本周AI集体搬到桌面:Qwen Book、助手o、DeepSeek Harness、Copilot超级应用——「常驻工作台」如何重定义人机交互
本周AI集体搬到桌面:Qwen Book、助手o、DeepSeek Harness、Copilot超级应用——「常驻工作台」如何重定义人机交互
一、引言:一周之内,四路大军同时冲向"桌面"
如果只用一个词概括过去这一周的 AI 前沿进展,那一定是 “桌面”。
几乎在同一时间窗口里,几件表面上互不相干的事发生了:
- 阿里在云栖大会上发布首款 AI 智能体电脑 Qwen Book,配 Skill 键盘阵列、全局 AI 按键、语音手写笔,喊出"自主理解意图、不断进化";
- 开发者从 ChatGPT 代码里挖出常驻助手 “o”(内部代号 Aeon),定位是长期在线、可持续运行数小时到数周的全天候 Agent,配云端托管沙盒;
- DeepSeek Harness 桌面版以 nightly 渠道流出,内置标准 / PTC / 极简 / 创造四种工作模式,走"一切皆插件(Everything is a Plugin)“的 Cordis 插件系统;
- 小米开源 MiMo-V2.6 系列的同时,上线 MiMo Desktop 桌面客户端正式版;
- 微软把新版 Copilot 升级成”超级应用",新增 Home、Code、Autopilot 三项核心能力,把 AI 从对话工具变成可持续工作的智能代理。
这些动作来自中美不同阵营、不同技术路线的巨头,却在几乎同一时刻指向同一个方向——AI 正在从"云端对话框里的聊天机器人"迁移到"常驻你桌面工作台上的操作系统级伙伴"。
这不是一次巧合,而是模型能力、工具生态与交互范式三股力量汇合后的必然结果。本文将从产品现象、技术架构、范式意义三个维度,深度拆解这场"AI 桌面化"浪潮。
二、现象盘点:四路大军的"桌面作业"
我们先看清每一路在做什么,再谈它们为什么殊途同归。
┌─────────────────────────────────────────────────────────────────┐
│ 2026 年 9 月最后一周:Agent 桌面化现象图谱 │
├─────────────────────────────────────────────────────────────────┤
│ │
│ 阿里 Qwen Book OpenAI 助手 "o"(代号 Aeon) │
│ · 首款 AI 智能体电脑 · 全天候个人智能体 │
│ · Skill 键盘阵列 · 云端托管沙盒(attach↑ 数小时~数周) │
│ · 全局 AI 按键 · Pro Lite $100 / Pro $200 / Pro Max │
│ · 语音手写笔 · 对标 Grok Bot 与 Meta Muse │
│ · 与 Omarchy 合作 · 预计 DevDay(9/29) 发布 │
│ │ │ │
│ └───────────┬──────────────┘ │
│ ▼ │
│ 「AI 常驻桌面工作台」 │
│ ▲ │
│ ┌───────────┴──────────────┐ │
│ │ │ │
│ DeepSeek Harness 桌面版 微软 Copilot 超级应用 │
│ · 标准/PTC/极简/创造 四模式 · Home 桌面入口 │
│ · 一切皆插件(Cordis) · Code 应用构建 │
│ · 模型/工具/会话/沙箱/存储 · Autopilot 自主执行 │
│ 全是插件 · 从对话→代理 │
│ (小米 MiMo Desktop 同期上线) │
└─────────────────────────────────────────────────────────────────┘
1. 阿里 Qwen Book:把"工作台"做进一台电脑
云栖大会上亮相的 Qwen Book,产品形态上是一台为 Agent 而生的电脑:Skill 键盘阵列给出了一整排可定义的 Agent 能力快捷键,全局 AI 按键让"呼出智能体"变成像按 Esc 一样顺手,语音手写笔则覆盖了语音、手写两类自然输入。它宣称能"自主理解用户意图并不断进化",并与开源项目 Omarchy 合作探索面向 Agent 的新一代桌面操作系统。
它释放的信号很直白:传统操作系统(Windows/macOS)是为"人类用鼠标键盘操作文件"设计的,而 Agent 需要的是为"智能体常驻、自主调度工具"设计的运行时。 当 AI 成为一等公民,桌面 OS 也该被重新设计。
2. OpenAI 助手 “o”(Aeon):把 Agent 做成"管家"
开发者从 ChatGPT 前端代码里挖出了小写字母 “o” 的布局——产品名定位为全天候个人智能体:内置 Fast Mode、多智能体共享留言板、以及 -o 邮箱后缀。据称内部代号 Aeon,挂载云端托管沙盒,可以连续跑数小时到数周。定价分层为 Pro Lite(100 美元)、Pro(200 美元)与尚未上线的 Pro Max(500 美元)。
“o” 的关键词是"长期在线、可持续运行"。它不再是你问一句答一句的聊天机器人,而是一个替你蹲守、替你干活、跑完再来汇报的常驻代理人——这正是 Agent 从"会话(Session)“走向"服务(Service)“的标志。
3. DeepSeek Harness 桌面版:把"一切皆插件"落到桌面
DeepSeek Harness 桌面版以 nightly 通道流出(安装包经 DeepSeek 的 Apple 开发者证书签名并公证),支持登录账号或填 API Key、选定本地工作区后直接布置 Agent 任务,不再需要 npx 启动 Web UI。
它定义了四种运行模式:
- 标准模式:处理代码、文件、资料等大多数任务,Agent 按需调用检索、编辑、终端等工具;
- PTC 模式:在标准模式基础上更侧重批量调用工具,并对结果筛选、整理、去重、统计或汇总;
- 极简模式:只用终端工具完成任务,用于测试和对比"裸 Agent"的基础表现;
- 创造模式:允许用户通过对话定制 DSH,Agent 可编写插件添加新功能/界面,也能组合工具与提示词创建自定义模式。
其核心设计理念”一切皆插件(Everything is a Plugin)“值得单独拎出来——模型、工具、技能、会话、沙箱、存储、智能体循环、调度乃至 UI,所有 Agent 能力都由底层插件系统 Cordis 提供。这是一种把"Agent 能力"本身标准化、可插拔化的架构哲学。
4. 微软 Copilot 超级应用:把"对话工具"升级成"代理”
微软新版 Copilot 新增 Home、Code、Autopilot 三大能力:
- Home:给 Copilot 一个常驻的桌面入口/工作空间,不再是悬浮对话框;
- Code:让 Copilot 具备构建应用的能力,直接产出可运行工程;
- Autopilot:让 Copilot 从"你要它做什么"变成"替你持续完成任务”。
微软自己也承认,目标是"把 AI 助手从对话工具扩展为可执行任务、构建应用和持续工作的智能代理"。
三、为什么是"桌面"?三股力量的合流
四路大军形态迥异,却殊途同归。这背后是三个底层变量同时成熟:
1. 模型能力到了"能持续干活"的临界点。 前面一篇文章里我们聊到 GPT-6 Astra 已经能通过脚本 API 接管软件、在 OSWorld 上操作真实电脑。当模型既能推理、又能写代码、还能调用工具并"运行—反馈—自纠"时,“让你一直开着它干活"才变得有意义。
2. 工具/沙箱生态成熟。 长期运行意味着模型需要一个隔离、可恢复、资源可控的执行环境——这正是云端托管沙箱(Aeon)、本地工作区(Harness)、Agent 运行时(Qwen Book 的 OS 化设计)共同解决的问题。
3. 交互范式迁移。 过去的人机交互是"请求—响应"的拉模式(Pull);Agent 常驻意味着推模式(Push):Agent 主动替你盯、替你跑,做完再来汇报。这要求产品从"对话框"升级为"工作台/工作空间”。
┌─────────────────────────────────────────────────────────────────┐
│ 为什么 AI 要"搬到桌面":交互范式迁移 │
├─────────────────────────────────────────────────────────────────┤
│ │
│ 旧范式:拉模式(Pull / 会话式) │
│ ┌─────┐ 提问 ┌───────┐ 回答 ┌─────┐ │
│ │ 用户 │ ────► │ 对话框 │ ◄──── │ 用户 │ 问一句、答一句 │
│ └─────┘ └───────┘ └─────┘ │
│ │
│ 新范式:推模式(Push / 常驻式) │
│ ┌─────────┐ 订阅/委托 ┌───────────────┐ │
│ │ 用户 │ ──────────►│ 常驻 Agent │ │
│ │ (设目标)│ ◄──────────│ (工作台运行) │ │
│ └─────────┘ 完成汇报 │ · 自动盯守 │ │
│ ▲ │ · 自调度工具│ │
│ │ │ · 云端沙箱 │ │
│ │ └───────┬───────┘ │
│ │ │ 调用 │
│ │ ▼ │
│ │ ┌────────────┐ │
│ └──────│ 文件/API/终端│ │
│ └────────────┘ │
└─────────────────────────────────────────────────────────────────┘
四、技术拆解:一台"Agent 桌面",底层长什么样
无论产品外壳是"电脑"“客户端"还是"超级应用”,几乎所有 Agent 桌面产品背后都共享一套运行时架构。理解了它,就理解了这场浪潮的全部玄机。
我来给出一套通用化(聚合各家做法)的 Agent 桌面运行时分层:
┌─────────────────────────────────────────────────────────────────┐
│ Agent Desktop Runtime(分层架构) │
├─────────────────────────────────────────────────────────────────┤
│ ┌────────────────────────────────────────────────────────────┐│
│ │ ① 交互界面层(UI / Human-in-the-loop) ││
│ │ 常驻面板 · 全局快捷键 · 语音/手写 · 审批卡片 ││
│ └───────────────────────────┬────────────────────────────────┘│
│ ▼ │
│ ┌────────────────────────────────────────────────────────────┐│
│ │ ② Agent 循环层(Loop / 意图·规划·执行·反思) ││
│ │ 状态记忆 · 任务队列 · 多智能体协作 · 自纠反馈 ││
│ └───────────────────────────┬────────────────────────────────┘│
│ ▼ │
│ ┌────────────────────────────────────────────────────────────┐│
│ │ ③ 能力编排层(Skill / 插件系统)★核心 ││
│ │ 模型·工具·技能·调度·存储·会话·UI 全部可插拔 ││
│ │ (DeepSeek Harness = 一切皆插件 / Cordis) ││
│ └───────────────────────────┬────────────────────────────────┘│
│ ▼ │
│ ┌────────────────────────────────────────────────────────────┐│
│ │ ④ 执行沙箱层(Sandbox / Ephemeral Workspace) ││
│ │ 文件系统 · 终端 · 进程 · 网络出口(受限) · 凭证隔离 ││
│ └───────────────────────────┬────────────────────────────────┘│
│ ▼ │
│ ┌────────────────────────────────────────────────────────────┐│
│ │ ⑤ 宿主/基础设施层(Host) ││
│ │ 云端托管(AgenticCloud/沙箱) 或 本地桌面(工作区) ││
│ └────────────────────────────────────────────────────────────┘│
└─────────────────────────────────────────────────────────────────┘
层级①:交互界面层——从"对话框"到"工作台"
字段级差异这里不展开,重点在于界面形态决定心智模型:对话框暗示"一次一问",工作台暗示"长期共事"。全局 AI 按键、Skill 键盘阵列都是把"呼出智能体"从"打开一个网页"变成"系统级操作"。
层级②:Agent 循环层——常驻的核心引擎
Agent 之所以能"跑数小时到数周",是因为它不是一个函数,而是一个持续运行的循环:维护状态 → 拆解意图 → 规划 → 执行工具调用 → 观察结果 → 反思修正 → 进入下一轮。我们看一个高度简化的 Agent 循环骨架:
# ============================================================
# 概念:Agent Desktop 的核心"常驻循环"(简化骨架)
# ============================================================
class ResidentAgentLoop:
def __init__(self, brain, skill_registry, sandbox):
self.brain = brain # 推理/决策模型
self.skills = skill_registry # 能力编排层(可插拔插件)
self.sandbox = sandbox # 执行环境
self.memory = [] # 会话级状态
self.todo = run() # 运行方式
def step(self, observation) -> str:
# 1. 把当前状态喂给大脑
decision = self.brain.plan(
memory=self.memory,
new_obs=observation
)
# 2. 如果是工具调用,通过技能注册表调度
if decision.kind == "tool":
result = self.skills.invoke(
decision.tool, decision.args, in_sandbox=self.sandbox)
self.memory.append(("tool_result", result))
return "keep_running" # 循环继续
# 3. 如果判定任务完成,结束回合并汇报
if decision.kind == "final":
return decision.answer
# 4. 其它情况(思考/等待)继续留在循环
return "polling"
# 常驻:Agent 不退出,用户随时可派新任务
agent = ResidentAgentLoop(brain=model, skill_registry=plugins,
sandbox=ephemeral_ws)
while not agent.should_exit():
agent.step(await_next_signal_or_schedule())
这段骨架的要点是 keep_running:Agent 完成任务后并不退出,而是回到"等待新目标/被调度"的状态——这正是"常驻工作台"和"聊天机器人"的本质差异。
层级③:能力编排层——“一切皆插件"为什么是架构分水岭
传统 Agent 的能力是"写死的”:加一个能力就要重新训练或硬编码。而"一切皆插件"把模型、工具、技能、会话、沙箱、存储、智能体循环、调度、UI 全部抽象成可插拔单元。这样做的好处极其明显:
- 能力即插即用:不用改核心,就能给 Agent 接上新的工具、数据源甚至新的思考模式;
- 用户可定制:通过对话让 Agent 自己"写插件"增加新功能(Harness 的创造模式);
- 可组合:工具、提示词可以组合成"自定义模式",像搭积木一样组装 Agent 能力。
下面是一个"Skill 插件"的接口示意,强调统一契约带来的扩展性:
# ============================================================
# 概念:可插拔 Skill 插件的统一接口契约
# 让"能力"能被动态装载进 Agent 运行时
# ============================================================
from abc import ABC, abstractmethod
from dataclasses import dataclass, field
from typing import Any
@dataclass
class SkillManifest:
name: str
version: str
tools: list[str] = field(default_factory=list) # 暴露的工具
modes: list[str] = field(default_factory=list) # 自定义工作模式
class SkillPlugin(ABC):
"""所有插件都必须实现的统一生命周期接口"""
@abstractmethod
def on_load(self, runtime) -> None:
"""装载:注册工具、初始化资源、声明能力"""
...
@abstractmethod
def on_unload(self) -> None:
"""卸载:释放资源,安全退出"""
...
@abstractmethod
async def handle(self, ctx, action: str, args: dict) -> Any:
"""执行一次工具调用,返回结构化结果给 Agent 循环"""
...
# 以"终端工具"插件为例
class TerminalFeature(SkillPlugin):
def __init__(self):
self.manifest = SkillManifest(name="terminal", version="1.0",
tools=["exec_shell", "read_file"])
def on_load(self, runtime):
runtime.register_tool("exec_shell", self.handle, sandboxed=True)
async def handle(self, ctx, action, args):
if action == "exec_shell":
return await ctx.sandbox.exec(cmd=args["cmd"], timeout=args.get("t"))
...
# 运行时按 manifest 动态发现与装载,无需改核心循环
runtime.load(SkillPlugin() for SkillPlugin in discover_plugins())
这段代码的价值在于:核心循环不关心"某个插件具体做了什么",它只认 on_load / handle / on_unload 的契约。这既提升了扩展效率,也让第三方生态(用户自定义插件、团队共享技能)成为可能。
层级④:执行沙箱层——常驻时代的"安全底座"
Agent 一旦长期运行、能调终端和文件,安全问题就急剧放大(这正是上一篇文章讨论的"能力越强、权限越要收缩")。因此 Agent 桌面普遍把执行隔离在沙箱里:
- 文件系统隔离:Agent 只能读写分配给它的工作区;
- 网络出口受限:默认禁止外联或走白名单代理;
- 凭证剥离:Agent 拿到的只是临时/最小凭据;
- 资源配额:限 CPU/内存/时长,防止失控空转或资源耗尽。
云端托管(如 AgenticCloud、Aeon 的沙箱)和本地桌面(Harness 的本地工作区)只是"宿主机"两种形态,安全分层逻辑完全一致。
五、几家对比:殊途同归的"工作台"
| 产品 | 形态 | 核心卖点 | 执行环境 | 能力可插拔 | 现状 |
|---|---|---|---|---|---|
| 阿里 Qwen Book | 智能体电脑 | OS 级 Agent 原生 | 本地+云 | Skill 键盘/插件 | 云栖亮相 |
| OpenAI 助手 “o” | 常驻助手 | 全天候、共享留言板 | 云端托管沙盒 | 计划插件 | 挖出/待发布 |
| DeepSeek Harness | 桌面客户端 | 一切皆插件(Cordis) | 本地工作区 | 强(模型/工具/UI均可) | nightly |
| 小米 MiMo Desktop | 桌面客户端 | 本地运行+RSI | 本地 | 中 | 正式版 |
| 微软 Copilot | 超级应用 | Home/Code/Autopilot | 云端 | 插件体系 | 已发布 |
尽管形态不同,但它们对"AI 的未来在哪里运行"给出了一致的回答:在用户身边、常驻地运行,能自主调度工具,能让能力像插件一样生长。 Qwen Book 想重定义 OS,Aeon 想重定义"管家",Harness 想重定义"Agent 开发者工具",Copilot 想重定义"日常超级应用"。它们从四个入口同时冲进了同一个房间。
六、挑战与隐忧
必须冷静看待,这场浪潮也有三块硬骨头:
1. 同质化风险。 “桌面 Agent"若是只做"一个常驻对话框 + 一排功能按钮”,那和原来的聊天机器人差别有限。真正的价值在深度工具编排和稳定自主执行,而这需要长期打磨,不是发个客户端就能兑现。
2. 安全与信任。 让 Agent"长期在线、能碰文件、能调终端",本质是把越来越大的权限交出去。“跑数小时到数周"意味着有足够的窗口去出错、越界甚至被攻击面袭击。权限最小化、人类确认(human-in-the-loop)、沙箱隔离不是可选项,而是能否产品化的生死线(详见上一篇关于 Astra 关键级网络能力的讨论)。
3. 生态与标准。 Skill/插件系统各家各做一套,尚未形成统一契约。Agent 桌面的价值高度依赖"有多少第三方能力可以即插即用”,这需要生态与标准层面的博弈。谁能定义插件的"通用语言",谁就掌握了 Agent 时代的平台入口。
七、总结
过去这周,阿里、OpenAI、DeepSeek、小米、微软几乎同时做出了同一种判断:AI 的下一个主场,是常驻的桌面工作台。这不是发布会上的巧合,而是三个底层变量(模型能干、沙箱可用、范式该变)同时成熟的注脚。
我们观察到的核心结论:
- 范式在迁移:人机交互从"拉模式——问一句答一句"到"推模式——设定目标、Agent 持续替你跑";
- 架构有共识:Agent 桌面普遍由交互层、Agent 循环层、能力编排层(插件系统)、执行沙箱层、宿主层五层构成,“一切皆插件"是最有想象力的编排哲学;
- 差异在入口:重定义 OS(Qwen Book)、重定义管家(Aeon)、重定义开发者工具(Harness)、重定义超级应用(Copilot)——四条路殊途同归;
- 安全是生死线:长期在线 + 可操作文件/终端的 Agent,其安全设计决定了它能不能被真正信任和使用。
如果说上一篇文章里的 Astra 解决了"AI 能不能厉害地干活”,那么这一周的桌面化浪潮回答的是"AI 该在哪里、以什么形态长期地干"。当 Agent 从云端对话框搬进你的桌面、常驻并自主运转,我们与机器的关系,正在从"使用工具"悄悄变成"与同事共事"。
那将不只是产品的更迭,而是一种新的数字生活方式的开端。