本周AI集体搬到桌面:Qwen Book、助手o、DeepSeek Harness、Copilot超级应用——「常驻工作台」如何重定义人机交互

本周AI集体搬到桌面:Qwen Book、助手o、DeepSeek Harness、Copilot超级应用——「常驻工作台」如何重定义人机交互

一、引言:一周之内,四路大军同时冲向"桌面"

如果只用一个词概括过去这一周的 AI 前沿进展,那一定是 “桌面”。

几乎在同一时间窗口里,几件表面上互不相干的事发生了:

  • 阿里在云栖大会上发布首款 AI 智能体电脑 Qwen Book,配 Skill 键盘阵列、全局 AI 按键、语音手写笔,喊出"自主理解意图、不断进化";
  • 开发者从 ChatGPT 代码里挖出常驻助手 “o”(内部代号 Aeon),定位是长期在线、可持续运行数小时到数周的全天候 Agent,配云端托管沙盒;
  • DeepSeek Harness 桌面版以 nightly 渠道流出,内置标准 / PTC / 极简 / 创造四种工作模式,走"一切皆插件(Everything is a Plugin)“的 Cordis 插件系统;
  • 小米开源 MiMo-V2.6 系列的同时,上线 MiMo Desktop 桌面客户端正式版;
  • 微软把新版 Copilot 升级成”超级应用",新增 Home、Code、Autopilot 三项核心能力,把 AI 从对话工具变成可持续工作的智能代理。

这些动作来自中美不同阵营、不同技术路线的巨头,却在几乎同一时刻指向同一个方向——AI 正在从"云端对话框里的聊天机器人"迁移到"常驻你桌面工作台上的操作系统级伙伴"。

这不是一次巧合,而是模型能力、工具生态与交互范式三股力量汇合后的必然结果。本文将从产品现象、技术架构、范式意义三个维度,深度拆解这场"AI 桌面化"浪潮。

二、现象盘点:四路大军的"桌面作业"

我们先看清每一路在做什么,再谈它们为什么殊途同归。

┌─────────────────────────────────────────────────────────────────┐
│              2026 年 9 月最后一周:Agent 桌面化现象图谱            │
├─────────────────────────────────────────────────────────────────┤
│                                                                 │
│  阿里 Qwen Book           OpenAI 助手 "o"(代号 Aeon)            │
│  · 首款 AI 智能体电脑     · 全天候个人智能体                     │
│  · Skill 键盘阵列         · 云端托管沙盒(attach↑ 数小时~数周)    │
│  · 全局 AI 按键           · Pro Lite $100 / Pro $200 / Pro Max   │
│  · 语音手写笔             · 对标 Grok Bot 与 Meta Muse           │
│  · 与 Omarchy 合作        · 预计 DevDay(9/29) 发布               │
│        │                          │                             │
│        └───────────┬──────────────┘                             │
│                    ▼                                            │
│            「AI 常驻桌面工作台」                                   │
│                    ▲                                            │
│        ┌───────────┴──────────────┐                             │
│        │                          │                             │
│  DeepSeek Harness 桌面版        微软 Copilot 超级应用            │
│  · 标准/PTC/极简/创造 四模式      · Home 桌面入口                │
│  · 一切皆插件(Cordis)             · Code 应用构建                │
│  · 模型/工具/会话/沙箱/存储        · Autopilot 自主执行           │
│    全是插件                       · 从对话→代理                 │
│  (小米 MiMo Desktop 同期上线)                                   │
└─────────────────────────────────────────────────────────────────┘

1. 阿里 Qwen Book:把"工作台"做进一台电脑

云栖大会上亮相的 Qwen Book,产品形态上是一台为 Agent 而生的电脑:Skill 键盘阵列给出了一整排可定义的 Agent 能力快捷键,全局 AI 按键让"呼出智能体"变成像按 Esc 一样顺手,语音手写笔则覆盖了语音、手写两类自然输入。它宣称能"自主理解用户意图并不断进化",并与开源项目 Omarchy 合作探索面向 Agent 的新一代桌面操作系统。

它释放的信号很直白:传统操作系统(Windows/macOS)是为"人类用鼠标键盘操作文件"设计的,而 Agent 需要的是为"智能体常驻、自主调度工具"设计的运行时。 当 AI 成为一等公民,桌面 OS 也该被重新设计。

2. OpenAI 助手 “o”(Aeon):把 Agent 做成"管家"

开发者从 ChatGPT 前端代码里挖出了小写字母 “o” 的布局——产品名定位为全天候个人智能体:内置 Fast Mode、多智能体共享留言板、以及 -o 邮箱后缀。据称内部代号 Aeon,挂载云端托管沙盒,可以连续跑数小时到数周。定价分层为 Pro Lite(100 美元)、Pro(200 美元)与尚未上线的 Pro Max(500 美元)。

“o” 的关键词是"长期在线、可持续运行"。它不再是你问一句答一句的聊天机器人,而是一个替你蹲守、替你干活、跑完再来汇报的常驻代理人——这正是 Agent 从"会话(Session)“走向"服务(Service)“的标志。

3. DeepSeek Harness 桌面版:把"一切皆插件"落到桌面

DeepSeek Harness 桌面版以 nightly 通道流出(安装包经 DeepSeek 的 Apple 开发者证书签名并公证),支持登录账号或填 API Key、选定本地工作区后直接布置 Agent 任务,不再需要 npx 启动 Web UI。

它定义了四种运行模式:

  • 标准模式:处理代码、文件、资料等大多数任务,Agent 按需调用检索、编辑、终端等工具;
  • PTC 模式:在标准模式基础上更侧重批量调用工具,并对结果筛选、整理、去重、统计或汇总;
  • 极简模式:只用终端工具完成任务,用于测试和对比"裸 Agent"的基础表现;
  • 创造模式:允许用户通过对话定制 DSH,Agent 可编写插件添加新功能/界面,也能组合工具与提示词创建自定义模式。

其核心设计理念”一切皆插件(Everything is a Plugin)“值得单独拎出来——模型、工具、技能、会话、沙箱、存储、智能体循环、调度乃至 UI,所有 Agent 能力都由底层插件系统 Cordis 提供。这是一种把"Agent 能力"本身标准化、可插拔化的架构哲学。

4. 微软 Copilot 超级应用:把"对话工具"升级成"代理”

微软新版 Copilot 新增 Home、Code、Autopilot 三大能力:

  • Home:给 Copilot 一个常驻的桌面入口/工作空间,不再是悬浮对话框;
  • Code:让 Copilot 具备构建应用的能力,直接产出可运行工程;
  • Autopilot:让 Copilot 从"你要它做什么"变成"替你持续完成任务”。

微软自己也承认,目标是"把 AI 助手从对话工具扩展为可执行任务、构建应用和持续工作的智能代理"。

三、为什么是"桌面"?三股力量的合流

四路大军形态迥异,却殊途同归。这背后是三个底层变量同时成熟:

1. 模型能力到了"能持续干活"的临界点。 前面一篇文章里我们聊到 GPT-6 Astra 已经能通过脚本 API 接管软件、在 OSWorld 上操作真实电脑。当模型既能推理、又能写代码、还能调用工具并"运行—反馈—自纠"时,“让你一直开着它干活"才变得有意义。

2. 工具/沙箱生态成熟。 长期运行意味着模型需要一个隔离、可恢复、资源可控的执行环境——这正是云端托管沙箱(Aeon)、本地工作区(Harness)、Agent 运行时(Qwen Book 的 OS 化设计)共同解决的问题。

3. 交互范式迁移。 过去的人机交互是"请求—响应"的拉模式(Pull);Agent 常驻意味着推模式(Push):Agent 主动替你盯、替你跑,做完再来汇报。这要求产品从"对话框"升级为"工作台/工作空间”。

┌─────────────────────────────────────────────────────────────────┐
│  为什么 AI 要"搬到桌面":交互范式迁移                              │
├─────────────────────────────────────────────────────────────────┤
│                                                                 │
│  旧范式:拉模式(Pull / 会话式)                                  │
│  ┌─────┐ 提问  ┌───────┐  回答   ┌─────┐                        │
│  │ 用户 │ ────► │ 对话框 │ ◄────  │ 用户 │  问一句、答一句          │
│  └─────┘       └───────┘        └─────┘                        │
│                                                                 │
│  新范式:推模式(Push / 常驻式)                                  │
│  ┌─────────┐  订阅/委托  ┌───────────────┐                      │
│  │  用户    │ ──────────►│  常驻 Agent   │                      │
│  │  (设目标)│ ◄──────────│  (工作台运行)  │                      │
│  └─────────┘   完成汇报  │   · 自动盯守   │                      │
│                     ▲    │   · 自调度工具│                      │
│                     │    │   · 云端沙箱  │                      │
│                     │    └───────┬───────┘                      │
│                     │            │   调用                       │
│                     │            ▼                              │
│                     │      ┌────────────┐                       │
│                     └──────│ 文件/API/终端│                      │
│                            └────────────┘                       │
└─────────────────────────────────────────────────────────────────┘

四、技术拆解:一台"Agent 桌面",底层长什么样

无论产品外壳是"电脑"“客户端"还是"超级应用”,几乎所有 Agent 桌面产品背后都共享一套运行时架构。理解了它,就理解了这场浪潮的全部玄机。

我来给出一套通用化(聚合各家做法)的 Agent 桌面运行时分层:

┌─────────────────────────────────────────────────────────────────┐
│                  Agent Desktop Runtime(分层架构)                │
├─────────────────────────────────────────────────────────────────┤
│  ┌────────────────────────────────────────────────────────────┐│
│  │  ① 交互界面层(UI / Human-in-the-loop)                     ││
│  │   常驻面板 · 全局快捷键 · 语音/手写 · 审批卡片               ││
│  └───────────────────────────┬────────────────────────────────┘│
│                              ▼                                 │
│  ┌────────────────────────────────────────────────────────────┐│
│  │  ② Agent 循环层(Loop / 意图·规划·执行·反思)                ││
│  │   状态记忆 · 任务队列 · 多智能体协作 · 自纠反馈               ││
│  └───────────────────────────┬────────────────────────────────┘│
│                              ▼                                 │
│  ┌────────────────────────────────────────────────────────────┐│
│  │  ③ 能力编排层(Skill / 插件系统)★核心                        ││
│  │  模型·工具·技能·调度·存储·会话·UI 全部可插拔                  ││
│  │  (DeepSeek Harness = 一切皆插件 / Cordis)                    ││
│  └───────────────────────────┬────────────────────────────────┘│
│                              ▼                                 │
│  ┌────────────────────────────────────────────────────────────┐│
│  │  ④ 执行沙箱层(Sandbox / Ephemeral Workspace)              ││
│  │   文件系统 · 终端 · 进程 · 网络出口(受限) · 凭证隔离        ││
│  └───────────────────────────┬────────────────────────────────┘│
│                              ▼                                 │
│  ┌────────────────────────────────────────────────────────────┐│
│  │  ⑤ 宿主/基础设施层(Host)                                  ││
│  │   云端托管(AgenticCloud/沙箱) 或 本地桌面(工作区)            ││
│  └────────────────────────────────────────────────────────────┘│
└─────────────────────────────────────────────────────────────────┘

层级①:交互界面层——从"对话框"到"工作台"

字段级差异这里不展开,重点在于界面形态决定心智模型:对话框暗示"一次一问",工作台暗示"长期共事"。全局 AI 按键、Skill 键盘阵列都是把"呼出智能体"从"打开一个网页"变成"系统级操作"。

层级②:Agent 循环层——常驻的核心引擎

Agent 之所以能"跑数小时到数周",是因为它不是一个函数,而是一个持续运行的循环:维护状态 → 拆解意图 → 规划 → 执行工具调用 → 观察结果 → 反思修正 → 进入下一轮。我们看一个高度简化的 Agent 循环骨架:

# ============================================================
# 概念:Agent Desktop 的核心"常驻循环"(简化骨架)
# ============================================================
class ResidentAgentLoop:
    def __init__(self, brain, skill_registry, sandbox):
        self.brain = brain            # 推理/决策模型
        self.skills = skill_registry  # 能力编排层(可插拔插件)
        self.sandbox = sandbox        # 执行环境
        self.memory = []              # 会话级状态
        self.todo = run()             # 运行方式

    def step(self, observation) -> str:
        # 1. 把当前状态喂给大脑
        decision = self.brain.plan(
            memory=self.memory,
            new_obs=observation
        )
        # 2. 如果是工具调用,通过技能注册表调度
        if decision.kind == "tool":
            result = self.skills.invoke(
                decision.tool, decision.args, in_sandbox=self.sandbox)
            self.memory.append(("tool_result", result))
            return "keep_running"     # 循环继续
        # 3. 如果判定任务完成,结束回合并汇报
        if decision.kind == "final":
            return decision.answer
        # 4. 其它情况(思考/等待)继续留在循环
        return "polling"

# 常驻:Agent 不退出,用户随时可派新任务
agent = ResidentAgentLoop(brain=model, skill_registry=plugins,
                          sandbox=ephemeral_ws)
while not agent.should_exit():
    agent.step(await_next_signal_or_schedule())

这段骨架的要点是 keep_running:Agent 完成任务后并不退出,而是回到"等待新目标/被调度"的状态——这正是"常驻工作台"和"聊天机器人"的本质差异。

层级③:能力编排层——“一切皆插件"为什么是架构分水岭

传统 Agent 的能力是"写死的”:加一个能力就要重新训练或硬编码。而"一切皆插件"把模型、工具、技能、会话、沙箱、存储、智能体循环、调度、UI 全部抽象成可插拔单元。这样做的好处极其明显:

  • 能力即插即用:不用改核心,就能给 Agent 接上新的工具、数据源甚至新的思考模式;
  • 用户可定制:通过对话让 Agent 自己"写插件"增加新功能(Harness 的创造模式);
  • 可组合:工具、提示词可以组合成"自定义模式",像搭积木一样组装 Agent 能力。

下面是一个"Skill 插件"的接口示意,强调统一契约带来的扩展性:

# ============================================================
# 概念:可插拔 Skill 插件的统一接口契约
# 让"能力"能被动态装载进 Agent 运行时
# ============================================================
from abc import ABC, abstractmethod
from dataclasses import dataclass, field
from typing import Any

@dataclass
class SkillManifest:
    name: str
    version: str
    tools: list[str] = field(default_factory=list)   # 暴露的工具
    modes:  list[str] = field(default_factory=list)  # 自定义工作模式

class SkillPlugin(ABC):
    """所有插件都必须实现的统一生命周期接口"""

    @abstractmethod
    def on_load(self, runtime) -> None:
        """装载:注册工具、初始化资源、声明能力"""
        ...

    @abstractmethod
    def on_unload(self) -> None:
        """卸载:释放资源,安全退出"""
        ...

    @abstractmethod
    async def handle(self, ctx, action: str, args: dict) -> Any:
        """执行一次工具调用,返回结构化结果给 Agent 循环"""
        ...

# 以"终端工具"插件为例
class TerminalFeature(SkillPlugin):
    def __init__(self):
        self.manifest = SkillManifest(name="terminal", version="1.0",
                                      tools=["exec_shell", "read_file"])
    def on_load(self, runtime):
        runtime.register_tool("exec_shell", self.handle, sandboxed=True)
    async def handle(self, ctx, action, args):
        if action == "exec_shell":
            return await ctx.sandbox.exec(cmd=args["cmd"], timeout=args.get("t"))
        ...

# 运行时按 manifest 动态发现与装载,无需改核心循环
runtime.load(SkillPlugin() for SkillPlugin in discover_plugins())

这段代码的价值在于:核心循环不关心"某个插件具体做了什么",它只认 on_load / handle / on_unload 的契约。这既提升了扩展效率,也让第三方生态(用户自定义插件、团队共享技能)成为可能。

层级④:执行沙箱层——常驻时代的"安全底座"

Agent 一旦长期运行、能调终端和文件,安全问题就急剧放大(这正是上一篇文章讨论的"能力越强、权限越要收缩")。因此 Agent 桌面普遍把执行隔离在沙箱里:

  • 文件系统隔离:Agent 只能读写分配给它的工作区;
  • 网络出口受限:默认禁止外联或走白名单代理;
  • 凭证剥离:Agent 拿到的只是临时/最小凭据;
  • 资源配额:限 CPU/内存/时长,防止失控空转或资源耗尽。

云端托管(如 AgenticCloud、Aeon 的沙箱)和本地桌面(Harness 的本地工作区)只是"宿主机"两种形态,安全分层逻辑完全一致。

五、几家对比:殊途同归的"工作台"

产品形态核心卖点执行环境能力可插拔现状
阿里 Qwen Book智能体电脑OS 级 Agent 原生本地+云Skill 键盘/插件云栖亮相
OpenAI 助手 “o”常驻助手全天候、共享留言板云端托管沙盒计划插件挖出/待发布
DeepSeek Harness桌面客户端一切皆插件(Cordis)本地工作区强(模型/工具/UI均可)nightly
小米 MiMo Desktop桌面客户端本地运行+RSI本地中正式版
微软 Copilot超级应用Home/Code/Autopilot云端插件体系已发布

尽管形态不同,但它们对"AI 的未来在哪里运行"给出了一致的回答:在用户身边、常驻地运行,能自主调度工具,能让能力像插件一样生长。 Qwen Book 想重定义 OS,Aeon 想重定义"管家",Harness 想重定义"Agent 开发者工具",Copilot 想重定义"日常超级应用"。它们从四个入口同时冲进了同一个房间。

六、挑战与隐忧

必须冷静看待,这场浪潮也有三块硬骨头:

1. 同质化风险。 “桌面 Agent"若是只做"一个常驻对话框 + 一排功能按钮”,那和原来的聊天机器人差别有限。真正的价值在深度工具编排和稳定自主执行,而这需要长期打磨,不是发个客户端就能兑现。

2. 安全与信任。 让 Agent"长期在线、能碰文件、能调终端",本质是把越来越大的权限交出去。“跑数小时到数周"意味着有足够的窗口去出错、越界甚至被攻击面袭击。权限最小化、人类确认(human-in-the-loop)、沙箱隔离不是可选项,而是能否产品化的生死线(详见上一篇关于 Astra 关键级网络能力的讨论)。

3. 生态与标准。 Skill/插件系统各家各做一套,尚未形成统一契约。Agent 桌面的价值高度依赖"有多少第三方能力可以即插即用”,这需要生态与标准层面的博弈。谁能定义插件的"通用语言",谁就掌握了 Agent 时代的平台入口。

七、总结

过去这周,阿里、OpenAI、DeepSeek、小米、微软几乎同时做出了同一种判断:AI 的下一个主场,是常驻的桌面工作台。这不是发布会上的巧合,而是三个底层变量(模型能干、沙箱可用、范式该变)同时成熟的注脚。

我们观察到的核心结论:

  1. 范式在迁移:人机交互从"拉模式——问一句答一句"到"推模式——设定目标、Agent 持续替你跑";
  2. 架构有共识:Agent 桌面普遍由交互层、Agent 循环层、能力编排层(插件系统)、执行沙箱层、宿主层五层构成,“一切皆插件"是最有想象力的编排哲学;
  3. 差异在入口:重定义 OS(Qwen Book)、重定义管家(Aeon)、重定义开发者工具(Harness)、重定义超级应用(Copilot)——四条路殊途同归;
  4. 安全是生死线:长期在线 + 可操作文件/终端的 Agent,其安全设计决定了它能不能被真正信任和使用。

如果说上一篇文章里的 Astra 解决了"AI 能不能厉害地干活”,那么这一周的桌面化浪潮回答的是"AI 该在哪里、以什么形态长期地干"。当 Agent 从云端对话框搬进你的桌面、常驻并自主运转,我们与机器的关系,正在从"使用工具"悄悄变成"与同事共事"。

那将不只是产品的更迭,而是一种新的数字生活方式的开端。