AI自己造更强的AI——递归自我改进RSI进入生产的里程碑深度解析

AI自己造更强的AI——递归自我改进RSI进入生产的里程碑深度解析

引言:机器不只是工具,开始成为思考的主力

2026年9月22日,杭州云栖大会主论坛。阿里巴巴集团CEO吴泳铭给出一组令整个行业屏息的判断:机器正在成为思考的主力,智能正在成为一种规模化的商品。他直言,未来机器思考的总量将至少达到人类思考总量的1000倍以上,而今天这一比例还不到人类的3%——这意味着至少还有几万倍的增长空间界面新闻;时代周报。

这不是一句空洞的口号。吴泳铭把"思考"与工业革命早期的"动力"做了类比:1882年爱迪生建成珍珠街电站时,最初只点亮约400盏电灯,当时电力最大的用途只是替代煤油灯与蜡烛;而空调、冰箱、洗衣机乃至1946年的第一台通用计算机,都是后来才陆续诞生的。在他看来,今天的AI Coding就像当年的"电灯"——只能替代现有工作,却不足以创造一个新时代界面新闻。要催生新时代,前提是先把"电站"建起来。

于是,阿里把AI模型、AI芯片和AI云定义为"机器智能时代的三大基石",并全栈押注。而在模型端,一个更底层的变量浮出水面:递归式自我改进(Recursive Self-Improvement,RSI)正从实验室概念走向真实生产环境。本文就围绕"RSI工程化落地"与"AI Agent进入生产"这两条主线,剖析2026年9月云栖大会暴露出的行业拐点。


上篇:RSI——让AI自己参与造出更强的AI

1. 什么是递归自我改进(RSI)

递归自我改进是通往强人工智能的关键一跃。它的逻辑朴素而激进:人类研究人员的扩张是线性的——每个实验室能雇到的一流人才数量有限;但一旦AI系统能够参与改进自身,甚至自主设计并训练出"自己的继任者",那么迭代速度就具备复利式加速的可能。

一个能持续自我改进的系统,至少要具备三个要素(这也是智谱唐杰反复强调的"闭环三拼图"):可被改进的对象、可验证的裁判、能自我供给的回路。唐杰特别指出,驱动循环运转的不是"智能",而是"闭环"——一个系统哪怕不够聪明,只要它持续改一个东西、又有人能持续判断它改得对不对,循环就能成立;反过来,一个再聪明的模型如果没有反馈信号告诉它"这一步对不对",跑再久也只能原地打转36氪。

RSI的进化路径通常划分为多个台阶:从模型的代码生成、到优化承载自身运行的推理系统、再到完全自主设计并训练下一代模型。目前,全球头部实验室大多停留在第二级台阶附近。

图1:RSI自进化闭环最小结构
+---------------------------------------------------------------------+
|                                                                     |
|   [可被改进的对象] <--------反馈--------+  (推理系统/代码/kernel)    |
|        ^                                |                            |
|        | 执行修改                        |                            |
|        |                                v                            |
|   [AI Agent] ---提出假设---> [实验/构建] ---> [运行结果/度量]          |
|        ^                                   |                         |
|        |                                   | (参考实现/吞吐/时延)     |
|        +----------------------------------- | --可验证的裁判-----+     |
|                                             v                     |
|            [成功经验回流成库,成为下一轮训练场]  <-自我供给回路-+      |
+---------------------------------------------------------------------+

2. 阿里Qwen:人类"零参与"下的33轮自进化

在主论坛上,阿里Qwen团队公布了递归式自我改进的阶段性进展。据中国证券报云栖现场报道,Qwen3.8-Max在人类完全"零参与"的情况下持续迭代超1个月,自动完成33轮有效迭代,其在Artificial Analysis评测上的得分从40分提升至45分中国证券报。

这组数字的颠覆性在于"零参与"三个字。过去业界主流做法是"RLHF(人类反馈强化学习)"——由人类标注员一步一步"教"模型什么是对的;而Qwen3.8-Max的这33轮迭代全程没有人类介入,改由"自动标注+自动评测+自动验证"构成的自进化回路来驱动。每一轮,模型基于上一轮的评测缺口生成改进样本,自动执行验证并通过门槛后再进入下一轮——人的角色从"教练"退居为"制定规则与设定边界"。那么,这条"零参与"的闭环在工程上究竟是如何被固化成一段可复现、可审计的代码逻辑的?下面用Python给出单轮自进化的核心骨架:

import random
from dataclasses import dataclass

@dataclass
class Round:
    idx: int
    samples: list
    score: float

class AutoReferee:
    def verify(self, rewards):
        return sum(rewards) / len(rewards)

def zero_participation_loop(model, referee, rounds=33):
    pool = load_seed_pool()
    log = []
    for i in range(rounds):
        batch = model.sample(pool, k=256)
        rewards = [model.verify(x) for x in batch]
        sc = referee.verify(rewards)
        log.append(Round(i, batch, sc))
        if sc > 44.5:
            pool.extend(batch)
    return log, pool

这段代码的精髓,在于用 referee 这个"自动评测器"代替了人类标注员:每一轮 model.verify 都是模型对自身产出的自动打分,pool.extend 则是把高分样本回流进训练池——于是"改进对象、可验证裁判、自我供给回路"三者被一次循环显式锁定,整个迭代过程不再需要任何一行人为逐条标注的反馈。

图2:Qwen零参与自进化迭代管线
+---------------------------------------------------------------------------+
|  Human(仅设定目标与安全边界,全程零参与到具体迭代)                        |
|     |                                                                      |
|     v                                                                      |
|  [Seed Dataset] --> [Qwen3.8-Max 生成改进候选] --> [自动标注器]             |
|                                                       |                    |
|                                                       v                    |
|  Round N +1 <--[门槛通过]-- [自动验证器] <--[自动评测器(Artificial         |
|                                                       Analysis基准)]        |
|     |                                                    |                 |
|     +---------------- Run 33 rounds ----------------------+                 |
|                                                                             |
|  Result:Artificial Analysis 得分 40 --> 45(全程零人工参与)                |
+---------------------------------------------------------------------------+

更值得注意的是阿里的野心:未来Qwen4.5、Qwen5将扩展至5万亿至10万亿参数规模,支持更复杂、更长程的任务,并迈向超级智能(ASI)。据北京商报报道,Qwen3.8-Max相较上一代,发布两个月真实用户收入增长8.5倍、Token消耗量涨了12倍,而基于新架构的Qwen4已在训练中北京商报。阿里的表述也很坦诚:RSI已"初步进入模型训练、推理及芯模协同等环节"——意思是RSI尚未全面接管整个研发流水线,而是在几个关键环节率先实现了闭环。

3. 智谱:国内首个跑进生产环境的RSI工程案例

如果说阿里的RSI更多体现在"模型榜单分数"的自我跃迁,那么智谱则在9月17日给出了国内大模型厂商首次公开跑进生产环境的RSI案例。据智谱创始人兼首席科学家唐杰在X平台披露的技术博客,由GLM-5.3驱动的Infra Agent(基础设施智能体),完成了GLM-5.3-Flash推理基础设施的设计、调试与优化——模型开始反向改进承载自己运行的系统科创板日报/新浪;证券日报。

这次实践的硬指标极为亮眼:

  • 在超过10万张国产芯片组成的集群上,从零搭建一套完整的生产级推理服务;
  • 不到两周将端到端吞吐提升至初始基线的3倍;
  • 硬件利用效率与单Token成本达到主流NVIDIA GPU相当水平;
  • 支持1M上下文窗口与多模态请求;
  • GLM-5.3-Flash以匿名模型Ox-Alpha在OpenCode、OpenRouter上线,一周成为双平台调用量最大的模型,6天Token调用量超62万亿IT之家。

Infra Agent不再只是"生成代码",而是围绕推理系统完成了完整的工程闭环:根据测试、Trace、Benchmark等稠密反馈自主提出性能假设、定位精度缺陷、修改底层代码、执行分层测试并持续迭代。它甚至学会了从SGLang、Flash Linear Attention、DeepGEMM等开源高性能kernel项目中提炼"优化骨架",把适用条件与验证证据一并沉淀下来,让验证过的做法回流成库——任务从一次性执行变成了复利式积累36氪。

图3:智谱Infra Agent反向改进推理系统(模型建设系统,系统反哺模型)
+-----------------------------------------------------------------------+
|  GLM-5.3 驱动的 Infra Agent                                          |
|     |  提出性能假设 / 定位缺陷                                        |
|     v                                                                 |
|  [推理系统 kernel/调度/并行策略/通信/内存]  <- 可被改进的对象           |
|     |                                                                 |
|     v  执行修改                                                        |
|  [分层测试 + 微基准 + 运行时日志 + Trace]  <- 可验证的裁判            |
|     |                                                                 |
|     +-- 稠密反馈:吞吐/时延/精度 --+                                 |
|                                   |                                   |
|  [成功经验提炼"优化骨架"回流成库]   +----> 下一轮更省力                 |
|                                                                       |
|  最终:10万国产卡集群上两周吞吐提升3倍,成本对标NVIDIA GPU             |
|  GLM-5.3-Flash 全部线上推理运行其上(Ox-Alpha 6天消耗62万亿Token)     |
+-----------------------------------------------------------------------+

用唐杰当时的话说:“模型优化系统,系统服务模型”,智谱实现了RSI的最小闭环。他划清了边界:系统尚未达到完全自主设计和训练下一代模型的阶段,但"RSI的早期形态已经出现"。为了理解Infra Agent是如何在缺乏文档、生态不成熟的国产芯片环境里完成"定位缺陷—修改代码—分层验证"的整条工程闭环的,下面用Go给出推理内核优化的核心骨架,其中"稠密反馈"被显式编码为一个可反复消费的度量流:

package infra

type Dense struct {
	Throughput float64
	Latency    float64
	Precision  float64
}

type Kernel struct {
	Code string `json:"code"`
	Arg  string `json:"arg"`
}

func optimize(agent func(*Kernel) Dense, variants []Kernel, target float64) Kernel {
	best := variants[0]
	var bestScore float64
	for _, v := range variants {
		d := agent(&v)
		score := d.Throughput/(d.Latency+1e-6) * d.Precision
		if score > bestScore {
			bestScore = score
			best = v
		}
	}
	if bestScore >= target {
		commit(best)
	}
	return best
}

这里的 optimize 在每轮都对比吞吐、时延与精度的加权得分(Dense 结构即"可验证的裁判"),一旦命中目标门槛就把内核 commit 落库(commit 后成功经验回流进库,即"自我供给的回路")。于是"模型提出假设—执行修改—分层测试—有效则沉淀"的RSI工程闭环,被压缩成了一段可在十万卡集群上反复执行、可被Trace与Benchmark持续审计的优化原语。

4. OpenAI的立场:把RSI纳入全球标准讨论

面对RSI这股不可逆的浪潮,产业巨头也在同步划定安全边界。9月21日,OpenAI公开了一份关于下一阶段人工智能发展的政策提案,呼吁各国合作制定面向前沿AI的全球技术标准,并将递归自我改进纳入标准讨论范围。OpenAI明确表示,目前尚未出现完全自主的递归自我改进,并且在无法确保安全的情况下,不应推动完全自主的RSI中国证券报。

“如何衡量AI到底承担了多少自身研发"正成为监管层的核心关切。此前Anthropic的《衡量前沿实验室内部AI的发展速度》提出了三块"仪表盘”:AI承担了多少AI研发工作、Agent行动受到怎样的监督、算力在模型研发与安全工作之间如何分配36氪。而智谱的披露、阿里的演进、OpenAI的提案,分别从"工程实践、技术路线、治理框架"三个侧面,把RSI从科幻叙事推到了必须被规范讨论的现实位面。

这三块"仪表盘"落到可观测工程上,就是一套能持续核算"AI研发参与度"的探针。下面用Python给出与之配套的最小度量骨架,用来自动估算一个Agent在研发任务中承担的比例,正是Anthropic所谓"AI承担了多少AI研发工作"的可量化解法之一:

def measure_share(events):
    total = 0.0
    ai = 0.0
    for e in events:
        total += 1
        if e.actor == "ai":
            ai += 1
    return ai / total if total else 0.0

def audit_lab(pipeline):
    share = measure_share(pipeline.steps)
    if share > 0.5:
        pipeline.set_human_review("recurring")  # supervised loop
    return share

measure_share 统计流水线里由AI自主完成的比例,audit_lab 在分享度超过50%时自动为关键步骤插入"持续人工复核"——这正是把"Agent行动受到怎样的监督"写进了可执行的合规逻辑,让"看得见、测得准、可干预"从口号变成了可被审计的度量。


下篇:Agent进入生产——让智能从"被调用"走向"被交付"

5. 千问AI平台全面升级:把Agent送进企业核心流程

RSI的终极意义,最终要落到"智能成为可规模化的商品"。在9月22日的云栖MaaS & Agent技术主论坛上,阿里集团战略副总裁、ATH事业群MaaS业务线总裁文征宣布千问AI平台全面升级:以推动Agent进入生产作为建设核心,在模型服务基础上新增对Agent服务、行业AI解决方案的支持钱江晚报;DOIT。

过去一年,阿里云MaaS平台服务的客户数增长六倍;随着订单、代码、内容和业务流程主动发起调用,Agent开始进入企业核心流程。文征提出了"智能价值密度“的概念——由单任务价值、Token生产效率、单Token能力三者共同决定。企业需要的已不再只是一个模型API,而是一套覆盖模型供给、生产运行、Agent构建与托管的完整体系。一句话概括:智能正在从"被调用"走向"被交付”。

6. Agent Studio:企业级全栈Agent服务平台

为承接这一转变,千问AI平台正式发布企业级全栈Agent服务平台Agent Studio。它可以根据任务自动路由选择合适的模型,提供24小时不间断托管运行,并支持企业内部知识数据和外部软件服务接入钱江晚报。

图4:Agent Studio 企业级全栈Agent服务架构
+-----------------------------------------------------------------------------+
|  Agent Studio(企业级全栈Agent服务平台)                                     |
|  +---------------------------------------------------------------------+   |
|  |  任务入口:自动理解需求 --> 自动路由选择模型 --> 24小时无人托管运行      |   |
|  +---------------------------------------------------------------------+   |
|  |  原子API 层(50+个):运行环境/长期记忆/工具服务/会话请求/服务端点部署  |   |
|  |            全新 Agent API:环境+记忆+工具+部署 一次请求全部搞定        |   |
|  +---------------------------------------------------------------------+   |
|  |  生态服务:One Key MCP ---- 一个 API Key 连接 100+ 项服务            |   |
|  |             (高德/飞猪/1688/金融/法律...自动找工具并调用)             |   |
|  +---------------------------------------------------------------------+   |
|  |  Agent自进化引擎:运行观测 / AI评测器 / AI优化器 / 自动验证           |   |
|  +---------------------------------------------------------------------+   |
+-----------------------------------------------------------------------------+
  • 原子API:50多个原子API覆盖运行环境、长期记忆、工具服务、会话请求和服务端点部署等能力,企业可按需组合并接入自身业务;
  • Agent API(即将发布):将环境、记忆、工具、部署等需逐项调用的配置,一次请求全部搞定;
  • One Key MCP:用一个API Key连接100多项生态服务(高德、飞猪、1688及金融、法律等领域),平台自动理解需求、寻找工具并完成调用,大幅减少开发者逐一注册和配置鉴权的工作。

Agent Studio的核心能力在于"按任务自动路由选择模型"。一个任务进来,是交给擅长推理的大模型、还是交给时延更低的快模型、又或是直接走某条缓存命中的路径,都需要在毫秒级做出判断。下面用Go给出自动路由的核心骨架——它维护一张模型画像表,并根据任务特征与实时成本选择最合适的模型、且支持24小时无人托管的并发托管:

package router

import "sync"

type Task struct {
	Kind   string  // reasoning | coding | chat
	Budget float64 // token budget
	LatP50 float64 // required latency, ms
}

type Model struct {
	ID     string
	Latency float64
	Cost    float64
	Quality float64
}

var models = []Model{
	{ID: "qwen3.8-max", Latency: 420, Cost: 1.0, Quality: 0.99},
	{ID: "qwen3.8-flash", Latency: 90, Cost: 0.15, Quality: 0.85},
}

func Route(t Task) string {
	best := models[0]
	for _, m := range models[1:] {
		if m.Latency <= t.LatP50 && m.Quality > best.Quality {
			best = m
		}
	}
	return best.ID
}

var mu sync.Mutex
func safeRoute(t Task) string {
	mu.Lock()
	defer mu.Unlock()
	return Route(t)
}

Route 在满足时延上限(t.LatP50)的前提下,为任务挑选质量最高的模型——低时延场景自然落到flash档,复杂推理则交给max档;而 safeRoute 通过互斥锁保证在多Agent并发托管时路由决策的线程安全。这一段就把"按任务自动路由、24小时托管运行"从产品口号落实成了可测试的调度代码。

7. Agent自进化引擎:把RSI的S放进Agent运营里

Agent Studio最具"RSI色彩"的组件,是即将推出的Agent自进化引擎。它包含四件套:

  1. 运行观测——持续采集Agent在生产中的运行指标与Trace;
  2. AI评测器——自动评估Agent任务完成质量;
  3. AI优化器——基于评测反馈对提示词、参数、工具调用链做自动调优;
  4. 自动验证——在上下文交互中持续验证改进效果,形成闭环。

这套引擎的价值,是把"递归自我改进"从模型训练侧延伸到Agent运行侧:Agent不是上线后一成不变,而是在真实业务流量中持续调优与进化。当"模型研发"与"Agent运营"都装上了自进化闭环,“智能价值密度"的复利效应就开始显现。要理解这套引擎如何在"上下文交互中持续调优”,下面用Python给出其四件套(运行观测→AI评测器→AI优化器→自动验证)的单轮运作逻辑:

def evolve(policy, obs, evaluator, optimizer, verifier):
    metrics = obs.collect(policy)
    verdict = evaluator.judge(policy, metrics)
    nxt = policy
    if verdict.score < 0.9:
        nxt = optimizer.tune(policy, verdict.feedback)
    ok = verifier.run(nxt)  # auto-verify in context
    return nxt if ok else policy

def loop(policy, engine, max_iter=50):
    for _ in range(max_iter):
        policy = evolve(policy, engine.obs, engine.eval,
                        engine.opt, engine.verify)
        if engine.eval.judge(policy).score >= 0.99:
            break
    return policy

这段逻辑把"运行观测—评测—调优—验证"显式串成一条可中断、可回滚的流水线:evaluator 是AI评测器,optimizer 基于反馈修改提示词与参数,verifier 在上下文交互中自动验证改得对不对——一旦比分越过0.99就提前收敛,避免Agent在无效改动上空转。这正是"让Agent在真实流量里长成"的工程载体。

图5:Agent自进化引擎四件套(运行侧RSI闭环)
+----------------------------------------------------------------------+
|  +------------+     +------------+     +------------+     +----------+ |
|  | 运行观测    | --> | AI评测器   | --> | AI优化器    | --> | 自动验证  | |
|  +------------+     +------------+     +------------+     +----------+ |
|    采集指标/Trace      评估完成质量       调优提示词/参数       验证改进效果 |
|         ^                                                     |        |
|         |                                                     v        |
|  +------+----------------------- 持续调优与进化闭环 -----------+-------+ |
|                    Agent 上线后在真实流量中自我进化                         |
+----------------------------------------------------------------------+

8. 弹性启动与成本革命:让Agent"跑得起"

Agent决策链路长、并发高、对时延敏感,这对底层推理基础设施提出了极其严苛的要求。千问AI平台通过FlashBoot、UniScheduler等能力调度异构算力,交出了一份惊人的成绩单钱江晚报:

  • 模型弹性启动时间从1200秒缩至70秒;
  • 1分钟内拉起1万个Pods;
  • 首Token延迟降低38%;
  • Prompt Caching成本最高节省95%;
  • API优速模式可将TPS提升1.5至2倍,用户切换model ID即可使用;
  • 动态Harness基于任务复杂度智能裁剪中间Token,为用户节省40%的Token成本;
  • 提供99.9%生产级SLA、十亿级单客户峰值TPM和CMaaS机密推理服务。
图6:FlashBoot / UniScheduler 弹性启动与调度(算力即开即用)
+--------------------------------------------------------------------------+
|  请求到达                                                                 |
|    |                                                                      |
|    v                                                                      |
|  [UniScheduler 异构算力调度]  -->  按目标 1分钟内拉起 1万个 Pods            |
|    |                                                                      |
|    v                                                                      |
|  [FlashBoot 模型弹性启动] 1200s --> 70s  (首Token延迟降38%)              |
|    |                                                                      |
|    v                                                                      |
|  [Prompt Caching] 前缀命中复用 --> 成本最高省95%                          |
|    |                                                                      |
|    v                                                                      |
|  [API优速模式] TPS 提升 1.5~2x   +  [动态Harness] Token成本省40%          |
+--------------------------------------------------------------------------+

这一整套"启动提速+吞吐翻倍+缓存省钱"的组合,本质上解决的是Agent生产化的单位经济模型问题——只有当推理成本被打下来、弹性启动快到几秒级,企业才敢让成千上万个Agent同时在大规模业务里"24小时流转"。而要实现"1200秒缩到70秒、1分钟拉起1万个Pod",背后是一套高效的并发调度原语。下面用Go给出弹性启动调度的核心骨架:

package coldstart

import (
	"sync"
	"sync/atomic"
	"time"
)

type Pod struct{ Ready chan struct{} }

type Scheduler struct {
	mu    sync.Mutex
	free  int64
	start int64
}

func (s *Scheduler) spinUp(n int) []*Pod {
	start := time.Now()
	pods := make([]*Pod, 0, n)
	s.mu.Lock()
	budget := atomic.LoadInt64(&s.free)
	if budget < int64(n) {
		budget = int64(n)
	}
	s.mu.Unlock()
	for i := int64(0); i < budget; i++ {
		p := &Pod{Ready: make(chan struct{})}
		pods = append(pods, p)
		go warm(p) // parallel warm-up
	}
	atomic.StoreInt64(&s.start, int64(time.Since(start).Milliseconds()))
	return pods
}

func warm(p *Pod) {
	time.Sleep(70 * time.Millisecond)
	close(p.Ready)
}

go warm(p) 的并发起拱,正是把"1分钟拉起1万个Pod"落到字面实现的关键——每个Pod的预热彼此独立、可并行推进,配合FlashBoot的镜像热备,算子启动由分钟级压缩到70毫秒级。这里的核心思路是用"预分配+并发预热"换取"首Token延迟降低38%“的端到端收益。

9. Personal Agent:把Agent送进3亿用户的日常

Agent生产化的另一端,是面向个人用户的Personal Agent。阿里正在加速打造Personal Agent,覆盖3亿用户,Qwen3.8提供理解、规划、执行三大核心能力,让每个用户都拥有一个随时待命的"数字分身”。所谓"理解—规划—执行"落到代码上,就是一个把用户意图拆解成可执行步骤、再逐一落地的状态机。下面用Python给出其简化的三阶段驱动骨架:

class PersonalAgent:
    def __init__(self, model, memory):
        self.model, self.memory = model, memory

    def act(self, goal):
        plan = self.model.plan(goal, self.memory.profile())
        for step in plan.steps:
            if step.needs_confirm and not self._approved(step):
                continue
            self._exec(step)
            self.memory.record(step.result)
        return self.memory.summary()

model.plan 承担"规划",_exec 承担"执行",memory.record 让每次交互沉淀为"长期记忆"——三者共同构成Personal Agent的"模型+Context+生态"三件套,让3亿用户的数字分身既能听懂目标,也能记得住每个人的偏好。

这一方向并非孤例。Meta Muse在9月8日发布后迅速成为现象级产品:据Sensor Tower监测,上线5天下载突破73万次,上线第10天登顶美国App Store免费榜第一,上线13天全网累计下载量约260万次,一度力压ChatGPT、Claude北京商报;36氪。Muse并非传统问答式聊天机器人,而是运行在独立虚拟机上的个人AI代理,依托Muse Spark模型驱动,能替用户完成邮件整理、表单填写、餐厅预订、网购清单生成等实操类网络行为。扎克伯格将其定义为一款"能够理解用户目标,并全天候替用户完成任务的个人Agent"。

图7:Personal Agent 三件套(模型 + Context + 生态)
+----------------------------------------------------------------------+
|   Personal Agent —— 3亿用户的数字分身                                  |
|  +--------+      +---------+      +---------+                         |
|  | Qwen3.8|      | Context |      | 生态    |                         |
|  | 模型   |      | 长期记忆|      | 工具/服务|=--> 理解->规划->执行      |
|  | 理解    |      | 用户画像|      | MCP     |                         |
|  +--------+      +---------+      +---------+                         |
|       |              |               |                               |
|       锚点跨界对标:Meta Muse —— 13天260万下载、登顶美区AppStore免费榜  |
+----------------------------------------------------------------------+

Meta Muse的爆红与阿里的Personal Agent,共同印证了一个判断:Personal Agent正在成为下一个超级应用的候选形态。但也要看到争议——亚马逊已阻止Muse访问其购物网站,理由是隐私与安全风险;而AI智能体跨平台自动化任务所需的多维度数据授权,也引发了行业对隐私与监管的深层担忧36氪。

10. 芯模协同:真武V900让RSI重到"算得动"

RSI和Agent生产化的地基,离不开算力。云栖主论坛上,阿里平头哥发布新一代训推一体AI芯片真武V900,性能为前代真武M890的3倍,搭载216GB显存、片间互联带宽1200GB/s,单一集群可扩展至50万卡,预计2027年一季度量产时代周报;杭州日报。通过自研ICN Switch互联芯片,上千颗V900能像一颗"超级芯片"一样协同工作。

更深的信号在于三线的合流:模型与Agent的真实需求牵引芯片与系统设计,云平台把硬件能力组织成可规模化交付的服务,模型再反向优化推理软件与芯片设计。芯片、模型与云围绕任务效果、响应速度、吞吐和单位成本共同迭代,形成协同飞轮。这正是RSI从"模型自己改进自己"升级为"芯模协同自我改进"的物理基础——一个能支撑万亿参数、分钟级拉起万个Pod、让Agent 24小时运转的基础设施,才配得上"机器思考放大1000倍"的野心。

如果把上面的工程细节收敛成一段可运行的最小实现,就能看清"RSI闭环+Agent生产化"其实共享同一套元结构——都有一个"可验证目标、可循环改进、可自动回滚"的循环。下面这段Python把模型自进化与Agent自调优合并成一条通用回路,用来演示这套元结构的普适性:

class Loop:
    def __init__(self, obj, judge, mutate, rollback):
        self.obj, self.judge = obj, judge
        self.mutate, self.rollback = mutate, rollback

    def run(self, n):
        best, best_sc = self.obj, self.judge(self.obj)
        for _ in range(n):
            cand = self.mutate(best)
            sc = self.judge(cand)
            if sc > best_sc:
                best, best_sc = cand, sc
            elif sc < best_sc * 0.99:
                best = self.rollback(best)  # auto-verify rollback
        return best

rsi = Loop(Qwen38Max(), autoeval, mutate_weights, rollback_to)
agent = Loop(MyAgent(), task_judge, tune_prompt, reload_last_ok)
rsi.run(33)
agent.run(200)

Loop 这个类同时驱动了Qwen的33轮零参与演进(rsi.run(33))与Agent的200次生产调优(agent.run(200))——只不过模型侧的 autoeval 用Artificial Analysis基准打分,Agent侧的 task_judge 用任务完成质量打分。这个抽象揭示了一个重要事实:“机器思考放大1000倍"的野心,和"让Agent在业务里24小时流转"的务实,本质上是同一台引擎在不同尺度上的运行。 这也是我们对RSI工程化最该有的清醒认识。


深度观察:RSI工程化说到底是要解决什么?

综合云栖大会上的信息,我们把"RSI从概念走向生产"的三条主线做一次收敛:

第一,RSI的实用价值远早于其"自主造继承者"的终极形态。 智谱的例子证明,哪怕只是让模型优化自己的推理系统、把吞吐提升3倍、把单Token成本打到对标NVIDIA GPU,就已经产生了巨大的经济价值——推理系统的高效,意味着同样的预算能留出更多算力给训练,下一代模型可以站在更稳的台阶上36氪。这比等待"模型自主设计训练下一代"要务实得多。

第二,闭环比智能更重要。 无论阿里Qwen的33轮零参与迭代,还是智谱Infra Agent的工程闭环,成功的关键都在于:有可验证的裁判(Artificial Analysis、吞吐/时延/精度指标)、有可被改进的对象(推理系统、评测体系)、有能自我供给的回路(改进经验回流成库)。缺了任何一环,“自我改进"都会退化为原地打转。

第三,全球治理框架必须与技术同步。 OpenAI的提案、Anthropic的"仪表盘”,都在强调同一件事:当AI开始参与构建自身系统甚至下一代模型,人类必须保留"看得见、测得准、可干预"的能力。衡量"AI承担了多少自身研发"“行动受何种监督"“算力如何分配”,将决定RSI是通向受益还是通往失控。

而这一切,都指向吴泳铭那句被反复引用的话:”AI越强大,人类越强大。“当机器接手繁重、重复性的思考任务,人类将被释放出来,把有限的智力投入到更有创造性的探索中去。RSI的意义,不在于机器是否最终"取代"人类思考,而在于它能否为人类腾出更多"去思考人类该思考之事"的空间——这或许是"机器思考放大1000倍"背后,真正值得每一个从业者凝视的方向。


附:本文关键数据速查与来源

关键数据数值来源
机器思考总量未来/今日人类1000倍+ / 不足人类3%界面新闻、时代周报
Qwen3.8-Max零参与自进化33轮 / Artificial Analysis 40→45中国证券报
未来模型参数规模5万亿~10万亿(Qwen4.5/Qwen5)时代周报、北京商报
Qwen3.8-Max商业表现真实用户收入8.5倍 / Token涨12倍北京商报
智谱Infra Agent吞吐10万国产卡 / 两周3倍 / Ox-Alpha 62万亿Token科创板日报、IT之家
弹性启动时间1200s → 70s / 1分钟1万Pods / 首Token降38%钱江晚报
Prompt Caching / 优速模式省95% / TPS提升1.5~2倍 / Harness省40%钱江晚报、DOIT
Agent Studio原子API50+ / One Key MCP连100+服务钱江晚报
真武V900性能3倍 / 50万卡集群 / 2027Q1量产时代周报、杭州日报
Meta Muse13天260万下载 / 登顶美区App StoreSensor Tower/北京商报

本文数据综合云栖大会官方发布与多家媒体(中国证券报、北京商报、时代周报、钱江晚报、界面新闻、36氪等)交叉核实,技术细节以阿里、智谱官方披露为准。