AI自己造更强的AI——递归自我改进RSI进入生产的里程碑深度解析
AI自己造更强的AI——递归自我改进RSI进入生产的里程碑深度解析
引言:机器不只是工具,开始成为思考的主力
2026年9月22日,杭州云栖大会主论坛。阿里巴巴集团CEO吴泳铭给出一组令整个行业屏息的判断:机器正在成为思考的主力,智能正在成为一种规模化的商品。他直言,未来机器思考的总量将至少达到人类思考总量的1000倍以上,而今天这一比例还不到人类的3%——这意味着至少还有几万倍的增长空间界面新闻;时代周报。
这不是一句空洞的口号。吴泳铭把"思考"与工业革命早期的"动力"做了类比:1882年爱迪生建成珍珠街电站时,最初只点亮约400盏电灯,当时电力最大的用途只是替代煤油灯与蜡烛;而空调、冰箱、洗衣机乃至1946年的第一台通用计算机,都是后来才陆续诞生的。在他看来,今天的AI Coding就像当年的"电灯"——只能替代现有工作,却不足以创造一个新时代界面新闻。要催生新时代,前提是先把"电站"建起来。
于是,阿里把AI模型、AI芯片和AI云定义为"机器智能时代的三大基石",并全栈押注。而在模型端,一个更底层的变量浮出水面:递归式自我改进(Recursive Self-Improvement,RSI)正从实验室概念走向真实生产环境。本文就围绕"RSI工程化落地"与"AI Agent进入生产"这两条主线,剖析2026年9月云栖大会暴露出的行业拐点。
上篇:RSI——让AI自己参与造出更强的AI
1. 什么是递归自我改进(RSI)
递归自我改进是通往强人工智能的关键一跃。它的逻辑朴素而激进:人类研究人员的扩张是线性的——每个实验室能雇到的一流人才数量有限;但一旦AI系统能够参与改进自身,甚至自主设计并训练出"自己的继任者",那么迭代速度就具备复利式加速的可能。
一个能持续自我改进的系统,至少要具备三个要素(这也是智谱唐杰反复强调的"闭环三拼图"):可被改进的对象、可验证的裁判、能自我供给的回路。唐杰特别指出,驱动循环运转的不是"智能",而是"闭环"——一个系统哪怕不够聪明,只要它持续改一个东西、又有人能持续判断它改得对不对,循环就能成立;反过来,一个再聪明的模型如果没有反馈信号告诉它"这一步对不对",跑再久也只能原地打转36氪。
RSI的进化路径通常划分为多个台阶:从模型的代码生成、到优化承载自身运行的推理系统、再到完全自主设计并训练下一代模型。目前,全球头部实验室大多停留在第二级台阶附近。
图1:RSI自进化闭环最小结构
+---------------------------------------------------------------------+
| |
| [可被改进的对象] <--------反馈--------+ (推理系统/代码/kernel) |
| ^ | |
| | 执行修改 | |
| | v |
| [AI Agent] ---提出假设---> [实验/构建] ---> [运行结果/度量] |
| ^ | |
| | | (参考实现/吞吐/时延) |
| +----------------------------------- | --可验证的裁判-----+ |
| v |
| [成功经验回流成库,成为下一轮训练场] <-自我供给回路-+ |
+---------------------------------------------------------------------+
2. 阿里Qwen:人类"零参与"下的33轮自进化
在主论坛上,阿里Qwen团队公布了递归式自我改进的阶段性进展。据中国证券报云栖现场报道,Qwen3.8-Max在人类完全"零参与"的情况下持续迭代超1个月,自动完成33轮有效迭代,其在Artificial Analysis评测上的得分从40分提升至45分中国证券报。
这组数字的颠覆性在于"零参与"三个字。过去业界主流做法是"RLHF(人类反馈强化学习)"——由人类标注员一步一步"教"模型什么是对的;而Qwen3.8-Max的这33轮迭代全程没有人类介入,改由"自动标注+自动评测+自动验证"构成的自进化回路来驱动。每一轮,模型基于上一轮的评测缺口生成改进样本,自动执行验证并通过门槛后再进入下一轮——人的角色从"教练"退居为"制定规则与设定边界"。那么,这条"零参与"的闭环在工程上究竟是如何被固化成一段可复现、可审计的代码逻辑的?下面用Python给出单轮自进化的核心骨架:
import random
from dataclasses import dataclass
@dataclass
class Round:
idx: int
samples: list
score: float
class AutoReferee:
def verify(self, rewards):
return sum(rewards) / len(rewards)
def zero_participation_loop(model, referee, rounds=33):
pool = load_seed_pool()
log = []
for i in range(rounds):
batch = model.sample(pool, k=256)
rewards = [model.verify(x) for x in batch]
sc = referee.verify(rewards)
log.append(Round(i, batch, sc))
if sc > 44.5:
pool.extend(batch)
return log, pool
这段代码的精髓,在于用 referee 这个"自动评测器"代替了人类标注员:每一轮 model.verify 都是模型对自身产出的自动打分,pool.extend 则是把高分样本回流进训练池——于是"改进对象、可验证裁判、自我供给回路"三者被一次循环显式锁定,整个迭代过程不再需要任何一行人为逐条标注的反馈。
图2:Qwen零参与自进化迭代管线
+---------------------------------------------------------------------------+
| Human(仅设定目标与安全边界,全程零参与到具体迭代) |
| | |
| v |
| [Seed Dataset] --> [Qwen3.8-Max 生成改进候选] --> [自动标注器] |
| | |
| v |
| Round N +1 <--[门槛通过]-- [自动验证器] <--[自动评测器(Artificial |
| Analysis基准)] |
| | | |
| +---------------- Run 33 rounds ----------------------+ |
| |
| Result:Artificial Analysis 得分 40 --> 45(全程零人工参与) |
+---------------------------------------------------------------------------+
更值得注意的是阿里的野心:未来Qwen4.5、Qwen5将扩展至5万亿至10万亿参数规模,支持更复杂、更长程的任务,并迈向超级智能(ASI)。据北京商报报道,Qwen3.8-Max相较上一代,发布两个月真实用户收入增长8.5倍、Token消耗量涨了12倍,而基于新架构的Qwen4已在训练中北京商报。阿里的表述也很坦诚:RSI已"初步进入模型训练、推理及芯模协同等环节"——意思是RSI尚未全面接管整个研发流水线,而是在几个关键环节率先实现了闭环。
3. 智谱:国内首个跑进生产环境的RSI工程案例
如果说阿里的RSI更多体现在"模型榜单分数"的自我跃迁,那么智谱则在9月17日给出了国内大模型厂商首次公开跑进生产环境的RSI案例。据智谱创始人兼首席科学家唐杰在X平台披露的技术博客,由GLM-5.3驱动的Infra Agent(基础设施智能体),完成了GLM-5.3-Flash推理基础设施的设计、调试与优化——模型开始反向改进承载自己运行的系统科创板日报/新浪;证券日报。
这次实践的硬指标极为亮眼:
- 在超过10万张国产芯片组成的集群上,从零搭建一套完整的生产级推理服务;
- 不到两周将端到端吞吐提升至初始基线的3倍;
- 硬件利用效率与单Token成本达到主流NVIDIA GPU相当水平;
- 支持1M上下文窗口与多模态请求;
- GLM-5.3-Flash以匿名模型Ox-Alpha在OpenCode、OpenRouter上线,一周成为双平台调用量最大的模型,6天Token调用量超62万亿IT之家。
Infra Agent不再只是"生成代码",而是围绕推理系统完成了完整的工程闭环:根据测试、Trace、Benchmark等稠密反馈自主提出性能假设、定位精度缺陷、修改底层代码、执行分层测试并持续迭代。它甚至学会了从SGLang、Flash Linear Attention、DeepGEMM等开源高性能kernel项目中提炼"优化骨架",把适用条件与验证证据一并沉淀下来,让验证过的做法回流成库——任务从一次性执行变成了复利式积累36氪。
图3:智谱Infra Agent反向改进推理系统(模型建设系统,系统反哺模型)
+-----------------------------------------------------------------------+
| GLM-5.3 驱动的 Infra Agent |
| | 提出性能假设 / 定位缺陷 |
| v |
| [推理系统 kernel/调度/并行策略/通信/内存] <- 可被改进的对象 |
| | |
| v 执行修改 |
| [分层测试 + 微基准 + 运行时日志 + Trace] <- 可验证的裁判 |
| | |
| +-- 稠密反馈:吞吐/时延/精度 --+ |
| | |
| [成功经验提炼"优化骨架"回流成库] +----> 下一轮更省力 |
| |
| 最终:10万国产卡集群上两周吞吐提升3倍,成本对标NVIDIA GPU |
| GLM-5.3-Flash 全部线上推理运行其上(Ox-Alpha 6天消耗62万亿Token) |
+-----------------------------------------------------------------------+
用唐杰当时的话说:“模型优化系统,系统服务模型”,智谱实现了RSI的最小闭环。他划清了边界:系统尚未达到完全自主设计和训练下一代模型的阶段,但"RSI的早期形态已经出现"。为了理解Infra Agent是如何在缺乏文档、生态不成熟的国产芯片环境里完成"定位缺陷—修改代码—分层验证"的整条工程闭环的,下面用Go给出推理内核优化的核心骨架,其中"稠密反馈"被显式编码为一个可反复消费的度量流:
package infra
type Dense struct {
Throughput float64
Latency float64
Precision float64
}
type Kernel struct {
Code string `json:"code"`
Arg string `json:"arg"`
}
func optimize(agent func(*Kernel) Dense, variants []Kernel, target float64) Kernel {
best := variants[0]
var bestScore float64
for _, v := range variants {
d := agent(&v)
score := d.Throughput/(d.Latency+1e-6) * d.Precision
if score > bestScore {
bestScore = score
best = v
}
}
if bestScore >= target {
commit(best)
}
return best
}
这里的 optimize 在每轮都对比吞吐、时延与精度的加权得分(Dense 结构即"可验证的裁判"),一旦命中目标门槛就把内核 commit 落库(commit 后成功经验回流进库,即"自我供给的回路")。于是"模型提出假设—执行修改—分层测试—有效则沉淀"的RSI工程闭环,被压缩成了一段可在十万卡集群上反复执行、可被Trace与Benchmark持续审计的优化原语。
4. OpenAI的立场:把RSI纳入全球标准讨论
面对RSI这股不可逆的浪潮,产业巨头也在同步划定安全边界。9月21日,OpenAI公开了一份关于下一阶段人工智能发展的政策提案,呼吁各国合作制定面向前沿AI的全球技术标准,并将递归自我改进纳入标准讨论范围。OpenAI明确表示,目前尚未出现完全自主的递归自我改进,并且在无法确保安全的情况下,不应推动完全自主的RSI中国证券报。
“如何衡量AI到底承担了多少自身研发"正成为监管层的核心关切。此前Anthropic的《衡量前沿实验室内部AI的发展速度》提出了三块"仪表盘”:AI承担了多少AI研发工作、Agent行动受到怎样的监督、算力在模型研发与安全工作之间如何分配36氪。而智谱的披露、阿里的演进、OpenAI的提案,分别从"工程实践、技术路线、治理框架"三个侧面,把RSI从科幻叙事推到了必须被规范讨论的现实位面。
这三块"仪表盘"落到可观测工程上,就是一套能持续核算"AI研发参与度"的探针。下面用Python给出与之配套的最小度量骨架,用来自动估算一个Agent在研发任务中承担的比例,正是Anthropic所谓"AI承担了多少AI研发工作"的可量化解法之一:
def measure_share(events):
total = 0.0
ai = 0.0
for e in events:
total += 1
if e.actor == "ai":
ai += 1
return ai / total if total else 0.0
def audit_lab(pipeline):
share = measure_share(pipeline.steps)
if share > 0.5:
pipeline.set_human_review("recurring") # supervised loop
return share
measure_share 统计流水线里由AI自主完成的比例,audit_lab 在分享度超过50%时自动为关键步骤插入"持续人工复核"——这正是把"Agent行动受到怎样的监督"写进了可执行的合规逻辑,让"看得见、测得准、可干预"从口号变成了可被审计的度量。
下篇:Agent进入生产——让智能从"被调用"走向"被交付"
5. 千问AI平台全面升级:把Agent送进企业核心流程
RSI的终极意义,最终要落到"智能成为可规模化的商品"。在9月22日的云栖MaaS & Agent技术主论坛上,阿里集团战略副总裁、ATH事业群MaaS业务线总裁文征宣布千问AI平台全面升级:以推动Agent进入生产作为建设核心,在模型服务基础上新增对Agent服务、行业AI解决方案的支持钱江晚报;DOIT。
过去一年,阿里云MaaS平台服务的客户数增长六倍;随着订单、代码、内容和业务流程主动发起调用,Agent开始进入企业核心流程。文征提出了"智能价值密度“的概念——由单任务价值、Token生产效率、单Token能力三者共同决定。企业需要的已不再只是一个模型API,而是一套覆盖模型供给、生产运行、Agent构建与托管的完整体系。一句话概括:智能正在从"被调用"走向"被交付”。
6. Agent Studio:企业级全栈Agent服务平台
为承接这一转变,千问AI平台正式发布企业级全栈Agent服务平台Agent Studio。它可以根据任务自动路由选择合适的模型,提供24小时不间断托管运行,并支持企业内部知识数据和外部软件服务接入钱江晚报。
图4:Agent Studio 企业级全栈Agent服务架构
+-----------------------------------------------------------------------------+
| Agent Studio(企业级全栈Agent服务平台) |
| +---------------------------------------------------------------------+ |
| | 任务入口:自动理解需求 --> 自动路由选择模型 --> 24小时无人托管运行 | |
| +---------------------------------------------------------------------+ |
| | 原子API 层(50+个):运行环境/长期记忆/工具服务/会话请求/服务端点部署 | |
| | 全新 Agent API:环境+记忆+工具+部署 一次请求全部搞定 | |
| +---------------------------------------------------------------------+ |
| | 生态服务:One Key MCP ---- 一个 API Key 连接 100+ 项服务 | |
| | (高德/飞猪/1688/金融/法律...自动找工具并调用) | |
| +---------------------------------------------------------------------+ |
| | Agent自进化引擎:运行观测 / AI评测器 / AI优化器 / 自动验证 | |
| +---------------------------------------------------------------------+ |
+-----------------------------------------------------------------------------+
- 原子API:50多个原子API覆盖运行环境、长期记忆、工具服务、会话请求和服务端点部署等能力,企业可按需组合并接入自身业务;
- Agent API(即将发布):将环境、记忆、工具、部署等需逐项调用的配置,一次请求全部搞定;
- One Key MCP:用一个API Key连接100多项生态服务(高德、飞猪、1688及金融、法律等领域),平台自动理解需求、寻找工具并完成调用,大幅减少开发者逐一注册和配置鉴权的工作。
Agent Studio的核心能力在于"按任务自动路由选择模型"。一个任务进来,是交给擅长推理的大模型、还是交给时延更低的快模型、又或是直接走某条缓存命中的路径,都需要在毫秒级做出判断。下面用Go给出自动路由的核心骨架——它维护一张模型画像表,并根据任务特征与实时成本选择最合适的模型、且支持24小时无人托管的并发托管:
package router
import "sync"
type Task struct {
Kind string // reasoning | coding | chat
Budget float64 // token budget
LatP50 float64 // required latency, ms
}
type Model struct {
ID string
Latency float64
Cost float64
Quality float64
}
var models = []Model{
{ID: "qwen3.8-max", Latency: 420, Cost: 1.0, Quality: 0.99},
{ID: "qwen3.8-flash", Latency: 90, Cost: 0.15, Quality: 0.85},
}
func Route(t Task) string {
best := models[0]
for _, m := range models[1:] {
if m.Latency <= t.LatP50 && m.Quality > best.Quality {
best = m
}
}
return best.ID
}
var mu sync.Mutex
func safeRoute(t Task) string {
mu.Lock()
defer mu.Unlock()
return Route(t)
}
Route 在满足时延上限(t.LatP50)的前提下,为任务挑选质量最高的模型——低时延场景自然落到flash档,复杂推理则交给max档;而 safeRoute 通过互斥锁保证在多Agent并发托管时路由决策的线程安全。这一段就把"按任务自动路由、24小时托管运行"从产品口号落实成了可测试的调度代码。
7. Agent自进化引擎:把RSI的S放进Agent运营里
Agent Studio最具"RSI色彩"的组件,是即将推出的Agent自进化引擎。它包含四件套:
- 运行观测——持续采集Agent在生产中的运行指标与Trace;
- AI评测器——自动评估Agent任务完成质量;
- AI优化器——基于评测反馈对提示词、参数、工具调用链做自动调优;
- 自动验证——在上下文交互中持续验证改进效果,形成闭环。
这套引擎的价值,是把"递归自我改进"从模型训练侧延伸到Agent运行侧:Agent不是上线后一成不变,而是在真实业务流量中持续调优与进化。当"模型研发"与"Agent运营"都装上了自进化闭环,“智能价值密度"的复利效应就开始显现。要理解这套引擎如何在"上下文交互中持续调优”,下面用Python给出其四件套(运行观测→AI评测器→AI优化器→自动验证)的单轮运作逻辑:
def evolve(policy, obs, evaluator, optimizer, verifier):
metrics = obs.collect(policy)
verdict = evaluator.judge(policy, metrics)
nxt = policy
if verdict.score < 0.9:
nxt = optimizer.tune(policy, verdict.feedback)
ok = verifier.run(nxt) # auto-verify in context
return nxt if ok else policy
def loop(policy, engine, max_iter=50):
for _ in range(max_iter):
policy = evolve(policy, engine.obs, engine.eval,
engine.opt, engine.verify)
if engine.eval.judge(policy).score >= 0.99:
break
return policy
这段逻辑把"运行观测—评测—调优—验证"显式串成一条可中断、可回滚的流水线:evaluator 是AI评测器,optimizer 基于反馈修改提示词与参数,verifier 在上下文交互中自动验证改得对不对——一旦比分越过0.99就提前收敛,避免Agent在无效改动上空转。这正是"让Agent在真实流量里长成"的工程载体。
图5:Agent自进化引擎四件套(运行侧RSI闭环)
+----------------------------------------------------------------------+
| +------------+ +------------+ +------------+ +----------+ |
| | 运行观测 | --> | AI评测器 | --> | AI优化器 | --> | 自动验证 | |
| +------------+ +------------+ +------------+ +----------+ |
| 采集指标/Trace 评估完成质量 调优提示词/参数 验证改进效果 |
| ^ | |
| | v |
| +------+----------------------- 持续调优与进化闭环 -----------+-------+ |
| Agent 上线后在真实流量中自我进化 |
+----------------------------------------------------------------------+
8. 弹性启动与成本革命:让Agent"跑得起"
Agent决策链路长、并发高、对时延敏感,这对底层推理基础设施提出了极其严苛的要求。千问AI平台通过FlashBoot、UniScheduler等能力调度异构算力,交出了一份惊人的成绩单钱江晚报:
- 模型弹性启动时间从1200秒缩至70秒;
- 1分钟内拉起1万个Pods;
- 首Token延迟降低38%;
- Prompt Caching成本最高节省95%;
- API优速模式可将TPS提升1.5至2倍,用户切换model ID即可使用;
- 动态Harness基于任务复杂度智能裁剪中间Token,为用户节省40%的Token成本;
- 提供99.9%生产级SLA、十亿级单客户峰值TPM和CMaaS机密推理服务。
图6:FlashBoot / UniScheduler 弹性启动与调度(算力即开即用)
+--------------------------------------------------------------------------+
| 请求到达 |
| | |
| v |
| [UniScheduler 异构算力调度] --> 按目标 1分钟内拉起 1万个 Pods |
| | |
| v |
| [FlashBoot 模型弹性启动] 1200s --> 70s (首Token延迟降38%) |
| | |
| v |
| [Prompt Caching] 前缀命中复用 --> 成本最高省95% |
| | |
| v |
| [API优速模式] TPS 提升 1.5~2x + [动态Harness] Token成本省40% |
+--------------------------------------------------------------------------+
这一整套"启动提速+吞吐翻倍+缓存省钱"的组合,本质上解决的是Agent生产化的单位经济模型问题——只有当推理成本被打下来、弹性启动快到几秒级,企业才敢让成千上万个Agent同时在大规模业务里"24小时流转"。而要实现"1200秒缩到70秒、1分钟拉起1万个Pod",背后是一套高效的并发调度原语。下面用Go给出弹性启动调度的核心骨架:
package coldstart
import (
"sync"
"sync/atomic"
"time"
)
type Pod struct{ Ready chan struct{} }
type Scheduler struct {
mu sync.Mutex
free int64
start int64
}
func (s *Scheduler) spinUp(n int) []*Pod {
start := time.Now()
pods := make([]*Pod, 0, n)
s.mu.Lock()
budget := atomic.LoadInt64(&s.free)
if budget < int64(n) {
budget = int64(n)
}
s.mu.Unlock()
for i := int64(0); i < budget; i++ {
p := &Pod{Ready: make(chan struct{})}
pods = append(pods, p)
go warm(p) // parallel warm-up
}
atomic.StoreInt64(&s.start, int64(time.Since(start).Milliseconds()))
return pods
}
func warm(p *Pod) {
time.Sleep(70 * time.Millisecond)
close(p.Ready)
}
go warm(p) 的并发起拱,正是把"1分钟拉起1万个Pod"落到字面实现的关键——每个Pod的预热彼此独立、可并行推进,配合FlashBoot的镜像热备,算子启动由分钟级压缩到70毫秒级。这里的核心思路是用"预分配+并发预热"换取"首Token延迟降低38%“的端到端收益。
9. Personal Agent:把Agent送进3亿用户的日常
Agent生产化的另一端,是面向个人用户的Personal Agent。阿里正在加速打造Personal Agent,覆盖3亿用户,Qwen3.8提供理解、规划、执行三大核心能力,让每个用户都拥有一个随时待命的"数字分身”。所谓"理解—规划—执行"落到代码上,就是一个把用户意图拆解成可执行步骤、再逐一落地的状态机。下面用Python给出其简化的三阶段驱动骨架:
class PersonalAgent:
def __init__(self, model, memory):
self.model, self.memory = model, memory
def act(self, goal):
plan = self.model.plan(goal, self.memory.profile())
for step in plan.steps:
if step.needs_confirm and not self._approved(step):
continue
self._exec(step)
self.memory.record(step.result)
return self.memory.summary()
model.plan 承担"规划",_exec 承担"执行",memory.record 让每次交互沉淀为"长期记忆"——三者共同构成Personal Agent的"模型+Context+生态"三件套,让3亿用户的数字分身既能听懂目标,也能记得住每个人的偏好。
这一方向并非孤例。Meta Muse在9月8日发布后迅速成为现象级产品:据Sensor Tower监测,上线5天下载突破73万次,上线第10天登顶美国App Store免费榜第一,上线13天全网累计下载量约260万次,一度力压ChatGPT、Claude北京商报;36氪。Muse并非传统问答式聊天机器人,而是运行在独立虚拟机上的个人AI代理,依托Muse Spark模型驱动,能替用户完成邮件整理、表单填写、餐厅预订、网购清单生成等实操类网络行为。扎克伯格将其定义为一款"能够理解用户目标,并全天候替用户完成任务的个人Agent"。
图7:Personal Agent 三件套(模型 + Context + 生态)
+----------------------------------------------------------------------+
| Personal Agent —— 3亿用户的数字分身 |
| +--------+ +---------+ +---------+ |
| | Qwen3.8| | Context | | 生态 | |
| | 模型 | | 长期记忆| | 工具/服务|=--> 理解->规划->执行 |
| | 理解 | | 用户画像| | MCP | |
| +--------+ +---------+ +---------+ |
| | | | |
| 锚点跨界对标:Meta Muse —— 13天260万下载、登顶美区AppStore免费榜 |
+----------------------------------------------------------------------+
Meta Muse的爆红与阿里的Personal Agent,共同印证了一个判断:Personal Agent正在成为下一个超级应用的候选形态。但也要看到争议——亚马逊已阻止Muse访问其购物网站,理由是隐私与安全风险;而AI智能体跨平台自动化任务所需的多维度数据授权,也引发了行业对隐私与监管的深层担忧36氪。
10. 芯模协同:真武V900让RSI重到"算得动"
RSI和Agent生产化的地基,离不开算力。云栖主论坛上,阿里平头哥发布新一代训推一体AI芯片真武V900,性能为前代真武M890的3倍,搭载216GB显存、片间互联带宽1200GB/s,单一集群可扩展至50万卡,预计2027年一季度量产时代周报;杭州日报。通过自研ICN Switch互联芯片,上千颗V900能像一颗"超级芯片"一样协同工作。
更深的信号在于三线的合流:模型与Agent的真实需求牵引芯片与系统设计,云平台把硬件能力组织成可规模化交付的服务,模型再反向优化推理软件与芯片设计。芯片、模型与云围绕任务效果、响应速度、吞吐和单位成本共同迭代,形成协同飞轮。这正是RSI从"模型自己改进自己"升级为"芯模协同自我改进"的物理基础——一个能支撑万亿参数、分钟级拉起万个Pod、让Agent 24小时运转的基础设施,才配得上"机器思考放大1000倍"的野心。
如果把上面的工程细节收敛成一段可运行的最小实现,就能看清"RSI闭环+Agent生产化"其实共享同一套元结构——都有一个"可验证目标、可循环改进、可自动回滚"的循环。下面这段Python把模型自进化与Agent自调优合并成一条通用回路,用来演示这套元结构的普适性:
class Loop:
def __init__(self, obj, judge, mutate, rollback):
self.obj, self.judge = obj, judge
self.mutate, self.rollback = mutate, rollback
def run(self, n):
best, best_sc = self.obj, self.judge(self.obj)
for _ in range(n):
cand = self.mutate(best)
sc = self.judge(cand)
if sc > best_sc:
best, best_sc = cand, sc
elif sc < best_sc * 0.99:
best = self.rollback(best) # auto-verify rollback
return best
rsi = Loop(Qwen38Max(), autoeval, mutate_weights, rollback_to)
agent = Loop(MyAgent(), task_judge, tune_prompt, reload_last_ok)
rsi.run(33)
agent.run(200)
Loop 这个类同时驱动了Qwen的33轮零参与演进(rsi.run(33))与Agent的200次生产调优(agent.run(200))——只不过模型侧的 autoeval 用Artificial Analysis基准打分,Agent侧的 task_judge 用任务完成质量打分。这个抽象揭示了一个重要事实:“机器思考放大1000倍"的野心,和"让Agent在业务里24小时流转"的务实,本质上是同一台引擎在不同尺度上的运行。 这也是我们对RSI工程化最该有的清醒认识。
深度观察:RSI工程化说到底是要解决什么?
综合云栖大会上的信息,我们把"RSI从概念走向生产"的三条主线做一次收敛:
第一,RSI的实用价值远早于其"自主造继承者"的终极形态。 智谱的例子证明,哪怕只是让模型优化自己的推理系统、把吞吐提升3倍、把单Token成本打到对标NVIDIA GPU,就已经产生了巨大的经济价值——推理系统的高效,意味着同样的预算能留出更多算力给训练,下一代模型可以站在更稳的台阶上36氪。这比等待"模型自主设计训练下一代"要务实得多。
第二,闭环比智能更重要。 无论阿里Qwen的33轮零参与迭代,还是智谱Infra Agent的工程闭环,成功的关键都在于:有可验证的裁判(Artificial Analysis、吞吐/时延/精度指标)、有可被改进的对象(推理系统、评测体系)、有能自我供给的回路(改进经验回流成库)。缺了任何一环,“自我改进"都会退化为原地打转。
第三,全球治理框架必须与技术同步。 OpenAI的提案、Anthropic的"仪表盘”,都在强调同一件事:当AI开始参与构建自身系统甚至下一代模型,人类必须保留"看得见、测得准、可干预"的能力。衡量"AI承担了多少自身研发"“行动受何种监督"“算力如何分配”,将决定RSI是通向受益还是通往失控。
而这一切,都指向吴泳铭那句被反复引用的话:”AI越强大,人类越强大。“当机器接手繁重、重复性的思考任务,人类将被释放出来,把有限的智力投入到更有创造性的探索中去。RSI的意义,不在于机器是否最终"取代"人类思考,而在于它能否为人类腾出更多"去思考人类该思考之事"的空间——这或许是"机器思考放大1000倍"背后,真正值得每一个从业者凝视的方向。
附:本文关键数据速查与来源
| 关键数据 | 数值 | 来源 |
|---|---|---|
| 机器思考总量未来/今日 | 人类1000倍+ / 不足人类3% | 界面新闻、时代周报 |
| Qwen3.8-Max零参与自进化 | 33轮 / Artificial Analysis 40→45 | 中国证券报 |
| 未来模型参数规模 | 5万亿~10万亿(Qwen4.5/Qwen5) | 时代周报、北京商报 |
| Qwen3.8-Max商业表现 | 真实用户收入8.5倍 / Token涨12倍 | 北京商报 |
| 智谱Infra Agent吞吐 | 10万国产卡 / 两周3倍 / Ox-Alpha 62万亿Token | 科创板日报、IT之家 |
| 弹性启动时间 | 1200s → 70s / 1分钟1万Pods / 首Token降38% | 钱江晚报 |
| Prompt Caching / 优速模式 | 省95% / TPS提升1.5~2倍 / Harness省40% | 钱江晚报、DOIT |
| Agent Studio原子API | 50+ / One Key MCP连100+服务 | 钱江晚报 |
| 真武V900 | 性能3倍 / 50万卡集群 / 2027Q1量产 | 时代周报、杭州日报 |
| Meta Muse | 13天260万下载 / 登顶美区App Store | Sensor Tower/北京商报 |
本文数据综合云栖大会官方发布与多家媒体(中国证券报、北京商报、时代周报、钱江晚报、界面新闻、36氪等)交叉核实,技术细节以阿里、智谱官方披露为准。