阶跃星辰 Step 5 Preview:600B稀疏MoE旗舰杀入AA指数全球开源前三,单任务成本仅Claude Opus 5的1/8

引言:一颗"又强又划算"的旗舰,把门槛重新抬起来了

2026年9月20日,上海徐汇的AI创业公司阶跃星辰放出了一枚攒了很久的重型武器——新一代旗舰基座模型 Step 5 Preview来源:IT之家。它不是一次例行小步快跑,而是这家正在紧锣密鼓筹备赴港IPO的国产大模型公司,对整个行业的一次坐标重排:总参数6000亿(600B)、激活参数仅270亿(27B)的稀疏MoE旗舰,在全球权威榜单 Artificial Analysis Intelligence Index(AA综合智能指数)上拿到44分,跻身全球开源模型前三;更炸裂的数字是,它的单任务成本只有Anthropic Claude Opus 5的八分之一来源:澎湃新闻

当下AI编程工具(Copilot、Codex、TRAE等)正成为大模型商业化最热的赛道之一,模型在"真实世界Agentic任务"上的表现,已经取代"背题考高分"成为行业评测的核心标尺。AA指数在9月初刚升级到v4.2——淘汰了太简单的GPQA Diamond、新加入两项评测、把私有测试集权重翻倍到40%——靠记忆刷榜的时代已经过去,模型必须在从未见过的任务上展现真正的推理与执行能力“AA智能指数v4.0构成”

Step 5 Preview就是在这样一个"拼真实干活能力"的窗口期杀进来的。本文将从600B稀疏MoE架构、单任务成本的经济学、AA指数评测方法论、编程与金融两大垂直场景、开源vs闭源成本竞争等维度,深度拆解这枚国产开源旗舰的技术与商业逻辑。

先看能力全景:

图1:Step 5 Preview 能力矩阵
┌─────────────────────────────────────────────────────────────┐
│              Step 5 Preview(600B总参/27B激活)                │
├─────────────┬───────────────────────────────────────────────┤
│  架构        │  稀疏MoE,总参600B,激活仅27B(约4.5%激活比例)  │
│  上下文      │  100万 Token(1M)超长窗口                      │
│  模态        │  原生文本 + 视觉(图片理解)输入                  │
├─────────────┼───────────────────────────────────────────────┤
│  AA智能指数  │  44 分,全球开源模型前三                         │
│  单任务成本  │  约为 Claude Opus 5 的 1/8                      │
│  输入/输出价 │  $1 / $2.7 每百万Token                          │
│  单AA任务成本│  ≈ $0.71                                       │
├─────────────┼───────────────────────────────────────────────┤
│  软件工程    │  DeepSWE v1.1 得67.7,领先开源,仅次于两大闭源旗舰│
│  金融        │  FrontierFinance 得66.4,全球第二               │
├─────────────┼───────────────────────────────────────────────┤
│  开源计划    │  2026-10-15 释放完整权重                         │
│  定位场景    │  AI编程 / 软件工程 / 专业知识工作 / 金融          │
└─────────────┴───────────────────────────────────────────────┘

一、600B稀疏MoE:一支"专家团队",每次只召见4.5%

Step 5 Preview采用的是稀疏混合专家(Mixture-of-Experts,MoE)架构。MoE的技术思想在今天已经成为大模型的主流叙事:把一座"万能大脑"拆解成一排各有所长的"小专家",每次处理一个词元时,只需要路由(Router)挑出其中一小部分专家来干活,而不是让所有参数全量参与计算来源:上观新闻

官方给出的数据是:总参数600B,实际激活参数仅27B,激活比例约4.5%。这意味着在模型内部,每一次推理只"唤醒"那27B被路由选中的参数进行计算,其余570多亿参数作为"知识储备"躺着不动。这种设计同时吞下两种红利:海量的参数容量(知识覆盖面接近万亿级模型)与克制的单次算力开销(推理代价接近一个小几十亿参数的稠密模型)。

图2:稀疏MoE架构示意
(以下为基于公开信息的技术示意,具体专家数量、层分配等内部细节
   未公开,图中为业界通用结构的还原,非阶跃官方图)
┌──────────────────────────────────────────────────────┐
│                   输入 Token(文本/图像)               │
└────────────────────────┬─────────────────────────────┘
                         ▼
┌──────────────────────────────────────────────────────┐
│            Router / Gating(路由门控)                 │
│   Block-wise Token Merging:合并高重叠Token的Top-k结果  │
│   —— 将Indexer与Top-k Selection成本降低约8×            │
└──────┬──────────────┬──────────────┬─────────────────┘
       ▼              ▼              ▼
  ┌─────────┐    ┌─────────┐    ┌─────────┐
  │Expert 1 │    │Expert 2 │    │Expert 3 │   ... ≈27B激活
  │(代码)   │    │(金融)   │    │(推理)   │       仅约4.5%
  └────┬────┘    └────┬────┘    └────┬────┘
       └───────┬──────┴──────┬───────┘
               ▼
┌──────────────────────────────────────────────────────┐
│             加权融合 → 下一层(92层窄而深Transformer)    │
└──────────────────────────────────────────────────────┘

关于MoE路由的细节,阶跃官方只确认了"稀疏MoE、激活27B"这一事实,并未披露具体的专家数量、每层专家个数与共享专家配置。不过,结合行业惯例与公开的技术描述,我们可以做审慎的技术解读:

  • “窄而深"的深度增加:据新智元报道,Step 5 Preview 采用"窄而深"架构,直接将Transformer深度增加到92层,为长Prefill阶段的信息传播提供更长的路径来源:新智元。更深网络对超长上下文(1M Token)中的"远距离信息流动"更友好——当上下文长达整个代码仓库或整间数据室时,层与层之间的信息传递路径越长,长程依赖被建模得越充分。不过,这些属于媒体转述的技术细节,层数等具体数字建议以官方技术报告为准。

  • 稀疏不只是算法,更是系统工程:算法上的稀疏并不天然等于系统上的更快。稀疏计算对GPU的索引机制和数据搬运模式提出了截然不同的要求——如果实现不当,理论上的算力节省会被碎片化的内存访问和低效的注意力计算吃掉大半。阶跃通过 Block-wise Token Merging,在没有大幅损失信息的前提下合并相邻Token高度重叠的Top-k选择结果,改善碎片化计算带来的GPU利用率问题,据称将Indexer与Top-k Selection的成本降低了约8×。这一步打通了"从算法稀疏到系统效率"的最后一公里,也是标签里"单任务成本1/8"能成为现实的工程保障。

**MoE的参数量与激活量,到底在算一笔什么账?**理解了这一点,才能真正看懂"600B但很便宜"这句话。我们用一个成本模型来量化——这是本文的第一段核心代码:

TASKS = {
    "step5":   (1.0,  2.7),
    "claude5": (8.0,  24.0),
    "deepseek":(0.35, 1.0),
}
def cost(in_p, out_p, in_t=82000, out_t=95000):
    return in_t/1e6*in_p + out_t/1e6*out_p
c = {n: cost(*p) for n, p in TASKS.items()}
for n in c: print(f"{n:>9}: ${c[n]:.2f}/task")
print(f"Step5 = 1/{c['claude5']/c['step5']:.1f} of Claude5")

这段估算器把"单任务成本"还原成最朴素的公式:成本 = 输入Token×输入单价 + 输出Token×输出单价,再除以任务数。同样是生成一份中等复杂度的编程/研究报告,如果两边消耗的Token量大致相当,那么成本差就完全由单价决定——而单价越高、输出速度越受推理算力拖累的任务,单次完成的账就越难做。

说到激活4.5%的稀疏路由,我们还可以用一个简化模拟来看"Top-k专家调度"是怎么工作的。理解这一点,才能看懂为什么"专家再多也不贵”:

import numpy as np
EXPERT = {0:"coding", 1:"finance", 2:"reasoning", 3:"vision"}
gating = np.array([0.1, 3.2, 1.5, 0.4])      # 门控得分(示意)
probs  = np.exp(gating - gating.max())
probs /= probs.sum()                          # softmax → 归一化概率
top2   = np.argsort(probs)[::-1][:2]          # 模拟 Top-k 选择(这里k=2)
active = {EXPERT[t]: round(float(probs[t]),3) for t in top2}
print("activated experts:", active)
total_params, active_params = 600, 27          # 单位:10亿
print(f"激活比例 = {active_params/total_params*100:.1f}%")
print(f"一次Forward仅调用 {len(active)} 个专家")

这段模拟用softmax归一化的门控得分挑出Top-k专家(示意k=2),形象地还原了稀疏MoE"每次只唤醒少数专家"的机理。600/27的组合,就是"总知识空间大、单次算力开销小"的直接来源。

二、单任务成本1/8:帕累托前沿的一次外推

“单任务成本仅为Claude Opus 5的1/8”——这个数字是Step 5 Preview最锋利的营销棱角,但也恰恰是最需要理性审视的部分。要理解这个1/8,关键是区分单价(unit price)单任务成本(cost-per-task) 两个概念。

从AA口径的数据看:Step 5 Preview每完成一项智能指数任务的成本约为 0.71美元,输入/输出价格分别为每百万词元1美元和2.7美元,输出速度约每秒100个词元来源:上观新闻。而Claude Opus 5作为市面上"最贵梯队"的闭源旗舰,其API定价远高于此。官方测算,在智能水平相当的前提下,单任务成本约为前者的1/8。

但要泼一盆冷水:这个"1/8"的参照对象是目前全球API定价最贵的模型之一。当我们把坐标拉平,用同一套AA口径去对比参数体量相近的国产开源模型,会发现Step 5 Preview并没有触及行业的成本地板。以DeepSeek最新模型 V4.1 Flash 为例,在AA测算口径下,它完成一项标准智能任务的加权平均成本约为 0.27美元,而Step 5 Preview是0.71美元来源:每日经济新闻

这就引出了一个值得玩味的问题:如果只看绝对单价,Step 5 Preview并没有赢在"地板价",那它凭什么声称"成本优势"?

答案在于,阶跃星辰想打的牌从来不是"价格战",而是"帕累托前沿"(Pareto Frontier)。在行业内,人们用"帕累托前沿"来描述能力-成本之间的最优平衡曲线:曲线上每一个点,都代表"在这个成本下当前能做到的最强智能"。前沿向外推,意味着同样的成本能买到更强的智能,同样的智能只需要更低的成本。Step 5 Preview的定位是把这条前沿线往里/往外同时搬动——用0.71美元做到44分的AA智能指数,在"这个分数段"里它确实足够便宜;而DeepSeek V4.1 Flash用0.27美元做到相近的分数,则是把前沿的"成本端"压得更低。两者其实各自推进了曲线的不同段落。

我们用一段多任务成本对比模拟,直观展示"单任务成本"在真实Agent工作流里如何累积差距:

BATCH=[("bug",15000,4200),("feat",60000,48000),("ref",90000,61000),("env",45000,28000)]
MODELS={"step5":(1.0,2.7),"claude5":(8.0,24.0),"deepseek":(0.35,1.0)}
def batch(m):
    ip,op = MODELS[m]
    return sum(i/1e6*ip + o/1e6*op for _,i,o in BATCH)
c = {m: batch(m) for m in MODELS}
for m in c: print(f"{m:>9}: ${c[m]:.2f}/batch")
print(f"Step5 = 1/{c['claude5']/c['step5']:.1f} of Claude5")
print(f"Step5 = {c['step5']/c['deepseek']:.1f}× DeepSeek")

这段模拟揭示了一个被很多人忽略的事实:单任务成本的优势会通过"任务时长与迭代次数"被指数级放大。一个编程Agent不是只跑一次,而是要经历"读仓库→写代码→跑测试→看报错→改代码→再跑"的循环,常常往复十几乃至几十次。每次循环都是独立的成本累加。因此,“单次便宜1/8"在长任务Agent里,最终整批任务的成本差距可能被放大到一个数量级。

要理解"帕累托前沿"并判断谁在它的边界上,我们可以用**支配关系(domination)**来判定:某个模型不被任何"更强且更便宜"的对手支配时,它就在前沿上:

MODELS = {"step5":(44,0.71),"kimi_k3":(44,2.1),"deepseek_v41":(42,0.27),
          "claude5":(52,5.6),"gpt6_astra":(52.8,4.8)}
def dominates(a, b):                    # a是否支配b(更强或更便宜且不全劣)
    ia,ca = a; ib,cb = b
    return (ia>=ib and ca<=cb) and (ia>ib or ca<cb)
for n, p in MODELS.items():
    beat = [m for m,q in MODELS.items() if m!=n and dominates(q,p)]
    tag = "在前沿上" if not beat else f"被 {','.join(beat)} 支配"
    print(f"{n:>13} ({p[0]}分, ${p[1]}): {tag}")

**帕累托前沿不是一个点,而是一组"没人能在所有维度上都赢过它"的点的集合。**Step 5 Preview用44分/0.71美元站在前沿的"性价比段”;而DeepSeek用42分/0.27美元把它"成本端"压得更低;GPT-6 Astra则以52.8分/4.8美元站在"智能顶点段"。它们互不支配,共同勾勒出2026年9月这条能力-成本边界的真实形态。

图3:成本对比(Step 5 vs Claude Opus 5 vs 竞品,AA口径示意)
每完成一项AA智能任务成本(含输入+输出Token)
$0.71 ─── Step 5 Preview ─── 44分
$0.27 ─── DeepSeek V4.1 Flash ─── 相近分数
$5.6  ─── Claude Opus 5(≈Step5的8倍)┘
        │
  ──────┴───────────────────────────────► 成本越高

三、AA综合智能指数:从"考高分"到"真干活"的评测转向

要理解Step 5 Preview这个44分的含金量,必须先看它考的是哪张卷子。Artificial Analysis Intelligence Index(AA智能指数)是全球最被认可的综合评测之一,它不像单一benchmark那样测一道题,而是把AI能力拆成可落地的多个维度,用统一标准化硬件独立运行,产出可复现的综合分数“AA智能指数v4.0构成”

图4:AA智能指数评测维度(v4.x)
┌─────────────────────────────────────────────────────────┐
│           Artificial Analysis Intelligence Index          │
├─────────────────────────────────────────────────────────┤
│  智能体真实任务   GDPval-AA                                │
│  工具调用         τ²-Bench                                │
│  智能体编程       Terminal-Bench                          │
│  编程能力         SciCode                                 │
│  长上下文推理     AA-LCR                                  │
│  知识与幻觉检测   AA-Omniscience                          │
│  指令遵循         IFBench                                 │
│  推理与知识       Humanity's Last Exam                   │
│  物理推理         CritPt                                  │
│  (v4.2 起:新增两项评测;GPQA Diamond 因过易被淘汰;      │
│    私有测试集权重翻倍至40%)                              │
└─────────────────────────────────────────────────────────┘

对评测方法论的敏感性,是读这个榜单的核心。9月初AA指数刚刚升级到v4.2:两项新评测加入、GPQA Diamond被淘汰(因为太容易了)、权重最大的私有测试集占比直接翻倍到40%来源:新智元。这个变化的潜台词非常直白——靠背题刷分的时代结束了。权重40%的私有测试集意味着,模型必须在一个它从未见过的、由AA内部构造的任务集上,凭真实的泛化推理能力而非训练记忆来得分。谁的训练集里混进了对应的评测题,谁就会因为过拟合而被这一变化狠狠惩罚。

正是冲击这个"更卷的卷子",Step 5 Preview拿下了44分。放在全球坐标系里对照:Claude Fable 5.1以53分领跑,GPT-6 Astra紧追其后(52.8),而Step 5 Preview的44分,与当月引发广泛关注的2.8万亿参数模型Kimi K3(44分)、智谱GLM-5.3、千问Qwen3.8 Max(45分)处在同一战斗群——用不到Kimi K3五分之一的体量,拿到相同分数,这正是它"效率叙事"最有力的注脚来源:每日经济新闻

评测的价值在于它指出了能力边界,但也有限度——benchmark只是入场券,能否真正交付才是成绩单。我们用一段Python脚本,演示如何在自己的工程环境里复现一个AA式的评测流程(跑benchmark、归一化、加权求和):

import json, subprocess, argparse
B = {"sci":("swe.jsonl",.15), "tau":("tau.jsonl",.15), "term":("term.jsonl",.15),
     "hle":("hle.jsonl",.15), "lcr":("lcr.jsonl",.10), "omni":("omn.jsonl",.10),
     "ifb":("ifb.jsonl",.10),  "crit":("crit.jsonl",.10)}
def run(ds, ep):
    cases=[json.loads(l) for l in open(ds)]
    n=0
    for cs in cases:
        out=subprocess.run(["curl","-s",ep,"-d",json.dumps({"prompt":cs["prompt"]})],
                           capture_output=True,text=True).stdout
        if cs["answer"].strip() in out: n+=1
    return n/len(cases)
def index(ep, verbose=False):
    w=0.0
    for name,(ds,wt) in B.items():
        acc=run(ds,ep); w+=acc*wt
        if verbose: print(f"  {name:>5}: acc={acc:.3f} w={wt}")
    return w
if __name__=="__main__":
    ap=argparse.ArgumentParser()
    ap.add_argument("--ep",default="http://api.stepfun/v1/step5")
    ap.add_argument("--verbose",action="store_true")
    a=ap.parse_args()
    print(f"AA式综合指数 ≈ {index(a.ep,a.verbose)*100:.1f}")

这段脚本把"评测"从模糊的营销话语变成可重复的工程动作:每个benchmark在统一数据上跑、算准确率、按预设权重加权、支持CLI参数化。它也是国内大量开源模型团队衡量自己"离旗舰还差多远"的标准工作流。

四、编程主场:StepCodeBench与"3小时自主改硬件"

如果说AA指数是综合座次,那么软件工程才是Step 5 Preview真正想赢的主战场——AI编程是当前大模型商业化最成熟、也最拥挤的红海。IDC数据显示,2025年中国AI编程市场规模约3.99亿元,预计2026年底将飙升至11.73亿元来源:每日经济新闻。Copilot、Codex、TRAE等工具已经教育了市场,而模型底层的"代码智商",决定了这些工具的上限。

Step 5 Preview在软件工程评测上的数据十分能打:DeepSWE v1.1得分67.7,领先月之暗面Kimi K3、智谱GLM-5.3等开源模型,仅次于GPT-6 Astra和Claude Opus 5两款闭源旗舰来源:IT之家。要注意,这是在"长程规划任务"(long-horizon planning)下取得的——不是解一道LeetCode,而是像真实工程师一样,接手一个项目、读懂已有代码、规划改动方案、逐步落地并验证。

阶跃为此专门构建了 StepCodeBench:覆盖553个独立代码仓库、9类任务、20个应用领域、33种编程语言,包括Bug修复、功能开发、代码重构、环境配置等真实开发任务。在内外部专家评估中,约七成参与者认为,新版旗舰模型能自主解决中高复杂度的编程任务来源:上观新闻

如何在一个大规模代码仓的基准上规范地跑分?下面这段驱动脚本演示了"克隆仓库→施加扰动→跑测试→判定通过"的StepCodeBench式流程:

import subprocess, tempfile, shutil, argparse
def run_stepcode(repo_url, task, model_ep):
    dir_=tempfile.mkdtemp()
    subprocess.run(["git","clone","--depth","1",repo_url,dir_],
                   check=True,capture_output=True)
    tests = load_tests(dir_)               # 读取该任务关联的测试用例
    patch = gen_patch(task, model_ep)      # 让模型生成修复/功能代码patch
    if patch: subprocess.run(["git","-C",dir_,"apply","-"], input=patch,
                             capture_output=True,text=True)
    p = subprocess.run(["pytest","-q",*tests], cwd=dir_, capture_output=True)
    shutil.rmtree(dir_, ignore_errors=True)
    return "PASS" if p.returncode==0 else "FAIL"
def gen_patch(task, ep):  # 简化:调用模型API拿到diff
    return None
def load_tests(path):     # 简化:定位测试文件列表
    import glob; return glob.glob(path+"/tests/test_*.py")[:8]
for repo in ["https://github.com/x/repo1","https://github.com/x/repo2"]:
    print(repo, run_stepcode(repo,"bug_fix","http://api.stepfun/v1/step5"))

真实有大模型参与"真实仓库"的自动化评测(如SWE-bench Verified、τ²-Bench),本质上都是这个循环:给仓库、给任务、跑测试,数通过率。长上下文价值就藏在"读完整仓库再改一处"这类需要全局理解的操作里。

最能说明"真干活"能力的,是那个被媒体反复引用的实验:阶跃让Step 5 Preview仅凭自然语言需求,自主阅读ESP32设备及相关API的大量开发文档,把一块ESP32-S3开发板改造成支持蓝牙按键与语音输入的Vibe Coding键盘。它不仅能写代码,还能访问串口、获取截图、调用摄像头、模拟鼠标操作,根据真实设备返回的状态和报错持续修改、运行、调试代码,连续自主执行超过3小时来源:IT之家。这不是在沙箱里背题库,而是在真实物理硬件上当一个"远程工程师"。

为什么长上下文对编程Agent如此关键?因为真实开发不是单轮问答,而是一个闭环工作流

图5:编程Agent闭环工作流(Step 5 Preview 定位场景)
┌────────┐   ┌────────────┐   ┌─────────────┐   ┌─────────┐
│ 读仓库   │──►│ 规划/拆解   │──►│ 写代码/重构  │──►│ 运行测试 │
│(1M上下文)│   │ (长程规划)  │   │ 多语言/工具  │   │ CLI调用  │
└────────┘   └────────────┘   └─────────────┘   └────┬────┘
                                                    │ 报错/失败
      ┌─────────┐   ┌────────────┐   ┌──────────┐   │ 回滚重试
      │ 交付验证 │◄──│ 硬设备联调  │◄──│ 环境配置  │◄──┘
      │ (截图/串口)│  │ (真实物理) │   │ (沙箱/容器)│
      └─────────┘   └────────────┘   └──────────┘

在这种循环里,模型必须能在"持续读入新信息(报错、日志、文档)→ 修改计划 → 再执行"的过程中,不丢失对全局上下文的理解。1M的上下文窗口,就是为了让整条任务链的状态始终留在"眼前",而不是像早期Agent那样频繁遗忘前置步骤。

在长程编程Agent中,对"自省"与"纠错"的要求极高。据新智元披露,Step 5 Preview在数据生产和训练体系中引入了Anti-hacking检查,避免模型利用任务或评测漏洞"看起来成功"却没有真正解决问题来源:新智元。这解释了为什么在私有测试集权重高达40%的v4.2榜单上,它依然能顶住——因为它训练的目标不是"背题"而是"解题"。

五、金融战场:从"答对"到"产出一份可用报告"

阶跃把金融列为Step 5 Preview的重点验证场景,这不是随手一拍。金融连接宏观经济、政策监管、行业周期与公司经营,既要求财报分析、估值建模等硬核专业知识,又考验跨行业理解、证据核验和复杂问题拆解能力——它是大模型在"超长任务链、超长上下文和工具调用"方面的缩影。「能答对一道金融题」和「能产出一份逻辑闭环、证据可追溯的公司研究报告」之间,隔着巨大的能力鸿沟。

外部基准 FrontierFinance 包含220道专业金融问题、11543项评估标准,覆盖六类投资应用场景。Step 5 Preview得分 66.4,领先GPT-6 Astra及其他参评开源模型,位列全球第二来源:上观新闻

更值得注意的是内部评测。围绕"公司研究"这条高难度金融工作流,阶跃自建了三项内部评测(FinStepBench),分别考察模型检索核验实时金融信息把数据和假设转化为可复现的估值、以及产出完整研究报告的能力。在这四项金融基准上,Step 5 Preview均取得开源模型中的领先成绩。

为什么金融场景最能暴露大模型的成色? 因为金融研究员的工作本质上是一个"多级证据链":拿到一个数据点不能直接信,要溯源、要交叉验证、要看时效、要判断口径。据新智元的实测,Step 5 Preview在"金融事实核验"上采用了七级优先级(审计报告 > 公司更正声明 > 一手核实 > 官方新闻稿 > BP > 数据平台 > 匿名帖),外加"口径优先于数值"“时点对齐"等辅助规则;在一项检核中,七个事实项全部答对,35处引用精确到文件和行号来源:新智元。这种"规则与直觉打架时站规则"的能力,是长上下文+强推理+诚实对齐共同作用的产物。

我们用一个金融场景的SDK调用示例,展示如何把Step 5 Preview封装成一个多轮的投研Agent(抽取→核验→估值→报告,带状态跟踪):

import requests, json
class ResearchAgent:
    EP="https://api.stepfun.ai/v1/research"
    def __init__(self, doc): self.doc=doc; self.steps=[]
    def _call(self, prompt, mx=800):
        r=requests.post(self.EP,json={"model":"step-5-preview",
            "messages":[{"role":"user","content":prompt}],"max_tokens":mx})
        return r.json()["choices"][0]["message"]["content"]
    def extract(self):
        p=("Extract {revenue,gross_margin,net_income,rd_expense}; "
           "mark [unverified] if not audited. JSON only.\n"+self.doc[:6000])
        self.steps.append("extract"); return json.loads(self._call(p))
    def verify(self, claim, srcs):
        p=("Verify claim using sources ranked: audit>press>platform>anon.\n"
           f"claim:{claim}\nsources:{json.dumps(srcs,ensure_ascii=False)}")
        self.steps.append("verify");  return self._call(p)
    def report(self, outline):
        p=("Produce a complete research report following this outline "
           "with citations to file+line.\n"+outline)
        self.steps.append("report");  return self._call(p, mx=2000)

ag=ResearchAgent(open("r.txt").read())
print("metrics:", ag.extract())
print("trail:", ag.steps)

这段代码把"投研Agent"变成一个带步骤轨迹(extract→verify→report)的对象:既能从财报文本抽取结构化指标、对关键断言做多信源核验,又能在最后产出一份带溯源的完整报告。前文反复强调的1M上下文、长任务闭环、工具调用,在这里变成了真实的工程价值。

六、从Flash到旗舰:三代"效率优先"的技术脉络

Step 5 Preview不是阶跃在效率这条赛道上的临时起意,而是一条已经走了三代的主线。把三代基座模型连起来看,能清晰看到一家公司"刻意压规模、死磕效率"的工程哲学:

模型总参激活上下文定位
Step 3.5 Flash196B11B256KAgent大脑
Step 3.7 Flash198B~11B256K+原生视觉
Step 5 Preview600B27B1M旗舰主力

一个容易被忽略的细节是:Step 3.5 Flash与Step 3.7 Flash两代总参几乎原地踏步(196B→198B),激活都是11B——这是阶跃刻意压住规模、在同一体量下死磕效率打磨的体现。据快思慢想研究院院长田丰的解读,这一步步验证、再扩容的节奏,体现出比"越做越大"更谨慎的工程自我约束来源:每日经济新闻

这也踩中了一个行业级的趋势拐点。Anthropic CEO Dario Amodei曾提出过判断:Scaling law本身没有失效,但"把算力转化为智能"的转化效率,正在成为新的竞争维度。当晶体管数量堆叠的边际效益递减时,摩尔定律的历史转折是竞争焦点从"数量"转向"每瓦性能”——大模型正在重演同样的剧本。从"用更多计算换更强智能",转向"用更高效率的计算换更强智能",是Step 5 Preview在技术路线上的战略押注来源:媒体转述

在训练体系上,Step 5 Preview也做了面向Agent的调整。据新智元披露:它的数据生产体系中,Agent不只负责生成样本,还参与知识探索、任务设计、难度与多样性控制以及整个流程的动态编排;训练从训推一致性、训练效率和长轨迹学习三个方面优化;算法侧进一步引入Context Compaction和更细粒度的奖励分配,让Agent能在有限上下文中持续推进更长任务来源:新智元。这套"Agent造数据→反哺Agent"的闭环,是它能在长程Agent任务上保持稳定性的内因。

七、国产编程大模型竞争格局:群雄并起,各占一词

把镜头拉远,Step 5 Preview只是2026年9月这场"周周洗牌"的国产大模型混战中的一个注脚。把当下头部玩家放在一张图上:

图6:国产编程大模型竞争格局(2026-09 概览)
┌─────────────────────────────────────────────────────────────┐
│  模型              │ 体量       │ 开源 │ 主打标签              │
├────────────────────┼────────────┼──────┼──────────────────────┤
│  Step 5 Preview    │ 600B/27B   │ 开源 │ 稀缺MoE效率、编程+金融 │
│  Kimi K3           │ 2.8T (约)  │ 开源 │ 超大规规模、Agent能力   │
│  Qwen3.8 Max       │ 未披露     │ 开源 │ 通用旗舰、生态丰富     │
│  GLM-5.3           │ 未披露     │ 开源 │ 编程+Agent、平衡       │
│  DeepSeek V4.1Flash│ 稀疏MoE    │ 开源 │ 极致性价比、成本地板   │
│  GPT-6 Astra       │ 闭源旗舰    │ 闭源 │ 综合能力最强之一       │
│  Claude Opus 5     │ 闭源旗舰    │ 闭源 │ agent+编程、最贵标杆   │
└─────────────────────────────────────────────────────────────┘

这张图揭示了几条关键的分化逻辑:

  1. 开源正在吃掉闭源的"性价比心智"。AA榜单前列绝大多数是闭源模型,但Kimi K3以开源权重身份杀入全球前五已被视为里程碑,Step 5 Preview是又一个挤进核心竞争区的开源选手——中国开源模型的能力天花板,仍在加速上移来源:新智元

  2. 竞争逻辑正在从"拼价格"走向"拼生态"。9月中旬的行业新闻反复强调:国产大模型竞争的核心逻辑,已经从价格战转向生态战。单点红旗的"低价"壁垒既容易被更大玩家用补贴战覆盖,也容易被全行业推理成本每12-18个月一次的普遍下探自然填平。Step 5 Preview把"成本优势"表述为"效率是方法、成本是结果",本质是在为生态竞争积累工程方法论来源:每日经济新闻

  3. 垂直金融成为差异化蓝海。编程是红海,金融是"蓝海"。当所有旗舰都在卷代码,谁能同时在"长期规划+金融专业知识+证据核验"上站稳,谁就多一条开发者必选的理由。Step 5 Preview在金融上全球第二的排位,是一种明显的差异化卡位。

需要清醒的是,国产大模型的密集更新正在稀释"分数领先"的含金量。正如田丰所言:值钱的不再是某一次登榜,而是能不能在成本曲线和智能曲线之间,持续跑出比对手更陡的斜率来源:每日经济新闻

八、开源时间线与生态落地:10月15日的"期末考试"

Step 5 Preview目前已经全量开放第三方接口,官方宣布将于 2026年10月15日正式开源完整权重来源:澎湃新闻。这意味着,在那之前,开发者只能通过API体验它的上限;而真正决定它能否"重回全球第一梯队"的,是开源后那场"实测检验"——任何人拿到权重后,都可以用自建评测、私有数据、真实场景去验证那个44分是否名副其实。

图7:开源时间线
2026-09-20   发布Step 5 Preview,开放第三方API
   │            AA指数44分 / 全球开源前三
   │            同阶段:StepAudio 3 语音五连发
   ▼
2026-09-20~10-15  开发者API试用期(长程Agent / 金融 / 编程实测)
   ▼
2026-10-15   释放完整权重(正式开源)
   ▼
开源后       社区自建评测 / 私有部署 / 生态工具链接入

阶跃的"模型+终端"策略也在为这次开源蓄力。据公开信息,阶跃模型手机装机量已超过 4200万台,日均服务近 2000万人次,合作覆盖国内超过半数头部手机品牌;在汽车端,与吉利的合作已深入到整车智能体层面(超级Eva)来源:新智元。4200万台装机量意味着,阶跃的模型在真实噪声、复杂环境、低算力、低延迟、高并发条件下持续经受检验——这些来自真实世界的反馈,又反过来反哺旗舰模型的训练与对齐。开源Step 5 Preview,相当于向全行业开放这套"效率工程"的底座能力。

图8:金融场景部署拓扑(Step 5 Preview 私有化场景示意)
┌──────────────────────────────────────────────────────────┐
│       金融机构 / 研发团队(私有化 / 半托管)                 │
│                                                            │
│  ┌────────┐    ┌───────────────┐    ┌──────────────────┐  │
│  │ 合规风控 │──►│ Step5 推理集群 │◄───│  本地知识库/RAG   │  │
│  │ (鉴权/审计) │  │ (MoE稀疏/27B) │    │ (研报/财报/监管文本)│  │
│  └────────┘    └──────┬────────┘    └──────────────────┘  │
│                       │                                    │
│                 ┌─────▼─────────────────────────────┐      │
│                 │  投研Agent工作流                    │      │
│                 │  财报抽取→事实核验→估值建模→报告生成  │      │
│                 └───────────────────────────────────┘      │
└──────────────────────────────────────────────────────────┘

结语:44分是入场券,“1/8"才是照妖镜

回到开头的判断:Step 5 Preview是一场"达标交卷”,但离真正的代际跃迁还有距离。

44分的AA智能指数、全球开源前三的座次、单任务成本1/8的营销棱角——这些都是真实的成就,值得被记录。但如果把"1/8"当成一张免检通行证,就容易忽视两个残酷的事实:其一,这个参照系是"全球最贵的闭源模型",当坐标换到DeepSeek,它并没有触及成本地板;其二,软件工程的DeepSWE、金融的FrontierFinance上都"仅次于闭源旗舰",意味着它暂时还没有在任何一张决定性的卷子上超越闭源顶点。

然而,Step 5 Preview真正值得行业重视的,不是某一个分数,而是它把"效率"从营销词变成了可验证的工程方法论——从稀疏MoE的4.5%激活,到Block-wise Token Merging的8×降本,再到三代连续"以小博大"的克制节奏。当全行业走向"能力×效率"的综合竞争时,这种"每瓦智能"的积累,才是下一轮洗牌里最深的护城河。10月15日的开源,正是这场期末考试的开考铃声。