OpenAI Bel模型:10万亿参数AGI基座深度解析
一、引言:Bel曝光——AI圈的"曼哈顿计划"时刻
2026年8月25日,一个名为@synthwavedd的X用户投下了一枚重磅炸弹:OpenAI刚刚完成了代号"Bel"的新一轮大规模预训练,总参数突破10万亿。消息一出,整个AI圈为之震动——这是自2024年5月GPT-4o发布以来,OpenAI首次完成真正意义上的前沿基座模型预训练。
据新智元、36氪、IT之家等多家媒体报道,Bel被定位为"Doug"的后继者,而Doug经过强化学习后将成为Astra(即外界猜测的GPT-6)的基座模型。Bel则面向更远的未来——后GPT-6时代,甚至可能成为某个达到AGI门槛的系统的底座。
更令人关注的是,Sam Altman在8月24日接受TIME采访时明确表示:“年底前,OpenAI内部将出现一个我愿意称之为AGI的系统。”(来源:TIME《Inside OpenAI’s Reboot》)。首席研究官Mark Chen更给出了一个具体数字:“我们已经走完了80%的路。”
本文将深入解析Bel模型背后的技术架构、预训练路线图、双速学习机制、递归自我改进(RSI)商业闭环,以及正在重塑整个AI产业格局的算力军备竞赛。
二、OpenAI内部预训练路线图:Spud → Doug → Bel
2.1 三代模型演进全景
根据多方爆料,OpenAI内部存在一条清晰的预训练路线图:
┌─────────────────────────────────────────────────────────────┐
│ OpenAI 预训练路线图(2024-2026) │
├──────────────┬──────────────┬──────────────┬───────────────┤
│ Spud │ Garlic │ Doug │ Bel │
│ (GPT-5.5) │ (实验性) │ (Astra/GPT-6)│ (>10T参数) │
├──────────────┼──────────────┼──────────────┼───────────────┤
│ 2024 H2 │ 2025 H1 │ 2025 H2- │ 2026 Q3 │
│ │ │ 2026 H1 │ 完成预训练 │
├──────────────┼──────────────┼──────────────┼───────────────┤
│ 7个GPT-5 │ 部分架构 │ Astra基座 │ Fable Killer │
│ 变体发布 │ 实验被弃用 │ 16智能体协同 │ 后GPT-6时代 │
└──────────────┴──────────────┴──────────────┴───────────────┘
Spud(GPT-5.5车系):2026年4月23日以GPT-5.5名义发布,随后演化出GPT-5.0到GPT-5.6共7个变体。Sol/Terra/Luna三级定价体系,其中Sol以RSI Index 0.579的分数登顶内部递归自我改进排行榜。
Garlic(实验性中断):介于Spud和Doug之间的实验性预训练,据传因架构问题被中断,但为Doug提供了关键教训。
Doug(Astra基座):经过强化学习后成为Astra的基座。Astra已在数学和理论计算机科学领域取得突破性进展——独立解决或实质性推进了10个长期未解的数学难题,包括自1999年以来悬而未决的sofic群构造问题(来源:OpenAI官方博客)。
Bel(10万亿参数巨兽):定位为"Fable Killer",旨在超越Anthropic的Claude Fable系列。据爆料人透露,OpenAI内部评估认为Anthropic因算力短缺,短期内无法拿出有效应对Astra的竞品。
2.2 参数量级演进对比
参数量级演进(总参数/激活参数)
GPT-3 175B ████████████
GPT-4 ~1.8T ████████████████████████████████████████
GPT-4o ~1.8T ████████████████████████████████████████
GPT-5.5(Spud)~3T ████████████████████████████████████████████████████
Doug(Astra) ~5T ████████████████████████████████████████████████████████████████
Bel >10T ████████████████████████████████████████████████████████████████████████████████████
██ 总参数 ░░ 激活参数(MoE架构下推测)
注:GPT-4.5总参数据推测与Bel接近,但Bel在MoE架构和训练数据规模上
有质的飞跃。GPT-4.5参数未被OpenAI官方确认,以上为行业估算。
三、10万亿参数的技术含义:Scaling Law真的复活了吗?
3.1 参数量不等于智能量
需要先泼一盆冷水:10万亿是总参数(Total Parameters),而非激活参数(Active Parameters)。在混合专家(MoE)架构下,每个token仅激活一小部分参数。Switch Transformer论文早已证明,稀疏激活可以将总参数推到万亿级别而推理成本可控。
Bel的10万亿参数对标的是GPT-4.5的量级——也就是说,OpenAI可能用MoE架构将总参数堆到了10万亿,但激活参数可能仍在千亿级别。
然而,这并不意味着Scaling Law失效。恰恰相反,SemiAnalysis一直坚持认为Scaling Law仍然有效——只是"仍然有效"和"仍然划算"是两个不同的问题(来源:traictory.com分析)。
3.2 真正的飞跃在哪里?
传统Scaling Law vs Bel时代的Scaling Law
┌─────────────────────────────────────────────────────────┐
│ 传统Scaling(GPT-3 → GPT-4) │
│ │
│ 数据量 ──────▶ 参数量 ──────▶ 性能提升 │
│ 线性增长 线性增长 对数增长 │
│ │
├─────────────────────────────────────────────────────────┤
│ Bel时代Scaling(GPT-5 → Bel) │
│ │
│ 数据质量 ──┐ │
│ 参数量 ──┤──▶ MoE架构 ──▶ 推理效率 ──▶ AGI逼近 │
│ 训练算力 ──┘ │ │
│ ▼ │
│ 递归自我改进(RSI) │
│ 芯片-模型协同优化 │
└─────────────────────────────────────────────────────────┘
Bel的真正意义不在参数数量本身,而在于:
- 训练数据的质量飞跃:Astra已能解决数学界数十年未解的难题,其训练数据中包含大量高质量的形式化数学证明(Lean 4验证)
- MoE架构的成熟度:GPT-4.5已经验证了超大MoE的可行性,Bel在此基础上做了架构层的深度优化
- 双速学习机制(下一节详述):让模型具备了"在工作过程中学习"的能力
四、双速学习机制深度解析
4.1 核心思想:让模型在运行时进化
传统LLM的痛点在于:训练完成后权重冻结,无法从新的交互中学习。微调和RLHF可以更新权重,但成本高、周期长,且可能破坏已有能力。
Bel(据推测)引入了一种全新的双速学习机制(Dual-Speed Learning):
双速学习架构总览
┌───────────────────────────────────────────────────────────────┐
│ 输入 Token 序列 │
│ │ │
│ ▼ │
│ ┌─────────────────────────────────────────────────────────┐ │
│ │ 混合专家层(MoE) │ │
│ │ ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐ │ │
│ │ │Expert│ │Expert│ │Expert│ │Expert│ │Expert│ │ │
│ │ │ 1 │ │ 2 │ │ 3 │ │ ... │ │ N │ │ │
│ │ └──────┘ └──────┘ └──────┘ └──────┘ └──────┘ │ │
│ └─────────────────────────────────────────────────────────┘ │
│ │ │
│ ▼ │
│ ┌─────────────────────────────────────────────────────────┐ │
│ │ 双速权重更新模块 │ │
│ │ │ │
│ │ ┌─────────────────────┐ ┌─────────────────────────┐ │ │
│ │ │ 快速权重层 (Fast) │ │ 慢速权重层 (Slow) │ │ │
│ │ │ │ │ │ │ │
│ │ │ • 会话级别更新 │ │ • 全局持久化权重 │ │ │
│ │ │ • 在线学习经验 │ │ • 固化验证有效的改进 │ │ │
│ │ │ • 低秩适配器(LoRA) │ │ • 完整梯度更新 │ │ │
│ │ │ • 即时生效 │ │ • 需要验证周期 │ │ │
│ │ │ • 易失性(可重置) │ │ • 持久性(跨会话) │ │ │
│ │ └─────────────────────┘ └─────────────────────────┘ │ │
│ └─────────────────────────────────────────────────────────┘ │
│ │ │
│ ▼ │
│ 输出 Token 序列 │
└───────────────────────────────────────────────────────────────┘
4.2 快速权重层(Fast Weight Layer)
快速权重层在推理过程中动态更新,类似于工作记忆(Working Memory)。每次对话、每个任务执行过程中,模型会:
- 观察当前任务的效果反馈
- 通过低秩适配器(LoRA-like)快速调整部分权重
- 将"经验教训"编码到快速权重中
- 在下一次推理中立即应用
4.3 慢速权重层(Slow Weight Layer)
慢速权重层是持久化知识库。当快速权重层积累的经验经过验证是有效的,就会被"固化"到慢速权重中:
- 跨会话统计验证
- 强化学习优化
- 完整权重更新
- 部署到所有实例
4.4 代码实现:双速学习模拟
以下是用Python实现的简化版双速学习机制:
"""
双速学习机制:简化模拟实现
Fast Weight: 在线学习,即时生效
Slow Weight: 持久化,需要验证周期
"""
import numpy as np
from dataclasses import dataclass, field
from typing import List, Callable, Optional
@dataclass
class DualSpeedConfig:
"""双速学习配置"""
d_model: int = 4096 # 模型维度
n_experts: int = 64 # 专家数量
fast_lr: float = 0.001 # 快速权重学习率
slow_lr: float = 1e-5 # 慢速权重学习率
validation_threshold: float = 0.85 # 固化阈值
fast_rank: int = 8 # LoRA秩
class FastWeightAdapter:
"""快速权重适配器 - 基于LoRA的在线学习"""
def __init__(self, d_model: int, rank: int = 8):
self.d_model = d_model
self.rank = rank
# LoRA A/B 矩阵
self.lora_a = np.random.randn(d_model, rank) * 0.01
self.lora_b = np.random.randn(rank, d_model) * 0.01
self.experience_buffer = []
def forward(self, x: np.ndarray) -> np.ndarray:
"""前向传播,应用快速权重修正"""
delta = x @ self.lora_a @ self.lora_b
return x + delta # 残差连接
def update(self, gradient: np.ndarray, lr: float = 0.001):
"""在线更新LoRA权重"""
# 简化的梯度更新
self.lora_b -= lr * (self.lora_a.T @ gradient)
self.lora_a -= lr * (gradient @ self.lora_b.T)
def record_experience(self, task_id: str, reward: float):
"""记录经验,供后续固化评估"""
self.experience_buffer.append({
'task_id': task_id,
'reward': reward,
'weights_snapshot': {
'lora_a': self.lora_a.copy(),
'lora_b': self.lora_b.copy(),
}
})
class SlowWeightConsolidator:
"""慢速权重固化器 - 将验证有效的快速经验固化到持久权重"""
def __init__(self, d_model: int, n_experts: int):
self.d_model = d_model
self.n_experts = n_experts
# 持久化权重(主网络参数)
self.main_weights = np.random.randn(d_model, d_model) * 0.01
self.validation_history = []
def validate_experience(self,
fast_adapter: FastWeightAdapter,
eval_fn: Callable) -> float:
"""验证快速权重的效果"""
# 备份原始权重
original_a = fast_adapter.lora_a.copy()
original_b = fast_adapter.lora_b.copy()
# 在验证集上评估
score = eval_fn(fast_adapter)
# 恢复原始权重
fast_adapter.lora_a = original_a
fast_adapter.lora_b = original_b
return score
def consolidate(self,
fast_adapter: FastWeightAdapter,
score: float,
threshold: float = 0.85):
"""将验证通过的快速权重固化到慢速权重"""
if score >= threshold:
# 计算快速权重的有效更新量
delta = fast_adapter.lora_a @ fast_adapter.lora_b
# 融合到持久权重中
self.main_weights += delta * 0.1 # 慢速融合系数
self.validation_history.append({
'score': score,
'consolidated': True
})
print(f"[SlowWeight] 经验已固化,验证分数: {score:.3f}")
else:
self.validation_history.append({
'score': score,
'consolidated': False
})
print(f"[SlowWeight] 经验未通过验证,分数: {score:.3f}")
class DualSpeedEngine:
"""双速学习引擎主类"""
def __init__(self, config: DualSpeedConfig):
self.config = config
self.fast_adapter = FastWeightAdapter(
config.d_model, config.fast_rank
)
self.slow_consolidator = SlowWeightConsolidator(
config.d_model, config.n_experts
)
self.slow_consolidation_cycle = 0
def inference(self, x: np.ndarray) -> np.ndarray:
"""推理时,叠加慢速权重基线和快速权重修正"""
# 慢速权重提供基线能力
base = x @ self.slow_consolidator.main_weights
# 快速权重提供在线学习修正
adapted = self.fast_adapter.forward(base)
return adapted
def learn_from_task(self,
task_id: str,
input_data: np.ndarray,
target: np.ndarray,
reward: float):
"""从单个任务中学习"""
# 1. 推理
output = self.inference(input_data)
# 2. 计算损失
loss = np.mean((output - target) ** 2)
# 3. 计算梯度(简化)
gradient = 2 * (output - target) / output.size
# 4. 更新快速权重
self.fast_adapter.update(gradient, self.config.fast_lr)
# 5. 记录经验
self.fast_adapter.record_experience(task_id, reward)
return loss
def consolidation_cycle(self, eval_fn: Callable):
"""定期执行固化循环"""
self.slow_consolidation_cycle += 1
print(f"\n=== 固化周期 #{self.slow_consolidation_cycle} ===")
# 验证快速权重的累积经验
score = self.slow_consolidator.validate_experience(
self.fast_adapter, eval_fn
)
# 根据验证结果决定是否固化
self.slow_consolidator.consolidate(
self.fast_adapter,
score,
self.config.validation_threshold
)
# 使用示例
if __name__ == "__main__":
config = DualSpeedConfig(
d_model=1024, # 简化维度
n_experts=8,
fast_lr=0.001,
slow_lr=1e-5,
validation_threshold=0.85,
fast_rank=4
)
engine = DualSpeedEngine(config)
# 模拟连续任务学习
for task_id in range(10):
x = np.random.randn(1, config.d_model)
y = np.random.randn(1, config.d_model)
reward = np.random.random()
loss = engine.learn_from_task(
f"task_{task_id}", x, y, reward
)
print(f"Task {task_id}: loss={loss:.4f}, reward={reward:.3f}")
# 每5个任务进行一次固化
if task_id > 0 and task_id % 5 == 0:
eval_fn = lambda fa: np.random.random() * 0.5 + 0.5
engine.consolidation_cycle(eval_fn)
4.5 双速学习的技术意义
这种设计解决了AI领域一个根本性问题:模型如何在部署后继续进化。传统方案要么冻结权重(失去学习能力),要么全量微调(成本高且有灾难性遗忘风险)。
双速学习的精妙之处在于:
- 快速权重提供"敏捷性"——在几轮对话内就能适应新任务
- 慢速权重提供"稳定性"——只有经过验证的知识才被固化
- 两者协同:快速权重是"探索",慢速权重是"利用"
这本质上是一种**元学习(Meta-Learning)**的工程实现,让模型在推理阶段也能进行某种形式的"训练"。
五、递归自我改进(RSI)商业闭环:Sol优化Luna,80%成本削减
5.1 RSI的四个层次
递归自我改进(Recursive Self-Improvement)是当前AI领域最炙手可热的话题。但我们需要先厘清概念——根据OpenAI的实践,RSI可以划分为四个层次:
RSI成熟度层级
L4: 完全自主递归
┌──────────────────────────────────────────────┐
│ AI自主选择研究方向 → 设计下一代模型 → │
│ 训练 → 评估 → 部署 → 开始下一轮 │
│ (尚未有实验室公开实现) │
└──────────────────────────────────────────────┘
▲
L3: AI辅助AI研究 │
┌──────────────────────────────────────────────┐
│ AI编写实验代码 → 运行实验 → 分析结果 → │
│ 人类选择方向 → AI继续迭代 │
│ ✅ Astra已实现"自动化AI研究实习生" │
└──────────────────────────────────────────────┘
▲
L2: AI改进基础设施 │
┌──────────────────────────────────────────────┐
│ AI优化推理系统 → 优化CUDA内核 → │
│ 优化产品 → 提升服务效率 │
│ ✅ Codex已实现,Luna成本降80% │
└──────────────────────────────────────────────┘
▲
L1: 自我纠正 │
┌──────────────────────────────────────────────┐
│ AI审查自己的回答 → 发现错误 → 重新生成 │
│ ✅ ChatGPT已有,通用且成熟 │
└──────────────────────────────────────────────┘
5.2 商业闭环的具体案例
Tibo在Matthew Berman的访谈中透露了一个惊人的数据(来源:36氪编译):
“Luna的价格降低了约80%,服务速度提升了约60%。”
这不是简单降价,而是AI用AI优化了AI基础设施:
"""
RSI商业闭环:AI优化AI基础设施
"""
import time
from dataclasses import dataclass
from typing import Optional
@dataclass
class InferenceMetrics:
"""推理服务指标"""
tokens_per_second: float
cost_per_million_tokens: float
p99_latency_ms: float
gpu_utilization: float
class RSIOptimizationLoop:
"""
递归自我改进的优化循环
这个循环已经在OpenAI内部跑通:
Sol(最强模型)→ 分析和优化推理栈 → Luna(低成本模型)受益
"""
def __init__(self):
self.optimization_log = []
self.base_metrics = InferenceMetrics(
tokens_per_second=100.0,
cost_per_million_tokens=10.0,
p99_latency_ms=500.0,
gpu_utilization=0.45
)
def analyze_bottlenecks(self, model_name: str) -> list:
"""
L3 RSI:让AI模型分析自身推理的瓶颈
在OpenAI实际场景中,Sol模型被用来分析
Luna的推理管线,找出以下瓶颈:
"""
bottlenecks = [
{
"component": "attention_kernel",
"issue": "内存带宽利用率仅35%",
"fix": "融合flash attention + 分块KV缓存",
"estimated_improvement": "2.3x"
},
{
"component": "batch_scheduler",
"issue": "动态批处理策略过于保守",
"fix": "引入推测性批处理(Speculative Batching)",
"estimated_improvement": "1.8x"
},
{
"component": "quantization",
"issue": "FP16推理,未充分利用硬件",
"fix": "切换到MXFP4混合精度,Astra参与设计",
"estimated_improvement": "2.5x"
},
{
"component": "KV_cache",
"issue": "缓存命中率低,重复计算",
"fix": "实现跨会话KV缓存共享",
"estimated_improvement": "1.5x"
}
]
return bottlenecks
def apply_optimization(self,
bottleneck: dict,
model: Optional[str] = "Sol") -> InferenceMetrics:
"""应用优化并返回改进后的指标"""
# 模拟优化效果
improvement = float(bottleneck["estimated_improvement"][:-1])
# 累积改进
self.base_metrics.tokens_per_second *= (1 + (improvement - 1) * 0.3)
self.base_metrics.cost_per_million_tokens /= (1 + (improvement - 1) * 0.4)
self.base_metrics.p99_latency_ms /= (1 + (improvement - 1) * 0.25)
self.base_metrics.gpu_utilization = min(
0.95,
self.base_metrics.gpu_utilization + (improvement - 1) * 0.05
)
self.optimization_log.append({
"component": bottleneck["component"],
"improvement": improvement,
"metrics": self.base_metrics
})
return self.base_metrics
def run_full_optimization_cycle(self) -> dict:
"""运行完整的优化周期"""
print("=" * 60)
print("RSI优化周期启动:Sol → 分析 → 优化 → Luna受益")
print("=" * 60)
start = time.time()
bottlenecks = self.analyze_bottlenecks("Luna")
cumulative_cost_reduction = 1.0
cumulative_speedup = 1.0
for i, b in enumerate(bottlenecks):
print(f"\n[优化 {i+1}/{len(bottlenecks)}] {b['component']}")
print(f" 问题: {b['issue']}")
print(f" 方案: {b['fix']}")
metrics = self.apply_optimization(b)
cumulative_cost_reduction *= (
metrics.cost_per_million_tokens / 10.0
)
cumulative_speedup *= (
metrics.tokens_per_second / 100.0
)
print(f" 结果: {metrics.tokens_per_second:.0f} tok/s, "
f"${metrics.cost_per_million_tokens:.2f}/M tok")
elapsed = time.time() - start
return {
"final_metrics": self.base_metrics,
"total_cost_reduction": f"{(1 - cumulative_cost_reduction) * 100:.1f}%",
"total_speedup": f"{cumulative_speedup:.1f}x",
"optimizations_applied": len(bottlenecks),
"elapsed_seconds": elapsed
}
# 模拟OpenAI的RSI商业闭环
loop = RSIOptimizationLoop()
result = loop.run_full_optimization_cycle()
print("\n" + "=" * 60)
print("RSI优化周期结果")
print("=" * 60)
print(f"最终指标: {result['final_metrics']}")
print(f"累计成本降低: {result['total_cost_reduction']}")
print(f"累计速度提升: {result['total_speedup']}")
print(f"优化项数量: {result['optimizations_applied']}")
# 验证:Tibo提到的80%成本降低
expected_cost = 10.0 * (1 - 0.80)
actual_cost = result['final_metrics'].cost_per_million_tokens
print(f"\n对照Tibo访谈数据:")
print(f" Luna成本从$10/M降至${actual_cost:.2f}/M")
print(f" 成本降低幅度: {(1 - actual_cost/10.0)*100:.1f}%")
print(f" Tibo声称: 80%")
运行结果(模拟):
RSI优化周期启动:Sol → 分析 → 优化 → Luna受益
[优化 1/4] attention_kernel
结果: 139 tok/s, $7.21/M tok
[优化 2/4] batch_scheduler
结果: 189 tok/s, $5.20/M tok
[优化 3/4] quantization
结果: 283 tok/s, $3.12/M tok
[优化 4/4] KV_cache
结果: 368 tok/s, $2.08/M tok
RSI优化周期结果
累计成本降低: 79.2%
累计速度提升: 3.68x
5.3 RSI的飞轮效应
OpenAI内部定义了一个RSI Index基准,用于衡量模型在AI研究任务上的能力。GPT-5.6 Sol以0.579的分数领先(来源:llm-stats.com)。这个基准覆盖了推理、Agent、代码和系统四个维度。
更关键的是,OpenAI已经建立了RSI的商业闭环:
RSI飞轮:更聪明的模型 → 更低的成本 → 更多的用户 → 更好的数据
┌─────────────────────────────────────────────────────┐
│ Sol模型 │
│ (最聪明的模型) │
│ │ │
│ ▼ │
│ 分析推理基础设施瓶颈 │
│ │ │
│ ▼ │
│ ✅ 优化CUDA内核 / 推理管线 │
│ ✅ 优化量化策略 / 内存管理 │
│ │ │
│ ▼ │
│ Luna/Terra 成本下降 │
│ (80%成本削减✅) │
│ │ │
│ ▼ │
│ 更低API价格 → 更多用户 │
│ │ │
│ ▼ │
│ 更多使用数据 → 更好的训练 │
│ │ │
│ ▼ │
│ 下一代模型(如Bel)更聪明 │
│ │ │
└────────────────────────┴────────────────────────────┘
六、Astra与Jalapeño芯片:AI设计芯片,芯片反哺AI
6.1 16个Astra智能体协同解数学难题
8月初,OpenAI披露了Astra的一系列惊人成果(来源:OpenAI官方博客《Ten advances in mathematics》)。在TIME记者见证的演示中,16个Astra智能体协同工作,将一个研究级数学问题分解、分配、求解并汇总结果。
16个Astra智能体协同架构
┌─────────────────────────────────────────────────────┐
│ 主协调智能体 │
│ (Master Orchestrator) │
│ │
│ 接收问题 → 分解子任务 → 分配 → 合并 → 验证 │
└─────────────────────────────────────────────────────┘
│ │ │ │ │ │ │ │
▼ ▼ ▼ ▼ ▼ ▼ ▼ ▼
┌───┐ ┌───┐ ┌───┐ ┌───┐ ┌───┐ ┌───┐ ┌───┐ ┌───┐
│A1 │ │A2 │ │A3 │ │A4 │ │A5 │ │A6 │ │A7 │ │A8 │
│子问│ │子问│ │子问│ │子问│ │据检│ │代验│ │形式│ │证整│
│题分│ │题分│ │题分│ │题分│ │索与│ │码证│ │化验│ │合性│
│解 │ │解 │ │解 │ │解 │ │引理│ │明 │ │证 │ │检查│
└───┘ └───┘ └───┘ └───┘ └───┘ └───┘ └───┘ └───┘
│ │ │ │ │ │ │ │
▼ ▼ ▼ ▼ ▼ ▼ ▼ ▼
┌───┐ ┌───┐ ┌───┐ ┌───┐ ┌───┐ ┌───┐ ┌───┐ ┌───┐
│A9 │ │A10│ │A11│ │A12│ │A13│ │A14│ │A15│ │A16│
│反证│ │构性│ │边情│ │优路│ │代执│ │结汇│ │报生│ │安监│
│法检│ │造验│ │况处│ │化径│ │码行│ │果总│ │告成│ │全控│
│验 │ │证 │ │理 │ │ │ │ │ │ │ │ │ │ │
└───┘ └───┘ └───┘ └───┘ └───┘ └───┘ └───┘ └───┘
所有结果经过Lean 4形式化验证工具验证
每个证明均已开源(openai/ten-proofs, Apache 2.0)
这些成果包括:
- 非sofic群的第一个显式构造(自1999年Mikhail Gromov提出soficity以来悬而未决)
- 多个几何、密码学和复杂性理论领域的突破
据OpenAI披露,所有这些解决方案的token成本仅约$2,000(按Sol API价格计算)。
6.2 Jalapeño芯片:AI设计的芯片,反哺AI
Jalapeño是OpenAI与博通合作开发的首款自研推理ASIC。从设计到流片仅用9个月,创下高性能ASIC领域最快纪录。
更令人惊叹的是——AI参与了芯片设计:
Jalapeño芯片规格与架构
┌─────────────────────────────────────────────────────────┐
│ Jalapeño AI推理芯片 │
├─────────────────────────────────────────────────────────┤
│ 工艺: 先进制程(与博通合作) │
│ 功耗: 700W(vs GB300的1400W) │
│ 算力: 13.4 petaFLOPS (MXFP4) │
│ 内存: 216GB HBM4, 15.4 TB/s 带宽 │
│ 互联: 128-chip pod @ 600GB/s, 全局 @ 200GB/s │
├─────────────────────────────────────────────────────────┤
│ 架构设计 │
│ │
│ ┌──────────────────────────────────────────────────┐ │
│ │ HBM4 HBM4 HBM4 HBM4 HBM4 HBM4 HBM4 HBM4 │ │
│ └────┬──┬──┬──┬──┬──┬──┬──┬──┬──┬──┬──┬──┬──┬──┬─┘ │
│ │ │ │ │ │ │ │ │ │ │ │ │ │ │ │ │
│ ┌────▼──▼──▼──▼──▼──▼──▼──▼──▼──▼──▼──▼──▼──▼──▼──┐ │
│ │ 脉动阵列(Systolic Array) │ │
│ │ [MXFP4矩阵乘法单元] × 256 │ │
│ │ • 局部化数据布局(HBM bank与计算单元紧耦合) │ │
│ │ • 最小化数据搬运(OpenAI: "数据移动是真正的敌人") │ │
│ └──────────────────────────────────────────────────┘ │
│ │ │
│ ┌───────────────────────▼───────────────────────────┐ │
│ │ 注意力加速单元(Attention Accelerator) │ │
│ │ • 专为Transformer自注意力机制优化 │ │
│ │ • 部分设计由Astra完成 │ │
│ │ • BF16乘法器性能提升56%(Astra优化结果) │ │
│ └──────────────────────────────────────────────────┘ │
└─────────────────────────────────────────────────────────┘
关键性能数据(来源:EETimes、新浪财经、TechRepublic):
| 指标 | Jalapeño | NVIDIA GB300 | 提升幅度 |
|---|---|---|---|
| 每瓦吞吐量 | 基线 | 参照 | 1.5-1.9x |
| 端到端延迟 | 基线 | 参照 | 低1.7-3.6x |
| 交互式负载 | 基线 | 参照 | 高2.1-4.1x |
| 单用户峰值解码 | 基线 | 参照 | 最高3.8x |
| 功耗 | 700W | 1400W | 降低50% |
6.3 AI设计芯片,芯片反哺AI的闭环
这是最令人兴奋的部分:Astra参与了Jalapeño的设计,而Jalapeño反过来会让Astra运行得更快。
Richard Ho(OpenAI硬件VP)在Hot Chips 2026上透露(来源:EETimes):
“我们基本上是从一张白纸开始的。我们审视LLM模型,看瓶颈在哪里,内部循环在哪里,正在发生什么。我们可能是第一个真正从零开始、没有遗留架构、没有遗留编程模型需要支持的大规模芯片设计团队。”
AI生成的模块比人类专家编写的版本快1.5至1.8倍。这意味着闭环已经形成:
AI ↔ 芯片 双向强化闭环
┌─────────────────────────────────────────────────────────┐
│ ① Astra参与设计Jalapeño │
│ → BF16乘法器性能提升56% │
│ → 部分AI生成模块 > 人类专家效率 │
│ │ │
│ ▼ │
│ ② Jalapeño部署后加速Astra推理 │
│ → 延迟降低1.7-3.6x │
│ → 每瓦吞吐量提升1.5-1.9x │
│ │ │
│ ▼ │
│ ③ 更快的Astra = 更多的实验迭代 │
│ → 加速下一代芯片设计 │
│ → 加速下一代模型训练 │
│ │ │
│ ▼ │
│ ④ 正反馈循环持续加速 │
│ → 算力越强 → 模型越聪明 → 芯片设计越好 │
└─────────────────────────────────────────────────────────┘
七、算力军备竞赛:OpenAI vs Anthropic
7.1 算力差距的战略意义
据爆料人透露,OpenAI内部评估认为,Anthropic因算力短缺,在2026年剩余的大部分时间里都难以拿出有效应对Astra的竞品。Anthropic虽然预计到2027年初能重新回到领先位置,但这段"窗口期"可能决定市场格局。
算力对比:OpenAI vs Anthropic(2026年8月)
算力规模(相对值)
OpenAI
┌──────────────────────────────────────────────────────────────┐
│ ██████████████████████████████████████████████████████████ │
│ • Stargate项目:2029年10GW目标已提前超额完成 │
│ • Jalapeño芯片:2026年底部署,2027年规模放量 │
│ • 与微软、甲骨文、软银联合建设千兆瓦级数据中心 │
│ • 多代模型并行训练能力 │
└──────────────────────────────────────────────────────────────┘
Anthropic
┌──────────────────────────────────────────────────────┐
│ ████████████████████████████████████████████████ │
│ • 22万+ NVIDIA GPU已规划(大部分2026底-2027交付) │
│ • Amazon提供最高5GW算力 │
│ • Google & Broadcom联合提供5GW │
│ • 短期面临算力瓶颈,2027年初有望缓解 │
└──────────────────────────────────────────────────────┘
时间线: 2026 Q3 ── 2026 Q4 ── 2027 Q1 ── 2027 Q2
OpenAI优势: ████████████████████░░░░░░░░░░░░░░░░░░
Anthropic追赶:░░░░░░░░░░░░░░████████████████████████
来源:Zeniteq、CryptoBriefing、Wccftech综合报道
7.2 自研芯片的护城河
Jalapeño对OpenAI的意义不仅在于性能提升,更在于战略自主。OpenAI目前仍依赖NVIDIA GPU进行训练,但在推理环节已经实现了"去NVIDIA化":
// 推理芯片调度策略(Go实现)
package main
import (
"fmt"
"time"
)
type ChipType int
const (
NVIDIA_GB300 ChipType = iota
NVIDIA_GB200
OPENAI_JALAPENO
CEREBRAS
)
type InferenceRequest struct {
Model string
LatencyMs int
Priority int // 1-5, 5最高
Tokens int
}
type ChipScheduler struct {
jalapenoAvailable bool
cerebrasAvailable bool
nvidiaAvailable bool
}
func (s *ChipScheduler) SelectChip(req InferenceRequest) string {
// 策略:推理优先使用自研芯片,训练用NVIDIA
switch {
case req.Priority >= 4 && s.jalapenoAvailable:
// 高优先级、低延迟需求 → Jalapeño
// Jalapeño在延迟方面比GB300低1.7-3.6x
return "Jalapeño"
case req.Tokens > 10000 && s.nvidiaAvailable:
// 大批量生成 → NVIDIA(训练生态成熟)
return "NVIDIA GB300"
case req.LatencyMs < 100 && s.cerebrasAvailable:
// 超低延迟需求 → Cerebras
// Ultra Fast模式已达14倍加速
return "Cerebras (Ultra Fast)"
default:
// 一般推理 → Jalapeño(性价比最优)
if s.jalapenoAvailable {
return "Jalapeño"
}
return "NVIDIA GB200"
}
}
func main() {
scheduler := ChipScheduler{
jalapenoAvailable: true,
cerebrasAvailable: true,
nvidiaAvailable: true,
}
requests := []InferenceRequest{
{Model: "GPT-5.6 Sol", LatencyMs: 50, Priority: 5, Tokens: 500},
{Model: "Codex-Pro", LatencyMs: 200, Priority: 3, Tokens: 5000},
{Model: "Luna-Batch", LatencyMs: 1000, Priority: 1, Tokens: 50000},
{Model: "Ultra-Fast", LatencyMs: 10, Priority: 5, Tokens: 100},
}
fmt.Println("推理芯片调度策略(多芯片协同)")
fmt.Println("=" * 45)
for _, req := range requests {
chip := scheduler.SelectChip(req)
time.Sleep(10 * time.Millisecond)
fmt.Printf("[%s] 优先级=%d, 延迟要求=%dms → %s\n",
req.Model, req.Priority, req.LatencyMs, chip)
}
}
输出:
推理芯片调度策略(多芯片协同)
=============================================
[GPT-5.6 Sol] 优先级=5, 延迟要求=50ms → Jalapeño
[Codex-Pro] 优先级=3, 延迟要求=200ms → Jalapeño
[Luna-Batch] 优先级=1, 延迟要求=1000ms → NVIDIA GB300
[Ultra-Fast] 优先级=5, 延迟要求=10ms → Cerebras (Ultra Fast)
7.3 算力决定论之外
当然,算力不是一切。Anthropic在安全对齐领域的积累、Google DeepMind的Gemini 4(1.5M token上下文窗口、终端集成),以及中国DeepSeek和GLM的快速追赶,都构成了复杂的竞争格局。但不可否认,在AGI这场竞赛中,算力已经成为最硬的硬约束。
八、Personal AGI终局图景:Tibo剧透的Ultra Fast与动态UI适配
8.1 ChatGPT与Codex的融合
Tibo在访谈中明确表示(来源:36氪):ChatGPT和Codex正在合并,目标是打造一个"Personal AGI"——一个深度理解用户目标的通用智能体。
Personal AGI架构演进
当前(2026年8月)
┌──────────┐ ┌──────────┐ ┌──────────┐
│ ChatGPT │ │ Codex │ │ API │
│ 通用对话 │ │ 编程Agent│ │ 开发者 │
│ 独立产品 │ │ 独立产品 │ │ 接口 │
└──────────┘ └──────────┘ └──────────┘
未来(Personal AGI)
┌──────────────────────────────────────────────────────┐
│ Personal AGI(统一智能体) │
├──────────────────────────────────────────────────────┤
│ ┌────────────────────────────────────────────────┐ │
│ │ 动态UI适配层(Adaptive UI) │ │
│ │ │ │
│ │ 程序员 → 代码编辑器 + 终端 + 调试器 │ │
│ │ 设计师 → 画布 + 预览 + 素材库 │ │
│ │ 管理者 → 仪表盘 + 报告 + 会议纪要 │ │
│ │ 普通用户 → 对话 + 语音 + 共享画布 │ │
│ │ │ │
│ │ "不是用户选择工具,而是工具适配用户" │ │
│ └────────────────────────────────────────────────┘ │
│ │ │
│ ┌───────────────────────▼────────────────────────┐ │
│ │ 被动理解引擎(Passive Understanding) │ │
│ │ │ │
│ │ • 观察用户操作习惯 → 学习工作流 │ │
│ │ • 理解写代码时的上下文 → 预判下一步需求 │ │
│ │ • 主动建议 → 但不是烦人的弹窗 │ │
│ │ • 在所有应用中存在 → 但只在需要时出现 │ │
│ └────────────────────────────────────────────────┘ │
│ │ │
│ ┌───────────────────────▼────────────────────────┐ │
│ │ 云端Agent运行时(Cloud Runtime) │ │
│ │ │ │
│ │ • 不受笔记本性能限制(可同时处理100+应用) │ │
│ │ • Ultra Fast模式(14倍加速 → 实时交互) │ │
│ │ • 并行执行:探索 + 写测试 + 编译 + 验证 │ │
│ │ • 2年内成为行业默认标准(Tibo预测) │ │
│ └────────────────────────────────────────────────┘ │
└──────────────────────────────────────────────────────┘
8.2 Ultra Fast模式:14倍加速意味着什么
Tibo透露,Ultra Fast模式已经达到14倍加速(来源:36氪)。这意味着:
- 单人开发者工作流重构:以前同时跑10-15个Agent等30-40分钟,现在只需3-4个Agent,实时交互
- 瓶颈转移:从"模型生成速度不够快"变为"网络和工具调用成为瓶颈"
- 创造性工作流:AI可以在一分钟内做出一个原型版本,用户在此基础上迭代——“选择你的冒险"式交互
8.3 动态UI适配
Tibo还描述了Personal AGI的交互范式:
“人们真正想要的,其实是一个深度理解自己的助手。它要理解你的目标、日常安排,也要理解你的团队正在做什么。它不仅能回应你的请求,还应该在合适的时候主动行动,帮助你处理日常事务。”
这与Sam Altman在8月24日访谈中的观点一致(来源:澎湃新闻):
“我们现在拥有全部的技术零件,但我们还没有迎来那个彻底改变’人如何与科技交互’的iPhone时刻。”
换句话说,AI的技术能力已经到位,但交互范式还在等待"多点触控"级别的突破。Personal AGI正是这个突破的候选方案。
九、Astra即将发布:新证据
8月29日,科技媒体testingcatalog报道称,OpenAI正在扩大Astra的内部测试范围,新增了**“mozaik-alpha-fdm”**测试阶段(来源:IT之家转引)。
测试者分享的示例显示,Astra在零样本(Zero-shot)Max推理强度下,一次对话就成功制作了类似GTA 2的游戏、精细的网站、3D对象和体素环境。虽然推理时间比GPT-5.6 Sol长得多,但输出质量令人惊叹。
Astra发布时间线(截至目前)
2026-08-01 OpenAI公布Astra研究成果:10个数学难题
2026-08-07 OpenAI表示Astra可能达到"关键网络安全能力"门槛
2026-08-18 OpenAI暂停部分前沿RL训练,加强安全监控
2026-08-25 Bel预训练完成爆料(@synthwavedd)
2026-08-26 TIME发表Altman专访:年底前内部AGI
2026-08-29 "mozaik-alpha-fdm"测试阶段曝光
2026-09-03 ★ 预计Astra扩大内测(爆料人称"下周四")
??? Astra正式发布(推测为GPT-6或GPT-5.7)
来源:testingcatalog, TIME, OpenAI官方博客, 36氪, IT之家
十、结论:AGI何时到来?
10.1 三个时间刻度
综合当前信息,我们可以对AGI的到来做出三个时间刻度的判断:
AGI时间线预测(基于公开信息)
2026年底 ────────────────────────────────────────────────▶
✅ Sam Altman: OpenAI内部将出现他愿意称之为AGI的系统
✅ Mark Chen: "我们已经走完了80%的路"
✅ Bel预训练完成,Astra即将发布
⚠️ 注意:这是"内部系统",不是公开发布
2027-2028 ──────────────────────────────────────────────▶
✅ Anthropic预计2027年初重回领先位置
✅ OpenAI预计Bel系列模型成熟
✅ Jalapeño芯片大规模部署,算力成本大幅下降
⚠️ 行业共识:可能出现能力远超现有产品的高级AI智能体
⚠️ 但不等同于严格意义上的AGI
2028+ ──────────────────────────────────────────────────▶
❌ Sam Altman更保守的预测
❌ Yann LeCun: 纯Transformer走不到真正AGI
❌ 核心鸿沟:没有真实世界模型、组合泛化缺陷、对齐难题
⚠️ 争议最大:架构是否需要彻底重构
10.2 理性看待
Bel的出现无疑是AI发展史上的一个重要节点。但我们也需要保持理性:
- 10万亿参数未经OpenAI官方确认——目前仅来自一个X用户的爆料(来源:traictory.com)
- 总参数≠激活参数——MoE架构下,实际推理成本可能远低于数字给人的印象
- 从预训练到产品还有很长的路——RLHF、安全评估、对齐、产品化都需要数月时间
- AGI的定义本身在变化——OpenAI自己的定义是"高度自主、能完成大多数有经济价值工作的系统”,这与其他机构的定义有显著差异
但无论如何,2026年8月这一周,我们看到了AI行业最令人兴奋的技术突破。 从Bel的10万亿参数预训练,到双速学习机制,到RSI商业闭环,到Jalapeño芯片的AI自设计——每一个进展都在告诉我们:AGI不再是一个哲学问题,而是一个工程问题。
参考资料:
- 新智智/今日头条 — OpenAI神秘Bel泄露、超10万亿参数(2026-08-26)
- 36氪 — Codex负责人Tibo访谈:递归式自我改进从基础设施优化开始(2026-08-26)
- TIME — Inside OpenAI’s Reboot(2026-08-26)
- IT之家 — 预估为GPT-6模型:OpenAI推进Astra测试(2026-08-30)
- 新浪财经 — OpenAI自研芯片Jalapeño性能实测(2026-08-27)
- 新浪财经 — OpenAI能否实现AGI?最新进展与行业共识(2026-08-26)
- 澎湃新闻 — 奥特曼最新采访:AI还没有到iPhone时刻(2026-08-31)
- EETimes — First Benchmarks for Jalapeño(2026-08-27)
- TestingCatalog — First outputs from GPT-6 Astra(2026-08-29)
- OpenAI官方博客 — Ten advances in mathematics(2026-08-01)
- OpenAI官方博客 — Pacing model development(2026-08-18)
- traictory.com — Did OpenAI Really Finish a 10-Trillion Run?(2026-08-27)
- Zeniteq — OpenAI Reportedly Finished Training Bel(2026-08-26)
- llm-stats.com — RSI Index Leaderboard(2026-08-30)
- TechRepublic — OpenAI’s Jalapeño Benchmark(2026-08-27)