GPT-6 Astra自主通关《传送门》:当通用型智能体第一次征服3D世界
一、引言:一个不可思议的夜晚
2026年9月5日深夜,AI爱好者CozyBlaze在X平台上发布了一条令人震惊的消息——GPT-6 Astra自主完成了Valve旗下经典3D解谜游戏《传送门》(Portal)的全部流程,从第一个测试室到最终与GLaDOS的对决,模型没有借助任何人类干预,也没有使用现成的攻略或脚本辅助。
整场实验持续了约24小时,进行了3336次工具调用,API成本高达571.18美元——但实际由CozyBlaze每月200美元的Codex Pro订阅覆盖。剪辑后的精彩视频压缩至约2小时,去掉了模型漫长的思考暂停时间。
就在不久之前,AI还在Atari 2600的国际象棋游戏中输给人类。而今天,一个通用型语言模型,仅凭屏幕截图和坐标信息,就能自主导航、操控一个完整的3D物理引擎世界,跨越数十个精心设计的解谜关卡。这不仅是技术进步的见证,更是多模态AI智能的一次极具说服力的展示。
二、实验技术细节:MCP + SPT 如何让AI"看见"和"操控"游戏
2.1 核心架构概览
GPT-6 Astra并非直接坐在屏幕前"玩游戏"——它通过一套精心设计的工具链来实现对游戏的控制:
+------------------+ +------------------+ +------------------+
| GPT-6 Astra | | MCP Protocol | | SourcePauseTool |
| (推理引擎) | <---> | (模型上下文协议) | <---> | (暂停/控制工具) |
+------------------+ +------------------+ +------------------+
| |
| 输入: | 输出:
| - 游戏截图(360p) | - 键盘输入序列
| - 玩家坐标(x,y,z) | - 鼠标移动/点击
| - 视角方向(yaw/pitch/roll) | - 视角旋转
| - 上下文管理(跨窗口笔记) | - 游戏暂停/恢复
| |
v v
+---------------------------------------------------------------+
| Portal 游戏引擎 (Source Engine) |
| - 物理模拟 - 光照渲染 - 碰撞检测 - 逻辑更新 - 粒子系统 |
+---------------------------------------------------------------+
2.2 MCP(Model Context Protocol)
MCP(模型上下文协议)是连接AI模型与外部工具的标准化协议。在本实验中,MCP充当了GPT-6 Astra与游戏世界之间的桥梁。模型通过MCP:
- 请求游戏状态快照(截图 + 坐标)
- 发送操作指令(移动、跳跃、射击传送门等)
- 接收执行结果反馈
# MCP 交互简化示例
class MCPGameClient:
"""MCP协议与Portal游戏的通信客户端"""
def __init__(self, game_process, spt):
self.game = game_process
self.spt = spt
self.context_window = []
self.max_context = 258_400 # Astra上下文窗口容量
def capture_state(self):
"""获取当前游戏状态"""
self.game.pause()
screenshot = self.game.capture_screenshot(resolution="360p")
position = self.game.get_player_position()
camera = self.game.get_camera_angle()
return {
"screenshot": screenshot,
"position": position, # (x, y, z)
"camera": camera, # (yaw, pitch, roll)
"timestamp": time.time()
}
def send_actions(self, actions: list):
"""发送预计算的动作序列"""
self.spt.unpause()
for action in actions:
self.game.execute(action)
time.sleep(action.duration)
self.spt.pause()
def think_and_act(self):
"""模型思考-执行循环"""
state = self.capture_state()
# 模型在此处暂停,基于截图和坐标进行推理
decision = self.model.reason(state)
# 执行决策
self.send_actions(decision.actions)
# 更新上下文
self.context_window.append(decision.summary)
2.3 SourcePauseTool(SPT)与游戏暂停机制
SourcePauseTool是一个为Source引擎游戏设计的修改工具。CozyBlaze对其进行了修改,使其能够:
- 暂停游戏:当模型需要思考时,冻结游戏的所有物理和逻辑更新
- 执行输入:模型输出一组预定义的输入序列后,SPT解除暂停并执行
- 返回控制:执行完毕后再次暂停,等待下一轮模型推理
时间线: 模型推理 → 游戏暂停 → 执行动作 → 再次暂停 → 模型推理
|__________| |__________|
思考周期 思考周期
Step 1: Model 接收截图和坐标
Step 2: Model 分析场景 (暂停中)
Step 3: Model 规划动作序列 (暂停中)
Step 4: SPT 解除暂停
Step 5: 引擎执行输入序列
Step 6: SPT 再次暂停
Step 7: 回到 Step 1
这一机制的核心意义在于:它解决了大语言模型推理速度与实时游戏之间的根本矛盾。人类玩家可以用毫秒级的反应时间来处理视觉信息并做出决策,而LLM的推理周期通常需要数秒甚至数十秒。没有暂停机制,模型会在思考时错过游戏中的所有关键事件。
// SPT 核心控制逻辑 (简化版)
package spt
import (
"fmt"
"time"
)
type SPTController struct {
engine *SourceEngine
isPaused bool
thinkTime time.Duration
}
func (s *SPTController) Cycle(modelInput chan GameState, modelOutput chan ActionSequence) {
for {
// 1. 暂停游戏
s.engine.Pause()
s.isPaused = true
// 2. 捕获当前状态
state := GameState{
Screenshot: s.engine.CaptureScreen(360),
Position: s.engine.GetPlayerPos(),
Camera: s.engine.GetCameraAngles(),
}
// 3. 发送给模型推理
modelInput <- state
// 4. 等待模型决策
actions := <-modelOutput
// 5. 解除暂停,执行动作
s.isPaused = false
s.engine.Unpause()
for _, action := range actions {
s.engine.Execute(action)
}
// 6. 记录执行摘要
fmt.Printf("Cycle complete: %d actions in %v\n",
len(actions), time.Since(s.thinkTime))
}
}
2.4 输入输出链路详解
输入层(模型接收的信息):
| 信息类型 | 格式 | 用途 |
|---|---|---|
| 游戏截图 | 360p JPG | 视觉场景理解 |
| 玩家坐标 | (x, y, z) 浮点数 | 空间定位 |
| 视角方向 | (yaw, pitch, roll) 角度 | 朝向判断 |
| 上下文笔记 | 结构化文本 | 跨窗口记忆 |
输出层(模型发出的指令):
| 指令类型 | 示例 | 说明 |
|---|---|---|
| 移动指令 | WASD 组合 | 前后左右移动 |
| 视角指令 | +left; +right | 旋转视角 |
| 交互指令 | +use | 拾取/放置物品 |
| 传送门指令 | +attack1; +attack2 | 发射蓝/橙色传送门 |
| 跳跃指令 | +jump | 跳跃 |
三、经济成本分析:3336次调用与571美元
3.1 Token消耗明细
CozyBlaze在GitHub上公开了完整的实验统计数据:
| 指标 | 数值 |
|---|---|
| 输入Token | 4.305亿(含缓存读取) |
| 输出Token | 160万 |
| Token总量 | 4.321亿 |
| 上下文利用率 | ~50%(约13.8万/25.84万窗口) |
| 工具调用次数 | 3,336 |
| 运行时长 | ~24小时 |
| API成本(标价) | 571.18美元 |
| 实际支付 | 200美元/月 Codex Pro订阅覆盖 |
3.2 成本构成分析
成本构成饼图 (ASCII)
═══════════════════════════════════════════
输入Token成本 (约 86%)
████████████████████████████████░░░░
4.305亿 × $10/百万 = $4,305
但大部分被缓存命中抵消
输出Token成本 (约 12%)
████████░░░░░░░░░░░░░░░░░░░░░░░░░░░░
160万 × $50/百万 = $80
缓存写入 & 其他 (约 2%)
█░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░
API标价: $571.18
Codex Pro订阅: $200/月
═══════════════════════════════════════════
3.3 成本效率的思考
571美元完成一个游戏的通关,相比人类玩家花十几美元购买游戏而言确实昂贵。但作为研究实验,这个成本展示了几个关键事实:
- 订阅覆盖效应:CozyBlaze的Codex Pro订阅(200美元/月)覆盖了全部费用,说明对于个人开发者而言,订阅制可以大幅降低实验门槛
- Token效率趋势:Astra在复杂任务上能以更少的输出Token完成任务,这与OpenAI强调的"任务成本定价"理念一致
- 成本下降曲线:如果对比GPT-5.6 Sol完成类似任务,成本可能高出数倍
四、Astra能力基础:为何它能完成这项任务
4.1 基准测试一览
GPT-6 Astra于2026年9月3日发布,被OpenAI称为"新一代智能模型"。它在多项关键基准测试中展现出前所未有的性能:
基准测试对比 (ASCII)
═══════════════════════════════════════════════════════════════
ARC-AGI-3 GPT-6 Astra: 99.9%
████████████████████████████████████
GPT-5.6 Sol: 7.8% ██
Claude Opus 5: 30.2% ████████████
OSWorld 2.0 GPT-6 Astra: 72.6%
██████████████████████████████
GPT-5.6 Sol: 65.7%
████████████████████████████
ExploitBench GPT-6 Astra: 100.0%
████████████████████████████████████
GPT-5.6 Sol: 78.5%
██████████████████████████████████
FrontierMath T4 GPT-6 Astra: 97.6%
████████████████████████████████████
Claude Fable 5.1: 87.8%
██████████████████████████████████
Agents' Last Exam GPT-6 Astra: 59.3%
██████████████████████████████
Claude Opus 5: 55.5%
█████████████████████████████
═══════════════════════════════════════════════════════════════
4.2 为何Astra能够胜任
1. 多模态推理能力
Astra能够同时处理视觉(截图)和文本(坐标、上下文)信息,并在两者之间建立关联。在《传送门》中,这意味着模型需要:
- 从截图中理解3D空间布局
- 识别关键物体(传送门出口、按钮、方块、炮塔)
- 将视觉信息与物理规则结合(传送门入口/出口的连通性)
2. 计算机操作(Computer Use)能力
Astra在OSWorld 2.0上得分72.6%,比前代快47%——这意味着它在理解屏幕界面、规划操作路径方面具有业界领先水平。虽然《传送门》不是桌面应用,但"看屏幕→理解界面→操作"的核心能力链是相通的。
3. 上下文管理
Astra引入了跨窗口笔记机制,在Codex中可以跨上下文窗口保持笔记,而不是反复压缩之前的摘要。在长达24小时的游戏中,模型需要记住:
- 已经探索过的区域
- 当前的测试室编号和进度
- 特定的解谜策略(如"用蓝色传送门连接出口")
- 之前尝试失败的方法
# Astra的上下文笔记系统(概念性示意)
class AstraContextManager:
"""跨窗口上下文管理"""
def __init__(self, window_size=258_400):
self.window_size = window_size
self.active_window = []
self.archived_notes = []
self.current_size = 0
def add_observation(self, observation: dict):
"""添加新的观察结果"""
note = self._summarize(observation)
if self.current_size + len(note) > self.window_size:
# 窗口已满,归档当前笔记,开始新窗口
self._archive()
self.active_window = []
self.current_size = 0
self.active_window.append(note)
self.current_size += len(note)
def _summarize(self, obs):
"""将观察结果压缩为结构化笔记"""
return {
"chamber": obs["level"],
"progress": obs["checkpoint"],
"failed_approaches": obs.get("failures", []),
"key_objects": obs.get("objects", []),
"strategy": obs.get("plan", ""),
}
def _archive(self):
"""归档当前窗口,保持索引可检索"""
summary = {
"window_id": len(self.archived_notes),
"chambers_covered": self._extract_chambers(),
"key_decisions": self._extract_decisions(),
"token_count": self.current_size,
}
self.archived_notes.append(summary)
def recall(self, query: str) -> list:
"""从归档笔记中检索相关信息"""
results = []
for note in self.archived_notes:
if query in str(note):
results.append(note)
return results
4. 空间推理与抽象建模
在ARC-AGI-3测试中(得分99.9%),Astra展现出了将陌生环境抽象为紧凑符号模型的能力。它自主创建了领域特定语言(DSL)来跟踪状态和规划动作。在《传送门》中,这种能力直接转化为:
- 将3D空间映射为逻辑规则
- 理解"传送门入口→出口"的因果关系
- 规划多步操作序列(先放传送门,再移动方块,最后踩按钮)
五、从Atari到Portal:AI游戏能力的进化史
5.1 2016年:OpenAI的愿景
2016年,OpenAI提出了一个宏伟的技术目标——“用一个单一AI智能体解决多种游戏”。当时,这被视为一个遥远而激进的愿景。同年,AI在Atari 2600的国际象棋游戏中表现不佳,甚至无法击败初级玩家。
5.2 进化时间线
AI游戏能力进化时间线 (ASCII)
═══════════════════════════════════════════════════════════════════
2016 ─ OpenAI提出"单一智能体解决多种游戏"愿景
│ AI在Atari 2600国际象棋中输给人类
│
2017 ─ AlphaStar在《星际争霸2》中展现能力 (但需大量专项训练)
│
2019 ─ OpenAI Five在Dota 2中击败职业战队 (专项强化学习)
│
2022 ─ ChatGPT发布,LLM开始展现推理能力
│
2024 ─ GPT-4完成简单2D游戏任务
│ 多模态模型开始理解视觉界面
│
2025 ─ GPT-5.6 Sol展示初步计算机操作能力
│ Agent框架兴起 (LangChain, AutoGPT等)
│
2026.9.3 ─ GPT-6 Astra发布
│ ARC-AGI-3: 99.9%
│ OSWorld 2.0: 72.6%
│
2026.9.5 ─ GPT-6 Astra自主通关《传送门》
│ 3336次工具调用
│ 24小时完成
│ 通用型智能体首次征服3D世界
│
2026+ ─ 下一个里程碑: 实时3D游戏?
│ 无暂停辅助的自主游玩?
v 多游戏通用智能体?
5.3 关键转折点
从2016年到2026年,AI游戏能力的演进经历了三个关键阶段:
阶段一:专项强化学习(2016-2022)
AlphaStar、OpenAI Five等模型在特定游戏中表现出色,但每个模型都经过了数百万甚至数十亿次专项训练。它们无法将学到的技能迁移到其他游戏中。
阶段二:LLM+多模态(2023-2025)
大语言模型的出现改变了游戏规则。模型不再需要专项训练,而是通过理解自然语言和视觉信息来"理解"游戏规则。但受限于推理速度和上下文窗口,它们只能处理简单的2D游戏或短时任务。
阶段三:通用型智能体(2026-)
GPT-6 Astra代表了第三个阶段的开始。它结合了:
- 强大的多模态理解能力
- 高效的上下文管理
- 计算机操作能力
- 长时间任务执行能力
使得一个通用型模型能够处理此前需要专项训练才能完成的复杂3D游戏任务。
六、技术意义:通用型智能体的里程碑
6.1 从"回答问题"到"完成任务"
Astra在《传送门》中的表现,标志着AI从**“回答问题"到"完成任务”**的根本性转变:
AI能力演进 (ASCII)
═══════════════════════════════════════════════════════════════════
GPT-3 时代 (2020) GPT-4 时代 (2023) GPT-6 Astra (2026)
┌─────────────────┐ ┌─────────────────┐ ┌─────────────────┐
│ 用户: "写首诗" │ │ 用户: "分析数据" │ │ 用户: "通关游戏" │
│ 模型: 输出文本 │ │ 模型: 输出代码 │ │ 模型: │
│ 任务结束 │ │ 用户: 复制运行 │ │ 1. 截图分析场景 │
│ │ │ 用户: 修正错误 │ │ 2. 规划动作序列 │
│ 单向输出 │ │ 用户: 再次运行 │ │ 3. 执行操作 │
│ 无反馈闭环 │ │ ... │ │ 4. 检查结果 │
│ │ │ 多轮但依赖人类 │ │ 5. 迭代优化 │
│ │ │ 无自主执行 │ │ 6. 完成目标 │
│ │ │ │ │ │
│ 输出模型 │ │ 辅助模型 │ │ 自主执行模型 │
└─────────────────┘ └─────────────────┘ └─────────────────┘
6.2 多模态推理的实际应用
《传送门》通关过程展示了多模态推理的多个关键能力:
空间理解:模型需要从2D截图中理解3D空间。例如,识别出面前是一堵墙,需要在墙上开传送门,以便让方块掉落到远处的按钮上。
因果推理:传送门的核心机制是"入口→出口"的连通性。模型需要理解:
- 如果在墙上开蓝色传送门,在另一面墙上开橙色传送门,那么穿过蓝色门就会从橙色门出来
- 利用动量:从高处进入传送门会从低处出口高速弹出
长期规划:挑战室中的解谜往往需要多步操作:
- 先移动方块到压力板
- 方块压住按钮后,平台升起
- 在墙上开传送门
- 穿过传送门到达高处
- 从高处跳下,利用动量到达出口
6.3 工具使用能力的泛化
Astra通过MCP协议控制游戏,本质上是工具使用能力的泛化——同样的"看屏幕→理解→操作"循环,可以应用于:
- 操作桌面软件(CRM、Excel、浏览器)
- 编写和测试代码
- 网络安全分析
- 科学研究数据分析
// 通用Agent循环结构 (Go)
package agent
type AgentLoop struct {
Model ReasoningEngine
Tools []Tool
Context ContextManager
Memory LongTermMemory
}
func (a *AgentLoop) Run(task Task) Result {
// 通用循环:感知 → 推理 → 行动 → 评估
for !task.IsComplete() {
// 感知: 收集当前状态
observations := a.sense(task)
// 推理: 模型分析并决策
plan := a.Model.Reason(observations, task.Goal)
// 行动: 执行计划
for _, step := range plan.Steps {
result := a.execute(step)
a.Context.Add(step, result)
// 评估: 检查是否需要调整
if result.HasError() {
correction := a.Model.Correct(step, result)
a.execute(correction)
}
}
}
return a.assembleResult(task)
}
// 该循环既适用于Portal游戏,也适用于桌面操作和代码编写
// 区别仅在于Tools的具体实现
七、局限性与挑战
7.1 时间成本
24小时的完成时间,对比人类玩家可能只需4-6小时。这暴露了当前LLM推理速度与人类感知-行动速度之间的巨大差距。暂停机制虽然解决了"实时性"问题,但也意味着模型无法处理需要快速反应的场景(如战斗、躲避障碍)。
7.2 经济成本
571.18美元的成本对于一次游戏通关来说过于昂贵。虽然被Codex Pro订阅覆盖,但按API标价计算,这相当于:
- 购买约38份《传送门》游戏
- 足够支付一个初级程序员两周的工资
- 远超大多数AI研究实验的预算
7.3 技术限制
当前局限与未来方向 (ASCII)
═══════════════════════════════════════════════════════════════════
当前局限 未来方向
───────────────────── ─────────────────────
需要暂停机制 实时推理能力
████████████████████████████ ██░░░░░░░░░░░░░░░░░░░░░░░
高API成本 推理成本下降10-100倍
████████████████████████████ ██░░░░░░░░░░░░░░░░░░░░░░░
360p截图输入 高清视觉理解
████████████████████████████ ██░░░░░░░░░░░░░░░░░░░░░░░
需人工干预异常情况 完全自主异常处理
████████████████████████████ █░░░░░░░░░░░░░░░░░░░░░░░░
仅限Source引擎游戏 多引擎通用适配
████████████████████████████ █░░░░░░░░░░░░░░░░░░░░░░░░
单次推理循环2-30秒 次秒级推理
████████████████████████████ █░░░░░░░░░░░░░░░░░░░░░░░░
7.4 非标准化基准测试
CozyBlaze本人明确表示,这次通关不应被视为AI能力的标准化基准测试。原因包括:
- 训练数据污染:《传送门》是2007年发布的游戏,已有近20年历史,其攻略、视频、讨论遍布互联网,可能已在Astra的训练数据中出现
- 工具辅助:SPT提供了坐标和视角信息,人类玩家通常没有这些辅助
- 暂停机制:游戏在模型思考时暂停,相当于将实时游戏变成了回合制
- 单次样本:只有一次成功实验,没有统计显著性
八、行业影响
8.1 对AI Agent领域的影响
《传送门》实验证明了通用型智能体可以完成此前需要专项训练才能完成的复杂任务。这意味着:
- Agent框架的演进方向:从"如何让模型调用函数"转向"如何约束任务、管理状态和处理失败"
- 多模态推理的边界扩展:模型不再局限于文本和简单视觉,而是可以处理完整的3D环境
- 自主性分级:从"需要人工全程监督"到"仅需设定目标即可自主执行"
8.2 对游戏AI的影响
游戏AI技术演进路径 (ASCII)
═══════════════════════════════════════════════════════════════════
传统游戏AI LLM驱动AI 通用型智能体
────────── ──────── ────────────
有限状态机 NPC对话系统 自主游戏通关
████████████████ ████████████████ ████████████████
行为树 动态剧情生成 游戏测试自动化
████████████████ ████████████████ ████████████████
寻路算法 智能NPC行为 新游戏自适应
████████████████ ████████████████ ████████░░░░░░░░
规则脚本 玩家行为分析 跨游戏迁移
████████████████ ████████████████ ████░░░░░░░░░░░░
专项强化学习 游戏内助手 自主游戏设计
████████████████ ████████████████ ██░░░░░░░░░░░░░░
8.3 对自动化测试的影响
AI能够自主探索游戏世界、发现解谜路径,这一能力可以直接应用于:
- 游戏质量保证:自动测试所有关卡的可通过性,发现bug
- 游戏平衡性验证:AI能以不同策略尝试通关,检测设计漏洞
- 回归测试:每次版本更新后,AI自动验证所有关卡
8.4 对AI Agent安全的影响
Astra同时是OpenAI首个达到"关键级"网络安全能力的模型。当模型能够自主操作计算机、浏览屏幕、执行操作序列时,安全控制变得至关重要:
# AI Agent 安全控制层(概念性示意)
class AgentSafetyLayer:
"""Agent安全控制层"""
PERMISSION_LEVELS = {
"read_only": 0, # 只读,不能执行任何操作
"confirm_all": 1, # 每步操作都需要人工确认
"confirm_risk": 2, # 高风险操作需确认
"autonomous": 3, # 完全自主(高风险)
}
def __init__(self, model, permission_level="confirm_risk"):
self.model = model
self.permission_level = permission_level
self.audit_log = []
def execute_with_safety(self, action):
"""安全执行动作"""
risk_score = self._assess_risk(action)
# 记录审计日志
self.audit_log.append({
"action": action,
"risk": risk_score,
"timestamp": time.now(),
})
# 检查是否需要人工确认
if self._needs_approval(risk_score):
approved = self._request_approval(action)
if not approved:
return {"status": "rejected", "action": action}
# 执行动作
result = self.model.execute(action)
# 执行后检查
if self._detect_anomaly(result):
self._emergency_stop()
return result
九、实验者视角:CozyBlaze的评论
CozyBlaze在X平台和GitHub上分享了他的看法:
“GPT-6 Astra已经自主完成了《传送门》!我没想到这一天会这么快到来,但我很高兴我们取得了如此大的进展。我想起2016年,OpenAI的技术目标之一是’用一个单一智能体解决多种游戏’。看着一个通用型智能体自主导航并一路通关整个游戏,感觉就像那个最初的愿景正在变成现实。”
他也坦诚地补充道:
“GPT-6 Astra是我们将拥有的最差的模型。”
这句话的含义是:Astra代表了通用型智能体的起点,而不是终点。未来的模型会更便宜、更快、更强大。今天的"里程碑"放在未来看,可能只是起点。
十、结论
GPT-6 Astra自主通关《传送门》是一个具有象征意义的里程碑。它证明了:
- 通用型智能体可以处理完整的3D游戏世界,而不仅仅是文本或2D环境
- 多模态推理 + 工具使用 + 上下文管理的组合,可以让模型完成需要长时间规划和多步操作的复杂任务
- AI Agent的能力正在从"辅助"走向"执行",从"回答问题"走向"完成任务"
但我们也必须清醒地认识到:24小时的耗时、571美元的成本、暂停机制的辅助、近20年游戏历史的训练数据污染——这些因素都意味着,这不是通用人工智能的终点,而是起点。
正如CozyBlaze所说,Astra是我们将拥有的最差的通用型智能体。未来的模型会在更短的时间内、以更低的成本、在没有辅助的情况下完成更复杂的任务。
2016年OpenAI提出的"单一智能体解决多种游戏"的愿景,正在2026年逐步成为现实。
参考来源
- CozyBlaze (@cozyblazex) on X: “GPT-6 Astra has autonomously completed Portal!” — September 5, 2026
- CozyBlaze, “Portal Agent” — GitHub repository (代码与文档)
- OpenAI, “GPT-6 Astra: A new generation of intelligence” — 官方发布页, September 3, 2026
- OpenAI, “GPT-6 Astra System Card” — 安全技术报告, September 2026
- ARC Prize, “OpenAI’s GPT-6 Astra on ARC-AGI-3” — 独立评测报告, September 3, 2026
- Tom’s Hardware — “AI model successfully completes Portal but it costs $571 in tokens” — September 7, 2026
- The Decoder — “GPT-6 Astra beat Portal start to finish without human help in under 24 hours” — September 7, 2026
- IT之家 — “OpenAI GPT-6 Astra模型自主通关3D解谜游戏《传送门》” — 2026年9月7日
- VideoCardz — “GPT-6 Astra beat Portal — after $571 in API calls” — September 7, 2026
- CSDN — “GPT-6 Astra: 99.9%的分数,和一条会停掉你任务的API” — 2026年9月6日