发布当天,你大概已经在信息流里刷到过几十条演示了:三维城市、会说话的 NPC、一句话生成的网站。热闹归热闹,一个正经问题没人回答——这一代模型到底比上一代强在哪,强出来的那部分值不值得你换。
有人拿跑分回答这个问题,但跑分这次特别不老实。同一场发布里,编程榜上 GPT-6 Astra 只领先第二名 0.3 个百分点,抽象推理榜上它却把第二名甩开了 69 个百分点。这两个数字放在一起才说得通:变强的不是写得对不对,是能不能自己跑很久还不跑偏。
这篇文章是对一支十一分钟测评视频的复核。视频作者把官方博文、基准截图和一串第三方案例串了一遍,本文按画面逐帧对了一次,顺手修掉了十几处口头表述与画面不符的地方——包括那句流传最广的"分数从 18.1% 提升到 41.4%"。
01 先把两张榜单摆在一起看
先说一处必须更正的读法。很多整理稿把官方表格读成了"Astra 的成绩由 18.1% 提升至 41.4%",好像是同一个模型的自我提升。画面上不是这么回事:18.1% 是同门师兄 GPT-5.6 Sol 的分数,41.4% 是 Astra 的分数,那是一张横向对比表的两列。
编程这一组,表上是这样的:
| 编码基准 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| 终端台 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended | 64.5% | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| 内部数据库迁移任务 | 63.9% | 42.7% | 57.8% | 50.3% | — | — |
DeepSWE 那一行就是外界传的"SWE-bench 74.1%"。Astra 确实是第一,但第二名 Gemini 3.8 Flash 是 73.8%,第三名 Claude Opus 5 是 73.7%。三家挤在 0.4 个百分点之内,这叫并列,不叫领先。
顺带更正三个专名:这一行的基准叫 DeepSWE v1.1,被对比的两家是 Claude Fable 5.1 和 Gemini 3.8 Flash。流传版本里的"SWE-bench、Claude 3.5 Sonnet、Gemini 1.5 Flash"是听写走样,数字倒是一个没错。
抽象推理那一组,画风完全不同:
| 抽象推理 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 |
|---|---|---|---|---|---|
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% |
| ARC-AGI-3 | 99.9% | 7.8% | — | — | 30.2% |
前两行是典型的饱和榜:所有人挤在 90 分往上,谁高一点都没有意义。第三行是断层:Astra 99.9%,Claude Opus 5 30.2%,GPT-5.6 Sol 7.8%。
ARC-AGI-3 和前两代的区别,是它测的不是解题,是学习。官方给的定义是"智能体在解决陌生交互任务时的学习能力"——把模型丢进一个没见过的交互环境,让它自己摸索规则再通关。前两代题目是静态的、一次判对错的;第三代要连续动作、要试错、要记住上一步的结果。
也就是说,编程榜和推理榜量的是两件事。前者量单次产出的正确率,后者量长程行为的稳定性。0.3 分和 69 分的落差不是矛盾,是同一件事的两面。
02 99.9% 底下那行小字
这个分数带了一个上标。官方注解写得很直白:他们没有用原始基准工具,而是用自家 API 测试工具跑的,理由是"该工具比原始基准测试工具更能反映实际应用场景下的性能"。
评论区有人早就注意到了。一位读者留言说,他看到另一个博主提到,Astra 是在测试界面保留了自有界面才拿到 99.9%,换用官方界面分数会下来,但仍排在所有模型和人类之前。官方脚注和这条留言说的其实是同一件事,只是一个说得漂亮一点。
同一张图上还有两句更值得记住的话。一句是人类测试者在这套题上的平均得分只有 48 分。另一句是官方自评:Astra 在 96% 的关卡上超过了他们设定的人类效率基准。
这两句合起来,比 99.9% 有信息量得多。99.9% 是一个被自家工具润色过的数字,"96% 的关卡上快过人类"是一个可以拿去验证的说法。
03 能力清单:官方页面上的八个标签
官方产品页把能力做成了八个可切换的标签,这份清单比任何跑分都直观:
电路板、Excel 竞赛、游戏开发、填写 1040 表格、前端质量保证、Power BI、汽车变速器、法律文件的格式设置。
这里要更正两处广泛流传的说法。第六个标签是 Power BI,不是 PowerPoint。第四个不是笼统的"填写复杂表格",是美国个人所得税申报表 1040。

最能说明问题的是第一个标签。官方给的说明是:这段画面是 Astra 在 KiCad 里做印刷电路板布局的 15 秒压缩回放,把电路原理图变成一块可制造的板子——放置元件、走铜线。官方还补了一句它为什么挑这个例子:PCB 布局是每个电子产品都要做的手工活,也是电子设计流程里常见的延迟来源。
同一页下方还有一条容易被忽略的信息:这次一起更新的还有 Codex 框架,和 Astra 配合之后,在 Mind2Web 基准上的任务完成速度是 GPT-5.6 Sol 的 1.9 倍。
这份清单的共同点是:它们都不是"回答一个问题",是"交付一个文件"。板子、报税表、报表、合同排版——每一件都有明确的验收标准,也都要连续做很多步。这跟第一节那两张表指向的是同一个结论。
04 价格、开放范围,和一条没人提的默认设置

官方博文的"可用性"一段,画面里写得很清楚,抄录如下:
- API 标准定价 每百万输入 10 美元、每百万输出 50 美元,缓存读取另有折扣。
- 提供快速模式,推理速度最高可达标准模式的两倍,价格也是标准模式的两倍。
- 开发者侧以 gpt-6-astra 的名字在 OpenAI API 提供,同时上 Microsoft Azure 与 Amazon Bedrock。
- 面向订阅用户是分批开放:当天先给部分机构,之后几天覆盖所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户。
- Pro、Business、Enterprise 还会额外拿到 GPT-6 Astra Pro 的访问权限。
有两处细节值得单独拎出来。
一是订阅档位是 Business,不是流传版本里的 Team。二是这一句:企业管理员需要为工作区启用 Astra,因为默认情况下它在发布时处于关闭状态。如果你在一家公司里,打开 ChatGPT 发现选不到这个模型,多半不是没排到,是管理员还没开。
至于单次任务成本,视频作者引用了第三方统计站 Artificial Analysis 的数字:Astra 约 2.57 美元一次任务,低于 GPT-5.1,但超过 GPT-5.6 的两倍。这个数字画面上没有出现,只有作者口述,姑且记着。
评论区的两条留言比价目表更有参考价值。一位读者说,"整了个 Excel 文件,40% 额度就没了"。另一位重度用户说,他用最高推理档修了两个功能、再让智能体做了一轮调研,一周的额度只剩下 7 个点。定价表写的是每百万 token 多少钱,订阅用户实际撞到的是额度墙。
05 网页与视频:快的不是渲染,是审美默认值
第一个案例是让它围绕"AI 将在 2030 年接管日常工作"做一个高质感互动网站。作者的描述是:布局紧凑,顶部区分了不同用户角色,左侧排了一份每日日程,想让 AI 接手就点对应按钮,看结果、不满意就改,围着同一个主题快速试多版。
真正说明问题的是第二个页面——一个抹茶品牌站。

深绿底、一只俯拍的抹茶碗居中、周围一圈细线构图,标题只有三个词:A little less noise。右侧是"Find your green note"和菜单入口,底部一行小字写着 From preparation to pause。
这已经不是"能不能生成一个页面"的问题了。排版、留白、配色、文案语气是一整套判断,过去要一个懂行的设计师定调。模型现在给出的默认值,比多数人自己动手的版本更接近成品。
第二个案例是做视频:一分钟的中文教育短片,主题是"普通人如何用 AI 代理每天节省两小时",从发指令到出片大约十分钟。片子的内容是三十封邮件不用逐一翻阅,让 AI 按紧急程度分类、提取截止日期、标出需要回复的。

这里要更正一处归属。视频里作者提到的那个"在视频生成领域表现惊人"的模型,画面字幕写的是 Anthropic 发布的 Fable 5.1,不是流传版本里的"OpenAI 发布的 GPT-5.1",也不是"f5.1 视频生成模型"。前面那两张基准表里的"Claude Fable 5.1"就是它。
06 3D 这一层:从生成一个物体,到生成一套规则
这是这次真正的新东西,也是最容易被演示画面骗过去的一层。看几个具体的。
一座会运转的城市。 Matthew Berman 做的 Newhaven,网页直接能打开玩。

顶栏三个数:人口 15,750、城市资金 129,331 美元、幸福度 83%。右侧面板叫 City Pulse,电力 7,742 / 8,100,水 5,865 / 6,300,健康度 88%。中间弹出一条 URGENT MEDICAL CALL,下面配着处理提示:有一通急救呼叫需要救护车,去查救护车路线、空余床位和被堵住的路段。底部工具栏十一个建造分类,从道路、分区、水电到教育、公园、旅游、交通、工业、地形。右下角是游戏内日期和 1× 2× 3× 倍速。
这不是"一个有车流和行人的三维场景",这是一套完整的城市模拟规则:容量约束、财政循环、随机事件、幸福度反馈。三维只是它的外壳。
一座能穿越时代的城市。 视频作者自己测试时做了另一个:伦敦,底部一条时间轴从 1215 Medieval、1599 Tudor、1666 Great Fire、1720 Georgian、1858 Victorian、1940 The Blitz 一直拉到 2026 Modern,四种视角(俯瞰、第一人称、第三人称、正上方)加一张地图随时切换。

七个时代要各有一套建筑形制,切换时还要保持街道骨架连续——这件事考的是空间一致性,不是建模。
一款真的卡丁车游戏。

赛道叫 FROSTBITE FALLS,右上角写着 LAP 1/3 和 0:05.100,中间提示当前第 7 名,左下角速度表 75 km/h,右下角是小地图。圈数、名次、计时、车速、赛道拓扑——这是完整的比赛逻辑,不是一段跑起来的动画。视频作者的判断是:过去 AI 做的游戏基本是小飞机射击或者简单二维游戏,现在能做真正的三维游戏了。
一个会自己过日子的世界。 Matt Shumer 用 GPT-6 搭了一个"Living World"。作者说里面有六百个 AI 角色;不过视频展示的那一幕,界面左上角写的是 12 位居民、10 头鹿、4 只狼、10 只乌鸦和 2 具尸体,跟随的角色下面标着各自的状态:build、wait、preparing_speech。
真正值得注意的是这几个状态名。角色不是在播放动画,是在各自的行为状态之间切换,其中一个正在"准备一段讲话"。视频里评论这件事的说法很准:搭个世界、放几个角色、用大模型生成对白、再用 ElevenLabs 转成语音,这些都不算难;难的是三维角色模型、地图素材和底层运行逻辑全部由模型自己生成。
一座重建的建筑。

有人直接让 GPT-6 调用 Blender 重建了旧金山艺术宫。暮色、穹顶、廊柱、水面倒影,细节还原度相当高。过去要做到这个效果需要大量三维模型、繁复的设计流程和海量训练数据,现在的输入是一句提示词。
07 最值钱的一个案例:让它连续跑四天二十一小时
前面那些都还在"一次会话之内"。真正把这一代和上一代分开的,是下面这个。
沃顿商学院的 Ethan Mollick 做了两件事。第一件是一座可漫游的亚历山大图书馆,网址挂在 alexandria-mouseion.netlify.app,项目开源在 GitHub 上,自我描述是"一次以史料为依据的三维重建,配可读文本、双语环境音,以及可选的'来世'叠加层"。

第二件更重要。他让模型读了自己数万封邮件、文章和日历安排,把这些东西织成一个覆盖他全部研究、人脉、想法和人际关系的个人知识库。他的原话是:模型自己写了相应的软件,制定了策略,在连续几天不间断的工作中、无需他任何干预,构建了一个数 GB 的个人维基。
那条帖子里最有说服力的不是文字,是配图里一个还在走的计时器。

Pursuing goal 4d 21h 17m 14s。 四天二十一小时十七分十四秒,还在跑。
这里要一口气更正四处流传的说法:
- 干这件事的是 GPT-6,不是 GPT-4。
- 读的是数万封邮件,不是数千封。
- 搭这套个人生活系统的是 Mollick 本人,不是 Karpathy。Karpathy 的贡献是最早提出"个人维基"这个概念——把你所有的文档变成一个互相链接的文本知识库。
- 成本不是"不低",而是不知道。Mollick 在同一条帖子里明说:他没有接受任何 AI 实验室的赞助,费用都是自己出的;但在试用期间他没有被收费,所以他没法告诉你这个过程要花多少钱。
顺带把这套东西跑通之后的日常也记一笔:此后每天,AI 会重新扫一遍他的邮件,跟那个庞大的知识库交叉比对,然后给他发一份摘要,列出他应该关注的事项和可能感兴趣的方向。用过去预测未来,这是它的全部逻辑。
Mollick 自己在帖子里标了风险,原文照抄:是的,他给了 AI 访问自己电脑的权限,这存在风险,尝试之前应该谨慎。
08 边界在哪,以及先做哪一件
复述一遍开头那句判断:这一代模型的差距不在写得对不对,在能不能自己跑很久还不跑偏。编程榜上的 0.3 分和 ARC-AGI-3 上的 69 分,说的是同一件事。
需要一起记住的几条边界:
跑分自带脚注。 99.9% 是用自家 API 测试工具跑出来的,官方自己写在图注里。同一张图上"96% 的关卡快过人类"这句更结实,因为它可被复验。
额度是真墙。 处理一个 Excel 文件就吃掉四成额度,最高推理档做完两件事额度只剩个位数,这两条来自真实用户。按 token 单价算成本会算漏。
默认是关着的。 企业工作区发布时默认不开 Astra,要管理员手动启用。
专业绘图仍然不行。 评论区被点名最多的短板是 CAD:有读者说目前没有 AI 能真的画出像样的图,都是错误百出、毫无逻辑;也有人在等它能做质谱相关的 PPT。三维世界搭得再漂亮,跟工程图纸是两回事。
如果只做一件事,我不会去追三维。我会挑一件你每周都做、且有明确验收标准的长任务——比如把过去三个月的会议纪要、邮件和文档整理成一个可检索的库——把它整个交出去一次,然后只看一个指标:它能连续跑多久而不跑偏。
那个还在走的计时器之所以比任何一段三维演示都重要,是因为它第一次让"交给它,然后走开"变成了一件可以被计时的事。