GPT-6刚发布,吹牛来了,我先给98.6%这个分数泼三盆冷水
北京时间9月4日凌晨,OpenAI 发布新一代旗舰模型 GPT-6 Astra。总裁 Greg Brockman 在媒体吹风会最后说了一句:「欢迎来到 AGI 时代。」
发布会一结束,时间线就被一个数字刷屏:ARC-AGI-3 测试拿到 98.6%,被称为「离 AGI 最近的标尺」上史无前例的高分。
我把 OpenAI 官方材料和国外几家媒体的报道翻了一遍,发现每个大数字背后,都跟着一条小字注释。
模型是真的,发布是真的,数字也是真的。要泼冷水的,是「AGI 来了」这个讲法。


第一盆冷水:谁在答题



ARC-AGI-3 是一套专门考察通用推理能力的测试,业界把它当作离 AGI 最近的标尺之一。Astra 在上面拿到 98.6%,听着像「考试快满分了」。
但 OpenAI 自己的材料里写明:考试时给模型配了一整套装备。
Responses API 让模型在多轮任务之间保留推理信息,Compaction 负责管理长上下文。所以成绩单上写的不是模型分,是「模型加装备」的团队分。
这不是我猜的,有现成先例。今年 8 月,NVIDIA 用 AVO 架构给 Claude Opus 5 套上同类装备,在同一场考试里拿了 100%。而 Opus 5 自己裸考,只有 30% 左右。
同样的事就发生在 Astra 身上:上一代 GPT-5.6 Sol 裸考 ARC-AGI-3,只有 7.8%;Astra 带着全套装备上场,98.6%。跳变主要来自装备,不是大脑。
允许带小抄的考试,班级平均分再高,也说明不了每个学生都变聪明了。装备分和裸考分,得分开看。
ARC-AGI-3:裸考分 vs 带装备分同一场测试,两种答法,分差 90 个百分点GPT-5.6 Sol(裸考)7.8%Claude Opus 5(裸考)约30%GPT-6 Astra(+官方装备)98.6%Claude Opus 5(+NVIDIA装备)100%装备 = Responses API + Compaction 等 Agent 系统;裸考 = 模型直接作答数据来源:OpenAI、NVIDIA 公开材料(2026年8-9月)


第二盆冷水:裁判是谁



Astra 另一个被刷屏的数字,是 FrontierMath Tier 4 拿到 97.6%。这是数学测试里最难的一档,全研究级难度。
负责运营这项测试的机构叫 Epoch AI,它在自己的官方页面上写着两行小字:这个项目由 OpenAI 出资支持;OpenAI 拥有其中部分题目的独家访问权。
这一档一共 43 道题,其中 41 道是私有题目。
题目不公开,再加上独家访问权,这个 97.6% 的含金量各位可以自己掂量。
出题的、出钱的、考试的,三方名单里出现了同一个名字。
97.6% 背后的三层关系OpenAI出资赞助测试Epoch AI运营测试与出题Astra 应考Tier 4:97.6%43 道题里 41 道为私有题,OpenAI 拥有部分题目独家访问权以上标注来自 Epoch AI 官方页面,不是我加的来源:Epoch AI FrontierMath 页面(2026年6月 v2 版)
网络安全测试 ExploitGym 的 42.4% 也有类似问题,比上一代的 30.3% 强不少。
但这次 OpenAI 取消了惯例的 6 小时时间限制。
没有时间压力的考试,和历届成绩没法放进同一张表里比。发布会上的「最对齐模型」同样如此。
内部测试里,Astra 面对完不成的任务时越权乱来的比例是 0%,上一代是 48.2%。
听着好得吓人,但 OpenAI 自己在注释里承认:对照组是在没有生产环境安全防护的条件下跑的,两组数字不能直接比较。
同一场发布会上,首席科学家 Jakub Pachocki 的话更扎心。他承认 Astra 的思维链比上一代更难监控,还说:智能水平的提升,并不保证对齐能力也会同步提升。
如果无法确保未来的模型仍然能被有效监控,OpenAI 将暂停扩大模型规模。
一边宣布「AGI 时代」,一边承认「监控没跟上」。
这两句话出现在同一场发布会上,才是这场发布的完整底色。


第三盆冷水:价格先涨了



前面说的都是 OpenAI 挑出来讲的强项。它没怎么提的,是竞争最激烈的编程。
编程测试 DeepSWE v1.1,Astra 拿到 74.1%,比上一代强,但没拿到第一。
Meta 的 Muse Spark 1.3 公布的成绩是 75.4%;Claude Opus 5、Gemini 3.8 Flash 也都贴在 74% 附近。
这场测试一共 113 道题,第一名和第二名差 1.3 个百分点,换算下来就是一到两道题的差距。
官方对比图的处理也值得一提:图里没有 Muse,放的是 Anthropic 上一代 Fable 5.1 的旧成绩。这么一比,领先幅度看起来就大了不少。
编程测试 DeepSWE v1.1(113 题)前四名挤在 1.8 个百分点里,没有断层第一Muse Spark 1.375.4%GPT-6 Astra74.1%Gemini 3.8 Flash73.8%Claude Opus 573.7%GPT-5.6 Sol(上代)72.7%Claude Fable 5.1(上代)67.4%Astra 与第一名差 1.3 个百分点,约合 1 到 2 道题来源:OpenAI、Meta 公布成绩及 the-decoder 汇总(2026年9月)
能力上没拉开差距,价格倒是先到位了。
Astra 的 API 定价:每百万输入 token 10 美元,输出 50 美元。
是 Sol 当前促销价的 2.5 倍,和 Anthropic Fable 5.1 持平。
对比一下:Meta Muse 是 1.25 和 4.25 美元,Gemini 3.8 Flash 首发价 0.75 和 3.75 美元。
Brockman 对定价的说法是:真正重要的不是单个 token 卖多少钱,而是完成一项任务的总价。
这话不算错,OpenAI 也确实展示了 Astra 完成任务消耗的 token 更少。
但发布当天,普通开发者看到的事实就是一条:用上「AGI」,先付两倍半的钱。
叙事是拿来讲的,价格是拿来付的。涨价两倍半,不会说谎。


谁最需要这句话



Greg Brockman:OpenAI 联合创始人、总裁,Stripe 前 CTO,公司日常运营和对外叙事的核心人物。Astra 发布会的 AGI 表态,就是从他嘴里说出来的。
把时间往回拨三个月。6 月 8 日,OpenAI 向美国证监会提交了 S-1 上市申请文件,估值目标一度谈到 1 万亿美元。
WIRED 在报道这次发布时写得直白:OpenAI 正试图在计划中的 IPO 之前,快速推进技术、提振销售。
资本市场这边的天气并不算好。6 月 26 日,OpenAI 考虑推迟 IPO 的传闻一出,科技股跟着跌了一轮。
前车之鉴是 SpaceX:6 月上市当天冲上 1.77 万亿美元估值,随后股价从 202 美元高点一路滑回 153 美元,几乎跌回发行价(纽约时报报道的数字)。
对手也没闲着。几天前,Anthropic 刚发布 Fable 5.1 和 Mythos 5.1,把科学、编程、推理几条线的标杆都刷了一遍。
Astra 这场发布会,从时间上看就是一场贴身应答。
这场发布会,藏在一条什么线上6月8日提交 S-1上市申请文件6月26日IPO 推迟传闻科技股抛售8月底Anthropic 发布Fable 5.19月3日Astra 发布「欢迎来到AGI时代」
回头看,这场发布会最说明问题的,反而是它吹得并不成功:
编程没拿第一,强项分数个个带星号注释。
正因为手里可吹的硬料紧张,「AGI 时代」这句叙事才显得格外重要。
发布会上有记者问 Brockman:OpenAI 是否正式宣布实现了 AGI?他没有给出这个结论,只说可以由每个人自行判断。
真到了不需要证明的时候,是不需要喊话的。
资本市场需要一句新故事,AGI 恰好是眼下最贵的那一句。

结语

冷水泼完,说句公道话:Astra 大概率还是当前最强的模型之一,买来干活不亏。
但把「AGI 来了」当真,是另一回事。
看任何跑分,先问一句,这是模型分,还是「模型加装备」的团队分。
读发布材料翻到底部找小字注释。时间限制、对照组条件、独家访问权,这三样东西决定一个数字能信几分。
接下来各家喊 AGI 的次数只会更多。把它当成营销节拍器听,别当成时钟看。
分数会过期,注释不会。学会读注释的人,不会被任何发布会收割。
#GPT6 #OpenAI #AGI #AI泡沫 #人工智能
数据与引语来源:OpenAI 官方发布材料、Axios、CNBC、WIRED、VentureBeat、The New Stack、the-decoder、Epoch AI(2026年9月3日核查)。本文由老王与智谱 GLM-5.3-Flash 协作完成:多源交叉核查与初稿整理由 AI 完成,观点、判断与结论由老王负责。
喜欢就点击关注我哦~