Claude Opus 5:智能接近Fable 5,价格减半,ARC-AGI 3得分三倍于次优模型
2026年7月25日,Anthropic投下了一颗"性价比炸弹"——发布Claude Opus 5,其智能水平接近旗舰Fable 5,但价格直接砍半:输入$5/M tokens,输出$25/M tokens。在Frontier-Bench v0.1上性能超过Opus 4.8两倍以上,在ARC-AGI 3上得分是次优模型的三倍。即日起成为Claude Max默认模型和Claude Pro最强模型。
AIHOT编辑的评价一针见血:"Anthropic这次把Opus的性价比条拉满了,性能翻倍价格减半,实际编码和知识工作基准已经超越所有模型。最打动我的是它自查自纠的严谨,写代码像真开发者一样审自己的页面,这种责任心以前只在人身上见过。"
这不是一次普通的模型迭代,而是Anthropic对"最强模型"定价逻辑的重新定义——当性能逼近天花板时,下一场战争不是"谁更强",而是"谁更值"。
"Anthropic这次把Opus的性价比条拉满了,性能翻倍价格减半,最打动我的是它自查自纠的严谨,写代码像真开发者一样审自己的页面。"——AIHOT编辑推荐语
1 Opus 5到底有多强?三组数据说明一切
先看硬核数据,三个维度:
第一,Frontier-Bench v0.1:性能超Opus 4.8两倍以上。Frontier-Bench是Anthropic自研的前沿能力评测基准,涵盖编码、数学、科学推理等高难度任务。两倍以上的提升意味着Opus 5在"真正的硬核工作"上,不是"好一点点",而是"降维打击"。
第二,ARC-AGI 3:得分是次优模型的三倍。ARC-AGI(抽象推理语料库-通用人工智能)是业界公认最难的AI推理测试之一,测试的是"从未见过的抽象模式识别能力"——不是靠背题能刷出来的。三倍于次优模型,意味着Opus 5在"真正的智能"上建立了代差优势。
第三,价格减半。输入$5/M tokens,输出$25/M tokens,比Opus 4.8便宜一半。这意味着用Opus 5跑一个中等规模的Agent任务,月成本可能从几百美元降到一百多美元。对于重度用户来说,这是实实在在的省钱。
性能翻倍+价格减半=Anthropic正在重新定义"最强模型"的定价逻辑
2 为什么说这是"性价比革命"?三个行业信号
Opus 5的发布,传递了三个重要的行业信号:
信号一:AI模型的"摩尔定律"正在加速。从Opus 4.8到Opus 5,性能翻倍、价格减半,周期不到一年。这不是"技术进步",这是"技术革命"。如果这个趋势持续,到2027年,我们可能用今天十分之一的成本,获得今天十倍的智能。
信号二:Anthropic在打"性价比"牌。在OpenAI、Google、Anthropic的三国杀中,Anthropic选择了一条差异化路线:不是"做最便宜的模型",而是"做最强模型中最便宜的"。Opus 5的定位是"Fable 5级别智能,但价格只要一半"——这就像iPhone Pro的性能卖iPhone标准版的价格,杀伤力巨大。
信号三:AI编码工具的"隐形升级"。Opus 5即日起成为Claude Max默认模型和Claude Pro最强模型,同时Claude Code v2.1.219已支持Opus 5+1M上下文+嵌套子智能体。这意味着所有Claude重度用户,从今天起用同样的价格,获得了翻倍的编码能力。这种"无感升级"是最可怕的——用户不需要做任何操作,竞争力就自动提升了。
Claude Opus 5 核心数据
智能水平:接近Claude Fable 5
价格:输入$5/M tokens,输出$25/M tokens(较Opus 4.8减半)
Frontier-Bench v0.1:性能超Opus 4.8两倍以上
ARC-AGI 3:得分是次优模型的三倍
默认搭载:Claude Max(默认)、Claude Pro(最强)
Claude Code:v2.1.219支持,1M上下文+嵌套子智能体
3 "自查自纠"的严谨性:AI开始像人一样"审自己的代码"
AIHOT编辑提到一个容易被忽略但非常重要的细节:Opus 5"自查自纠的严谨,写代码像真开发者一样审自己的页面"。
这听起来像一句赞美,但背后是AI编程范式的根本变化。之前的AI编程模型,基本是"你说需求它写代码你看结果"。如果代码有bug,你需要自己发现、自己反馈、自己修。而Opus 5引入了一种"自我审查"的能力——它在写完代码后,会像一个有经验的开发者一样,自动检查自己的输出是否有逻辑错误、边界问题、性能隐患。
这意味着什么?
第一,AI编程的"可信度"大幅提升。以前AI写的代码,你需要逐行审查;现在AI自己先审一遍,你只需要做"二审"。这就像从"让实习生写代码"升级到"让高级工程师写代码"——输出质量本身就有保障。
第二,与"系统提示词精简80%"相呼应。同一天,Anthropic还公布了Claude 5代模型的上下文工程新规则:删除了Claude Code超过80%的系统提示词,编码评测无显著损失。这说明Opus 5的"自我审查"能力不是靠"给它写更多规则"实现的,而是模型本身就具备了这种"自觉性"——不需要你告诉它"要检查代码",它自己会检查。
第三,这对Agent应用是重大利好。Agent的核心痛点是"可靠性"——如果Agent写出的代码有bug、做出的决策有漏洞,整个Agent链条就会断裂。Opus 5的自我审查能力,让Agent在"自动执行"的过程中有了"自检"机制,大幅降低了出错概率。
从"写代码"到"写代码+审代码"——AI编程正在从"工具"进化成"搭档"
4 冷静看待:Opus 5的"天花板"和"隐忧"
尽管数据亮眼,但几个问题值得清醒:
第一,Opus 5≠Fable 5。"接近Fable 5"不等于"等于Fable 5"。在需要极致推理的场景(如数学证明、前沿科学研究),Fable 5仍然是Anthropic的"天花板"。Opus 5的定位是"最强性价比",而不是"绝对最强"。
第二,竞争格局正在变化。OpenAI的GPT-5.5、Google的Gemini 3.5、DeepSeek V4等竞品都在路上。Opus 5今天的"性价比优势",可能在几个月内被追平。AI模型竞争的"红皇后效应"——你必须不停奔跑,才能留在原地。
第三,自我审查≠完美。Opus 5的自我审查能力虽然惊艳,但在复杂任务中仍可能出现"审查不彻底"或"误判"的情况。将AI的输出直接用于生产环境,仍然需要人类把关。
AI模型的"性价比曲线":从"越强越贵"到"越强越便宜"
2024-2025(参数竞赛期):更强=更多参数=更贵。GPT-4、Claude 3.5、Gemini 2.0,价格和性能同步上升。
2026上半年(效率竞赛期):更强=更聪明架构=差不多贵。DeepSeek V3、蚂蚁百灵、MiniCPM,用MoE和蒸馏技术降本增效。
2026下半年(性价比竞赛期,Opus 5开启):更强=翻倍性能+减半价格。AI公司开始主动降价,模型能力逼近天花板,竞争焦点从"谁更强"转向"谁更值"。这对用户是最大的利好——AI智能正在从"奢侈品"变成"日用品"。
Opus 5的意义不在于"又出了一个更强的模型",而在于"最强模型的价格开始下降"。当性能逼近天花板,Anthropic选择用"降价"而不是"涨价"来争夺市场——这意味着AI模型的"价格战"已经打响,受益的将是每一个AI用户。