克雷西 发自 凹非寺
量子位 | 公众号 QbitAI
泄露了一路的Opus 5,刚正式登场就被网友玩疯了。
今天凌晨,Anthropic正式把这款新模型放了出来。

多项硬核评测上,它追平甚至反超了Fable 5,价格却只有一半。
Frontier-Bench上,它反超了包括Fable 5在内的所有对手,性能是上一代Opus 4.8的两倍还多。
CursorBench最高努力设置下,也贴近定价两倍的Fable 5峰值成绩,只差0.5%。

官方给出的demo里,有一个能实时显示气流路径的风洞,气流怎么绕过去看得清清楚楚。

还有一张能360度旋转的3D细胞结构图,连内质网上密密麻麻的核糖体都画了出来。

更耐人寻味的是,为了配上这代模型的判断力,Anthropic把自己给Claude Code写的系统提示词删掉了八成,成绩却没掉。
之前泄露的时候有网友感叹Opus 5简直就像fable 6,现在Opus 5正式发布之后,有人更赞同这个说法了。

网友已开启疯玩模式
Opus 5上线不过半天,网友们就已经开启了疯玩模式,接下来就来看看网友们都整出了什么活。
博主am.will本来觉得Opus 5不过是一个便宜版Fable,测完直接改口,说自己「大错特错」。
他只用了5倍Max订阅额度的27%,就让Opus 5搭出了他见过最好的一个Rocket League克隆版,游戏能玩,代码还开源在了评论区。

类似的反差,也出现在另一段动画演示里。
博主OmedTheVibeCoder做完测完一个竞技场对决的画面,评价从「以为会接近」变成「根本不是接近,是完全甩开了它」。
开头看到的「就是fable 6」的评价,正是看了这个结果说出来的。

后来他有放出了和其他模型的对比,并补充说自己「差点从椅子上摔下来」,因为Opus 5 Max直接打破了他原来的测试标准。
他表示,这已经不像是代码生成的画面,倒像是把提示词丢进了图像生成器,出来的却是一整张能走进去的地图。

另一位博主Alex Ermolov搭建的是滑雪场景,他给出的结论是「和Fable 5打平,甩开我测过的所有其他模型」,第一遍生成就没有明显穿模,滑行物理也对。

Minecraft复刻测试里,Chetaslua更是把这次生成称为「迄今为止最好的一次创作」。

把它接入到Unity,就像给游戏开了挂一样。

Opus 5对物理规律也拿捏的很精准,在这个连环机关场景当中,每个缓解都和真实规律严丝合缝。

Noema则给了Opus 5一个「狠」提示词,要求只用一个HTML文件,做出一整条从1945年变化到2055年的街区,建筑、车辆、店铺、人群、灯光和音效全部跟着年份走。
即使effort从max降到high,Opus 5的结果也把Fable 5、GPT-5.6 Sol都甩在了后面,Noema给的评价只有三个单词,「是个怪物」。

还有阿波罗任务的点火升空场景,从火箭喷焰到实时刷新的遥测数据,几乎全靠程序生成,没有拼现成素材库。

CAD设计上,网友也是直接给它封神,表示它在很多机械设计任务当中表现超越了fable。

教育场景上,开发者Matt Shumer给@AlphaSchool做了个实时AI家教原型。
Opus 5负责对话和方向判断,配合一个专门训练的小型世界模型做实时渲染,虽然还很粗糙,已经能一边讲分数概念一边在画板上同步画图。

另外我自己也试着让Opus 5(Low Effort)写了一个三羧酸循环过程的3D网页动画演示。
它的核心思路是只描述化学过程,把几何计算交给程序完成。
具体来说,Opus 5针对每幕反应只写原子清单与键表,每根键带有反应前后两个键级,由此同时定义底物与产物。
三维坐标交则由几何优化器现场求解,按元素和键级取标准键长,按配位数推杂化得到键角,再加上非键排斥与平面性约束迭代收敛。
产物构型则以底物坐标为起点再优化一次,使动画只保留必要位移,离去的小分子则自动被推开飞散。
最后,Opus 5将代码单独抽出,校验键长与键角,确认无误后再用Three.js渲染成球与圆柱。
最终交付的成果不仅正确体现反应过程,键长、键角等物质的真实结构信息,也都是按照实际渲染的。

atomic.chat则用三个破坏场景的题目,做了一次更细的横向对比,并且比较了成本。
同样是龙卷风卷起整片场地、重锤砸楼、卡车压塌桁架桥这三道题,Opus 5花0.508美元全部做对,Fable 5花的钱几乎是Opus 5的两倍,龙卷风卷不起地面上的东西,楼在锤子碰到之前自己就塌了,桥直接炸成一堆木棍。
GPT 5.6最便宜,0.14美元,但锤子压根没碰到楼,同期的Kimi K3和GPT 5.6水平相当。

之前Opus 5泄露时,有人怀疑它虽然单价低但token烧太多,综合下来并不比fable便宜,现在看来可能只是个例。
更硬核的自检流程
博主Victor M做了一次更硬核的自检演示,题目是照着波音747的公开数据,用代码在浏览器里重建出一架能转能看的3D模型。
Fable 5用42分钟交了活,4个文件、约1000行代码,搭了一套Puppeteer渲染管线,跑了17轮渲染,检查了54张截图,验证方式只靠肉眼看图对不对。
Opus 5花了71分钟,写出20个模块、约4000行代码,换成Playwright渲染管线,25套镜头预设,还多写了一个测量脚本。
而它验证的方式,是从渲染出来的画面里提取正射轮廓,算出翼展、轴距、机翼前缘扫掠角等14项具体指标,逐项去和波音747-400的公开数据核对公差。
它还做了几件Fable 5没做的事,前43分钟只渲染没贴皮的素模,确认轮廓过关了才上涂装,中途加了一个调试参数,能单独渲染某个子部件方便排查问题,最后把6个视角拼成一张联系表一次看完,不用一张张翻截图。
Victor M的结论是,Fable 5交货快了大概40%,尺寸表也更好读,但它用的是和Opus 5一样的747-400真实数据,却从没拿建好的模型反过来量过这些数据对不对。

之所以把这个例子单独拿出来说,是因为Opus 5这种「自己验证自己」的劲头,在Anthropic官方给的案例里同样能看到。

比如Frontier-Bench有一道题,给Opus 5一张机械零件的图纸,要求它写代码,用FreeCAD把零件重建成3D模型,却不给任何直接看图的方式。
它索性自己写了一套计算机视觉管道,从像素里提取几何数据,把零件重建了出来,而且反复成功,同样的设定下,其他模型试了五次都没做出来。
还有一个开源包管理器的真实bug,社区提交的补丁只处理了表面症状,Opus 5顺藤摸瓜找到了底层原因,把边缘情况一起修了。
另外,一位量化交易工程师用它给新交易所搭实时行情源,之前的模型全部做不出来,Opus 5发现没有实时数据可以验证,干脆自己搭了一套测试环境,专门检查代码解析交易所数据对不对。
一半价格咬住fable 5
看完这些demo,再来通过数据感受一下Opus 5的性价比。
价格上,Opus 5和前一代的Opus 4.8相比是提质不加价,依然是每百万token输入5美元、输出25美元,只要Fable 5的一半。
同时Opus 5也照旧配备了Fast模式,和之前一样是两倍价格换2.5倍速度。
比起价格,Opus 5在跑分上的赢面更让人意外。

Frontier-Bench v0.1这类硬核编程任务上,它拿到43.3%,把Fable 5的33.7%甩开一截,是自家上一代Opus 4.8(21.1%)的两倍还多。
Opus 5赢面最大的一项是ARC-AGI-3,专测那种模型压根没见过的全新问题。
它拿到30.2%,隔壁GPT-5.6 Sol只有7.8%,差了将近四倍,比上一代Opus 4.8更是翻了近20倍。

还有专门用来为难顶尖模型的高难度测试Human's Last Exam,不开工具的时候,Opus 5的得分是56.3%,和Fable 5的56.5%差距极小,而如果开启工具,Opus 5的成绩就会涨到64.7%,反超Fable 5的63.9%。

网页搜索、编程智能体指数、深度搜索问答这几项,Opus 5也都小幅领先,BrowseComp 90.8%对87.4%,AA Coding Agent Index 66.7%对65.8%,DeepSearchQA 95%对94.7%。
还有一个小插曲是,A社先前的一版通告里,在FrontierCode榜单上,把得分更低的Opus标成了获胜者,不过现在这个bug已经修正了。

电脑操作和业务流程这两项,差距拉得更大,OSWorld 2.0上的成绩是70.6%对66.1%。
而且,官方说Opus 5在这项测试里,只花了不到fable 5三分之一的成本。

之前在Opus 5泄露风波中频繁出现的cursor,其联创评价,Opus 5用Opus的价格实现了接近fable的性能。

除了官方通告里的那些数字,Opus 5也在今年的IMO 2026竞赛中取得了满分成绩,而且没有用任何外部工具。

另外,Opus 5也不像fable 5那么的守口如瓶了,其预计触发拦截的频率比后者降了约85%。

之前fable 5近乎变态的安全护栏确实让人感到头疼,现在有了Opus,或许就能缓解了。
CC系统提示词也改了
Opus 5发布的同一天,Anthropic工程师Thariq写了一篇文章,讲他们怎么给Claude Code这类产品设计上下文。
文章里最扎眼的一条是,Claude Code的系统提示词被删掉了超过80%,编码评测成绩却没有任何下降。
这80%的删减,就是专门针对Opus 5、Fable 5这代模型做的。

能删掉这么多,前提是模型的判断力已经追上来了,过去靠规则硬堵的地方,现在可以放手交给模型自己判断。
最典型的一条规则是「默认不写注释」。
早期模型判断力不够,团队怕它注释写得又多又乱,只能定死这条规则,但用户自己想要详细注释的时候,这条规则反而帮了倒忙。
现在这条规则被换成了「写代码时贴合周围代码的风格,匹配注释密度、命名和习惯」,判断权交还给了模型。

类似的逻辑也用在了工具设计上。
过去团队靠给例子来教模型怎么用工具,但例子越多,模型可选的路径反而被框得越死。
现在,团队反过来在工具接口本身上花心思,比如Todo工具只留「待处理」「进行中」「已完成」几个状态,模型自己就能判断该怎么用,不需要额外举例。

判断力上来了,上下文本身也不用一次性堆给模型。
系统提示词从一开始就把所有场景的说明塞进去,改成了「渐进式披露」,把代码审查这类不常用的说明单独拆成一个技能文件,模型判断需要时才自己去调用。
记忆也不例外,以前靠用户手动把信息写进CLAUDE.md,现在Claude能自己判断哪些信息值得记下来,直接存成记忆。
这些变化背后是同一个判断,规则、例子、记忆,本来都是给判断力不够的模型搭的脚手架,现在脚手架被一根根拆掉,因为模型自己就能接得住。
One More Thing
Opus 5发布之后,马斯克也来蹭了波热闹。
他放了一张FrontierCode的性价比截图,表示只有Grok 4.5和Opus 5处于帕累托前沿,也就是多目标优化问题中所有“最优权衡解”构成的一条边界线。

按他的说法,Grok 4.5虽然表现不及Opus 5,但价格便宜,是同等性能下最低价的模型之一。
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8v2mCn5CSVL

小同爱分享2 个月前
命没了还有轮回,钱没了,死都不甘心。 - 小同爱分享
小同爱分享5 个月前
疫情,就是让人抑郁,又没了感情。 - 小同爱分享