不是,A社你不讲武德啊,

前天熬夜等Opus5不更新,还想着应该下周了,突然上线直接给我干懵了,准备了很多测试我特别想要复现的就是Opus5刚开始被爆料出来的3D game,因为如果真是这种程度的话,我就可以直接丢掉幻觉贼大的Opus4.8了。

打开网易新闻 查看更多视频
实测Claude Opus5,系统提示语删了80%,半价还能逼近Fable5。

OK,照例是先来看看分数,

这不对吧不对吧,Fable5不是应该横扫一切吗,你Opus5除了四个项(多学科推理, Agent 编程,法律和健康)怎么都给了Fable5一个大逼兜啊。

只能说订阅里的一半额度有去处了,不需要Fable5用完就只能GPT5.6了。就算没有账号用API也能烧得动了,输入5刀/每百万Token,输出25刀/每百万Token ,价格跟Opus 4.8一样。还有快速模式,速度加2.5倍,价格X2。

打开网易新闻 查看更多图片

100万上下文,知识更新到了26年的5月份,属于是新鲜出炉了。

在max effort下,距离Fable 5的最高分只有0.5%。而且在high,xhigh,max这几个档位上,它的性能成本比都压过了其他模型。

打开网易新闻 查看更多图片

还有一个最刺眼的评分,ARC-AGI-3分数居然是GPT 5.6的3倍以上,这个测试主要测的就是模型进入完全陌生的环境后,能不能通过试错迅速搞懂规则并完成目标。

打开网易新闻 查看更多图片

具体点说就是,把模型扔进一个从没见过的二维小游戏,只告诉它有哪些按钮,不告诉玩法,规则和胜利条件。模型需要自己建立规则模型,把前几关学到的规律用于后面的关卡。

所以现在我的执行路线从Fable5出计划,GPT5.6 sol做长时间执行,Sonnet5做短时间一次性任务执行,幻觉大的Opus4.8路边一条,变成了Fable5出计划,GPT5.6和Opus5并行执行,最后Fable5再整合就行,实测这个积分还是能撑得住,因为很多执行环节现在都可以直接转到Opus5做了。

刚刚还学到了一手,用网页版上的GPT-5.6 Sol Pro来做大型代码Review,又省一个额度。

Opus 5这次在X上测试最多的就是做这类3D场景的画面游戏。只能说同样提示语下GPT 5.6做出来了完全一坨。

实测Claude Opus5,系统提示语删了80%,半价还能逼近Fable5。

来都来了,我也做了一把3D游戏,Opus 5带关卡的设置和对应的NPC的智能设置置非常大而全,不像之前我们只能跟静物去互动。我做出来的这个逃生游戏,里面的机器人能够随机扫射你的位置,压迫感非常强。大家可以去看看我试玩的那一段,我自从被机器人发现的那一瞬间,就只活了5秒,就被电没了。

实测Claude Opus5,系统提示语删了80%,半价还能逼近Fable5。

最后还是我打了十年游戏的同学给我打到第二关的,我这个出游戏的居然连第一关都打不过。

打开网易新闻 查看更多图片

隔壁的GPT 5.6 Sol做出来的让我没啥试玩的冲动啊,机器人就跟个木头一样,我一个秦王绕柱就绕开了。

打开网易新闻 查看更多图片

最后来测试一下写作能力,

我的大Opus4.6会不会拉了,

直接输出故事,不要解释创作思路

先看看理工直男GPT 5.6 Sol,

文章一出我直接万人沉默,果然理工的脑子就不能让他写文章做人事。。。

打开网易新闻 查看更多图片

再看看下Opus 5,

打开网易新闻 查看更多图片

和Opus4.6的,

打开网易新闻 查看更多图片

我觉得这个千人千味啊,反正我们投票了好几轮。我是觉得Opus 4.6还是版本之子,但是已经开始有朋友觉得Opus 5 在这一篇文章的表达里面,更能把整个故事环境更拧成一条线。

简单来说,就是Opus 5写出来的故事更完整,但是 4.6 很会制造整体的悬疑。

所以大家觉得哪一个模型现在写作更好呢?

我还是会投Opus 4.6的。

最后的最后,这次A社还把Claude Code上80%的系统提示语去了,结合之前GPT 5.6 Sol出来了SuperPower这个辅助思考的Skill就可以直接删了,其实可以看到随着模型能力的上来,我们不太需要那么多的条条框框来规定模型的发挥了。

打开网易新闻 查看更多图片

我去看了一下,被删掉的主要是过量示例,硬性的不要做什么,重复约束,以及模型已经能够自行判断的内容。

隔壁OpenAI之前测试GPT-5.6 Model Guidance 也给过了对照数据,在一组内部coding-agent评测中,更简单的System Prompt反而让评分提高约10–15%,Token减少 41–66%,成本降低 33–67%

留下来的Skills越多,模型反而会越懵逼,强行兼容冲突,所以我一开始用GPT 5.6甚至会出现一个简单的问题想了一个小时的情况。

A社推荐我们用/doctor来给Claude Code做个大瘦身,能找出来长期未使用但仍有上下文成本的Skill、MCP和插件。我也把我之前给Codex做skill瘦身的提示语改造了一下,因为直接删掉可能有些触发词用习惯了还要重新安装,

发布、回滚、安全、隐私等低频关键 Skill 单独加RARE_CRITICAL 标签,不得仅因使用次数低而归档或删除。

打开网易新闻 查看更多图片

这样的话不会影响日常工作流的同时还会提升模型的效果,

所以这次最让我开心的,

不是Opus 5又拿了几个第一。

是它开始把Fable 5那种贵到有点不想睡觉天天都要打满5小时的能力,

往日常默认模型的上拉。

以前会觉得,Fable 5当然很强,

但额度和价格摆在这,除非任务真的很重要,不然根本舍不得开。

我还专门做了一个路由,就是Fable5是全程只需要动脑子不动手的,

这样我一周API价格才能控制在3000内

现在Opus 5摆在这里,

性能已经挤进了同一张桌子,

价格却直接砍了一大截。

我们的白月光回来了,

这次好像还没那么贵了。

@ 作者 / 卡尔 & yc星辰

最后,感谢你看到这里如果喜欢这篇文章,不妨顺手给我们点赞|在看|转发|评论

如果想要第一时间收到推送,不妨给我个星标

如果你有更有趣的玩法,欢迎在评论区聊聊

更多的内容正在不断填坑中……

打开网易新闻 查看更多图片