把时间拨回12个月前,Claude Opus 4.1 Thinking、Gemini 2.5 Pro、GPT-5 High,这三款模型就是当时公认的第一梯队。现在再回头看,它们的能力坐标已经完全不同。

一年前的“最强”意味着什么

打开网易新闻 查看更多图片

那时候,这三款模型各自代表了不同路线的最优解。Claude Opus 4.1 Thinking主打推理深度,Gemini 2.5 Pro在多模态和长上下文上领先,GPT-5 High则把通用能力推到了一个新台阶。把它们放在一起比较,基本就能看出当时整个行业的天花板在哪里。

但“最强”从来都是有时效性的。12个月的时间,足够让一套评价体系彻底失效。今天再拿这三款模型去跑同一批任务,结果会让人产生一种错觉:它们好像从来没有“最强”过。

12个月里的能力飞跃

原文没有给出具体的评测分数,但有一个判断很直接:这三款模型是12个月前最好的模型。仅仅一年之后,再回头看它们,能感受到的已经不是“进步”,而是“飞跃”。这种飞跃不是某个单项指标的提升,而是整体能力台阶式的上移。

一个值得注意的细节是,原文用的是“incredible leaps”——复数。也就是说,过去12个月里发生的不是一次跳跃,而是多次连续的、叠加的跳跃。每一次跳跃都在重新定义“好模型”的标准。

回看的意义不在怀旧

把一年前最强的模型拿出来重新审视,不是为了感叹它们“过时”了,而是为了看清一件事:这个领域的迭代速度,已经快到让人来不及建立稳定的参照系。

今天被认为最强的模型,12个月后大概率也会被放进同一份“回看”名单里。到那时候,人们同样会惊讶于这一年又发生了什么。