打开网易新闻 查看更多图片

来源|Tech星球

| 华卫

今天(9月4日),OpenAI 发布新一代前沿模型 GPT-6 Astra,并直接甩下一句:Welcome to the AGI era(欢迎来到AGI时代)。

最近的大模型行业,新模型的出现简直像坐火箭。9月仅仅过去了四天,就有四家海外巨头轮番上阵。第一天,Anthropic宣布推出Claude Fable 5.1和Mythos 5.1。第二天,谷歌发布了Gemini 3.8 Flash和专攻网络安全的Gemini 3.8 Flash Cyber,Meta祭出Muse Spark 1.3。

国内市场的发布节奏同样快得惊人。上一周,三家国内开源模型厂商发了新模型,阿里千问Qwen3.8-Flash、智谱GLM-5.3-Flash和腾讯混元Hy4 preview都上线了。再往前推两周,DeepSeek V4 Pro、Grok 4.6、谷歌Gemini 3.7 Flash、智谱GLM-5.3接连在48小时内亮相。

Benchmark排行榜上,最强模型的保质期越来越短了,从登顶榜首到被超越,现在根本撑不过一周。模型厂商似乎要完成某种KPI一样,扎堆上线,“周抛”,正在成为大模型的新常态。

大模型厂商,已经等不起了

在最新模型的发布中,OpenAI 和谷歌都不约而同地提到RSI机制上的巨大飞跃。该机制的核心是AI 参与乃至改进自身研发流程、从而持续缩短模型迭代周期,全称是Recursive Self-Improvement(递归式自我改进)。

OpenAI 强调,Astra是第一款由前代模型深度参与训练监督的旗舰产品。谷歌 DeepMind 大牛姚顺宇表示,Gemini 3.8 Flash对 RSI 来说是一次巨大飞跃。

作为本轮模型发版加速的重要推手,RSI 即将开启模型发布的新周期,可以预见模型进化的速度将会更快,周抛马上要成为过去式。

除了用模型加速自身的内部研究,另一个重要原因是,大模型研发正在从一次“造神”的大工程,变成越来越标准化的“流水线”式训练。

过去,新模型发布是一件很重的事情。无论是数据、训练周期还是算力,都需要巨额投入,研发周期动辄几个月甚至更久。模型厂商也不会轻易发版,一旦推出新模型,就意味着一次重大的“代际升级”,可能要被讨论上几个月。

但现在,这套节奏正在被打破。

基础模型训练方法越来越成熟,后训练、强化学习、推理优化、数据处理等环节也越来越工程化。一个新模型不一定意味着从头训练一个完全不同的巨型模型,而能够基于已有模型底座,通过强化推理、代码、Agent、视觉等特定能力,或者进一步优化速度、成本和上下文能力,快速推出一个新版本。

模型的“代际”概念也因此开始变得模糊。新模型不一定意味着一次彻底的技术跃迁,更像软件产品小版本迭代:能力有提升,体验有变化,价格可能更低,但底层架构未必发生翻天覆地的变化。

此前,智谱就明确表示,GLM-5.3 和 5.2 使用同一个基础模型,所有提升全部来自后训练。阿里通义团队在发布 Qwen3.8-Flash-Next 的开源权重时透露,Next 新架构将是全新一代 Qwen4 系列模型的雏形。

还有一个变化是,模型厂商开始越来越频繁地发布“小版本”和“专用版本”。他们的发版目标,从追求“做出一个最强模型”,拆成推出“瞄准某个具体需求而且可以马上用起来”的专项版本。

这也是为什么今年“Flash”越来越密集地出现在各家模型产品线中。它们并不一定追求在所有指标上击败旗舰模型,而是把速度、成本、推理能力或者特定场景做到更极。并且,Flash 参数规模相对较小,修改和重新训练模型所消耗的算力更低,进一步降低了模型发布的门槛和周期。

与此同时,开源模型“闪电战”般的密集发布,正在把大模型竞争拉进一个更加实时的维度。对开源阵营来说,它们甚至不一定需要在每次发布中都全面击败最强模型,只需要不断缩短与其的距离。而这种持续追赶,本身就是一种竞争压力。

过去,大模型行业“分工”清晰,开源模型“卷速度”,闭源巨头则更习惯集中资源做长周期研发,每次发布就是一次重磅升级。但现在,连过去最有能力“憋大招”的闭源巨头,也开始运行这套高频迭代的发布规则。从Gemini 3.7 Flash到3.8 Flash,谷歌只用了3周。

模型发布的常规周期一旦缩短,整个行业的“时间感”都会改变。以前半年不更新,市场觉得正常。现在几周不更新,大家就会开始怀疑:“你是不是掉队了”。如今,模型的更新速度本身,已经开始成为竞争壁垒了。

没有绝对TOP,模型越来越像“快消品”

如果说2023年的大模型是“奢侈品”,稀缺、昂贵、少数巨头独占。那么,2026年的模型市场,正在变成一场“快消品的盛宴”。

现在,“绝对领先”已经不适用于这个行业了。Benchmark排行榜越来越像模型的“实时股价”。“谁是第一?” 不再是用户口中讨论的焦点,大家只关心: “今天哪个模型最好用?”换个任务场景选择可能就不同了。

OpenAI 刚发的 GPT-6 Astra 就是一个典型例子。在其内部测试中,GPT-6 Astra以同样的标准版定价,在多项基准都拿到了高于Claude Fable 5.1的得分。但在“人类最后的考试”测试中,Astra 使用工具的得分为 57.2%,低于 Sol 的 65.0% 和 Claude Fable 5.1 的 63.8%。在第三方机构 Artificial Analysis的横测中,Astra 的 Coding Agent Index 比 Fable 5.1低 3分。

模型越来越多,能力差距收窄了。每家都有自己的“第一”,没有谁一骑绝尘。

价格也被打下来了,“最强模型”越来越不值钱。 Anthropic刚发布的Fable 5.1,缓存读取费用下调75%,每百万 token 只需 0.25 美元。对于常规任务来说,整体的成本比 Fable 5 降低了约 25%;大量使用 AI 智能体的复杂任务能够节省的成本更多,最高能够达到 45%。

8 月,OpenAI 还发帖宣布:未来三个月内,GPT-5.6 Sol 的 API 调用价格与超额信用额度全面下调超过 20%。数据服务商Silicon Data公开的最新数据显示,今年全球每百万token推理均价已从5月底的2.04美元跌至8月初的1.16美元,创年内新低。

更关键的是,各家模型正在主动降低切换的技术门槛,接入新模型不一定意味着从底层重写一套系统。腾讯最新发布的 Hy4 preview 支持 OpenAI Chat Completions、OpenAI Responses以及Anthropic Messages 三种API协议,Qwen和智谱的GLM-5.3同样提供兼容OpenAI Chat Completion和Anthropic Messages规格的API。

上下文长度也不再能“绑定”特定模型,现在有更多替代方案了。Gemini 3.7和3.8 Flash都支持约104.8万Token输入上限,Hy4采和Qwen3.8-Flash都提供了1M Token上下文窗口。

当然,这并不意味着所有用户真的会在实际任务中每周换一次模型。但需要注意的是,用户越来越没有理由对某一个模型保持长期忠诚。现在的大模型市场,品牌崇拜正在退场,取而代之的是一种“超市货架式”的随取随用,没有稀缺性、迭代速度贼快且切换无负担。

谁最焦虑,谁又在狂欢?

于是,一个很有意思的局面出现了:模型厂商越来越焦虑,开发者和普通用户却越来越开心。

当模型进入高频迭代,模型厂商几乎没有“喘息期”。一次发布建立的领先优势,很快就可能被下一轮更新追上。它们不仅要做出比上一代更强的模型,还需持续证明自己没有落后。

但对于开发者和普通用户来说,感受却完全不同。模型发布越来越快,数量越来越多,他们反而越方便“货比三家”,重要的是只有三个问题:好不好用、够不够便宜、能不能完成任务。

情况稍显棘手的,可能是那些把大模型深度嵌入业务流程的企业。模型越来越多之后,持续的模型评估、选择正在变成企业新的工程负担。不同模型在推理、代码、Agent、速度、价格等维度各有优劣,而模型又在持续更新,今天的最优解很可能很快被新的版本打破。

更麻烦的是,企业很难像普通用户一样“说换就换”。企业已经围绕原有模型搭建了Prompt、知识库、工具调用、Agent工作流和评测体系,模型一旦更换,不仅是修改一个API参数,实际上可能很多业务流程与环节都需要重新测试和调优。

因此,在B端市场,大模型比拼的下一阶段,可能不只是模型厂商之间争夺用户,而是围绕“谁能更低成本地选择、切换和组合模型”展开,这或将成为新的竞争力。

今天的行业TOP,只属于今天。因为下一代模型,可能下周就来了。

“周抛”改变的,或许不只是模型发布的频率,而是大模型行业的竞争逻辑:“领先一次”远远不够,真正决定胜负的,是谁能更快进入下一轮。