编辑|Panda、山辉
8 月 17 日零点,DeepSeek 新的 API 价格正式生效。
V4 全系启用峰谷分时计费,工作日 9:00 至 12:00、14:00 至 18:00 按高峰价结算,其余时段价格减半。想不到,大模型也有需要「错峰用电」的一天。
第三方核算显示,V4 Flash 闲时缓存未命中输入价格上涨约 57%,闲时输出上涨约 136%,高峰时段的输出价格则接近旧价的 4.7 倍。
涨价的不止一家。此前 OpenAI、谷歌和 Anthropic 已相继上调 API 价格或收缩免费额度。过去两年,大模型厂商一路把价格往下打,在 2026 年下半年,这条价格曲线却开始集体掉头。
原因并不复杂。推理需求的增长跑赢了算力供给的增长,而 Agent 把单次调用变成了几十次调用。当账单从「一问一答」变成「一个任务跑几小时」,此前靠补贴维持的低价就撑不住了。
能力向上,价格还能不能向下?这成了大模型真正进入生产环境前的一道必答题。
就在刚刚,阿里交出了一份让人满意的答卷:发布了Qwen3.8-Flash,同步开源Qwen3.8-Flash-Next(两者为同一模型,前者是 API 版本名称,后者是开源版本的正式名称)。
它的成绩相当亮眼。在智能体编程基准 DeepSWE 1.1 上,它拿到 58.7 分,而参数规模是它三倍的前代 Qwen3.7-Plus 只有 16.5 分;长周期办公任务 CoWorkBench 和专业岗位任务 JobBench 上分别为 73.9 和 55.7 分,明显高于 Claude Opus 4.6(Max)的 68.2 和 36.6 分;多模态方面,AndroidWorld、ERQA、MathVision 等基准同样大幅领先。它并非全面占优,HLE 上的 35.9 分仍落后于 Opus 4.6 的 40.0 分,仓库级代码生成 NL2Repo-Bench 也不及 DeepSeek-V4-Flash-0731。
但真正的反差在价格。Qwen3.8-Flash 在千问 AI 平台的定价为每百万 token 输入 1 元、输出 3 元,仅为本月初发布的 Qwen3.8-Max 的十二分之一,也低于 DeepSeek V4 Flash 在 8 月 17 日调价后的闲时价格。
在一个几乎所有模型都在涨价的月份里逆势压价,补贴显然不是可持续的答案。Qwen 给出的答案是:向模型架构要空间,重写每一个 token 的生产账单。
AI 的斩杀线
「斩杀线」是过去半年中文 AI 圈流行起来的说法:大模型切换成本极低,开发者更换底层模型几乎没有迁移负担,一款模型的性价比一旦落到某条线以下,就不是缓慢失去份额,而是迅速失去商业存在感。
值得注意的是,这条线的刻度正在换算方式。衡量单位不再是每百万 token 多少钱,而是跑完一项真实任务要花多少钱。
其中一项重要的行业参考是 Artificial Analysis 采用的「每任务成本」。按这一口径,Claude Opus 4.8 在最大推理档下能力智能得分 57 分,每任务成本 2.03 美元;DeepSeek V4 Pro 在同档下得 53 分,每任务成本 0.25 美元;V4 Flash 0731 得 52 分,0.11 美元,得分与之相同的 GPT-5.6 Luna 价格还更低,仅有 0.05 美元。
这也是「斩杀线」开始真正变得残酷的地方。此前,DeepSeek-V4-Flash 就曾凭借更低的任务成本和相对较高的能力,把一批「能力更弱但价格更高」的模型压到了性价比前沿之外。如今,Qwen3.8-Flash 又试图继续推动这条前沿:从目前 Qwen3.8-Flash 的三方性能水平及 API 定价来看,(性能比 DeepSeek-V4-Flash 强,价格低至其 1/3),这条模型「斩杀线」将再次抬高(如图所示),推动 AI 大模型产业往更高智能、更低价格的实用方向演进。
另外一个现象也值得关注:Artificial Analysis 在 6 月 30 日的一篇分析中指出,Claude Sonnet 5 的每任务成本为 2.29 美元,较上一代翻倍,而它的输入输出单价没有任何变化。增量全部来自 token 用量:在两项知识工作评测中,它的智能体轮次约为前代的三倍。单价没涨,账单翻倍。
不仅如此,Agent 还在另一个方向上放大差距。多步骤任务的成功率约等于各步成功率的连乘,单步 95% 与 90% 只差五个百分点,二十步之后却是 36% 与 12%,而失败重试还要重新支付一遍 token。一个便宜但常常失败的模型,最终未必更省钱。
这就把压力交回给了模型本身。既然低价不能靠补贴长期维持,能力又不能打折,那么唯一的出路,就是在同一份算力里榨出更多智能。
而 Qwen3.8-Flash 的答案,就藏在它的另一个名字里。
Next:下一代模型的预演
Qwen3.8-Flash-Next 这个名字里,「Next」非常值得关注。正如已经预热了一整天的 Hugging Face 和 ModelScope 模型页面上写的那样:Qwen3.8-Flash-Next 是 Qwen4 架构的一次预演。
实际上,这种预演,阿里之前已经做过一次。
2025 年 9 月发布的 Qwen3-Next 引入了 Gated DeltaNet 与 Gated Attention 混合结构,此后被 Qwen3.5 一路沿用到 Qwen3.8 系列。它并不是某一代的旗舰,而是一次结构预告:先在中等规模的模型上把新架构做出来交给社区检验,再铺到整个家族。
这一次,还是同一套动作。Qwen 在技术博客中明确写道,Qwen3.8-Flash-Next 承担的角色与 Qwen3-Next 对 Qwen3.5 的角色一致,是 Qwen4 所用模型结构的先导预览,提前释出结构改动,以便在其上构建 Qwen4 完整模型家族之前先让社区检验。
而如果将它放回 Qwen3.8 这一代的产品序列之中,我们还能看见更大的图景。
8 月 3 日发布的 Qwen3.8-Max 是这个系列的能力上限,总参数 2.4T、激活 95B,支持约 100 万 token 上下文与图像视频输入,8 月 12 日以 Qwen3.8-2.4T-A95B 之名开放权重,是 Qwen 的 Max 级旗舰首次开源。8 月 14 日,面向本地部署和开发者生态的 Qwen3.8-27B 开源,并且昨天还登顶了 Image-to-WebDev 竞技场开源模型排行榜。
就在刚刚,Qwen3.8-Flash 补上了最后一个位置,承接高频、长期、规模化的真实调用。但其架构却与家族内其它模型大不一样:Qwen3.8-Max 是基于前代 Qwen3.5 架构迭代而来的,而这次的Qwen3.8-Flash 用的是一套全新架构。
也就是说,新架构没有先给到旗舰,而是先上了性价比款。
按过去几年的惯例,架构创新通常先在最大规模的模型上证明自己,再逐级下放,而这一次的路径是反的。一种可能的解释是:这套架构想要提升的不只是智能水平,更是「单位计算的智能产出」,即「在极致的架构优化下,用更少的算力完成同样甚至更复杂的任务」。那么,最合适的验证场就是对成本、速度、吞吐更敏感的 Flash。
那么这一次,新架构究竟改了什么?据 Qwen 团队介绍,这次的系统升级围绕四个方面展开:Attention、Residual、Embedding 和 Optimization。它们分别对应模型的注意力机制、层间信息通路、参数存放方式,以及训练优化方案。
四大技术创新,暴夯模型效率
先看看这个模型的基本信息。Qwen3.8-Flash 是一个多模态 MoE 模型,主模型参数量125B,另外配备51B 的 N-gram Embedding,而每个 token 只激活 6B 参数。它原生支持262,144 token上下文,并可通过 YaRN 扩展至100 万 token。
这组数字里最关键的是6B。作为对照,被它拿来做对比的前代 Qwen3.7-Plus 总参数 397B、激活 17B。也就是说,新模型要用不到前代三分之一的激活参数,去换取相当甚至更强的能力。这显然不是某一处巧思能够做到的,而需要在模型最基础的几个部件上同时动手。
Qwen3.8-Flash 的四个升级方向恰好对应了成本结构中的四个环节:Attention决定长上下文里要算多少、搬多少数据;Residual决定信息在层与层之间会损耗多少;Embedding决定参数能不能被放到显存之外;Optimization则决定这一整套结构能不能被稳定且低成本地训出来。
注意力:GDN 负责记住,QSA 负责查找
这是智能体的时代,也是长上下文的时代,而长上下文的麻烦在于,标准注意力的计算复杂度随序列长度二次增长,而真正的瓶颈往往不在计算量本身,而在数据搬运。推理的两个阶段瓶颈并不相同:Prefill 阶段卡算力,Decode 阶段卡带宽,后者的带宽需求正比于层数、已生成序列长度、KV 头数、头维度与精度字节数的乘积。序列越长,GPU 就需要更多时间来等待数据。
行业给出的解法大致分成两条路:
- 线性注意力,把过去的状态压成固定大小的隐状态,用常数级的内存换掉二次增长,代价是精确回溯特定信息的能力会下降。
- 稀疏注意力,保留标准注意力的形式,但只对真正重要的部分做精细计算。
Qwen 的选择是把两者混起来。这不是本次才有的选择:Qwen3-Next 已经是 Gated DeltaNet(GDN)与 Gated Attention 的混合架构,两者按 3:1 的比例交错,四分之三的层用线性注意力,四分之一保留标准注意力。
GDN 的设计要点是门控机制负责快速清除过期记忆,delta rule 负责精确更新特定记忆位置而非全量覆盖,从而在保持线性复杂度的同时逼近完整注意力的表达力。其中的门控部分来自 Qwen 团队的论文《Gated Attention for Large Language Models》,该研究获得了 NeurIPS 2025 最佳论文奖,核心结论是门控为注意力引入了非线性和输入相关的稀疏性,并顺带消除了注意力池与巨量激活现象,让训练过程中的 loss 波动大幅减少。
本次的新东西是那剩下的一层。Qwen 在全局注意力上引入了自研的Qwen Sparse Attention(QSA)。
稀疏注意力的通行思路是只关注重要的上下文,以此减少长序列下的计算。但这里有一个容易被忽略的成本:要知道哪些上下文重要,本身就需要计算。Qwen 在技术博客中指出,DSA 等现有方案通常仍需要一个 token 级的 indexer 来寻找重要位置,随着上下文增长,indexer 自身的开销也会逐渐变得不可忽略。
QSA 的做法是把这一步也压缩掉。轻量 indexer 先把序列聚合成 micro-block,在 block 粒度上估计上下文的重要性,再选出最相关的区域执行 Attention。这样减少的不只是 Attention 的实际计算量,还有「寻找重要上下文」的 indexing 成本。
而且 QSA 在每层内部独立完成序列压缩,对跨层注意力相似性的依赖更小,这对 GDN 与 Attention 交替出现的混合架构尤其关键。
可以简单理解为:GDN 负责高效「记住」,QSA 负责精准「查找」。
效果上,在 1M token 的设定下,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现了最高 7.6 倍和 4.9 倍的加速。在更贴近线上高缓存复用的实验设定下(Prefix Cache 命中率 90%),Qwen3.8-Flash 在 1M 上下文下的 Prefill 吞吐达到 Qwen3.7-Plus 的8.6 倍。
作为行业对照,同期其他团队走的是相邻但不同的分支。DeepSeek 的原生稀疏注意力 NSA 把注意力拆成压缩、选择和滑动窗口三个分支再用门控聚合;到了 4 月发布的 DeepSeek V4,方案变成 CSA 与 HCA 的组合,前者先压缩 KV 条目再做稀疏选择,配合 FP4 精度的 Lightning Indexer 加速索引。
一边是线性加稀疏的混合,一边是压缩加稀疏的组合。这是目前长上下文效率问题上并行的两条主流解法,谁更适合哪类负载还没有定论。
残差:一条通路变成四条
Qwen 团队也对 Transformer 里面经典的残差组件进行了升级。
传统 Transformer 中,各层持续在同一条 Residual Stream 上读写信息,网络越深,早期特征越是与后续信息混合,重要信息更容易被逐渐稀释。
Qwen 引入的Gated Residual(GR)是两种思路的结合。一方面它延续了 Hyper-Connection 把 residual stream 扩展为多分支的设计,另一方面把 GatedNorm 的逐元素动态门控融进了 residual read。最终,原本单一的 residual stream 被扩展成 4 条并行分支,模型可以根据当前内容动态决定从哪条分支读多少、往哪条分支写多少。
我们可以把它理解成把一条信息通道扩成多条车道:有些分支负责局部信息传递,有些则可以把早期信息直接保留到很深的网络层。Qwen 团队观察到,其中一条 branch 会自然形成一条连接第一层 Attention 和大部分中后层的长距离通道。这个观察比设计本身更有说服力:它说明多分支不是冗余,模型确实用出了不同的分工。
GR 还对 Hyper-Connection 做了简化。Qwen 团队发现,当 read 和 write 足够灵活之后,额外的 branch mixing 已经没有明显收益,因此直接去掉,减少访存开销和不稳定因素。归一化后的 Gate 则能有效抑制 activation outlier、提升训练稳定性。此外,Residual State 支持用 FP8 存储进一步降低访存开销。
把这处改动放回行业里,从字节跳动 Seed 提出 Hyper-Connection,到 DeepSeek 用 mHC 解决它的深层信号发散问题并用在 V4 上,十年没有变过的残差连接,正在成为 2026 年新的架构战场。
N-gram Embedding:低成本扩展模型容量
这可能是本次架构改动中最值得细说的一处。
模型参数量的 scaling 已经越来越费劲。参数越多知识容量越大,但每一个 token 都要为被激活的那部分参数付出计算代价,而 MoE 的稀疏化能压缩的是激活比例,压不掉参数本身要占的显存。
Qwen 这次的做法是在 Transformer 参数之外单开一个维度:普通 Embedding 根据单个 token 查表;N-gram Embedding则结合当前 token 与前几个 token 组成的局部上下文来查表,为常见短语和局部模式提供额外的表示。它的核心优势是可以增加大量参数,同时几乎不增加每个 token 的计算量。
Qwen3.8-Flash 额外引入了 51B 的 N-gram Embedding 参数,而模型只在前部使用一层 N-gram Embedding。这相当于以较低成本挂了一个大规模的局部模式记忆库。
这里有一个对理解成本结构很关键的性质:查询位置可以提前确定。与 MoE 依赖运行时隐状态做动态路由不同,N-gram 的查询索引只取决于输入的 token 序列,在前面几层开始计算之前就已经能算出来。这意味着这 51B 参数可以直接存放在 Host Memory 中,通过异步 Prefetch 与模型计算重叠,无需长期占用 GPU 显存。Qwen 在 Base 模型的评测说明中也点明了这一点:51B 的 N-gram Embedding 参数是确定性寻址的,不进入每 token 的矩阵乘预算。
这一设计受到了 Gemma 3n 的 Per-Layer Embedding 与 DeepSeek Engram 等工作的启发。值得记一笔的是,提出 Engram 的 DeepSeek 自己并没有在 V4 上启用它,只将其列为未来方向;而 Qwen 选择先把这条思路做进了一个即将开源的生产模型。
架构和优化协同设计
前面三处改动的目标都是提升模型效率,第四处改动则是把它们训出来的方法。
Qwen3.8-Flash 使用 Muon 优化器训练。Muon 通过对动量矩阵做正交化来加速收敛,此前 Moonlight、Kimi K2 与 DeepSeek V4 都已用过;Qwen 这次是把它的用法进一步工程化,集中在正交化精度、Muon 与 AdamW 的参数分工,以及融合参数矩阵的拆分三个问题上。
分工上的原则是,真正作为二维线性映射的参数用 Muon,例如 Attention、GDN 和 MoE Expert 中的主要权重;而 Embedding、MoE Router、GR 的低秩参数等则继续交给 AdamW。至于工程实现中被融合存储的 QKV、SwiGLU 和 GDN Projection,则先按实际对应的独立线性变换拆开,再分别执行正交化。
针对新结构和新优化器,Qwen 团队还重新拟合了 Scaling Law。
结果是模型可以稳定使用更大的学习率和批量大小,收敛效率和大规模并行训练吞吐都因此提升。其中一个发现足以改掉不少团队的默认配置:过去大模型训练中常见的 Batch Size Warmup 已经不再必要。实验显示,从小 Batch 逐渐增加到目标 Batch 并没有改善最终效果,反而要额外执行 18.8% 的 optimizer steps。最终的训练配置直接从目标批量大小开始。
其余组件沿用了 Qwen3-Next 确立、并在 Qwen3.5 至 Qwen3.8 系列中不断打磨的设计,包括极致稀疏的 MoE(较大的专家池、每 token 只路由少量专家并配一个共享专家)、多 token 预测(MTP 模块以多步方式训练以保持训练与推理的一致性,其中的全注意力层同样被换成了 QSA),以及一组训练稳定性措施。
这些创新加起来,让 Qwen3.8-Flash 收获了显著的模型效率优势:相比 Qwen3.7-Plus,它的训练开销仅约九分之一。
在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优,在其它 6 个上也与 Qwen3.7-Plus-Base 接近(Base 模型对比反映的是预训练效率,与最终产品表现不能直接画等号)。
结论很清楚:激活参数只有三分之一、训练开销只有九分之一的模型,在多数预训练评测上追平甚至超过了一个大三倍的前代。这并不意味着 Scaling 停了下来,它只是换了方向:从扩大参数规模,转向提升单位算力所能承载的智能。
结语
这一代架构改动还外溢出了一个产业层面的信号。
2026 年,超大规模云厂商的推理资本开支历史上第一次超过训练开支,核心矛盾也从算力与集群规模,变成了内存带宽与通信延迟。
而这次的四处改动指向的正是同一个方向:QSA连索引开销一起削掉,N-gram Embedding把 51B 参数整个挪出显存,Gated Residual的残差状态可以存成 FP8。模型不再默认把所有数据都放进昂贵的 GPU 显存,而是开始主动为 GPU、HBM 与主机内存组成的分层存储体系做设计。
那么,单次调用成本下降,行业需要的 GPU 会不会因此减少?这个问题,市场其实已经给出过一个颇为戏剧性的解答。2025 年 1 月 DeepSeek R1 发布后,「更便宜的模型意味着更少的算力」一度成为共识,英伟达曾单日暴跌近 17%、市值蒸发约 5890 亿美元,创下美股单只股票的单日跌幅纪录。而 2026 年 4 月 DeepSeek 拿出更强也更省的 V4 时,英伟达当日却收涨 4.3%,市值重返 5 万亿美元。同样的剧本,相反的结局。这十六个月证明:每次任务变便宜之后,人们通常不会把省下的预算收起来,而是把 AI 部署到更多环节里。更便宜的模型未必是 GPU 需求的终点,反而可能是推理需求爆发的起点。
回到开头那条价格曲线。当补贴不再是可持续的降价来源,能压低成本的就只剩下架构本身。竞争的核心也随之改变:从提升智能水平,变成提升模型效率,即用最低的成本交付足够强的智能。而按官方的说法,这套结构真正要服务的对象还没到场,它要等的是Qwen4。
Qwen3.8-Flash 的开放权重已发布至 Hugging Face 与 ModelScope,技术报告见 GitHub 仓库;生产版本已在千问 AI 平台提供服务。
- Hugging Face:https://huggingface.co/Qwen/Qwen3.8-Flash-Next
- ModelScope:https://www.modelscope.ai/models/Qwen/Qwen3.8-Flash-Next
- 技术博客:https://qwen.ai/blog?id=qwen3.8-flash-next
- 技术报告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

