★ 设为星标 | 只讲人话,带你玩转AIGC。

前几天那个把整个 AI 圈猜了个遍的神秘模型 Ox Alpha(牛来),终于掉马了。

答案是:智谱。

8 月 26 日,智谱正式发布并开源 GLM-5.3-Flash。官方确认,此前突然出现在 OpenCode 和 OpenRouter、没有公布任何背景的 Ox Alpha,其实就是 GLM-5.3-Flash 的匿名预览版。

更有意思的是,智谱表示,匿名测试期间 Ox Alpha 很快成为当周最受欢迎的模型之一,而这些流量全部跑在国产 AI 芯片上

打开网易新闻 查看更多图片

一夜之间,GLM 5.3 Flash 已经成为新的斩杀线。

打开网易新闻 查看更多图片

GLM-5.3-Flash 标准 API 定价(每 100 万 token) :

- 输入:0.15 美元

- 输出:0.50 美元

- 缓存输入:0.03 美元

智谱给出的定位是:GLM-5.3-Flash 正常价格只有 GLM-5.3 的 1/10。

限时折扣期间更低到 1/20;按照官方对比,大约只有 Claude Opus 4.8 的 1/40,是 DeepSeek 的 1/7。

打开网易新闻 查看更多图片

Artificial Analysis 的测试里,它取得 57 分综合智能指数时,每完成一个任务的折扣成本只有约 0.045 美元

换句话说,以前需要大约 10 倍成本才能买到的智能水平,现在被直接打下来了。

这可能才是 GLM-5.3-Flash 真正值得关注的地方。

现在大模型的竞争已经越来越不像单纯的“谁分数最高”,而更像:同样 1 块钱,你到底能买到多少智能。

01 它到底是什么?

GLM-5.3-Flash 可以理解成智谱最新的高性价比主力模型

它有几个非常关键的数据:320B 总参数,但每次只激活 18B。也就是总参数 3200 亿,真正推理时只需要激活 180 亿

相比 GLM-4.5 的 355B 总参数、32B 激活参数,GLM-5.3-Flash 不仅激活参数接近砍半,模型层数也从 92 层降到了 45 层。

但模型变“轻”了,能力反而更强。

官方数据显示,GLM-5.3-Flash 在多项测试和实际工作负载中已经超过 GLM-5.2,在编程和 Agent 能力上则开始逼近 Claude Opus 4.8。

这也是这个模型最值得关注的地方:

不是继续无脑堆参数,而是想办法用更少的计算量,换来更强的能力。

02 能力对标 Opus 4.8

这次比较炸裂的是 Artificial Analysis 的综合智能指数。

GLM-5.3-Flash 拿到了 57 分。按照智谱公布的对比,这已经进入目前全球前沿模型区间,并与 Claude Opus 4.8 处于同一分数水平。

打开网易新闻 查看更多图片

在几个更偏 Coding 和 Agent 的测试里,提升也很明显。

DeepSWE v1.1 从 GLM-5.2 的 46.2 提升到 63.4;AutomationBench 从 26.2 提升到 48.8

智谱自己的 Z.ai Code Bench 上,在最高推理强度下,GLM-5.3-Flash 得分 29.0,Claude Opus 4.8 是 29.5,已经非常接近。

当然,自家 Benchmark 还是要留一点余地看。

但至少从目前公开结果来看,GLM-5.3-Flash 已经不是传统意义上的“小模型换低价”,而是在尝试做到:

旗舰模型的能力,Flash 模型的成本。

03 还是原生多模态

GLM-5.3-Flash 还是 GLM-5 系列第一个原生多模态模型

它不是后面外挂一个视觉模型,而是在预训练阶段就把文本、图片等多模态数据一起训练,整个预训练数据规模达到 30T Token

同时支持最高 100 万 Token 上下文

这意味着它的定位其实已经不只是 Coding。

比如 Agent 可以直接看网页、理解界面,然后点击和操作;也可以处理文档、表格、PPT、Dashboard 等内容,甚至根据视觉反馈检查自己刚刚生成的东西,再继续修改。

这其实非常符合下一阶段 Agent 的方向:

不只是“会写代码”,而是开始真正看得见、点得动、做得完。

04 为什么它能这么便宜?

背后一个很重要的变化,是架构。

GLM-5.3-Flash 首次采用了稀疏注意力 + 线性注意力的混合架构

简单理解:

以前处理超长上下文,有点像每个人都要和房间里所有人说一遍话,人越多,计算量增长越快。

新的方法则是——附近的人重点交流,真正重要的远距离信息再单独建立联系。

这样一来,模型面对几十万甚至上百万 Token 时,就不需要把所有信息都用最昂贵的方式计算一遍。

据公开资料,GLM-5.3-Flash 相比 GLM-5.3 将 Attention 计算量降低到约 1/3,KV Cache 占用降低约 4.4 倍

打开网易新闻 查看更多图片

再加上 320B 总参数只激活 18B,推理成本自然就被大幅压了下来。

所以这次的 Flash,并不是简单把 GLM-5.3 做个“青春版”。

它实际上重新设计了一套更追求效率的模型架构。

05 还有一个容易被忽略的细节

这次 Ox Alpha 的匿名测试,还有一个挺有意思的信息:

所有真实用户流量都是国产 AI 芯片跑出来的。

智谱称,他们基于 SGLang 搭建了一套推理系统,把编码、预填充和解码等阶段拆开优化,并已经运行在数万张国产加速卡组成的基础设施上。

官方资料称,这套系统实现了约 3 倍的端到端服务性能提升

这件事情的意义甚至可能不亚于模型本身。

因为国产 AI 现在真正缺的,从来不只是“能不能训练出一个好模型”。

而是:

模型 + 芯片 + 推理框架 + 大规模真实用户流量,能不能真的跑起来。

Ox Alpha 至少给出了一次非常有意思的实战验证,这已经表明国产芯片能够高效、经济地支持大规模前沿模型推理。

06 而且,它已经开源

和刚刚发布时还要等两周才能开放权重的 GLM-5.3 不同,这次 GLM-5.3-Flash 直接开放了模型权重

目前 Hugging Face 已经上线,模型采用 MIT License,本地部署已经支持 SGLang、vLLM 和 TokenSpeed。

https://huggingface.co/zai-org/GLM-5.3-Flash

前几天我写 Ox Alpha 的时候还在问:“牛来”到底是谁?

现在答案出来了。

但 GLM-5.3-Flash 更值得关注的,可能不是“牛来居然是智谱”。

而是另一个越来越明显的趋势:前沿 AI 的门槛,正在从“谁能做出最强模型”,变成“谁能用最低的成本,把足够强的智能真正跑起来”。

而这一次,中国模型又把价格往下砍了一刀。

参考资料:

https://z.ai/blog/glm-5.3-flash