打开网易新闻 查看更多图片

下个月,苹果就要端出 iPhone 18 Pro 系列和首款折叠屏 iPhone。未曾想,就在这场「科技春晚」即将到来之际,小米直接把桌子给掀了

就在刚刚结束的玄戒技术沟通会上,小米第二代自研 SoC「玄戒 O3」刷新了手机 SoC 跑分纪录:Geekbench 6.5 多核成绩冲上 1.5 万分,比目前行业的性能标杆苹果 A19 Pro 还要高出近四成,实验室低温环境下的安兔兔极限跑分更是冲破了 500 万大关,达到 522 万分。

打开网易新闻 查看更多图片

但这 522 万的跑分,还远远不是这次发布会的重点。

十颗全大核,又猛又省电

要达到如此恐怖的理论性能表现,小米给玄戒 O3 塞了一套规模相当凶猛的 10 核心 CPU 核心配置——由 6 颗超大核搭配 4 个大核组成,最高主频达到 4.35GHz。比起单纯追求极限的超高单核主频,O3 显然把更多筹码押在了多核并发的吞吐能力上。

打开网易新闻 查看更多图片

要在寸土寸金的手机 SoC 里塞下整整 10 个全大核,首先得有足够的物理空间。在同样的 3nm 先进工艺下,O3 的芯片面积从上一代的 109mm² 扩大到了 133mm²,晶体管数量也由 190 亿硬生生推到了 240 亿(较 O1 提升 26%),硅片规模整整大了一圈。O3 在多核上的领先优势,很大程度上正是依靠这套 10 核全大核架构的并行效率换来的。

打开网易新闻 查看更多图片

全大核架构的另一面,是功耗和发热更难压住。手机日常更多面对的是刷视频、回消息、看网页这类轻负载,如果这些大核心不能及时降下来,再漂亮的跑分也很容易变成续航和温度的负担。所以这次小米除了强调性能,也重点提到 O3 在覆盖 80% 日常中低负载区间里,功耗相比上一代降低了 25%。

打开网易新闻 查看更多图片

图|小米官方

除了 CPU,GPU 这次给的提升同样扎实。玄戒 O3 换上了 16 核 G2-Ultra NX,官方称图形性能相比上一代提升 85%,光追性能提升 182%。GPU 内部还集成了 8 个 NX 神经网络单元,提供 36 TOPS 算力,用来处理游戏超分和插帧。

更重要的是,在相同性能点下,O3 的功耗最高比 O1 低了 64%。高性能可以维持得更久,发热和掉电也更容易控制。

打开网易新闻 查看更多图片

除了计算与图形,影像也是 O3 的重点升级项。这颗芯片集成了小米第五代旗舰 ISP 架构,支持最高 4.32 亿像素单摄与 24bit 最大位宽,并具备 64M + 64M + 50M 的三摄并发处理能力;配合硬件级智能影像引擎,把 4K 60FPS AINR(AI 降噪)夜景视频做进了芯片底层,为后续旗舰机型的计算摄影留足了冗余。

打开网易新闻 查看更多图片

芯片跑太快,内存快跟不上了

然而,当 CPU、GPU 和 NPU 的算力拉满之后,芯片设计师们很快就会撞上另一堵看不见的墙——数据搬运的速度跟不上了。

这就像一个顶级厨房,厨师越来越多、切菜翻炒的速度也快如闪电,但如果送菜的通道狭窄,或者食材仓库离灶台太远,厨师做完一道菜就只能端着空锅站在灶台前等。算力如果被堵在内存通道里,再漂亮的跑分也换不来流畅的体验。

打开网易新闻 查看更多图片

为了给这群「厨师」拓宽通道,O3 在内存体系上也下足了功夫,行业首发支持了 4×24bit 位宽、10667Mbps 的 LPDDR6 内存,直接把带宽推到了 113.8GB/s,比主流的 LPDDR5X 提升了近一半;

打开网易新闻 查看更多图片

同时,芯片内部的主要缓存总量被扩充到了约 60MB(包含 12MB CPU L2、16MB L3 以及 16MB 系统级缓存 SLC),相当于把最常用的一批食材直接整齐码放在了灶台旁边。

配合重构的自研统一融合总线与物理高层走线,O3 的静态访存延迟被压缩到了 82ns(后台带载动态延迟 177ns),比苹果 A19 Pro 的 92ns / 211ns、上一代 O1 的 121ns / 384ns 都要来得更快。

打开网易新闻 查看更多图片

而这种对高带宽与低延迟的饥渴,在端侧 AI 场景下被放大了数倍。大模型每吐出一个 token,本质上都要把数十亿参数的模型权重从内存里完整读取一遍。

光有 200TOPS 的 A8W4 张量算力和 3.13TFLOPS 向量算力还不够,O3 专门针对定制的 Xiaomi MiMo 5 值量化模型,配备了硬件霍夫曼无损压缩技术,直接节省了 30% 的内存带宽占用;配合 28MB 的 NPU 近存,在官方实验室口径下,MiMo 3B 的首词响应速度提升 40%,推理速度提升 45%,运行功耗还降低了 26%。

打开网易新闻 查看更多图片

在手机这颗需要顾及方方面面的通用 SoC 里,小米能做的优化基本已经拉满了。但如果跳出手机的条条框框,做一颗专门用来跑大模型的芯片,又该怎么解决这个数据瓶颈?

就在沟通会接近尾声的时候,小米掏出了 One More Thing——玄戒 O100。

打开网易新闻 查看更多图片

玄戒 O100:高带宽 AI 加速芯片

与兼顾日常多任务的通用 SoC 不同,O100 是一颗完全面向大模型推理的高带宽 AI 加速芯片。它的逻辑工艺虽然是相对成熟的 6nm,但封装方式却更为激进:

打开网易新闻 查看更多图片

小米采用了 Wafer on Wafer 晶圆级 3D 堆叠与 Hybrid Bonding 混合键合技术,将两层高速 AI 专用 DRAM 晶圆与一层高性能 NPU 晶圆在垂直方向直接键合堆叠,把原本平面的数据通路变成了「垂直穿透」。

通过创新的 Face to Face 金属层直连结构,两层晶圆之间依托 258 万个物理键合节点相连,TSV 硅通孔孔径仅为 0.7μm,键合间距缩短至 1.4μm。微米级的物理互联距离,让数据能够以极短的路径在计算核心与专用内存之间高速流转,直接将 O100 的内存带宽推到了惊人的 1.22TB/s——达到目前主流旗舰手机 LPDDR5X 的 16 倍。

为了把这套惊人的带宽吞吐完全吃透,O100 还为 14 个 NPU 核心设计了不同的互联架构:处理长提示词的 Prefill 阶段走 Ring 环形网络逐级传递,逐字吐词的 Decode 阶段则切换到 All-to-All 广播网络让多核瞬间同步。在小米实验室测试中,O100 配合 Xiaomi MiMo 跑出了最高 330Tokens/s 的超高速本地推理成绩。

打开网易新闻 查看更多图片

从 O3 到 O100,小米其实一直在解决同一个问题:算力越来越强以后,怎么让数据不「堵」在路上。手机如此,大模型如此,而当这套思路继续往更大的终端走,下一站就是汽车

小米开始为自己的 AI,造一整套芯片 玄戒 D100:智驾高算力 AI 芯片

面向智驾场景的玄戒 D100 采用 3nm 先进工艺,配备了 20 核 CPU 与 16 核 NPU,最夸张的指标是最高支持 160GB 的统一内存,官方确认已经在本地成功部署 200B 参数规模的模型,并计划于明年正式商用。

打开网易新闻 查看更多图片

图|小米官方

在智能汽车上,端侧算力的核心诉求是离线与低延迟。无论是端到端智驾还是座舱多模态交互,一旦驶入地库、隧道等弱网环境,单靠云端协同就会面临延迟甚至断连的问题。160GB 统一内存的意义,正是为了让大参数模型能够直接常驻在车机本地,在不依赖网络的情况下也能完成实时推理。

从手机、大模型专属加速卡到智能汽车,随着三颗芯片全部就位,玄戒也正式补齐了小米 AI 战略最底层的物理算力。这恰好呼应了计算机先驱阿兰·凯(Alan Kay)那句曾被乔布斯在初代 iPhone 发布会上引用的名言:

真正认真对待软件的人,就应该自己做硬件。

如今的小米,澎湃 OS 负责整机调度,MiMo 负责模型算法,玄戒则提供物理底座——从系统、模型到底层芯片,三者之间真正形成了一套配合默契的丝滑小连招。

打开网易新闻 查看更多图片

最后,小米还介绍了几款搭载全新芯片的新品:

  • Xiaomi AI Cube Prototype:形态类似英伟达的 DGX Spark,把原本属于服务器或者工作站的 AI 算力,压缩进一台可以摆上桌面的机器里。

打开网易新闻 查看更多图片

图|小米官方

这台由航天铝一体成型外壳、带有超过 33874 个 CNC 蜂窝散热孔的桌面终端,在内部将芯片阵列串联在一起,实现了 120B + 3B 双模型的本地混合部署。小模型负责毫秒级响应日常高频指令,大模型负责深度逻辑推理,系统根据任务负载把算力实时分发给最合适的芯片。

  • 小米 18 Fold 和小米平板 9 Pro Max:定于 9 月发布,前者预计是小米首款「阔折叠」形态的产品,两款新品都会搭载玄戒 O3。

打开网易新闻 查看更多图片

图|小米官方

值得一提的是,此前小米在 HyperOS 的宣传海报里,就曾出现过一台机身比例明显比传统大折叠更宽的设备,引发了外界关于小米折叠屏新形态的猜测;而在今天的技术沟通会上,爱范儿也看到了采用「阔折叠」宽屏比例的工程原型机。

打开网易新闻 查看更多图片

至于这台「阔折叠」最终会以怎样的工业设计落地,以及玄戒 O3 会在这块宽屏上释放出怎样的实际体验,答案很快就会在下个月的发布会上见分晓。