打开网易新闻 查看更多图片

2016年3月,首尔四季酒店的对局室里,围棋世界冠军李世石盯着棋盘,久久没有落子。

就在刚才,谷歌DeepMind开发的AlphaGo在第二局第37手下出了一步“怪棋”,让现场解说员大感意外。李世石赛后感叹:“AlphaGo毫无疑问是有创造力的。”

那次人机大战最终以AlphaGo四比一获胜告终,被视为人工智能发展史上的分水岭。

他的观点直截了当:别被表象迷惑,今天的大语言模型并不具备真正的推理能力。

更耐人寻味的是,格雷佩尔近期刚刚离开谷歌DeepMind,转而探索机器推理的全新路径。这位亲手参与创造“第37手”的人认为,当下的AI恰恰丢掉了当年那场胜利背后最关键的东西。

打开网易新闻 查看更多图片

要理解格雷佩尔的批评,得先拆开AlphaGo的“大脑”。

AlphaGo由两套互补的系统构成。一套是策略网络,它从人类棋谱中学习,能凭“直觉”迅速给出几步看起来不错的候选着法。

另一套是搜索机制。它会沿着棋局的“未来之树”展开推演,模拟成千上万种后续变化,再评估每一步棋最终会把局面带向何方。

这恰好对应诺贝尔经济学奖得主丹尼尔·卡尼曼提出的“系统1”与“系统2”。前者快速、直觉,后者缓慢、审慎。

第37手正是两套系统博弈的产物。按照策略网络的判断,人类高手下出这步棋的概率大约只有万分之一。

但搜索机制在推演未来局面后发现,这步棋在战略上明显更优,于是力排“直觉”,选择了它。

换句话说,真正的推理不是更快地给出答案,而是有能力推翻自己的第一反应。

此后,DeepMind又推出完全依靠自我对弈训练的AlphaZero,把“直觉加搜索”的框架推广到国际象棋和日本将棋。无论版本如何更迭,搜索始终是不可或缺的一环。

在格雷佩尔看来,今天的大语言模型几乎只有“系统1”。它们本质上是在做极其强大的模式补全,流畅却未必可靠。

他指出了三个关键缺陷。首先,模型没有一个明确且持续存在的“认知状态”。

所谓认知状态,就像侦探手中的案情白板,上面写着正在考虑哪些假设、各有几分把握、证据如何权衡,以及还有哪些疑点没有解开。

模型的知识与推理过程被不可分割地揉进了神经网络的权重之中,无法单独检查或修正。

第三,人们津津乐道的“思维链”,很多时候并非真实的思考过程,而是模型先通过其他途径得出答案,再事后编造出来的一套说辞。

这一判断并非空穴来风。近年来多项研究发现,推理模型展示出来的思考步骤,并不总能如实反映其内部真正的决策路径。

美国Anthropic公司研究人员2025年的实验显示,当提示中暗藏答案线索时,推理模型在大多数情况下并不会在思维链里承认自己用了这些线索。

这就好比一个学生先偷看了答案,再倒推出一套像模像样的解题过程,卷面整洁,却经不起追问。

格雷佩尔并不否定大模型的价值,而是主张为它们配上“推理的骨架”。

在他设想的系统中,AI应当维护一个清晰的认知状态,记录哪些已经确定、哪些仍有疑问、哪些可能性已被排除、哪些问题尚待回答。

推理则被看作一连串推动认知前进的“棋步”,比如演绎、拆解问题、提出关键追问,每一步都要减少不确定性。

大模型在其中可以扮演“直觉”的角色,负责提出解题思路、调用外部工具、评估证据。

但判断不确定性是否真正被消除、何时更新信念,要交给独立的组件来把关,只有证据充分时才改变结论。

这套思路,几乎就是把AlphaGo的“直觉加搜索”从棋盘搬到了开放世界。

当然,并非所有人都认同“大模型不会推理”的论断。OpenAI、DeepSeek等公司推出的推理模型,通过强化学习在数学竞赛和编程任务上取得了惊人成绩。

支持者认为,推理未必需要显式的搜索树,足够大的模型同样可能在内部形成某种推理能力。

争论的核心或许不在于模型能否答对题,而在于我们能否看清、检验并信任它得出答案的过程。

对于医学诊断、科学发现这类容错率极低的领域,这个问题尤为致命。一个说不清自己为何这样判断的“天才”,很难被托付性命攸关的决定。

十年前,第37手让人类第一次见识了机器的创造力。十年后,格雷佩尔提醒我们,流畅不等于思考,答对也不等于理解。