给模型看几个输入输出示例,它就能归纳出规律、完成剩下的题——这听起来像人类做智力测试的方式。ARC-AGI-1 正是围绕这一点设计的评测基准。

它到底测什么

打开网易新闻 查看更多图片

ARC-AGI-1 被定义为一个概念学习基准。它的评测目标有三层:少样本抽象、模式归纳,以及从输入输出示例中完成类程序化推理。

换句话说,它不考模型记住了多少知识,而是考它能不能从极少量示例里"看出"规则。

为什么强调泛化

少样本抽象意味着示例数量很少,模型必须靠抽象能力补全规律。模式归纳要求它从示例中提炼出可复用的结构。类程序化推理则指向一种更接近写程序的思维方式:把规律表达成一套可执行的步骤。

这三项能力叠加,指向的正是模型的泛化能力——面对没见过的任务,能不能自己推出解法。

评测逻辑的落点

ARC-AGI-1 的题目形式统一:给出若干输入输出示例,让模型推断规则并应用到新输入上。这种设计把"记忆"和"推理"分开,逼模型展示真正的概念学习过程。

对于关注模型泛化能力的人来说,这个基准提供了一种可对照的观察方式:不是看模型答对了多少,而是看它从多少的示例里学会了什么。