给模型看几个输入输出示例,它就能归纳出规律、完成剩下的题——这听起来像人类做智力测试的方式。ARC-AGI-1 正是围绕这一点设计的评测基准。
它到底测什么
打开网易新闻 查看更多图片
ARC-AGI-1 被定义为一个概念学习基准。它的评测目标有三层:少样本抽象、模式归纳,以及从输入输出示例中完成类程序化推理。
换句话说,它不考模型记住了多少知识,而是考它能不能从极少量示例里"看出"规则。
为什么强调泛化
少样本抽象意味着示例数量很少,模型必须靠抽象能力补全规律。模式归纳要求它从示例中提炼出可复用的结构。类程序化推理则指向一种更接近写程序的思维方式:把规律表达成一套可执行的步骤。
这三项能力叠加,指向的正是模型的泛化能力——面对没见过的任务,能不能自己推出解法。
评测逻辑的落点
ARC-AGI-1 的题目形式统一:给出若干输入输出示例,让模型推断规则并应用到新输入上。这种设计把"记忆"和"推理"分开,逼模型展示真正的概念学习过程。
对于关注模型泛化能力的人来说,这个基准提供了一种可对照的观察方式:不是看模型答对了多少,而是看它从多少的示例里学会了什么。
