在LLM评估中,同一个模型、同一批测试题,用acc(原始准确率)和acc_norm(字节归一化准确率)两个指标打分,结果可能截然不同。问题出在长度偏差上。

长度偏差如何影响acc

打开网易新闻 查看更多图片

原始准确率acc的计算方式很简单:模型给出的答案与标准答案一致,就算对。但这种方式存在一个漏洞——模型可以通过生成更长、更啰嗦的答案来“刷分”。

当答案变长时,其中包含正确内容的概率也随之增加,即使模型本身并不真正理解问题。acc指标无法区分“真会”和“蒙对”,因此长答案更容易获得高分,这就是长度偏差的来源。

acc_norm的修正逻辑

acc_norm的改进在于:将模型的输出概率按字节长度进行归一化。简单说,就是看模型在“每个字节”上平均分配了多少概率,而不是看整体概率总和。

这样一来,冗长答案的优势被削弱——如果模型靠堆字数提高得分,归一化后每个字节的平均概率反而会下降。acc_norm因此更能反映模型真实的推理能力,而非“话多”的优势。

何时用哪个指标

两者没有绝对优劣,取决于评估目标:

  • 生成质量、答案是否完整可用 → 用acc
  • 模型理解能力、排除长度干扰 → 用acc_norm

部分场景下,还可以考虑PMI归一化等替代方案,进一步剥离先验概率的影响。理解这些指标的差异,才能避免被单一数字误导。