Peking University and YIXIN AI Lab identify 'readout bottleneck' in LLM reasoning at EMNLP 2026
Researchers from Peking University and YIXIN AI Lab presented a paper at EMNLP 2026 introducing the 'readout bottleneck' phenomenon, where LLMs may encode correct answers in hidden states but fail to express them due to systematic biases in the output layer. They propose a staged diagnostic method to distinguish between genuine capability deficits and expression failures. The paper, titled 'Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores', was accepted to the main conference with a 15.4% acceptance rate.
Coverage timeline
机器之心机器之心
当大语言模型在逻辑题上给出错误答案时,我们通常会下一个很快的结论: 它不会做这道题 。 但这个结论真的可靠吗? 想象一下:学生已经在草稿纸上写出了正确推导,交卷时却把答案栏涂错了。只看答题卡,我们会说他 “不会”;如果能同时检查草稿,就会发现问题出在最后一步的表达。 北京大学研究团队 和 易鑫(YIXIN)AI Lab 围绕大模型推理评测与内部表征展开合作 ,共同追问一个看似简单、却可能影响我们解读 Benchmark 结果的问题: 当模型答错一道逻辑题时,它是真的没有想出来,还是已经想到了,却没有把正确答案表达出来? 这项研究提出了一个专用于大模型的诊断视角: 模型很可能已经在隐藏状态(Hidden States)中编码了正确答案,却在将其转换为最终候选分数的过程中,被输出层的系统性偏差给 “掩盖” 了。 作者将这一现象命名为 “读出瓶颈”(Readout Bottleneck) ,并设计了一套分阶段的诊断方法来验证 “答错” 究竟是能力缺失,还是表达失真。 该工作已被自然语言处理顶级会议 EMNLP 2026 主会接收(录取率 15.4%) 。 论文题目: Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores 作者: Qiyao Yan、Chenpeng Wang、Liangming Pan 合作单位: 北京大学、易鑫(YIXIN)YiXin-AILab Arxiv 链接:https://arxiv.org/abs/2608.31068 1. 一个常被忽视的混淆:答错,真的等于不会吗? 在目前的逻辑推理评测(多选题或固定选项)中,标准流程非常统一: 1)输入题干 ,2)计算每个候选答案的 Logit 分数,3)取最高分项 ,4)统计准确率 。大家习惯性地将最终得分低,等同于 “模型缺乏该项推理能力”。 但作者团队指出,这里存在一个被长期混淆的因果断裂:模型最终输出错误,究竟是因为内部根本没推导出来,还是推导出来了,却在最后一步的输出映射中被 “读坏了”? 图 1:论文的三步诊断链。关键问题不是 “模型最后选了什么”,而是 “正确答案的信息在哪一步丢失了”。 为了把这两者彻底拆开,作者在不同难度梯度的测试集上(包括基础同分布的 id 、考查更长推
