Back to News

SAGE topological guidance mitigates long-horizon reasoning biases, NeurIPS 2026

#reasoning#topological-guidance#neurips-2026#llm

Researchers from Virginia Tech, UW-Madison, and Dartmouth propose SAGE, a method that uses symbolic closure analysis and topological guidance to mitigate exploration and accumulation biases in long-horizon reasoning. Evaluated on 12 benchmarks across 7 model families, SAGE outperforms compared post-training methods; on Andrews–Curtis instances, Qwen3's Lean verification pass rate is nearly 8 times that of the base model. The paper is accepted at NeurIPS 2026.

Coverage timeline

  1. 机器之心机器之心

    大模型解短题常能给出流畅答案,推理链一长,却可能每一步都看似合理、终点仍然失效。来自弗吉尼亚理工大学、威斯康星大学麦迪逊分校和达特茅斯学院的研究团队在 NeurIPS2026 论文中提出 SAGE:用符号闭包分析(SCA)解释长推理中的探索偏差与累积偏差,再把这一诊断变成训练时的结构引导。在 12 个基准、7 个模型家族的评测中,SAGE 的总体表现优于所比较的后训练方法;在 Andrews–Curtis(AC)实例上,Qwen3 的 Lean 验证通过率接近基础模型的 8 倍。 论文名称:SAGE:MitigatingLong-HorizonReasoningBiasesviaTopologicalGuidance 会议:NeurIPS2026 作者:XinyueZeng,JiaweiZhang,YujunYan,DaweiZhou 单位:VirginiaTech,UniversityofWisconsin-Madison,DartmouthCollege 论文链接:https://arxiv.org/abs/2609.30192 代码链接:https://github.com/Susan571/SAGE-NeurIPS2026 一、长推理的难处:终点才有奖,岔路却越来越多 依靠最终答案给奖励的后训练,已显著提升模型的数学推理能力;但长任务里的奖励往往稀少而滞后。一条解题路径可能经过几十甚至上百次变换,训练过程却只知道结尾成败,难以判断从哪一步开始偏离。 一种思路是让人类或过程奖励模型逐步评分,代价是要取得可靠的过程标签或验证器;另一种思路是改造探索与奖励,却不必刻画任务本身的结构。SAGE 因而追问:为什么模型更容易走向 “看起来对” 的分支?终点奖励为什么很难把早期偏差纠回来? 论文用 Andrews–Curtis(AC)任务作为压力测试。给定一个由生成元与关系式构成的群表示,模型要依次执行允许的 AC 变换,尝试到达平凡表示。每一步是否合法可以检查,但合法操作不等于已经找到通向目标的路径;真正的成功信号要到整条序列结束才能确认。 实验求解的是 1,190 个按论文设置构造的 AC 实例。这一任务把 “局部合法、全局难成” 的矛盾放大,适合检验长程推理是否能持续朝目标推进。 图 1:以 AC 任务为例,SAGE 分别用代数稀疏化和双曲结构引导缓解两类偏差。 二