Back to News

Danish team extracts hidden chain-of-thought from frontier models via tool calling

#chain-of-thought#tool-calling#frontier-models#interpretability

Researchers at Aalborg University's AI Safety Lab, with the Seafill open-source community, published a paper showing that hidden chain-of-thought reasoning can be extracted from frontier models via standard API tool calling. They validated the method on open models, where extracted reasoning matched or slightly exceeded native reasoning in accuracy, and applied it to closed models across math, code, and science benchmarks. All extraction experiments were completed before September 9, 2026, and OpenAI and Anthropic were informed.

Coverage timeline

  1. 机器之心机器之心

    如今 Test-time scaling 正在极强地增益前沿大模型的推理能力。但 GPT、Claude 等最新闭源模型到底怎么 “想”,外界通常只能看到一个最终答案,或者一段被处理过的思维链,而真正具体的推理过程和原始思维链,被隐藏了起来。 最近, 丹麦奥尔堡大学 AI 安全实验室与 Seafill 开源社区联合发表的工作 《Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models》,尝试打开这个黑箱。 论文链接: https://arxiv.org/pdf/2609.26637 研究团队找到了一种简单但有效的方法:这是一次协议层 “越狱” 提取,通过标准 API 的 tool calling 让多款前沿模型外显出具有推理性质的隐藏思维链。 声明:所有提取实验均在 2026 年 9 月 9 日之前完成,研究团队已正式告知 OpenAI 与 Anthropic。 提取出的 reasoning,是真实推理,还是事后合理化? 在能够直接观察原生思维链的开源模型上验证: 表 1:开源模型上,工具提取 reasoning 与原生推理的准确率对比(%) 从表中可以看出,工具提取的 reasoning 不仅远超无推理 baseline,在 DeepSeek-V4-Flash 上甚至略高于原生推理,在 GLM-5.2 上也接近原生推理。进一步比较文本相似度,对每道题进行了多次 rollout,比较 “原生思维链之间” 以及 “原生思维链与工具提取思维链” 的相似度,在 DeepSeek-V4-Flash 上,两者的 ROUGE-L 分别为 0.198 和 0.188,5-gram Jaccard 更是同为 0.017。 也就是说, 工具提取出的思维链与原生思维链的差异,已经接近模型多次生成原生思维链时自身的波动范围。 在闭源模型上验证: 表 2:闭源模型基准准确率(%) 在闭源模型上跨数学、代码、科学的多个 benchmark 也对该工具提取方法进行了相应的测试,性能上接近原生推理,部分设置甚至略高,同时显著优于无推理 baseline。 需要强调的是,闭源模型的原生 CoT 不可见,但诱导出的思维链分析表明,提取出的 reasoning 可作