Stanford: DeepSeek V4 Flash with self-verification beats Claude Fable 5 on Terminal-Bench 2.1 at 11x lower cost
Stanford researchers report that using DeepSeek V4 Flash with an LLM-as-a-Verifier self-verification framework surpasses Claude Fable 5 on Terminal-Bench 2.1, with overall cost about 11 times lower. The method generates five candidate agent trajectories per task, then uses the same model to verify and rank them, raising task success rate from 79% to 88%. Code is released on GitHub, and the approach has sparked community replication on local hardware.
Coverage timeline
机器之心机器之心
随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「 自验证 」,可以在 Terminal-Bench 2.1 上 超越 Claude Fable 5 ,同时整体 成本低约 11 倍 。 GitHub 代码:https://github.com/llm-as-a-verifier/llm-as-a-verifier 具体来说,团队首先让 DeepSeek V4 Flash 针对同一个任务生成 5 条候选 Agent 轨迹。随后,不引入任何能力更强的闭源模型,而是继续使用同一个 DeepSeek V4 Flash,通过 LLM-as-a-Verifier 验证框架对这些候选结果进行验证、打分和排序。最终,DeepSeek V4 Flash 在 Terminal-Bench 2.1 上的任务成功率从: 79% → 88% 。 值得注意的是,这里的成本并不只是验证成本,而是同时包含两部分:生成 5 个候选方案的成本,以及使用 DeepSeek V4 Flash 进行验证和筛选的成本。「自验证」确实会消耗更多 Token,但由于开源模型的 Token 成本足够低,即使加入额外的采样和验证, 整体单任务成本依然显著低于闭源前沿模型。 并且,上述成本已经按照 DeepSeek 涨价后的最新价格计算。 在延迟方面,自验证也不意味着需要串行等待 5 次完整生成。多个候选方案可以 并行生成 ,大部分验证过程同样可以并行执行。在并发资源充足的情况下,整体延迟大致相当于:耗时最长的一次 Agent rollout + 少数几轮验证。因此,候选数量增加并不会让端到端延迟按比例增长。 随着实验结果发布,LLM-as-a-Verifier 在 X 上引发广泛讨论,同时也冲上了 GitHub Trending 热榜 #2 。与此同时,开源社区已经开始在 DGX Spark 等 本地硬件上部署 GLM、DeepSeek 等模型,并复现类似的自验证结果。这可能会成为本地 AI 非常重要的一条发展路线:当本地和开源模型足够便宜时,与其把所有希望押在一次生成上,不如通过「 多次采样 → 自我验证 &r
