Back to News

EMNLP 2026 paper: Behavior consistency beats state consistency for text-based world models

#world models#llm agents#emnlp 2026#behavior consistency

A paper accepted at EMNLP 2026 proposes replacing state consistency with behavior consistency as the training objective for text-based world models, arguing that predictions closer to real environments can mislead agents. Across 16 experimental configurations, trajectory-level consistency improved almost universally, and the false positive rate in offline evaluation of weak agents dropped from 42.5% to 9.5%.

Coverage timeline

  1. 机器之心机器之心

    论文标题:Beyond State Consistency: Behavior Consistency in Text-Based World Models 录用信息: EMNLP 2026 Main Conference 论文链接:https://arxiv.org/abs/2604.13824 代码开源:https://github.com/Ricardo-H/behr-wm 模型开源:https://huggingface.co/collections/Ricardo-H/behr-behavior-consistent-world-models 一句话概括:文本世界模型都在比 "生成文本像不像真实环境",但我们发现文本更接近真实环境的预测反而可能让智能体错得更离谱。把训练目标从 "状态一致" 换成 "行为一致" 后,16 组实验配置下世界模型的轨迹级一致性几乎全面提升,弱智能体离线评测的假阳性率从 42.5% 降到 9.5%。 预测偏差不可避免时,什么才是 "关键" 幻觉? LLM agent 在网页导航、工具调用、文本冒险等任务上进步很快,但让智能体在真实环境里跑一遍代价不小:慢、贵,有时还会触发不可逆操作。一种思路是用另一个 LLM 来 "扮演" 环境 —— 智能体在电商网站点击 "搜索毛衣",这个模型就生成搜索结果页;智能体选了某件商品,它就给出商品详情页。这就是文本世界模型。有了它,智能体可以在模拟环境中做离线评估或前瞻规划,不用真的去访问网站。 怎样才算一个好的世界模型?现有方法几乎都给出同一个答案:让生成文本尽可能贴近真实环境。训练上,无论是监督学习(在真实轨迹上做逐 token 最大似然)还是强化学习(以 F1 score 等文本相似度作为 reward),优化目标都指向同一件事 —— 让预测文本更接近真实观察;评估上也用 F1、BERTScore、ROUGE-L 等指标衡量文本相似度。背后的逻辑很直接:文本越接近真实,世界模型就越好;所有偏离真实的生成幻觉都是需要相同压制的误差。 如果真能把所有幻觉都消掉,这套逻辑当然成立。但在长步交互中,几十步自回归预测下误差不断累积,漏商品、错属性、编造 UI 元素难以避免。既然幻觉短期内无法完全消除,一个更实际的问题是:不同类型的幻觉对下游智能体决策的影响是否相同?训练目标能否引导模型把错往 "无害"