Back to News

VisInteract: Interactive Text-to-Visualization for Imperfect Queries, NeurIPS 2026 Spotlight

#text-to-visualization#interactive#neurips-2026#monte-carlo-tree-search

Researchers from Hong Kong Polytechnic University and ByteDance propose VisInteract, a new paradigm for dynamic interactive text-to-visualization that handles imperfect user queries. They introduce VisInteract-Bench, a benchmark acknowledging ambiguous, incomplete, or erroneous inputs, and Vis-MCTS, a Monte Carlo tree search-based method that branches and backtracks between data retrieval, chart generation, and clarification. The work was accepted as a Spotlight paper at NeurIPS 2026 (292 out of 30,709 submissions).

Coverage timeline

  1. 机器之心机器之心

    本文作者分别来自香港理工大学以及字节跳动。共同第一作者许文鑫、卢锦伟来自香港理工大学。许文鑫是香港理工大学博士生,指导老师为张晨教授与魏骁勇教授。 数据要让人看懂,通常得先从数据库里查出来,再画成图。文本到可视化(Text-to-Vis)做的就是这件事:用户说出想看什么,系统去库里查询,再用图表把需要的数据展示出来。 你可能会觉得,现在的大模型已经非常强,这不过是小菜一碟。模型强是强,可需求得说清楚。通常,大多数用户没法一次把自己的需求表达完整。比如「把 2025 年 top-5 产品的月度营收画出来,按地区拆开」,听着已经很具体,可 top-5 按销售额还是按销量、退款算不算、数据库里到底有没有 2025 年的数据,这些都还没定。只出一次图,系统不会问,只会自己默默选定一种解释。 所以,要得到与用户真实意图相匹配的数据可视化,往往需要模型与用户进行多轮交互:缺的补上,含糊的问清,说错的改掉,一步步落到真正想看的那张图。这也是这项工作的研究背景。从适用性上看,这个场景要解决的是真实业务里的查数与出图。文生图在大模型里已经研究得很多,而企业用户有大量数据存在数据库里,要通过交互尽快把该看的内容锁定,这个意义会更大。 一旦把「需求往往说不完全」当成前提,现有研究就会同时碰到两个挑战。第一,现有基准数据集大多假设查询已经说清,而且很难评估开放的可视化输出,也就是同一句话,往往有不止一种合理画法。第二,现有方法还没法通过动态交互,主动把用户的真实意图问回来。查询不完美时,Text-to-Vis 更接近一种交互式的意图找回,而不只是一次出图。 针对这两个挑战,研究团队提出了 VisInteract 。这是一种面向不完美查询的动态交互式 Text-to-Vis 新范式。为了实现这种范式,团队发布了评测基准 VisInteract-Bench ,承认输入可以含糊、信息缺失甚至说错;同时提出基于蒙特卡洛树搜索的方法 Vis-MCTS ,让系统在查数、画图和追问之间分叉与回退,把真实意图问回来。 目前,该工作已被 NeurIPS 2026 接收为 Spotlight(292/30709 投稿)。 论文标题: VisInteract: Towards Dynamic Interactive Text-to-Visualization under Imperfect Queries 论文