VBVR-Pro: 300 verifiable visual reasoning tasks, 1.25M samples, models and code released
Researchers from NTU, CMU, and Berkeley released VBVR-Pro, a scalable and verifiable suite for native visual reasoning, including 300 tasks, 1.25 million training samples, a 100-task benchmark with verifiable scorers, and models and code. The suite supports training and evaluation of image, video, and interleaved models, and the scorers can serve as verifiable rewards in reinforcement learning.
Coverage timeline
机器之心机器之心
在迷宫里规划一条路径、想象 3D 物体旋转后的状态、持续追踪物体的位置…… 图像和视频不只是模型需要理解的输入,更是可以推理的 “工作空间 “。近年来,原生视觉推理受到越来越多的关注,语言不再是模型推理的唯一途径,模型可以直接理解、探索和更新视觉空间来解决问题。 但目前,还缺少一套完整的基础设施。用什么任务训练模型视觉推理能力?怎么评估模型输出的图片或视频是否正确?图片、视频或图文交错哪一个更适合视觉推理?为了回答这个问题,来自 NTU、CMU、Berkeley 等多家高校研究员联合推出 VBVR-Pro(A Scalable and Verifiable Suite for Native Visual Reasoning)。 论文、数据、模型与代码均已公开。 VBVR-Pro 官方网站:https://video-reason.com/?v=pro VBVR-Pro arXiv 论文:https://arxiv.org/abs/2608.26105 VBVR-Pro 将视觉推理构建成一个闭环:首先定义了 300 个视觉推理任务,然后利用 100 任务构建 benchmark,并对每一个任务提供可验证的打分器。在相同数据情况下,训练和测试 30 + 图像、视频和图文交错模型,探索不同视觉推理范式的能力差异, 同时我们还验证了这些可验证打分器可以直接作为大规模强化学习中的 Verifiable Reward,进一步提升模型的视觉推理能力。 VBVR-Pro 整体框架:从 300 项视觉推理任务出发,连接多模态模型训练、可验证评测与 RL 优化,构建视觉推理的完整闭环。 视觉推理不只需要更多数据,还需要更广泛任务 VBVR-Pro 专门设计 300 个覆盖不同能力和复杂度的视觉推理任务,构建 125 万条高质量训练数据。更重要的是,每一条数据都被渲染成视频和图文交错两种模式。这意味着,我们同时给视频和图像模型准备了两套不同的数据,能够让不同模态的模型在相同配置下进行比较。 VBVR-Pro 包含 300 项视觉推理任务,覆盖感知、空间、变换、抽象和知识五类核心能力。 尽管这 300 项任务着重关注于抽象视觉场景,但经过 VBVR-Pro 数据训练后,模型所获得的能力并没有局限于这些抽象任务,进一步展现出了良好的跨场景泛化能力。我们将训练后的模型在 RISE-Video、
