Back to News

VideoGen-Agent: 8B multimodal agent learns tool use for video generation via RL

#video generation#reinforcement learning#multimodal agent#tool use

Researchers released VideoGen-Agent, an 8B multimodal agent built on Qwen3-VL-8B-Instruct that learns to call retrieval, generation, and verification tools for video generation through supervised fine-tuning and multi-task reinforcement learning. On the VABench benchmark with 600 prompts covering six capabilities, its Toolset 1 configuration scored 75.6, up 19.1 from the base generator's 56.5, and reached 86.1 when generation tools were upgraded without changing agent parameters. In human comparisons, evaluators preferred the upgraded configuration's videos over the strongest single-model baseline in 84.3% of judgments.

Coverage timeline

  1. 机器之心机器之心

    从检索动作知识、寻找角色参考,到模拟运动和衔接镜头,一个经过强化学习的智能体,能给视频生成带来多大提升? 让视频模型生成一个人打太极,画面可能很流畅。但如果把要求具体到某个招式,手该怎么抬、重心该怎么移,模型还能做对吗? 再加一点难度:指定一个角色,让它完成这套动作;或者要求两个物体按给定条件碰撞,再把一段故事分成三个连续镜头。 这些要求把视频生成带到了更细的层面。动作需要知识,角色需要视觉参照,运动需要物理约束,多个镜头还要保持顺序与连续性。仅靠一句提示词,生成模型未必能把所有细节都处理好。 如果系统可以先查资料、找参考,必要时跑一次模拟,再决定怎样生成视频,会发生什么? VideoGen-Agent 尝试把这些步骤交给一个可训练的多模态智能体 。它以 Qwen3-VL-8B-Instruct 为基础,在多轮交互中调用检索、生成和验证工具,并根据工具返回的结果继续作出决策。研究团队先用监督微调建立工具使用能力,再通过多任务强化学习改进这套决策过程。 在包含 600 条提示词、覆盖六类能力的 VABench 上,VideoGen-Agent 的 Toolset 1 配置取得 75.6 分 ,相较基础视频生成器的 56.5 分提高 19.1 分 。保持智能体参数不变、升级生成工具后,得分进一步达到 86.1 分 。在人类比较中,评估者在 84.3% 的判断中更偏好升级配置生成的视频,而非最强单模型基线的结果。 论文:VideoGen-Agent: Reinforcing Video Generation Agents 论文链接:https://arxiv.org/abs/2609.24997 项目主页:https://andyca111.github.io/VideoGen_Agent/ VideoGen-Agent 面向不同生成要求选择工具:检索动作知识、获取视觉参考、模拟物理运动、验证场景结构,以及逐段生成连续镜头。 看三个例子,工具具体补上了什么 第一个例子是太极招式「白鹤亮翅」。 图 1 第一行中,单模型已经生成了白衣练习者和庭院,也表现出了武术动作,但展示的姿态更接近泛化的展臂、收手,未清楚体现指定招式的动作细节。Agent 先检索招式说明,将重心后移、右腿屈膝和左脚前移等信息补充到生成输入中。右侧关键帧呈现出逐步抬臂、形成一高一低手位的过程。这里需要补充的