SCoPE: Ray-Space Positional Encoding for Video DiTs Improves Camera Control
Researchers from the University of Hong Kong, HKUST, and Tencent ARC Lab propose SCoPE, a ray-space positional encoding for video diffusion transformers (DiTs). It replaces the conventional (u,v,t) grid coordinates with observation rays computed from camera motion, adding less than 0.1% parameters while improving camera control, cross-view consistency, and revisit consistency. The method enables interactive camera control from a single static image without game engines or 3D reconstruction.
Coverage timeline
机器之心机器之心
视频模型与世界模型,究竟应该在什么坐标系里工作? 现有视频 DiT 通常以 (u, v, t) 张量网格组织位置。它能标出 token 位于哪一帧、哪一行、哪一列,却没有编码一次观察来自世界中的哪里、朝向哪里。镜头移动或出现重复纹理时,网格地址与场景位置之间的对应很快变得含混。 香港大学、香港科技大学与腾讯 ARC Lab 联合提出 SCoPE(Sightline-Coordinate Positional Encoding) ,一套面向视频 DiT 的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。 视频 1:SCoPE 从单张输入图生成的交互式相机控制结果。画面左下为 WASD 指令,右下为对应相机轨迹。 先看一段由 SCoPE 生成的结果。输入只有一张静态图片和连续的 WASD 指令,模型能够按指令前进、后退和横移,组合动作同样成立。整个过程没有游戏引擎、人工建模或三维重建。SCoPE 直接根据相机运动,为每个视频 token 计算对应的观察射线,并将射线坐标注入视频 DiT。整体新增参数不到原视频模型的 0.1%,相机控制、跨视角一致性与 revisit 一致性均得到改善。 作者:Minghao Yin、Jiahao Lu、Wenbo Hu、Wang Zhao、Ying Shan、Kai Han 机构:香港大学、香港科技大学、腾讯 ARC Lab 论文:https://arxiv.org/abs/2606.27345 项目主页:https://visual-ai.github.io/scope/ 代码:https://github.com/TencentARC/SCoPE 模型:https://huggingface.co/TencentARC/SCoPE 视频世界模型究竟需要怎样的坐标系 Video DiT 通常用(u, v, t) 表示位置。它记录 token 位于哪一帧、哪一行、哪一列,却没有相机与场景的几何。相机一动,同一个物体就会换到新的网格位置。 最理想的坐标当然是表面三维点坐标:每个 token 画的是世界中的哪个点,就用哪个点作为地址。但在生成开始之前,场景表面和深度都还不存在,这个坐标无从获得。 射线提供了一条出路。轨迹一旦给定,每个 token 对应的观察射线就可以提前计算。单条射线不确定深度,两条射线的关系却能帮助
