SparkDiffusion: Unified Sparse Attention, Distillation, FP8 Speeds Video Generation 265x
Researchers from Peking University, Tsinghua University, and Alibaba propose SparkDiffusion, a unified framework integrating sparse attention, few-step distillation, and FP8 quantization to accelerate video generation. It addresses the 'high-sparsity trap' where extreme sparsity (97%) degrades output quality despite falling training loss, using staged sparse warm-up and trajectory-mixed distillation. The system achieves 265x speedup, generating a 5-second 720P video in 18 seconds, with open weights and code.
Coverage timeline
机器之心机器之心
随着 Sora、Runway 等视频生成模型的快速迭代,AI 视频生成正在变得越来越普及。但生成速度慢、算力门槛高的问题,让大多数开发者和创作者难以将其落地。一段 5 秒 720P 视频,传统方法需要超过 1 小时才能完成扩散生成——这给实时创作、批量生成与消费级硬件部署带来了巨大挑战。 更令人困惑的是,当研究者试图通过极致稀疏化(97%稀疏率)来突破性能瓶颈时,却发现了一个 反常现象 :训练损失持续下降,生成视频质量却急剧恶化——人物破碎、背景扭曲、时序混乱。 针对这一问题,北京大学、清华大学、阿里巴巴等机构的研究者提出了 SparkDiffusion:首个将稀疏注意力、少步蒸馏与低精度量化整合到统一框架(含开源权重及完整训练代码)的视频生成加速系统 ,推动 DiT 视频生成从「分散优化单个组件」转向「端到端系统化加速」的新范式。 论文标题: SparkDiffusion: Mitigating the High-Sparsity Trap via Staged Sparse Warm-up, Trajectory-Mixed Distillation, and FP8 Quantization 项目主页: https://sparkdiffusion.github.io/ 代码地址: https://github.com/AlibabaResearch/SparkDiffusion 研究机构: 北京大学、清华大学、阿里巴巴、电子科技大学、哈尔滨工业大学 核心发现 "高稀疏陷阱"——当训练越久,质量越差 极致稀疏的反常现象 研究团队发现,当稀疏率从 90%推到 97%时(计算量从 10%降至 3%),训练损失持续下降, 生成视频却开始破碎、扭曲、失去时序连贯性 。更诡异的是,延长训练、增大数据集、扩大补偿分支容量,都无法修复这个问题。 团队将这种现象命名为" 高稀疏陷阱 "(High-Sparsity Trap): 在极高稀疏率下,逐步监督架构的稀疏视频 DiT 会陷入一种失效模式——尽管单步验证损失持续优化,但终端生成质量却停滞不前甚至退化,而且延长逐步训练也无法实质性恢复终端质量。 问题出在哪?误差累积在高噪声阶段 扩散模型沿着去噪轨迹逐步生成视频。传统的 Flow Matching 等逐步监督方法,只要求模型在某个噪声时刻预测正确的速度,却不直接约束"这一步
