Alibaba launches public beta of video model Wan 3.0 with document-to-video support
Alibaba launched the public beta of its video generation model Wan 3.0 on August 6, 2026, extending single-generation length to 30 seconds and adding support for document inputs such as doc, xls, ppt, pdf, and md files up to 100MB or 50 pages. The model aims to improve realism with diverse faces and fine-grained control, and is available on multiple platforms including Alibaba Cloud Bailian and Wanxiang official site, with API pricing from 0.3 yuan per second for 480P.
Coverage timeline
量子位量子位
阿里视频大模型Wan3.0开启公测:文档、ppt也能变视频 量子位的朋友们 2026-08-07 11:23:54 来源: 量子位 8月6日,阿里巴巴视频生成大模型Wan 3.0开启公测 8月6日,阿里巴巴视频生成大模型Wan 3.0开启公测,在生成时长、万能创作、全能参考以及真实世界还原等维度全面升级:单次可生成30秒视频,完整表达创作意图;在文本、图片、音频、视频四种基础模态之外,首次支持doc、xls、ppt、pdf、md等文档格式输入;力求准确还原真实世界——人物千人千面,每一帧画面既真实、又可信。 生成时长的延展是Wan3.0最直观的升级。单段30秒生成让叙事节奏更游刃有余,连续运镜、一镜到底等复杂镜头语言得以充分表达,AI视频从“生成一个镜头”走向“讲述一段完整的故事”。Wan3.0还有智能时长功能,可根据提示词自动推荐合适时长。 Wan3.0正从视频生成模型跃迁为信息的表达载体,不仅能以文本、图片、音频、视频作为全能参考,还能读取文档、ppt等结构化信息,搭配提示词即可生成教学课件、产品演示、业务汇报等内容。支持格式覆盖doc、xls、ppt、pdf、md等,单个文件或链接不超过100MB、50页。比如上传一个智能眼镜产品的ppt,配上提示词,就能得到一个完整的形象片。 这背后,是模型强大的提示词工程与指令遵循能力,将提示词转化为调度输入、控制表达的中枢。 视频生成模型正从内容生成升级为生产力工具,用户对画面的要求不止于清晰,更要真实。无论是现实场景还是数字化信息,Wan3.0都力求精准地复刻与呈现。生成视频中的人像力求“千人千面”,更敏锐地刻画五官与皮肤细节,人物情绪表达自然克制,微表情与肢体动作彼此联动。全能参考任务中,角色、道具、声音、空间关系、风格等细粒度维度均可稳定保持。数字化信息的画面审美也同步提升,让图表、数据与界面内容同样拥有质感。 此外,Wan3.0的视频编辑能力也有大幅提升,支持修改画面、剧情与台词。Wan3.0在声音质感与文字准确度方面仍有进步空间。 即日起,Wan3.0在阿里云百炼、万镜一刻、万相官网、千问创作PC端、IF STUDIO和堆友开启公测,在千问APP灰度开放。480P/720P/1080P的API价格分别为0.3/0.6/1.2 元/秒,API接口将于近期全量开放。 本文由阿里云提供,量子位获授权转载,观点归原作者
