Back to News

Xiaohongshu and SJTU Open-Source dots.tts, a 2B Continuous Autoregressive TTS Model

#tts#open-source#autoregressive#xiaohongshu

The dots team at Xiaohongshu and SJTU's X-LANCE lab released dots.tts, a 2B-parameter fully continuous autoregressive TTS foundation model, along with six checkpoints and full code under Apache 2.0. It achieves state-of-the-art average accuracy and speaker similarity on Seed-TTS-Eval, and supports streaming output and dual-stream mode with 54.4ms first-packet latency.

Coverage timeline

  1. 机器之心机器之心

    语音合成这条赛道,最近越来越像早期的大语言模型:模型一个比一个强大,底层路线却远没有收敛。 有人选择非自回归的扩散,一次并行生成整段声音,但是这种方法只适合离线使用; 有人沿用大语言模型最熟悉的方式,把语音压成离散 Token,再逐个自回归预测,但是语音毕竟不是一个一个的词,这样的做法会有一个无法打破的天花板。 小红书 dots 团队和上海交通大学 X-LANCE 实验室这次合作开源的 dots.tts ,走的是另一条路线: 不用离散 token,而是在连续隐空间中进行自回归生成。 它是一个 20 亿参数、全连续、端到端的自回归 TTS 基础模型。整条生成链路不依赖离散声学 Token:模型直接在连续隐空间中,以自回归方式逐个声学块建模,再把连续隐变量还原成波形。 最稳最像 :Seed-TTS-Eval 三个子集上,平均准确度和平均说话人相似度达到 SOTA; 可扩展基座 :支持音色微调、任务微调,例如 dots.tts.edit 就直接沿用 dots.tts 基座模型,支持文本、情绪、韵律和停顿四类编辑,指令执行率和局部保持率在 doteBench 上整体领先; 全量开源 :预训练、自纠正对齐、MeanFlow 四步、两步和单步,以及 1T1A 双流共六个检查点;同时开放训练、推理、微调、蒸馏代码,采用 Apache 2.0 许可; 交互优先 :天然支持流式输出,配合双工对话系统还可以使用 1T1A 的双流模式; 推理友好 :1T1A 双流模式音频首包低至 54.4 毫秒;使用 SGLang Omni 引擎最高支持 16 路并行推理; 先看模型表现 Seed-TTS-Eval 是语音生成领域常见的零样本声音克隆评测。模型只拿到一小段训练时未见过的参考语音,再用同一个人的声音说出新文本。 它主要测试两件事: 第一,准确度 :即内容有没有说对。英语用 WER,中文用 CER,数值越低越好。 第二,相似度 :即声音像不像同一个人。SIM 衡量生成音频和参考音频在说话人表征上的相似度,数值越高越好。 dots.tts SOAR 版本在中文、英文和中文困难集上的 WER/CER 分别为 0.94%、1.30% 和 6.60% ,SIM 分别为 81.0、77.1 和 79.5 。 把三个子集取平均后,它的平均 SIM 为 79.2 ,平均 WER/CER 为 2.95% ;