Back to News

Xiaohongshu FireRed Team Unveils FireRedTTS3, a Unified Speech Generation and Editing Model Supporting 24 Languages

#speech-generation#voice-cloning#multilingual#xiaohongshu

Xiaohongshu's FireRed team has released FireRedTTS3, a unified speech generation and editing model that supports 24 languages and 21 Chinese dialects, along with zero-shot voice cloning, natural language-based voice design, and precise speech editing. The model reportedly achieves state-of-the-art results on four public benchmarks, including top scores in voice cloning accuracy and similarity. The technical report, demo, and code have been made available.

Coverage timeline

  1. 机器之心机器之心

    小红书 FireRed 团队发布新一代语音生成与编辑模型 FireRedTTS3。它用同一个模型打通了语音的三大能力——多语言、多方言的零样本音色克隆,用自然语言「描述」就能定制的声音设计,以及「哪里不满意改哪里」的精准语音编辑,并在四大公开评测集上全面达到行业领先水平。 论文标题:FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations 技术报告:https://arxiv.org/abs/2608.17492 Demo 链接:https://fireredteam.github.io/demos/firered_tts_3/ 代码链接:https://github.com/FireRedTeam/FireRedTTS3 给它几秒钟你的声音,它就能用「你」说 24 种语言、21 种中文方言;给它一句话描述,它能凭空「捏」出一个从不存在的声音;给它一段现成的语音,它能像改文档一样,只动你圈出来的那一处,其余分毫不改、音色不飘。克隆、设计、编辑——过去得靠三套系统才能干的事,现在一个模型全包了。 秘密藏在一个叫 RedAE 的语音表示里:它请了一位「语义老师」,在源头就把语义「教」进声音的表示中。于是不堆模块、不搞多阶段训练、不叠复杂架构,就稳稳压住了连续语音生成最头疼的老毛病——「越说越跑偏」。 成绩也够硬:音色克隆的准确率和相似度双料第一(Seed-TTS-Eval 3.04% / 78.8%),24 种语言的克隆同样双料第一(3.75% / 84.8%),声音设计和语音编辑两个榜单也一并领先。 先上耳朵:这几段声音,你能分清真假吗? 继 FireRedTTS-2 把长对话与播客生成做到工业级之后,FireRedTTS3 这次把能力从「把一句话说好」,一路推到了「克隆、设计、编辑一手包办」。道理讲一万句,不如亲耳听一段。先来听四段——留个心眼:哪句是 AI,哪句又被悄悄「动过刀」? 先听听世界各地的朋友怎么聊世界杯 。趁着世界杯的余热,不同语言、不同口音轮番上阵;但你可能想不到,这些声音其实出自同一套模型之口。 接下来,我们来听下各地区的网友们用亲切的方言向大师提问 。你觉得他们的口音正宗不正宗呢? 如果说「说好各类语言」