IT之家 1 月 22 日消息,據(jù)千問 Qwen 微信公眾號消息,Qwen3-TTS 多碼本全系列模型已開源,包含 1.7B 和 0.6B 兩種尺寸,1.7B 可以達(dá)到極致性能,0.6B 均衡性能與效率。
據(jù)介紹,Qwen3-TTS 是由 Qwen 開發(fā)的一系列功能強(qiáng)大的語音生成模型,全面支持音色克隆、音色創(chuàng)造、超高質(zhì)量擬人化語音生成,以及基于自然語言描述的語音控制,為開發(fā)者與用戶提供最全面的語音生成功能。
依托創(chuàng)新的 Qwen3-TTS-Tokenizer-12Hz 多碼本語音編碼器,Qwen3-TTS 實(shí)現(xiàn)了對語音信號的高效壓縮與強(qiáng)表征能力,不僅完整保留副語言信息和聲學(xué)環(huán)境特征,還能通過輕量級的非 DiT 架構(gòu)實(shí)現(xiàn)高速、高保真的語音還原。Qwen3-TTS 采用 Dual-Track 雙軌建模,達(dá)成了極致的雙向流式生成速度,首包音頻僅需等待一個字符。
據(jù)IT之家了解,模型覆蓋 10 種主流語言(中文、英文、日語、韓語、德語、法語、俄語、葡萄牙語、西班牙語、意大利語)及多種方言音色,滿足全球化應(yīng)用需求。同時,模型具備強(qiáng)大的上下文理解能力,可根據(jù)指令和文本語義自適應(yīng)調(diào)整語氣、節(jié)奏與情感表達(dá),并對輸入文本噪聲的魯棒性有顯著提升。目前已經(jīng)在 Github 上開源同時也可通過 Qwen API 體驗(yàn)。
模型列表
1.7B 模型

0.6B 模型

Qwen3-TTS 特性
主要特點(diǎn):
強(qiáng)大的語音表征:基于自研 Qwen3-TTS-Tokenizer-12Hz,實(shí)現(xiàn)語音信號的高效聲學(xué)壓縮與高維語義建模,完整保留副語言信息及聲學(xué)環(huán)境特征,并可通過輕量級的非 DiT 架構(gòu)實(shí)現(xiàn)高效、高保真語音還原。
通用的端到端架構(gòu):采用離散多碼本 LM 架構(gòu),實(shí)現(xiàn)語音全信息端到端建模,徹底規(guī)避傳統(tǒng) LM+DiT 方案的信息瓶頸與級聯(lián)誤差,顯著提升模型的通用性、生成效率與效果上限。
高極致的低延遲流式生成:基于創(chuàng)新的 Dual-Track 混合流式生成架構(gòu),單模型同時兼容流式與非流式生成,最快可在輸入單字后即刻輸出音頻首包,端到端合成延遲低至 97ms,滿足實(shí)時交互場景的嚴(yán)苛需求。
智能的文本理解與語音控制:支持自然語言指令驅(qū)動的語音生成,靈活調(diào)控音色、情感、韻律等多維聲學(xué)屬性;同時深度融合文本語義理解,自適應(yīng)調(diào)節(jié)語氣、節(jié)奏、情感與韻律,實(shí)現(xiàn)“所想即所聽”的擬人化表達(dá)。

模型性能
我們對 Qwen3-TTS 在音色克隆、創(chuàng)造、控制等方面進(jìn)行了全面評估,結(jié)果顯示其在多項(xiàng)指標(biāo)上都達(dá)到了 SOTA 性能。具體來說:
音色創(chuàng)造任務(wù)上,Qwen3-TTS-VoiceDesign 在 InstructTTS-Eval 中指令遵循能力和生成表現(xiàn)力都整體超越 MiniMax-Voice-Design 閉源模型,并大幅領(lǐng)先其余開源模型。
在音色控制任務(wù)上,Qwen3-TTS-Instruct 不僅具備單人多語言的泛化能力,平均詞錯率 2.34%;同時具備保持音色的風(fēng)格控制能力,InstructTTS-Eval 取得了 75.4% 的分?jǐn)?shù);此外,也展現(xiàn)出卓越的長語音生成能力,一次性合成 10 分鐘語音的中英詞錯率為 2.36/2.81%。
在音色克隆任務(wù)上,Qwen3-TTS-VoiceClone 在 Seed-tts-eval 上中英文克隆的語音穩(wěn)定性表現(xiàn)上均超越 MiniMax 和 SeedTTS;在 TTS multilingual test set 上 10 個語項(xiàng)上取得了 1.835% 的平均詞錯誤率和 0.789 的說話人相似度,超越 MiniMax 和 ElevenLabs;跨語種音色克隆也超越 CosyVoice3 位居 SOTA。


Tokenizer 性能
我們對 Qwen-TTS-Tokenizer 進(jìn)行了語音重構(gòu)評估,在 LibriSpeech test-clean set 的結(jié)果顯示其在關(guān)鍵指標(biāo)上都達(dá)到了的 SOTA 水平。具體來說,在感知語音質(zhì)量評估(PESQ)中,Qwen-TTS-Tokenizer 在寬帶和窄帶上分別取得了 3.21 和 3.68 的分?jǐn)?shù),大幅領(lǐng)先同類 tokenizer。在短時客觀可懂度(STOI)以及 UTMOS 上,Qwen-TTS-Tokenizer 取得了 0.96 和 4.16 的分?jǐn)?shù),展現(xiàn)出卓越的還原質(zhì)量。在說話人相似度上,Qwen-TTS-Tokenizer 取了 0.95 的分?jǐn)?shù),顯著超越對比模型,表明其近乎無損的說話人信息保留能力。

ModelScope:
https://www.modelscope.cn/collections/Qwen/Qwen3-TTS
HuggingFace:
https://huggingface.co/collections/Qwen/qwen3-tts
Github:
https://github.com/QwenLM/Qwen3-TTS
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。