語音合成技術的演進正從簡單的文字轉語音,邁向更精細、更具表現力與控制力的新階段。Qwen3-TTS 家族近期發佈的兩款新模型——音色創造模型 Qwen3-TTS-VD-Flash 與音色克隆模型 Qwen3-TTS-VC-Flash,透過 Qwen API 對外提供服務,標誌著聲音生成技術在靈活性與真實感上取得了重要突破。這兩款模型旨在滿足從音色自由創造到精準克隆,再到多語言輸出的廣泛需求,為內容創作、互動娛樂及企業服務等領域開闢了新的可能性。
從描述到聲色:細膩的語音創造藝術
Qwen3-TTS-VD-Flash 的核心在於透過複雜的自然語言指令,實現對生成語音的深度控制。用戶不再受限於預設或既有的音色庫,而是能夠透過輸入包含聲學屬性、人物設定、背景資訊等自由描述,創造出理想中的聲音形象。這項技術讓「說什麼」與「如何說」都能獲得全面掌控。
在公開的技術評測指標中,其表現印證了此一能力。Qwen3-TTS-VD-Flash 在 InstructTTS-Eval 的綜合表現上顯著優於 GPT-4o-mini-tts 與 Mimo-audio-7b-instruct 等模型,在角色扮演測試中也超越了 Gemini-2.5-pro-preview-tts。實際應用場景展示了其驚人的細膩度:用戶可以指令模型模仿電視購物主持人,以中年男性洪亮激昂、語速極快的音調進行推銷;也能要求其展現悲苦沙啞、帶有哭腔的緩慢訴說,完美貼合文本中的強烈情感。
角色塑造與敘事:賦予聲音生命與故事
這項音色創造能力的更進階應用,體現在複雜的角色塑造與長篇敘事上。模型能夠根據詳細的人物設定,如「年近七十的資深戰略科學家」,並結合其外貌特徵、性格特質與人生信條,生成極具說服力與權威感的語音。這不僅是聲線的模仿,更是人物氣質與背景的語音化呈現。
此外,模型支援將創造出的音色進行持久化儲存與重複調用,這使得生成生動自然的多輪次、多角色長篇章對話成為可能。例如,在一段設定了「沉穩旁白」、「猶豫上班族小林」與「自信御姐」三個音色的對話腳本中,模型能夠流暢地切換不同音色,並根據角色性格與對話情境自動調整語氣、節奏與情緒,構建出充滿張力的敘事場景。這項功能對於有聲書製作、戲劇廣播或互動式遊戲的語音內容生成具有重大意義。
三秒克隆與多語種輸出:打破語言與音源限制
相對於無中生有的創造,Qwen3-TTS-VC-Flash 專精於音色的精準複製與擴展。其支援僅需約 3 秒鐘的參考音頻即可完成音色克隆,並能基於此克隆音色,流暢生成中文、英文、德語、義大利語、葡萄牙語、西班牙語、日語、韓語、法語、俄語等十大主流語言的語音。
在 MiniMax TTS Multilingual Test Set 的評測中,Qwen3-TTS-VC-Flash 在平均詞錯誤率(WER)這項衡量語音內容準確性的關鍵指標上,全面優於 MiniMax、ElevenLabs 及 GPT-4o-Audio-Preview 等競爭模型。這意味著其能在跨語言轉換時,更好地保持語音清晰度與內容忠實度。從展示樣例可見,一段中文詩詞的韻味可以被克隆並用於英文句子的朗讀;而包含多國語言混雜的複雜文本,模型也能準確解析並以克隆音色自然合成。
強大的文本魯棒性與創意應用
兩款模型皆強調對複雜文本結構與非規範化格式的強大處理能力。它們能自動解析文本,精準提取關鍵資訊,對拼音標註、特殊符號、生僻字詞乃至數學公式等內容展現出高度的魯棒性。這確保了在面對多樣化、真實世界的文本輸入時,仍能穩定輸出高度契合語義的語音內容。
更令人印象深刻的是其應用邊界的拓展。模型甚至展示了「跨物種克隆」的創意潛力,能夠將動物的叫聲作為參考音色,並以此生成符合該動物「性格」的擬人化語句,如狗狗抱怨晚餐遲到,或山羊發表「一小步」感言。這雖然看似趣味應用,但背後體現的是模型對音色特徵提取與泛化能力的深度掌握。
便捷的 API 整合與實時語音流
為了方便開發者與研究人員快速整合,官方提供了清晰的 Qwen API 使用指南與程式碼片段。對於 Qwen3-TTS-VD-Flash,開發者可以透過簡單的 HTTP 請求,提交音色描述與預覽文本,即可獲得創建的音色名稱與對應的預覽音頻文件。而 Qwen3-TTS-VC-Flash 的應用則更側重於實時語音合成場景。
官方提供的示範程式碼展示了如何透過 DashScope Python SDK,結合 PyAudio 庫,實現完整的音色克隆與流式語音輸出流程。從上傳本地音頻文件創建專屬音色,到建立 WebSocket 連接進行實時文本推送與語音播放,整個過程設計為模組化,方便開發者根據自身需求進行調整與擴展。這種設計降低了先進語音合成技術的應用門檻,使其能夠更靈活地部署於各類互動式產品中。
隨著人工智慧在感知與創造領域的持續突破,語音合成技術正變得前所未有的靈活與生動。Qwen3-TTS-VD-Flash 與 Qwen3-TTS-VC-Flash 的推出,不僅是技術指標上的進步,更代表著一種範式轉移:聲音從一種固定的輸出媒介,轉變為一種可按需設計、精準複製並承載豐富情感與角色的動態元素。這將進一步激發內容創作者、產品設計師與研究人員的想像力,推動人機互動向更自然、更多元的方向發展。







