 SGLang-Omni:開箱即用的語音模型,正在悄悄長成新的開源生態(tài))
AuK 已進(jìn) SGLang-Omni開箱即用的語音模型正在悄悄長成新的開源生態(tài)【免費(fèi)下載鏈接】AuK項(xiàng)目地址: https://ai.gitcode.com/tencent_hunyuan/AuK2026 年 9 月 9 日騰訊混元開源了 1.5B 參數(shù)的語音基礎(chǔ)模型 AuK代碼與權(quán)重以 MIT 協(xié)議一次性放出。如果只是又多了一個 TTS 模型這件事在當(dāng)下并不稀奇真正值得關(guān)注的是它開源當(dāng)天的姿態(tài)——SGLang-Omni 團(tuán)隊(duì)在同一時間完成了對 AuK 的 Day 0 適配官方倉庫直接用一行命令把它接入了完整的服務(wù)化推理?xiàng)?。開箱即用不只是說模型權(quán)重公開而是說它第一時間擁有了生產(chǎn)級的推理基礎(chǔ)設(shè)施。這篇文章從源碼、官方文檔與社區(qū)實(shí)測出發(fā)拆解這次適配的含金量梳理 Gradio、ComfyUI、SGLang 三路部署正在形成的生態(tài)格局并回答一個問題開源語音模型接下來會怎么長。一條命令背后的 Day 0 適配打開倉庫根目錄的 README.mdNews 一節(jié)只有一條消息2026/09/09 開源代碼與權(quán)重公開。而緊隨其后的 Inference with SGLang-Omni 一節(jié)寫得格外簡短卻信息量十足python -m sglang_omni.cli serve --model-path tencent/AuK這一行命令背后是 SGLang-Omni 為 AuK 實(shí)現(xiàn)的完整服務(wù)化流水線。官方 Cookbook 給出了清晰的四階段結(jié)構(gòu)preprocessing音頻預(yù)處理與時長估計→ conditioning條件編碼→ DiT sampling擴(kuò)散采樣→ VAE decoding波形解碼。四個階段在獨(dú)立的 CUDA 流上重疊執(zhí)行Qwen 編碼器、VAE 與 DiT 可以按需分批加載這在語音模型服務(wù)化里已經(jīng)接近主流大語言模型的工程標(biāo)準(zhǔn)。適配之所以能如此順暢根源在于 AuK 的架構(gòu)是可拆分的模塊化組合。對照倉庫根目錄的 config.yaml 可以看得非常清楚主干是 Flux 風(fēng)格的混合流 Transformerbackbone: Flux2Edit文本編碼器外掛 Qwen2.5-Omni-3B聲碼器是獨(dú)立權(quán)重文件vae.safetensorsBigVGANFlowVAE24kHz 輸出、64 維 latent、480 倍下采樣率。配置里甚至預(yù)埋了工程細(xì)節(jié)注釋注意力后端可在flash_attn與torch之間切換推理時避免 flash_attn 依賴、梯度檢查點(diǎn)將峰值顯存從約 91G 壓到約 75G。SGLang-Omni 的服務(wù)端實(shí)現(xiàn)與這套配置一一對應(yīng)凍結(jié)的 Qwen2.5-Omni-3B Thinker 提供語義條件共享參考編碼器與音頻解碼器的 VAE 提供聲學(xué)條件10 層雙流 MMDiT 20 層單流 DiT 構(gòu)成生成主干。三個組件各司其職、邊界清晰第三方推理?xiàng)2拍茉谝恢軆?nèi)完成對齊實(shí)現(xiàn)而不是被塞進(jìn)一個無法拆卸的整體。更難得的是適配還配了驗(yàn)證手段。SGLang-Omni 的 AuK 章節(jié)里專門保留了Upstream Parity測試安裝上游依賴后用 pytest 跑test_auk_parity.py在 RNG 對齊的前提下逐一比對參考 latent、融合后的 Qwen 條件、生成 latent 與最終波形與上游實(shí)現(xiàn)逐位一致。這不是能跑通就行的適配而是把復(fù)現(xiàn)責(zé)任寫進(jìn)了測試套件——對一個開源模型來說這幾乎是最高規(guī)格的信任背書。從能跑到能服務(wù)API 與推理?xiàng)_M(jìn)入 SGLang-Omni 之后AuK 獲得的是一整套與 LLM 同級的服務(wù)化能力。首先是 API 形態(tài)生成任務(wù)走 OpenAI 風(fēng)格的/v1/audio/speech傳input文本與instructions音色描述即可做指令式 TTS傳ref_audio加參考文本即可做零樣本克隆編輯任務(wù)走/generate把去掉背景噪聲換成耳語這類原生指令放進(jìn)prompt字段配合metadata.tts_params.ref_audio指定源音頻。一個模型、兩種端點(diǎn)覆蓋了生成與編輯兩大能力面。其次是采樣策略的可配置性?;A(chǔ)版 AuK 使用 Euler 求解器默認(rèn) 32 次函數(shù)評估、CFG 強(qiáng)度 2.0、sway 系數(shù) -1.0而蒸餾版 AuK-Flash 鎖定官方發(fā)布的 4 步時間網(wǎng)格、關(guān)閉 CFG——這正是技術(shù)報告里描述的4 步無 CFG 推理、墻鐘時間提速 4.5 倍的服務(wù)端落地。模型權(quán)重與推理配置解耦服務(wù)端可以通過啟動參數(shù)覆蓋采樣細(xì)節(jié)而不必改動模型本身。然后是實(shí)打?qū)嵉男阅芄こ?。SGLang-Omni 為 AuK 專門寫了 Triton 內(nèi)核把逐頭 RMSNorm 與交錯式 RoPE 融合成單個 kernel默認(rèn)開啟torch.compile逐塊編譯 Transformer并用 CUDA Graph 捕獲整條 Euler 采樣軌跡——由于每一步之間只有加噪 latent 和時間步在變化一次捕獲即可復(fù)用于整條軌跡乃至后續(xù)所有形狀匹配的請求。在 config.yaml 中還能看到這類工程取舍的影子推理默認(rèn)把注意力后端切到torch以消除 flash_attn 的安裝負(fù)擔(dān)把開箱即用貫徹到底。社區(qū)實(shí)測數(shù)據(jù)印證了這套棧的真實(shí)水平。SGLang-Omni 的 AuK 優(yōu)化路線圖issue #2064披露單張 H200 上并發(fā) 8 時吞吐約 1.2 請求/秒RTF p99 在并發(fā) 8/16/32 下分別為 5.3/9.2/19.3在并發(fā) 16 的事件分解中DiT 采樣占總耗時 80.8%Qwen 條件編碼占 10.1%VAE 解碼僅占 8.9%——瓶頸在哪、優(yōu)化該打哪里數(shù)據(jù)說得明明白白。首輪合并的 Q/K RMSNormRoPE 融合內(nèi)核在并發(fā) 1 到 64 的掃描中帶來約 32%~42% 的吞吐提升且 WER 與上游完全一致。這些數(shù)字意味著語音模型第一次享受到可觀測、可調(diào)優(yōu)、可壓測的服務(wù)化待遇。Gradio、ComfyUI、SGLang三路部署一個模型社區(qū)對 AuK 的工程化反饋可以濃縮成三個關(guān)鍵詞Gradio、ComfyUI、SGLang-Omni。這三條路徑恰好構(gòu)成了開源語音模型生態(tài)里清晰的分層——體驗(yàn)層、創(chuàng)意層、生產(chǎn)層。Gradio 解決的是最快跑起來。官方同時上線了 Hugging Face 與 ModelScope 的在線 Demo Space社區(qū)也涌現(xiàn)出本地一鍵整合包拉權(quán)重、起 WebUI、上傳參考音頻、輸入自然語言指令幾分鐘內(nèi)就能復(fù)刻音色、改情緒、去口音甚至做 ASMR 式的音頻編輯。它的價值在于把模型的邊界快速暴露給普通用戶也把顯存門檻、時長限制這些真實(shí)約束第一時間反饋給開發(fā)者。ComfyUI 解決的是可視化編排。把 AuK 接入節(jié)點(diǎn)化工作流后零樣本 TTS、內(nèi)容編輯、人聲分離可以被拖拽成可復(fù)用的流水線一段人聲進(jìn)去并行輸出增強(qiáng)版、去口音版、目標(biāo)說話人提取版再把結(jié)果級聯(lián)給后續(xù)處理節(jié)點(diǎn)。對于創(chuàng)作者和后期人員這比手寫 Python 調(diào)用友好得多也讓語音能力第一次像圖像工作流一樣具備可組合性。SGLang-Omni 解決的是規(guī)?;?wù)。它是三者中唯一面向并發(fā)的路徑動態(tài)批處理、長度分桶、CUDA Graph 復(fù)用、SeedTTS 基準(zhǔn)的一鍵評測腳本乃至后續(xù)計劃中的編輯任務(wù)評估基準(zhǔn)MMAE-Speech、SpeechEditBench、Ming-Freeform-Audio-Edit 已在路線圖中登記。三層定位彼此不沖突——Gradio 做傳播ComfyUI 做創(chuàng)作SGLang 做承載而底層是同一個模型、同一套權(quán)重、同一個自然語言指令接口。配合 AuK / AuK-Flash 雙變體高質(zhì) 32 步與高速 4 步一個生態(tài)骨架已經(jīng)相當(dāng)完整。當(dāng)然生態(tài)的真實(shí)度不在于宣傳而在于坦誠的邊界。目前已知的限制包括單次生成默認(rèn)有 30 秒音頻長度上限服務(wù)端可通過參數(shù)放寬推理需要同時常駐 Qwen2.5-Omni-3B 編碼器、1.5B DiT 與 VAE顯存門檻不低README.md 的權(quán)重要求一節(jié)也寫明 MLLM 編碼器與 VAE 需運(yùn)行時單獨(dú)加載text_encoder.*權(quán)重缺失屬預(yù)期行為。最誠實(shí)的一筆來自技術(shù)報告SpeechEditBench 上情緒編輯的聯(lián)合成功率只有 9.94%——統(tǒng)一指令接口覆蓋了任務(wù)但覆蓋不等于每個任務(wù)都已爐火純青。這些短板沒有影響生態(tài)的成型反而指明了社區(qū)接下來該補(bǔ)的位置。開源語音生態(tài)的下一站把視野拉遠(yuǎn)一點(diǎn)AuK 進(jìn)入 SGLang-Omni 更像是一個信號語音模型的生態(tài)競爭正在從模型能力轉(zhuǎn)向模型 推理?xiàng)? 工具鏈的整體。先看能力盤子。技術(shù)報告披露的訓(xùn)練語料是 30.3 億條指令-音頻樣本、195 萬小時有效監(jiān)督橫跨生成、內(nèi)容編輯、聲學(xué)編輯、副語言編輯與增強(qiáng)分離五大任務(wù)族后訓(xùn)練階段用人類反饋偏好優(yōu)化對齊開放編輯用 Flow-GRPO 強(qiáng)化生成質(zhì)量再用任務(wù)路由的 Decoupled DMD 蒸餾出 4 步推理的 AuK-Flash?;鶞?zhǔn)成績也拿得出手Seed-TTS-Eval 三語平均 WER 2.65%、說話人相似度 0.795雙雙壓過此前的最強(qiáng)基線MMAE-Speech 的指令遵循率 48.23%、屬性保持率 88.11%DNS 挑戰(zhàn)賽 dWER 降到 2.66%AuK-VAE 在語音、通用音頻、音樂三域的重建指標(biāo)全面領(lǐng)先。SGLang-Omni 官方復(fù)現(xiàn)的編輯評估英語 Full 集 WER 3.96%、準(zhǔn)確率 84.58%也基本對齊了論文數(shù)據(jù)——這說明成績是可以被第三方復(fù)現(xiàn)的而不是自說自話。再看生態(tài)結(jié)構(gòu)。SGLang-Omni 的 Cookbook 里已經(jīng)躺著一長串語音模型Qwen3-TTS、Fish Audio、MiniMax Music 3、dots.tts、ZONOS2、MOSS-TTS……AuK 是其中任務(wù)覆蓋最全的成員之一也是少數(shù)把編輯作為一等公民接進(jìn)服務(wù)化的模型。它的適配模式——凍結(jié) MLLM 編碼器 擴(kuò)散主干 VAE 三段式、上游一致性測試、逐層優(yōu)化與吞吐數(shù)據(jù)公開——正在成為第三方推理?xiàng)=尤胄抡Z音模型的參考模板。而 SGLang-Omni 路線圖中把語音編輯評估納入基準(zhǔn)體系的計劃則預(yù)示著下一個階段的主題當(dāng)生成質(zhì)量趨于同質(zhì)化編輯能力、時長可控性、流式延遲與評估標(biāo)準(zhǔn)化將成為差異化戰(zhàn)場。最后回到那個問題開源語音模型接下來會怎么長。AuK 給出的答案有三層。第一統(tǒng)一指令接口是方向——自然語言指令 參考音頻正在成為語音界的通用 prompt任務(wù)碎片化被接口統(tǒng)一替代。第二蒸餾加速是標(biāo)配——4 步無 CFG 推理、4.5 倍提速不再是論文里的表演而是直接落進(jìn)服務(wù)端默認(rèn)配置的工程事實(shí)。第三生態(tài)分層的價值大于單點(diǎn)能力——Gradio 觸達(dá)用戶、ComfyUI 服務(wù)創(chuàng)作者、SGLang-Omni 承載生產(chǎn)疊加 MIT 協(xié)議賦予的商用自由度一個可組合、可演進(jìn)、可商業(yè)化的語音開源生態(tài)正在成型。模型會迭代基準(zhǔn)會刷新但統(tǒng)一任務(wù)、開放協(xié)議、多端部署這套組合拳已經(jīng)讓 AuK 從又一個開源模型變成了開源語音生態(tài)里一個真正的節(jié)點(diǎn)?!久赓M(fèi)下載鏈接】AuK項(xiàng)目地址: https://ai.gitcode.com/tencent_hunyuan/AuK創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考