恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
AuK 已进 SGLang-Omni:开箱即用的语音模型,正在悄悄长成新的开源生态
首页
资讯中心
/
AuK 已进 SGLang-Omni:开箱即用的语音模型,正在悄悄长成新的开源生态
AuK 已进 SGLang-Omni:开箱即用的语音模型,正在悄悄长成新的开源生态
发布时间:2026/10/10 21:21:26
AuK 已进 SGLang-Omni开箱即用的语音模型正在悄悄长成新的开源生态【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK2026 年 9 月 9 日腾讯混元开源了 1.5B 参数的语音基础模型 AuK代码与权重以 MIT 协议一次性放出。如果只是又多了一个 TTS 模型这件事在当下并不稀奇真正值得关注的是它开源当天的姿态——SGLang-Omni 团队在同一时间完成了对 AuK 的 Day 0 适配官方仓库直接用一行命令把它接入了完整的服务化推理栈。开箱即用不只是说模型权重公开而是说它第一时间拥有了生产级的推理基础设施。这篇文章从源码、官方文档与社区实测出发拆解这次适配的含金量梳理 Gradio、ComfyUI、SGLang 三路部署正在形成的生态格局并回答一个问题开源语音模型接下来会怎么长。一条命令背后的 Day 0 适配打开仓库根目录的 README.mdNews 一节只有一条消息2026/09/09 开源代码与权重公开。而紧随其后的 Inference with SGLang-Omni 一节写得格外简短却信息量十足python -m sglang_omni.cli serve --model-path tencent/AuK这一行命令背后是 SGLang-Omni 为 AuK 实现的完整服务化流水线。官方 Cookbook 给出了清晰的四阶段结构preprocessing音频预处理与时长估计→ conditioning条件编码→ DiT sampling扩散采样→ VAE decoding波形解码。四个阶段在独立的 CUDA 流上重叠执行Qwen 编码器、VAE 与 DiT 可以按需分批加载这在语音模型服务化里已经接近主流大语言模型的工程标准。适配之所以能如此顺畅根源在于 AuK 的架构是可拆分的模块化组合。对照仓库根目录的 config.yaml 可以看得非常清楚主干是 Flux 风格的混合流 Transformerbackbone: Flux2Edit文本编码器外挂 Qwen2.5-Omni-3B声码器是独立权重文件vae.safetensorsBigVGANFlowVAE24kHz 输出、64 维 latent、480 倍下采样率。配置里甚至预埋了工程细节注释注意力后端可在flash_attn与torch之间切换推理时避免 flash_attn 依赖、梯度检查点将峰值显存从约 91G 压到约 75G。SGLang-Omni 的服务端实现与这套配置一一对应冻结的 Qwen2.5-Omni-3B Thinker 提供语义条件共享参考编码器与音频解码器的 VAE 提供声学条件10 层双流 MMDiT 20 层单流 DiT 构成生成主干。三个组件各司其职、边界清晰第三方推理栈才能在一周内完成对齐实现而不是被塞进一个无法拆卸的整体。更难得的是适配还配了验证手段。SGLang-Omni 的 AuK 章节里专门保留了Upstream Parity测试安装上游依赖后用 pytest 跑test_auk_parity.py在 RNG 对齐的前提下逐一比对参考 latent、融合后的 Qwen 条件、生成 latent 与最终波形与上游实现逐位一致。这不是能跑通就行的适配而是把复现责任写进了测试套件——对一个开源模型来说这几乎是最高规格的信任背书。从能跑到能服务API 与推理栈进入 SGLang-Omni 之后AuK 获得的是一整套与 LLM 同级的服务化能力。首先是 API 形态生成任务走 OpenAI 风格的/v1/audio/speech传input文本与instructions音色描述即可做指令式 TTS传ref_audio加参考文本即可做零样本克隆编辑任务走/generate把去掉背景噪声换成耳语这类原生指令放进prompt字段配合metadata.tts_params.ref_audio指定源音频。一个模型、两种端点覆盖了生成与编辑两大能力面。其次是采样策略的可配置性。基础版 AuK 使用 Euler 求解器默认 32 次函数评估、CFG 强度 2.0、sway 系数 -1.0而蒸馏版 AuK-Flash 锁定官方发布的 4 步时间网格、关闭 CFG——这正是技术报告里描述的4 步无 CFG 推理、墙钟时间提速 4.5 倍的服务端落地。模型权重与推理配置解耦服务端可以通过启动参数覆盖采样细节而不必改动模型本身。然后是实打实的性能工程。SGLang-Omni 为 AuK 专门写了 Triton 内核把逐头 RMSNorm 与交错式 RoPE 融合成单个 kernel默认开启torch.compile逐块编译 Transformer并用 CUDA Graph 捕获整条 Euler 采样轨迹——由于每一步之间只有加噪 latent 和时间步在变化一次捕获即可复用于整条轨迹乃至后续所有形状匹配的请求。在 config.yaml 中还能看到这类工程取舍的影子推理默认把注意力后端切到torch以消除 flash_attn 的安装负担把开箱即用贯彻到底。社区实测数据印证了这套栈的真实水平。SGLang-Omni 的 AuK 优化路线图issue #2064披露单张 H200 上并发 8 时吞吐约 1.2 请求/秒RTF p99 在并发 8/16/32 下分别为 5.3/9.2/19.3在并发 16 的事件分解中DiT 采样占总耗时 80.8%Qwen 条件编码占 10.1%VAE 解码仅占 8.9%——瓶颈在哪、优化该打哪里数据说得明明白白。首轮合并的 Q/K RMSNormRoPE 融合内核在并发 1 到 64 的扫描中带来约 32%~42% 的吞吐提升且 WER 与上游完全一致。这些数字意味着语音模型第一次享受到可观测、可调优、可压测的服务化待遇。Gradio、ComfyUI、SGLang三路部署一个模型社区对 AuK 的工程化反馈可以浓缩成三个关键词Gradio、ComfyUI、SGLang-Omni。这三条路径恰好构成了开源语音模型生态里清晰的分层——体验层、创意层、生产层。Gradio 解决的是最快跑起来。官方同时上线了 Hugging Face 与 ModelScope 的在线 Demo Space社区也涌现出本地一键整合包拉权重、起 WebUI、上传参考音频、输入自然语言指令几分钟内就能复刻音色、改情绪、去口音甚至做 ASMR 式的音频编辑。它的价值在于把模型的边界快速暴露给普通用户也把显存门槛、时长限制这些真实约束第一时间反馈给开发者。ComfyUI 解决的是可视化编排。把 AuK 接入节点化工作流后零样本 TTS、内容编辑、人声分离可以被拖拽成可复用的流水线一段人声进去并行输出增强版、去口音版、目标说话人提取版再把结果级联给后续处理节点。对于创作者和后期人员这比手写 Python 调用友好得多也让语音能力第一次像图像工作流一样具备可组合性。SGLang-Omni 解决的是规模化服务。它是三者中唯一面向并发的路径动态批处理、长度分桶、CUDA Graph 复用、SeedTTS 基准的一键评测脚本乃至后续计划中的编辑任务评估基准MMAE-Speech、SpeechEditBench、Ming-Freeform-Audio-Edit 已在路线图中登记。三层定位彼此不冲突——Gradio 做传播ComfyUI 做创作SGLang 做承载而底层是同一个模型、同一套权重、同一个自然语言指令接口。配合 AuK / AuK-Flash 双变体高质 32 步与高速 4 步一个生态骨架已经相当完整。当然生态的真实度不在于宣传而在于坦诚的边界。目前已知的限制包括单次生成默认有 30 秒音频长度上限服务端可通过参数放宽推理需要同时常驻 Qwen2.5-Omni-3B 编码器、1.5B DiT 与 VAE显存门槛不低README.md 的权重要求一节也写明 MLLM 编码器与 VAE 需运行时单独加载text_encoder.*权重缺失属预期行为。最诚实的一笔来自技术报告SpeechEditBench 上情绪编辑的联合成功率只有 9.94%——统一指令接口覆盖了任务但覆盖不等于每个任务都已炉火纯青。这些短板没有影响生态的成型反而指明了社区接下来该补的位置。开源语音生态的下一站把视野拉远一点AuK 进入 SGLang-Omni 更像是一个信号语音模型的生态竞争正在从模型能力转向模型 推理栈 工具链的整体。先看能力盘子。技术报告披露的训练语料是 30.3 亿条指令-音频样本、195 万小时有效监督横跨生成、内容编辑、声学编辑、副语言编辑与增强分离五大任务族后训练阶段用人类反馈偏好优化对齐开放编辑用 Flow-GRPO 强化生成质量再用任务路由的 Decoupled DMD 蒸馏出 4 步推理的 AuK-Flash。基准成绩也拿得出手Seed-TTS-Eval 三语平均 WER 2.65%、说话人相似度 0.795双双压过此前的最强基线MMAE-Speech 的指令遵循率 48.23%、属性保持率 88.11%DNS 挑战赛 dWER 降到 2.66%AuK-VAE 在语音、通用音频、音乐三域的重建指标全面领先。SGLang-Omni 官方复现的编辑评估英语 Full 集 WER 3.96%、准确率 84.58%也基本对齐了论文数据——这说明成绩是可以被第三方复现的而不是自说自话。再看生态结构。SGLang-Omni 的 Cookbook 里已经躺着一长串语音模型Qwen3-TTS、Fish Audio、MiniMax Music 3、dots.tts、ZONOS2、MOSS-TTS……AuK 是其中任务覆盖最全的成员之一也是少数把编辑作为一等公民接进服务化的模型。它的适配模式——冻结 MLLM 编码器 扩散主干 VAE 三段式、上游一致性测试、逐层优化与吞吐数据公开——正在成为第三方推理栈接入新语音模型的参考模板。而 SGLang-Omni 路线图中把语音编辑评估纳入基准体系的计划则预示着下一个阶段的主题当生成质量趋于同质化编辑能力、时长可控性、流式延迟与评估标准化将成为差异化战场。最后回到那个问题开源语音模型接下来会怎么长。AuK 给出的答案有三层。第一统一指令接口是方向——自然语言指令 参考音频正在成为语音界的通用 prompt任务碎片化被接口统一替代。第二蒸馏加速是标配——4 步无 CFG 推理、4.5 倍提速不再是论文里的表演而是直接落进服务端默认配置的工程事实。第三生态分层的价值大于单点能力——Gradio 触达用户、ComfyUI 服务创作者、SGLang-Omni 承载生产叠加 MIT 协议赋予的商用自由度一个可组合、可演进、可商业化的语音开源生态正在成型。模型会迭代基准会刷新但统一任务、开放协议、多端部署这套组合拳已经让 AuK 从又一个开源模型变成了开源语音生态里一个真正的节点。【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考