恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

Xinference 部署 Qwen2.5-Omni:Omni 全模态模型的启动命令、引擎选择与源码级请求链路

  • 首页
  • 资讯中心
  • /
  • Xinference 部署 Qwen2.5-Omni:Omni 全模态模型的启动命令、引擎选择与源码级请求链路

相关资讯

51单片机智能台灯:软硬件闭环设计与工程调试指南 2026/9/17 22:15:28
Windows Server 2008 R2远程桌面授权报错:120天过期与CAL配置全解析 2026/9/17 22:15:28
一条 TaoToken Key:补丁验证 Agent 在 FLAWED 里分档跑 2026/9/17 22:10:27

最新资讯

文华财经15分钟指标源码详解:SAR均线过滤与图形绘制
Webnovel Writer 题材模板体系:37 个内置网文题材、别名映射与复合题材融合实战指南
如何实现优雅降级的依赖探测:book-to-skill dependencies.py最佳实践拆解
Genkit × Angular:用流式 Flow 在 Angular 应用中构建 Gemini 驱动的角色生成器与聊天机器人
短视频封面设计工具怎么选?盘点一批模板资源充足的平台
Notepad--:批量查找替换、编码转换、文件对比,3 件事搞定日常文本编辑

今日推荐

每日热评|13% 的 Agent 技能带严重漏洞,这个注册表想用“验证+签名”解决信任危机
即梦AI保姆级教程:从生图到数字人,一站式搞定AI视频创作
BERT+LLM混合架构:突破NER长尾实体抽取瓶颈的工程实践

本周热门

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化
Flutter应用改名全指南:从Android到iOS的配置与工具实践

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

Xinference 部署 Qwen2.5-Omni:Omni 全模态模型的启动命令、引擎选择与源码级请求链路

发布时间:2026/9/17 22:15:28
Xinference 部署 Qwen2.5-Omni:Omni 全模态模型的启动命令、引擎选择与源码级请求链路 Xinference 部署 Qwen2.5-OmniOmni 全模态模型的启动命令、引擎选择与源码级请求链路【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inferenceXinference 将 Qwen2.5-Omni 作为内置模型收录支持 3B 与 7B 两种规格通过一条xinference launch命令即可在 vLLM 或 Transformers 引擎上拉起服务。本文基于官方模型文档 qwen2.5-omni结合 模型注册表、Transformers 多模态实现 与 vLLM 引擎核心 的源码完整讲解该模型的规格参数、启动方式、多模态输入处理链路以及其独有的“音频输出”在响应中如何编码与返回。模型概览规格、能力与上下文qwen2.5-omni是 Qwen 系列中的端到端全模态Omni模型可感知文本、图像、音频、视频输入并生成文本与语音。模型在 Xinference 中的注册信息以 JSON 声明于 llm_family.json与文档页完全一致属性取值说明Model Nameqwen2.5-omni启动时的--model-name取值Context Length32768最大上下文长度tokenLanguagesen,zh中英双语Abilitieschat,vision,audio,omniomni能力决定引擎走全模态处理分支Model Formatpytorch两种规格均为 PyTorch 格式Quantizationsnone目前仅支持不量化EnginesvLLM、Transformers两种推理引擎可选两个规格及其 Model ID3BQwen/Qwen2.5-Omni-3B7BQwen/Qwen2.5-Omni-7B两个 Model ID 均可从 Hugging Face 或 ModelScope 两个模型源拉取源码中model_src分别为huggingface与modelscope两个分支。能力字段里同时声明了vision、audio与omni这一点很关键从源码结构看omni这个 ability 是引擎选择多模态处理路径的开关后文的 vLLM 与 Transformers 实现都会依据它分支。启动模型xinference launch命令由于唯一支持的量化方式为none文档中的${quantization}占位符直接填none。启动命令如下${engine}替换为vllm或transformers。3B 规格pytorch, 3 Billionxinference launch --model-engine vllm \ --model-name qwen2.5-omni \ --size-in-billions 3 \ --model-format pytorch \ --quantization none7B 规格pytorch, 7 Billionxinference launch --model-engine vllm \ --model-name qwen2.5-omni \ --size-in-billions 7 \ --model-format pytorch \ --quantization none启动成功后会返回一个model_uid后续所有 OpenAI 兼容的/v1/chat/completions请求都通过该 uid 寻址。从 llm_family.json 的virtualenv.packages字段可以看到Xinference 会为该模型按需安装一组专属依赖按引擎条件安装的#transformers_dependencies#、#vllm_dependencies#、#sglang_dependencies#此处实际启用前两者qwen_omni_utilsQwen Omni 系列官方多模态工具包负责解析 messages 中的音频/图像/视频内容该依赖同时出现在 pyproject.toml 的可选依赖声明中audioread、soundfile音频解码与 WAV 写入。另外该模型在注册表中声明了完整的 Jinjachat_template含|vision_bos||IMAGE||vision_eos|、|audio_bos||AUDIO||audio_eos|等多模态特殊标记的拼装逻辑以及停止标记stop_token_ids: [151645, 151643]即 【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号