恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

Qwen3.6-35B 多模态模型 llama.cpp 部署实战:命令行、脚本与 API 服务全指南

  • 首页
  • 资讯中心
  • /
  • Qwen3.6-35B 多模态模型 llama.cpp 部署实战:命令行、脚本与 API 服务全指南

相关资讯

Dawarich Kubernetes 部署指南:从 YAML 清单到生产可用的自托管位置追踪服务 2026/9/15 21:46:38
计算机视觉与光谱分析在食品包装重金属检测中的应用 2026/9/15 21:41:38
跨系统支付测试方案全解析:从用例设计到避坑实践 2026/9/15 21:41:38

最新资讯

21天日更挑战复盘:从目标设定到习惯养成的实战经验
CubeSandbox 全链路追踪指南:Sandbox.create() 如何快速穿越 8 层组件
Plate 如何手动安装无头包并搭建第一个编辑器?
SpringBoot+Vue+微信小程序构建民宿预约系统实战
怎么选成长股?费雪教你识别真正的行业冠军并长期持有
TanStack Start 的 no-async-client-component 规则:基于渲染图的异步组件客户端上下文静态检测

今日推荐

GDPR下大数据架构重构与隐私保护实践
多组学数据平台架构设计与优化实践
企业主数据管理系统架构设计与实施全解析

本周热门

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化
Flutter应用改名全指南:从Android到iOS的配置与工具实践

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

Qwen3.6-35B 多模态模型 llama.cpp 部署实战:命令行、脚本与 API 服务全指南

发布时间:2026/9/15 21:46:38
Qwen3.6-35B 多模态模型 llama.cpp 部署实战:命令行、脚本与 API 服务全指南 Qwen3.6-35B 多模态模型 llama.cpp 部署实战命令行、脚本与 API 服务全指南【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS想让一个能看图、说话开放未加内容过滤的多模态大模型跑在自家机器上目标模型是 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive基于 Qwen3.6-35B-A3B 开发文本、图像、视频都能进开放对话风格。本文覆盖它在 llama.cpp 里的完整落地路径——量化版本怎么选、源码怎么编译、命令行怎么聊、脚本怎么调、API 服务怎么开复制命令即可执行。硬件门槛与量化版本怎么选先对一下机器再决定下哪个文件内存32GB 起步64GB 及以上更从容显卡CUDA 架构显存 12GBRTX 3090 / 4090 一档体验最佳基础软件Git、GCC 或 Clang、CMake量化文件统一命名Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-量化.gguf按硬件对号入座量化体积适合硬件Q8_K_P约 44 GB高端 GPU / 服务器Q4_K_M约 21 GB中端 GPU默认推荐IQ2_M约 11 GB入门 GPU / 纯 CPU图像与视频理解还依赖配套的mmproj-...-f16.gguf投影文件随模型一起获取后文所有命令都假设它和模型文件在同一目录。模型文件与 llama.cpp 编译就位从模型镜像仓库下载上表中的量化文件与 mmproj 投影文件放入工作目录。克隆配套示例仓库本文使用的界面截图素材就在data/目录里git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS cd UI-TARS获取 llama.cpp 源码后编译CUDA 加速make LLAMA_CUBLAS1验证产物可用./llama-cli --version纯 CPU 环境直接make即可无需 CUBLAS。三种跑法按场景选入口命令行交互——手动试手感、看原始输出、临时调温度./llama-cli \ -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf \ --mmproj mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \ --jinja -c 131072 -ngl 99-m模型文件--mmproj图像/视频投影文件--jinja启用对话模板保证格式正确-c 131072128K 上下文-ngl 99全部层上 GPU本地脚本调用——批量处理截图、跑固定任务。以图像理解为例把一张 GUI 截图 base64 编码后发给本地服务import base64, json, urllib.request b64 base64.b64encode(open(data/coordinate_process_image.png, rb).read()).decode() payload {messages: [{role: user, content: [ {type: text, text: 这张 GUI 截图打开了什么程序}, {type: image_url, image_url: {url: data:image/png;base64, b64}}]}], max_tokens: 256} req urllib.request.Request(http://localhost:8080/v1/chat/completions, datajson.dumps(payload).encode(), headers{Content-Type: application/json}) print(urllib.request.urlopen(req).read().decode())API 服务——让 Web 应用或其他程序来调30 秒起一个 ./llama-server \ -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf \ --mmproj mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \ --jinja -c 131072 -ngl 99 \ --host 0.0.0.0 --port 8080纯文本生成走/completioncurl -X POST http://localhost:8080/completion \ -H Content-Type: application/json \ -d {prompt: 写一篇关于人工智能的短文, temperature: 0.7, max_tokens: 512}图像理解走 OpenAI 兼容的/v1/chat/completionsimage_url里放 base64。模型返回的点击坐标可以画回原图核对定位效果生成参数调参手册场景temperaturetop_ptop_k手感通用对话 / 生成1.00.9520默认配置代码与精确任务0.60.9520更收敛少跑偏深度推理1.01.040采样放开容忍试错显存紧张时加--low-vram并按任务动态调小-c。跑不动了看这里排错速查现象常见原因解法模型加载失败路径写错 / 文件下载不完整核对相对路径重新下载并校验显存不足OOM量化偏高或上下文过长换 Q4_K_M / IQ2_M加--low-vram缩小-c生成速度慢GPU 层数没吃满-ngl提到 99关掉其他占用 GPU 的进程图像输入无反应漏了--mmproj或图片未做 base64确认投影文件参数生效image_url须为data:image/...;base64,形式对话格式错乱模板没启用命令行与服务端都带上--jinja跑通之后延伸资源更完整的部署与推理流程README_deploy.md动作解析与后处理代码codes/ui_tars/建议路线先用 Q4_K_M 在llama-cli里试手感确认输出符合预期再切到llama-server把能力开放给其他程序——现在就可以把上面第一段命令敲下去。【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号