恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

1931_日常应用的主力模型切换成 Qwen 27B

  • 首页
  • 资讯中心
  • /
  • 1931_日常应用的主力模型切换成 Qwen 27B

相关资讯

购物节消费博弈:从平台补贴到理性决策的实战指南 2026/8/2 17:47:50
STM32F469与LTE Cat 1模块在工业物联网中的设计与优化 2026/8/5 21:20:49
STM32F407串口DMA收发详解:标准库实现与环形缓冲区应用 2026/8/2 17:47:51

最新资讯

短信接口集成实战:标准化流程与常见问题解决
Rocky Linux 8.6 整机系统备份与迁移方案文档文档用途
多波束测深建模:从几何原理到覆盖优化,解析数模竞赛B题核心
VMware安装CentOS 7超详细指南:从网络配置到故障排查
秘诀-如何远程SSN访问家里的八台电脑(frp 实操方案)
网页表单自动填写:从原生JS到自动化框架的四种实战方法

今日推荐

内景 空间站内部 中国空间站 太空 内仓
重新定义数据接口:3个突破性场景让通达信数据读取更智能
5大网络安全实操平台,免费练手入门,轻松掌握攻防技能

本周热门

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁
如何快速生成中国车牌图片:Python开源工具完整指南
当 LLM 遇见大文档:主流开源项目如何处理上下文超限

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

1931_日常应用的主力模型切换成 Qwen 27B

发布时间:2026/8/15 13:16:13
1931_日常应用的主力模型切换成 Qwen 27B 在过去的两个星期里面我手头使用的主力本地大模型是千问的 35B-A3B。从使用的体验来说这个 A3B 的模型的确是足够惊艳的能够满足我大部分的一个使用场景。比较重要的一点是它的输出效率非常高执行的速度非常快每秒的 token 数非常多。那么为什么我还要切换 27B 的模型呢主要是在高频次使用 A3B 的这个模型的时候偶尔会发现这个模型的发挥不是那么稳定输出的一致性也不是特别好。通过网络上的一些信息检索对比发现 27B 这方面可能会更优秀一些。我尝试部署的 27B 模型是一个 IQ3 的量化版本。因为选择这个版本的话基本上能够刚好把我的 RTX 5080 Laptop 的显卡用起来也不会有太多的 CPU RAM 相关的限制。在选择这个模型的时候我也做了一些基础的测试。从网络上找了一些别人测试其他模型时候用的一些输入比如说让它做一个小游戏之类的。发现 27B 的模型在实现这部分功能的时候表现的比较好。经过了一系列的调优27B 的模型在我现在电脑上的配置如果是开启了 MTP 模式之后最高的速度可能能达到 45 token 每秒。但是在这样的配置之下上下文就压缩的特别可怜只能 16K。如果配合 Agent 使用的时候16K 的上下文可能就是一个很大的短板。于是尝试做了一些其他的修改保证这个模型首先能用。我尝试的几个修改点主要有上下文的量化压缩同时取消 MTP 的加速。这样的话基本上能保证 48K 的上下文。在 48K 上下文的配置之下显存的占用大概是 14.6G内存的占用包括系统本身的一些服务占用一共是占用了大概 22G运行过程中最高占到 28.5G 左右。最终 GPU 还有 1G 多的空闲这样的话可能不至于在系统偶尔使用的时候导致整个大模型的崩溃。在这样的配置之下每秒的 token 数大概是 25 左右。不是特别快但是基本上能够满足一些代码推理编写的基本需求。进行了一个复杂模块的软件编写中间没有出现爆显存之类的问题。在这个过程中GPU 的压力还是很大的而且温度也是比较高的。我看温度最后到了 86 度。后续的话在这个基础上继续使用一段时间中间也可以去尝试一下其他参数的优化看看能不能有更高的输出速度。有一点值得注意的是我发现相比于 A3B 的模型这个 27B 的单词模型在解决同一个问题的时候消耗的 Token 数会少很多。虽然总体的执行时间还是比 3B 要长一些但是在复杂问题的解决上这个时间也不是一个很大的劣势体验差距不是很大。下面附加我的启动脚本。echo offsetlocalset LLAMA_CPP_DIRC:\llama.cppset MODEL_PATH%LLAMA_CPP_DIR%\models\Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-IQ3_M.gguf:: 【致命修复1】将上下文削减到 48000set CONTEXT_SIZE48000:: 【致命修复2】保持全层 GPU但配合下方压缩set GPU_LAYERS99:: 线程数保持物理大核数量如 8-12set THREADS10set PORT8080set HOST0.0.0.0echo Starting Safe Mode Qwen3.6-27B Server...echo Model: %MODEL_PATH%echo Context: %CONTEXT_SIZE%, Layers: %GPU_LAYERS%, Threads: %THREADS%%LLAMA_CPP_DIR%\llama-server.exe ^-m %MODEL_PATH% --alias Qwen3.6-27B ^-c %CONTEXT_SIZE% ^-ngl %GPU_LAYERS% ^-t %THREADS% ^-b 512 ^-ub 512 ^--port %PORT% ^--host %HOST% ^--threads-batch %THREADS% ^--chat-template chatml ^--parallel 1 ^-ctk q4_0 ^-ctv q4_0 ^-fa on ^--split-mode layer ^--mlockpause

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号