恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
RKNN-LLM 上手指南:从模型转换到板端 NPU 大模型推理
首页
资讯中心
/
RKNN-LLM 上手指南:从模型转换到板端 NPU 大模型推理
RKNN-LLM 上手指南:从模型转换到板端 NPU 大模型推理
发布时间:2026/8/22 19:59:03
RKNN-LLM 上手指南从模型转换到板端 NPU 大模型推理【免费下载链接】rknn-llm项目地址: https://gitcode.com/gh_mirrors/rk/rknn-llmRKNN-LLM 是 Rockchip NPU芯片里专门加速 AI 运算的硬件单元端侧 LLM 部署的软件栈在 PC 上完成 RKNN 模型转换把大模型推理直接跑在开发板上。三步把 HuggingFace 模型跑上开发板 环境准备PC 装 Python 3.9~3.12从rkllm-toolkit/packages/挑对应版本的 whl 装上依赖按requirements.txt拉。模型转换照着examples/rkllm_api_demo/export/export_rkllm.py走三步——load_huggingface()读权重 →build()量化编译 →export_rkllm()出.rkllm文件。先跑同目录generate_data_quant.py生成data_quant.json校准集转换才不翻车。板端推理用examples/rkllm_api_demo/deploy的 C 例程交叉编译把可执行文件、lib/和.rkllm推到板子设好export LD_LIBRARY_PATH./lib后跑./llm_demo model.rkllm 2048 4096即可出对话。多模态模型Qwen2-VL、InternVL3 等的视觉塔另走 rknn-toolkit2 转成.rknn参考examples/multimodal_model_demo。各模块分工什么场景拉哪个 ⚙️模块一句话定位你在什么场景下碰它rkllm-toolkitPC 端模型转换与量化产出.rkllm换模型、调量化参数、出文件一切从这里开始rkllm-runtime板端 C/C 推理库librkllmrt.sorkllm.h写自己的推理程序链接它调 C APIrknpu-driverNPU 内核驱动已开源并入 Rockchip 内核NPU 起不来、怀疑驱动版本不匹配时排查scripts锁频与 CPU/NPU 占用监控脚本跑 benchmark、性能调优前后对比examplesAPI、多模态、服务化三套完整样例抄模板改别从零写五处最常动的配置量化精度、NPU 核数与上下文调法 ⚡量化精度默认quantized_dtypeW8A8配normal算法→ 大模型想省板端内存 → 改W4A16并把quantized_algorithm切到grq。NPU 核数默认num_npu_core3→ RK3588/RK3576 全系就是三核 → 保持不动。上下文长度默认max_context4096→ 多模态输入超了会截断丢图 → 调大到「文本 token 图像 token max_new_tokens」之上但别猛拉NPU 内存会爆。Embedding 存放默认常驻内存 → 板子内存吃紧 → 开embed_flash把词嵌入表塞进 flash。校准集默认用样例数据 → 业务域差异大导致量化掉点 → 换成贴近真实场景的问答对再build()。三个新手必撞坑缺库、NPU 初始化失败、Python 版本 ⚠️报libomp.so找不到去交叉编译工具链里翻出这个库放到librkllmrt.so同目录。NPU 初始化失败先确认板端内核驱动版本和 SDK 版本对齐再跑scripts/里对应平台的fix_freq_rk3588.sh等锁频脚本。转换环境报错工具只支持 Python 3.9~3.123.12 装依赖前先export BUILD_CUDA_EXT0RWKV7 转换仅支持 3.12。深入细节看 doc/ 里的官方 PDF版本改动查 CHANGELOG.md支持模型全列表与性能数据见 README.md 和benchmark.md。【免费下载链接】rknn-llm项目地址: https://gitcode.com/gh_mirrors/rk/rknn-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考