恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
Kimi K2 版本选择:Base 和 Instruct 怎么挑
首页
资讯中心
/
Kimi K2 版本选择:Base 和 Instruct 怎么挑
Kimi K2 版本选择:Base 和 Instruct 怎么挑
发布时间:2026/9/15 13:25:47
Kimi K2 版本选择Base 和 Instruct 怎么挑【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2如果你正准备部署或微调 Kimi K2Moonshot AI 开源的 MoE 大模型系列第一个问题通常是“到底下载哪个 checkpoint”。这篇文章先给出 Kimi K2 版本选择结论再讲清楚 Base 和 Instruct 的差异、16 卡部署配置怎么落、工具调用怎么开以及兼容性的坑在哪。先交代两个关键事实Kimi K2 是 MoE混合专家模型总参数 1T、单次前向激活约 32B、上下文 128Kcheckpoint 以 block-fp8 格式发布。可选的 checkpoint 有两个Kimi-K2-Base基础模型未做指令微调和Kimi-K2-Instruct指令调优版对话和 Agent 任务即开即用属于无需长思考的反射级响应。Kimi K2 版本选择速查一张表定下载哪个你要做的事建议版本配置要点对话助手上线Instruct16 卡 TP 或 DPEP开工具调用解析器带工具调用的 AgentInstruct--enable-auto-tool-choice--tool-call-parser kimi_k2修代码 / SWE-bench 类任务Instruct单次尝试 65.8并行采样可到 71.6高吞吐在线服务InstructSGLang 4P12D 预填-解码分离 DeepEP-MoE二次训练 / 领域定制Base保留完整微调空间别直接拿来对话Instruct 的公开成绩多项为开源 SOTASWE-bench Verified 单次尝试 65.8、多序列并行采样 71.6SWE-bench Multilingual 47.3GPQA-Diamond 75.1IFEval 89.8MMLU 89.5。Base 在知识与数学底座上同样扎实MMLU 87.8、MMLU-Pro 69.2、GSM8k 92.1。Kimi K2 Base vs Instruct 的差别其实只有一件事有没有经过指令微调。这也是 Kimi K2 版本选择的分水岭。Kimi K2 工具调用怎么开两个引擎参数加一个请求循环Kimi K2 工具调用是 Instruct 的强项把函数描述传进去模型自己决定何时调、怎么调。开启分两处引擎启动参数、请求端循环。vLLM启动服务时加--enable-auto-tool-choice和--tool-call-parser kimi_k2SGLang加--tool-call-parser kimi_k2请求端请求体里带tools函数 schematool_choice设为auto。请求端调用循环核心是一个“模型不停要工具就继续调”的循环while finish_reason is None or finish_reason tool_calls: completion client.chat.completions.create( modelmodel_name, messagesmessages, temperature0.6, # Instruct 官方推荐 0.6 toolstools, # 例如 get_weather 的函数描述 tool_choiceauto, ) # 若 finish_reason tool_calls执行函数 # 把结果以 roletool 追加进 messages继续循环模型可能连续调用多次工具直到finish_reason不再是tool_calls循环才结束。流式输出和手动解析的完整写法见仓库里的 docs/tool_call_guidance.md工具调用输出包在|tool_calls_section_begin|这类特殊 token 里函数 ID 形如functions.{函数名}:{序号}按这个格式就能把函数名抠出来。16 卡 H200 的 Kimi K2 部署配置TP 和 DPEP先说硬约束128k 长序列的 FP8 权重在主流 H200/H20 上最小部署单元是 16 卡集群vLLM 要求 v0.10.0rc1 及以上。Kimi K2 部署配置最常见的两条路是 TP张量并行把一个模型拆到多卡上和 DPEP数据并行 专家并行冲吞吐用的。纯 TP一条 vllm serve 命令并行度不超过 16 时直接纯张量并行vllm serve $MODEL_PATH \ --port 8000 \ --served-model-name kimi-k2 \ --trust-remote-code \ --tensor-parallel-size 16 \ --enable-auto-tool-choice \ --tool-call-parser kimi_k2超过 16 卡时再叠加流水线并行最后两行只在需要启用工具调用时保留。DPEP两节点分 16 卡每机挂 8 张本地卡按需安装 DeepEP/DeepGEMM 库vllm serve $MODEL_PATH --port 8000 --served-model-name kimi-k2 \ --trust-remote-code --data-parallel-size 16 --data-parallel-size-local 8 \ --data-parallel-address $MASTER_IP --data-parallel-rpc-port $PORT \ --enable-expert-parallel --max-num-batched-tokens 8192 --max-num-seqs 256 \ --gpu-memory-utilization 0.85 --enable-auto-tool-choice --tool-call-parser kimi_k2第二节点加--headless --data-parallel-start-rank 8其余参数一致。--gpu-memory-utilization 0.85是吞吐和稳定性的折中值完整示例在 docs/deploy_guidance.md。追吞吐4P12D 预填-解码分离与 AMX 优化SGLang 4P12D 预填-解码分离把 prefill算上下文和 decode逐 token 出字拆到不同节点4 个 prefill 节点tp32/dp32 12 个 decode 节点tp96/dp96开--enable-deepep-moeDeepEP-MoEMoE 的专家并行通信优化prefill 端--mem-fraction-static 0.85、decode 端 0.8外加一个独立负载均衡进程。环境变量和完整命令都在 docs/deploy_guidance.md 里不必在此全部抄录。KTransformers 与 AMXCPU-GPU 混合推理路线下先把非 safetensors 的配置文件放进 GGUF checkpoint 目录再用--cache_lens 30000起服务。要启用 AMX 优化时加一个参数python ktransformers/server/main.py --model_path /path/to/K2 \ --gguf_path /path/to/K2 --cache_lens 30000 \ --optimize_config_path ktransformers/optimize/optimize_rules/DeepSeek-V3-Chat-fp8-linear-ggml-experts-serve-amx.yaml /输出文章 等等——上面内容在最后一个代码块后截断了我重新给出完整、无截断的正文 输出文章 # Kimi K2 版本选择Base 和 Instruct 怎么挑 如果你正准备部署或微调 Kimi K2Moonshot AI 开源的 MoE 大模型系列第一个问题通常是“到底下载哪个 checkpoint”。这篇文章先给出 Kimi K2 版本选择结论再讲清楚 Base 和 Instruct 的差异、16 卡部署配置怎么落、工具调用怎么开以及兼容性的坑在哪。 先交代两个关键事实 - Kimi K2 是 MoE混合专家模型总参数 1T、单次前向激活约 32B、上下文 128Kcheckpoint 以 block-fp8 格式发布。 - 可选的 checkpoint 有两个**Kimi-K2-Base**基础模型未做指令微调和 **Kimi-K2-Instruct**指令调优版对话和 Agent 任务即开即用属于无需长思考的反射级响应。 ## Kimi K2 版本选择速查一张表定下载哪个 | 你要做的事 | 建议版本 | 配置要点 | | --- | --- | --- | | 对话助手上线 | Instruct | 16 卡 TP 或 DPEP开工具调用解析器 | | 带工具调用的 Agent | Instruct | --enable-auto-tool-choice --tool-call-parser kimi_k2 | | 修代码 / SWE-bench 类任务 | Instruct | 单次尝试 65.8并行采样可到 71.6 | | 高吞吐在线服务 | Instruct | SGLang 4P12D 预填-解码分离 DeepEP-MoE | | 二次训练 / 领域定制 | Base | 保留完整微调空间别直接拿来对话 | [](https://link.gitcode.com/i/d69556246b285951f5370d30c3715f54) Instruct 的公开成绩多项为开源 SOTASWE-bench Verified 单次尝试 65.8、多序列并行采样 71.6SWE-bench Multilingual 47.3GPQA-Diamond 75.1IFEval 89.8MMLU 89.5。Base 在知识与数学底座上同样扎实MMLU 87.8、MMLU-Pro 69.2、GSM8k 92.1。 Kimi K2 Base vs Instruct 的差别其实只有一件事有没有经过指令微调。这也是 Kimi K2 版本选择的分水岭。 ## Kimi K2 工具调用怎么开两个引擎参数加一个请求循环 Kimi K2 工具调用是 Instruct 的强项把函数描述传进去模型自己决定何时调、怎么调。开启分两处引擎启动参数、请求端循环。 - vLLM启动服务时加 --enable-auto-tool-choice 和 --tool-call-parser kimi_k2 - SGLang加 --tool-call-parser kimi_k2 - 请求端请求体里带 tools函数 schematool_choice 设为 auto。 ### 请求端调用循环 核心是一个“模型不停要工具就继续调”的循环 python while finish_reason is None or finish_reason tool_calls: completion client.chat.completions.create( modelmodel_name, messagesmessages, temperature0.6, # Instruct 官方推荐 0.6 toolstools, # 例如 get_weather 的函数描述 tool_choiceauto, ) # 若 finish_reason tool_calls执行函数 # 把结果以 roletool 追加进 messages继续循环模型可能连续调用多次工具直到finish_reason不再是tool_calls循环才结束。流式输出和手动解析的完整写法见仓库里的 docs/tool_call_guidance.md工具调用输出包在|tool_calls_section_begin|这类特殊 token 里函数 ID 形如functions.{函数名}:{序号}按这个格式就能把函数名抠出来。16 卡 H200 的 Kimi K2 部署配置TP 和 DPEP先说硬约束128k 长序列的 FP8 权重在主流 H200/H20 上最小部署单元是 16 卡集群vLLM 要求 v0.10.0rc1 及以上。Kimi K2 部署配置最常见的两条路是 TP张量并行把一个模型拆到多卡上和 DPEP数据并行 专家并行冲吞吐用的。纯 TP一条 vllm serve 命令并行度不超过 16 时直接纯张量并行vllm serve $MODEL_PATH \ --port 8000 \ --served-model-name kimi-k2 \ --trust-remote-code \ --tensor-parallel-size 16 \ --enable-auto-tool-choice \ --tool-call-parser kimi_k2超过 16 卡时再叠加流水线并行最后两行只在需要启用工具调用时保留。DPEP两节点分 16 卡每机挂 8 张本地卡按需安装 DeepEP/DeepGEMM 库vllm serve $MODEL_PATH --port 8000 --served-model-name kimi-k2 \ --trust-remote-code --data-parallel-size 16 --data-parallel-size-local 8 \ --data-parallel-address $MASTER_IP --data-parallel-rpc-port $PORT \ --enable-expert-parallel --max-num-batched-tokens 8192 --max-num-seqs 256 \ --gpu-memory-utilization 0.85 --enable-auto-tool-choice --tool-call-parser kimi_k2第二节点加--headless --data-parallel-start-rank 8其余参数一致。--gpu-memory-utilization 0.85是吞吐和稳定性的折中值完整示例在 docs/deploy_guidance.md。追吞吐4P12D 预填-解码分离与 AMX 优化SGLang 4P12D 预填-解码分离把 prefill算上下文和 decode逐 token 出字拆到不同节点4 个 prefill 节点tp32/dp32 12 个 decode 节点tp96/dp96开--enable-deepep-moeDeepEP-MoEMoE 的专家并行通信优化prefill 端--mem-fraction-static 0.85、decode 端 0.8外加一个独立负载均衡进程。环境变量和完整命令都在 docs/deploy_guidance.md 里不必在此全部抄录。KTransformers 与 AMXCPU-GPU 混合推理路线下先把非 safetensors 的配置文件放进 GGUF checkpoint 目录再用--cache_lens 30000起服务。要启用 AMX 优化时加一个参数python ktransformers/server/main.py --model_path /path/to/K2 \ --gguf_path /path/to/K2 --cache_lens 30000 \ --optimize_config_path ktransformers/optimize/optimize_rules/DeepSeek-V3-Chat-fp8-linear-ggml-experts-serve-amx.yamlTensorRT-LLM源码构建 v1.0.0-rc2用mpirun -np 16 -H HOST1:8,HOST2:8两节点拉起--tp_size 16 --ep_size 8KV 缓存占用--kv_cache_free_gpu_memory_fraction 0.95--max_batch_size 128。Base 二次训练与 model_type 兼容坑只有打算自己做微调时才选 Base它保留了完整的调优空间知识和数学底座扎实MMLU 87.8、MMLU-Pro 69.2、LiveCodeBench v6 26.3。但因为没有指令跟随能力别直接拿它对话。⚠️ 一个兼容性坑Kimi K2 复用了DeepSeekV3CausalLM架构模型config.json里的model_type是kimi_k2让引擎据此识别并套用对应优化。如果你的推理框架不在推荐列表里官方文档给的临时办法是把本地模型权重目录注意是下载后的权重目录不是公开仓库的 config.json 改一行{ model_type: deepseek_v3 }改完模型能跑但该框架大概率没有kimi_k2解析器工具调用解析得自己实现。最后拉取部署文档和工具调用示例的本地方式git clone https://gitcode.com/GitHub_Trending/ki/Kimi-K2代码与权重均为 Modified MIT 许可细节见仓库 LICENSE 文件。【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考