恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
Yi 开源双语大模型从 0 到 1:安装、推理到微调的完整新手教程
首页
资讯中心
/
Yi 开源双语大模型从 0 到 1:安装、推理到微调的完整新手教程
Yi 开源双语大模型从 0 到 1:安装、推理到微调的完整新手教程
发布时间:2026/9/20 2:24:47
Yi 开源双语大模型从 0 到 1安装、推理到微调的完整新手教程【免费下载链接】YiA series of large language models trained from scratch by developers 01-ai项目地址: https://gitcode.com/GitHub_Trending/yi/YiYi 是 01.AI 从零训练非 Llama 衍生品的开源中英双语大语言模型系列覆盖 6B / 9B / 34B 多种规格配套官方的推理、微调、量化代码和多模态版本让个人开发者和中小团队也能在自有硬件上跑起来一个表现不俗的开源 LLM。规格齐全Yi-6B / 9B / 34B另有 200K 长上下文版本和多模态的 Yi-VL 版本部署门槛低4-bits 量化版最低 4GB 显存即可运行消费级显卡甚至 MacBook 都能跑兼容主流生态沿用 Llama 架构transformers、Docker、llama.cpp 等工具开箱即用官方工具链仓库自带推理 demo、SFT 微调脚本、AWQ/GPTQ 量化脚本许可友好代码与权重均为 Apache 2.0可免费用于个人、学术和商业场景能力版图Yi 仓库里都有什么能力对应入口关键特性备注Base 文本续写demo/text_generation.py支持流式输出、多卡张量并行续写模式非对话模式Chat 对话推理demo/web_demo.py一行命令起 Web 聊天界面可调系统提示、温度等仅 Chat 模型支持长上下文Yi-6B-200K / Yi-34B-200K200K token 上下文约 40 万汉字34B-200K 需 4 x A800 级别显存多模态视觉问答VL/single_inference.py、VL/cli.pyYi-VL-6B / 34B支持命令行、Web demo、OpenAI 风格 API发布时 MMMU / CMMMU 基准第一2024 年 1 月量化压缩quantization/ 下 AWQ、GPTQ 脚本后训练量化4-bits 版最低 4GB 显存精度会下降几个百分点SFT 微调finetune/scripts/ 下run_sft_Yi_6b.sh等官方微调 评估脚本支持自定义 jsonl 数据6B 建议 4 卡 x 60GB34B 全参需 8 x 80GB本地 CPU/低功耗推理llama.cpp GGUF 权重仓库提供教程MacBook Pro16GB / M2 Pro可跑 2-bit 量化版参考 docs/README_llama.cpp.md跑通最小闭环3 步拿到第一条模型回复先说结论有 A80080GB级别的卡走 pip / Docker 路线只有 MacBook 这类设备直接走 llama.cpp GGUF 量化权重。官方给出的学习路径选择图如下第 1 步拿到代码并装依赖需 Python 3.10git clone https://gitcode.com/GitHub_Trending/yi/Yi cd Yi pip install -r requirements.txt也可以用官方 Docker 镜像替代本地环境docker run -it --gpus all -v your-model-path:/models ghcr.io/01-ai/yi:latest第 2 步下载模型权重。模型托管在 Hugging Face、ModelScope魔搭、WiseModel 等平台选对应规格下载即可如Yi-6B-Chat小显存选 4-bits 量化版。第 3 步写一个最小推理脚本保存为quick_start.py并运行from transformers import AutoModelForCausalLM, AutoTokenizer model_path your-model-path # 替换为本地模型路径 tokenizer AutoTokenizer.from_pretrained(model_path, use_fastFalse) model AutoModelForCausalLM.from_pretrained( model_path, device_mapauto, torch_dtypeauto ).eval() # 走 chat 模板把 hi 发给模型 messages [{role: user, content: hi}] input_ids tokenizer.apply_chat_template( messages, tokenizeTrue, add_generation_promptTrue, return_tensorspt) output_ids model.generate(input_ids.to(cuda)) response tokenizer.decode(output_ids[0][input_ids.shape[1]:], skip_special_tokensTrue) print(response) # 例如: Hello! How can I assist you today?python quick_start.py跑通后你就完成了 Yi 部署的最小闭环 后面所有玩法都是在这个基础上加功能。实战示例从 Web 界面到多模态场景 1一条命令拉起 Web 聊天界面适合想快速演示或给团队试用 Chat 模型的情况。注意Web demo 只支持 Chat 模型Base 模型不行python demo/web_demo.py -c 你的模型路径命令执行完按控制台提示的网址访问浏览器即可。Base 模型想体验多卡推理的话用张量并行脚本2 卡示例来自 demo/README.mdtorchrun --nproc_per_node 2 text_generation_tp.py \ --model 01-ai/Yi-6B --max-tokens 512 --streaming场景 2用 Yi-VL 做多模态图片问答Yi-VL视觉语言模型能看图说话。先按 VL/README.md 装好 VL 依赖然后用仓库自带的示例图提问cd VL export PYTHONPATH$PYTHONPATH:$(pwd) pip install -r requirements.txt CUDA_VISIBLE_DEVICES0 python single_inference.py \ --model-path path-to-yi-vl-model \ --image-file images/cats.jpg \ --question Describe the cats and what they are doing in detail.上面这条命令做的事加载 Yi-VL 权重把cats.jpg和问题一起喂给模型得到一段对图中三只猫行为的详细描述。想要持续对话把入口换成 VL/cli.py想对外提供服务用 VL/openai_api.py 起一个 OpenAI 风格的 API。场景 3量化与微调把模型改小或改专量化显存不够时把模型压成低位。官方脚本支持 AWQ 和 GPTQ 两种方式例如python quantization/awq/quant_autoawq.py \ --model /base_model --output_dir /quantized_model --trust_remote_code更细的参数说明看 quantization/awq/README.md 和 quantization/gptq/README.md。微调用官方 SFT 脚本在自有数据上训练数据为promptchosen两字段的 jsonl示例见 finetune/yi_example_dataset/bash finetune/scripts/run_sft_Yi_6b.sh # 微调 bash finetune/scripts/run_eval.sh # 对比微调前后效果微调的完整流程含 Docker 方式、硬件配置建议在 finetune/README.md 里。选型前必须知道的边界与限制先给结论要中文场景、要代码数学能力、要在消费级显卡上跑Yi 值得用要单机跑 200K 长文本、或追求极致稳定的确定性输出要先掂量硬件和预期。显存要求推理最低显存模型最低显存参考 GPU 配置Yi-6B-Chat15 GB1 x RTX 3090 / 4090Yi-6B-Chat-4bits4 GB1 x RTX 3060 / 4060Yi-9B20 GB1 x RTX 4090Yi-34B-Chat72 GB1 x A800 80GB 或 4 x RTX 4090Yi-34B-Chat-4bits20 GB1 x RTX 3090 / 4090Yi-34B-200K200 GB4 x A800 80GB已知限制官方 FAQ 里明说的⚠️ Chat 模型训练时鼓励回复多样化副作用是幻觉、重新生成不一致、长推理中误差累积的概率更高建议调低温度 / top_p / top_k 来换一致性量化版 benchmark 会有几个百分点的性能下降逻辑推理类任务对这点差异尤其敏感34B 全参数微调需要 8 x 80GB 显卡LoRA 类低资源方案成本低得多默认上下文 4K200K 是单独的 200K 版本模型不是免费送的性能底牌官方基准中 Yi-34B-Chat 在 MMLU、CMMLU、BBH、GSM8k 等主流开源模型对比里处于第一梯队Yi-34B 曾在 Hugging Face Open LLM Leaderboard 与 C-Eval 上登顶数据截至 2023 年底。延伸阅读完整中文文档README_CN.md推理示例含张量并行demo/多模态 Yi-VL 文档VL/README.md微调指南finetune/README.md量化脚本说明quantization/awq/README.md、quantization/gptq/README.mdllama.cpp 本地部署教程docs/README_llama.cpp.md社区教程与最佳实践合集RAG、Function Calling、Ollama 等Cookbook/README.md【免费下载链接】YiA series of large language models trained from scratch by developers 01-ai项目地址: https://gitcode.com/GitHub_Trending/yi/Yi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考