恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
Llama Models 从安装到跑通:新手快速跑起 Llama 4 实战指南
首页
资讯中心
/
Llama Models 从安装到跑通:新手快速跑起 Llama 4 实战指南
Llama Models 从安装到跑通:新手快速跑起 Llama 4 实战指南
发布时间:2026/9/20 15:55:48
Llama Models 从安装到跑通新手快速跑起 Llama 4 实战指南【免费下载链接】llama-modelsUtilities intended for use with Llama models.项目地址: https://gitcode.com/GitHub_Trending/ll/llama-modelsLlama Models 是 Meta 官方的 Llama 模型工具库模型权重、分词器把文本切成模型能读的 token 的组件、llama-model命令行下载工具、以及能直接运行的推理代码全都在一个仓库里。它覆盖 Llama 2 到 Llama 4 共 7 个模型家族其中最新的 Llama 4 原生支持图像输入并且用混合专家MoE一种只激活部分参数的网络结构把推理成本压了下来。这篇文章不讲宏大概念只回答一个问题拿到这个仓库之后我怎么最快看到模型输出的第一句话 先搞清它能帮你解决什么下载一个大模型麻烦通常不止下载本身权重散落在不同渠道、下载链接要审批、下完还得自己搭推理代码。这个仓库把整条链路打包了一套llama-modelCLI查模型、下权重、校验完整性、删模型、查提示词格式一共 7 个命令。装包时会自动注册装完就能敲。可直接跑的推理代码models/llama3/scripts/和models/llama4/scripts/里就有示例脚本不用自己写加载逻辑。每个模型的完整档案模型卡、使用政策USE_POLICY、许可证分目录放好比如 Llama 4 模型卡。7 个 CLI 命令够用一辈子llama-model list列出最新可用模型加--show-all能看到所有历史版本describe -m 模型ID查看某个模型的详细信息download从 Meta 或 Hugging Face 下载verify-download校验文件完整性remove -m 模型ID删掉已下载的模型prompt-format -m 模型ID显示该模型的提示词格式不同模型的对话模板长得不一样写应用前值得看一眼。任何命令加--help都有详细帮助。权重下载后放在哪所有权重默认落在~/.llama/checkpoints/模型ID/目录下。后面跑推理时要指定这个路径记住它就行。⏱️ 5 分钟搭好环境安装与下载权重安装 CLI 并查看模型列表Python 需要 3.10 及以上版本。三条命令从空环境到开始下载pip install llama-models llama-model list llama-model download --source meta --model-id Llama-4-Scout-17B-16E-Instructlist的输出会告诉你当前最新的模型 ID。想跑别的版本先把 ID 换成你要的。拿到签名链接完成下载直接download之前得先在 Meta Llama 官网读并同意许可证审批通过后邮件里会收到一个签名 URL下载时照着提示粘贴进去即可。两个注意点链接 24 小时内有效且有下载次数上限过期或超次后会报403: Forbidden——重新申请一个链接就能解决别慌。想跑推理而不只是下权重需要 clone 仓库装完整依赖git clone https://gitcode.com/GitHub_Trending/ll/llama-models cd llama-models pip install .[torch].[torch]会额外装 PyTorch、fairscale模型并行库、fbgemm-gpu-genai 这些推理所需的包不跑推理只玩 CLI第一步的pip install llama-models就够了。 七个模型家族该挑哪一个仓库里每个版本的模型卡、许可证、使用政策都分目录存放。先把全家福放这儿模型发布日期参数规模上下文长度分词器Llama 22023/7/187B, 13B, 70B4KSentencepieceLlama 32024/4/188B, 70B8K基于 TikTokenLlama 3.12024/7/238B, 70B, 405B128K基于 TikTokenLlama 3.22024/9/251B, 3B128K基于 TikTokenLlama 3.2-Vision2024/9/2511B, 90B128K基于 TikTokenLlama 3.32024/12/470B128K基于 TikTokenLlama 42025/4/5Scout-17B-16E, Maverick-17B-128E10M, 1M基于 TikToken按场景挑别按参数挑设备内存紧张、想本地玩Llama 3.2 的 1B 和 3B 是全场最小的两个还带 128K 上下文。要处理超长文档Llama 3.1/3.2 全系 128K更夸张的是 Llama 4 Scout上下文直接到 10M一千万 token。要看图老路线选 Llama 3.2-Vision11B/90B图像经视觉编码器接入文本模型新路线直接用 Llama 4文本加图像原生输入。Llama 4 的两个型号Scout 激活 17B、总参数 109B上下文 10MMaverick 激活 17B、总参数 400B上下文 1M用了约 22T token 训练。两者都支持 12 种语言知识截止 2024 年 8 月。一句话90% 的新项目从Llama-4-Scout-17B-16E-Instruct开始就对了。 跑推理单机、多卡与量化跑通 Llama 4 的对话推理前提已 clone 仓库并装好.[torch]依赖。Llama 4 系列在 bf16 全精度下推理至少需要 4 张 GPU官方示例脚本是这么跑的NGPUS4 CHECKPOINT_DIR~/.llama/checkpoints/Llama-4-Scout-17B-16E-Instruct PYTHONPATH$(git rev-parse --show-toplevel) \ torchrun --nproc_per_node$NGPUS \ -m models.llama4.scripts.chat_completion $CHECKPOINT_DIR \ --world_size $NGPUS注意两点chat_completion脚本只适用于 Instruct对话模型如果下的是 Base未指令微调模型改用models.llama4.scripts.completion脚本并更新CHECKPOINT_DIR路径。示例脚本还会加载models/resources/dog.jpg和下面这张图作为输入方便你直接验证多模态效果量化FP8 两张卡Int4 一张卡显存不够就开混合精度量化。在上面的命令末尾加一个参数即可--quantization-mode fp8_mixed或--quantization-mode int4_mixed。前者把部分权重压成 FP88 位浮点、激活保持 bfloat16后者把部分权重压成 Int44 位整数。以 Llama-4-Scout-17B-16E-Instruct 为例80GB 显存的 GPU 需求精度模式所需 GPU80GBbf16 全精度4 张fp8_mixed2 张int4_mixed1 张说白了单卡 80GB 也能跑 Llama 4代价是精度损失很小。想要更灵活的推理后端比如接入其他提供商官方推荐看 Llama Stack 工具集。 底下一半MoE、多模态与量化实现混合专家为什么让 Llama 4 又强又省普通 Transformer 每层的前馈网络对所有参数一视同仁MoE 把它换成一组专家每个 token 只由路由选中的少数专家处理。Llama 4 Scout 总参数 109B但每个 token 实际只激活 17B——参数容量接近大模型计算成本接近小模型。仓库里models/llama4/moe.py和models/llama4/ffn.py就是这部分实现。两代多模态方案Llama 3.2-Vision 的做法是加装在 Llama 3.1 文本模型旁边配一个独立训练的视觉适配器用一系列交叉注意力层把图像编码喂给语言模型。Llama 4 则是 early fusion早期融合图像和文本从第一层就一起进入主干网络属于真正的原生多模态。3.2-Vision 的视觉提示词格式可以参考models/llama3_2/vision_prompt_format.md量化代码在哪fp8_mixed/int4_mixed的加载逻辑集中在 量化模块核心入口是loader.py里的convert_to_quantized_model它把 checkpoint 里的全精度权重按需转换成 FP8 或 Int4 存储格式再换掉对应层的矩阵乘法实现。想研究细节直接读这里比读博客快。️ 常见坑与排查下载报 403 Forbidden九成是签名链接过期或下载次数用完了。回邮件里重新申请一个新链接即可不用重新走审批。Base 和 Instruct 脚本搞混同一个模型家族Instruct 版配chat_completion脚本Base 版配completion脚本。用错的话对话模板不匹配输出会很怪。拿不准就先跑llama-model prompt-format -m 模型ID看一眼模板长什么样。显存或卡数不够按上一条的量化表降级4 卡 → 2 卡fp8_mixed→ 1 卡int4_mixed。再不够就换小一号的模型比如 Llama 3.2 的 1B/3B。另外商用前务必读一下对应模型的 使用政策各版本限制条款不完全一样。跑通第一句话之后建议先花十分钟通读一遍所用模型的模型卡和 USE_POLICY再谈接入生产。仓库里models/llama4/scripts/的示例脚本是最好的起点——改几个参数它就是你的第一版推理服务。【免费下载链接】llama-modelsUtilities intended for use with Llama models.项目地址: https://gitcode.com/GitHub_Trending/ll/llama-models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考