恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
06 预训练(上):损失、困惑度与训练循环
首页
资讯中心
/
06 预训练(上):损失、困惑度与训练循环
06 预训练(上):损失、困惑度与训练循环
发布时间:2026/9/4 6:47:16
06 预训练(上):损失、困惑度与训练循环系列第 6 篇。上一篇我们搭好了 GPT 模型的"骨架",但它的参数是随机的——不会说话。这一篇开始预训练:让模型在海量无标注文本上学习"预测下一个词"。对应《从零构建大模型》第 5 章前半部分:文本生成评估、交叉熵损失、困惑度、训练循环、过拟合与验证集。1. 预训练在做什么?预训练的目标非常单纯:给定一段文本的前缀,让模型预测下一个 token。重复亿万次,模型就"学会"了语言。输入: "The cat sat on the" 目标: "mat"用自监督的方式,从语料里自动生成 (输入, 目标右移一位) 的训练对——无需人工标注,这就是它能吃下 TB 级数据的原因。为什么"预测下一个词"能学会语言?正如第 1 篇强调的:这个目标极其"宽泛",为了把它做好,模型被迫学会语法(怎么组句)、语义(词的意思)、常识(什么该接什么)。预训练不是"背课文",而是"在亿万次预测中被迫内化语言规律"。本系列用的是《The Verdict》这种 5 千词小文本做演示,真实 GPT 用的是 40GB+ 的 WebText。/