恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

nn-zero-to-hero:7 个笔记本手写反向传播,从零搭出语言模型

  • 首页
  • 资讯中心
  • /
  • nn-zero-to-hero:7 个笔记本手写反向传播,从零搭出语言模型

相关资讯

Isaac Lab 3.0 快速上手:三步跑通你的第一个机器人强化学习仿真 2026/9/20 6:25:04
Pygame 弹球模拟器(Bouncing Ball Simulator):基于重力与弹性碰撞的物理仿真入门实战 2026/9/20 6:25:04
Cutter 发布流程完全指南:从功能冻结到正式 Release 的全链路操作手册 2026/9/20 6:25:04

最新资讯

TraceLab+:专业轨迹记录与分析工具的技术解析
移动端多智能体协同系统架构与优化实践
Excel智能占位符工具:自动化数据生成解决方案
开源大模型Model 1架构解析与工程实践
基于ANSYS与optiSLang的压气机叶轮多目标优化方法
Python+Django+Vue.js构建建筑工程任务管理系统实践

今日推荐

BrewUI:给Homebrew套上图形界面,让macOS软件包管理更简单
BrewUI:让Homebrew包管理变得可视化与高效
公式与文本对齐全攻略:从Word到LaTeX的实用技巧

本周热门

BrewUI:给Homebrew套上图形界面,让macOS软件包管理更简单
BrewUI:让Homebrew包管理变得可视化与高效
公式与文本对齐全攻略:从Word到LaTeX的实用技巧

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

nn-zero-to-hero:7 个笔记本手写反向传播,从零搭出语言模型

发布时间:2026/9/20 6:25:04
nn-zero-to-hero:7 个笔记本手写反向传播,从零搭出语言模型 nn-zero-to-hero7 个笔记本手写反向传播从零搭出语言模型【免费下载链接】nn-zero-to-heroNeural Networks: Zero to Hero项目地址: https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero看视频学神经网络暂停时觉得每一步都懂一敲代码梯度就乱飞反向传播到底在算什么BatchNorm 不加训练为什么崩这个仓库就是为这种卡点准备的——它不教你调 API而是把Neural Networks: Zero to Hero课程的每个推导做成能跑的 Jupyter 笔记本让你一行行把神经网络从标量级手写出来。仓库内容地图两个目录、七个笔记本全部内容集中在 lectures/ 目录下分两条学习线micrograd 线lectures/micrograd/micrograd_lecture_first_half_roughly.ipynb从零手搓一个标量自动求导引擎定义Value类、实现前向与backward()把链式法则敲进代码。micrograd_lecture_second_half_roughly.ipynb用这个引擎搭出两层小网络并训练看梯度怎么一步步流回去。makemore 线lectures/makemore/按 part1 到 part5 递增难度makemore_part1_bigrams.ipynb字符级 bigram 语言模型第一次接触torch.Tensor和语言模型训练—采样—算 loss的完整框架。makemore_part2_mlp.ipynb把 bigram 换成多层感知机顺带引入学习率、过拟合、train/dev/test 划分这些 ML 基础概念。makemore_part3_bn.ipynb检查多层 MLP 的前向激活和反向梯度统计讲清为什么深网络训练脆弱并引入 BatchNorm。makemore_part4_backprop.ipynb不用loss.backward()手动对整个网络做反向传播覆盖交叉熵、线性层、tanh、BatchNorm 到 embedding 全链路。makemore_part5_cnn1.ipynb把网络加深成树状结构搭出类似 WaveNet 的卷积架构顺带学会读torch.nn文档和盯张量 shape。根目录的 README.md 就是课程目录每一讲都写明了主题、前置要求和对应文件翻一下就知道自己该从哪儿切入。从克隆到第一次跑通上手路径克隆仓库git clone https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero准备环境装好 Python 和 PyTorchpip install torchmicrograd 部分只需要纯 Pythonmakemore 部分依赖torch。先跑 micrograd 两个笔记本前半段验证你能手推Value的求导后半段让网络真正训起来。切到 makemore_part1_bigrams.ipynb把 bigram 模型训练完并采样出看起来像人名的输出——这是你的第一个成果。按 part2 → part3 → part4 → part5 顺序推进每讲只加一层复杂度跑完一个再开下一个。四个容易卡住的地方跳过 micrograd 直接进 makemore所有自动求导都会变成黑盒到 part4 要求手推反向传播时基本无从下手。part4 只看不写这一讲的设计就是先让你自己推、卡住再对答案纯看一遍收获约打对折。part5 不打印 shape 就往下写CNN 部分torch.nn用法密度高张量形状猜错一层后面全错多print几行比查代码快。在仓库里找 GPT 那两讲的笔记本提醒一下README 里列的第 7 讲从零搭 GPT和第 8 讲GPT 分词器目前只有视频仓库里还没有对应文件。适合谁以及一个前置条件适合入门者想真正弄清反向传播在算什么而不是背公式。天天用 PyTorch 但没手写过 autograd 的开发者part4 会补上这块直觉。对 GPT、语言模型原理感兴趣的 NLP 学习者makemore 线就是通向 GPT 的铺垫。不适合只想快速调用现成模型出效果的场景这套课节奏偏慢直接看框架官方教程更快。前置条件需要 Python 基础以及高中水平的微积分记忆——至少能想起导数和链式法则是什么。底子太薄的话先花半天复习一下否则 micrograd 会看得很吃力。跑完 micrograd 前半段后做个自检不看代码你能不能自己写出x Value(3)这种标量的backward()能就可以进 makemore 了。【免费下载链接】nn-zero-to-heroNeural Networks: Zero to Hero项目地址: https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号