恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

人工智能数学基础:线性代数、微积分与概率论在AI中的落点

  • 首页
  • 资讯中心
  • /
  • 人工智能数学基础:线性代数、微积分与概率论在AI中的落点

相关资讯

SAP PM功能位置本质:逻辑坐标系而非物理地点 2026/9/16 3:22:03
MATLAB中实现三维拓扑重建(3DT)的工程实践指南 2026/9/16 3:22:03
Java实现HTML转PDF的三种方案对比与实战:Playwright、Openhtmltopdf与wkhtmltopdf 2026/9/16 3:22:03

最新资讯

端口模式详解:Access、Trunk与Hybrid的配置与实战
OLT远程升级ONU固件全攻略:中兴C300、华为5680T、烽火AN5516实操
悬浮 Prompt 工具:让 Claude Code 与 Codex 的 CLI 交互效率倍增
深入解析ZGC在AArch64 Linux下的系统调用封装与内存屏障机制
风光蓄互补调度:基于MILP的Matlab日前优化模型
AI智能体实操路线图:4阶段8课时避开90%新手陷阱

今日推荐

IoT-For-Beginners 智能语音计时器:Wio Terminal 基于 DMAC 与 Flash 的音频采集实战
基于MATLAB的CRI显色指数计算:从SPD光谱到Ra的完整流程
JSP+Servlet+MySQL博客系统源码部署与优化全攻略

本周热门

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化
Flutter应用改名全指南:从Android到iOS的配置与工具实践

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

人工智能数学基础:线性代数、微积分与概率论在AI中的落点

发布时间:2026/9/16 3:27:04
人工智能数学基础:线性代数、微积分与概率论在AI中的落点 简介这是一份面向人工智能初学者的数学基础学习资料包针对机器学习与深度学习中常用的线性代数、概率统计、微积分和最优化方法等知识点配套B站视频教程、课件与可运行代码。课程设计以“从零补数学、动手写代码”为线索适合刚进入AI领域、需要系统巩固数学基础或备战算法工程师笔试面试的学习者。压缩包采用zip格式大小约74.13MB内含视频配套课件与教程源码方便离线复盘与二次整理。目前已有412人浏览学习。资料的价值在于将抽象数学概念落地为Python代码示例通过可视化演示和公式推导笔记帮助读者理解矩阵运算、梯度下降、概率分布等难点源码覆盖常用实现可直接修改运行。同时附B站视频链接形成“视频讲解—课件复习—代码实操”的完整闭环能有效提升自学效率尤其适合需要结构化学习路线的初学者。1. 人工智能数学基础要学什么不看公式看落点数学是 AI 绕不过去的门槛但卡住大多数人的不是智商而是不知道这门数学学了之后用在哪。学线性代数时不知道特征值就是 PCA 降维的核心学概率时不知道贝叶斯公式就是垃圾邮件过滤和朴素贝叶斯分类器的根基学微积分时不知道链式法则就是反向传播的底层运算。这篇文章把这门课的知识点对齐到代码和工程场景讲清楚每个数学概念在人工智能项目里解决什么问题并提供一条可以直接跟着走的自主学习和动手验证的路径配合课件代码和 B 站视频教程让数学真正长在代码里。适合三类人准备转行人工智能开发但数学基础薄弱的人自学完机器学习算法却总在参数调优时一头雾水的人以及需要给团队做人工智能基础内训的工程师。学完这套内容你能做的不只是看懂公式而是能把公式翻译成 NumPy、PyTorch 代码能说清楚某个损失函数为什么收敛慢能在面试里把数学原理和工程实现串起来讲。2. 线性代数与矩阵运算从向量空间到神经网络参数的本质2.1 为什么人工智能离不开矩阵从数据表到张量的思维转换人工智能处理的所有数据最终都变成矩阵或张量。一张 28×28 的灰度图是一个 784 维向量一批 32 张图叠在一起就是一个形状为 32×1×28×28 的四维张量。线性代数提供了一套语言来描述这些数据的变换神经网络的一层本质就是 y Wx bW 是权重矩阵x 是输入向量b 是偏置。学习时最容易犯的错误是只背公式不理解几何意义。向量点积的几何意义是投影矩阵乘法的几何意义是线性变换的组合特征值和特征向量描述的是变换中不改变方向只改变长度的特殊向量。如果你做图像分类卷积核在特征图上滑动本质就是一组权重矩阵与局部像素块做点积。线性代数概念在 AI 中的落点常见代码对应向量点积注意力机制中的相似度计算torch.matmul(q, k.T)矩阵乘法全连接层的前向传播x W b范数正则化项、梯度裁剪torch.norm(w, 2)特征值分解PCA 降维、图卷积np.linalg.eig()逆矩阵线性回归的闭式解np.linalg.inv()张量变形数据批处理、Embedding 查表x.reshape(-1, 784)这些概念在人工智能大作业和真实项目中几乎天天遇到。你不必一开始就掌握全部证明过程但要能看着公式写出代码看着代码说出它对应哪个数学操作。2.2 用 Python 实现一个最小神经网络来验证线性代数理论学习要配合动手。下面用纯 NumPy 实现一个单隐层神经网络它只依赖线性代数运算用来验证前向传播的本质就是一连串矩阵乘法。import numpy as np def sigmoid(x): return 1 / (1 np.exp(-x)) # 输入: 4个样本, 每个样本3个特征 X np.random.randn(4, 3) # 真实标签 y np.array([[0], [1], [1], [0]]) # 初始化参数 np.random.seed(42) W1 np.random.randn(3, 4) # 输入层到隐层 b1 np.zeros((1, 4)) W2 np.random.randn(4, 1) # 隐层到输出 b2 np.zeros((1, 1)) # 前向传播: 本质是两层矩阵乘法 Z1 X W1 b1 # 形状 (4, 3) (3, 4) - (4, 4) A1 sigmoid(Z1) Z2 A1 W2 b2 # 形状 (4, 4) (4, 1) - (4, 1) A2 sigmoid(Z2) print(f输出形状: {A2.shape}) print(f预测值: {A2.ravel()})这段代码演示了神经网络前向传播的全部线性代数本质。X W1 b1就是 y Wx b 的批量执行4 个样本同时过矩阵乘法这正是显卡并行计算的理论基础。注意参数W1的形状是 (3, 4)意味着隐层有 4 个神经元每个神经元接收 3 个输入特征。如果只有一个样本输入形状变成了 (1, 3)矩阵乘法仍然成立这就是向量外积在神经网络中的扩张应用。2.3 矩阵求导反向传播的理论地基理解了前向传播的矩阵乘法之后接下来要看反向传播。反向传播的核心是链式法则配合矩阵求导要求你算出损失函数对每个权重参数的偏导数。PyTorch 的autograd帮你自动算了但手动推一次才知道梯度为什么是那个形状。import torch # 固定一个小例子: y Wx, 损失为 (y - y_true)^2 x torch.tensor([1.0, 2.0], requires_gradFalse) W torch.tensor([[0.5, -0.2]], requires_gradTrue) y_true torch.tensor([1.0]) y_pred W x # 手动做矩阵乘法 loss (y_pred - y_true) ** 2 loss.backward() print(f梯度 dL/dW: {W.grad})输出结果是dL/dW 2 * (y_pred - y_true) * x的具体数值。观察梯度形状它和 W 的形状完全一致这是反向传播正确性的基本判据。如果手推的梯度形状对不上矩阵形状说明维度分析错了。3. 微积分与优化梯度、偏导数与神经网络的反向传播3.1 导数的几何意义和链式法则在计算图中的传递微积分在 AI 中的角色高度聚焦不是让你做复杂的积分变换而是理解导数和梯度。梯度是导数对多维输入的自然推广它指示了损失函数上升最快的方向梯度下降就往反方向走。注意梯度的形状与参数形状一致这是反向传播正确性的基本判据。3.2 手动用 Python 实现梯度下降验证数学原理做梯度下降实验要用最基本的三件套主函数、一阶导、学习率。下面是一个最小实现用来验证学习率如何影响收敛行为。import numpy as np import matplotlib.pyplot as plt def f(x): # 目标函数 y x^2 1, 最小值在 x0 return x**2 1 def df(x): # 一阶导数: 2x return 2 * x # 用导数实现梯度下降 x 4.0 lr 0.1 history [] for i in range(30): grad df(x) # 计算当前梯度 x - lr * grad # 沿负梯度方向更新 history.append((i, x, f(x))) print(f迭代30次的x: {x:.6f}) print(f迭代30次的y: {f(x):.6f}) print(f最后3步的梯度: {df(history[-1][1]):.6f})参数说明lr是学习率控制每步走多远。这个例子选 0.1跑了 30 步就接近最小值 1.0。学习率调大更新步长会变大出现来回震荡甚至发散到更大数值的情况学习率调小收敛很慢迭代次数不够就停在离最优点较远的地方。3.3 偏导数和多变量梯度下降的处理方法真实场景中损失函数不是一元的而是一个多变量函数。假设有两个参数 w 和 b梯度是对每个变量求偏导组成的向量。梯度本是一个向量包含各参数偏导指向多维误差函数上升最快的方向。沿梯度的反方向逐步移动能逼近函数的局部最小值这是参数学习的直接几何依据。深度学习的反向传播本质就是先用链式法则逐层计算梯度并传递再按梯度下降更新每层的权重和偏置。参数更新量 学习率 × 梯度这是全连接网络与卷积网络共享的基本更新规则。4. 概率论与统计不确定性建模和损失函数的设计原理4.1 为什么机器学习到处是概率图像分类输出的是各类别概率分布语言模型生成的每个 token 都对应一个概率推荐系统预测的是点击率看作一个概率值。概率论提供的是一套描述不确定性的数学语言。核心内容包括随机变量、概率分布、期望、方差、贝叶斯公式、极大似然估计。交叉熵损失函数本质就是两个概率分布之间的差异度量最大似然估计推导出均方误差的生物学解释。4.2 用 NumPy 实现贝叶斯推断做简单的文本分类用一个朴素贝叶斯分类器来验证概率公式并把它跑在真实可感的数据上。下面是最小可运行的版本。import numpy as np from collections import defaultdict # 构造简易语料: (文本词列表, 类别) corpus [ ([price, cheap, deal], spam), ([win, prize, money], spam), ([meeting, schedule, project], normal), ([report, deadline, meeting], normal), ] # 统计先验和条件概率 vocab set() class_docs defaultdict(list) for words, label in corpus: class_docs[label].append(words) vocab.update(words) prior {} likelihood {} for label, docs in class_docs.items(): prior[label] len(docs) / len(corpus) # 统计词频加1平滑 word_count defaultdict(lambda: 1) # 加1平滑避免零概率 total len(vocab) # 平滑分母含词汇表大小 for words in docs: for w in words: word_count[w] 1 for w in vocab: word_count[w] word_count.get(w, 1) # 未出现的词按1计 total sum(word_count.values()) likelihood[label] {w: word_count[w] / total for w in vocab} def predict(words): scores {} for label in prior: # 先验取对数条件概率累加 score np.log(prior[label]) for w in words: if w in likelihood[label]: score np.log(likelihood[label][w]) else: score np.log(1 / sum(likelihood[label].values())) scores[label] score return max(scores, keyscores.get) test_doc [free, prize, money] print(f预测类别: {predict(test_doc)})代码逻辑说明先验概率 P(类别) 由训练集中该类别文档占比估计条件概率 P(词|类别) 由该类文档中该词出现频率估计。预测时对每个类别计算 P(类别) × Π P(词|类别)取对数避免下溢选分数最大的类别作为输出。加 1 平滑的必要性在于测试时遇到训练集没出现过的词条件概率为 0 会让整个乘积变为 0平滑后这个问题不再出现。这和交叉熵、KL 散度之间是相通的在神经网络训练时用的多分类交叉熵其本质也是在最大化正确类别的对数似然。4.3 期望、方差与模型训练的关系期望对应数据的均值是预测的基准方差衡量数据离散程度对应模型的稳定性。特征标准化把均值归零、方差归一让梯度下降在不同特征方向上速度接近这在实际训练中比调大迭代次数更有效。初始化权重不只影响收敛速度还会影响能否避开对称性问题。如果所有权重初始化为 0反向传播时同层神经元梯度完全一致也就是对称权重问题表现为参数更新永远同步模型能力大打折扣。使用随机初始化并配合合适的方差缩放是避免该问题的标准手段。5. 人工智能数学学习路径与实战代码从理论到 B 站视频的搭配姿势5.1 一条可行的学习路线三阶段推进数学知识多且杂如果按教材顺序从头啃线性代数会耗费大量时间且容易中途放弃。建议按“需要什么补什么”的策略学习。先围绕人工智能的核心模型和算法建立整体认知把数学基础放在训练过程中同步补再回到理论中查出每个知识点的定义和推导。学习阶段数学重点配套代码任务配套视频方向第一周基础扫盲向量、矩阵、导数、概率基础用 NumPy 实现线性回归人工智能导论 数学基础速成第二周核心关联矩阵求导、链式法则、极大似然估计手动实现梯度下降 交叉熵反向传播推导视频第三周融会贯通PCA、正则化与范数、贝叶斯手写 PCA 或用 PyTorch 搭 MLP人工智能项目实战拆解每完成一个阶段就用代码跑通一个最小实验不需要做高深的项目。把线性回归跑通就同时覆盖了矩阵乘法、最小二乘法和梯度下降三个数学点。建议把“完成最小实验”作为阶段验收标准替代“读完第几章”。5.2 最小可运行的线性回归检验你数学是否学透线性回归是数学和代码结合最好的入门项目它同时用了矩阵运算、导数推导和梯度下降。import numpy as np import matplotlib.pyplot as plt # 生成带噪声的线性数据 y 2x 1 noise np.random.seed(42) X np.random.rand(100, 1) * 10 # 100个样本 true_w, true_b 2.0, 1.0 y true_w * X true_b np.random.randn(100, 1) * 1.5 # 用正规方程求解(闭式解): w (X^T X)^(-1) X^T y X_b np.c_[np.ones((100, 1)), X] # 加一列1作为偏置 w_closed np.linalg.inv(X_b.T X_b) X_b.T y print(f正规方程结果: w0{w_closed[0][0]:.3f}, w1{w_closed[1][0]:.3f}) # 用梯度下降求解 w np.array([[0.0], [0.0]]) # 初始化为0 lr 0.01 losses [] for i in range(500): y_pred X_b w loss np.mean((y_pred - y) ** 2) losses.append(loss) # 梯度: (2/m) X^T (Xw - y) grad (2 / len(X_b)) * X_b.T (y_pred - y) w - lr * grad print(f梯度下降结果: w0{w[0][0]:.3f}, w1{w[1][0]:.3f}) print(f真实参数: w0{true_b:.3f}, w1{true_w:.3f})这段代码的关键点在于两个解法互相对照正规方程一次性算出最小二乘解梯度下降走 500 步逼近同一结果。矩阵求导在这里体现为解析地算出了参数的梯度公式没有用自动微分库。学习率和迭代次数就是仅有的两个可调参数。如果损失曲线下降不平滑优先检查的特征标准化是否做了。X 的值域在 0~10与参数相乘后进入梯度公式的量级可能让更新不稳定。5.3 B 站视频的高效看法怎么做到看一个学一个学习资源本身再丰富缺少正确的筛选方式还是容易陷入“收藏吃灰”的状态。我一般用三条标准筛选 AI 数学相关视频有没有配套代码运行演示标题里有没有明确的知识点而不是“速通/带练”这类空泛词视频长度是否大于 15 分钟。小于 10 分钟的视频往往只讲结论不讲推导错过推导内容反而更难建立长期记忆。看视频的姿势也很关键。先用 1.5 倍速过一遍把不懂的公式截屏存下来然后回到代码里找对应实现最后再开 1.0 倍速逐帧看推导。每看完一个视频就跑一遍对应代码并把公式用注释写到代码里这样后面回查代码时数学推导也在手边。6. 用一个小工具把“数学能力”量化验证你到底学会了没有学习的效果要靠验证。推荐一个可复现的小实验用两种不同的数学工具解同一个问题比对结果。这个方法能一次性检验你有没有掌握矩阵求导、闭式解推导和梯度下降调参。下面以岭回归为例对比闭式解、梯度下降和 PyTorch 自动求导三种方式。import numpy as np import torch import torch.nn as nn # 生成高相关特征数据 np.random.seed(0) X np.random.randn(100, 3) true_w np.array([1.5, -2.0, 3.0]) y X true_w np.random.randn(100) * 0.5 # 方法1: 闭式解 w(X^T X λI)^(-1) X^T y lmbda 0.1 X_b np.c_[np.ones((100, 1)), X] I np.eye(4) I[0, 0] 0 # 不惩罚偏置 w_closed np.linalg.inv(X_b.T X_b lmbda * I) X_b.T y # 方法2: PyTorch 自动求导 Xt torch.tensor(X_b, dtypetorch.float32) yt torch.tensor(y.reshape(-1, 1), dtypetorch.float32) model nn.Linear(4, 1, biasFalse) optimizer torch.optim.Adam(model.parameters(), lr0.05) for _ in range(2000): optimizer.zero_grad() loss torch.mean((model(Xt) - yt) ** 2) l2 0 for p in model.parameters(): l2 torch.sum(p[:, 1:] ** 2) # 不惩罚偏置 loss loss lmbda * l2 loss.backward() optimizer.step() w_torch model.weight.detach().numpy().ravel() print(f闭式解: {np.round(w_closed.ravel(), 3)}) print(fPyTorch: {np.round(w_torch, 3)})参数说明lmbda是正则化强度值越大参数被压得越接近 0optimizer.Adam是一种带自适应学习率的优化器调参比普通 SGD 更省心。两种方法的结果应当非常接近若有差异通常来自 Adam 的学习率设置导致没完全收敛可以把迭代次数加大到 5000或改用torch.optim.SGD。完成这个小实验的时间在 30 分钟内。如果你能解释清楚为什么闭式解要加λI能说清bias不受惩罚的原因并且能预估lmbda和优化器内部动量机制对结果的影响说明线代、微积分和概率统计已经内化成你的工程直觉了。这也是面试官最爱问的一道交叉题背后是三块数学知识的同时验证。本文还有配套的精品资源点击获取

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号