目录摘要Abstract1. SVM 核心思想1.1 函数间隔与几何间隔数学定义1.2 硬间隔 SVM 优化目标与约束条件1.3 对偶问题与 KKT 条件、支持向量本质2. 软间隔 SVM2.1 松弛变量与 Hinge 损失2.2 软间隔优化公式与惩罚系数C作用3. 核技巧 Kernel Trick3.1 高维映射思想与核函数定义3.2 常用核函数公式与适用场景4. SVM 与线性分类模型对比总结摘要本周系统学习李宏毅机器学习 Lecture20 支持向量机SVM全章节内容。先从最大间隔分类的几何思路切入推导函数间隔、几何间隔公式完成线性可分场景下硬间隔 SVM 的优化问题推导结合拉格朗日对偶变换解释支持向量的含义针对现实数据集存在噪声、无法严格线性可分的痛点学习软间隔 SVM、松弛变量与 Hinge 损失分析惩罚参数C对拟合效果的调控逻辑重点掌握核技巧原理依靠核函数隐式完成高维特征映射实现非线性分类最后将 SVM 与逻辑回归、朴素贝叶斯做横向对比区分四类线性 / 非线性分类模型的适用场景完善监督分类算法知识体系。AbstractThis week, I systematically studied Support Vector Machine (SVM) from Lecture 20 of Hung-yi Lee’s machine learning course. Starting from the geometric idea of maximum margin classification, I derived the formulas of functional margin and geometric margin, and deduced the optimization problem of hard-margin SVM under linearly separable scenarios. Combined with Lagrangian dual transformation, I explained the essence of support vectors. To adapt to real noisy datasets that cannot be strictly linearly separated, I learned soft-margin SVM, slack variables and Hinge loss, and analyzed how penalty parameter C controls model fitting effect. I focused on kernel trick, which implicitly maps features to high-dimensional space to realize nonlinear classification. Finally, I compared SVM with Logistic Regression and Naive Bayes, distinguished applicable scenarios of four classification models, and perfected the knowledge system of supervised classification algorithms.1. SVM 核心思想SVM 核心目标在所有可以正确划分两类样本的超平面里选择几何间隔最大的超平面最大化分类边界与样本的距离以此获得最优泛化能力。1.1 函数间隔与几何间隔数学定义设分类超平面标签统一改写为 y∈{1,−1}。函数间隔无归一化几何间隔归一化、真实距离具备物理意义全局几何间隔取全部样本间隔的最小值。1.2 硬间隔 SVM 优化目标与约束条件假设数据集严格线性可分要求所有样本函数间隔γi≥1最大化几何间隔等价于。优化问题约束含义所有样本必须正确划分且落在间隔边界外侧。1.3 对偶问题与 KKT 条件、支持向量本质构造拉格朗日函数将带约束原问题转为对偶问题KKT 互补松弛条件若αi0约束成立样本落在间隔边界上称为支持向量若αi0样本远离间隔边界不会参与最终超平面的构建。最终权重仅由支持向量线性组合得到2. 软间隔 SVM硬间隔 SVM 必须严格分割样本存在异常点时直接无解因此引入软间隔机制允许少量样本违反间隔约束。2.1 松弛变量与 Hinge 损失引入松弛变量ξi≥0代表样本违反间隔的程度配套 SVM 专属损失Hinge 损失当样本分类正确且间隔≥1 时损失为 0样本落入间隔内部 / 错分时产生损失。2.2 软间隔优化公式与惩罚系数C作用软间隔完整优化目标参数C含义对错分、违规样本的惩罚权重C→∞惩罚极强趋近硬间隔容易过拟合C→0惩罚极弱允许大量样本违规容易欠拟合工程中选取适中C平衡间隔大小与分类错误。3. 核技巧 Kernel Trick3.1 高维映射思想与核函数定义低维空间线性不可分的数据经过映射ϕ(x)映射至高维特征空间后大概率线性可分。核函数规避直接计算高维向量内积带来的维度爆炸定义无需显式构造ϕ(x)直接通过核函数完成内积运算这就是核技巧。3.2 常用核函数公式与适用场景线性核等价无映射用于高维稀疏文本高斯 RBF 核万能核适配绝大多数非线性场景多项式核4. SVM 与线性分类模型对比对比维度逻辑回归朴素贝叶斯线性 SVM高斯核 SVM建模目标最小化交叉熵损失最大化联合概率最大化分类间隔高维空间最大化间隔损失函数交叉熵对数似然损失Hinge 损失Hinge 损失是否生成模型判别式生成式判别式判别式高维稀疏文本适用效果最优线性 SVM 效果优秀不推荐非线性数据需要特征工程无法处理无法处理效果极强小样本表现一般优秀优秀较好输出结果类别概率类别概率类别无概率类别总结本周学习了 SVM 整套理论体系有五点收获SVM 的核心设计逻辑是最大化几何间隔依靠更大分类间隔提升模型泛化性能这是 SVM 泛化能力优异的根本原因硬间隔仅适用于完美线性可分数据集工业场景全部使用软间隔 SVM依靠参数C完成正则化调控Hinge 损失使得 SVM 解具备稀疏性最终模型仅由少量支持向量决定推理速度快、内存占用低核技巧巧妙规避高维映射的计算灾难让 SVM 拥有处理非线性分类的能力RBF 高斯核是日常使用最多的通用核文本等高维稀疏数据优先选择线性 SVM / 朴素贝叶斯复杂非线性分布数据优先高斯核 SVM。