公司动态

AI大模型与数学 第38课 条件极值入门:拉格朗日乘数法基础计算(10道约束优化计算题)

📅 2026/8/19 22:13:33
AI大模型与数学 第38课 条件极值入门:拉格朗日乘数法基础计算(10道约束优化计算题)
课程前言上课学习无约束损失极值判定而真实AI训练几乎全部带约束权重衰减、参数限制、归一化约束、模型内存上限对应条件极值拉格朗日乘数法是求解带约束优化的标准数学工具。我们先理解拉格朗日乘法解决的是在n维函数关系中求n-1维函数值的极值。解决思路是n维函数值中乘以拉格朗日系数后然后求导等于零与n-1维函数求导等于零构成方程组然后解未知数的值将未知数代入n-1纬函数中求导极值他的原理是在n维空间中限定条件n-1维函数他们的极值导数都是0从而得到方程组关系来求解。核心原理目标函数zf(x,y)损失/目标值约束条件\varphi(x,y)0参数约束、正则限制构造拉格朗日函数L(x,y,\lambda)f(x,y)\lambda\varphi(x,y)联立方程组求解驻点\begin{cases}\dfrac{\partial L}{\partial x}0[4pt]\dfrac{\partial L}{\partial y}0[4pt]\dfrac{\partial L}{\partial \lambda}0\end{cases}AI大模型对应逻辑\lambda正则化系数L2权重衰减系数控制约束强度约束 \varphi(x,y)0限制权重大小、向量模长归一化、显存参数上限拉格朗日乘数法 带正则损失函数的数学推导根基Adam、权重衰减全部基于此模型。10道约束极值计算题题1求 f(x,y)x2y2 在约束 xy2 下最小值约束改写\varphixy-20拉格朗日函数Lx2y2\lambda(xy-2)求偏导联立\begin{cases}L_x2x\lambda0L_y2y\lambda0L_\lambdaxy-20\end{cases}解得 xy1,\lambda-2极小值 f(1,1)2AI解读权重模长最小约束对应L2正则限制权重不要过大防止过拟合。题2求 f(x,y)xy约束 x2y4 的极值Lxy\lambda(x2y-4)\begin{cases}L_xy\lambda0L_yx2\lambda0x2y4\end{cases}解得 y2,x0极值 f0AI解读特征交叉损失带参数约束约束直接限制特征权重取值区间。题3最大化 f(x,y)2x3y约束 x2y21L2x3y\lambda(x2y2-1)\begin{cases}22\lambda x032\lambda y0x2y21\end{cases}x-\dfrac{1}{\lambda},\ y-\dfrac{3}{2\lambda}代入约束得 \lambda\pm\dfrac{\sqrt{13}}{2}最大值点 (\dfrac{2}{\sqrt{13}},\dfrac{3}{\sqrt{13}})最大值 \sqrt{13}AI解读向量归一化约束大模型RoPE位置编码、注意力向量强制模长为1完全对应此模型。题4最小化 f(x,y)x24y2约束 xy1Lx24y2\lambda(xy-1)\begin{cases}2x\lambda y08y\lambda x0xy1\end{cases}解得 x\pm2,y\pm\dfrac{1}{2}极小值 f4AI解读双向权重约束同时限制x、y权重乘积用于模型参数均衡约束。题5f(x,y)x2y2约束 2xy3Lx2y2\lambda(2xy-3)\begin{cases}2x2\lambda02y\lambda02xy3\end{cases}x\dfrac{6}{5},y\dfrac{3}{5}极小值 f\dfrac{9}{5}AI解读单层全连接权重线性约束工程中限制参数线性取值范围。题6最大化 f(x,y)xy约束 x24y21Lxy\lambda(x24y2-1)\begin{cases}y2\lambda x0x8\lambda y0x24y21\end{cases}解得 x\pm\dfrac{\sqrt{2}}{2},y\pm\dfrac{\sqrt{2}}{4}最大值 \dfrac{1}{4}AI解读多头注意力权重归一化约束限制多头权重整体模长。题7最小化 f(x,y)e^{xy}约束 x-y1Le^{xy}\lambda(x-y-1)\begin{cases}e{xy}\lambda0\ e{xy}-\lambda0x-y1\end{cases}联立前两式得 e^{xy}0无实数解无约束极值AI解读指数激活损失带线性约束不存在最优参数训练会持续发散。题8f(x,y)x2y2xy约束 xy1Lx2y2xy\lambda(xy-1)\begin{cases}2xy\lambda0x2y\lambda0xy1\end{cases}解得 xy\dfrac{1}{2}极小值 f\dfrac{3}{4}AI解读带耦合权重的MSE损失叠加线性参数约束对应带权重衰减的回归模型。题9最大化 f(x,y)4x-y约束 x2y24L4x-y\lambda(x2y2-4)\begin{cases}42\lambda x0-12\lambda y0x2y24\end{cases}x-\dfrac{2}{\lambda},y\dfrac{1}{2\lambda}代入得 \lambda\pm\dfrac{\sqrt{17}}{4}最大值 2\sqrt{17}AI解读分类任务输出向量约束限制logits向量模长。题10 压轴综合最小化 f(x,y)x^2 e^y约束 xy2Lx^2 e^y\lambda(xy-2)\begin{cases}2x ey\lambda0\ x2 e^y\lambda0xy2\end{cases}联立2x e^y x^2 eyey0得 x0 或 x2x0,y2f02.x2,y0f4极小值为 0AI解读Transformer注意力权重复合损失带线性约束是深度学习约束优化通用模板。课程核心总结衔接第39课多元积分基础拉格朗日乘数法核心引入\lambda将约束优化转化为无约束多元极值\lambda等价于正则化强度数值越大约束对参数限制越强大模型权重衰减、向量归一化、参数限制全部属于条件极值问题方程组无解代表不存在最优参数模型训练无法收敛。L2权重衰减本质是拉格朗日约束优化你能推导带L2正则的损失函数梯度吗欢迎评论区交流