DC娱乐网

模型训练-正则化:别让模型死记硬背 上一篇讲了损失函数与优化器 但是训练参数

模型训练-正则化:别让模型死记硬背
上一篇讲了损失函数与优化器

但是训练参数不能只看预测对错,还要约束参数不要过大。
总式:Loss_total = Loss_task + λ · Ω(w)。惩罚项像山谷,最低点在 w=0,坡度就是往 0 拉的力。

(1)L1
惩罚 |w|,V 字山谷,拉力恒定。
不重要特征易被一路拉到 w=0 → 稀疏,可做特征选择;深度学习很少单独用。

(2)L2
惩罚 w²,抛物线山谷,拉力 ∝ |w|。
大权重猛拉,靠近 0 几乎松手 → 权重趋近 0,一般不为 0;处处可导,神经网络常用。

(3)Weight Decay
目标与 L2 相同(压大权重),但不改损失,每步更新前先把权重缩一圈。
SGD 下二者近似等价;Adam 下不等价:不要往损失里硬加 L2,用 Adam 又要衰减时应选 AdamW。

两篇总结:
损失函数:输出端衡量对错,给出误差信号。
优化器:按梯度更新权重,决定怎么下山。
正则:约束权重别太大,防过拟合。

下一篇:激活函数:决定网络能不能学复杂规律
AI不焦虑howto 多元化思维模型 智能体 人工智能 深度学习 大模型 机器学习