什么是 Ridge 回归?

Ridge 回归(岭回归) 是给线性回归加了一个「约束」的改进版——防止模型「用力过猛」导致过拟合。

生活类比:考试防作弊

想象一个学生(模型)在做考试(拟合数据)。普通线性回归像「开卷考试」——学生可以用极其复杂的方法来「背答案」(过拟合),虽然训练集满分,但遇到新题就不会了。Ridge 回归就像给考试加了一条规则:答案不能太夸张(权重不能太大)。这迫使学生学会真正的解题方法,而不是死记硬背。惩罚越重(α 越大),对「夸张答案」的限制越严格。

逐步理解:

  • 第一步:先了解线性回归——找一条线让预测值和真实值的误差最小
  • 第二步:问题是权重可能变得很大(特别是特征间相关时),导致模型对小扰动敏感
  • 第三步:Ridge 的解决方案——在误差基础上加一个「权重大小的惩罚」:$\alpha \sum w_j^2$
  • 第四步:α 越大 → 权重越小 → 模型越简单 → 过拟合风险越低(但可能欠拟合)

适用场景

  • 多重共线性问题:当特征之间高度相关时,普通回归的参数估计不稳定
  • 高维数据:特征数量接近或超过样本数量时
  • 需要稳定解:希望模型参数估计更加稳定可靠
  • 防止过拟合:通过正则化约束模型复杂度
  • 病态矩阵:当 $X^TX$ 接近奇异矩阵时,Ridge 可以保证可逆

历史渊源

问题背景:到了20世纪中期,统计学家发现线性回归有个致命弱点——当特征之间高度相关(多重共线性)时,参数估计会变得极不稳定,微小的数据变化就导致权重剧烈波动。

关键突破:1970年,Hoerl 和 Kennard 提出了一个优雅的解决方案:在损失函数后面加一个"罚款"——权重越大罚得越重。数学上只需在 $X^TX$ 上加一个 $\alpha I$(对角线加一个小常数),矩阵就一定可逆了。他们把这个方法命名为"Ridge"(山脊),因为等高线图上的解像沿着山脊移动。

深远影响:Ridge 回归开创了正则化的先河——"以偏差换方差"的思想成为机器学习的核心原则。后来的 Lasso、Elastic Net、Dropout、Weight Decay 都是这个思想的延续。

趣闻:Hoerl 在化工公司工作时遇到了多重共线性问题——化学实验中的温度、压力、浓度等变量总是高度相关。正是这个工业实践中的痛点,催生了 Ridge 回归的理论。

发展脉络

1805
OLS回归
无正则化
共线性问题
->
1970
Ridge
L2正则化
需要特征选择
->
1996
Lasso
L1正则化
结合两者
->
2005
Elastic Net
L1+L2混合

局限性

  • 不能做特征选择:Ridge 会收缩所有特征的权重,但不会将任何权重置为零
  • 需要调参:正则化参数 $\alpha$ 需要通过交叉验证等方法选择
  • 所有特征保留:当特征数量非常大时,模型仍然复杂
  • 对尺度敏感:使用前必须对特征进行标准化处理

这些局限催生了:Lasso(可做特征选择)、Elastic Net(结合L1和L2的优点)

工业界地位

广泛使用

Ridge 回归是高维数据的标准方法,在工业界应用广泛:

  • 基因组学:处理数万个基因特征,样本量相对较少
  • 金融风控:信用评分中的大量相关特征处理
  • 自然语言处理:文本分类中的高维稀疏特征
  • 推荐系统:处理大量用户/物品特征的回归问题

为什么 Ridge 如此流行?数学性质优雅(有闭式解)、计算高效、对多重共线性有天然的鲁棒性。在特征数 > 样本数的场景下,Ridge 几乎是默认选择。

交互式可视化

调整正则化参数,观察 Ridge 如何收缩权重

10
20
30
试一试:
  • 调高正则化参数 α:权重被压缩到接近 0,回归线变得更平坦(更简单)
  • 调低 α 到接近 0:回归接近普通线性回归——可能过拟合
  • 观察岭迹图:每条线代表一个特征的权重,随 α 增大逐渐收缩到 0 附近(但不会精确为 0)

数据与拟合线

权重变化

模型信息:

斜率:

截距:

R² 分数:

L2 惩罚: --

数学原理

直觉引入:普通线性回归在特征多、数据少时容易"记住噪声"(过拟合),权重会变得很大。Ridge 的思路很简单:在损失函数后面加一个"罚款"——权重越大罚得越重,迫使模型保持简单。

目标函数(MSE + L2 惩罚):

$$\min_w \underbrace{\sum_{i=1}^n (y_i - w^T x_i)^2}_{\text{拟合数据}} + \underbrace{\alpha \sum_{j=1}^p w_j^2}_{\text{惩罚大权重}}$$

闭式解:

$$w = (X^T X + \alpha I)^{-1} X^T y$$

对比普通回归 $w = (X^TX)^{-1}X^Ty$,多了 $\alpha I$。这让矩阵一定可逆(解决多重共线性),同时收缩权重。

$\alpha$ 的效果:

  • $\alpha = 0$:退化为普通线性回归
  • $\alpha \to \infty$:所有权重趋近于 0(极度欠拟合)
  • 适中的 $\alpha$:平衡拟合与简单性
Ridge vs Lasso:
• Ridge (L2):权重被"均匀压缩",趋近 0 但不等于 0
• Lasso (L1):权重可以精确等于 0 → 自动特征选择
• 几何直觉:L2 约束是圆形,L1 约束是菱形(有尖角,容易在坐标轴上相切)