防止“背答案”:线性模型压系数,树模型管叶子

分别拖动三个旋钮。前后两栏把惩罚写进训练目标;中间一栏直接限制树允许怎样分叉。

线性模型 · Lasso

显式惩罚:系数越大,付出的代价越高。OLS 没有这项 L1 惩罚。

随机森林 · 本课

结构约束:切完之后每片叶子都得有足够样本;不是额外的 L1/L2 惩罚项。

候选分叉:把 12 个样本分为两组

左叶 4 个
右叶 8 个

规则:两边都达到最少样本数才准切。

XGBoost · 显式正则

开新叶子要有足够收益;叶子给出的修正分数也能受惩罚。

假设这次切分在惩罚前带来 0.18 的收益

切分收益
0.18
新增叶子罚分
0.00

只有收益大于罚分,才值得新增叶子。

一句话:Lasso 管系数;本课随机森林管树能切多细;XGBoost 还直接惩罚叶子数量与叶子分数

教学示意:左栏是标准化且正交的三特征 Lasso 简化例子,系数按软阈值收缩;中栏只检查一处分叉是否满足 min_samples_leaf;右栏固定其他条件,展示 γ 对新增一片叶子的门槛。XGBoost 的 reg_lambda / reg_alpha 分别对叶子分数加 L2 / L1 惩罚,此页未调整它们。本课 RF 设 max_depth=6、min_samples_leaf=5;XGBoost 的 gamma 未在模型工厂显式设置。