首页 / 💻 技术交流 / 机器学习入门之统计推断(MLE & MA
💻 技术交流 📊 投票帖

机器学习入门之统计推断(MLE & MAP)

📊 参与投票(共 1 票)
MLE 提供了解释参数正则化的方法 0 票 · 0%
MAP 提供了解释参数正则化的方法 1 票 · 100%

最大似然估计(MLE)

我们将模型表示为拟合真实数据分布 pdata(x) 的函数 pmodel(x;θ)。这是个输入向量输出实数的函数,输入数据 x 预测它出现的概率(或概率密度),函数的具体行为由内部的算法以及参数 θ 控制。

我们有m个 i.i.d.(独立同分布)样本的数据集(向量的集合) X={x(1),x(2),,x(m)},由 pdata 生成。MLE 方法估计的“最佳”参数,即对 θ 的最大似然估计定义为,能使得 pmodel 对 X 中预测的所有概率之积最大的参数:

θML=arg maxθpmodel(X;θ)=arg maxθi=1mpmodel(x(i);θ)

连乘计算容易出现数值计算上的误差(下溢),我们加上个 log 函数让连乘变成求和,这样能降低误差,方便求导,同时不影响 arg max

=arg maxθlog(i=1mpmodel(x(i);θ))=arg maxθi=1mlogpmodel(x(i);θ)

模型选择很重要,因为 MLE 只最大化训练样本的似然,并不直接约束模型对训练集外数据的预测。如果模型过于灵活,它很可能将训练集中未出现(但真实概率非零)的区域的概率推向 0,导致泛化能力弱。

最大后验估计(MAP)

相比于 MLE,MAP 将 θ 视为参数空间上的随机变量,估计的是 θ 在参数空间中的概率分布,而不是一个具体的值。除此之外,还加入了先验分布 p(θ)。先验分布一般偏好更“简单”的解。

和 MLE 的关系:

  • 当样本数趋于无穷时,最大后验概率估计一般趋向于最大似然估计。

  • 最大似然估计也可看作参数的先验概率密度函数服从均匀分布(相当于没有先验知识)的最大后验概率估计。

  • 当参数的先验概率密度函数比较准确时,最大后验概率估计的小样本性质大大优于最大似然估计。

💬 全部评论 0

共 0 条 · 按楼层排序
登录 注册 后即可发表评论
💬
还没有评论,快来抢沙发吧