最大似然估计(MLE)
我们将模型表示为拟合真实数据分布 的函数 。这是个输入向量输出实数的函数,输入数据 预测它出现的概率(或概率密度),函数的具体行为由内部的算法以及参数 控制。
我们有m个 i.i.d.(独立同分布)样本的数据集(向量的集合) ,由 生成。MLE 方法估计的“最佳”参数,即对 的最大似然估计定义为,能使得 对 中预测的所有概率之积最大的参数:
连乘计算容易出现数值计算上的误差(下溢),我们加上个 函数让连乘变成求和,这样能降低误差,方便求导,同时不影响 :
模型选择很重要,因为 MLE 只最大化训练样本的似然,并不直接约束模型对训练集外数据的预测。如果模型过于灵活,它很可能将训练集中未出现(但真实概率非零)的区域的概率推向 0,导致泛化能力弱。
最大后验估计(MAP)
相比于 MLE,MAP 将 视为参数空间上的随机变量,估计的是 在参数空间中的概率分布,而不是一个具体的值。除此之外,还加入了先验分布 。先验分布一般偏好更“简单”的解。
和 MLE 的关系:
当样本数趋于无穷时,最大后验概率估计一般趋向于最大似然估计。
最大似然估计也可看作参数的先验概率密度函数服从均匀分布(相当于没有先验知识)的最大后验概率估计。
当参数的先验概率密度函数比较准确时,最大后验概率估计的小样本性质大大优于最大似然估计。