Skip to content

概率模型

概率模型用概率分布描述数据生成机制。它不仅给出预测结果,还能表达不确定性,是朴素贝叶斯、HMM、GMM、VAE 等模型的共同基础。

概念详解

概率建模通常从联合分布开始:

P(X,Y)=P(Y|X)P(X)=P(X|Y)P(Y)

如果关注预测标签,常使用判别式模型 P(Y|X);如果关注数据如何生成,常使用生成式模型 P(X,Y)

贝叶斯公式

P(Y|X)=P(X|Y)P(Y)P(X)

其中:

P(X)=yP(X|Y=y)P(Y=y)

分类时:

y^=argmaxyP(X|Y=y)P(Y=y)

最大似然估计

给定独立同分布样本 {xi}i=1N,似然函数为:

L(θ)=i=1Np(xi|θ)

通常最大化对数似然:

(θ)=i=1Nlogp(xi|θ)

以高斯分布为例,对 μ 求导可得:

μ=1Ni=1Nxi

应用代码

python
import numpy as np

X = np.array([1.2, 0.9, 1.4, 1.1, 0.8, 1.0])
mu = X.mean()
sigma2 = ((X - mu) ** 2).mean()

def gaussian_pdf(x, mu, sigma2):
    return np.exp(-(x - mu) ** 2 / (2 * sigma2)) / np.sqrt(2 * np.pi * sigma2)

print("MLE mu:", mu)
print("MLE sigma2:", sigma2)
print("p(1.0):", gaussian_pdf(1.0, mu, sigma2))

小结

概率模型的核心是“假设一个分布,再用数据估计分布参数”。理解似然、后验和边缘概率,有助于串起很多机器学习模型。