第 4 章 估计理论¶
本章预计学习时间: 4 小时
前置知识: 第 1 章(概率论)、第 2 章(随机过程)、第 3 章(线性代数)
后续依赖: 第 9 章(信道估计算法)、第 10 章(均衡算法)
📌 本章目标¶
学完本章后,你将能够:
- 理解 参数估计的基本概念和评价标准
- 推导 最大似然估计(MLE)的完整过程
- 推导 最小二乘估计(LS)的闭式解
- 理解 贝叶斯估计与 MMSE 估计的关系
- 应用 估计理论解决通信中的信道估计问题
4.1 参数估计基本概念¶
🎯 基础概念(零基础友好)¶
什么是估计问题?¶
生活中的例子:
估计量: 样本平均值 \(\(\hat{\mu} = \frac{1}{10}\sum_{i=1}^{10} x_i = 39.6 \text{ min}\)\)
通信中的例子:
估计问题的数学描述¶
定义 4-1(参数估计问题):
观测数据 \(\mathbf{y}\) 与未知参数 \(\theta\) 的关系:
其中: - \(\theta\):未知参数(待估计) - \(\mathbf{y}\):观测数据(已知) - \(\mathbf{n}\):噪声(随机) - \(f(\cdot)\):已知函数
目标: 从 \(\mathbf{y}\) 构造估计量 \(\hat{\theta} = g(\mathbf{y})\)
关键区分:
| 术语 | 含义 | 例子 |
|---|---|---|
| 参数 \(\theta\) | 未知的确定值 | 信道增益 \(h\) |
| 估计量 \(\hat{\theta}\) | 随机变量(依赖观测) | \(\hat{h} = y/x\) |
| 估计值 | 估计量的具体实现 | \(\hat{h} = 0.5 + 0.3j\) |
📊 估计量的评价标准¶
问题:如何判断估计量好不好?¶
直观想法: 估计值应该接近真值。
数学化: 需要定量的评价指标!
标准 1:无偏性¶
定义 4-2(无偏估计):
估计量 \(\hat{\theta}\) 是无偏的,如果:
解释: 估计量的期望等于真值。
有偏估计: \(E[\hat{\theta}] \neq \theta\)
偏差: \(\text{Bias}(\hat{\theta}) = E[\hat{\theta}] - \theta\)
例子 4-1:样本均值的无偏性
问题: 估计总体均值 \(\mu\)
估计量: 样本均值 \(\hat{\mu} = \frac{1}{N}\sum_{i=1}^N x_i\)
验证无偏性:
所以样本均值是无偏估计!
例子 4-2:样本方差的有偏性
问题: 估计总体方差 \(\sigma^2\)
** naive 估计量:** \(\hat{\sigma}^2 = \frac{1}{N}\sum_{i=1}^N (x_i - \bar{x})^2\)
可以证明: \(\(E[\hat{\sigma}^2] = \frac{N-1}{N}\sigma^2 \neq \sigma^2\)\)
偏差: \(\text{Bias} = -\frac{\sigma^2}{N}\)
无偏修正: \(\(s^2 = \frac{1}{N-1}\sum_{i=1}^N (x_i - \bar{x})^2\)\)
标准 2:一致性¶
定义 4-3(一致估计):
估计量 \(\hat{\theta}_N\)(基于 \(N\) 个样本)是一致的,如果:
解释: 样本数→∞时,估计量依概率收敛到真值。
直观理解:
标准 3:有效性¶
定义 4-4(有效性):
对于两个无偏估计量 \(\hat{\theta}_1\) 和 \(\hat{\theta}_2\):
若 \(\text{Var}(\hat{\theta}_1) < \text{Var}(\hat{\theta}_2)\),则 \(\hat{\theta}_1\) 更有效。
解释: 方差小 = 估计值波动小 = 更可靠!
例子 4-3:比较两个均值估计量
数据: \(x_1, x_2, ..., x_N\) 独立同分布,均值 \(\mu\),方差 \(\sigma^2\)
估计量 1: 样本均值 \(\hat{\mu}_1 = \frac{1}{N}\sum_{i=1}^N x_i\)
估计量 2: 只用第一个样本 \(\hat{\mu}_2 = x_1\)
比较: \(\frac{\sigma^2}{N} < \sigma^2\)(当 \(N > 1\))
结论: \(\hat{\mu}_1\) 更有效!
标准 4:均方误差(MSE)⭐⭐⭐¶
定义 4-5(MSE):
MSE 分解公式 ⭐⭐⭐:
推导:
令 \(b = \text{Bias}(\hat{\theta}) = E[\hat{\theta}] - \theta\)
物理解释:
方差 - 偏差权衡 ⭐:
📡 在通信中的应用¶
应用 1:信道估计¶
模型: \(\(y = hx + n\)\)
已知: 导频符号 \(x_p\)(发射端已知的参考信号)
观测: \(y_p = h x_p + n\)
估计: \(\hat{h} = \frac{y_p}{x_p} = h + \frac{n}{x_p}\)
性能分析:
- 无偏性:\(E[\hat{h}] = h + E[n]/x_p = h\) ✅
- 方差:\(\text{Var}(\hat{h}) = \text{Var}(n)/|x_p|^2 = \sigma^2/|x_p|^2\)
- MSE:\(\text{MSE} = \sigma^2/|x_p|^2\)
应用 2:噪声方差估计¶
模型: 在空闲子载波上,\(y = n\)
观测: \(y_1, y_2, ..., y_N\)(只有噪声)
估计量: \(\hat{\sigma}^2 = \frac{1}{N}\sum_{i=1}^N |y_i|^2\)
验证:
是无偏估计!
✏️ 练习题 4.1¶
基础题 4-1:
估计量 \(\hat{\theta}_1\) 和 \(\hat{\theta}_2\) 的偏差和方差如下:
| 估计量 | 偏差 | 方差 |
|---|---|---|
| \(\hat{\theta}_1\) | 0 | 10 |
| \(\hat{\theta}_2\) | 2 | 3 |
哪个估计量的 MSE 更小?
答案:
进阶题 4-2:
证明:样本均值 \(\bar{x} = \frac{1}{N}\sum x_i\) 的方差是 \(\sigma^2/N\)。
假设: \(x_i\) 独立同分布,\(\text{Var}(x_i) = \sigma^2\)
答案:
4.2 最大似然估计(MLE)⭐⭐⭐⭐⭐¶
🎯 基础概念¶
直观理解¶
问题: 如何估计未知参数 \(\theta\)?
核心思想: 选择使观测数据"最可能出现"的参数值。
例子 4-4:硬币投掷
这就是最大似然估计!
📐 数学定义¶
定义 4-6(似然函数):
给定观测 \(\mathbf{y}\),参数 \(\theta\) 的似然函数为:
其中 \(f(\cdot|\theta)\) 是条件概率密度(或质量)函数。
定义 4-7(最大似然估计):
等价地(对数似然): \(\(\hat{\theta}_{ML} = \arg\max_{\theta} \log L(\theta)\)\)
为什么用对数? - 对数是单调函数,不改变最大值位置 - 乘积变求和,便于计算 - 指数变线性,简化求导
🔧 MLE 的求解步骤¶
标准步骤:
- 写出似然函数 \(L(\theta)\)
- 取对数 \(\ell(\theta) = \log L(\theta)\)
- 对 \(\theta\) 求导 \(\frac{\partial \ell}{\partial \theta}\)
- 令导数为零 \(\frac{\partial \ell}{\partial \theta} = 0\)
- 解方程得到 \(\hat{\theta}_{ML}\)
📝 经典例子¶
例子 4-5:高斯分布均值的 MLE¶
问题: \(x_1, ..., x_N \sim \mathcal{N}(\mu, \sigma^2)\),估计 \(\mu\)(\(\sigma^2\) 已知)
步骤 1:似然函数
步骤 2:对数似然
步骤 3:对 \(\mu\) 求导
步骤 4:令导数为零
步骤 5:求解
结论: 高斯均值的 MLE 是样本均值!
例子 4-6:高斯分布方差的 MLE¶
问题: \(x_1, ..., x_N \sim \mathcal{N}(\mu, \sigma^2)\),估计 \(\sigma^2\)(\(\mu\) 已知)
对数似然(关于 \(\sigma^2\)):
求导:
令为零:
重要发现:
MLE 估计的方差是**有偏**的!
无偏版本: \(\(s^2 = \frac{1}{N-1}\sum_{i=1}^N (x_i-\mu)^2\)\)
📡 在通信中的应用 ⭐⭐⭐¶
应用 1:AWGN 信道中的符号检测¶
模型: \(\(y = x + n, \quad n \sim \mathcal{CN}(0, \sigma^2)\)\)
问题: 从 \(y\) 估计发送符号 \(x\)
假设: \(x \in \{x_1, x_2, ..., x_M\}\)(星座点)
似然函数:
MLE 检测:
结论: MLE 检测 = 最小距离检测!
几何解释:
选择距离 \(y\) 最近的星座点!
应用 2:信道估计的 MLE¶
模型: \(\(y_p = h x_p + n\)\)
其中 \(x_p\) 是已知导频。
似然函数:
MLE:
解:
这就是 LS 估计!
🔍 MLE 的性质¶
性质 1:渐近无偏¶
性质 2:渐近有效¶
MLE 渐近达到 Cramér-Rao 下界(CRLB):
其中 \(I(\theta)\) 是 Fisher 信息。
性质 3:一致性¶
性质 4:不变性¶
若 \(\hat{\theta}_{ML}\) 是 \(\theta\) 的 MLE,则对于函数 \(g(\theta)\):
例子: 若 \(\hat{\sigma}^2_{ML}\) 是方差的 MLE,则 \(\hat{\sigma}_{ML} = \sqrt{\hat{\sigma}^2_{ML}}\) 是标准差的 MLE。
⚠️ 常见误区¶
误区 1: "MLE 总是无偏的"
纠正: MLE 通常是有偏的(如方差估计),只是渐近无偏。
误区 2: "MLE 总是最优的"
纠正: MLE 只在渐近意义下最优(大样本)。小样本时,贝叶斯估计可能更好。
误区 3: "MLE 需要考虑先验"
纠正: MLE 是频率学派方法,不使用先验信息。贝叶斯估计才用先验。
✏️ 练习题 4.2¶
基础题 4-3:
指数分布 \(f(x|\lambda) = \lambda e^{-\lambda x}\) 的 MLE 是什么?
观测:\(x_1, ..., x_N\)
答案:
进阶题 4-4:
推导 AWGN 信道 \(y = hx + n\) 中,当 \(x\) 是未知确定参数时的 MLE。
观测:\(y_1, ..., y_N\)(\(x\) 相同,噪声独立)
答案:
4.3 最小二乘估计(LS)⭐⭐⭐⭐⭐¶
🎯 基础概念¶
直观理解¶
问题: 如何拟合数据点?
这就是最小二乘!
📐 数学描述¶
定义 4-8(最小二乘估计):
对于线性模型:
LS 估计为:
解释:
- \(\mathbf{y}\):观测向量(\(N \times 1\))
- \(\mathbf{H}\):已知矩阵(\(N \times p\))
- \(\theta\):未知参数向量(\(p \times 1\))
- \(\mathbf{n}\):误差/噪声
目标: 最小化残差平方和!
🔧 LS 的闭式解¶
定理 4-1(LS 解):
前提是 \((\mathbf{H}^H \mathbf{H})\) 可逆。
完整推导 ⭐⭐⭐:
步骤 1:写出代价函数
步骤 2:展开
(利用了 \(\mathbf{y}^H\mathbf{H}\theta = (\theta^H\mathbf{H}^H\mathbf{y})^*\))
步骤 3:对 \(\theta\) 求梯度
使用复梯度公式: \(\(\frac{\partial}{\partial \theta^*} (\theta^H \mathbf{a}) = \mathbf{a}\)\) \(\(\frac{\partial}{\partial \theta^*} (\theta^H \mathbf{A} \theta) = \mathbf{A}\theta\)\)
步骤 4:令梯度为零
步骤 5:求解
若 \((\mathbf{H}^H \mathbf{H})\) 可逆:
几何解释:
LS 解的几何意义: \(\mathbf{H}\hat{\theta}_{LS}\) 是 \(\mathbf{y}\) 在 \(\mathbf{H}\) 列空间上的正交投影!
📊 LS 的统计特性¶
无偏性¶
假设: \(\mathbf{n}\) 零均值,\(E[\mathbf{n}] = \mathbf{0}\)
LS 是无偏估计!
方差¶
假设: \(\mathbf{n}\) 的协方差为 \(\sigma^2 \mathbf{I}\)
MSE¶
由于 LS 是无偏的:
📡 在通信中的应用 ⭐⭐⭐⭐⭐¶
应用 1:导频辅助信道估计¶
模型: \(\(\mathbf{y}_p = \mathbf{X}_p \mathbf{h} + \mathbf{n}\)\)
其中: - \(\mathbf{y}_p\):导频位置的接收信号 - \(\mathbf{X}_p\):导频符号构成的对角矩阵 - \(\mathbf{h}\):信道频率响应
LS 估计:
若 \(\mathbf{X}_p\) 是对角矩阵(OFDM 系统):
逐元素: \(\(\hat{H}[k] = \frac{Y_p[k]}{X_p[k]}\)\)
数值例子 4-7:
假设 4 个导频子载波:
LS 估计:
应用 2:数据辅助信道估计¶
模型: 使用已知数据符号(如训练序列)
其中 \(\mathbf{x}\) 是已知的训练序列。
LS 估计:
若 \(\mathbf{x}\) 是向量:
⚠️ LS 的局限性¶
问题 1:噪声增强¶
分析:
若 \(|X_p[k]|\) 很小,噪声被放大!
MSE: \(\(\text{MSE}_{LS} = \sum_k \frac{\sigma^2}{|X_p[k]|^2}\)\)
问题 2:未利用信道统计特性¶
问题: LS 不使用信道的先验信息(如相关性)。
解决方案: LMMSE 估计(下一节)!
✏️ 练习题 4.3¶
基础题 4-5:
对于标量模型 \(y = h x + n\),推导 LS 估计。
答案:
进阶题 4-6:
证明:当噪声是高斯分布时,LS 估计等价于 MLE。
提示:
4.4 贝叶斯估计与 MMSE ⭐⭐⭐⭐⭐¶
🎯 基础概念¶
频率学派 vs 贝叶斯学派¶
频率学派(MLE/LS): - 参数 \(\theta\) 是**确定但未知的** - 只有数据是随机的 - 估计量 \(\hat{\theta}\) 是随机变量
贝叶斯学派: - 参数 \(\theta\) 是**随机变量** - 有先验分布 \(p(\theta)\) - 估计基于后验分布 \(p(\theta|\mathbf{y})\)
贝叶斯公式 ⭐⭐⭐¶
各项含义:
| 项 | 名称 | 含义 |
|---|---|---|
| $p(\theta | \mathbf{y})$ | 后验分布 |
| $p(\mathbf{y} | \theta)$ | 似然函数 |
| \(p(\theta)\) | 先验分布 | 看到数据前,参数的分布 |
| \(p(\mathbf{y})\) | 证据 | 归一化常数 |
📐 贝叶斯估计器¶
问题:如何从后验分布得到点估计?¶
答案: 定义代价函数,最小化期望代价!
定义 4-9(贝叶斯估计):
其中 \(C(\cdot, \cdot)\) 是代价函数。
常见代价函数¶
1. 平方误差代价: \(C(\hat{\theta}, \theta) = |\hat{\theta} - \theta|^2\)
最优估计: \(\hat{\theta} = E[\theta|\mathbf{y}]\)(后验均值)
这就是**MMSE 估计**!
2. 均匀代价: \(\(C(\hat{\theta}, \theta) = \begin{cases} 0 & |\hat{\theta}-\theta| < \epsilon \\ 1 & \text{otherwise} \end{cases}\)\)
最优估计: \(\hat{\theta} = \arg\max p(\theta|\mathbf{y})\)(后验众数)
这就是**MAP 估计**!
🔧 MMSE 估计¶
定义¶
关键性质 ⭐⭐⭐¶
定理 4-2:MMSE 估计最小化 MSE
证明:
令 \(\hat{\theta} = E[\theta|\mathbf{y}] + \delta\)
交叉项: \(\(E[E[\theta|\mathbf{y}] - \theta | \mathbf{y}] = E[\theta|\mathbf{y}] - E[\theta|\mathbf{y}] = 0\)\)
所以: \(\(E[|\hat{\theta} - \theta|^2 | \mathbf{y}] = E[|E[\theta|\mathbf{y}] - \theta|^2 | \mathbf{y}] + |\delta|^2\)\)
当且仅当 \(\delta = 0\) 时最小!✅
📝 高斯 - 高斯模型 ⭐⭐⭐⭐⭐¶
问题:如何计算 MMSE 估计?¶
难点: 需要计算后验均值 \(E[\theta|\mathbf{y}]\),通常涉及复杂积分。
解决方案: 高斯 - 高斯模型有闭式解!
模型:
- 先验:\(\theta \sim \mathcal{N}(0, \sigma_\theta^2)\)
- 似然:\(\mathbf{y}|\theta \sim \mathcal{N}(\theta \mathbf{1}, \sigma_n^2 \mathbf{I})\)
(为简化,考虑标量 \(\theta\),向量观测 \(\mathbf{y}\))
定理 4-3(高斯 - 高斯后验):
后验分布仍是高斯: \(\(\theta|\mathbf{y} \sim \mathcal{N}(\mu_{post}, \sigma_{post}^2)\)\)
其中:
MMSE 估计:
其中 \(\bar{y} = \frac{1}{N}\sum y_i\)。
物理解释:
其中权重: \(\(w = \frac{\sigma_\theta^2}{\sigma_\theta^2 + \sigma_n^2/N}\)\)
极端情况:
| 情况 | 权重 \(w\) | 估计 |
|---|---|---|
| 高 SNR(\(\sigma_n^2 \to 0\)) | \(w \to 1\) | \(\hat{\theta} \to \bar{y}\)(信任数据) |
| 低 SNR(\(\sigma_n^2 \to \infty\)) | \(w \to 0\) | \(\hat{\theta} \to 0\)(信任先验) |
| 无先验信息(\(\sigma_\theta^2 \to \infty\)) | \(w \to 1\) | \(\hat{\theta} \to \bar{y}\)(退化为 LS) |
📡 在通信中的应用 ⭐⭐⭐⭐⭐¶
应用:LMMSE 信道估计¶
模型: \(\(\mathbf{y} = \mathbf{H}\mathbf{x} + \mathbf{n}\)\)
假设: - \(\mathbf{h} \sim \mathcal{CN}(\mathbf{0}, \mathbf{R}_{hh})\)(信道先验) - \(\mathbf{n} \sim \mathcal{CN}(\mathbf{0}, \sigma^2 \mathbf{I})\)(噪声)
LMMSE 估计:
推导(线性 MMSE):
假设线性估计:\(\hat{\mathbf{h}} = \mathbf{W}\mathbf{y}\)
MSE 矩阵: \(\(\mathbf{E} = E[(\mathbf{h} - \mathbf{W}\mathbf{y})(\mathbf{h} - \mathbf{W}\mathbf{y})^H]\)\)
迹 MSE: \(\(J(\mathbf{W}) = \text{tr}(\mathbf{E})\)\)
展开: \(\(\begin{aligned} J(\mathbf{W}) &= \text{tr}(E[\mathbf{h}\mathbf{h}^H] - E[\mathbf{h}\mathbf{y}^H]\mathbf{W}^H - \mathbf{W}E[\mathbf{y}\mathbf{h}^H] + \mathbf{W}E[\mathbf{y}\mathbf{y}^H]\mathbf{W}^H) \\ &= \text{tr}(\mathbf{R}_{hh} - \mathbf{R}_{hy}\mathbf{W}^H - \mathbf{W}\mathbf{R}_{yh} + \mathbf{W}\mathbf{R}_{yy}\mathbf{W}^H) \end{aligned}\)\)
求梯度: \(\(\frac{\partial J}{\partial \mathbf{W}^*} = -\mathbf{R}_{yh}^H + \mathbf{W}\mathbf{R}_{yy} = \mathbf{0}\)\)
代入: - \(\mathbf{R}_{hy} = E[\mathbf{h}\mathbf{y}^H] = \mathbf{R}_{hh}\) - \(\mathbf{R}_{yy} = E[\mathbf{y}\mathbf{y}^H] = \mathbf{R}_{hh} + \sigma^2 \mathbf{I}\)
与 LS 的比较:
| 估计器 | 公式 | 需要信息 |
|---|---|---|
| LS | \(\hat{\mathbf{h}} = \mathbf{y}\) | 无 |
| LMMSE | \(\hat{\mathbf{h}} = \mathbf{R}_{hh} (\mathbf{R}_{hh} + \sigma^2 \mathbf{I})^{-1} \mathbf{y}\) | \(\mathbf{R}_{hh}, \sigma^2\) |
性能比较:
LMMSE 总是优于或等于 LS!
📝 数值例子¶
例子 4-8:标量 LMMSE
模型: \(y = h + n\)
假设: - \(h \sim \mathcal{CN}(0, 1)\) - \(n \sim \mathcal{CN}(0, 0.1)\)
LMMSE 估计:
比较:
| 观测 \(y\) | LS 估计 | LMMSE 估计 |
|---|---|---|
| \(0.5\) | \(0.5\) | \(0.45\) |
| \(1.0\) | \(1.0\) | \(0.91\) |
| \(-0.3\) | \(-0.3\) | \(-0.27\) |
解释: LMMSE 向先验均值(0)收缩!
⚠️ 常见误区¶
误区 1: "MMSE 估计总是无偏的"
纠正: MMSE 估计通常是有偏的!
例子: 上面的标量 LMMSE,\(E[\hat{h}] = 0.91 E[h] = 0 \neq h\)(对特定 \(h\))
误区 2: "MMSE 需要知道精确的先验"
纠正: 可以使用经验贝叶斯方法,从数据估计先验参数。
误区 3: "LMMSE 总是比 LS 好"
纠正: 理论上是的,但实际中: - 若 \(\mathbf{R}_{hh}\) 不准确,性能下降 - 计算复杂度高 - 需要知道 \(\sigma^2\)
✏️ 练习题 4.4¶
基础题 4-7:
先验 \(\theta \sim \mathcal{N}(0, 4)\),观测 \(y|\theta \sim \mathcal{N}(\theta, 1)\),观测值 \(y=3\)。
计算 MMSE 估计。
答案:
进阶题 4-8:
推导向量 LMMSE 估计的 MSE 矩阵。
答案:
📌 本章小结¶
关键公式速查¶
| 估计器 | 公式 |
|---|---|
| MLE | $\hat{\theta}_{ML} = \arg\max p(\mathbf{y} |
| LS | \(\hat{\theta}_{LS} = (\mathbf{H}^H \mathbf{H})^{-1} \mathbf{H}^H \mathbf{y}\) |
| MMSE | $\hat{\theta}_{MMSE} = E[\theta |
| LMMSE | \(\hat{\mathbf{h}}_{LMMSE} = \mathbf{R}_{hh} (\mathbf{R}_{hh} + \sigma^2 \mathbf{I})^{-1} \mathbf{y}\) |
| MSE 分解 | \(\text{MSE} = \text{Var} + \text{Bias}^2\) |
估计器比较¶
| 估计器 | 优点 | 缺点 | 需要信息 |
|---|---|---|---|
| MLE | 渐近最优 | 小样本有偏 | 似然函数 |
| LS | 简单、无偏 | 噪声增强 | 无 |
| LMMSE | MSE 最小 | 复杂、需先验 | \(\mathbf{R}_{hh}, \sigma^2\) |
与后续章节的联系¶
- 第 9 章(信道估计): 直接应用 LS 和 LMMSE
- 第 10 章(均衡): MMSE 均衡器推导
- 第 11 章(解调): MAP 检测
🎓 本章完成检查¶
在完成第 5 章之前,确保你能:
- 解释无偏性、一致性、有效性的含义
- 推导 MSE 分解公式
- 推导高斯均值的 MLE
- 推导 LS 估计的闭式解
- 解释 LS 的几何意义
- 说明贝叶斯估计与频率学派的区别
- 推导高斯 - 高斯模型的 MMSE 估计
- 推导 LMMSE 信道估计公式
全部掌握? → 继续学习 第 5 章 检测理论
还有疑问? → 重读本章节,或做更多练习题
第 4 章 结束