跳转至

第 4 章 估计理论

本章预计学习时间: 4 小时
前置知识: 第 1 章(概率论)、第 2 章(随机过程)、第 3 章(线性代数)
后续依赖: 第 9 章(信道估计算法)、第 10 章(均衡算法)


📌 本章目标

学完本章后,你将能够:

  1. 理解 参数估计的基本概念和评价标准
  2. 推导 最大似然估计(MLE)的完整过程
  3. 推导 最小二乘估计(LS)的闭式解
  4. 理解 贝叶斯估计与 MMSE 估计的关系
  5. 应用 估计理论解决通信中的信道估计问题

4.1 参数估计基本概念

🎯 基础概念(零基础友好)

什么是估计问题?

生活中的例子:

1
2
3
4
5
6
7
8
场景:你想知道从家到公司的平均通勤时间

方法:记录 10 天的通勤时间
数据:35min, 42min, 38min, 45min, 40min, 37min, 43min, 39min, 41min, 36min

问题:如何从这 10 个数据推断"平均通勤时间"?

答案:用估计!

估计量: 样本平均值 \(\(\hat{\mu} = \frac{1}{10}\sum_{i=1}^{10} x_i = 39.6 \text{ min}\)\)


通信中的例子:

场景:接收机收到信号 y,想知道发送的符号 x

模型:y = hx + n

已知:y(接收信号)、h(信道,可能已知或未知)
未知:x(发送符号)

问题:如何从 y 估计 x?

答案:用估计理论!

估计问题的数学描述

定义 4-1(参数估计问题):

观测数据 \(\mathbf{y}\) 与未知参数 \(\theta\) 的关系:

\[\mathbf{y} = f(\theta) + \mathbf{n}\]

其中: - \(\theta\):未知参数(待估计) - \(\mathbf{y}\):观测数据(已知) - \(\mathbf{n}\):噪声(随机) - \(f(\cdot)\):已知函数

目标:\(\mathbf{y}\) 构造估计量 \(\hat{\theta} = g(\mathbf{y})\)


关键区分:

术语 含义 例子
参数 \(\theta\) 未知的确定值 信道增益 \(h\)
估计量 \(\hat{\theta}\) 随机变量(依赖观测) \(\hat{h} = y/x\)
估计值 估计量的具体实现 \(\hat{h} = 0.5 + 0.3j\)

📊 估计量的评价标准

问题:如何判断估计量好不好?

直观想法: 估计值应该接近真值。

数学化: 需要定量的评价指标!


标准 1:无偏性

定义 4-2(无偏估计):

估计量 \(\hat{\theta}\) 是无偏的,如果:

\[E[\hat{\theta}] = \theta\]

解释: 估计量的期望等于真值。

有偏估计: \(E[\hat{\theta}] \neq \theta\)

偏差: \(\text{Bias}(\hat{\theta}) = E[\hat{\theta}] - \theta\)


例子 4-1:样本均值的无偏性

问题: 估计总体均值 \(\mu\)

估计量: 样本均值 \(\hat{\mu} = \frac{1}{N}\sum_{i=1}^N x_i\)

验证无偏性:

\[\begin{aligned} E[\hat{\mu}] &= E\left[\frac{1}{N}\sum_{i=1}^N x_i\right] \\ &= \frac{1}{N}\sum_{i=1}^N E[x_i] \quad \text{(期望线性性)} \\ &= \frac{1}{N}\sum_{i=1}^N \mu \\ &= \mu \quad \checkmark \end{aligned}\]

所以样本均值是无偏估计!


例子 4-2:样本方差的有偏性

问题: 估计总体方差 \(\sigma^2\)

** naive 估计量:** \(\hat{\sigma}^2 = \frac{1}{N}\sum_{i=1}^N (x_i - \bar{x})^2\)

可以证明: \(\(E[\hat{\sigma}^2] = \frac{N-1}{N}\sigma^2 \neq \sigma^2\)\)

偏差: \(\text{Bias} = -\frac{\sigma^2}{N}\)

无偏修正: \(\(s^2 = \frac{1}{N-1}\sum_{i=1}^N (x_i - \bar{x})^2\)\)

\[E[s^2] = \sigma^2 \quad \checkmark\]

标准 2:一致性

定义 4-3(一致估计):

估计量 \(\hat{\theta}_N\)(基于 \(N\) 个样本)是一致的,如果:

\[\hat{\theta}_N \xrightarrow{P} \theta \quad \text{当 } N \to \infty\]

解释: 样本数→∞时,估计量依概率收敛到真值。


直观理解:

1
2
3
N = 10:  估计值可能在真值附近波动
N = 100: 波动范围变小
N = 1000: 非常接近真值

标准 3:有效性

定义 4-4(有效性):

对于两个无偏估计量 \(\hat{\theta}_1\)\(\hat{\theta}_2\)

\(\text{Var}(\hat{\theta}_1) < \text{Var}(\hat{\theta}_2)\),则 \(\hat{\theta}_1\) 更有效。

解释: 方差小 = 估计值波动小 = 更可靠!


例子 4-3:比较两个均值估计量

数据: \(x_1, x_2, ..., x_N\) 独立同分布,均值 \(\mu\),方差 \(\sigma^2\)

估计量 1: 样本均值 \(\hat{\mu}_1 = \frac{1}{N}\sum_{i=1}^N x_i\)

\[\text{Var}(\hat{\mu}_1) = \frac{\sigma^2}{N}\]

估计量 2: 只用第一个样本 \(\hat{\mu}_2 = x_1\)

\[\text{Var}(\hat{\mu}_2) = \sigma^2\]

比较: \(\frac{\sigma^2}{N} < \sigma^2\)(当 \(N > 1\)

结论: \(\hat{\mu}_1\) 更有效!


标准 4:均方误差(MSE)⭐⭐⭐

定义 4-5(MSE):

\[\text{MSE}(\hat{\theta}) = E[(\hat{\theta} - \theta)^2]\]

MSE 分解公式 ⭐⭐⭐:

\[\boxed{\text{MSE} = \text{Var}(\hat{\theta}) + [\text{Bias}(\hat{\theta})]^2}\]

推导:

\(b = \text{Bias}(\hat{\theta}) = E[\hat{\theta}] - \theta\)

\[\begin{aligned} \text{MSE} &= E[(\hat{\theta} - \theta)^2] \\ &= E[(\hat{\theta} - E[\hat{\theta}] + E[\hat{\theta}] - \theta)^2] \\ &= E[(\hat{\theta} - E[\hat{\theta}] + b)^2] \\ &= E[(\hat{\theta} - E[\hat{\theta}])^2] + 2bE[\hat{\theta} - E[\hat{\theta}]] + b^2 \\ &= \text{Var}(\hat{\theta}) + 0 + b^2 \\ &= \text{Var}(\hat{\theta}) + [\text{Bias}(\hat{\theta})]^2 \quad \checkmark \end{aligned}\]

物理解释:

1
2
3
4
5
6
MSE = 方差 + 偏差²

方差:估计值的波动程度(随机误差)
偏差²:系统误差的平方

好的估计量:方差小 + 偏差小

方差 - 偏差权衡 ⭐:

1
2
3
4
复杂模型:偏差小,方差大(过拟合)
简单模型:偏差大,方差小(欠拟合)

最优:平衡两者,最小化 MSE

📡 在通信中的应用

应用 1:信道估计

模型: \(\(y = hx + n\)\)

已知: 导频符号 \(x_p\)(发射端已知的参考信号)

观测: \(y_p = h x_p + n\)

估计: \(\hat{h} = \frac{y_p}{x_p} = h + \frac{n}{x_p}\)

性能分析:

  • 无偏性:\(E[\hat{h}] = h + E[n]/x_p = h\)
  • 方差:\(\text{Var}(\hat{h}) = \text{Var}(n)/|x_p|^2 = \sigma^2/|x_p|^2\)
  • MSE:\(\text{MSE} = \sigma^2/|x_p|^2\)

应用 2:噪声方差估计

模型: 在空闲子载波上,\(y = n\)

观测: \(y_1, y_2, ..., y_N\)(只有噪声)

估计量: \(\hat{\sigma}^2 = \frac{1}{N}\sum_{i=1}^N |y_i|^2\)

验证:

\[E[\hat{\sigma}^2] = \frac{1}{N}\sum_{i=1}^N E[|y_i|^2] = \frac{1}{N}\cdot N \cdot \sigma^2 = \sigma^2 \quad \checkmark\]

是无偏估计!


✏️ 练习题 4.1

基础题 4-1:

估计量 \(\hat{\theta}_1\)\(\hat{\theta}_2\) 的偏差和方差如下:

估计量 偏差 方差
\(\hat{\theta}_1\) 0 10
\(\hat{\theta}_2\) 2 3

哪个估计量的 MSE 更小?

答案:

1
2
3
4
5
MSE(θ̂₁) = Var(θ̂₁) + Bias² = 10 + 0 = 10
MSE(θ̂₂) = Var(θ̂₂) + Bias² = 3 + 2² = 7

θ̂₂ 的 MSE 更小!
(虽然有偏,但方差小,总体更好)


进阶题 4-2:

证明:样本均值 \(\bar{x} = \frac{1}{N}\sum x_i\) 的方差是 \(\sigma^2/N\)

假设: \(x_i\) 独立同分布,\(\text{Var}(x_i) = \sigma^2\)

答案:

1
2
3
4
5
Var(x̄) = Var((1/N)Σxᵢ)
       = (1/N)² Var(Σxᵢ)
       = (1/N)² Σ Var(xᵢ)  (独立性)
       = (1/N)² · N · σ²
       = σ²/N  ✓


4.2 最大似然估计(MLE)⭐⭐⭐⭐⭐

🎯 基础概念

直观理解

问题: 如何估计未知参数 \(\theta\)

核心思想: 选择使观测数据"最可能出现"的参数值。


例子 4-4:硬币投掷

1
2
3
4
5
6
7
8
9
场景:有一枚硬币,正面概率 p 未知

实验:投掷 10 次,观察到 7 次正面

问题:p 是多少?

直观答案:p ≈ 7/10 = 0.7

为什么?因为 p=0.7 时,观察到 7 次正面的概率最大!

这就是最大似然估计!


📐 数学定义

定义 4-6(似然函数):

给定观测 \(\mathbf{y}\),参数 \(\theta\) 的似然函数为:

\[L(\theta) = f(\mathbf{y} | \theta)\]

其中 \(f(\cdot|\theta)\) 是条件概率密度(或质量)函数。


定义 4-7(最大似然估计):

\[\hat{\theta}_{ML} = \arg\max_{\theta} L(\theta)\]

等价地(对数似然): \(\(\hat{\theta}_{ML} = \arg\max_{\theta} \log L(\theta)\)\)

为什么用对数? - 对数是单调函数,不改变最大值位置 - 乘积变求和,便于计算 - 指数变线性,简化求导


🔧 MLE 的求解步骤

标准步骤:

  1. 写出似然函数 \(L(\theta)\)
  2. 取对数 \(\ell(\theta) = \log L(\theta)\)
  3. \(\theta\) 求导 \(\frac{\partial \ell}{\partial \theta}\)
  4. 令导数为零 \(\frac{\partial \ell}{\partial \theta} = 0\)
  5. 解方程得到 \(\hat{\theta}_{ML}\)

📝 经典例子

例子 4-5:高斯分布均值的 MLE

问题: \(x_1, ..., x_N \sim \mathcal{N}(\mu, \sigma^2)\),估计 \(\mu\)\(\sigma^2\) 已知)

步骤 1:似然函数

\[L(\mu) = \prod_{i=1}^N \frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(x_i-\mu)^2}{2\sigma^2}\right)\]

步骤 2:对数似然

\[\begin{aligned} \ell(\mu) &= \log L(\mu) \\ &= \sum_{i=1}^N \left[-\frac{1}{2}\log(2\pi\sigma^2) - \frac{(x_i-\mu)^2}{2\sigma^2}\right] \\ &= -\frac{N}{2}\log(2\pi\sigma^2) - \frac{1}{2\sigma^2}\sum_{i=1}^N (x_i-\mu)^2 \end{aligned}\]

步骤 3:对 \(\mu\) 求导

\[\frac{\partial \ell}{\partial \mu} = -\frac{1}{2\sigma^2}\sum_{i=1}^N 2(x_i-\mu)(-1) = \frac{1}{\sigma^2}\sum_{i=1}^N (x_i-\mu)\]

步骤 4:令导数为零

\[\frac{1}{\sigma^2}\sum_{i=1}^N (x_i-\mu) = 0\]
\[\sum_{i=1}^N x_i - N\mu = 0\]

步骤 5:求解

\[\hat{\mu}_{ML} = \frac{1}{N}\sum_{i=1}^N x_i = \bar{x}\]

结论: 高斯均值的 MLE 是样本均值!


例子 4-6:高斯分布方差的 MLE

问题: \(x_1, ..., x_N \sim \mathcal{N}(\mu, \sigma^2)\),估计 \(\sigma^2\)\(\mu\) 已知)

对数似然(关于 \(\sigma^2\)):

\[\ell(\sigma^2) = -\frac{N}{2}\log(2\pi) - \frac{N}{2}\log(\sigma^2) - \frac{1}{2\sigma^2}\sum_{i=1}^N (x_i-\mu)^2\]

求导:

\[\frac{\partial \ell}{\partial \sigma^2} = -\frac{N}{2\sigma^2} + \frac{1}{2(\sigma^2)^2}\sum_{i=1}^N (x_i-\mu)^2\]

令为零:

\[-\frac{N}{2\sigma^2} + \frac{1}{2(\sigma^2)^2}\sum_{i=1}^N (x_i-\mu)^2 = 0\]
\[\hat{\sigma}^2_{ML} = \frac{1}{N}\sum_{i=1}^N (x_i-\mu)^2\]

重要发现:

MLE 估计的方差是**有偏**的!

\[E[\hat{\sigma}^2_{ML}] = \frac{N-1}{N}\sigma^2 \neq \sigma^2\]

无偏版本: \(\(s^2 = \frac{1}{N-1}\sum_{i=1}^N (x_i-\mu)^2\)\)


📡 在通信中的应用 ⭐⭐⭐

应用 1:AWGN 信道中的符号检测

模型: \(\(y = x + n, \quad n \sim \mathcal{CN}(0, \sigma^2)\)\)

问题:\(y\) 估计发送符号 \(x\)

假设: \(x \in \{x_1, x_2, ..., x_M\}\)(星座点)


似然函数:

\[p(y|x_i) = \frac{1}{\pi\sigma^2} \exp\left(-\frac{|y-x_i|^2}{\sigma^2}\right)\]

MLE 检测:

\[\begin{aligned} \hat{x}_{ML} &= \arg\max_{x_i} p(y|x_i) \\ &= \arg\max_{x_i} \log p(y|x_i) \\ &= \arg\max_{x_i} \left[-\log(\pi\sigma^2) - \frac{|y-x_i|^2}{\sigma^2}\right] \\ &= \arg\min_{x_i} |y-x_i|^2 \end{aligned}\]

结论: MLE 检测 = 最小距离检测!


几何解释:

         Im
          │    × 星座点 x₁
          │   /
          │  /
          │ • y(接收点)
          │  \
          │   \
          │    × 星座点 x₂
──────────┼────────→ Re

选择距离 \(y\) 最近的星座点!


应用 2:信道估计的 MLE

模型: \(\(y_p = h x_p + n\)\)

其中 \(x_p\) 是已知导频。


似然函数:

\[p(y_p|h) = \frac{1}{\pi\sigma^2} \exp\left(-\frac{|y_p - h x_p|^2}{\sigma^2}\right)\]

MLE:

\[\begin{aligned} \hat{h}_{ML} &= \arg\max_h p(y_p|h) \\ &= \arg\min_h |y_p - h x_p|^2 \end{aligned}\]

解:

\[\frac{\partial}{\partial h^*} |y_p - h x_p|^2 = -x_p^*(y_p - h x_p) = 0\]
\[\hat{h}_{ML} = \frac{y_p}{x_p}\]

这就是 LS 估计!


🔍 MLE 的性质

性质 1:渐近无偏

\[\lim_{N\to\infty} E[\hat{\theta}_{ML}] = \theta\]

性质 2:渐近有效

MLE 渐近达到 Cramér-Rao 下界(CRLB):

\[\text{Var}(\hat{\theta}_{ML}) \geq \frac{1}{I(\theta)}\]

其中 \(I(\theta)\) 是 Fisher 信息。


性质 3:一致性

\[\hat{\theta}_{ML} \xrightarrow{P} \theta \quad \text{当 } N \to \infty\]

性质 4:不变性

\(\hat{\theta}_{ML}\)\(\theta\) 的 MLE,则对于函数 \(g(\theta)\)

\[\widehat{g(\theta)}_{ML} = g(\hat{\theta}_{ML})\]

例子:\(\hat{\sigma}^2_{ML}\) 是方差的 MLE,则 \(\hat{\sigma}_{ML} = \sqrt{\hat{\sigma}^2_{ML}}\) 是标准差的 MLE。


⚠️ 常见误区

误区 1: "MLE 总是无偏的"

纠正: MLE 通常是有偏的(如方差估计),只是渐近无偏。


误区 2: "MLE 总是最优的"

纠正: MLE 只在渐近意义下最优(大样本)。小样本时,贝叶斯估计可能更好。


误区 3: "MLE 需要考虑先验"

纠正: MLE 是频率学派方法,不使用先验信息。贝叶斯估计才用先验。


✏️ 练习题 4.2

基础题 4-3:

指数分布 \(f(x|\lambda) = \lambda e^{-\lambda x}\) 的 MLE 是什么?

观测:\(x_1, ..., x_N\)

答案:

1
2
3
4
L(λ) = ∏ λe^(-λxᵢ) = λᴺ e^(-λΣxᵢ)
ℓ(λ) = N log λ - λΣxᵢ
∂ℓ/∂λ = N/λ - Σxᵢ = 0
λ̂_ML = N/(Σxᵢ) = 1/x̄


进阶题 4-4:

推导 AWGN 信道 \(y = hx + n\) 中,当 \(x\) 是未知确定参数时的 MLE。

观测:\(y_1, ..., y_N\)\(x\) 相同,噪声独立)

答案:

1
2
3
4
5
6
L(h,x) = ∏ (1/πσ²) exp(-|yᵢ-hx|²/σ²)
ℓ = -N log(πσ²) - (1/σ²)Σ|yᵢ-hx|²

对 h* 求导:
∂ℓ/∂h* = (1/σ²)Σx*(yᵢ-hx) = 0
ĥ = (Σyᵢ)/(Nx) = ȳ/x


4.3 最小二乘估计(LS)⭐⭐⭐⭐⭐

🎯 基础概念

直观理解

问题: 如何拟合数据点?

1
2
3
4
5
6
7
数据点:(x₁,y₁), (x₂,y₂), ..., (x_N,y_N)

模型:y = ax + b(直线)

问题:如何选择 a, b 使直线"最好"地拟合数据?

答案:最小化误差平方和!

这就是最小二乘!


📐 数学描述

定义 4-8(最小二乘估计):

对于线性模型:

\[\mathbf{y} = \mathbf{H}\theta + \mathbf{n}\]

LS 估计为:

\[\hat{\theta}_{LS} = \arg\min_{\theta} \|\mathbf{y} - \mathbf{H}\theta\|^2\]

解释:

  • \(\mathbf{y}\):观测向量(\(N \times 1\)
  • \(\mathbf{H}\):已知矩阵(\(N \times p\)
  • \(\theta\):未知参数向量(\(p \times 1\)
  • \(\mathbf{n}\):误差/噪声

目标: 最小化残差平方和!


🔧 LS 的闭式解

定理 4-1(LS 解):

\[\boxed{\hat{\theta}_{LS} = (\mathbf{H}^H \mathbf{H})^{-1} \mathbf{H}^H \mathbf{y}}\]

前提是 \((\mathbf{H}^H \mathbf{H})\) 可逆。


完整推导 ⭐⭐⭐:

步骤 1:写出代价函数

\[J(\theta) = \|\mathbf{y} - \mathbf{H}\theta\|^2 = (\mathbf{y} - \mathbf{H}\theta)^H (\mathbf{y} - \mathbf{H}\theta)\]

步骤 2:展开

\[\begin{aligned} J(\theta) &= \mathbf{y}^H\mathbf{y} - \mathbf{y}^H\mathbf{H}\theta - \theta^H\mathbf{H}^H\mathbf{y} + \theta^H\mathbf{H}^H\mathbf{H}\theta \\ &= \mathbf{y}^H\mathbf{y} - 2\text{Re}\{\theta^H\mathbf{H}^H\mathbf{y}\} + \theta^H\mathbf{H}^H\mathbf{H}\theta \end{aligned}\]

(利用了 \(\mathbf{y}^H\mathbf{H}\theta = (\theta^H\mathbf{H}^H\mathbf{y})^*\)


步骤 3:对 \(\theta\) 求梯度

使用复梯度公式: \(\(\frac{\partial}{\partial \theta^*} (\theta^H \mathbf{a}) = \mathbf{a}\)\) \(\(\frac{\partial}{\partial \theta^*} (\theta^H \mathbf{A} \theta) = \mathbf{A}\theta\)\)

\[\frac{\partial J}{\partial \theta^*} = -\mathbf{H}^H\mathbf{y} + \mathbf{H}^H\mathbf{H}\theta\]

步骤 4:令梯度为零

\[-\mathbf{H}^H\mathbf{y} + \mathbf{H}^H\mathbf{H}\theta = \mathbf{0}\]
\[\mathbf{H}^H\mathbf{H}\hat{\theta}_{LS} = \mathbf{H}^H\mathbf{y}\]

步骤 5:求解

\((\mathbf{H}^H \mathbf{H})\) 可逆:

\[\boxed{\hat{\theta}_{LS} = (\mathbf{H}^H \mathbf{H})^{-1} \mathbf{H}^H \mathbf{y}}\]

几何解释:

        y(观测)
        │\
        │ \
        │  \
        │   \ 残差 y - Hθ̂
        │    \
        │     \
        │      • Hθ̂(投影)
        │     /
        │    /
        │   /
        └──────────→ 列空间 Col(H)

LS 解的几何意义: \(\mathbf{H}\hat{\theta}_{LS}\)\(\mathbf{y}\)\(\mathbf{H}\) 列空间上的正交投影!


📊 LS 的统计特性

无偏性

假设: \(\mathbf{n}\) 零均值,\(E[\mathbf{n}] = \mathbf{0}\)

\[\begin{aligned} E[\hat{\theta}_{LS}] &= E[(\mathbf{H}^H \mathbf{H})^{-1} \mathbf{H}^H \mathbf{y}] \\ &= (\mathbf{H}^H \mathbf{H})^{-1} \mathbf{H}^H E[\mathbf{y}] \\ &= (\mathbf{H}^H \mathbf{H})^{-1} \mathbf{H}^H \mathbf{H} \theta \\ &= \theta \quad \checkmark \end{aligned}\]

LS 是无偏估计!


方差

假设: \(\mathbf{n}\) 的协方差为 \(\sigma^2 \mathbf{I}\)

\[\begin{aligned} \text{Var}(\hat{\theta}_{LS}) &= E[(\hat{\theta}_{LS} - \theta)(\hat{\theta}_{LS} - \theta)^H] \\ &= E[((\mathbf{H}^H \mathbf{H})^{-1} \mathbf{H}^H \mathbf{n})((\mathbf{H}^H \mathbf{H})^{-1} \mathbf{H}^H \mathbf{n})^H] \\ &= (\mathbf{H}^H \mathbf{H})^{-1} \mathbf{H}^H E[\mathbf{n}\mathbf{n}^H] \mathbf{H} (\mathbf{H}^H \mathbf{H})^{-1} \\ &= (\mathbf{H}^H \mathbf{H})^{-1} \mathbf{H}^H (\sigma^2 \mathbf{I}) \mathbf{H} (\mathbf{H}^H \mathbf{H})^{-1} \\ &= \sigma^2 (\mathbf{H}^H \mathbf{H})^{-1} \end{aligned}\]

MSE

由于 LS 是无偏的:

\[\text{MSE} = \text{Var}(\hat{\theta}_{LS}) = \sigma^2 (\mathbf{H}^H \mathbf{H})^{-1}\]

📡 在通信中的应用 ⭐⭐⭐⭐⭐

应用 1:导频辅助信道估计

模型: \(\(\mathbf{y}_p = \mathbf{X}_p \mathbf{h} + \mathbf{n}\)\)

其中: - \(\mathbf{y}_p\):导频位置的接收信号 - \(\mathbf{X}_p\):导频符号构成的对角矩阵 - \(\mathbf{h}\):信道频率响应


LS 估计:

\[\hat{\mathbf{h}}_{LS} = (\mathbf{X}_p^H \mathbf{X}_p)^{-1} \mathbf{X}_p^H \mathbf{y}_p\]

\(\mathbf{X}_p\) 是对角矩阵(OFDM 系统):

\[\hat{\mathbf{h}}_{LS} = \mathbf{X}_p^{-1} \mathbf{y}_p\]

逐元素: \(\(\hat{H}[k] = \frac{Y_p[k]}{X_p[k]}\)\)


数值例子 4-7:

假设 4 个导频子载波:

\[\mathbf{X}_p = \text{diag}(1, j, -1, -j)$$ $$\mathbf{y}_p = [0.5+0.3j, -0.2+0.8j, -0.4-0.2j, 0.1-0.9j]^T\]

LS 估计:

\[\hat{\mathbf{h}}_{LS} = \mathbf{X}_p^{-1} \mathbf{y}_p = [0.5+0.3j, 0.8+0.2j, 0.4+0.2j, 0.9+0.1j]^T\]

应用 2:数据辅助信道估计

模型: 使用已知数据符号(如训练序列)

\[\mathbf{y} = \mathbf{H}\mathbf{x} + \mathbf{n}\]

其中 \(\mathbf{x}\) 是已知的训练序列。


LS 估计:

\[\hat{\mathbf{H}}_{LS} = \mathbf{y} \mathbf{x}^H (\mathbf{x} \mathbf{x}^H)^{-1}\]

\(\mathbf{x}\) 是向量:

\[\hat{\mathbf{H}}_{LS} = \frac{\mathbf{y} \mathbf{x}^H}{\|\mathbf{x}\|^2}\]

⚠️ LS 的局限性

问题 1:噪声增强

分析:

\[\hat{\mathbf{h}}_{LS} = \mathbf{h} + \mathbf{X}_p^{-1} \mathbf{n}\]

\(|X_p[k]|\) 很小,噪声被放大!

MSE: \(\(\text{MSE}_{LS} = \sum_k \frac{\sigma^2}{|X_p[k]|^2}\)\)


问题 2:未利用信道统计特性

问题: LS 不使用信道的先验信息(如相关性)。

解决方案: LMMSE 估计(下一节)!


✏️ 练习题 4.3

基础题 4-5:

对于标量模型 \(y = h x + n\),推导 LS 估计。

答案:

1
2
3
J(h) = |y - hx|²
∂J/∂h* = -x*(y - hx) = 0
ĥ_LS = y/x


进阶题 4-6:

证明:当噪声是高斯分布时,LS 估计等价于 MLE。

提示:

1
2
3
写出高斯似然函数
取对数
发现最大化似然 = 最小化平方误差


4.4 贝叶斯估计与 MMSE ⭐⭐⭐⭐⭐

🎯 基础概念

频率学派 vs 贝叶斯学派

频率学派(MLE/LS): - 参数 \(\theta\) 是**确定但未知的** - 只有数据是随机的 - 估计量 \(\hat{\theta}\) 是随机变量

贝叶斯学派: - 参数 \(\theta\) 是**随机变量** - 有先验分布 \(p(\theta)\) - 估计基于后验分布 \(p(\theta|\mathbf{y})\)


贝叶斯公式 ⭐⭐⭐

\[p(\theta|\mathbf{y}) = \frac{p(\mathbf{y}|\theta) p(\theta)}{p(\mathbf{y})}\]

各项含义:

名称 含义
$p(\theta \mathbf{y})$ 后验分布
$p(\mathbf{y} \theta)$ 似然函数
\(p(\theta)\) 先验分布 看到数据前,参数的分布
\(p(\mathbf{y})\) 证据 归一化常数

📐 贝叶斯估计器

问题:如何从后验分布得到点估计?

答案: 定义代价函数,最小化期望代价!


定义 4-9(贝叶斯估计):

\[\hat{\theta}_{Bayes} = \arg\min_{\hat{\theta}} E[C(\hat{\theta}, \theta)]\]

其中 \(C(\cdot, \cdot)\) 是代价函数。


常见代价函数

1. 平方误差代价: \(C(\hat{\theta}, \theta) = |\hat{\theta} - \theta|^2\)

最优估计: \(\hat{\theta} = E[\theta|\mathbf{y}]\)(后验均值)

这就是**MMSE 估计**!


2. 均匀代价: \(\(C(\hat{\theta}, \theta) = \begin{cases} 0 & |\hat{\theta}-\theta| < \epsilon \\ 1 & \text{otherwise} \end{cases}\)\)

最优估计: \(\hat{\theta} = \arg\max p(\theta|\mathbf{y})\)(后验众数)

这就是**MAP 估计**!


🔧 MMSE 估计

定义

\[\hat{\theta}_{MMSE} = E[\theta|\mathbf{y}]\]

关键性质 ⭐⭐⭐

定理 4-2:MMSE 估计最小化 MSE

\[\hat{\theta}_{MMSE} = \arg\min_{\hat{\theta}} E[|\hat{\theta} - \theta|^2 | \mathbf{y}]\]

证明:

\(\hat{\theta} = E[\theta|\mathbf{y}] + \delta\)

\[\begin{aligned} E[|\hat{\theta} - \theta|^2 | \mathbf{y}] &= E[|E[\theta|\mathbf{y}] + \delta - \theta|^2 | \mathbf{y}] \\ &= E[|(E[\theta|\mathbf{y}] - \theta) + \delta|^2 | \mathbf{y}] \\ &= E[|E[\theta|\mathbf{y}] - \theta|^2 | \mathbf{y}] + |\delta|^2 \\ &\quad + 2\text{Re}\{\delta^* E[E[\theta|\mathbf{y}] - \theta | \mathbf{y}]\} \end{aligned}\]

交叉项: \(\(E[E[\theta|\mathbf{y}] - \theta | \mathbf{y}] = E[\theta|\mathbf{y}] - E[\theta|\mathbf{y}] = 0\)\)

所以: \(\(E[|\hat{\theta} - \theta|^2 | \mathbf{y}] = E[|E[\theta|\mathbf{y}] - \theta|^2 | \mathbf{y}] + |\delta|^2\)\)

当且仅当 \(\delta = 0\) 时最小!✅


📝 高斯 - 高斯模型 ⭐⭐⭐⭐⭐

问题:如何计算 MMSE 估计?

难点: 需要计算后验均值 \(E[\theta|\mathbf{y}]\),通常涉及复杂积分。

解决方案: 高斯 - 高斯模型有闭式解!


模型:

  • 先验:\(\theta \sim \mathcal{N}(0, \sigma_\theta^2)\)
  • 似然:\(\mathbf{y}|\theta \sim \mathcal{N}(\theta \mathbf{1}, \sigma_n^2 \mathbf{I})\)

(为简化,考虑标量 \(\theta\),向量观测 \(\mathbf{y}\)


定理 4-3(高斯 - 高斯后验):

后验分布仍是高斯: \(\(\theta|\mathbf{y} \sim \mathcal{N}(\mu_{post}, \sigma_{post}^2)\)\)

其中:

\[\sigma_{post}^2 = \left(\frac{1}{\sigma_\theta^2} + \frac{N}{\sigma_n^2}\right)^{-1}\]
\[\mu_{post} = \frac{\sigma_{post}^2}{\sigma_n^2} \sum_{i=1}^N y_i\]

MMSE 估计:

\[\hat{\theta}_{MMSE} = \mu_{post} = \frac{\sigma_\theta^2}{\sigma_\theta^2 + \sigma_n^2/N} \cdot \bar{y}\]

其中 \(\bar{y} = \frac{1}{N}\sum y_i\)


物理解释:

\[\hat{\theta}_{MMSE} = w \cdot \bar{y} + (1-w) \cdot 0\]

其中权重: \(\(w = \frac{\sigma_\theta^2}{\sigma_\theta^2 + \sigma_n^2/N}\)\)


极端情况:

情况 权重 \(w\) 估计
高 SNR(\(\sigma_n^2 \to 0\) \(w \to 1\) \(\hat{\theta} \to \bar{y}\)(信任数据)
低 SNR(\(\sigma_n^2 \to \infty\) \(w \to 0\) \(\hat{\theta} \to 0\)(信任先验)
无先验信息(\(\sigma_\theta^2 \to \infty\) \(w \to 1\) \(\hat{\theta} \to \bar{y}\)(退化为 LS)

📡 在通信中的应用 ⭐⭐⭐⭐⭐

应用:LMMSE 信道估计

模型: \(\(\mathbf{y} = \mathbf{H}\mathbf{x} + \mathbf{n}\)\)

假设: - \(\mathbf{h} \sim \mathcal{CN}(\mathbf{0}, \mathbf{R}_{hh})\)(信道先验) - \(\mathbf{n} \sim \mathcal{CN}(\mathbf{0}, \sigma^2 \mathbf{I})\)(噪声)


LMMSE 估计:

\[\hat{\mathbf{h}}_{LMMSE} = \mathbf{R}_{hh} (\mathbf{R}_{hh} + \sigma^2 \mathbf{I})^{-1} \mathbf{y}\]

推导(线性 MMSE):

假设线性估计:\(\hat{\mathbf{h}} = \mathbf{W}\mathbf{y}\)

MSE 矩阵: \(\(\mathbf{E} = E[(\mathbf{h} - \mathbf{W}\mathbf{y})(\mathbf{h} - \mathbf{W}\mathbf{y})^H]\)\)

迹 MSE: \(\(J(\mathbf{W}) = \text{tr}(\mathbf{E})\)\)


展开: \(\(\begin{aligned} J(\mathbf{W}) &= \text{tr}(E[\mathbf{h}\mathbf{h}^H] - E[\mathbf{h}\mathbf{y}^H]\mathbf{W}^H - \mathbf{W}E[\mathbf{y}\mathbf{h}^H] + \mathbf{W}E[\mathbf{y}\mathbf{y}^H]\mathbf{W}^H) \\ &= \text{tr}(\mathbf{R}_{hh} - \mathbf{R}_{hy}\mathbf{W}^H - \mathbf{W}\mathbf{R}_{yh} + \mathbf{W}\mathbf{R}_{yy}\mathbf{W}^H) \end{aligned}\)\)


求梯度: \(\(\frac{\partial J}{\partial \mathbf{W}^*} = -\mathbf{R}_{yh}^H + \mathbf{W}\mathbf{R}_{yy} = \mathbf{0}\)\)

\[\mathbf{W}_{opt} = \mathbf{R}_{hy} \mathbf{R}_{yy}^{-1}\]

代入: - \(\mathbf{R}_{hy} = E[\mathbf{h}\mathbf{y}^H] = \mathbf{R}_{hh}\) - \(\mathbf{R}_{yy} = E[\mathbf{y}\mathbf{y}^H] = \mathbf{R}_{hh} + \sigma^2 \mathbf{I}\)

\[\boxed{\hat{\mathbf{h}}_{LMMSE} = \mathbf{R}_{hh} (\mathbf{R}_{hh} + \sigma^2 \mathbf{I})^{-1} \mathbf{y}}\]

与 LS 的比较:

估计器 公式 需要信息
LS \(\hat{\mathbf{h}} = \mathbf{y}\)
LMMSE \(\hat{\mathbf{h}} = \mathbf{R}_{hh} (\mathbf{R}_{hh} + \sigma^2 \mathbf{I})^{-1} \mathbf{y}\) \(\mathbf{R}_{hh}, \sigma^2\)

性能比较:

\[\text{MSE}_{LS} = \sigma^2\]
\[\text{MSE}_{LMMSE} = \text{tr}(\mathbf{R}_{hh} - \mathbf{R}_{hh}(\mathbf{R}_{hh} + \sigma^2 \mathbf{I})^{-1}\mathbf{R}_{hh})\]

LMMSE 总是优于或等于 LS!


📝 数值例子

例子 4-8:标量 LMMSE

模型: \(y = h + n\)

假设: - \(h \sim \mathcal{CN}(0, 1)\) - \(n \sim \mathcal{CN}(0, 0.1)\)

LMMSE 估计:

\[\hat{h}_{LMMSE} = \frac{\sigma_h^2}{\sigma_h^2 + \sigma_n^2} y = \frac{1}{1 + 0.1} y = 0.91 y\]

比较:

观测 \(y\) LS 估计 LMMSE 估计
\(0.5\) \(0.5\) \(0.45\)
\(1.0\) \(1.0\) \(0.91\)
\(-0.3\) \(-0.3\) \(-0.27\)

解释: LMMSE 向先验均值(0)收缩!


⚠️ 常见误区

误区 1: "MMSE 估计总是无偏的"

纠正: MMSE 估计通常是有偏的!

例子: 上面的标量 LMMSE,\(E[\hat{h}] = 0.91 E[h] = 0 \neq h\)(对特定 \(h\)


误区 2: "MMSE 需要知道精确的先验"

纠正: 可以使用经验贝叶斯方法,从数据估计先验参数。


误区 3: "LMMSE 总是比 LS 好"

纠正: 理论上是的,但实际中: - 若 \(\mathbf{R}_{hh}\) 不准确,性能下降 - 计算复杂度高 - 需要知道 \(\sigma^2\)


✏️ 练习题 4.4

基础题 4-7:

先验 \(\theta \sim \mathcal{N}(0, 4)\),观测 \(y|\theta \sim \mathcal{N}(\theta, 1)\),观测值 \(y=3\)

计算 MMSE 估计。

答案:

1
2
3
σ_θ² = 4, σ_n² = 1
w = σ_θ²/(σ_θ² + σ_n²) = 4/5 = 0.8
θ̂_MMSE = 0.8 × 3 = 2.4


进阶题 4-8:

推导向量 LMMSE 估计的 MSE 矩阵。

答案:

1
2
3
MSE = E[(h-ĥ)(h-ĥ)ᴴ]
    = R_hh - R_hh(R_hh + σ²I)⁻¹R_hh
    = (R_hh⁻¹ + (1/σ²)I)⁻¹


📌 本章小结

关键公式速查

估计器 公式
MLE $\hat{\theta}_{ML} = \arg\max p(\mathbf{y}
LS \(\hat{\theta}_{LS} = (\mathbf{H}^H \mathbf{H})^{-1} \mathbf{H}^H \mathbf{y}\)
MMSE $\hat{\theta}_{MMSE} = E[\theta
LMMSE \(\hat{\mathbf{h}}_{LMMSE} = \mathbf{R}_{hh} (\mathbf{R}_{hh} + \sigma^2 \mathbf{I})^{-1} \mathbf{y}\)
MSE 分解 \(\text{MSE} = \text{Var} + \text{Bias}^2\)

估计器比较

估计器 优点 缺点 需要信息
MLE 渐近最优 小样本有偏 似然函数
LS 简单、无偏 噪声增强
LMMSE MSE 最小 复杂、需先验 \(\mathbf{R}_{hh}, \sigma^2\)

与后续章节的联系

  • 第 9 章(信道估计): 直接应用 LS 和 LMMSE
  • 第 10 章(均衡): MMSE 均衡器推导
  • 第 11 章(解调): MAP 检测

🎓 本章完成检查

在完成第 5 章之前,确保你能:

  • 解释无偏性、一致性、有效性的含义
  • 推导 MSE 分解公式
  • 推导高斯均值的 MLE
  • 推导 LS 估计的闭式解
  • 解释 LS 的几何意义
  • 说明贝叶斯估计与频率学派的区别
  • 推导高斯 - 高斯模型的 MMSE 估计
  • 推导 LMMSE 信道估计公式

全部掌握? → 继续学习 第 5 章 检测理论

还有疑问? → 重读本章节,或做更多练习题


第 4 章 结束