Fisher信息量与系统辨识

1 minute read

Published:

若随机变量 $X$ 的分布依赖于参数 $\theta$,则Fisher信息是用于度量 $X$ 所携带的关于参数 $\theta$ 的信息量。


一、最大似然估计

设随机变量 $X$ 的概率依赖于参数 $\theta$,概率密度函数为:

\[p(X;\theta) \tag{1}\]
如果采集得到了 $X$ 的一系列样本 ${x_ii=1,2,\cdots,N}$,采用最大似然估计(maximum likelihood estimation, MLE)对 $\theta$ 进行估计时,定义的似然函数为:
\[L(\theta) = \prod_{i=1}^{N}p(x_i;\theta) \tag{2}\]

两边取自然对数有:

\[l(\theta)=\ln L(\theta) = \sum_{i=1}^n \ln p(x_i;\theta) \tag{3}\]

取使得 $l(\theta)$ 最大的 $\theta$ 作为参数估计结果 $\hat\theta_{MLE}$,此时有

\[\frac{\partial l(\theta)}{\partial \theta}\Big|_{\theta ={\hat\theta_{MLE}}} =0 \tag{4}\]

式(3)左侧似然函数关于参数的偏导数被称为评估分数(score)。


二、Fisher信息量

如果 $\theta^$ 就是 $X$ 分布密度 $p(X;\theta)$ 的真实参数,则在 $\theta^$ 处式(3)评估分数的期望为0:

\[\mathbb E_{X}\left[ \frac{\partial l(\theta)}{\partial \theta}\Big|{\theta=\theta^*} \right] = 0 \tag{5}\]

而Fisher信息则为评估分数对应的方差:

\[{\cal I}(\theta^*) = {\mathbb E}_{X}\left[ \left(\frac{\partial l(\theta)}{\partial \theta} \right)^2 \Big|{\theta=\theta^*} \right] \tag{6}\]

容易看出

\[{\cal I}(\theta^*) \geq 0 \tag{7}\]

如果 $l(\theta)$ 关于 $\theta$ 是二次可微的,则可证明:

\[{\cal I}(\theta^*) = -{\mathbb E}_{X}\left[ \frac{\partial^2 l(\theta)}{\partial \theta^2} \Big|{\theta=\theta^*} \right] \tag{8}\]

对Fisher信息的直观理解:

  1. 如果参数 $\theta^$ 的Fisher信息量越大,则根据式(8)中的二阶导数形式,似然函数 $l(\theta)$ 在 $\theta^$ 处的变化斜率绝对值就越大,这样一来,待估计参数 $\theta$ 值的小幅变化都会导致似然函数 $l(\theta)$ 的显著改变,那么我们就更容易准确估计 $\theta^*$ 的取值,这就表明 $X$ 携带了关于确定 $\theta$ 的更多信息;

  2. 这意味着我们可以优化 $X$ 采样以提升对参数 $\theta$ 估计的准确性。


三、Fisher信息用于系统辨识

在系统辨识中,通常采用Fisher信息矩阵逆的标量函数指导最优输入信号条件的构造,从而进行参数估计。如果指标函数为

\[J = \phi({\mathbf M}^{-1}) \tag{9}\]
其中 $\mathbf M$ 为Fisher信息矩阵。如果系统输入输出样本集为 $S = {(u_i, x_i)i=1,2,\cdots,N}$,带估计参数为 $\theta = {\theta_1,\theta_2,\cdots,\theta_M}$,则根据式(6)有
\[\mathbf M = {\mathbb E}_S \left[ \left( \frac{\partial l(\theta|S)}{\partial \theta} \right) \left( \frac{\partial l(\theta|S)}{\partial \theta} \right)^T \right] \tag{10}\]

常用的度量函数 $\phi(\cdot)$ 形式有:

  1. A-最优准则:$J = {\rm Tr}({\mathbf{M}}^{-1})$ 或 $J = {\rm Tr}({\mathbf W}{\mathbf M}^{-1})$;

  2. D-最优准则:$J = \det({\mathbf M}^{-1})$ 或 $J = \log\left(\det\left({\mathbf M}^{-1}\right)\right)$。

其中 $\mathbf W$ 为非负定矩阵。


四、辨识输入信号选择

通过Fisher信息矩阵可知,当系统为单输入单输出且残差为独立同分布正态序列时,通过D-最优准则可获得辨识输入的自相关函数应满足脉冲形式。更一般地,Goodwin和Payne提出:如果模型结构正确,且参数估计值 $\hat\theta$ 是无偏最小方差估计,则对参数 $\hat\theta$ 的辨识精度将依赖于输入信号 $u$,**最优辨识输入信号是具有脉冲式自相关函数的信号**,即

\[\frac{1}{N}\sum_{k=1}^N u_{k-i} u_{k-j} = \left\{ \begin{matrix} 1, i = j \\ 0, i \neq j \\ \end{matrix} \right.\]

当样本数 $N$ 很大时,白噪声或M序列可近似满足此要求;否则,并非对所有 $N$ 都能找到这种信号。

**具体工程应用**中,辨识输入信号的选择还需考虑:

  1. 输入信号的功率和幅度不应过大,避免系统工作区呈现非线性或对运行安全等构成影响;也不应过小导致辨识信噪比过低和辨识精度下降;

  2. 输入信号对系统的“净扰动”要小,即使正负扰动的概率均等;

  3. 维纳-辛钦关系式:输入信号频谱需宽于系统频谱以充分激励系统