§E14.9Rao–Blackwell の定理

最終更新

成功確率が零と一の間にある未知の値である Bernoulli 分布から複数の独立同分布標本を得た場合、一個目の成否だけでも成功確率の不偏推定量になる。しかし、その分散は標本全体の成功割合の分散より大きい。既に得られた推定量から、未知の成功確率を使わずに、標本全体の情報を反映する推定量を構成する方法が必要になる。

成功回数は成功確率に対する十分統計量であり、一個目の成否を成功回数で条件付けた期待値は標本全体の成功割合に等しい。Rao–Blackwell の定理は、この条件付き期待値が母数に依存しない推定量を与え、凸損失に対するリスクを増加させないことを示す。十分統計量による条件付けは、十分性を推定の改善へ結び付ける最も基本的な原理の一つであり、二乗可積分な不偏推定量に対しては期待値を保ちながら分散を増加させない。

本記事では、Rao–Blackwell の定理と、不偏推定量の分散に対する帰結を扱う。

1 凸損失の改善

定理 1.1 (Rao–Blackwell の定理).(X,A)(\mathcal X,\mathcal A)上の確率測度の非空な族(Pθ)θ∈Θ(P_\theta)_{\theta\in\Theta}がシグマ有限測度に支配され、T:(X,A)→(Y,B)T:(\mathcal X,\mathcal A)\to(\mathcal Y,\mathcal B)が十分であるとする。A⊆RA\subseteq\Rを非空な区間とし、δ:X→A\delta:\mathcal X\to Aを可測関数で、すべてのθ∈Θ\theta\in\ThetaについてEθ∣δ∣<∞E_\theta|\delta|<\inftyを満たすものとする。

各θ∈Θ\theta\in\Thetaに対し、Lθ:A→[0,∞)L_\theta:A\to[0,\infty)が有限値の可測な凸関数であり、Lθ(δ)L_\theta(\delta)がPθP_\theta可積分であるとする。このとき、母数θ\thetaに依存しない有限値B\mathcal B可測関数g:Y→Ag:\mathcal Y\to Aが存在し、推定量

δT=g(T)\delta_T=g(T)

は、すべてのθ∈Θ\theta\in\Thetaについて

δT=Eθ[δ∣σ(T)]Pθ-ほとんど確実に\delta_T=E_\theta[\delta\mid\sigma(T)]\qquad P_\theta\text{-ほとんど確実に}

を満たす。さらに、Lθ(δT)L_\theta(\delta_T)はPθP_\theta可積分であり、

Rθ(δT):=Eθ[Lθ(δT)]≤Eθ[Lθ(δ)]=:Rθ(δ)R_\theta(\delta_T):=E_\theta[L_\theta(\delta_T)] \leq E_\theta[L_\theta(\delta)]=:R_\theta(\delta)

がすべてのθ∈Θ\theta\in\Thetaについて成り立つ。

証明.§E14.5 命題 3.3をu=δu=\deltaに適用し、有限値B\mathcal B可測関数aδa_\deltaを、すべてのθ∈Θ\theta\in\Thetaについて

aδ(T)=Eθ[δ∣σ(T)]Pθ-ほとんど確実にa_\delta(T)=E_\theta[\delta\mid\sigma(T)]\qquad P_\theta\text{-ほとんど確実に}

となるように取る。a0∈Aa_0\in Aを一つ取り、

g(y)={aδ(y),aδ(y)∈A,a0,aδ(y)∉Ag(y)= \begin{cases} a_\delta(y),&a_\delta(y)\in A,\\ a_0,&a_\delta(y)\notin A \end{cases}

と定める。区間AAは Borel 集合であるから、ggは有限値B\mathcal B可測関数であり、すべての点でAAに値を取る。

θ∈Θ\theta\in\Thetaを固定し、M=aδ(T)M=a_\delta(T)と置く。下端α=inf⁡A\alpha=\inf Aが有限ならば、δ≥α\delta\geq\alphaと条件付き期待値の正値性§E11.11 命題 2.1 (2)からM≥αM\geq\alphaがPθP_\theta-ほとんど確実に成り立つ。α∉A\alpha\notin Aの場合にはδ−α>0\delta-\alpha>0である。B={M=α}∈σ(T)B=\{M=\alpha\}\in\sigma(T)と置くと、条件付き期待値の定義から

Eθ[(δ−α)1B]=Eθ[(M−α)1B]=0E_\theta[(\delta-\alpha)\mathbf1_B] =E_\theta[(M-\alpha)\mathbf1_B]=0

となるため、Pθ(B)=0P_\theta(B)=0である。したがって、下端がAAに属さない場合にはM>αM>\alphaがPθP_\theta-ほとんど確実に成り立つ。上端β=sup⁡A\beta=\sup Aが有限である場合には、β−δ\beta-\deltaに同じ議論を適用すると、M≤βM\leq\betaが成り立ち、β∉A\beta\notin AならばM<βM<\betaが成り立つ。有限でない端点には条件がないので、いずれの場合にもM∈AM\in AがPθP_\theta-ほとんど確実に成り立つ。

関数ggはaδa_\deltaがAAの外に値を取る点だけで補正されているから、

δT=g(T)=M=Eθ[δ∣σ(T)]\delta_T=g(T)=M=E_\theta[\delta\mid\sigma(T)]

がPθP_\theta-ほとんど確実に成り立つ。§E11.11 定理 3.2を区間AA上の凸関数LθL_\thetaに適用すると、

Lθ(δT)≤Eθ[Lθ(δ)∣σ(T)]Pθ-ほとんど確実にL_\theta(\delta_T) \leq E_\theta[L_\theta(\delta)\mid\sigma(T)] \qquad P_\theta\text{-ほとんど確実に}

を得る。右辺は非負かつ可積分であるから、左辺も可積分である。両辺の期待値を取り、期待値保存§E11.11 命題 2.1 (4)を用いると、

Rθ(δT)≤Rθ(δ)R_\theta(\delta_T)\leq R_\theta(\delta)

となる。ggはすべての母数に対して同じ関数であり、θ\thetaは任意であったから、主張はすべてのθ∈Θ\theta\in\Thetaについて成り立つ。▨

例 1.2 (凸性を外した場合).P(X=1)=P(X=−1)=1/2P(X=1)=P(X=-1)=1/2とし、母数空間を一点集合とする。定数統計量T=0T=0は十分であり、δ=X\delta=Xに対して

E[δ∣σ(T)]=E[X]=0E[\delta\mid\sigma(T)]=E[X]=0

である。行動空間をA=[−1,1]A=[-1,1]とし、非負損失をL(a)=1−a2L(a)=1-a^2と定めると、LLは凸ではない。元の推定量と条件付き期待値による推定量のリスクはそれぞれ

E[L(δ)]=0,E[L(E[δ∣σ(T)])]=L(0)=1E[L(\delta)]=0, \qquad E[L(E[\delta\mid\sigma(T)])]=L(0)=1

である。したがって、損失の凸性を外すと、十分統計量による条件付けがリスクを増加させる場合がある。

2 不偏性と分散

定理 2.1.(X,A)(\mathcal X,\mathcal A)上の確率測度の非空な族(Pθ)θ∈Θ(P_\theta)_{\theta\in\Theta}がシグマ有限測度に支配され、T:(X,A)→(Y,B)T:(\mathcal X,\mathcal A)\to(\mathcal Y,\mathcal B)が十分であるとする。τ:Θ→R\tau:\Theta\to\Rとし、実数値可測関数τ^\widehat\tauが、すべてのθ∈Θ\theta\in\Thetaについて

Eθ[τ^]=τ(θ),Eθ[τ^2]<∞E_\theta[\widehat\tau]=\tau(\theta), \qquad E_\theta[\widehat\tau^2]<\infty

を満たすとする。このとき有限値B\mathcal B可測関数hhが存在し、τ~=h(T)\widetilde\tau=h(T)と置くと次が成り立つ。

  1. τ~\widetilde\tauは母数θ\thetaに依存しない統計量である。
  2. τ~\widetilde\tauはτ(θ)\tau(\theta)の不偏推定量である。すなわち、すべてのθ∈Θ\theta\in\ThetaについてEθ[τ~]=τ(θ)E_\theta[\widetilde\tau]=\tau(\theta)である。
  3. すべてのθ∈Θ\theta\in\Thetaについて Var⁡θ(τ^)−Var⁡θ(τ~)=Eθ[(τ^−τ~)2]≥0\operatorname{Var}_\theta(\widehat\tau)-\operatorname{Var}_\theta(\widetilde\tau) =E_\theta[(\widehat\tau-\widetilde\tau)^2]\geq0 が成り立つ。固定したθ\thetaについて分散が等しいための必要十分条件は、τ^=τ~\widehat\tau=\widetilde\tauがPθP_\theta-ほとんど確実に成り立つことであり、これはτ^\widehat\tauがPθP_\thetaに関してσ(T)\sigma(T)可測な版をもつことと同値である。

証明.定理 1.1をA=RA=\R、δ=τ^\delta=\widehat\tauおよび

Lθ(a)=(a−τ(θ))2L_\theta(a)=(a-\tau(\theta))^2

に適用する。Eθ[τ^2]<∞E_\theta[\widehat\tau^2]<\inftyであるからLθ(τ^)L_\theta(\widehat\tau)は可積分である。したがって、母数に依存しない有限値B\mathcal B可測関数hhが存在し、τ~=h(T)\widetilde\tau=h(T)と置けば

τ~=Eθ[τ^∣σ(T)]Pθ-ほとんど確実に\widetilde\tau=E_\theta[\widehat\tau\mid\sigma(T)] \qquad P_\theta\text{-ほとんど確実に}

がすべてのθ∈Θ\theta\in\Thetaについて成り立つ。特に、TTとhhの可測性から(1)が成り立つ。

(2)を示す。期待値保存§E11.11 命題 2.1 (4)により、任意のθ∈Θ\theta\in\Thetaについて

Eθ[τ~]=Eθ[τ^]=τ(θ)E_\theta[\widetilde\tau]=E_\theta[\widehat\tau]=\tau(\theta)

である。

(3)を示す。θ∈Θ\theta\in\Thetaを固定する。全分散公式§E11.11 定理 4.4とτ~=Eθ[τ^∣σ(T)]\widetilde\tau=E_\theta[\widehat\tau\mid\sigma(T)]から

Var⁡θ(τ^)=Eθ[(τ^−τ~)2]+Var⁡θ(τ~)\operatorname{Var}_\theta(\widehat\tau) =E_\theta[(\widehat\tau-\widetilde\tau)^2] +\operatorname{Var}_\theta(\widetilde\tau)

を得る。したがって分散差の恒等式と分散改善が成り立つ。分散が等しいことは、非負確率変数(τ^−τ~)2(\widehat\tau-\widetilde\tau)^2の期待値が零であることと同値であり、さらにτ^=τ~\widehat\tau=\widetilde\tauがPθP_\theta-ほとんど確実に成り立つことと同値である。この等式が成り立つならばτ~\widetilde\tauがσ(T)\sigma(T)可測なので、τ^\widehat\tauはσ(T)\sigma(T)可測な版をもつ。逆にτ^\widehat\tauがσ(T)\sigma(T)可測な版をもつならば、条件付き期待値の可測変数に対する性質§E11.11 命題 2.1 (3)によりτ^=τ~\widehat\tau=\widetilde\tauがPθP_\theta-ほとんど確実に成り立つ。▨

3 Bernoulli 標本

例 3.1.n≥2n\geq2とし、X1,…,XnX_1,\ldots,X_nを成功確率p∈(0,1)p\in(0,1)の Bernoulli 分布からの独立同分布標本とする。X1X_1はppの不偏推定量であり、§E14.5 例 1.3により成功回数

T=∑i=1nXiT=\sum_{i=1}^nX_i

はppに対して十分である。

s∈{1,…,n−1}s\in\{1,\ldots,n-1\}に対して、T=sT=sとなる零と一の列のうち第一成分が一であるものは(n−1s−1)\binom{n-1}{s-1}個である。条件付き分布はこのような列の上の一様分布であるから、

Ep[X1∣T=s]=(n−1s−1)(ns)=snE_p[X_1\mid T=s] =\frac{\binom{n-1}{s-1}}{\binom ns} =\frac sn

となる。s=0,ns=0,nでも同じ等式は直接成り立つ。したがって

Ep[X1∣σ(T)]=Tn=X‾E_p[X_1\mid\sigma(T)]=\frac Tn=\overline X

であり、条件付き期待値の表示はppに依存しない。

T∼Bin⁡(n,p)T\sim\operatorname{Bin}(n,p)であるから、§E11.5 命題 1.3により

Var⁡p(X1)=p(1−p),Var⁡p(X‾)=p(1−p)n.\operatorname{Var}_p(X_1)=p(1-p), \qquad \operatorname{Var}_p(\overline X)=\frac{p(1-p)}n.

二乗損失Lp(a)=(a−p)2L_p(a)=(a-p)^2の下では、両推定量が不偏であるためリスクはそれぞれの分散に等しい。したがって、p∈(0,1)p\in(0,1)とn≥2n\geq2の全範囲でX‾\overline XのリスクはX1X_1のリスクより真に小さい。

4 Jensen の不等式の等号

命題 4.1 (Jensen の不等式と狭義凸の場合の等号).I⊆RI\subseteq\Rを区間とし、φ:I→R\varphi:I\to\Rとする。XXとφ(X)\varphi(X)が可積分で、P(X∈I)=1P(X\in I)=1およびE[X]∈IE[X]\in Iを満たすとする。

  1. φ\varphiが凸ならば、φ(E[X])≤E[φ(X)]\varphi(E[X])\leq E[\varphi(X)]である。
  2. φ\varphiが狭義凸ならば、等号φ(E[X])=E[φ(X)]\varphi(E[X])=E[\varphi(X)]が成り立つための必要十分条件は、X=E[X]X=E[X]がほとんど確実に成り立つことである。
  3. φ\varphiが凹ならば、φ(E[X])≥E[φ(X)]\varphi(E[X])\geq E[\varphi(X)]である。φ\varphiがアフィンならば等号が成り立つ。

証明. 凸関数に対する不等式は§E11.4 定理 3.4である。m=E[X]m=E[X]と置き、φ\varphiが狭義凸であるとする。mmがIIの端点ならば、X−mX-mまたはm−Xm-Xは非負で期待値が零であるから、X=mX=mがほとんど確実に成り立つ。

mmがIIの内点である場合には、mmにおける支持直線の傾きssを取り、

D=φ(X)−φ(m)−s(X−m)D=\varphi(X)-\varphi(m)-s(X-m)

と置く。支持直線の性質からD≥0D\geq0であり、狭義凸性からD=0D=0となるのはX=mX=mの場合に限る。Jensen の不等式で等号が成り立つならば

E[D]=E[φ(X)]−φ(m)−s(E[X]−m)=0E[D]=E[\varphi(X)]-\varphi(m)-s(E[X]-m)=0

である。非負確率変数の期待値が零であるためD=0D=0がほとんど確実に成り立ち、したがってX=mX=mがほとんど確実に成り立つ。逆にX=mX=mがほとんど確実ならば、期待値を直接取ると等号を得る。

凹関数φ\varphiについては凸関数−φ-\varphiに第一の主張を適用する。アフィン関数は凸かつ凹であるため、二つの不等式から等号が成り立つ。▨

参考文献

  1. Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer Texts in Statistics, Springer, 1998.十分統計量による推定量の改善と二乗誤差に対する等号条件を参考にした。
  2. George Casella and Roger L. Berger, Statistical Inference, 2nd ed., CRC Press, Boca Raton, 2024, originally published 2002.Rao–Blackwell の定理と Bernoulli 標本における条件付き期待値の計算を参考にした。

前提記事