1 推定量、損失、リスク
定義 1.1. ( X , A ) (\mathcal X,\mathcal A) ( X , A ) 上の確率測度の非空な族( P θ ) θ ∈ Θ (P_\theta)_{\theta\in\Theta} ( P θ ) θ ∈ Θ を統計モデルとし、( A , G ) (A,\mathcal G) ( A , G ) を可測な行動空間、τ : Θ → A \tau:\Theta\to A τ : Θ → A を推定対象とする。可測写像δ : ( X , A ) → ( A , G ) \delta:(\mathcal X,\mathcal A)\to(A,\mathcal G) δ : ( X , A ) → ( A , G ) をτ \tau τ の 推定量 (estimator ) という。観測値x ∈ X x\in\mathcal X x ∈ X に対するδ ( x ) \delta(x) δ ( x ) を 推定値 (estimate ) という。各θ ∈ Θ \theta\in\Theta θ ∈ Θ の下での像測度P θ ∘ δ − 1 P_\theta\circ\delta^{-1} P θ ∘ δ − 1 を推定量の 標本分布 (sampling distribution ) という。
定義 1.2. 定義 1.1 の統計モデル、行動空間、推定対象を考える。各θ ∈ Θ \theta\in\Theta θ ∈ Θ についてa ↦ L ( θ , a ) a\mapsto L(\theta,a) a ↦ L ( θ , a ) がG \mathcal G G 可測である関数
L : Θ × A ⟶ [ 0 , ∞ ] L:\Theta\times A\longrightarrow[0,\infty] L : Θ × A ⟶ [ 0 , ∞ ] を 損失関数 (loss function ) という。推定量δ \delta δ のθ \theta θ における リスク (risk ) を
R θ ( δ ) = E θ [ L ( θ , δ ) ] = ∫ X L ( θ , δ ( x ) ) P θ ( d x ) ∈ [ 0 , ∞ ] R_\theta(\delta)=E_\theta[L(\theta,\delta)]
=\int_{\mathcal X}L(\theta,\delta(x))\,P_\theta(dx)
\in[0,\infty] R θ ( δ ) = E θ [ L ( θ , δ )] = ∫ X L ( θ , δ ( x )) P θ ( d x ) ∈ [ 0 , ∞ ] で定義する。
2 偏りと平均二乗誤差
定義 2.1. 定義 1.1 においてA = R A=\R A = R とし、τ : Θ → R \tau:\Theta\to\R τ : Θ → R を実数値推定対象とする。実数値推定量δ \delta δ がすべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ について可積分であるとき、θ \theta θ における 偏り (bias ) を
Bias θ ( δ ) = E θ [ δ ] − τ ( θ ) \operatorname{Bias}_\theta(\delta)=E_\theta[\delta]-\tau(\theta) Bias θ ( δ ) = E θ [ δ ] − τ ( θ ) で定義する。すべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ についてBias θ ( δ ) = 0 \operatorname{Bias}_\theta(\delta)=0 Bias θ ( δ ) = 0 であるとき、δ \delta δ をτ \tau τ の 不偏推定量 (unbiased estimator ) という。
不偏性は、すべての母数において推定量の平均が推定対象に一致する性質である。各観測で得る推定値と推定対象との差が小さいことは、不偏性だけからは従わない。
定義 2.2. 実数値推定対象τ : Θ → R \tau:\Theta\to\R τ : Θ → R と実数値推定量δ \delta δ に対し、θ \theta θ における 平均二乗誤差 (mean squared error ) (MSE)を
MSE θ ( δ ) = E θ [ ( δ − τ ( θ ) ) 2 ] ∈ [ 0 , ∞ ] \operatorname{MSE}_\theta(\delta)
=E_\theta\!\left[(\delta-\tau(\theta))^2\right]
\in[0,\infty] MSE θ ( δ ) = E θ [ ( δ − τ ( θ ) ) 2 ] ∈ [ 0 , ∞ ] で定義する。これは二乗損失L ( θ , a ) = ( a − τ ( θ ) ) 2 L(\theta,a)=(a-\tau(\theta))^2 L ( θ , a ) = ( a − τ ( θ ) ) 2 に対するリスクである。
命題 2.3. 実数値推定量δ \delta δ がすべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ について二乗可積分であるとする。このとき、すべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ について
MSE θ ( δ ) = Var θ ( δ ) + Bias θ ( δ ) 2 \operatorname{MSE}_\theta(\delta)
=\operatorname{Var}_\theta(\delta)
+\operatorname{Bias}_\theta(\delta)^2 MSE θ ( δ ) = Var θ ( δ ) + Bias θ ( δ ) 2 が成り立つ。特に、δ \delta δ が不偏ならば、すべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ についてMSE θ ( δ ) = Var θ ( δ ) \operatorname{MSE}_\theta(\delta)=\operatorname{Var}_\theta(\delta) MSE θ ( δ ) = Var θ ( δ ) である。
証明. b θ = E θ [ δ ] − τ ( θ ) b_\theta=E_\theta[\delta]-\tau(\theta) b θ = E θ [ δ ] − τ ( θ ) と置き、誤差を
δ − τ ( θ ) = { δ − E θ [ δ ] } + b θ \delta-\tau(\theta)
=\{\delta-E_\theta[\delta]\}+b_\theta δ − τ ( θ ) = { δ − E θ [ δ ]} + b θ と分解する。二乗して期待値を取ると、交差項の期待値は
2 b θ E θ [ δ − E θ [ δ ] ] = 0 2b_\theta E_\theta[\delta-E_\theta[\delta]]=0 2 b θ E θ [ δ − E θ [ δ ]] = 0 である。残る二項はそれぞれVar θ ( δ ) \operatorname{Var}_\theta(\delta) Var θ ( δ ) とb θ 2 b_\theta^2 b θ 2 であるから、主張を得る。▨
この分解により、偏りを導入して分散を減らした推定量が、不偏推定量より小さな平均二乗誤差をもつ場合がある。次の例では、この比較を同じ形の推定量族の中で行う。
例 2.4. n ≥ 2 n\geq2 n ≥ 2 とし、X 1 , … , X n X_1,\ldots,X_n X 1 , … , X n をN ( μ , σ 2 ) N(\mu,\sigma^2) N ( μ , σ 2 ) からの独立同分布標本とする。ただし、μ ∈ R \mu\in\R μ ∈ R とσ 2 > 0 \sigma^2>0 σ 2 > 0 はともに未知である。
X ‾ = 1 n ∑ i = 1 n X i , Q = ∑ i = 1 n ( X i − X ‾ ) 2 \overline X=\frac1n\sum_{i=1}^nX_i,
\qquad
Q=\sum_{i=1}^n(X_i-\overline X)^2 X = n 1 i = 1 ∑ n X i , Q = i = 1 ∑ n ( X i − X ) 2 と置く。§E14.3 定理 4.1 とカイ二乗分布の積率により
Q σ 2 ∼ χ n − 1 2 , E μ , σ 2 [ Q ] = ( n − 1 ) σ 2 , Var μ , σ 2 ( Q ) = 2 ( n − 1 ) σ 4 \frac Q{\sigma^2}\sim\chi^2_{n-1},\qquad
E_{\mu,\sigma^2}[Q]=(n-1)\sigma^2,\qquad
\operatorname{Var}_{\mu,\sigma^2}(Q)=2(n-1)\sigma^4 σ 2 Q ∼ χ n − 1 2 , E μ , σ 2 [ Q ] = ( n − 1 ) σ 2 , Var μ , σ 2 ( Q ) = 2 ( n − 1 ) σ 4 である。
c > 0 c>0 c > 0 に対してδ c = Q / c \delta_c=Q/c δ c = Q / c と置く。このとき
Bias μ , σ 2 ( δ c ) = ( n − 1 c − 1 ) σ 2 , Var μ , σ 2 ( δ c ) = 2 ( n − 1 ) c 2 σ 4 \operatorname{Bias}_{\mu,\sigma^2}(\delta_c)
=\left(\frac{n-1}{c}-1\right)\sigma^2,
\qquad
\operatorname{Var}_{\mu,\sigma^2}(\delta_c)
=\frac{2(n-1)}{c^2}\sigma^4 Bias μ , σ 2 ( δ c ) = ( c n − 1 − 1 ) σ 2 , Var μ , σ 2 ( δ c ) = c 2 2 ( n − 1 ) σ 4 である。したがって命題 2.3 により
MSE μ , σ 2 ( δ c ) = σ 4 c 2 { 2 ( n − 1 ) + ( n − 1 − c ) 2 } . \operatorname{MSE}_{\mu,\sigma^2}(\delta_c)
=\frac{\sigma^4}{c^2}\left\{2(n-1)+(n-1-c)^2\right\}. MSE μ , σ 2 ( δ c ) = c 2 σ 4 { 2 ( n − 1 ) + ( n − 1 − c ) 2 } . m = n − 1 m=n-1 m = n − 1 と置けば、σ − 4 MSE μ , σ 2 ( δ c ) \sigma^{-4}\operatorname{MSE}_{\mu,\sigma^2}(\delta_c) σ − 4 MSE μ , σ 2 ( δ c ) のc c c による導関数は
2 m { c − ( m + 2 ) } c 3 \frac{2m\{c-(m+2)\}}{c^3} c 3 2 m { c − ( m + 2 )} である。この導関数は0 < c < m + 2 0<c<m+2 0 < c < m + 2 で負、c > m + 2 c>m+2 c > m + 2 で正であるから、Q / c Q/c Q / c という推定量族の中ではc = n + 1 c=n+1 c = n + 1 が MSE を一意に最小にする。
§E14.7 命題 1.7 により、Q / n Q/n Q / n は未知の平均と分散をもつ正規モデルにおける分散の最尤推定量とほとんど確実に等しい。
n = 10 n=10 n = 10 、σ 2 = 1 \sigma^2=1 σ 2 = 1 の場合には次の値を得る。
推定量
除数c c c
偏り
偏りの二乗
分散
MSE
Q / ( n − 1 ) Q/(n-1) Q / ( n − 1 ) (不偏)
9 9 9
0 0 0
0 0 0
2 / 9 ≈ 0.2222 2/9\approx0.2222 2/9 ≈ 0.2222
0.2222 0.2222 0.2222
σ ^ M L 2 \widehat\sigma^2_{\mathrm{ML}} σ ML 2 (Q / n Q/n Q / n とほとんど確実に等しい)
10 10 10
− 0.1 -0.1 − 0.1
0.01 0.01 0.01
0.18 0.18 0.18
0.19 0.19 0.19
Q / ( n + 1 ) Q/(n+1) Q / ( n + 1 )
11 11 11
− 2 / 11 ≈ − 0.1818 -2/11\approx-0.1818 − 2/11 ≈ − 0.1818
4 / 121 ≈ 0.03306 4/121\approx0.03306 4/121 ≈ 0.03306
18 / 121 ≈ 0.14876 18/121\approx0.14876 18/121 ≈ 0.14876
2 / 11 ≈ 0.18182 2/11\approx0.18182 2/11 ≈ 0.18182
Q / n Q/n Q / n についてはE [ Q / n ] = 0.9 E[Q/n]=0.9 E [ Q / n ] = 0.9 であり、その MSE は( 2 n − 1 ) / n 2 = 19 / 100 = 0.19 (2n-1)/n^2=19/100=0.19 ( 2 n − 1 ) / n 2 = 19/100 = 0.19 である。Q / ( n + 1 ) Q/(n+1) Q / ( n + 1 ) は、不偏推定量Q / ( n − 1 ) Q/(n-1) Q / ( n − 1 ) と最尤推定量にほとんど確実に等しいQ / n Q/n Q / n のいずれよりも小さな MSE をもつ。この比較はQ / c Q/c Q / c という族の中での比較であり、すべての推定量の中でQ / ( n + 1 ) Q/(n+1) Q / ( n + 1 ) が MSE を最小にするとは主張していない。
3 一致性
定義 3.1. 各n ∈ N ≥ 1 n\in\NN n ∈ N ≥ 1 について、( X n , A n ) (\mathcal X_n,\mathcal A_n) ( X n , A n ) 上の統計モデル( P θ ( n ) ) θ ∈ Θ (P_\theta^{(n)})_{\theta\in\Theta} ( P θ ( n ) ) θ ∈ Θ と、実数値推定量δ n : X n → R \delta_n:\mathcal X_n\to\R δ n : X n → R を考える。推定量列( δ n ) (\delta_n) ( δ n ) が実数値推定対象τ : Θ → R \tau:\Theta\to\R τ : Θ → R の 一致推定量 (consistent estimator ) であるとは、すべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ とすべてのε > 0 \varepsilon>0 ε > 0 について
P θ ( n ) ( ∣ δ n − τ ( θ ) ∣ > ε ) ⟶ 0 P_\theta^{(n)}\!\left(|\delta_n-\tau(\theta)|>\varepsilon\right)
\longrightarrow0 P θ ( n ) ( ∣ δ n − τ ( θ ) ∣ > ε ) ⟶ 0 となることをいう。この収束をδ n → P θ τ ( θ ) \delta_n\xrightarrow{P_\theta}\tau(\theta) δ n P θ τ ( θ ) と書く。
一致性はすべての母数について要求される。固定したθ 0 ∈ Θ \theta_0\in\Theta θ 0 ∈ Θ に対して定数推定量δ n = τ ( θ 0 ) \delta_n=\tau(\theta_0) δ n = τ ( θ 0 ) を用いれば、θ 0 \theta_0 θ 0 では誤差が常に零になる。しかし、τ ( θ ) ≠ τ ( θ 0 ) \tau(\theta)\ne\tau(\theta_0) τ ( θ ) = τ ( θ 0 ) を満たす母数θ \theta θ が存在する場合、この推定量列はその母数では一致しないため、モデル上の一致推定量ではない。推定対象が定数関数ならば、この定数推定量列はモデル上でも一致する。
命題 3.2. 各n ∈ N ≥ 1 n\in\NN n ∈ N ≥ 1 について実数値推定量δ n \delta_n δ n を考える。すべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ について
MSE θ ( δ n ) = E θ ( n ) [ ( δ n − τ ( θ ) ) 2 ] ⟶ 0 \operatorname{MSE}_\theta(\delta_n)
=E_\theta^{(n)}\!\left[(\delta_n-\tau(\theta))^2\right]
\longrightarrow0 MSE θ ( δ n ) = E θ ( n ) [ ( δ n − τ ( θ ) ) 2 ] ⟶ 0 であるとする。このとき( δ n ) (\delta_n) ( δ n ) はτ \tau τ の一致推定量である。
証明. θ ∈ Θ \theta\in\Theta θ ∈ Θ とε > 0 \varepsilon>0 ε > 0 を固定し、非負確率変数( δ n − τ ( θ ) ) 2 (\delta_n-\tau(\theta))^2 ( δ n − τ ( θ ) ) 2 に§E11.4 定理 3.1 を適用する。すると
P θ ( n ) ( ∣ δ n − τ ( θ ) ∣ > ε ) ≤ P θ ( n ) ( ( δ n − τ ( θ ) ) 2 ≥ ε 2 ) ≤ MSE θ ( δ n ) ε 2 P_\theta^{(n)}\!\left(|\delta_n-\tau(\theta)|>\varepsilon\right)
\leq
P_\theta^{(n)}\!\left((\delta_n-\tau(\theta))^2\geq\varepsilon^2\right)
\leq\frac{\operatorname{MSE}_\theta(\delta_n)}{\varepsilon^2} P θ ( n ) ( ∣ δ n − τ ( θ ) ∣ > ε ) ≤ P θ ( n ) ( ( δ n − τ ( θ ) ) 2 ≥ ε 2 ) ≤ ε 2 MSE θ ( δ n ) を得る。右辺は仮定により零へ収束する。θ \theta θ とε \varepsilon ε は任意であるから、定義 3.1 の条件が成り立つ。▨
分散が有限な独立同分布標本の標本平均X ‾ n \overline X_n X n は母平均μ \mu μ の不偏推定量であり、分散はσ 2 / n \sigma^2/n σ 2 / n である。したがって各母集団分布の下でX ‾ n \overline X_n X n の MSE はσ 2 / n → 0 \sigma^2/n\to0 σ 2 / n → 0 であり、命題 3.2 によって母平均に一致する。この結論は弱大数の法則§E14.2 定理 4.1 と同じ確率収束を与える。
一方、σ 2 > 0 \sigma^2>0 σ 2 > 0 を既知とし、各n n n についてN ( μ , σ 2 ) N(\mu,\sigma^2) N ( μ , σ 2 ) からの独立同分布標本の第一観測だけを用いてδ n = X 1 \delta_n=X_1 δ n = X 1 と置く。この推定量列はすべてのμ ∈ R \mu\in\R μ ∈ R について不偏である。Z ∼ N ( 0 , σ 2 ) Z\sim N(0,\sigma^2) Z ∼ N ( 0 , σ 2 ) とすれば、任意のε > 0 \varepsilon>0 ε > 0 について
P μ ( ∣ δ n − μ ∣ > ε ) = P ( ∣ Z ∣ > ε ) > 0 P_\mu(|\delta_n-\mu|>\varepsilon)
=P(|Z|>\varepsilon)>0 P μ ( ∣ δ n − μ ∣ > ε ) = P ( ∣ Z ∣ > ε ) > 0
であり、右辺はn n n によらない。したがって( δ n ) (\delta_n) ( δ n ) はμ \mu μ の一致推定量ではない。不偏性だけでは一致性は従わない。
正規標本分散の例では、Q n / n Q_n/n Q n / n の偏りは− σ 2 / n -\sigma^2/n − σ 2 / n 、分散は2 ( n − 1 ) σ 4 / n 2 2(n-1)\sigma^4/n^2 2 ( n − 1 ) σ 4 / n 2 である。したがって
MSE μ , σ 2 ( Q n / n ) = 2 n − 1 n 2 σ 4 ⟶ 0 \operatorname{MSE}_{\mu,\sigma^2}(Q_n/n)
=\frac{2n-1}{n^2}\sigma^4
\longrightarrow0 MSE μ , σ 2 ( Q n / n ) = n 2 2 n − 1 σ 4 ⟶ 0
となり、有限標本では偏っていてもσ 2 \sigma^2 σ 2 に一致する。固定した標本サイズでの不偏性と、標本サイズを増やしたときの一致性は異なる性質である。
4 精度比較への接続
有限標本の不偏推定量は、§E14.9 定理 2.1 による十分統計量での分散改善、§E14.10 定理 2.2 による完備十分統計量の関数としての一意性、または§E14.12 定理 2.1 による正則な支配モデルでの分散下界によって比較する。台が母数とともに変わるモデルでは、Cramér–Rao の不等式の正則条件を個別に確認する必要がある。
大標本では、§E14.13 定理 3.1 が一致する尤度方程式解の正規極限を与えるため、極限分布と漸近分散を比較する。この結論は有限標本における正規近似の精度を自動的には与えない。