§E14.17尤度に基づく検定の漸近論

最終更新

尤度比検定は、帰無仮説の下で許される最大尤度と、母数空間全体での最大尤度とを比較する。正規平均の検定のように有限標本で統計量の分布を求めることができる場合もあるが、一般の多母数モデルでは帰無分布がモデルごとに異なり、その分布を明示することができるとは限らない。

指定した棄却確率に対応する閾値を正確に計算するためには、帰無仮説の下での統計量の分布が必要になる。さらに、尤度比統計量、推定値と帰無値の差を測る Wald 統計量、および制約付き推定量での score 統計量は有限標本では異なるため、一つの統計量の性質から他の統計量を直接評価することもできない。

一致する制約付き・無制約の最尤推定量が得られる正則な独立同分布モデルでは、標本サイズが増えると三つの統計量は同じ二次形式で近似され、帰無仮説の余次元を自由度とするカイ二乗分布へ収束する。Wilks の定理は、この極限が局所座標の選び方によらず、滑らかな帰無部分多様体にも成り立つことを示す。尤度に基づく検定の漸近論は、有限標本分布を明示することができないモデルにも検定と信頼領域を与える最も基本的な一般理論の一つである。

本記事では、尤度に基づく検定の漸近的な性質と、その代表的な応用について解説する。

1 情報行列と制約付き推定量

補題 1.1.q,r∈N≥1q,r\in\NNとし、実対称正定値行列IIを

I=(ABB⊤C),A∈Rq×q,C∈Rr×rI=\begin{pmatrix}A&B\\B^\top&C\end{pmatrix}, \qquad A\in\R^{q\times q},\quad C\in\R^{r\times r}

と分ける。AAと Schur 補行列S=C−B⊤A−1BS=C-B^\top A^{-1}Bは正定値であり、(I−1)22=S−1(I^{-1})_{22}=S^{-1}である。d=(d1,d2)∈Rq×Rrd=(d_1,d_2)\in\R^q\times\R^rとv=d2−B⊤A−1d1v=d_2-B^\top A^{-1}d_1に対して

(I−1d)2=S−1v,d⊤I−1d−d1⊤A−1d1=v⊤S−1v(I^{-1}d)_2=S^{-1}v,\qquad d^\top I^{-1}d-d_1^\top A^{-1}d_1=v^\top S^{-1}v

が成り立つ。

証明. 証明は演習とする(問題 5.1)。▨

補題 1.2.p=q+rp=q+r、q,r∈N≥1q,r\in\NNとし、Θ⊆Rq×Rr\Theta\subseteq\R^q\times\R^rを開集合とする。独立同分布モデルがθ0=(η0,ζ0)∈Θ\theta_0=(\eta_0,\zeta_0)\in\Thetaにおける局所 Cramér 条件§E14.13 定義 1.1を満たすとする。Un=∇ℓnU_n=\nabla\ell_n、Jn=−∇2ℓn/nJ_n=-\nabla^2\ell_n/nとおき、真値での情報行列と正規化した score を

I0=(ABB⊤C),Δn=Un(θ0)n=(Δn,1Δn,2),Vn=Δn,2−B⊤A−1Δn,1I_0=\begin{pmatrix}A&B\\B^\top&C\end{pmatrix},\qquad \Delta_n=\frac{U_n(\theta_0)}{\sqrt n} =\begin{pmatrix}\Delta_{n,1}\\\Delta_{n,2}\end{pmatrix},\qquad V_n=\Delta_{n,2}-B^\top A^{-1}\Delta_{n,1}

と書く。θ~n=(η~n,ζ0)∈Θ\widetilde\theta_n=(\widetilde\eta_n,\zeta_0)\in\Thetaが可測で、θ~n→Pθ0θ0\widetilde\theta_n\xrightarrow{P_{\theta_0}}\theta_0、かつ確率が1へ収束する事象上でUn,1(θ~n)=0U_{n,1}(\widetilde\theta_n)=0であると仮定する。このとき

n(η~n−η0)=A−1Δn,1+oPθ0(1),Un,2(θ~n)n=Vn+oPθ0(1).\sqrt n(\widetilde\eta_n-\eta_0) =A^{-1}\Delta_{n,1}+o_{P_{\theta_0}}(1),\qquad \frac{U_{n,2}(\widetilde\theta_n)}{\sqrt n} =V_n+o_{P_{\theta_0}}(1).

さらにS=C−B⊤A−1BS=C-B^\top A^{-1}BとするとVn⇒Nr(0,S)V_n\Rightarrow N_r(0,S)である。局所微分が定義されない標本では score を零に補完する。

証明.η↦p(η,ζ0)\eta\mapsto p_{(\eta,\zeta_0)}を開集合{η:(η,ζ0)∈Θ}\{\eta:(\eta,\zeta_0)\in\Theta\}上で考える。この部分モデルの score と Hessian は元の対応する成分であり、微分積分交換と三階優関数の条件を継承する。情報行列AAは補題 1.1によって正定値である。したがって部分モデルに§E14.13 定理 3.1を適用すると、η~n\widetilde\eta_nの表示を得る。

h~n=n(θ~n−θ0)\widetilde h_n=\sqrt n(\widetilde\theta_n-\theta_0)とおく。この列は確率有界であり、最後のrr成分は零である。θ~n\widetilde\theta_nが局所閉球に入る事象上で、score の線分積分は

Un(θ~n)n=Δn−{∫01Jn(θ0+t(θ~n−θ0)) dt}h~n\frac{U_n(\widetilde\theta_n)}{\sqrt n} =\Delta_n- \left\{\int_0^1J_n\bigl(\theta_0+t(\widetilde\theta_n-\theta_0)\bigr)\,dt\right\}\widetilde h_n

を与える。積分行列は§E14.13 補題 1.3 (3)によりI0I_0へ確率収束する。確率有界な列とoP(1)o_P(1)の積はoP(1)o_P(1)であるから、最後のrr成分を取れば残存する score の表示を得る。

§E14.13 補題 1.3 (1)によりΔn⇒Np(0,I0)\Delta_n\Rightarrow N_p(0,I_0)である。線形写像(d1,d2)↦d2−B⊤A−1d1(d_1,d_2)\mapsto d_2-B^\top A^{-1}d_1を適用すると、正規極限の共分散は

C−B⊤A−1B−B⊤A−1B+B⊤A−1AA−1B=SC-B^\top A^{-1}B-B^\top A^{-1}B +B^\top A^{-1}AA^{-1}B=S

となる。正規ベクトルの特徴づけ§E11.10 定理 4.2から結論を得る。▨

2 座標を固定する帰無仮説

命題 2.1.Θ⊆Rp\Theta\subseteq\R^pを空でない開集合、Θ0⊆Θ\Theta_0\subseteq\Thetaを空でない Borel 集合とする。共通正台SSをもつ密度族について、各x∈Sx\in Sで0<pθ(x)<∞0<p_\theta(x)<\inftyかつθ↦pθ(x)\theta\mapsto p_\theta(x)がΘ\Theta上で連続であると仮定する。標本に対して

Ln=sup⁡θ∈Θℓn(θ),Ln,0=sup⁡θ∈Θ0ℓn(θ)L_n=\sup_{\theta\in\Theta}\ell_n(\theta),\qquad L_{n,0}=\sup_{\theta\in\Theta_0}\ell_n(\theta)

は拡張実数値の可測関数である。An=Sn∩{Ln<∞}A_n=S^n\cap\{L_n<\infty\}とおき、AnA_n上で

Dn=2(Ln−Ln,0)=−2log⁡Λn,Λn=sup⁡θ∈Θ0∏ipθ(Xi)sup⁡θ∈Θ∏ipθ(Xi)D_n=2(L_n-L_{n,0})=-2\log\Lambda_n,\qquad \Lambda_n=\frac{\sup_{\theta\in\Theta_0}\prod_i p_\theta(X_i)} {\sup_{\theta\in\Theta}\prod_i p_\theta(X_i)}

とおく。AncA_n^cではDn=0D_n=0、Λn=1\Lambda_n=1と定めると、DnD_nとΛn\Lambda_nは可測であり、全標本上でDn=−2log⁡ΛnD_n=-2\log\Lambda_nが成り立つ。さらに、すべてのθ∈Θ\theta\in\ThetaについてPθ(An)=1P_\theta(A_n)=1ならば、Λn\Lambda_nは§E14.15 定義 4.1の一般化尤度比統計量である。

証明.Θ\ThetaとΘ0\Theta_0にそれぞれ可算稠密集合D,D0D,D_0を固定する。Euclid 空間の可算基のうち当該集合と交わる各要素から一点ずつ取れば、そのような集合を得る。各標本で対数尤度は母数に関して連続なので、Ln=sup⁡θ∈Dℓn(θ)L_n=\sup_{\theta\in D}\ell_n(\theta)、Ln,0=sup⁡θ∈D0ℓn(θ)L_{n,0}=\sup_{\theta\in D_0}\ell_n(\theta)である。各母数で対数尤度は可測であるから、両上限とAnA_nは可測である。SnS^n上では各固定母数の対数尤度が有限なので、−∞<Ln,0≤Ln-\infty<L_{n,0}\leq L_nである。したがってAnA_n上で差は有限かつ非負であり、補完後のDnD_nは非負実数値の可測関数である。AnA_n上では尤度の二つの上限がそれぞれeLn,0e^{L_{n,0}}とeLne^{L_n}なので、表示した比はe−Dn/2e^{-D_n/2}に等しい。AncA_n^cでも補完値によりΛn=e−Dn/2=1\Lambda_n=e^{-D_n/2}=1であるから、Λn\Lambda_nも可測である。

すべてのθ\thetaについてPθ(An)=1P_\theta(A_n)=1ならば、AnA_nは全母数に共通する確率一集合である。AnA_n上では無制約尤度の上限eLne^{L_n}が有限正であり、上限の可測性も既に示したので、§E14.15 定義 4.1の条件を満たす。▨

定理 2.2.Θ⊆Rp\Theta\subseteq\R^pを空でない開集合、1≤r≤p1\leq r\leq pとし、θ=(η,ζ)\theta=(\eta,\zeta)、ζ∈Rr\zeta\in\R^rと書く。帰無母数集合をΘ0={(η,ζ0)∈Θ}\Theta_0=\{(\eta,\zeta_0)\in\Theta\}とする。r=pr=pではΘ0={θ0}\Theta_0=\{\theta_0\}とする。独立同分布モデルが命題 2.1の連続性と共通正台の仮定、および固定したθ0∈Θ0\theta_0\in\Theta_0における局所 Cramér 条件を満たすと仮定する。

未知母数によらない可測推定量列θ^n∈Θ\widehat\theta_n\in\Theta、θ~n∈Θ0\widetilde\theta_n\in\Theta_0が存在し、両者がPθ0P_{\theta_0}の下でθ0\theta_0へ確率収束するとする。さらに

Pθ0(ℓn(θ^n)=Ln<∞,ℓn(θ~n)=Ln,0)⟶1P_{\theta_0}\bigl( \ell_n(\widehat\theta_n)=L_n<\infty,\quad \ell_n(\widetilde\theta_n)=L_{n,0}\bigr)\longrightarrow1

と仮定する。すなわち、両推定量は確率が1へ収束する事象上で、それぞれ無制約・制約付きの大域最尤推定量である。このとき尤度比統計量は

Dn⇒χr2D_n\Rightarrow\chi^2_r

を満たす。より正確には、r<pr<pでは補題 1.2の記号を用いてDn=Vn⊤S−1Vn+oPθ0(1)D_n=V_n^\top S^{-1}V_n+o_{P_{\theta_0}}(1)であり、r=pr=pではDn=Δn⊤I0−1Δn+oPθ0(1)D_n=\Delta_n^\top I_0^{-1}\Delta_n+o_{P_{\theta_0}}(1)である。

証明. 一致性と上限達成の仮定によって、確率が1へ収束する事象上で両推定量は局所領域に入り、Un(θ^n)=0U_n(\widehat\theta_n)=0である。r<pr<pならば制約付き最大点はη\etaの開母数空間の内点なので、Un,1(θ~n)=0U_{n,1}(\widetilde\theta_n)=0でもある。

h^n=n(θ^n−θ0)\widehat h_n=\sqrt n(\widehat\theta_n-\theta_0)とおく。§E14.13 定理 3.1によりh^n=I0−1Δn+oP(1)\widehat h_n=I_0^{-1}\Delta_n+o_P(1)である。r<pr<pの場合、補題 1.2により

h~n=n(θ~n−θ0)=(A−1Δn,10)+oP(1).\widetilde h_n=\sqrt n(\widetilde\theta_n-\theta_0) =\begin{pmatrix}A^{-1}\Delta_{n,1}\\0\end{pmatrix}+o_P(1).

両列は確率有界であるから、§E14.13 命題 3.3にそれぞれ代入すると

2{ℓn(θ^n)−ℓn(θ0)}=Δn⊤I0−1Δn+oP(1),2{ℓn(θ~n)−ℓn(θ0)}=Δn,1⊤A−1Δn,1+oP(1).\begin{aligned} 2\{\ell_n(\widehat\theta_n)-\ell_n(\theta_0)\} &=\Delta_n^\top I_0^{-1}\Delta_n+o_P(1),\\ 2\{\ell_n(\widetilde\theta_n)-\ell_n(\theta_0)\} &=\Delta_{n,1}^\top A^{-1}\Delta_{n,1}+o_P(1). \end{aligned}

ここで線形表示の誤差を代入して生じる項は、確率有界なΔn\Delta_nとoP(1)o_P(1)の積、またはoP(1)o_P(1)の二次式であるため、いずれもoP(1)o_P(1)である。上限達成事象上で二式の差はDnD_nに等しい。補題 1.1によって

Dn=Vn⊤S−1Vn+oP(1)D_n=V_n^\top S^{-1}V_n+o_P(1)

を得る。

Vn⇒Nr(0,S)V_n\Rightarrow N_r(0,S)であり、SSは正定値である。正規ベクトルの特徴づけにより極限ベクトルの分布はS1/2GS^{1/2}G、G∼Nr(0,Ir)G\sim N_r(0,I_r)の分布と等しい。したがって、連続写像定理と Slutsky の定理によって

Vn⊤S−1Vn+oP(1)⇒G⊤G∼χr2.V_n^\top S^{-1}V_n+o_P(1) \Rightarrow G^\top G\sim\chi^2_r.

最後の同定は、独立標準正規変数の平方和によるカイ二乗分布の定義§E14.3 定義 2.2 (1)による。

r=pr=pの場合はθ~n=θ0\widetilde\theta_n=\theta_0であり、制約付き尤度差は零である。無制約の二次展開だけからDn=Δn⊤I0−1Δn+oP(1)D_n=\Delta_n^\top I_0^{-1}\Delta_n+o_P(1)を得る。Δn⇒Np(0,I0)\Delta_n\Rightarrow N_p(0,I_0)へ上の正規二次形式の計算を適用するとχp2\chi^2_p極限が従う。▨

定義 2.3 (Wald 統計量と score 統計量).Θ⊆Rp\Theta\subseteq\R^pを開集合、1≤r≤p1\leq r\leq pとし、θ=(η,ζ)\theta=(\eta,\zeta)、ζ∈Rr\zeta\in\R^rと書く。帰無仮説はζ=ζ0\zeta=\zeta_0とする。可測な無制約・制約付き推定量をθ^n\widehat\theta_n、θ~n\widetilde\theta_nとし、J^n=Jn(θ^n)\widehat J_n=J_n(\widehat\theta_n)、J~n=Jn(θ~n)\widetilde J_n=J_n(\widetilde\theta_n)とおく。

  1. J^n\widehat J_nが定義され正定値であるとき、Wald 統計量 (Wald statistic) を Wn=n(ζ^n−ζ0)⊤[(J^n−1)22]−1(ζ^n−ζ0)W_n=n(\widehat\zeta_n-\zeta_0)^\top \bigl[(\widehat J_n^{-1})_{22}\bigr]^{-1} (\widehat\zeta_n-\zeta_0) と定める。r=pr=pでは右下の部分行列は全行列である。
  2. J~n\widetilde J_nが定義され正定値であり、Un(θ~n)U_n(\widetilde\theta_n)が定義されるとき、score 統計量 (score statistic) を Rn=1nUn(θ~n)⊤J~n−1Un(θ~n)R_n=\frac1nU_n(\widetilde\theta_n)^\top \widetilde J_n^{-1}U_n(\widetilde\theta_n) と定める。

各表示式の条件を満たさない標本では、対応する統計量を零と定める。観測に関して可測で、母数に関して連続な微分の版を用いると、両統計量は可測である。

定理 2.4.Θ⊆Rp\Theta\subseteq\R^pを開集合、1≤r≤p1\leq r\leq pとし、独立同分布モデルが固定したθ0=(η0,ζ0)\theta_0=(\eta_0,\zeta_0)で局所 Cramér 条件を満たすとする。可測な一致推定量θ^n∈Θ\widehat\theta_n\in\Theta、θ~n∈{(η,ζ0)∈Θ}\widetilde\theta_n\in\{(\eta,\zeta_0)\in\Theta\}が、確率が1へ収束する事象上で

Un(θ^n)=0,Un,1(θ~n)=0U_n(\widehat\theta_n)=0,\qquad U_{n,1}(\widetilde\theta_n)=0

を満たすと仮定する。r=pr=pでは第二の条件をθ~n=θ0\widetilde\theta_n=\theta_0に置き換える。このとき定義 2.3の統計量は

Wn⇒χr2,Rn⇒χr2,Wn−Rn→Pθ00W_n\Rightarrow\chi^2_r,\qquad R_n\Rightarrow\chi^2_r, \qquad W_n-R_n\xrightarrow{P_{\theta_0}}0

を満たす。さらに定理 2.2の大域上限達成の仮定も満たせば、Wn−Dn→Pθ00W_n-D_n\xrightarrow{P_{\theta_0}}0、Rn−Dn→Pθ00R_n-D_n\xrightarrow{P_{\theta_0}}0である。

証明.§E14.13 補題 1.3 (3)によって、J^n\widehat J_nとJ~n\widetilde J_nはI0I_0へ確率収束する。I0I_0の最小固有値をλ>0\lambda>0とすると、∥J−I0∥op<λ/2\|J-I_0\|_{\mathrm{op}}<\lambda/2ならば対称行列JJは正定値である。さらに∥Ip−I0−1J∥op<1/2\|I_p-I_0^{-1}J\|_{\mathrm{op}}<1/2では§E4.7 補題 1.1により∥J−1∥op≤2∥I0−1∥op\|J^{-1}\|_{\mathrm{op}}\leq2\|I_0^{-1}\|_{\mathrm{op}}であり、

J−1−I0−1=J−1(I0−J)I0−1J^{-1}-I_0^{-1}=J^{-1}(I_0-J)I_0^{-1}

から逆行列もI0−1I_0^{-1}へ確率収束する。したがって、各統計量を零へ補完する事象の確率は00へ収束する。

r<pr<pとし、補題 1.2のS,VnS,V_nを用いる。無制約の線形表示と補題 1.1から

n(ζ^n−ζ0)=S−1Vn+oP(1),[(J^n−1)22]−1→PS\sqrt n(\widehat\zeta_n-\zeta_0)=S^{-1}V_n+o_P(1),\qquad \bigl[(\widehat J_n^{-1})_{22}\bigr]^{-1}\xrightarrow{P}S

である。第二の収束には、正定値行列S−1S^{-1}の近傍に上の逆行列の評価を適用した。したがってWn=Vn⊤S−1Vn+oP(1)W_n=V_n^\top S^{-1}V_n+o_P(1)である。

制約付きの score は

Un(θ~n)n=(0Vn)+oP(1)\frac{U_n(\widetilde\theta_n)}{\sqrt n} =\begin{pmatrix}0\\V_n\end{pmatrix}+o_P(1)

であるから、(I0−1)22=S−1(I_0^{-1})_{22}=S^{-1}によりRn=Vn⊤S−1Vn+oP(1)R_n=V_n^\top S^{-1}V_n+o_P(1)を得る。両統計量の極限と差についての結論は、座標固定尤度比の証明中の正規二次形式の同定から従う。

r=pr=pの場合にはn(θ^n−θ0)=I0−1Δn+oP(1)\sqrt n(\widehat\theta_n-\theta_0)=I_0^{-1}\Delta_n+o_P(1)とUn(θ~n)/n=ΔnU_n(\widetilde\theta_n)/\sqrt n=\Delta_nを直接代入する。両統計量はΔn⊤I0−1Δn+oP(1)\Delta_n^\top I_0^{-1}\Delta_n+o_P(1)となる。大域最大化の条件がある場合は、いずれの次元でも定理 2.2のDnD_nの表示と引き算すればよい。▨

例 2.5.Xi=(Xi1,Xi2)⊤X_i=(X_{i1},X_{i2})^\topが独立にN2((η,ζ)⊤,Σ)N_2((\eta,\zeta)^\top,\Sigma)に従い、既知の共分散行列が

Σ=(accb),a,b>0,ab−c2>0\Sigma=\begin{pmatrix}a&c\\c&b\end{pmatrix},\qquad a,b>0,\quad ab-c^2>0

であるとする。帰無仮説をζ=ζ0\zeta=\zeta_0とする。平方完成によって大域最尤推定量は

θ^n=(X‾n,1,X‾n,2),θ~n=(X‾n,1−cb(X‾n,2−ζ0),ζ0)\widehat\theta_n=(\overline X_{n,1},\overline X_{n,2}),\qquad \widetilde\theta_n= \left(\overline X_{n,1}-\frac cb(\overline X_{n,2}-\zeta_0),\zeta_0\right)

である。帰無仮説の下で、両推定量は真値(η0,ζ0)(\eta_0,\zeta_0)へ確率収束する。制約によって、自由な母数η\etaの推定値も変わる。

このモデルではI=Jn=Σ−1I=J_n=\Sigma^{-1}であり、情報行列を(η,ζ)(\eta,\zeta)に分けると

A=bab−c2,B=−cab−c2,S=1b.A=\frac b{ab-c^2},\quad B=-\frac c{ab-c^2},\quad S=\frac1b.

帰無真値を(η0,ζ0)(\eta_0,\zeta_0)とすると、有効 score はVn=n(X‾n,2−ζ0)/bV_n=\sqrt n(\overline X_{n,2}-\zeta_0)/bである。対数尤度は厳密な二次式なので、三統計量はすべて

Dn=Wn=Rn=n(X‾n,2−ζ0)2bD_n=W_n=R_n=\frac{n(\overline X_{n,2}-\zeta_0)^2}{b}

に等しい。n(X‾n,2−ζ0)/b∼N(0,1)\sqrt n(\overline X_{n,2}-\zeta_0)/\sqrt b\sim N(0,1)であるから、この例では任意の標本サイズでχ12\chi^2_1に従う。

3 滑らかな帰無部分多様体

定義 3.1 (帰無部分多様体).Θ⊆Rp\Theta\subseteq\R^pを開集合、1≤r≤p1\leq r\leq pとする。空でない Borel 集合Θ0⊆Θ\Theta_0\subseteq\Thetaが余次元rrのC3C^3級の帰無部分多様体 (null submanifold) であるとは、任意のθ0∈Θ0\theta_0\in\Theta_0に対し、開近傍G⊆ΘG\subseteq\ThetaとC3C^3級写像g:G→Rrg:G\to\R^rが存在して

Θ0∩G={θ∈G:g(θ)=0},rank⁡Dg(θ0)=r\Theta_0\cap G=\{\theta\in G:g(\theta)=0\},\qquad \operatorname{rank}Dg(\theta_0)=r

を満たすことをいう。

補題 3.2.Θ0⊆Θ⊆Rp\Theta_0\subseteq\Theta\subseteq\R^pが余次元rrのC3C^3級帰無部分多様体であり、θ0∈Θ0\theta_0\in\Theta_0とする。r<pr<pならば、母数の座標を並べ替えた後、θ0\theta_0の開近傍GGと開集合B⊆Rp−r×RrB\subseteq\R^{p-r}\times\R^rの間のC3C^3級微分同相

Φ:G⟶B,Φ(θ)=(η,g(θ))\Phi:G\longrightarrow B,\qquad \Phi(\theta)=(\eta,g(\theta))

が存在し、Φ(Θ0∩G)=B∩{(u,z):z=0}\Phi(\Theta_0\cap G)=B\cap\{(u,z):z=0\}となる。r=pr=pならば、ある開近傍GGに対しΘ0∩G={θ0}\Theta_0\cap G=\{\theta_0\}である。

証明.r<pr<pのとき、Dg(θ0)Dg(\theta_0)の非零なrr次小行列に対応する座標を最後のrr成分に移す。§E4.8 定理 2.1 (1)によって、Φ=(η,g)\Phi=(\eta,g)は適切な開近傍間でC1C^1級微分同相になる。その逆写像をψ\psiとすると

Dψ=(DΦ∘ψ)−1.D\psi=(D\Phi\circ\psi)^{-1}.

余因子公式§D3.4 定理 7.4により、可逆行列の逆行列の各成分は行列成分の多項式を非零な行列式で割った関数である。一次行列では逆数関数である。したがって逆行列を取る写像は可逆行列上でC∞C^\infty級である。Φ\PhiがC3C^3級、ψ\psiがC1C^1級なので、表示式の右辺はC1C^1級であり、ψ\psiはC2C^2級となる。再び同じ式を使うと右辺はC2C^2級であり、ψ\psiはC3C^3級となる。

r=pr=pのときDg(θ0)Dg(\theta_0)は可逆である。逆関数定理§E4.7 定理 2.1によりggはある開近傍上で単射となる。g(θ0)=0g(\theta_0)=0なので、その近傍での零点はθ0\theta_0だけである。▨

補題 3.3. 密度族pθp_\thetaがθ0∈Θ⊆Rp\theta_0\in\Theta\subseteq\R^pにおける局所 Cramér 条件を満たすとする。開集合間のC3C^3級微分同相ψ:B→G⊆Θ\psi:B\to G\subseteq\Thetaがψ(β0)=θ0\psi(\beta_0)=\theta_0を満たすならば、密度族pψ(β)p_{\psi(\beta)}もβ0\beta_0における局所 Cramér 条件を満たす。K(β)=Dψ(β)K(\beta)=D\psi(\beta)とおくと、変換後の score と真値での情報行列は

Unβ(β)=K(β)⊤Un(ψ(β)),I0β=K(β0)⊤I0K(β0)U_n^\beta(\beta)=K(\beta)^\top U_n(\psi(\beta)),\qquad I_0^\beta=K(\beta_0)^\top I_0K(\beta_0)

である。観測情報は

Jnβ(β)=K(β)⊤Jn(ψ(β))K(β)−1n∑a=1pUn,a(ψ(β))D2ψa(β)J_n^\beta(\beta)=K(\beta)^\top J_n(\psi(\beta))K(\beta) -\frac1n\sum_{a=1}^p U_{n,a}(\psi(\beta))D^2\psi_a(\beta)

を満たす。可測推定量Tn→Pθ0θ0T_n\xrightarrow{P_{\theta_0}}\theta_0に対し、βn=ψ−1(Tn)\beta_n=\psi^{-1}(T_n)を近傍外でβ0\beta_0に補完すればJnβ(βn)→Pθ0I0βJ_n^\beta(\beta_n)\xrightarrow{P_{\theta_0}}I_0^\betaである。

証明.β0\beta_0を中心とする十分小さい閉球K0⊂BK_0\subset Bを取り、その像が元の局所 Cramér 条件の閉球内に入るようにする。ψ\psiの一階から三階までの微分はK0K_0上で有界である。s0(x)=∇ℓ(x,θ0)s_0(x)=\nabla\ell(x,\theta_0)、H0(x)=∇2ℓ(x,θ0)H_0(x)=\nabla^2\ell(x,\theta_0)と書く。元の三階優関数をMMとすると、線分積分によって、元の局所閉球上の一階・二階対数微分の絶対値は、ある定数倍の

N(x)=∥s0(x)∥+∑a,b∣(H0(x))ab∣+M(x)N(x)=\|s_0(x)\|+\sum_{a,b}|(H_0(x))_{ab}|+M(x)

で支配される。Eθ0N(X)<∞E_{\theta_0}N(X)<\inftyである。変換後の三階対数微分は連鎖律により、元の三階微分と三つの一階ψ\psi微分の積、元の二階微分と一階・二階ψ\psi微分の積、および元の一階微分と三階ψ\psi微分の積の有限和である。ゆえにK0K_0上で定数倍のNNを可積分優関数として用いることができる。

真値で変換後の score はK(β0)⊤s0K(\beta_0)^\top s_0であり、二次可積分である。期待値は零で、共分散はI0βI_0^\betaに等しい。K(β0)K(\beta_0)は可逆なのでI0βI_0^\betaは正定値である。Hessian の成分はH0H_0とs0s_0の成分の有限線形結合なので可積分である。密度の微分についても

∂i(p∘ψ)=∑a(∂ap)∂iψa,∂ij(p∘ψ)=∑a,b(∂abp)∂iψa∂jψb+∑a(∂ap)∂ijψa\partial_i(p\circ\psi)=\sum_a(\partial_ap)\partial_i\psi_a, \qquad \partial_{ij}(p\circ\psi) =\sum_{a,b}(\partial_{ab}p)\partial_i\psi_a\partial_j\psi_b +\sum_a(\partial_ap)\partial_{ij}\psi_a

である。β0\beta_0で積分すると、元の一次・二次密度微分の積分はすべて零なので、変換後にも微分積分交換の等式が成り立つ。密度そのものの積分は各β\betaで11である。共通正台と観測に関する可測性も保存され、局所 Cramér 条件を得る。

対数尤度に一階・二階の連鎖律を適用すると、主張の score と観測情報の式を得る。一致点TnT_nが元の局所閉球に入る事象上では

Un(Tn)n=Δnn−{∫01Jn(θ0+t(Tn−θ0)) dt}(Tn−θ0)→P0.\frac{U_n(T_n)}n =\frac{\Delta_n}{\sqrt n} -\left\{\int_0^1J_n(\theta_0+t(T_n-\theta_0))\,dt\right\}(T_n-\theta_0) \xrightarrow{P}0.

ここでは§E14.13 補題 1.3 (3)とΔn\Delta_nの確率有界性を用いた。したがって観測情報の式の第二項は00へ確率収束し、第一項は連続性とJn(Tn)→PI0J_n(T_n)\xrightarrow{P}I_0によりI0βI_0^\betaへ確率収束する。▨

定理 3.4 (Wilks の定理).Θ⊆Rp\Theta\subseteq\R^pを開集合とし、Θ0⊆Θ\Theta_0\subseteq\Thetaを余次元rr、1≤r≤p1\leq r\leq pのC3C^3級帰無部分多様体とする。独立同分布モデルが命題 2.1の仮定と、固定したθ0∈Θ0\theta_0\in\Theta_0における局所 Cramér 条件を満たすとする。可測なΘ\Theta値・Θ0\Theta_0値推定量列θ^n,θ~n\widehat\theta_n,\widetilde\theta_nが存在して両者がθ0\theta_0へ確率収束し、

Pθ0(ℓn(θ^n)=Ln<∞,ℓn(θ~n)=Ln,0)⟶1P_{\theta_0}\bigl( \ell_n(\widehat\theta_n)=L_n<\infty,\quad \ell_n(\widetilde\theta_n)=L_{n,0}\bigr)\longrightarrow1

であると仮定する。このときDn⇒χr2D_n\Rightarrow\chi^2_rである。

さらに、θ0\theta_0の開近傍GG上のC3C^3級写像g:G→Rrg:G\to\R^rがΘ0∩G={g=0}\Theta_0\cap G=\{g=0\}とrank⁡Dg(θ0)=r\operatorname{rank}Dg(\theta_0)=rを満たすとする。J^n=Jn(θ^n)\widehat J_n=J_n(\widehat\theta_n)、J~n=Jn(θ~n)\widetilde J_n=J_n(\widetilde\theta_n)とおくと、

Wng=n g(θ^n)⊤[Dg(θ^n)J^n−1Dg(θ^n)⊤]−1g(θ^n),Rn=1nUn(θ~n)⊤J~n−1Un(θ~n)\begin{aligned} W_n^g&=n\,g(\widehat\theta_n)^\top \bigl[Dg(\widehat\theta_n)\widehat J_n^{-1}Dg(\widehat\theta_n)^\top\bigr]^{-1} g(\widehat\theta_n),\\ R_n&=\frac1nU_n(\widetilde\theta_n)^\top\widetilde J_n^{-1}U_n(\widetilde\theta_n) \end{aligned}

についてWng−Dn→Pθ00W_n^g-D_n\xrightarrow{P_{\theta_0}}0、Rn−Dn→Pθ00R_n-D_n\xrightarrow{P_{\theta_0}}0が成り立ち、両者もχr2\chi^2_rへ分布収束する。各統計量は、必要な推定量がGGの外にあるか、微分が定義されないか、表示式の対称行列が正定値でない標本では零と定める。

証明.r<pr<pとし、補題 3.2のC3C^3座標β=Φ(θ)=(η,g(θ))\beta=\Phi(\theta)=(\eta,g(\theta))と逆写像ψ\psiを取る。β0=Φ(θ0)\beta_0=\Phi(\theta_0)とおく。補題 3.3によって変換後モデルはβ0\beta_0で局所 Cramér 条件を満たす。

両推定量がGGに入る確率は1へ収束する。β^n=Φ(θ^n)\widehat\beta_n=\Phi(\widehat\theta_n)、β~n=Φ(θ~n)\widetilde\beta_n=\Phi(\widetilde\theta_n)を近傍外でβ0\beta_0に補完すると、可測で一致する推定量になる。元の大域上限が達成される事象と両推定量がGGに入る事象の共通部分では、GG上の無制約上限およびG∩Θ0G\cap\Theta_0上の制約付き上限は、それぞれ元のLn,Ln,0L_n,L_{n,0}と等しい。尤度の値は再パラメータ化によって変わらないので、定理 2.2からDn⇒χr2D_n\Rightarrow\chi^2_rを得る。

変換後の観測情報をJ^nβ,J~nβ\widehat J_n^\beta,\widetilde J_n^\betaとし、K=Dψ(β0)K=D\psi(\beta_0)とおく。両者はK⊤I0KK^\top I_0Kへ確率収束する。Dg(θ0)K=(0,Ir)Dg(\theta_0)K=(0,I_r)であるから

Dg(θ0)I0−1Dg(θ0)⊤=[(K⊤I0K)−1]22.Dg(\theta_0)I_0^{-1}Dg(\theta_0)^\top =\bigl[(K^\top I_0K)^{-1}\bigr]_{22}.

両辺は正定値である。n g(θ^n)\sqrt n\,g(\widehat\theta_n)は変換後の一致根の線形表示によって確率有界である。WngW_n^gの中の行列と(J^nβ)−1(\widehat J_n^\beta)^{-1}の右下部分行列は上の同じ正定値行列へ確率収束するため、逆行列の差も00へ確率収束する。したがってWngW_n^gと変換後の座標 Wald 統計量との差はoP(1)o_P(1)である。

またUnβ(β~n)=Dψ(β~n)⊤Un(θ~n)U_n^\beta(\widetilde\beta_n)=D\psi(\widetilde\beta_n)^\top U_n(\widetilde\theta_n)であり、変換後の制約付き score をn\sqrt nで割った列は補題 1.2によって確率有界である。Dψ(β~n)→PKD\psi(\widetilde\beta_n)\to_P Kと可逆性からUn(θ~n)/nU_n(\widetilde\theta_n)/\sqrt nも確率有界である。さらに

Dψ(β~n)(J~nβ)−1Dψ(β~n)⊤→PK(K⊤I0K)−1K⊤=I0−1.D\psi(\widetilde\beta_n)(\widetilde J_n^\beta)^{-1} D\psi(\widetilde\beta_n)^\top \xrightarrow{P}K(K^\top I_0K)^{-1}K^\top=I_0^{-1}.

この行列とJ~n−1\widetilde J_n^{-1}の差はoP(1)o_P(1)なので、変換後の score 統計量とRnR_nの差もoP(1)o_P(1)である。変換後の定理 2.4により残る結論を得る。

r=pr=pでは帰無集合はθ0\theta_0の近傍で一点である。一致性によってθ~n=θ0\widetilde\theta_n=\theta_0となる確率は1へ収束するから、尤度比と score の結論は座標固定定理のr=pr=pの場合に帰着する。G0=Dg(θ0)G_0=Dg(\theta_0)は可逆であり、全微分の剰余と無制約の線形表示から

n g(θ^n)=G0I0−1Δn+oP(1).\sqrt n\,g(\widehat\theta_n)=G_0I_0^{-1}\Delta_n+o_P(1).

これをWngW_n^gへ代入すると、[G0I0−1G0⊤]−1=G0−⊤I0G0−1[G_0I_0^{-1}G_0^\top]^{-1}=G_0^{-\top}I_0G_0^{-1}によりWng=Δn⊤I0−1Δn+oP(1)W_n^g=\Delta_n^\top I_0^{-1}\Delta_n+o_P(1)となる。▨

4 棄却域と漸近信頼領域

系 4.1.0<α<10<\alpha<1とし、定理 3.4の仮定を満たす固定した帰無母数θ0\theta_0を考える。FrF_rをχr2\chi^2_r分布の分布関数、cr,αc_{r,\alpha}をその1−α1-\alpha分位点とする。統計量Dn,Wng,RnD_n,W_n^g,R_nのそれぞれについて、その値がcr,αc_{r,\alpha}より大きいときに棄却する検定の棄却確率は、Pθ0P_{\theta_0}の下でα\alphaへ収束する。また、これらの統計量の一つをTnT_nとすると、p 値の近似

pn=1−Fr(Tn)p_n=1-F_r(T_n)

は、帰無母数θ0\theta_0の下で区間[0,1][0,1]上の一様分布へ分布収束する。

証明. カイ二乗分布の分位点の性質§E14.3 命題 2.4により、分布関数FrF_rはcr,αc_{r,\alpha}で連続であり、Fr(cr,α)=1−αF_r(c_{r,\alpha})=1-\alphaである。各統計量の分布収束と§E11.17 命題 1.2によって、cr,αc_{r,\alpha}以下となる確率が1−α1-\alphaへ収束する。さらにY∼χr2Y\sim\chi^2_rとすると、連続写像定理によりpn⇒1−Fr(Y)p_n\Rightarrow1-F_r(Y)である。任意の0<u<10<u<1に対し、P(1−Fr(Y)≤u)=P(Y≥cr,u)=uP(1-F_r(Y)\leq u)=P(Y\geq c_{r,u})=uなので、極限は一様分布である。▨

注意 4.2. この棄却確率の結論は、各固定帰無母数についての極限である。帰無母数全体の棄却確率の上限を先に取り、その極限がα\alpha以下になるという一様な主張ではない。また、有限標本で水準α\alpha以下になることもこの極限だけからは従わない。

例 4.3 (境界をもつ正規平均の帰無仮説).X1,…,XnX_1,\ldots,X_nをN(μ,1)N(\mu,1)からの独立同分布標本とし、母数空間をΘ=R\Theta=\R、帰無母数集合をΘ0=(−∞,0]\Theta_0=(-\infty,0]とする。真値μ=0\mu=0における尤度比統計量を求める。

対数尤度は母数に依存しない項を除いて−n(μ−X‾n)2/2-n(\mu-\overline X_n)^2/2である。したがって、無制約最大点はμ^n=X‾n\widehat\mu_n=\overline X_n、制約付き最大点はμ~n=min⁡(X‾n,0)\widetilde\mu_n=\min(\overline X_n,0)であり、

Dn=2{ℓn(μ^n)−ℓn(μ~n)}=n(X‾n)+2D_n=2\{\ell_n(\widehat\mu_n)-\ell_n(\widetilde\mu_n)\} =n(\overline X_n)_+^2

となる。真値μ=0\mu=0ではZ=n X‾n∼N(0,1)Z=\sqrt n\,\overline X_n\sim N(0,1)なのでDn=(Z+)2D_n=(Z_+)^2である。ゆえにP0(Dn=0)=P(Z≤0)=1/2P_0(D_n=0)=P(Z\leq0)=1/2であり、t>0t>0に対して

P0(Dn≤t)=P(Z≤t)=12+12P(Z2≤t)P_0(D_n\leq t) =P(Z\leq\sqrt t) =\frac12+\frac12P(Z^2\leq t)

が成り立つ。したがって、任意の標本サイズで

Dn∼12δ0+12χ12D_n\sim\frac12\delta_0+\frac12\chi^2_1

である。Θ0\Theta_0は00に境界をもつため、その点の近傍では定義 3.1の境界をもたない帰無部分多様体ではない。したがって、この例には定理 3.4の仮定が適用されない。

例 4.4.X1,…,XnX_1,\ldots,X_nが独立にN(μ,v)N(\mu,v)に従い、μ∈R\mu\in\R、v>0v>0、n≥2n\geq2とする。帰無仮説をμ=μ0\mu=\mu_0とし、

d=X‾n−μ0,v^=1n∑i(Xi−X‾n)2,v~=v^+d2d=\overline X_n-\mu_0,\qquad \widehat v=\frac1n\sum_i(X_i-\overline X_n)^2,\qquad \widetilde v=\widehat v+d^2

とおく。v^>0\widehat v>0は確率1で成り立つ。§E14.7 命題 1.7により、母数の順序を(v,μ)(v,\mu)としたときの無制約大域最尤推定量は(v^,X‾n)(\widehat v,\overline X_n)である。帰無仮説の下では、残差平方和の分解から対数尤度が定数項を除いて

−n2log⁡v−nv~2v-\frac n2\log v-\frac{n\widetilde v}{2v}

となる。これをvvで微分すると、制約付き大域最尤推定量は(v~,μ0)(\widetilde v,\mu_0)である。v^=0\widehat v=0の零事象上では正の固定分散で補完する。

正規分布の四次モーメントは有限なので、(Xi,Xi2)(X_i,X_i^2)に多変量中心極限定理§E11.17 定理 4.3を適用すると、両成分の標本平均は期待値へ確率収束する。v^=n−1∑iXi2−X‾n2\widehat v=n^{-1}\sum_iX_i^2-\overline X_n^2であるから、帰無仮説の下で両推定量は(v,μ0)(v,\mu_0)に一致する。

∣μ∣≤K|\mu|\leq K、0<ε≤v≤K0<\varepsilon\leq v\leq Kの母数領域では、三階対数微分の絶対値は定数倍の1+x21+x^2で支配される。一次・二次密度微分は、ある定数C,c>0C,c>0によってC(1+∣x∣4)e−cx2C(1+|x|^4)e^{-cx^2}以下になる。実際、密度微分は次数4以下のxxの多項式と密度の積であり、(x−μ)2≥x2/2−μ2(x-\mu)^2\geq x^2/2-\mu^2を用いればこの評価を得る。右辺は可積分なので微分と積分を交換することができる。真値での情報行列はdiag⁡(1/(2v2),1/v)\operatorname{diag}(1/(2v^2),1/v)であり、局所 Cramér 条件が成り立つ。

T=n d/SnT=\sqrt n\,d/S_n、Sn2=nv^/(n−1)S_n^2=n\widehat v/(n-1)とおく。§E14.15 例 4.2の尤度比の表示と、Wald 統計量および score 統計量の定義から

Dn=nlog⁡(1+T2n−1),Wn=nn−1T2,Rn=nT2n−1−T2(T2<n−1)D_n=n\log\left(1+\frac{T^2}{n-1}\right),\qquad W_n=\frac n{n-1}T^2, \qquad R_n=\frac{nT^2}{n-1-T^2}\quad(T^2<n-1)

となる。最後の条件を満たさない場合はRn=0R_n=0である。実際、制約付き点における観測情報は

J~n=(1/(2v~2)d/v~2d/v~21/v~),\widetilde J_n= \begin{pmatrix} 1/(2\widetilde v^2)&d/\widetilde v^2\\ d/\widetilde v^2&1/\widetilde v \end{pmatrix},

その Schur 補行列は(v^−d2)/v~2(\widehat v-d^2)/\widetilde v^2である。したがって正定値性はT2<n−1T^2<n-1と同値である。帰無仮説の下ではTTは確率有界なので、補完する事象の確率は00へ収束する。

ここでRnR_nは制約付き推定量における観測情報を用いるため、期待情報を用いる通常の score 統計量とは有限標本で一般に異なる。

有限標本では§E14.3 定理 4.3によりT∼tn−1T\sim t_{n-1}である。tn−1t_{n-1}の1−α/21-\alpha/2分位点をtn−1,1−α/2t_{n-1,1-\alpha/2}とすると、尤度比検定の閾値

nlog⁡(1+tn−1,1−α/2 2n−1)n\log\left(1+\frac{t_{n-1,1-\alpha/2}^{\,2}}{n-1}\right)

は棄却確率をちょうどα\alphaにする。一方、三統計量に共通のχ12\chi^2_1分位点を用いた閾値は、棄却確率を漸近的にα\alphaにする。三統計量の有限標本の値は上の式のとおり異なる。

定理 4.5.Θ⊆Rp\Theta\subseteq\R^pを空でない開集合、0<α<10<\alpha<1とする。各固定θ0∈Θ\theta_0\in\Thetaにおいて、可測なΘ\Theta値推定量列θ^n\widehat\theta_nと可測な実対称行列列J^n\widehat J_nが

n(θ^n−θ0)⇒Np(0,I(θ0)−1),J^n→Pθ0I(θ0)>0\sqrt n(\widehat\theta_n-\theta_0)\Rightarrow N_p(0,I(\theta_0)^{-1}), \qquad \widehat J_n\xrightarrow{P_{\theta_0}}I(\theta_0)>0

を満たすと仮定する。cp,αc_{p,\alpha}をχp2\chi^2_p分布の1−α1-\alpha分位点とする。J^n\widehat J_nが正定値ならば

Cn={θ∈Θ:n(θ^n−θ)⊤J^n(θ^n−θ)≤cp,α}C_n=\left\{\theta\in\Theta: n(\widehat\theta_n-\theta)^\top\widehat J_n(\widehat\theta_n-\theta) \leq c_{p,\alpha}\right\}

とおき、それ以外の標本ではCn=ΘC_n=\Thetaとする。この集合は各固定θ0\theta_0に対して被覆事象が可測であり、

Pθ0(θ0∈Cn)⟶1−αP_{\theta_0}(\theta_0\in C_n)\longrightarrow1-\alpha

を満たす。この意味でCnC_nは被覆率1−α1-\alphaの漸近信頼領域である。特に局所 Cramér 条件の下の一致する尤度方程式解と、その点での観測情報を用いることができる。

証明. 標本をxxと書くと、(x,θ)↦n(θ^n(x)−θ)⊤J^n(x)(θ^n(x)−θ)(x,\theta)\mapsto n(\widehat\theta_n(x)-\theta)^\top\widehat J_n(x)(\widehat\theta_n(x)-\theta)は、可測な標本関数と連続な母数関数の有限和・積なので積可測である。対称行列の正定値集合は開集合であり、{(x,θ):θ∈Cn(x)}\{(x,\theta):\theta\in C_n(x)\}は積可測集合になる。したがって各固定母数の被覆事象も可測である。

θ0\theta_0を固定する。Slutsky の定理と二次形式の連続性により

n(θ^n−θ0)⊤J^n(θ^n−θ0)⇒Z⊤I(θ0)Z,Z∼Np(0,I(θ0)−1).n(\widehat\theta_n-\theta_0)^\top\widehat J_n(\widehat\theta_n-\theta_0) \Rightarrow Z^\top I(\theta_0)Z, \qquad Z\sim N_p(0,I(\theta_0)^{-1}).

右辺の分布はG⊤G∼χp2G^\top G\sim\chi^2_p、G∼Np(0,Ip)G\sim N_p(0,I_p)に等しい。情報行列の正定値性からJ^n\widehat J_nが正定値でない確率は00へ収束する。分位点での分布関数の連続性によって被覆率の結論を得る。尤度方程式解への適用は§E14.13 定理 3.1と§E14.13 補題 1.3 (3)による。▨

5 演習

問題 5.1.補題 1.1の証明を完成させよ。

解答.

x∈Rq∖{0}x\in\R^q\setminus\{0\}に対してx⊤Ax=(x,0)⊤I(x,0)>0x^\top Ax=(x,0)^\top I(x,0)>0なのでAAは正定値である。任意のx∈Rq,y∈Rrx\in\R^q,y\in\R^rに対して平方完成すると

(x,y)⊤I(x,y)=(x+A−1By)⊤A(x+A−1By)+y⊤Sy.(x,y)^\top I(x,y) =(x+A^{-1}By)^\top A(x+A^{-1}By)+y^\top Sy.

y≠0y\ne0に対してx=−A−1Byx=-A^{-1}Byとおけば左辺は正なのでy⊤Sy>0y^\top Sy>0である。したがってSSも正定値である。

I(x,y)=(d1,d2)I(x,y)=(d_1,d_2)を解くと、第一行からx=A−1(d1−By)x=A^{-1}(d_1-By)、第二行からSy=d2−B⊤A−1d1=vSy=d_2-B^\top A^{-1}d_1=vを得る。ゆえにy=S−1vy=S^{-1}vであり、特にd1=0d_1=0の場合から(I−1)22=S−1(I^{-1})_{22}=S^{-1}である。また

d⊤I−1d=d1⊤x+d2⊤y=d1⊤A−1d1+(d2−B⊤A−1d1)⊤y=d1⊤A−1d1+v⊤S−1vd^\top I^{-1}d=d_1^\top x+d_2^\top y =d_1^\top A^{-1}d_1+(d_2-B^\top A^{-1}d_1)^\top y =d_1^\top A^{-1}d_1+v^\top S^{-1}v

となる。▨

問題 5.2.a>0a>0を既知とし、Xi∼N2(θ,I2)X_i\sim N_2(\theta,I_2)を独立に観測する。帰無仮説を∥θ∥=a\|\theta\|=aとする。無制約・制約付き大域最尤推定量を求め、尤度比統計量、観測情報による score 統計量、およびg(θ)=∥θ∥2−a2g(\theta)=\|\theta\|^2-a^2による Wald 統計量を計算せよ。それらの帰無仮説の下での漸近分布を求めよ。

解答.

m=X‾nm=\overline X_nとおく。対数尤度は定数項を除いて−n∥θ−m∥2/2-n\|\theta-m\|^2/2であるから、無制約最大点はθ^n=m\widehat\theta_n=mである。m≠0m\ne0の場合、円周上で

∥θ−m∥2=a2+∥m∥2−2θ⊤m≥(a−∥m∥)2\|\theta-m\|^2=a^2+\|m\|^2-2\theta^\top m \geq(a-\|m\|)^2

であり、等号はθ=am/∥m∥\theta=am/\|m\|で成り立つ。したがってθ~n=am/∥m∥\widetilde\theta_n=am/\|m\|は制約付き大域最大点である。m=0m=0ではθ~n=(a,0)\widetilde\theta_n=(a,0)と定める。この選択は可測であり、帰無真値θ0\theta_0は零でないので、標本平均の一致性から両推定量はθ0\theta_0へ一致する。

Jn=I2J_n=I_2、Un(θ)=n(m−θ)U_n(\theta)=n(m-\theta)、Dg(θ)=2θ⊤Dg(\theta)=2\theta^\topであるから、m≠0m\ne0のとき

Dn=Rn=n(∥m∥−a)2,Wng=n(∥m∥2−a2)24∥m∥2.D_n=R_n=n(\|m\|-a)^2, \qquad W_n^g=\frac{n(\|m\|^2-a^2)^2}{4\|m\|^2}.

m=0m=0の場合にもDn=Rn=na2D_n=R_n=na^2であり、Wng=0W_n^g=0と補完する。この事象は正規分布の密度から確率零である。

円周上ではDg(θ0)=2θ0⊤Dg(\theta_0)=2\theta_0^\topの階数は1である。正規位置モデルは局所 Cramér 条件を満たすので、定理 3.4により三統計量はすべてχ12\chi^2_1へ分布収束する。m≠0m\ne0ではWng=Dn(∥m∥+a)2/(4∥m∥2)W_n^g=D_n(\|m\|+a)^2/(4\|m\|^2)であり、乗数が11へ確率収束することからも二統計量の漸近的な一致を確認することができる。▨

前提記事