§E14.7推定法

最終更新

平均と分散が未知である正規分布では、標本平均と残差平方和から尤度の最大点を求めることができる。一方、標本値がすべて一致する例外的な場合には、正の分散をもつ模型の内部で尤度は最大値をもたない。尤度方程式を書くだけでは、有限標本に対する推定量の存在を保証することができない。

点推定では、標本の経験的なモーメントを模型のモーメントへ対応させる方法と、観測結果への適合を尤度によって比較する方法が広く用いられる。モーメント法には方程式の解とその選択が必要であり、最尤法には大域的な最大点と可測な選択が必要である。これらの条件を明示することは、具体的な公式を統計量として正しく定め、有限標本の推定から後続の最適性や漸近理論へ進むための基礎となる。

本記事では、モーメント法と最尤法を定式化し、代表的な有限標本モデルにおける推定量を扱う。

1 最尤法

定義 1.1.d∈N≥1d\in\NNとし、Θ⊆Rd\Theta\subseteq\R^dを Borel 集合、(X,A)(\mathcal X,\mathcal A)を標本空間とする。各観測値x∈Xx\in\mathcal Xに対する尤度関数Lx:Θ→[0,∞)L_x:\Theta\to[0,\infty)を考える。独立同分布標本について選択した積密度から定まる尤度と対数尤度は§E14.4 注意 1.4が与える。

M(x)=arg max⁡θ∈ΘLx(θ)={θ∈Θ|Lx(θ)=sup⁡ϑ∈ΘLx(ϑ)}M(x)=\operatorname*{arg\,max}_{\theta\in\Theta}L_x(\theta) =\left\{\theta\in\Theta\mathrel{\middle|}L_x(\theta)=\sup_{\vartheta\in\Theta}L_x(\vartheta)\right\}

とおく。可測集合X0∈A\mathcal X_0\in\mathcal Aと可測写像θ^ML:X→Θ\widehat\theta_{\mathrm{ML}}:\mathcal X\to\Thetaが存在し、すべてのθ∈Θ\theta\in\ThetaについてPθ(X∈X0)=1P_\theta(X\in\mathcal X_0)=1であり、

θ^ML(x)∈M(x)\widehat\theta_{\mathrm{ML}}(x)\in M(x)

をすべてのx∈X0x\in\mathcal X_0について満たすとき、θ^ML(X)\widehat\theta_{\mathrm{ML}}(X)を 最尤推定量 (maximum likelihood estimator)(MLE)という。X0\mathcal X_0の外側ではθ^ML\widehat\theta_{\mathrm{ML}}の値を任意に定めてよい。最大点が複数ある場合には、最尤推定量は最大化集合から選んだ可測な選択である。

注意 1.2. 尤度の上限値が有限であっても、上限を達成する母数が存在するとは限らない。また、各xxについて最大点が存在しても、最大点をxxの関数として可測に選ぶことができるとは限らない。したがって、非可算な母数集合について、sup⁡θ∈ΘLX(θ)\sup_{\theta\in\Theta}L_X(\theta)の可測性や最大点の可測な選択を、各LX(θ)L_X(\theta)の可測性だけから結論することはできない。最大点が存在しない標本点全体が可測であり、すべての母数の下で確率零となる場合は、定義 1.1の集合X0\mathcal X_0からその零集合を除くことができる。

命題 1.3.Θ⊆R\Theta\subseteq\Rを区間とし、観測値xxを固定する。Lx(θ^)>0L_x(\widehat\theta)>0であり、対数尤度ℓx=log⁡Lx\ell_x=\log L_xが内点θ^∈Θ\widehat\theta\in\Thetaの近傍で微分可能であるとする。θ^\widehat\thetaがLxL_xの最大点ならば、

ℓx′(θ^)=0\ell_x'(\widehat\theta)=0

である。

証明.θ^\widehat\thetaはℓx\ell_xの内点最大点でもある。十分小さいh>0h>0に対して

ℓx(θ^+h)−ℓx(θ^)h≤0,ℓx(θ^−h)−ℓx(θ^)−h≥0\frac{\ell_x(\widehat\theta+h)-\ell_x(\widehat\theta)}{h}\leq0, \qquad \frac{\ell_x(\widehat\theta-h)-\ell_x(\widehat\theta)}{-h}\geq0

である。h↓0h\downarrow0とすると、微分可能性によりℓx′(θ^)≤0\ell_x'(\widehat\theta)\leq0かつℓx′(θ^)≥0\ell_x'(\widehat\theta)\geq0を得る。▨

注意 1.4.命題 1.3は必要条件であり、大域的な最大値を与える十分条件ではない。たとえばℓ(θ)=θ3\ell(\theta)=\theta^3はℓ′(0)=0\ell'(0)=0を満たすが、00は局所最大点でも大域最大点でもない。尤度方程式を解いた後にも、境界と各停留点の値を比較し、最大値が実際に達成されることを確かめる必要がある。

命題 1.5.H⊆RkH\subseteq\R^kを Borel 集合とし、g:Θ→Hg:\Theta\to Hを全単射とする。ggとg−1g^{-1}はともに Borel 可測であると仮定する。η=g(θ)\eta=g(\theta)による再パラメータ化の尤度を

Lx(g)(η)=Lx(g−1(η))L_x^{(g)}(\eta)=L_x(g^{-1}(\eta))

と定める。このとき、すべてのx∈Xx\in\mathcal Xについて

arg max⁡η∈HLx(g)(η)=g ⁣(arg max⁡θ∈ΘLx(θ))\operatorname*{arg\,max}_{\eta\in H}L_x^{(g)}(\eta) =g\!\left(\operatorname*{arg\,max}_{\theta\in\Theta}L_x(\theta)\right)

が成り立つ。特に、θ^ML\widehat\theta_{\mathrm{ML}}が最尤推定量ならば、g∘θ^MLg\circ\widehat\theta_{\mathrm{ML}}はη\etaの最尤推定量である。

証明.η∈H\eta\in Hに対してη=g(θ)\eta=g(\theta)を満たすθ∈Θ\theta\in\Thetaはただ一つ存在し、Lx(g)(η)=Lx(θ)L_x^{(g)}(\eta)=L_x(\theta)である。したがって、η\etaが左辺の最大化集合に属することと、g−1(η)g^{-1}(\eta)がLxL_xの最大化集合に属することは同値である。これにより最大化集合の等式を得る。ggとθ^ML\widehat\theta_{\mathrm{ML}}は可測であるから、その合成も可測である。▨

例 1.6.n∈N≥1n\in\NNとし、X1,…,XnX_1,\ldots,X_nをN(0,v)N(0,v)(§E11.5 定義 2.4)からの独立同分布な標本とし、v∈(0,∞)v\in(0,\infty)とする。観測値x=(x1,…,xn)x=(x_1,\ldots,x_n)に対してQ=∑i=1nxi2>0Q=\sum_{i=1}^n x_i^2>0ならば、vvに依存しない正の因子を除いた尤度は

Lx(v)=v−n/2exp⁡ ⁣(−Q2v)L_x(v)=v^{-n/2}\exp\!\left(-\frac{Q}{2v}\right)

である。その対数の微分は

ℓx′(v)=−n2v+Q2v2=Q−nv2v2\ell_x'(v)=-\frac{n}{2v}+\frac{Q}{2v^2}=\frac{Q-nv}{2v^2}

であるから、尤度は0<v<Q/n0<v<Q/nで増加し、v>Q/nv>Q/nで減少する。したがって

v^ML=1n∑i=1nXi2\widehat v_{\mathrm{ML}}=\frac1n\sum_{i=1}^nX_i^2

がQ>0Q>0における一意な最大点である。各v>0v>0についてPv(Q=0)=0P_v(Q=0)=0であるから、Q=0Q=0で(0,∞)(0,\infty)内の値を任意に補えば最尤推定量を得る。標準偏差σ=v\sigma=\sqrt vはv∈(0,∞)v\in(0,\infty)上の全単射な再パラメータ化であるため、命題 1.5により、Q>0Q>0では

σ^ML=v^ML=(1n∑i=1nXi2)1/2\widehat\sigma_{\mathrm{ML}}=\sqrt{\widehat v_{\mathrm{ML}}} =\left(\frac1n\sum_{i=1}^nX_i^2\right)^{1/2}

となる。Q=0Q=0ではv↓0v\downarrow0のときLx(v)L_x(v)が上に有界でなく、v∈(0,∞)v\in(0,\infty)に最大点は存在しない。

命題 1.7.n≥2n\geq2とし、X1,…,XnX_1,\ldots,X_nをN(μ,v)N(\mu,v)からの独立同分布標本とする。ただし、母数空間をR×(0,∞)\R\times(0,\infty)とする。さらに

X‾=1n∑i=1nXi,Q=∑i=1n(Xi−X‾)2\overline X=\frac1n\sum_{i=1}^nX_i, \qquad Q=\sum_{i=1}^n(X_i-\overline X)^2

と置く。Q>0Q>0では尤度の一意な最大点は

(μ^ML,v^ML)=(X‾,Qn)(\widehat\mu_{\mathrm{ML}},\widehat v_{\mathrm{ML}}) =\left(\overline X,\frac Qn\right)

である。Q=0Q=0では尤度は上に有界でなく、最大点は存在しない。したがって、Q=0Q=0における値を(X‾,1)(\overline X,1)と定めれば、得られる可測写像はすべての(μ,v)∈R×(0,∞)(\mu,v)\in\R\times(0,\infty)の下でほとんど確実に尤度を最大化する最尤推定量である。

証明. 観測値x=(x1,…,xn)x=(x_1,\ldots,x_n)に対して、x‾=n−1∑ixi\overline x=n^{-1}\sum_i x_iおよびQx=∑i(xi−x‾)2Q_x=\sum_i(x_i-\overline x)^2と置く。任意のa∈Ra\in\Rについて

∑i=1n(xi−a)2=Qx+n(a−x‾)2\sum_{i=1}^n(x_i-a)^2 =Q_x+n(a-\overline x)^2

である。したがって、固定したw>0w>0に対する尤度

Lx(a,w)=(2πw)−n/2exp⁡ ⁣[−Qx+n(a−x‾)22w]L_x(a,w)=(2\pi w)^{-n/2} \exp\!\left[-\frac{Q_x+n(a-\overline x)^2}{2w}\right]

はa=x‾a=\overline xで一意に最大となる。

a=x‾a=\overline xに固定すると、wwに依存する部分は

w−n/2exp⁡ ⁣(−Qx2w)w^{-n/2}\exp\!\left(-\frac{Q_x}{2w}\right)

である。これは例 1.6の分散方向の尤度と同じ形である。ゆえにQx>0Q_x>0ではw=Qx/nw=Q_x/nが一意な最大点であり、Qx=0Q_x=0ではw↓0w\downarrow0のとき尤度が正の無限大へ発散する。

Q=0Q=0はX1=⋯=XnX_1=\cdots=X_nと同値である。(X1,X2)(X_1,X_2)は二次元 Lebesgue 測度に関する密度をもち、対角集合{(x,x)∣x∈R}\{(x,x)\mid x\in\R\}の二次元 Lebesgue 測度は零である。したがって{Q=0}⊆{X1=X2}\{Q=0\}\subseteq\{X_1=X_2\}はすべての(μ,v)(\mu,v)の下で確率零である。X‾\overline XとQQは可測であり、場合分けで定めた写像も可測であるから、定義 1.1の条件を満たす。▨

命題 1.8.g:Θ→H=g(Θ)g:\Theta\to H=g(\Theta)を写像とし、観測値xxに対するプロファイル尤度を

Lx∗(η)=sup⁡{Lx(θ)∣θ∈Θ, g(θ)=η}(η∈H)L_x^*(\eta)=\sup\{L_x(\theta)\mid \theta\in\Theta,\ g(\theta)=\eta\} \qquad(\eta\in H)

と定める。θ^∈Θ\widehat\theta\in\ThetaがLxL_xの最大点ならば、g(θ^)g(\widehat\theta)はLx∗L_x^*の最大点である。さらに、θ^ML\widehat\theta_{\mathrm{ML}}が可測な最尤推定量であり、ggが可測ならば、g∘θ^MLg\circ\widehat\theta_{\mathrm{ML}}はプロファイル尤度を最大にする可測な推定量である。

証明.m=Lx(θ^)m=L_x(\widehat\theta)とおく。θ^\widehat\thetaは大域最大点であるから、すべてのη∈H\eta\in Hとg(θ)=ηg(\theta)=\etaを満たす各θ\thetaに対してLx(θ)≤mL_x(\theta)\leq mである。したがってLx∗(η)≤mL_x^*(\eta)\leq mである。一方、θ^\widehat\thetaはg(θ^)g(\widehat\theta)の繊維に属するため、

Lx∗(g(θ^))≥Lx(θ^)=mL_x^*(g(\widehat\theta))\geq L_x(\widehat\theta)=m

である。ゆえにLx∗(g(θ^))=mL_x^*(g(\widehat\theta))=mであり、g(θ^)g(\widehat\theta)は最大点である。最後の主張はg∘θ^MLg\circ\widehat\theta_{\mathrm{ML}}の可測性から従う。▨

注意 1.9. 非可算な繊維上の上限LX∗(η)L_X^*(\eta)が確率変数として可測であることや、各繊維で上限を達成する点を可測に選ぶことは自動的には従わない。

例 1.10. 一つの観測値x∈Rx\in\Rに対し、Θ=R\Theta=\R上の尤度が、正の定数因子を除いて

Lx(θ)=exp⁡(−(x−θ)2)L_x(\theta)=\exp(-(x-\theta)^2)

である正規位置模型を考える。写像g(θ)=θ2g(\theta)=\theta^2はR\Rから[0,∞)[0,\infty)への全射であるが単射ではない。η≥0\eta\geq0に対して

Lx∗(η)=max⁡{e−(x−η)2,e−(x+η)2}=exp⁡ ⁣(−(∣x∣−η)2)L_x^*(\eta) =\max\{e^{-(x-\sqrt\eta)^2},e^{-(x+\sqrt\eta)^2}\} =\exp\!\left(-(|x|-\sqrt\eta)^2\right)

である。元の尤度の一意な最大点はθ^=x\widehat\theta=xであり、プロファイル尤度の一意な最大点はη^=x2=g(θ^)\widehat\eta=x^2=g(\widehat\theta)である。

2 存在、一意性、識別可能性

例 2.1. 母数空間をΘ={−1,1}\Theta=\{-1,1\}、標本空間を{0,1,2}\{0,1,2\}とし、

P−1(0)=P1(0)=12,P−1(2)=P1(1)=12P_{-1}(0)=P_{1}(0)=\frac12, \qquad P_{-1}(2)=P_{1}(1)=\frac12

と定め、残りの確率を00とする。P−1≠P1P_{-1}\neq P_1であるから、この統計モデルは識別可能である。しかしX=0X=0を観測するとL0(−1)=L0(1)=1/2L_0(-1)=L_0(1)=1/2となり、最大点は二つある。したがって、識別可能性は個々の有限標本について尤度の最大点が一意であることを保証しない。

また、n∈N≥1n\in\NNとし、X1,…,XnX_1,\ldots,X_nをPois⁡(λ)\operatorname{Pois}(\lambda)(§E11.5 定義 1.4)からの独立同分布な標本とし、λ∈(0,∞)\lambda\in(0,\infty)とする。この模型は識別可能である。すべての観測値が00ならば、尤度はL(λ)=e−nλL(\lambda)=e^{-n\lambda}であり、上限11はλ∈(0,∞)\lambda\in(0,\infty)で達成されない。したがって、識別可能性は最尤推定量の存在も保証しない。

3 モーメント法

定義 3.1.d,n∈N≥1d,n\in\NNとし、Θ⊆Rd\Theta\subseteq\R^dとS⊆R\mathcal S\subseteq\Rを Borel 集合とする。X1,…,XnX_1,\ldots,X_nを同一の分布に従うS\mathcal S値確率変数とする。各θ∈Θ\theta\in\ThetaについてEθ[∣X1∣j]<∞E_\theta[|X_1|^j]<\infty(j=1,…,dj=1,\ldots,d)と仮定し、

μ(θ)=(Eθ[X1],…,Eθ[X1d]),Mn=(1n∑i=1nXi,…,1n∑i=1nXid)\mu(\theta)=\bigl(E_\theta[X_1],\ldots,E_\theta[X_1^d]\bigr), \qquad M_n=\left(\frac1n\sum_{i=1}^nX_i,\ldots,\frac1n\sum_{i=1}^nX_i^d\right)

とおく。可測写像θ^n:Sn→Θ\widehat\theta_n:\mathcal S^n\to\Thetaがモーメント方程式

μ(θ^n(x1,…,xn))=Mn(x1,…,xn)\mu(\widehat\theta_n(x_1,\ldots,x_n))=M_n(x_1,\ldots,x_n)

をすべての標本点について満たすとき、θ^n\widehat\theta_nを モーメント法推定量 (method of moments estimator) という。方程式に解が存在しない標本点がある場合には、この定義によるモーメント法推定量は存在しない。解が複数ある場合には、解の集合から可測な選択を別に定める必要がある。

命題 3.2.d∈N≥1d\in\NNとし、S⊆R\mathcal S\subseteq\Rを Borel 集合とする。X1,X2,…X_1,X_2,\ldotsを母数θ0∈Θ⊆Rd\theta_0\in\Theta\subseteq\R^dの下で独立同分布なS\mathcal S値確率変数列とする。Eθ0[∣X1∣j]<∞E_{\theta_0}[|X_1|^j]<\infty(j=1,…,dj=1,\ldots,d)と仮定する。D⊆RdD\subseteq\R^dと Borel 可測写像ψ:D→Θ\psi:D\to\Thetaが存在し、すべてのnnについてMn(Sn)⊆DM_n(\mathcal S^n)\subseteq Dであり、

μ(ψ(Mn))=Mn\mu(\psi(M_n))=M_n

を満たすと仮定する。さらにμ(θ0)∈D\mu(\theta_0)\in D、ψ(μ(θ0))=θ0\psi(\mu(\theta_0))=\theta_0とし、ψ\psiがμ(θ0)\mu(\theta_0)においてDD上連続であるとする。このとき、モーメント法推定量θ^n=ψ(Mn)\widehat\theta_n=\psi(M_n)はθ0\theta_0に確率収束する。

証明. 各j=1,…,dj=1,\ldots,dに対してYi(j)=XijY_i^{(j)}=X_i^jとおく。仮定からEθ0[∣Y1(j)∣]<∞E_{\theta_0}[|Y_1^{(j)}|]<\inftyであるため、§E11.15 定理 2.1により

1n∑i=1nXij→PEθ0[X1j]\frac1n\sum_{i=1}^nX_i^j\xrightarrow{P}E_{\theta_0}[X_1^j]

である。各座標の確率収束と§E11.17 命題 5.2から、Mn→Pμ(θ0)M_n\xrightarrow{P}\mu(\theta_0)を得る。

任意のε>0\varepsilon>0をとる。ψ\psiはμ(θ0)\mu(\theta_0)においてDD上連続であるから、あるδ>0\delta>0が存在し、m∈Dm\in Dと∥m−μ(θ0)∥<δ\|m-\mu(\theta_0)\|<\deltaから∥ψ(m)−θ0∥<ε\|\psi(m)-\theta_0\|<\varepsilonが従う。したがって

Pθ0(∥θ^n−θ0∥≥ε)≤Pθ0(∥Mn−μ(θ0)∥≥δ)⟶0P_{\theta_0}(\|\widehat\theta_n-\theta_0\|\geq\varepsilon) \leq P_{\theta_0}(\|M_n-\mu(\theta_0)\|\geq\delta) \longrightarrow0

である。▨

注意 3.3.命題 3.2は、選択関数ψ\psiが真のモーメントμ(θ0)\mu(\theta_0)の近くでθ0\theta_0に対応する解の枝を選び、その点で連続であることを用いる。モーメント写像が全域で単射である必要はないが、真のモーメントの近くで別の解の枝を選ぶ規則はθ0\theta_0へ収束しない場合がある。

例 3.4.n∈N≥1n\in\NNとし、X1,…,XnX_1,\ldots,X_nをBern⁡(p)\operatorname{Bern}(p)(§E11.5 定義 1.2)からの独立同分布標本とし、p∈[0,1]p\in[0,1]とする。S=∑i=1nXiS=\sum_{i=1}^nX_iと置くと、観測値に対する尤度は

L(p)=pS(1−p)n−SL(p)=p^S(1-p)^{n-S}

である。0<S<n0<S<nのとき、

ℓ′(p)=Sp−n−S1−p=S−npp(1−p)\ell'(p)=\frac{S}{p}-\frac{n-S}{1-p} =\frac{S-np}{p(1-p)}

であるから、LLはp<S/np<S/nで増加し、p>S/np>S/nで減少する。S=0S=0のときはL(p)=(1−p)nL(p)=(1-p)^n、S=nS=nのときはL(p)=pnL(p)=p^nである。したがって、すべての標本点で最大値は存在して一意であり、

p^ML=Sn=X‾n\widehat p_{\mathrm{ML}}=\frac Sn=\overline X_n

である。この写像は可測である。

Ep[X1]=pE_p[X_1]=pであるから、一階のモーメント方程式もp=X‾np=\overline X_nとなる。したがってX‾n\overline X_nはモーメント法推定量でもある。ここでS={0,1}\mathcal S=\{0,1\}、D=[0,1]D=[0,1]、ψ(m)=m\psi(m)=mとすれば、標本モーメントの像はDDに含まれ、命題 3.2の条件を満たす。ゆえに各p∈[0,1]p\in[0,1]についてX‾n\overline X_nはppの一致推定量である。

例 3.5.n∈N≥1n\in\NNとし、X1,…,XnX_1,\ldots,X_nを母数θ>0\theta>0と密度

pθ(x)=1θ1(0,θ](x)p_\theta(x)=\frac1\theta\mathbf{1}_{(0,\theta]}(x)

をもつ一様分布からの独立同分布標本とする。このとき

Eθ[X1]=1θ∫0θx dx=θ2E_\theta[X_1]=\frac1\theta\int_0^\theta x\,dx=\frac\theta2

であるから、一階のモーメント方程式はθ=2X‾n\theta=2\overline X_nを与える。

観測値x1,…,xn>0x_1,\ldots,x_n>0に対し、x(n)=max⁡ixix_{(n)}=\max_i x_iと置く。尤度は

Lx(θ)=θ−n1[x(n),∞)(θ)L_x(\theta)=\theta^{-n}\mathbf{1}_{[x_{(n)},\infty)}(\theta)

である。これは0<θ<x(n)0<\theta<x_{(n)}で零となり、θ≥x(n)\theta\geq x_{(n)}では狭義単調減少する。したがって最尤推定量はX(n)=max⁡iXiX_{(n)}=\max_iX_iである。一般には2X‾n2\overline X_nとX(n)X_{(n)}は等しくないため、モーメント法と最尤法は異なる推定量を与える。

参考文献

  1. George Casella and Roger L. Berger, Statistical Inference, 2nd ed., CRC Press, Boca Raton, 2024, originally published 2002.モーメント法、最尤法および最尤推定量の不変性の標準的な定式化を参考にした。
  2. Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer Texts in Statistics, Springer, 1998.最尤推定量の存在と一意性を区別するための一般的な定式化を参考にした。

前提記事