1 局所正則性と観測情報
定義 1.1 (局所 Cramér 条件).p∈N≥1、Θ⊆Rpを空でない開集合とし、可測空間(X,A)上のシグマ有限測度μに関する密度族(pθ)θ∈Θを考える。共通の可測集合S上で0<pθ(x)<∞、Sの外でpθ(x)=0とする。θ0∈Θにおいて次を満たすことを、θ0における局所 Cramér 条件 (local Cramér conditions) という。
- あるρ0>0についてB(θ0,ρ0)⊆Θであり、各x∈Sに対してℓ(x,θ)=logpθ(x)はこの閉球の開近傍でC3級である。密度と各母数微分は観測xに関して可測な版を用いる。
- s(x)=∇θℓ(x,θ0)はEθ0∥s(X)∥2<∞を満たし、I0=Eθ0[s(X)s(X)⊤]は正定値である。各j,kに対して∂jkℓ(X,θ0)はPθ0可積分である。また、∂jpθ0と∂jkpθ0はμ可積分であり、真値において微分と積分を交換することができる。すなわち、
∫S∂jpθ0dμ=∂j∫Spθdμθ=θ0=0,∫S∂jkpθ0dμ=∂jk∫Spθdμθ=θ0=0
が成り立つ。
- ある非負可測関数MがEθ0M(X)<∞を満たし、すべてのx∈S、θ∈B(θ0,ρ0)とj,k,l∈{1,…,p}に対して
∣∂jklℓ(x,θ)∣≤M(x)
が成り立つ。
証明. 各 Hessian 成分に線分上の微積分の基本定理を適用する。∥h∥≤ρ0のとき、
∣∂jkℓ(x,θ0+h)−∂jkℓ(x,θ0)∣≤l=1∑p∣hl∣M(x)≤p∥h∥M(x).標本平均を取り、行列の作用素ノルムが各成分の絶対値の最大値のp倍以下であることを用いると、(2)の不等式を得る。
score の平均と情報等式§E14.12 命題 1.2、§E14.12 命題 1.4の積分計算は、真値における交換条件から
Eθ0sj(X)=∫S∂jpθ0dμ=0,Eθ0∂jkℓ(X,θ0)=∫S∂jkpθ0dμ−(I0)jk=−(I0)jkを与える。Hessian の各成分とM(Xi)に弱大数の法則§E14.2 定理 4.1を、s(Xi)に多変量中心極限定理§E11.17 定理 4.3を適用すると、(1)が従う。
単位球面のコンパクト性§E2.9 定理 4.3と極値定理§E4.1 定理 5.1により、
λ=∥v∥=1minv⊤I0v>0である。b=Eθ0M(X)+1とおき、p3/2ρb≤λ/4となるρ∈(0,ρ0]を取る。事象
∥Jn(θ0)−I0∥op<λ/4,Mn≤bの確率は1へ収束する。この事象上で、半径ρの閉球のすべての点において
2λIp⪯Jn(t)⪯(∥I0∥op+2λ)Ipである。これで(2)の後半も得られた。
Tnが半径ρ0の閉球に入る事象上では、(2)の不等式によって、(3)の上限は
∥Jn(θ0)−I0∥op+p3/2∥Tn−θ0∥Mn以下である。任意のε>0とK>0に対して
Pθ0(∥Tn−θ0∥Mn>ε)≤Pθ0(Mn>K)+Pθ0(∥Tn−θ0∥>ε/K).先にK>Eθ0M(X)を固定してn→∞とすると右辺は0へ収束する。閉球の外に出る確率も0へ収束するから、結論を得る。▨
2 尤度方程式の一致解
命題 2.1. 密度族がθ0における局所 Cramér 条件を満たし、標本がPθ0に従う独立同分布列であるとする。このとき、あるρ>0が存在し、任意の固定したε∈(0,ρ]に対して
Pθ0(∥h∥=εsupℓn(θ0+h)<ℓn(θ0))⟶1.さらに、確率が1へ収束する事象上で、B(θ0,ε)上の対数尤度は唯一の最大点をもち、その点は開球内にあって尤度方程式を満たす。この閉球内にほかの尤度方程式解は存在しない。
証明.補題 1.3 (2)のρ,cを取り、ε∈(0,ρ]を固定する。閉球でJn⪰cIpとなる事象上で、Taylor の積分剰余公式§E4.5 定理 1.1により
nℓn(θ0+h)−ℓn(θ0)=nUn(θ0)⊤h−∫01(1−t)h⊤Jn(θ0+th)hdt≤nUn(θ0)ε−2cε2が球面上で成り立つ。補題 1.3 (1)からUn(θ0)/nP0であるため、最後の式は確率が1へ収束する事象上で負になる。
連続な対数尤度はコンパクトな閉球上で最大値を取る。球面の不等式によって最大点は内点にあるため、各座標方向の微分は0である。また、Jn⪰cIpならば対数尤度は閉球上で強凹であり、最大点は一意である。実際、相異なる2点を結ぶ線分上では二階微分が負である。二つの score 根z,wが閉球にあれば、
0=(z−w)⊤{Un(z)−Un(w)}=−n∫01(z−w)⊤Jn(w+t(z−w))(z−w)dt≤−nc∥z−w∥2となり、z=wである。▨
補題 2.2.Θ⊆Rpを空でない開集合とし、(Pθ)θ∈Θを可測空間(X,A)上の同じシグマ有限測度μに支配された確率測度族とする。モデルが識別可能、すなわちPθ=Pηならばθ=ηであり、密度への写像θ↦pθがL1(μ)で連続であると仮定する。このとき、モデルだけから定まる可測写像列Tn:Xn→Θが存在し、各固定θ∈ΘとPθに従う独立同分布標本に対して
Tn(X1,…,Xn)Pθθが成り立つ。
定理 2.3.Θ⊆Rpを空でない開集合とし、(Pθ)θ∈Θを同じシグマ有限測度に関する共通正台Sをもつ識別可能な密度族とする。各x∈Sに対してθ↦logpθ(x)がΘ全体でC3級であり、各θ∈Θにおいて局所 Cramér 条件が成り立つと仮定する。このとき、未知の母数によらない単一の可測写像列θn:Xn→Θが存在し、各固定θ∈ΘとPθに従う独立同分布標本に対して
θnPθθ,Pθ(Un(θn)=0)⟶1を満たす。
証明.θj→θに対して密度はS上で点ごとに収束し、Sの外では0である。優収束定理§E9.7 定理 3.2をmin(pθj,pθ)≤pθに適用すると、
∥pθj−pθ∥1=2−2∫min(pθj,pθ)dμ⟶0.したがって補題 2.2による一致推定量列Tnを一つ固定する。
有理中心a∈Qpと正の有理半径rでK=B(a,r)⊆Θとなる閉球、およびm∈N≥1の組を一列に並べる。標本がSnに属するとき、組(K,m)が次の三条件を満たすことを考える。
Tn∈B(a,r/2),Jn(t)⪰m−1Ip(t∈K),t∈∂Ksupℓn(t)<ℓn(a).これらを満たす事象は可測である。Hessian 条件は、Kの固定した可算稠密集合とv∈Qpに対する不等式v⊤Jn(t)v≥m−1∥v∥2の可算個の共通部分で表される。境界の上限は境界の固定した可算稠密集合上で取ってよい。両者には母数についての連続性を用いた。
この三条件の下では、極値定理と強凹性からℓn∣Kは唯一の最大点znをもつ。境界の不等式によりznは内点であり、Un(zn)=0である。この点は標本の可測関数である。実際、Kの固定した可算稠密列(qj)を取り、bn=supjℓn(qj)とおく。各k∈N≥1についてℓn(qj)>bn−1/kを満たす最初のqjをzn,kとする。各zn,kは可測であり、Taylor の公式とUn(zn)=0から
2mn∥zn,k−zn∥2≤ℓn(zn)−ℓn(zn,k)<1/k.よってzn,k→znであり、znは可測である。三条件を満たさない標本では各選択を固定点θ∗∈Θに補完すれば、全標本上の可測写像になる。
三条件を満たす最初の組の最大点をθnと定め、該当する組がない場合と標本がSnの外にある場合にはθn=θ∗とする。この選択も可算個の可測な場合分けで定まり、定義に未知母数は含まれない。
θ0∈Θを固定する。補題 1.3 (2)の閉球B(θ0,ρ)と定数c,Cを取る。有理数r∈(0,ρ/2)と有理中心aを
d:=∥a−θ0∥<min{4r,r16Cc}となるように固定し、m−1<cとなるm∈N≥1を取る。この組の添字をj0とする。K⊆B(θ0,ρ)であり、θ0∈B(a,r/2)である。cIp⪯Jn⪯CIpが半径ρの閉球上で成り立つ事象上では、sn=Un(θ0)/nとして、各t∈∂Kに対する Taylor 評価から
nℓn(t)−ℓn(a)≤∥sn∥(r+2d)−2c(r−d)2+2Cd2.右辺の定数部分は−9cr2/32+cr2/32=−cr2/4以下である。snPθ00およびTnPθ0θ0から、組j0は確率が1へ収束する事象上で三条件を満たす。したがって、選ばれる添字は確率が1へ収束する事象上でj0以下になる。
添字がj0以下の有限個の組のうち、θ0∈/B(a,r/2)であるものについては、Tn∈B(a,r/2)となる確率が0へ収束する。残る組ではθ0はKの内点である。その組が選ばれた標本では、h=θn−θ0とおくと
sn=∫01Jn(θ0+th)hdt,m−1∥h∥2≤h⊤sn≤∥h∥∥sn∥.よって∥θn−θ0∥≤m∥sn∥である。有限個の組に現れるmの最大値を用いれば、一致性が従う。選ばれた最大点は score 根であり、組が選ばれる確率は1へ収束するから、尤度方程式についての結論も成り立つ。▨
例 2.4.Xiが成功確率θ∈(0,1)の Bernoulli 分布に従うとき、
Un(t)=t(1−t)∑iXi−nt.0<∑iXi<nのときの唯一の根は標本平均である。一方、全観測が成功ならばUn(t)=n/t>0であり、全観測が失敗ならばUn(t)=−n/(1−t)<0である。これらの標本では開母数空間に根がなく、大域最大点も存在しない。例外事象の確率はθn+(1−θ)n→0である。したがって、全標本で根となることを要求すると、正則なモデルでも存在の結論は成立しない。
3 漸近線形表示と二次展開
定理 3.1. 密度族が固定したθ0における局所 Cramér 条件を満たし、標本がPθ0に従う独立同分布列であるとする。Θ値の可測推定量列θnが一致し、確率が1へ収束する事象上で局所領域に属してUn(θn)=0を満たすと仮定する。Δn=Un(θ0)/nとおくと、
n(θn−θ0)=I0−1Δn+oPθ0(1),n(θn−θ0)⇒Np(0,I0−1).ここでoPθ0(1)はノルムが0へ確率収束する確率ベクトルを表す。この結論は任意の一致する尤度方程式解の列に成り立つ。
証明.hn=θn−θ0とおく。θnが局所閉球に属し、尤度方程式を満たす事象上では、score の線分積分によって
0=Un(θn)=Un(θ0)−nAnhn,An=∫01Jn(θ0+thn)dtである。局所閉球の外ではAn=I0と定める。補題 1.3 (3)によりAnPθ0I0である。
∥Ip−I0−1An∥op<1/2となる確率は1へ収束する。摂動可逆性§E4.7 補題 1.1によって、この事象上でAnは可逆であり、∥An−1∥op≤2∥I0−1∥opである。
An−1−I0−1=An−1(I0−An)I0−1から、例外事象上でAn−1をI0−1に補完すればAn−1Pθ0I0−1である。
確率が1へ収束する事象上でnhn=An−1Δnである。補題 1.3 (1)と行列 Slutsky の定理§E11.17 系 5.5により、右辺はNp(0,I0−1)に分布収束する。さらに、An−1−I0−1Pθ00とΔn⇒Np(0,I0)に行列 Slutsky の定理を適用すると、(An−1−I0−1)ΔnPθ00となる。等式が成立しない例外事象の確率も0へ収束するため、線形表示と正規極限の両方を得る。▨
系 3.2. 固定したθ0で局所 Cramér 条件を満たす独立同分布モデルにおいて、可測な大域最尤推定量列θnが存在し、θnPθ0θ0であるとする。このとき定理 3.1の線形表示と正規極限が成り立つ。
証明. 一致性によって、θnは確率が1へ収束する事象上で、対数尤度が微分可能な局所開球に入る。大域最大点はその開球内でも最大点であるから各座標微分が0であり、定理 3.1を適用することができる。▨
命題 3.3. 密度族が固定したθ0における局所 Cramér 条件を満たし、標本がPθ0に従う独立同分布列であるとする。Θ値の可測推定量列Tnに対し、hn=n(Tn−θ0)が確率有界であると仮定する。このとき、Δn=Un(θ0)/nとして
Jn(Tn)Pθ0I0,ℓn(Tn)−ℓn(θ0)=Δn⊤hn−21hn⊤I0hn+oPθ0(1)が成り立つ。局所領域の外では表示式の左辺を任意の固定値に補完してよい。
証明.hnの確率有界性からTnPθ0θ0である。したがって観測情報の結論は補題 1.3 (3)による。Tnが局所閉球に属する事象上で Taylor の積分剰余公式を用いると、
ℓn(Tn)−ℓn(θ0)=Δn⊤hn−∫01(1−t)hn⊤Jn(θ0+t(Tn−θ0))hndt.積分とhn⊤I0hn/2の差の絶対値は
21∥hn∥20≤t≤1sup∥Jn(θ0+t(Tn−θ0))−I0∥op以下である。上限は0へ確率収束し、∥hn∥2は確率有界であるから、積は0へ確率収束する。具体的には∥hn∥≤Kとその補事象に分け、先にn→∞、次にK→∞とすればよい。▨
4 母数関数と漸近有効性
定理 4.1 (デルタ法).p,k∈N≥1とし、TnをRp値の可測な確率ベクトル、an>0をan→∞を満たす定数列とする。固定したθ0∈Rpと半正定値行列Vに対して
an(Tn−θ0)⇒Np(0,V)であると仮定する。θ0の開近傍G上の Borel 可測写像g:G→Rkがθ0で全微分可能ならば、
an{g(Tn)−g(θ0)}⇒Nk(0,Dg(θ0)VDg(θ0)⊤).Tn∈/Gではg(Tn)を固定値に補完する。Dg(θ0)の階数が小さい場合やDg(θ0)=0の場合も含む。
証明.Zn=an(Tn−θ0)とおく。§E11.17 補題 3.2からZnは確率有界である。任意のδ>0についてP(∥Tn−θ0∥>δ)=P(∥Zn∥>anδ)→0であるから、TnPθ0である。
全微分可能性により、θ0+h∈Gでは
g(θ0+h)−g(θ0)=Dg(θ0)h+r(h),∥h∥∥r(h)∥⟶0であり、r(0)=0とする。ε,η>0を固定し、supnP(∥Zn∥>K)<ηとなるK>0を取る。あるδ>0について、∥h∥≤δならばθ0+h∈Gかつ∥r(h)∥≤ε∥h∥/Kである。したがって
P(an∥r(Tn−θ0)∥>ε)≤P(∥Zn∥>K)+P(∥Tn−θ0∥>δ)となり、n→∞の後にη↓0とすると剰余は0へ確率収束する。局所領域の外の確率も0へ収束する。行列 Slutsky の定理§E11.17 系 5.5をDg(θ0)Zn+oP(1)に適用すれば結論を得る。▨
定義 4.2 (漸近有効性).Θ⊆Rp上の独立同分布モデルにおいて、1観測当たりの Fisher 情報行列I(θ0)が正定値であるとする。可測な推定量列Tnが
n(Tn−θ0)⇒Np(0,I(θ0)−1)を満たすとき、Tnはθ0において漸近有効 (asymptotically efficient) であるという。すべてのθ0∈Θにおいてこの性質をもつとき、モデル上で漸近有効であるという。一般にn(Tn−θ0)⇒Np(0,V)の極限共分散Vをここでの漸近分散と呼ぶ。
系 4.3.定理 2.3のモデルでは、同定理が構成する尤度方程式解の列はモデル上で漸近有効である。固定した真値における定理 3.1の仮定の下では、任意の一致する尤度方程式解の列がその真値で漸近有効である。
命題 4.4.定理 3.1の仮定の下で、Vn=Jn(θn)−1とおく。観測情報が定義されないか正定値でない標本ではVn=Ipと定める。このとき
VnPθ0I0−1,(Vn)jj/nθn,j−θ0,j⇒N(0,1)(j=1,…,p).したがって(Vn)jj/nは第j座標の漸近標準誤差の一致する推定を与える。すなわち、この量と(I0−1)jj/nの比は1へ確率収束する。さらに、I(θ)がθ0の近傍で有限かつθ0で連続であるならば、VnをI(θn)−1に置き換えても同じ結論が成り立つ。近傍の外または逆行列が存在しない標本ではIpに補完する。
証明.補題 1.3 (3)によってJn(θn)Pθ0I0である。正定値の下界と逆行列の摂動評価を定理 3.1の証明と同じ行列に適用すると、VnPθ0I0−1である。正定値行列I0−1の対角成分は正なので、平方根の連続性から
(Vn)jj/(I0−1)jjPθ01.標準化された正規極限は定理 3.1と Slutsky の定理から従う。期待情報については、一致性と仮定した連続性からI(θn)Pθ0I0を得るので、同じ逆行列の評価と標準化を適用することができる。▨
注意 4.5. 一径数の場合、漸近標準誤差は1/nI(θ0)である。観測情報から得る漸近標準誤差の二乗の推定値は
nJn(θn)1=−ℓn′′(θn)1であり、期待情報を用いる場合は1/[nI(θn)]である。いずれも命題 4.4の仮定と例外事象上の補完を伴う。
例 4.7.Xi∼Np(θ,Ip)が独立同分布であり、θ∈Rpとする。対数尤度は定数項を除いて−∑i∥Xi−θ∥2/2であるから、θn=Xnは唯一の大域最尤推定量であり、I(θ)=Ipである。弱大数の法則を各成分へ適用すると一致性が従う。対数密度の三階微分は零であり、score はX−θ、Hessian は−Ipである。各固定K>0に対し、∥θ∥≤Kにおける密度の一階・二階微分の絶対値は、ある定数CKによってCK(1+∥x∥2)e−∥x∥2/4以下である。この評価は∥x−θ∥2≥∥x∥2/2−∥θ∥2と密度の微分公式から従う。右辺は可積分なので微分積分交換が成立し、局所 Cramér 条件を満たす。したがって
n(Xn−θ)⇒Np(0,Ip).g(t)=∥t∥2にデルタ法を適用すると
n(∥Xn∥2−∥θ∥2)⇒N(0,4∥θ∥2).θ=0では極限は原点に集中する確率分布である。
例 4.8 (Hodges の推定量).Xi∼N(θ,1)が独立同分布であり、θ∈Rとする。標本平均Xnを用いて
Hn={0,Xn,∣Xn∣≤n−1/4,∣Xn∣>n−1/4と定める。この可測な推定量列はすべてのθで一致し、
n(Hn−θ)⇒{N(0,0),N(0,1),θ=0,θ=0を満たす。原点における漸近分散0はI(0)−1=1より小さい。このような点での現象を超有効性という。
証明.θ=0のとき、nXn⇒N(0,1)であるから、この列は確率有界である。したがって
P0(Hn=0)=P0(∣nXn∣>n1/4)⟶0.任意のε>0に対してP0(∣nHn∣>ε)≤P0(Hn=0)なので、nHnP00である。
固定したθ=0について、十分大きなnではn−1/4<∣θ∣/2である。標本平均の一致性によって
Pθ(Hn=Xn)≤Pθ(∣Xn∣≤n−1/4)≤Pθ(∣Xn−θ∣≥∣θ∣/2)⟶0.よってn(Hn−θ)は、確率が1へ収束する事象上でn(Xn−θ)と等しい。標本平均の正規極限から結論が従い、HnPθθも得られる。▨
5 演習
解答.
Θの可算稠密列(qj)を固定し、可測集合Ajk={x:pqj(x)>pqk(x)}を一列に並べて(Am)と書く。この族はモデルを分離する。実際、θ=ηに対してδ=∥pθ−pη∥1>0とおく。L1連続性から
e:=∥pqj−pθ∥1+∥pqk−pη∥1<δ/6となるj,kを選ぶことができる。f=pθ−pη、g=pqj−pqkとすると、∫gdμ=0であるから、
∫Ajkfdμ≥∫Ajkgdμ−e=21∥g∥1−e≥2δ−23e>4δ.したがってPθ(Ajk)=Pη(Ajk)である。
確率測度P,Qに対して
d(P,Q)=m=1∑∞2−m∣P(Am)−Q(Am)∣とおく。モデル上ではdは距離であり、d(Pθ,Pη)≤∥pθ−pη∥1なのでθ↦Pθはdについて連続である。経験測度PnとDn(t)=d(Pn,Pt)を定める。各mの標本比率の分散は1/(4n)以下であるから、Cauchy–Schwarz の不等式と非負級数の単調収束定理から
Eθd(Pn,Pθ)≤m=1∑∞2−m2n1=2n1.εn=n−1/4とおくと Markov の不等式によって
Pθ{d(Pn,Pθ)>εn}≤2n1/41⟶0.また、三角不等式からすべてのt∈Θに対して
∣Dn(t)−d(Pθ,Pt)∣≤d(Pn,Pθ).有理中心と正の有理半径をもち、半径を2倍にした閉球もΘに含まれる閉球を一列に並べる。その最初のj個の和集合をKjとする。各Kjは非空コンパクトであり、Kj⊆Kj+1かつ⋃jint(K)j=Θである。各Kjに可算稠密列Dj=(tj,l)l∈N≥1を固定する。標本を固定したときDn(t)はtについて連続なので、
vn,j=linfDn(tj,l)=t∈KjminDn(t)である。左辺は可算個の可測関数の下限であり、可測である。
vn,j<2εnとなる最小のjを選び、そのjについてDn(tj,l)<vn,j+εnとなる最小のlを選んでTn=tj,lと定める。該当するjがなければ固定したθ∗∈Θを用いる。下限の性質からlは存在し、選択は可算個の可測な比較だけで定まる。
真値θを固定し、θ∈KJとなるJを取る。d(Pn,Pθ)≤εnの事象上ではvn,J≤εnであるから、選ばれたjはJ以下であり、
Tn∈KJ,Dn(Tn)<3εn,d(PTn,Pθ)<4εn.任意のδ>0に対し、F=KJ∩{t:∥t−θ∥≥δ}はコンパクトである。Fが空でなければ、連続関数t↦d(Pt,Pθ)はF上で正の最小値bδをもつ。最小値が正であることにはモデルの識別可能性を用いた。十分大きなnでは4εn<bδであるため、上の事象上で∥Tn−θ∥<δとなる。Fが空ならこの結論はTn∈KJだけから従う。よってTnPθθである。θ,J,δは収束の検証だけに用いており、Tnの構成には現れない。▨
問題 5.2. 成功確率θ∈(0,1)の独立同分布 Bernoulli 標本について、Tn=(1+∑i=1nXi)/(n+2)とおく。対数オッズの推定量log{Tn/(1−Tn)}の漸近正規分布を求めよ。
解答.
∣Tn−Xn∣=∣1−2Xn∣/(n+2)≤1/(n+2)である。中心極限定理と Slutsky の定理によって
n(Tn−θ)⇒N(0,θ(1−θ)).g(t)=log{t/(1−t)}は(0,1)で微分可能であり、g′(t)=1/[t(1−t)]である。0<Tn<1なので全標本でg(Tn)が定義される。デルタ法定理 4.1によって
n(log1−TnTn−log1−θθ)⇒N(0,θ(1−θ)1).▨