§E11.17多変量中心極限定理

最終更新

独立同分布の観測が有限な分散を持つとき、標本平均の揺らぎは一次元の中心極限定理によって記述される。複数の量を同時に観測する場合にも、各成分の標本平均は同じ原理に従うが、成分間の関係は各成分の極限分布だけからは読み取れない。多変量の極限分布を定めるには、座標ごとの揺らぎに加えて、任意の線形結合がどのように揺らぐかを捉える必要がある。

この不足を埋める道具が、有限次元 Euclid 空間上の分布収束と特性関数である。特性関数の反転と一意性は、すべての線形結合の分布が確率ベクトル全体の分布を決定することを支える。Cramér–Wold の定理は、確率ベクトルの分布収束を一次元射影の分布収束へ帰着する判定法を与える。

この判定法によって、一次元の中心極限定理から多変量中心極限定理を導くことができる。極限の共分散行列は正定値とは限らず、揺らぎが低次元の部分空間に限られる場合も同じ定理に含まれる。さらに、連続写像定理と Slutsky の定理を用いると、分布収束する確率ベクトルに、定数へ確率収束するベクトルや行列を組み合わせた統計量の極限も扱うことができる。

たとえば、試行の結果を複数の種類に分けて各種類の出現回数を同時に数えると、その度数ベクトルの成分和は試行回数に固定される。中心化した度数ベクトルの成分和は常に零であるため、極限正規分布の共分散行列は特異になる。それでも、各方向への射影を調べれば、度数ベクトル全体の揺らぎを一つの多変量正規分布として記述することができる。

以下では、一次元射影による判定から多変量の極限定理を導き、行列を含む統計量へ適用する。

1 分布収束と連続写像

定義 1.1.d∈N≥1d\in\NNとし、μn,μ\mu_n,\muをRd\R^d上の Borel 確率測度とする。すべての有界連続関数f:Rd→Rf:\R^d\to\Rに対して

∫Rdf dμn⟶∫Rdf dμ\int_{\R^d}f\,d\mu_n\longrightarrow\int_{\R^d}f\,d\mu

が成り立つとき、μn\mu_nはμ\muに弱収束する (converge weakly) といい、μn⇒μ\mu_n\Rightarrow\muと書く。確率ベクトルXn,XX_n,Xの分布がμn,μ\mu_n,\muであるとき、この収束をXnX_nのXXへの分布収束 (convergence in distribution of random vectors) といい、Xn⇒XX_n\Rightarrow Xと書く。XnX_nとXXを同じ確率空間上で定義する必要はない。XXの分布だけを指定するときはXn⇒μX_n\Rightarrow\muとも書く。

命題 1.2.μn,μ\mu_n,\muをR\R上の Borel 確率測度とし、その分布関数をFn,FF_n,Fとする。μn⇒μ\mu_n\Rightarrow\muであるための必要十分条件は、FFのすべての連続点a∈Ra\in\RでFn(a)→F(a)F_n(a)\to F(a)が成り立つことである。したがって、一次元では§E11.12 定義 1.3の分布収束と一致する。

証明.μn⇒μ\mu_n\Rightarrow\muとし、FFの連続点aaとδ>0\delta>0に対して

ℓδ(x)=min⁡{1,max⁡{0,a−xδ}},uδ(x)=ℓδ(x−δ)\ell_\delta(x)=\min\left\{1,\max\left\{0,\frac{a-x}{\delta}\right\}\right\}, \qquad u_\delta(x)=\ell_\delta(x-\delta)

とおく。両関数は有界連続であり、

1(−∞,a−δ]≤ℓδ≤1(−∞,a]≤uδ≤1(−∞,a+δ]\mathbf1_{(-\infty,a-\delta]}\leq\ell_\delta \leq\mathbf1_{(-\infty,a]} \leq u_\delta\leq\mathbf1_{(-\infty,a+\delta]}

である。μn\mu_nに関して積分し、n→∞n\to\inftyとすると、

F(a−δ)≤lim inf⁡nFn(a)≤lim sup⁡nFn(a)≤F(a+δ)F(a-\delta)\leq\liminf_n F_n(a) \leq\limsup_n F_n(a)\leq F(a+\delta)

を得る。δ↓0\delta\downarrow0とFFのaaにおける連続性からFn(a)→F(a)F_n(a)\to F(a)である。逆向きは§E11.14 補題 4.1により従う。▨

定理 1.3 (連続写像定理).d,k∈N≥1d,k\in\NNとし、Xn⇒XX_n\Rightarrow Xを満たすRd\R^d値確率ベクトルと、連続写像g:Rd→Rkg:\R^d\to\R^kを考える。このときg(Xn)⇒g(X)g(X_n)\Rightarrow g(X)である。

証明. 任意の有界連続関数h:Rk→Rh:\R^k\to\Rに対してh∘gh\circ gは有界連続であるから、

E[h(g(Xn))]⟶E[h(g(X))]E[h(g(X_n))]\longrightarrow E[h(g(X))]

である。▨

2 特性関数と反転公式

定義 2.1.d∈N≥1d\in\NNとし、μ\muをRd\R^d上の Borel 確率測度とする。μ\muの特性関数 (characteristic function of a random vector) を

μ^(t)=∫Rdeit⊤x μ(dx)(t∈Rd)\widehat\mu(t)=\int_{\R^d}e^{it^\top x}\,\mu(dx) \qquad(t\in\R^d)

によって定める。XXの分布がμ\muであるときはφX=μ^\varphi_X=\widehat\muと書く。

命題 2.2.d,k∈N≥1d,k\in\NNとする。確率ベクトルの特性関数について次が成り立つ。

  1. Rd\R^d上の Borel 確率測度の特性関数φ\varphiは一様連続であり、すべてのt∈Rdt\in\R^dに対して φ(0)=1,∣φ(t)∣≤1,φ(−t)=φ(t)‾\varphi(0)=1,\qquad |\varphi(t)|\leq1,\qquad \varphi(-t)=\overline{\varphi(t)} を満たす。
  2. XXがRd\R^d値、A∈Rk×dA\in\R^{k\times d}、b∈Rkb\in\R^kならば、 φAX+b(t)=eit⊤bφX(A⊤t)(t∈Rk)\varphi_{AX+b}(t)=e^{it^\top b}\varphi_X(A^\top t) \qquad(t\in\R^k) である。
  3. X1,…,XrX_1,\ldots,X_rが独立なRd\R^d値確率ベクトルならば、 φX1+⋯+Xr(t)=∏j=1rφXj(t)(t∈Rd)\varphi_{X_1+\cdots+X_r}(t)=\prod_{j=1}^r\varphi_{X_j}(t) \qquad(t\in\R^d) である。
  4. X∼Nd(m,Σ)X\sim N_d(m,\Sigma)ならば、 φX(t)=exp⁡(it⊤m−12t⊤Σt)(t∈Rd)\varphi_X(t)=\exp\left(it^\top m-\frac12t^\top\Sigma t\right) \qquad(t\in\R^d) である。Σ\Sigmaは半正定値でよい。

証明.(1)を示す。XXの分布をμ\muとすると、

sup⁡t∈Rd∣φX(t+h)−φX(t)∣≤∫Rd∣eih⊤x−1∣ μ(dx)\sup_{t\in\R^d}|\varphi_X(t+h)-\varphi_X(t)| \leq\int_{\R^d}|e^{ih^\top x}-1|\,\mu(dx)

である。h→0h\to0のとき被積分関数は各点で00に収束し、22以下であるから、優収束定理§E9.7 定理 3.2により右辺は00に収束する。原点での値、絶対値の上界および共役の等式は、指数関数の対応する性質を積分して得られる。

(2)を示す。等式t⊤(AX+b)=(A⊤t)⊤X+t⊤bt^\top(AX+b)=(A^\top t)^\top X+t^\top bを指数関数に代入して期待値を取ればよい。

(3)を示す。固定したt∈Rdt\in\R^dに対して、t⊤X1,…,t⊤Xrt^\top X_1,\ldots,t^\top X_rは独立な実確率変数である。§E11.14 命題 1.3をこれらの変数に適用し、特性関数の引数を11とすれば表示式を得る。

(4)を示す。§E11.10 定理 4.2により、t⊤Xt^\top Xの分布はt⊤m+t⊤Σt Gt^\top m+\sqrt{t^\top\Sigma t}\,Gの分布に等しい。ただしG∼N(0,1)G\sim N(0,1)である。§E11.16 命題 1.1から

E[eit⊤X]=eit⊤mE[eit⊤Σt G]=exp⁡(it⊤m−12t⊤Σt)E[e^{it^\top X}] =e^{it^\top m}E[e^{i\sqrt{t^\top\Sigma t}\,G}] =\exp\left(it^\top m-\frac12t^\top\Sigma t\right)

を得る。この等式はt⊤Σt=0t^\top\Sigma t=0の場合にも成り立つ。▨

定理 2.3 (Gauss 核による反転公式).d∈N≥1d\in\NN、ε>0\varepsilon>0とし、Rd\R^d上の Borel 確率測度μ\muとγε=Nd(0,εId)\gamma_\varepsilon=N_d(0,\varepsilon I_d)の畳み込みをμε\mu_\varepsilonとする。すなわち、με\mu_\varepsilonは分布μ\mu、γε\gamma_\varepsilonをもつ独立なベクトルの和の分布である。με\mu_\varepsilonは連続な密度

pμ,ε(x)=1(2π)d∫Rde−it⊤xμ^(t)e−ε∥t∥2/2 dtp_{\mu,\varepsilon}(x) =\frac1{(2\pi)^d}\int_{\R^d} e^{-it^\top x}\widehat\mu(t)e^{-\varepsilon\|t\|^2/2}\,dt

をもつ。右辺は絶対収束する。任意の有界連続関数f:Rd→Rf:\R^d\to\Rに対して

∫Rdf dμ=lim⁡ε↓0∫Rdf(x)pμ,ε(x) dx\int_{\R^d}f\,d\mu =\lim_{\varepsilon\downarrow0}\int_{\R^d}f(x)p_{\mu,\varepsilon}(x)\,dx

が成り立つ。

証明. 標準正規分布の特性関数§E11.16 命題 1.1に変数変換を施すと、u∈Ru\in\Rに対して

12π∫Re−itue−εt2/2 dt=12πεe−u2/(2ε)\frac1{2\pi}\int_\R e^{-itu}e^{-\varepsilon t^2/2}\,dt =\frac1{\sqrt{2\pi\varepsilon}}e^{-u^2/(2\varepsilon)}

である。各座標について積を取り、絶対可積分な被積分関数へ Fubini の定理§E9.11 定理 3.2を適用すると、

gε(u):=1(2πε)d/2e−∥u∥2/(2ε)=1(2π)d∫Rde−it⊤ue−ε∥t∥2/2 dtg_\varepsilon(u):=\frac1{(2\pi\varepsilon)^{d/2}} e^{-\|u\|^2/(2\varepsilon)} =\frac1{(2\pi)^d}\int_{\R^d}e^{-it^\top u}e^{-\varepsilon\|t\|^2/2}\,dt

を得る。

Tonelli の定理§E9.11 定理 2.3により、任意の Borel 集合B⊆RdB\subseteq\R^dについて

με(B)=∫Rd∫Rd1B(y+z)gε(z) dz μ(dy)=∫B(∫Rdgε(x−y) μ(dy))dx\mu_\varepsilon(B) =\int_{\R^d}\int_{\R^d}\mathbf1_B(y+z)g_\varepsilon(z)\,dz\,\mu(dy) =\int_B\left(\int_{\R^d}g_\varepsilon(x-y)\,\mu(dy)\right)dx

である。したがって、括弧内の関数が密度である。gεg_\varepsilonの積分表示を代入すると、μ\muの全質量が11でありe−ε∥t∥2/2e^{-\varepsilon\|t\|^2/2}が可積分であるため、 Fubini の定理によってy,ty,tの積分順序を交換することができる。よって

∫Rdgε(x−y) μ(dy)=1(2π)d∫Rde−it⊤x(∫Rdeit⊤y μ(dy))e−ε∥t∥2/2 dt=pμ,ε(x).\int_{\R^d}g_\varepsilon(x-y)\,\mu(dy) =\frac1{(2\pi)^d}\int_{\R^d}e^{-it^\top x} \left(\int_{\R^d}e^{it^\top y}\,\mu(dy)\right) e^{-\varepsilon\|t\|^2/2}\,dt =p_{\mu,\varepsilon}(x).

同じ可積分な上界と優収束定理から、pμ,εp_{\mu,\varepsilon}は連続である。

分布μ\muのXXと標準正規ベクトルGGを積確率空間上で独立に取ると、X+εGX+\sqrt\varepsilon Gの分布はμε\mu_\varepsilonである。任意の有界連続関数ffに対してf(X+εG)→f(X)f(X+\sqrt\varepsilon G)\to f(X)が各点で成り立つ。定数∥f∥∞\|f\|_\inftyを上界とする優収束定理により

∫f(x)pμ,ε(x) dx=E[f(X+εG)]⟶E[f(X)]=∫f dμ\int f(x)p_{\mu,\varepsilon}(x)\,dx =E[f(X+\sqrt\varepsilon G)]\longrightarrow E[f(X)] =\int f\,d\mu

である。▨

定理 2.4.d∈N≥1d\in\NNとする。Rd\R^d上の二つの Borel 確率測度が同じ特性関数をもつならば、二つの測度は等しい。

証明.μ^=ν^\widehat\mu=\widehat\nuとすると、定理 2.3によりすべてのε>0\varepsilon>0でpμ,ε=pν,εp_{\mu,\varepsilon}=p_{\nu,\varepsilon}である。同じ反転公式でε↓0\varepsilon\downarrow0とすれば、すべての有界連続関数ffについて∫f dμ=∫f dν\int f\,d\mu=\int f\,d\nuを得る。§E11.10 補題 2.1によりμ=ν\mu=\nuである。▨

3 緊密性と Lévy の連続性定理

定義 3.1.d∈N≥1d\in\NNとする。Rd\R^d上の Borel 確率測度の族M\mathcal Mが緊密 (tight) であるとは、任意のη>0\eta>0に対してR>0R>0が存在して

sup⁡μ∈Mμ({x∈Rd:∥x∥>R})<η\sup_{\mu\in\mathcal M}\mu(\{x\in\R^d:\|x\|>R\})<\eta

となることをいう。

補題 3.2.d∈N≥1d\in\NNとし、μn⇒μ\mu_n\Rightarrow\muを満たすRd\R^d上の Borel 確率測度列を考える。族{μn:n∈N≥1}\{\mu_n:n\in\NN\}は緊密である。

証明.R>0R>0に対してχR(x)=min⁡{1,max⁡{0,R+1−∥x∥}}\chi_R(x)=\min\{1,\max\{0,R+1-\|x\|\}\}とおく。χR\chi_Rは閉球{∥x∥≤R}\{\|x\|\leq R\}上で11、{∥x∥≥R+1}\{\|x\|\geq R+1\}上で00となる有界連続関数である。χR→1\chi_R\to1がR→∞R\to\inftyで各点収束するので、優収束定理により∫χR dμ→1\int\chi_R\,d\mu\to1である。任意のη>0\eta>0に対して∫χR dμ>1−η/2\int\chi_R\,d\mu>1-\eta/2となるRRを取り、∫χR dμn→∫χR dμ\int\chi_R\,d\mu_n\to\int\chi_R\,d\muを用いると、十分大きいnnについて

μn({∥x∥>R+1})≤1−∫χR dμn<η\mu_n(\{\|x\|>R+1\})\leq1-\int\chi_R\,d\mu_n<\eta

である。残る有限個のμn\mu_nについては、閉球がRd\R^dを増加して覆うことから、半径を共通に大きくして同じ上界を得ることができる。▨

補題 3.3.d∈N≥1d\in\NNとする。Rd\R^d上の Borel 確率測度列(μn)(\mu_n)が緊密ならば、 Borel 確率測度μ\muと部分列(μnj)(\mu_{n_j})が存在してμnj⇒μ\mu_{n_j}\Rightarrow\muとなる。

証明.m∈N≥0m\in\N、k=(k1,…,kd)∈Zdk=(k_1,\ldots,k_d)\in\Z^dに対して

Qm,k=∏i=1d[2−mki,2−m(ki+1))Q_{m,k}=\prod_{i=1}^d[2^{-m}k_i,2^{-m}(k_i+1))

とおく。すべての(m,k)(m,k)を列挙し、[0,1][0,1]内の列μn(Qm,k)\mu_n(Q_{m,k})から収束部分列を順に選出する。対角部分列を取れば、すべての(m,k)(m,k)について

μnj(Qm,k)⟶pm,k\mu_{n_j}(Q_{m,k})\longrightarrow p_{m,k}

となる。mmを固定すると、任意の有限集合J⊆ZdJ\subseteq\Z^dについて∑k∈Jpm,k≤1\sum_{k\in J}p_{m,k}\leq1である。一方、任意のη>0\eta>0に対し、緊密性からinf⁡jμnj({∥x∥≤R})>1−η\inf_j\mu_{n_j}(\{\|x\|\leq R\})>1-\etaとなるRRを取る。この閉球と交わるQm,kQ_{m,k}は有限個であり、その添字集合をJJとすると∑k∈Jpm,k≥1−η\sum_{k\in J}p_{m,k}\geq1-\etaである。したがって、

∑k∈Zdpm,k=1.\sum_{k\in\Z^d}p_{m,k}=1.

各Qm,kQ_{m,k}は次の段階の2d2^d個の立方体の非交和なので、有限和の極限を取ることにより

pm,k=∑v∈{0,1}dpm+1,2k+vp_{m,k}=\sum_{v\in\{0,1\}^d}p_{m+1,2k+v}

も成り立つ。

Zd\Z^dの列挙を一つ固定し、[0,1)[0,1)を長さp0,kp_{0,k}の半開区間I0,kI_{0,k}に順に分割する。長さが00の区間は空集合とする。各Im,kI_{m,k}を、v∈{0,1}dv\in\{0,1\}^dの固定した順に、長さpm+1,2k+vp_{m+1,2k+v}の半開区間Im+1,2k+vI_{m+1,2k+v}へ分割する。質量の和と整合関係から、各段階の区間は[0,1)[0,1)を分割し、子の区間は親の区間に含まれる。u∈Im,ku\in I_{m,k}に対してYm(u)=2−mkY_m(u)=2^{-m}kと定める。各YmY_mは可測であり、Lebesgue 確率空間[0,1)[0,1)上で値2−mk2^{-m}kを取る確率はpm,kp_{m,k}である。

固定したuuに対応する立方体は入れ子である。l≥ml\geq mならば

∥Yl(u)−Ym(u)∥≤d 2−m\|Y_l(u)-Y_m(u)\|\leq\sqrt d\,2^{-m}

であるから、Ym(u)Y_m(u)はRd\R^dの Cauchy 列であり、極限Y(u)Y(u)が存在する。可測関数の各成分の極限としてYYは可測である。その分布をμ\muとする。有界連続関数f:Rd→Rf:\R^d\to\Rに対して、優収束定理から

∑k∈Zdf(2−mk)pm,k=E[f(Ym)]⟶E[f(Y)]=∫f dμ\sum_{k\in\Z^d}f(2^{-m}k)p_{m,k} =E[f(Y_m)]\longrightarrow E[f(Y)]=\int f\,d\mu

が成り立つ。

qm(x)=2−mkq_m(x)=2^{-m}kをx∈Qm,kx\in Q_{m,k}によって定める。固定したmmについて、∑kpm,k=1\sum_k p_{m,k}=1と質量の各点収束から

∑k∈Zd∣μnj(Qm,k)−pm,k∣⟶0(j→∞)\sum_{k\in\Z^d}\left|\mu_{n_j}(Q_{m,k})-p_{m,k}\right|\longrightarrow0 \qquad(j\to\infty)

である。実際、有限集合JJを∑k∉Jpm,k<η\sum_{k\notin J}p_{m,k}<\etaとなるように取り、JJ上で極限を取れば、十分大きいjjについて∑k∉Jμnj(Qm,k)<2η\sum_{k\notin J}\mu_{n_j}(Q_{m,k})<2\etaとなる。JJ上の絶対差の和は00に収束し、JJ外の絶対差の和は3η3\eta未満である。よって

∫f∘qm dμnj⟶E[f(Ym)](j→∞).\int f\circ q_m\,d\mu_{n_j}\longrightarrow E[f(Y_m)] \qquad(j\to\infty).

M=∥f∥∞M=\|f\|_\inftyとする。任意のη>0\eta>0に対して緊密性によりsup⁡jμnj({∥x∥>R})<η\sup_j\mu_{n_j}(\{\|x\|>R\})<\etaとなるRRを取る。∥qm(x)−x∥≤d 2−m\|q_m(x)-x\|\leq\sqrt d\,2^{-m}なので、ffの閉球{∥x∥≤R+d}\{\|x\|\leq R+\sqrt d\}上の一様連続性から

ωm:=sup⁡∥x∥≤R∣f(qm(x))−f(x)∣⟶0.\omega_m:=\sup_{\|x\|\leq R}|f(q_m(x))-f(x)|\longrightarrow0.

したがって、すべてのj,mj,mについて

∣∫f∘qm dμnj−∫f dμnj∣≤ωm+2Mη.\left|\int f\circ q_m\,d\mu_{n_j}-\int f\,d\mu_{n_j}\right| \leq\omega_m+2M\eta.

三角不等式を用い、j→∞j\to\infty、m→∞m\to\inftyの順に極限を取ると、

lim sup⁡j∣∫f dμnj−∫f dμ∣≤2Mη\limsup_j\left|\int f\,d\mu_{n_j}-\int f\,d\mu\right|\leq2M\eta

を得る。η>0\eta>0は任意なので、μnj⇒μ\mu_{n_j}\Rightarrow\muである。▨

補題 3.4.d∈N≥1d\in\NNとし、μn\mu_nをRd\R^d上の Borel 確率測度、その特性関数をφn\varphi_nとする。すべてのt∈Rdt\in\R^dでφn(t)→ψ(t)\varphi_n(t)\to\psi(t)が成り立ち、ψ\psiが原点で連続ならば、(μn)(\mu_n)は緊密である。

証明.eje_jを第jj座標ベクトルとする。第jj周辺分布の特性関数はs↦φn(sej)s\mapsto\varphi_n(se_j)なので、§E11.14 補題 4.2により、任意のδ>0\delta>0について

μn({∣xj∣≥2/δ})≤1δ∫−δδ(1−Re⁡φn(sej)) ds.\mu_n(\{|x_j|\geq2/\delta\}) \leq\frac1\delta\int_{-\delta}^{\delta} \bigl(1-\operatorname{Re}\varphi_n(se_j)\bigr)\,ds.

ψ(0)=1\psi(0)=1である。ψ\psiの原点での連続性から、任意のη>0\eta>0に対しδ\deltaを十分小さく取れば、すべてのj=1,…,dj=1,\ldots,dについて

1δ∫−δδ(1−Re⁡ψ(sej)) ds<η2d\frac1\delta\int_{-\delta}^{\delta} \bigl(1-\operatorname{Re}\psi(se_j)\bigr)\,ds<\frac{\eta}{2d}

となる。有限区間上の優収束定理により、十分大きいnnでは各周辺の表示した尾部確率はη/d\eta/d未満である。事象の包含

{∥x∥≥2d/δ}⊆⋃j=1d{∣xj∣≥2/δ}\{\|x\|\geq2\sqrt d/\delta\} \subseteq\bigcup_{j=1}^d\{|x_j|\geq2/\delta\}

から、十分大きいnnに対して左辺の測度はη\eta未満である。残る有限個の測度について半径を大きくすれば、列全体について同じ尾部評価を得る。▨

定理 3.5 (Lévy の連続性定理).d∈N≥1d\in\NNとし、μn\mu_nをRd\R^d上の Borel 確率測度、その特性関数をφn\varphi_nとする。

  1. Borel 確率測度μ\muに対してμn⇒μ\mu_n\Rightarrow\muならば、すべてのt∈Rdt\in\R^dでφn(t)→μ^(t)\varphi_n(t)\to\widehat\mu(t)である。
  2. すべてのt∈Rdt\in\R^dでφn(t)→ψ(t)\varphi_n(t)\to\psi(t)が成り立ち、ψ\psiが原点で連続ならば、Borel 確率測度μ\muが一意に存在してψ=μ^\psi=\widehat\muかつμn⇒μ\mu_n\Rightarrow\muとなる。

証明.(1)を示す。x↦eit⊤xx\mapsto e^{it^\top x}の実部と虚部は有界連続であるから、分布収束の定義を両者に適用すればよい。

(2)を示す。補題 3.4により(μn)(\mu_n)は緊密であり、補題 3.3によって分布収束する部分列が存在する。その極限をμ\muとすると、(1)からμ^=ψ\widehat\mu=\psiである。定理 2.4により、この特性関数をもつ Borel 確率測度は一意である。

全列がμ\muに分布収束しないと仮定すると、有界連続関数ff、a>0a>0および部分列(μnj)(\mu_{n_j})が存在して、すべてのjjについて

∣∫f dμnj−∫f dμ∣≥a\left|\int f\,d\mu_{n_j}-\int f\,d\mu\right|\geq a

となる。この部分列も緊密なので、さらに分布収束する部分列を持つ。その極限をν\nuとすると、(1)と仮定の各点収束からν^=ψ=μ^\widehat\nu=\psi=\widehat\muである。一意性によりν=μ\nu=\muなので、この部分列上では表示した絶対差が00に収束する。すべての項でaa以上であることと矛盾する。したがってμn⇒μ\mu_n\Rightarrow\muである。▨

4 一次元射影と中心極限定理

定理 4.1 (Cramér–Wold の定理).d∈N≥1d\in\NNとし、Xn,XX_n,XをRd\R^d値確率ベクトルとする。次の二条件は同値である。

  1. Xn⇒XX_n\Rightarrow Xである。
  2. すべてのt∈Rdt\in\R^dに対してt⊤Xn⇒t⊤Xt^\top X_n\Rightarrow t^\top Xである。

証明.(1)⇒\Rightarrow(2)は、連続写像x↦t⊤xx\mapsto t^\top xに定理 1.3を適用すれば従う。

(2)⇒\Rightarrow(1)を示す。各ttについて、実確率変数t⊤Xnt^\top X_nの分布収束から

φXn(t)=E[ei(t⊤Xn)]⟶E[ei(t⊤X)]=φX(t)\varphi_{X_n}(t)=E[e^{i(t^\top X_n)}]\longrightarrow E[e^{i(t^\top X)}]=\varphi_X(t)

である。φX\varphi_Xは原点で連続なので、定理 3.5 (2)と定理 2.4からXn⇒XX_n\Rightarrow Xを得る。▨

例 4.2.G∼N(0,1)G\sim N(0,1)とし、Xn=(G,(−1)nG)⊤X_n=(G,(-1)^nG)^\topとおく。どちらの成分も各nnでN(0,1)N(0,1)に従うが、(Xn)(X_n)は分布収束しない。実際、有界連続関数f(x,y)=cos⁡(x−y)f(x,y)=\cos(x-y)に対して

E[f(Xn)]={1,n が偶数のとき,e−2,n が奇数のときE[f(X_n)]= \begin{cases} 1,&n\text{ が偶数のとき},\\ e^{-2},&n\text{ が奇数のとき} \end{cases}

である。奇数の場合の値は§E11.16 命題 1.1の引数を22として得られる。期待値が収束しないので、分布収束の定義を満たさない。Cramér–Wold の定理では、座標への射影だけでなくすべての線形結合の収束を仮定する必要がある。

定理 4.3 (多変量中心極限定理).d∈N≥1d\in\NNとし、X1,X2,…X_1,X_2,\ldotsを独立同分布なRd\R^d値確率ベクトルとする。E[∥X1∥2]<∞E[\|X_1\|^2]<\inftyを仮定し、

m=E[X1],Σ=E[(X1−m)(X1−m)⊤],X‾n=1n∑j=1nXjm=E[X_1],\qquad \Sigma=E[(X_1-m)(X_1-m)^\top],\qquad \overline X_n=\frac1n\sum_{j=1}^nX_j

とおく。このとき

n(X‾n−m)=1n∑j=1n(Xj−m)⇒Nd(0,Σ)\sqrt n(\overline X_n-m) =\frac1{\sqrt n}\sum_{j=1}^n(X_j-m) \Rightarrow N_d(0,\Sigma)

である。共分散行列Σ\Sigmaが正定値であることは仮定しない。

証明.§E11.6 定理 3.2によりΣ\Sigmaは対称半正定値であるから、§E11.10 定理 4.2によって分布Nd(0,Σ)N_d(0,\Sigma)が存在する。この分布に従う確率ベクトルをZZとする。t∈Rdt\in\R^dを固定し、Yj=t⊤(Xj−m)Y_j=t^\top(X_j-m)およびs2=t⊤Σts^2=t^\top\Sigma tとおく。(Yj)(Y_j)は独立同分布であり、期待値と有限和の交換からE[Yj]=0E[Y_j]=0、E[Yj2]=s2<∞E[Y_j^2]=s^2<\inftyである。

s2>0s^2>0ならば、一次元中心極限定理§E11.16 定理 2.1によりn−1/2∑j=1nYj/s⇒N(0,1)n^{-1/2}\sum_{j=1}^nY_j/s\Rightarrow N(0,1)である。命題 1.2と定理 1.3を用いてss倍すると、

1n∑j=1nYj⇒N(0,s2)\frac1{\sqrt n}\sum_{j=1}^nY_j\Rightarrow N(0,s^2)

を得る。s2=0s^2=0ならばE[Yj2]=0E[Y_j^2]=0なので各YjY_jはほとんど確実に00であり、各有限和の分布はN(0,0)N(0,0)である。したがって、表示した分布収束はこの場合にも成り立つ。

§E11.10 定理 4.2によりt⊤Z∼N(0,t⊤Σt)t^\top Z\sim N(0,t^\top\Sigma t)である。すべてのttで射影の分布収束を得たので、定理 4.1により結論が従う。▨

例 4.4 (多項度数の極限).r≥2r\geq2とし、p1,…,pr≥0p_1,\ldots,p_r\geq0、∑i=1rpi=1\sum_{i=1}^rp_i=1とする。独立同分布な変数J1,J2,…J_1,J_2,\ldotsがP(Jj=i)=piP(J_j=i)=p_iを満たすとき、Xj=eJjX_j=e_{J_j}とおく。ただしeie_iはRr\R^rの第ii座標ベクトルである。∑j=1nXj=(Nn,1,…,Nn,r)⊤\sum_{j=1}^nX_j=(N_{n,1},\ldots,N_{n,r})^\topは、各種類の出現回数を並べたベクトルである。p=(p1,…,pr)⊤p=(p_1,\ldots,p_r)^\topと書くと、

E[Xj]=p,E[XjXj⊤]=diag⁡(p1,…,pr),Σ=diag⁡(p1,…,pr)−pp⊤E[X_j]=p,\qquad E[X_jX_j^\top]=\operatorname{diag}(p_1,\ldots,p_r), \qquad \Sigma=\operatorname{diag}(p_1,\ldots,p_r)-pp^\top

である。定理 4.3により

(Nn,1,…,Nn,r)⊤−npn⇒Nr(0,Σ).\frac{(N_{n,1},\ldots,N_{n,r})^\top-np}{\sqrt n} \Rightarrow N_r(0,\Sigma).

1=(1,…,1)⊤\mathbf1=(1,\ldots,1)^\topとするとΣ1=0\Sigma\mathbf1=0なので、極限の共分散行列は特異である。実際、左辺の成分の和は常に00であり、極限のZ∼Nr(0,Σ)Z\sim N_r(0,\Sigma)でも1⊤Z∼N(0,0)\mathbf1^\top Z\sim N(0,0)である。各種類の度数を同時に扱うには、この退化を含める必要がある。

5 確率収束と Slutsky の定理

定義 5.1.d∈N≥1d\in\NNとし、Xn,XX_n,Xを一つの確率空間上のRd\R^d値確率ベクトルとする。任意のε>0\varepsilon>0に対して

P(∥Xn−X∥>ε)⟶0P(\|X_n-X\|>\varepsilon)\longrightarrow0

となるとき、XnX_nはXXに確率収束する (converge in probability) といい、Xn→PXX_n\xrightarrow{P}Xと書く。

命題 5.2.d∈N≥1d\in\NNとし、Xn,XX_n,Xを一つの確率空間上のRd\R^d値確率ベクトルとする。Xn→PXX_n\xrightarrow{P}Xであるための必要十分条件は、各i=1,…,di=1,\ldots,dについてXn,i→PXiX_{n,i}\xrightarrow{P}X_iが成り立つことである。

証明. 任意のε>0\varepsilon>0と各iiに対して

P(∣Xn,i−Xi∣>ε)≤P(∥Xn−X∥>ε)≤∑j=1dP(∣Xn,j−Xj∣>ε/d)P(|X_{n,i}-X_i|>\varepsilon) \leq P(\|X_n-X\|>\varepsilon) \leq\sum_{j=1}^dP(|X_{n,j}-X_j|>\varepsilon/\sqrt d)

であるから、両方向の含意を得る。▨

定理 5.3 (Slutsky の定理).d,q∈N≥1d,q\in\NNとし、Xn,YnX_n,Y_nを一つの確率空間上の、それぞれRd\R^d値、Rq\R^q値の確率ベクトルとする。Rd\R^d値確率ベクトルXXと定数c∈Rqc\in\R^qに対して

Xn⇒X,Yn→PcX_n\Rightarrow X,\qquad Y_n\xrightarrow{P}c

ならば

(Xn,Yn)⇒(X,c)(X_n,Y_n)\Rightarrow(X,c)

である。したがって、任意のk∈N≥1k\in\NNと連続写像g:Rd+q→Rkg:\R^{d+q}\to\R^kに対してg(Xn,Yn)⇒g(X,c)g(X_n,Y_n)\Rightarrow g(X,c)が成り立つ。XnX_nとYnY_nの独立性は仮定しない。

証明.h:Rd+q→Rh:\R^{d+q}\to\Rを有界連続関数とし、M=∥h∥∞M=\|h\|_\inftyとおく。任意のη>0\eta>0に対して、補題 3.2により

sup⁡nP(∥Xn∥>R)<η\sup_nP(\|X_n\|>R)<\eta

となるRRを取る。hhはコンパクト集合{(x,y):∥x∥≤R, ∥y−c∥≤1}\{(x,y):\|x\|\leq R,\ \|y-c\|\leq1\}上で一様連続なので、任意のα>0\alpha>0に対し0<δ<10<\delta<1を選び、∥x∥≤R\|x\|\leq R、∥y−c∥≤δ\|y-c\|\leq\deltaならば∣h(x,y)−h(x,c)∣<α|h(x,y)-h(x,c)|<\alphaとすることができる。よって

∣E[h(Xn,Yn)]−E[h(Xn,c)]∣≤α+2M(P(∥Xn∥>R)+P(∥Yn−c∥>δ)).\bigl|E[h(X_n,Y_n)]-E[h(X_n,c)]\bigr| \leq\alpha+2M\bigl(P(\|X_n\|>R)+P(\|Y_n-c\|>\delta)\bigr).

Yn→PcY_n\xrightarrow{P}cなので、左辺の上極限はα+2Mη\alpha+2M\eta以下である。α,η>0\alpha,\eta>0は任意であるから左辺は00に収束する。一方、x↦h(x,c)x\mapsto h(x,c)は有界連続なので、Xn⇒XX_n\Rightarrow XからE[h(Xn,c)]→E[h(X,c)]E[h(X_n,c)]\to E[h(X,c)]である。したがって(Xn,Yn)⇒(X,c)(X_n,Y_n)\Rightarrow(X,c)を得る。ggに関する結論は定理 1.3により従う。▨

系 5.4.d∈N≥1d\in\NNとし、Xn,bnX_n,b_nをRd\R^d値、ana_nを実数値の、一つの確率空間上の確率変数とする。Xn⇒XX_n\Rightarrow X、an→Pa∈Ra_n\xrightarrow{P}a\in\R、bn→Pb∈Rdb_n\xrightarrow{P}b\in\R^dならば

anXn+bn⇒aX+b.a_nX_n+b_n\Rightarrow aX+b.

特にXn+bn⇒X+bX_n+b_n\Rightarrow X+b、anXn⇒aXa_nX_n\Rightarrow aXであり、d=1d=1では実確率変数の和と積の結論を含む。

証明.命題 5.2により(an,bn)→P(a,b)(a_n,b_n)\xrightarrow{P}(a,b)である。定理 5.3を連続写像(x,a,b)↦ax+b(x,a,b)\mapsto ax+bに適用すればよい。▨

系 5.5.d,k∈N≥1d,k\in\NNとし、一つの確率空間上の確率ベクトルXn∈RdX_n\in\R^d、bn∈Rkb_n\in\R^kおよび確率行列An∈Rk×dA_n\in\R^{k\times d}を考える。Xn⇒XX_n\Rightarrow X、bn→Pb∈Rkb_n\xrightarrow{P}b\in\R^kとし、AnA_nの各成分が定数行列A∈Rk×dA\in\R^{k\times d}の対応する成分へ確率収束すると仮定する。このとき

AnXn+bn⇒AX+b.A_nX_n+b_n\Rightarrow AX+b.

特にX∼Nd(m,Σ)X\sim N_d(m,\Sigma)ならば

AnXn+bn⇒Nk(Am+b,AΣA⊤).A_nX_n+b_n\Rightarrow N_k(Am+b,A\Sigma A^\top).

独立性、AAの可逆性および共分散行列の正定値性は仮定しない。

証明. 行列の成分を固定した順に並べると、命題 5.2により(An,bn)→P(A,b)(A_n,b_n)\xrightarrow{P}(A,b)である。写像(x,A,b)↦Ax+b(x,A,b)\mapsto Ax+bは各成分が多項式なので連続であり、定理 5.3から最初の結論を得る。X∼Nd(m,Σ)X\sim N_d(m,\Sigma)の場合は、命題 2.2 (2)と命題 2.2 (4)により

φAX+b(t)=exp⁡(it⊤(Am+b)−12t⊤AΣA⊤t)\varphi_{AX+b}(t) =\exp\left(it^\top(Am+b)-\frac12t^\top A\Sigma A^\top t\right)

である。定理 2.4から後半の結論が従う。▨

6 演習

問題 6.1.d∈N≥1d\in\NN、G∼Nd(0,Id)G\sim N_d(0,I_d)とし、Xn=nGX_n=nGとおく。φXn\varphi_{X_n}が各点収束することを示し、その極限を求めよ。さらに、(Xn)(X_n)が分布収束しないことを示せ。

解答.

命題 2.2 (4)により

φXn(t)=e−n2∥t∥2/2⟶ψ(t):={1,t=0,0,t≠0.\varphi_{X_n}(t)=e^{-n^2\|t\|^2/2}\longrightarrow \psi(t):= \begin{cases} 1,&t=0,\\ 0,&t\neq0. \end{cases}

もしXn⇒μX_n\Rightarrow\muならば、定理 3.5 (1)からμ^=ψ\widehat\mu=\psiとなる。しかしψ\psiは原点で不連続であり、命題 2.2 (1)に反する。したがって(Xn)(X_n)は分布収束しない。▨

問題 6.2.d∈N≥1d\in\NN、Σ∈Rd×d\Sigma\in\R^{d\times d}を対称正定値行列とする。同じ確率空間上のRd\R^d値確率ベクトルXnX_nと確率行列Bn∈Rd×dB_n\in\R^{d\times d}がXn⇒Nd(0,Σ)X_n\Rightarrow N_d(0,\Sigma)を満たし、BnB_nの各成分がΣ−1\Sigma^{-1}の対応する成分へ確率収束すると仮定する。独立な標準正規変数G1,…,GdG_1,\ldots,G_dに対して

Xn⊤BnXn⇒∑j=1dGj2X_n^\top B_nX_n\Rightarrow\sum_{j=1}^dG_j^2

であることを示せ。XnX_nとBnB_nの独立性は仮定しない。

解答.

Z∼Nd(0,Σ)Z\sim N_d(0,\Sigma)とする。定理 5.3を連続写像(x,B)↦x⊤Bx(x,B)\mapsto x^\top Bxに適用すると、Xn⊤BnXn⇒Z⊤Σ−1ZX_n^\top B_nX_n\Rightarrow Z^\top\Sigma^{-1}Zである。対称正定値平方根C=Σ1/2C=\Sigma^{1/2}を取り、G=(G1,…,Gd)⊤G=(G_1,\ldots,G_d)^\topと書く。§E11.10 定理 4.2によりZZとCGCGの分布は等しい。C⊤=CC^\top=C、C2=ΣC^2=\SigmaからC⊤Σ−1C=IdC^\top\Sigma^{-1}C=I_dなので、

(CG)⊤Σ−1(CG)=G⊤G=∑j=1dGj2.(CG)^\top\Sigma^{-1}(CG)=G^\top G=\sum_{j=1}^dG_j^2.

したがって求める分布収束を得る。▨

参考文献

  1. Rick Durrett, Probability: Theory and Examples, 5th ed., Cambridge University Press, Cambridge, 2019.Euclid 空間上の分布収束、Cramér–Wold の定理および多変量中心極限定理の定式化を参考にした。

前提記事

9 本の記事・単元を表示