1 分布収束と連続写像
定義 1.1. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とし、μ n , μ \mu_n,\mu μ n , μ をR d \R^d R d 上の Borel 確率測度とする。すべての有界連続関数f : R d → R f:\R^d\to\R f : R d → R に対して
∫ R d f d μ n ⟶ ∫ R d f d μ \int_{\R^d}f\,d\mu_n\longrightarrow\int_{\R^d}f\,d\mu ∫ R d f d μ n ⟶ ∫ R d f d μ が成り立つとき、μ n \mu_n μ n はμ \mu μ に弱収束する (converge weakly ) といい、μ n ⇒ μ \mu_n\Rightarrow\mu μ n ⇒ μ と書く。確率ベクトルX n , X X_n,X X n , X の分布がμ n , μ \mu_n,\mu μ n , μ であるとき、この収束をX n X_n X n のX X X への分布収束 (convergence in distribution of random vectors ) といい、X n ⇒ X X_n\Rightarrow X X n ⇒ X と書く。X n X_n X n とX X X を同じ確率空間上で定義する必要はない。X X X の分布だけを指定するときはX n ⇒ μ X_n\Rightarrow\mu X n ⇒ μ とも書く。
命題 1.2. μ n , μ \mu_n,\mu μ n , μ をR \R R 上の Borel 確率測度とし、その分布関数をF n , F F_n,F F n , F とする。μ n ⇒ μ \mu_n\Rightarrow\mu μ n ⇒ μ であるための必要十分条件は、F F F のすべての連続点a ∈ R a\in\R a ∈ R でF n ( a ) → F ( a ) F_n(a)\to F(a) F n ( a ) → F ( a ) が成り立つことである。したがって、一次元では§E11.12 定義 1.3 の分布収束と一致する。
証明. μ n ⇒ μ \mu_n\Rightarrow\mu μ n ⇒ μ とし、F F F の連続点a a a とδ > 0 \delta>0 δ > 0 に対して
ℓ δ ( x ) = min { 1 , max { 0 , a − x δ } } , u δ ( x ) = ℓ δ ( x − δ ) \ell_\delta(x)=\min\left\{1,\max\left\{0,\frac{a-x}{\delta}\right\}\right\},
\qquad u_\delta(x)=\ell_\delta(x-\delta) ℓ δ ( x ) = min { 1 , max { 0 , δ a − x } } , u δ ( x ) = ℓ δ ( x − δ ) とおく。両関数は有界連続であり、
1 ( − ∞ , a − δ ] ≤ ℓ δ ≤ 1 ( − ∞ , a ] ≤ u δ ≤ 1 ( − ∞ , a + δ ] \mathbf1_{(-\infty,a-\delta]}\leq\ell_\delta
\leq\mathbf1_{(-\infty,a]}
\leq u_\delta\leq\mathbf1_{(-\infty,a+\delta]} 1 ( − ∞ , a − δ ] ≤ ℓ δ ≤ 1 ( − ∞ , a ] ≤ u δ ≤ 1 ( − ∞ , a + δ ] である。μ n \mu_n μ n に関して積分し、n → ∞ n\to\infty n → ∞ とすると、
F ( a − δ ) ≤ lim inf n F n ( a ) ≤ lim sup n F n ( a ) ≤ F ( a + δ ) F(a-\delta)\leq\liminf_n F_n(a)
\leq\limsup_n F_n(a)\leq F(a+\delta) F ( a − δ ) ≤ n lim inf F n ( a ) ≤ n lim sup F n ( a ) ≤ F ( a + δ ) を得る。δ ↓ 0 \delta\downarrow0 δ ↓ 0 とF F F のa a a における連続性からF n ( a ) → F ( a ) F_n(a)\to F(a) F n ( a ) → F ( a ) である。逆向きは§E11.14 補題 4.1 により従う。▨
定理 1.3 (連続写像定理). d , k ∈ N ≥ 1 d,k\in\NN d , k ∈ N ≥ 1 とし、X n ⇒ X X_n\Rightarrow X X n ⇒ X を満たすR d \R^d R d 値確率ベクトルと、連続写像g : R d → R k g:\R^d\to\R^k g : R d → R k を考える。このときg ( X n ) ⇒ g ( X ) g(X_n)\Rightarrow g(X) g ( X n ) ⇒ g ( X ) である。
証明. 任意の有界連続関数h : R k → R h:\R^k\to\R h : R k → R に対してh ∘ g h\circ g h ∘ g は有界連続であるから、
E [ h ( g ( X n ) ) ] ⟶ E [ h ( g ( X ) ) ] E[h(g(X_n))]\longrightarrow E[h(g(X))] E [ h ( g ( X n ))] ⟶ E [ h ( g ( X ))] である。▨
2 特性関数と反転公式
定義 2.1. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とし、μ \mu μ をR d \R^d R d 上の Borel 確率測度とする。μ \mu μ の特性関数 (characteristic function of a random vector ) を
μ ^ ( t ) = ∫ R d e i t ⊤ x μ ( d x ) ( t ∈ R d ) \widehat\mu(t)=\int_{\R^d}e^{it^\top x}\,\mu(dx)
\qquad(t\in\R^d) μ ( t ) = ∫ R d e i t ⊤ x μ ( d x ) ( t ∈ R d ) によって定める。X X X の分布がμ \mu μ であるときはφ X = μ ^ \varphi_X=\widehat\mu φ X = μ と書く。
命題 2.2. d , k ∈ N ≥ 1 d,k\in\NN d , k ∈ N ≥ 1 とする。確率ベクトルの特性関数について次が成り立つ。
R d \R^d R d 上の Borel 確率測度の特性関数φ \varphi φ は一様連続であり、すべてのt ∈ R d t\in\R^d t ∈ R d に対して
φ ( 0 ) = 1 , ∣ φ ( t ) ∣ ≤ 1 , φ ( − t ) = φ ( t ) ‾ \varphi(0)=1,\qquad |\varphi(t)|\leq1,\qquad
\varphi(-t)=\overline{\varphi(t)} φ ( 0 ) = 1 , ∣ φ ( t ) ∣ ≤ 1 , φ ( − t ) = φ ( t )
を満たす。
X X X がR d \R^d R d 値、A ∈ R k × d A\in\R^{k\times d} A ∈ R k × d 、b ∈ R k b\in\R^k b ∈ R k ならば、
φ A X + b ( t ) = e i t ⊤ b φ X ( A ⊤ t ) ( t ∈ R k ) \varphi_{AX+b}(t)=e^{it^\top b}\varphi_X(A^\top t)
\qquad(t\in\R^k) φ A X + b ( t ) = e i t ⊤ b φ X ( A ⊤ t ) ( t ∈ R k )
である。
X 1 , … , X r X_1,\ldots,X_r X 1 , … , X r が独立なR d \R^d R d 値確率ベクトルならば、
φ X 1 + ⋯ + X r ( t ) = ∏ j = 1 r φ X j ( t ) ( t ∈ R d ) \varphi_{X_1+\cdots+X_r}(t)=\prod_{j=1}^r\varphi_{X_j}(t)
\qquad(t\in\R^d) φ X 1 + ⋯ + X r ( t ) = j = 1 ∏ r φ X j ( t ) ( t ∈ R d )
である。
X ∼ N d ( m , Σ ) X\sim N_d(m,\Sigma) X ∼ N d ( m , Σ ) ならば、
φ X ( t ) = exp ( i t ⊤ m − 1 2 t ⊤ Σ t ) ( t ∈ R d ) \varphi_X(t)=\exp\left(it^\top m-\frac12t^\top\Sigma t\right)
\qquad(t\in\R^d) φ X ( t ) = exp ( i t ⊤ m − 2 1 t ⊤ Σ t ) ( t ∈ R d )
である。Σ \Sigma Σ は半正定値でよい。
証明. (1) を示す。X X X の分布をμ \mu μ とすると、
sup t ∈ R d ∣ φ X ( t + h ) − φ X ( t ) ∣ ≤ ∫ R d ∣ e i h ⊤ x − 1 ∣ μ ( d x ) \sup_{t\in\R^d}|\varphi_X(t+h)-\varphi_X(t)|
\leq\int_{\R^d}|e^{ih^\top x}-1|\,\mu(dx) t ∈ R d sup ∣ φ X ( t + h ) − φ X ( t ) ∣ ≤ ∫ R d ∣ e i h ⊤ x − 1∣ μ ( d x ) である。h → 0 h\to0 h → 0 のとき被積分関数は各点で0 0 0 に収束し、2 2 2 以下であるから、優収束定理§E9.7 定理 3.2 により右辺は0 0 0 に収束する。原点での値、絶対値の上界および共役の等式は、指数関数の対応する性質を積分して得られる。
(2) を示す。等式t ⊤ ( A X + b ) = ( A ⊤ t ) ⊤ X + t ⊤ b t^\top(AX+b)=(A^\top t)^\top X+t^\top b t ⊤ ( A X + b ) = ( A ⊤ t ) ⊤ X + t ⊤ b を指数関数に代入して期待値を取ればよい。
(3) を示す。固定したt ∈ R d t\in\R^d t ∈ R d に対して、t ⊤ X 1 , … , t ⊤ X r t^\top X_1,\ldots,t^\top X_r t ⊤ X 1 , … , t ⊤ X r は独立な実確率変数である。§E11.14 命題 1.3 をこれらの変数に適用し、特性関数の引数を1 1 1 とすれば表示式を得る。
(4) を示す。§E11.10 定理 4.2 により、t ⊤ X t^\top X t ⊤ X の分布はt ⊤ m + t ⊤ Σ t G t^\top m+\sqrt{t^\top\Sigma t}\,G t ⊤ m + t ⊤ Σ t G の分布に等しい。ただしG ∼ N ( 0 , 1 ) G\sim N(0,1) G ∼ N ( 0 , 1 ) である。§E11.16 命題 1.1 から
E [ e i t ⊤ X ] = e i t ⊤ m E [ e i t ⊤ Σ t G ] = exp ( i t ⊤ m − 1 2 t ⊤ Σ t ) E[e^{it^\top X}]
=e^{it^\top m}E[e^{i\sqrt{t^\top\Sigma t}\,G}]
=\exp\left(it^\top m-\frac12t^\top\Sigma t\right) E [ e i t ⊤ X ] = e i t ⊤ m E [ e i t ⊤ Σ t G ] = exp ( i t ⊤ m − 2 1 t ⊤ Σ t ) を得る。この等式はt ⊤ Σ t = 0 t^\top\Sigma t=0 t ⊤ Σ t = 0 の場合にも成り立つ。▨
定理 2.3 (Gauss 核による反転公式). d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 、ε > 0 \varepsilon>0 ε > 0 とし、R d \R^d R d 上の Borel 確率測度μ \mu μ とγ ε = N d ( 0 , ε I d ) \gamma_\varepsilon=N_d(0,\varepsilon I_d) γ ε = N d ( 0 , ε I d ) の畳み込みをμ ε \mu_\varepsilon μ ε とする。すなわち、μ ε \mu_\varepsilon μ ε は分布μ \mu μ 、γ ε \gamma_\varepsilon γ ε をもつ独立なベクトルの和の分布である。μ ε \mu_\varepsilon μ ε は連続な密度
p μ , ε ( x ) = 1 ( 2 π ) d ∫ R d e − i t ⊤ x μ ^ ( t ) e − ε ∥ t ∥ 2 / 2 d t p_{\mu,\varepsilon}(x)
=\frac1{(2\pi)^d}\int_{\R^d}
e^{-it^\top x}\widehat\mu(t)e^{-\varepsilon\|t\|^2/2}\,dt p μ , ε ( x ) = ( 2 π ) d 1 ∫ R d e − i t ⊤ x μ ( t ) e − ε ∥ t ∥ 2 /2 d t をもつ。右辺は絶対収束する。任意の有界連続関数f : R d → R f:\R^d\to\R f : R d → R に対して
∫ R d f d μ = lim ε ↓ 0 ∫ R d f ( x ) p μ , ε ( x ) d x \int_{\R^d}f\,d\mu
=\lim_{\varepsilon\downarrow0}\int_{\R^d}f(x)p_{\mu,\varepsilon}(x)\,dx ∫ R d f d μ = ε ↓ 0 lim ∫ R d f ( x ) p μ , ε ( x ) d x が成り立つ。
証明. 標準正規分布の特性関数§E11.16 命題 1.1 に変数変換を施すと、u ∈ R u\in\R u ∈ R に対して
1 2 π ∫ R e − i t u e − ε t 2 / 2 d t = 1 2 π ε e − u 2 / ( 2 ε ) \frac1{2\pi}\int_\R e^{-itu}e^{-\varepsilon t^2/2}\,dt
=\frac1{\sqrt{2\pi\varepsilon}}e^{-u^2/(2\varepsilon)} 2 π 1 ∫ R e − i t u e − ε t 2 /2 d t = 2 π ε 1 e − u 2 / ( 2 ε ) である。各座標について積を取り、絶対可積分な被積分関数へ Fubini の定理§E9.11 定理 3.2 を適用すると、
g ε ( u ) : = 1 ( 2 π ε ) d / 2 e − ∥ u ∥ 2 / ( 2 ε ) = 1 ( 2 π ) d ∫ R d e − i t ⊤ u e − ε ∥ t ∥ 2 / 2 d t g_\varepsilon(u):=\frac1{(2\pi\varepsilon)^{d/2}}
e^{-\|u\|^2/(2\varepsilon)}
=\frac1{(2\pi)^d}\int_{\R^d}e^{-it^\top u}e^{-\varepsilon\|t\|^2/2}\,dt g ε ( u ) := ( 2 π ε ) d /2 1 e − ∥ u ∥ 2 / ( 2 ε ) = ( 2 π ) d 1 ∫ R d e − i t ⊤ u e − ε ∥ t ∥ 2 /2 d t を得る。
Tonelli の定理§E9.11 定理 2.3 により、任意の Borel 集合B ⊆ R d B\subseteq\R^d B ⊆ R d について
μ ε ( B ) = ∫ R d ∫ R d 1 B ( y + z ) g ε ( z ) d z μ ( d y ) = ∫ B ( ∫ R d g ε ( x − y ) μ ( d y ) ) d x \mu_\varepsilon(B)
=\int_{\R^d}\int_{\R^d}\mathbf1_B(y+z)g_\varepsilon(z)\,dz\,\mu(dy)
=\int_B\left(\int_{\R^d}g_\varepsilon(x-y)\,\mu(dy)\right)dx μ ε ( B ) = ∫ R d ∫ R d 1 B ( y + z ) g ε ( z ) d z μ ( d y ) = ∫ B ( ∫ R d g ε ( x − y ) μ ( d y ) ) d x である。したがって、括弧内の関数が密度である。g ε g_\varepsilon g ε の積分表示を代入すると、μ \mu μ の全質量が1 1 1 でありe − ε ∥ t ∥ 2 / 2 e^{-\varepsilon\|t\|^2/2} e − ε ∥ t ∥ 2 /2 が可積分であるため、
Fubini の定理によってy , t y,t y , t の積分順序を交換することができる。よって
∫ R d g ε ( x − y ) μ ( d y ) = 1 ( 2 π ) d ∫ R d e − i t ⊤ x ( ∫ R d e i t ⊤ y μ ( d y ) ) e − ε ∥ t ∥ 2 / 2 d t = p μ , ε ( x ) . \int_{\R^d}g_\varepsilon(x-y)\,\mu(dy)
=\frac1{(2\pi)^d}\int_{\R^d}e^{-it^\top x}
\left(\int_{\R^d}e^{it^\top y}\,\mu(dy)\right)
e^{-\varepsilon\|t\|^2/2}\,dt
=p_{\mu,\varepsilon}(x). ∫ R d g ε ( x − y ) μ ( d y ) = ( 2 π ) d 1 ∫ R d e − i t ⊤ x ( ∫ R d e i t ⊤ y μ ( d y ) ) e − ε ∥ t ∥ 2 /2 d t = p μ , ε ( x ) . 同じ可積分な上界と優収束定理から、p μ , ε p_{\mu,\varepsilon} p μ , ε は連続である。
分布μ \mu μ のX X X と標準正規ベクトルG G G を積確率空間上で独立に取ると、X + ε G X+\sqrt\varepsilon G X + ε G の分布はμ ε \mu_\varepsilon μ ε である。任意の有界連続関数f f f に対してf ( X + ε G ) → f ( X ) f(X+\sqrt\varepsilon G)\to f(X) f ( X + ε G ) → f ( X ) が各点で成り立つ。定数∥ f ∥ ∞ \|f\|_\infty ∥ f ∥ ∞ を上界とする優収束定理により
∫ f ( x ) p μ , ε ( x ) d x = E [ f ( X + ε G ) ] ⟶ E [ f ( X ) ] = ∫ f d μ \int f(x)p_{\mu,\varepsilon}(x)\,dx
=E[f(X+\sqrt\varepsilon G)]\longrightarrow E[f(X)]
=\int f\,d\mu ∫ f ( x ) p μ , ε ( x ) d x = E [ f ( X + ε G )] ⟶ E [ f ( X )] = ∫ f d μ である。▨
定理 2.4. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とする。R d \R^d R d 上の二つの Borel 確率測度が同じ特性関数をもつならば、二つの測度は等しい。
証明. μ ^ = ν ^ \widehat\mu=\widehat\nu μ = ν とすると、定理 2.3 によりすべてのε > 0 \varepsilon>0 ε > 0 でp μ , ε = p ν , ε p_{\mu,\varepsilon}=p_{\nu,\varepsilon} p μ , ε = p ν , ε である。同じ反転公式でε ↓ 0 \varepsilon\downarrow0 ε ↓ 0 とすれば、すべての有界連続関数f f f について∫ f d μ = ∫ f d ν \int f\,d\mu=\int f\,d\nu ∫ f d μ = ∫ f d ν を得る。§E11.10 補題 2.1 によりμ = ν \mu=\nu μ = ν である。▨
3 緊密性と Lévy の連続性定理
定義 3.1. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とする。R d \R^d R d 上の Borel 確率測度の族M \mathcal M M が緊密 (tight ) であるとは、任意のη > 0 \eta>0 η > 0 に対してR > 0 R>0 R > 0 が存在して
sup μ ∈ M μ ( { x ∈ R d : ∥ x ∥ > R } ) < η \sup_{\mu\in\mathcal M}\mu(\{x\in\R^d:\|x\|>R\})<\eta μ ∈ M sup μ ({ x ∈ R d : ∥ x ∥ > R }) < η となることをいう。
補題 3.2. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とし、μ n ⇒ μ \mu_n\Rightarrow\mu μ n ⇒ μ を満たすR d \R^d R d 上の Borel 確率測度列を考える。族{ μ n : n ∈ N ≥ 1 } \{\mu_n:n\in\NN\} { μ n : n ∈ N ≥ 1 } は緊密である。
証明. R > 0 R>0 R > 0 に対してχ R ( x ) = min { 1 , max { 0 , R + 1 − ∥ x ∥ } } \chi_R(x)=\min\{1,\max\{0,R+1-\|x\|\}\} χ R ( x ) = min { 1 , max { 0 , R + 1 − ∥ x ∥ }} とおく。χ R \chi_R χ R は閉球{ ∥ x ∥ ≤ R } \{\|x\|\leq R\} { ∥ x ∥ ≤ R } 上で1 1 1 、{ ∥ x ∥ ≥ R + 1 } \{\|x\|\geq R+1\} { ∥ x ∥ ≥ R + 1 } 上で0 0 0 となる有界連続関数である。χ R → 1 \chi_R\to1 χ R → 1 がR → ∞ R\to\infty R → ∞ で各点収束するので、優収束定理により∫ χ R d μ → 1 \int\chi_R\,d\mu\to1 ∫ χ R d μ → 1 である。任意のη > 0 \eta>0 η > 0 に対して∫ χ R d μ > 1 − η / 2 \int\chi_R\,d\mu>1-\eta/2 ∫ χ R d μ > 1 − η /2 となるR R R を取り、∫ χ R d μ n → ∫ χ R d μ \int\chi_R\,d\mu_n\to\int\chi_R\,d\mu ∫ χ R d μ n → ∫ χ R d μ を用いると、十分大きいn n n について
μ n ( { ∥ x ∥ > R + 1 } ) ≤ 1 − ∫ χ R d μ n < η \mu_n(\{\|x\|>R+1\})\leq1-\int\chi_R\,d\mu_n<\eta μ n ({ ∥ x ∥ > R + 1 }) ≤ 1 − ∫ χ R d μ n < η である。残る有限個のμ n \mu_n μ n については、閉球がR d \R^d R d を増加して覆うことから、半径を共通に大きくして同じ上界を得ることができる。▨
補題 3.3. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とする。R d \R^d R d 上の Borel 確率測度列( μ n ) (\mu_n) ( μ n ) が緊密ならば、
Borel 確率測度μ \mu μ と部分列( μ n j ) (\mu_{n_j}) ( μ n j ) が存在してμ n j ⇒ μ \mu_{n_j}\Rightarrow\mu μ n j ⇒ μ となる。
証明. m ∈ N ≥ 0 m\in\N m ∈ N ≥ 0 、k = ( k 1 , … , k d ) ∈ Z d k=(k_1,\ldots,k_d)\in\Z^d k = ( k 1 , … , k d ) ∈ Z d に対して
Q m , k = ∏ i = 1 d [ 2 − m k i , 2 − m ( k i + 1 ) ) Q_{m,k}=\prod_{i=1}^d[2^{-m}k_i,2^{-m}(k_i+1)) Q m , k = i = 1 ∏ d [ 2 − m k i , 2 − m ( k i + 1 )) とおく。すべての( m , k ) (m,k) ( m , k ) を列挙し、[ 0 , 1 ] [0,1] [ 0 , 1 ] 内の列μ n ( Q m , k ) \mu_n(Q_{m,k}) μ n ( Q m , k ) から収束部分列を順に選出する。対角部分列を取れば、すべての( m , k ) (m,k) ( m , k ) について
μ n j ( Q m , k ) ⟶ p m , k \mu_{n_j}(Q_{m,k})\longrightarrow p_{m,k} μ n j ( Q m , k ) ⟶ p m , k となる。m m m を固定すると、任意の有限集合J ⊆ Z d J\subseteq\Z^d J ⊆ Z d について∑ k ∈ J p m , k ≤ 1 \sum_{k\in J}p_{m,k}\leq1 ∑ k ∈ J p m , k ≤ 1 である。一方、任意のη > 0 \eta>0 η > 0 に対し、緊密性からinf j μ n j ( { ∥ x ∥ ≤ R } ) > 1 − η \inf_j\mu_{n_j}(\{\|x\|\leq R\})>1-\eta inf j μ n j ({ ∥ x ∥ ≤ R }) > 1 − η となるR R R を取る。この閉球と交わるQ m , k Q_{m,k} Q m , k は有限個であり、その添字集合をJ J J とすると∑ k ∈ J p m , k ≥ 1 − η \sum_{k\in J}p_{m,k}\geq1-\eta ∑ k ∈ J p m , k ≥ 1 − η である。したがって、
∑ k ∈ Z d p m , k = 1. \sum_{k\in\Z^d}p_{m,k}=1. k ∈ Z d ∑ p m , k = 1. 各Q m , k Q_{m,k} Q m , k は次の段階の2 d 2^d 2 d 個の立方体の非交和なので、有限和の極限を取ることにより
p m , k = ∑ v ∈ { 0 , 1 } d p m + 1 , 2 k + v p_{m,k}=\sum_{v\in\{0,1\}^d}p_{m+1,2k+v} p m , k = v ∈ { 0 , 1 } d ∑ p m + 1 , 2 k + v も成り立つ。
Z d \Z^d Z d の列挙を一つ固定し、[ 0 , 1 ) [0,1) [ 0 , 1 ) を長さp 0 , k p_{0,k} p 0 , k の半開区間I 0 , k I_{0,k} I 0 , k に順に分割する。長さが0 0 0 の区間は空集合とする。各I m , k I_{m,k} I m , k を、v ∈ { 0 , 1 } d v\in\{0,1\}^d v ∈ { 0 , 1 } d の固定した順に、長さp m + 1 , 2 k + v p_{m+1,2k+v} p m + 1 , 2 k + v の半開区間I m + 1 , 2 k + v I_{m+1,2k+v} I m + 1 , 2 k + v へ分割する。質量の和と整合関係から、各段階の区間は[ 0 , 1 ) [0,1) [ 0 , 1 ) を分割し、子の区間は親の区間に含まれる。u ∈ I m , k u\in I_{m,k} u ∈ I m , k に対してY m ( u ) = 2 − m k Y_m(u)=2^{-m}k Y m ( u ) = 2 − m k と定める。各Y m Y_m Y m は可測であり、Lebesgue 確率空間[ 0 , 1 ) [0,1) [ 0 , 1 ) 上で値2 − m k 2^{-m}k 2 − m k を取る確率はp m , k p_{m,k} p m , k である。
固定したu u u に対応する立方体は入れ子である。l ≥ m l\geq m l ≥ m ならば
∥ Y l ( u ) − Y m ( u ) ∥ ≤ d 2 − m \|Y_l(u)-Y_m(u)\|\leq\sqrt d\,2^{-m} ∥ Y l ( u ) − Y m ( u ) ∥ ≤ d 2 − m であるから、Y m ( u ) Y_m(u) Y m ( u ) はR d \R^d R d の Cauchy 列であり、極限Y ( u ) Y(u) Y ( u ) が存在する。可測関数の各成分の極限としてY Y Y は可測である。その分布をμ \mu μ とする。有界連続関数f : R d → R f:\R^d\to\R f : R d → R に対して、優収束定理から
∑ k ∈ Z d f ( 2 − m k ) p m , k = E [ f ( Y m ) ] ⟶ E [ f ( Y ) ] = ∫ f d μ \sum_{k\in\Z^d}f(2^{-m}k)p_{m,k}
=E[f(Y_m)]\longrightarrow E[f(Y)]=\int f\,d\mu k ∈ Z d ∑ f ( 2 − m k ) p m , k = E [ f ( Y m )] ⟶ E [ f ( Y )] = ∫ f d μ が成り立つ。
q m ( x ) = 2 − m k q_m(x)=2^{-m}k q m ( x ) = 2 − m k をx ∈ Q m , k x\in Q_{m,k} x ∈ Q m , k によって定める。固定したm m m について、∑ k p m , k = 1 \sum_k p_{m,k}=1 ∑ k p m , k = 1 と質量の各点収束から
∑ k ∈ Z d ∣ μ n j ( Q m , k ) − p m , k ∣ ⟶ 0 ( j → ∞ ) \sum_{k\in\Z^d}\left|\mu_{n_j}(Q_{m,k})-p_{m,k}\right|\longrightarrow0
\qquad(j\to\infty) k ∈ Z d ∑ μ n j ( Q m , k ) − p m , k ⟶ 0 ( j → ∞ ) である。実際、有限集合J J J を∑ k ∉ J p m , k < η \sum_{k\notin J}p_{m,k}<\eta ∑ k ∈ / J p m , k < η となるように取り、J J J 上で極限を取れば、十分大きいj j j について∑ k ∉ J μ n j ( Q m , k ) < 2 η \sum_{k\notin J}\mu_{n_j}(Q_{m,k})<2\eta ∑ k ∈ / J μ n j ( Q m , k ) < 2 η となる。J J J 上の絶対差の和は0 0 0 に収束し、J J J 外の絶対差の和は3 η 3\eta 3 η 未満である。よって
∫ f ∘ q m d μ n j ⟶ E [ f ( Y m ) ] ( j → ∞ ) . \int f\circ q_m\,d\mu_{n_j}\longrightarrow E[f(Y_m)]
\qquad(j\to\infty). ∫ f ∘ q m d μ n j ⟶ E [ f ( Y m )] ( j → ∞ ) . M = ∥ f ∥ ∞ M=\|f\|_\infty M = ∥ f ∥ ∞ とする。任意のη > 0 \eta>0 η > 0 に対して緊密性によりsup j μ n j ( { ∥ x ∥ > R } ) < η \sup_j\mu_{n_j}(\{\|x\|>R\})<\eta sup j μ n j ({ ∥ x ∥ > R }) < η となるR R R を取る。∥ q m ( x ) − x ∥ ≤ d 2 − m \|q_m(x)-x\|\leq\sqrt d\,2^{-m} ∥ q m ( x ) − x ∥ ≤ d 2 − m なので、f f f の閉球{ ∥ x ∥ ≤ R + d } \{\|x\|\leq R+\sqrt d\} { ∥ x ∥ ≤ R + d } 上の一様連続性から
ω m : = sup ∥ x ∥ ≤ R ∣ f ( q m ( x ) ) − f ( x ) ∣ ⟶ 0. \omega_m:=\sup_{\|x\|\leq R}|f(q_m(x))-f(x)|\longrightarrow0. ω m := ∥ x ∥ ≤ R sup ∣ f ( q m ( x )) − f ( x ) ∣ ⟶ 0. したがって、すべてのj , m j,m j , m について
∣ ∫ f ∘ q m d μ n j − ∫ f d μ n j ∣ ≤ ω m + 2 M η . \left|\int f\circ q_m\,d\mu_{n_j}-\int f\,d\mu_{n_j}\right|
\leq\omega_m+2M\eta. ∫ f ∘ q m d μ n j − ∫ f d μ n j ≤ ω m + 2 M η . 三角不等式を用い、j → ∞ j\to\infty j → ∞ 、m → ∞ m\to\infty m → ∞ の順に極限を取ると、
lim sup j ∣ ∫ f d μ n j − ∫ f d μ ∣ ≤ 2 M η \limsup_j\left|\int f\,d\mu_{n_j}-\int f\,d\mu\right|\leq2M\eta j lim sup ∫ f d μ n j − ∫ f d μ ≤ 2 M η を得る。η > 0 \eta>0 η > 0 は任意なので、μ n j ⇒ μ \mu_{n_j}\Rightarrow\mu μ n j ⇒ μ である。▨
補題 3.4. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とし、μ n \mu_n μ n をR d \R^d R d 上の Borel 確率測度、その特性関数をφ n \varphi_n φ n とする。すべてのt ∈ R d t\in\R^d t ∈ R d でφ n ( t ) → ψ ( t ) \varphi_n(t)\to\psi(t) φ n ( t ) → ψ ( t ) が成り立ち、ψ \psi ψ が原点で連続ならば、( μ n ) (\mu_n) ( μ n ) は緊密である。
証明. e j e_j e j を第j j j 座標ベクトルとする。第j j j 周辺分布の特性関数はs ↦ φ n ( s e j ) s\mapsto\varphi_n(se_j) s ↦ φ n ( s e j ) なので、§E11.14 補題 4.2 により、任意のδ > 0 \delta>0 δ > 0 について
μ n ( { ∣ x j ∣ ≥ 2 / δ } ) ≤ 1 δ ∫ − δ δ ( 1 − Re φ n ( s e j ) ) d s . \mu_n(\{|x_j|\geq2/\delta\})
\leq\frac1\delta\int_{-\delta}^{\delta}
\bigl(1-\operatorname{Re}\varphi_n(se_j)\bigr)\,ds. μ n ({ ∣ x j ∣ ≥ 2/ δ }) ≤ δ 1 ∫ − δ δ ( 1 − Re φ n ( s e j ) ) d s . ψ ( 0 ) = 1 \psi(0)=1 ψ ( 0 ) = 1 である。ψ \psi ψ の原点での連続性から、任意のη > 0 \eta>0 η > 0 に対しδ \delta δ を十分小さく取れば、すべてのj = 1 , … , d j=1,\ldots,d j = 1 , … , d について
1 δ ∫ − δ δ ( 1 − Re ψ ( s e j ) ) d s < η 2 d \frac1\delta\int_{-\delta}^{\delta}
\bigl(1-\operatorname{Re}\psi(se_j)\bigr)\,ds<\frac{\eta}{2d} δ 1 ∫ − δ δ ( 1 − Re ψ ( s e j ) ) d s < 2 d η となる。有限区間上の優収束定理により、十分大きいn n n では各周辺の表示した尾部確率はη / d \eta/d η / d 未満である。事象の包含
{ ∥ x ∥ ≥ 2 d / δ } ⊆ ⋃ j = 1 d { ∣ x j ∣ ≥ 2 / δ } \{\|x\|\geq2\sqrt d/\delta\}
\subseteq\bigcup_{j=1}^d\{|x_j|\geq2/\delta\} { ∥ x ∥ ≥ 2 d / δ } ⊆ j = 1 ⋃ d { ∣ x j ∣ ≥ 2/ δ } から、十分大きいn n n に対して左辺の測度はη \eta η 未満である。残る有限個の測度について半径を大きくすれば、列全体について同じ尾部評価を得る。▨
定理 3.5 (Lévy の連続性定理). d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とし、μ n \mu_n μ n をR d \R^d R d 上の Borel 確率測度、その特性関数をφ n \varphi_n φ n とする。
Borel 確率測度μ \mu μ に対してμ n ⇒ μ \mu_n\Rightarrow\mu μ n ⇒ μ ならば、すべてのt ∈ R d t\in\R^d t ∈ R d でφ n ( t ) → μ ^ ( t ) \varphi_n(t)\to\widehat\mu(t) φ n ( t ) → μ ( t ) である。
すべてのt ∈ R d t\in\R^d t ∈ R d でφ n ( t ) → ψ ( t ) \varphi_n(t)\to\psi(t) φ n ( t ) → ψ ( t ) が成り立ち、ψ \psi ψ が原点で連続ならば、Borel 確率測度μ \mu μ が一意に存在してψ = μ ^ \psi=\widehat\mu ψ = μ かつμ n ⇒ μ \mu_n\Rightarrow\mu μ n ⇒ μ となる。
証明. (1) を示す。x ↦ e i t ⊤ x x\mapsto e^{it^\top x} x ↦ e i t ⊤ x の実部と虚部は有界連続であるから、分布収束の定義を両者に適用すればよい。
(2) を示す。補題 3.4 により( μ n ) (\mu_n) ( μ n ) は緊密であり、補題 3.3 によって分布収束する部分列が存在する。その極限をμ \mu μ とすると、(1) からμ ^ = ψ \widehat\mu=\psi μ = ψ である。定理 2.4 により、この特性関数をもつ Borel 確率測度は一意である。
全列がμ \mu μ に分布収束しないと仮定すると、有界連続関数f f f 、a > 0 a>0 a > 0 および部分列( μ n j ) (\mu_{n_j}) ( μ n j ) が存在して、すべてのj j j について
∣ ∫ f d μ n j − ∫ f d μ ∣ ≥ a \left|\int f\,d\mu_{n_j}-\int f\,d\mu\right|\geq a ∫ f d μ n j − ∫ f d μ ≥ a となる。この部分列も緊密なので、さらに分布収束する部分列を持つ。その極限をν \nu ν とすると、(1) と仮定の各点収束からν ^ = ψ = μ ^ \widehat\nu=\psi=\widehat\mu ν = ψ = μ である。一意性によりν = μ \nu=\mu ν = μ なので、この部分列上では表示した絶対差が0 0 0 に収束する。すべての項でa a a 以上であることと矛盾する。したがってμ n ⇒ μ \mu_n\Rightarrow\mu μ n ⇒ μ である。▨
4 一次元射影と中心極限定理
定理 4.1 (Cramér–Wold の定理). d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とし、X n , X X_n,X X n , X をR d \R^d R d 値確率ベクトルとする。次の二条件は同値である。
X n ⇒ X X_n\Rightarrow X X n ⇒ X である。
すべてのt ∈ R d t\in\R^d t ∈ R d に対してt ⊤ X n ⇒ t ⊤ X t^\top X_n\Rightarrow t^\top X t ⊤ X n ⇒ t ⊤ X である。
証明. (1) ⇒ \Rightarrow ⇒ (2) は、連続写像x ↦ t ⊤ x x\mapsto t^\top x x ↦ t ⊤ x に定理 1.3 を適用すれば従う。
(2) ⇒ \Rightarrow ⇒ (1) を示す。各t t t について、実確率変数t ⊤ X n t^\top X_n t ⊤ X n の分布収束から
φ X n ( t ) = E [ e i ( t ⊤ X n ) ] ⟶ E [ e i ( t ⊤ X ) ] = φ X ( t ) \varphi_{X_n}(t)=E[e^{i(t^\top X_n)}]\longrightarrow
E[e^{i(t^\top X)}]=\varphi_X(t) φ X n ( t ) = E [ e i ( t ⊤ X n ) ] ⟶ E [ e i ( t ⊤ X ) ] = φ X ( t ) である。φ X \varphi_X φ X は原点で連続なので、定理 3.5 (2) と定理 2.4 からX n ⇒ X X_n\Rightarrow X X n ⇒ X を得る。▨
例 4.2. G ∼ N ( 0 , 1 ) G\sim N(0,1) G ∼ N ( 0 , 1 ) とし、X n = ( G , ( − 1 ) n G ) ⊤ X_n=(G,(-1)^nG)^\top X n = ( G , ( − 1 ) n G ) ⊤ とおく。どちらの成分も各n n n でN ( 0 , 1 ) N(0,1) N ( 0 , 1 ) に従うが、( X n ) (X_n) ( X n ) は分布収束しない。実際、有界連続関数f ( x , y ) = cos ( x − y ) f(x,y)=\cos(x-y) f ( x , y ) = cos ( x − y ) に対して
E [ f ( X n ) ] = { 1 , n が偶数のとき , e − 2 , n が奇数のとき E[f(X_n)]=
\begin{cases}
1,&n\text{ が偶数のとき},\\
e^{-2},&n\text{ が奇数のとき}
\end{cases} E [ f ( X n )] = { 1 , e − 2 , n が偶数のとき , n が奇数のとき である。奇数の場合の値は§E11.16 命題 1.1 の引数を2 2 2 として得られる。期待値が収束しないので、分布収束の定義を満たさない。Cramér–Wold の定理では、座標への射影だけでなくすべての線形結合の収束を仮定する必要がある。
定理 4.3 (多変量中心極限定理). d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とし、X 1 , X 2 , … X_1,X_2,\ldots X 1 , X 2 , … を独立同分布なR d \R^d R d 値確率ベクトルとする。E [ ∥ X 1 ∥ 2 ] < ∞ E[\|X_1\|^2]<\infty E [ ∥ X 1 ∥ 2 ] < ∞ を仮定し、
m = E [ X 1 ] , Σ = E [ ( X 1 − m ) ( X 1 − m ) ⊤ ] , X ‾ n = 1 n ∑ j = 1 n X j m=E[X_1],\qquad
\Sigma=E[(X_1-m)(X_1-m)^\top],\qquad
\overline X_n=\frac1n\sum_{j=1}^nX_j m = E [ X 1 ] , Σ = E [( X 1 − m ) ( X 1 − m ) ⊤ ] , X n = n 1 j = 1 ∑ n X j とおく。このとき
n ( X ‾ n − m ) = 1 n ∑ j = 1 n ( X j − m ) ⇒ N d ( 0 , Σ ) \sqrt n(\overline X_n-m)
=\frac1{\sqrt n}\sum_{j=1}^n(X_j-m)
\Rightarrow N_d(0,\Sigma) n ( X n − m ) = n 1 j = 1 ∑ n ( X j − m ) ⇒ N d ( 0 , Σ ) である。共分散行列Σ \Sigma Σ が正定値であることは仮定しない。
証明. §E11.6 定理 3.2 によりΣ \Sigma Σ は対称半正定値であるから、§E11.10 定理 4.2 によって分布N d ( 0 , Σ ) N_d(0,\Sigma) N d ( 0 , Σ ) が存在する。この分布に従う確率ベクトルをZ Z Z とする。t ∈ R d t\in\R^d t ∈ R d を固定し、Y j = t ⊤ ( X j − m ) Y_j=t^\top(X_j-m) Y j = t ⊤ ( X j − m ) およびs 2 = t ⊤ Σ t s^2=t^\top\Sigma t s 2 = t ⊤ Σ t とおく。( Y j ) (Y_j) ( Y j ) は独立同分布であり、期待値と有限和の交換からE [ Y j ] = 0 E[Y_j]=0 E [ Y j ] = 0 、E [ Y j 2 ] = s 2 < ∞ E[Y_j^2]=s^2<\infty E [ Y j 2 ] = s 2 < ∞ である。
s 2 > 0 s^2>0 s 2 > 0 ならば、一次元中心極限定理§E11.16 定理 2.1 によりn − 1 / 2 ∑ j = 1 n Y j / s ⇒ N ( 0 , 1 ) n^{-1/2}\sum_{j=1}^nY_j/s\Rightarrow N(0,1) n − 1/2 ∑ j = 1 n Y j / s ⇒ N ( 0 , 1 ) である。命題 1.2 と定理 1.3 を用いてs s s 倍すると、
1 n ∑ j = 1 n Y j ⇒ N ( 0 , s 2 ) \frac1{\sqrt n}\sum_{j=1}^nY_j\Rightarrow N(0,s^2) n 1 j = 1 ∑ n Y j ⇒ N ( 0 , s 2 ) を得る。s 2 = 0 s^2=0 s 2 = 0 ならばE [ Y j 2 ] = 0 E[Y_j^2]=0 E [ Y j 2 ] = 0 なので各Y j Y_j Y j はほとんど確実に0 0 0 であり、各有限和の分布はN ( 0 , 0 ) N(0,0) N ( 0 , 0 ) である。したがって、表示した分布収束はこの場合にも成り立つ。
§E11.10 定理 4.2 によりt ⊤ Z ∼ N ( 0 , t ⊤ Σ t ) t^\top Z\sim N(0,t^\top\Sigma t) t ⊤ Z ∼ N ( 0 , t ⊤ Σ t ) である。すべてのt t t で射影の分布収束を得たので、定理 4.1 により結論が従う。▨
例 4.4 (多項度数の極限). r ≥ 2 r\geq2 r ≥ 2 とし、p 1 , … , p r ≥ 0 p_1,\ldots,p_r\geq0 p 1 , … , p r ≥ 0 、∑ i = 1 r p i = 1 \sum_{i=1}^rp_i=1 ∑ i = 1 r p i = 1 とする。独立同分布な変数J 1 , J 2 , … J_1,J_2,\ldots J 1 , J 2 , … がP ( J j = i ) = p i P(J_j=i)=p_i P ( J j = i ) = p i を満たすとき、X j = e J j X_j=e_{J_j} X j = e J j とおく。ただしe i e_i e i はR r \R^r R r の第i i i 座標ベクトルである。∑ j = 1 n X j = ( N n , 1 , … , N n , r ) ⊤ \sum_{j=1}^nX_j=(N_{n,1},\ldots,N_{n,r})^\top ∑ j = 1 n X j = ( N n , 1 , … , N n , r ) ⊤ は、各種類の出現回数を並べたベクトルである。p = ( p 1 , … , p r ) ⊤ p=(p_1,\ldots,p_r)^\top p = ( p 1 , … , p r ) ⊤ と書くと、
E [ X j ] = p , E [ X j X j ⊤ ] = diag ( p 1 , … , p r ) , Σ = diag ( p 1 , … , p r ) − p p ⊤ E[X_j]=p,\qquad E[X_jX_j^\top]=\operatorname{diag}(p_1,\ldots,p_r),
\qquad \Sigma=\operatorname{diag}(p_1,\ldots,p_r)-pp^\top E [ X j ] = p , E [ X j X j ⊤ ] = diag ( p 1 , … , p r ) , Σ = diag ( p 1 , … , p r ) − p p ⊤ である。定理 4.3 により
( N n , 1 , … , N n , r ) ⊤ − n p n ⇒ N r ( 0 , Σ ) . \frac{(N_{n,1},\ldots,N_{n,r})^\top-np}{\sqrt n}
\Rightarrow N_r(0,\Sigma). n ( N n , 1 , … , N n , r ) ⊤ − n p ⇒ N r ( 0 , Σ ) . 1 = ( 1 , … , 1 ) ⊤ \mathbf1=(1,\ldots,1)^\top 1 = ( 1 , … , 1 ) ⊤ とするとΣ 1 = 0 \Sigma\mathbf1=0 Σ 1 = 0 なので、極限の共分散行列は特異である。実際、左辺の成分の和は常に0 0 0 であり、極限のZ ∼ N r ( 0 , Σ ) Z\sim N_r(0,\Sigma) Z ∼ N r ( 0 , Σ ) でも1 ⊤ Z ∼ N ( 0 , 0 ) \mathbf1^\top Z\sim N(0,0) 1 ⊤ Z ∼ N ( 0 , 0 ) である。各種類の度数を同時に扱うには、この退化を含める必要がある。
5 確率収束と Slutsky の定理
定義 5.1. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とし、X n , X X_n,X X n , X を一つの確率空間上のR d \R^d R d 値確率ベクトルとする。任意のε > 0 \varepsilon>0 ε > 0 に対して
P ( ∥ X n − X ∥ > ε ) ⟶ 0 P(\|X_n-X\|>\varepsilon)\longrightarrow0 P ( ∥ X n − X ∥ > ε ) ⟶ 0 となるとき、X n X_n X n はX X X に確率収束する (converge in probability ) といい、X n → P X X_n\xrightarrow{P}X X n P X と書く。
命題 5.2. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とし、X n , X X_n,X X n , X を一つの確率空間上のR d \R^d R d 値確率ベクトルとする。X n → P X X_n\xrightarrow{P}X X n P X であるための必要十分条件は、各i = 1 , … , d i=1,\ldots,d i = 1 , … , d についてX n , i → P X i X_{n,i}\xrightarrow{P}X_i X n , i P X i が成り立つことである。
証明. 任意のε > 0 \varepsilon>0 ε > 0 と各i i i に対して
P ( ∣ X n , i − X i ∣ > ε ) ≤ P ( ∥ X n − X ∥ > ε ) ≤ ∑ j = 1 d P ( ∣ X n , j − X j ∣ > ε / d ) P(|X_{n,i}-X_i|>\varepsilon)
\leq P(\|X_n-X\|>\varepsilon)
\leq\sum_{j=1}^dP(|X_{n,j}-X_j|>\varepsilon/\sqrt d) P ( ∣ X n , i − X i ∣ > ε ) ≤ P ( ∥ X n − X ∥ > ε ) ≤ j = 1 ∑ d P ( ∣ X n , j − X j ∣ > ε / d ) であるから、両方向の含意を得る。▨
定理 5.3 (Slutsky の定理). d , q ∈ N ≥ 1 d,q\in\NN d , q ∈ N ≥ 1 とし、X n , Y n X_n,Y_n X n , Y n を一つの確率空間上の、それぞれR d \R^d R d 値、R q \R^q R q 値の確率ベクトルとする。R d \R^d R d 値確率ベクトルX X X と定数c ∈ R q c\in\R^q c ∈ R q に対して
X n ⇒ X , Y n → P c X_n\Rightarrow X,\qquad Y_n\xrightarrow{P}c X n ⇒ X , Y n P c ならば
( X n , Y n ) ⇒ ( X , c ) (X_n,Y_n)\Rightarrow(X,c) ( X n , Y n ) ⇒ ( X , c ) である。したがって、任意のk ∈ N ≥ 1 k\in\NN k ∈ N ≥ 1 と連続写像g : R d + q → R k g:\R^{d+q}\to\R^k g : R d + q → R k に対してg ( X n , Y n ) ⇒ g ( X , c ) g(X_n,Y_n)\Rightarrow g(X,c) g ( X n , Y n ) ⇒ g ( X , c ) が成り立つ。X n X_n X n とY n Y_n Y n の独立性は仮定しない。
証明. h : R d + q → R h:\R^{d+q}\to\R h : R d + q → R を有界連続関数とし、M = ∥ h ∥ ∞ M=\|h\|_\infty M = ∥ h ∥ ∞ とおく。任意のη > 0 \eta>0 η > 0 に対して、補題 3.2 により
sup n P ( ∥ X n ∥ > R ) < η \sup_nP(\|X_n\|>R)<\eta n sup P ( ∥ X n ∥ > R ) < η となるR R R を取る。h h h はコンパクト集合{ ( x , y ) : ∥ x ∥ ≤ R , ∥ y − c ∥ ≤ 1 } \{(x,y):\|x\|\leq R,\ \|y-c\|\leq1\} {( x , y ) : ∥ x ∥ ≤ R , ∥ y − c ∥ ≤ 1 } 上で一様連続なので、任意のα > 0 \alpha>0 α > 0 に対し0 < δ < 1 0<\delta<1 0 < δ < 1 を選び、∥ x ∥ ≤ R \|x\|\leq R ∥ x ∥ ≤ R 、∥ y − c ∥ ≤ δ \|y-c\|\leq\delta ∥ y − c ∥ ≤ δ ならば∣ h ( x , y ) − h ( x , c ) ∣ < α |h(x,y)-h(x,c)|<\alpha ∣ h ( x , y ) − h ( x , c ) ∣ < α とすることができる。よって
∣ E [ h ( X n , Y n ) ] − E [ h ( X n , c ) ] ∣ ≤ α + 2 M ( P ( ∥ X n ∥ > R ) + P ( ∥ Y n − c ∥ > δ ) ) . \bigl|E[h(X_n,Y_n)]-E[h(X_n,c)]\bigr|
\leq\alpha+2M\bigl(P(\|X_n\|>R)+P(\|Y_n-c\|>\delta)\bigr). E [ h ( X n , Y n )] − E [ h ( X n , c )] ≤ α + 2 M ( P ( ∥ X n ∥ > R ) + P ( ∥ Y n − c ∥ > δ ) ) . Y n → P c Y_n\xrightarrow{P}c Y n P c なので、左辺の上極限はα + 2 M η \alpha+2M\eta α + 2 M η 以下である。α , η > 0 \alpha,\eta>0 α , η > 0 は任意であるから左辺は0 0 0 に収束する。一方、x ↦ h ( x , c ) x\mapsto h(x,c) x ↦ h ( x , c ) は有界連続なので、X n ⇒ X X_n\Rightarrow X X n ⇒ X からE [ h ( X n , c ) ] → E [ h ( X , c ) ] E[h(X_n,c)]\to E[h(X,c)] E [ h ( X n , c )] → E [ h ( X , c )] である。したがって( X n , Y n ) ⇒ ( X , c ) (X_n,Y_n)\Rightarrow(X,c) ( X n , Y n ) ⇒ ( X , c ) を得る。g g g に関する結論は定理 1.3 により従う。▨
系 5.4. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とし、X n , b n X_n,b_n X n , b n をR d \R^d R d 値、a n a_n a n を実数値の、一つの確率空間上の確率変数とする。X n ⇒ X X_n\Rightarrow X X n ⇒ X 、a n → P a ∈ R a_n\xrightarrow{P}a\in\R a n P a ∈ R 、b n → P b ∈ R d b_n\xrightarrow{P}b\in\R^d b n P b ∈ R d ならば
a n X n + b n ⇒ a X + b . a_nX_n+b_n\Rightarrow aX+b. a n X n + b n ⇒ a X + b . 特にX n + b n ⇒ X + b X_n+b_n\Rightarrow X+b X n + b n ⇒ X + b 、a n X n ⇒ a X a_nX_n\Rightarrow aX a n X n ⇒ a X であり、d = 1 d=1 d = 1 では実確率変数の和と積の結論を含む。
証明. 命題 5.2 により( a n , b n ) → P ( a , b ) (a_n,b_n)\xrightarrow{P}(a,b) ( a n , b n ) P ( a , b ) である。定理 5.3 を連続写像( x , a , b ) ↦ a x + b (x,a,b)\mapsto ax+b ( x , a , b ) ↦ a x + b に適用すればよい。▨
系 5.5. d , k ∈ N ≥ 1 d,k\in\NN d , k ∈ N ≥ 1 とし、一つの確率空間上の確率ベクトルX n ∈ R d X_n\in\R^d X n ∈ R d 、b n ∈ R k b_n\in\R^k b n ∈ R k および確率行列A n ∈ R k × d A_n\in\R^{k\times d} A n ∈ R k × d を考える。X n ⇒ X X_n\Rightarrow X X n ⇒ X 、b n → P b ∈ R k b_n\xrightarrow{P}b\in\R^k b n P b ∈ R k とし、A n A_n A n の各成分が定数行列A ∈ R k × d A\in\R^{k\times d} A ∈ R k × d の対応する成分へ確率収束すると仮定する。このとき
A n X n + b n ⇒ A X + b . A_nX_n+b_n\Rightarrow AX+b. A n X n + b n ⇒ A X + b . 特にX ∼ N d ( m , Σ ) X\sim N_d(m,\Sigma) X ∼ N d ( m , Σ ) ならば
A n X n + b n ⇒ N k ( A m + b , A Σ A ⊤ ) . A_nX_n+b_n\Rightarrow N_k(Am+b,A\Sigma A^\top). A n X n + b n ⇒ N k ( A m + b , A Σ A ⊤ ) . 独立性、A A A の可逆性および共分散行列の正定値性は仮定しない。
証明. 行列の成分を固定した順に並べると、命題 5.2 により( A n , b n ) → P ( A , b ) (A_n,b_n)\xrightarrow{P}(A,b) ( A n , b n ) P ( A , b ) である。写像( x , A , b ) ↦ A x + b (x,A,b)\mapsto Ax+b ( x , A , b ) ↦ A x + b は各成分が多項式なので連続であり、定理 5.3 から最初の結論を得る。X ∼ N d ( m , Σ ) X\sim N_d(m,\Sigma) X ∼ N d ( m , Σ ) の場合は、命題 2.2 (2) と命題 2.2 (4) により
φ A X + b ( t ) = exp ( i t ⊤ ( A m + b ) − 1 2 t ⊤ A Σ A ⊤ t ) \varphi_{AX+b}(t)
=\exp\left(it^\top(Am+b)-\frac12t^\top A\Sigma A^\top t\right) φ A X + b ( t ) = exp ( i t ⊤ ( A m + b ) − 2 1 t ⊤ A Σ A ⊤ t ) である。定理 2.4 から後半の結論が従う。▨
6 演習
問題 6.1. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 、G ∼ N d ( 0 , I d ) G\sim N_d(0,I_d) G ∼ N d ( 0 , I d ) とし、X n = n G X_n=nG X n = n G とおく。φ X n \varphi_{X_n} φ X n が各点収束することを示し、その極限を求めよ。さらに、( X n ) (X_n) ( X n ) が分布収束しないことを示せ。
解答. 命題 2.2 (4) により
φ X n ( t ) = e − n 2 ∥ t ∥ 2 / 2 ⟶ ψ ( t ) : = { 1 , t = 0 , 0 , t ≠ 0. \varphi_{X_n}(t)=e^{-n^2\|t\|^2/2}\longrightarrow
\psi(t):=
\begin{cases}
1,&t=0,\\
0,&t\neq0.
\end{cases} φ X n ( t ) = e − n 2 ∥ t ∥ 2 /2 ⟶ ψ ( t ) := { 1 , 0 , t = 0 , t = 0. もしX n ⇒ μ X_n\Rightarrow\mu X n ⇒ μ ならば、定理 3.5 (1) からμ ^ = ψ \widehat\mu=\psi μ = ψ となる。しかしψ \psi ψ は原点で不連続であり、命題 2.2 (1) に反する。したがって( X n ) (X_n) ( X n ) は分布収束しない。▨
問題 6.2. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 、Σ ∈ R d × d \Sigma\in\R^{d\times d} Σ ∈ R d × d を対称正定値行列とする。同じ確率空間上のR d \R^d R d 値確率ベクトルX n X_n X n と確率行列B n ∈ R d × d B_n\in\R^{d\times d} B n ∈ R d × d がX n ⇒ N d ( 0 , Σ ) X_n\Rightarrow N_d(0,\Sigma) X n ⇒ N d ( 0 , Σ ) を満たし、B n B_n B n の各成分がΣ − 1 \Sigma^{-1} Σ − 1 の対応する成分へ確率収束すると仮定する。独立な標準正規変数G 1 , … , G d G_1,\ldots,G_d G 1 , … , G d に対して
X n ⊤ B n X n ⇒ ∑ j = 1 d G j 2 X_n^\top B_nX_n\Rightarrow\sum_{j=1}^dG_j^2 X n ⊤ B n X n ⇒ j = 1 ∑ d G j 2 であることを示せ。X n X_n X n とB n B_n B n の独立性は仮定しない。
解答. Z ∼ N d ( 0 , Σ ) Z\sim N_d(0,\Sigma) Z ∼ N d ( 0 , Σ ) とする。定理 5.3 を連続写像( x , B ) ↦ x ⊤ B x (x,B)\mapsto x^\top Bx ( x , B ) ↦ x ⊤ B x に適用すると、X n ⊤ B n X n ⇒ Z ⊤ Σ − 1 Z X_n^\top B_nX_n\Rightarrow Z^\top\Sigma^{-1}Z X n ⊤ B n X n ⇒ Z ⊤ Σ − 1 Z である。対称正定値平方根C = Σ 1 / 2 C=\Sigma^{1/2} C = Σ 1/2 を取り、G = ( G 1 , … , G d ) ⊤ G=(G_1,\ldots,G_d)^\top G = ( G 1 , … , G d ) ⊤ と書く。§E11.10 定理 4.2 によりZ Z Z とC G CG C G の分布は等しい。C ⊤ = C C^\top=C C ⊤ = C 、C 2 = Σ C^2=\Sigma C 2 = Σ からC ⊤ Σ − 1 C = I d C^\top\Sigma^{-1}C=I_d C ⊤ Σ − 1 C = I d なので、
( C G ) ⊤ Σ − 1 ( C G ) = G ⊤ G = ∑ j = 1 d G j 2 . (CG)^\top\Sigma^{-1}(CG)=G^\top G=\sum_{j=1}^dG_j^2. ( C G ) ⊤ Σ − 1 ( C G ) = G ⊤ G = j = 1 ∑ d G j 2 . したがって求める分布収束を得る。▨