§E11.10多変量正規分布

最終更新

一変量正規分布を有限次元へ拡張するとき、密度から定義すると特異な共分散行列を除外してしまう。本記事では、すべての線形結合が一変量正規分布に従うことを定義に採用する。この定義は分散が零である線形結合を許し、確率ベクトルが真のアフィン部分空間に集中する場合も同じ枠組みに含める。

1 分散零を含む一変量正規分布

実数直線上の Lebesgue 測度をλ\lambdaと書く。

定義 1.1.a∈Ra\in\mathbb Rとs2≥0s^2\geq0に対して、平均aa、分散s2s^2の正規分布 (normal distribution with meanaaand variances2s^2)N(a,s2)N(a,s^2)を次のように定める。

  1. s2>0s^2>0の場合には、Lebesgue 密度 x⟼12πs2exp⁡(−(x−a)22s2)x\longmapsto\frac{1}{\sqrt{2\pi s^2}} \exp\left(-\frac{(x-a)^2}{2s^2}\right) をもつ確率分布とする。
  2. s2=0s^2=0の場合には、点aaにおける Dirac 測度δa\delta_aとする。

N(0,1)N(0,1)を標準正規分布 (standard normal distribution) という。

正の分散をもつ密度の規格化は、§E11.5 命題 2.5が Lebesgue 積分として証明している。s2=0s^2=0の場合のδa\delta_aも全質量11の確率測度である。したがって、定義 1.1はすべてのs2≥0s^2\geq0について確率分布を定める。

命題 1.2.Y∼N(a,s2)Y\sim N(a,s^2)ならばYYは二次可積分であり、

E[Y]=a,Var⁡(Y)=s2E[Y]=a,\qquad\operatorname{Var}(Y)=s^2

が成り立つ。特にs2=0s^2=0ならばY=aY=aがほとんど確実に成り立つ。

証明.s2=0s^2=0の場合には、μY=δa\mu_Y=\delta_aなのでE[Y]=∫x δa(dx)=aE[Y]=\int x\,\delta_a(dx)=aかつVar⁡(Y)=∫(x−a)2 δa(dx)=0\operatorname{Var}(Y)=\int(x-a)^2\,\delta_a(dx)=0である。また、P(Y=a)=δa({a})=1P(Y=a)=\delta_a(\{a\})=1である。s2>0s^2>0の場合には、定義 1.1の密度は§E11.5 定義 2.4のμ=a\mu=a、σ=s\sigma=sと同じである。規格化、二次可積分性、平均および分散は§E11.5 命題 2.5から従う。▨

分散零を含めることにより、後で現れるt⊤Xt^\top Xが定数になる場合にも「正規分布に従う」という定義を変更せずに用いることができる。

2 有限次元分布を射影から一意に定める補題

多変量正規分布の特徴づけでは、すべての一次元射影が同じ二つの分布を同一視する必要がある。この事実を特性関数の一般論へ委ねず、Gaussian 平滑化に必要な Fourier 恒等式を局所的に証明する。

補題 2.1.μ,ν\mu,\nuをRd\mathbb R^d上の Borel 確率測度とする。すべての有界連続関数f:Rd→Rf:\mathbb R^d\to\mathbb Rについて

∫f dμ=∫f dν\int f\,d\mu=\int f\,d\nu

が成り立つならば、μ=ν\mu=\nuである。

証明.F⊆RdF\subseteq\mathbb R^dを閉集合とし、

fn(x)=max⁡{1−ndist⁡(x,F),0}f_n(x)=\max\{1-n\operatorname{dist}(x,F),0\}

とおく。各fnf_nは有界連続であり、fn→1Ff_n\to\mathbf1_Fが点ごとに成り立つ。優収束定理§E9.7 定理 3.2を、支配関数11の下でμ\muとν\nuに適用するとμ(F)=ν(F)\mu(F)=\nu(F)を得る。

二つの測度が一致する Borel 集合の族は、補集合と互いに交わらない可算和に対して閉じるので Dynkin 系である。閉集合全体は有限共通部分に対して閉じる π 系であり、Borel 集合族を生成する。π–λ 定理§E9.1 定理 4.8により、二つの測度はすべての Borel 集合上で一致する。▨

補題 2.2.μ,ν\mu,\nuをRd\mathbb R^d上の Borel 確率測度とする。すべてのt∈Rdt\in\mathbb R^dについて、写像x↦t⊤xx\mapsto t^\top xによるμ\muとν\nuの像測度が一致するならば、μ=ν\mu=\nuである。

証明. 最初に、ε>0\varepsilon>0とu∈Ru\in\mathbb Rに対する一次元の Fourier–Gaussian 恒等式

∫Re−εr2/2cos⁡(ru) dr=2πεe−u2/(2ε),∫Re−εr2/2sin⁡(ru) dr=0(1)\int_{\mathbb R}e^{-\varepsilon r^2/2}\cos(ru)\,dr =\sqrt{\frac{2\pi}{\varepsilon}}e^{-u^2/(2\varepsilon)}, \qquad \int_{\mathbb R}e^{-\varepsilon r^2/2}\sin(ru)\,dr=0 \tag{1}

を証明する。第二の積分は奇関数の積分なので00である。第一の積分をI(u)=∫e−εr2/2cos⁡(ru) drI(u)=\int e^{-\varepsilon r^2/2}\cos(ru)\,drとおく。∣r∣e−εr2/2|r|e^{-\varepsilon r^2/2}の可積分性は、§E11.5 命題 2.5をN(0,ε−1)N(0,\varepsilon^{-1})へ適用することによって従う。したがって、優収束定理§E9.7 定理 3.2を差商へ適用して積分の下で微分することができる。広義積分の部分積分から

I′(u)=−∫Rre−εr2/2sin⁡(ru) dr=−uε∫Re−εr2/2cos⁡(ru) dr=−uεI(u)\begin{aligned} I'(u) &=-\int_{\mathbb R}r e^{-\varepsilon r^2/2}\sin(ru)\,dr\\ &=-\frac{u}{\varepsilon}\int_{\mathbb R}e^{-\varepsilon r^2/2}\cos(ru)\,dr =-\frac{u}{\varepsilon}I(u) \end{aligned}

を得る。具体的には、有限区間[−R,R][-R,R]上で部分積分する。被積分関数は連続であるため、有限区間上の Riemann 積分と Lebesgue 積分の一致§E9.9 系 5.2を適用することができる。R→∞R\to\inftyでは、上で確認した∣r∣e−εr2/2|r|e^{-\varepsilon r^2/2}の可積分性とe−εr2/2e^{-\varepsilon r^2/2}の可積分性を優関数として優収束定理を適用する。端点項はe−εR2/2sin⁡(Ru)→0e^{-\varepsilon R^2/2}\sin(Ru)\to0により消える。正規密度の規格化§E11.5 命題 2.5をN(0,ε−1)N(0,\varepsilon^{-1})へ適用するとI(0)=2π/εI(0)=\sqrt{2\pi/\varepsilon}であるため、この微分方程式を解くと式 (1) を得る。余弦の加法公式を反復してcos⁡(t⊤u)\cos(t^\top u)を各座標の余弦と正弦の積の和へ展開する。少なくとも一つの正弦因子を含む項は、その座標について奇関数なので積分が00である。残る余弦因子だけの積へ式 (1) を各座標で適用し、絶対可積分な関数に Fubini の定理§E9.11 定理 3.2を用いると、

gε(u)=1(2πε)d/2e−∥u∥2/(2ε)=1(2π)d∫Rdcos⁡(t⊤u)e−ε∥t∥2/2 dt(2)g_\varepsilon(u) =\frac{1}{(2\pi\varepsilon)^{d/2}}e^{-\lVert u\rVert^2/(2\varepsilon)} =\frac1{(2\pi)^d}\int_{\mathbb R^d} \cos(t^\top u)e^{-\varepsilon\lVert t\rVert^2/2}\,dt \tag{2}

を得る。

gεg_\varepsilonは分散ε\varepsilonの一次元正規密度のdd個の積である。§E11.5 命題 2.5と非負関数に対する Tonelli の定理§E9.11 定理 2.3により∫Rdgε=1\int_{\mathbb R^d}g_\varepsilon=1である。γε\gamma_\varepsilonを密度gεg_\varepsilonをもつ確率測度とする。μ\muをγε\gamma_\varepsilonで平滑化した測度を

με(B)=∫Rdγε(B−y) μ(dy)\mu_\varepsilon(B) =\int_{\mathbb R^d}\gamma_\varepsilon(B-y)\,\mu(dy)

と定める。Tonelli の定理§E9.11 定理 2.3から、この測度は

pμ,ε(x)=∫Rdgε(x−y) μ(dy)(3)p_{\mu,\varepsilon}(x) =\int_{\mathbb R^d}g_\varepsilon(x-y)\,\mu(dy) \tag{3}

を Lebesgue 密度にもつ。実際、任意の Borel 集合BBに対して

∫Bpμ,ε(x) dx=∫Rd(∫Bgε(x−y) dx)μ(dy)=∫Rdγε(B−y) μ(dy)=με(B)\int_Bp_{\mu,\varepsilon}(x)\,dx =\int_{\mathbb R^d}\left(\int_Bg_\varepsilon(x-y)\,dx\right)\mu(dy) =\int_{\mathbb R^d}\gamma_\varepsilon(B-y)\,\mu(dy) =\mu_\varepsilon(B)

である。ここが平滑化した測度と表示された密度との同一視である。

Cμ(t)=∫Rdcos⁡(t⊤y) μ(dy),Sμ(t)=∫Rdsin⁡(t⊤y) μ(dy)C_\mu(t)=\int_{\mathbb R^d}\cos(t^\top y)\,\mu(dy), \qquad S_\mu(t)=\int_{\mathbb R^d}\sin(t^\top y)\,\mu(dy)

とおく。これらは本補題の証明内だけで用いる有界な実数値振動積分である。射影の像測度が等しいという仮定を、有界 Borel 関数r↦cos⁡rr\mapsto\cos rとr↦sin⁡rr\mapsto\sin rへそれぞれ適用すると、Cμ(t)=Cν(t)C_\mu(t)=C_\nu(t)とSμ(t)=Sν(t)S_\mu(t)=S_\nu(t)がすべてのttで成り立つ。式 (2) を式 (3) へ代入する。被積分関数の絶対値はe−ε∥t∥2/2e^{-\varepsilon\lVert t\rVert^2/2}で抑えられ、この関数は可積分であり、μ\muは確率測度なので、 Fubini の定理§E9.11 定理 3.2によって積分順序を交換することができる。その結果、

pμ,ε(x)=1(2π)d∫Rd(cos⁡(t⊤x)Cμ(t)+sin⁡(t⊤x)Sμ(t))e−ε∥t∥2/2 dt(4)p_{\mu,\varepsilon}(x) =\frac1{(2\pi)^d}\int_{\mathbb R^d} \bigl(\cos(t^\top x)C_\mu(t)+\sin(t^\top x)S_\mu(t)\bigr) e^{-\varepsilon\lVert t\rVert^2/2}\,dt \tag{4}

を得る。Cμ=CνC_\mu=C_\nuかつSμ=SνS_\mu=S_\nuなので、式 (4) からpμ,ε=pν,εp_{\mu,\varepsilon}=p_{\nu,\varepsilon}が各点で成り立ち、με=νε\mu_\varepsilon=\nu_\varepsilonである。

最後にε↓0\varepsilon\downarrow0とする。f∈Cb(Rd)f\in C_b(\mathbb R^d)とy∈Rdy\in\mathbb R^dに対して

Tεf(y)=∫Rdf(y+z)gε(z) dzT_\varepsilon f(y)=\int_{\mathbb R^d}f(y+z)g_\varepsilon(z)\,dz

とおく。写像w↦ε ww\mapsto\sqrt\varepsilon\,wはRd\mathbb R^dのC1C^1級微分同相である。 Borel 可測関数に対する変数変換公式§E11.8 補題 2.1を非負 Borel 可測関数1{∥z∥≥δ}gε(z)\mathbf1_{\{\lVert z\rVert\geq\delta\}}g_\varepsilon(z)へ適用すると、任意のδ>0\delta>0について

∫∥z∥≥δgε(z) dz=∫∥w∥≥δ/εg1(w) dw⟶0\int_{\lVert z\rVert\geq\delta}g_\varepsilon(z)\,dz =\int_{\lVert w\rVert\geq\delta/\sqrt\varepsilon}g_1(w)\,dw\longrightarrow0

である。最後の極限では、指示関数がε↓0\varepsilon\downarrow0で点ごとに00へ収束し、g1g_1が可積分であるため、優収束定理§E9.7 定理 3.2を適用した。ffのyyにおける連続性とffの有界性を、∥z∥<δ\lVert z\rVert<\deltaと∥z∥≥δ\lVert z\rVert\geq\deltaに分けて用いるとTεf(y)→f(y)T_\varepsilon f(y)\to f(y)を得る。また∣Tεf(y)∣≤∥f∥∞|T_\varepsilon f(y)|\leq\lVert f\rVert_\inftyである。したがって、優収束定理§E9.7 定理 3.2を支配関数∥f∥∞\lVert f\rVert_\inftyの下で適用すると

∫f dμε=∫Tεf(y) μ(dy)⟶∫f dμ\int f\,d\mu_\varepsilon =\int T_\varepsilon f(y)\,\mu(dy) \longrightarrow\int f\,d\mu

である。同じ結論がν\nuにも成り立つ。各ε>0\varepsilon>0でμε=νε\mu_\varepsilon=\nu_\varepsilonなので、すべてのf∈Cb(Rd)f\in C_b(\mathbb R^d)について∫f dμ=∫f dν\int f\,d\mu=\int f\,d\nuを得る。補題 2.1によりμ=ν\mu=\nuである。▨

この補題の Fourier 積分は、射影一意性を閉じるためだけに用いた。本単元後半の「特性関数と Lévy の連続性定理」で扱う特性関数の計算法と分布収束の判定は、本記事の後続の結論には用いない。

3 標準正規ベクトルと直交不変性

定義 3.1.r≥1r\geq1とする。Rr\mathbb R^r上の密度

φr(z)=1(2π)r/2exp⁡(−∥z∥22)=∏j=1r12πe−zj2/2\varphi_r(z)=\frac1{(2\pi)^{r/2}}\exp\left(-\frac{\lVert z\rVert^2}{2}\right) =\prod_{j=1}^{r}\frac1{\sqrt{2\pi}}e^{-z_j^2/2}

をもつ確率分布をNr(0,Ir)N_r(0,I_r)と書く。この分布に従う確率ベクトルZ=(Z1,…,Zr)⊤Z=(Z_1,\ldots,Z_r)^\topをrr次元標準正規ベクトル (rr-dimensional standard normal vector) という。

各一次元因子の積分は正規密度の規格化§E11.5 命題 2.5により11である。被積分関数が非負なので、Tonelli の定理§E9.11 定理 2.3により∫Rrφr=1\int_{\mathbb R^r}\varphi_r=1である。また、Borel 集合B1,…,BrB_1,\ldots,B_rに対して

P(Z1∈B1,…,Zr∈Br)=∏j=1r∫Bj12πe−zj2/2 dzjP(Z_1\in B_1,\ldots,Z_r\in B_r) =\prod_{j=1}^{r}\int_{B_j}\frac1{\sqrt{2\pi}}e^{-z_j^2/2}\,dz_j

であるため、成分は独立なN(0,1)N(0,1)確率変数である。標準正規化の定数と独立性の双方が、この積表示によって確認される。

補題 3.2.r≥1r\geq1とし、Z∼Nr(0,Ir)Z\sim N_r(0,I_r)とする。QQをrr次直交行列とすると、QZQZもNr(0,Ir)N_r(0,I_r)に従う。

証明. 直交行列の特徴づけ§D3.15 命題 1.2により∥Qz∥=∥z∥\lVert Qz\rVert=\lVert z\rVertかつ∣det⁡Q∣=1|\det Q|=1である。h∈Cb(Rr)h\in C_b(\mathbb R^r)とする。 Borel 可測関数に対する変数変換公式§E11.8 補題 2.1を、可逆線形写像z↦Qzz\mapsto Qzと、終域上の非負 Borel 可測関数h±(x)φr(Q⊤x)h^\pm(x)\varphi_r(Q^\top x)に適用すると、

∫Rrh(Qz)φr(z) dz=∫Rrh(x)φr(Q⊤x) dx=∫Rrh(x)φr(x) dx\int_{\mathbb R^r}h(Qz)\varphi_r(z)\,dz =\int_{\mathbb R^r}h(x)\varphi_r(Q^\top x)\,dx =\int_{\mathbb R^r}h(x)\varphi_r(x)\,dx

を得る。二つの法則はすべての有界連続関数の積分で一致するので、補題 2.1により同じ確率測度である。▨

補題 3.3.r≥1r\geq1、Z∼Nr(0,Ir)Z\sim N_r(0,I_r)およびu∈Rru\in\mathbb R^rに対して、

u⊤Z∼N(0,∥u∥2)u^\top Z\sim N(0,\lVert u\rVert^2)

である。u=0u=0の場合には、右辺は分散零の正規分布N(0,0)N(0,0)である。

証明.u=0u=0ならばu⊤Z=0u^\top Z=0である。u≠0u\neq0とし、v=u/∥u∥v=u/\lVert u\rVertとおく。単位ベクトルを座標軸へ移す鏡映§D3.15 補題 2.3により、直交行列HHでHv=e1Hv=e_1かつH⊤=HH^\top=Hとなるものが存在する。したがって、

u⊤Z=∥u∥v⊤Z=∥u∥e1⊤HZ.u^\top Z=\lVert u\rVert v^\top Z =\lVert u\rVert e_1^\top HZ.

補題 3.2によりHZHZは標準正規ベクトルなので、その第一成分はN(0,1)N(0,1)に従う。Borel 可測関数に対する変数変換公式§E11.8 補題 2.1を写像x↦∥u∥xx\mapsto\lVert u\rVert xへ適用すると、上の線形結合はN(0,∥u∥2)N(0,\lVert u\rVert^2)に従う。▨

4 多変量正規分布の定義と特徴づけ

定義 4.1.X=(X1,…,Xd)⊤X=(X_1,\ldots,X_d)^\topをRd\mathbb R^d値確率ベクトルとする。すべてのt∈Rdt\in\mathbb R^dについて、実数値確率変数t⊤Xt^\top Xが分散零を許す一変量正規分布に従うとき、XXは多変量正規分布 (multivariate normal distribution) に従う、または Gaussian 確率ベクトル (Gaussian random vector) であるという。

t=0t=0の射影は定数00であり、定義 1.1によりN(0,0)N(0,0)に従う。分散零を定義から除くと、この自明な射影さえ条件を満たさないため、退化正規分布を含めることは本質的である。

定理 4.2.XXをRd\mathbb R^d値確率ベクトルとする。次の二条件は同値である。

  1. XXは定義 4.1の意味で Gaussian である。
  2. ある整数r≥1r\geq1、m∈Rdm\in\mathbb R^d、実行列A∈Rd×rA\in\mathbb R^{d\times r}、およびZ∼Nr(0,Ir)Z\sim N_r(0,I_r)が存在して、XXとm+AZm+AZの法則が一致する。

このとき、m=E[X]m=E[X]かつ

Σ=Cov⁡(X)=AA⊤\Sigma=\operatorname{Cov}(X)=AA^\top

であり、Σ\Sigmaは半正定値である。逆に、任意のm∈Rdm\in\mathbb R^dと実対称半正定値行列Σ\Sigmaに対して、平均mm、共分散Σ\Sigmaをもつ Gaussian 確率測度がただ一つ存在する。この法則をNd(m,Σ)N_d(m,\Sigma)と書く。

証明. 第二の条件を仮定する。任意のt∈Rdt\in\mathbb R^dに対して

t⊤(m+AZ)=t⊤m+(A⊤t)⊤Zt^\top(m+AZ)=t^\top m+(A^\top t)^\top Z

である。W=(A⊤t)⊤ZW=(A^\top t)^\top Zとおくと、補題 3.3によりW∼N(0,t⊤AA⊤t)W\sim N(0,t^\top AA^\top t)である。分散が正の場合には、Borel 可測関数に対する変数変換公式§E11.8 補題 2.1を平行移動x↦t⊤m+xx\mapsto t^\top m+xへ適用すると、t⊤m+W∼N(t⊤m,t⊤AA⊤t)t^\top m+W\sim N(t^\top m,t^\top AA^\top t)を得る。分散が零の場合にはW=0W=0がほとんど確実に成り立つため、同じ結論は定義 1.1の退化分布の定義から従う。したがって、m+AZm+AZ、従ってXXは Gaussian である。

標準正規ベクトルの各成分は平均00、分散11である。異なる成分の積の期待値は、積密度と Fubini の定理§E9.11 定理 3.2によって一次元積分の積へ分かれ、E[ZiZj]=0E[Z_iZ_j]=0となる。よってE[Z]=0E[Z]=0、Cov⁡(Z)=Ir\operatorname{Cov}(Z)=I_rである。期待値と共分散の線形性§E11.4 命題 1.2、§E11.4 命題 2.3を成分ごとに適用すると、

E[m+AZ]=m,Cov⁡(m+AZ)=AA⊤E[m+AZ]=m,\qquad\operatorname{Cov}(m+AZ)=AA^\top

を得る。さらにt⊤AA⊤t=∥A⊤t∥2≥0t^\top AA^\top t=\lVert A^\top t\rVert^2\geq0なのでAA⊤AA^\topは半正定値である。

第一の条件を仮定する。各成分Xi=ei⊤XX_i=e_i^\top Xは一変量正規分布に従うので二次可積分である。m=E[X]m=E[X]、Σ=Cov⁡(X)\Sigma=\operatorname{Cov}(X)とおく。任意のttについて、期待値と共分散の公式から

E[t⊤X]=t⊤m,Var⁡(t⊤X)=t⊤ΣtE[t^\top X]=t^\top m, \qquad \operatorname{Var}(t^\top X)=t^\top\Sigma t

である。定義によりt⊤Xt^\top Xは正規分布なので、命題 1.2から

t⊤X∼N(t⊤m,t⊤Σt)(5)t^\top X\sim N(t^\top m,t^\top\Sigma t) \tag{5}

となる。分散は非負であるためΣ\Sigmaは半正定値である。

スペクトル定理§D3.15 定理 3.1により、ある直交行列QQとλ1,…,λd≥0\lambda_1,\ldots,\lambda_d\geq0が存在して

Σ=Qdiag⁡(λ1,…,λd)Q⊤\Sigma=Q\operatorname{diag}(\lambda_1,\ldots,\lambda_d)Q^\top

と書くことができる。

A=Qdiag⁡(λ1,…,λd)Q⊤A=Q\operatorname{diag}(\sqrt{\lambda_1},\ldots,\sqrt{\lambda_d})Q^\top

とおけばA=A⊤A=A^\topかつAA⊤=ΣAA^\top=\Sigmaである。Z∼Nd(0,Id)Z\sim N_d(0,I_d)とすると、既に示した方向からt⊤(m+AZ)∼N(t⊤m,t⊤Σt)t^\top(m+AZ)\sim N(t^\top m,t^\top\Sigma t)である。式 (5) と補題 2.2により、XXとm+AZm+AZの法則は一致する。

任意の(m,Σ)(m,\Sigma)に対する存在は、同じスペクトル分解とm+AZm+AZの構成から従う。同じ平均と共分散をもつ二つの Gaussian 確率ベクトルでは、式 (5) によりすべての一次元射影の法則が一致するため、補題 2.2から法則が一致する。▨

この定理は、半正定値行列の零固有値をそのままAAの零固有値として保持する。したがって、退化成分を独立な雑音で置き換える操作は行っていない。

5 正定値な場合の密度

定理 5.1.Σ\Sigmaをdd次実対称正定値行列とする。このとき、Nd(m,Σ)N_d(m,\Sigma)は Lebesgue 密度

fm,Σ(x)=1(2π)d/2(det⁡Σ)1/2exp⁡(−12(x−m)⊤Σ−1(x−m))(6)f_{m,\Sigma}(x) =\frac1{(2\pi)^{d/2}(\det\Sigma)^{1/2}} \exp\left(-\frac12(x-m)^\top\Sigma^{-1}(x-m)\right) \tag{6}

をもつ。

証明.定理 4.2のスペクトル分解で、A=Σ1/2A=\Sigma^{1/2}を対称正定値平方根とする。すべての固有値が正なのでAAは可逆であり、A2=ΣA^2=\Sigma、det⁡A=(det⁡Σ)1/2>0\det A=(\det\Sigma)^{1/2}>0である。

Z∼Nd(0,Id)Z\sim N_d(0,I_d)とY=m+AZY=m+AZを考える。h∈Cb(Rd)h\in C_b(\mathbb R^d)に対し、アフィン微分同相z↦m+Azz\mapsto m+Azと、終域上の非負 Borel 可測関数h±(x)(det⁡A)−1φd(A−1(x−m))h^\pm(x)(\det A)^{-1}\varphi_d(A^{-1}(x-m))へ、Borel 可測関数に対する変数変換公式§E11.8 補題 2.1を適用して差を取ると、

E[h(Y)]=∫Rdh(m+Az)φd(z) dz=∫Rdh(x)1det⁡Aφd(A−1(x−m)) dx=∫Rdh(x)fm,Σ(x) dx.\begin{aligned} E[h(Y)] &=\int_{\mathbb R^d}h(m+Az)\varphi_d(z)\,dz\\ &=\int_{\mathbb R^d}h(x) \frac{1}{\det A}\varphi_d\bigl(A^{-1}(x-m)\bigr)\,dx\\ &=\int_{\mathbb R^d}h(x)f_{m,\Sigma}(x)\,dx. \end{aligned}

最後の等号ではA−⊤A−1=Σ−1A^{-\top}A^{-1}=\Sigma^{-1}を用いた。右辺の関数は非負であり、h=1h=1とすれば積分が11である。YYの法則と密度 (6) から定まる確率測度は、すべての有界連続関数の積分で一致する。補題 2.1により両者は等しい。定理 4.2からY∼Nd(m,Σ)Y\sim N_d(m,\Sigma)なので主張を得る。▨

密度 (6) はdet⁡Σ>0\det\Sigma>0とΣ−1\Sigma^{-1}を必要とする。半正定値で特異なΣ\Sigmaへ、この式を形式的に適用してはならない。

6 特異な場合の集中部分空間

定理 6.1.X∼Nd(m,Σ)X\sim N_d(m,\Sigma)とし、Σ\Sigmaを半正定値とする。このとき、

P(X∈m+Ran⁡Σ)=1P\bigl(X\in m+\operatorname{Ran}\Sigma\bigr)=1

である。特にrank⁡Σ<d\operatorname{rank}\Sigma<dならば、XXは真のアフィン部分空間に集中し、dd次元 Lebesgue 測度に関する密度をもたない。

証明.A=Σ1/2A=\Sigma^{1/2}を定理 4.2で構成した対称半正定値平方根とする。同定理によりXXとm+AZm+AZの法則は一致する。スペクトル分解からker⁡A=ker⁡Σ\ker A=\ker\Sigmaである。実対称行列では像が核の直交補空間に等しいので、

Ran⁡A=(ker⁡A)⊥=(ker⁡Σ)⊥=Ran⁡Σ\operatorname{Ran}A=(\ker A)^\perp=(\ker\Sigma)^\perp=\operatorname{Ran}\Sigma

である。すべてのzzについてm+Az∈m+Ran⁡Σm+Az\in m+\operatorname{Ran}\Sigmaなので、集中の主張を得る。

rank⁡Σ=r<d\operatorname{rank}\Sigma=r<dとする。Ran⁡Σ\operatorname{Ran}\Sigmaの正規直交基底を一つ取り、その係数が[−n,n][-n,n]に入る部分を考える。係数領域を幅δ\deltaのrr次元立方体で分割すると、必要な小立方体の個数はO(δ−r)O(\delta^{-r})である。各小立方体の像は、Rd\mathbb R^d内の一辺CδC\deltaの立方体に含まれる。したがって、この有界部分は総体積O(δd−r)O(\delta^{d-r})のdd次元立方体で覆われ、δ↓0\delta\downarrow0により Lebesgue 測度が00である。nnについて可算和を取ると、アフィン部分空間全体の Lebesgue 測度も00である。もしXXが Lebesgue 密度をもてば、この零集合へ確率11を与えることは絶対連続性に反する。▨

例 6.2 (一直線に集中する二変量正規分布).G∼N(0,1)G\sim N(0,1)とし、X=(G,2G)⊤X=(G,2G)^\topとする。任意の(a,b)∈R2(a,b)\in\mathbb R^2に対してaX1+bX2=(a+2b)GaX_1+bX_2=(a+2b)GはN(0,(a+2b)2)N(0,(a+2b)^2)に従うので、XXは Gaussian である。共分散行列は

Σ=(1224)\Sigma= \begin{pmatrix}1&2\\2&4\end{pmatrix}

であり、階数は11、像はspan⁡{(1,2)⊤}\operatorname{span}\{(1,2)^\top\}である。実際にP(X2=2X1)=1P(X_2=2X_1)=1であり、平面上の Lebesgue 密度は存在しない。

7 Gaussian ベクトルでは無相関から独立性が従う

一般の確率変数では無相関から独立性は従わない。Gaussian ベクトルでは、共分散の零ブロックが標準正規ベクトルの独立な座標ブロックへ分解されるため、逆向きも成立する。

定理 7.1.X∼Nd(m,Σ)X\sim N_d(m,\Sigma)とし、I,JI,Jを互いに交わらない空でない二つの添字集合とする。I∪JI\cup Jが全添字集合に一致することは仮定しない。ΣIJ=0\Sigma_{IJ}=0ならば、部分ベクトルXIX_IとXJX_Jは独立である。

特に、Σ\Sigmaが対角行列ならばX1,…,XdX_1,\ldots,X_dは互いに独立である。また、任意の二成分Xi,XjX_i,X_jについてCov⁡(Xi,Xj)=0\operatorname{Cov}(X_i,X_j)=0ならばXiX_iとXjX_jは独立である。分散が零である定数成分もこの主張に含まれる。

証明.XIX_Iの任意の線形結合は、XXの係数をJJ上で零とした線形結合であるため正規分布に従う。したがって、XI∼N∣I∣(mI,ΣII)X_I\sim N_{|I|}(m_I,\Sigma_{II})であり、同様にXJ∼N∣J∣(mJ,ΣJJ)X_J\sim N_{|J|}(m_J,\Sigma_{JJ})である。

AI=ΣII1/2A_I=\Sigma_{II}^{1/2}、AJ=ΣJJ1/2A_J=\Sigma_{JJ}^{1/2}とし、Z=(ZI,ZJ)Z=(Z_I,Z_J)を∣I∣+∣J∣|I|+|J|次元標準正規ベクトルとする。

YI=mI+AIZI,YJ=mJ+AJZJY_I=m_I+A_IZ_I, \qquad Y_J=m_J+A_JZ_J

とおく。標準正規密度の積表示からZIZ_IとZJZ_Jは独立である。任意の Borel 集合CI,CJC_I,C_Jについて、{YI∈CI}\{Y_I\in C_I\}と{YJ∈CJ}\{Y_J\in C_J\}はそれぞれZIZ_IとZJZ_Jの Borel 逆像なので、確率の積公式が保たれる。したがって、可測なアフィン像YI,YJY_I,Y_Jも独立である。さらに(YI,YJ)(Y_I,Y_J)は Gaussian で、平均と共分散は

((mImJ),(ΣII00ΣJJ))\left( \begin{pmatrix}m_I\\m_J\end{pmatrix}, \begin{pmatrix}\Sigma_{II}&0\\0&\Sigma_{JJ}\end{pmatrix} \right)

である。仮定ΣIJ=0\Sigma_{IJ}=0と共分散行列の対称性から、表示した平均ベクトルと共分散行列は(XI,XJ)(X_I,X_J)の平均と共分散に等しい。定理 4.2の一意性により、(XI,XJ)(X_I,X_J)と(YI,YJ)(Y_I,Y_J)の法則は一致する。後者の同時分布は周辺分布の積なので、前者についても同じであり、XIX_IとXJX_Jは独立である。

Σ\Sigmaが対角の場合には、同じ構成を各成分の平方根からなる対角行列で行うと、XXの法則は独立なmi+ΣiiZim_i+\sqrt{\Sigma_{ii}}Z_iの法則に一致する。二成分の主張はI={i}I=\{i\}、J={j}J=\{j\}として得られる。▨

8 非退化な密度から求める条件付き分布

ここでは、条件とする一点の確率を比で定義しない。同時密度を周辺密度で割って得られる条件付き密度だけを扱う。

定理 8.1.

X=(X1X2)∼Np+q((m1m2),(Σ11Σ12Σ21Σ22))X=\begin{pmatrix}X_1\\X_2\end{pmatrix} \sim N_{p+q}\left( \begin{pmatrix}m_1\\m_2\end{pmatrix}, \begin{pmatrix}\Sigma_{11}&\Sigma_{12}\\\Sigma_{21}&\Sigma_{22}\end{pmatrix} \right)

とし、全共分散行列Σ\Sigmaは正定値であると仮定する。X1∈RpX_1\in\mathbb R^p、X2∈RqX_2\in\mathbb R^qとする。このとき、

B=Σ12Σ22−1,S=Σ11−Σ12Σ22−1Σ21B=\Sigma_{12}\Sigma_{22}^{-1}, \qquad S=\Sigma_{11}-\Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21}

とおけばSSは正定値であり、X2=yX_2=yの下で密度から定まるX1X_1の条件付き分布は

Np(m1+B(y−m2),S)(7)N_p\bigl(m_1+B(y-m_2),S\bigr) \tag{7}

である。より具体的に、

k(y,x)=fm1+B(y−m2),S(x),K(y,A)=∫Ak(y,x) dxk(y,x)=f_{m_1+B(y-m_2),S}(x), \qquad K(y,A)=\int_Ak(y,x)\,dx

とおく。各 Borel 集合A⊆RpA\subseteq\mathbb R^pについてy↦K(y,A)y\mapsto K(y,A)は Borel 可測であり、各y∈Rqy\in\mathbb R^qについてA↦K(y,A)A\mapsto K(y,A)はRp\mathbb R^p上の確率測度である。さらに、任意の Borel 集合A⊆RpA\subseteq\mathbb R^pとC⊆RqC\subseteq\mathbb R^qに対して

P(X1∈A,X2∈C)=∫CK(y,A)fm2,Σ22(y) dyP(X_1\in A,X_2\in C)=\int_CK(y,A)f_{m_2,\Sigma_{22}}(y)\,dy

が成り立つ。

証明.Σ\Sigmaが正定値なので、その主部分行列Σ22\Sigma_{22}も正定値であり可逆である。u≠0u\neq0に対して

w=(u−Σ22−1Σ21u)≠0w=\begin{pmatrix}u\\-\Sigma_{22}^{-1}\Sigma_{21}u\end{pmatrix}\neq0

とおくと、直接計算によりw⊤Σw=u⊤Suw^\top\Sigma w=u^\top S uである。左辺は正なのでSSは正定値である。

ブロック行列

L=(IpB0Iq),D=(S00Σ22)L=\begin{pmatrix}I_p&B\\0&I_q\end{pmatrix}, \qquad D=\begin{pmatrix}S&0\\0&\Sigma_{22}\end{pmatrix}

に対して

Σ=LDL⊤\Sigma=LDL^\top

が成り立つ。したがって、det⁡L=1\det L=1からdet⁡Σ=(det⁡S)(det⁡Σ22)\det\Sigma=(\det S)(\det\Sigma_{22})である。また、u=x−m1u=x-m_1、v=y−m2v=y-m_2とすると

(uv) ⁣⊤Σ−1(uv)=(u−Bv)⊤S−1(u−Bv)+v⊤Σ22−1v.(8)\begin{pmatrix}u\\v\end{pmatrix}^{\!\top} \Sigma^{-1} \begin{pmatrix}u\\v\end{pmatrix} =(u-Bv)^\top S^{-1}(u-Bv)+v^\top\Sigma_{22}^{-1}v. \tag{8}

式 (8) はL−1(u,v)⊤=(u−Bv,v)⊤L^{-1}(u,v)^\top=(u-Bv,v)^\topをΣ−1=L−⊤D−1L−1\Sigma^{-1}=L^{-\top}D^{-1}L^{-1}へ代入すると得られる。

定理 5.1の密度へ行列式の分解と式 (8) を代入すると、

fX1,X2(x,y)=fm2,Σ22(y)fm1+B(y−m2),S(x)(9)f_{X_1,X_2}(x,y) =f_{m_2,\Sigma_{22}}(y) f_{m_1+B(y-m_2),S}(x) \tag{9}

を得る。第一因子はすべてのy∈Rqy\in\mathbb R^qで正である。第二因子をk(y,x)=fm1+B(y−m2),S(x)k(y,x)=f_{m_1+B(y-m_2),S}(x)と書く。SSは正定値であるため、定理 5.1により、各yyについてx↦k(y,x)x\mapsto k(y,x)は非負 Borel 可測で積分が11である。したがって、Lebesgue 積分の可算加法性から、各yyについてA↦K(y,A)A\mapsto K(y,A)は確率測度である。

表示された正規密度の式から(y,x)↦k(y,x)(y,x)\mapsto k(y,x)は連続である。Borel 集合A⊆RpA\subseteq\mathbb R^pを固定すると、(y,x)↦1A(x)k(y,x)(y,x)\mapsto\mathbf1_A(x)k(y,x)は非負 Borel 可測である。 Tonelli の定理§E9.11 定理 2.3は

y⟼K(y,A)=∫Rp1A(x)k(y,x) dxy\longmapsto K(y,A)=\int_{\mathbb R^p}\mathbf1_A(x)k(y,x)\,dx

が Borel 可測であることも与える。同じ定理と式 (9) により、Borel 集合C⊆RqC\subseteq\mathbb R^qに対して

P(X1∈A,X2∈C)=∫CK(y,A)fm2,Σ22(y) dyP(X_1\in A,X_2\in C) =\int_CK(y,A)f_{m_2,\Sigma_{22}}(y)\,dy

となる。A=RpA=\mathbb R^pとすれば、X2X_2の周辺密度はfm2,Σ22f_{m_2,\Sigma_{22}}である。したがって、同時密度と正の周辺密度の比はkkであり、上の等式はKKが式 (7) の条件付き分布を与えることを示す。零確率の一点事象へ§E11.2 定義 1.1の比を適用したのではない。▨

例 8.2 (二変量正規分布の条件付き平均と分散).

(XY)∼N2((1−1),(4223))\begin{pmatrix}X\\Y\end{pmatrix} \sim N_2\left( \begin{pmatrix}1\\-1\end{pmatrix}, \begin{pmatrix}4&2\\2&3\end{pmatrix} \right)

とする。共分散行列の行列式は12−4=8>012-4=8>0で、第一主座小行列も正なので正定値である。定理 8.1にB=2/3B=2/3とS=4−2⋅3−1⋅2=8/3S=4-2\cdot3^{-1}\cdot2=8/3を代入すると、

X∣(Y=y)∼N(1+23(y+1),83)X\mid(Y=y)\sim N\left(1+\frac23(y+1),\frac83\right)

を得る。例えばy=2y=2ならば条件付き平均は33であり、条件付き分散は8/38/3のままである。

共分散行列が特異な場合には周辺密度や逆行列が存在しないことがある。その場合に式 (7) を一般化するには、条件付き分布の測度論的な構成と、退化方向を分離する追加の議論が必要であり、本記事では扱わない。

9 演習

問題 9.1.

  1. X∼Nd(m,Σ)X\sim N_d(m,\Sigma)と実行列C∈Rk×dC\in\mathbb R^{k\times d}、b∈Rkb\in\mathbb R^kに対して b+CX∼Nk(b+Cm,CΣC⊤)b+CX\sim N_k(b+Cm,C\Sigma C^\top) が成り立つことを、すべての線形結合を調べることによって証明せよ。CΣC⊤C\Sigma C^\topが特異な場合も証明に含めること。
  2. X∼N3(0,Σ)X\sim N_3(0,\Sigma)、 Σ=(101040102)\Sigma=\begin{pmatrix}1&0&1\\0&4&0\\1&0&2\end{pmatrix} とする。X2X_2が(X1,X3)(X_1,X_3)と独立であることを証明し、X1X_1とX3X_3が独立でない理由を述べよ。
  3. 例 6.2について、t=(2,−1)⊤t=(2,-1)^\topではt⊤X∼N(0,0)t^\top X\sim N(0,0)となることを確認せよ。この退化射影とRan⁡Σ\operatorname{Ran}\Sigmaの直交補空間との関係を説明せよ。
  4. 定理 8.1のブロック分解Σ=LDL⊤\Sigma=LDL^\topを行列積によって検算し、SSの正定値性の証明で用いたベクトルwwが零にならない理由を述べよ。

10 本記事の境界と次の課題

多変量正規分布の有限次元理論は、半正定値共分散を含めて平均と共分散だけで閉じる。本単元後半では、「確率変数の収束概念」で実確率変数列の分布収束を定義し、「特性関数と Lévy の連続性定理」で特性関数による収束判定を証明する。後続の「中心極限定理」では、これらの結果を用いて Lindeberg–Lévy の中心極限定理を証明する。条件付き分布について本記事で用いたのは正定値共分散から得られる密度の比だけである。条件付き期待値は次の記事で扱い、正則条件付き分布の一般論は「測度論続論」が扱う。

参考文献

  1. Vladimir I. Bogachev, Gaussian Measures, Mathematical Surveys and Monographs 62, American Mathematical Society, Providence, RI, 1998.退化 Gaussian 分布、射影による定義、およびアフィン像による特徴づけを参考にした。
  2. Achim Klenke, Probability Theory, 3rd ed., Universitext, Springer, 2020.多変量正規密度、無相関と独立性、および条件付き分布の有限次元公式を参考にした。
  3. T. W. Anderson, An Introduction to Multivariate Statistical Analysis, 3rd ed., Wiley, Hoboken, New Jersey, 2003.共分散行列のブロック分解と条件付き正規分布の公式を参考にした。

前提記事

9 本の記事・単元を表示