1 標本平均と標本分散
無作為標本と統計量は§E14.1 定義 2.1で定めた。本節では実数値の無作為標本を扱い、標本平均Xˉ=n−1∑i=1nXiと、n≥2の場合の不偏標本分散S2=(n−1)−1∑i=1n(Xi−Xˉ)2の性質を調べる。
定義 1.1.X∈L2(P)に対して、分散の非負平方根σX=Var(X)をXの標準偏差 (standard deviation) という。
定義 1.2. 統計量T=T(X1,…,Xn)の像測度P∘T−1を、Tの標本分布 (sampling distribution) という。さらにTが実数値でT∈L2(P)であるとき、その標準偏差Var(T)を、推定量Tの標準誤差 (standard error)(standard error, SE)という。
定義 1.3.X,Y∈L2(P)の標準偏差がともに正であるとき、
ρ(X,Y)=σXσYCov(X,Y)をXとYの相関係数 (correlation coefficient) という。Cov(X,Y)=0であるとき、XとYは無相関 (uncorrelated) であるという。分散が零の変数を含む場合、相関係数は定義しない。
§E11.4 命題 2.3により、相関係数は∣ρ(X,Y)∣≤1を満たす。中心化した確率変数X−E[X]とY−E[Y]をL2(P)のベクトルとみなすと、共分散は両者の内積であり、相関係数は両者がなす角の余弦である。独立な二つのL2(P)確率変数は§E11.7 定理 3.1により無相関であるが、無相関な二変数が独立であるとは限らない。
定理 1.4.X1,…,Xn∈L2(P)とする。このとき
Var(i=1∑nXi)=i=1∑nVar(Xi)+21≤i<j≤n∑Cov(Xi,Xj)が成り立つ。特に、X1,…,Xnが対ごとに無相関ならば
Var(i=1∑nXi)=i=1∑nVar(Xi)である。
証明.μi=E[Xi]とおく。有限個のL2(P)確率変数の和はL2(P)に属し、期待値の線形性から
i=1∑nXi−E[i=1∑nXi]=i=1∑n(Xi−μi)である。右辺の平方を展開して期待値の線形性を用いると
Var(i=1∑nXi)=i=1∑nj=1∑nE[(Xi−μi)(Xj−μj)]=i=1∑nVar(Xi)+21≤i<j≤n∑Cov(Xi,Xj)を得る。各積の可積分性は§E11.4 定理 2.2による。対ごとに無相関ならば非対角項はすべて零である。▨
同分布性だけでは、標本平均の分散が標本サイズとともに減少するとは限らない。実確率変数Zが0<Var(Z)<∞を満たすとし、各iに対してXi=Zとおく。このとき各Xiは同じ分布に従うが、相互に独立ではない。Xˉ=Zであるから、すべてのnに対してVar(Xˉ)=Var(Z)となり、平均をとっても分散は減少しない。
命題 1.5.X1,…,Xnを独立同分布な実確率変数とする。X1∈L1(P)でμ=E[X1]ならば
E[Xˉ]=μ.さらにX1∈L2(P)でσ2=Var(X1)ならば
Var(Xˉ)=nσ2.σ2=0の場合も含む。したがって、Xˉはμの不偏推定量であり、その分散は標本サイズに対して1/nの比率で減少する。
証明.Xiはすべて可積分であり、期待値の線形性から
E[Xˉ]=n1i=1∑nE[Xi]=μを得る。さらにXi∈L2(P)ならば、独立性によって異なる二変数の共分散は0である。定理 1.4を適用すると、
Var(Xˉ)=n21i=1∑nVar(Xi)=nσ2である。▨
分散の式には独立性より弱い仮定である二変数ずつの無相関性で足りる。期待値の式には独立性も無相関性も必要ない。
命題 1.6.n≥2とし、X1,…,Xnを独立同分布なL2(P)確率変数とする。μ=E[X1]、σ2=Var(X1)とおき、
S2=n−11i=1∑n(Xi−Xˉ)2と定める。このとき
S2=n−11(i=1∑nXi2−nXˉ2),E[S2]=σ2.σ2=0の場合も含む。
証明.∑i=1n(Xi−Xˉ)=0を用いて平方を展開すると、
i=1∑n(Xi−Xˉ)2=i=1∑nXi2−2Xˉi=1∑nXi+nXˉ2=i=1∑nXi2−nXˉ2である。命題 1.5と分散の恒等式から
E[Xˉ2]=nσ2+μ2,E[Xi2]=σ2+μ2である。したがって、
E[S2]=n−11(n(σ2+μ2)−n(nσ2+μ2))=σ2を得る。▨
標本平均については命題 1.5より
SE(Xˉ)=nσ
である。n≥2かつσが未知のときは、標本標準偏差S=S2で置き換えたS/nを推定標準誤差として用いる。
注意 1.7 (標準偏差と標準誤差). 母標準偏差σは母集団の 1 個体のばらつきであり、標本サイズnに依存しない量である。一方、標本平均の標準誤差σ/nは推定量のばらつきであり、nを増やすほど0に近づく。両者はn倍だけ異なる。
例 1.8 (サイコロの標本平均). 公平なサイコロの目Xは各k∈{1,…,6}に確率61を置く。期待値の定義(§E11.4 定義 1.1)よりE[X]=∑k=16k⋅61=61+2+3+4+5+6=621=3.5.像分布に関する積分公式(§E11.4 定理 1.3)でg(x)=x2をとるとE[X2]=∑k=16k2⋅61=61+4+9+16+25+36=691≈15.1667.よって分散の恒等式(§E11.4 命題 2.3)からVar(X)=691−(3.5)2=691−449=12182−147=1235≈2.9167.標準偏差はσX=35/12≈1.7078である。
独立な公平なサイコロ二個の目をX1,X2とし、S=X1+X2とおく。期待値の線形性と独立性による分散の加法性から
E[S]=7,Var(S)=635≈5.8333である。さらに、独立な公平なサイコロn個の標本平均Xˉについて命題 1.5を適用すると、
E[Xˉ]=27,Var(Xˉ)=12n35を得る。
2 順序統計量
補題 2.1.n≥1とする。Y∼Bin(n,p)に対して
Tx(p)=Pp(Y≥x)(1≤x≤n),Hx(p)=Pp(Y≤x)(0≤x≤n−1)とおく。Txは[0,1]上で連続かつ狭義単調増加であり、Tx(0)=0、Tx(1)=1を満たす。0<p<1では
Tx′(p)=n(x−1n−1)px−1(1−p)n−x>0である。Hxは[0,1]上で連続かつ狭義単調減少であり、Hx(0)=1、Hx(1)=0を満たし、0<p<1では
Hx′(p)=−n(xn−1)px(1−p)n−x−1<0である。さらに、xが増加するとTx(p)は非増加になり、Hx(p)は非減少になる。
証明.§E11.5 定義 1.2の確率質量関数から、0<p<1において有限和を微分する。恒等式k(kn)=n(k−1n−1)と(n−k)(kn)=n(kn−1)を用いると、中間項が相殺されて
Tx′(p)=nk=x∑n{(k−1n−1)pk−1(1−p)n−k−(kn−1)pk(1−p)n−k−1}=n(x−1n−1)px−1(1−p)n−x>0を得る。和の各項は多項式であるためTxは[0,1]上で連続であり、端点の値は確率質量関数へp=0,1を代入して得られる。またHx(p)=1−Tx+1(p)であるから、Hxに関する導関数、連続性、狭義単調性および端点の主張も従う。事象{Y≥x+1}⊆{Y≥x}と{Y≤x}⊆{Y≤x+1}から、xに関する二つの単調性を得る。▨
命題 2.2 (順序統計量の分布).X1,…,Xnを分布関数Fに従う独立同分布な実確率変数とし、小さい順に並べた値をX(1)≤⋯≤X(n)と書く。1≤k≤nとx∈Rに対して
P(X(k)≤x)=j=k∑n(jn)F(x)j(1−F(x))n−j.この式はFが原子をもつ場合にも成り立つ。さらにFが Lebesgue 密度fをもつならば、X(k)は密度
(k−1)!(n−k)!n!F(x)k−1(1−F(x))n−kf(x)をもつ。
証明. 固定したxに対してNx=∑i=1n1{Xi≤x}とおく。事象{X(k)≤x}は{Nx≥k}に等しい。各指示関数は成功確率F(x)の独立な Bernoulli 確率変数であるから、
P(Nx=j)=(jn)F(x)j(1−F(x))n−jであり、j=k,…,nについて和を取れば分布関数の式を得る。この議論ではFの連続性を用いていない。
Fが密度fをもつとする。分布関数の式は補題 2.1のTkを用いてTk(F(x))と書くことができる。同補題の導関数の式から
Tk′(u)=(k−1)!(n−k)!n!uk−1(1−u)n−kである。Tkは[0,1]上で連続微分可能であり、Fは絶対連続でF′=fがほとんど至る所で成り立つため、合成Tk∘Fも絶対連続である。連鎖律から表示した密度を得る。▨
3 積率条件と標本平均
有限標本の積率公式と大標本での集中は、母集団に課す積率条件に依存する。次の標準 Cauchy 分布は、その条件を外したときに標本平均の挙動が変わる例である。
命題 3.1. 関数
f(x)=π(1+x2)1(x∈R)は確率密度である。この密度をもつ標準 Cauchy 分布に従う確率変数Xについて
E[X+]=E[X−]=∞であり、平均は定義されない。独立同分布なX1,X2,…がこの分布に従うならば、任意のn≥1に対して標本平均Xˉnも標準 Cauchy 分布に従う。したがって、Xˉnはどの定数にも確率収束しない。さらに、任意のt=0に対して
E[etX]=∞である。
証明. 逆正接関数の原始関数を用いると
∫Rπ(1+x2)dx=π1[arctanx]−∞∞=1であるから、fは確率密度である。非負確率変数の期待値を密度で積分すると
E[X+]=π1∫0∞1+x2xdx=∞,E[X−]=π1∫−∞01+x2−xdx=∞を得る。したがってE[X]は正部分と負部分の期待値の差として定義されず、E[∣X∣]=∞でもある。
a>0に対して
fa(x)=π(a2+x2)aとおく。逆正接関数による同じ積分から、faは確率密度である。a,b>0とz=0に対して
(x2+a2)((z−x)2+b2)1AΔ=x2+a2Ax+B+(x−z)2+b2−A(x−z)+D,=Δ2z,B=Δz2+b2−a2,D=Δz2+a2−b2,=(z2+(a+b)2)(z2+(a−b)2)が成り立つ。両辺を[−R,R]上で積分してR→∞とする。一次の分子から生じる二つの対数項は極限で相殺され、逆正接項から
∫R(x2+a2)((z−x)2+b2)dx=π(aB+bD)=ab(z2+(a+b)2)π(a+b)を得る。固定したa,b>0に対し、任意のz,x∈Rについて
fa(x)fb(z−x)≤πbfa(x)であり、右辺はxについて可積分である。fbの連続性と優収束定理§E9.7 定理 3.2により、fa∗fbはzの連続関数である。上でz=0に対して得た積分公式の右辺もzについて連続であるから、z→0として同じ公式がz=0でも成り立つ。したがって
(fa∗fb)(z)=π2ab∫R(x2+a2)((z−x)2+b2)dx=fa+b(z)である。
Sn=X1+⋯+Xnとおく。独立な連続確率変数の和の密度を与える畳み込み定理§E11.9 定理 2.2とfa∗fb=fa+bを帰納的に適用すると、Snは密度fnをもつ。密度の尺度変換からSn/n=Xˉnの密度は
nfn(nx)=π(1+x2)1=f(x)である。任意のc∈Rに対して
P(∣Xˉn−c∣>1)=P(∣X−c∣>1)>0はnに依存しないため、Xˉnはcへ確率収束しない。
t>0とする。十分大きなxでは1+x2≤etx/2であるから、正の裾で
π(1+x2)etx≥π1etx/2となり、その積分は発散する。ゆえにE[etX]=∞である。t<0の場合はy=−xと変数変換すると、負の裾の積分が−t>0に対する同じ積分へ移るため、やはりE[etX]=∞である。▨
4 大数の法則と中心極限定理の統計的読み
定理 4.1.X1,X2,…を独立同分布な実確率変数列とし、X1∈L1(P)、μ=E[X1]とする。このとき、任意のε>0に対して
P(∣Xˉ−μ∣>ε)n→∞0,すなわちXˉPμ.したがって、標本平均は母平均の一致推定量である。
二次可積分性も仮定するならば、大数の強法則§E11.15 定理 4.1によりXˉ→μが確率1で成り立つ。
定理 4.2.X1,X2,…を独立同分布な実確率変数列とし、X1∈L2(P)、μ=E[X1]、0<σ2=Var(X1)<∞とする。このとき、
σ/nXˉ−μ=σn(Xˉ−μ)dn→∞N(0,1).したがって、nが大きいとき、Xˉの分布をN(μ,σ2/n)によって近似することができる。
証明.§E11.16 定理 2.1を中心化した確率変数Xi−μに適用すると、
σn1i=1∑n(Xi−μ)dN(0,1)を得る。左辺はn(Xˉ−μ)/σに等しい。▨
正規標本の平均. 母平均μは未知で母標準偏差がσ=20である正規母集団から、大きさn=100の無作為標本を取る。標本平均の標準誤差は
SE(Xˉ)=nσ=10020=1020=2.
独立性から(X1,…,X100)の法則は、Z∼N100(0,I100)に対するμ1+20Zの法則に等しい。したがって、多変量正規分布のアフィン像による特徴づけ§E11.10 定理 4.2を係数ベクトル1/100に適用すると、Xˉ∼N(μ,22)である。ゆえに、標本平均が母平均の±3に入る確率は正確に
P(∣Xˉ−μ∣<3)=2Φ(23)−1=2Φ(1.5)−1≈0.86639,
すなわち約87%である。ただし、Φは標準正規分布関数であり、Φ(1.5)≈0.93319である。一方、1 個体の観測値X1が母平均の±3に入る確率は2Φ(3/20)−1=2Φ(0.15)−1≈2×0.55962−1≈0.119、約12%にすぎない。100個の平均では標準誤差が20から2へ減少するため、この確率が約12%から約87%へ増加する。
5 Slutsky の定理とデルタ法
連続写像定理と Slutsky の定理は、確率変数の変換および一致推定量による定数の置換を扱う。
補題 5.1.XndXとし、C⊂Rを閉集合とする。このとき
n→∞limsupP(Xn∈C)≤P(X∈C).
証明.C=∅の場合は明らかである。C=∅とし、m≥1に対して
fm(x)=max{1−mdist(x,C),0}とおく。§E11.17 命題 1.2により一次元の分布収束は有界連続関数による弱収束と一致するため、
n→∞limsupP(Xn∈C)≤n→∞limE[fm(Xn)]=E[fm(X)]である。fm↓1Cであり0≤fm≤1なので、優収束定理§E9.7 定理 3.2を適用し、m→∞とすれば結論を得る。▨
定理 5.2 (連続写像定理・Slutsky の定理).Xn,Ynを一つの確率空間上の実確率変数とし、XndX、YnPcとする。ただし、cは定数である。このとき次が成り立つ。
- h:R→Rが Borel 可測であり、不連続点全体をDhとするとき、P(X∈Dh)=0ならばh(Xn)dh(X)である。
- Xn+YndX+c、XnYndcXである。また、c=0ならばXn/YndX/cである。
商はYn=0の事象上で任意の固定値に定める。
証明.(1)を示す。hが全域で連続な場合は§E11.17 定理 1.3の一次元特殊化である。一般の場合に、閉集合B⊂Rを取る。hがxで連続でh(x)∈/Bならば、Bが閉であることからxの近傍Uでh(U)∩B=∅となる。したがって、
h−1(B)⊂h−1(B)∪Dh.補題 5.1より
n→∞limsupP(h(Xn)∈B)≤P(X∈h−1(B))≤P(h(X)∈B)である。補集合を取れば、開集合Gに対してliminfnP(h(Xn)∈G)≥P(h(X)∈G)も得る。h(X)の分布関数の連続点tにおいて、閉集合(−∞,t]と開集合(−∞,t)を用いると、P(h(X)=t)=0であるから分布関数が収束する。よってh(Xn)dh(X)である。
(2)の和と積は§E11.17 定理 5.3と§E11.17 系 5.4の一次元特殊化である。c=0とし、Yn=0ではRn=1/Yn、Yn=0ではRn=0と定める。事象{∣Yn−c∣<∣c∣/2}上では∣Yn∣>∣c∣/2であり、
Rn−c1=∣cYn∣∣Yn−c∣≤∣c∣22∣Yn−c∣.したがって、任意のε>0に対して
P(Rn−c1>ε)≤P(∣Yn−c∣≥2∣c∣)+P(∣Yn−c∣>2ε∣c∣2)⟶0.この評価はc<0の場合も含む。積の結論をXnとRnに適用するとXnRndX/cを得る。Yn=0上で任意の固定値を与えた商をQnとすると、
P(Qn=XnRn)≤P(Yn=0)≤P(∣Yn−c∣≥∣c∣/2)⟶0.従って和に関する Slutsky の結論からQndX/cである。▨
命題 5.3.X1,X2,…を独立同分布なL2(P)確率変数列とし、μ=E[X1]、σ2=Var(X1)とする。n≥2に対してSn2を命題 1.6の式で定めると、
Sn2Pσ2.さらにσ2>0ならば、Sn=Sn2はSnPσを満たし、
Snn(Xˉ−μ)dN(0,1).商はSn=0の事象上で0と定める。
証明.§E11.15 定理 2.1をXiとXi2に適用すると、
XˉPμ,n1i=1∑nXi2PE[X12]である。X12∈L1(P)であるため、二つ目の適用に四次積率は不要である。§E11.17 命題 5.2により
(n−1n,n1i=1∑nXi2,Xˉ)P(1,E[X12],μ)である。写像(a,b,x)↦a(b−x2)は極限点で連続であるため、連続性のε–δ条件と確率収束の定義から、命題 1.6の恒等式より
Sn2=n−1n(n1i=1∑nXi2−Xˉ2)PE[X12]−μ2=σ2を得る。平方根関数は[0,∞)上で連続なので、σ2>0ならばSnPσである。定理 4.2と定理 5.2 (2)の商に関する結論を、n(Xˉ−μ)/σとSn/σに適用すると、最後の分布収束を得る。分母が0の事象上で商を0とする補完も同結論に含まれる。▨
この結論では、未知の母標準偏差を一致推定量Snで置き換えている。
定理 5.4 (デルタ法).X1,X2,…が中心極限定理定理 4.2の仮定を満たすとする。I⊂Rをμを含む開区間とし、g:I→Rは連続微分可能でg′(μ)=0とする。g:R→Rが Borel 可測であり、μのある近傍上でgと一致するならば、
n(g(Xˉ)−g(μ))dN(0,g′(μ)2σ2).延長の選択は極限分布に影響しない。
証明.[μ−δ,μ+δ]⊂Iとなるδ>0を取る。∣x−μ∣<δではg(x)、その外ではg(μ)と定めれば Borel 可測延長が得られるため、主張に現れる延長は存在する。任意のgを固定し、
r(x)=⎩⎨⎧x−μg(x)−g(μ)−g′(μ),0,x=μ,x=μとおく。gのμにおける微分可能性から、x→μのときr(x)→0であり、rは Borel 可測である。定理 4.1によりXˉPμなので、r(Xˉ)P0である。差商の定義から
n(g(Xˉ)−g(μ))=(g′(μ)+r(Xˉ))n(Xˉ−μ)である。定理 4.2と Slutsky の積の結論§E11.17 系 5.4を適用すると、右辺はg′(μ)Zに分布収束する。ただしZ∼N(0,σ2)である。よって極限分布はN(0,g′(μ)2σ2)である。
二つの可測延長はμのある共通近傍で一致する。定理 4.1によりXˉがその近傍に入る確率は1へ収束するため、二つの延長から得る確率変数が異なる確率は0へ収束する。従って延長の選択は極限分布に影響しない。▨
例 5.5 (正の母平均の対数変換).X1,X2,…を独立同分布なL2(P)確率変数列とし、μ=E[X1]>0、0<σ2=Var(X1)<∞とする。x>0ではg(x)=logx、x≤0ではg(x)=0と定める。g(x)=logxはμの近傍で連続微分可能であり、g′(μ)=1/μであるから、定理 5.4により
n(g(Xˉ)−logμ)dN(0,μ2σ2).したがって、n(g(Xˉ)−logμ)の極限正規分布の分散はσ2/μ2である。
例 5.6 (導関数が零になる二乗変換).X1,X2,…を独立同分布なL2(P)確率変数列とし、E[X1]=0、0<σ2=Var(X1)<∞とする。g(x)=x2ではg′(0)=0である。定理 4.2と定理 5.2 (1)により、G∼N(0,1)に対して
nXˉ2=(nXˉ)2dσ2G2.さらに1/n→0であるから、Slutsky の積の結論により
nXˉ2=n1nXˉ2d0.すなわち、n尺度では極限が退化する一方、n尺度では標準正規変数の平方のσ2倍として表される非退化な極限をもつ。
6 有限標本法則と漸近法
定理 4.2はXˉ自身ではなくn(Xˉ−μ)/σの分布収束を述べ、定理 4.1はXˉ自身が定数μへ確率収束することを述べる。
一般の独立同分布な母集団では、XˉとSn2の独立性や(n−1)Sn2/σ2∼χn−12は有限標本では成立するとは限らない。正規性を仮定しない場合には、定理 4.2と命題 5.3が与える漸近的な正規法則を用いる。