§E14.14仮説検定

最終更新

統計モデルにおける主張は、未知の母数が属する範囲として表すことができる。標本を観測したとき、その主張を棄却するか否かを判断するには、標本から決定を定める規則が必要になる。しかし、一つの観測結果だけを根拠に判断すると、正しい主張を棄却する危険と、誤った主張を棄却しない危険をどのように制御したかが明らかにならない。

仮説検定は、棄却する確率を標本の関数として定め、二種類の過誤を確率によって評価する枠組みである。許容する第 I 種過誤を水準として制限しながら、対立仮説の下で棄却する確率を検出力として調べる。たとえば、既知の分散をもつ正規分布の母平均に対する片側検定では、検出したい効果と目標検出力から必要な標本サイズを定めることができる。

仮説検定は、統計的な意思決定を定式化する最も基本的な方法の一つであり、個々の検定を構成して比較するための共通の基準を与える。

本記事では、仮説検定の基本概念と、その確率的な評価方法を扱う。

1 仮説と検定関数

定義 1.1. 可測空間(X,A)(\mathcal X,\mathcal A)上の確率測度族(Pθ)θ∈Θ(P_\theta)_{\theta\in\Theta}を統計モデルとする。母数空間Θ\Thetaを空でない互いに素な部分集合Θ0,Θ1\Theta_0,\Theta_1に分け、

H0:θ∈Θ0,H1:θ∈Θ1H_0:\theta\in\Theta_0, \qquad H_1:\theta\in\Theta_1

を、それぞれ帰無仮説 (null hypothesis) および対立仮説 (alternative hypothesis) という。

検定 (hypothesis test) とは、可測関数

φ:X⟶[0,1]\varphi:\mathcal X\longrightarrow[0,1]

である。観測値がxxのとき、φ(x)\varphi(x)はH0H_0を棄却する条件付き確率を表す。φ\varphiの値が00または11に限られる検定を決定的検定という。この場合には、あるR∈AR\in\mathcal Aを用いてφ=1R\varphi=\mathbf 1_Rと書くことができ、RRを棄却域 (rejection region) という。決定的検定はX∈RX\in RのときH0H_0を棄却し、X∉RX\notin RのときH0H_0を棄却しない。RRの補集合を採択域ということもあるが、採択域に入ることはH0H_0が真であることを確定しない。

i∈{0,1}i\in\{0,1\}とする。仮説HiH_iに属する観測分布の集合{Pθ:θ∈Θi}\{P_\theta:\theta\in\Theta_i\}が一点集合であるとき、HiH_iを単純仮説 (simple hypothesis) という。この観測分布の集合が一点集合でないとき、HiH_iを複合仮説 (composite hypothesis) という。

検定統計量T:X→RT:\mathcal X\to\Rと Borel 集合C⊂RC\subset\Rを選ぶ決定的検定では、棄却域はR={x:T(x)∈C}R=\{x:T(x)\in C\}である。検定関数は、棄却域の境界に限らず、標本空間の任意の部分で無作為化することができる。

命題 1.2.(X,A,(Pθ)θ∈Θ)(\mathcal X,\mathcal A,(P_\theta)_{\theta\in\Theta})を統計モデルとし、φ:X→[0,1]\varphi:\mathcal X\to[0,1]を検定とする。各PθP_\thetaと区間(0,1)(0,1)上の一様分布との積確率空間で、標本XXと独立なU∼Unif⁡(0,1)U\sim\operatorname{Unif}(0,1)を取り、

U≤φ(X)U\leq\varphi(X)

のとき、かつそのときに限りH0H_0を棄却する。この規則では、X=xX=xを固定したときの棄却確率はφ(x)\varphi(x)であり、母数θ\thetaの下での棄却確率はEθ[φ(X)]E_\theta[\varphi(X)]である。

証明.x∈Xx\in\mathcal Xを固定すると、一様分布の区間確率から

P(U≤φ(x))=φ(x)P\bigl(U\leq\varphi(x)\bigr)=\varphi(x)

を得る。積測度に関する Tonelli の定理を指示関数1{u≤φ(x)}\mathbf 1_{\{u\leq\varphi(x)\}}に適用すると、

(Pθ⊗Unif⁡)(U≤φ(X))=∫X ⁣(∫011{u≤φ(x)} du)Pθ(dx)=Eθ[φ(X)](P_\theta\otimes\operatorname{Unif})\bigl(U\leq\varphi(X)\bigr) =\int_{\mathcal X}\!\left(\int_0^1\mathbf 1_{\{u\leq\varphi(x)\}}\,du\right)P_\theta(dx) =E_\theta[\varphi(X)]

となる。▨

2 過誤と検出力

定義 2.1.(X,A,(Pθ)θ∈Θ)(\mathcal X,\mathcal A,(P_\theta)_{\theta\in\Theta})を統計モデルとし、Θ=Θ0⊔Θ1\Theta=\Theta_0\sqcup\Theta_1および検定φ:X→[0,1]\varphi:\mathcal X\to[0,1]を取る。

  1. θ∈Θ0\theta\in\Theta_0であるのにH0H_0を棄却することを第 I 種過誤 (type I error) という。その確率はEθ[φ(X)]E_\theta[\varphi(X)]である。
  2. θ∈Θ1\theta\in\Theta_1であるのにH0H_0を棄却しないことを第 II 種過誤 (type II error) という。その確率は1−Eθ[φ(X)]1-E_\theta[\varphi(X)]である。

検定φ\varphiのサイズ (size of a test) を

sup⁡θ∈Θ0Eθ[φ(X)]\sup_{\theta\in\Theta_0}E_\theta[\varphi(X)]

と定める。サイズがα\alpha以下であるとき、φ\varphiは有意水準α\alpha (significance level alpha)、または水準α\alphaの検定であるという。したがって、水準は許される第 I 種過誤確率の上限であり、検定のサイズがα\alphaに等しいことまでは要求しない。

定義 2.2.(X,A,(Pθ)θ∈Θ)(\mathcal X,\mathcal A,(P_\theta)_{\theta\in\Theta})を統計モデルとし、検定φ:X→[0,1]\varphi:\mathcal X\to[0,1]を取る。検定φ\varphiの検出力関数 (power function) を

βφ(θ)=Eθ[φ(X)](θ∈Θ)\beta_\varphi(\theta)=E_\theta[\varphi(X)] \qquad(\theta\in\Theta)

と定める。θ∈Θ1\theta\in\Theta_1における値βφ(θ)\beta_\varphi(\theta)を、その母数における検出力 (power) という。θ∈Θ0\theta\in\Theta_0ではβφ(θ)\beta_\varphi(\theta)は第 I 種過誤の確率であり、検定のサイズはsup⁡θ∈Θ0βφ(θ)\sup_{\theta\in\Theta_0}\beta_\varphi(\theta)である。θ∈Θ1\theta\in\Theta_1では第 II 種過誤の確率は1−βφ(θ)1-\beta_\varphi(\theta)である。

注意 2.3 (記号β\betaの二つの用法). 単純対立仮説の母数θ1\theta_1を固定し、第 II 種過誤の確率をβ\betaと書いて、検出力を1−β1-\betaと表す慣用もある。検出力関数βφ(θ)\beta_\varphi(\theta)との関係は

β第 II 種過誤=1−βφ(θ1)\beta_{\text{第 II 種過誤}}=1-\beta_\varphi(\theta_1)

である。本記事では、検出力関数にはβφ\beta_\varphiを用い、第 II 種過誤の設計上の上限にはβ0\beta_0を用いる。

3 p 値

定義 3.1.(X,A,(Pθ)θ∈Θ)(\mathcal X,\mathcal A,(P_\theta)_{\theta\in\Theta})を統計モデルとし、Θ=Θ0⊔Θ1\Theta=\Theta_0\sqcup\Theta_1とする。実可測関数T:X→RT:\mathcal X\to\Rの値が大きいほどH0H_0に反する証拠が強いものとする。各θ∈Θ0\theta\in\Theta_0とt∈Rt\in\Rに対して

qθ(t)=Pθ(T(X)≥t)q_\theta(t)=P_\theta(T(X)\geq t)

とおく。観測値xxに対するp 値 (p-value) を

p(x)=sup⁡θ∈Θ0qθ(T(x))p(x)=\sup_{\theta\in\Theta_0}q_\theta(T(x))

で定める。各qθq_\thetaは非増加であり、その上限も非増加な Borel 可測関数になるため、ppは可測である。単純帰無仮説H0:θ=θ0H_0:\theta=\theta_0ではp(x)=Pθ0(T(X)≥T(x))p(x)=P_{\theta_0}(T(X)\geq T(x))である。

  1. 任意のa∈[0,1]a\in[0,1]とθ∈Θ0\theta\in\Theta_0に対してPθ(p(X)≤a)≤aP_\theta(p(X)\leq a)\leq aである。特に、p(X)≤αp(X)\leq\alphaのときH0H_0を棄却する規則は水準α\alphaの検定である。
  2. 帰無仮説が単純であり、その母数の下でT(X)T(X)の分布関数が連続ならば、p(X)p(X)は区間(0,1)(0,1)上の一様分布に従う。

証明.θ∈Θ0\theta\in\Theta_0を固定し、q(t)=qθ(t)q(t)=q_\theta(t)とおく。a∈[0,1]a\in[0,1]に対してAa={t∈R:q(t)≤a}A_a=\{t\in\R:q(t)\leq a\}とする。qqは非増加なので、AaA_aは空集合、R\R、[c,∞)[c,\infty)、(c,∞)(c,\infty)のいずれかである。Aa=[c,∞)A_a=[c,\infty)の場合には

Pθ(T(X)∈Aa)=q(c)≤aP_\theta(T(X)\in A_a)=q(c)\leq a

である。Aa=(c,∞)A_a=(c,\infty)の場合には、tk∈Aat_k\in A_aかつtk↓ct_k\downarrow cとなる列を取ると、確率測度の下からの連続性により

Pθ(T(X)∈Aa)=lim⁡k→∞Pθ(T(X)≥tk)=lim⁡k→∞q(tk)≤aP_\theta(T(X)\in A_a) =\lim_{k\to\infty}P_\theta(T(X)\geq t_k) =\lim_{k\to\infty}q(t_k) \leq a

となる。空集合とR\Rの場合にも同じ不等式は直ちに成り立つ。したがって、

Pθ(q(T(X))≤a)≤aP_\theta(q(T(X))\leq a)\leq a

である。p(x)≥qθ(T(x))p(x)\geq q_\theta(T(x))なので、{p(X)≤a}⊂{qθ(T(X))≤a}\{p(X)\leq a\}\subset\{q_\theta(T(X))\leq a\}であり、(1)を得る。

帰無仮説をH0:θ=θ0H_0:\theta=\theta_0とし、T(X)T(X)のPθ0P_{\theta_0}の下での分布関数をFFとする。FFが連続ならばPθ0(T(X)=t)=0P_{\theta_0}(T(X)=t)=0なので、

p(X)=1−F(T(X))p(X)=1-F(T(X))

である。u∈(0,1)u\in(0,1)に対してbu=sup⁡{t∈R:F(t)≤u}b_u=\sup\{t\in\R:F(t)\leq u\}とおく。分布関数の両端での極限と連続性によりbu∈Rb_u\in\RかつF(bu)=uF(b_u)=uである。また、単調性から

{T(X)<bu}⊂{F(T(X))≤u}⊂{T(X)≤bu}\{T(X)<b_u\}\subset\{F(T(X))\leq u\}\subset\{T(X)\leq b_u\}

であり、両辺の確率はいずれもuuである。したがってF(T(X))F(T(X))は区間(0,1)(0,1)上の一様分布に従い、1−F(T(X))=p(X)1-F(T(X))=p(X)も同じ一様分布に従う。これで(2)は示された。▨

原子をもつ帰無分布では、(1)の不等号が真に小さくなることがある。ある境界原子をすべて棄却すると水準を超える場合、決定的検定はその原子を棄却域から除くため、サイズが水準を下回りうる。境界無作為化は、除いた原子の一部を棄却することによってサイズを水準まで調整する。

例 3.2. 単純帰無仮説の下でX∼Bernoulli⁡(1/2)X\sim\operatorname{Bernoulli}(1/2)とし、検定統計量をT=XT=Xとする。上側確率に等号を含めた定義 3.1から

p(0)=1,p(1)=12p(0)=1,\qquad p(1)=\frac12

を得る。水準1/41/4でp(X)≤1/4p(X)\leq1/4のとき棄却する決定的検定は常に棄却せず、そのサイズは00である。一方、

φ(x)=121{1}(x)\varphi(x)=\frac12\mathbf 1_{\{1\}}(x)

とおくと、E0[φ(X)]=1/4E_0[\varphi(X)]=1/4であるから、φ\varphiのサイズは1/41/4である。この検定は、決定的検定が除いた原子{X=1}\{X=1\}で確率1/21/2の無作為化を行う。上側確率の等号を除いてP0(T(X)>T(x))P_0(T(X)>T(x))を用いると、x=1x=1で値が00となり、水準1/41/4の規則がX=1X=1を必ず棄却して第 I 種過誤確率1/21/2をもつため、水準を保証しない。

注意 3.3 (p 値の誤解). p 値について、次の読み替えはいずれも正しくない。

  • pp値は「H0H_0が正しい確率」ではない。p(x)p(x)はH0H_0に属する各観測分布の下での上側確率の上限であり、その上限を達成する分布が存在するとは限らない。p(x)p(x)は、データを観測した後のH0H_0の確率ではない。後者を定めるには事前分布を含む確率モデルが必要である(§E14.8 定理 1.2)。
  • pp値は効果の大きさではない。pp値は効果の大きさと標本サイズの両方に依存するため、効果は推定値と信頼区間(§E14.18 定義 1.1)によって評価する必要がある。
  • p(X)>αp(X)>\alphaはH0H_0が真であることを証明しない。この不等式は、採用した水準ではH0H_0を棄却しないことだけを表す。標本サイズが小さい場合、効果が小さい場合、または分散が大きい場合には、検出力が低いために第 II 種過誤が生じる可能性がある。

4 正規平均の検出力と標本サイズ

命題 4.1.n∈N≥1n\in\NNとし、X1,…,XnX_1,\ldots,X_nを正の既知分散σ2\sigma^2をもつ正規分布N(μ,σ2)N(\mu,\sigma^2)からの独立同分布標本とする。0<α<10<\alpha<1とし、zαz_\alphaを標準正規確率変数ZZに対する上側α\alpha点、すなわちP(Z>zα)=αP(Z>z_\alpha)=\alphaを満たす数とする。単純帰無仮説H0:μ=μ0H_0:\mu=\mu_0に対して、

n(Xˉ−μ0)σ>zα\frac{\sqrt n(\bar X-\mu_0)}{\sigma}>z_\alpha

のときH0H_0を棄却する検定の検出力関数は、すべてのμ∈R\mu\in\Rに対して

β(μ)=Φ ⁣(n(μ−μ0)σ−zα)\beta(\mu)=\Phi\!\left(\frac{\sqrt n(\mu-\mu_0)}{\sigma}-z_\alpha\right)

である。ただし、Φ\Phiは標準正規分布の分布関数である。

δ>0\delta>0、0<β0<10<\beta_0<1とする。効果μ=μ0+δ\mu=\mu_0+\deltaにおける検出力が1−β01-\beta_0以上であるための必要十分条件は

n δσ≥zα+zβ0\frac{\sqrt n\,\delta}{\sigma}\geq z_\alpha+z_{\beta_0}

である。したがって、条件を満たす最小の正の整数標本サイズは

nmin⁡=max⁡{1,⌈(max⁡{zα+zβ0,0} σδ)2⌉}n_{\min} =\max\left\{1, \left\lceil \left(\frac{\max\{z_\alpha+z_{\beta_0},0\}\,\sigma}{\delta}\right)^2 \right\rceil\right\}

である。特にzα+zβ0>0z_\alpha+z_{\beta_0}>0ならば、標本サイズの条件は

n≥((zα+zβ0)σδ)2n\geq\left(\frac{(z_\alpha+z_{\beta_0})\sigma}{\delta}\right)^2

と書くことができる。

証明.Zi=(Xi−μ)/σZ_i=(X_i-\mu)/\sigmaとおく。正規密度で変数変換x=μ+σzx=\mu+\sigma zを行うと各ZiZ_iの密度は標準正規密度になり、座標ごとの可測変換は独立性を保つ。したがって、(Z1,…,Zn)⊤(Z_1,\ldots,Z_n)^\topは標準正規ベクトルである。u=(1/n,…,1/n)⊤u=(1/\sqrt n,\ldots,1/\sqrt n)^\topとすれば∥u∥=1\lVert u\rVert=1なので、§E11.10 補題 3.3により

n(Xˉ−μ)σ=u⊤(Z1,…,Zn)⊤∼N(0,1)\frac{\sqrt n(\bar X-\mu)}{\sigma}=u^\top(Z_1,\ldots,Z_n)^\top\sim N(0,1)

である。したがって、標準正規分布の対称性から

β(μ)=Pμ ⁣(n(Xˉ−μ0)σ>zα)=Pμ ⁣(n(Xˉ−μ)σ>zα−n(μ−μ0)σ)=Φ ⁣(n(μ−μ0)σ−zα)\begin{aligned} \beta(\mu) &=P_\mu\!\left(\frac{\sqrt n(\bar X-\mu_0)}{\sigma}>z_\alpha\right)\\ &=P_\mu\!\left(\frac{\sqrt n(\bar X-\mu)}{\sigma}>z_\alpha-\frac{\sqrt n(\mu-\mu_0)}{\sigma}\right)\\ &=\Phi\!\left(\frac{\sqrt n(\mu-\mu_0)}{\sigma}-z_\alpha\right) \end{aligned}

を得る。

μ=μ0+δ\mu=\mu_0+\deltaとする。Φ\Phiは狭義増加であり、標準正規分布の対称性からΦ(zβ0)=1−β0\Phi(z_{\beta_0})=1-\beta_0なので、

β(μ0+δ)≥1−β0⟺n δσ−zα≥zβ0.\beta(\mu_0+\delta)\geq1-\beta_0 \quad\Longleftrightarrow\quad \frac{\sqrt n\,\delta}{\sigma}-z_\alpha\geq z_{\beta_0}.

δ/σ>0\delta/\sigma>0とn≥1n\geq1を用いてこの不等式を解くと、主張した必要十分条件と最小標本サイズを得る。▨

例 4.2 (必要標本サイズの数値検算). 片側検定の水準をα=0.05\alpha=0.05、目標検出力を1−β0=0.801-\beta_0=0.80、標準化した効果をδ/σ=0.5\delta/\sigma=0.5とする。標準正規分布の上側点はz0.05=1.6449z_{0.05}=1.6449およびz0.20=0.8416z_{0.20}=0.8416である。命題 4.1により

n≥(1.6449+0.84160.5)2=4.97302=24.73n\geq \left(\frac{1.6449+0.8416}{0.5}\right)^2 =4.9730^2 =24.73

であるため、必要な最小標本サイズはn=25n=25である。

n=25n=25の検出力は

Φ(25×0.5−1.6449)=Φ(0.8551)=0.8038≥0.80\Phi(\sqrt{25}\times0.5-1.6449) =\Phi(0.8551) =0.8038 \geq0.80

である。一方、n=24n=24の検出力は

Φ(24×0.5−1.6449)=Φ(0.8046)=0.7895<0.80\Phi(\sqrt{24}\times0.5-1.6449) =\Phi(0.8046) =0.7895 <0.80

なので、2525が最小である。正のzα+zβ0z_\alpha+z_{\beta_0}を固定すると、整数へ切り上げる前の実数下界はδ2\delta^2に反比例する。したがって、標準化した効果を0.50.5から0.250.25へ半分にすると、この下界は24.7324.73から98.9298.92へ四倍になる。一方、必要な最小の整数標本サイズは2525から9999へ変わる。

前提記事