§E14.19線形回帰と最小二乗法

最終更新

複数の説明変数から観測された応答を説明するとき、係数を選んで残差平方和を最小にすることが基本的な出発点となる。内積空間における直交射影は最良近似を与えるが、同じ説明変数を二列に置く場合のように計画行列の階数が不足すれば、係数は一意に定まらない。また、射影の最良近似性だけでは、誤差を含む推定量の不偏性や分散の比較までは得られない。

固定計画の線形回帰モデルと推定可能な線形量は、係数表示の非一意性と不偏に推定することができる量とを分ける。さらに Gauss–Markov の定理は、平均が零で等分散かつ無相関な誤差のもとで、最小二乗法による推定量が、推定可能な線形量の線形不偏推定量の中で最小の分散をもつことを示す。この性質は、当てはまりと係数推定の精度を区別するための基準となる。

本記事では、最小二乗法の射影としての構造を用いて、係数と当てはめ値の一意性および推定の性質を調べる。

1 線形回帰モデルと Gauss–Markov 仮定

定義 1.1.n,pn,pを正の整数とする。観測ベクトルy=(y1,…,yn)⊤∈Rny=(y_1,\ldots,y_n)^\top\in\R^nが、既知の固定計画行列X∈Rn×pX\in\R^{n\times p}、未知の係数β∈Rp\beta\in\R^p、誤差ε∈Rn\varepsilon\in\R^nにより

y=Xβ+εy=X\beta+\varepsilon

と表されるモデルを 線形回帰モデル (linear regression model) という。次の条件を Gauss–Markov 仮定 (Gauss-Markov assumptions) という。

  1. 平均が零であること:E[ε]=0\mathbb{E}[\varepsilon]=0。
  2. 等分散かつ無相関であること:ある未知のσ2>0\sigma^2>0に対してCov⁡(ε)=σ2In\operatorname{Cov}(\varepsilon)=\sigma^2I_n。

「線形」は係数β\betaに関する線形性を表す。したがって、XXの列には説明変数の二乗や対数を配置することができる。XXが1=(1,…,1)⊤\mathbf 1=(1,\ldots,1)^\topを列として含むモデルを切片つきモデルという。

2 一般階数の最小二乗法

定理 2.1 (最小二乗解と当てはめの一意性).X∈Rn×pX\in\R^{n\times p}の階数をrrとする。任意のy∈Rny\in\R^nに対して、∥y−Xb∥2\lVert y-Xb\rVert^2を最小にするb∈Rpb\in\R^pが存在する。一つの最小二乗解をb0b_0とすれば、最小二乗解の全体は

b0+ker⁡Xb_0+\ker X

である。最小二乗解はr=pr=pのとき、かつそのときに限って一意である。一方、r<pr<pの場合を含めて、当てはめ値Xb0Xb_0は一意であり、yyのcol⁡(X)\operatorname{col}(X)への直交射影に等しい。

証明.§D3.17 定理 2.2をA=XA=X、b⃗=y\vec b=yに適用すると、最小二乗解は存在し、その全体はb0+ker⁡Xb_0+\ker Xである。同じ定理により、その一意性はXXの列の一次独立性、すなわちr=pr=pと同値である。

二つの最小二乗解b1,b2b_1,b_2の差はker⁡X\ker Xに属するため、Xb1=Xb2Xb_1=Xb_2となる。また、正規方程式

X⊤(y−Xb0)=0X^\top(y-Xb_0)=0

から、Xb0∈col⁡(X)Xb_0\in\operatorname{col}(X)かつy−Xb0⊥col⁡(X)y-Xb_0\perp\operatorname{col}(X)である。§D3.14 命題 3.2により、Xb0Xb_0は所要の直交射影である。▨

階数が不足すると、平均XβX\betaを変えない方向z∈ker⁡Xz\in\ker Xに沿って係数をβ+z\beta+zへ動かすことができる。係数表示が一意でない場合にも、当てはめと残差は一意に定まる。

系 2.2 (列が一次独立な場合の最小二乗推定量).XXの列が一次独立であるとする。このとき最小二乗解は一意であり、

β^=(X⊤X)−1X⊤y\hat\beta=(X^\top X)^{-1}X^\top y

と表される。

証明.v⊤X⊤Xv=∥Xv∥2v^\top X^\top Xv=\lVert Xv\rVert^2であるから、X⊤XX^\top Xは正則である。定理 2.1の正規方程式X⊤Xb=X⊤yX^\top Xb=X^\top yを解くと表示式を得る。▨

系 2.3 (射影行列による表示).XXの列が一次独立であるとする。このとき

H=X(X⊤X)−1X⊤H=X(X^\top X)^{-1}X^\top

とおけば、当てはめ値と残差はそれぞれy^=Hy\hat y=Hy、e=(In−H)ye=(I_n-H)yである。行列HHはcol⁡(X)\operatorname{col}(X)への直交射影を表し、H⊤=HH^\top=H、H2=HH^2=H、HX=XHX=Xが成り立つ。

証明.系 2.2を左からXX倍するとy^=Hy\hat y=Hyを得る。行列積からH⊤=HH^\top=H、H2=HH^2=H、HX=XHX=Xが従う。また、HHの像はcol⁡(X)\operatorname{col}(X)に含まれ、HX=XHX=Xから逆の包含も成り立つ。したがって、HHはcol⁡(X)\operatorname{col}(X)への直交射影である。▨

3 推定可能な線形量

定義 3.1 (推定可能な線形量). 固定計画の線形回帰モデルにE[ε]=0\mathbb{E}[\varepsilon]=0を仮定し、c∈Rpc\in\R^pとする。すべてのβ∈Rp\beta\in\R^pに対して

Eβ[a⊤y]=c⊤β\mathbb{E}_\beta[a^\top y]=c^\top\beta

を満たすa∈Rna\in\R^nが存在するとき、c⊤βc^\top\betaを 推定可能な線形量 (estimable linear function) という。

命題 3.2 (推定可能性の特徴づけ).c∈Rpc\in\R^pに対して、次の条件は同値である。

  1. c⊤βc^\top\betaは推定可能である。
  2. あるa∈Rna\in\R^nが存在してX⊤a=cX^\top a=cとなる。
  3. c∈row⁡(X):=Im⁡(X⊤)c\in\operatorname{row}(X):=\operatorname{Im}(X^\top)である。
  4. すべてのz∈ker⁡Xz\in\ker Xに対してc⊤z=0c^\top z=0である。

証明.Eβ[y]=Xβ\mathbb{E}_\beta[y]=X\betaであるから、(1)は

a⊤Xβ=c⊤β(β∈Rp)a^\top X\beta=c^\top\beta\qquad(\beta\in\R^p)

と同値であり、さらにX⊤a=cX^\top a=cと同値である。したがって、最初の三条件は同値である。c=X⊤ac=X^\top aならば、z∈ker⁡Xz\in\ker Xに対してc⊤z=a⊤Xz=0c^\top z=a^\top Xz=0となる。

逆に(4)を仮定し、X⊤X^\topとccに§D3.17 定理 2.2を適用する。最小二乗解a0a_0はX(c−X⊤a0)=0X(c-X^\top a_0)=0を満たす。d=c−X⊤a0d=c-X^\top a_0とおくと、d∈ker⁡Xd\in\ker Xである。また、仮定と既に示した包含によりd⊥ker⁡Xd\perp\ker Xでもある。ゆえにd=0d=0となり、X⊤a0=cX^\top a_0=cを得る。▨

条件4は、同じ平均ベクトルを与えるβ\betaとβ+z\beta+zに対して推定対象の値が一致する条件である。階数不足のモデルでは個々の係数が推定可能とは限らないが、特定の係数の組合せは推定可能になりうる。

例 3.3.n=1n=1、p=2p=2とし、計画行列をX=(1,1)X=(1,1)とする。観測値y∈Ry\in\Rに対する残差平方和は

(y−b1−b2)2(y-b_1-b_2)^2

であるから、最小二乗解の全体は

{(b1,b2)⊤∈R2∣b1+b2=y}\{(b_1,b_2)^\top\in\R^2\mid b_1+b_2=y\}

であり、ker⁡X={(t,−t)⊤∣t∈R}\ker X=\{(t,-t)^\top\mid t\in\R\}である。したがって個々の係数β1\beta_1とβ2\beta_2は推定可能でない。一方、c=(1,1)⊤c=(1,1)^\topはすべてのz∈ker⁡Xz\in\ker Xに対してc⊤z=0c^\top z=0を満たすため、命題 3.2により係数和β1+β2\beta_1+\beta_2は推定可能である。どの最小二乗解を選んでも、その係数和は観測値yyに等しい。

定理 3.4 (推定可能量に対する Gauss–Markov 定理).定義 1.1の Gauss–Markov 仮定を置き、c⊤βc^\top\betaが推定可能であるとする。このときX⊤a0=cX^\top a_0=cを満たすa0∈col⁡(X)a_0\in\operatorname{col}(X)がただ一つ存在する。推定量a0⊤ya_0^\top yはc⊤βc^\top\betaの線形不偏推定量であり、別の線形不偏推定量a⊤ya^\top yに対して

Var⁡(a⊤y)−Var⁡(a0⊤y)=σ2∥a−a0∥2≥0\operatorname{Var}(a^\top y)-\operatorname{Var}(a_0^\top y) =\sigma^2\lVert a-a_0\rVert^2\geq0

が成り立つ。等号はa=a0a=a_0のとき、かつそのときに限って成り立つ。

証明.命題 3.2によりX⊤a=cX^\top a=cを満たすaaが存在する。a=a0+da=a_0+dをcol⁡(X)\operatorname{col}(X)とその直交補への直交分解とする。X⊤d=0X^\top d=0であるからX⊤a0=cX^\top a_0=cとなる。二つのベクトルa0,a1∈col⁡(X)a_0,a_1\in\operatorname{col}(X)がこの方程式を満たすならば、a0−a1∈col⁡(X)a_0-a_1\in\operatorname{col}(X)かつa0−a1⊥col⁡(X)a_0-a_1\perp\operatorname{col}(X)なのでa0=a1a_0=a_1となる。

Gauss–Markov 仮定から

Var⁡(a⊤y)=a⊤(σ2In)a=σ2∥a∥2\operatorname{Var}(a^\top y)=a^\top(\sigma^2I_n)a=\sigma^2\lVert a\rVert^2

である。a=a0+(a−a0)a=a_0+(a-a_0)は直交分解であるから、ノルムの平方の差を取ると主張する式を得る。▨

PPをcol⁡(X)\operatorname{col}(X)への直交射影とし、b^\widehat bを任意の最小二乗解とする。定理 2.1によりXb^=PyX\widehat b=Pyであり、a0∈col⁡(X)a_0\in\operatorname{col}(X)なのでa0⊤P=a0⊤a_0^\top P=a_0^\topである。したがって

c⊤b^=a0⊤Xb^=a0⊤Py=a0⊤yc^\top\widehat b=a_0^\top X\widehat b=a_0^\top Py=a_0^\top y

が成り立つ。ゆえに推定可能量の最良線形不偏推定値は、最小二乗解の選択に依存しない。

4 列が一次独立な場合の係数推定

系 4.1.定義 1.1の Gauss–Markov 仮定を置き、XXの列が一次独立であるとする。このとき系 2.2のβ^\hat\betaは不偏であり、

Cov⁡(β^)=σ2(X⊤X)−1\operatorname{Cov}(\hat\beta)=\sigma^2(X^\top X)^{-1}

が成り立つ。

証明.A=(X⊤X)−1X⊤A=(X^\top X)^{-1}X^\topとおくとAX=IpAX=I_pであるから、β^=Ay=β+Aε\hat\beta=Ay=\beta+A\varepsilonとなる。期待値と共分散を計算すると

E[β^]=β,Cov⁡(β^)=A(σ2In)A⊤=σ2(X⊤X)−1\mathbb{E}[\hat\beta]=\beta,\qquad \operatorname{Cov}(\hat\beta)=A(\sigma^2I_n)A^\top =\sigma^2(X^\top X)^{-1}

を得る。▨

系 4.2 (Gauss–Markov:最小二乗推定量は BLUE).系 4.1と同じ仮定を置く。β~=Cy\widetilde\beta=Cyがすべてのβ∈Rp\beta\in\R^pに対してβ\betaの線形不偏推定量であるならば、あるD∈Rp×nD\in\R^{p\times n}に対して

Cov⁡(β~)−Cov⁡(β^)=σ2DD⊤⪰0\operatorname{Cov}(\widetilde\beta)-\operatorname{Cov}(\hat\beta) =\sigma^2DD^\top\succeq0

が成り立つ。等号はβ~=β^\widetilde\beta=\hat\betaのとき、かつそのときに限って成り立つ。

証明. 不偏性はCX=IpCX=I_pと同値である。A=(X⊤X)−1X⊤A=(X^\top X)^{-1}X^\top、D=C−AD=C-AとおくとDX=0DX=0となる。交差項が消えるため、

CC⊤=(A+D)(A+D)⊤=(X⊤X)−1+DD⊤CC^\top=(A+D)(A+D)^\top=(X^\top X)^{-1}+DD^\top

である。したがって、主張する共分散差を得る。任意のv∈Rpv\in\R^pに対してv⊤DD⊤v=∥D⊤v∥2≥0v^\top DD^\top v=\lVert D^\top v\rVert^2\geq0であり、共分散差が零であることはD=0D=0と同値である。▨

Gauss–Markov 定理は誤差の正規性を仮定しない。正規性は、係数の検定や区間を有限標本で構成するときに別途用いる。

5 誤差分散の推定

階数rrの行列XXに対し、PPをcol⁡(X)\operatorname{col}(X)への直交射影行列とする。定理 2.1により、最小二乗残差はe=(In−P)ye=(I_n-P)yと一意に表される。

命題 5.1.定義 1.1の Gauss–Markov 仮定を置き、r=rank⁡(X)<nr=\operatorname{rank}(X)<nとする。RSS=∥e∥2\mathrm{RSS}=\lVert e\rVert^2とおくと、

s2=RSSn−rs^2=\frac{\mathrm{RSS}}{n-r}

はσ2\sigma^2の不偏推定量である。

証明.PX=XPX=Xであるからe=(In−P)εe=(I_n-P)\varepsilonである。PPは対称かつべき等なので

RSS=ε⊤(In−P)ε\mathrm{RSS}=\varepsilon^\top(I_n-P)\varepsilon

となる。E[εε⊤]=σ2In\mathbb{E}[\varepsilon\varepsilon^\top]=\sigma^2I_nから

E[RSS]=tr⁡ ⁣((In−P)E[εε⊤])=σ2tr⁡(In−P)\mathbb{E}[\mathrm{RSS}] =\operatorname{tr}\!\left((I_n-P)\mathbb{E}[\varepsilon\varepsilon^\top]\right) =\sigma^2\operatorname{tr}(I_n-P)

を得る。

§D3.15 定理 3.1によりPPを直交対角化することができる。P2=PP^2=Pなので固有値は00または11であり、像の次元がrrなのでtr⁡(P)=r\operatorname{tr}(P)=rである。したがって、E[RSS]=σ2(n−r)\mathbb{E}[\mathrm{RSS}]=\sigma^2(n-r)となる。r<nr<nであるから、両辺をn−rn-rで割ることができる。▨

正規誤差の下での係数と残差の分布は§E14.20 定理 3.1で扱う。係数、平均応答、新しい観測に対する区間は§E14.20 命題 3.2で扱う。新しい観測の予測誤差には将来の誤差による分散成分も含まれる。

6 平方和と決定係数

定義 6.1. 切片つきモデルにおいて、yˉ=n−1∑i=1nyi\bar y=n^{-1}\sum_{i=1}^ny_iとし、

TSS=∑i=1n(yi−yˉ)2,ESS=∑i=1n(y^i−yˉ)2,RSS=∑i=1n(yi−y^i)2\mathrm{TSS}=\sum_{i=1}^n(y_i-\bar y)^2,\qquad \mathrm{ESS}=\sum_{i=1}^n(\hat y_i-\bar y)^2,\qquad \mathrm{RSS}=\sum_{i=1}^n(y_i-\hat y_i)^2

と定める。TSS>0\mathrm{TSS}>0のとき、決定係数 (coefficient of determination) を

R2=ESSTSS=1−RSSTSSR^2=\frac{\mathrm{ESS}}{\mathrm{TSS}}=1-\frac{\mathrm{RSS}}{\mathrm{TSS}}

で定義する。さらに、r=rank⁡(X)<nr=\operatorname{rank}(X)<nかつn>1n>1のとき、自由度調整済み決定係数 (adjusted coefficient of determination) を

Radj2=1−RSS/(n−r)TSS/(n−1)R^2_{\mathrm{adj}}=1-\frac{\mathrm{RSS}/(n-r)}{\mathrm{TSS}/(n-1)}

で定義する。

命題 6.2. 切片を含む最小二乗当てはめでは、TSS=0\mathrm{TSS}=0の場合も含めて

TSS=ESS+RSS\mathrm{TSS}=\mathrm{ESS}+\mathrm{RSS}

が成り立つ。TSS>0\mathrm{TSS}>0ならば0≤R2≤10\leq R^2\leq1である。

証明.y−yˉ1=e+(y^−yˉ1)y-\bar y\mathbf1=e+(\hat y-\bar y\mathbf1)である。残差eeはcol⁡(X)\operatorname{col}(X)に直交し、切片つきモデルではy^−yˉ1∈col⁡(X)\hat y-\bar y\mathbf1\in\operatorname{col}(X)である。Pythagoras の定理により

∥y−yˉ1∥2=∥e∥2+∥y^−yˉ1∥2\lVert y-\bar y\mathbf1\rVert^2 =\lVert e\rVert^2+\lVert\hat y-\bar y\mathbf1\rVert^2

となる。各平方和は非負であるから、TSS>0\mathrm{TSS}>0の場合には0≤R2≤10\leq R^2\leq1となる。▨

命題 6.3 (説明変数を加えたときの決定係数). 同じ応答yyに二つの切片つきモデルを当てはめ、その計画行列の列空間をW1⊆W2W_1\subseteq W_2とする。TSS>0\mathrm{TSS}>0ならば、二つの決定係数はR12≤R22R_1^2\leq R_2^2を満たす。等号が成り立つ場合もある。

証明.W1W_1上の当てはめはW2W_2における最小二乗の候補でもある。したがって、W2W_2に対する最小 RSS はW1W_1に対する最小 RSS 以下である。R2=1−RSS/TSSR^2=1-\mathrm{RSS}/\mathrm{TSS}から結論を得る。▨

R2R^2は標本内の平方和分解に基づく指標である。説明変数を加えても減少しないため、変数数が異なるモデルをR2R^2だけで比較することはできない。自由度調整済み決定係数も、モデルの妥当性や標本外予測を単独で保証しない。

7 数値例

例 7.1 (単回帰の最小二乗当てはめ).n=5n=5、x=(1,2,3,4,5)⊤x=(1,2,3,4,5)^\top、y=(2,3,5,4,6)⊤y=(2,3,5,4,6)^\topとし、切片つき単回帰yi=β1+β2xi+εiy_i=\beta_1+\beta_2x_i+\varepsilon_iを当てはめる。このときr=p=2r=p=2、xˉ=3\bar x=3、yˉ=4\bar y=4である。

Sxx=∑i=15(xi−xˉ)2=4+1+0+1+4=10,S_{xx}=\sum_{i=1}^5(x_i-\bar x)^2=4+1+0+1+4=10,Sxy=∑i=15(xi−xˉ)(yi−yˉ)=4+1+0+0+4=9.S_{xy}=\sum_{i=1}^5(x_i-\bar x)(y_i-\bar y)=4+1+0+0+4=9.

したがって、

β^2=SxySxx=910=0.9,β^1=yˉ−β^2xˉ=4−2.7=1.3\hat\beta_2=\frac{S_{xy}}{S_{xx}}=\frac9{10}=0.9,\qquad \hat\beta_1=\bar y-\hat\beta_2\bar x=4-2.7=1.3

を得る。当てはめ値と残差は

y^=(2.2,3.1,4.0,4.9,5.8)⊤,e=(−0.2,−0.1,1.0,−0.9,0.2)⊤\hat y=(2.2,3.1,4.0,4.9,5.8)^\top,\qquad e=(-0.2,-0.1,1.0,-0.9,0.2)^\top

であり、∑i=15ei=0\sum_{i=1}^5e_i=0となる。

RSS=0.04+0.01+1.00+0.81+0.04=1.90,s2=1.905−2=1930≈0.6333,s=1930≈0.7958.\mathrm{RSS}=0.04+0.01+1.00+0.81+0.04=1.90,\qquad s^2=\frac{1.90}{5-2}=\frac{19}{30}\approx0.6333,\qquad s=\sqrt{\frac{19}{30}}\approx0.7958.

また、

TSS=4+1+1+0+4=10,ESS=10−1.90=8.10=β^22Sxx=0.81⋅10\mathrm{TSS}=4+1+1+0+4=10,\qquad \mathrm{ESS}=10-1.90=8.10=\hat\beta_2^2S_{xx}=0.81\cdot10

である。よって、

R2=8.1010=0.81,1.90/310/4=1975≈0.2533,Radj2=1−1975=5675≈0.7467R^2=\frac{8.10}{10}=0.81,\qquad \frac{1.90/3}{10/4}=\frac{19}{75}\approx0.2533,\qquad R^2_{\mathrm{adj}}=1-\frac{19}{75}=\frac{56}{75}\approx0.7467

となる。

単回帰では、cjk=[(X⊤X)−1]jkc_{jk}=[(X^\top X)^{-1}]_{jk}とおくと

c22=1Sxx,c11=1n+xˉ2Sxxc_{22}=\frac1{S_{xx}},\qquad c_{11}=\frac1n+\frac{\bar x^2}{S_{xx}}

である。同じ標本を用いた係数検定、FF検定、平均応答の信頼区間、新しい観測の予測区間は§E14.20 例 5.1で計算する。

8 多重共線性

命題 8.1 (分散拡大係数). 切片を含み、列が一次独立な計画行列XXを考え、第jj列xjx_jは切片列ではなく定数でもないとする。xjx_jをXXの残りの列へ最小二乗回帰したときの決定係数をRj2R_j^2とし、

Sjj=∑i=1n(xij−xˉj)2S_{jj}=\sum_{i=1}^n(x_{ij}-\bar x_j)^2

とおく。このとき

[(X⊤X)−1]jj=1(1−Rj2)Sjj=VIFj(n−1)sxj2,VIFj:=11−Rj2,[(X^\top X)^{-1}]_{jj} =\frac{1}{(1-R_j^2)S_{jj}} =\frac{\mathrm{VIF}_j}{(n-1)s_{x_j}^2},\qquad \mathrm{VIF}_j:=\frac1{1-R_j^2},

が成り立つ。ただし、sxj2=Sjj/(n−1)s_{x_j}^2=S_{jj}/(n-1)は固定された計画点の散らばりを表す標本分散の規約であり、確率変数としての説明変数の分散を仮定していない。

証明.ZZをxjx_j以外の列からなる行列とし、xjx_jのcol⁡(Z)\operatorname{col}(Z)への射影残差をzjz_jとする。zj⊥col⁡(Z)z_j\perp\operatorname{col}(Z)かつxj−zj∈col⁡(Z)x_j-z_j\in\operatorname{col}(Z)であるから、

zj⊤xj=∥zj∥2z_j^\top x_j=\lVert z_j\rVert^2

となる。bj=zj/∥zj∥2b_j=z_j/\lVert z_j\rVert^2とおけば、X⊤bjX^\top b_jは第jj成分だけが11の標準基底ベクトルである。またbj∈col⁡(X)b_j\in\operatorname{col}(X)なので、定理 3.4の一意性により

bj=X(X⊤X)−1ejb_j=X(X^\top X)^{-1}e_j

である。したがって、

[(X⊤X)−1]jj=∥X(X⊤X)−1ej∥2=∥bj∥2=1∥zj∥2.[(X^\top X)^{-1}]_{jj} =\lVert X(X^\top X)^{-1}e_j\rVert^2 =\lVert b_j\rVert^2 =\frac1{\lVert z_j\rVert^2}.

ZZは切片列を含むため、平方和分解から∥zj∥2=(1−Rj2)Sjj\lVert z_j\rVert^2=(1-R_j^2)S_{jj}である。これとSjj=(n−1)sxj2S_{jj}=(n-1)s_{x_j}^2を代入する。▨

注意 8.2 (多重共線性と尺度).系 4.1により、列が一次独立な場合にはVar⁡(β^j)=σ2[(X⊤X)−1]jj\operatorname{Var}(\hat\beta_j)=\sigma^2[(X^\top X)^{-1}]_{jj}である。命題 8.1は、他の説明列によってxjx_jを精度よく近似することができる状況でRj2R_j^2が11に近づくと、第jj係数の分散が大きくなることを示す。この変化は不偏性を損なわない。

§D3.15 定理 3.1によるX⊤XX^\top Xの最大固有値と最小固有値をλmax⁡\lambda_{\max}、λmin⁡>0\lambda_{\min}>0とすると、条件数はκ(X⊤X)=λmax⁡/λmin⁡\kappa(X^\top X)=\lambda_{\max}/\lambda_{\min}である。小さい固有値に対応する係数の方向では分散と数値誤差が増幅される場合がある。一方、列の単位を変更するだけでも条件数と各係数の分散は変わるため、大きな条件数だけから全係数の分散が一律に増えるとは結論することができない。条件数を比較するときは、説明列の尺度をそろえたかどうかも明示する必要がある。

前提記事