§E4.3連鎖律と勾配

最終更新

曲線に沿って動く点で温度や高さを測ると、時刻の変化は、まず位置の変化となり、その位置を入力とする実数値関数の変化となる。座標変換を重ねる場合にも、入力の変化は複数の写像の合成によって順に変換される。このような合成写像は、解析学と幾何学で繰り返し現れる具体的な対象である。

各写像が一点の近くで線形写像によって近似されても、合成全体の誤差が入力の大きさに比べて無視できることは、個々の近似式から直ちには従わない。また、局所的な線形近似から離れた二点間の変化を評価するには、一点での微分とは異なる議論が必要になる。

全微分の連鎖律は、合成写像の一次近似を二つの全微分の合成として与える、多変数微分の最も基本的な法則の一つである。実数値関数では、この線形近似を一つのベクトルとの内積として表すことにより、入力方向と関数値の変化の関係を統一的に記述することができる。

本記事では、全微分を線形写像として扱う立場から、合成写像と局所変化の基本的な性質を解説する。

1 全微分の連鎖律

定理 1.1 (全微分の連鎖律).U⊂RnU\subset\mathbb R^nとV⊂RmV\subset\mathbb R^mを開集合とし、f ⁣:U→Vf\colon U\to Vとg ⁣:V→Rℓg\colon V\to\mathbb R^\ellを写像、a∈Ua\in Uを点とする。ffがaaで全微分可能であり、ggがf(a)f(a)で全微分可能ならば、g∘f ⁣:U→Rℓg\circ f\colon U\to\mathbb R^\ellはaaで全微分可能であり、

D(g∘f)(a)=Dg(f(a))∘Df(a)∈L(Rn,Rℓ)D(g\circ f)(a)=Dg(f(a))\circ Df(a) \in\mathcal L(\mathbb R^n,\mathbb R^\ell)

が成り立つ。

証明. 証明では、合成写像の剰余を二つの項に分離し、それぞれを入力変位のノルムで割った極限を評価する。

b=f(a)b=f(a)、A=Df(a)∈L(Rn,Rm)A=Df(a)\in\mathcal L(\mathbb R^n,\mathbb R^m)、B=Dg(b)∈L(Rm,Rℓ)B=Dg(b)\in\mathcal L(\mathbb R^m,\mathbb R^\ell)とおく。ffの全微分可能性により、a+h∈Ua+h\in Uを満たす十分小さいhhに対して

f(a+h)=b+Ah+r(h),∥r(h)∥∥h∥⟶0(h→0,h≠0)f(a+h)=b+Ah+r(h), \qquad \frac{\lVert r(h)\rVert}{\lVert h\rVert}\longrightarrow0 \quad(h\to0, h\ne0)

と書くことができる。k(h)=Ah+r(h)k(h)=Ah+r(h)とおく。§E4.2 命題 1.4によって

∥k(h)∥∥h∥≤∥A∥op+∥r(h)∥∥h∥\frac{\lVert k(h)\rVert}{\lVert h\rVert} \leq \lVert A\rVert_{\mathrm{op}} +\frac{\lVert r(h)\rVert}{\lVert h\rVert}

であるから、左辺はh=0h=0の近くで有界であり、k(h)→0k(h)\to0である。

VVはbbを含む開集合である。b+k∈Vb+k\in Vを満たす十分小さいkkに対して

s(k)=g(b+k)−g(b)−Bks(k)=g(b+k)-g(b)-Bk

とおくと、ggの全微分可能性から

∥s(k)∥∥k∥⟶0(k→0,k≠0)\frac{\lVert s(k)\rVert}{\lVert k\rVert}\longrightarrow0 \quad(k\to0, k\ne0)

である。さらに

ε(k)={∥s(k)∥∥k∥,k≠0,0,k=0\varepsilon(k)= \begin{cases} \dfrac{\lVert s(k)\rVert}{\lVert k\rVert},&k\ne0,\\ 0,&k=0 \end{cases}

と定めれば、ε(k)→0\varepsilon(k)\to0となる。

f(a+h)=b+k(h)f(a+h)=b+k(h)をggの剰余表示へ代入すると、

g(f(a+h))−g(f(a))−BAh=Br(h)+s(k(h))g(f(a+h))-g(f(a))-BAh =Br(h)+s(k(h))

を得る。§E4.2 命題 1.4をBBに適用すれば、h≠0h\ne0に対して

∥Br(h)+s(k(h))∥∥h∥≤∥B∥op∥r(h)∥∥h∥+ε(k(h))∥k(h)∥∥h∥.\begin{aligned} \frac{\lVert Br(h)+s(k(h))\rVert}{\lVert h\rVert} &\leq \lVert B\rVert_{\mathrm{op}} \frac{\lVert r(h)\rVert}{\lVert h\rVert} +\varepsilon(k(h)) \frac{\lVert k(h)\rVert}{\lVert h\rVert}. \end{aligned}

第一項は00へ収束する。第二項では、第一因子がk(h)→0k(h)\to0によって00へ収束し、第二因子が有界であるから、積は00へ収束する。したがって、合成写像の剰余はo(∥h∥)o(\lVert h\rVert)であり、D(g∘f)(a)=BAD(g\circ f)(a)=BAである。▨

2 平均値不等式

定理 2.1 (ベクトル値写像の平均値不等式).U⊂RnU\subset\mathbb R^nを開集合とし、x,y∈Ux,y\in Uを結ぶ閉線分

[x,y]={x+t(y−x)∣0≤t≤1}[x,y]=\{x+t(y-x)\mid 0\leq t\leq1\}

がUUに含まれるとする。F ⁣:U→RmF\colon U\to\mathbb R^mが[x,y][x,y]の各点で全微分可能であり、あるM≥0M\geq0に対して

∥DF(z)∥op≤M(z∈[x,y])\lVert DF(z)\rVert_{\mathrm{op}}\leq M \qquad(z\in[x,y])

が成り立つならば、

∥F(y)−F(x)∥≤M∥y−x∥\lVert F(y)-F(x)\rVert \leq M\lVert y-x\rVert

である。

証明. 証明では、差ベクトルF(y)−F(x)F(y)-F(x)の方向を表す単位ベクトルとの内積によってベクトル値写像を実数値関数へ帰着し、一変数の平均値の定理を適用する。

F(y)=F(x)F(y)=F(x)の場合には結論が成り立つ。以下ではF(y)≠F(x)F(y)\ne F(x)とし、

u=F(y)−F(x)∥F(y)−F(x)∥∈Rmu=\frac{F(y)-F(x)}{\lVert F(y)-F(x)\rVert} \in\mathbb R^m

とおく。∥u∥=1\lVert u\rVert=1である。実数値関数φ ⁣:[0,1]→R\varphi\colon[0,1]\to\mathbb Rを

φ(t)=⟨u,F(x+t(y−x))⟩\varphi(t)=\langle u,F(x+t(y-x))\rangle

によって定める。

FFは線分上の各点で全微分可能であるから、§E4.2 命題 1.5によって線分上で連続である。したがってφ\varphiは[0,1][0,1]上で連続である。写像t↦x+t(y−x)t\mapsto x+t(y-x)は全微分可能であり、線形汎関数w↦⟨u,w⟩w\mapsto\langle u,w\rangleは剰余が零である全微分可能な写像である。したがって定理 1.1により、φ\varphiは(0,1)(0,1)上で微分可能であり、

φ′(t)=⟨u,DF(x+t(y−x))(y−x)⟩\varphi'(t) =\left\langle u,DF(x+t(y-x))(y-x)\right\rangle

を満たす。

§D1.14 定理 3.1 (平均値の定理)をφ\varphiへ適用すると、あるθ∈(0,1)\theta\in(0,1)が存在して

φ(1)−φ(0)=φ′(θ)\varphi(1)-\varphi(0)=\varphi'(\theta)

となる。uuの定義から、左辺は∥F(y)−F(x)∥\lVert F(y)-F(x)\rVertに等しい。Cauchy–Schwarz の不等式と§E4.2 命題 1.4によって

∥F(y)−F(x)∥=⟨u,DF(x+θ(y−x))(y−x)⟩≤∥u∥∥DF(x+θ(y−x))(y−x)∥≤∥DF(x+θ(y−x))∥op∥y−x∥≤M∥y−x∥\begin{aligned} \lVert F(y)-F(x)\rVert &=\left\langle u,DF(x+\theta(y-x))(y-x)\right\rangle\\ &\leq\lVert u\rVert \left\lVert DF(x+\theta(y-x))(y-x)\right\rVert\\ &\leq\lVert DF(x+\theta(y-x))\rVert_{\mathrm{op}}\lVert y-x\rVert\\ &\leq M\lVert y-x\rVert \end{aligned}

を得る。▨

例 2.2 (ベクトル値の平均値等式が成立しない例). 開区間U=(−1,2π+1)U=(-1,2\pi+1)上の写像F ⁣:U→R2F\colon U\to\mathbb R^2を

F(t)=(cos⁡t,sin⁡t)F(t)=(\cos t,\sin t)

によって定める。F(2π)−F(0)=0F(2\pi)-F(0)=0である。一方、任意のc∈(0,2π)c\in(0,2\pi)に対して

DF(c)(2π)=2π(−sin⁡c,cos⁡c)≠0DF(c)(2\pi)=2\pi(-\sin c,\cos c)\ne0

である。したがって、実数値関数の平均値の定理を模倣した等式

F(2π)−F(0)=DF(c)(2π−0)F(2\pi)-F(0)=DF(c)(2\pi-0)

を満たすccは存在しない。ベクトル値写像では、一点における微分との等式ではなく、定理 2.1のノルム評価を用いる必要がある。

系 2.3.U⊂RnU\subset\mathbb R^nを空でない凸な開集合とし、F ⁣:U→RmF\colon U\to\mathbb R^mがUUの各点で全微分可能であるとする。すべてのz∈Uz\in Uに対してDF(z)=0DF(z)=0ならば、FFは定数写像である。

証明.x,y∈Ux,y\in Uを任意に取る。UUの凸性により[x,y]⊂U[x,y]\subset Uである。定理 2.1をM=0M=0として適用すると、

∥F(y)−F(x)∥≤0\lVert F(y)-F(x)\rVert\leq0

となるから、F(y)=F(x)F(y)=F(x)である。x,yx,yは任意であるため、FFは定数写像である。▨

3 勾配と方向微分

定義 3.1.U⊂RnU\subset\mathbb R^nを開集合、f ⁣:U→Rf\colon U\to\mathbb Rを関数、a∈Ua\in Uを点とする。ffのすべての偏微分がaaで存在するとき、

∇f(a)=(∂1f(a),…,∂nf(a))∈Rn\nabla f(a) =\bigl(\partial_1f(a),\ldots,\partial_nf(a)\bigr) \in\mathbb R^n

をffのaaにおける勾配 (gradient) という。

定理 3.2.U⊂RnU\subset\mathbb R^nを開集合、f ⁣:U→Rf\colon U\to\mathbb Rを関数、a∈Ua\in Uを点とする。ffがaaで全微分可能ならば、任意のh∈Rnh\in\mathbb R^nに対して

Df(a)h=⟨∇f(a),h⟩Df(a)h=\langle\nabla f(a),h\rangle

が成り立つ。さらに、∇f(a)\nabla f(a)はこの等式を満たす唯一のベクトルであり、任意のv∈Rnv\in\mathbb R^nに対して

Dvf(a)=⟨∇f(a),v⟩D_vf(a)=\langle\nabla f(a),v\rangle

である。

証明.§E4.2 命題 1.5により、すべての偏微分がaaで存在し、標準基底eje_jに対して

Df(a)ej=∂jf(a)Df(a)e_j=\partial_jf(a)

である。h=∑j=1nhjejh=\sum_{j=1}^nh_je_jと書けば、Df(a)Df(a)の線形性から

Df(a)h=∑j=1nhjDf(a)ej=∑j=1nhj∂jf(a)=⟨∇f(a),h⟩Df(a)h =\sum_{j=1}^nh_jDf(a)e_j =\sum_{j=1}^nh_j\partial_jf(a) =\langle\nabla f(a),h\rangle

を得る。

w∈Rnw\in\mathbb R^nもDf(a)h=⟨w,h⟩Df(a)h=\langle w,h\rangleをすべてのhhについて満たすとする。h=ejh=e_jとすればwj=Df(a)ej=∂jf(a)w_j=Df(a)e_j=\partial_jf(a)となるため、w=∇f(a)w=\nabla f(a)である。最後に、§E4.2 命題 1.5の方向微分に関する結論へh=vh=vの表示を適用すると、

Dvf(a)=Df(a)v=⟨∇f(a),v⟩D_vf(a)=Df(a)v=\langle\nabla f(a),v\rangle

となる。▨

命題 3.3.U⊂RnU\subset\mathbb R^nを開集合、f ⁣:U→Rf\colon U\to\mathbb Rを関数、a∈Ua\in Uを点とする。ffがaaで全微分可能ならば、単位ベクトルvvに関するDvf(a)D_vf(a)の最大値は∥∇f(a)∥\lVert\nabla f(a)\rVertである。∇f(a)≠0\nabla f(a)\ne0の場合、最大値を与える単位ベクトルは

v=∇f(a)∥∇f(a)∥v=\frac{\nabla f(a)}{\lVert\nabla f(a)\rVert}

である。∇f(a)=0\nabla f(a)=0の場合、すべての単位ベクトルが最大値00を与える。

証明.定理 3.2と Cauchy–Schwarz の不等式により、単位ベクトルvvに対して

Dvf(a)=⟨∇f(a),v⟩≤∥∇f(a)∥D_vf(a) =\langle\nabla f(a),v\rangle \leq\lVert\nabla f(a)\rVert

である。∇f(a)≠0\nabla f(a)\ne0の場合には、主張にあるvvを取れば等号が成り立つ。等号が成り立つ単位ベクトルは∇f(a)\nabla f(a)と同じ向きでなければならないから、このvvに限る。∇f(a)=0\nabla f(a)=0の場合には、任意のvvに対してDvf(a)=0D_vf(a)=0である。▨

系 3.4.U⊂RnU\subset\mathbb R^nを開集合、I⊂RI\subset\mathbb Rを開区間、t0∈It_0\in Iを点とする。γ ⁣:I→U\gamma\colon I\to Uがt0t_0で微分可能であり、f ⁣:U→Rf\colon U\to\mathbb Rがγ(t0)\gamma(t_0)で全微分可能ならば、

ddtf(γ(t))∣t=t0=⟨∇f(γ(t0)),γ′(t0)⟩\frac{d}{dt}f(\gamma(t))\bigg|_{t=t_0} =\left\langle\nabla f(\gamma(t_0)),\gamma'(t_0)\right\rangle

が成り立つ。

証明.γ\gammaの全微分は

Dγ(t0)s=sγ′(t0)(s∈R)D\gamma(t_0)s=s\gamma'(t_0) \qquad(s\in\mathbb R)

である。定理 1.1によって

D(f∘γ)(t0)1=Df(γ(t0))(Dγ(t0)1)=Df(γ(t0))γ′(t0)D(f\circ\gamma)(t_0)1 =Df(\gamma(t_0))\bigl(D\gamma(t_0)1\bigr) =Df(\gamma(t_0))\gamma'(t_0)

となる。定理 3.2を右辺へ適用すれば結論を得る。▨

4 演習

問題 4.1 (合成関数の全微分と勾配). 写像F ⁣:R2→R2F\colon\mathbb R^2\to\mathbb R^2と関数q ⁣:R2→Rq\colon\mathbb R^2\to\mathbb Rを

F(x,y)=(xey,x2+y),q(u,v)=u2+v2F(x,y)=(xe^y,x^2+y), \qquad q(u,v)=u^2+v^2

によって定める。定理 1.1を用いてD(q∘F)(a,b)D(q\circ F)(a,b)を求め、定理 3.2によって∇(q∘F)(a,b)\nabla(q\circ F)(a,b)を求めよ。

解答.

h,k∈Rh,k\in\mathbb Rに対して

DF(a,b)(h,k)=(ebh+aebk,2ah+k)DF(a,b)(h,k) =\bigl(e^bh+ae^bk,2ah+k\bigr)

であり、r,s∈Rr,s\in\mathbb Rに対して

Dq(u,v)(r,s)=2ur+2vsDq(u,v)(r,s)=2ur+2vs

である。したがって連鎖律により

D(q∘F)(a,b)(h,k)=Dq(F(a,b))(DF(a,b)(h,k))=2aeb(ebh+aebk)+2(a2+b)(2ah+k)=(2ae2b+4a(a2+b))h+(2a2e2b+2(a2+b))k.\begin{aligned} D(q\circ F)(a,b)(h,k) &=Dq(F(a,b))\bigl(DF(a,b)(h,k)\bigr)\\ &=2ae^b(e^bh+ae^bk)+2(a^2+b)(2ah+k)\\ &=\bigl(2ae^{2b}+4a(a^2+b)\bigr)h\\ &\quad+\bigl(2a^2e^{2b}+2(a^2+b)\bigr)k. \end{aligned}

よって

∇(q∘F)(a,b)=(2ae2b+4a(a2+b), 2a2e2b+2(a2+b))\nabla(q\circ F)(a,b) =\bigl(2ae^{2b}+4a(a^2+b),\ 2a^2e^{2b}+2(a^2+b)\bigr)

である。▨

問題 4.2 (一階連続微分可能な写像の局所 Lipschitz 性).U⊂RnU\subset\mathbb R^nを開集合、F ⁣:U→RmF\colon U\to\mathbb R^mをC1C^1級の写像、a∈Ua\in Uを点とする。あるr>0r>0とL≥0L\geq0が存在して、任意のx,y∈B‾(a,r)x,y\in\overline B(a,r)に対して

∥F(y)−F(x)∥≤L∥y−x∥\lVert F(y)-F(x)\rVert\leq L\lVert y-x\rVert

となることを、定理 2.1を用いて証明せよ。

解答.

UUは開集合であるから、B‾(a,r0)⊂U\overline B(a,r_0)\subset Uを満たすr0>0r_0>0が存在する。DFDFはaaで作用素ノルムについて連続であるから、0<r≤r00<r\leq r_0を十分小さく取れば、任意のz∈B‾(a,r)z\in\overline B(a,r)に対して

∥DF(z)−DF(a)∥op<1\lVert DF(z)-DF(a)\rVert_{\mathrm{op}}<1

となる。したがって

∥DF(z)∥op≤∥DF(a)∥op+1\lVert DF(z)\rVert_{\mathrm{op}} \leq\lVert DF(a)\rVert_{\mathrm{op}}+1

である。閉球B‾(a,r)\overline B(a,r)は凸集合であるから、x,y∈B‾(a,r)x,y\in\overline B(a,r)に対して[x,y]⊂B‾(a,r)⊂U[x,y]\subset\overline B(a,r)\subset Uである。定理 2.1を

L=∥DF(a)∥op+1L=\lVert DF(a)\rVert_{\mathrm{op}}+1

として適用すれば結論を得る。▨

参考文献

  1. Michael Spivak, Calculus on Manifolds: A Modern Approach to Classical Theorems of Advanced Calculus, CRC Press, 2018, originally published 1965.全微分の連鎖律と線形写像による定式化を参考にした。
  2. Walter Rudin, Principles of Mathematical Analysis, 3rd ed., International Series in Pure and Applied Mathematics, McGraw Hill, 1976.ベクトル値写像の平均値不等式を参考にした。

前提記事