\[
% to cope with definition mismatch between MathJax and LaTeX
\newcommand{\coloneq}{\mathrel{:=}}
\newcommand{\eqcolon}{\mathrel{=:}}
% general purpose
\newcommand{\ctext}[1]{\raise0.2ex\hbox{\textcircled{\scriptsize{#1}}}}
% mathematics
% general purpose
\DeclarePairedDelimiterX{\parens}[1]{\lparen}{\rparen}{#1}
\DeclarePairedDelimiterX{\braces}[1]{\lbrace}{\rbrace}{#1}
\DeclarePairedDelimiterX{\bracks}[1]{\lbrack}{\rbrack}{#1}
\DeclarePairedDelimiterX{\verts}[1]{|}{|}{#1}
\DeclarePairedDelimiterX{\Verts}[1]{\|}{\|}{#1}
\DeclarePairedDelimiterX{\setComprehension}[2]{\lbrace}{\rbrace}{#1\,\delimsize\vert\,#2}
\newcommand{\as}{{\quad\textrm{as}\quad}}
\newcommand{\st}{{\textrm{ s.t. }}}
\newcommand{\naturalNumbers}{\mathbb{N}}
\newcommand{\integers}{\mathbb{Z}}
\newcommand{\rationalNumbers}{\mathbb{Q}}
\newcommand{\realNumbers}{\mathbb{R}}
\newcommand{\nonNegRealNumbers}{\mathbb{R}_{\geq 0}}
\newcommand{\posRealNumbers}{\mathbb{R}_{> 0}}
\newcommand{\complexNumbers}{\mathbb{C}}
\newcommand{\field}{\mathbb{F}}
\newcommand{\EuclideanSpace}{\mathbb{E}}
\newcommand{\argmax}{\operatorname*{arg~max}}
\newcommand{\argmin}{\operatorname*{arg~min}}
% set theory
\newcommand{\range}[2]{\braces*{#1,\dotsc,#2}}
\renewcommand{\complement}{\mathrm{c}}
\newcommand{\ind}[2]{\mathbbm{1}_{#1}\parens*{#2}}
\newcommand{\indII}[1]{\mathbbm{1}\braces*{#1}}
% number theory
\newcommand{\abs}[1]{\verts*{#1}}
\newcommand{\combi}[2]{{_{#1}\mathrm{C}_{#2}}}
\newcommand{\perm}[2]{{_{#1}\mathrm{P}_{#2}}}
\newcommand{\GaloisField}{\mathrm{GF}}
% real analysis
\newcommand{\NapierE}{\mathrm{e}}
\newcommand{\sgn}{\operatorname{sgn}} % sign function
\newcommand{\rect}{\operatorname{rect}} % rectangular function
\newcommand{\cl}{\operatorname{cl}} % closure of a set
\newcommand{\img}{\operatorname{im}} % image of a function
\newcommand{\dom}{\operatorname{dom}} % domain of a function
\newcommand{\LittleO}[2]{\underset{#1}{o}\parens*{#2}} % little-o notation
\newcommand{\norm}[1]{\Verts*{#1}} % norm of a vector or function
\newcommand{\floor}[1]{\left\lfloor #1\right\rfloor}
\newcommand{\ceil}[1]{\left\lceil#1\right\rceil}
\newcommand{\sinc}{\operatorname{sinc}}
\newcommand{\nrmSinc}{\operatorname{nsinc}} % normalized sinc function
\newcommand{\erf}{\operatorname{erf}}
% inverse trigonometric functions
\newcommand{\asin}{\operatorname{Sin}^{-1}}
\newcommand{\acos}{\operatorname{Cos}^{-1}}
\newcommand{\atan}{\operatorname{Tan}^{-1}}
% derivative
\newcommand{\deriv}[3]{\frac{\mathrm{d}^{#3}#1}{\mathrm{d}{#2}^{#3}}}
\newcommand{\derivLong}[3]{\frac{\mathrm{d}^{#3}}{\mathrm{d}{#2}^{#3}}#1}
\newcommand{\partDeriv}[3]{\frac{\mathrm{\partial}^{#3}#1}{\mathrm{\partial}{#2}^{#3}}}
\newcommand{\partDerivLong}[3]{\frac{\mathrm{\partial}^{#3}}{\mathrm{\partial}{#2}^{#3}}#1}
\newcommand{\partDerivIIHetero}[3]{\frac{\mathrm{\partial}^2#1}{\partial#2\mathrm{\partial}#3}}
\newcommand{\partDerivIIHeteroLong}[3]{{\frac{\mathrm{\partial}^2}{\partial#2\mathrm{\partial}#3}#1}}
% integral
\newcommand{\pv}{{\textrm{ p.v. }}}
\newcommand{\integrate}[5]{\int_{#1}^{#2}{#3}{\;\mathrm{d}^{#4}}#5}
\newcommand{\LebInteg}[4]{\int_{#1} {#2} {#3}\parens*{\;\mathrm{d}#4}}
% complex analysis
\newcommand{\conj}[1]{\overline{#1}}
\renewcommand{\Re}{\operatorname{Re}}
\renewcommand{\Im}{\operatorname{Im}}
\newcommand{\Arg}{\operatorname{Arg}}
\newcommand{\Log}{\operatorname{Log}}
% Laplace transform
\newcommand{\LPLC}{\operatorname{\mathcal{L}}}
\newcommand{\ILPLC}{\operatorname{\mathcal{L}}^{-1}}
% discrete fourier transform
\newcommand{\DFT}{\operatorname{DFT}}
\newcommand{\IDFT}{\operatorname{IDFT}}
% Z-transform
\newcommand{\ZTrans}{\operatorname{\mathcal{Z}}}
\newcommand{\IZTrans}{\operatorname{\mathcal{Z}}^{-1}}
\newcommand{\SSZTrans}{\underset{\text{s.s.}}{\mathcal{Z}}} % single-sided Z-transform
% linear algebra
\newcommand{\bm}[1]{{\boldsymbol{#1}}}
\newcommand{\vecEntry}[2]{\bm{#1}\bracks*{#2}}
\newcommand{\matEntry}[3]{#1\bracks*{#2}\bracks*{#3}}
\newcommand{\matPart}[5]{\matEntry{#1}{#2:#3}{#4:#5}}
\newcommand{\minor}[3]{{#1}\bracks*{\setminus #2}\bracks*{\setminus #3}} % the minor of a matrix: row #2 and column #3 deleted
\newcommand{\diag}{\operatorname{diag}}
\newcommand{\transpose}[1]{{#1}^\top}
\newcommand{\HerConj}[1]{{#1}^*}
\newcommand{\tr}{\operatorname{tr}}
\newcommand{\inProd}[2]{\left\langle#1,#2\right\rangle}
\newcommand{\dotProd}[2]{#1 \cdot #2}
\newcommand{\HadamardProd}{\odot}
\newcommand{\HadamardDiv}{\oslash}
\newcommand{\vecSpan}{\operatorname{span}}
\newcommand{\rank}{\operatorname{rank}}
% vector
% unit vector
\newcommand{\vix}{\bm{i}_x}
\newcommand{\viy}{\bm{i}_y}
\newcommand{\viz}{\bm{i}_z}
% graph theory
\newcommand{\neighborhood}{\mathcal{N}}
% probability theory
\newcommand{\PDF}{\operatorname{PDF}}
\newcommand{\Ber}{\operatorname{Ber}}
\newcommand{\Beta}{\operatorname{Beta}}
\newcommand{\ExpDist}{\operatorname{ExpDist}}
\newcommand{\ErlangDist}{\operatorname{ErlangDist}}
\newcommand{\PoissonDist}{\operatorname{PoissonDist}}
\newcommand{\GammaDist}{\operatorname{Gamma}}
\newcommand{\cind}[2]{\ind{#1\left| #2\right.}} % conditional indicator function
\renewcommand{\Pr}{\operatorname{Pr}}
\DeclarePairedDelimiterX{\cPrParens}[2]{(}{)}{#1\,\delimsize\vert\,#2}
\newcommand{\Ev}{\operatorname{E}} % expected value
\newcommand{\Var}{\operatorname{Var}}
\newcommand{\Cov}{\operatorname{Cov}}
% physics
% unit of measurement
\newcommand{\second}{\text{s}}
\newcommand{\hertz}{\text{Hz}}
\newcommand{\decibel}{\text{dB}}
% signal processing
% Discrete Time Fourier Transform
\newcommand{\DTFT}{\operatorname{DTFT}}
\newcommand{\IDTFT}{\operatorname{IDTFT}}
% computer science
% fixed-point arithmetic
\newcommand{\IntPartBW}[1]{\underbracket[0.140ex]{#1}_\mathrm{i}} % 0.140ex is half of the default thickness. See: [How to make underbracket thinner](https://tex.stackexchange.com/questions/559078/how-to-make-underbracket-thinner)
\newcommand{\DecPartBW}[1]{\underbracket[0.140ex]{#1}_\mathrm{d}}
\newcommand{\TotalBW}[1]{\underbracket[0.140ex]{#1}}
\newcommand{\Rat}{\operatorname{Rat}} % Maps a fixed-point number to a corresponding rational number.
% programming
\newcommand{\plpl}{\mathrel{++}}
\newcommand{\pleq}{\mathrel{+}=}
\newcommand{\asteq}{\mathrel{*}=}
\]
はじめに
先日、面白い記事を見つけた。二重数(下記ページでは「双対数」と呼ばれているが、Wikipediaでは「二重数」)を用いると、初等的な関数($e^x,\sin x,\cos x,\log x,\dots$)の加減乗除と合成関数で作られた関数の微分係数を機械的に計算するプログラムを比較的簡単に実装できるという話。
双対数を利用した自動微分についてのメモ
数学的な妥当性の説明が簡単に述べられているが、私の知識不足故か、素直に納得できないところがあったので、自分が気になった箇所について考えてみた。以下それについて述べる。
紹介されている数式の導出
$f(a + b\varepsilon) = f(a) + b\varepsilon f'(a)$の導出
関数$f: x \in G \subseteq \mathbb{C} \mapsto f(x) \in \mathbb{C}$は$a_0 \in G$を中心に冪級数展開可能であるとする。$a,b \in \mathbb{C}$とし、$a$は収束領域に入っているものとする。
$$
\begin{aligned}
f(a + b\varepsilon) &= \sum_{k=0}^\infty \frac{1}{k!}f^{(k)}(a_0)(a + b\varepsilon – a_0)^k \\
&= f(a_0) + \sum_{k=1}^\infty \frac{1}{k!}f^{(k)}(a_0)(a + b\varepsilon – a_0)^k \\
&= f(a_0) + \sum_{k=1}^\infty \frac{1}{k!}f^{(k)}(a_0) \sum_{l=0}^k \binom{k}{l}(a-a_0)^{k-l}(b\varepsilon)^l \\
&= f(a_0) + \sum_{k=1}^\infty \frac{1}{k!}f^{(k)}(a_0) \left[(a-a_0)^k + b\varepsilon k(a-a_0)^{k-1}\right] \\
&= \sum_{k=0}^\infty \frac{1}{k!}f^{(k)}(a_0)(a-a_0)^k + b\varepsilon\sum_{k=1}^\infty \frac{1}{k!}f^{(k)}(a_0)k(a-a_0)^{k-1} \\
&= f(a) + b\varepsilon\left.\left(\frac{\mathrm{d}}{\mathrm{d}x}\sum_{k=0}^\infty \frac{1}{k!}f^{(k)}(a_0)(x-a_0)^k\right)\right|_{x=a} \\
&= f(a) + b\varepsilon f'(a)
\end{aligned}
$$
$f(\bm{a} + \varepsilon\bm{p}) = f(\bm{a}) + \bm{p}^\top \nabla f(a)$ の導出
$f: \bm{x} \in G \subseteq \realNumbers^n \mapsto f(\bm{x}) \in \mathbb{C}$は$\bm{a}_0$を中心として冪級数展開可能であるとする。このとき$f$は無限回微分可能であり、Youngの定理より$\partial/\partial x_i$と$\partial/\partial x_j$が可換であることに注意する。$\bm{a}, \bm{p} \in \realNumbers$とし、$\bm{a}$は収束領域に入っているものとする。
$$
\begin{aligned}
f(\bm{a} + \varepsilon\bm{p}) &= f(\bm{a}_0 + (\bm{a} – \bm{a}_0 + \varepsilon\bm{p})) \\
&= f(\bm{a}_0) + \sum_{k=1}^\infty\frac{1}{k!}\left[(\bm{a} – \bm{a}_0 + \varepsilon\bm{p})^\top\nabla\right]^k (f, \bm{a}_0) \\
&= f(\bm{a}_0) + \sum_{k=1}^\infty\frac{1}{k!}\left[(\bm{a} – \bm{a}_0)^\top\nabla + \varepsilon\bm{p}^\top\nabla\right]^k (f, \bm{a}_0) \\
&= f(\bm{a}_0) + \sum_{k=1}^\infty\frac{1}{k!}\left\{\left[(\bm{a} – \bm{a}_0)^\top\nabla\right]^k + k\left[(\bm{a} – \bm{a}_0)^\top\nabla\right]^{k-1}\varepsilon\bm{p}^\top\nabla\right\} (f, \bm{a}_0) \\
&= f(\bm{a}_0) + \sum_{k=1}^\infty\frac{1}{k!}\left[(\bm{a} – \bm{a}_0)^\top\nabla\right]^k (f, \bm{a}_0) \\
&\phantom{=} + \left\{(\varepsilon\bm{p}^\top\nabla)\sum_{k=1}^\infty\frac{1}{(k-1)!}\left[(\bm{a} – \bm{a}_0)^\top\nabla\right]^{k-1}\right\} (f, \bm{a}_0) \\
&= f(\bm{a}) + (\varepsilon\bm{p}^\top\nabla)\left(\sum_{k=0}^\infty\frac{1}{k!}\left[(\bm{a} – \bm{a}_0)^\top\nabla\right]^k f, \bm{a}_0\right) \\
&= f(\bm{a}) + (\varepsilon\bm{p}^\top\nabla)\left(g, \bm{a}_0\right) \quad \text{where} \quad g: \bm{x} \mapsto f(\bm{x} + (\bm{a}-\bm{a}_0)) \\
&= f(\bm{a}) + \varepsilon\bm{p}^\top\nabla (f, \bm{a})
\end{aligned}
$$
計算機での実装を意識
計算機で先述の冪級数展開を計算するわけにはいかない。実装上は、まず二重数クラスを定義し、$f(a + b\varepsilon) = f(a) + b\varepsilon f'(a)$を初等的な関数($\sqrt x, e^x, \sin x, \cos x, \tan x, \log x,\dots$)について実装する。
双対数を利用した自動微分についてのメモの解説にあるように、$f + f’\varepsilon, g + g’\varepsilon$型の二重数同士の四則演算が好都合な結果をもたらすので、$f(a + b\varepsilon) = f(a) + b\varepsilon f'(a)$を実装した関数同士の四則演算で構成されたユーザー定義関数$h$については、引数に$a + \varepsilon$を渡すだけで自動的に$h(a) + h'(a)$が計算される。
Juliaでの実装
Juliaで実装したコードをGistで公開している: Automatic differentiation using Dual Number
コメントを残す
コメントを投稿するにはログインしてください。