脳とAIの数理
表現・学習・測定
はじめに
いまのAIを動かしているのは、小さな計算単位を何層もつないだ深層ニューラルネットワークである。その名のとおり、もともとは脳に着想を得て生まれた。1943年の McCulloch と Pitts の形式ニューロン、Hebb の学習則、Rosenblatt のパーセプトロン、視覚を担う脳の領域(視覚野)の階層を写した畳み込みネットワーク—出発点はいつも脳だった。
だが着想を得たあと、二つの分野は別々の進化を遂げた。AIの側は、生物学的な忠実さを手放すことで前に進んだ。誤差逆伝播も、正規化も、注意機構も、脳に対応物があるから採用されたのではない。動いたから採用された。一方で脳の理論研究は、実際の神経回路が何をしているのかを問い続けた。重なりを残しながらも、二つは別の言葉と別の基準で進んでいった。
ここで、脳に対する期待も問い直しておきたい。脳は、自然が磨き上げた最適な設計図なのだろうか。1985年、知覚の研究者 Ramachandran は違う見取り図を示した。知覚は、自然選択の長い試行のなかで集まった、用途別の近道や経験則の「手品の袋」かもしれない。消化が一つの計算で済まず、噛むこと、胃腸の運動、さまざまな酵素の働きによって進むように、見ることにも、そのつど役に立つ仕掛けがある。大きな原理を先に置いても、実際に使われている仕掛けが分かるとは限らない。
この見方に立つと、脳のアーキテクチャ—部品の配置とつなぎ方—には、解くべき課題だけでなく、進化の歴史や身体の制約も刻まれている。配線を短くしたい。遠くへ速く情報を送りたい。多くを覚えたいが、維持する費用は抑えたい。すべてを同時にいちばんよくする設計は、そう簡単には手に入らない。「何かを最小化する」と書けることと、脳全体がそのために最適設計されていることは違う。この警戒心を持ったうえで、脳とAIの重なりを見ていこう。
近年、両者はふたたび交わりつつある。
きっかけは、誰も設計しなかった一致が見つかったことだった。画像認識のために訓練した深層ネットワークの内部表現(入力に応じて内部の計算単位に生じる活動パターン)が、サルやヒトの視覚野の応答と似た構造を持つ。しかも層の深さと脳の階層が対応する。この一致は、細い電極で電気信号を拾う電極記録でも、血液の酸素化の変化から脳活動を間接的に測る機能的磁気共鳴画像法(fMRI)でも、活動を予測するやり方でも表現の幾何を比べるやり方でも、繰り返し確かめられてきた。細部まで脳を真似たわけではないのに、似た表現が現れる—この種の一致はアライメント(alignment)と呼ばれ、いまでは視覚に限らず言語や運動でも報告されている。
この交点に生まれたのが、ニューロAI(NeuroAI)と呼ばれる領域である。
では、なぜ似るのか。似せていないのに似るのなら、理由は設計者の意図の外にあることになる。同じ課題を解いているからだろうか。同じ数学的な制約に縛られているからだろうか。それとも—われわれが両者を同じ道具で記述しているから、そう見えるだけなのだろうか。
本書は、似ている理由を一つの原理で決着させる本ではない。問いを精密にするための道具を渡す本である。Ramachandran の警鐘は第1章で立ち止まって読み、第4章の効率的符号化、第7章のエネルギー関数、第16章の自由エネルギー原理で確かめ直す。第9章では Piantadosi の言語モデル論も手がかりに、「短い原理が分かれば、複雑な能力まで理解できたことになるのか」を問う。
実際、脳の側とAIの側で同じ数学が繰り返し現れる。畳み込み。エネルギー関数。変分下界。ヤコビアン。群の作用。しかも、似た役割を果たすことがある。本書は、その重なりを一つずつ確かめていく。そして最後に、重なりが何を意味するのかを問い直す。
本書は、神谷之康が京都大学で行ってきた講義の資料に基づく。2023年まで総合人間学部を兼担していた際の「脳情報学」および「脳情報学演習」がもとになっている。
講義の内容を土台にしつつ、そこでは扱えなかった現代の話題—表現幾何、深層学習の汎化理論、測定理論、対称性、生成モデル、自由エネルギー原理—を大幅に加えて再構成した。文章化・構造化には生成AI(Claude)を活用したが、内容の企画・判断・最終的な責任は著者にある。
本書はまだ執筆中のドラフトである。誤りや不正確な記述が残っている可能性がある。お気づきの点があればお知らせいただけるとありがたい。
本書が目指すもの
学部生・大学院生が、次のような現代の話題を自分で読み進められるようになるための、十分な下地をつくること。
- 神経集団の活動を「高次元空間の形」として測る表現幾何
- 深層ネットワークがなぜ未見のデータにも通用するのか(汎化)をめぐる理論(二重降下、ニューラル・タンジェント・カーネル、direct fit)
- 対称性と群論から見た同変ネットワーク、そして共変と反変
- ボルツマンマシンから変分推論・自由エネルギー原理へ至る系譜
- VAE・GAN・正規化フロー・拡散モデルの数理
- そして「表現を測る」という営みそのものを問う測定理論
これらは互いに無関係な話題に見えるかもしれない。本書を読み終えたとき、そう見えなくなっていることが目標である。
三つの方針
行間を空けない。式変形の途中を飛ばさない。「明らかに」で済まさない。新しい数学が必要になったら、その場で導入する。測度論も関数解析も多様体論も前提にしない。必要なのは、大学1〜2年で習う線形代数と微積分、そして確率の初歩だけである。(現時点の草稿では、これは努力目標にとどまる。行間が空いたまま、あるいは記号の説明を欠いたままの箇所が残っている。気づかれた箇所はお知らせいただきたい。)
脳とAIを混ぜる。章を「脳の章」と「AIの章」に分けない。ひとつの数学的な道具が両方の場所で同じ働きをすることを、その場で並べて示す。畳み込みは第4章で単純細胞の受容野として現れ、第8章で畳み込み層として再登場し、第13章で「平行移動同変性から必然的に導かれるもの」として正体を明かす—という具合に。
一本の道筋で通す。本書には筋がある。第7章でホップフィールドのエネルギー関数から出発し、ボルツマンマシン、ヘルムホルツマシン、変分推論を経て、第16章の自由エネルギー原理へ進む。そこでは、一つの量で多くを記述できることの力と、それだけで脳を理解したとすることの危うさを、同時に確かめる。その途中で生成モデルの現代形に降りていき、第17章で「脳はなぜ世界に似るのか」を問い、最後に「表現とは何か、それを測るとはどういうことか」という問いに着地する。
読み方
通読する場合は第1章から順に。章をまたぐ回収(前の章で伏せた話が後の章で正体を明かす仕掛け)が随所にあるので、順に読むのがいちばん報われる。
特定の話題だけ知りたい場合は、次を入口にしてほしい。
- 表現幾何・RSA → 第11章(第6章のデコーディングを先に読むと楽)
- 深層学習の汎化理論 → 第9章
- 対称性・同変ネットワーク → 第13章(第12章の「許される変換」を先に読むと理解が早い)
- 拡散モデル → 第15章(第5章の変数変換の節が前提)
- 自由エネルギー原理 → 第16章(第14章の変分下界が前提)
- 世界モデル → 第17章(第10章第7節を先に読むと楽)
- 測定理論 → 第12章(独立に読める)
- 表現とは何か → 第18章(第12章の測定理論が前提)
数学が不安な場合でも、身構えなくてよい。本書は数学を前もって積み上げる構成を取らない。前提として要求するのは、微積分(偏微分と連鎖律まで)、行列の積と固有値、確率の初歩—大学1〜2年で習う範囲である。それを超える道具、たとえばフーリエ変換や群の言葉は、使う直前に「必要な数学:〜」という節で導入する。
詳しい計算を追いたい場合は、巻末の発展編A・発展編B・発展編Cへ。式の成立条件や重要な反例をまとめ、各項に先に読む章・節を示した。本文は、発展編を読まずに読み進められる。追加の数値実験と詳しいコード説明は、Web版の各章の「手を動かす」に置いてある。
コラムは本文の流れから独立している。脳の解剖や生理の背景を扱っているので、読まなくても数学は追えるが、読むと「その式が何の話なのか」が見えるようになる。
記法について
本書で使う記号の約束は、第1章第4節にまとめてある。ベクトルと行列の書き分け、添字の上下(共変と反変)、確率の記法、神経応答の記号(s、\mathbf{r}、f、J)である。記号に迷ったら、そこへ戻ってほしい。
謝辞
本書のもとになったのは、京都大学での講義「脳情報学」および「脳情報学演習」である。受講してくれた学生の皆さんに感謝したい。講義中の質問や、演習でつまずいた箇所が、どこに説明が足りていないかを教えてくれた。本書で「ここは丁寧に書こう」と判断した箇所の多くは、教室でのそうしたやりとりから来ている。
演習の TA を務めてくれた、神谷研究室の歴代の大学院生にも感謝する。彼ら・彼女らは課題の Jupyter Notebook を作ってくれた。その完成度は講義資料を上回るもので、学生からも非常に好評だった。本書の「手を動かす」の囲みは、その延長線上にある。
ライセンス
本書は CC BY-NC-ND 4.0 で公開している。