13  対称性 ── 変換で変わらないもの、ともに変わるもの

前章の第2節で、われわれは「許される変換のあつまり」というものを扱った。摂氏を華氏に直しても同じ測定である。原色の選び方を変えても同じ色空間である。そして最後に、そのあつまりは恒等変換を含み、合成について閉じ、逆変換を持つと書いた。この構造を群という。

本章はその名前を正しく与えるところから始める。だが目的は用語の整備ではない。群という概念を手に入れると、本書がここまで何度も使ってきた道具の一つに、まったく別の顔が見えてくる。畳み込みである。

第4章でわれわれは畳み込みを、視覚受容野を記述する便利な数学として導入した。第8章では、それが畳み込みニューラルネットの重み共有として再登場した。二度とも「そういうものだ」として使ってきた。本章の第7節では、線形性と平行移動同変性を要求すると、作用素が畳み込みに限られることを示す。便利な道具として使ってきた畳み込みを、対称性から捉え直すのである。

本書でもっとも息の長い伏線が、ここで回収される。

ヒント本章のガイド

第2〜3節が群と表現の最小限の導入である。群論を学んだことがあれば飛ばしてよい。学んだことがなくても心配は要らない—本章で使うのは定義と初歩の例だけで、シローの定理も可解群も出てこない。

第4〜6節が概念の整理(不変・同変・共変・反変・準同型)、第7〜10節が深層学習への応用である。

第7節が本章の山場である。第4章から引いてきた畳み込みの伏線が回収される。急ぐならここだけでもよい。

第5節(共変と反変)は、第11章第4節のヤコビアンの話と直結している。あそこで \deltaJ^\top J が何をしていたのかが、この節で腑に落ちるはずだ。


1. なぜ対称性か

猫の写真を右に10ピクセルずらす。まだ猫である。

当たり前のことを言っているようだが、この当たり前を機械に教えるのは簡単ではない。画像を1万次元のベクトルとして扱うなら、10ピクセルずらした画像は元の画像とまったく違うベクトルである。ユークリッド距離で測れば遠く離れている。「これも猫だ」と学ばせるには、ずらした画像を全部見せるしかない—素朴にはそうなる。

だがわれわれは、これを学習で獲得させる必要があるのだろうか。「ずらしても猫」は、データから学ぶべき事実ではなく、世界についてわれわれが最初から知っていることである。ならば、それをアーキテクチャに埋め込んでしまえばよい。これが本章の発想である。整理すると三つの利得がある。

第一に、サンプル効率。平行移動しても同じだと分かっているなら、平行移動したデータを見る必要がない。学習すべき関数の空間が小さくなる。第9章で扱った汎化の議論で言えば、仮説空間を対称性で絞ることになる。

第二に、保証。学習で「だいたい平行移動に強くなった」のと、構造として「厳密に平行移動と可換である」のとでは、性質がまったく違う。後者は入力が訓練分布の外にあっても壊れない。

第三に、統一的な見方。これがいちばん深い利得である。CNN・グラフニューラルネット・Transformer は、それぞれ別々に発明されたアーキテクチャに見える。だが「どんな対称性を仮定しているか」という観点から見ると、同じ設計原理の異なる実装として整理できる。第9節で扱う幾何学的深層学習の主張である。

そして脳の側にも同じ話がある。視覚系は階層を上がるにつれて位置や大きさの変化に頑健になっていく。第4章で扱った複雑細胞の位相不変性が、その最初の一歩だった。「不変性の獲得」は視覚神経科学の中心的な主題であり、それを数学的に語る言葉が対称性である。


2. 必要な数学:群

定義

画像を右へずらし、続けてさらに右へずらす。この二つの操作は、合わせれば一つの平行移動になる。こうした「二つを組み合わせて一つにする規則」を二項演算という。

操作の集まりを集合 G、組み合わせる規則を \ast と書く。\ast: G \times G \to G は、G の二つの要素の組を受け取って G の一つの要素を返す、という意味である。組み合わせた結果も G に入るので、この集まりの外には出ない。

以下では g, h, k を任意の操作、e を何もしない操作、g^{-1}g を元に戻す操作として使う。集合 G と演算 \ast の組が(group)であるとは、次の三つを満たすことである。

  1. 結合律 — 任意の g, h, k \in G について (g \ast h) \ast k = g \ast (h \ast k)
  2. 単位元 — ある e \in G が存在して、任意の g について e \ast g = g \ast e = g
  3. 逆元 — 任意の g に対し、g \ast g^{-1} = g^{-1} \ast g = e となる g^{-1} が存在する

これだけである。可換性(g \ast h = h \ast g)は要求されない。可換性まで成り立つ群を可換群(アーベル群)と呼ぶ。

抽象的に見えるが、正体は単純である。群とは「操作のあつまり」であって、続けてできること・何もしないこと・元に戻せることを要求しているだけである。

平行移動群 \mathbb{R}^2 画像を横に u、縦に v だけずらす操作。連続的にずらせるなら (u,v) \in \mathbb{R}^2、画素の格子の上で整数個だけずらすなら (u,v) \in \mathbb{Z}^2 を使う(\mathbb{Z} は整数全体である)。二回ずらせば足し算になるから、演算は +、単位元は (0,0)、逆元は (-u,-v)。可換群であり、本章ではこの群を中心に扱う。

回転群 \mathrm{SO}(2) 平面を原点のまわりに回転させる操作の群である。角度 \theta の回転を続けて角度 \varphi の回転をすれば \theta + \varphi の回転だから、これも可換群である。回転を行列に対応させる方法は、次節で「表現」として導入する。

三次元回転群 \mathrm{SO}(3) こちらは可換でない。x 軸まわりに90度回してから y 軸まわりに90度回すのと、順序を逆にするのとでは、結果が違う。手元にあるもの(本でもスマホでも)で試してみてほしい。

置換群 S_n 番号の付いたもののうち、二つの番号を入れ替える操作を考えよう。もの自体は変わらず、どの番号で呼ぶかが変わる。一般に、n 個の番号 1, \dots, n を重複も欠落もなく並べ替える一つの操作を置換という。すべての置換を集め、二つの置換を続けて行うことを演算にすると群になる。何も並べ替えない操作が単位元、元の並びに戻す操作が逆元である。この群が S_n で、n 個の番号の置換をすべて含むので対称群とも呼ばれる。

点と点のつながりをデータとして扱い、つながった点どうしで情報を受け渡して特徴を更新するのが、グラフニューラルネット(GNN)である。点にあたるノードの番号を付け替えるとき、どのノードとどのノードがつながっているかも同じ付け替えに従って書き直す。「ノードの番号の付け方によらない」という要求が、この群に対応する。

スケール変換群 正の実数の掛け算 x \mapsto axa > 0)。前章で見た比率尺度の許容変換群がまさにこれである。

作用・軌道・不変

群それ自体より、群が何かに作用するときのほうが大事である。

G が集合 X に作用するとは、各 g \in G に対して写像 x \mapsto g\cdot x が定まり、

e \cdot x = x, \qquad g \cdot (h \cdot x) = (g \ast h)\cdot x

を満たすことをいう。平行移動群が画像の集合に作用する、というのが典型例である。作用が定まると、集合が自然に分割される。x \in X に対し、

\mathcal{O}(x) = \{\, g\cdot x \;:\; g \in G \,\}

x軌道(orbit)と呼ぶ(第10章第4節で強化学習の試行の記録を「軌道」と呼んだが、あちらは trajectory で別物である)。「x を群で動かして到達できる点の全体」である。

軌道は本章を通じて重要な役割を果たす。「平行移動しても猫」という主張は、「猫の画像の軌道の上で、出力が一定である」という主張だからである。分類器に求めているのは、軌道を潰す写像なのだ。

一方で、軌道を潰しすぎてもいけない。位置を読み出したいなら、平行移動の情報は残さねばならない。何を潰し、何を残すか。これが次節以降の主題である。

ここがポイント

群とは操作のあつまり、軌道とは「群で動かして到達できる点の全体」。不変性とは軌道を潰すことであり、対称性を設計するとは「どの軌道を潰し、どれを残すか」を決めることである。


3. 必要な数学:表現

群は抽象的な操作のあつまりだが、われわれが扱うのはベクトルである。両者を橋渡しするのが表現である。

二つの回転を続けて行った結果は、それぞれの回転行列を掛けた結果と一致する。この「操作の合成が行列の積に対応する」ところが、表現の要点である。

第12章第3節で扱った準同型は、構造を保つ写像だった。群の演算を保つ写像を群準同型(群準同型写像)と呼ぶ。群 G の各操作 g に線形写像 \rho(g) を割り当てるとき、その条件は

\rho(g \ast h) = \rho(g)\,\rho(h)

である。左辺は「二つの操作を合成してから写す」、右辺は「それぞれを写してから合成する」。右辺の積は線形写像の合成であり、行列で書けば行列積である。

ベクトル空間 V の可逆線形写像の全体は、合成を演算として群をなす。これを GL(V) と書く(行列で言えば正則行列全体)。可逆とは、逆の写像で元に戻せることである。群 G線形表現とは、この群への群準同型写像

\rho: G \to GL(V)

のことである。Vd 次元の実ベクトル空間なら、基底を選べば \rho(g) \in \mathbb{R}^{d \times d} と書ける。行が変換後の成分、列が変換前の成分に対応する。

読み方を言葉にしておこう。表現とは、抽象的な群の操作を、具体的な行列として実現したものである。たとえば「角度 \theta だけ回転する」という操作に、次の 2\times2 の回転行列を割り当てる。

R(\theta) = \begin{pmatrix} \cos\theta & -\sin\theta \\ \sin\theta & \cos\theta \end{pmatrix}

この行列は平面のベクトルを角度 \theta だけ回転させ、R(\theta+\varphi)=R(\theta)R(\varphi) を満たすので、\mathrm{SO}(2) の表現になっている。同じ群にも表現はいくつもある。\mathrm{SO}(2) を例に取ろう。

  • 自明表現 \rho(\theta) = I_1 = (1)。ここでは1次元なので、単位行列も 1\times1 である。一般の d 次元では \rho(\theta)=I_d とすればよく、どの回転も恒等写像に対応する
  • 標準表現 \rho(\theta) = R(\theta)。平面の回転そのもの
  • k 次のフーリエ表現 \rho_k(\theta) = R(k\theta)k は正の整数で、元の回転角 \theta を何倍にして表すかを指定する。たとえば k = 2 なら、表現の側では角度 2\theta の回転になる。「k 倍の速さで回る」とは、元の角度の変化に対して表現側の角度が k 倍動くという意味である。フーリエ級数展開とのつながりも見ておこう。角度 \varphi の余弦と正弦を縦に並べたベクトル z(\varphi) = (\cos k\varphi,\ \sin k\varphi)^\top \in \mathbb{R}^2 を考えると、加法定理から z(\varphi + \theta) = R(k\theta)\, z(\varphi) となる。k は角度が一周するあいだの振動回数でもあり、この正弦・余弦の組に働く回転がフーリエ表現である

最後のものが、本書の文脈では面白い。方位選択性の細胞集団を考えてほしい。方位 \theta の刺激を与えたとき、好み方位が \theta_i の細胞が強く応じる。刺激を \Delta だけ回すと、応答パターン全体が \Delta だけ「ずれる」。好み方位を連続的に並べた理想化では、このずれを \mathrm{SO}(2) の表現として扱える。方位は180度で一周するので基本成分は k=2 だが、応答には k=4,6,\ldots の成分も含まれる。フォン・ミーゼス型のチューニング曲線 f_i(\theta) = A\exp\{\kappa[\cos(2(\theta-\theta_i))-1]\}A が最大発火率、\kappa がチューニングの鋭さ、\theta_i が細胞 i の好み方位)を思い出してほしい—第6章第5節と第11章第5節の「手を動かす」で使った、余弦の中の 2 がそれである。

既約表現

三次元の矢印を鉛直軸のまわりに回す場面を考えよう。水平成分は水平面の中で回り、鉛直成分は変わらない。両者は混ざらないので、水平面上の表現と鉛直軸上の表現に分けて考えられる。

一般に、表現が働くベクトル空間 V を二つの部分空間 V_1V_2 に分けて V = V_1 \oplus V_2 と書けることがある。\oplus直和を表し、どのベクトルも V_1 のベクトルと V_2 のベクトルの和に一意に分けられるという意味である。さらに、群のどの操作を施しても各部分空間のベクトルがその中にとどまるなら、\rho はそれぞれの成分の中で完結するので、二つに分けて考えればよい。群の操作で外へ出ない、より小さい部分空間(零だけの空間は除く)を持たない表現を、これ以上分解できない表現として既約表現(irreducible representation)と呼ぶ。

次の段落で使う言葉も補っておこう。有限群は要素が有限個の群である。コンパクト群は、ここで扱う実行列の群では、成分が全体として有界で、群の行列の収束先も群に含まれるものをいう(回転群がその例である)。連続表現とは、群の操作を連続的に変えると表現行列の成分も連続的に変わる表現である。

有限群では任意の有限次元表現が、コンパクト群では任意の有限次元の連続表現が、既約表現の直和に分解できる。\mathrm{SO}(2) の実既約表現は、自明表現と上に挙げたフーリエ表現 \rho_kk = 1, 2, \dots)で尽きており、一般の表現をこれらに分解することが、まさにフーリエ級数展開である。k=0 を上の式に入れると \rho_0 = R(0) = I_2 となるが、これは自明表現二つの直和=可約なので既約の列には入れない。なお複素係数で考えれば、既約表現は e^{ik\theta} という1次元のものが k \in \mathbb{Z} について並ぶ形になる—第4章でフーリエ基底を既約表現と呼んだのは、こちらの姿である。ここで回転と平行移動がつながる。信号を横にずらすと、各周波数の成分は、同じ周波数の余弦波と正弦波に掛かる係数を並べた平面の中で回転する—しかも回転角は周波数に比例する。だから信号の平行移動は、周波数ごとの回転として表せるのである。つまり、第4章で導入したフーリエ変換は、平行移動群の表現論だったのである。周波数成分とは既約表現のラベルであり、畳み込み定理は表現論の言葉で自然に説明される。本書では深入りしないが、頭の隅に置いておくと見通しがよくなる。


4. 不変・同変・共変の区別

前節では、群の操作をベクトル上の変換へ写す準同型 \rho を考えた。次は、その変換と入力から出力への写像 f の関係を考える。入力を変換したときに出力がどう変わるかを表す言葉が、不変・同変・共変である。

写像 f: X \to Y を考える。群 GX にも Y にも作用しているとしよう。XY がベクトル空間で作用が線形なら、それぞれの作用は前節の表現である。f 自体は線形とも群準同型とも限らない。X 上の作用を \rho_X(g)\, xY 上の作用を \rho_Y(g)\, y と書く。このとき、

f\big(\rho_X(g)\, x\big) = \rho_Y(g)\, f(x) \qquad (\forall g \in G, \forall x \in X)

が成り立つとき、fG に対して同変(equivariant)であるという。入力側の動かし方 \rho_X と出力側の動かし方 \rho_Y を別に書いたのは、入力と出力が違う空間のこともあるからだ(画像を入れて確率ベクトルを出す分類器では、「画像をずらす」という操作を出力側でそのまま実行することはできない)。この一本の式で、三つが尽きる。違いは出力側の \rho_Y が何かだけである。

\rho_Y(g) 呼び名 意味
どの g も恒等作用素へ送る(自明表現) 不変(invariant) f(\rho_X(g)x) = f(x) 入力を動かしても出力は変わらない
入力側と同じ作用が使える場合 共変(covariant) f(g\cdot x) = g \cdot f(x) 入力と同じように出力も動く
一般の作用 同変(equivariant) f(\rho_X(g)x) = \rho_Y(g) f(x) 出力も動くが、動き方は \rho_Y で決まる

不変と共変は同変の特別な場合である。用語としては、同変が上位概念だと覚えておけばよい。なお「共変」という呼び名は本書の約束である—第5節で出てくるテンソルの共変・反変とは別の話なので、混同しないでほしい。

三つの関係を一枚にまとめたのが 図 1 である。

図の四角形には名前がある。可換図式(commutative diagram)である。四隅を結ぶ二つの道すじ—「動かしてから写す」と「写してから動かす」—が同じ結果に着くとき、その四角形は可換であるという。同変性とは、この四角形が可換であることに他ならない。

この四角形を覚えておいてほしい。 いまは一つの系の内部の話である。f は入力空間から出力空間への写像で、群がその両側に作用していた。だが第17章第10節では、同じ四角形が「脳」と「AI」という二つの系のあいだで問われる。 写像の役を務めるのは、第15章第10節で見た翻訳器になる。

図 1: 不変・共変・同変の区別。上の可換図式は「入力を動かしてから写す」と「写してから出力を動かす」が一致することを表す。三つを分けているのは、出力側の動かし方 ρ(g) だけである。不変と共変は同変の特別な場合にあたる。

具体例で掴む

画像で考えよう。G は平行移動群である。

不変の例:画像分類器 猫の画像を右にずらしても、出力は「猫」のまま変わらない。f(g\cdot x) = f(x)

共変の例:セグメンテーション(領域分割) 猫の画像を右にずらしたら、猫に属する画素を示す出力のマスクも右にずれてほしい。f(g\cdot x) = g\cdot f(x)

同変の例:畳み込み層 入力をずらせば特徴マップもずれる。この部分だけを見れば共変にあたる。より一般に、回転群に対する同変ネットワークでは、入力を回すと出力の特徴が「表現 \rho に従って混ざる」。単純にずれるのではなく、成分どうしが混ざり合う—これが一般の同変である。

設計原理としての含意

ここから一つ、実用上の原則が出る。同変を積み重ね、最後に不変にする。

分類器がほしいなら最終出力は不変であるべきだ。だが最初から不変にしてしまうと、途中の層で位置情報が使えなくなる。「目と鼻と口が、この位置関係で並んでいるから顔だ」という判断ができなくなってしまう。だから中間層は同変(位置情報を保ったまま変換)にしておき、最後に不変化する。CNN が畳み込み層を重ねてから大域プーリングをするのは、まさにこの構造である。第4章で見た単純細胞(位相に依存する)から複雑細胞(位相に不変)への流れも、同じ形をしている。

ここがポイント

f(g\cdot x) = \rho(g)f(x) の一本で、不変(\rho(g)=\mathrm{id})・共変(\rho(g) が入力側と同じ作用)・同変(一般の \rho)が尽きる。設計の原則は「同変を積み、最後に不変化する」—情報を早く捨てすぎないためである。


5. 共変と反変 ── 添字の上下

前節では、入力を動かすと出力がどう動くかを考えた。ここでは、物を動かさずに物差しを取り替える。同じ矢印の成分と、その矢印から数を読み出す重みは、どう変わるだろうか。線形代数でいう共変・反変は、この変わり方を区別する言葉である。

物差しを伸ばすと、成分は縮む

長さ1の目盛りを持つ定規で測り、ある矢印の成分が6だったとしよう。定規だけを2倍に伸ばすと、同じ矢印の成分は3になる。基準を伸ばせば、成分は縮む。この逆向きの変化を反変(contravariant)と呼ぶ。

同じことを n 次元で書こう。実ベクトル空間 V の基底を並べた行列を E=(e_1,\ldots,e_n) とし、新しい基底を E'=EA と書く。A\in\mathbb{R}^{n\times n} は可逆行列で、その第 j 列が、新しい基底 e'_j を古い基底で表した係数である。ここでの A は第3節の最大発火率とは別物だ。

古い基底での成分の列を v、新しい基底での成分の列を v' とする。どちらも \mathbb{R}^n の元で、矢印そのものを表すのは EvE'v' である。同じ矢印だから、

\begin{aligned} E'v'&=Ev &&\textsf{(矢印は変わらない)}\\ EAv'&=Ev &&\textsf{(新しい基底を代入)}\\ Av'&=v &&\textsf{(基底は一次独立)}\\ v'&=A^{-1}v &&\textsf{(逆行列を掛ける)} \end{aligned}

定規の例なら A=2 なので v'=6/2=3。逆行列という名前の中身は、この割り算だったのである。

読み出しの重みは、逆を埋め合わせる

ベクトルから一つの実数を取り出し、足し算と定数倍を保つ操作を線形汎関数という。たとえば横方向の成分だけを読み出す操作である。ベクトルの住む空間が V なら、この操作の集まりが双対空間 V^* だ。矢印と、矢印を測る操作は、違う種類のものである。

読み出しの重みを行ベクトル \omega\in\mathbb{R}^{1\times n} とすれば、出力は \omega v である。基底を取り替えても出力を変えないには、新しい重みを \omega'=\omega A とすればよい。

\omega'v'=(\omega A)(A^{-1}v)=\omega v

AA^{-1} が打ち消し合った。定規を2倍にしたら、成分は半分、重みは2倍で、読み出す数は変わらない。重みが基底と同じ向きに変わる性質を共変(covariant)と呼ぶ。重みを列に並べる約束なら、変換は左から A^\top を掛ける形になる。

慣習では反変な成分を v^i、共変な成分を \omega_i と書く。上付きの i は累乗ではなく成分の番号である。添字の上下は、この変わり方の違いを示す標識なのだ。

内積が、矢印と読み出しを結ぶ

どちらも n 個の数で書けるのに、なぜ区別するのだろうか。数の組が同じ形をしていても、何をするものかは同じでないからである。ただし V に内積を決めると、両者を一対一に対応させられる。矢印 a\in V を固定し、入力 u\in V から \langle a,u\rangle を返す読み出しを作ればよい。どの読み出しがどの矢印に対応するかは、内積の選び方に依存する。

長さや角度を測るこの規則が計量である。基底間の内積を並べた行列 M(第 i 行・第 j 列が \langle e_i,e_j\rangle)を使うと、成分 v の矢印の長さの二乗は v^\top Mv になる。成分の二乗和だけでは、物差しを2倍にした途端に36が9になってしまう。M が物差しの長さと向きを勘定に入れるのである。互いに直交する長さ1の基底なら M は単位行列で、ふだんの二乗和に戻る。

第11章第4節の式を見直そう。

\|f(s+\delta)-f(s)\|^2\approx\delta^\top(J^\top J)\delta

\delta は刺激の微小な変化、J は刺激の変化を応答の変化へ写すヤコビアンである。まず J\delta で応答の変化を求め、その長さを測ると (J\delta)^\top(J\delta)、つまり右辺になる。J^\top J が、刺激の変化を応答の長さへ換算する M の役をしていたわけだ。第11章で断ったとおり、計量と呼ぶには J の列が一次独立で、正定値になることを仮定する。

ノイズの方向ごとの大きさまで勘定に入れたのが、第11章第5節のフィッシャー情報行列 J^\top\Sigma^{-1}J だった。ノイズ共分散 \Sigma が正定値で、J の列が一次独立なら、これも計量になる。

添字を上げ下げする計算と、斜めの基底で数値がどう変わるかは、発展編C.1 添字と計量にまとめた。ここでは、矢印と読み出しは別のもので、内積を決めて初めて両者が結ばれることを持ち帰ってほしい。第18章第1節で、この区別が効いてくる。

座標変換としての神経科学

この話は、脳の側にも直接の対応物を持つ。視覚系は網膜座標で情報を受け取る。だが手を伸ばすには、身体座標での位置が必要である。あいだには頭部座標がある。網膜座標 → 頭部座標 → 身体座標という座標変換の連鎖を、脳は実行している。

眼球が回転したとき、網膜上の像の座標は変わる。だが物体の身体座標での位置は変わらない。「座標は変わるが、指しているものは変わらない」—これはまさに本節で扱った構造である。頭頂葉では、同じ網膜上の位置に同じ刺激を出しても、眼球の向きによって細胞の応答の大きさが変わることが知られている。この性質をゲインフィールド(gain field)と呼び、これは座標変換を実装する回路の候補と考えられている。

ここがポイント

基底を A で変えたとき、成分が A^{-1} で変わるのが反変(添字は上)、成分を行に並べて右から A が掛かるのが共変(添字は下)である。共変な成分を列に並べるなら、左から A^\top が掛かる。計量が両者を行き来させる。第11章の J^\top J が「計量」だったのは、まさにこの意味においてである。

なお、この語にはもう一つの用法がある。第17章第8節で扱う「反変原理」の反変は、群作用でもテンソルでもなく、課題と機構の対応についての言葉である。同じ語が三通りに使われるので、そのつど何の話かを確かめてほしい。


6. 準同型と構造の保存

第3節で群準同型 \rho(g\ast h) = \rho(g)\rho(h) を定義した。この形を、もう一度よく見てほしい。

f(a \ast b) = f(a) \ast f(b)

前章第3節で、まったく同じ形を見ている。

\phi(a \circ b) = \phi(a) + \phi(b)

測定における準同型である。棒を継ぎ足してから長さを測るのと、それぞれ測ってから足すのとが一致する—それが測定が成立する条件だった。そして群準同型は、群の演算をしてから写すのと、写してから演算するのが一致することを要求する。同じ発想である。

だが同じではない。第12章第3節が「この差が効いてくる」と予告していたのは、ここである。測定の準同型は \iff で書かれていた—数の順序から元の順序が読み取れることまで要求していた。だから測定の \phi は、順序の情報を落とさない。同じ長さの二本の棒が同じ数に写るのは構わない—その二本は \succsim では区別がつかないからである。無差別なものを同一視したうえでは、\phi は単射になる。いっぽう群準同型が要求するのは片側だけである。\rho(g) = \rho(h) でも g \ne h でありうる。つまり群準同型は潰せる。この違いは、次項の核が自明かどうかという形で現れる。そして本書では、この「潰せる準同型」のほうが繰り返し顔を出す。第17章第2節の良い調節器定理で「脳が持つのは世界の同型ではなく準同型である」と言うとき、また第18章第4節でミリカンが表象の働き方として準同型を挙げるとき、効いているのは情報を落としてよいというこちら側の緩さである。

「構造を保つ写像」という概念は、数学のあちこちで同じ形をしている。線形写像 f(\alpha x + \beta y) = \alpha f(x) + \beta f(y) もそうだ。対象が変わるだけで、要求していることは一つ—演算と写像が可換であること。

第一準同型定理

群準同型 f: G \to H に対して、二つの部分集合が定まる。写すと「何もしない操作」になってしまう元と、写した先で実際に届く元とを、それぞれ集めるのである(以下の e_H は行き先の群の単位元である)。

\ker f = \{\, g \in G \;:\; f(g) = e_H \,\}, \qquad \mathrm{Im}\, f = \{\, f(g) \;:\; g \in G \,\}

(kernel)と(image)である。核は「写したら単位元になってしまう元の集まり」、つまり f が潰してしまう部分。像は「行き先として実際に到達される部分」である。

第一準同型定理は、この二つを結びつける。写した先で区別できない操作を元の群でひとまとめにすると、行き先に残る構造と一対一に対応させられる—しかもこの対応は、操作を続けて行うという演算まで保つ、という主張である。

G/\ker f \;\cong\; \mathrm{Im}\, f

左辺の G/\ker f商群という。作り方はこうである。たとえば第3節の「角度を二倍にする表現」では、何もしない回転も180度の回転も、表現の側では恒等変換になる。元の回転を180度だけ変えても、写した先では区別できない。このように、同じ行き先を持つ操作を一つのまとまりにするのである。

このまとまりどうしにも演算を入れられるので「群」と呼べる。その作り方は、発展編C.2 商群の作り方で確かめよう。ここでは、写した先で区別できないものをまとめると、残った構造が像と一致する、という定理の意味を押さえてほしい。

表現学習の言葉に翻訳する

この定理には、本書の文脈で読むと味わい深い解釈がある。ただし先に一言。定理が言葉どおりに使えるのは f が群から群への準同型であるときで、画像から特徴を取り出す写像は一般にそうではない(画像の集合に群の演算を入れていない)。以下は定理そのものの適用ではなく、そこから借りた見方である。そのつもりで読んでほしい。核は「捨てた情報」、像は「保った構造」である。

表現学習とは何をしているのか。入力の中には、課題にとってどうでもいい変動がたくさんある。照明の色、カメラの位置、背景のノイズ。それらは捨てたい。一方で、対象の同一性やカテゴリの区別は保ちたい。

\underbrace{G/\ker f}_{\textsf{捨てた後に残るもの}} \;\cong\; \underbrace{\mathrm{Im}\,f}_{\textsf{表現として現れるもの}}

表現とは、核で割った商である。何を捨てたか(核)を決めれば、何が表現されるか(像)が決まる。逆向きは同じようにはいかない—像の形だけからは、元のどこが潰れたかまでは決まらない。

この見方は、第11章第4節で扱ったヤコビアンの階数の話とも響き合う。J の階数が刺激の次元より小さいとき、J の核にあたる方向の刺激変化は表現に現れない。階数落ちとは、核が非自明だということである。そして前章第10節で「デコーディングは何を測っているか」を論じたとき、読み出し部分空間とヤコビアンの像の関係が問題になった。あれも像の話だった。


7. 畳み込みは平行移動同変性から導かれる

第4章から引いてきた畳み込みの伏線を、ここで回収する。

まず、使う言葉をそろえておこう。整数の位置ごとに実数が並ぶものを離散信号といい、その型は x: \mathbb{Z} \to \mathbb{R}、位置 n での値を x[n] と書く(角括弧は、整数の位置を指定するときの記法である)。ゼロでない値を取る位置が有限個しかないことを有限台という。線形作用素 T とは、信号を受け取って信号を返し、足し算と定数倍を保つ写像である(Tx が出力の信号全体、(Tx)[n] がその位置 n での値。行を出力位置、列を入力位置とする行列に見立てられるが、位置が整数全体にわたるので有限の行列ではない)。そして T が平行移動 S_a可換であるとは、任意の a と任意の x について T(S_a x) = S_a(Tx) が成り立つこと、つまり「ずらしてから処理する」と「処理してからずらす」が一致することをいう。最後に、下の式に出てくる k も信号である(型は k: \mathbb{Z} \to \mathbb{R})。ただしデータではなく重みを並べたものであり、k[n-m] は、入力の位置 m にある値を、出力の位置 n にどれだけの重みで足し込むかを表す。重みが二つの位置の差 n-m だけで決まる、というところがこの式の言っていることである。この k も、第3節のフーリエ表現の次数 k とは別物である。

定理

\mathbb{Z} 上の有限台の関数の空間を定義域とする線形作用素 T が、すべての平行移動 S_a と可換であるとき、T は畳み込みである。すなわち、ある k がただ一つ存在して

(Tx)[n] = \sum_{m} k[n-m]\, x[m]

と書ける。和は入力の位置 m の全体、つまり整数全体にわたる。x が有限台なので、実際に足される項は有限個である。

言い換えよう。「線形」と「平行移動同変」の二つだけを要求すると、畳み込み以外の選択肢がなくなる。便利な道具として使ってきた畳み込みが、この二つの条件から導けるのである。

証明

一次元の離散信号で示す。記号を用意しよう。

信号を一つ右にずらすと、元の位置 0 の値が新しい位置 1 に移る。つまり、移動後の位置 n の値を求めるには、元の位置 n-1 の値を読めばよい。一般に、平行移動作用素 S_a(S_a x)[n] = x[n - a] で定める(信号を a だけ右にずらす。a が負なら左へずれる)。次に、位置 0 にだけ高さ 1 を持つ信号を用意する。これが単位インパルス \delta で、\delta[0] = 1、それ以外は 0 で定める。

仮定は二つ。T は線形であり、T S_a = S_a T(平行移動と可換)である。

第一歩

ある位置にだけ値を持つ信号なら、単位インパルスをその位置までずらし、高さをその値に合わせれば作れる。値を持つ位置が複数あれば、それぞれに対応する信号を足せばよい。この足し合わせが「インパルスの重ね合わせ」である。なおこの \delta は、第5節で刺激の微小変化に使った \delta とは別物である。これを使って、任意の信号をインパルスの重ね合わせで書く。

x[n] = \sum_m x[m]\, \delta[n-m] = \sum_m x[m]\, (S_m \delta)[n]

これは定義を書き下しただけである。m 番目の項は「位置 m に高さ x[m] のインパルスを置いたもの」で、それを全部足せば元の信号になる。位置 n を一つ固定して和を見てほしい。\delta[n-m]m = n の項でだけ 1、ほかの項では 0 だから、残るのは x[n] だけである。

第二歩

T を作用させ、線形性で和の外に出す。(有限台としたのはここで効く。無限に広がる信号まで許すなら、無限和を外に出すために T の連続性を仮定する必要がある。)

\begin{aligned} Tx &= T\Big(\sum_m x[m]\, S_m \delta\Big) \\ &= \sum_m x[m] \; T(S_m \delta) &&\textsf{(線形性。} x[m] \textsf{ は係数なので外へ)} \end{aligned}

第三歩

ここで平行移動同変性を使う。T S_m = S_m T だから、

T(S_m \delta) = S_m (T\delta)

T\delta に何をするかさえ分かれば、他のすべてが決まることに注目してほしい。k = T\delta と置こう。これを Tインパルス応答と呼ぶ。

第四歩

代入して整理する。

\begin{aligned} (Tx)[n] &= \sum_m x[m]\, (S_m k)[n] &&\textsf{(第三歩を代入)}\\ &= \sum_m x[m]\, k[n-m] &&\textsf{(} S_m \textsf{ の定義)} \end{aligned}

これは畳み込みの定義そのものである。証明終わり。

何が起きたのか

逆向きも言っておこう。畳み込みは必ず線形であり(和と定数倍が \sum_m k[n-m]x[m] の中を素通りする)、平行移動とも可換である(n-m という差は、xn を同じだけずらしても変わらない)。二行で済む。だが、これで両方向が言えたことになる。

四段階で終わってしまったが、内容は重い。振り返っておこう。

決定的だったのは第三歩である。平行移動同変性のおかげで、T を知るのに必要な情報が、たった一つの信号(インパルス)への応答に還元された。無限にある入力それぞれに対して振る舞いを指定する必要がない。一点での応答が、平行移動によって全体に「複製」される。そして—これがまさに、CNN の重み共有である。

第8章で畳み込み層を導入したとき、「全結合層と違って、同じ重みを画像の各位置で使い回す」と説明した。パラメータが減って効率がよい、という話をした。対称性の側から見れば、線形層に平行移動同変性を要求すると、重みは共有せざるをえない。位置ごとに違う重みを持つことは、平行移動と可換でないことを意味する。

第4章でガボールフィルタを畳み込みとして書いたときも、同じ形のフィルタを位置をずらして配置するモデルを使っていた。このモデルでは、線形性と平行移動同変性を仮定している。実際の受容野には位置による違いもあるが、その違いを捨象したモデルに畳み込みが現れる理由を、この定理で説明できる。

ここがポイント

ここで扱った離散信号では、線形性と平行移動同変性を満たす作用素は畳み込みであり、逆に畳み込みはこの二つを満たす。対称性から決まるのは畳み込みという形式であり、個々の重みはまだ自由に選べる。CNN の重み共有や、同じ受容野を位置をずらして配置するモデルを、この共通の性質から理解できる。

ヒント手を動かす

上の証明を、有限長の信号(周期境界条件、\mathbb{Z}/N\mathbb{Z} 上)で書き直してみよう。N は信号の長さである。周期境界条件とは、右端の次を左端につなぐ約束のことで、位置が N の倍数だけ違えば同じ位置とみなす。この同一視をした位置の集合を \mathbb{Z}/N\mathbb{Z} と書く。整数全体に伸びた信号ではなく、N 個の成分を持つベクトル x \in \mathbb{R}^{N} を扱うことになる。コードは コード/13_circulant.py にある。

N=8 とし、巡回シフト行列 S と可換な行列 T の自由度を数える。TS = STT の成分についての線形方程式なので、その解空間の次元を測ればよい。

N = 8
S = np.roll(np.eye(N), 1, axis=0)     # 巡回シフト行列

def commutant_dim(S):
    """TS = ST を満たす T の空間の次元。"""
    A = (np.kron(S.T, np.eye(N))      # 列優先の vec で
         - np.kron(np.eye(N), S))     # vec(TS-ST) = A vec(T)
    return N*N - np.linalg.matrix_rank(A, tol=1e-9)

# 可換な T を作ってみると、巡回行列になっている
k = rng.standard_normal(N)
T = np.array([[k[(i-j) % N] for j in range(N)]
              for i in range(N)])
print(np.abs(T @ S - S @ T).max())    # ほぼゼロ

# フーリエ基底へ移すと対角化される(畳み込み定理)
F = np.array([[np.exp(-2j*np.pi*i*j/N)
               for j in range(N)]
              for i in range(N)])/np.sqrt(N)
D = F @ T @ F.conj().T
print(np.abs(D - np.diag(np.diag(D))).max())

commutant_dim は証明を線形代数の問題に翻訳している—TS = STT の成分についての連立一次方程式と見て、その零空間の次元を測る。

自由度
任意の 8\times8 行列 64
S と可換な行列 8

N^2 から N へ落ちている。制約は対称性から来ており、残った N 個の自由度がインパルス応答 k に他ならない。実際、k から作った巡回行列 T_{ij} = k_{(i-j) \bmod N}TS - ST = 0 を厳密に満たし、Txkx の巡回畳み込みに一致する(差は 4\times10^{-16}、丸め誤差の範囲である)。

そして最後の問い。S の固有値は N 個の 1 の冪根で、すべて相異なる。このとき TS と可換なら、S の固有ベクトルは T の固有ベクトルでもある(固有値が重なっていると、これは言えない)。S の固有ベクトルは何だろうか。答えは離散フーリエ基底である。実際、フーリエ基底で T を書き直すと非対角成分が 2\times10^{-15} 程度となり、丸め誤差の範囲で対角行列になる。これが畳み込み定理である。「畳み込みはフーリエ領域で積になる」という第4章第2節の定理が、対称性の側から出てきた。


8. 群畳み込みと同変ネットワーク

平行移動でうまくいったなら、他の群でも同じことができるのではないか。できる。Cohen と Welling (2016) の群同変畳み込みネットワーク(G-CNN)である。

群畳み込み

平行移動の畳み込みは \sum_m k[n-m]x[m] だった。入力位置 m と出力位置 n の差に応じて重みを決めていたのである。平行移動群では演算が足し算、逆元が符号の反転だから、n - m という差は、平行移動群における h^{-1} \ast g にあたる(h が入力位置 mg が出力位置 n の役割を担う)。ならば一般の群 G に対して、入力を x: G \to \mathbb{R}、重みを k: G \to \mathbb{R}(どちらも群の要素一つにつき実数一つを割り当てる関数)として、こう定義すればよい。

(k \star x)(g) = \sum_{h \in G} k(h^{-1} \ast g)\, x(h)

これが群畳み込みである。\star は関数どうしの畳み込みで、群の要素を組み合わせる \ast とは別の演算だ。出力を読む要素 g を固定し、入力側の要素 h 全体について和を取る。出力もまた G の上の関数になる。G が平行移動群なら通常の畳み込みに戻る。G が連続群のときは、和を群の不変測度による積分に置き換える。不変測度とは、各領域に割り当てる大きさが、群の作用で領域を移しても変わらない測り方のことである(平行移動なら、区間をずらしても長さが変わらないことに当たる)。

この群畳み込みでは、入力の位置 h を一斉に u\ast h へ移すと、出力も同じように移る。ここで u は、入力全体に施す一つの群の操作である。これがこの規約での G 同変性である。離散群で、入力を有限台(あるいは群が有限)とすれば、逆に「線形かつこの作用に同変な作用素は群畳み込みである」ことも、前節と同じ筋で示せる。

実装上の要点

回転同変な CNN を作りたいとしよう。G を「平行移動 + 90度単位の回転」の群(\mathrm{p4} 群)とする。

第一層

入力は画像(平行移動群の上の関数)だが、出力は G の上の関数になる。この G の要素は g = ((u,v), r) と書ける。(u,v) は第2節と同じ横・縦の移動量で、r \in \{0,1,2,3\} が90度の回転を何回行うかである。「G の上の関数」とは、位置と回転の組ごとに一つの値を持つもののことだ。実装としては、フィルタを4通りに回転させたものをそれぞれ畳み込み、4枚の特徴マップを得る。出力の縦横の大きさを HW、元のフィルタを一つとすれば、出力は Y \in \mathbb{R}^{H \times W \times 4} という三本の添字を持つ配列になる。第一の添字が縦位置、第二が横位置、第三が回転の種類で、Y[i,j,r] がその位置・その回転に対する応答である。

第二層以降

入力も出力も G の上の関数である。上の群畳み込みの式をそのまま実装する。回転成分どうしが混ざり合う—これが第4節で言った「一般の同変」の具体例である。

最後

回転成分について最大値を取る(あるいは平均する)と、回転成分が消えて平面上の特徴マップに戻る。ただし、これだけでは回転不変になっていないことに注意してほしい—入力を回すと、出力は値が位置ごとに回る。空間方向にも大域的なプーリングをして、群全体の軌道にわたって集約したところで、はじめて回転不変な出力になる。

この最後の操作を見て、既視感を覚えてほしい。第4章の複雑細胞である。単純細胞は位相に依存する応答をし、複雑細胞はそれらの二乗和を取って位相不変になった。あれは「位相のずらし」という群に対して、軌道上で足し合わせる操作だった。群同変ネットワークのプーリングと、まったく同じ構造である。

得られるもの

G-CNN の利点は、第1節で述べた通りである。回転したデータで水増し(data augmentation)しなくても回転に強い。しかも「だいたい強い」ではなく、構造として厳密に同変である。

限界も述べておく。扱える群は、あらかじめ決めておかねばならない(この制約は第10節で改めて扱う)。そして現実の画像には厳密な対称性はない(照明があるから、上下反転した顔は不自然に見える)。近似的な対称性をどう扱うかは、いまも研究課題である。


9. 幾何学的深層学習という統一

ここまでの話を、もっと大きな枠組みに置き直そう。Bronstein、Bruna、Cohen、Veličković (2021) は、深層学習のアーキテクチャを「どんな対称性を仮定しているか」で整理することを提案した。この見方は Erlangen プログラムになぞらえられている。

Erlangen プログラムとは

1872年、Felix Klein は幾何学の分類について画期的な提案をした。当時、ユークリッド幾何・射影幾何・アフィン幾何・双曲幾何などが乱立していた。Klein の主張はこうである—それぞれの幾何学は、「どの変換群のもとで不変な性質を研究するか」で特徴づけられる。

ユークリッド幾何は合同変換群(回転・平行移動・鏡映)のもとで不変な性質を扱う。だから長さや角度が意味を持つ。射影幾何はより大きな射影変換群を許すので、長さも角度も意味を失い、代わりに、複数の点が同じ直線上にあるという共線性や、一直線上の四点の位置から作る二つの比の比である複比が残る。

群を指定すれば幾何学が決まる。これが Erlangen プログラムである。

深層学習への翻案

Bronstein らの主張は、深層学習のアーキテクチャにも同じ整理が効くというものである。

アーキテクチャ 定義域 対称性の群
CNN 格子 平行移動群
GNN グラフ ノードの置換群 S_n
Transformer 集合 置換群(位置符号化で一部破る)
RNN 系列 時間方向の平行移動
球面 CNN 球面 回転群 \mathrm{SO}(3)
同変メッシュネット 多様体 ゲージ変換

最後の行だけ補っておこう。メッシュとは、曲面を小さな三角形などに分けて表したものである。曲面上の各点で接平面(第11章第4節の接空間の、二次元の場合である)の基準となる二方向を選べば、その点の矢印を二つの成分で書ける。基準方向を取り替えると、同じ矢印でも成分は変わる—たとえば二方向をどちらも反転させれば、成分 (1,0)(-1,0) になる。このように、各点で基準の選び方を取り替える操作がゲージ変換である。曲面そのものを動かす操作ではない、というところが回転や平行移動と違う。同変メッシュネットが要求するのは、この取り替えに合わせて出力の成分も変わり、同じ幾何学的な量を指し続けることである。

こう並べると、これらが別々の発明ではないことが見えてくる。すべて「定義域とその対称性を指定し、同変な層を積み、最後に不変化する」という同じレシピの実装である。

そして本書の文脈で強調したいのは、この枠組みの副産物のほうである。この見方は、新しいアーキテクチャを設計する手順を与える。データがどんな空間に住み、どんな対称性を持つかが分かれば、そこから同変な層を構成できる。分子(三次元の回転と平行移動を合わせた群 \mathrm{SE}(3) の対称性)、タンパク質、物理シミュレーション—近年の応用の多くが、この筋道で作られている。

脳への含意

脳の側にも、この見方を持ち込めるだろうか。

視覚系については、対応がかなり明瞭である。網膜上の近い位置が皮質でも近い位置に対応する網膜部位対応(retinotopy)は「格子」という定義域を、受容野の位置不変性は平行移動群を与える。第4章から本章まで辿ってきたのは、まさにこの構造だった。

嗅覚系はどうか。匂い分子の空間には格子構造も自然な対称性もない。だから、鼻の受容細胞から匂いの信号を最初に受け取る脳の部位である嗅球の地図は視覚野のような整然とした構造を持たない—と考えるのは魅力的な仮説だが、確かめられてはいない。

海馬の場所細胞と、内側嗅内皮質のグリッド細胞はどうか。第10章第7節で見たように、場所細胞はある場所で強く発火し、グリッド細胞は六角格子状に並ぶ複数の場所で発火する。内側嗅内皮質は、海馬と情報をやり取りする嗅内皮質の内側の領域である。グリッド細胞の周期的な位置表現は、トーラスの話につながる。同じ格子間隔と向きを持つ細胞集団を考え、格子の二方向それぞれについて一周期進むと元に戻る位相を使えば、二つの円の組、すなわちトーラスで位置を表せる。Gardner ら (2022) は、格子間隔と向きがそろった集団、すなわち同じモジュールに属するグリッド細胞の集団活動が、トーラス状の多様体上にあることを示した。ここでいうトーラスは動物が歩く空間の形ではなく、細胞集団の活動が作る空間の形である。この周期性は対称性と結びつくが、それだけで、なぜ発火場所が六角格子を作るのかまで説明できるわけではない。


10. 構成性

対称性の話の締めくくりとして、構成性(compositionality)に触れておきたい。同変性と近い場所にあり、しばしば混同されるが、別の概念である。

定義と例

構成性とは、全体の意味が、部分の意味とその組み合わせ方で決まるという性質である。言語学では Frege の原理として知られる。「赤い車」の意味は「赤い」と「車」から決まる。だから「緑の飛行機」を一度も聞いたことがなくても理解できる。

視覚でも同じことが言える。物体は形・色・材質・位置・大きさといった属性の組み合わせで記述できる。「紫色のキリン」を見たことがなくても認識できるのは、色と形が独立に処理され、組み合わされているからだ、という説明になる。

同変性との関係

構成性と同変性は、どうつながるか。

属性ごとに独立な群作用がある状況を考えよう。色を変える操作の群 G_{\text{color}}、位置を変える群 G_{\text{pos}} があり、表現がそれぞれに対して同変だとする。

ここで一歩、慎重に進みたい。同変であることだけからは、表現空間が「色の部分」と「位置の部分」に分かれるとは言えない。数を入れて見よう。色の特徴を c = (1,2)^\top \in \mathbb{R}^2、位置の特徴を p = (3,4)^\top \in \mathbb{R}^2 とする。別々に並べれば (1,2,3,4)^\top で、前半が色、後半が位置である。ところが成分どうしの積を並べることもできて、そのときは (1\cdot3,\ 1\cdot4,\ 2\cdot3,\ 2\cdot4)^\top = (3,4,6,8)^\top になる。これを c \otimes p と書き、テンソル積と呼ぶ。どの成分にも色と位置の両方が入っているので、「ここが色の部分」と切り出すことができない。いっぽう積の群とは、色を変える操作と位置を変える操作を一組にして、それぞれを別々に合成する群である。積の群の表現は、二つの表現のテンソル積にもなりうる—色と位置が座標の上で絡み合ったまま、それでも同変であるような表現が存在する。分かれてくれるのは、表現と読み出しが属性ごとに因子化されるように設計されている(あるいはそう学習された)ときである。

その条件が満たされているなら、色を変えても位置の成分は動かない。だから訓練で見たことのない色と位置の組み合わせに対しても、成分の組み合わせとして表現が作れる。これが構成的汎化(compositional generalization)である。つまり—同変な構造は構成的な汎化を支える条件の一つだが、それだけで十分ではない。対称性に加えて「どう因子化されているか」が要る。

構成性がないと何が起きるか ── 出力次元崩壊

構成性の効き目は、それが失われた場合を見ると分かりやすい。脳活動からの画像再構成(第15章第10節)で、この失敗が具体的な形で観察されている。

脳活動から画像特徴へ写す線形の翻訳器を、限られた数の脳画像ペアで学習させるとしよう。このとき翻訳器が出力できる方向は、訓練刺激が特徴空間の中でどれだけ広がっているかで決まってしまう。Shirakawa ら (2025) の出力次元崩壊(output dimension collapse)である(詳しくは第15章第10節)。

崩壊が起きると何が困るか。その刺激に必要な方向を訓練集合が張っていなければ、その方向は出せない。 出力は訓練で見た側へ引き寄せられ、それらしい絵は出るが、再構成ではなく分類に近いものになる。第9章の内挿と外挿の区別が、ここでは出力側で問題になっている。

構成性は、この崩壊への処方箋になる。 属性が独立な成分として表現されていれば、訓練で見た組み合わせが少なくても、成分の組み合わせとして新しい出力を作れる。N 個の属性がそれぞれ独立なら、覆える組み合わせは積で増える—訓練データを指数的に増やさなくてよい。多様な出力を組み合わせで表現できることが、ゼロショットの再構成を可能にしうる。

Otsuka、Nagano と Kamitani (2026) は、この状況を数学的に詰めている(第15章第10節)。脳から特徴への写像がスパースであれば、変数選択がデータの少ない領域で効くというのが結論である。

表現の作り方が、汎化の届く範囲を決めている。 これは本章が対称性の側から述べてきたことの、実務側からの裏書きである。

そして留保

だが、ここで慎重になっておきたい。第9章第8節で扱った Direct Fit to Nature の主張を思い出してほしい。Hasson らは、脳もネットワークも「簡潔な規則を発見している」のではなく「高次元の密なサンプリングの上で内挿している」のだと論じた。もしそれが正しいなら、「構成的に汎化している」ように見える現象の多くは、実は訓練分布が十分に広かっただけかもしれない。

構成的汎化と、密な被覆による内挿。この二つを実験的に切り分けるのは、見かけよりずっと難しい。「訓練で見ていない組み合わせ」だと思っていたものが、実は表現空間の中では訓練データに囲まれていた—ということが起こりうるからだ。

そして本章の枠組み自体にも限界がある。対称性を設計者が指定しなければならない。世界のどんな変換が「意味を変えない」のかを、あらかじめ知っている必要がある。だが脳は、それを教わらずに獲得したはずである。対称性そのものを学習するという問題は、まだ十分に解かれていない。この留保は、次章以降への橋にもなる。第17章では「脳とAIの表現は収束するのか」という問いを扱うが、そこで問題になるのも同じ構造である—何が保たれているかを言うには、何を許すかを先に決めねばならない。第12章の測定理論と本章の対称性は、その一点で通じている。

そしてもう一つ、遠い橋がかかっている。 構成性は、いまは「訓練で見ていない組み合わせに届く」という汎化の話として書いた。だが第18章第8節では、これが「一つの表現を多くの受け手が別々に使えるようにする仕掛け」として読み直される。属性が分かれていれば、色だけを使う受け手も、形だけを使う受け手も作れるからだ。設計の話が、表象とは何かという問いに接続する。

ノートコラム:方位選択性コラムと網膜部位対応

本文で扱った群作用は、視覚皮質の解剖学的な構造にかなり素直な対応物を持つ。

網膜部位対応(retinotopy)。V1 の表面は、網膜上の位置と系統的に対応している。隣り合う網膜の位置は皮質でも隣り合う。つまり V1 は視野の「地図」を持っている—本文で「定義域は格子である」と言ったことの解剖学的な実体がこれである。ただし均一な地図ではなく、中心視野に対応する領域が不釣り合いに大きい(皮質拡大, cortical magnification)。

方位選択性コラム

V1 の細胞は特定の方位の線分によく応答する。そして皮質表面に沿って電極を進めると、好みの方位が滑らかに回転していく。表面を垂直に貫く方向(コラム)では方位が揃う。光学的イメージングで表面を見ると、方位が風車状に配置された構造(pinwheel)が見える—\mathrm{SO}(2) の作用が皮質表面に埋め込まれているように見える。

眼優位性コラム

左眼由来の入力と右眼由来の入力が縞状に交替する。方位マップと眼優位性マップは、互いにほぼ直交するように配置されている。限られた二次元の表面に複数の特徴次元を詰め込むための、効率的な配置と考えられている。

分かっていないこと

これらの地図が何のためにあるのかは決着していない。有力な説は「配線長の最小化」—似た特徴を扱う細胞を近くに置けば、結合に必要な軸索の総延長が短くなる—だが、定量的にどこまで成り立つかは議論が続いている。本文の主題により関わる留保もある。齧歯類の V1 には方位マップがない。マウスの V1 の細胞も方位選択性を持つが、皮質上の配置はランダムに見える(salt-and-pepper 構造)。機能は保たれているのに空間配置だけが違うのだから、「皮質表面での幾何学的配置」は計算にとって本質的でないかもしれない。本文で群作用と皮質構造を対応づけたが、その対応がどこまで計算論的な意味を持つのかは開かれた問いである。

出典 Hubel & Wiesel (1962, 1968)、Bonhoeffer & Grinvald (1991)、Ohki et al. (2005)。

確認問題

  1. [確認]f(g\cdot x) = \rho(g) f(x) において、不変・共変・同変がそれぞれ \rho の何に対応するかを述べよ。(第4節)

  2. [考える]「中間層は同変にして、最後に不変化する」という設計原則の理由を説明せよ。最初から不変にすると何が失われるか。(第4節)

  3. [導出]基底を並べた行列を E から E'=EA に取り替えたとき、成分が v'=A^{-1}v で変換されることを、同じ矢印を表す条件から導出せよ。(第5節)

  4. [確認]第11章の J^\top J が「計量」と呼べる理由を、刺激の変化 \delta と応答の変化 J\delta の関係から説明せよ。J に必要な条件も述べよ。(第5節・第11章第4節)

  5. [確認]第一準同型定理 G/\ker f \cong \mathrm{Im}\, f を、表現学習の文脈で解釈せよ。核と像はそれぞれ何にあたるか。(第6節)

  6. [導出]「線形かつ平行移動同変な作用素は畳み込みである」ことを、本文の四段階の証明を自分で再現して示せ。また逆に、畳み込みが線形かつ平行移動同変であることを示せ。(第7節)

  7. [考える]CNN の重み共有を、線形性と平行移動同変性の帰結として説明せよ。パラメータ数を減らすという利点の説明とは、何が違うか。(第7節・第8章第7節)

  8. [考える]同変性が構成的汎化を支えるという主張を説明せよ。またその主張に対して、第9章の Direct Fit の議論からどんな留保が付くか。(第10節・第9章第8節)


参考文献

  • Gardner, R. J., et al. (2022). Toroidal topology of population activity in grid cells. Nature, 602, 123–128. https://doi.org/10.1038/s41586-021-04268-7 — グリッド細胞集団のトーラス構造[9節]

  • 岡野原大輔(2023)『拡散モデル:データ生成技術の数理』岩波書店. — 日本語で読める最良の入口。本章の内容をより詳しく

  • Cohen, T. S., & Welling, M. (2016). Group equivariant convolutional networks. arXiv:1602.07576. https://doi.org/10.48550/arxiv.1602.07576 — G-CNN の原典[8節]

  • Bronstein, M. M., Bruna, J., Cohen, T., & Veličković, P. (2021). Geometric deep learning: grids, groups, graphs, geodesics, and gauges. arXiv:2104.13478. https://doi.org/10.48550/arxiv.2104.13478 — 幾何学的深層学習の綱領[9節]

  • Bonhoeffer, T., & Grinvald, A. (1991). Iso-orientation domains in cat visual cortex are arranged in pinwheel-like patterns. Nature, 353(6343), 429–431. https://doi.org/10.1038/353429a0 — 方位マップ[コラム C11]

  • Ohki, K., et al. (2005). Functional imaging with cellular resolution reveals precise micro-architecture in visual cortex. Nature, 433(7026), 597–603. https://doi.org/10.1038/nature03274 — 齧歯類に方位マップがないこと[コラム C11]

  • Shirakawa, K., et al. (2025). Spurious reconstruction from brain activity. Neural Networks, 190, 107515. https://doi.org/10.1016/j.neunet.2025.107515 — 出力次元崩壊[10節・第15章第10節]

  • Otsuka, K., Nagano, Y., & Kamitani, Y. (2026). Overcoming output dimension collapse: when sparsity enables zero-shot brain-to-image reconstruction at small data scales. Transactions on Machine Learning Research. https://doi.org/10.48550/arxiv.2509.15832 — スパース性による打開[10節]