arXiv論文メモ
新着一覧
cs.LG · 査読状況未確認

グラフ注意機構でヘッド間の情報交換を可能にする

Let the Heads Talk: Beyond Diagonal Graph Attention

Riccardo Ali, Alessio Borgi, Mario Severino, Alessio Gravina, Davide Bacciu, Pietro Liò, Christopher Irwin

この論文をやさしく読む

ひとことで言うと

グラフの情報を集める注意機構で、通常は対応するヘッド同士に限られる情報の流れを、辺ごとに別のヘッドへも流せるようにする方法です。

何に役立つ?

関係の種類に応じて特徴の変換を変える必要がある推論課題で、モデル構成を選ぶ材料になります。分布外への汎化も評価対象に含まれます。

この研究の面白いところ

単なる層の追加として扱わず、集約後の共通変換では一般に代用できない操作であることを示しています。追加経路をゼロにすると元の注意機構に戻る構成です。

どこまで分かった?

異なる種類のノードがつながるだけでは、一貫した改善は得られていません。利点は相互作用に応じた変換が必要な課題で強く、要旨に具体的な改善率はありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

層ニューラルネットワークは、スカラーの辺重みを局所特徴空間の間の線形輸送写像に置き換えることで、スカラー重み付きのメッセージ伝播を一般化する。しかし、この行列値の輸送の役割は、より広い層拡散の構成と絡み合っている。本研究では、有向グラフである箙の表現を通じて輸送という基本操作を切り分け、多頭注意機構との直接のつながりを確立する。注意ヘッドを局所的な輸送空間の座標とみなすと、標準的な多頭注意機構は対角な辺写像を実装していることが分かる。すなわち、各有向相互作用に沿って、送信元のヘッドは受信側の対応するヘッドにしか寄与できない。これに対し非対角成分を許すと、近傍を集約する前に、辺に応じたヘッド間の通信が可能になる。この操作は一般には、集約後に適用する単一の共有線形写像に吸収できないことを示す。 この特徴付けに基づいて、Topological Attention(Top-A)を導入する。これは、元の同一ヘッド間の経路を保持しながら、辺に依存する非対角の経路を学習する多頭注意機構であり、追加経路が消えると標準的な注意機構を厳密に再現する。分布外への汎化を含む関係推論、異種グラフ学習、アルゴリズム推論でTop-Aを評価し、対照的な設定として異質なノード同士がつながるグラフのノード分類も用いる。結果は、相互作用に応じた変換が有効な課題でヘッド間輸送が最も役立つ一方、異質なノード間の接続という性質だけでは系統的な優位性は得られないことを示す。これらの知見は、辺に応じたヘッド間通信が、行列値輸送における独自の計算上の基本操作であることを明らかにする。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Sheaf Neural Networks generalize scalar-weighted message passing by replacing scalar edge weights with linear transport maps between local feature spaces. Yet the role of this matrix-valued transport is entangled with the broader sheaf-diffusion construction. We isolate the transport primitive through quiver representations and establish a direct connection with multi-head attention. Treating attention heads as coordinates of a local transport space reveals that standard multi-head attention implements diagonal edge maps: along each directed interaction, a source head can contribute only to the corresponding receiver head. Allowing off-diagonal entries instead enables edge-conditioned communication across heads before neighborhood aggregation. We show that this operation cannot, in general, be absorbed into a single shared linear map applied after aggregation. Building on this characterization, we introduce Topological Attention (Top-A), a multi-head attention that learns edge-dependent off-diagonal routes while preserving the original same-head paths and exactly recovering vanilla attention when the additional routing vanishes. We evaluate Top-A on relational reasoning, heterogeneous graph learning, and algorithmic reasoning, including out-of-distribution generalization, with heterophilic node classification as a contrast setting. The results show that cross-head transport is most useful when the task benefits from interaction-dependent transformations, while heterophily alone provides no systematic advantage. These findings identify edge-conditioned cross-head communication as a distinct computational primitive of matrix-valued transport.

arXiv ID: 2610.01494 / 要約の誤りについて