段落構造は段落間アテンションの抑制の強さに表れる
Paragraph Boundaries Are Not White Space:Compression Depth as the Signature of Hierarchical Structure
この論文をやさしく読む
ひとことで言うと
段落の区切りがモデルの注意の向け方にどう表れるかを、文章自体を変えずに調べています。段落をまたぐ注意がどれだけ弱まるかが手掛かりになります。
何に役立つ?
階層的な位置符号化が文章構造をどう反映するかを評価するための分析方法です。文章理解タスク全般の性能向上を報告したものではありません。
この研究の面白いところ
ランダムな区切りでも注意の抑制が起きるため、抑制の有無だけでは不十分だと示します。実際の段落では抑制の強さが増し、コーパスごとの差も現れます。
どこまで分かった?
結論はhRoPEと指定の介入・推定法を使った設定に限られます。調べた8つの量のどれも、コーパス間の順序を完全には説明できていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
標準的な位置符号化は、位置を1次元の読み順の座標で表す。しかし、読み順だけでは文章の階層構造は決まらない。本研究では、段落、文、トークンのインデックスを別々のチャネルで表す階層型回転位置符号化hRoPEを用いる。トークン列を固定したまま段落座標p1へ介入し、トークン距離を厳密に揃えた推定法で、段落をまたぐアテンションを測定する。 すべてのコーパスで、トークン距離を揃えたベースラインと比べてアテンションが抑制される。しかし、抑制されること自体は本物の構造を見分ける指標にならない。同じアーキテクチャのチャネルに、密度を揃えたランダムなラベルを与えた場合も、より浅いながら抑制が起こるためである。本物の構造を区別するのは抑制の深さであり、本物では抑制がより深くコーパスに依存する一方、対照条件ではそうならない。 語彙的持続性、段落長、埋込みに基づく一貫性という3つの概念にわたる、コーパスだけから求める8つの量を比較したところ、どの量もコーパス間での抑制の深さの順位を完全には再現しなかった。ただし、埋込みに基づく一貫性が最も近かった。本研究の設定では、本物の段落構造を再現性よく特徴付けるのは、抑制が生じる場所ではなく、その深さである。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Standard positional encodings represent position as a one-dimensional reading-order coordinate, but reading order alone does not determine hierarchical textual structure. We use a hierarchical rotary positional encoding (hRoPE) that represents paragraph, sentence, and token indices as separate channels, hold the token sequence fixed, intervene on the paragraph coordinate p1, and measure cross-paragraph attention with a token-distance-exact estimator. Attention is compressed relative to a token-distance-matched baseline in every corpus, but compression alone is not diagnostic of true structure: an architecturally identical channel with density-matched random labels is compressed too, more shallowly. What distinguishes real structure is the depth of compression, which is greater and corpus-dependent while the control's is not. Comparing eight corpus-only quantities across three constructs (lexical persistence, paragraph length, embedding-based coherence), none fully reproduces the cross-corpus ordering of depth, though embedding-based coherence comes closest. Compression depth, not its location, is the reproducible signature of genuine paragraph structure in our setting.
arXiv ID: 2609.23551 / 要約の誤りについて