arXiv論文メモ
新着一覧
cs.CL / cs.AI · 査読状況未確認

MoEの専門家選択を言語間でそろえて多言語性能を改善

Cross-Lingual Alignment for Decoder-Only Models using MoE Routers

Lucas Bandarkar, Clark Peng, Ahmed Haj Ahmed, Aditi Khandelwal, Nanyun Peng

この論文をやさしく読む

ひとことで言うと

言語ごとに単語の区切り方が違っても、MoEモデルがどの専門家を選ぶかを比較してそろえ、多言語学習へ利用します。

何に役立つ?

複数言語を扱うMoEモデルの継続事前学習で、言語間の知識転移を促す方法として役立ちます。

この研究の面白いところ

直接対応しにくい隠れ状態ではなく、専門家へ振り分けるルーター出力をそろえると、隠れ表現の側も整合するという結果です。

どこまで分かった?

評価は四つのオープンソースMoEで行われています。要旨には言語別の改善値や学習コストがなく、MoE以外の構造で同じ方法が使えるという結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

言語間の対照学習は、多言語エンコーダーの学習で中心的な要素となってきた。しかし、デコーダーのみのLLMでは多言語のトークン分割が異なるため、表現を明示的に対応付けることができない。一方、LLMでも、言語間の表現の整合性が高いほど言語間転移が改善することを示唆する研究が増えている。本論文では、現代のLLMの構造上の制約の下で、言語間対照学習を捉え直す新しい方法を提案する。 隠れ状態へ補助的な整合損失を適用する代わりに、混合専門家(MoE)のルーターの出力を整合の対象として使うことを提案する。ルーターの出力は、多くのトークンをまとめてプーリングすることにより適しており、系列単位でより信頼できる言語間比較を可能にする。四つのオープンソースMoEを用いて条件を統制した継続事前学習実験では、このルーティング損失を組み込むと、その基礎となる隠れ表現も言語間で整合することが示された。最も重要な点として、この損失は多様な評価課題群における多言語性能を改善し、言語間でMoEのルーターを整合させる方法の可能性を示している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Cross-lingual contrastive learning has been a core component of multilingual encoder training, but the ability to explicitly align representations is not possible in decoder-only LLMs because of varying multilingual tokenization. However, a growing amount of research suggests that even in LLMs, higher cross-lingual representational alignment leads to improved cross-lingual transfer. In this paper, we propose a novel approach to reimagine cross-lingual contrastive learning given the architectural constraints of modern LLMs. Rather than applying an auxiliary alignment loss on hidden states, we propose using the outputs of the mixture-of-experts (MoE) routers as the target for alignment. Router outputs lend themselves better to pooling over many tokens, enabling more reliable cross-lingual comparisons at the sequence-level. Controlled continual pre-training experiments on four open-source MoEs show that incorporating this routing loss also aligns the underlying hidden representations across languages. Most importantly, this loss improves multilingual performance on our diverse evaluation suite, demonstrating the potential of cross-lingual MoE router alignment.

arXiv ID: 2610.01921 / 要約の誤りについて