多言語モデルが知識を本当に忘れたかを評価する
$\mu^2$-Bench: A Multilingual Machine Unlearning Benchmark
この論文をやさしく読む
ひとことで言うと
ある言語で出なくなった情報が、別の言語では残っていないかを調べる忘却評価です。
何に役立つ?
多言語LLMの情報削除手法を比較し、学習外の言語や言語を組み合わせた場合の残存知識を点検する用途が考えられます。
この研究の面白いところ
忘却後だけを試すのではなく、知識を覚えさせる段階から評価までを一つのベンチマークにしています。複数言語に散らばる知識も対象です。
どこまで分かった?
要旨には言語数、具体的な削除成功率、各手法の成績はありません。この評価枠組みの提示だけで、すべての言語からの完全削除が保証されるわけではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
有害な内容や私的データなどの望ましくない情報は、直接の学習と、言語をまたぐ間接的な伝播を通じ、多言語大規模言語モデル(LLM)に広がる。多言語機械アンラーニング(MMU)は、こうした情報の除去を目指すが、その評価は十分に研究されていない。そのため、アンラーニングがすべての言語にわたって対象知識を本当に取り除くのかは不明である。 この不足を埋めるため、多様な言語について、記憶、アンラーニング、評価という全過程を模擬するMMUベンチマーク、μ²-Benchを導入する。このベンチマークは、第一に幅広い言語を対象とし、第二に学習に用いた言語と保留した言語の両方で評価し、第三に複数言語に分散した知識を評価する。MMUを成功させるには多言語特有の性質を反映した手法が必要であることを示し、MMUへの理解を深める分析を行う。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Undesired information such as harmful content and private data propagates through Multilingual Large Language Models (LLMs) via direct training and indirect cross-linguistic spread. Multilingual Machine Unlearning (MMU) aims to remove such information, yet its evaluation remains underexplored, leaving unclear whether unlearning truly eliminates target knowledge across all languages. To bridge this gap, we introduce $\mu^2$-Bench, an MMU benchmark that simulates the full pipeline of memorization, unlearning, and evaluation across diverse languages. It 1) spans a broad set of languages, 2) evaluates on both training and hold-out languages, and 3) assesses knowledge as dispersed across multiple languages. We show that successful MMU requires methods that reflect multilingual characteristics, and conduct analysis to provide deeper insights into MMU.
arXiv ID: 2609.20945 / 要約の誤りについて