意味を保つ言い換えでAIの事実回答の不安定さを探る
Hallucination-R1: Robustness-Oriented Paraphrase Generation for Factual Consistency
この論文をやさしく読む
ひとことで言うと
同じ意味の質問なのに言い方を変えるとAIが誤答する弱点を、狙って見つける研究です。意味を変えず、しかも元の文の単なるコピーにならない質問を作ります。
何に役立つ?
考えられる用途は、質問応答モデルの頑健性テストと、その弱点を補う学習データ作成です。小規模な微調整では言い換えに対する正答率の改善も報告しています。
この研究の面白いところ
言い換えの自然な多様性を学ぶ段階と、回答の不整合を引き出す段階を分けています。単なる意味の変化による誤答では説明できないかも分析しています。
どこまで分かった?
評価は挙げられた3データセットなどで行われ、具体的な改善量は要旨にありません。微調整の検討は小規模であり、すべての事実誤りやハルシネーションを解消する結果ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
事実に関するハルシネーションは、一般に誤った事実を出力することとして定義される。本研究では、元の形の事実質問には正答するモデルが、意味的に等価な言い換えでは誤答する、言い換えによって誘発されるハルシネーションの設定を研究する。このような不整合は、意味が変わらなくても潜在的な事実回答の不安定さがあることを明らかにする。しかし、汎用的な言い換えは頑健性のための教師信号として不十分なことが多い。元の文に近すぎる言い換えは弱い信号しか与えず、多様性が過度な言い換えは意味的等価性を壊すことがある。 本論文では、意味には忠実でありながら頑健性を試す難しい言い換えを生成するよう学習する、事実的一貫性のための枠組みHALLUCINATION-R1を提案する。2段階の最適化によって、まず意味を保ちつつ多様な言い換えを安定して生成させ、次に後段の質問応答モデルの事実的一貫性の低下を露呈させる言い換えに報酬を与える。 SimpleQuestions、PopQA、TruthfulQAでの実験では、HALLUCINATION-R1が一貫性と多様性を良好に両立し、複数のモデル系列とデータセットで頑健性の問題を明らかにした。追加分析によると、これらの失敗は表層的なアーティファクトや意味のずれだけでは説明できず、意味を保った変化のもとで無視できない事実回答の不安定さを示している。小規模な微調整の検討でも、HALLUCINATION-R1が生成したデータによって、言い換えによる変動のもとでの頑健な正答率が改善し、頑健性を重視した学習への有用性が示唆された。コードとモデルは https://github.com/yuwenhan07/Hallucination-R1 で公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Factual hallucination is commonly defined by incorrect factual outputs. We study a paraphrase-induced hallucination setting, where a model answers a factual question correctly in its original form but generates an incorrect answer under a semantically equivalent paraphrase. Such inconsistencies expose latent factual instability under semantic invariance. However, general-purpose paraphrases are often insufficient as robustness-oriented supervision: near-copy paraphrases provide weak signals, while overly diverse paraphrases may break semantic equivalence. In this paper, we propose HALLUCINATION-R1, a robustness-oriented paraphrase generation framework that learns to produce semantically faithful yet robustness-challenging paraphrases for factual consistency. Through two-stage optimization, it first stabilizes meaning-preserving and diverse paraphrasing, then rewards paraphrases that reveal factual consistency degradation in downstream QA models. Experiments on SimpleQuestions, PopQA, and TruthfulQA show that HALLUCINATION-R1 achieves a strong consistency--diversity trade-off and exposes robustness failures across multiple model families and datasets. Further analyses indicate that these failures are not reducible to surface-level artifacts or semantic drift, but reveal non-trivial factual instability under meaning-preserving variation. A lightweight fine-tuning study also shows that HALLUCINATION-R1-generated data improves robust accuracy under paraphrase variations, suggesting its utility for robustness-oriented training. Our code and models are publicly available at https://github.com/yuwenhan07/Hallucination-R1.
arXiv ID: 2609.21227 / 要約の誤りについて