arXiv論文メモ
新着一覧
cs.CR · 査読状況未確認

品質選別を通過する学習データ汚染の影響を調べる

High-quality Data Do not Mean Safe! Poisoning LLMs after Data Selection

Kaiyang Li, Jiahao Chen, Yuwen Pu, Chunyi Zhou, Tong Zhang, Bin Cai, Chunqiang Hu, Haibo Hu

この論文をやさしく読む

ひとことで言うと

文章として高品質な学習データでも、追加学習後のモデルの安全性を損なう可能性があることを調べた研究です。

何に役立つ?

学習データの品質検査と安全性検査を別々に評価する必要性を考える材料になります。

この研究の面白いところ

フィルターが除いた量だけでなく、残ったデータがモデルに与える影響を評価している点が中心です。

どこまで分かった?

勾配パターンを原因とする説明は要旨では可能性として述べられています。有害性スコアの尺度の定義や、対象モデルの詳細は要旨にありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

安全性を調整した大規模言語モデルでも、少量の有害なサンプルや、一見無害なサンプルによる追加学習には脆弱性が残る。ただし従来研究は通常、汚染サンプルがそのまま後段の追加学習へ入ると仮定しており、実際の学習工程にある品質に基づく選別を見落としている。この不足を埋めるため、汚染に対するフィルタリング効果と、残されたデータが後段の安全性に及ぼす影響の両方を体系的に評価する。 結果は、選別が明白に有害な多くのサンプルを除く一方、保持された高品質サンプルの一部は、なおモデルの安全性調整を劣化させ得ることを示す。これは、層ごとの勾配における学習更新のパターンが、有害なデータに似ているためである可能性がある。これらの知見は、安全性を損なう影響が、保持される高品質サンプルを通じて品質選別をすり抜け得るという、実際上の脆弱性を示す。 その体系的な悪用可能性を調べるため、二段階の品質制約付き安全性劣化テキスト最適化(Bi-QSTO)を提案する。これは、明示的な品質制約の下で汚染サンプルを最適化し、安全性を劣化させる影響を保ったまま選別を通過させる。異なる汚染設定、対象モデル、フィルタリング率にわたり、Bi-QSTOは選別の前後で攻撃効果を維持する。90%を除去する場合でも、有害なサンプルを出発点としたデータは90%超の汚染保持率と3.30~4.01の有害性スコアを達成する。攻撃効果はモデル間で強く転移し、保持率の優位も追加の選別手法に一般化する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Safety-aligned Large Language Models remain vulnerable to fine-tuning on small sets of harmful or benign-looking samples. However, prior studies typically assume that poisoned samples directly enter downstream fine-tuning, overlooking quality-based selection in practical training pipelines. To fill this gap, we systematically evaluate both the filtering effects against poisoning and the downstream safety impact of retained data. The results reveal that selection removes many overtly harmful samples, yet some retained high-quality samples can still degrade model safety alignment possibly due to their harmful-like training-update patterns at the layer-wise gradient level. Together, these findings expose a practical vulnerability: safety-degrading influence can pass through quality-based selection via retained high-quality samples. To examine its systematic exploitability, we propose Bi-Stage Quality-Constrained Safety-Degradation Text Optimization (Bi-QSTO), which optimizes poisoned samples under an explicit quality constraint to survive selection while preserving their safety-degrading influence. Across poisoning settings, target models, and filtering rates, Bi-QSTO maintains attack effectiveness before and after selection. Even at 90% filtering, harmful-seeded samples achieve a Poisoning Retention Rate above 90% and Harmful Score of 3.30--4.01. Their attack effectiveness strongly transfers across models and their retention advantage generalizes to additional selection methods.

著者のコメント

15 pages, in submission

arXiv ID: 2610.01367 / 要約の誤りについて