アラビア語の有害ミームとプロンプト検出を競う課題
ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts
この論文をやさしく読む
ひとことで言うと
アラビア語ミームのヘイト表現と、言語モデルへの有害な指示を検出する共有課題の結果です。
何に役立つ?
アラビア語の安全性評価で、課題ごとの難しさや既存モデルの成績を比較する材料になります。
この研究の面白いところ
同じ共有課題内でも成績に大きな差があり、ミームの細分類で最良のマクロF1は0.419でした。
どこまで分かった?
要旨は共有課題の参加状況と最良スコアを報告しています。A2の難しさの一因としてラベル不足と分布のずれを挙げています。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ArGuardは、アラビア語のミームと大規模言語モデルへのプロンプトに含まれる有害な内容を検出する共有課題である。二つのトラックからなり、トラックAはアラビア語ミームにおける画像と言語を組み合わせたヘイト検出、トラックBはアラビア語LLMの安全性評価に向けた有害プロンプトの検出を扱う。計58チームが登録し、35チームが最終評価に参加し、27チームがシステムの説明論文を提出した。参加チームはAraBERT、Jais、Qwen3-VLなどのモデルを試した。最良のシステムのマクロF1スコアはA1で0.823、A2で0.419、B1で0.984、B2で0.790だった。A2のミームの細分類が最も難しく、その一因はラベルの少なさと訓練・テスト間の分布の違いであった。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
ArGuard is a shared task on harmful content detection in Arabic memes and LLM prompts. It includes two tracks: Track A focuses on multimodal hate detection in Arabic memes, while Track B addresses harmful prompt detection for Arabic LLM safety evaluation. In total, 58 teams registered, 35 participated in the final evaluation, and 27 submitted system-description papers. Participating teams explored models such as AraBERT, Jais, and Qwen3-VL. The best systems achieved macro-F1 scores of 0.823 on A1, 0.419 on A2, 0.984 on B1, and 0.790 on B2. Fine-grained meme classification in A2 was the most challenging setting, partly due to sparse labels and train-test distribution shifts.
arXiv ID: 2609.29349 / 要約の誤りについて