ベトナム労働法の言語横断検索と回答検証を評価
Cross-Lingual Legal QA for Vietnamese Labour Law: Retrieval, Translation, and Verifier-Guided Correction
この論文をやさしく読む
ひとことで言うと
英語の質問からベトナム語の労働法を探し、法律回答の根拠を確認する仕組みを評価した研究です。
何に役立つ?
言語横断の法令検索や、回答中の引用と主張の整合性を評価する際に役立つ。実務の法的判断そのものの正しさを保証する結果ではない。
この研究の面白いところ
検索方式、翻訳の位置、引用検証を切り分けて比較し、引用保持だけは改善しても他の品質指標は改善しないことを示した。
どこまで分かった?
評価は231組の質問・回答と、そのうち75組の詳細注釈に基づく。自動指標は人間の品質判断と完全には一致しない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
言語をまたぐ法律の質問応答では、異なる言語で法令を検索しながら、根拠のない法的主張を防ぐ必要がある。著者らは、ベトナム労働法に関するベトナム語と英語の質問・回答231組からなる二言語評価セットを導入する。このうち75組には、難しい法的推論の現象5種類について追加の注釈を付けた。回答を個々の主張に分け、引用先に到達できるか、引用が主張を含意するかを確認し、引用の失敗や矛盾を修正する検証器付きの処理手順を評価する。また、引用、法的な義務・許可などの表現、例外、手続き、結論、証拠による支持について、検索した根拠への忠実性を調べる自動診断指標6種類を導入する。実験では、学習型の疎な検索は英語からベトナム語の検索で性能が低く、R@5は約0.032だった。一方、密な検索は0.358に達し、混合型検索をわずかに上回った。翻訳を処理のどこに置くかは、制御した比較と追加の感度分析では、これらの自動診断指標に統計的に検出可能な影響を与えなかった。検証器による修正はシステム全体の引用保持を0.022〜0.034改善したが、ほかの側面では信頼できる改善は得られなかった。人による評価では、自動診断指標が回答品質に関する人間の判断と完全には一致しないことも示された。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 掲載先の記載あり
著者による掲載先の記載:NLLP 2026 at EMNLP 2026。出版社での独立確認は未実施です。
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Cross-lingual legal question answering must retrieve statutes across languages while preventing unsupported legal claims. We introduce a bilingual evaluation suite of 231 Vietnamese--English question--answer pairs from Vietnamese labour law. Of these, 75 are additionally annotated for five challenging legal reasoning phenomena. We evaluate a verifier-guided pipeline that decomposes answers into claims, checks citation reachability and entailment, and corrects citation failures and contradictions. We also introduce six automatic diagnostics for faithfulness to retrieved evidence, covering citations, modality, exceptions, procedures, conclusions, and evidential support. Experiments show that learned-sparse retrieval performs poorly for English-to-Vietnamese retrieval (R@5~=~0.032), whereas dense retrieval reaches 0.358 and slightly outperforms hybrid retrieval. Translation placement has no statistically detectable effect on these automatic diagnostics in our controlled comparison and supporting sensitivity analyses. Verifier-guided correction improves citation preservation by $0.022$--$0.034$ at the system level but produces no reliable gains in the remaining dimensions. Human evaluation further shows that the automatic diagnostics do not fully align with human judgements of answer quality.
著者のコメント
14 pages
arXiv ID: 2609.27376 / 要約の誤りについて