arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

インド諸語間の機械翻訳用に人手確認した対訳データ

COILD: An Indic-Centric Parallel Corpus and Benchmark for Machine Translation Across Indian Languages

Kshetrimayum Boynao Singh, Nitin Kumar Mishra, Palash Pratim Dutta, Atai Waris Khan, Aparna Kaushik, Avinash Kumar, Deeksha, Deepak Kumar, Saroj Kumar Jha, Saloka Sengupta, Anansa Roy, Umalatha Kannoth, Saifulla Samar, Meena Sharma, Manpreet Kaur, Jyoti Sharma, Ashwini Vaidya, Muralikrishna SN, Md Shad Akhtar, Poonam Bansal, Amita Dev, Sanasam Ranbir Singh, Samit Bhattacharya, Tanmoy Chakraborty, Asif Ekbal

この論文をやさしく読む

ひとことで言うと

英語を中継せず、インド諸語を原資料として集めた大規模な対訳データと評価用文集合です。

何に役立つ?

インド諸語同士の機械翻訳モデルの学習と比較評価に使える資料です。要旨では二つの翻訳モデルの微調整で改善を確認しています。

この研究の面白いところ

116万組超の人手翻訳・確認済み対訳と、専門家確認済みの2000文を、複数語族・八分野にまたがって用意しています。

どこまで分かった?

実験結果はIndicTrans2-DistilledとNLLB-200の微調整で示されます。要旨には各言語組の改善幅の数値はありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

インド諸語の機械翻訳は、インド諸語を中心に作られた高品質な対訳コーパスと評価基準が十分にないことに制約されている。既存の多言語資料の多くは英語を中継する内容から作られ、インド諸語の言語的多様性、文化的な複雑さ、分野固有の特徴を十分に捉えないことがある。本研究は、116万組を超える、人手で翻訳し人手で検証した文の対からなるCOILDを提示する。インド・アーリア語族、ドラヴィダ語族、チベット・ビルマ語族、オーストロアジア語族にまたがる20のインド諸語の組み合わせを扱う。コーパスは、実際の用途に直結する八つの分野を対象に、利用許諾を得た保管元から収集したインド諸語の原資料だけで構築した。 さらに、専門家が確認した2000文からなる分野別のベンチマークを導入し、インド諸語の組み合わせ間で一貫した多言語・言語間評価を可能にする。COILDの有効性を確かめるため、代表的な多言語ニューラル機械翻訳モデルIndicTrans2-DistilledとNLLB-200を微調整した。実験では、言語の組み合わせ、分野、自動評価指標、人手評価のいずれでも一貫した改善が示され、インド諸語を中心とした高品質な教師データの有効性が示された。COILDは、インド諸語の多言語機械翻訳や今後の多言語言語モデルのための学習・評価資源となる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Machine translation (MT) for Indian languages remains constrained by the limited availability of high-quality, Indic-centric parallel corpora and evaluation benchmarks. Existing multilingual resources are largely constructed from English-pivot content and often fail to capture the linguistic diversity, cultural complexity, and domain-specific characteristics of Indian languages. We present COILD, an Indic-centric parallel corpus comprising over 1.16 million human-translated and human-verified sentence pairs, covering 20 Indian language pairs across the Indo-Aryan, Dravidian, Tibeto-Burman, and Austro-Asiatic language families. The corpus is built entirely from original Indian language sources collected from licensed repositories spanning eight domains with direct real-world applicability. Furthermore, we introduce a domain-centric benchmark comprising 2,000 expert-verified sentences to enable consistent multilingual and cross-lingual evaluation across Indian language pairs. To validate the effectiveness of COILD, we fine-tune two representative multilingual neural machine translation models, IndicTrans2-Distilled and NLLB-200. Experimental results demonstrate consistent improvements across language pairs, domains, automatic evaluation metrics, and human evaluation, highlighting the effectiveness of high-quality Indic-centric supervision. COILD provides a valuable training and evaluation resource for advancing multilingual machine translation and future multilingual language models for Indian languages.

著者のコメント

17 pages, including references and appendices

arXiv ID: 2609.28826 / 要約の誤りについて