arXiv論文メモ
新着一覧
cs.CL / cs.AI / cs.LG · 掲載先の記載あり

合成翻訳文だけでフランス語生命科学モデルを事前学習

TransBERT: A Framework for Synthetic Translation in Domain-Specific Language Modeling

Julien Knafou, Luc Mottin, Anaïs Mottaz, Alexandre Flament, Patrick Ruch

この論文をやさしく読む

ひとことで言うと

機械翻訳で作ったフランス語の生命科学文書だけを使い、専門分野の言語モデルを事前学習した研究です。

何に役立つ?

専門分野の現地語データが少ない場合に、翻訳文を使って言語処理資源を作る方法の参考になります。公開されたコーパスは36.4 GBです。

この研究の面白いところ

実際のフランス語原文に依存せず、合成翻訳文だけから下流課題で高い性能を得たと報告しています。

どこまで分かった?

実証対象はフランス語の生命科学分野です。要旨は各課題の個別数値や他言語・他分野での性能を示していません。

v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

専門分野で英語以外の言語データが不足していることは、有効な自然言語処理ツールの開発を大きく制限する。本研究は、合成的に翻訳した文章だけで言語モデルを事前学習する新しい枠組みTransBERTと、規模を拡張できる翻訳ツールキットTransCorpusを提示する。フランス語の生命科学分野を対象にした結果、合成翻訳データのみを活用して、さまざまな下流課題で最先端の性能に達し得ることを示した。TransCorpusツールキット、36.4 GBのフランス語生命科学文書からなるTransCorpus-bio-frコーパス、TransBERT-bio-fr、その事前学習済み言語モデル、事前学習とファインチューニングの再現用コードを公開する。結果は、翻訳資源が豊富な翻訳方向を利用する合成翻訳が、言語と分野の組み合わせとしては資源の少ない領域に、高品質な自然言語処理資源を作る方法として有効であることを示している。

v2の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-23 · v2
査読・掲載
掲載先の記載あり

著者による掲載先の記載:Findings of the Association for Computational Linguistics: EMNLP 2025, pages 19338-19354。出版社での独立確認は未実施です。

arXivで読むPDFDOI

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

The scarcity of non-English language data in specialized domains significantly limits the development of effective Natural Language Processing (NLP) tools. We present TransBERT, a novel framework for pre-training language models using exclusively synthetically translated text, and introduce TransCorpus, a scalable translation toolkit. Focusing on the life sciences domain in French, our approach demonstrates that state-of-the-art performance on various downstream tasks can be achieved solely by leveraging synthetically translated data. We release the TransCorpus toolkit, the TransCorpus-bio-fr corpus (36.4GB of French life sciences text), TransBERT-bio-fr, its associated pre-trained language model and reproducible code for both pre-training and fine-tuning. Our results highlight the viability of synthetic translation in a high-resource translation direction for building high-quality NLP resources in low-resource language/domain pairs.

著者のコメント

17 pages

arXiv ID: 2609.26347 / 要約の誤りについて