arXiv論文メモ
新着一覧
cs.SD / eess.AS · 査読状況未確認

音声の一部だけを加工した偽物の区間を特定する

Boundary and Intra-Segment Learning for Partial Audio Deepfake Localization

Zhe Ye, Xiangui Kang, Minhua Huang, Kai Wu, Kong Aik Lee, Chng Eng Siong

この論文をやさしく読む

ひとことで言うと

音声のうち偽造された部分を見つけるため、偽造区間の境界と区間内部の特徴を同時に学ぶ方法。

何に役立つ?

発話の一部だけが加工された音声について、どの区間が偽造されたかを調べる手法の評価に役立つ。実際の調査現場での性能を示した結果ではない。

この研究の面白いところ

境界の位置だけでなく、真偽が切り替わる特徴と、連続した各区間内の一貫性を合わせて学習する。PartialSpoofでは等誤り率2.52%、F1スコア97.40%と報告している。

どこまで分かった?

数値は要旨に示されたベンチマークの結果である。HADとLPSの改善幅は要旨に数値がなく、未知の音声加工方法への強さも分からない。コード公開は採択後の予定として記されている。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

音声の一部だけを偽造する手法では、発話の選ばれた区間だけを加工するため、加工箇所を特定しにくい。既存の部分的な音声偽造の位置特定手法は、境界の手掛かりを利用するものの、真偽が切り替わる際の特徴の変化を捉えるよりも、主に境界の位置を特定することに重点を置いている。一方、本物の連続した区間と偽造された連続区間の内部の特徴は、十分に調べられていない。本稿では、境界と区間内部の学習を組み合わせたBISLを提案する。境界学習により隣り合うフレーム間の特徴の違いを捉え、真偽の切り替わりと一般的な音響変化を区別する。さらに、区間内部の学習では、連続する本物と偽造の区間全体の特徴を捉えながら、各区間内の特徴の一貫性を高める。フレーム、境界、区間の情報を共同で学習することで、BISLは音声の部分的な偽造箇所をより細かく特定できる。複数の位置特定ベンチマークでの実験では、PartialSpoofで等誤り率2.52%、F1スコア97.40%となり、比較手法を上回った。また、HADでは競争力のある性能を維持し、LPSではデータセットをまたぐ性能が改善した。コードは採択された場合に公開する予定である。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Partial audio deepfakes manipulate only selected speech regions, making them difficult to be localized. Existing methods exploit boundary cues for partial deepfake localization, but primarily focus on identifying boundary positions rather than modeling the feature changes that characterize authenticity transitions. Meanwhile, the internal characteristics of continuous bona fide and spoofed segments remain underexplored. In this paper, we propose Boundary and Intra-Segment Learning (BISL), which introduces boundary learning to model feature differences between adjacent frames and distinguish authenticity transitions from general acoustic variations. In addition, intra-segment learning captures the overall characteristics of continuous bona fide and spoofed segments while enhancing feature consistency within each segment. By jointly learning frame, boundary, and segment information, BISL enables more effective fine-grained partial audio deepfake localization. Experiments on multiple localization benchmarks show that BISL achieves an EER of 2.52\% and an F1-score of 97.40\% on PartialSpoof, outperforming the compared methods, while maintaining competitive performance on HAD and improved cross-dataset performance on LPS. The code will be made publicly available upon acceptance.

arXiv ID: 2609.25822 / 要約の誤りについて