arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

連合学習の画像言語モデルで判断を損なうずれを補正

Beyond Domain-Level Adaptation: Margin-Oriented Semantic-Appearance Interaction Correction for Personalized Federated Vision-Language Models

Wentao Yue, Qingyu Mao, Tianyou Lai, Ahmed M. Abdelmoniem, Qilei Li

この論文をやさしく読む

ひとことで言うと

端末ごとの画像の見え方の違いを一律に直すのではなく、分類判断を誤らせるクラスとドメインの組合せを優先して補正する方法です。

何に役立つ?

異なる環境の端末がデータを共有せず画像言語モデルを個別適応させる場面で、分類精度を改善する用途が考えられます。

この研究の面白いところ

同じドメインのずれでも画像クラスによって影響が異なり、そのすべてが誤判断につながるわけではないという点を補正設計へ取り込んでいます。

どこまで分かった?

改善は三つのデータセットで評価した設定に関する結果です。要旨には具体的な改善幅や通信負荷の数値は示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

連合型のパラメータ効率的な微調整は、分散したクライアントが生データを共有せず、バックボーン全体を更新することもなく、事前学習済みの画像言語モデルを適応させることを可能にする。しかし、その有効性はクライアント間のドメインの異質性に制限される。既存の個別適応手法は、全体で共有する知識とクライアント固有のスタイルを分けるが、多くの場合、各ドメインをクラスに依存しない変換として扱っている。 本研究では、この抽象化が不十分であることを示す。ある固定されたドメインに対応するドメイン間の変位は、意味的なクラスごとに異なり、そうしたクラス・ドメイン残差のうち一部だけが画像と文章の判断マージンを損なう。そこで、Margin-Oriented Semantic-Appearance Interaction Correction(MOSAIC)を提案する。まず、学習データから得たクラス・ドメイン残差が、正解クラスよりも競合する文章プロトタイプを有利にするかを測る、判断を考慮した有害度スコアを構築する。 続いて、低ランク残差アダプターで細かなクラス・ドメイン相互作用をモデル化する。このアダプターでは、クラス因子と残差基底を全体で共有し、ドメイン因子はクライアント内に非公開で保持する。さらに、画像を条件とするゲートが候補ごとの補正を制御し、有害な組合せを考慮した重み付けの変更によって、ローカル最適化中に判断に関わる残差を優先する。Office31、OfficeHome、DomainNet100での広範な実験により、評価したすべてのドメインシフト設定、およびドメインとラベルが同時にずれる設定で、MOSAICがクライアントごとのトップ1正解率のマクロ平均を一貫して改善することが示された。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Federated parameter-efficient fine-tuning enables distributed clients to adapt pretrained vision-language models without sharing raw data or updating the full backbone. Its effectiveness, however, is limited by domain heterogeneity across clients. Existing personalized methods separate globally shared knowledge from client-specific style, but they largely treat each domain as a class-agnostic transformation. We show that this abstraction is insufficient: the cross-domain displacement associated with a fixed domain varies across semantic classes, and only a subset of these class-domain residuals damages the image-text decision margin. We therefore propose Margin-Oriented Semantic-Appearance Interaction Correction (MOSAIC), which first constructs a decision-aware harmfulness score that measures whether a training-derived class-domain residual favors a competing text prototype over the true class. It then models fine-grained class-domain interactions with a low-rank residual adapter whose class factors and residual basis are globally shared while domain factors remain client-private. An image-conditioned gate further controls candidate-wise correction, and harmful-pair-aware reweighting prioritizes decision-relevant residuals during local optimization. Extensive experiments on Office31, OfficeHome, and DomainNet100 demonstrate that MOSAIC consistently improves macro-client top-1 accuracy across all evaluated domain-shift and joint domain-label-shift settings.

arXiv ID: 2610.01625 / 要約の誤りについて