arXiv論文メモ
新着一覧
cs.LG · 査読状況未確認

複数の情報種別に応じて慣性を調整する学習法VCMM

VCMM: Variance-Calibrated Momentum for Multimodal Learning

Zhongjing Gu, Chenyang Huang, Yufa Feng, Chong He, Qinxu Ding, Yiming Cui

この論文をやさしく読む

ひとことで言うと

画像や文章などを一緒に学習する際、情報種別ごとに過去の勾配をどれだけ残すかを調整する最適化手法です。

何に役立つ?

考えられる用途は、ある情報種別が学習を支配しがちなマルチモーダルモデルの訓練です。要旨では4つのベンチマークで改善を報告しています。

この研究の面白いところ

現在の勾配だけでなく、モメンタムに蓄積された過去の勾配にも着目し、ミニバッチノイズと時間的変動から記憶の強さを決めています。

どこまで分かった?

改善は4つのベンチマークで示されていますが、要旨には改善幅や対象モデルの詳細はありません。全ての組み合わせでの有効性までは判断できません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

複数の情報種別を同時に学習すると、優勢な情報種別が他の情報種別の最適化を妨げるという不均衡がしばしば生じる。既存手法は主に、勾配の大きさや方向の調節、最適化目標の変更、学習戦略の調整によって均衡を取るが、多くは現在の更新に注目している。しかし、広く使われるモメンタム型最適化手法と組み合わせると、更新には過去の勾配から蓄積した情報も含まれるため、現在のステップだけの調節では明示的に扱えない。 この問題に対し、情報種別ごとの勾配の変化に応じて勾配の記憶を調整する Variance-Calibrated MomentuM(VCMM)を提案する。VCMM はミニバッチ由来のノイズと時間的な変動をオンラインで推定し、両者の相対的な強さを使って、カルマンフィルターに着想を得た制御器から情報種別ごとのモメンタムを決める。さらに、情報種別間で制御信号を中心化し、時間とともに変化する一次モーメントに厳密なバイアス補正を適用する。これにより、ネットワークの追加の順伝播や明示的な学習率の倍率調整なしに、適応的な勾配の記憶を実現する。4つのマルチモーダル・ベンチマークでの実験では、学習時の追加負荷を抑えつつ、一貫した改善が示された。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Multimodal joint training often suffers from modality imbalance, where a dominant modality suppresses the optimization of others. Existing methods mainly balance modality learning by modulating gradient magnitudes or directions, modifying optimization objectives, or adjusting training strategies, with most interventions focusing on the current update. However, when combined with widely used momentum-based optimizers, the update also incorporates accumulated information from previous gradients, which is not explicitly addressed by current-step modulation alone. To address this issue, we propose Variance-Calibrated MomentuM (VCMM), which adapts gradient memory to modality-specific gradient dynamics. Specifically, VCMM estimates minibatch noise and temporal drift online and uses their relative strength to determine modality-specific momentum through a Kalman-inspired controller. We further center the control signal across modalities and apply exact bias correction for the time-varying first moment, enabling adaptive gradient memory without extra network passes or explicit learning-rate scaling. Experiments on four multimodal benchmarks demonstrate consistent improvements with modest training overhead.

arXiv ID: 2609.27577 / 要約の誤りについて