異なる画像認識モデルを幾何学的に融合する
Riemannian--Lorentz Fusion of Vision Transformers and State-Space Models
この論文をやさしく読む
ひとことで言うと
仕組みの異なる二つの画像認識モデルを、パラメータの役割と空間の幾何学を使って結びつける方法です。
何に役立つ?
考えられる用途は、別々に学習済みのViTとSSMの能力を組み合わせることです。三つの画像分類データセットで、融合前の最良モデルを上回る正解率が報告されています。
この研究の面白いところ
単純に同じ位置の重みを平均するのでなく、共通座標と双曲空間を介して融合します。入力によって二つの分岐の出力を組み合わせるゲートも用います。
どこまで分かった?
最終結果には微調整とゲートの学習が含まれます。二つの分岐を残す構成なので、訓練なしの単一モデルへのマージや、その計算費用削減を実証した結果とは扱えません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
深層学習の大規模化は、データの枯渇、訓練費用の指数的増大、計算資源の集中という重大な制約に直面している。モデルマージは、勾配降下法を使わずに事前学習済みチェックポイントを組み合わせ、再学習に比べて桁違いの費用削減を可能にする。しかし、独立に訓練された画像モデルの構造やパラメータの形状が異なる場合、その組合せは難しい。既存の重み空間でのマージ手法は、一般に対応が取れ、形状に互換性のあるチェックポイントを前提とする。一方、Vision Transformer(ViT)と状態空間モデル(SSM)は、異なる演算子でトークン間の混合を行う。 本研究では、両方の構造を維持しながら、意味的な役割に応じてパラメータ群を対応づける、ハイブリッド型の異種モデル融合を扱う。提案するリーマン・ローレンツ・パラメータ融合(RLPF)は、対応づけた群を共通座標へ射影し、選んだ座標を双曲空間のローレンツ双曲面モデルへ持ち上げ、正則化された測地的重心を計算した後、その結果を二つの分岐へ復号する。学習されたゲートが、入力ごとに両分岐のロジットを組み合わせる。構成要素の群には固定の曲率値を使い、正規化パラメータはユークリッド空間で扱う。 本稿で得られている結果では、微調整後のシステムはCIFAR-10で82.37%、Oxford-IIIT Petで75.04%、ImageNet-1Kでトップ1正解率78.58%を達成した。対応する融合前の最良モデルの正解率は、それぞれ76.54%、71.42%、76.42%である。ImageNet-1Kでは、報告された微調整前の初期状態で77.80%に達している。 これらの結果は、幾何学を考慮した異種モデル融合のさらなる研究を支持するが、訓練不要で単一チェックポイントへ統合できることを示すものではない。RLPFは二分岐のハイブリッドであり、ゲートと報告された最終モデルはいずれも訓練されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Scaling deep learning faces critical bottlenecks: data exhaustion, exponential training costs, and resource concentration. Model merging combines pre-trained checkpoints without gradient descent, offering orders-of-magnitude savings versus retraining. Combining independently trained vision models is difficult when their architectures and parameter shapes differ. Existing weight-space merging methods generally assume aligned, shape-compatible checkpoints, whereas a Vision Transformer (ViT) and a state-space model (SSM) implement token mixing with different operators. We study a hybrid Heterogeneous merging setting that retains both architectures while aligning parameter groups by semantic role. Our proposed Riemannian--Lorentz Parameter Fusion (RLPF) method projects aligned groups to common coordinates, lifts selected coordinates to the Lorentz hyperboloid model of hyperbolic space, computes a regularized geodesic barycenter, and decodes the result into the two branches. A learned gate then combines branch logits for each input. Component groups use fixed curvature values, with normalization parameters treated as Euclidean. In the results available in this manuscript, the fine-tuned system obtains 82.37\% on CIFAR-10, 75.04\% on Oxford-IIIT Pet, and 78.58\% top-1 accuracy on ImageNet-1K; the corresponding best-parent accuracies are 76.54\%, 71.42\%, and 76.42\%. On ImageNet-1K, the reported pre-fine-tuning initialization reaches 77.80\%. These results support further study of geometry-aware heterogeneous fusion, but not a training-free single-checkpoint merge: RLPF is a two-branch hybrid whose gate and reported final models are trained.
arXiv ID: 2609.19384 / 要約の誤りについて