arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

剪定した視覚・言語・行動モデルを隠れ状態で復元

Recovering Aggressively Pruned Vision-Language-Action Models with Offline Hidden-State Distillation

Chiyoung Kim, Sanghyuk Roy Choi, Minhyeok Lee

この論文をやさしく読む

ひとことで言うと

ロボット用の視覚・言語・行動モデルを大きく削った後、元モデル内部の状態をまねる学習で性能を回復します。オンラインで試行を追加せず、事前に保存した教師の計算結果を使います。

何に役立つ?

ロボット本体の計算資源やメモリに収まるモデルを作るための手法です。6自由度の実機では72%削減モデルが教師比2.23倍速、メモリ62%減となり、成功率77.5%を報告しています。

この研究の面白いところ

層の幅を縮めても残差の流れの寸法を保つことで、教師と生徒の内部状態を追加の射影器なしに比較します。圧縮率を9段階で調べ、強い圧縮で内部状態の蒸留が効くことを示しています。

どこまで分かった?

効果はモデルと削減率に依存し、OpenVLA-OFTでは45%削減まで二つの回復目的の差は有意ではありません。幅削減は成功率、深さ削減は遅延に有利という違いもあり、すべての指標を同時に最適化した結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

視覚・言語・行動(VLA)モデルにより、ロボットは言語指示に従えるが、数十億パラメータを持つ言語バックボーンが、ロボット上で実行する主な障害となる。構造化剪定によってこのバックボーンを小さくすると、OpenVLA-OFTから63%を除去した場合、LIBERO-Longでの成功率は93.2%から0.8%へ低下する。最近の方法では、教師ありファインチューニングの後に強化学習を行ってこのようなモデルを復元するが、オンラインのロールアウトと数百GPU時間を必要とする。 本研究では、失われた成功率の大部分を完全にオフラインで復元する。幅方向の剪定ではブロックを狭くする一方で残差ストリームを元の大きさに保つため、教師と生徒の隠れ状態は同じ形状になり、射影器なしで直接対応付けられる。教師を1回実行して作ったキャッシュを使って訓練すると、63%削減した生徒モデルは約8 GPU時間で教師モデルとの差を3.5ポイント以内に縮めた。9種類の削減率を調べ、復元目的が効き始める位置も特定した。OpenVLA-OFTでは削減率45%まで、2つの方法に有意な差はなかった。その後の隠れ状態蒸留は、63%から87%の範囲で2.1から4.5ポイントを加え、CogACTでは63%以降で9.4から22.1ポイントを加えた。CogACTを81%削減した場合、復元予算を3倍にすると、蒸留した生徒と教師の平均差は3.9ポイントに縮まったが、教師あり復元は20ポイント超の差を保った。同じ圧縮率では、幅剪定は高い成功率を、深さ剪定は低い遅延をもたらした。6自由度マニピュレータでは、72%削減した蒸留生徒モデルの成功率は、教師あり復元の59.5%に対して77.5%となり、機上で教師モデルの2.23倍速く動き、メモリ使用量は62%少なかった。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Vision-language-action (VLA) models let robots follow language instructions, but their language backbones of several billion parameters are the main obstacle to running them on robot hardware. Structured pruning reduces that backbone, and removing 63% of it from OpenVLA-OFT drops LIBERO-Long success from 93.2% to 0.8%. A recent approach restores such a model with supervised fine-tuning followed by reinforcement learning, which needs online rollouts and hundreds of GPU-hours. We recover most of the lost success entirely offline. Width pruning narrows the blocks but keeps the residual stream at its original size, so teacher and student hidden states have the same shape and are matched directly, without a projector. Training against a cache built in one teacher pass lifts the 63%-reduced student to within 3.5 points of the teacher in about 8 GPU-hours. A sweep over nine ratios locates where the recovery objective starts to matter. Up to 45% reduction the two do not differ significantly on OpenVLA-OFT. Hidden-state distillation then adds +2.1 to +4.5 points there between 63% and 87%, and +9.4 to +22.1 points on CogACT from 63% onward. At 81% on CogACT, a tripled recovery budget narrows the distilled student's gap to the teacher to 3.9 points on average, while supervised recovery stays more than 20 points below. At matched compression, width pruning yields higher success and depth pruning lower latency. On a 6-DoF manipulator, the distilled student at 72% reduction reaches 77.5% success against 59.5% for supervised recovery, runs 2.23x faster on-board than the teacher, and uses 62% less memory.

著者のコメント

Preprint

arXiv ID: 2609.19579 / 要約の誤りについて