ロボットの動作を保ちながら視覚言語行動モデルを低ビット化
FoldQuantVLA: Native Low-Bit Quantization of Vision-Language-Action Models via Consistent Folding
この論文をやさしく読む
ひとことで言うと
ロボットを動かすAIの数値精度を下げて高速化しつつ、動作が崩れやすい一部の計算は高めの精度に保つ方法です。
何に役立つ?
計算資源の限られたロボット上で、推論の速さと動作成功率の両立を検討するのに役立ちます。Orinとデスクトップでの高速化に加え、実機課題も評価されています。
この研究の面白いところ
重要な射影だけを8ビットに戻すと、追加遅延1ミリ秒で実機成功率が80.0%から92.5%へ上がりました。これは12.5ポイントの改善で、比較相手は一律4ビットの構成です。
どこまで分かった?
実機の数値はGR00T N1.7の4課題、構成ごと80試行で得られたものです。すべてのロボット動作で同じ改善が得られるとは限らず、要旨ではその範囲を超える評価は述べられていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
視覚言語行動モデルの低ビット推論では、ロボットの振る舞いを維持しつつ、観測から行動までの遅延を減らす必要がある。本研究では、較正、重みの丸め、ネイティブな整数演算による実行を通じて、一貫した活性値表現を維持する学習後量子化フレームワークFoldQuantVLAを提示する。方策を再学習することなく、チャネルのスケーリングおよびブロックHadamard変換を、トークンごとの動的量子化と組み合わせる。 独自のTensorRTプラグインにより、Ada GPUとJetson AGX Orin上で、言語バックボーンと反復型の行動エキスパートの両方の射影計算を、4ビットの重みと活性値(W4A4)で実行する。評価はLIBERO、SimplerEnv、および2種類のロボットプラットフォームにわたる。GR00Tの3つのチェックポイントとπ₀.₅において、W4A4は浮動小数点TensorRTと比べ、Orinで1.20〜1.33倍、デスクトップで1.25〜1.52倍の高速化を達成した。 言語モデルの注意出力射影とフィードフォワードの次元縮小射影を8ビット(W8A8)に維持すると、4つすべてのチェックポイントで、評価用に取り分けたデータに対する行動の忠実度が改善する。4つの実機ロボット課題で、各構成80試行を行ったところ、この構成ではGR00T N1.7の観測成功率が、一律W4A4の80.0%から92.5%へ向上した。Orinで測定された追加遅延は1ミリ秒だった。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Low-bit vision-language-action inference must reduce observation-to-action latency while preserving robot behavior. We present FoldQuantVLA, a post-training quantization framework that carries a consistent activation representation through calibration, weight rounding, and native integer execution. It combines channel scaling and block Hadamard transforms with dynamic per-token quantization, without policy retraining. Custom TensorRT plugins execute projections in both the language backbone and iterative action expert with four-bit weights and activations (W4A4) on Ada GPUs and Jetson AGX Orin. Evaluation spans LIBERO, SimplerEnv, and two robot platforms. Across three GR00T checkpoints and $\pi_{0.5}$, W4A4 achieves $1.20$ to $1.33\times$ speedups over floating-point TensorRT on Orin and $1.25$ to $1.52\times$ on desktop. Retaining language attention-output and feed-forward down projections at eight bits (W8A8) improves held-out action fidelity on all four checkpoints. Across four real-robot tasks, this configuration raises observed GR00T N1.7 success from $80.0\%$ with uniform W4A4 to $92.5\%$ over 80 trials per configuration, with a measured additional Orin latency of 1 ms.
著者のコメント
8 pages, 5 figures, 7 tables. Code: https://github.com/cair-vinuni/FoldQuantVLA
arXiv ID: 2609.24433 / 要約の誤りについて