arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

SVG生成の評価基準を指示ごとに作る強化学習

RULER: Instance-aware Rubric Rewards for SVG Generation

Hangyu Ran, Yuhao Zheng, Yingying Zhang, Kevin Qinghong Lin, Han Peng

この論文をやさしく読む

ひとことで言うと

SVG画像生成を、指示ごとに作った6項目の採点基準で評価・強化学習する方法である。

何に役立つ?

考えられる用途は、正解画像や人間の選好ラベルがないSVG生成の訓練と評価である。

この研究の面白いところ

単一の画像スコアではなく、意味・見た目・様式を個別に採点して報酬にした。

どこまで分かった?

報告した改善はMMSVGの二つのデータセットでの評価である。あらゆる図柄や指示で同じ効果が出るとは要旨にない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

自然言語の指示からSVGコードを生成する課題は、唯一の正解画像がない自由度の高い課題であり、評価にも方針の最適化にも忠実な信号を得にくい。自然画像で調整したCLIPや美的評価のような単一数値の尺度は、様式化されたベクター画像には適用しにくく、強化学習の報酬に流用すると報酬の抜け道を突く結果を招く。本研究は項目別の採点基準を用いて両方の問題に取り組む。 まず、視覚言語モデルの判定器に複数軸の採点基準を与えると、サンプル間でも同じ指示内でも、単一数値の尺度より人間の判断との相関がはるかに高いことを実験的に示した。これを基にRULERを導入し、各指示を意味、視覚、様式にまたがる6項目の指示固有の採点基準に変換する。判定用の視覚言語モデルが生成された画像を項目ごとに採点し、重み付きの充足度を細かい報酬としてグループ相対方針最適化で学習する。採点基準は文章だけから作るため、対になる正解SVGも人間の選好ラベルも不要である。 MMSVG-IllustrationとMMSVG-Iconでは、採点基準に基づくスコアがそれぞれ0.432から0.693、0.395から0.683に上昇した。SVG専用モデルを上回り、規模のかなり大きいDeepSeek-V3に並んだ。要素除去実験は、採点基準の設計が自由形式のSVG生成における強化学習の効果を生む主要因だと示した。プロジェクトページも公開されている。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Generating Scalable Vector Graphics (SVG) code from natural-language instructions is an open-ended task without absolute visual ground truth, leaving both evaluation and policy optimization without a faithful signal. Scalar metrics (CLIP, Aesthetic) calibrated on natural images transfer poorly to stylized vector content, and reusing them as RL rewards triggers reward hacking. We address both limitations with rubric-based scoring. We first establish empirically that prompting a vision-language judge with a multi-axis rubric correlates with human judgments far better than scalar metrics, both across samples and within instructions. Building on this finding, we introduce RULER (Instance-aware Rubric Rewards for Reinforcement Learning), which converts each instruction into an instance-aware rubric of six items spanning semantic, visual, and stylistic axes; a judge VLM scores rendered rollouts item-by-item, and the weighted satisfactions form a fine-grained reward optimized via Group Relative Policy Optimization. Because the rubric is derived from text alone, RULER requires neither paired SVG ground truth nor human preference labels. On MMSVG-Illustration and MMSVG-Icon, RULER lifts the rubric score from 0.432/0.395 to 0.693/0.683, surpassing dedicated SVG specialists and matching the substantially larger DeepSeek-V3, with ablations identifying rubric design as the active lever for RL on open-ended SVG generation. The project page is available at https://hangyuran.github.io/RULER/.

arXiv ID: 2609.25270 / 要約の誤りについて