arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

画像の修復途中の状態に合わせて道具の使い方を学ぶ

SkillIR: Evolving Scene-Aware Skills for Agentic Image Restoration

Jie Shao, Shengkai Hu, Xu Zhang, Beihang Song, Yongcheng Jing, Xu Wu, Jun Wan

この論文をやさしく読む

ひとことで言うと

画像を直すたびに残る傷みが変わることを踏まえ、一手ずつ結果を確かめながら次の修復ツールを選ぶ仕組みです。

何に役立つ?

複数の劣化が重なる画像で、途中の状態に合わない処理を続けることを避けるために役立ちます。研究では合成画像と実世界画像のデータセットで評価しています。

この研究の面白いところ

過去の成功手順を丸ごと再利用する代わりに、各操作がどんな状況で効いたかをスキルとして蓄えます。成功だけでなく失敗もスキルの修正に使います。

どこまで分かった?

要旨には品質改善の具体的な数値や、状態遷移の検証方法の詳細はありません。修復結果の候補を検証する仕組みであり、元の画像内容を常に正確に復元できる保証とは述べられていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

本論文は、マルチモーダルなエージェントが専用の修復ツールを連携させ、複雑な劣化のある画像を回復する、エージェント型画像修復を研究する。既存の修復エージェントは、元の劣化画像からツール使用の計画全体を導くか、過去に成功した処理の軌跡を検索することが多く、変化していく修復途中の状態に個々の操作を適応させる支援が限られている。本研究では、採用されたツール実行によって残存劣化の状態が変わり、その結果、後続のツールの適用可能性も変わることを見いだす。 この問題に対処するため、修復経験をツール使用の完全な軌跡ではなく、劣化を中心とした操作の根拠として表す、スキルに導かれる枠組みSkillIRを提案する。SkillIRは、文脈に依存する操作結果を、適用条件、期待される効果、原因を対応付けられる失敗例を特徴付けた、場面に応じた修復スキルへまとめる。検索したスキルは修復計画全体を指定する代わりに、残存状態を検証するループの中で、一度に範囲を限定した一つの操作を導く。各ツール出力は候補として扱い、状態遷移を検証してから採用し、その後に現在残っている劣化を再評価する。 各ロールアウト後には、得られた根拠を動的スキルの作成、洗練、修正に使い、蓄積された修復経験によって次の入力に対する意思決定を改善する。合成および実世界の複数劣化データセットでの実験は、SkillIRが修復品質を高め、より信頼性が高く効果的なツール使用を可能にすることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

This paper studies agentic image restoration, in which multimodal agents coordinate specialized restoration tools to recover images affected by complex degradations. Existing restoration agents often derive complete tool-use plans from the original degraded image or retrieve previously successful trajectories, providing limited support for adapting individual actions to evolving intermediate restoration states. We find that accepted tool executions can change the residual degradation state and, consequently, the applicability of subsequent tools. To address this issue, we propose SkillIR, a skill-guided framework that represents restoration experience as degradation-centered action evidence rather than complete tool-use trajectories. SkillIR consolidates context-dependent action outcomes into scene-aware restoration skills that characterize applicable conditions, expected effects, and attributable failure cases. Instead of prescribing a complete restoration plan, the retrieved skills guide one bounded action at a time within a verified residual-state loop: each tool output is treated as a candidate, committed only after transition verification, and followed by reassessment of the active residual degradations. After each rollout, the resulting evidence is used to create, refine, or patch dynamic skills, enabling accumulated restoration experience to improve decision-making for subsequent inputs. Experiments on synthetic and real-world multi-degradation datasets demonstrate that SkillIR improves restoration quality and enables more reliable and effective tool use.

arXiv ID: 2609.21468 / 要約の誤りについて