複数セッションの画像と文章を保持する長期記憶
C3M: Cross-Session Multimodal Memory Maintenance for Long-Horizon Tasks
この論文をやさしく読む
ひとことで言うと
画像と文章の記録を、後で出典や時間の違いを確かめられるように圧縮・検索する仕組み。
何に役立つ?
長い作業をセッションをまたいで進めるシステムで、限られた記憶容量から元の証拠へ戻る設計に役立つ。
この研究の面白いところ
似た記録を統合する一方、矛盾する記録は残し、質問時に必要な元の画像・文章へたどれる索引を使う。
どこまで分かった?
要旨には具体的なベンチマーク数値や比較性能が示されていない。提案構成の効果の量は要旨だけでは判断できない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
長期にわたるタスクでは、容量が限られ、将来の質問も分からない記憶の中に、セッションをまたぐ証拠を保存し、後で取り出す必要がある。既存の圧縮方法は細かな画像上の手掛かりを捨てたり、意味は似ていても両立しない観測を混同したりすることがある。著者らは、永続的な文章・画像の元証拠を参照する、容量を制限した活動中の索引を維持する、セッション横断のマルチモーダル記憶構成C3Mを提示する。関係を考慮した更新によって、安全にまとめられる重複を統合しながら、相補的な記録と互いに両立しない記録を保持する。質問時には、予算を定めた経路選択で有用な索引ページを選び、読み手に割り当てられた固定予算内で関連する元証拠を展開する。これらの仕組みにより、時間的な違いと元資料へのリンクを保ち、後段の推論に必要な情報を維持する、コンパクトなマルチモーダル記憶構成を実現する。コードは公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Long-horizon tasks require preserving and later recovering cross-session evidence under a bounded, query-blind memory budget. Existing compression can discard fine-grained visual cues or conflate semantically similar but incompatible observations. We present C3M, a cross-session multimodal memory organization that maintains a bounded active index over persistent source text-image evidence. Relation-aware updates consolidate safe redundancy while preserving complementary and incompatible records. At query time, budgeted routing selects useful index pages and expands their associated source evidence under a fixed reader budget. Together, these mechanisms establish a compact, provenance-preserving multimodal memory organization for cross-session long-horizon tasks, retaining temporal distinctions and source links required for reliable downstream reasoning. Code is available at https://github.com/HuzhouNLP/C3M.
arXiv ID: 2609.29735 / 要約の誤りについて