23の画像品質データセットを共通の評価尺度にそろえる
Unifying Image Quality Assessment Datasets: MOSAIQ-500K and MOSAIQ-Bench
この論文をやさしく読む
ひとことで言うと
評価尺度が違う23の画質データセットを、人の評価を基準に同じ尺度へそろえます。
何に役立つ?
異なるデータセットを合わせて画質モデルを学習したり、別のデータセットへの一般化を公平に比べたりするために役立ちます。
この研究の面白いところ
新しい主観評価を共通の目印として単調変換を求め、各データセット内の順位を保ちます。31手法の比較では、同じデータ内の性能と別データでの性能の差を示します。
どこまで分かった?
50万枚超の整合された評価を提供しますが、すべての画像を新規に人が採点したという意味ではありません。コードとデータの公開は採択後の予定で、査読済みとの判定はできません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
画像品質評価(IQA)のデータセットでは、主観評価の手順や評点の尺度が異なるため、得点を直接比較できない。共通の知覚尺度がないことは、複数データセットを用いた学習を妨げ、データセット間での直接評価を不可能にしている。本研究では、新たな主観評価実験を行い、その評点を知覚的な基準点として単調写像を当てはめることで、この問題に対処する。これにより、各データセット内での順位を保ちながら、23のIQAデータセットの既存の得点を共通の品質尺度に配置する。 得られたMOSAIQ-500Kは50万枚を超える画像を含み、著者らの知る限り、知覚的に整合させた主観評価得点を備える最大のIQAデータセットである。また、データセット間評価のためのMOSAIQ-Benchを提案し、31種類のIQA手法を評価する。その結果、同一データセット内での性能とデータセット間での性能には大きな隔たりがあり、特に実環境で生じる歪みで顕著であることが分かった。 整合させた得点には重要な利点がある。複数データセット学習のための専用機構を標準的な回帰損失に置き換えても、同一データセット内では同程度の精度が得られ、データセット間では性能が向上する。したがってMOSAIQは、異質なIQAデータセットを組み合わせ、より汎化能力の高いIQAモデルを学習するための実用的な基盤となる。コードとデータセットは、採択後にivc.uwaterloo.ca/projects/unifying_iqa_datasets/で公開する予定である。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Image quality assessment (IQA) datasets use different subjective protocols and rating scales, so their scores are not directly comparable. The lack of a common perceptual scale hinders multi-dataset training and precludes direct inter-dataset evaluation. We address this by conducting a new subjective experiment and using its ratings as perceptual anchors to fit monotonic mappings that place the existing scores of 23 IQA datasets on a common quality scale while preserving within-dataset rankings. The resulting dataset, MOSAIQ-500K, contains over 500,000 images and is, to our knowledge, the largest IQA dataset with perceptually aligned subjective scores. We also propose MOSAIQ-Bench, an inter-dataset benchmark, and use it to evaluate 31 IQA methods, revealing substantial gaps between intra- and inter-dataset performance, particularly on authentic distortions. The aligned scores offer a key advantage: replacing specialized multi-dataset training mechanisms with standard regression losses yields comparable intra-dataset accuracy and better inter-dataset performance. MOSAIQ thus provides a practical foundation for combining heterogeneous IQA datasets to train more generalizable IQA models. Code and dataset will be made public at ivc.uwaterloo.ca/projects/unifying_iqa_datasets/ upon acceptance.
著者のコメント
6 pages, 5 figures. This work has been submitted to the IEEE for possible publication
arXiv ID: 2609.20247 / 要約の誤りについて