視覚言語モデルの説明を使って飛び込み競技を採点する
Can Vision-Language Models Judge Olympic Diving? From Reasoning to Scores in Zero-Shot Action Quality Assessment
この論文をやさしく読む
ひとことで言うと
飛び込み映像を見たAIの点数をそのまま使うだけでなく、AIが文章で述べた評価理由を別の回帰モデルへ入れる研究です。
何に役立つ?
考えられる用途は、理由を示せるスポーツ動作評価の補助です。人間の審判を置き換えることではなく、説明を利用する半自動評価の可能性を検討しています。
この研究の面白いところ
AIが出す生の部分点より、評価理由の文章を数値化した特徴量の方が役立ちました。説明文に含まれる情報が、直接の点数より豊かである可能性を示します。
どこまで分かった?
AQA-7での評価で、相関0.67は四モデルを使う回帰の結果です。VLM単独のゼロショット結果は0.32未満で、回帰を含む全体を無学習と扱えません。原文のコードURLには空白が含まれています。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
オリンピック競技における動作の質の自動評価(AQA)は、人間の動作の複雑さと専門家の採点に内在する主観性のため、依然として難しい課題である。本研究では、AQA-7ベンチマークデータセットを使い、オープンソースの視覚言語モデル(VLM)がオリンピックの飛び込み映像をゼロショットで評価する能力を検討する。 そのため、VLMが生成する意味的な推論と局面ごとの部分点を利用し、TF-IDFによるベクトル化、次元削減、アンサンブル学習を組み合わせて最終的な競技得点を予測する、回帰ベースの枠組みを提案する。実験では、VLM単独のスピアマン相関は0.32未満の中程度の値だった。一方、提案するアンサンブル回帰の枠組みは、報告された評価で性能を大きく改善し、四つのモデルを用いる構成でスピアマン相関0.67に達した。 文章による推論の特徴量は、生の数値の部分点を一貫して上回り、VLMが生成する説明に動作の質を分析する豊かな情報があることを示した。これらの知見は、VLMが説明可能で半自動的なスポーツの実技評価を補助するツールとして高い可能性を持つことを示唆する。コードはGitHubで公開されている(原文記載のURL:https://github.com/hvelesaca/olympic diving judge vlm)。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Automated action quality assessment (AQA) in Olympic sports remains a challenging task due to the complexity of human motion and the subjectivity inherent in expert judging. This work evaluates the capability of open-source Vision-Language Models (VLMs) to perform zero-shot action quality assessment on Olympic diving videos using the AQA-7 benchmark dataset. In this regard, a regression-based framework is pro-posed to leverage both the semantic reasoning and phase-level sub-scores generated by the VLMs, combining TF-IDF vectorization, dimensionality reduction, and ensemble learning to predict final competition scores. Experimental results show that standalone VLMs achieve moderate Spearman correlations below 0.32, while the proposed ensemble regression framework substantially improves performance in the reported evaluation, reaching a Spearman correlation of 0.67 with a four-model configuration. Textual reasoning features con-sistently outperformed raw numerical sub-scores, highlighting the richness of VLM-generated explanations for action quality analysis. These findings suggest that VLMs hold strong potential as assistive tools for explainable and semi-automated sports performance evaluation. The code is publicly available on GitHub https://github.com/hvelesaca/olympic diving judge vlm
arXiv ID: 2609.19354 / 要約の誤りについて