LLMによる利用者操作の模擬からWebサイト改善案を作る
Automatic multimodal UX improvement recommendations from LLM agent user simulations
この論文をやさしく読む
ひとことで言うと
LLMでWebサイトの利用者操作を模擬し、その記録から優先順位付きのUX改善案を自動生成した。
何に役立つ?
WebサイトのUX評価で、改善候補を見つけて優先順位を付ける作業に役立つ可能性がある。
この研究の面白いところ
模擬中の視覚情報は有効だったが、改善案を作る段階で画像を渡すと品質が少し下がり得るという非対称性がある。
どこまで分かった?
示された結果は評価した商用Webサイトと専門家・LLM判定の手順に基づく。実際の利用者による改善後の効果は要旨に示されていない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
稼働中のWebサイトのユーザー体験(UX)を利用者テストで評価することは、費用がかかり、主観的で、大規模化が難しい。LLMエージェントによる現実的な利用者行動の模擬は、UXテストの自動化に向けた有望な方法である。しかし既存の模擬手法は一般に複数の情報形式を扱わず、実行可能な知見を取り出すために時間のかかる手作業の確認を要する。そこで、模擬データからUX改善案を作る問題を、構造化された自然言語生成と順位付けの問題として定式化し、専門家の注釈とLLMによる判定を使う評価手順を定める。複数の情報形式で利用者行動を模擬し、得られたデータから優先順位付きのUX改善案を自動生成する枠組みAMUSERを提示する。商用Webサイトで評価したところ、改善案はテキストのみの模擬による案を大きく上回り、NDCG@3は0.758対0.359だった。模擬の費用も89%低かった。結果は、複数の情報形式が段階によって異なる役割を持つことを示唆する。模擬時の視覚情報へのアクセスは記録を豊かにして改善案を向上させる一方、改善案の生成時に画像を入力すると品質がやや低下し得る。AMUSERを商用Webサイトに適用した際の運用上の知見も論じる。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-19(UTC)
- 最新改訂
- 2026-09-19 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-19 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Evaluating user experience (UX) on live websites through user testing is expensive, subjective, and difficult to scale. LLM agents offer a promising route to automating UX testing by simulating realistic user behaviour. However, existing simulation approaches typically lack multimodality and require time-consuming manual review to extract actionable insights. We formalise UX improvement recommendation from simulation data as a structured natural language generation and ranking problem, and establish an evaluation protocol using expert annotation and LLM-as-a-Judge. We present AMUSER, a multimodal framework which simulates user behaviour and automatically generates prioritised UX improvement recommendations from resulting data. We evaluate AMUSER on commercial websites and show that its recommendations substantially outperform those from text-only simulation (NDCG@3 = 0.758 versus 0.359) at an 89% lower simulation cost. Our results suggest an asymmetric role of multimodality: visual access during simulation improves recommendations through richer traces, while providing visual inputs during recommendation generation can modestly degrade quality. We also discuss practical deployment lessons from applying AMUSER to commercial websites.
arXiv ID: 2609.22971 / 要約の誤りについて