arXiv論文メモ
新着一覧
cs.AI · 査読状況未確認

ゲームのテスト目標をPDDLに変換する6つの言語モデルを比較

Which LLM is Best for Translating Natural Language Goals to PDDL

Tomas Balyo and Lukas Chrpa and G. Michael Youngblood

この論文をやさしく読む

ひとことで言うと

ゲームテスターが普段の言葉で書いた目標を、自動計画ツールが使えるPDDLに直す能力を6つのLLMで比較した研究です。

何に役立つ?

テスト担当者が形式言語を手書きする負担を減らすため、変換モデルやプロンプトを選ぶ参考になります。正確さと応答速度で最良のモデルが異なる点も判断材料です。

この研究の面白いところ

全モデルが92%超でも、最高の正解率、偽陽性の少なさ、速度を分けて評価しています。単一の順位だけでは用途に合う選択を決められません。

どこまで分かった?

結果は使われたゲームテスト領域のベンチマークとプロンプトに関するものです。言語の曖昧さや領域表現の限界による失敗が残ると報告されており、無検査での変換を保証する結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

人の意図と機械による実行の隔たりを埋めることは、自動計画における課題であり続けている。PDDLのような形式言語で目標を表現する必要があるため、専門家でない人には利用しにくい。本稿では、ビデオゲームのテスターが非形式的な言葉で記した自然言語のテスト目標を、現在の大規模言語モデル(LLM)が、古典的計画に適した構文的に整ったPDDLの目標へ確実に変換できるかを実証的に評価する。 反復的な実験から得た知見を取り込み、複数の最先端LLMの正確さと応答の整合性を最大化することを狙って、慎重に設計したプロンプトのテンプレートを提示する。現実の領域特化ベンチマークを使い、6つの現行モデルの正確さ、速度、誤りの傾向を体系的に評価する。すべてのモデルが92%を超える高い正解率を示した。Gemini 2.5 Flashは96%で最高の正解率を達成し、偽陽性の発生も最も少なかった一方、GPT-4.1は応答速度で最も優れていた。 こうした進歩にもかかわらず、モデル性能には重要な違いがあり、言語の曖昧さや領域表現の限界に起因する失敗が時折起こる。本分析は、自然言語の目的と自動計画の処理系を結ぶ堅牢な橋渡し役としてLLMを使ううえで、大きな進展と、なお残る隔たりの双方を示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Bridging the gap between human intent and machine execution remains a challenge in automated planning, where expressing goals in formal languages like PDDL restricts accessibility to non-experts. This paper empirically evaluates whether current Large Language Models (LLMs) can reliably translate natural language testing goals, written in informal language by video game testers, into well-formed PDDL targets suitable for classical planning. We present a carefully designed prompt template, integrating insights from iterative experimentation, aimed at maximizing both accuracy and response coherence from multiple state-of-the-art LLMs. Six contemporary models are systematically assessed on correctness, speed, and error tendencies using real-world, domain-specific benchmarks. All models demonstrate high correctness, exceeding 92\%, with Gemini 2.5 Flash achieving the highest accuracy at 96\% and the lowest incidence of false positives, while GPT-4.1 leads in response speed. Despite these advances, critical distinctions exist in model performance, and occasional failures arise from language ambiguity and limitations in domain representation. Our analysis underscores both the significant progress and ongoing gaps in enabling LLMs to act as robust bridges between natural language objectives and automated planning pipelines.

arXiv ID: 2609.18731 / 要約の誤りについて