arXiv論文メモ
新着一覧
cs.AI / cs.LO / cs.SC · 査読状況未確認

論理ソルバーでAIの推論途中を点検するLogicTrack

LogicTrack: Auditing Reasoning Trajectories of Large Language Models with Formal Logic Solvers

Jingyu Hu, Shu Yang, Weiru Liu, Di Wang

この論文をやさしく読む

ひとことで言うと

AIの最終回答だけでなく、途中の論理が正しいかを定理証明器で確認し、問題があれば戻って考え直させる仕組みです。その点検過程を学習データにも使います。

何に役立つ?

論理的な推論過程を点検したい問題で、回答の正しさと途中の妥当性を併せて改善する方法として役立ちます。高い信頼性を要する分野への応用は著者が目指す方向です。

この研究の面白いところ

形式化、論理チェック、後戻り探索を連結し、推論時だけでなく微調整にも同じ軌跡を利用します。正解でも途中に誤りがあり得るという評価上の問題に取り組んでいます。

どこまで分かった?

報告された実証は8ベンチマークと7モデルでの比較です。要旨には自動形式化の誤り率や計算コストの数値はなく、実務の高リスク判断全般の安全性を保証した結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

思考の連鎖(CoT)による推論は大規模言語モデル(LLM)の性能を改善すると示されてきたが、既存の最適化手法は主として最終結果に基づくフィードバックに依存し、中間推論段階の論理的妥当性は大部分が未検証のままである。論理的に欠陥のある中間推論の連鎖を通じてLLMが正しい最終回答に達するという問題に対処するため、各推論段階を記号表現へ自動的に形式化し、自動定理証明器で検証することで推論の軌跡を監査する、ニューラル・シンボリックな枠組みLogicTrackを提案する。 LogicTrackは、論理的健全性を定量化し、推論時の後戻りを伴う木探索を導く、段階ごとの採点機構Solver-Based Backtracking Reward(SBR)を導入する。さらにLogicTrackを拡張し、その推論軌跡から後戻りの履歴を含む教師あり微調整(SFT)データを構築する。これにより、微調整されたモデルが、段階ごとの監査を内在的な能力として身に付けられるようにする。8つの推論ベンチマークと7つのLLMにわたる広範な実験は、LogicTrackが推論連鎖の検証可能性と最終回答の合格率の双方を効果的に改善し、その結果として、高い信頼性を要する領域でのCoT全体の品質と信頼性を高めることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Chain-of-Thought (CoT) reasoning has been shown to improve the performance of large language models (LLMs), yet existing optimization methods largely rely on outcome-based feedback, leaving the logical validity of intermediate reasoning steps largely unverified. To address the gap whereby LLMs arrive at correct final answers through logically flawed intermediate reasoning chains, we propose LogicTrack, a neuro-symbolic framework that audits reasoning trajectories by auto-formalizing each reasoning step into symbolic representations and verifying it with automated theorem provers. LogicTrack introduces Solver-Based Backtracking Reward (SBR), a step-wise scoring mechanism that quantifies logical soundness and guides backtracking tree search at inference time. We further extend LogicTrack to construct supervised fine-tuning (SFT) data with backtracking traces from its trajectories, enabling fine-tuned models to internalize step-wise auditing as an intrinsic capability. Extensive experiments across 8 reasoning benchmarks and 7 LLMs demonstrate that LogicTrack effectively improves both the verifiability of reasoning chains and final answer pass rate, thereby enhancing overall CoT quality and trustworthiness in high-stakes domains.

arXiv ID: 2609.21492 / 要約の誤りについて