生成済み文章を手掛かりに秘匿通信の復号誤りを減らす
Feedback Coding Enables Inference-Time Covert Agentic Communication
この論文をやさしく読む
ひとことで言うと
普通の生成文章に隠した短い情報を、受信側がモデル内部を知らなくても読み取れるようにする研究です。すでに生成された文章を双方が見られることを、誤りを減らす手掛かりにしています。
何に役立つ?
生成文章が意図しない情報伝達経路になり得る範囲を、評価するための研究材料になります。要旨の結果は秘匿通信の成立性の評価であり、検知や防止の実証ではありません。
この研究の面白いところ
文章生成を一度きりの埋込みではなく、途中までの結果を利用する逐次通信として扱っています。情報理論に基づく設計と、暗号学的な安全性の証明を分けて提示しています。
どこまで分かった?
0〜0.1%という誤り率は、3モデル、8ビット、約50トークン、1,000試行という実験条件での値です。安全性証明の前提や実環境での検知可能性の詳細は要旨に示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデル(LLM)がデジタル上のやり取りの自動化にますます使われるにつれ、利用者はLLMが生成する文章を隠れみのにして、一見無害な会話の中で秘匿通信を行えるようになっている。しかし既存のLLMステガノグラフィは主としてホワイトボックス型であり、送信者と受信者が、通常はモデルの重みとプロンプトへのアクセスを通じて、隠れみのとなる文章の統計情報を共有する必要がある。ブラックボックス方式は、受信者が生成文章だけで動作できるようにしてこの要件を取り除くが、現在の手法は固定長かつ開ループの透かし埋込み技術に依存しており、生成トークン長が可変の場合には復号誤り率が高い。我々は、ブラックボックスLLMステガノグラフィを、因果的かつ無雑音のフィードバックを伴う逐次通信問題として捉え直す。生成された各トークンは双方が観測し、その後の埋込みを導くことができる。この観点に基づき、事後分布マッチングと復号・確認段階を組み合わせるフィードバック符号化方式Burnashev Adaptive Posterior Matching(BAM)を導入する。その設計は古典的な情報理論のフィードバック符号化原理に着想を得ており、安全性は暗号学的な帰着証明によって確立される。重みが公開された3つの言語モデルにおける1,000試行の実験で、BAMは8ビットのペイロードを約50トークンに載せた際、経験的なメッセージ誤り率0〜0.1%を達成した。同程度の長さで最も強いブラックボックスのベースラインは10〜17%だった。提案したステガノグラフィアルゴリズムを基に、複数の会話設定で高い通信レートを達成する、端から端までの通信プロトコルが実現可能であることも示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
As large language models (LLMs) are increasingly used to automate digital interactions, users can leverage LLM-generated text as cover for covert communication within seemingly benign conversations. Existing LLM steganography, however, is predominantly white-box, requiring the sender and receiver to share the cover statistics, typically through access to the model weights and prompt. Black-box schemes remove this requirement by allowing the receiver to operate solely on the generated text, but current approaches rely on fixed-length, open-loop watermarking techniques that suffer from high decoding error rates under variable-length token generation. We recast black-box LLM steganography as a sequential communication problem with causal, noiseless feedback: every generated token is observed by both parties and can guide subsequent embedding. Based on this perspective, we introduce \textbf{B}urnashev \textbf{A}daptive Posterior \textbf{M}atching (BAM), a feedback-coding scheme that combines posterior matching with a decode-and-confirm phase. The design is inspired by classical information-theoretic feedback-coding principles, while its security is established through a cryptographic reduction proof. Across three open-weight language models, we demonstrate that BAM attains 0-0.1\% empirical message error on an 8-bit payload in around 50 tokens, across 1000 trials, versus 10-17\% for the strongest black-box baseline at comparable length. Building on the proposed steganography algorithm, we demonstrate the feasibility of an end-to-end communication protocol that achieves high communication rates across multiple conversational settings.
arXiv ID: 2609.24994 / 要約の誤りについて