広告目的をまたいで入札を学ぶ統合モデルOneBid
OneBid: A Unified Auto-Bidding Foundation Model for Diverse oCPX Advertising Scenarios
この論文をやさしく読む
ひとことで言うと
登録や購入など、広告の目的ごとに分かれていた入札モデルを共通の基盤へまとめる研究です。共通知識を学びつつ、目的に合わせた追加学習で使い分けます。
何に役立つ?
広告シナリオごとのモデル管理を統合し、費用の制約を考慮して入札を改善する用途です。著者らはKuaishouでのオンラインA/Bテストと全面導入を報告しています。
この研究の面白いところ
価値とコスト比率を別々の条件信号にし、共有・専用エキスパートを組み合わせています。追加学習ではオンライン探索を行わず、評価器による相対採点と方策変化の制約を使います。
どこまで分かった?
全体2.2%とROASシナリオ最大13.1%は、要旨で報告されたADVVの改善です。ADVVの詳細定義や試験期間は要旨にないため、利益や売上の増加率と置き換えることはできません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
自動入札は計算広告の中心的要素であり、その戦略は経済的制約のもとで広告主のコンバージョン価値を最大化しなければならない。ルールベースの制御器から強化学習、Decision Transformer(DT)などの生成的手法へ進化してきた。しかし、これらの手法は現在主流の最適化された成果単価(oCPX)の枠組みとの不整合が大きくなっている。oCPXは登録や購入など異種のシナリオにまたがり、それぞれを別モデルで扱うため、処理パイプラインが分断され、シナリオをまたいだモデル化が十分に探索されていない。LLMのような基盤モデルに着想を得て、一つのモデルにoCPXシナリオを統合する場合、多目的制御、厳しい遅延制約のもとでの容量拡張、安全なオフライン方策改善という三つの課題が生じる。 本研究では、異種oCPXログから再利用可能な基幹モデルを学び、オフラインの事後学習を通じてシナリオ別の運用へ適応させる統合自動入札基盤モデルOneBidを提示する。DTを基に、単一のReturn-to-Goによる条件付けを、コンバージョン価値を表すReturn-to-Goとコスト比率を表すCost-to-Goという二つの基本信号へ拡張し、次の行動の予測に価値を考慮した正則化を加える。分布の異質性を吸収するため、系列単位のMixture-of-Experts構造を設計する。共有エキスパートがシナリオ横断の知識を符号化し、疎に振り分けられるエキスパートが低遅延でシナリオ固有のパターンを捉え、モデルとデータの規模に応じた一貫した性能向上を得る。 事後学習では、Critic-guided Relative Offline Policy optimization(CROP)により基幹モデルを各シナリオの選好に合わせる。学習した評価器が候補行動をグループ内で相対評価することで、GRPO型の微調整に伴う安全でないオンライン探索を避け、同時に方策の変化を制約して分布外(OOD)リスクを減らす。オンラインA/Bテストで検証され、Kuaishouに全面導入されたOneBidは、oCPX広告全体でADVVを2.2%改善し、ROASシナリオでは最大13.1%改善した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Auto-bidding is central to computational advertising, where strategies must maximize advertisers' conversion value under economic constraints. It has evolved from rule-based controllers to reinforcement learning and generative methods such as Decision Transformer (DT). Yet these methods increasingly mismatch the prevailing optimized cost-per-X (oCPX) paradigm, which spans heterogeneous scenarios (e.g., registration, purchase), each served by a separate model, leading to fragmented pipelines and underexploring cross-scenario modeling. Inspired by foundation models like LLMs, unifying these oCPX scenarios into one model raises three challenges: multi-objective control, scalable capacity under strict latency, and safe offline policy improvement. We present OneBid, a unified auto-bidding foundation model that learns a reusable backbone from heterogeneous oCPX logs and adapts it to scenario-specific deployments via offline post-training. Building on DT, OneBid extends single Return-to-Go conditioning to two atomic signals, Return-to-Go for conversion value and Cost-to-Go for cost ratio, plus value-aware regularization on next-action prediction. To absorb distributional heterogeneity, we design a sequence-level Mixture-of-Experts architecture, where shared experts encode cross-scenario knowledge and sparsely-routed experts capture scenario-specific patterns at low latency, yielding consistent scaling with model size and data. During post-training, we align the backbone with scenario preferences via Critic-guided Relative Offline Policy optimization (CROP): a learned critic scores candidate actions group-relatively, avoiding the unsafe online exploration of GRPO-style fine-tuning while constraining policy shift to reduce OOD risk. Validated via online A/B tests and fully deployed at Kuaishou, OneBid delivers an overall +2.2% ADVV gain on oCPX Ads, peaking at +13.1% in the ROAS scenario.
arXiv ID: 2609.21550 / 要約の誤りについて