arXiv論文メモ
新着一覧
stat.ME / stat.CO · 査読状況未確認

拠点間の違いを補正し不正な報告に耐える分散回帰

Heterogeneity-calibrated Byzantine-robust distributed composite quantile regression

Xiaofei Wu and Jian Qing Shi

この論文をやさしく読む

ひとことで言うと

データ分布が機関ごとに異なり、一部が偽の報告を送る分散回帰で、正常な差と攻撃の影響を分けて推定する方法です。

何に役立つ?

複数機関の分位点回帰を頑健に集約するための設計です。シミュレーションと自転車需要データを用いた検討が行われています。

この研究の面白いところ

正常な機関の曲率が違うと、中間的な偽報告は単純な刈り込みを通過し得ます。局所切片とヘッセ行列に基づく補正を入れてから、座標ごとの刈り込みとしきい値処理を行います。

どこまで分かった?

正常な機関が共通の傾きを持つ設定です。傾きを無制限に異ならせると故障機関不明のもとで平均傾きを識別できないことも示し、保証には別途条件を置いています。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

正常な拠点間に異質性があり、ビザンチン型の不正動作をするワーカーも含まれる分散データを対象に、疎な複合分位点回帰(CQR)を研究する。正常な拠点は共通の傾き係数を持つが、共変量の分布、誤差分布、分位点ごとの切片は異なってよい。提案する異質性補正付き頑健CQR(HC-RCQR)は、局所的な切片をプロファイル化し、プロファイル・ヘッセ行列の近似逆行列を使ってスコアを補正する。正常なワーカーはこうして得られるベクトルを送信する一方、ビザンチン・ワーカーは任意のベクトルを送信できる。サーバーは座標ごとのトリミングとソフトしきい値処理によって推定値を更新する。 スカラーの例により、正常な拠点間で曲率が異なると中間的な値を持つ不正な報告がトリミングをすり抜けること、また理想的な補正がそれらの及ぼし得る影響をどう減らすかを示す。さらに、どの拠点が不正か分からない場合、正常拠点の傾き係数に制約を課さなければ、その平均を識別できないことを確立する。 適切な条件の下で、条件付きの収縮性とサポート回復の保証を確立する。評価式では、スコアのオフセット、標本変動、汚染、補正誤差、ニュートン法の剰余項を分離する。シミュレーションと自転車需要の研究により、異質なデータと敵対的なメッセージがある状況での性能を検討する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We study sparse composite quantile regression (CQR) for distributed data with heterogeneous honest sites and Byzantine workers. Honest sites share a common slope but may differ in their covariate distributions, error laws, and quantile intercepts. The proposed heterogeneity-calibrated robust CQR (HC-RCQR) profiles local intercepts and calibrates scores using an approximate inverse profile Hessian. Honest workers transmit the resulting vectors, whereas Byzantine workers may send arbitrary vectors. The server updates the estimate by coordinatewise trimming and soft thresholding. A scalar example shows how unequal honest-site curvatures allow intermediate Byzantine reports to survive trimming and how ideal calibration reduces their possible effect. We also establish nonidentification of the mean of unrestricted honest-site slopes when fault identities are unknown. Under suitable conditions, we establish conditional contraction and support-recovery guarantees. The bound separates score offset, sampling fluctuation, contamination, calibration error, and the Newton remainder. Simulations and a bike-demand study examine performance under heterogeneous data and adversarial messages.

arXiv ID: 2609.19701 / 要約の誤りについて