arXiv論文メモ
新着一覧
stat.ME / stat.CO / stat.ML · 査読状況未確認

外れ値があっても重要な説明変数を選ぶ二段階法

Robust Dual-Regularized Variable Selection under Outlier Contamination

Abdul-Nasah Soale, Adewale F. Lukman, and Essoham Ali

この論文をやさしく読む

ひとことで言うと

極端な観測値に引っ張られず、予測に本当に関係する変数を選ぶ統計手法です。局所的な変化を推定してから、その情報をまとめて変数を選びます。

何に役立つ?

考えられる用途は、異常値を含む多変量データでの変数選択です。要旨では大気汚染とゲノムデータへの適用を報告しています。

この研究の面白いところ

各局所回帰がそれぞれ正しい変数を選べることを前提にせず、まとめた勾配行列から有効集合を復元する理論を示します。応答側と説明変数側の異常を両方扱います。

どこまで分かった?

対象は単一指数モデルで、性能比較は指定のシミュレーションと実データです。要旨には許容できる混入率や理論仮定の詳細がなく、任意の外れ値に無条件で対応する保証ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

実データには、変数選択へ不釣り合いに大きな影響を及ぼす異常な観測がしばしば含まれ、複雑な予測変数設定では特に問題になる。本研究では、外れ値混入のある単一指数モデルで変数を選択する、二段階の疎な中央値勾配外積(smOPG)法を提案する。まず、ℓ₁罰則付き局所中央値回帰を用いて疎な局所勾配を推定する。次に、正則化特異値分解を用い、得られた勾配行列のランク1の疎な近似から有効な予測変数の集合を復元する。中央値回帰と局所重み付けの組み合わせにより、応答変数の外れ値と高レバレッジ点の両方に対する頑健性が得られる。 次元と混入機構を変えた広範なシミュレーションで、smOPGは既存手法に比べて良好な変数選択性能を示す。大気汚染データとゲノムデータへの適用は実用上の有用性を示し、理論では個々の局所回帰の選択一致性を要求せずに有効変数集合の復元を確立する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Real data often contain unusual observations that can exert disproportionate effects on variable selection, especially in complex predictor settings. We propose a two-stage {\it sparse median outer product of gradients (smOPG)} method for variable selection in single index models with outlier contamination. We first estimate sparse local gradients via \(\ell_1\)-penalized local median regression and then recover the active predictor set from a rank-one sparse approximation of the resulting gradient matrix using regularized singular value decomposition. The combination of median regression and local weighting provides robustness to both response outliers and leverage points. Extensive simulations across varying dimensions and contamination mechanisms demonstrate the favorable variable selection performance of smOPG relative to existing methods. Applications to air pollution and genomic data demonstrate practical utility, while theory establishes active-set recovery without requiring selection consistency of individual local regressions.

arXiv ID: 2609.21342 / 要約の誤りについて