二つのエージェントによる履歴書選考のアクセスと再現性
When Hiring Becomes Agent-Mediated: Evaluating Access and Recurrence in Two-Agent Résumé Screening
この論文をやさしく読む
ひとことで言うと
採用側と応募者側を別のAIエージェントで表し、証拠をやり取りしてから書類通過を決める方法を調べます。一度だけの履歴書判定と比べ、誰が通るか、繰り返しても通るかを評価します。
何に役立つ?
考えられる用途は、AIを介した書類選考の手続きそのものを評価することです。通過件数だけでなく、候補者に人の審査へ進む機会が安定して与えられるかを見る指標になります。
この研究の面白いところ
二者対話で通過数は増えますが、一回判定で通った応募を落とす変化もあり、単なる基準緩和ではありません。同じ通過数に調整しても選ばれる応募が異なることを示しています。
どこまで分かった?
600組の構成された履歴書・求人ペアでの評価です。二者対話だけで選ばれた事例は再実行で再選されにくく、その差の明確さはモデルによって違います。実際の採用成果や公平性を直接実証した研究ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
採用は双方向の営みである。雇用者は適合性を評価し、候補者は資格の証拠を提示して説明する。しかし最初の関門である履歴書選考は、履歴書と求人の組に対する静的な一回限りの判断として自動化されることが多い。本研究は、雇用者側エージェントと候補者側エージェントがそれぞれの役割を担い、証拠を交換し、誰を次へ進めるか決める前に判断を更新する二エージェント方式を調べる。GPT-5.5とClaude Opus 4.7を用い、構成した履歴書・求人の組600件で手続きを比較した。二エージェント選考は、GPT-5.5では33.3%から39.3%へ、Opus 4.7では34.0%から35.5%へ、より多くの応募を通過させた。共通する境界事例191件について3回実行すると、通過事例率はそれぞれ4.5%から26.2%、6.5%から16.1%へ上昇した。これは一様な緩和ではない。二エージェント選考は、一回判定では通過させる応募を不合格にすることもあり、判断を両方向に変える。同程度の通過数でも、両手続きが進める応募は異なり、一回判定のしきい値を変えても、二エージェント選考が一貫して選ぶ応募を再現できない。発見段階で選ばれた事例を新しい実行で再評価すると、二エージェントだけが選んだ事例は共通選択事例より再現頻度が低かった。これはGPT-5.5では明確で、Opus 4.7では確実性が低かった。一方、別の一回判定の追試では同様の低下は見られなかった。採用が双方のエージェントを介するようになると、どの応募が人による審査へ届くか、またそのアクセスがどれだけ再現されるかを左右するのは、モデルだけでなく選考手続きでもある。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Hiring is bilateral: employers assess fit, while candidates present and defend evidence of their qualifications. Yet résumé screening, the first gate, is commonly automated as a static, one-call judgment over a résumé-job pair. We study a two-agent alternative in which employer-side and candidate-side agents represent these roles, exchange evidence, and update their judgments before deciding who advances. We compare procedures on 600 constructed résumé-job pairs using GPT-5.5 and Claude Opus 4.7. Two-agent screening advances more applications (33.3% to 39.3% for GPT-5.5; 34.0% to 35.5% for Opus 4.7). Across three runs on the common 191-pair borderline pool, pass-instance rates rise from 4.5% to 26.2% and from 6.5% to 16.1%, respectively. This is not a uniform relaxation: two-agent screening rejects applications one-call advances, changing decisions in both directions. At similar pass volumes, the procedures advance different applications, and no one-call threshold recovers applications consistently selected by two-agent screening. Among discovery-selected cases re-executed in fresh runs, two-agent-only selections recur less often than shared selections, clearly under GPT-5.5 and less certainly under Opus 4.7, while a separate one-call follow-up shows no comparable decline. As hiring becomes agent-mediated on both sides, the screening procedure, not only the model behind it, shapes who reaches human review and how reliably that access recurs.
著者のコメント
9 pages, 5 tables, 1 figure. Accepted to the REALM Workshop at EMNLP 2026
arXiv ID: 2609.19530 / 要約の誤りについて