AI 求职面试:70,884 份申请揭示了什么
Tech
AI
AI Hiring
Job Interviews
Voice AI

AI 求职面试:70,884 份申请揭示了什么

一项大规模实地实验发现,结构化 AI 面试带来了积极效果,但并未测试自主招聘。这个边界至关重要。

Uygar DuzgunUUygar Duzgun
Aug 3, 2026
更新於 2026年8月16日
11 min read

AI 求职面试:70,884 份申请揭示了什么

读者对象: 正在评估招聘、HR 运营或高风险工作流程中 AI 应用的中级读者。

一项关于 AI 求职面试的最大规模实地实验之一,并未测试自主招聘。它测试的是一个更狭窄的系统:AI 语音代理进行结构化面试,随后由人类招聘人员审阅录音、文字记录和测试结果,并作出决定。

这一边界带来了一个引人注目的结果。在随机分配到面试条件的 67,056 份符合条件的申请中,使用人类面试官时的录用率为 8.70%,使用 AI 面试官时升至 9.73%,相对增加 12%。入职人数和早期留任率也有所提高。然而,由于人类审核人员成为新的排队环节,AI 工作流程从申请到入职所需的时间反而更长。

实际结论是明确的:AI 可以改善大规模招聘中可重复的信息收集。该研究并未表明 LLM 应该对候选人进行排序、决定谁进入下一轮,或取代负有责任的人类审核。

AI 求职面试实验测试了什么?

Voice AI in Firms 实地实验跟踪了 2025 年 3 月 7 日至 6 月 7 日期间,一家位于菲律宾的招聘流程外包公司收到的 70,884 份申请。这些职位涵盖 48 个招聘岗位、41 个客户账户、19 个城市,以及技术、保险、零售、金融和医疗保健等行业。

研究人员将 67,056 份符合条件的申请随机分为三组:

由人类招聘人员进行面试。
由 AI 语音代理进行面试。
由申请人在真人和 AI 代理之间进行选择。

两类面试官都遵循相同的结构化指南。AI 在通话开始时披露了自己的身份。它还告知申请人,评估面试并决定是否发出录用通知的是人类招聘人员,而不是 AI。

与“AI 招聘人员”这个说法相比,这种设计更为重要。AI 负责收集证据,人类保留决策权。

研究人员测量了什么?

论文测量的结果不止是面试完成情况。研究人员将随机分配的面试条件与录用通知、接受录用、入职、最长四个月的留任率、离职原因,以及可获得的生产力指标联系起来。

结果人类面试官AI 面试官报告的差异
------:---:---:
获得工作机会8.70%9.73%相对增加 12%
入职5.65%6.71%相对增加约 18%
30 天后仍在职4.97%5.85%相对增加约 17%
申请到入职的中位时间20 天24 天AI 工作流程慢了 4 天

录用、入职和 30 天留任数据使用了人类面试官组和 AI 面试官组中的全部随机申请者。后续留任差异仍为正向,但随着样本量缩小,估计结果变得不那么精确。作者还发现,在能够获得生产力数据的已录用员工子样本中,生产力没有显著差异。

由于研究人员对面试官进行了随机分配,这些结果对于本实验而言属于因果估计。它们并不是对每种工作、国家、语音模型或招聘流程的普遍绩效保证。

为什么结构化 AI 面试收集到了更好的证据?

作者将这一机制描述为“受控差异”。人类招聘人员在问题覆盖范围、追问行为,以及何时筛除某人的节点上存在差异。AI 代理更一致地遵循流程,同时仍能提出有针对性的追问。

文字记录分析发现,AI 主导的面试覆盖了更多与工作相关的主题,并为后续的人类评估提供了更多信息。这有助于解释录用率为何更高,而无需假设模型能够独立识别人才。

结构化面试本来就旨在提出可比较的问题,并一致地评估与工作相关的证据。AI 代理让这种运营纪律更容易在数千次通话中重复执行。考虑采用 AI 求职面试的团队,应将流程遵循视为产品要求,而不只是追求对话的逼真程度。

实验也暴露了一个新的瓶颈

AI 代理缩短了从申请到面试的等待时间。在远程条件下,成功申请者使用 AI 后到达面试环节的中位时间为 0.32 天,而使用人类面试官时为 0.51 天。

随后的人类评估拖慢了流程。AI 主导面试后的面试到录用中位间隔为 7.24 天,而人类主导面试后为 2.62 天。AI 组从申请到入职的总中位时间达到 24 天,人类组则为 20 天。

自动化将排队环节转移到了下游。如果审核能力保持不变,招聘团队即使能够进行更多面试,也可能让候选人等待更久。

论文的成本模型也指向同一限制。在高工资环境中,AI 在较低业务量下就能实现成本效益;而在其他情境中,盈亏平衡点则达到数千甚至数万次面试。商业案例取决于工资水平、供应商定价、失败率和审核工作量。仅凭每分钟演示价格无法回答这个问题。

这项研究没有证明什么?

它没有测试自主筛选

所有录用决定都由人类招聘人员作出。他们知道面试是由 AI 还是人类进行的。因此,该实验支持的是 AI 辅助的证据收集,而不是由 LLM 决定谁能获得工作。

推薦閱讀

如果团队加入模型生成的候选人评分、排名、拒绝建议、情绪分析或性格推断,那么它构建的是一个具有不同风险特征的不同系统。任何数值输出都需要根据真实结果进行校准;LLM 置信度分数并不是通用概率

它没有确立受保护群体之间的公平性

论文报告称,AI 条件并未显著改变观察到的录用性别差距。这一结果并不能确立在种族、残障、年龄、口音或交叉群体方面的公平性;作者也缺乏足够的处理前细节,无法确定所有性别差异的来源。

两项受控研究说明了为什么需要单独测试筛选层。一项2026 年 6 月关于日式格式简历的研究在保持资历不变的同时更改体现性别的姓名。五个 LLM 产生了不同的评分,而一条公平性指令并未消除总体差异。该研究使用了模型转换后的简历和一种提示词设计,因此不应将其绝对分数泛化。

一项2026 年 3 月的新加坡研究在合成简历变体上测试了 18 个模型。在移除明确身份标识后,语言、活动、志愿服务和兴趣爱好仍使模型能够推断人口统计属性。测得的差异属于受控的新加坡环境,但该方法揭示了一个实际失败点:删除姓名并不会删除所有人口统计代理变量。

它没有推广到所有类型的工作

实验在一家处理大规模招聘的公司进行,职位主要是客户服务岗位。作者预计,在面试重复性高、结果能够快速观察到,并且人类流程差异会产生成本的场景中,收益最为明显。依赖隐性知识或关系建立的专业岗位可能产生不同结果。

申请人调查的完成率也只有 14%。接受调查的申请人对两种体验的评价相近;在获得选择权的申请人中,78% 选择了 AI 代理,但这些数字应仅与该流程和申请人群体联系起来理解。

AI 求职面试的更安全边界

这项研究为雇主和供应商提出了一种有用的架构。

在加入 AI 之前定义与工作相关的问题。 让人类和 AI 面试官遵循相同流程。删除无法对应关键工作要求的问题。
使用 AI 进行面试并记录过程。 披露系统身份,保存文字记录,并为每个结论保留证据。
让负有责任的人类留在决策边界上。 审阅原始证据,而不是不加检查地接受模型摘要或分数。
提供无障碍替代方案和申诉渠道。 语音速度、口音处理、屏幕阅读器支持、听力、语言表达和认知无障碍条件,都可能改变谁能够完成流程。
每次发生重大变更后审计结果。 在合法且适当的情况下,比较相关群体和职位类型的完成率、录用率、入职率、留任率、便利措施和申诉率。
对整个系统进行版本管理。 跟踪语音供应商、模型、提示词、评分规则和政策变更。AI 物料清单可以为审计提供一个稳定对象,而不是一个模糊的产品名称。
制定保留和删除规则。 面试包含个人数据、语音录音和推断属性。删除请求必须覆盖文字记录、嵌入、评估产物、备份和下游数据集;机器遗忘工作流程涵盖了这一更广泛的边界。
从结构化面试到人类决策、审计、便利措施和申诉的 AI 求职面试责任边界
从结构化面试到人类决策、审计、便利措施和申诉的 AI 求职面试责任边界

*一个可辩护的工作流程将自动化面试执行与人类决策权分开,然后衡量结果,并为便利措施或申诉提供渠道。*

法律和无障碍检查是系统的一部分

规则取决于司法管辖区以及工具会影响什么。EU AI Act将用于招聘或筛选的 AI 列为高风险就业应用场景。第 6 条还规定,在某些条件下,如果一个狭窄的程序性或准备性系统不会对决策产生实质影响,则可能不属于该分类。声称适用该例外的供应商必须记录评估过程。工作流程中存在人类本身并不能决定其分类。

纽约市的自动化就业决策工具规则要求进行近期偏见审计、公开审计信息,并在使用受监管工具时发出通知。具体定义和适用范围需要结合个案审查。

美国司法部警告,招聘技术可能会筛除具备资格的残障人士。其AI 招聘与残障指南要求提供无障碍替代方案、明确的便利措施流程,以及衡量工作技能而非申请人残障状况的测试。

NIST AI 风险管理框架提供了一种与司法管辖区无关的运营模型:治理系统、明确其背景、衡量风险,并管理证据所揭示的问题。它是自愿性指南,不能替代就业法律顾问的意见。

防止虚假胜利的指标

AI 面试试点需要结果指标和流程指标。至少应跟踪:

面试完成率和技术失败率。
从申请到面试、从面试到决定,以及从决定到入职的时间。
录用、接受录用、入职和留任率。
每次完成面试所需的人类审核分钟数。
便利措施请求、替代渠道使用、申诉和推翻原决定的情况。
在合法且适当的情况下,各群体的筛选率和完成率。
模型、提示词、语音或供应商更新后的漂移情况。

在可能的情况下,将这些指标与同期的人类流程进行比较。更短的排期队列可能掩盖更长的审核队列。更高的完成率可能掩盖差异性筛选。更便宜的面试可能带来更昂贵的申诉。

有价值的结果是边界,而不是标题

这项实地实验有力地证明,结构化 AI 语音代理能够大规模收集有用的招聘信息。它也说明了为什么团队应抵制“AI 招聘人员胜过人类”这一宽泛说法。决定由人类作出,实验环境有利于重复性面试,而工作流程用更慢的审核换取了更快的排期。

使用 AI 求职面试来标准化一项明确的信息收集任务。让筛选标准、便利措施、审核、申诉和结果审计继续由能够解释并改变流程的人负责。

常见问题

在这项实地实验中,AI 是否作出了招聘决定?

没有。AI 语音代理负责进行面试,但人类招聘人员审阅面试证据,并作出所有录用决定。该研究并未验证自主招聘。

AI 求职面试合法吗?

它们可能合法,但就业、歧视、无障碍、隐私和自动化决策规则都可能适用。适用范围取决于司法管辖区以及工具对筛选的影响程度。雇主应审查实际工作流程和当前当地法律,而不是依赖供应商标签。

声明核查

声明状态证据边界
---------
该研究跟踪了 70,884 份申请,并将 67,056 份符合条件的申请随机分配。已验证Voice AI in Firms,实验样本。
AI 主导的面试将录用率从 8.70% 提高到 9.73%。已验证随机分配的人类与 AI 面试官组。
入职率和 30 天留任率分别相对提高约 18% 和 17%。已验证无条件随机样本结果。
该研究未发现生产力显著下降。有限定条件生产力数据仅覆盖部分已录用员工。
AI 工作流程使从申请到入职的中位时间多出 4 天。已验证远程模式下的成功入职者;24 天对比 20 天。
AI 面试在不同人口统计群体之间是公平的。不成立该实地实验未确立这一宽泛结论;受控招聘研究发现了特定情境下的差异。
人类审核人员会自动消除法律上的高风险地位。不成立分类取决于系统的实际影响和适用法律。
AI 面试总能降低招聘成本。不成立盈亏平衡取决于业务量、工资、供应商价格、失败情况和审核工作。

来源

Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews — 随机实地实验、方法、结果、运营时间和成本情景。
Regulation (EU) 2024/1689, Artificial Intelligence Act — EU 官方分类和风险管理要求。
NYC Automated Employment Decision Tools — 官方偏见审计、发布和通知要求。
Algorithms, Artificial Intelligence, and Disability Discrimination in Hiring — 美国司法部关于无障碍和便利措施的指导。
NIST AI Risk Management Framework — 自愿性的治理、明确背景、衡量和管理框架。