AI-jobbintervjuer: Vad 70 884 ansökningar visade
Målgrupp: Läsare på mellannivå som utvärderar AI inom rekrytering, HR-verksamhet eller arbetsflöden med höga krav.
Ett av de största fältexperimenten om AI-jobbintervjuer testade inte autonom rekrytering. Det testade ett smalare system: en AI-röstagent genomförde en strukturerad intervju, varefter en mänsklig rekryterare granskade inspelningen, transkriberingen och testresultaten och fattade beslutet.
Den gränsdragningen gav ett slående resultat. Bland 67 056 behöriga ansökningar som slumpmässigt tilldelades ett intervjövillkor ökade andelen erbjudanden från 8,70 % med mänskliga intervjuare till 9,73 % med AI-intervjuare – en relativ ökning på 12 %. Även påbörjade anställningar och tidig kvarstannandegrad förbättrades. Ändå tog AI-arbetsflödet längre tid från ansökan till anställningsstart eftersom mänskliga granskare blev nästa kö.
Den praktiska slutsatsen är specifik: AI kan förbättra repeterbar informationsinsamling vid rekrytering i stor skala. Studien visar inte att en LLM bör rangordna kandidater, besluta vilka som går vidare eller ersätta ansvarstagande mänsklig granskning.
Vad testade experimentet med AI-jobbintervjuer?
Voice AI in Firms-fältexperimentet följde 70 884 ansökningar som togs emot av ett företag inom outsourcing av rekryteringsprocesser i Filippinerna mellan den 7 mars och den 7 juni 2025. Tjänsterna omfattade 48 platsannonser, 41 kundkonton, 19 städer och sektorer som teknik, försäkring, detaljhandel, finans och sjukvård.
Forskarna randomiserade 67 056 behöriga ansökningar till tre grupper:
Båda intervjuarna följde samma strukturerade riktlinjer. AI:n uppgav sin identitet i början av samtalet. Den berättade också för de sökande att en mänsklig rekryterare – inte AI:n – skulle utvärdera intervjun och besluta om ett erbjudande skulle lämnas.
Den utformningen är viktigare än uttrycket ”AI-rekryterare”. AI:n samlade in underlag. Människor behöll beslutanderätten.
Vad mätte forskarna?
Artikeln mätte resultat bortom slutförda intervjuer. Den kopplade det randomiserade intervjövillkoret till erbjudanden, accepterade erbjudanden, påbörjade anställningar, kvarstannande i upp till fyra månader, orsaker till avslut och tillgängliga produktivitetsmått.
| Resultat | Mänsklig intervjuare | AI-intervjuare | Rapporterad skillnad |
|---|---|---|---|
| --- | ---: | ---: | ---: |
| Jobberbjudande | 8,70 % | 9,73 % | Relativ ökning på 12 % |
| Påbörjad anställning | 5,65 % | 6,71 % | Relativ ökning på cirka 18 % |
| Anställd efter 30 dagar | 4,97 % | 5,85 % | Relativ ökning på cirka 17 % |
| Median tid från ansökan till anställningsstart | 20 dagar | 24 dagar | AI-arbetsflödet var fyra dagar långsammare |
Siffrorna för erbjudanden, starter och 30-dagars kvarstannandegrad använder alla randomiserade sökande i grupperna med mänsklig respektive AI-intervjuare. Senare skillnader i kvarstannandegrad förblev positiva, men skattningarna blev mindre precisa när urvalet minskade. Författarna fann också ingen signifikant produktivitetsskillnad i den delmängd anställda för vilka produktivitetsdata fanns tillgängliga.
Detta är kausala skattningar för just detta experiment eftersom forskarna randomiserade intervjuaren. De är inte universella prestationsgarantier för varje jobb, land, röstmodell eller rekryteringsprocess.
Varför samlade strukturerade AI-intervjuer in bättre underlag?
Författarna beskriver mekanismen som ”kontrollerad varians”. Mänskliga rekryterare skilde sig åt i fråga om frågetäckning, uppföljningsbeteende och vid vilken punkt de sållade bort någon. AI-agenten följde protokollet mer konsekvent och ställde samtidigt relevanta följdfrågor.
Analys av transkriberingarna visade att AI-ledda intervjuer täckte fler arbetsrelevanta ämnen och producerade mer information för den efterföljande mänskliga utvärderingen. Det hjälper till att förklara den högre andelen erbjudanden utan att anta att modellen själv identifierade talang.
Strukturerade intervjuer syftar redan till att ställa jämförbara frågor och konsekvent bedöma arbetsrelaterade underlag. AI-agenten gjorde denna arbetsdisciplin enklare att upprepa över tusentals samtal. Team som överväger AI-jobbintervjuer bör se protokollföljsamhet som produktkravet, inte enbart samtalsrealism.
Experimentet blottlade också en ny flaskhals
AI-agenten förkortade väntetiden från ansökan till intervju. Framgångsrika sökande i distansvillkoret nådde intervjun efter en median på 0,32 dagar med AI jämfört med 0,51 dagar med en människa.
Den mänskliga utvärderingen bromsade sedan processen. Medianintervallet från intervju till erbjudande var 7,24 dagar efter en AI-ledd intervju och 2,62 dagar efter en människoledd intervju. Den totala mediantiden från ansökan till anställningsstart nådde 24 dagar för AI-gruppen jämfört med 20 dagar för människogruppen.
Automatisering flyttade kön nedströms. Ett rekryteringsteam kan genomföra fler intervjuer och ändå låta kandidater vänta längre om granskningskapaciteten förblir oförändrad.
Artikelns kostnadsmodell pekar på samma begränsning. AI blev kostnadseffektivt vid lägre volymer i miljöer med höga löner, medan brytpunkten nådde tusentals eller tiotusentals intervjuer i andra scenarier. Affärsnyttan beror på lönenivåer, leverantörspriser, felfrekvenser och granskningsarbete. Ett demonstrationspris per minut kan inte besvara frågan.
Vad bevisade studien inte?
Den testade inte autonomt urval
Mänskliga rekryterare fattade alla beslut om erbjudanden. De visste om AI eller en person hade genomfört intervjun. Experimentet stöder därför AI-assisterad insamling av underlag, inte att en LLM beslutar vem som får ett jobb.
Om ett team lägger till modellgenererade kandidatskattningar, rangordningar, rekommendationer om avslag, känsloanalys eller personlighetsinferens har det byggt ett annat system med en annan riskprofil. Alla numeriska resultat behöver kalibreras mot verkliga utfall; ett LLM-konfidensvärde är inte en universell sannolikhet→.
Den fastställde inte rättvisa mellan skyddade grupper
Artikeln rapporterar att AI-villkoret inte signifikant förändrade den observerade könsskillnaden i erbjudanden. Det resultatet fastställer inte rättvisa avseende ras, funktionsnedsättning, ålder, accent eller intersektionella grupper, och författarna saknade tillräckligt med information före behandlingen för att identifiera ursprunget till alla könsskillnader.
Två kontrollerade studier visar varför urvalslagret behöver testas separat. En studie från juni 2026 av CV:n i japanskt format höll kvalifikationerna konstanta samtidigt som namn som signalerade kön ändrades. Fem LLM:er gav olika poäng, och en rättviseinstruktion tog inte bort den samlade skillnaden. Studien använde modellkonverterade CV:n och en promptformulering, så de absoluta poängen bör inte generaliseras.
En singaporiansk studie från mars 2026 testade 18 modeller på syntetiska CV-varianter. Språk, aktiviteter, volontärarbete och hobbyer gjorde det möjligt för modellerna att dra slutsatser om demografiska attribut efter att uttryckliga identifierare tagits bort. De uppmätta skillnaderna hör till den kontrollerade singaporianska miljön, men metoden blottlägger ett praktiskt misslyckande: att ta bort namn tar inte bort alla demografiska proxyvariabler.
Den generaliserade inte till alla typer av arbete
Experimentet genomfördes hos ett företag som hanterade rekrytering i stor skala, främst för kundtjänstroller. Författarna förväntar sig de starkaste fördelarna där intervjuer upprepas, resultat snabbt blir observerbara och variation i mänskliga processer medför en kostnad. Specialiserade roller som är beroende av tyst kunskap eller relationsskapande kan ge andra resultat.
Även enkäterna till sökande hade en svarsfrekvens på 14 %. De sökande som svarade bedömde upplevelserna likartat, och 78 % av de sökande som erbjöds ett val valde AI-agenten, men dessa siffror bör förbli kopplade till denna process och denna sökandepopulation.
En säkrare gräns för AI-jobbintervjuer
Studien föreslår en användbar arkitektur för arbetsgivare och leverantörer.

*Ett försvarbart arbetsflöde skiljer automatiserat intervjugenomförande från mänsklig beslutanderätt, mäter sedan resultaten och erbjuder en väg för anpassning eller överklagande.*
Juridiska kontroller och tillgänglighetskontroller är en del av systemet
Reglerna beror på jurisdiktion och på vad verktyget påverkar. EU AI Act listar AI som används för rekrytering eller urval bland användningsområden med hög risk inom arbetslivet. Artikel 6 innehåller också villkor enligt vilka ett smalt procedur- eller förberedelsesystem som inte väsentligt påverkar ett beslut kan falla utanför den klassificeringen. Leverantörer som åberopar undantaget måste dokumentera bedömningen. Att en människa ingår i arbetsflödet avgör inte klassificeringen i sig.
New York Citys regler för Automated Employment Decision Tools kräver en aktuell biasgranskning, offentlig information om granskningen och meddelanden när ett omfattat verktyg används. Den exakta definitionen och omfattningen behöver bedömas från fall till fall.
USA:s justitiedepartement varnar för att rekryteringsteknik kan sålla bort kvalificerade personer med funktionsnedsättning. Dess vägledning om AI-rekrytering och funktionsnedsättning efterlyser tillgängliga alternativ, tydliga rutiner för anpassning och tester som mäter arbetsfärdigheter snarare än den sökandes funktionsnedsättning.
NIST AI Risk Management Framework erbjuder en jurisdiktionsneutral operativ modell: styr systemet, kartlägg dess sammanhang, mät risker och hantera det som underlaget visar. Det är frivillig vägledning och ersätter inte arbetsrättslig rådgivning.
Mätetal som förhindrar en falsk framgång
Ett pilotprojekt för AI-intervjuer behöver resultatmått och processmått. Följ åtminstone:
Jämför om möjligt dessa mått med en samtidig mänsklig process. En kortare schemaläggningskö kan dölja en längre granskningskö. En högre slutförandegrad kan dölja ojämlik sållning. En billigare intervju kan skapa dyrare överklaganden.
Det användbara resultatet är gränsen, inte rubriken
Fältexperimentet ger starka belägg för att en strukturerad AI-röstagent kan samla in användbar rekryteringsinformation i stor skala. Det visar också varför team bör motstå det breda påståendet att ”AI-rekryterare överträffar människor”. Människor fattade besluten, miljön gynnade repeterbara intervjuer och arbetsflödet bytte snabbare schemaläggning mot långsammare granskning.
Använd AI-jobbintervjuer för att standardisera en definierad uppgift för insamling av underlag. Låt urvalskriterier, anpassningar, granskning, överklaganden och resultatrevisioner förbli knutna till människor som kan förklara och ändra processen.
FAQ
Fattade AI anställningsbeslut i fältexperimentet?
Nej. AI-röstagenten genomförde intervjuer, men mänskliga rekryterare granskade intervjunderlaget och fattade alla beslut om erbjudanden. Studien validerar inte autonom rekrytering.
Är AI-jobbintervjuer lagliga?
De kan vara lagliga, men regler om anställning, diskriminering, tillgänglighet, integritet och automatiserade beslut kan gälla. Omfattningen beror på jurisdiktion och på hur mycket verktyget påverkar urvalet. Arbetsgivare bör granska det faktiska arbetsflödet och aktuell lokal lagstiftning i stället för att förlita sig på en leverantörsbeteckning.
Påståendekontroller
| Påstående | Status | Bevisgräns |
|---|---|---|
| --- | --- | --- |
| Studien följde 70 884 ansökningar och randomiserade 67 056 behöriga ansökningar. | Verifierat | Voice AI in Firms, experimentellt urval. |
| AI-ledda intervjuer ökade andelen erbjudanden från 8,70 % till 9,73 %. | Verifierat | Randomiserade grupper med mänsklig respektive AI-intervjuare. |
| Påbörjade anställningar och 30-dagars kvarstannandegrad ökade med cirka 18 % respektive 17 % relativt sett. | Verifierat | Ovillkorliga utfall i det randomiserade urvalet. |
| Studien fann ingen signifikant produktivitetsminskning. | Kvalificerat | Produktivitetsdata omfattade endast en delmängd av de anställda. |
| AI-arbetsflödet tog fyra median dagar mer från ansökan till anställningsstart. | Verifierat | Framgångsrika anställningar i distansläget; 24 jämfört med 20 dagar. |
| AI-intervjuer är rättvisa mellan demografiska grupper. | Avvisat | Fältexperimentet fastställde inte detta breda påstående; kontrollerade rekryteringsstudier visar kontextspecifika skillnader. |
| En mänsklig granskare tar automatiskt bort juridisk högriskstatus. | Avvisat | Klassificeringen beror på systemets faktiska påverkan och tillämplig lag. |
| AI-intervjuer minskar alltid rekryteringskostnaden. | Avvisat | Brytpunkten berodde på volym, löner, leverantörspriser, fel och granskningsarbete. |
