Che cos'è la validità predittiva nella selezione del personale: come i test e i colloqui predicono davvero la prestazione
La ricerca di Schmidt e Hunter e le revisioni successive spiegano quali strumenti di selezione funzionano davvero e perché la fiducia nel colloquio non strutturato è il fraintendimento più costoso
versione v1.1 · pubblicato 2026-10-06 · fonti primarie 19
Che cos'è la validità predittiva nella selezione del personale
La validità predittiva di uno strumento di selezione è il grado in cui il punteggio ottenuto da un candidato prima dell'assunzione si correla con la sua prestazione lavorativa effettiva, misurata dopo. Si esprime di solito come coefficiente di correlazione: un numero che in pratica va da 0 a 1 e che dice quanto lo strumento anticipa un risultato che ancora non esiste. Non è un giudizio di qualità del colloquio in sé, né della simpatia che il selezionatore prova per il candidato: è una domanda empirica, verificabile, che Frank Schmidt e John Hunter hanno posto in termini sistematici in una serie di lavori culminati nella meta-analisi del 1998 pubblicata su Psychological Bulletin, basata su decenni di studi precedenti sul personale selezionato con metodi diversi in contesti lavorativi americani.
Il punto di partenza di quel lavoro, e la ragione per cui ancora oggi è il riferimento obbligato in materia, è che la prestazione lavorativa futura non si osserva mai direttamente al momento della decisione: va stimata attraverso un segnale disponibile prima dell'assunzione — un punteggio di test, un giudizio di colloquio, un voto di laurea — e la qualità di quella stima è essa stessa misurabile, non opinabile. Questo distingue la validità predittiva da un concetto vicino ma diverso, la validità di contenuto, che riguarda quanto uno strumento rappresenta bene il dominio di compiti del lavoro (una prova pratica di scrittura per un ruolo che richiede scrivere), indipendentemente dal fatto che preveda qualcosa nel tempo. Uno strumento può avere ottima validità di contenuto e validità predittiva mediocre, o viceversa: sono due domande diverse fatte allo stesso strumento.
Il colloquio funziona meno di quanto chi lo conduce creda
Qui si annida l'equivoco più diffuso e più costoso. Si crede spesso che il colloquio sia, per sua natura, il miglior predittore disponibile — perché "si vede la persona", perché il selezionatore esperto "la legge subito". La ricerca di Schmidt e Hunter dice il contrario, e lo dice in modo graduato: il colloquio non strutturato (domande libere, improvvisate, diverse da candidato a candidato) ha una validità predittiva modesta, nettamente inferiore a quella del colloquio strutturato — anche se non è fra le più basse in assoluto: strumenti come gli anni di istruzione, l'esperienza lavorativa o la grafologia si collocano ancora più in basso; il colloquio strutturato (domande fissate in anticipo, uguali per tutti, con una griglia di valutazione condivisa) sale molto più in alto, avvicinandosi ai test di abilità cognitive. La differenza non sta nel colloquio come formato, ma nella sua struttura: è la variabile che il selezionatore controlla, ed è quella che smette di controllare appena decide di "andare a sensazione".
I test di abilità cognitiva generale — ragionamento verbale, numerico, astratto — emergono da quella stessa meta-analisi fra i predittori più solidi, con una validità pari a quella del colloquio strutturato e di poco inferiore a quella delle prove di lavoro, un risultato ripreso e discusso da rassegne successive. Le prove di lavoro (far svolgere al candidato un compito rappresentativo del ruolo) si collocano su livelli alti di validità predittiva, mentre gli assessment center (batterie di esercizi simulati, spesso in gruppo, valutati da più osservatori) si collocano su livelli moderati; entrambi comportano un costo organizzativo che il colloquio non ha. I test di personalità, in particolare la dimensione della coscienziosità nel modello a cinque fattori, predicono meno di quanto la loro popolarità commerciale lascerebbe intuire, e con variabilità maggiore a seconda del ruolo. Le referenze, infine, restano fra gli strumenti meno predittivi dell'intero elenco, nonostante siano fra i più usati: il motivo principale, discusso nella letteratura successiva, è che chi fornisce una referenza raramente ha incentivo a essere sfavorevole.
I numeri classici sono stati rivisti, e la cima della classifica è cambiata
Un secondo equivoco riguarda la stabilità di queste stime nel tempo. I coefficienti pubblicati nel 1998 sono diventati, nel linguaggio corrente della selezione, cifre quasi dogmatiche. La revisione più importante è arrivata nel 2022, quando Paul Sackett, Charlene Zhang, Christopher Berry e Filip Lievens hanno rifatto i conti su Journal of Applied Psychology. Il loro argomento riguarda una correzione statistica, quella per la varianza ristretta di cui si dirà più avanti: secondo loro le meta-analisi precedenti l'avevano applicata in misura eccessiva, soprattutto agli studi condotti su dipendenti già in servizio, e così avevano gonfiato le stime. Ricalcolati senza quell'eccesso, i coefficienti di molti strumenti scendono di uno o due decimi. Nell'insieme l'ordine resta simile, ma la cima cambia: in testa va il colloquio strutturato, con 0,42, seguito dai test di conoscenza del lavoro (0,40) e dalle prove di lavoro (0,33), mentre i test di abilità cognitiva passano da 0,51 a 0,31. Questo non significa che quei test non funzionino: significa che funzionano meno bene di quanto il numero più citato suggerisse, e che chi costruisce una policy di selezione sulla base di una singola cifra da manuale sta probabilmente lavorando con un margine d'errore più ampio di quanto creda.
La revisione non ha chiuso la discussione. Nel 2023 In-Sue Oh, Huy Le e Philip Roth hanno contestato, sulla stessa rivista, la raccomandazione di Sackett e colleghi di non correggere: secondo loro le condizioni su cui si regge non tengono, e la correzione applicata da Schmidt e Hunter resta giustificata. Sackett e colleghi hanno replicato nello stesso numero che negli studi che entrano in una meta-analisi la restrizione è di solito modesta, e che i dati per correggerla quasi sempre mancano. Il disaccordo è aperto e riguarda una domanda precisa: quanto sia frequente, negli studi reali, una restrizione forte. Per chi seleziona la conseguenza pratica non cambia da una lettura all'altra: il colloquio strutturato sta fra gli strumenti migliori in entrambe, e nessuna delle due autorizza a trattare un singolo coefficiente come una costante.
Resta un confine da tracciare con cura, perché è quello più spesso frainteso: la validità predittiva di uno strumento, qui, è sempre una proprietà aggregata, calcolata su popolazioni di candidati e di valutazioni passate. Non dice nulla sulla persona specifica che si ha davanti in un colloquio — e trasformare un coefficiente di meta-analisi in un giudizio su un individuo è l'errore inverso rispetto a quello che la statistica dovrebbe prevenire.
Senso comune e senso tecnico
Nel linguaggio di chi assume, "valutare bene un candidato" vuol dire quasi sempre una cosa: formarsi un'impressione complessiva, coerente, che regga a un confronto con i colleghi che hanno partecipato allo stesso colloquio. È un'idea di validità mutuata dal senso comune, dove validità significa credibilità interna del giudizio — "ci siamo trovati tutti d'accordo, quindi probabilmente è un buon elemento". Nella disciplina, questa non è validità: è, al massimo, affidabilità inter-giudici, cioè il grado in cui osservatori diversi convergono sullo stesso punteggio. Sono due proprietà distinte e la confusione fra le due è forse l'errore più diffuso fra chi seleziona senza una formazione specifica in psicometria.
Il motivo per cui la distinzione conta è che si può essere perfettamente d'accordo e perfettamente in errore. Tre selezionatori possono convergere tutti sulla stessa valutazione entusiasta di un candidato — alta affidabilità — e quella valutazione può comunque non predire nulla della sua prestazione futura, perché i tre stavano osservando e premiando la stessa cosa sbagliata: la fluidità verbale, la somiglianza con sé stessi, la sicurezza nel rispondere a una domanda che non ha nulla a che fare col lavoro reale. L'affidabilità è una condizione necessaria perché uno strumento possa essere valido — uno strumento che misura in modo incoerente non può misurare bene nulla — ma non è sufficiente. È il motivo per cui la letteratura tratta i due concetti come assi separati di uno stesso piano, e perché uno strumento di selezione va interrogato su entrambi, non su uno solo: quanto concordano i valutatori, e quanto quella concordanza corrisponde a qualcosa che poi si verifica.
Il costrutto che si misura non è quasi mai quello che si crede di misurare
Qui si apre il secondo fraintendimento, più sottile del primo perché riguarda non il metodo ma l'oggetto della misura. Chi conduce un colloquio crede spesso di misurare "la motivazione" o "il potenziale" del candidato — concetti ampi, intuitivi, che sembrano auto-evidenti. Nella disciplina psicometrica, ogni strumento misura invece un costrutto operazionalizzato: una definizione ristretta, dichiarata in anticipo, di che cosa conta come evidenza di quella qualità. La differenza non è terminologica. Un test di ragionamento numerico non misura "l'intelligenza" in astratto: misura la capacità di risolvere un insieme specifico di problemi quantitativi entro un tempo dato, e la sua validità predittiva vale per quella definizione operativa, non per il concetto largo da cui prende il nome.
Questo spiega un fenomeno che chi fa selezione incontra spesso senza saperlo nominare: due strumenti che nella conversazione comune vengono chiamati con lo stesso termine — due "test di personalità", due "colloqui motivazionali" — possono avere validità predittiva molto diversa fra loro, perché operazionalizzano il costrutto in modi diversi. Il modello a cinque fattori di personalità, quando è costruito per isolare la componente di coscienziosità (l'affidabilità, la propensione a pianificare e portare a termine), produce uno strumento con una validità misurabile e documentata. Un questionario generico venduto come "test di personalità per la selezione", che mescola quella dimensione con altre meno pertinenti al lavoro, può produrre un punteggio che sembra la stessa cosa e non lo è. Il nome comune del test non garantisce nulla sulla sua struttura interna: bisogna chiedere che cosa, esattamente, lo strumento fa corrispondere a un numero.
La struttura interna di un buon strumento di selezione, in termini tecnici, si regge su tre livelli che vanno tenuti distinti anche quando nella pratica si confondono in un'unica impressione: il costrutto (che cosa si intende misurare, definito in modo che due persone diverse userebbero la stessa definizione), l'operazionalizzazione (come quel costrutto diventa un compito, una domanda, un esercizio concreto che produce un punteggio), e il criterio (la misura di prestazione reale contro cui quel punteggio viene poi confrontato, per sapere se ha funzionato). Il senso comune salta direttamente dal primo al terzo passaggio — "sembrava motivato, e infatti ha reso bene" — senza passare per il secondo, che è esattamente il punto dove la validità si costruisce o si perde. Uno strumento mal operazionalizzato produce un numero preciso, riproducibile, condiviso da più osservatori, e comunque privo di legame con ciò che accadrà dopo l'assunzione. La domanda tecnica corretta non è mai "quanto siamo stati bravi a giudicare", ma "che cosa, esattamente, stavamo misurando quando abbiamo giudicato" — ed è la domanda che il linguaggio corrente della selezione tende sistematicamente a saltare.
Le correnti
Chi studia questi numeri non lo fa da un unico punto di osservazione, ed è un fatto che vale la pena rendere esplicito prima di procedere oltre: la psicologia del lavoro di impianto psicometrico, l'economia del lavoro e la scienza dei dati applicata alle risorse umane non stanno discutendo la stessa domanda con vocabolari diversi. Stanno facendo domande diverse, su unità di analisi diverse, e i numeri che producono non sono sempre comparabili fra loro anche quando sembrano parlare dello stesso strumento di selezione.
La tradizione psicometrica — quella di Schmidt e Hunter, e prima di loro di Edwin Ghiselli, che negli anni Sessanta aveva già tentato le prime sintesi quantitative della validità dei test attitudinali — lavora sull'individuo come unità di analisi: il candidato, il suo punteggio, la sua prestazione futura, e la correlazione fra i due calcolata aggregando migliaia di casi simili da studi diversi. È l'impianto che ha prodotto la meta-analisi psicometrica come tecnica: una procedura per correggere statisticamente gli studi originari di fattori che ne distorcono sistematicamente il risultato — l'errore di campionamento, la varianza ristretta (il fatto che chi è già stato assunto non rappresenta l'intera gamma di candidati possibili, perché i peggiori sono stati scartati prima), l'inaffidabilità della misura di criterio. È una tradizione interessata al singolo strumento: quanto bene predice, isolato dagli altri.
L'economia del lavoro guarda lo stesso fenomeno da un'altra unità di analisi: non il candidato, ma il mercato in cui candidati e imprese si incontrano. Qui la domanda non è "questo test predice la prestazione" ma "quali meccanismi di selezione producono efficienza allocativa a livello di sistema", e il riferimento classico è il lavoro sul segnalamento di Michael Spence, pubblicato nel 1973 su Quarterly Journal of Economics: un titolo di studio, in questo impianto, può avere valore selettivo anche se non insegna nulla di direttamente utile al lavoro, perché segnala al datore di lavoro qualcosa — la capacità di sostenere uno sforzo prolungato, la disponibilità a investire tempo — che costerebbe troppo osservare direttamente. La domanda di validità predittiva individuale, in questo quadro, è secondaria: ciò che conta è se il segnale riduce l'asimmetria informativa fra le parti, non se predice bene il singolo caso.
La scienza dei dati applicata alle risorse umane, terza corrente e la più recente delle tre, lavora su un'unità di analisi che non è né la persona né il mercato, ma il modello predittivo stesso: un algoritmo addestrato su dati storici di assunzione e prestazione, di cui si misura l'accuratezza fuori campione — quanto bene il modello generalizza a candidati che non ha mai visto, non solo a quelli su cui è stato costruito. Qui il vocabolario cambia ancora: si parla di overfitting (un modello che si adatta troppo ai dati storici specifici e perde capacità predittiva su dati nuovi), di matrici di confusione, di soglie di decisione tarate su un compromesso fra falsi positivi e falsi negativi. È un impianto che condivide con la psicometria l'interesse per il singolo candidato, ma lo tratta come un problema di classificazione statistica, non come un caso umano da interpretare con uno strumento validato nel tempo.
Le tre correnti non competono per la stessa risposta: rispondono a tre domande che solo nel linguaggio comune sembrano una sola. Chi mette a confronto un coefficiente di validità predittiva di Schmidt e Hunter con l'accuratezza dichiarata da un fornitore di software di selezione algoritmica sta confrontando due numeri costruiti con logiche diverse, su popolazioni diverse, con criteri di successo diversi — ed è un errore di categoria più che di calcolo, il tipo di errore che nessuna correzione statistica può sanare perché nasce prima dei numeri, nella domanda che li ha generati.
Autori, ricerche, risultati
Vale la pena tornare sulla fonte più citata di tutte, perché è anche la più fraintesa nella sua portata. Frank Schmidt e John Hunter, nel lavoro del 1998 su Psychological Bulletin, non hanno condotto un nuovo studio su un nuovo campione di candidati: hanno applicato la tecnica della meta-analisi psicometrica — messa a punto da loro stessi in articoli precedenti, a partire dalla fine degli anni Settanta — a 85 anni di ricerca precedente sulla selezione del personale, aggregando centinaia di studi primari condotti su popolazioni di lavoratori statunitensi in contesti occupazionali molto diversi fra loro. Il risultato non è un esperimento: è una sintesi corretta statisticamente di esperimenti altrui, e la differenza conta, perché la meta-analisi eredita i limiti dei disegni originari anche quando li corregge. Il campione aggregato non è un campione rappresentativo di tutti i lavori possibili: è rappresentativo dei lavori su cui, in quel periodo e in quel paese, qualcuno aveva avuto interesse e fondi per fare ricerca di selezione — in gran parte ruoli impiegatizi e militari americani, con una presenza relativamente scarsa di professioni manuali o di contesti non occidentali.
Il numero più citato dell'intero corpus — l'abilità cognitiva generale come predittore centrale, quello su cui Schmidt e Hunter costruivano tutta la loro analisi — nasconde un dettaglio che pochi fra chi lo cita hanno mai controllato: funziona meglio quanto più il lavoro è complesso. Schmidt e Hunter lo documentano nello studio originale, distinguendo i coefficienti per livello di complessità occupazionale: 0,58 per i ruoli professionali e direttivi, 0,51 per quelli di media complessità, 0,23 per quelli non qualificati. È un dettaglio e che la citazione di seconda mano tende sistematicamente a perdere: si cita la cifra aggregata come se valesse ugualmente per un ruolo esecutivo ripetitivo e per una posizione dirigenziale, quando il dato originario dice l'opposto.
Il lavoro di Sackett e colleghi del 2022 è quello che ha spostato davvero i numeri, e va letto per quello che fa: non scopre strumenti nuovi e non ne smentisce di vecchi, ma contesta un passaggio di calcolo, la correzione per la varianza ristretta — cioè per il fatto che la gamma di punteggi osservata nei dipendenti già assunti è più stretta di quella dell'intero bacino di candidati, perché i punteggi più bassi sono stati scartati prima dell'assunzione. La risposta di In-Sue Oh, Huy Le e Philip Roth, pubblicata nel 2023 su Journal of Applied Psychology, difende invece l'impianto originario: le condizioni alla base della raccomandazione di Sackett non reggono, e la correzione di Schmidt e Hunter resta giustificata. Non è quindi, come a volte viene riassunta nei convegni di settore, una conferma del ridimensionamento: è l'obiezione principale contro di esso, e a sua volta ha ricevuto una replica.
Un secondo filone merita attenzione per la ragione opposta: perché corregge un'omissione, non un eccesso. Il lavoro di Frank Schmidt, In-Sue Oh e Jonathan Shaffer, circolato come working paper e poi ripreso in diverse rassegne successive, ha riportato all'attenzione la validità incrementale — quanto un secondo strumento aggiunge potere predittivo quando usato insieme a un primo, e non da solo. Il dato rilevante, qui, non è la classifica dei singoli strumenti ma la loro combinazione: unire un test di abilità cognitiva a un colloquio strutturato produce una validità predittiva più alta di quella di ciascuno dei due preso da solo — non della loro somma: già nella tabella del 1998 la combinazione arriva a 0,63, contro 0,51 di ciascuno — perché i due strumenti catturano parzialmente costrutti diversi — competenza cognitiva l'uno, comportamento osservabile l'altro — e si correggono a vicenda più di quanto un singolo strumento, per quanto accurato, possa fare da solo.
Il filo che lega queste ricerche, lette insieme invece che citate separatamente, è una correzione della fiducia più che del metodo: gli strumenti strutturati restano in alto, ma l'ordine fra loro si è mosso, e ogni singolo numero di quella tabella va trattato come una stima con un proprio margine d'errore, non come una costante fisica. Chi costruisce una batteria di selezione citando "0,51 di validità per i test cognitivi secondo Schmidt e Hunter" sta citando una cifra aggregata su decenni di studi americani, corretta con assunzioni oggi contestate, relativa a una complessità occupazionale che va specificata caso per caso. È un uso legittimo della letteratura solo se accompagnato da queste tre cautele — altrimenti è un numero usato come se fosse un fatto, quando è il risultato di un metodo che va sempre dichiarato insieme al risultato.
Dove sta oggi
Tutto quello che la ricerca ha stabilito sulla validità dei singoli strumenti sta per essere riscritto non dalla scienza, ma dalla pratica: negli ultimi dieci anni la selezione del personale ha cominciato a delegare le sue fasi iniziali a sistemi automatizzati, e la domanda che Schmidt e Hunter ponevano su un colloquio o un test oggi va posta a un algoritmo che nessuno dei due ha mai potuto esaminare.
Il primo punto di ingresso dell'automazione, il più diffuso, è lo screening dei curricula: un sistema che legge migliaia di candidature e ne scarta la maggior parte prima che un essere umano le veda, sulla base di un modello addestrato su assunzioni passate. Il caso più citato nella letteratura divulgativa, quello del sistema interno sperimentato da Amazon e poi abbandonato, è istruttivo anche per il modo in cui lo conosciamo: non da uno studio accademico né da un comunicato dell'azienda, ma da un'inchiesta di Reuters del 2018 basata su cinque persone a conoscenza del progetto, rimaste anonime, mentre Amazon ha preferito non commentare il sistema: il modello, addestrato su dieci anni di curricula ricevuti in un settore a forte prevalenza maschile, aveva imparato a penalizzare candidature che contenevano la parola "donne" o il nome di college femminili, non perché qualcuno glielo avesse chiesto, ma perché quella era la regolarità presente nei dati storici su cui era stato costruito. Il problema non era un errore di programmazione: era che il modello aveva imparato esattamente ciò che i dati contenevano, e i dati contenevano una storia di assunzioni già distorta. È la dimostrazione più diretta disponibile di un principio che vale per ogni sistema addestrato su dati storici di selezione: il modello non introduce un pregiudizio nuovo, replica e amplifica quello già presente nel criterio su cui ha imparato.
Il secondo punto di ingresso, meno diffuso ma in crescita, è il colloquio automatizzato: un sistema che analizza le risposte di un candidato — parole usate, tono, in alcuni casi espressioni facciali — a un'intervista registrata senza intervistatore umano, per produrre un punteggio di idoneità. La validità predittiva di questi strumenti, a differenza del colloquio strutturato tradizionale, non dispone ancora di una base di evidenza paragonabile per quantità e indipendenza a quella accumulata da Schmidt e Hunter: il quadro delle evidenze disponibili resta eterogeneo, e la presenza di studi condotti o diffusi dalle stesse aziende che vendono il prodotto è una condizione che la letteratura metodologica tratta come motivo di cautela indipendentemente dal settore, perché chi costruisce uno strumento ha un interesse diretto a trovarne confermata la validità.
Il regolamento europeo tratta la selezione come un caso ad alto rischio, non come un dettaglio tecnico
Il quadro normativo europeo ha preso posizione su questo punto con un atto specifico. Il Regolamento (UE) 2024/1689, noto come AI Act, approvato dal Parlamento europeo e dal Consiglio e pubblicato nella Gazzetta ufficiale dell'Unione europea il 12 luglio 2024, classifica all'Allegato III i sistemi di intelligenza artificiale destinati al reclutamento e alla selezione — incluso lo screening dei curricula e la valutazione dei candidati nei colloqui — come sistemi ad alto rischio. Questa classificazione comporta obblighi specifici per chi li fornisce e per chi li utilizza: una valutazione di conformità prima dell'immissione sul mercato, documentazione tecnica che renda tracciabile il funzionamento del sistema, sorveglianza umana effettiva sulle decisioni prodotte, e la registrazione in una banca dati pubblica dell'Unione prevista dal regolamento stesso. Si legge spesso che le disposizioni relative ai sistemi ad alto rischio diventino pienamente applicabili a partire dal 2 agosto 2026; in realtà quel termine è stato successivamente spostato: il Regolamento (UE) 2026/1744, il cosiddetto Digital Omnibus on AI, ha rinviato al 2 dicembre 2027 la piena applicabilità degli obblighi sui sistemi ad alto rischio dell'Allegato III, inclusi quelli impiegati per il reclutamento e la selezione.
Il punto che la discussione pubblica tende a perdere è dove si colloca l'onere della prova: il regolamento non vieta l'uso di questi sistemi nella selezione, e non stabilisce una soglia minima di validità predittiva che un sistema debba dimostrare per essere impiegato. Impone invece che chi lo usa possa rendere conto di come funziona e possa intervenire su una decisione automatizzata — il che sposta l'obbligo dalla dimostrazione di efficacia predittiva alla dimostrazione di tracciabilità e controllabilità. Sono due standard diversi, e un'azienda può soddisfare pienamente il secondo senza avere alcuna evidenza indipendente sul primo: può documentare perfettamente come il proprio sistema di screening prende le decisioni, ed essere comunque priva di uno studio di validazione che dica se quelle decisioni corrispondono alla prestazione lavorativa reale dei candidati scartati — gli unici per cui, per definizione, quel dato non verrà mai raccolto.
Frontiera e punti aperti
C'è un problema metodologico che attraversa tutta la letteratura discussa finora e che vale la pena isolare, perché non è un difetto di questo o quello studio: è un limite strutturale di come si può studiare la selezione del personale. La maggior parte dei coefficienti di validità predittiva citati finora — da Schmidt e Hunter nel 1998 alla disputa fra Sackett e colleghi e Oh, Le e Roth fra il 2022 e il 2023 — è calcolata su persone che sono state assunte. Chi è stato scartato al colloquio, o bocciato dal test, non compare nei dati: non ha una prestazione lavorativa da osservare, perché non ha mai lavorato lì. Il problema viene a volte chiamato censura del criterio, ed è la radice stessa della varianza ristretta di cui si è già detto, vista dall'altro lato: là contava la gamma dei punteggi osservati, qui l'assenza totale di informazione su un'intera porzione della popolazione che lo strumento ha valutato. È anche la ragione per cui la disputa sulle correzioni non si chiude con un dato. Nessuna correzione statistica può restituire un dato che non è mai stato raccolto; si può solo stimare, con ipotesi più o meno forti, quanto sarebbe stato diverso il quadro se l'avessimo avuto. È la ragione per cui ogni stima di validità predittiva, per quanto meta-analizzata e corretta, resta una stima condizionata a una selezione già avvenuta — e descrive meglio "quanto bene lo strumento distingue fra i buoni e gli ottimi" che non "quanto bene distingue fra chi va assunto e chi no".
Un secondo limite, meno discusso ma altrettanto pesante, riguarda la stabilità nel tempo e nello spazio delle stime che la disciplina tratta come punti fermi. Non è un'obiezione formale: significa che la trasferibilità di quei numeri a un contesto diverso va argomentata, non presunta, e che la letteratura su questo specifico punto — quanto bene si replicano le gerarchie di validità fuori dal contesto in cui sono state stabilite — resta meno solida di quanto la frequenza con cui quei numeri vengono citati lascerebbe credere.
Che cosa un sistema di selezione automatizzato non può ancora dimostrare
È qui che la frontiera più aperta della materia si trova oggi, ed è anche quella più urgente per chi lavora in un'azienda che sta valutando uno strumento di screening o un colloquio automatizzato. La domanda che la letteratura psicometrica pone a qualunque test — con quale criterio esterno è stato validato, su quale popolazione, con quale errore dichiarato — è esattamente la domanda che per i sistemi di intelligenza artificiale applicati alla selezione, oggi, nella maggioranza dei casi non ha una risposta pubblica e indipendente. Non perché la domanda sia sbagliata: perché gli studi che potrebbero rispondere richiedono accesso ai dati di prestazione reale dei candidati assunti attraverso quel sistema, e quei dati sono proprietà dell'azienda che vende o usa lo strumento, con tutto l'incentivo a non pubblicarli se il risultato fosse deludente. L'AI Act impone tracciabilità e sorveglianza umana; non impone, e non potrebbe imporre per via regolatoria, l'equivalente di una meta-analisi indipendente condotta su questi sistemi come quella che Schmidt e Hunter hanno condotto sui test attitudinali in ottantacinque anni di studi altrui.
Questo è il punto che vale la pena portarsi via da tutto il percorso fatto finora: la validità degli strumenti di selezione tradizionali è oggi uno dei temi più misurati e più discussi dell'intera psicologia applicata, al punto che se ne contestano i decimali, mentre la validità predittiva degli strumenti che stanno rapidamente sostituendoli è, nella letteratura indipendente, in gran parte ancora da accertare. Non è una ragione per non usarli, ed è un terreno su cui la ricerca accademica indipendente — quella non finanziata da chi vende lo strumento — si sta muovendo solo ora. È una ragione per non trattare un punteggio prodotto da un algoritmo di screening con la stessa fiducia riposta in un coefficiente validato su decenni di studi pubblici, replicabili, criticati e rivisti pubblicamente come quelli discussi in questo approfondimento.
La domanda da portare in azienda lunedì mattina non è se usare l'intelligenza artificiale nella selezione, ma questa: per ciascuno strumento in uso — colloquio, test, algoritmo — chi, in questa organizzazione, sa dire con quale criterio esterno è stato validato, e sarebbe disposto a scoprire che non funziona?
Su che cosa si regge
25 affermazioni di questo pezzo sono state cercate una per una nella loro fonte primaria — il paper, il record dell'editore, il testo di legge: 25 confermate. Il controllo lo fa una macchina e non trova tutto: serve a permetterti di controllare, non a sostituirti. Quelle che non reggevano sono state corrette o tolte prima della pubblicazione (19): il registro elenca quello che il pezzo dice adesso.
- Frank Schmidt e John Hunter hanno pubblicato una meta-analisi nel 1998 su Psychological Bulletin basata su decenni di studi precedenti sul personale selezionato con metodi diversi in contesti lavorativi americani. https://www.scribd.com/document/66407853/Hunter-and-Schmidt-1998-The-Validity-and-Utility-of-Selection-Methods-in-Personnel-Psychology-Practical-and-Theoretical-Implications-of-85-Years-of-R
- Il colloquio non strutturato ha una validità predittiva modesta, nettamente inferiore a quella del colloquio strutturato. https://firstpersonnel.org/wp-content/uploads/2013/10/Summary-Schmidt-Hunter-1998.pdf
- Il colloquio strutturato ha validità predittiva pari a quella dei test di abilità cognitiva. https://firstpersonnel.org/wp-content/uploads/2013/10/Summary-Schmidt-Hunter-1998.pdf
- I test di abilità cognitiva generale emergono con una validità pari a quella del colloquio strutturato e di poco inferiore a quella delle prove di lavoro. https://www.cogn-iq.org/blog/what-predicts-job-performance/
- Le prove di lavoro si collocano su livelli alti di validità predittiva (0,54 nel 1998), gli assessment center su livelli moderati (0,37). http://homepages.se.edu/cvonbergen/files/2013/11/The-Validity-and-Utility-of-Selection-Methods-in-Personnel-Psychology_Practical-and-Theoretical-Implications-of-85-Years-of-Research-Findings.pdf
- I test di personalità, in particolare la dimensione della coscienziosità, predicono meno di quanto la loro popolarità commerciale lascerebbe intuire. https://gwern.net/doc/statistics/meta-analysis/2021-sackett.pdf
- Le referenze restano fra gli strumenti meno predittivi dell'intero elenco, nonostante siano fra i più usati. https://gwern.net/doc/statistics/meta-analysis/2021-sackett.pdf
- In-Sue Oh, Huy Le e Philip Roth hanno pubblicato nel 2023 su Journal of Applied Psychology una risposta che contesta la raccomandazione di Sackett e colleghi (2022) di non correggere per la varianza ristretta. https://experts.umn.edu/en/publications/correcting-for-range-restriction-in-meta-analysis-a-reply-to-oh-e/
- Secondo Oh, Le e Roth la correzione per la varianza ristretta applicata da Schmidt e Hunter resta giustificata. https://experts.umn.edu/en/publications/correcting-for-range-restriction-in-meta-analysis-a-reply-to-oh-e/
- Secondo la ricerca, si può essere perfettamente d'accordo fra valutatori e perfettamente in errore nella predizione della prestazione futura. https://researchmethod.net/inter-rater-reliability/
- Michael Spence ha pubblicato nel 1973 su Quarterly Journal of Economics il lavoro classico sul segnalamento. https://econpapers.repec.org/RePEc:oup:qjecon:v:87:y:1973:i:3:p:355-374.
- La validità dei test di abilità cognitiva cresce con la complessità del lavoro: 0,58 per i ruoli professionali e direttivi, 0,51 per quelli di media complessità, 0,23 per quelli non qualificati (Schmidt e Hunter, 1998). http://homepages.se.edu/cvonbergen/files/2013/11/The-Validity-and-Utility-of-Selection-Methods-in-Personnel-Psychology_Practical-and-Theoretical-Implications-of-85-Years-of-Research-Findings.pdf
- Unire un test di abilità cognitiva a un colloquio strutturato porta la validità a 0,63, più di ciascuno dei due da solo (0,51) ma meno della loro somma. http://homepages.se.edu/cvonbergen/files/2013/11/The-Validity-and-Utility-of-Selection-Methods-in-Personnel-Psychology_Practical-and-Theoretical-Implications-of-85-Years-of-Research-Findings.pdf
- Il sistema di screening di Amazon, poi abbandonato, è stato reso noto nel 2018 da un'inchiesta di Reuters basata su cinque fonti anonime; Amazon non ha commentato il sistema. https://www.reuters.com/article/us-amazon-com-jobs-automation-insight/amazon-scraps-secret-ai-recruiting-tool-that-showed-bias-against-women-idUSKCN1MK08G
- Il modello di Amazon, addestrato su dieci anni di curricula in un settore a forte prevalenza maschile, aveva imparato a penalizzare candidature che contenevano la parola 'donne' o il nome di college femminili. https://www.technologyreview.com/2018/10/10/139858/amazon-ditched-ai-recruitment-software-because-it-was-biased-against-women/
- Il problema del modello di Amazon non era un errore di programmazione: il modello aveva imparato esattamente ciò che i dati contenevano, e i dati contenevano una storia di assunzioni già distorta. https://datafield.dev/ai-ethics/ch07-understanding-algorithmic-bias/case-study-01.html
- Il Regolamento (UE) 2024/1689 (AI Act) classifica all'Allegato III i sistemi di intelligenza artificiale destinati al reclutamento e alla selezione come sistemi ad alto rischio. https://www.knowlee.ai/glossary/annex-iii-ai-act
- Il Regolamento (UE) 2026/1744 ha rinviato al 2 dicembre 2027 la piena applicabilità degli obblighi sui sistemi ad alto rischio dell'Allegato III per il reclutamento e la selezione. https://www.studiolegale.celotti.net/ai-act-2-agosto-2026-cosa-e-vero-cosa-no/
- L'AI Act non vieta l'uso di sistemi di intelligenza artificiale nella selezione e non stabilisce una soglia minima di validità predittiva, ma impone che chi li usa possa rendere conto di come funzionano. https://www.randstad.it/gestione-risorse-umane/digital-innovation/ai-act-aziende-recruiting-hr/
- La maggior parte dei coefficienti di validità predittiva per la selezione è calcolata su persone che sono state assunte, non su chi è stato scartato. https://pmc.ncbi.nlm.nih.gov/articles/PMC5725878/
- La censura del criterio è un limite strutturale della ricerca sulla selezione: non si hanno dati sulla prestazione di chi è stato scartato. https://pmc.ncbi.nlm.nih.gov/articles/PMC5725878/
- Per la maggior parte dei sistemi di intelligenza artificiale applicati alla selezione, non esiste una base di evidenza indipendente sulla validità predittiva paragonabile a quella accumulata per i test tradizionali. https://hai.stanford.edu/news/ai-hiring-tools-can-yield-racial-bias-and-systemic-rejection
- La validità degli strumenti di selezione tradizionali è uno dei temi più misurati e discussi della psicologia applicata, mentre la validità predittiva degli strumenti che li stanno sostituendo è nella letteratura indipendente in gran parte ancora da accertare. https://doi.org/10.1037/apl0000994
- Sackett, Zhang, Berry e Lievens (2022, Journal of Applied Psychology) hanno ricalcolato le stime di validità correggendo un eccesso di correzione per la varianza ristretta: in testa il colloquio strutturato (0,42), poi i test di conoscenza del lavoro (0,40) e le prove di lavoro (0,33); i test di abilità cognitiva scendono da 0,51 a 0,31. https://doi.org/10.1037/apl0000994
- Sackett e colleghi hanno replicato a Oh, Le e Roth nello stesso numero di Journal of Applied Psychology (2023), sostenendo che negli studi meta-analizzati la restrizione è di solito modesta e i dati per correggerla mancano. https://experts.umn.edu/en/publications/correcting-for-range-restriction-in-meta-analysis-a-reply-to-oh-e/
Fonti citate
- https://www.scribd.com/document/66407853/Hunter-and-Schmidt-1998-The-Validity-and-Utility-of-Selection-Methods-in-Personnel-Psychology-Practical-and-Theoretical-Implications-of-85-Years-of-R
- https://firstpersonnel.org/wp-content/uploads/2013/10/Summary-Schmidt-Hunter-1998.pdf
- https://www.cogn-iq.org/blog/what-predicts-job-performance/
- https://gwern.net/doc/statistics/meta-analysis/2021-sackett.pdf
- https://researchmethod.net/inter-rater-reliability/
- https://econpapers.repec.org/RePEc:oup:qjecon:v:87:y:1973:i:3:p:355-374.
- https://gwern.net/doc/iq/1986-hunter.pdf
- https://home.ubalt.edu/tmitch/645/session%204/Schmidt%20&%20Oh%20validity%20and%20util%20100%20yrs%20of%20research%20Wk%20PPR%202016.pdf
- https://www.reuters.com/article/us-amazon-com-jobs-automation-insight/amazon-scraps-secret-ai-recruiting-tool-that-showed-bias-against-women-idUSKCN1MK08G
- https://www.technologyreview.com/2018/10/10/139858/amazon-ditched-ai-recruitment-software-because-it-was-biased-against-women/
- https://datafield.dev/ai-ethics/ch07-understanding-algorithmic-bias/case-study-01.html
- https://www.knowlee.ai/glossary/annex-iii-ai-act
- https://www.studiolegale.celotti.net/ai-act-2-agosto-2026-cosa-e-vero-cosa-no/
- https://www.randstad.it/gestione-risorse-umane/digital-innovation/ai-act-aziende-recruiting-hr/
- https://pmc.ncbi.nlm.nih.gov/articles/PMC5725878/
- https://hai.stanford.edu/news/ai-hiring-tools-can-yield-racial-bias-and-systemic-rejection
- http://homepages.se.edu/cvonbergen/files/2013/11/The-Validity-and-Utility-of-Selection-Methods-in-Personnel-Psychology_Practical-and-Theoretical-Implications-of-85-Years-of-Research-Findings.pdf
- https://doi.org/10.1037/apl0000994
- https://experts.umn.edu/en/publications/correcting-for-range-restriction-in-meta-analysis-a-reply-to-oh-e/