Test di Ragionamento Generale Adattivo (Adapt-g)
Capitolo 1: Introduzione alla valutazione dell'abilità cognitiva
L'intelligenza generale, o abilità cognitiva come è talvolta chiamata, è stata studiata per più di un secolo (Spearman, 1904) a causa della sua importanza critica nell'istruzione e nel mondo del lavoro. Kuncel, Hezlett e Ones (2001), ad esempio, hanno dimostrato che l'abilità cognitiva è un eccellente predittore della performance accademica, misurata attraverso i voti, il completamento del titolo di studio, le valutazioni dei docenti, ecc. Per lavori di complessità media, Hunter (1980) ha riscontrato che l'abilità cognitiva è fortemente correlata alla performance, e la relazione è ancora più marcata per lavori più complessi. Recentemente, Kuncel, Hezlett e Ones (2004) hanno dimostrato che una singola misura dell'abilità cognitiva predice un'ampia gamma di esiti importanti, tra cui la performance accademica, il potenziale di carriera, la creatività e la performance lavorativa. Sulla base dei dati di migliaia di studi, la conclusione inevitabile è che l'abilità cognitiva è fortemente correlata alla performance in molti ambiti importanti.
Il modello a tre strati di Carroll (1993) è la concettualizzazione dell'intelligenza più nota e più ampiamente accettata attualmente disponibile. Il modello suddivide il costrutto ampio dell'abilità cognitiva in tre livelli o strati distinti, che vanno dai fattori specifici e ristretti dello Strato I a una concettualizzazione ampia della g o intelligenza generale allo Strato III. Lo Strato II comprende otto ampie abilità cognitive che influenzano la g, tra cui la Gf e la Gc.
Gf — Intelligenza fluida (Cattell, 1971): la capacità di "estrarre relazioni complesse tra elementi semplici le cui proprietà sono note a tutti" (p. 98). Detto più semplicemente, la Gf si riferisce all'abilità di ragionamento di base, esemplificata dal ragionamento induttivo e deduttivo.
Gc — Intelligenza cristallizzata: riflette le conoscenze acquisite da un individuo. Ad esempio, la conoscenza del lessico è un'abilità dello Strato I, fortemente correlata alla Gc.
Passando ora alla misurazione dell'intelligenza, una buona misura dell'abilità cognitiva dovrebbe includere la valutazione sia della Gf sia della Gc. Il Test di Ragionamento Generale Adattivo (AdaptGRT) è stato progettato proprio con questo obiettivo. Comprende due test (Ragionamento Numerico e Ragionamento Astratto) che misurano l'intelligenza fluida, e un test (Ragionamento Verbale) che è una buona misura dell'intelligenza cristallizzata. Il punteggio complessivo del test, che è un composito del Ragionamento Numerico, del Ragionamento Astratto e del Ragionamento Verbale, fornisce un'ottima misura dell'abilità cognitiva generale.
Capitolo 2: Test Adattivo Computerizzato e Teoria della Risposta all'Item
Il Test Adattivo Computerizzato, o CAT, è una forma di somministrazione su schermo che si adatta al livello di abilità dell'individuo (Van der Linden & Glas, 2000). In altre parole, il test regola la difficoltà degli item presentati sulla base della sequenza di risposte del candidato. Se un individuo risponde in modo errato a un item di difficoltà media, il CAT presenterà un item più facile. Un individuo che risponde correttamente a un item riceverà una domanda più difficile. I criteri di terminazione integrati nel motore CAT determinano quando è stato raggiunto il livello ottimale di informazione.
Principi del CAT
Secondo Weiss e Kingsbury (1984), un test CAT si compone di cinque aspetti: la banca di item, il punto di partenza del test, la selezione degli item, i criteri di terminazione e la procedura di punteggio. Questi vengono convertiti in algoritmi che regolano la sessione di test e sono contenuti in ciò che viene definito "motore" o software del test.
Banca di item
Una valutazione CAT richiede un'ampia banca di item. Questi item devono essere validati e calibrati prima di essere integrati nel CAT, al fine di determinarne il livello di difficoltà e altri parametri importanti. Queste stime parametriche vengono introdotte nel motore CAT e guidano la selezione degli item. Gli item vengono calibrati secondo la Teoria della Risposta all'Item (IRT), il modello statistico alla base del CAT. È importante che la banca di item complessiva includa un numero sufficiente di item per coprire tutti i livelli di difficoltà e di abilità dei candidati.
Punto di partenza
Inizialmente il livello di abilità del candidato è sconosciuto. Alcuni motori CAT assumono che egli o ella possieda un livello di abilità medio e presentano quindi un item di difficoltà media all'inizio del test. In alternativa, come nell'AdaptGRT, al candidato vengono presentati diversi item che coprono l'intera scala di difficoltà, al fine di determinare una stima preliminare dell'abilità.
Selezione degli item
Un algoritmo guida la selezione degli item nel CAT al fine di fornire una stima dell'abilità massimale con il minor numero possibile di item (Thissen & Mislevy, 2000). Una volta stabilito il punto di partenza, viene selezionato un item successivo che fornisca la maggiore quantità di informazione. La stima iniziale dell'abilità viene continuamente aggiornata dopo ogni risposta corretta o errata e guida la selezione dell'item successivo.
Terminazione del test
Un algoritmo è incorporato nel motore CAT per impedire che la selezione degli item continui indefinitamente. Questo criterio specifica il punto in cui il test dovrebbe terminare. Nel test AdaptGRT, ciò avviene quando l'errore standard di misurazione scende al di sotto di una soglia pre-specificata.
Punteggio
Come per la calibrazione degli item, la procedura di punteggio che sottende la stima dell'abilità si basa sull'IRT. Ulteriori informazioni sul modello di punteggio IRT sono fornite più avanti nel capitolo.
Vantaggi: minor numero di item necessari, sessioni più brevi, maggiore sicurezza del test grazie alla sequenza unica per candidato, riduzione degli effetti di memoria nelle ri-somministrazioni.
Limiti: necessità di una banca di item molto ampia; costi e tempi di calibrazione elevati; rischio di sovraesposizione di item a media difficoltà; difficoltà di gestione del tempo per il candidato; costi di aggiornamento della banca.
Introduzione alla Teoria della Risposta all'Item (IRT)
L'AdaptGRT si basa sul modello IRT logistico a tre parametri (3PLM; Birnbaum, 1968), particolarmente adatto ai tipi di item di abilità cognitiva utilizzati in questo test. In sintesi, l'AdaptGRT adatta la difficoltà del test al livello di abilità di ciascun candidato selezionando item che soddisfino specifiche di contenuto e di "informazione". In questo modo, ciascun test è progettato individualmente per fornire elevata accuratezza e precisione con un numero di item molto inferiore rispetto a quello richiesto da un tipico test cartaceo (non adattivo).
Cos'è l'IRT?
L'IRT è una metodologia statistica basata su modelli che, analogamente alla teoria classica dei test (CTT), mira a misurare la performance di un individuo su un tratto o costrutto latente. L'IRT si basa su una serie di assunzioni riguardanti la relazione matematica tra tratti e risposte dei candidati. Il termine "abilità", indicato con la lettera greca theta (Θ), viene utilizzato nell'IRT per riferirsi al punteggio o al "livello" del tratto latente di un individuo.
L'IRT valuta la probabilità di rispondere correttamente a un item in funzione sia del tratto latente sia di determinati parametri dell'item. La stessa metodologia è utilizzata per determinare la verosimiglianza dell'abilità di un candidato in funzione delle risposte osservate agli item e, ancora una volta, dei parametri degli item stessi.
Il modello IRT 3PLM
Uno dei modelli IRT più parsimoniosi e riconosciuti è il modello logistico a un parametro o modello di Rasch (Rasch, 1960) per dati dicotomici (corretto-errato). Il modello di Rasch utilizza il livello del tratto del candidato e un solo parametro dell'item, la difficoltà (la collocazione di un item sul continuum del tratto), per predire la probabilità di rispondere correttamente a un item. Nella maggior parte dei domini psicologici, tuttavia, vengono utilizzate più proprietà degli item (parametri) per modellare la probabilità di risposte corrette. In particolare, per item a scelta multipla, vengono presi in considerazione anche la discriminazione dell'item (quanto bene un item differenzia tra candidati con diversi livelli di abilità) e il guessing.
Nel modello logistico a tre parametri (3PLM), ciascun item è caratterizzato da un parametro di difficoltà (b), un parametro di discriminazione (a) e un parametro di pseudo-guessing (c). Il parametro c rappresenta l'asintoto inferiore al quale i candidati con il livello più basso di abilità possono fornire la risposta corretta per via del guessing. La probabilità di una risposta corretta o positiva all'item i per il 3PLM è data da:
Dove:
- ui indica la risposta di un candidato all'item i. ui = 1 se corretta, 0 se errata.
- P(ui = 1 | Θ) è la probabilità di una risposta corretta per un candidato scelto a caso con livello del tratto Θ.
- 1,7 è un fattore di scala incluso per ragioni storiche.
Si noti che il modello logistico a due parametri (2PLM) e il modello logistico a un parametro (1PLM o modello di Rasch), talvolta utilizzati anch'essi per la valutazione dell'abilità cognitiva, possono essere ottenuti dall'equazione sopra riportata imponendo "vincoli" ai parametri a e c. Se si assume l'assenza di guessing e si imposta c = 0 per tutti gli item, si ottiene il 2PLM. Se si assume inoltre che tutti gli item siano egualmente discriminanti (ad esempio, impostando a = 1 per tutti), si ottiene il 1PLM.
Il 3PLM è il modello IRT più comunemente applicato nei programmi di valutazione dell'abilità cognitiva su larga scala. La presenza di tre parametri dell'item rende questo modello sufficientemente flessibile da descrivere le risposte a un'ampia varietà di item a scelta multipla. Ancora più importante, numerosi studi hanno dimostrato che il 3PLM si adatta eccellentemente ai dati di abilità cognitiva (ad esempio, Drasgow, Levine, Tsien, Williams e Mead, 1995), per cui può essere utilizzato agevolmente per assegnare i punteggi ai candidati.
Funzione di risposta all'item (IRF)
La funzione di risposta all'item (IRF) o curva caratteristica dell'item (ICC) rappresenta la probabilità di rispondere correttamente a un item in funzione del livello di abilità del candidato. La Figura 1 presenta un esempio di IRF 3PLM con un parametro di difficoltà (b) pari a 0, un parametro di discriminazione (a) pari a 1 e un parametro di guessing (c) pari a 0,2.
L'asse x di un grafico IRF rappresenta l'abilità teorica di un candidato e tipicamente varia da −3 a +3. Si noti che l'intervallo da −3 a +3 è scelto per Θ poiché la sua distribuzione viene solitamente assunta come normale standard durante la fase iniziale di stima dei parametri degli item e di punteggio. L'asse y rappresenta la probabilità di ottenere una risposta corretta, indicata con P(ui = 1 | Θ).
La Figura 2 mostra le IRF 3PLM per tre item ipotetici aventi gli stessi parametri di discriminazione e guessing (rispettivamente a = 1,5 e c = 0,2), ma diversi parametri di difficoltà (o di "collocazione") (rispettivamente b = −1,0; 0,0; +1,0). Si può osservare che il parametro di difficoltà dell'item influenza la posizione laterale delle IRF lungo il continuum del tratto. Man mano che il parametro di difficoltà aumenta da −1,0 a 1,0, la probabilità di una risposta corretta, a un dato theta, diminuisce. Ad esempio, solo i candidati con Θ > 1,5 hanno un'alta probabilità di rispondere correttamente all'ultimo item.
La Figura 3 illustra come il parametro di discriminazione dell'item influenza la forma delle IRF. Sono mostrati item che presentano discriminazione piuttosto bassa (a = 0,5), discriminazione media (a = 1,0) e discriminazione alta (a = 2,0). È evidente che, man mano che il parametro di discriminazione dell'item aumenta, le IRF diventano più ripide in pendenza. Si noti che la differenza nelle probabilità di risposta per candidati con, ad esempio, Θ = −0,5 e Θ = 0,5 aumenta all'aumentare della discriminazione dell'item. Per l'item a bassa discriminazione, la differenza nella probabilità di risposta è solo 0,2. Per l'item ad alta discriminazione, invece, la differenza nelle probabilità di risposta è quasi 0,8. Pertanto, gli item con parametri a elevati differenziano meglio i candidati aventi diversi livelli del tratto; da qui il termine "discriminazione dell'item".
Infine, la Figura 4 illustra l'effetto del terzo parametro dell'item del 3PLM, il parametro di guessing, c. Con un tipico item a scelta multipla, anche i candidati a bassa abilità possono indovinare la risposta corretta. Come mostrato, il parametro c innalza l'asintoto inferiore della IRF, cosicché la probabilità di una risposta corretta rimane superiore a zero per qualsiasi livello del tratto. I valori del parametro c tipicamente variano da 0,1 a 0,3 per item aventi 4 o 5 opzioni di risposta.
Stima dei livelli del tratto mediante la Teoria della Risposta all'Item
La logica del punteggio dei candidati in IRT è fondamentalmente diversa dal punteggio della Teoria Classica dei Test (CTT). Nella CTT, i livelli del tratto vengono stimati sommando le risposte attraverso gli item in un punteggio totale e convertendo poi il punteggio sommato in un punteggio standard o in un punteggio su un'altra metrica (ad esempio, la metrica del QI con media 100 e deviazione standard 15, o la metrica SAT con media 500 e deviazione standard 100). I punteggi sommati non sono appropriati per i test adattivi perché alcuni candidati ricevono item più difficili rispetto a quelli somministrati ad altri. In contrasto con il punteggio CTT, il punteggio IRT stima il livello del tratto di un individuo, Θ, che non dipende dall'insieme di item che gli vengono somministrati.
Nell'IRT, la stima dei livelli del tratto è simile a una diagnosi clinica, in cui un clinico cerca di stimare la malattia più probabile sulla base di un insieme di sintomi presentati. Nell'IRT, i "sintomi" sono le risposte agli item e la "malattia" è il livello del tratto del candidato. Si noti che sia l'IRT sia la diagnosi clinica assumono che siano possibili anche altri esiti (un candidato può avere un diverso livello del tratto o un paziente può avere una diversa malattia), ma l'esito diagnosticato (livello del tratto) è quello più probabile. Pertanto, nell'IRT esiste un processo di ricerca in cui i comportamenti manifestati (le risposte agli item e i relativi parametri) vengono utilizzati per determinare quale livello del tratto è più probabile.
Si consideri un candidato con una risposta corretta e una errata a due item. L'item corretto ha a = 1,0, b = −1,0, c = 0,1. L'item errato ha a = 1,0, b = 2,0, c = 0,2. La probabilità condizionata del pattern (corretto, errato) è il prodotto delle singole probabilità fornite dall'Equazione 1.
Questa regola del prodotto deriva dall'assunzione di IRT di indipendenza locale o condizionata, che afferma che le risposte agli item di un candidato sono indipendenti l'una dall'altra, dato il suo livello Θ. In sostanza, l'indipendenza condizionata afferma che la probabilità di risposta per un dato item è funzione del livello del tratto di quel candidato e dei parametri dell'item, e non dipende da come il candidato ha risposto agli altri item.
Formalmente, la probabilità condizionata di un pattern di risposta u = <u1, u2, …, un> per un candidato j dato Θ e i vettori dei parametri degli item βi = <ai, bi, ci> è data da:
In questa equazione, Qi rappresenta la probabilità di una risposta errata all'item i ed è uguale a 1 − Pi.
Per illustrare la regola del prodotto scritta nell'Equazione 2, abbiamo moltiplicato la probabilità della risposta corretta all'Item 1 e la probabilità della risposta errata all'Item 2 a vari livelli del tratto, e abbiamo riportato questi valori in grafico nella Figura 5. Il risultato, chiamato "funzione di verosimiglianza", presenta un singolo picco, con un massimo a Θ = 1,0. Questo valore è chiamato stima di massima verosimiglianza del livello del tratto del candidato (è la moda della funzione di verosimiglianza). In altre parole, è il livello del tratto più probabile dato il pattern di risposta osservato per i due item. Naturalmente, anche altre stime sono possibili, ma la Figura 5 mostra che il valore 1,0 è il più probabile.
Trovare il valore Θ che massimizza l'equazione della probabilità condizionata è semplice. Una soluzione per forza bruta consiste nel calcolare il valore di verosimiglianza in molti punti Θ attraverso l'intervallo del tratto e selezionare semplicemente il livello del tratto corrispondente al valore di verosimiglianza più alto. È esattamente ciò che è stato fatto nell'esempio sopra. Può essere implementata anche una soluzione analitica basata su un algoritmo suggerito per la prima volta da Sir Isaac Newton, che richiede meno calcoli.
Un problema critico delle stime di massima verosimiglianza è che non è possibile stimare alcun livello del tratto per candidati con pattern di risposta tutti corretti o tutti errati: la stima dell'abilità è più o meno infinito. Inoltre, la stima dell'abilità di massima verosimiglianza funziona meglio quando è disponibile un numero relativamente elevato di item. Entrambe queste limitazioni rendono la stima di massima verosimiglianza impraticabile in un contesto CAT. Di conseguenza, altri metodi di stima del tratto, come il massimo a posteriori (MAP) o l'atteso a posteriori (EAP), sono preferiti in pratica.
La stima EAP (Bock & Mislevy, 1982) è uno stimatore bayesiano derivato dalla ricerca della media della distribuzione a posteriori del tratto, data le risposte agli item. Il vantaggio principale è che è una procedura non iterativa, per cui non è necessario implementare metodi di ricerca come quello per forza bruta o il metodo di Newton-Raphson.
La stima EAP (Bock & Mislevy, 1982) è uno stimatore bayesiano derivato dalla ricerca della media della distribuzione a posteriori del tratto, data le risposte agli item. La distribuzione a posteriori è calcolata come la probabilità condizionata del pattern di risposta (vedi Equazione 2) moltiplicata per la funzione di distribuzione a priori (solitamente la funzione normale standard). La distribuzione a priori è semplicemente la distribuzione di probabilità dalla quale è estratto un candidato. L'integrazione di questa prior nella funzione di verosimiglianza migliora la stima del tratto nei casi in cui si osservano pattern di risposta tutti corretti/tutti errati o quando i test sono relativamente brevi. Il principale vantaggio della stima EAP è che si tratta di una procedura non iterativa, per cui non è necessario implementare metodi di ricerca come quello per forza bruta o il metodo di Newton-Raphson descritti sopra. L'equazione per la stima EAP è la seguente:
Qr rappresenta i valori Θ di 80 nodi di quadratura equidistanti (compresi tra −4 e 4), W(Qr) sono i pesi a ciascun nodo tratti da una distribuzione normale standard e L(Qr) sono i valori di probabilità condizionata del pattern di risposta a ciascun valore di Θ (questi sono calcolati utilizzando l'Equazione 2). Sebbene sia possibile utilizzare più o meno di 80 nodi di sommatoria nell'Equazione 3, abbiamo riscontrato che 80 forniscono risultati molto accurati e, con i computer moderni, vengono calcolati molto rapidamente. La stima risultante del livello del tratto rappresenta la media della distribuzione a posteriori. Questo metodo di stima EAP è implementato nell'AdaptGRT.
Come discusso sopra, una caratteristica importante dell'IRT è che si può ottenere una stima di Θ purché siano disponibili osservazioni da qualsiasi insieme di item con parametri noti. Ancora più significativamente, se i parametri degli item per una data banca di item sono sulla stessa metrica, qualsiasi sottoinsieme di item somministrato a un candidato specifico produrrà stime del tratto sulla stessa scala. In altre parole, il tratto in IRT è invariante rispetto all'item (naturalmente, le stime del tratto sono più accurate quando a un candidato vengono somministrati item di difficoltà appropriata). La proprietà di invarianza dell'item dell'IRT è critica per le applicazioni CAT perché i candidati non affrontano la stessa sequenza o lo stesso numero di item.
Valutazione dell'accuratezza delle stime del tratto in IRT
Un'altra domanda importante per le applicazioni CAT è: come influiscono gli item somministrati a un candidato sulla precisione della stima di Θ? Sebbene i metodi di stima descritti sopra producano una stima del livello del tratto del candidato, una rapida occhiata al grafico della verosimiglianza nella Figura 5 suggerisce che esiste una sostanziale probabilità di altri valori (la verosimiglianza di livelli del tratto vicini non è molto inferiore alla verosimiglianza nel massimo). L'ampiezza della funzione di verosimiglianza vicino alla sua moda nella Figura 5 (cioè, la funzione di verosimiglianza è relativamente piatta vicino al suo massimo) mostra che non dovremmo avere eccessiva fiducia nella stima di massima verosimiglianza ottenuta. Intuitivamente, sarebbe preferibile una funzione di verosimiglianza con un picco più accentuato, perché ciò riduce notevolmente la gamma di stime alternative possibili. La curvatura della funzione di verosimiglianza nel suo punto di massimo può essere utilizzata per caratterizzare la precisione della stima del tratto. Può essere approssimata dalla funzione di informazione del test (TIF):
Dove P′i è la derivata prima di Pi per l'item i rispetto a Θ. La quantità all'interno della somma è nota come funzione di informazione dell'item (IIF), e pertanto la somma delle IIF produce la TIF. Più alta è la TIF, più stretta è la funzione di verosimiglianza. Un'ulteriore analisi dell'Equazione 4 rivela che essa è: 1) additiva (l'aggiunta di più item produce maggiore informazione); e 2) non dipende dalle risposte agli item, per cui può essere calcolata per l'insieme di item somministrati a un candidato.
Per rendere la funzione di verosimiglianza con un picco accentuato (o l'informazione elevata) per un particolare candidato, si può aumentare il numero di item somministrati. Tuttavia, l'aggiunta di item che hanno IRF piatte al livello del tratto del candidato contribuisce poco ad aumentare la curvatura della funzione di verosimiglianza (in sostanza moltiplica la verosimiglianza per una costante, il che non aumenta la curvatura). Una strategia più utile è presentare item aventi parametri di difficoltà simili al livello del tratto di quel candidato. Qui la pendenza della IRF è elevata e la sua moltiplicazione nella verosimiglianza aumenta la curvatura. Le applicazioni CAT raggiungono la loro efficienza selezionando accuratamente tali item in modo che la lunghezza del test possa essere mantenuta al minimo. A titolo di esempio, la Figura 6 presenta due funzioni di verosimiglianza ipotetiche per un candidato con Θ = 1,2 che sostiene due test da 5 item. Il primo test conteneva item con un'ampia gamma di difficoltà, mentre il secondo test conteneva item con difficoltà raggruppate attorno al livello del tratto di quel candidato.
Come previsto, l'ampiezza della funzione di verosimiglianza del secondo test è inferiore a quella del primo. Di fatto, somministrare un test di 10 o anche 15 item, simile al test 1 (cioè avente item con un'ampia gamma di difficoltà), non raggiungerebbe la precisione del secondo test, sebbene questo sia considerevolmente più breve.
Per riassumere, la curvatura della funzione di verosimiglianza ci informa sulla precisione di una stima dell'abilità: maggiore curvatura significa maggiore precisione. La TIF ci dice quanta curvatura della funzione di verosimiglianza ci si aspetta nel punto di massimo, dato l'insieme di item contenuti in un test. Di conseguenza, la TIF può essere calcolata prima che un test venga somministrato, per valutarne la precisione a vari valori di Θ. La TIF è la somma delle IIF per gli item contenuti nel test; le IIF si combinano in modo additivo per formare la TIF. Pertanto, in un CAT possono essere calcolati i valori delle IIF alla stima dell'abilità corrente per gli item non ancora somministrati. L'item con la IIF più elevata può essere selezionato e somministrato come prossimo nel CAT; questo è chiamato selezione dell'item a massima informazione.
Nell'algoritmo CAT dell'AdaptGRT, le funzioni di informazione dell'item (IIF) sono calcolate per ciascun item e memorizzate in "tabelle di consultazione". Questi valori vengono utilizzati durante la somministrazione del CAT per determinare quali item somministrare a un particolare candidato.
Sebbene il reciproco della funzione di informazione del test data nell'Equazione 4 possa essere utilizzato per approssimare la varianza dell'errore della stima EAP, in pratica i valori di informazione vengono utilizzati esclusivamente per la selezione degli item. L'errore standard della stima EAP, chiamato deviazione standard a posteriori (PSD), può essere calcolato direttamente mediante la seguente equazione:
Questa equazione è implementata nel programma AdaptGRT per valutare l'accuratezza delle stime del tratto per ciascun candidato. Una discussione più dettagliata della procedura di selezione adattiva degli item nell'AdaptGRT è fornita di seguito.
Test Adattivo Computerizzato basato sul 3PLM
A differenza degli ambienti di test tradizionali, in cui una o più forme di test vengono costruite in anticipo e gli item sono somministrati ai candidati in un ordine prescritto, i test adattivi computerizzati possono essere costruiti al volo, cosicché ciascun candidato riceve un insieme unico di item che forniscono un'informazione quasi massimale, in senso psicometrico, alla stima del punteggio del tratto di un candidato in qualsiasi momento durante l'esame.
Come discusso sopra, gli item del test vengono scelti per fornire un'informazione quasi massimale al livello di abilità del candidato. Una volta che ciascun item è stato risposto, la stima dell'abilità del candidato viene aggiornata e fornisce la base per la selezione dell'item successivo.
Il test adattivo in questa modalità è psicometricamente efficiente, producendo spesso una precisione simile a quella di test convenzionali (non adattivi) aventi quasi il doppio degli item. Inoltre, i CAT tendono a fornire maggiore accuratezza e precisione a livelli del tratto estremi rispetto ai test non adattivi, il che ne migliora l'utilità per il processo decisionale e il feedback diagnostico.
Per illustrare in modo più dettagliato come gli item vengono selezionati nell'AdaptGRT, si consideri, ad esempio, l'equazione dell'informazione dell'item per il 3PLM, mostrata di seguito:
Prima che ciascun item venga selezionato, l'Equazione 6 viene utilizzata per calcolare la quantità di informazione fornita da ciascun item disponibile nella banca alla stima del punteggio del tratto del candidato (EAP). Selezionare l'item che fornisce la maggiore quantità di informazione sarebbe ottimale in senso psicometrico, ma ciò porterebbe a un sovrutilizzo degli item con i parametri a più elevati. Pertanto, nell'AdaptGRT, l'esposizione degli item è controllata identificando un piccolo sottoinsieme di item che forniscono un'informazione quasi massimale al punteggio del tratto EAP più o meno un piccolo numero casuale, e un item viene poi selezionato casualmente da quel sottoinsieme per essere presentato al candidato. Studi di simulazione che confrontano la selezione adattiva e non adattiva degli item utilizzando questo e approcci simili hanno costantemente mostrato miglioramenti considerevoli nell'efficienza del test. Tipicamente, il CAT produce punteggi del tratto con accuratezza e precisione simili utilizzando solo la metà degli item.
Capitolo 3: Sviluppo dell'AdaptGRT
L'AdaptGRT è stato inizialmente adattato da una valutazione dell'abilità cognitiva cartacea. Da allora, ha attraversato una serie di fasi di sviluppo successive, ciascuna delle quali ha mirato a migliorare gli item e il funzionamento della valutazione. Questa sezione fornisce maggiori informazioni sulla metodologia di ricerca e sull'analisi condotte in ciascuna fase.
Fase Uno: Sviluppo iniziale dell'AdaptGRT
L'AdaptGRT è stato originariamente concepito come versione adattiva computerizzata della batteria di test di ragionamento generale cartacea di Psytech, la GRT2. La GRT2 è stata selezionata in quanto è un test di abilità a largo spettro basato su molti anni di rigorosa validazione e ricerca (Psytech International Limited, 2010). Sia la GRT2 sia l'AdaptGRT valutano tre domini legati al ragionamento: Verbale, Numerico e Astratto. Ciascuno di questi test contiene una varietà di diversi formati di item per garantire che forniscano una misura ampia delle dimensioni sottostanti ciascuno dei tre domini.
Le abilità Verbale e Numerica valutano, come suggerirebbero i rispettivi nomi, la capacità di utilizzare parole e numeri in modo razionale, identificando correttamente le relazioni logiche tra queste entità e trarre conclusioni e inferenze da esse. Il ragionamento astratto valuta la capacità di identificare relazioni logiche tra relazioni spaziali astratte e figure geometriche.
Creazione e pre-test della banca di item
Gli item per l'AdaptGRT sono stati sviluppati e sottoposti a pre-test nel corso di un periodo di due anni. Per ciascun test, è stato redatto un gran numero di item con una lunghezza dello stesso analogo. Questi item dovevano variare in difficoltà al fine di fornire una misura per i candidati a ciascun punto del continuum dell'abilità. Gli item sono stati inoltre redatti tenendo presenti due assunzioni primarie dell'IRT, ovvero l'unidimensionalità e l'indipendenza locale (Kolen & Brennan, 2014):
- L'unidimensionalità richiede che un item o un test sia correlato a un unico costrutto sottostante.
- L'indipendenza locale richiede che un item nel test sia indipendente da un altro item. Pertanto la risposta di un candidato all'item A non dovrebbe influenzare la sua risposta all'item B.
Se queste assunzioni non vengono prese in considerazione nella progettazione degli item, possono avere un effetto dannoso sull'adattamento del modello e sulle stime parametriche. La violazione dell'indipendenza locale può portare a una sovrastima dell'affidabilità e a una sottostima dell'errore standard di misurazione.
Poiché l'AdaptGRT è prevalentemente utilizzato per applicazioni di selezione e screening del personale, in cui il tempo di test è un fattore critico, si è cercato di mantenere il contenuto degli item il più semplice e breve possibile. Inoltre, i tipi di domanda posti sono stati ridotti al minimo e, ove possibile, tipi di domanda simili sono stati inseriti in più forme di test.
- Associazioni — es. "3,18 sta a 1,06 come 1,23 sta a ...?" oppure "Zinco sta a Orchidea come Metallo sta a ...?"
- Intruso — es. "Quale dei seguenti è l'intruso: Veicolo, Motocicletta, Camion, Aereo, Hovercraft o Treno?"
- Completa la sequenza — es. "1, 3, 5, 6, 10, 9, 15, 12, ... Quale numero viene dopo?" (Astratto e Numerico)
- Problema — es. "Se New York è cinque ore indietro rispetto a Londra e Los Angeles è tre ore indietro rispetto a New York, che ore sono a Los Angeles quando sono le 16:00 a Londra?" (Numerico)
- Antonimi — es. "Piangere è l'opposto di ..." (Verbale)
Indipendentemente dal tipo, tutte le domande avevano sei (6) opzioni di risposta per minimizzare gli effetti del guessing.
Una volta redatti, gli item sono stati raggruppati in forme di test da 20 a 35 item e caricati sulla piattaforma di valutazione Psytech. I dati sono stati prevalentemente raccolti tramite test di pratica. Pertanto, i campioni utilizzati per il pre-test degli item dell'AdaptGRT rispecchiavano da vicino la popolazione dei futuri candidati. I candidati sono stati assegnati casualmente a una delle forme di test, in modo che i dataset risultanti potessero essere trattati come equivalenti. Sono stati effettuati ulteriori controlli inserendo item in più forme di test e confrontando i p-value degli item tra i dataset.
Sebbene non siano state raccolte informazioni demografiche durante il pre-test a causa dell'accordo di riservatezza, nel complesso la maggior parte dei candidati erano aspiranti a posizioni di livello qualificato nel Regno Unito, con una percentuale circa uguale di uomini e donne, e un mix diversificato di background culturali e razziali.
| Test | Item unici pre-testati | Forme di test | Range campione |
|---|---|---|---|
| Ragionamento Verbale | 268 | 11 | 200 – 5.000 |
| Ragionamento Numerico | 177 | 10 | 200 – 5.000 |
| Ragionamento Astratto | 126 | 5 | 200 – 5.000 |
La maggior parte dei campioni superava i 500 candidati, sufficiente per una stima parametrica IRT accurata con MML o metodi bayesiani.
Codifica degli item e pre-calibrazione
Sono state condotte analisi degli item secondo la Teoria Classica dei Test (CTT) per verificare la qualità e l'appropriatezza degli item per il modello IRT logistico a tre parametri (3PL). Nello specifico, sono stati calcolati e esaminati i p-value e le correlazioni item-totale corrette (CITC) per ciascun item per determinare se fossero codificati correttamente e avessero correlazioni positive con gli altri item nella forma di test. Gli item con p-value bassi (cioè, quando la percentuale di risposte corrette era pari o inferiore al livello di casualità di 0,15) sono stati verificati per possibili problemi di contenuto o codifica e, se necessario, eliminati dalla banca. Sono stati eliminati anche gli item con CITC negativa o prossima a zero; tali item erano stati o mal interpretati dai candidati o contenevano più di una risposta corretta e avrebbero probabilmente causato problemi di convergenza del programma durante la calibrazione IRT degli item.
Calibrazione degli item
Gli item dell'AdaptGRT sono stati calibrati secondo il modello IRT 3PL, utilizzando il programma per computer BILOG-MG per Windows (du Toit, 2003). In un mondo ideale, l'intera banca di item sarebbe stata completata dallo stesso gruppo campione eterogeneo, in modo da poter calibrare simultaneamente i parametri per tutti gli item. Tuttavia, dato il gran numero di item, ciò non era praticabile e pertanto la banca di item è stata divisa in sottoinsiemi più piccoli. Questi sottoinsiemi condividevano item comuni ed era quindi possibile fondere i dati in una fase successiva, codificando le risposte mancanti come "non raggiunte" e calibrando concomitantemente i parametri degli item. Nelle situazioni in cui i sottoinsiemi non condividevano item comuni, si è assunto che il campione di pre-test fosse equivalente in distribuzione dell'abilità, poiché assegnato casualmente ai gruppi di sottoinsiemi e con una dimensione campionaria totale spesso superiore a 1000.
In totale, il team di ricerca ha condotto sette calibrazioni parametriche degli item separate per il test di Ragionamento Verbale, 5 calibrazioni per il test di Ragionamento Numerico e cinque calibrazioni per il test di Ragionamento Astratto. I dati mancanti per progettazione sono stati trattati come "non raggiunti". Sono stati utilizzati prior predefiniti per i parametri di discriminazione e difficoltà, l'integrazione numerica è stata eseguita con 40 punti di quadratura, e il criterio di convergenza è stato impostato a 0,01 come raccomandato da BILOG. Tutte le esecuzioni di calibrazione hanno convergente prima che fosse raggiunto il numero massimo di cicli E-M (100).
L'adattamento modello-dati è stato valutato utilizzando sia metodi grafici (grafici di adattamento) sia metodi statistici (chi-quadro per item singoli, doppi e tripli) (Chernyshenko, Stark, Chan, Drasgow e Williams, 2001). Come previsto, il 3PL si è adattato molto bene agli item dell'AdaptGRT. Con poche eccezioni, i rapporti chi-quadro corretto sui gradi di libertà per item singoli, doppi e tripli erano al di sotto o al livello di 3,0 raccomandato da Drasgow, Levine, Tsien, Williams e Mead (1995). Nei rari casi in cui le statistiche di adattamento superavano i livelli di cut-off raccomandati, gli item non adattati sono stati eliminati.
I parametri 3PL risultanti sono stati quindi esaminati per valutarne l'idoneità al CAT. Gli item con parametri di discriminazione bassi (al di sotto di 0,40) sono stati eliminati. Tali item tendono a fornire poca informazione a qualsiasi livello del tratto ed è improbabile che vengano selezionati dall'algoritmo di test adattivo. Gli item con parametri di discriminazione moderati (tra 0,40 e 0,50) sono stati conservati solo se i loro parametri di difficoltà erano compresi nelle gamme medie o positive del tratto. In queste regioni erano disponibili relativamente pochi item, per cui questi item avrebbero avuto una maggiore probabilità di essere utilizzati durante la somministrazione.
| Test | Item finali | Range a | Range b | Range c |
|---|---|---|---|---|
| Verbale | 200 | 0,42 – 3,26 | −4,80 – 4,07 | 0,01 – 0,50 |
| Numerico | 155 | 0,42 – 2,41 | −3,89 – 2,53 | 0,05 – 0,30 |
| Astratto | 110 | 0,42 – 1,59 | −3,24 – 3,09 | 0,03 – 0,46 |
Funzioni di Informazione del Test (TIF) ed Errore Standard (SE)
Come discusso nel capitolo due, la funzione di informazione dell'item (IIF) e la corrispondente TIF aggregata forniscono un'indicazione dell'"informazione" che l'item o il test fornisce nel predire l'abilità di un candidato. Secondo Baker (2008), l'informazione può essere considerata un analogo IRT della misura di affidabilità della teoria classica dei test (CTT) e fornisce un'indicazione di quanto precisamente il test possa distinguere tra individui con livelli più alti o più bassi di abilità.
L'Errore Standard è un altro indicatore della qualità dell'item e può essere considerato un analogo dell'errore standard di misurazione tipicamente calcolato nelle analisi CTT. Man mano che l'informazione di un test aumenta, l'ES del test dovrebbe diminuire. Lo stesso vale per la funzione di informazione e l'ES degli item. In un test ideale, gli item determinerebbero la quantità massimale di informazione sull'abilità di un candidato con la minima quantità di ES. Le funzioni di informazione sono utili anche per dimostrare quali aree del continuum del tratto gli item individuali e la banca di item nel suo complesso misurano bene e in quali aree lo fanno meno.
Queste funzioni sono state riportate in grafico per i tre test AdaptGRT una volta completata la calibrazione. Come si può vedere dalla Figura 7, gli item di Ragionamento Verbale presentavano curve di informazione più elevate ed errori standard più bassi su un intervallo più ampio di valori del tratto rispetto agli altri due test. Ciò era dovuto in parte al fatto che la banca di item per il test di Ragionamento Verbale conteneva 200 item, rispetto ai 155 della banca di item di Ragionamento Numerico e ai 110 della banca di item di Ragionamento Astratto. Inoltre, le difficoltà degli item erano distribuite in modo più uniforme per questa banca, per cui vi erano sufficienti item altamente discriminanti per tutte le regioni del tratto.
Per il Ragionamento Numerico e Astratto, la TIF indicava che gli item discriminavano meglio nella regione del tratto compresa tra 1,5 e 2,0 – vedi Figure 8 e 9. Entrambi questi test contenevano un piccolo numero di item difficili, causando l'aumento dell'errore standard all'estremo superiore della gamma di abilità. Tuttavia, poiché lo scopo principale dell'AdaptGRT è selezionare i candidati nelle gamme basse e medie del tratto, tutte e tre le banche di item sono state giudicate sufficientemente eterogenee per i fini di utilizzo del CAT.
Stima del tratto e normazione
Uno dei vantaggi chiave dell'IRT rispetto ai metodi CTT è che le sue stime del tratto sono invarianti rispetto all'item. Ciò significa che, purché gli item del test siano collocati sulla stessa metrica, le stime dei punteggi del tratto in IRT sono direttamente confrontabili indipendentemente da quale sottoinsieme sia stato effettivamente somministrato a un candidato. Come discusso nel capitolo due, l'AdaptGRT ha utilizzato l'EAP come metodo di stima del tratto.
Le risposte agli item sono state raccolte e fuse per creare un singolo dataset per ciascun test. Le risposte sono state trasformate in una variabile dicotomica, con 0 che indica una risposta errata e 1 una risposta corretta. Il 9 è stato utilizzato per rappresentare gli item non somministrati. Ciascun candidato aveva tra 20 e 35 risposte, sufficienti per un punteggio accurato. Successivamente, queste risposte, insieme alle corrispondenti stime parametriche IRT degli item, sono state inserite nel programma per computer 3PL_EAP di Stark, punteggiate e salvate in un foglio di calcolo Excel per ulteriori analisi.
È stato quindi deciso di normalizzare le stime EAP. Ciò non è necessario all'interno del paradigma IRT, ma diventa utile quando si riportano i risultati in pratica, poiché le scale standardizzate sono più facilmente comprese e interpretate in un contesto aziendale. La normalizzazione consente inoltre il calcolo di un punteggio composito che fornisce un'indicazione della performance complessiva del test.
Per creare le norme per ciascun test AdaptGRT, sono state calcolate statistiche di distribuzione e grafici basati sui punteggi EAP. È stata quindi creata una tabella di conversione per determinare i ranghi percentile, gli stanine e i punteggi Z. Le distribuzioni di frequenza dei punteggi EAP per i tre test sono mostrate nella Figura 10.
La tabella di conversione consente di "normalizzare" i punteggi EAP consultando la stima dell'abilità, individuando il punteggio percentile e utilizzando una trasformazione p-to-z che fornisce il punteggio z normale standard del corrispondente valore percentile. Successivamente il punteggio z può essere trasformato in qualsiasi scala di punteggio desiderata. Ad esempio, se si desiderano punteggi T con media 50 e deviazione standard 10, può essere utilizzata la semplice trasformazione T = 10z + 50. Il punteggio complessivo di Ragionamento Generale è un composito ponderato unitariamente dei punteggi z o T dei tre test AdaptGRT.
Affidabilità test-retest
È stata condotta anche un'analisi CTT dell'affidabilità dell'AdaptGRT per determinare se le stime dell'abilità rimanevano confrontabili nel tempo. Uno studio condotto all'interno di un'agenzia governativa neozelandese ha trovato evidenze di un'affidabilità test-retest da buona a eccellente (Brown & McInnes, 2001). Per ciascuno dei tre test AdaptGRT, i punteggi tra le sessioni di test si sono rivelati molto simili tra loro. La corrispondenza tra i punteggi di test e retest sul composito complessivo dell'AdaptGRT è stata eccellente.
- Dimensione iniziale: 85 partecipanti adulti
- Completamento retest: 47 (periodo 5-9 settimane)
- Casi validi post-pulizia: 38 (Astratto e Numerico), 45 (Verbale)
Sono state effettuate analisi fattoriali sui dati per valutare se il punteggio composito complessivo del test potesse essere utilizzato accuratamente al posto dei punteggi dei singoli test. La conclusione è stata che un unico fattore poteva spiegare la maggior parte della varianza nei punteggi dei test, e che questo fattore consisteva in saturazioni approssimativamente uguali dei punteggi Astratto, Numerico e Verbale. Di conseguenza, è giustificabile utilizzare un singolo punteggio composito che è una semplice somma dei punteggi di Ragionamento Astratto, Numerico e Verbale.
L'analisi test-retest è stata condotta su punteggi z basati sul gruppo normativo neozelandese con media 0 e deviazione standard (DS) pari a 1. Il coefficiente di correlazione di Pearson è stato utilizzato per valutare la corrispondenza tra i due set di punteggi, a livello di singolo test così come a livello di punteggio composito. La correlazione minima accettabile tra i punteggi di test e retest è 0,7 (vedi Kline, 2000). Un coefficiente di correlazione di 0,8 è considerato buono.
| Test | Test-Retest r | Interpretazione |
|---|---|---|
| Astratto | 0,76 | Discreta |
| Numerico | 0,85 | Molto buona |
| Verbale | 0,84 | Molto buona |
| Composito | 0,93 | Eccellente |
I ricercatori hanno inoltre riscontrato che i punteggi della seconda sessione di test non erano soggetti ai tipici effetti di memoria osservati nei test non adattivi. Ciò è stato considerato un vantaggio dell'AdaptGRT, in quanto il contenuto del test cambia a ogni sessione.
Fase Due: Revisioni minori e modifiche al motore CAT
Una volta completato il processo di ricerca intrapreso durante la fase uno, le stime parametriche finali sono state aggiunte al motore CAT e l'AdaptGRT è stato messo in pratica. Nel tempo, sono emerse alcune questioni che hanno reso necessaria una seconda fase di sviluppo. Queste questioni includevano:
- Copertura della gamma di abilità: la maggior parte degli item nei tre test AdaptGRT era concentrata nella gamma da bassa a media abilità. Era necessario ampliare la banca di item per includere item più difficili, al fine di valutare chi si trova all'estremo superiore del continuum del tratto.
- Sovraesposizione degli item: determinati item con IIF ripide erano sovraesposti durante la sessione di test, specialmente quelli nella gamma media del tratto. Questi venivano continuamente selezionati dall'algoritmo di selezione degli item poiché, statisticamente, fornivano la maggiore quantità di informazione sul livello di abilità di un candidato.
- Limite di tempo: durante la fase di pre-test della fase uno, i candidati completavano un sottoinsieme statico di item all'interno di un ambiente di test di pratica. I limiti di tempo di queste sessioni sono stati applicati ai test AdaptGRT e hanno comportato che diversi candidati non riuscissero a completare il test nel periodo assegnato.
- Basso impatto vs. alto impatto: il pre-test degli item è avvenuto in un ambiente a basso impatto, mentre l'AdaptGRT era tipicamente utilizzato in test ad alto impatto. Questo cambiamento fondamentale nella natura dell'ambiente di test ha portato i candidati a ottenere punteggi tipicamente più bassi sull'AdaptGRT, rispetto ai punteggi ottenuti nei test di pratica. Ciò ha inoltre comportato che i parametri di determinati item cambiassero tra lo studio pilota e l'applicazione pratica del test.
Ampliamento della banca di item e norme aggiornate
A causa di queste questioni emerse, è stato deciso di calibrare nuovamente gli item utilizzando il programma BILOG-MG per Windows. Gli item che erano stati evidenziati come problematici sono stati modificati per affrontare questioni di multidimensionalità, stimoli degli item confusi o mancanza di chiarezza sulla risposta corretta.
Il team di ricerca ha inoltre trasformato i punteggi EAP in una distribuzione normale standard. Ciò ha spostato l'asse dei punteggi al fine di migliorare la performance dei candidati e affrontare il problema dei punteggi dei partecipanti più bassi del previsto. Il punteggio EAP di un candidato è quindi divenuto un riflesso della sua abilità rispetto alla scala della distribuzione normale. Le tabelle di conversione delle norme sono state inoltre aggiornate per riflettere i punteggi EAP degli item revisionati e facilitarne la conversione in varie scale standardizzate.
Modifiche al motore CAT
Per affrontare il problema della sovraesposizione degli item, è stato aggiunto un parametro di randomizzazione al motore CAT. In precedenza, l'algoritmo di selezione sovraespondeva gli item che discriminavano molto precisamente tra diversi livelli di abilità. L'algoritmo modificato garantiva che ciascun item presentato fosse selezionato casualmente da un intervallo di item possibili, pur mantenendo elevati gradi di informazione. Il motore CAT è stato inoltre aggiornato per includere le stime parametriche revisionate ottenute durante la seconda tornata di calibrazione degli item.
Fase Tre: Ricalibrazione e revisione degli item
Le modifiche apportate durante la fase due hanno fornito una soluzione a breve termine per le problematiche identificate con l'AdaptGRT. La trasformazione dei punteggi EAP ha permesso ai partecipanti di ottenere punteggi più alti, ma non ha modificato la questione iniziale dei risultati dei candidati inferiori al previsto. Inoltre, permaneva ancora una scarsità di item in determinate aree della gamma di abilità. Pertanto, è stata intrapresa un'ulteriore tornata completa di validazione del test, attualmente in corso.
L'obiettivo della fase tre era ottimizzare il funzionamento dell'AdaptGRT identificando gli item che risultavano ancora problematici dopo le prime due fasi di sviluppo, in termini di parametri, adattamento del modello, valori di informazione, ES e multicollinearità.
Ricalibrazione degli item
Tutti i dati relativi alle validazioni precedenti sono stati fusi in un singolo dataset. Le risposte dei candidati agli item sono state ricodificate dal formato di risposta scala Likert a variabili dicotomiche, dove 0 rappresentava una risposta errata e 1 una risposta corretta. Gli item sono stati ricalibrati utilizzando il pacchetto software IRTPRO (Cai, Thissen e Du Toit, 2011). Ancora una volta, tutti gli item sono stati analizzati secondo il 3PLM.
Per ricalibrare gli item, l'analisi è stata condotta per test (Verbale, Numerico o Astratto). All'interno di ciascun test, il numero totale di item validati è stato suddiviso in sottoinsiemi, ciascuno dei quali è stato analizzato separatamente. Questi sottoinsiemi erano identici a quelli forniti nella Tabella 1 e derivavano dalle forme di test di validazione originali. Il test di Abilità Verbale, con un totale di 200 item validati, è stato suddiviso in 11 sottoinsiemi. I 155 item del test di Abilità Numerica sono stati suddivisi in 8 sottoinsiemi, mentre i 110 item Astratti sono stati divisi in 5 sottoinsiemi. Ciascun sottoinsieme consisteva in un numero di item compreso tra 9 e 28.
I risultati hanno mostrato stime parametriche e indici di adattamento significativamente diversi da quelli registrati nel processo di validazione originale. Nello specifico, i ricercatori hanno riscontrato differenze nei parametri a, b e c all'interno dei test Verbale, Numerico e Astratto, con cambiamenti nei valori a e c notevolmente più sostanziali rispetto ai cambiamenti nei valori b. Gli item sono risultati problematici anche per le seguenti ragioni:
- Scarso adattamento del modello: gli item sono stati valutati in termini del loro grado di adattamento al 3PLM. Ciò è stato determinato utilizzando una statistica chi-quadro, con significatività (p > 0,05) o valori superiori a 20 che indicavano uno scarso adattamento del modello. Il 67% degli item precedentemente validati è risultato avere un indice chi-quadro superiore a 20. Determinati item all'interno del test di Ragionamento Astratto sono risultati notevolmente problematici, con valori chi-quadro superiori a 100.
- Bassi valori di informazione: diversi item sono risultati avere bassi valori di informazione con IIF relativamente piatte. Tali risultati implicano che gli item non contribuiscono con una quantità significativa di informazione nella stima dell'abilità del candidato e non hanno un grande valore all'interno di una valutazione CAT.
- Elevato ES: insieme a curve di informazione piatte, determinati item hanno riportato elevati valori di ES su un parametro.
- Multicollinearità: gli item che dimostravano multicollinearità sono risultati altamente correlati e, come tali, contribuivano con una varianza unica relativamente scarsa alla stima del tratto.
Abilità verbale
La Tabella 5 fornisce un riepilogo delle variazioni medie dei parametri per ciascun sottoinsieme di Abilità Verbale.
Il parametro di adattamento medio complessivo per gli item di Abilità Verbale era 58,50, un valore leggermente superiore al punto di cut-off di 20. Due sottoinsiemi contenevano item considerevolmente problematici in termini di adattamento, in particolare GRT3VR (111,28) e IRTV4 (179,85). Nel tentativo di migliorare la qualità della sottoscala di Abilità Verbale, 104 su un totale di 199 item sono stati revisionati o proposti per la revisione.
Il parametro a è aumentato in media di 0,63, il che implica che gli item avevano curve di discriminazione più ripide rispetto a quanto originariamente previsto. I cambiamenti nel parametro b sono stati minimi, con un aumento di 0,18. Nel complesso, gli item di Abilità Verbale sono risultati relativamente facili da rispondere, con un valore medio complessivo del parametro di difficoltà di −0,15. Il parametro b del sottoinsieme IRTV1 è cambiato drasticamente da −0,10 a 1,09; questo insieme di item è risultato più difficile di quanto indicato in precedenza. Anche il sottoinsieme GRT3VR ha mostrato un aumento della difficoltà degli item.
La ricalibrazione degli item per il parametro c ha portato a cambiamenti minimi, con un aumento complessivo di 0,31. I parametri c erano motivo di preoccupazione, con molti item suscettibili di guessing o manipolazione. I parametri c medi erano particolarmente elevati nei seguenti sottoinsiemi: IRTV33 (1,36), IRTV3 (1,60) e GRT3VR (1,09). Sulla base dei risultati per il test Verbale, una larga proporzione di item ha richiesto revisione con l'obiettivo di ampliare l'intervallo della banca di item per fornire una maggiore copertura all'estremo superiore del tratto.
Abilità numerica
La Tabella 6 fornisce un riepilogo medio delle variazioni delle stime parametriche nei sottoinsiemi di item di Abilità Numerica.
Le variazioni parametriche complessive per gli item di Abilità Numerica sono state minime. L'adattamento complessivo è risultato anche più ottimale rispetto a quello osservato nel test di Abilità Verbale, con un valore chi-quadro complessivo di 36,30. Su un totale di 143 item, 68 sono stati contrassegnati per la revisione.
In media, il parametro a è aumentato di 0,75, il che implica che gli item dimostravano un maggiore potere di discriminazione tra individui con diversi livelli di abilità. Ciò suggerisce che le pendenze delle curve sinusoidali sono molto più ripide di quanto originariamente previsto, con determinati item che discriminano più precisamente lungo un tratto più ristretto. Vi sono stati cambiamenti minimi nel parametro b tra la calibrazione degli item effettuata durante la fase uno e la fase tre. Con un parametro b medio di −1,11, gli item di Abilità Numerica erano situati all'estremo più facile del continuum del tratto. In media i valori b erano negativi nella maggior parte dei sottoinsiemi, con l'eccezione del sottoinsieme GRT2NR. Ciò può suggerire vuoti nella banca di item all'estremo superiore del tratto.
Analogamente agli item di Abilità Verbale, i parametri c per la seconda fase di calibrazione sono cambiati di 1,52 unità. Con un valore medio complessivo c di 1,68, gli item hanno dimostrato vulnerabilità al guessing o alla manipolazione da parte dei candidati a tutti i livelli di abilità.
Abilità astratta
I valori medi dei parametri per l'Abilità Astratta, confrontati tra la prima e la terza fase di calibrazione degli item, sono forniti nella Tabella 7.
Nel complesso, gli item di Abilità Astratta sono risultati significativamente più problematici rispetto a quanto dimostrato in precedenza. La statistica di adattamento del modello, in particolare, è risultata molto più alta del previsto, con un valore medio complessivo di 105,04. Il sottoinsieme IRTA3, con un valore chi-quadro di 29,68, è risultato il migliore nel complesso. Il valore medio a riscontrato in questa analisi (6,10) era problematico e potrebbe essere stato influenzato dal disproporzionato adattamento del modello.
I parametri b sono passati da negativi durante la prima tornata di calibrazione (−0,77) a positivi (0,70). Questi cambiamenti non sono stati così sostanziali come quelli osservati nei parametri a e c. Anche il valore c è cambiato in modo considerevole, con un valore medio revisionato del parametro di −5,07. I valori c negativi sono problematici in natura, suggerendo item soggetti a manipolazione e guessing.
Cancellazione e revisione degli item
A questo punto, gli item risultati problematici sono stati eliminati o revisionati. In certi casi, i problemi sono stati ricondotti a stimoli degli item vaghi o a opzioni di risposta prive di una risposta chiara o con più di una risposta corretta. In altri casi, gli item contenevano termini non culturalmente neutri e potenzialmente poco familiari a determinati individui. Questi termini sono stati sostituiti con parole più universalmente comprese.
Filosofia di progettazione e analisi in corso
La fase tre è concepita come un approccio completo e in continua evoluzione che incorpora calibrazione degli item, cancellazione o revisione, inserimento (seeding), sperimentazione e ricalibrazione. L'obiettivo è rimuovere gli item problematici, revisionare quelli potenzialmente confusi e ampliare la banca di item per colmare i vuoti nel tratto.
Gli item nuovi o revisionati sono sottoposti a pre-test inserendoli nell'AdaptGRT. Il test è sostenuto in condizioni ad alto impatto, ma gli item sperimentati non contribuiscono al punteggio del candidato o alla stima del tratto. Una volta raccolto un numero sufficiente di risposte, ciascun sottoinsieme di item viene calibrato utilizzando il programma IRTPRO. Se risultano avere stime parametriche e adattamento del modello accettabili, questi item vengono formalmente incorporati nella valutazione. In caso contrario, gli item vengono esaminati per la cancellazione o la revisione. La sensibilità culturale degli item viene valutata per garantire che discriminino in modo uguale tra individui di culture diverse. Questo processo continuerà in modo ciclico finché l'analisi non mostrerà statistiche soddisfacenti con basso errore standard, IIF da medie a alte e nessuna evidenza di multicollinearità.
La filosofia di progettazione della fase tre è rappresentata nella Figura 11.
Riferimenti
- Baker, F. B. (2008). The basics of item response theory. ERIC Clearinghouse on Assessment and Evaluation.
- Birnbaum, A. (1968). Some latent trait models and their use in inferring an examinee's ability. In F. M. Lord and M. R. Novick (Eds.), Statistical theories of mental test scores (pp. 397–472). Reading, MA: Addison-Wesley.
- Bock, R. D., & Mislevy, R. J. (1982). Adaptive EAP estimation of ability in a microcomputer environment. Applied Psychological Measurement, 6(4), 431–444.
- Brown, G. S., & McInnes, A. (2011). AdaptGRT: Test-Retest Reliability. Unpublished research report.
- Cai, L., Du Toit, S. H. C., & Thissen, D. (2011). IRTPRO: Flexible, multidimensional, multiple categorical IRT modeling [Computer software]. Chicago, IL: Scientific Software International.
- Carroll, J. B. (1993). Human cognitive abilities: A survey of factor-analytic studies. New York, NY: Cambridge University Press.
- Cattell, R. B. (1971). Abilities: Their structure, growth, and action. Boston, MA: Houghton Mifflin.
- Du Toit, M. (Ed.). (2003). IRT from SSI: Bilog-MG, multilog, parscale, testfact. Scientific Software International.
- Drasgow, F., Levine, M. V., Tsien, S., Williams, B., & Mead, A. D. (1995). Fitting polytomous item response theory models to multiple-choice tests. Applied Psychological Measurement, 19(2), 143–165.
- Hunter, J. E. (1980). Validity generalization for 12,000 jobs: An application of synthetic validity and validity generalization to the General Aptitude Test Battery (GATB). Washington, DC: U.S. Department of Labor, Employment Service.
- Kline, P. (2000). A psychometrics primer. Free Association Books.
- Kolen, M. J., & Brennan, R. L. (2014). Test Equating, Scaling, and Linking. Springer New York.
- Kuncel, N. R., Hezlett, S. A., & Ones, D. S. (2001). A comprehensive meta-analysis of the predictive validity of the Graduate Record Examination: Implications for graduate student selection and performance. Psychological Bulletin, 127, 162–181.
- Kuncel, N. R., Hezlett, S. A., & Ones, D. S. (2004). Academic performance, career potential, creativity, and job performance: Can one construct predict them all? Journal of Personality and Social Psychology, 86, 148–161.
- Meijer, R. R., & Nering, M. L. (1999). Computerized adaptive testing: Overview and introduction. Applied Psychological Measurement, 23(3), 187–194.
- Psytech International (2010). General and graduate reasoning tests. Unpublished technical manual.
- Rasch, G. (1960). Probabilistic models for some intelligence and attainment tests. Chicago: University of Chicago Press.
- Spearman, C. (1904). "General intelligence," objectively determined and measured. American Journal of Psychology, 15, 201–293.
- Thissen, D., & Mislevy, R. J. (2000). Testing Algorithms. In H. Wainer (Ed.) Computerized Adaptive Testing: A Primer. Mahwah, NJ: Lawrence Erlbaum.
- Unick, G. J., Shumway, M., & Hargreaves, W. (2008). Are we ready for computerized adaptive testing? Psychiatric services (Washington, DC), 59(4), 369–371.
- Van Der Linden, W., & Hambleton, R. (1997). Handbook for Modern Item Response Theory. New York: Springer.
- Van der Linden, W. J., & Glas, C. A. (2000). Capitalization on item calibration error in adaptive testing. Applied Measurement in Education, 13(1), 35–53.
- Weiss, D. J., & Kingsbury, G. G. (1984). Application of computerized adaptive testing to educational problems. Journal of Educational Measurement, 21, 361–375.
