$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
L'intensa globalizzazione dell'istruzione e delle tecnologie digitali ha aumentato la necessità di valutare scientificamente e credibilmente il livello di scrittura in inglese per l'insegnamento delle lingue, lo sviluppo accademico e l'avanzamentoprofessionale 1. Le valutazioni convenzionali della scrittura, come praticate dalla valutazione umana, possono misurare aspetti soggettivi della scrittura come la completezza dell'argomentazione e l'adeguatezzaculturale 2, ma sono soggette a lunghi tempi di consegna, elevati costi di manodopera e pregiudizi dovuti all'esperienza e alle inclinazioni delvalutatore 3,4. Questi vincoli sono particolarmente severi nelle pratiche su larga scala, come i test di lingua internazionale (IELTS, TOEFL) o altri corsi di inglese tenuti nelle università dove il punteggio manuale non può essere tutto ciò che è richiesto in termini di feedback immediato ecopertura 5.
I sistemi AWE sono diventati ampiamente utilizzati in questo contesto grazie alla loro elaborazione in tempo reale, standardizzazione e scalabilità6. Strumenti popolari come Grammarly (che si concentra sugli errori grammaticali e sul perfezionamento dello stile) ed ETS Criterion (che aderisce alle norme formali di scrittura) sono attualmente utilizzati da milioni di studenti nell'istruzione K-12, nelle scuole di lingue, nell'istruzione superiore e nella formazioneindividuale 7. Sebbene questi siano i vantaggi, l'efficienza tecnologica e l'applicabilità educativa dei sistemi AWE sono ancora oggetto didiscussione. Tecnicamente parlando, i sistemi esistenti sono altamente accurati nelle dimensioni oggettive, inclusa la rilevazione degli errori e la diversità lessicale, dove la correlazione con la valutazione umana può essere superiore a 0,859. Tuttavia, in aree più soggettive, come la rilevanza del contenuto, l'argomentazione logica e l'organizzazione di un testo, le correlazioni spesso diventano inferiori a 0,70-10. Tale sproporzione rischia di promuovere un'accuratezza superficiale tra gli studenti a scapito della competenza complessiva nellascrittura 11.
La questione dell'equità limita anche l'utilità educativa dell'AWE. Gli studi attuali tendono anche a concentrarsi sugli indicatori aggregati di accuratezza, trascurando la possibilità di deviazioni che svantaggiano sistematicamente alcuni gruppi12. In modo indicativo, le caratteristiche dell'interlingua condivise da studenti di cinese o spagnolo verrebbero scambiate per errori, e ciò porterebbe a una sottostimasistematica 13,14. Inoltre, l'accettazione soggettiva del feedback dell'IA da parte degli studenti è generalmente poco nota15. I sondaggi indicano che quasi un terzo degli studenti non nativi riporta un'inadeguatezza tra i punteggi dell'IA e le prestazioni effettive, con i processi di accuratezza tecnica, equità di gruppo e soddisfazione degli studenti ancora pococompresi 16.
Queste debolezze riflettono le carenze del paradigma classicodell'accuratezza 17. Un quadro che considera solo l'allineamento tra IA e punteggio umano non può catturare questioni di equità o della fiducia dello studente nel sistema. In pratica, il valore educativo dell'AWE deve soddisfare tre condizioni contemporaneamente: precisione tecnica, equità tra i gruppi e accettazione da parte degli studenti18. L'assenza di un approccio di validazione così completo aiuta a spiegare perché i sistemi AWE godono di un'ampia adozione ma di una fiducia limitata nella pratica educativa19,20.
Per affrontare questa sfida, il presente studio introduce un quadro di validazione multilivello che integra accuratezza tecnica, equità di gruppo e individuale, e percezione dello studente in una struttura coerente. Il framework XAI proposto è progettato per essere implementato in modo pratico all'interno delle piattaforme AWE esistenti, fornendo a insegnanti e studenti diagnostiche di equità e spiegazioni trasparenti dei punteggi, e può essere applicato in corsi di scrittura o corsi di preparazione ai test per valutarne la capacità di migliorare equità, interpretabilità e utilità didattica in contesti reali di valutazione.
In questo contesto, l'ipotesi è un AFMM per indagare il ruolo mediatore della percepita equità nel determinare la relazione tra accuratezza e soddisfazione, così come il ruolo moderatore della competenza linguistica sulla sensibilità all'equità. Pertanto, contribuisce in due modi: sia teoricamente arricchendo i modelli di valutazione dell'AWE descrivendo l'equità come una delle principali dimensioni di validazione insieme all'accuratezza e alla percezione, sia praticamente, fornendo agli sviluppatori strategie per massimizzare l'equità, educatori con criteri di selezione del sistema sensibili al gruppo, e il valore educativo dell'AWE spiegando il modo in cui si formano le percezioni degli studenti. Oltre all'educazione, il quadro è anche allineato al concetto più ampio di XAI, dimostrando come equità e percezione degli utenti possano migliorare trasparenza, fiducia e accettazione in altri ambiti, come la sanità, i sistemi autonomi e la cybersecurity.
Domande di ricerca:
1.To che misura il sistema AWE dimostra accuratezza tecnica ed equità tra i diversi gruppi di lingua madre e di competenza?
2. In che modo un framework di valutazione multilivello basato su XAI può migliorare la trasparenza e l'equità nella valutazione automatica della scrittura in inglese?
REVISIONE DELLA LETTERATURA:
I fattori che influenzano l'accettazione del feedback AWE da parte degli studenti sono stati esaminati utilizzando un Technology Acceptance Model (TAM)21 esteso. Sulla base dei dati di un sondaggio condotto da 448 studenti cinesi che utilizzavano SEM, è stato determinato che utilità, facilità d'uso e intenzione avevano un'influenza significativa sulle norme soggettive, sulla fiducia, sull'autoefficacia, sul feedback cognitivo e sulle caratteristiche del sistema. Tuttavia, lo studio è stato limitato a una singola nazione e a un singolo gruppo di studenti, il che limita l'applicabilità della generalizzazione. Per esplorare come gli studenti cinesi di inglese inglese rispondano ai feedback del PigaiAWE 22, uno studio ha analizzato le ripetute presentazioni (n = 5) da parte di studenti universitari. Ha evidenziato un'enfasi precoce sulla correzione degli errori, una bassa assimilazione di feedback linguistico e un graduale approfondimento della risposta. Tuttavia, la dimensione del campione era molto limitata, così come il sistema AWE, che limita l'applicabilità e la generalizzabilità. Le convinzioni degli insegnanti di inglese inglese riguardo all'applicazione dello strumento di valutazione AI (CoGrader) sono state esaminate per identificare i fattori che influenzano le loroopinioni 23. Attraverso uno studio a metodi misti su 10 insegnanti universitari sauditi, un sondaggio e un'intervista hanno rivelato che c'era un'opinione positiva mista, ma una riluttanza a essere completamente certi dell'affidabilità e della sostituzione completa degli insegnanti. Ciò ostacola la generalizzazione a causa del campione limitato e dell'impostazione di un solo paese.
Considerando gli sviluppi nella linguistica dei corpus e nella tecnologia dell'IA, uno studio ha indagato i frameworkAES 24. Ha impiegato PCA per migliorare gli indicatori linguistici nella valutazione della qualità della scrittura e ha scoperto che combinare micro-caratteristiche con caratteristiche aggregate definiva la qualità della scrittura in modo più efficace rispetto alle caratteristiche aggregate da sole. L'approccio AES non lineare basato sulla Regressione della Foresta Casuale ha superato gli altri approcci. Inoltre, SHAP ha identificato elementi essenziali del linguaggio per ogni attributo valutato, aumentando la trasparenza del sistema tramite un'IA spiegabile. I risultati potrebbero contribuire a migliorare i metodi multidimensionali nella scrittura, nella valutazione e nell'educazione. Il sistema di collaborazione uomo-macchina è stato introdotto per affrontare le sfide dell'annotazione degli scritti arabi, spesso costose e dispendiose in termini di tempo. Il metodo considera saggi basati su sette aspetti della letteratura con l'aiuto di un LLM. I processi di validazione e le tattiche di prompting sono stati personalizzati per garantire coerenza e accuratezza. La cooperazione comporta un aumento dell'offerta di risorse etichettate e non influisce sulla qualità della valutazione, dimostrando che è un metodo scalabile di annotazione dati adatto a linguaggi con risorse più basse.
L'uso dell'IA nell'ambito educativo offre l'opportunità di ridurre significativamente i requisiti di valutazione e migliorare l'educazione allascrittura 25,26. Allo stesso tempo, i ricercatori hanno sottolineato che l'accuratezza dell'IA non è l'unico aspetto rilevante per il suo uso responsabile. Esistono principi di equità e riduzione dei pregiudizi, sicurezza e privacy, responsabilità, spiegabilità, trasparenza, effetto educativo, integrità e sviluppo continuo. Ricerche recenti hanno valutato empiricamente la punteggio zero-shot basata su GPT-4o, concentrandosi su questi requisiti. La ricerca si è concentrata sulle percezioni che gli educatori avevano nei confronti degli ADWT riguardo all'aspetto dell'integrità educativa27. Lo studio trasversale che coinvolge 100 studenti e professori di dottorato in 10 materie suggerisce che, nonostante gli insegnanti attribuiscano i benefici degli ADWT nel raggiungere l'obiettivo educativo, essi presentano alcune limitazioni, come accessibilità limitata, mancanza di conoscenza e preoccupazione per il loro impatto su integrità e creatività. La ricerca ha suggerito che, man mano che le tecnologie di IA si integrano maggiormente nell'istruzione, sono necessarie preoccupazioni etiche e la partecipazione degli stakeholder per il loro uso di successo e responsabilità. La ricerca ha indagato l'efficacia delle tecnologie di IA rispetto a quelle dei valutatori umani nella valutazione dei saggi presentati da studentiEFL 28. La valutazione di 30 saggi ha rivelato che, sebbene l'IA offrisse commenti di alta qualità in termini di contenuto, linguaggio, organizzazione e correttezza, forniva costantemente valutazioni più basse rispetto ai valutatori umani. Inoltre, l'IA forniva un feedback più approfondito, ma i punteggi dei vari strumenti di IA non erano sostanzialmente diversi.
Lacuna nella ricerca:
Attualmente, la maggior parte delle ricerche sulla borsa di studio AWE esamina sia l'accuratezza sia l'accettazione da parte degli utenti. Pochissimi esaminano se le differenze di punteggio svantaggiano sistematicamente la lingua madre o i gruppi di competenza. Sebbene studi precedenti abbiano esaminato l'accettazione da parte degli utenti o siano limitati a uno specifico sistema AWE di un determinato paese e dimensione del campione, sorgono dubbi sulla generalizzabilità. Sebbene sia SHAP che PCA siano strategie XAI e siano state sviluppate per aumentare la trasparenza, nessuno studio ha esaminato i meccanismi di equità o come gli studenti utilizzano il feedback dell'IA dall'AWE. Non esistono quadri estesi nella letteratura che contemplino dimensioni definite di accuratezza, analisi dell'equità e percezioni degli apprendenti. Non esiste un esempio di modello spiegabile di valutazione che consideri l'accuratezza intra- e inter-valutatore, l'equità e la percezione degli apprendenti. In questa ricerca vengono proposti e validati un quadro spiegabile, TLEF, e un modello combinato, AFMM, per valutare accuratezza, equità e percezione degli studenti contemporaneamente tra studenti multilingue e con competenze diverse.