Articolo metodologico

Indagine sull'effetto della valutazione automatica della scrittura attraverso una profonda reti neurale e la valutazione scritta degli insegnanti sulle prestazioni nella scrittura in inglese

DOI:

10.3791/69995

8 maggio 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La fornitura di feedback sotto forma di due funzionalità semantiche di NLP tramite il sistema informatico e il feedback scritto dell'insegnante è stata impiegata per migliorare la fluidità e la correttezza della scrittura inglese degli studenti. I risultati hanno mostrato risultati positivi riguardo al primo.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le tecnologie di apprendimento delle lingue assistite da computer hanno ottenuto i maggiori progressi nell'apprendimento delle lingue, soprattutto nel contesto dell'intelligenza artificiale (IA), negli ultimi anni. Esistono varie tecnologie, come la valutazione automatizzata della scrittura (AWE d'ora in avanti) e la valutazione automatica dei saggi (AES), considerate pilastri dell'apprendimento delle lingue, non solo nelle discipline informatiche ma anche nell'istruzione. La valutazione può essere effettuata solo sotto forma di punteggi olistici utilizzando la tecnologia AWE, che si è dimostrata piuttosto efficace nel migliorare l'apprendimento linguistico e, pertanto, non può fornire feedback dettagliati o approfonditi. Per fornire feedback dettagliati sulla scrittura su due elementi principali di una lingua (cioè, grammatica e fluidità), sono stati presi in considerazione un sistema di implementazione assistita dal computer che coinvolge modelli di reti neurali e due metodi di elaborazione del linguaggio naturale basata sulla semantica (NLP di qui in avanti). A tal fine, 90 studenti universitari pakistani che imparavano l'inglese seconda lingua (ESL) sono stati assegnati casualmente ai gruppi controllo, feedback degli insegnanti e esperimentali. La valutazione assistita da computer comprendeva una rete neurale. I risultati del test di confronto tra il modello di base AWE e gli insegnanti che hanno valutato hanno mostrato una correlazione tra il feedback assistito da computer che utilizzava queste reti neurali. Le implicazioni di tali risultati risiedono nella pedagogia della scrittura ESL, specialmente in situazioni in cui l'accuratezza linguistica e la fluidità rappresentano una sfida.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il feedback nella scrittura affronta vari attributi del linguaggio, come organizzazione, grammatica, fluidità, contenuto e meccanica, permettendo agli studenti di riscrivere o creare un nuovo testo scritto 1,2,3. Attualmente, gli insegnanti di scrittura inglese sono stati un grande beneficiario grazie ai rapidi cambiamenti e ai progressi dell'apprendimento delle lingue assistito da computer (CALL d'ora in avanti) e della valutazione della scrittura assistita da computer sotto forma di AWE o AES, oltre alla valutazione dei saggiscritti 4. Inoltre, la valutazione assistita da computer della scrittura inglese fornisce feedback diagnostici su elementi linguistici come contenuto, grammatica, vocabolario, ecc., fornendo risposte tempestive, individuali e oggettive al testo scritto degli studenti. Il sistema AWE è anche in grado di fornire risposte scritte chiare agli studenti, affinché interiorizzino le conoscenze acquisite attraverso queste risposte scritte e aumentino la capacità cognitiva6degli studenti.

Il presente studio si è basato su una ricerca4, che ha proposto il concetto di un apprendimento della scrittura inglese multi-strategia, basato su computer, con la teoria del feedback della scrittura inglese in prospettiva e il processo di valutazione analitica in mente. Questo includeva altri modelli semantici di NLP che incorporavano deep learning nel feedback scritto per offrire una valutazione dettagliata del feedback scritto. Affronta le limitazioni della precedente tecnologia AWE, che enfatizza solo l'olistico ma non il punteggio specifico e analitico. Di conseguenza, ciò riguarda più la valutazione accurata e immediata con voti di sottovalutazione e totale riguardo a una serie di elementi di indicatori linguistici per migliorare l'apprendimento della scrittura inglese tra gli studenti. Tra le varie caratteristiche della linguistica (cioè contenuti, complessità, correttezza, fluidità), il presente studio esaminerà solo la fluidità e l'aspetto grammaticale degli studenti di ESL in Pakistan. A tal fine, lo studio attuale suggerisce una strategia della tecnologia NLP che prevede l'uso di reti neurali accompagnate dalla valutazione degli insegnanti.

Nel contesto dell'apprendimento della lingua pakistana, gli studenti pakistani incontrano difficoltà nell'apprendimento della scrittura in inglese, anche se considerano lo studio dell'inglese come materia obbligatoria a partire dalla prima elementare e fino alla quattordicesima classe. Ed è qui che entrano in gioco numerosi fattori, come corsi sbagliati e l'uso dei vecchi metodi per spiegare lagrammatica. A livello universitario, il numero di studenti che gli insegnanti devono insegnare è piuttosto notevole, poiché gli studenti provengono da una varietà di background che includono vari college e scuole. Questo costringe gli insegnanti a dedicare molto tempo a correggere gli errori di scrittura degli studenti, e questo rende il carico di lavoro troppo elevato. D'altra parte, gli studenti davano per scontati i feedback scritti degli insegnanti e non facevano alcuno sforzo per riconoscere gli errori ecorreggerli 8.

Uno studio ha affermato che la fluidità è influenzata principalmente dal fatto che, poiché gli studenti hanno paura di commettere errori, essa diventa un ostacolo per scrivere fluentemente, e quindi preferiscono evitare errori più frequentemente piuttosto che impegnarsi nei pensieri. Vi è occasionale interferenza della lingua urdu con la scrittura inglese, oltre ad altri fattori contestuali. Inoltre, la lingua urdu è la lingua nazionale. A causa di questi fattori contestuali, gli insegnanti trovano difficile fornire feedback precisi, tempestivi e coerenti a ogni studente ogni volta che questi generano output scritto o modificano i manoscritti. Considerando la teoria della valutazione della scrittura, questo studio sarà in grado di seguire quello che impiega una strategia automatica di feedback di scrittura automatica durante il confronto con la valutazione tradizionale dell'insegnante e prende la valutazione analitica invece che olistica, per garantire che gli studenti ricevano un feedback immediato sulle due dimensioni linguistiche significative (cioè grammatica e fluidità)4.

Sono emersi diversi prodotti industriali AWE e AES, tra cui Pigai.org, Bingo English, My Access, E-rater, I-write, Criterion, ecc. AES/AWE nella sua fase iniziale di sviluppo è caratterizzato principalmente dal tradizionale sistema di apprendimento automatico basato sul teoremadi Bayes 10, regressionelineare 11 , ecc. Attualmente, lo sviluppo esteso del deep learning, in particolare la tecnologia delle reti neurali, ha anche notevolmente portato benefici al campo del feedback di scrittura, come le reti neurali ricorrenti oRNN 12, la memoria a breve terminelungo 13, le Reti Neurali Convoluzionali (CNN)14, l'approccioBERT 15. AWE ha inoltre tratto benefici dalle strategie di pre-formazione adottate all'inizio dellaNLP 16. Molti studi hanno preso in considerazione varie soluzioni focalizzate sulle reti neurali, come la generazione di campioni adversariali per scopi di apprendimento, l'apprendimento tramite Multitasking17, l'apprendimento tramiteAuto-Supervisione 18 e gli Algoritmi diGrafo 19. Alcuni hanno suggerito tecniche diverse per affrontare il problema della mancanza di dati di addestramento per la scrittura di feedback20. Esistono anche modelli di punteggio che contribuiscono a molti modelli di retineurali 21.

La correzione degli errori grammaticali (GEC d'ora in poi) è un metodo indipendente per le missioni NLP, che ha la capacità di rilevare e poi correggere automaticamente gli errori di composizione. Il contenuto del compito del GEC è intercorrelato con quello degli aspetti AWE. I compiti AWE sono considerati per tenere conto della diagnosi degli errori grammaticali, la maggior parte dei quali deve essere evidenziata nella forma corretta. Tuttavia, gli studi AWE hanno dato meno attenzione al GEC, e solo pochi ricerche hanno integrato il modello GEC iniziale nella tecnologia AWE. Inizialmente, la ricerca sul GEC sceglie la maggior parte delle volte N-gram22, e il modellolinguistico 23 inclusoBERT 24 per identificare e correggere errori grammaticali. Tuttavia, le soluzioni sopra menzionate non riuscivano a risolvere completamente problemi come il disordine e l'omissione di componenti. L'architettura dell'encoder-decoder25 ha raggiunto lo stesso successo nel GEC affrontando problemi che altri modelli non potevano affrontare in precedenza. È importante notare che le architetture GEC avanzate utilizzavano molteplici modelli per risolvere problemi, inclusi gli approcci basati suTransformer 26.

Diversi studi hanno confermato l'efficacia dell'AES rispetto alle valutazioni umane nella valutazione della scrittura disaggi 27,28. Uno studio29 ha dimostrato l'effetto della valutazione automatica sulla fluidità dell'inglese degli studenti. I risultati indicarono che la valutazione automatica aveva un effetto positivo sulla fluidità della scrittura inglese. Al contrario, alcuni altri studiignoranol'alto tasso di rilevamento degli errori da parte dell'AES rispetto alle valutazioni umane. Studi recenti evidenziano l'efficacia crescente degli strumenti assistiti dall'IA per la valutazione della scrittura nell'educazione linguistica. Uno di questi studi, 31, ha fatto un confronto tra la valutazione automatica e il feedback degli insegnanti nel contesto di apprendimento degli studenti universitari cinesi.

Il ruolo rivoluzionario degli strumenti basati sull'IA nella scrittura accademica è stato attivamente riportato nella letteratura recente. Le ricerche riguardanti l'applicazione di strumenti di scrittura basati su IA come integratori all'educazione tradizionale alla scrittura EFL evidenziano l'importanza fondamentale di pari opportunità e supporto proattivo degli insegnanti nell'implementazione efficace dellatecnologia 32. Gli studi che hanno studiato l'AWE, come Pigai, hanno indicato la forte correlazione tra il feedback con il supporto dei computer e il miglioramento della scrittura, revisione e nuovi scrittiESL 33. Un altro studio ha evidenziato i benefici degli autoencoder variazionali (VAE) che influenzano positivamente l'aspetto dell'addestramento della scrittura inglese negli studenti e ricevono feedback su livelli più alti di deep learning, specializzandosi nelle varie caratteristichelinguistiche 34. Un'altra ricerca ha suggerito che i sistemi AWE neurali sarebbero efficaci da utilizzare con GEC basati su NLP, che utilizza deep learning per offrire una valutazioneimmediata 35.

Il miglioramento dei sistemi multi-agente è un passo importante nello sviluppo di tecnologie che aiutano nella scrittura. Un esempio di multi-agente, assistente di raffinamento della scrittura accademica, l'AcademyCraft, basato sul deep-learning, ha dimostrato capacità di scrivere e fornire feedback dettagliati, facilitando così il supporto alla scrittura EFL/ESL basato su schemi analitici complessi36. Infatti, studi di apprendimento linguistico basati sulla tecnologia hanno anche identificato diversi modelli emergenti come deep learning, valutazione automatica e feedback semantico con analisi delle prestazioni che hanno mostrato un aumento graduale e costante della precisione della scrittura, così come del coinvolgimento degliapprendenti 37.

I modelli Transformer-LSTM hanno mostrato una certa propensione alla valutazione automatica e al feedback sulla scrittura inglese. Tali architetture ibride hanno richiesto insieme la comprensione contestuale dei transformer insieme all'elaborazione sequenziale dei sistemi LSTM, risultando una maggiore accuratezza riguardo alla gradazione di grammatica e coerenza e fornendo una generazione di feedback più sfumata38. La percezione degli insegnanti di EFL sugli strumenti di scrittura con IA riporta costantemente miglioramenti misurabili nell'organizzazione dei contenuti e nella qualità della scrittura, concentrandosi sul ruolo cruciale dell'aiuto pedagogico nel stimolare l'utilità dell'integrazionetecnologica 39. Ci sono meno studi che confrontano il feedback degli insegnanti e quello supportato dal computer, suggerendo modelli di deep learning per esplorare l'effetto sulla scrittura inglese degli studenti ESL in termini di fluidità e grammatica.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tutti i software e gli strumenti utilizzati nello studio sono elencati nella Tabella dei Materiali.

Criteri di valutazione

La classificazione della valutazione adottata nel presente studio riguarda due domini principali, ovvero la fluidità e la correttezza, che incorporano tutti i requisiti per una valutazione completa della scrittura in inglese come lingua straniera (EFL). Queste dimensioni sono pensate per misurare i punti chiave della qualità della scrittura che aiutano a comunicare efficacemente e a dimostrare competenze linguistiche. Il modulo Fluency misura naturalezza, espressività e coerenza nella scrittura misurando la fluidità delle idee e quanto bene vengono utilizzate le parole e la struttura delle frasi. Il modulo Correttezza mira a precisione grammaticale, impeccabilità meccanica e conformità alle convenzioni standard inglesi e, ipoteticamente, misura e conta l'errore della lingua su diversi livelli. (vedi Tabella 1)

Definizione del compito

Seguendo le condizioni della valutazione automatica della scrittura degli studenti che imparano la lingua inglese, il presente studio suggerisce un nuovo modello di sistema di valutazione della scrittura inglese assistita da computer per EG. Rispetto agli studi precedenti, che sono stati limitati dall'ambito dei sistemi automatizzati di valutazione della scrittura, il sistema proposto aiuterà a risolvere tali limitazioni attraverso l'introduzione di tecniche innovative di deep learning per consentire agli utenti un livello di analisi linguistica, ambito di modifica e analisi di feedback a livello di sistema basata sull'ampia elaborazione dei dati. Operando su due degli indicatori più significativi di una composizione, ovvero la fluidità (quanto il pezzo sia naturale, coerente ed espressivo), o la correttezza (quanto sia scritto correttamente il testo, pieno di errori grammaticali, meccanici e linguistici), con i componenti separati delle reti neurali, il sistema a doppio modello deve effettuare numerose valutazioni. Inoltre, identifica errori a diversi livelli linguistici, raccomanda misure correttive e fornisce feedback in forma di elenco per permettere agli utenti di migliorare l'apprendimento linguistico degli studenti in modo metodico. Per descrivere il processo di calcolo del sistema di valutazione automatica assistita da computer, suggeriamo il seguente modello matematico nelle formule (1)–(4) (vedi Tabella 2).

figure-protocol-1(1)

figure-protocol-2(2)

figure-protocol-3(3)

figure-protocol-4(4)

dove: Punteggio finale = il punteggio composito della valutazione della scrittura; W1 = peso assegnato al punteggio di fluenza; w2 = peso assegnato al punteggio di correttezza; Sf = punteggio di fluidità basato sul BERT (normalizzato a [0, 1]); Sc = punteggio di correttezza del decadimento esponenziale; λ = costante di decadimento che controlla la penalità di errore; σ(x) = funzione di attivazione sigmoide logistica; ErrorRatio = rapporto di errori rispetto al totale dei token nel testo. I punteggi di fluidità sono normalizzati a [0, 1] dalla funzione sigmoide logistica σ(x), mentre la funzione di decadimento esponenziale viene utilizzata per valutare la correttezza e imporre una penalità appropriata sulla frequenza degli errori.

Architettura e progettazione del sistema

La sua architettura di sistema utilizza un sistema a due modelli con un'architettura di elaborazione parallela, in cui l'analisi dei saggi di input viene eseguita in parallelo tramite percorsi di valutazione paralleli. I moduli di Fluency e Correttezza, a loro volta, forniscono i rispettivi punteggi, e il punteggio composito finale è la media ponderata dei due sotto-punteggi. Il modulo di correttezza offre anche suggerimenti sul rilevamento e correzione degli errori, oltre alla valutazione (vedi Figura 1).

Il modulo di fluidità

La fluidità della scrittura può essere definita come la natura o il modello di uso di una lingua riguardo alla scelta corretta del vocabolario, alla varietà della struttura delle frasi, alla complessità sintattica, alla coerenza, ecc.4. I modelli di valutazione della fluidità catturano le idee trasmesse senza balbettare o risultare goffe, suonando approssimativamente al tipo nativista di tendenze comunicative. La misurazione tradizionale della fluidità si basa su scale, evidenziando le preoccupazioni di affidabilità tra i valutatori. Il sistema proposto supera questo svantaggio includendo reti neurali basate su BERT per indurre automaticamente coerenza semantica e naturalità linguistica attraverso una profonda comprensione situazionale. Questa decisione architettonica è stata presa considerando i punti di forza del BERT, che si è dimostrato efficace nell'identificazione delle relazioni contestuali e dei modelli semantici necessari nella misurazione della fluidità. Le sequenze di input vengono inserite nel sistema e passate attraverso 12 strati di trasformatore con autoattenzione multi-testa per identificare dipendenze a lungo raggio e relazioni contestuali (vedi Figura 2).

Il meccanismo dell'attenzione sarebbe il seguente:

figure-protocol-5(5)

Siano Q, K e V le matrici che rappresentano rispettivamente interrogy, key e value, e d e k le dimensioni dei vettori chiave. L'embedding del token CLS è quello sommario, che registra la coerenza semantica complessiva dell'intera sequenza di input.

Il calcolo del punteggio di fluidità è il seguente:

figure-protocol-6(6)

In cui hCLS è l'embedding del token BERT [CLS], e Wreg, sono breg i parametri della testa di regressione, e σ è la funzione di attivazione sigmoid che normalizza l'output a [0, 1].

Il modulo di correttezza

La valutazione della correttezza si concentra sull'accuratezza grammaticale, l'accuratezza meccanica e l'aderenza alle convenzioni inglesi standard. Questa dimensione affronta gli aspetti tecnici della scrittura, inclusi sintassi, morfologia, punteggiatura e accuratezza ortografica. La componente di correttezza non solo valuta il numero di errori linguistici, ma esamina anche l'impatto sulla qualità complessiva del testo. A differenza della valutazione della fluidità, che enfatizza la coerenza semantica e il flusso naturale, il modulo di valutazione della correttezza richiede un'identificazione precisa degli errori e una correzione sistematica. Il modulo distingue tra diversi tipi di errore, ne valuta la gravità e fornisce correzioni mirate per supportare il miglioramento dell'apprendimento. La perdita di correttezza utilizza il modello FLAN-T5, che è stato ricalibrato per individuare e correggere errori grammaticali. Questa scelta è influenzata dalla trasformabilità testo-testo di T5, che permette al sistema non solo di trovare errori, ma anche di eseguire correzioni rilevanti all'interno di un unico sistema. Il sistema è una forma encoder-decodificatore, e il testo viene alimentato sotto forma di questa trasformazione: (vedi Figura 3)

figure-protocol-7(7)

L'elemento encoder genera rappresentazioni contestuali che non solo catturano le tendenze grammaticali ma anche potenziali aree di guasto:

figure-protocol-8(8)

Con l'aiuto della generazione di variazioni grammaticali appropriate su errori falsamente identificati, il decodificatore genera sequenze corrette:

figure-protocol-9(9)

Questo tipo di elaborazione bidirezionale permette al sistema di avere la consapevolezza dei contesti degli errori e di come tali contesti debbano essere corretti, così che gli indizi siano semanticamente coerenti ma si concentrino su eventuali correzioni grammaticali.

Quantificazione dell'errore e algoritmo di punteggio

Il punteggio di accuratezza confrontava la scrittura originale con la versione corretta della scrittura, considerando gli errori linguistici e la gravità basati sulla posizione all'interno del testo e sull'interferenza con il significato. Questo metodo cattura la distinzione tra tipi di errori rispetto all'impatto sulla comprensione testuale del testo. La relazione tra frequenza degli errori e scarsa qualità del testo è stata sottolineata in modo logaritmico nel sistema di valutazione. Un passaggio fondamentale nel confronto a token tra il testo originale e quello corretto sono due gradi di confronto basati sulla tecnica bit a bit dell'allineamento delle stringhe. La seconda fase riguarda l'identificazione e la classificazione dei tipi di errori basandosi su alcune tassonomie linguistiche note che differenziano errori grammaticali (concordanza soggetto-verbo, coerenza temporale e affidabilità della struttura sintattica), errori meccanici (maiuscolo, punteggiatura e ortografia) e errori d'uso (scelta delle parole, espressione idiomatica e appropriatezza dei registri). La terza fase è il calcolo del rapporto di errore basato sulla lunghezza totale del testo. Il quarto passo sfrutta l'algoritmo di punteggio del decadimento esponenziale che trasforma i rapporti di errori in punteggi di correttezza direttamente interpretabili per approssimare la dipendenza non additiva e non lineare tra frequenza degli errori e qualità del testo.

Il trattamento matematico del processo di quantificazione degli errori inizia con il calcolo del rapporto degli errori installato, che fornisce un tasso di installazione degli errori normalizzato, il che a sua volta consente un confronto equo di testi di diverse lunghezze:

figure-protocol-10(10)

figure-protocol-11(11)

È stato stabilito un parametro di calibrazione di 2,5 su base empirica, validandolo completamente con giudizi di esperti umani, in modo che la funzione di punteggio possa offrire risultati in linea con la comprensione umana in relazione al calo della qualità del testo con l'aumento della frequenza degli errori. Impostare questo valore di parametro in questo modo garantisce che qualsiasi testo con un basso tasso di errore (Error_Ratio < 0,1) abbia un punteggio di correttezza elevato, poiché segue fedelmente le regole dell'inglese standard; qualsiasi testo con un tasso di errore moderato (0,1 < Error_Ratio ≤ 0,3) ha un punteggio intermedio di correttezza, indicando che ci sono alcune preoccupazioni linguistiche che tuttavia non sono del tutto disastrose, e qualsiasi testo con un alto tasso di errore (Error_Ratio > 0,3) ha ottenuto un basso punteggio di correttezza perché ci sono preoccupazioni linguistiche critiche che influenzano significativamente la possibilità di comprensione.

L'algoritmo di punteggio della correttezza per la valutazione della correttezza tiene sistematicamente conto di tutti gli errori individuati e fissati dal sistema basato su T5 come elementi di penalità nel calcolo del rapporto finale di errore. Il meccanismo di penalità utilizzato per gli errori grammaticali è rappresentato dalla diminuzione esponenziale della crescita del proporzio di errore verso valori elevati, il che significa che la qualità del testo è molto scarsa, e diventa 100 quando il rapporto di errore è uguale a 0, il che significa che non vengono rilevati assolutamente errori. È un uso perfetto delle convenzioni standard inglesi. Tale relazione matematica garantisce che il codice di correttezza offra una distinzione significativa all'interno dell'intero spettro dei livelli di competenza linguistica e sia reattivo a piccoli progressi successivi, che indicano acquisizioni reali.

Dataset: corpus di formazione e valutazione

I dati di addestramento di qualità e portata sufficienti sono fondamentali per le prestazioni del sistema a doppio modello. Il presente studio ha utilizzato un dataset ben progettato di testi scritti dagli studenti per sviluppare e valutare il modello, prodotto utilizzando diversi compiti di scrittura. Il campione comprendeva 45 studenti universitari pakistani maschi e 45 donne con un'età media di 19 anni, che studiavano 'Inglese Funzionale' come corso obbligatorio. Ogni studente ha scritto otto saggi per otto settimane, inclusi pre-test, saggi di intervento e occasioni post-esame. Agli studenti era permesso di scrivere da 400 a 450 parole per ogni compito di scrittura. Le statistiche dei set di dati forniscono le seguenti caratteristiche:

70.500 parole

Lunghezza media delle frasi: 15,7 parole (SD = 3,2)

L'intervallo di vocabolario (rapporto tipo-token): 0,64 (SD 0,08) Densità di errore grammaticale: 2,3 in 100 parole (SD = 1,1)

La giustificazione e la garanzia della qualità dei dati selezionati

Il dataset scelto era guidato da alcune considerazioni importanti che hanno permesso la ricchezza e la rilevanza per il lavoro di ricerca sulla valutazione automatica della scrittura. Per cominciare, la popolazione studentesca di Economia è stata selezionata per la sua natura, simile a quella degli studenti di EFL nell'istruzione superiore pakistana, permettendo così la presentazione di esempi di scrittura più autentici che riflettono situazioni reali. In secondo luogo, l'istituzione dell'intervallo massimo e minimo potenziale di parole, 400–450 parole, è stata informata dai dati di studi pilota che questo intervallo è linguisticamente abbastanza complesso da essere analizzato in modo affidabile da una macchina, e rimaneva allo stesso tempo di dimensioni gestibili in termini di valutazioni umane coerenti. Ciascuna delle composizioni è stata valutata da tre insegnanti di inglese formati (affidabilità inter-valutatori κ = 0,847, dimensione di fluidità, e 0,823, dimensione di correttezza) su scale standardizzate di valutazione di fluidità e correttezza di 10 punti. La formazione dei valutatori umani era rigorosa e dipendeva da criteri di valutazione sviluppati per le valutazioni scritte IELTS e TOEFL. I dati consistono in un dataset annotato da un uomo, che può essere utilizzato nell'addestramento e nella validazione di modelli da addestrare su dati annotati da umani.

Procedure di pre-elaborazione e validazione dei dati

Il dataset veniva pre-elaborato sistematicamente e prevedeva la normalizzazione del testo, la tokenizzazione del testo con il tokenizzatore BERT WordPiece e la validazione della qualità. Coloro che hanno inviato lavori incompleti e prodotto testo plagiato non sono stati inclusi per determinare l'integrità dei dati. Gli ultimi dati sono stati suddivisi casualmente in addestramento (70%, n = 189), validazione (15%, n = 41) e set di test (15%, n = 40) tramite campionamento stratificato per bilanciare i livelli di competenza e il tipo di compiti. Analisi linguistica di un ampio corpus di riferimento contenente testi accademici professionalmente curati, articoli di giornali e saggi pubblicati, per circa 50 milioni di parole. Questo corpus fornisce i modelli linguistici necessari per eseguire i test di fluidità e assiste nelle procedure di rilevamento degli errori confrontandoli con l'uso standard. Nel corpus di riferimento, i passaggi prima della preelaborazione e dell'indicizzazione sono la tokenizzazione, il taggaggio delle parti del discorso, l'analisi sintattica e l'etichettatura semantica per facilitare un accesso efficiente durante la valutazione in tempo reale.

Strategia di addestramento con modello di fluidità

Viene proposto un sistema di ottimizzazione sequenziale per addestrare i dati a raggiungere la fluidità. La formazione utilizzava funzionalità all'avanguardia, tra cui la programmazione adattiva del tasso di apprendimento, la dimensione progressiva del batch e metodi avanzati di regolarizzazione che prevengono il sovrafitting durante il progredire della formazione, mantenendo così l'efficacia del modello nell'identificare schemi linguistici indicatori della fluidità linguistica. La velocità di apprendimento è 5 × 10-4 con un programma di decadimento lineare, configurato per garantire che la convergenza rimanga stabile e non oscilli attorno ai valori ottimali dei parametri. Questa velocità di apprendimento viene scelta tramite la ricerca a griglia in [1 x 10-6, 1 x 10-4], con 5 x 10-5 che rappresenta il compromesso più appropriato tra velocità di convergenza e stabilità. L'addestramento reale sarà limitato a sole 3 epoche, una configurazione ottimizzata sulla base dei benefici empirici tramite il tracciamento delle perdite di validazione per prevenire l'overfitting senza impedire aggiornamenti sufficienti dei parametri che rendano l'apprendimento efficace. È stato effettuato un arresto precoce dei meccanismi con una pazienza di 2 epoche e un delta minimo di 0,001 per prevenire il degrado.

L'ottimizzazione viene effettuata dall'ottimizzatore AdamW, con scelte semplificate come β₁ = 0,9 (momento di movimento, che controlla esponenzialmente il decadimento delle stime del primo momento), β₂ = 0,999 (stima del secondo momento, che controlla esponenzialmente il decadimento delle stime del secondo momento) e ε = 1 × 10⁻8 (termine di stabilità numerica). La regolarizzazione del decadimento dei pesi (λ = 0,01) impedisce che le magnitudini dei parametri crescano eccessivamente, con questo valore selezionato tramite analisi delle prestazioni di validazione su tutto l'intervallo [0,001, 0,1]. Il monitoraggio complesso è in grado di monitorare varie metriche durante l'addestramento per garantire le migliori prestazioni di un modello ed evitare il sovrafitting. Nel quadro di monitoraggio sono inclusi:

Tracciamento delle perdite: la perdita di addestramento e validazione viene monitorata in ogni epoca, e la cessazione anticipata avviene automaticamente quando la perdita da validazione non migliora più durante due epoche consecutive.

Metriche di prestazione: I dati di validazione vengono utilizzati per calcolare i coefficienti di correlazione di Pearson tra i punteggi previsti e reali ogni 100 passaggi di addestramento.

Rilevamento gradiente: Le norme di gradiente vengono monitorate per rilevare gradienti di nulance ed esplosione, e a una norma di gradiente di 1.0 viene applicato il clipping di gradiente.

Programmazione del tasso di apprendimento: Diminuzione del tasso di apprendimento basata sulla validazione (fattore = 0,5) nel caso in cui venga rilevata una squadra di più di un'epoca.

Correlazione alla regolarizzazione: Tassi di ablazione (0,1 per BERT, 0,3 per la testa di regressione) sono stati riscontrati tramite ablazione sistematica. Durante il processo di addestramento vengono utilizzati diversi metodi di regolarizzazione basati sulla prevenzione dell'overfitting: (1) regolarizzazione del dropout utilizzando tassi di dropout ottimizzati per tipo di strato nella rete, (2) decadimento del peso come spiegato sopra, (3) arresto precoce, determinato dalla performance di validazione, e (4) aumento dei dati basato sulla parafrasi del 15 percento degli esempi di addestramento tramite metodi di retrotraduzione. I checkpoint del modello con le migliori prestazioni venivano salvati dopo ogni epoca e i modelli con il punteggio più alto venivano selezionati in base ai punteggi di correlazione di validazione. La funzione di perdita utilizzata nella parte di valutazione della fluidità è l'Errore Quadratico Medio (MSE), che è la funzione principale del compito di regressione ovvero la previsione dei punteggi di fluenza continua. La formulazione della perdita è matematicamente data come:

figure-protocol-12(12)

N è la dimensione totale del campione di allenamento, y_pred, i è il punteggio di fluidità previsto del campione i-esimo, e y_true, i è il corrispondente punteggio di verità di base dato dagli esperti valutatori umani. Questa perdita è molto utile per scoraggiare quadraticamente l'errore effettivo di previsione, in modo che errori maggiori comportino una penalità maggiore, ed è anche differenziabile. Il meccanismo di pianificazione della velocità di apprendimento è altamente avanzato con un processo bifasico, e inizia con una fase di riscaldamento lineare, seguita da un processo sistematico di decadimento per creare caratteristiche di convergenza ottimali. Questo avviene nella fase di riscaldamento, in cui la velocità di apprendimento parte da zero e cambia gradualmente fino alla velocità massima, dopodiché i parametri del modello vengono ottimizzati rispetto al dataset di addestramento. L'espressione matematica della fase di riscaldamento è:

figure-protocol-13(13)

Dopo la fase di riscaldamento, il tasso di apprendimento diminuisce in modo lineare sistematico per evitare il superamento dei valori ottimali dei parametri e si traduce in una convergenza costante. Matematicamente, la fase di decadimento si legge come:

figure-protocol-14(14)

In cui t è il passaggio di allenamento corrente, lr max è la velocità massima di apprendimento raggiunta durante il riscaldamento, il riscaldamento è il numero di passaggi assegnati alla fase di riscaldamento e il totale è il numero totale di passi di allenamento in tutte le epoche. La procedura di pianificazione menzionata garantisce un apprendimento aggressivo del modello ai livelli inferiori e stabilità ai livelli di convergenza.

Strategia di addestramento del modello di correttezza

Il modello di correttezza si basava sulla strategia di apprendimento tramite trasferimento utilizzando il modello FLAN-T5 pre-addestrato per sfruttare tutte le conoscenze grammaticali disponibili secondo necessità. Questo mirava a esaminare la comprensione generale della lingua così come le informazioni specifiche sugli errori commessi dagli studenti ESL. Il metodo di apprendimento tramite trasferimento utilizzava il checkpoint pszemraj/flan-t5-grande-grammatica-sintesi come modello base, con diversi vantaggi degni di nota in termini di correttezza. Poiché il modello è già addestrato e possiede una grande capacità di comprensione linguistica formata in vari campi del testo, si adatterà a molti stili di scrittura e argomenti di scrittura. In particolare, è stata effettuata una messa a punto specifica per grammatica su grandi dataset di correzione che coprono molteplici tipi di errori grammaticali come si riscontrano nella scrittura in seconda lingua. Inoltre, il checkpoint comprende potenti sistemi di rilevamento degli errori che vengono testati contro i diversi tipi di errori (cioè errori morfologici, errori sintattici e semantici), creando uno standard perfetto di confronto con i parametri innati di test di correzione dello studio.

Il processo di adattamento del dominio riflette le modifiche sistematiche dei parametri che non alterano le capacità generali di comprensione linguistica del modello pre-addestrato, ma introducono le caratteristiche specifiche della soluzione di valutazione della scrittura. Questo processo di adattamento ha la derivazione matematica come:

figure-protocol-15(15)

Qui θpre-addestrato rappresenta i parametri del modello pre-addestrato che codifica la comprensione generale del linguaggio e la conoscenza grammaticale, eil dominio Δθ rappresenta gli aggiornamenti specifici dei parametri appresi dal compito di valutazione della scrittura target. Gli aggiornamenti specifici per dominio vengono calcolati tramite ottimizzazione basata su gradiente sul dataset target, assicurando che il modello sviluppi una sensibilità specifica al compito ai tipi di errore comuni nella scrittura EFL senza compromettere le sue capacità linguistiche più ampie.

Esperimenti con confronti

Per dimostrare la funzionalità dell'EG, si propone il coefficiente di correlazione di Pearson come valore chiave della misurazione, che determina la connessione lineare tra i punteggi automatizzati e l'esperienza umana. Il coefficiente di correlazione si trova tramite la formula:

figure-protocol-16(16)

Dove xi rappresenta i punteggi automatici, rappresenta le valutazioni umane, e figure-protocol-17 e figure-protocol-18 sono le rispettive medie. Il coefficiente di correlazione varia da −1 a 1, con valori vicini a 1 che indicano una forte relazione positiva tra valutazione automatica e valutazione umana.

figure-protocol-19(17)

figure-protocol-20(18)

figure-protocol-21(19)

Confronti di modelli di base

Per valutare le prestazioni dell'EG e dimostrarne la superiorità rispetto ai metodi esistenti, vengono effettuati confronti approfonditi con approcci AWE consolidati e tradizionali a metrica singola. Questi confronti di base sono essenziali per validare il valore aggiunto dell'architettura EG e dimostrare che l'integrazione della valutazione della fluidità e della correttezza fornisce miglioramenti misurabili rispetto ad approcci che si concentrano isolatamente sulle singole dimensioni. La selezione dei modelli di base copre quattro categorie di AWE, ognuna riflettendo un orientamento distinto su come la scrittura dovrebbe essere valutata. Il primo utilizza un unico modello basato sul BERT per valutare la fluidità. Questi modelli utilizzano architetture a transformer per valutare i modelli testuali di fluidità e coerenza. La seconda categoria, inserita nelle metodologie linguistiche tradizionali, si concentra su sistemi basati su regole per il rilevamento degli errori grammaticali. Pertanto, l'attenzione è rimasta sulla correttezza, trascurando altri aspetti legati alla qualità della scrittura, come la coesione e i contenuti. La terza categoria sono i sistemi AWE basati su caratteristiche, che includono indicatori di complessità linguistica—come la lunghezza variazionale delle frasi, la diversificazione del lessico e la complessità sintattica per generare punteggi complessivi di qualità. Il quarto prende in considerazione i sistemi ibridi combinando varie caratteristiche linguistiche superficiali, spesso utilizzando metodi di ensemble o medie ponderate. Questi modelli non raggiungono il livello di sofisticazione integrata raggiunto dalle architetture neurali EG. Le prestazioni di base del modello vengono valutate con tre dimensioni principali. Il primo misura l'allineamento dei voti generati dal sistema con le valutazioni degli esperti umani formati (insegnanti di inglese) utilizzando rubriche standardizzate. Il secondo determina la generalizzabilità, identificando se la performance rimane coerente in tre saggi con argomenti e complessità diversi. La terza dimensione si basa sull'affidabilità predittiva, valutando l'accuratezza e la stabilità della valutazione tramite strumenti statistici come l'errore assoluto medio, l'errore quadratico medio e l'analisi degli intervalli di confidenza. Collettivamente, queste dimensioni stabiliscono un quadro solido per il confronto e mettono in evidenza la superiorità dei sistemi EG, in particolare nel raggiungere maggiore precisione e stabilità rispetto agli approcci tradizionali.

Gruppi sperimentali e di controllo

Questo studio ha coinvolto 90 studenti universitari di Economia che stavano studiando un corso funzionale di inglese in due classi intatte. I dati sono stati prelevati in tre occasioni: pre-test, intervento e post-test per monitorare i progressi nell'accuratezza e nella fluidità della scrittura nel tempo. Questo studio su soggetti umani è stato approvato dal Consiglio Consultivo Dipartimentale della COMSATS University Islamabad, Campus di Lahore, Pakistan. I partecipanti sono stati esposti a due condizioni: il feedback umano tradizionale e il feedback supportato dal computer. Il gruppo di controllo era composto da 45 studenti, che ricevevano il tradizionale feedback scritto da un insegnante di inglese formato. I partecipanti hanno ricevuto feedback scritti sui saggi degli studenti sotto forma di voti olistici, identificazione degli errori e raccomandazioni sotto forma di commenti di un docente su come migliorare il lavoro. Il gruppo sperimentale, a sua volta, includeva 45 studenti che venivano istruiti allo stesso modo in classe, ma la scrittura degli studenti veniva integrata da un rapido feedback automatico fornito dall'EG, che forniva loro le informazioni diagnostiche, sia in termini di fluidità che di correttezza, entro circa 30 secondi dalla consegna.

Questo studio è stato condotto nell'arco di 8 settimane, durante le quali è stato effettuato un pre-test (Settimana 1) per determinare la performance iniziale di scrittura dei soggetti del test prima che agli studenti venisse effettuato un intervento. Feedback basato su computer con marcatori semantici NLP nel gruppo sperimentale e valutazione degli insegnanti nel gruppo di controllo sono stati forniti ai partecipanti per sei settimane. Infine, il post-test (nella settimana 8) è stato condotto per comprendere la differenza tra le misure di accuratezza pre- e post-test e i punteggi di fluidità. Per ottenere risultati simili in comparabilità, è stato chiesto ai rispondenti di svolgere compiti simili per iscritto ad ogni periodo di valutazione, minimizzando così le potenziali variabili di confusione della difficoltà del compito e della familiarità con i contenuti nella scrittura. Per garantire che i prompt di scrittura siano coerenti con il livello di difficoltà, oltre a stabilire la validità del contenuto, i prompt sono stati scelti in modo coerente. Gli argomenti per i saggi sono stati scelti sulla base del fatto che gli studenti coprono vari ambiti di contenuto per evitare effetti di pratica e noia da parte dei partecipanti dal dover svolgere un compito simile per un lungo periodo di tempo.

Durante la fase pre-test, ai partecipanti è stato chiesto di scrivere un saggio di 400–450 parole e di scrivere sugli obiettivi accademici e professionali. Questo compito descrittivo si basava su esperienze personali e proiezioni future, il che implica la necessità di organizzare la scrittura, fornire esempi chiari e formulare una dichiarazione logica di obiettivi personali e motivazioni. Il compito di scrittura per interventi si basava su diversi argomenti, come scrivere della routine quotidiana della vita, hobby, viaggi, il primo giorno all'università, giorni memorabili della vita e momenti di amicizia. Il prompt post-test era collegato all'argomento 'Effetto della tecnologia sulla comunicazione' e la lunghezza richiesta era di 400–450 parole.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Validità e affidabilità dell'approccio statistico

Il sistema è stato testato su vari metodi statistici complementari che forniscono prove complete degli effetti dell'EG sullo sviluppo della scrittura. Si tratta di un metodo analitico multifaccettato che riconosce che gli interventi educativi sono soggetti ad analisi statistiche complesse che non possono essere ridotte a semplici confronti tra gruppi, ma piuttosto all'analisi dei modelli di cam...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

I risultati sperimentali dimostrano diversi risultati significativi. Innanzitutto, il sistema a doppio modello ha raggiunto una forte correlazione con i giudizi degli esperti umani (r = 0,923), superando sostanzialmente gli approcci a modello singolo e i sistemi AWE contemporanei. In secondo luogo, lo studio sull'intervento controllato ha rivelato miglioramenti significativi nelle prestazioni di scrittura degli studenti ESL, con grandi dimensioni degli effetti (d = 1,28) superiori a quel...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Non ci sono conflitti di interesse tra tutti gli autori.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Riconosciamo il sostegno della COMSATS University Islamabad, campus di Lahore, della facoltà di inglese, nell'aiutare a raccogliere dati dagli studenti.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
/LIBRERIE FORTI USATI NELLO STUDIO
Quadro di Deep LearningPyTorch1.13.1Framework di deep learning per l'implementazione di reti neurali
Modelli pre-addestratiTransformers (Faccia abbracciante)4.21.3Caricamento di modelli pre-addestrati, implementazioni di modelli BERT e T5
Modello linguisticoBERT (Rappresentazioni Bidirezionali degli Encoder da Transformers)Base-Zero-UncasedValutazione della fluidità, valutazione della coerenza semantica, comprensione contestuale
Modello linguisticoFLAN-T5 (Rete linguistica fine-tunata T5)pszemraj/flan-t5-grande-grammatica-sintesiCorrezione degli errori grammaticali, trasformazione da testo in testo, rilevamento errori
Calcolo numericoNumPy1.23.5Calcoli numerici, operazioni di array per funzioni matematiche
Analisi dei DatiPandas1.5.2Manipolazione dei dati, analisi statistica e pre-elaborazione
Apprendimento automaticoScikit-learn1.1.3Calcolo delle metriche statistiche, analisi di correlazione, metriche di valutazione
VisualizzazioneMatplotlib3.6.2Visualizzazione dei dati, grafici di progresso dell'addestramento, grafici delle prestazioni
VisualizzazioneSeaborn0.12.1Visualizzazione statistica dei dati, heatmap di correlazione
NLP ToolkitNLTK (Kit di strumenti per il linguaggio naturale)3.7Preprocessing del testo, tokenizzazione, analisi linguistica
Elaborazione NLPSpaCy3.4.4Preprocessing avanzato NLP, tag POS, analisi sintattica
TokenizzazioneTokenizzatori0.13.2Tokenizzazione rapida per la tokenizzazione BERT WordPiece e T5
SOFTWARE STATISTICO E DI ANALISI
Software statisticoSoftware statistico SPSSVersione 26.0Analisi statistica, campioni indipendenti, test t, ANOVA, analisi di correlazione
Dataset di addestramentoKaggle ASAP DatasetVersione 2012Reference del corpus di addestramento (il 90% dei modelli AWE utilizza questo dataset)
LIBRERIE DI OTTIMIZZAZIONE E ADDESTRAMENTO IN PYTHON
Ottimizzatoretorch.optim.AdamWPyTorch 1.13.1Ottimizzazione del modello con regolarizzazione del decadimento dei pesi (λ=0.01), β 1=0,9, β 2=0,999, ε=1× 10-8
Perdita / Attivazionetorch.nn.functionalPyTorch 1.13.1Attivazione sigmoide, funzioni di perdita, regolarizzazione del dropout
Caricamento dei datitorch.utils.data.DataLoaderPyTorch 1.13.1Dimensionamento progressivo a batch (4→ 16), caricamento e batching dei dati
TokenizzazioneTrasformatori. AutoTokenizerTransformers 4.21.3Tokenizzazione BERT WordPiece, preprocessing del testo
Caricamento dei modelliTrasformatori. AutomodelloTransformers 4.21.3Caricamento pre-addestrato dei modelli per architetture BERT e T5
Controllo della pendenzatorch.nn.utils.clip_grad_norm_PyTorch 1.13.1Clipping del gradiente (soglia: 1.0) per la stabilità dell'addestramento
Programmazione LRtorch.optim.lr_schedulerPyTorch 1.13.1Programmazione della velocità di apprendimento con decadimento lineare e riscaldamento
Metrichesklearn.metricsScikit-learn 1.1.3Correlazione Pearson, MAE, calcolo RMSE per la valutazione
IMPLEMENTAZIONE DI RETI NEURALI PYTHON
Classe basetorch.nn.ModulePyTorch 1.13.1Classe base per architetture di reti neurali personalizzate (Fluency & Fluency & moduli di correttezza)
Strati lineariTorch.nn.LinearePyTorch 1.13.1Implementazione della testa di regressione lineare (768→ 512→ 256→ 128→ 1 neuroni)
RegolarizzazioneTorch.nn.DropoutPyTorch 1.13.1Regolarizzazione del dropout (0,1 per BERT, 0,3 per la testa di regressione)
Attivazionetorch.nn.functional.sigmoidPyTorch 1.13.1Attivazione sigmoide per la normalizzazione del punteggio di fluency [0,1]
Attivazionetorch.nn.functional.reluPyTorch 1.13.1Attivazione di ReLU negli strati di regressione per trasformazioni non lineari
TrasformatoreTrasformatori. BertModelTransformers 4.21.312 strati trasformatori con autoattenzione multi-testa per la valutazione della fluidità
Seq2SeqTrasformatori. T5For
CondizionaleGeneration
Transformers 4.21.3Architettura codificatore-decodificatore per la correzione degli errori grammaticali
Funzione di perditatorch.nn.MSELossPyTorch 1.13.1Funzione di perdita dell'errore quadratico medio per l'addestramento alla regressione della fluidità
LIBRERIE DI VALUTAZIONE E METRICHE PYTHON
Correlazionescipy.stats.pearsonrSciPy 1.9.3Coefficiente di correlazione di Pearson per l'accordo modello-uomo
Metrica di erroresklearn.metrics.mean_absolute_errorScikit-learn 1.1.3Calcolo dell'Errore Assoluto Medio (MAE) per l'accuratezza della previsione
Metrica di erroresklearn.metrics.mean_squared_errorScikit-learn 1.1.3Errore quadratico medio radice (RMSE) per la valutazione dell'entità dell'errore
Test statisticoscipy.stats.ttest_indSciPy 1.9.3Test t per campioni indipendenti per il test di significatività statistica
Matrice di correlazionenumpy.corrcoefNumPy 1.23.5Calcolo della matrice di correlazione per l'affidabilità inter-rater
Correlazione dei datiPanda. DataFrame.corrPandas 1.5.2Analisi della correlazione dei dati e reportistica statistica
Visualizzazionematplotlib.pyplotMatplotlib 3.6.2Visualizzazione delle prestazioni, grafici di correlazione, grafici di progresso dell'allenamento
Mappa termicaseaborn.heatmapSeaborn 0.12.1Visualizzazione della matrice di correlazione e presentazione dei dati statistici
PYTHON ELABORAZIONE DEL TESTO E LIBRERIE NLP
Elaborazione del testore (Espressioni Regolari)Python 3.9+ integratoAbbinamento di pattern di testo, pulizia dei dati e preprocessing
Gestione della configurazioneJSONPython 3.9+ integratoGestione dei file di configurazione, memorizzazione dei parametri del modello
SerializzazioneCetrioloPython 3.9+ integratoSerializzazione dei modelli e salvataggio/caricamento dei checkpoint
Monitoraggio dei progressiQDM4.64.1Barre di progresso per cicli di addestramento e elaborazione dati
DisboscamentoLoggingPython 3.9+ integratoRegistrazione dei progressi dell'addestramento, monitoraggio degli errori e debug
RiproducibilitàcasualePython 3.9+ integratoImpostazione casuale dei semi per esperimenti riproducibili
File SystemOSPython 3.9+ integratoOperazioni del file system, gestione del percorso dei modelli
CLI ParsingargparsePython 3.9+ integratoParsing degli argomenti da riga di comando per configurazioni di addestramento
PIATTAFORME COMMERCIALI AWE / AES (Riferito)
Piattaforma commercialePigai.orgPiattaforma AWE commercialeValutazione della scrittura EFL cinese, sistemi di feedback automatizzati
Piattaforma commercialeInglese BingoSistema AWE commercialeSupporto all'apprendimento della lingua inglese, sviluppo delle competenze di scrittura
Piattaforma EducativaIl mio accessoPiattaforma di scrittura educativaValutazione della scrittura degli studenti e trasmissione di feedback
Motore di punteggioE-raterMotore automatico di punteggio ETSValutazione standardizzata di saggi di esame, valutazione olistica
Strumento di valutazioneI-writeStrumento di valutazione della scritturaValutazione della scrittura accademica e feedback diagnostico
Servizio di PraticaCriterioServizio di pratica di scrittura ETSSviluppo delle competenze di scrittura e feedback automatico
Modello di linguaggio AIChatGPTModello linguistico OpenAIFeedback e valutazione della scrittura assistiti dall'IA (citati nella letteratura)
ARCHITETTURE DI DEEP LEARNING (citate in letteratura)
ArchitetturaReti Neurali Ricorrenti (RNN)Cai, 2019Elaborazione sequenziale del testo — Sistemi di feedback di scrittura e valutazione automatizzata
ArchitetturaMemoria a breve termine lungo (LSTM)Jin et al., 2018Modellazione delle dipendenze a lungo raggio & mdash; Valutazione automatica dei saggi e analisi di sequenza
ArchitetturaReti Neurali Convoluzionali (CNN)Dong et al., 2017Riconoscimento locale di pattern — Classificazione del testo ed estrazione delle caratteristiche per la valutazione
ArchitetturaIbrido Transformer-LSTMXuan, 2025Elaborazione contestuale e sequenziale combinata — Valutazione automatica e generazione di feedback
ArchitetturaAutoencoder variazionali (VAE)Kumar et al., 2024Modellazione generativa & mdash; Sviluppo delle competenze di scrittura migliorato e feedback personalizzato
ArchitetturaSistemi Multi-AgenteThompson et al., 2024Elaborazione collaborativa dell'IA e mdash; assistenza avanzata alla scrittura (piattaforma AcademiCraft)
MeccanismoMeccanismi di attenzioneDong et al., 2017Autoattenzione e attenzione multi-testa — miglioramento delle prestazioni AES e comprensione contestuale
TECNICHE TRADIZIONALI DI MACHINE LEARNING (Riferito)
Metodo statisticoTeorema di BayesRudner & Liang, 2002Approccio tradizionale ML & mdash; Sviluppo iniziale di AES/AWE e punteggio probabilistico
Metodo statisticoRegressione linearePhandi et al., 2015Modellazione statistica & mdash; Valutazione della scrittura basata su funzionalità e previsione del punteggio
Metodo di apprendimentoApprendimento per preferenza di rangoChen & Lui, 2013Metodologia basata sulla classifica & mdash; Valutazione dei saggi comparativi e modellazione delle preferenze
Modello linguisticoModelli N-gramXie et al., 2015Modellazione statistica del linguaggio & mdash; Correzione degli errori grammaticali e riconoscimento di pattern
ArchitetturaArchitettura codificatore-decodificatoreGe et al., 2018Modellazione sequenza a sequenza & mdash; Correzione degli errori grammaticali e trasformazione del testo
STANDARD E QUADRI DI VALUTAZIONE
Standard di valutazioneValutazione di scrittura IELTSAdattamento della rubrica di valutazioneCriteri standardizzati di valutazione per la fluidità e la correttezza
Standard di valutazioneValutazione di scrittura TOEFLStandard di scrittura accademicaValutazione della competenza e punteggio standardizzato
Misura statisticaDimensione dell'effetto d di Cohen0,2=piccolo, 0,5=medio, 0,8=grandeValutazione pratica della significatività dell'intervento
Misura di affidabilitàAffidabilità inter-valutatori (κ)Fluidità: 0,847 / Correttezza: 0,823Coefficiente Kappa & mdash; Valutazione della coerenza e della validazione dell'accordo da parte degli esaminatori umani

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Apprendimento delle Lingue Assistito dal ComputerModelli di Reti NeuraliElaborazione del Linguaggio NaturaleValutazione Automatica dei TemiPedagogia della Scrittura ESLFeedback GrammaticaleFluenza della Scrittura

Articoli correlati