Insegnare la progettazione degli esperimenti
Questo studio ha utilizzato la versione open-source di base di DeepSeek, basandosi sull'interfaccia API aperta della piattaforma per le chiamate al programma. L'intero insieme dei cinque modelli di testo per i prompt, delle quattro categorie di esempi di compiti, dei tag di annotazione per il trasferimento e delle regole di mappatura per l'abbinamento con modelli di errore di scrittura è stato raccolto nell'appendice supplementare. Il sistema aveva parametri di chiamata fissi: un coefficiente di temperatura di 0,7 e una lunghezza generata limitata dinamicamente in base al tipo di domanda di scrittura. Ha seguito rigorosamente una sequenza fissa di ricostruzione semantica > aggiustamento stilistico > adattamento culturale, eseguendo chiamate a catena di prompt nidificate. L'output del modello è stato selezionato manualmente dall'insegnante per individuare il testo più efficace da utilizzare nell'insegnamento in aula.
Questo studio ha coinvolto tre docenti universitari a tempo pieno di scrittura in lingua inglese con oltre 5 anni di esperienza, invitandoli a partecipare alla valutazione manuale. Tutti i valutatori hanno ricevuto una formazione standardizzata prima della valutazione ufficiale, familiarizzando con le dimensioni della valutazione, il sistema di punteggio su scala da 1 a 5, il trasferimento culturale, la sintassi, il discorso e altri dettagli di valutazione, e hanno completato una fase preliminare di calibrazione. Tutti i saggi degli studenti sono stati valutati indipendentemente da due insegnanti in modalità di doppia valutazione cieca. Se la differenza tra i punteggi assegnati dai due valutatori superava 1 punto (su 5), un terzo docente esperto interviene come arbitro nella valutazione, e la media dei due punteggi validi viene considerata il punteggio manuale finale per quel campione. Due gruppi di valutatori hanno partecipato alla fase di valutazione per finalità di ricerca diverse. Tre docenti universitari a tempo pieno di scrittura in inglese con oltre 5 anni di esperienza hanno effettuato la doppia valutazione cieca di tutti i campioni scritti dagli studenti nell’esperimento formale, e un terzo docente esperto ha svolto il ruolo di arbitro in caso di discrepanze superiori a 1 punto sulla scala da 5. Al contrario, cinque valutatori hanno partecipato al test di affidabilità inter-valutatore mediante il Coefficiente di Correlazione Intraclasse (ICC), condotto separatamente per verificare la coerenza degli standard di valutazione tra i valutatori. La differenza nel numero di valutatori deriva da esigenze funzionali distinte: i tre docenti principali hanno garantito la valutazione pratica dei dati sperimentali, mentre il gruppo allargato di cinque valutatori ha fornito evidenze più solide sull'affidabilità dell'intero sistema di valutazione.
La complessità sintattica, il punteggio della struttura del testo tramite BERT e la similarità semantica vengono tutti valutati su una scala da 0 a 5 punti. I pesi per ciascuna dimensione sono stati stabiliti in base agli standard didattici e di ricerca nell'insegnamento della scrittura in lingua straniera: sintassi 0,35, struttura del testo 0,35 e logica e cultura 0,3. I valori dei pesi si basano su sistemi di valutazione quantitativa consolidati per la scrittura nello stesso settore. Il modulo di valutazione automatica dell'IA è stato calibrato utilizzando soglie definite a partire da 15 saggi modello pre-classificati. La valutazione umana ha seguito una scala di valutazione unificata a cinque punti. La valutazione automatica e la calibrazione umana sono state combinate per una verifica preliminare prima della valutazione formale.
Il compito didattico è stato svolto sulla base degli obiettivi di trasferimento a tre livelli "sintassi-struttura-cultura", con tre cicli di formazione, ciascuno della durata di una settimana. Il primo ciclo ha previsto una riscrittura a livello di frase per migliorare la diversità sintattica e l'accuratezza espressiva; il secondo ciclo ha comportato una ricostruzione strutturale a livello di paragrafo per potenziare l'organizzazione del paragrafo e la coerenza logica; il terzo ciclo ha riguardato il trasferimento a livello culturale per rafforzare la consapevolezza pragmatica interculturale e l'adattabilità espressiva. Considerando le misurazioni ripetute raccolte dagli stessi partecipanti in fase di pre-test, nei tre cicli sequenziali di formazione e in fase di post-test, è stata adottata l'analisi della varianza per misure ripetute (RM-ANOVA) come approccio statistico principale per esaminare gli effetti principali del gruppo (sperimentale vs. controllo), gli effetti principali del momento della rilevazione, nonché l'effetto d'interazione gruppo × tempo, che ha indicato se le variazioni dei punteggi durante la formazione differivano tra le due coorti. L'assunzione di sfericità è stata verificata tramite il test di Mauchly; la correzione di Greenhouse–Geisser è stata applicata qualora la sfericità fosse violata. I test t per campioni indipendenti sono stati utilizzati esclusivamente per confronti post-hoc a coppie tra gruppi in singoli momenti temporali, mentre la correlazione di Pearson e la d di Cohen sono state mantenute rispettivamente per la valutazione della coerenza dei punteggi e della quantificazione dell'ampiezza dell'effetto.
Tutte le analisi statistiche sono state specificate a priori prima della raccolta dei dati. Sono stati utilizzati test t per campioni indipendenti per confrontare gli indicatori di scrittura pre-post tra due gruppi, con l'ipotesi nulla principale che prevedeva l'assenza di differenze intergruppo nella performance di trasferimento della scrittura. È stata impiegata un'analisi di correlazione di Pearson per quantificare l'associazione lineare tra la valutazione automatica dell'IA e i punteggi manuali degli insegnanti, e la d di Cohen è stata calcolata come misura standardizzata dell'effetto per i confronti tra gruppi. La soglia di significatività è stata fissata a α = 0,05 per tutti i test d'ipotesi, e sono stati calcolati intervalli di confidenza al 95% insieme a tutte le statistiche dei test. SPSS 26.0 è stato utilizzato per eseguire tutti i calcoli statistici. Non si sono verificati dati mancanti nei punteggi dei test degli studenti e nei set di dati dei questionari, poiché tutti i partecipanti hanno completato l'intero training in tre fasi e le relative valutazioni; pertanto, non è stata necessaria alcuna imputazione o eliminazione di casi per valori mancanti.
Costruzione del sistema di indicatori di valutazione
Per valutare in modo completo le prestazioni degli studenti nel training sul trasferimento della scrittura in inglese, questo studio ha costruito un sistema di valutazione multidimensionale che copre gli obiettivi di trasferimento su tre livelli: "sintassi-struttura-cultura", integra l'abilità linguistica, la risposta del modello, il feedback didattico e l'autocognizione, e stabilisce sei indicatori principali. In primo luogo, l'"indice di trasferimento della scrittura" è un indicatore di valutazione complessivo che include diversità sintattica, chiarezza strutturale e adattabilità culturale, combinando il punteggio automatico del sistema e la valutazione manuale dell'insegnante per un'analisi quantitativa. Il "punteggio di complessità sintattica" utilizza la tecnologia di elaborazione del linguaggio naturale per estrarre caratteristiche come la lunghezza media delle frasi, il numero di livelli di annidamento delle proposizioni e la frequenza d'uso delle locuzioni verbali, al fine di valutare la ricchezza e la complessità delle frasi degli studenti. L'analisi del "grado di aderenza allo stile accademico" esamina la proporzione di voce passiva e la proporzione di vocabolario formale, basandosi su un modello di NLP (Natural Language Processing), per determinare se il testo rispetta le norme stilistiche della scrittura accademica in inglese. Inoltre, lo studio ha introdotto una dimensione di valutazione soggettiva, raccogliendo tramite questionari per insegnanti il feedback sull'accettazione e l'utilità dei suggerimenti generati dal modello, al fine di valutare l'impatto reale dell'insegnamento assistito dall'intelligenza artificiale. Le "variazioni nei punteggi di correzione degli insegnanti" riflettono l'impatto dell'insegnamento assistito dall'IA sul miglioramento della qualità della scrittura, confrontando i voti assegnati dagli insegnanti ai saggi degli studenti prima e dopo l'esperimento. Infine, l'"autovalutazione dello studente sull'abilità di trasferimento" utilizza la tabella di autocognizione del trasferimento per guidare gli studenti nell'autovalutare il proprio livello di padronanza di struttura, sintassi, cultura e altre dimensioni, potenziando così la loro consapevolezza metacognitiva e le capacità di riflessione. Le descrizioni specifiche e le fonti dei dati per ciascun indicatore sono riportate nella Tabella 3.
Gli indicatori sintattici e stilistici sono stati calcolati automaticamente tramite analisi dipendente e classificazione basata su BERT, con punteggi normalizzati compresi tra 0 e 5; la valutazione manuale utilizza una scala a 5 punti. Le formule di calcolo per la complessità sintattica hanno impiegato il rapporto tra il numero totale di parole e il numero di proposizioni come denominatore principale. Fonte dei dati grezzi: composizioni scritte del pretest e del posttest di tutti e 60 gli studenti iscritti.
Risultati sperimentali e analisi
Per presentare in modo intuitivo le differenze complessive nelle prestazioni degli studenti nelle tre dimensioni del trasferimento sintattico, del trasferimento strutturale e del trasferimento culturale, Figura 3 confronta l'indice medio di trasferimento scritto degli studenti del gruppo sperimentale e del gruppo di controllo prima e dopo l'esperimento: Figura 3 mostra la differenza nei punteggi medi tra il gruppo sperimentale e il gruppo di controllo nelle tre dimensioni del trasferimento sintattico, del trasferimento strutturale e del trasferimento culturale. Il gruppo sperimentale ha mostrato un miglioramento significativo nell'abilità di trasferimento in ciascuna dimensione dopo l'esperimento, e il cerchio esterno del grafico a ragnatela è notevolmente più grande del cerchio interno, indicando che il metodo di ottimizzazione dell'insegnamento basato sul modello DeepSeek ha un effetto positivo nel promuovere lo sviluppo dell'abilità di trasferimento scritto in inglese degli studenti. Al contrario, gli indicatori di abilità di trasferimento del gruppo di controllo sono rimasti relativamente invariati prima e dopo l'esperimento. Il miglioramento complessivo è stato limitato, indicando che i metodi di insegnamento tradizionali o gli strumenti assistiti dall'intelligenza artificiale che non avevano ottimizzato le istruzioni del sistema hanno un ruolo limitato nella formazione al trasferimento. È risultato difficile stimolare efficacemente il potenziale di apprendimento degli studenti nel trasferimento linguistico multidimensionale.
Gli indici medi di trasferimento scritto del gruppo sperimentale, nelle dimensioni del trasferimento sintattico, del trasferimento strutturale e del trasferimento culturale prima dell'esperimento, erano rispettivamente 3,0, 2,9 e 2,8, aumentati a 4,3, 4,1 e 4,5 dopo l'esperimento, con incrementi di 1,3, 1,2 e 1,7 rispettivamente, indicando che il metodo didattico ha avuto un buon effetto d'intervento a diversi livelli di trasferimento. I punteggi del gruppo di controllo prima dell'esperimento erano 3,0, 3,0 e 2,9. Dopo l'esperimento, i valori sono aumentati rispettivamente a 3,4, 3,3 e 3,2, significativamente inferiori a quelli del gruppo sperimentale. È particolarmente degno di nota che, nella dimensione del trasferimento culturale, il gruppo sperimentale ha mostrato il miglioramento più significativo, passando da 2,8 a 4,5, con un aumento di 1,7 punti, molto superiore all'aumento di 0,3 punti del gruppo di controllo. Questo risultato suggerisce che il metodo didattico proposto svolge un ruolo importante nell'aiutare gli studenti a identificare e adattarsi alle norme espressive della cultura inglese. Tale effetto non si è riflesso soltanto negli aggiustamenti della forma linguistica, ma anche nel potenziamento della consapevolezza pragmatica interculturale degli studenti e nella profondità della loro comprensione delle abitudini espressive culturali della lingua target. Il trasferimento linguistico si è manifestato principalmente nella complessità sintattica, nell'adattamento dello stile linguistico e in altri aspetti. Lo studio ha utilizzato la tecnologia NLP automatizzata per analizzare approfonditamente i testi scritti degli studenti, estrarre caratteristiche linguistiche chiave e, combinando tali dati con i punteggi attribuiti dagli insegnanti, ha valutato sistematicamente i cambiamenti nell'abilità di trasferimento linguistico degli studenti nel corso di tre serie di compiti.
Complessità sintattica e stile linguistico
Per quanto riguarda la complessità sintattica, lo studio ha registrato la lunghezza media delle frasi e il numero di livelli di annidamento delle proposizioni nel testo prodotto dagli studenti al termine del compito di scrittura assegnato in ogni serie di attività. Questi due indicatori sono stati ampiamente utilizzati per misurare la complessità dell'espressione linguistica. Essi riflettevano efficacemente il livello di sviluppo degli studenti in termini di varietà delle frasi e capacità di organizzazione strutturale, come mostrato in Figura 4.
Nell'evoluzione longitudinale della complessità sintattica, il gruppo sperimentale ha mostrato una chiara tendenza ascendente nelle tre serie di compiti, riflettendo l'efficace promozione dell'abilità degli studenti nell'esprimere strutture linguistiche grazie al training trasferibile. Per quanto riguarda la lunghezza media delle frasi, il gruppo sperimentale è passato da 12,5 parole nel Compito 1 a 16,1 parole nel Compito 3, con un aumento di 3,6 parole, significativamente superiore all'aumento di soli 0,9 parole osservato nel gruppo di controllo nello stesso periodo (da 12,4 a 13,3). Analogamente, dal punto di vista della complessità strutturale, misurata dal numero di livelli di annidamento delle proposizioni, il gruppo sperimentale è aumentato da 1,8 a 2,7 livelli, mentre il gruppo di controllo è passato da 1,7 a 1,9 livelli, con un incremento relativamente lento. Per verificare ulteriormente se la differenza nella complessità sintattica tra i due gruppi di studenti sia statisticamente significativa, lo studio ha utilizzato test t per campioni indipendenti per analizzare la lunghezza media delle frasi e il numero di livelli di annidamento proposizionale nelle tre fasi del compito. I risultati hanno mostrato una differenza significativa tra il gruppo sperimentale e il gruppo di controllo per quanto riguarda la lunghezza media delle frasi, t(58) = 4,23, p < 0,001, Cohen’s d = 0,98; vi era inoltre una differenza significativa nel numero di livelli di annidamento proposizionale, t(58) = 3,15, p = 0,002, Cohen’s d = 0,78. Questo confronto ha dimostrato che il training trasferibile sistematico non solo ha migliorato la capacità degli studenti di costruire frasi complesse, ma ha anche rafforzato il loro dominio delle strategie di organizzazione grammaticale. In particolare, nella terza fase del compito, gli studenti del gruppo sperimentale hanno dimostrato una maggiore flessibilità nell'uso di proposizioni a più livelli e di strutture frasali complesse. Ciò ha riflettuto un cambiamento significativo nel loro trasferimento linguistico, passato da un livello “funzionale” a uno più “strategico”. Il percorso formativo orientato al trasferimento ha continuamente potenziato le abilità di trasferimento sintattico degli studenti, superando efficacemente i limiti della scrittura frase per frase e degli schemi espressivi fissi spesso presenti nell'insegnamento tradizionale. Per quanto riguarda l'adattamento dello stile linguistico, lo studio ha estratto i testi scritti dagli studenti prima e dopo l'esperimento. È stato utilizzato un modello di elaborazione del linguaggio naturale (NLP) per determinare la proporzione di vocabolario formale e la frequenza d'uso della voce passiva come indicatori principali per valutare l'allineamento allo stile linguistico accademico. Tali indicatori riflettono se gli studenti abbiano sviluppato la consapevolezza linguistica e l'abilità espressiva necessarie per adattarsi allo stile richiesto nella scrittura in inglese. I risultati pertinenti sono mostrati in Figura 5.
Figura 5 mostra i cambiamenti nell'allineamento allo stile accademico del gruppo sperimentale e del gruppo di controllo prima e dopo il compito, concentrandosi principalmente su due indicatori chiave: la proporzione di vocabolario formale e la frequenza d'uso della voce passiva. Nel complesso, dopo aver completato l'addestramento al trasferimento basato sul modello DeepSeek, la capacità di adattamento allo stile accademico del gruppo sperimentale è migliorata in modo significativo, dimostrando l'efficacia di questo metodo didattico nel coltivare la consapevolezza degli studenti riguardo alle norme linguistiche e alla loro abilità di adattarsi agli stili accademici. Per quanto riguarda la proporzione di vocabolario formale, il gruppo sperimentale è aumentato da 0,42 prima del compito a 0,56 dopo il compito, un incremento relativamente significativo. Al contrario, il gruppo di controllo è aumentato solo leggermente, da 0,43 a 0,48, suggerendo un miglioramento limitato. Questo risultato ha mostrato che, dopo aver ricevuto indicazioni sistematiche tramite prompt e feedback del modello, gli studenti del gruppo sperimentale hanno mostrato una maggiore tendenza a utilizzare un vocabolario formale conforme ai requisiti dello stile accademico durante il processo di scrittura, e il loro stile linguistico si è progressivamente avvicinato agli standard della scrittura accademica inglese. Per quanto riguarda la frequenza d'uso della voce passiva, il gruppo sperimentale è aumentato in modo significativo da 0,18 prima del compito a 0,27 dopo il compito, con un incremento di 0,09; al contrario, il gruppo di controllo è aumentato soltanto di 0,02.
Per verificare ulteriormente se i cambiamenti sopra descritti fossero statisticamente significativi, lo studio ha effettuato un test t per campioni indipendenti sui dati raccolti prima e dopo il compito. I risultati hanno mostrato un miglioramento significativo nel gruppo sperimentale per quanto riguarda la proporzione di vocabolario formale, t(58) = 3,89, p < 0,001, d di Cohen = 0,92; anche l'aumento della frequenza d'uso della voce passiva è risultato significativo, t(58) = 4,56, p < 0,001, d di Cohen = 1,05. Questo indica che gli studenti del gruppo sperimentale hanno compiuto progressi sostanziali nell'adattamento dello stile linguistico, progressi che non sono dovuti al caso, bensì all'effetto combinato della guida sistematica tramite prompt e del feedback del modello.
Verifica statistica
Inoltre, per verificare ulteriormente l'affidabilità dei contenuti generati dall'intelligenza artificiale nella pratica didattica, lo studio ha confrontato anche i punteggi medi dei contenuti generati dall'IA e di quelli generati dagli insegnanti in diversi tipi di prompt. La coerenza tra i due è stata valutata calcolando il coefficiente di correlazione di Pearson. I risultati del confronto pertinenti sono mostrati nella Tabella 4. La Tabella 4 illustra la coerenza tra i punteggi attribuiti dall'IA e quelli degli insegnanti in cinque tipi di prompt orientati al trasferimento. Dal punto di vista del punteggio medio, il punteggio attribuito dall'IA era leggermente inferiore a quello degli insegnanti nel complesso. Tuttavia, la differenza rientrava in un intervallo ragionevole nella maggior parte dei tipi di compito, indicando che il modello DeepSeek presenta un'elevata stabilità e valore di riferimento nella valutazione di compiti di trasferimento scritto. Nel caso del prompt di trasferimento sintattico, il punteggio medio attribuito dagli insegnanti era 4,1, mentre quello dell'IA era 4,0, con una differenza di soli 0,1 punti. Nei prompt di trasferimento strutturale e logico, il punteggio dell'IA era inferiore di soli 0,1 punti rispetto a quello degli insegnanti, indicando che il modello riesce a simulare in modo soddisfacente i criteri di valutazione degli insegnanti in compiti che coinvolgono un elevato grado di struttura linguistica e regole chiare. Al contrario, le discrepanze nei punteggi nei prompt di trasferimento culturale e di registro risultano relativamente più evidenti, con punteggi dell'IA rispettivamente di 3,6 e 3,7, inferiori di 0,2 punti rispetto ai punteggi degli insegnanti, evidenziando come l'IA presenti ancora alcune limitazioni nel gestire compiti ad alto grado di soggettività, come le implicazioni semantiche e la pragmatica culturale. L'affidabilità inter-valutatore è stata valutata tramite ICC (n = 5 valutatori). L'ICC complessivo per la valutazione manuale è stato 0,86, mentre gli ICC per ciascuna dimensione sono compresi tra 0,82 e 0,89, indicando un accordo inter-valutatore soddisfacente.
Un'ulteriore analisi del coefficiente di correlazione di Pearson ha rivelato che la coerenza dei punteggi in risposta a diversi prompt era molto elevata, indicando che il punteggio attribuito dall'intelligenza artificiale non era solo vicino al giudizio dell'insegnante in termini di valore, ma mostrava anche una buona relazione lineare nella tendenza di valutazione. Tra questi, il coefficiente di coerenza per il prompt di trasferimento sintattico era il più alto, pari a 0,87, mentre quelli relativi ai prompt di trasferimento strutturale e logico erano rispettivamente 0,83 e 0,85, indicando che i risultati della valutazione dell'IA in termini di complessità sintattica, organizzazione del paragrafo e coerenza logica sono altamente coerenti con il giudizio dell'insegnante. Ciò potrebbe essere dovuto al fatto che questi compiti presentano obiettivi chiari e caratteristiche linguistiche quantificabili, che hanno facilitato il riconoscimento da parte del modello e una valutazione stabile. Il coefficiente di correlazione per il prompt di trasferimento disciplinare è 0,81. Sebbene leggermente inferiore, esso dimostra comunque una forte capacità valutativa, indicando che l'intelligenza artificiale possiede un certo grado di capacità di giudizio a livello di adattamento stilistico. Tuttavia, il coefficiente di coerenza per il prompt di trasferimento culturale è stato solo 0,79, valore più basso rispetto agli altri tipi, ma comunque entro un intervallo accettabile.
Per esaminare l'applicabilità di diversi tipi di prompt nella pratica didattica e il grado di accettazione da parte degli insegnanti, è stato progettato un questionario sulla soddisfazione riguardo alle risposte ai prompt. Cinque insegnanti di inglese (numerati da T1 a T5) sono stati invitati a valutare, mediante una scala a cinque livelli (da molto insoddisfatto a molto soddisfatto), i suggerimenti generati da cinque tipi di prompt, come mostrato in Figura 6: i punteggi assegnati dai cinque insegnanti ai cinque tipi di prompt variano leggermente, ma nel complesso il riconoscimento è stato elevato. Tra questi, i prompt relativi al "trasferimento sintattico" e al "trasferimento culturale" hanno ottenuto i punteggi più alti, con una media di 4,0, riflettendo un'elevata praticità e adattabilità nell'insegnamento. Al contrario, il prompt relativo al "trasferimento di registro" ha ottenuto punteggi relativamente bassi, con una media di soli 2,4, e alcuni insegnanti, come T4 e T5, hanno assegnato i punteggi più bassi, indicando che la sua efficacia e adattabilità nelle applicazioni didattiche necessitano ancora di miglioramenti.
A livello individuale, si sono osservate evidenti differenze nelle tendenze di valutazione dei docenti. Il punteggio complessivo di T1 era positivo, a indicare un elevato grado di accettazione della scrittura assistita dall'intelligenza artificiale, mentre i punteggi di T5 erano bassi in molteplici dimensioni del Prompt, in particolare in "transfer del registro" e "transfer logico". Tale differenza potrebbe essere legata all'esperienza didattica, alla preferenza linguistica o alla familiarità dei docenti con gli strumenti di intelligenza artificiale, suggerendo che nella progettazione futura dei Prompt sarà necessario prevedere meccanismi di adattamento personalizzati per aumentare l'accettazione da parte di diversi gruppi di docenti. Per verificare ulteriormente l'effetto reale dell'insegnamento assistito dall'IA nel migliorare la qualità della scrittura degli studenti, lo studio ha confrontato le variazioni dei punteggi complessivi del gruppo sperimentale e del gruppo di controllo, valutate dai docenti, prima e dopo l'esperimento. I risultati del confronto sono mostrati in Figura 7.
Come mostrato in Figura 7, i punteggi complessivi del gruppo sperimentale e del gruppo di controllo, valutati dagli insegnanti prima e dopo l'esperimento, hanno mostrato differenze significative. Nel complesso, dopo l'intervento didattico basato sull'ottimizzazione dell'insegnamento mediante il modello DeepSeek, il punteggio complessivo del gruppo sperimentale ha mostrato una marcata tendenza all'aumento. Al contrario, la variazione del punteggio nel gruppo di controllo è stata relativamente lieve. Il punteggio medio attribuito dagli insegnanti al gruppo sperimentale prima dell'esperimento era di 59,1 punti, e dopo l'esperimento è aumentato significativamente a 74,4 punti, con un incremento di 15,3 punti. Ciò ha indicato che l'insegnamento assistito dall'intelligenza artificiale ha avuto un impatto positivo sulla qualità della scrittura degli studenti. Dall'istogramma a scatola si è osservato che anche l'intervallo di distribuzione dei punteggi del gruppo sperimentale si è ampliato. In particolare, la scatola dei punteggi dopo l'esperimento è significativamente più alta rispetto a prima, e i valori massimo superiore e minimo inferiore sono aumentati, indicando un miglioramento significativo del livello complessivo degli studenti. Al contrario, le variazioni di punteggio nel gruppo di controllo sono state relativamente limitate. Prima dell'esperimento, il punteggio medio del gruppo di controllo era di 60,1 punti, e dopo l'esperimento è stato di 64,9 punti, con un aumento di 4,8 punti. Questo incremento è stato molto inferiore rispetto a quello del gruppo sperimentale, e la scatola dei punteggi del gruppo di controllo non ha subito grandi cambiamenti prima e dopo l'esperimento, indicando che i metodi didattici tradizionali o gli strumenti assistiti dall'IA non ottimizzati hanno un effetto limitato nel migliorare la qualità della scrittura.
Inoltre, questo studio ha utilizzato la tabella della cognizione del trasferimento per guidare gli studenti attraverso tre cicli di autovalutazione sullo sviluppo delle proprie capacità in termini di aggiustamento strutturale, trasformazione delle frasi ed espressione culturale, tra gli altri aspetti, al fine di riflettere l'andamento evolutivo della consapevolezza metacognitiva degli studenti e del loro dominio delle strategie di trasferimento. I risultati sono mostrati in Figura 8. Secondo i dati del grafico a ragnatela relativi all'autovalutazione degli studenti sulle capacità di trasferimento riportati nella Figura 8, l'autovalutazione degli studenti nelle cinque dimensioni — trasferimento strutturale, trasferimento sintattico, trasferimento culturale, trasferimento di registro e trasferimento logico — nei tre cicli di attività ha mostrato un andamento costantemente crescente, indicando che, grazie all'intervento didattico basato sull'ottimizzazione dell'insegnamento mediante il modello DeepSeek, la capacità degli studenti di utilizzare strategie di trasferimento è migliorata in modo significativo. Nel primo ciclo di attività, i punteggi di autovalutazione degli studenti erano generalmente bassi. Tra le cinque dimensioni, il "trasferimento strutturale" e il "trasferimento logico" hanno ottenuto rispettivamente 3,2 e 3,0, mentre il "trasferimento culturale" e il "trasferimento di registro" hanno ottenuto 2,5 e 2,7, indicando che gli studenti erano ancora poco esperti nell'identificare e utilizzare le strategie di trasferimento. Nel secondo ciclo di attività, i punteggi di ciascuna voce sono migliorati: il "trasferimento strutturale" è salito a 3,8, il "trasferimento sintattico" a 3,5 e il "trasferimento logico" a 3,7. Ciò ha dimostrato che, grazie alla guida degli insegnanti e al supporto dei feedback del modello, gli studenti hanno gradualmente acquisito i punti chiave delle operazioni di base del trasferimento e hanno iniziato ad applicarle nella scrittura reale. Nel terzo ciclo di attività, i punteggi di autovalutazione degli studenti sono aumentati in modo significativo: il "trasferimento strutturale" e il "trasferimento logico" hanno raggiunto rispettivamente 4,5 e 4,3, mentre le altre dimensioni si sono stabilizzate al di sopra dei 4,0 punti, evidenziando l'effetto sostenuto di più cicli di allenamento al trasferimento nel migliorare il controllo delle forme linguistiche e la capacità di costruzione del testo da parte degli studenti. A questo stadio, gli studenti avevano sviluppato un ciclo cognitivo di base chiuso tra comprensione, esecuzione e riflessione sulle strategie di trasferimento. Oltre al feedback degli insegnanti, lo studio ha distribuito un questionario di soddisfazione sulla funzione di scrittura assistita dall'intelligenza artificiale a tutti gli studenti del gruppo sperimentale, raccogliendo complessivamente 30 questionari validi. Il questionario ha valutato le prestazioni dell'IA in tre moduli funzionali: suggerimenti di riscrittura, ottimizzazione strutturale e suggerimenti culturali, chiedendo agli studenti di selezionare le opzioni in base a cinque livelli di valutazione. I risultati sono mostrati nella Tabella 5.
Secondo i risultati del sondaggio sulla soddisfazione degli studenti riguardo alle funzioni di scrittura assistita dall'intelligenza artificiale mostrati nella Tabella 5, gli studenti del gruppo sperimentale hanno espresso in generale commenti positivi sulle prestazioni dell'IA nei tre moduli funzionali di suggerimenti di riscrittura, ottimizzazione strutturale e suggerimenti culturali, evidenziando le buone prospettive applicative dei sistemi di scrittura assistita dall'IA nel migliorare l'efficienza dell'addestramento alla scrittura e la qualità del supporto didattico. Nel complesso, oltre il 90% degli studenti ha espresso un livello di soddisfazione "molto soddisfatto" o "soddisfatto" nei due elementi funzionali "suggerimenti di riscrittura" e "ottimizzazione strutturale", con i "suggerimenti di riscrittura" che hanno ottenuto il punteggio più alto, raggiungendo il 91%, indicando un elevato grado di riconoscimento da parte degli studenti riguardo alla capacità dell'IA nella ricostruzione sintattica e nella revisione linguistica. In confronto, la soddisfazione per la funzione di "suggerimenti culturali" è risultata relativamente inferiore, ma ha comunque raggiunto l'83%, indicando che, sebbene l'IA presenti una certa complessità e soggettività nel guidare l'espressione interculturale, il suo ruolo nell'aiutare gli studenti a identificare e correggere le interferenze culturali della lingua madre è stato riconosciuto dalla maggior parte degli studenti. Per quanto riguarda l'insoddisfazione, la percentuale di studenti che hanno scelto "insoddisfatto" o "molto insoddisfatto" nei tre ambiti funzionali è risultata inferiore al 5%, indicando che le funzioni assistite dall'IA presentano una buona usabilità e accettazione nella maggior parte degli scenari applicativi. È degno di nota che la proporzione di studenti che hanno valutato "sufficiente" nell'elemento "suggerimenti culturali" è risultata relativamente alta, suggerendo che l'attuale IA potrebbe non soddisfare pienamente le aspettative degli studenti nel trattare questioni di adattamento culturale, lasciando spazio a ulteriori miglioramenti. Un'analisi complessiva rivela che il metodo di ottimizzazione delle istruzioni basato su DeepSeek è stato ampiamente riconosciuto dagli studenti, in particolare per il supporto fornito alla forma linguistica.
ANOVA a misure ripetute
È stata condotta un'analisi della varianza a due vie con misure ripetute (RM-ANOVA) per esaminare gli effetti del gruppo (fattore tra i soggetti: gruppo sperimentale rispetto al gruppo di controllo) e del tempo (fattore all'interno dei soggetti: pre-test, Attività 1, Attività 2, Attività 3, post-test), nonché della loro interazione sulle prestazioni degli studenti nel trasferimento della scrittura in inglese. Il test di Mauchly ha indicato una violazione dell'assunzione di sfericità (p < 0,05); pertanto, è stata applicata la correzione di Greenhouse–Geisser per aggiustare i gradi di libertà degli effetti all'interno dei soggetti. Tutte le analisi si basano su n = 30 partecipanti per gruppo. I risultati sono riportati nella Tabella 6:
I risultati dell'ANOVA a misure ripetute con correzione di Greenhouse–Geisser hanno indicato effetti principali significativi del Fattore Gruppo, del Fattore Tempo e dell'interazione Gruppo × Tempo in tutte le dimensioni misurate (p < 0,001). Per l'Indice Generale di Trasferimento, è stato osservato un effetto significativo del Gruppo (F(1,58) = 76,32), insieme a un effetto significativo del Tempo (F(2,14,124,12) = 92,75) e un'interazione Gruppo × Tempo significativa (F(2,14,124,12) = 68,49), suggerendo che le variazioni nelle prestazioni complessive di trasferimento nel tempo differivano in modo significativo tra i gruppi.
Analogamente, il trasferimento sintattico ha mostrato effetti significativi del Fattore Gruppo (F(1,58) = 52,18), del Fattore Tempo (F(2,11,122,38) = 71,26) e dell'interazione Gruppo × Tempo (F(2,11,122,38) = 45,73), indicando pattern differenziali di sviluppo nelle capacità di trasferimento sintattico tra i gruppi e nei diversi punti di misurazione. Per quanto riguarda il Trasferimento Strutturale, sono stati riscontrati effetti significativi del Gruppo (F(1,58)=48,65), del Tempo (F(2,09,121,22) = 67,81) e dell'interazione (F(2,09,121,22) = 41,36), che riflettono miglioramenti costanti con traiettorie dipendenti dal gruppo. In particolare, il Trasferimento Culturale ha mostrato gli effetti più forti, con un effetto significativo del Gruppo (F(1,58) = 81,44), un marcato effetto del Tempo (F(2,07,119,96) = 98,52) e una robusta interazione Gruppo × Tempo (F(2,07,119,96) = 79,27), suggerendo il pattern di crescita più consistente e differenziato in questa dimensione. Nel complesso, tutti gli indici mostrano effetti statisticamente significativi, confermando che l'intervento ha esercitato un impatto stabile e differenziato sullo sviluppo del trasferimento nel tempo.
DISPONIBILITÀ DEI DATI:
Tutti i dati generati o analizzati durante questo studio sono inclusi nel presente articolo. I dati grezzi della valutazione sono forniti nella Tabella Supplementare 1.

Figura 1: Passaggi per la trasformazione della struttura della frase. (A) Strategie per combinare e rafforzare i verbi al fine di migliorare la struttura della frase. (B) Trasformazioni alternative del soggetto, incluse forme gerundiali, infinitive e soggetti nominalizzati. (C) Uso di frasi non finite per aumentare la varietà e la concisione della frase. (D) Esempi di versioni finali riviste che dimostrano uno stile accademico migliorato e un'espressione in inglese più adatta al contesto interculturale. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 2: Diagramma ad albero dell'evoluzione del compito. Illustra la struttura progressiva di compiti di trasferimento articolati su quattro livelli, che vanno dalla frase, al paragrafo, al discorso, fino al livello culturale. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 3: Confronto dell'abilità di trasferimento scritto prima e dopo l'esperimento. Il grafico radar mostra i punteggi del pre-test e del post-test del gruppo sperimentale e del gruppo di controllo nelle dimensioni del trasferimento sintattico, strutturale e culturale. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 4: Grafico dell'andamento della complessità sintattica. Sono mostrati i cambiamenti nella lunghezza media delle frasi e nei livelli di annidamento delle proposizioni attraverso tre compiti di addestramento. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 5: Corrispondenza della terminologia accademica. Questa figura mostra le variazioni nella proporzione di vocabolario formale e nella frequenza della voce passiva prima e dopo l'intervento. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 6: Mappa termica della soddisfazione per le risposte ai prompt. Qui vengono riassunti i punteggi attribuiti da insegnanti partecipanti a cinque tipi di modelli di prompt. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 7: Grafico a scatola delle variazioni nei giudizi degli insegnanti. Il grafico a scatola mostra la distribuzione e le variazioni complessive dei punteggi attribuiti dagli insegnanti alla scrittura di due gruppi prima e dopo l'esperimento. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 8: Grafico radar dell'autovalutazione della capacità di trasferimento degli studenti. Mostra i punteggi di autovalutazione degli studenti su cinque dimensioni del trasferimento in tre round di formazione. Cliccare qui per visualizzare una versione ingrandita di questa figura.
| Inserimento | Operazione dell'insegnante | Tipo di prompt | Operazione per studenti | Risultato | Criteri di valutazione |
| Bozze originali di scrittura degli studenti (frasi/paragrafi/temi) | 1. Etichettare i tipi di trasferimento e i livelli di compito
2. Regolare i parametri del prompt se necessario | Singolo prompt di trasferimento / Catena di prompt annidati a tre stadi | 1. Imparare strategie di trasferimento
2. Rivedere le bozze sulla base dei feedback dell'intelligenza artificiale
3. Completare l'autovalutazione | Testo rivisto con intelligenza artificiale + Bozza finale rivista dallo studente | Complessità sintattica, razionalità strutturale, appropriatezza culturale, coerenza logica, standardizzazione del registro (scala 0–5) |
Tabella 1: Tabella Riassuntiva del Flusso di Lavoro. Questa tabella riassume l'intero flusso operativo del training di trasferimento della scrittura in inglese assistito da intelligenza artificiale, coprendo i materiali di input, le operazioni del docente e dello studente, i tipi di prompt, gli output finali e i corrispondenti criteri di valutazione.
| Categoria del progetto | Contenuti |
| Comprensione degli obiettivi della missione | Descrivere brevemente gli obiettivi di migrazione di questo ciclo di attività di scrittura, ad esempio aggiustamento strutturale, adattamento culturale e conversione linguistica. |
| Strategia di migrazione utilizzata | Indicare le strategie di migrazione adottate (sono consentite scelte multiple): |
| Aggiustamento strutturale |
| Trasformazione della frase |
| Cambio linguistico |
| Manifestazione culturale |
| Rafforzamento della connessione logica |
| Altro:_______ |
| Riscrittura di esempi e istruzioni | Selezionare 1–2 frasi riscritte, mostrare le versioni prima e dopo la riscrittura e spiegare le ragioni dei cambiamenti e gli obiettivi di trasferimento desiderati. |
| Difficoltà e dubbi riscontrati | Descrivere le difficoltà incontrate durante la migrazione o i dubbi riguardo a un'espressione specifica. |
Valutazione autonoma
(su 5 punti) | Valutare la riscrittura del testo in base ai seguenti tre aspetti: |
| • Accuratezza nell'applicazione delle strategie (/5) |
| • Fluidità naturale dell'espressione (/5) |
| • Adeguatezza culturale (/5) |
| Obiettivi futuri di miglioramento della scrittura | Descrivere brevemente l'aspetto del trasferimento che si desidera rafforzare o ottimizzare nel prossimo ciclo di formazione |
Tabella 2: Tabella della cognizione del trasferimento. Viene adottata una scala di valutazione da 1 a 5 (1 = nessun apprendimento, 5 = apprendimento completo) per l'autovalutazione degli studenti riguardo alle strategie di trasferimento della scrittura.
| Nome dell'indicatore | Descrizione | Fonte dei dati |
| Indice di trasferimento della scrittura (0–5) | Un indicatore quantitativo che misura in modo completo la capacità di trasferimento linguistico, coprendo tre livelli: sintassi, struttura e cultura. | Valutazione automatica del sistema + valutazione manuale da parte degli insegnanti |
| Punteggio di complessità sintattica | Comprende la lunghezza media delle frasi, il numero di inclusioni di proposizioni, la ricchezza delle locuzioni verbali, ecc. | Analisi automatica tramite elaborazione del linguaggio naturale (NLP) |
| Corrispondenza allo stile accademico | Rispetta gli standard della scrittura accademica in inglese? | Valutazione effettuata da un modello di elaborazione del linguaggio naturale |
| Soddisfazione riguardo alle risposte ai prompt | Accettazione e valutazione pratica da parte degli insegnanti dei suggerimenti generati dal modello | Questionario per insegnanti |
| Variazioni nei voti attribuiti dagli insegnanti | Confronto tra i voti assegnati dagli insegnanti prima e dopo l'esperimento, per riflettere il miglioramento della qualità della scrittura | Record delle valutazioni degli insegnanti |
| Capacità di trasferimento autovalutata dagli studenti | Gli studenti autovalutano il proprio livello di padronanza rispetto alle diverse dimensioni del trasferimento | Compilazione del modulo sulla consapevolezza del trasferimento |
Tabella 3: Sintesi degli indicatori di valutazione, delle descrizioni e delle fonti dei dati. Questa tabella chiarisce le definizioni, i metodi di misurazione e le fonti originali dei dati per ciascun indicatore principale di valutazione dello studio.
| Tipo di prompt | Valutazione media degli insegnanti | Punteggio medio dell'IA | Coefficiente di correlazione di Pearson |
| Trasferimento strutturale | 4 | 3.9 | 0.83 |
| Trasferimento sintattico | 4.1 | 4 | 0.87 |
| Trasferimento culturale | 3.8 | 3.6 | 0.79 |
| Trasferimento di registro | 3.9 | 3.7 | 0.81 |
| Trasferimento logico | 4.2 | 4.1 | 0.85 |
Tabella 4: Confronto della coerenza tra i contenuti generati dall'IA e le valutazioni degli insegnanti. I risultati dimostrano la coerenza tra i contenuti generati dall'IA e le valutazioni degli insegnanti in diversi tipi di prompt.
| Elementi funzionali | Molto soddisfatto | Soddisfatto | Abbastanza | Insoddisfatto | Molto insoddisfatto |
| Suggerimento di riscrittura | 66% | 25% | 7% | 1,50% | 0,50% |
| Ottimizzazione strutturale | 60% | 30% | 7% | 2% | 1% |
| Suggerimenti culturali | 55% | 28% | 12% | 3,50% | 1,50% |
Tabella 5: Statistiche del sondaggio sulla soddisfazione degli studenti riguardo alle funzioni assistite dall'intelligenza artificiale. Le statistiche mostrano la distribuzione della soddisfazione degli studenti per le funzioni di riscrittura mediante intelligenza artificiale, ottimizzazione strutturale e prompt culturali.
| Misura | Gruppo F(df) | Tempo F(df)GG | Gruppo × Tempo F(df)GG | p |
| Indice Generale di Trasferimento | 76.32 (1, 58) | 92.75 (2.14, 124.12) | 68.49 (2.14, 124.12) | <0.001 |
| Trasferimento Sintattico | 52.18 (1, 58) | 71.26 (2.11, 122.38) | 45.73 (2.11, 122.38) | <0.001 |
| Trasferimento Strutturale | 48.65 (1, 58) | 67.81 (2.09, 121.22) | 41.36 (2.09, 121.22) | <0.001 |
| Trasferimento Culturale | 81.44 (1, 58) | 98.52 (2.07, 119.96) | 79.27 (2.07, 119.96) | <0.001 |
Tabella 6: Sintesi dei risultati dell'ANOVA a misure ripetute. Presenta i risultati dell'ANOVA a misure ripetute a due fattori per la prestazione complessiva nel trasferimento della scrittura e per le sue tre sottodimensioni, inclusi gli effetti principali del gruppo, del tempo e dell'interazione gruppo per tempo. Abbreviazioni: GG = correzione di Greenhouse–Geisser.
Tabella supplementare 1: Valutazione dei dati grezzi. Include i dati grezzi utilizzati in tutte le analisi del presente studio.Cliccare qui per scaricare il file.