Tutti i metodi che coinvolgevano partecipanti umani erano condotti in conformità con le linee guida istituzionali e la dichiarazione di Helsinki. Il protocollo di studio è stato esaminato e approvato dal comitato di revisione istituzionale del collegio di costruzione della città di Guangzhou (approvazione IRB n. GZCJ2026A016; data di approvazione: 2 gennaio 2026). Il titolo dello studio approvato era "istruzione incentrata sullo studente assistita dall'IA e autoconcetto accademico e competenza comunicativa degli adolescenti: uno studio a metodi misti." Il permesso scritto è stato ottenuto dalla scuola partecipante prima che lo studio fosse attuato. Il consenso scritto informato è stato ottenuto dai genitori o tutori legali, e il consenso scritto di tutti gli studenti partecipanti. Agli studenti è stato informato che la partecipazione era volontaria e che potevano ritirarsi dallo studio in qualsiasi momento senza penalità accademica. Non sono stati inseriti nomi, dati di contatto, identificatori scolastici, voti o altre informazioni direttamente identificabili nella piattaforma di chatbot IA né inclusi nel dataset pubblico. Tutte le procedure di studio sono state condotte durante il periodo di studio approvato dal 2 gennaio 2026 al 2 gennaio 2027. Tutti gli strumenti e le piattaforme utilizzati in questo studio sono elencati nella Tabella dei Materiali
Progettazione dello studio e assegnazione in classe
Questo studio ha utilizzato un design di classe quasi sperimentale e misto con due condizioni didattiche: un gruppo di istruzione assistito dall'IA e centrato sullo studente e un gruppo di istruzione usualmente centrato sullo studente. Le misurazioni longitudinali sono state effettuate in tre momenti: la base prima dell'intervento (T1), immediatamente dopo l'ultima sessione didattica (T2) e in una valutazione di follow-up a breve termine (T3) predefinita. L'intervallo T2–T3 è stato registrato nel registro dello studio e mantenuto coerente su tutto il manoscritto, il dataset, gli script di analisi e le etichette delle figure. La Figura 1 riassume il reclutamento, l'assegnazione delle classi, i tempi delle valutazioni, le esclusioni e il campionamento qualitativo. Poiché vincoli amministrativi ed ecologici impedivano la randomizzazione individuale, sono state assegnate sei classi intatte a livello di aula, con tre classi nella condizione assistita dall'IA e tre classi nella condizione di confronto. Ogni classe ha contribuito con 29 studenti al campione analitico finale. Livello scolastico, area di materia, sequenza delle lezioni, durata delle sessioni, compiti in classe, programma di valutazione e tempo di contatto con gli insegnanti sono stati mantenuti comparabili tra le condizioni. Gli identificatori di classe sono stati mantenuti per i controlli statistici sensibili al cluster.
Selezione dei partecipanti e screening di idoneità
I partecipanti sono stati reclutati direttamente dalle classi integre partecipanti. Gli studenti e i loro genitori o tutori legali hanno ricevuto una scheda informativa dettagliata che illustrava lo scopo dello studio, le procedure in classe, le attività supportate dall'IA, i calendari dei questionari, la componente opzionale per il colloquio, le tutele sulla privacy, i diritti di prelievo e i piani di archiviazione dei dati. Gli studenti venivano inclusi nello studio se erano iscritti a una delle classi partecipanti, avevano frequentato l'istruzione regolare in aula, fornito il consenso scritto, ottenuto il consenso scritto dei genitori o tutori e completato il questionario di riferimento prima della prima sessione. Al contrario, gli studenti sono stati esclusi dal campione analitico finale se si sono trasferiti dalla scuola, hanno saltato più del 25% delle sessioni di intervento, hanno inviato record del questionario non validi o hanno ritirato il permesso di utilizzo dei dati. Una delle ragioni principali dell'esclusione è stata documentata per ogni partecipante escluso. Prima dell'inserimento dei dati, a ogni partecipante idoneo veniva assegnato un codice unico di identificazione dello studio. Sono state registrate covariate demografiche ed educative rilevanti, tra cui età, genere, identificatore di classe, fascia di rendimento accademica di base, esposizione precedente all'apprendimento assistito dall'IA e familiarità di apprendimento digitale di base. Per il tracciamento statistico, la variabile del gruppo istruzionale era codificata come 0 per la condizione di confronto e 1 per la condizione assistita dall'IA.
Materiali didattici e erogazione di interventi
Prima dell'implementazione è stata sviluppata un'unità didattica di sei sessioni (Tabella Supplementare 1), con ogni sessione in aula della durata di 40–45 minuti. Obiettivi di apprendimento identici, argomenti di lezione, schede di lavoro, compiti di discussione tra pari, moduli di autovalutazione e prompt di riflessione sono stati applicati in entrambe le condizioni didattiche. La struttura del questionario, le indicazioni di punteggio, gli item a punteggio inverso e le variabili finali a livello di scala hanno seguito la mappa di punteggio bloccata nella Tabella 1. I materiali sulla riproducibilità includevano piani di lezione (Tabella Supplementare 1), fogli di prompt per l'IA (Tabella Supplementare 2), schede di prompt per insegnanti (Tabella Supplementare 3), schede di lavoro per studenti (Supplementary Table 4), moduli di autovalutazione (Supplementary Table 5), checklist di osservazione (Supplementary Table 6), log tecnici degli incidenti (Supplementary Table 7), guide per i colloqui (Supplementary Table 8) e un codebook qualitativo (Tabella supplementare 9). L'insegnante partecipante ha completato la formazione utilizzando una guida scritta che copriva la sequenza delle sessioni, i limiti dell'uso dell'IA, le procedure dei gruppi di confronto, i requisiti di privacy e le checklist di fedeltà. È stata condotta una prova con studenti non praticanti per verificare il tempismo delle attività, l'accesso al dispositivo, la chiarezza dei fogli di lavoro e la difficoltà del compito. Lo strumento di IA era un chatbot basato su ChatGPT approvato istituzionalmente che utilizzava l'architettura GPT-4. Per l'uso in classe, la cronologia delle chat, la memoria del profilo, la navigazione web, i plug-in, la generazione di immagini e la correzione automatica sono stati disabilitati. Il manoscritto utilizza il termine generico "piattaforma chatbot IA" dopo la sua prima menzione per evitare linguaggio promozionale. I principi di prompt-design sono stati fissati prima dell'intervento e l'uso dell'IA è stato limitato per chiarimenti, generazione di esempi, confronto di spiegazioni, supporto mirato alle revisioni e segnali di autovalutazione. Prompt rappresentativi, esempi di output AI e esempi di moderazione per insegnanti sono stati mantenuti come parte dei materiali di riproducibilità.
Ogni sessione assistita dall'IA è stata condotta in cinque fasi strutturate. Per prima cosa, è stato condotto un briefing di 5 minuti per l'insegnante per dichiarare gli obiettivi di apprendimento, spiegare i compiti, identificare la piattaforma chatbot AI configurata e ricordare agli studenti che i risultati dell'IA erano prompt provvisorii piuttosto che risposte autorevole. Agli studenti è stato severamente istruito di non inserire alcuna informazione personale identificabile sulla piattaforma. In secondo luogo, è seguita un'attività individuale di indagine supportata dall'IA di 10 minuti, durante la quale gli studenti hanno utilizzato il foglio di prompt preparato per richiedere chiarimenti, esempi, spiegazioni alternative o suggerimenti di revisione. Ogni studente ha registrato la categoria di prompt utilizzata, un'idea utile supportata dall'IA, un punto da verificare e la decisione finale sull'adozione. In terzo luogo, è stata condotta un'attività di discussione tra pari e di 12–15 minuti, durante la quale gli studenti hanno confrontato le loro idee supportate dall'IA in piccoli gruppi, identificato le inesattezze e revisionato collaborativamente il loro lavoro. Durante questa fase, l'insegnante ha scelto la classe per applicare una regola di moderazione standardizzata, spingendo gli studenti a giustificare verbalmente le loro revisioni rispetto ai criteri della lezione e correggere risultati errati o troppo sicuri dell'IA prima della finalizzazione. In quarto luogo, è stata condotta una sessione di chiarimenti di 5–8 minuti per tutta la classe per affrontare i diffusi malintesi e correggere errori fattuali. Infine, un'attività di autovalutazione di 5 minuti ha concluso la sessione, durante la quale gli studenti hanno valutato la loro comprensione, registrato un miglioramento concreto e annotato una domanda irrisolta. Questa sequenza operativa esatta è stata mantenuta in tutte le classi di intervento. I fogli di prompt stampati servivano come backup tecnici, e le deviazioni tecniche che riguardavano oltre un terzo di una classe venivano esplicitamente registrate. Esempi rappresentativi anonimizzati di prompt-output-moderazione sono stati mantenuti e documentati nelle Tabelle Supplementari 2, 3.
La condizione di confronto è stata consegnata utilizzando la stessa durata della sessione, obiettivi di apprendimento, sequenza degli argomenti, schede di esercizi, intervalli di discussione tra pari, moduli di autovalutazione e finestre di feedback per gli insegnanti. Tuttavia, i prompt supportati dall'IA sono stati sostituiti da prompt guida standardizzati e preparati dagli insegnanti che istruivano gli studenti a spiegare i concetti fondamentali, confrontare esempi, identificare le debolezze e rivedere il loro lavoro. La stessa struttura in cinque fasi, che comprendeva il briefing, l'indagine individuale, la discussione tra pari, la chiarificazione dell'intera classe e l'autovalutazione finale, è stata mantenuta rigorosamente. Non sono stati forniti tutoraggi aggiuntivi, compiti fuori classe, periodi di feedback prolungati o altri compiti di valutazione per nessuno dei due spettacoli. La frequenza in classe, le interruzioni comportamentali, le sostituzioni degli insegnanti e i componenti incompleti sono stati documentati utilizzando lo stesso formato di registrazione per entrambi i gruppi.
Raccolta dati, monitoraggio della fedeltà e analisi quantitativa
I questionari di valutazione sono stati somministrati a intervalli basali, post-intervento e follow-up, utilizzando formulazioni coerenti degli item, scale di risposta e regole di punteggio in tutte e tre le ondate di misura. Gli strumenti comprendevano scale validate che valutavano il concetto accademico di sé, la competenza comunicativa, la qualità dell'interazione, l'autovalutazione e il coinvolgimento dello studente. Le risposte sono state raccolte utilizzando una scala standard di tipo Likert a 5 punti che va da 1 (forte disaccordo) a 5 (forte accordo), con punteggi più alti che indicano livelli più alti del costrutto target. I punteggi individuali della scala sono stati calcolati come media aritmetica degli elementi validi dopo la necessaria codifica inversa. I valori mancanti degli item venivano sostituiti con il punteggio medio dello studente all'interno della stessa scala e onda, a condizione che non mancasse più del 20% degli elementi. Le scale con più del 20% di elementi mancanti sono state considerate mancanti, e i dati di un'onda di valutazione completamente mancante non sono stati inseriti. Prima dell'analisi statistica, il dataset grezzo veniva accuratamente verificato per violazioni di range, voci duplicate, pattern di risposta lineari e tempi di completamento anomali. I record venivano segnalati come invalidi ed esclusi se presentavano valori numerici impossibili, risposte invarianti su tutti gli elementi o tempi di completamento inferiori a 1/3 della durata mediana, a meno che i log espliciti della classe non ne convalidassero l'autenticità. Le principali analisi post-intervento e di follow-up includevano studenti che fornivano punteggi di base validi e i relativi dati sugli esiti post-intervento o follow-up, evitando così la cancellazione unilaterale lista per schede parzialmente complete. Un dizionario dati bloccato è stato istituito prima dell'inserimento dati per definire nomi di variabili, etichette, intervalli di risposta, codici di valore mancanti, regole di valutazione inversa, identificatori di onda e costrutti finali a livello di scala. I dati del questionario sono stati inseriti in formato ampio, con una singola riga per studente e suffissi d'onda (_T1, _T2, _T3) utilizzati per distinguere le onde di misura. Intervalli numerici e registri unici dei partecipanti sono stati verificati computazionalmente, e i modelli di mancanza sono stati ispezionati tra gruppi, classi e ondate rispetto al registro principale delle presenze.
Durante ogni sessione didattica veniva utilizzata una lista di controllo standardizzata per l'osservazione della classe per monitorare la fedeltà dell'implementazione. Ogni componente pedagogica è stata valutata come 0 (non completata), 1 (parzialmente completata) o 2 (completata completata). I componenti valutati sono strettamente allineati alla sequenza didattica in cinque fasi, inclusi il briefing dell'insegnante, l'indagine individuale, la discussione tra pari, la chiarizione dell'intera classe e il completamento dei record di autovalutazione. La percentuale complessiva di fedeltà della sessione è stata calcolata dividendo il punteggio osservato per il punteggio massimo possibile. Qualsiasi sessione che scendeva sotto la soglia di fedeltà del 70% veniva registrata come deviazione del protocollo. Per garantire l'affidabilità tra i valutatori, un secondo osservatore addestrato valutava indipendentemente almeno il 20% del totale delle sessioni. La percentuale di concordanza è stata calcolata su tutti gli elementi e eventuali discrepanze di valutazione sono state risolte tramite discussione consensuale ogni volta che l'accordo iniziale scendeva sotto l'80%. I malfunzionamenti tecnici hardware o software venivano registrati in log separati per distinguerli dai problemi di fedeltà istruzionale.
Le analisi statistiche sono state effettuate utilizzando un flusso di lavoro riproducibile basato su script, in cui il seme casuale veniva fissato prima di qualsiasi campionamento o controllo di sensibilità. Tutti i test statistici erano a doppia coda, con significatività impostata a p < 0,05. Le variabili continue sono state riassunte come medie e deviazioni standard, mentre le variabili categoriche sono state espresse come frequenze e percentuali. L'equivalenza basale tra le coorti è stata valutata descrittivamente utilizzando test t a campioni indipendenti per dati continui e test chi-quadrato per distribuzioni categoriche. La consistenza interna è stata misurata utilizzando l'alfa di Cronbach, applicando soglie di α ≥ 0,70 per scale generali e α ≥ 0,80 per le misure di esito primarie, insieme a correlazioni correlate tra il totale degli item e le mie. L'ANCOVA aggiustata alla base ha rappresentato l'approccio analitico principale. Sono stati adattati modelli separati per ciascun esito primario, con il punteggio post-intervento o di follow-up specificato come variabile dipendente, il gruppo istruttivo come principale predittore e il corrispondente punteggio di base come covariata obbligatoria. Sono state incluse covarie aggiuntive (genere, fascia di rendimento accademico di base ed esposizione precedente all'IA) per controllare gli squilibri di base o la loro rilevanza teorica, e sono state riportate differenze medie corrette, intervalli di confidenza al 95%, errori standard e valori di R2 del modello. Confronti dei punteggi di cambiamento (T2–T1 e T3–T1) sono stati effettuati come analisi secondarie utilizzando i test t di Welch a campioni indipendenti, con dimensioni degli effetti quantificate tramite d di Cohen. Analisi esplorative dei processi hanno valutato le correlazioni di Pearson tra variabili di processo e cambiamenti di esito, integrate da regressioni lineari multi-predittive con monitoraggio del fattore di inflazione della varianza (VIF) per verificare la multicollinearità. Infine, sono stati implementati controlli sensibili al cluster per tenere conto della struttura annidata degli studenti all'interno delle sei classi intatte. Sono stati stimati coefficienti di correlazione intraclasse (ICC) incondizionati, le modifiche di esame aggregate e confrontate a livello di classe, e i calcoli primari di ANCOVA sono stati ripetuti utilizzando errori standard robusti al cluster come controllo esplorativo della sensibilità.
Campionamento qualitativo, codifica e integrazione con metodi misti
Immediatamente dopo il questionario post-intervento, è stato selezionato un sottocampione proposito di 36 studenti per interviste semi-strutturate. Questa coorte qualitativa includeva partecipanti di entrambe le condizioni didattiche che hanno mostrato punteggi di cambiamento alti, medi o bassi nell'autoconcetto accademico o nella competenza comunicativa. La guida semi-strutturata per i colloqui ha indagato esperienze di interazione in classe, fiducia nell'spiegare le idee, comportamenti di autovalutazione, coinvolgimento nei compiti e disponibilità a comunicare, utilizzando prompt mirati per esplorare momenti di revisione, risposte a feedback poco chiari e variazioni nell'impegno. Le interviste venivano registrate solo dopo aver ottenuto il consenso dei genitori e l'assenso degli studenti; altrimenti, venivano presi appunti scritti strutturati. Tutti i nomi personali, numeri di classe e dettagli identificativi venivano rimossi durante la trascrizione, e i certificati venivano collegati ai corrispondenti identificatori quantitativi. Il quadro iniziale di codifica qualitativa è stato derivato deduttivamente dalla qualità dell'interazione, dall'autovalutazione e dai costrutti di coinvolgimento dello studente, con codici tematici induttivi aggiunti solo quando i dati non rientravano nel quadro di base. Due codificatori indipendenti hanno analizzato almeno il 20% delle trascrizioni per verificare l'affidabilità. Sono stati valutati i coefficienti kappa di Cohen, con valori compresi tra 0,61 e 0,80 considerati come concordanza sostanziale e valori superiori a 0,80 come concordanza forte. Le definizioni dei codici venivano perfezionate e la doppia codifica veniva ripetuta ogni volta che il kappa iniziale scendeva sotto 0,61, e le definizioni finali insieme alla risultante matrice qualitativa di frequenza del codice venivano archiviate (Tabelle Supplementari 9 e 10).
L'analisi quantitativa dei dati e i quadri di codifica qualitativa sono stati finalizzati indipendentemente prima di avviare l'integrazione con metodi misti. Un display congiunto coeso è stato strutturalmente costruito per collegare le tre variabili quantitative di processo con i rispettivi temi qualitativi. I risultati integrati sono stati sistematicamente classificati come convergenza (dove i modelli del questionario e i temi delle interviste si allineavano), espansione (dove narrazioni qualitative spiegavano i meccanismi alla base delle tendenze quantitative) o divergenza (quando le interviste hanno rivelato barriere uniche o una partecipazione disomogenea che hanno complicato i modelli quantitativi). I risultati qualitativi sono stati utilizzati per contestualizzare i processi in classe, collegando i punteggi di coinvolgimento degli studenti ai temi di domande attive e discussione tra pari, e collegando i punteggi di autovalutazione con i resoconti della consapevolezza delle lacune e degli aggiustamenti strategici.