Articolo metodologico

Un flusso di lavoro riproducibile per valutazione di sondaggi e albero decisionale C5.0 per classificare il pensiero di ordine superiore auto-riportato nell'apprendimento supportato dall'IA generativa

DOI:

10.3791/71447

5 giugno 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo presenta un flusso di lavoro riproducibile per raccogliere dati di indagini auto-report, punteggiare variabili correlate allo studente, dicotomiare punteggi di pensiero di ordine superiore e applicare un albero decisionale C5.0 per dimostrare la classificazione interpretabile degli studenti nell'apprendimento accademico supportato dall'intelligenza artificiale generativa.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'intelligenza artificiale generativa è sempre più utilizzata nell'istruzione superiore, ma i ricercatori necessitano ancora di procedure trasparenti per raccogliere, valutare e organizzare i dati di sondaggi a livello di studente in questo contesto in rapido cambiamento. Questo articolo presenta un flusso di lavoro riproducibile con sondaggi e albero decisionale C5.0 per classificare il pensiero di ordine superiore auto-riportato tra studenti universitari che hanno utilizzato strumenti di intelligenza artificiale generativa per l'apprendimento accademico. Il protocollo copre il reclutamento dei partecipanti, l'amministrazione dei questionari, lo screening della qualità delle risposte, il calcolo del punteggio composito, la codifica binaria, la partizione dei test di addestramento, la costruzione dell'albero C5.0, la potatura, l'esportazione dei risultati del modello e l'interpretazione di percorsi di classificazione basati su nodi. Il flusso di lavoro è dimostrato utilizzando un dataset di indagine su un'unica università su 776 studenti universitari raccolto in Cina dal 7 al 15 marzo 2023. Il pensiero di ordine superiore viene operazionalizzato come un punteggio auto-riportato in un questionario piuttosto che come performance cognitiva osservata direttamente. Nel dataset dimostrativo, l'albero potato ha mantenuto otto variabili legate agli apprendisti: ansia da intelligenza artificiale generativa, fiducia nell'intelligenza artificiale generativa, uso problematico dello smartphone, procrastinazione accademica, rendimento accademico, educazione genitoriale, emozioni negative e atteggiamenti verso l'intelligenza artificiale generativa. Il modello ritenuto ha raggiunto l'89,52% di accuratezza nel sottoinsieme di addestramento e dell'86,21% nel sottoinsieme di test. Tuttavia, la valutazione specifica per classe ha mostrato prestazioni disomogenee, con un richiamo sostanzialmente più debole per la classe Low-HOT rispetto a quella High-HOT. Pertanto, l'albero dovrebbe essere interpretato come una dimostrazione ausiliaria e interpretabile del flusso di lavoro, piuttosto che come uno strumento di screening convalidato. Questo protocollo può supportare i ricercatori che necessitano di una procedura documentata e ripetibile per il profiling degli studenti basati su sondaggi in ambienti di apprendimento supportati dall'intelligenza artificiale generativa.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il pensiero di ordine superiore è una preoccupazione centrale nell'istruzione superiore perché ci si aspetta che l'apprendimento universitario vada oltre il richiamo della conoscenza fattuale verso analisi, valutazione, riflessione, problem solving e creazionedi conoscenza. Revisioni successive della tassonomia di Bloom hanno ulteriormente chiarito che l'apprendimento avanzato non riguarda solo la memoria e la comprensione, ma anche l'applicazione, l'analisi, la valutazione e la creazione di conoscenza in contesti sempre più complessi2. Questa distinzione è importante per il protocollo attuale perché il pensiero di ordine superiore non viene trattato come un semplice punteggio di rendimento, ma come un costrutto a livello di apprendente che richiede un'attenta operativizzazione prima di poter essere analizzato. Nella ricerca educativa, il pensiero di ordine superiore è stato anche collegato al ragionamento critico, al monitoraggio metacognitivo e al trasferimento dell'apprendimento tra contestiproblematici. Per l'apprendimento supportato dalla tecnologia, questa questione diventa particolarmente importante perché gli studenti spesso devono collegare concetti, valutare le informazioni generate e prendere decisioni durante le attività di problem solving, piuttosto che semplicemente ricevere contenutididattici 4.

La rapida diffusione dell'intelligenza artificiale generativa ha reso più complicata la misurazione del pensiero di ordine superiore. Gli strumenti di intelligenza artificiale generativa possono produrre testo, codice, immagini, spiegazioni, riassunti e altre forme di supporto accademico a partire da modelli appresi da dataset su largascala 5. I grandi modelli linguistici, incluso ChatGPT, sono diventati particolarmente visibili nell'istruzione superiore durante il primo periodo di adozione pubblica tra la fine del 2022 e l'inizio del 2023. In contesti accademici, gli studenti possono utilizzare questi strumenti per la ricerca di informazioni, la spiegazione dei concetti, lo sviluppo di scalette, la generazione di idee, la revisione dei compiti, il supporto alla traduzione e altre attività correlate al corso. Questi usi possono ridurre il carico di lavoro di routine, ma possono anche modificare il modo in cui gli studenti assegnano l'attenzione, giudicano la qualità delle informazioni e regolano il proprio sforzo cognitivo. Per questo motivo, la ricerca sull'apprendimento supportato dall'intelligenza artificiale generativa richiede procedure che documentino chiaramente come le variabili a livello di apprendente vengono raccolte, valutate, codificate e interpretate.

Lavori precedenti sull'apprendimento digitale e misto hanno dimostrato che la tecnologia può supportare il pensiero di ordine superiore quando gli studenti rimangono attivamente coinvolti nei compiti di apprendimento invece di usare l'ambientepassivamente 7. Studi di apprendimento avanzato da dispositivi mobili e tecnologici hanno suggerito in modo simile che l'interazione tra pari, la percezione dell'apprendimento e l'impegno attivo siano rilevanti per le tendenze di pensiero di ordine superiore deglistudenti 8. Gli approcci di data mining sono stati utilizzati anche per esplorare come i comportamenti di apprendimento online siano associati alle capacità di pensiero di ordine superiore, mostrando il valore di organizzare i dati educativi in schemi interpretabili per loapprendente 9. Una parte sostanziale della ricerca sull'uso della tecnologia è stata informata dal Technology Acceptance Model, che spiega il comportamento d'uso attraverso la percezione di utilità e la percezione della facilitàd'uso 10. Tuttavia, l'apprendimento supportato dall'intelligenza artificiale generativa si differenzia dai precedenti contesti digitali perché gli studenti interagiscono con sistemi che generano risposte aperte, modellano la fiducia in sé stessi e possono stimolare o ridurre l'impegno critico. Pertanto, un protocollo per questo argomento non dovrebbe solo registrare se gli studenti accettano la tecnologia, ma anche documentare come gli indicatori emotivi, comportamentali, accademici e contestuali vengono preparati per l'analisi.

Diverse variabili correlate allo studente sono particolarmente rilevanti in questo contesto. La fiducia nell'intelligenza artificiale può influenzare se gli studenti si affidano ai risultati generati, li mettono in discussione o se lo integrano nel lavoro accademico con cautela11. L'ansia verso la tecnologia o l'intelligenza artificiale può avere un rapporto, anche se non dovrebbe essere interpretata in una sola direzione senza cautelaempirica 12. L'uso problematico dello smartphone è un altro indicatore comportamentale rilevante perché l'attenzione frammentata e la distrazione legata al dispositivo possono interferire con un coinvolgimento cognitivo sostenuto durante lo studio13. Ricerche sull'apprendimento più generali suggeriscono inoltre che le strategie di apprendimento autoregolate sono associate al successo accademico in ambienti online e supportati dalla tecnologia14. Le ricerche sull'apprendimento basato sull'indagine e sull'apprendimento cooperativo indicano inoltre che un apprendimento significativo dipende da come gli studenti partecipano ai compiti di apprendimento, organizzano le evidenze e costruisconospiegazioni 15. Queste considerazioni supportano l'uso di un flusso di lavoro di sondaggio multivariabile piuttosto che una misura ristretta dell'esposizione all'intelligenza artificiale generativa da sola.

La Cognitive Load Theory fornisce una motivazione aggiuntiva per documentare indicatori emotivi e comportamentali nello stesso flusso di lavoro. Poiché la memoria di lavoro è limitata, un'informazione eccessiva o mal organizzata può interferire con l'apprendimento e la risoluzione deiproblemi 16. Nell'apprendimento supportato dall'intelligenza artificiale generativa, questo problema diventa evidente quando gli studenti si imbattono in un'abbondanza di output generato, spiegazioni incoerenti, suggerimenti irrilevanti o fonti di informazione concorrenti. È stato inoltre dimostrato che l'attività emotiva è collegata al carico cognitivo durante l'apprendimento multimediale, suggerendo che gli stati affettivi possono influenzare il modo in cui gli studenti elaborano le informazioni in ambienti ricchi di tecnologia17. Allo stesso tempo, le discussioni attuali sull'intelligenza artificiale generale e sull'educazione futura hanno sottolineato che l'intelligenza artificiale potrebbe rimodellare le pratiche di apprendimento più rapidamente di quanto i sistemi didattici tradizionali possanoadattare 18. Queste condizioni rendono necessario utilizzare un metodo che registri non solo gli atteggiamenti tecnologici, ma anche le condizioni emotive, l'autoregolazione, il background accademico e le variabili contestuali. Nel flusso di lavoro attuale, queste variabili sono trattate come indicatori di indagine auto-report, non come tracce comportamentali o meccanismi causali osservati direttamente.

Una difficoltà metodologica è che i profili degli studenti raramente si formano da una sola variabile. I dati dei sondaggi educativi spesso contengono combinazioni stratificate di indicatori emotivi, comportamentali, accademici, contestuali e legati alla tecnologia. I modelli di regressione convenzionali sono utili per stimare le associazioni nette, ma sono meno intuitivi quando l'obiettivo è mostrare ramificazioni condizionali, differenziazione dei sottogruppi e classificazione basata su regole. L'analisi dell'albero decisionale fornisce un approccio complementare perché suddivide ricorsivamente i casi in rami interpretabili e rende visibile la sequenza di classificazione attraverso le strutture deinodi 19. Rispetto a modelli di machine learning più complessi, un singolo albero decisionale è più facile da ispezionare, spiegare ed esportare come parte di un flusso di lavoro riproducibile. Rispetto alla modellazione lineare standard, può mostrare come combinazioni di indicatori dello studente formino percorsi pratici di classificazione nei datieducativi 20. Tuttavia, un singolo albero è anche sensibile a squilibri di classe, decisioni di partizionamento, impostazioni di potatura e caratteristiche del campione. Per questo motivo, l'albero decisionale in questo protocollo viene utilizzato come un passaggio ausiliario di classificazione interpretabile, non come motore di previsione universale o modellocausale 21.

Questo articolo presenta un flusso di lavoro riproducibile con punteggio di sondaggi e albero decisionale C5.0 per classificare il pensiero di ordine superiore auto-riportato nell'apprendimento accademico supportato dall'intelligenza artificiale generativa. Il flusso di lavoro è dimostrato con un unico dataset universitario su 776 studenti universitari raccolto in Cina dal 7 al 15 marzo 2023. Il risultato è un punteggio auto-riportato di un questionario di pensiero di ordine superiore, dicotomico per la classificazione ausiliaria; Non è una misura diretta della performance cognitiva dimostrata. L'esposizione all'intelligenza artificiale generativa in questa dimostrazione si riferisce all'uso auto-riferito da parte degli studenti di strumenti di intelligenza artificiale generativa per attività accademiche legate ai corsi durante le quattro settimane precedenti, inclusa ricerca di informazioni, spiegazione dei concetti, generazione di idee, stesura di scaletta e revisione dei compiti. L'uso degli strumenti non è stato verificato tramite log della piattaforma, cronologie dei prompt o tracce di attività in tempo reale.

Lo scopo del protocollo non è affermare che l'albero conservato si generalizzi a tutte le istituzioni, coorti o attuali ambienti di intelligenza artificiale generativa. Questa cautela è necessaria perché i dati dimostrativi sono stati raccolti in un'università durante una breve finestra all'inizio del 2023, quando l'esposizione degli studenti all'intelligenza artificiale generativa si stava ancora sviluppando rapidamente. Invece, il contributo dell'articolo risiede nel rendere l'intera procedura ripetibile: definire il contesto del sondaggio, somministrare il questionario, selezionare le risposte, valutare i costrutti, documentare l'affidabilità, applicare una regola di codifica fissa, partizionare il dataset, addestrare e potare un albero C5.0, esportare i risultati del modello e interpretare i percorsi di classificazione basati su nodi con attenzione alle prestazioni specifiche della classe. Questo flusso di lavoro focalizzato sul metodo può aiutare ricercatori educativi, ricercatori orientati alla classe e analisti didattici a riprodurre o adattare un approccio trasparente alla profilazione degli studenti basata su sondaggi nell'apprendimento supportato dall'intelligenza artificiale generativa.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio che ha coinvolto partecipanti umani è stato esaminato e approvato dal Comitato Etico della School of Educational Science, Università Normale di Yili (Riferimento n. LZEDU2023003). Lo studio è stato condotto dal 7 al 15 marzo 2023. Il comitato ha stabilito che lo studio aveva diritto all'esenzione etica perché prevedeva solo procedure anonime e volontarie di questionario senza alcun danno fisico, psicologico o sociale ai partecipanti. Tutti i partecipanti hanno fornito il consenso informato elettronico prima di compilare il questionario.

Prima dell'analisi, sostituire i record dei rispondenti con numeri di caso non reversibili e rimuovere tutti gli identificatori diretti. Non conservare nomi, numeri di identificazione degli studenti, numeri di telefono, nomi di conto, identificatori di classe, indirizzi del protocollo Internet, identificatori di dispositivi o marcatori grezzi degli account della piattaforma nel file analitico. Usa solo le informazioni di controllo duplicate per lo screening delle risposte, poi rimuovile prima di bloccare il dataset analitico.

1. Stabilire il contesto del sondaggio e la procedura di campionamento

  1. Definisci il contesto di studio e i criteri di idoneità
    1. Condotte il sondaggio presso l'Università Politecnica di Liuzhou, Regione Autonoma Guangxi Zhuang, Cina, dal 7 al 15 marzo 2023.
    2. Definire la popolazione target come studenti universitari attualmente iscritti presso l'università partecipante.
    3. Includere gli studenti che riportano di aver utilizzato almeno uno strumento di intelligenza artificiale generativa per l'apprendimento accademico correlato ai corsi nelle precedenti 4 settimane.
    4. Definire l'uso accademico idoneo come ricerca informativa, spiegazione del concetto, generazione di idee, stesura di scaletta, revisione di compiti, supporto alla traduzione, assistenza relativa al codice o altri compiti correlati al corso.
    5. Escludere gli studenti che riferiscono solo uso di intrattenimento, chiacchiere informali, sperimentazioni non legate allo studio o altri usi non legati ai corsi.
    6. Escludere i rispondenti che non sono studenti attuali, non segnalare l'uso accademico dell'intelligenza artificiale generativa, rifiutare il consenso informato elettronico o inviare questionari non validi secondo le regole di screening riportate.
    7. Registrare l'esposizione all'intelligenza artificiale generativa tramite elementi di auto-valutazione che coprono la categoria o il nome dello strumento, approssimare la frequenza di utilizzo durante le 4 settimane precedenti e le attività accademiche supportate dallo strumento. Non trattare questi dati di esposizione come registri verificati sull'uso delle piattaforme.
  2. Costruire il frame di campionamento e reclutare i partecipanti
    1. Ottieni il frame di campionamento istituzionale per studenti universitari dall'università partecipante. La cornice copre più di 15.000 studenti in 46 corsi di studi.
    2. Applicare il campionamento casuale stratificato per categoria di corso e livello di anno per redigere la lista degli invitati, in modo che studenti di diverse aree disciplinari e fasi di studio siano rappresentati nel campione invitato.
    3. Applica il campionamento casuale stratificato per categoria principale e livello di anno per estrarre la lista degli invitati.
    4. Invitare 800 studenti selezionati utilizzando un avviso di reclutamento standardizzato.
    5. Distribuire il codice di risposta rapida della piattaforma di questionario online solo agli studenti invitati durante i periodi non didattivi, come le pause o le sessioni di consulenza agli studenti.
    6. Registra l'intero flusso di reclutamento e selezione. In questo flusso di lavoro, sono stati invitati 800 studenti e sono stati restituiti 792 questionari. Sedici questionari sono stati esclusi: 4 per l'uso non idoneo dell'intelligenza artificiale generativa, 3 per la sottomissione duplicata, 5 per i tempi di completamento sotto la soglia minima e 4 per schemi di risposta lineari non validi. Il campione analitico finale conteneva 776 questionari validi.

2. Configurare l'amministrazione dei questionari e le procedure di privacy dei dati

  1. Configura il questionario online
    1. Crea e distribuisci il questionario utilizzando la piattaforma di questionari online, nota anche come Questionnaire Star.
    2. Abilita la distribuzione rapida del codice di risposta, le risposte obbligatorie su scala degli elementi, l'esportazione nel tempo di invio, il controllo dei doppi e l'esportazione di fogli di calcolo.
    3. Blocca il questionario rivolto al rispondente prima di raccogliere la prima risposta valida. Mantieni invariati il testo degli articoli, l'ordine degli articoli, gli ancoraggi delle risposte, le istruzioni, le etichette delle scale, i formuli del consenso e la via di accesso per tutto il periodo del sondaggio.
    4. Imposta tutti gli oggetti in scala come oggetti richiesti. Non utilizzare imputazioni post hoc per le risposte sulla scala.
    5. Abilita il controllo one-submission tramite l'opzione di piattaforma meno identificabile disponibile. Usa marker generati a livello di account, dispositivo o piattaforma solo per lo screening duplicato.
  2. Standardizzare le condizioni di completamento
    1. Chiedi ai rispondenti di compilare il questionario individualmente, in una sola sessione e senza discussione tra pari.
    2. Istruire i rispondenti a rispondere in base all'uso accademico effettivo dell'intelligenza artificiale generativa durante le precedenti 4 settimane.
    3. Chiedi ai rispondenti di compilare il questionario in un ambiente silenzioso ed evitare il cambio di dispositivo, pause prolungate o accessi ripetuti dopo la sottomissione.
    4. Imposta la finestra temporale prevista per il completamento a 530 min. Usa il tempo di completamento solo come indicatore della qualità della risposta.

3. Selezionare le risposte e bloccare il dataset analitico

  1. Esporta il file di risposta grezzo
    1. Esporta il file grezzo del questionario dalla piattaforma online dopo la chiusura della finestra del sondaggio.
    2. Conserva l'esportazione grezza prima di esclusione, punteggio, codifica o costruzione del modello.
    3. Assegnare numeri di caso non identificabili a tutti i documenti restituiti prima dello screening. In questo flusso di lavoro, assegna i numeri di caso ai 792 questionari restituiti.
  2. Applica regole di esclusione della qualità della risposta
    1. Escludere i documenti senza il consenso informato elettronico.
    2. Escludere i documenti che non soddisfano lo status attuale di studente o l'idoneità accademica.
    3. Escludere i record con risposte non specifiche della scala demografica mancanti dopo l'esportazione. In questo flusso di lavoro, le impostazioni di risposta obbligatorie hanno evitato la mancanza di risposte su scala.
    4. Utilizzare una soglia media di tempo di completamento di 2 s per ogni elemento chiuso per identificare i record che difficilmente rifletteranno la lettura e l'elaborazione delle risposte a livello di item. Escludere i record al di sotto di questa soglia.
    5. Ispezionare i registri completati in meno di 5 minuti o più di 30 minuti come potenziali risposte di bassa qualità o interrotte. Conservare i record al di fuori di questa finestra temporale solo quando il controllo duplicato e l'ispezione del pattern di risposta non indicano completamento invalido.
    6. Usa la risposta a linea retta come ulteriore indicatore di qualità della risposta. Escludere i record in cui la stessa opzione di risposta è selezionata per almeno il 90% degli elementi in scala Likert, poiché questo schema suggerisce un coinvolgimento limitato con il contenuto degli elementi.
    7. Escludere le segnalazioni duplicate basate sui marcatori duplicati della piattaforma e conservare il record valido completo più antico.
    8. Conserva il questionario rivolto al rispondente come Fascicolo Supplementare 1.
    9. Conserva il registro di screening come Supplementare File 2. Il registro di screening dovrebbe riportare gli studenti invitati, i questionari restituiti, i questionari esclusi, le ragioni di esclusione e i casi finali trattenuti.
  3. Crea il dataset analitico bloccato
    1. Conservare i 776 questionari validi dopo lo screening. Blocca il questionario rivolto al rispondente e il dataset analitico prima di assegnare il punteggio per garantire che la formulazione degli item, i criteri di idoneità, le decisioni di esclusione e le definizioni delle variabili non vengano modificate dopo la raccolta dei dati.
    2. Rimuovere identificatori diretti, timestamp grezzi, marcatori a livello di account, tracce a livello di dispositivo e duplicati marcatori di controllo prima dell'analisi. Utilizzare questo passaggio di de-identificazione per proteggere l'anonimato dei partecipanti e impedire che il dataset analitico venga collegato ai singoli studenti.
    3. Salva il dataset di casi 776 de-identificato come dataset analitico bloccato.
    4. Usa il dataset analitico bloccato come unica fonte per punteggi, codifica e classificazione.

4. Misurare le variabili correlate all'apprendente

  1. Organizza il questionario
    1. Dividere il questionario in quattro sezioni: consenso informato, background demografico e accademico, esposizione all'intelligenza artificiale generativa e scale relative all'apprendente.
    2. Registra genere, età, corso di studi, anno e auto-dichiarato rendimento accademico.
    3. Registrare l'esposizione all'intelligenza artificiale generativa per categoria di strumento, frequenza approssimativa di utilizzo e compiti accademici supportati.
    4. Misura il pensiero auto-dichiarato di ordine superiore, l'ansia da intelligenza artificiale generativa, la fiducia nell'intelligenza artificiale generativa, le emozioni negative, gli atteggiamenti verso l'intelligenza artificiale generativa, l'uso problematico dello smartphone, la procrastinazione accademica e l'educazione genitoriale.
    5. Considera tutte le variabili basate su scala come indicatori di indagine auto-report, non come osservazioni comportamentali dirette o performance cognitive osservate direttamente.
  2. Definire misure ritenute
    1. Misurare il pensiero auto-riportato di ordine superiore con uno strumento mantenuto di 23 item che copre problem solving, pensiero critico, lavoro di squadra, comunicazione einnovazione 22.
    2. Misura l'ansia da intelligenza artificiale generativa con una scala di ansia tecnologica adattata di 11items 23.
    3. Misura la fiducia nell'intelligenza artificiale generativa con una scala di 12 elementi di fiducia adattata nell'automazione24.
    4. Misura le emozioni negative con un set adattato di Scale Depressione-Ansia e Stress da 21 items utilizzato come indicatore generale di emozioninegative 25. Non interpretare questo punteggio come una diagnosi clinica.
    5. Misura gli atteggiamenti verso l'intelligenza artificiale generativa con una scala di atteggiamento tecnologico adattatodi 18 items 26.
    6. Misura l'uso problematico di smartphone con la Smartphone Addiction Scale Versione Breve adattata per il sondaggio studentescocontesto 27.
    7. Misura la procrastinazione accademica con una scala di procrastinazione accademica di16 item 28.
    8. Misura il rendimento accademico con un item di autovalutazione a 5 punti: 1 = molto al di sotto della media, 2 = sotto la media, 3 = medio, 4 = sopra la media e 5 = eccellente.
    9. Misura l'educazione genitoriale con un elemento contestuale di autovalutazione di 5 punti: 1 = molto poco supportivo, 2 = poco supportivo, 3 = neutrale o misto, 4 = di supporto e 5 = altamente di supporto.
  3. Specificare gli ancoraggi di risposta e le procedure di adattamento
    1. Utilizzare un formato di risposta di tipo Likert da 1 a 5 per le variabili di scala trattenute.
    2. Usa gli ancoraggi generali: 1 = fortemente in disaccordo, 2 = in disaccordo, 3 = neutro o incerto, 4 = d'accordo e 5 = fortemente d'accordo.
    3. Somministrare il questionario in cinese per garantire che i rispondenti completino tutti gli item della scala nel contesto didattico e linguistico utilizzato nell'università partecipante.
    4. Adattare gli elementi di origine tramite traduzione anticipata, revisione di esperti, aggiustamento di formulazione per l'apprendimento supportato dall'intelligenza artificiale generativa e test pilota di leggibilità per preservare il significato del concetto previsto migliorando la chiarezza contestuale per i rispondenti universitari cinesi.
    5. Utilizzare la revisione degli esperti per verificare se gli elementi adattati rimangano coerenti con i costrutti originali, i punti di riferimento di risposta, la direzione di punteggio e il contesto dello studio. Rivedere solo le formulazioni che possano causare ambiguità, disallineamenti di contesto o incomprensioni nell'ambiente di apprendimento supportato dall'intelligenza artificiale generativa.
    6. Includere la formulazione degli elementi, gli ancoraggi delle risposte, l'ordine degli item, la direzione di punteggio e le etichette delle variabili finali nel File Supplementare 1.

5. Punteggio delle misure e verifica della qualità della misurazione

  1. Prepara il file di lavoro con punteggio
    1. Apri il dataset analitico bloccato in IBM SPSS Statistics 26.0.
    2. Conserva un rispondente per riga e un elemento o variabile per colonna.
    3. Controlla valori mancanti, intervalli di risposta, etichette degli oggetti e nomi delle variabili.
    4. Salva un dataset selezionato a livello di item prima di calcolare i punteggi compositi.
  2. Calcolare i punteggi compositi
    1. Calcola un punteggio composito medio a livello di rispondente per ogni costrutto multiitem.
    2. Valuta al contrario solo gli elementi identificati come a chiave inversa nella chiave di punteggio prima del calcolo del punteggio composito.
    3. Non valutare inversamente gli elementi emotivi negativi derivati da DASS21 in questo flusso di lavoro perché tutti gli elementi trattenuti vengono valutati nella stessa direzione, con valori più alti che indicano un'esperienza emotiva negativa più forte.
    4. Non calcolare punteggi compositi da scale parzialmente trasformate.
    5. Salva un file di lavoro con punteggio continuo dopo il calcolo del punteggio composito.
  3. Verifica la qualità della misurazione interna
    1. Calcola l'alpha di Cronbach per ogni scala multi-item mantenuta in IBM SPSS Statistics 26.0. Usa l'alpha di Cronbach come indice di coerenza interna che indica se gli elementi all'interno della stessa scala mostrano sufficiente coerenza per il calcolo del punteggio composito.
    2. Ispezionare le correlazioni corrette tra il totale degli elementi e i valori alfa-se-item-eliminato per ciascuna scala conservata. Utilizzare le correlazioni correlate tra il totale dell'item e l'item per verificare se ogni item è sufficientemente allineato con il punteggio totale della propria scala dopo aver escluso quell'item dal calcolo totale.
    3. Usa valori alpha-if-item-deleted per identificare elementi che potrebbero ridurre la coerenza interna se mantenuti. Non rimuovere automaticamente gli elementi solo per motivi statistici; Conservare o rimuovere un item solo dopo aver verificato il significato del costrutto, la direzione del punteggio e la coerenza con il questionario adattato.
    4. Effettuare i test di Kaiser-Meyer-Olkin e Bartlett per il set di scale adattato.
    5. Riporta i valori alfa della chiave di Cronbach nel testo principale.
    6. Fornire il registro completo di punteggio e misurazione come Tabella Supplementare 1. Includere il numero degli elementi, l'intervallo di risposta, gli ancoraggi delle risposte, la direzione del punteggio, gli elementi a chiave inversa, la regola del punteggio composito, l'alpha di Cronbach, il risultato corretto della correlazione totale-elemento, il risultato di controllo alpha-if-item-deleted e l'etichetta della variabile finale.

6. Convertire i punteggi continui in input ausiliari di classificazione

  1. Applicare la codifica binaria
    1. Usa il file di lavoro del punteggio continuo come file sorgente.
    2. Ricodifica il pensiero di ordine superiore auto-riportato come variabile target binaria.
    3. Il codice ≤3 come 0 e >3 come 1.
    4. Applicare la stessa soglia a tutti i predittori mantenuti dopo il calcolo del punteggio composito.
    5. Utilizzare la soglia di 3 come punto medio della scala di risposta 1–5 per creare una regola di codifica trasparente e riproducibile.
    6. Eseguire la dicotomizzazione solo per creare input binari per la dimostrazione dell'albero decisionale C5.0.
    7. Controlla il numero di classi dopo la dicotomia.
    8. Conserva il file di lavoro del punteggio continuo.
  2. Crea il file di analisi codificata
    1. Genera un nuovo file di analisi codificato binario.
    2. Codifica l'ansia per l'intelligenza artificiale generativa, la fiducia nell'intelligenza artificiale generativa, l'uso problematico dello smartphone, la procrastinazione accademica, le prestazioni accademiche, l'educazione dei genitori, le emozioni negative e gli atteggiamenti verso l'intelligenza artificiale generativa usando la stessa soglia.
    3. Verifica il numero di classi per ogni variabile binaria.
    4. Riporta la regola di codifica e il conteggio delle classi nella Tabella 1.
    5. Conserva il file di analisi codificato in binario.
    6. Fornire la struttura del file di analisi codificata come File Supplementare 3.

7. Costruire il classificatore ausiliario dell'albero decisionale C5.0

  1. Configurare l'ambiente di modellazione
    1. Apri IBM SPSS Modeler 18.4 su un sistema operativo Windows 10 a 64 bit.
    2. Importa il file di analisi codificato in binario.
    3. Assegna come campo di riferimento il pensiero binario auto-riportato di ordine superiore.
    4. Assegnare tutte le altre variabili binarie conservate come campi di input.
    5. Verifica nomi di campi, etichette di valore e ruoli target/input.
    6. Annota il nome del software, la versione, il sistema operativo, l'implementazione di C5.0, il nome del file del progetto e la data di analisi nella Tabella Supplementare 2.
  2. Partizionare il dataset
    1. Suddividere i 776 casi in una suddivisione 70:30 dei test di addestramento.
    2. Usa il seed casuale fisso 20230307.
    3. Applica la partizionazione stratificata tramite il target di pensiero binario di ordine superiore.
    4. Assegnare 544 casi al sottoinsieme di addestramento e 232 casi al sottoinsieme di test.
    5. Verifica i conteggi low-HOT e high-HOT nell'intero dataset, nel sottoinsieme di addestramento e nel sottoinsieme di testing.
    6. Conserva il record di partizione nella Tabella Supplementare 2.
  3. Addestra e pota l'albero C5.0
    1. Addestra un classificatore C5.0 sul sottoinsieme di addestramento.
    2. Usa il rapporto di guadagno come regola di selezionedivisa 29.
    3. Definisci entropia come:
      Entropia(D) = −Σpilog2(pi)
      dove pi è la proporzione di casi nella classe i all'interno del dataset D.
    4. Definisci il rapporto di guadagno come:
      Rapporto di guadagno (D, C) = [Entropia(D) − Entropia(D|C)]/SplitInfo (D, C)
      dove C è la variabile di spartizione candidata.
    5. Consentire la potatura per ridurre rami troppo specifici che potrebbero adattarsi al rumore del sottoinsieme di addestramento.
    6. Usa le seguenti impostazioni C5.0: potatura = abilitata; Boost = disabilitato; numero di prove = 1; costi di classificazione errata = non applicati; Pesi di classe = non applicati; record minimi per ramo figlio = 2; Potatura globale = abilitato; Crescita sottoalbero = abilitato; fattore di fiducia = 0,25; regole di stop = impostazioni predefinite IBM SPSS Modeler C5.0 salvo diversa indicazione.
    7. Non applicare il sovracampionamento sintetico, la ponderazione delle classi o l'apprendimento sensibile ai costi nel flusso di lavoro primario.
    8. Esporta l'albero iniziale e quello potato mantenuto.
    9. Salva la struttura finale dei nodi, i riassunti dei nodi terminali, l'output di importanza delle variabili, le regole di classificazione e le impostazioni del modello.
  4. Squilibrio di classe del documento
    1. Calcola la distribuzione low-HOT e high-HOT prima dell'addestramento del modello.
    2. Registra il tasso di mancanza di informazioni come proporzione di classe maggioritaria nell'intero dataset e nel sottoinsieme dei test.
    3. Interpretare l'albero come un output ausiliario di classificazione interpretabile piuttosto che come un modello di screening ottimizzato.
    4. Per applicazioni future orientate allo screening, considera pesi di classe, apprendimento sensibile ai costi, ricampionamento, partizioni train-test ripetute, validazione incrociata k-fold o aggiustamento della soglia.

8. Valutare e preservare il risultato della classificazione

  1. Output delle prestazioni di esportazione
    1. Applica l'albero potato mantenuto al sottoinsieme di addestramento.
    2. Esporta la matrice di confusione dell'addestramento, l'accuratezza, il richiamo specifico della classe, la precisione specifica della classe e l'output del nodo terminale.
    3. Applica lo stesso albero al sottoinsieme di test.
    4. Esporta la matrice di confusione del test, l'accuratezza, il richiamo specifico per classe, la precisione specifica per classe e l'output del nodo terminale.
    5. Calcola il richiamo come TP/(TP + FN).
    6. Calcola la precisione come TP/(TP + FP).
    7. Calcola l'accuratezza complessiva come casi correttamente classificati diviso per il totale dei casi.
    8. Calcola il tasso di mancanza di informazioni e confronta l'accuratezza dei test con la base della classe maggioritaria.
    9. Riporta metriche specifiche per classe insieme all'accuratezza complessiva.
  2. Output di interpretabilità per l'esportazione
    1. Esporta la tabella di importanza variabile con i valori numerici.
    2. Esporta il diagramma finale ad albero con la dimensione del campione del nodo, la classe prevista, la distribuzione delle classi e la probabilità della classe.
    3. Se il diagramma ad albero completo è visivamente affollato, fornisci una figura principale semplificata e posiziona la tabella dei nodi completa nel File Supplementare 4.
    4. Riassunti dei terminali di esportazione includono il percorso delle regole, la dimensione del campione del nodo, la classe prevista, il basso conteggio di HOT, l'alto conteggio di HOT e la fiducia nella classificazione.
    5. Descrivi uno o due percorsi di classificazione rappresentativi nei Risultati Rappresentativi.
  3. Preservare il pacchetto di riproducibilità
    1. Conservare il file di risposta grezza, il record di de-identificazione, il log di screening, il dataset selezionato a livello di item, il file di lavoro del punteggio continuo, il file di analisi codificata in binario, la tabella di flusso di campionamento, la chiave di punteggio, la tabella di affidabilità, il file progetto C5.0, il file albero iniziale, il file albero potato, l'output dell'importanza delle variabili, la tabella dei nodi terminali, le matrici di confusione e i riassunti dei modelli esportati.
    2. Fornire la Tabella Supplementare 1 come registro di punteggio e misurazione.
    3. Fornire la Tabella Supplementare 2 come impostazione del modello e record di output.
    4. Fornire il Fascicolo Supplementare 1 come questionario rivolto al rispondente.
    5. Fornisci il Fascicolo Supplementare 2 come registro di selezione di esempio.
    6. Fornire il File Supplementare 3 come struttura codificata del file di analisi.
    7. Fornire il Supplementary File 4 come output terminale e variabile di importanza.
    8. Preservare il percorso di lavoro come: export grezzo del questionario > log di de-identificazione e screening > dataset a livello di item selezionato > file di lavoro di punteggio continuo > file di analisi codificata binaria > partizione di addestramento/test > albero C5.0 iniziale > albero C5.0 potato > output di classificazione esportato > pacchetto supplementare di riproducibilità.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Statistica descrittiva delle variabili conservate

La Tabella 2 riporta le statistiche descrittive delle variabili di indagine self-report conservate nel dataset a punteggio continuo prima della ricodifica binaria. Il punteggio medio auto-riportato del pensiero di ordine superiore era 3,71 (SD = 0,68), che superava la soglia media fissa di 3 sulla scala di risposta 1–5. La fiducia nell'intelligenza artificiale generativa ha sup...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo presenta un flusso di lavoro riproducibile con sondaggi e albero decisionale C5.0 per organizzare i dati auto-segnalati degli studenti nell'apprendimento accademico supportato dall'intelligenza artificiale generativa. Il suo contributo principale è metodologico piuttosto che predittivo. Il flusso di lavoro specifica come definire il contesto del sondaggio, selezionare le risposte, valutare i costrutti multi-elemento, applicare una regola di codifica a punto medio fisso,...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere interessi finanziari o relazioni personali in conflitto che possano aver influenzato il lavoro riportato in questo articolo.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questa ricerca è stata supportata dal Progetto di Riforma Educativa della Regione Autonoma 2024 "Ricerca sul meccanismo di condivisione di risorse educative ideologiche e politiche di alta qualità nei programmi di studio tra università orientali e occidentali" (Progetto n.: XJGXJGZH2024011).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
IBM SPSS ModelerIBM Corp.Versione 18.4Utilizzato per la partizione dei dati stratificata 70:30, la costruzione dell'albero decisionale C5.0, la potatura, la valutazione della classificazione e l'esportazione dell'output dell'albero.
IBM SPSS StatisticaIBM Corp.Versione 26.0Utilizzato per il controllo dei dati, il calcolo del punteggio composito, l'analisi dell'affidabilità, il controllo della frequenza e la ricodifica binaria.
Dispositivo intervistato connesso a InternetDispositivo di proprietà del convenutoSmartphone, tablet o laptop con accesso al browserUtilizzato dai rispondenti per compilare il questionario online. Non è stato fornito alcun dispositivo specifico per lo studio.
Microsoft ExcelMicrosoft Corp.Microsoft 365 o Excel 2019 o successivoUtilizzato per la revisione dei registri di screening, la verifica della codifica, la formattazione delle tabelle e il controllo degli output esportati.
Funzione di distribuzione del codice QRWenjuanxing / Stella del QuestionarioFunzione QR-code integrata tramite collegamento a questionarioUtilizzato per fornire accesso standardizzato a questionari agli studenti invitati durante la finestra del sondaggio.
Impostazione di completamento silenzioso del rilievoUniversità partecipanteAmbiente di pausa non didattica o di consulenza agli studentiUtilizzato per ridurre la variazione risposta-contesto durante il completamento del questionario in una sola sessione.
Directoria di archiviazione dati sicuraAutori / istituzioni partecipantiArchiviazione istituzionale a controllo di accessoUtilizzato per preservare esportazioni grezze, dataset selezionati, dataset valutati, dataset codificati, file di modello, log e output esportati con controllo versione.
Piattaforma di sondaggi online Wenjuanxing / Questionnaire StarChangsha Ranxing Information Technology Co., Ltd.Piattaforma web; accesso tramite il sito ufficiale di WenjuanxingUtilizzato per la costruzione di questionari, distribuzione dei codici QR, impostazioni di risposta obbligatoria, controllo dei duplicati, esportazione di timestamp ed export di fogli di calcolo.
Sistema operativo WindowsMicrosoft Corp.Windows 10, 64 bitAmbiente operativo per IBM SPSS Statistics 26.0 e IBM SPSS Modeler 18.4.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Intelligenza Artificiale GenerativaProfilazione dell ApprendenteProcrastinazione AccademicaUso Problematico dello SmartphoneAccuratezza del ModelloQuestionario di AutovalutazioneClassificazione Basata sui Nodi

Articoli correlati