Alle Methoden mit menschlichen Teilnehmern wurden gemäß institutionellen Richtlinien und der Erklärung von Helsinki durchgeführt. Das Studienprotokoll wurde vom institutionellen Überprüfungsausschuss des Guangzhou City Construction College überprüft und genehmigt (IRB-Genehmigung Nr. GZCJ2026A016; Genehmigungsdatum: 2. Januar 2026). Der genehmigte Studientitel lautete "KI-unterstützte, schülerzentrierte Instruktion und das akademische Selbstkonzept und die Kommunikationskompetenz der Jugendlichen: eine Mixed-Methods-Studie." Vor der Durchführung der Studie wurde eine schriftliche Genehmigung von der teilnehmenden Schule eingeholt. Eine schriftliche informierte Zustimmung wurde von den Eltern oder gesetzlichen Erziehungsberechtigten eingeholt, und die schriftliche Zustimmung wurde von allen teilnehmenden Schülern eingeholt. Die Studierenden wurden darüber informiert, dass die Teilnahme freiwillig sei und sie jederzeit ohne akademische Strafe aus dem Studium zurücktreten können. Keine Namen, Kontaktdaten, Schulkennungen, Noten oder andere direkt identifizierbare Informationen wurden in die KI-Chatbot-Plattform eingegeben oder in den öffentlichen Datensatz aufgenommen. Alle Studienverfahren wurden während des genehmigten Studienzeitraums vom 2. Januar 2026 bis zum 2. Januar 2027 durchgeführt. Alle in dieser Studie verwendeten Werkzeuge und Plattformen sind in der Materialtabelle aufgeführt
Studiendesign und Unterrichtszuweisung
Diese Studie verwendete ein quasi-experimentelles, gemischtes Klassenzimmerdesign mit zwei Unterrichtsbedingungen: einer KI-unterstützten, schülerzentrierten Unterrichtsgruppe und einer üblichen schülerzentrierten Unterrichtsgruppe. Longitudinale Messungen wurden an drei Zeitpunkten durchgeführt: Basislinie vor der Intervention (T1), unmittelbar nach der letzten Unterrichtssitzung (T2) und bei einer vordefinierten kurzfristigen Nachbeobachtung (T3). Das T2–T3-Intervall wurde im Studienprotokoll erfasst und über Manuskript, Datensatz, Analyseskripte und Figurenbeschriftungen hinweg konsistent gehalten. Abbildung 1 fasst Rekrutierung, Klassenzuteilung, Bewertungszeitpunkt, Ausschlüsse und qualitative Stichprobe zusammen. Da administrative und ökologische Einschränkungen die individuelle Randomisierung verhinderten, wurden sechs intakte Klassen auf Klassenzimmerebene vergeben, davon drei Klassen im KI-unterstützten Zustand und drei Klassen in der Vergleichsbedingung. Jede Klasse trug 29 Schüler zur finalen analytischen Stichprobe bei. Klassenstufen, Fachbereich, Unterrichtsreihenfolge, Sitzungsdauer, Aufgaben im Klassenraum, Bewertungsplan und Kontaktzeit mit Lehrkräften wurden über die Bedingungen hinweg vergleichbar gehalten. Klassenkennungen wurden für clustersensitive statistische Überprüfungen beibehalten.
Teilnehmerrekrutierung und Eignungsprüfung
Die Teilnehmer wurden direkt aus den teilnehmenden unversehrten Klassen rekrutiert. Schüler und ihre Eltern oder gesetzlichen Erziehungsberechtigten erhielten ein detailliertes Informationsblatt, das den Lernzweck, die Unterrichtsabläufe, KI-unterstützte Aktivitäten, Fragebogenpläne, den optionalen Interviewbestandteil, Datenschutz, Rückzugsrechte und Datenspeicherpläne beschrieb. Die Schüler wurden in die Studie einbezogen, wenn sie in einer der teilnehmenden Klassen eingeschrieben waren, regulären Unterricht besuchten, eine schriftliche Zustimmung gaben, die schriftliche Zustimmung von Eltern oder Erziehungsberechtigten einholten und den Basisfragebogen vor der ersten Sitzung ausfüllten. Umgekehrt wurden Schüler aus der finalen analytischen Stichprobe ausgeschlossen, wenn sie von der Schule wechselten, mehr als 25 % der Interventionssitzungen verpassten, ungültige Fragebogendaten einreichten oder die Erlaubnis zur Datennutzung zurückzogen. Ein Hauptgrund für den Ausschluss wurde für jeden ausgeschlossenen Teilnehmer dokumentiert. Vor der Dateneingabe erhielt jeder berechtigte Teilnehmer einen eindeutigen Studienidentifikationscode. Relevante demografische und bildungsbezogene Kovariaten wurden erfasst, darunter Alter, Geschlecht, Klassenkennung, Basisleistungsband, vorherige Exposition mit KI-unterstütztem Lernen und Basisvertrautheit mit digitalem Lernen. Für die statistische Nachverfolgung wurde die Instruktionsgruppenvariable als 0 für die Vergleichsbedingung und 1 für die KI-unterstützte Bedingung codiert.
Unterrichtsmaterialien und Durchführung von Interventionen
Vor der Einführung wurde eine sechsteilige Unterrichtseinheit (Ergänzende Tabelle 1) entwickelt, wobei jede Unterrichtseinheit 40–45 Minuten dauerte. Identische Lernziele, Unterrichtsthemen, Arbeitsblätter, Diskussionsaufgaben mit Gleichaltrigen, Selbstbewertungsformulare und Reflexionsanregungen wurden in beiden Unterrichtsphasen angewendet. Die Fragebogenstruktur, Bewertungsrichtungen, umgewertete Aufgaben und die finalen Variablen auf Skalenebene folgten der gesperrten Wertungskarte in Tabelle 1. Die Reproduzierbarkeitsmaterialien umfassten Unterrichtspläne (Ergänzende Tabelle 1), KI-Eingabeblätter (Ergänzende Tabelle 2), Lehrer-Eingabeblätter (Ergänzende Tabelle 3), Schülerarbeitsblätter (Ergänzende Tabelle 4), Selbstbewertungsformulare (Ergänzende Tabelle 5), Beobachtungschecklisten (Ergänzende Tabelle 6), technische Vorfallprotokolle (Ergänzende Tabelle 7), Interviewanleitungen (Ergänzende Tabelle 8) und ein qualitatives Codebuch (Ergänzende Tabelle 9). Der teilnehmende Lehrer absolvierte die Schulung anhand eines schriftlichen Vortragsleitfadens, der die Abfolge der Sitzungen, KI-Nutzungsgrenzen, Vergleichsgruppenverfahren, Datenschutzanforderungen und Fidelity-Checklisten abdeckte. Es wurde eine Probe mit Nicht-Lernschülern durchgeführt, um den Zeitpunkt der Aktivität, den Zugriff auf Geräte, die Klarheit der Arbeitsblätter und die Schwierigkeit der Aufgaben zu überprüfen. Das KI-Tool war ein institutionell anerkannter ChatGPT-basierter Chatbot, der die GPT-4-Architektur nutzte. Für den Unterricht wurden Chatverlauf, Profilspeicherung, Websurfen, Plug-ins, Bildgenerierung und automatisierte Bewertung deaktiviert. Das Manuskript verwendet nach seiner ersten Erwähnung den generischen Begriff "KI-Chatbot-Plattform", um Werbesprache zu vermeiden. Prompt-Design-Prinzipien wurden vor der Intervention festgelegt und die Nutzung von KI auf Klarstellung, Beispielgenerierung, Erklärungsvergleich, gezielte Überarbeitungsunterstützung und Selbstbewertungshinweise beschränkt. Repräsentative Prompts, Beispiel-KI-Ausgaben und Beispiele für Lehrermoderation wurden als Teil der Reproduzierbarkeitsmaterialien beibehalten.
Jede KI-unterstützte Sitzung wurde in fünf strukturierten Phasen durchgeführt. Zunächst wurde ein 5-minütiges Lehrerbriefing durchgeführt, um die Lernziele zu nennen, Aufgaben zu erklären, die konfigurierte KI-Chatbot-Plattform zu identifizieren und die Schüler daran zu erinnern, dass KI-Ausgaben vorläufige Eingaben und keine autoritativen Antworten sind. Die Schüler wurden streng angewiesen, keine identifizierbaren persönlichen Informationen in die Plattform einzugeben. Anschließend folgte eine 10-minütige, individuelle, KI-unterstützte Inquiry-Aktivität, bei der die Schüler das vorbereitete Eingabeblatt nutzten, um Klarstellungen, Beispiele, alternative Erklärungen oder Überarbeitungsvorschläge anzufordern. Jeder Schüler notierte die verwendete Prompt-Kategorie, eine nützliche KI-unterstützte Idee, einen Punkt, der verifiziert werden muss, und seine endgültige Adoptionsentscheidung. Drittens wurde eine 12–15-minütige Peer-Diskussionsaktivität durchgeführt, bei der die Schüler ihre KI-unterstützten Ideen in Kleingruppen verglichen, Ungenauigkeiten identifizierten und ihre Arbeit gemeinsam überarbeiteten. Während dieser Phase verteilte sich der Lehrer im Klassenraum, um eine standardisierte Moderationsregel anzuwenden, die die Schüler dazu aufforderte, ihre Überarbeitungen mündlich anhand der Unterrichtskriterien zu begründen und fehlerhafte oder überhebliche KI-Ergebnisse vor der Finalisierung zu korrigieren. Viertens wurde eine 5–8-minütige ganzheitliche Klarstellungssitzung durchgeführt, um weit verbreitete Missverständnisse zu beseitigen und sachliche Fehler zu korrigieren. Abschließend beendete eine 5-minütige Selbstbewertungsaktivität die Sitzung, in der die Schüler ihr Verständnis bewerteten, eine konkrete Verbesserung notierten und eine unbeantwortete Frage notierten. Diese exakte Betriebsabfolge wurde über alle Interventionsklassen hinweg beibehalten. Ausgedruckte Prompt-Sheets dienten als technische Backups, und technische Abweichungen, die über ein Drittel einer Klasse betrafen, wurden explizit protokolliert. Anonymisierte repräsentative Prompt-Output-Moderationsbeispiele wurden beibehalten und in den Supplementary Tables 2, 3 dokumentiert.
Die Vergleichsbedingung wurde unter Verwendung der gleichen Sitzungsdauer, Lernziele, Themenreihenfolge, Arbeitsblätter, Diskussionsintervallen mit Gleichaltrigen, Selbstbewertungsformularen und Lehrerfeedbackfenstern bereitgestellt. Die KI-unterstützten Aufgaben wurden jedoch durch standardisierte, von Lehrern erstellte Leitaufgaben ersetzt, die die Schüler anwiesen, Kernkonzepte zu erklären, Beispiele zu vergleichen, Schwächen zu identifizieren und ihre Arbeit zu überarbeiten. Die identische fünfstufige Struktur, bestehend aus Briefing, individueller Anfrage, Peer-Diskussion, Gruppenklärung und abschließender Selbstbewertung, wurde streng beibehalten. Keine zusätzlichen Nachhilfe, außerschulische Aufgaben, längere Rückkopplungsphasen oder andere Bewertungsaufgaben wurden für eine der beiden Erkrankungen bereitgestellt. Anwesenheit im Klassenzimmer, Verhaltensstörungen, Lehrerwechsel und unvollständige Komponenten wurden im gleichen Protokollformat für beide Gruppen dokumentiert.
Datenerhebung, Treueüberwachung und quantitative Analyse
Bewertungsfragebögen wurden zu Basis-, nach der Intervention und in Nachbeobachtungsintervallen durchgeführt, wobei konsistente Item-Formulierungen, Antwortskalen und Bewertungsregeln über alle drei Messwellen verwendet wurden. Die Instrumente umfassten validierte Skalen, die akademisches Selbstkonzept, Kommunikationskompetenz, Interaktionsqualität, Selbstbewertung und Lernbeteiligung bewerteten. Die Antworten wurden mit einer standardisierten 5-Punkte-Likert-Skala von 1 (starke Meinungsverschiedenheit) bis 5 (starke Übereinstimmung) erhoben, wobei höhere Werte auf höhere Niveaus des Zielkonstrukts hindeuten. Einzelne Skalenwerte wurden als arithmetischer Mittelwert gültiger Items nach notwendiger Umkehrcodierung berechnet. Fehlende Itemwerte wurden durch den Durchschnittswert des Schülers innerhalb derselben Skala und Welle ersetzt, vorausgesetzt, nicht mehr als 20 % der Items fehlten. Skalen mit mehr als 20 % fehlenden Items wurden als fehlend behandelt, und Daten aus einer vollständig fehlenden Bewertungswelle wurden nicht zugeschrieben. Vor der statistischen Analyse wurde der Rohdatensatz sorgfältig auf Bereichsverletzungen, doppelte Einträge, geradlinige Antwortmuster und anomale Abschlusszeiten geprüft. Datensätze wurden als ungültig markiert und ausgeschlossen, wenn sie unmögliche numerische Werte, invariante Antworten über alle Elemente oder Abschlusszeiten unter einem Drittel der Mediandauer aufwiesen, sofern explizite Klassenprotokolle ihre Echtheit nicht bestätigten. Die Hauptanalysen nach der Intervention und Nachbeobachtung umfassten Studierende, die valide Baseline-Ergebnisse sowie entsprechende Daten zu den Nacheinsätzen oder Nachbeobachtungsergebnissen lieferten, wodurch eine einseitige listenweise Löschung bei teilweise vollständigen Zeitplänen vermieden wurde. Vor der Dateneingabe wurde ein gesperrtes Datenwörterbuch eingerichtet, um Variablennamen, Labels, Antwortbereiche, fehlende Wertcodes, Reverse-Scoring-Regeln, Wellenkennungen und endgültige Skalierungskonstrukte zu definieren. Die Fragebogendaten wurden in großem Format eingetragen, mit einer einzelnen Zeile pro Schüler und Wellensuffixen (_T1, _T2, _T3) zur Unterscheidung der Messwellen. Numerische Bereiche und eindeutige Teilnehmeraufzeichnungen wurden rechnerisch überprüft, und Fehlmuster wurden zwischen Gruppen, Klassen und Wellen anhand des Master-Anwesenheitsprotokolls überprüft.
Während jeder Unterrichtseinheit wurde eine standardisierte Checkliste zur Beobachtung der Implementierung verwendet. Jeder pädagogische Teil wurde mit 0 (nicht abgeschlossen), 1 (teilweise abgeschlossen) oder 2 (vollständig abgeschlossen) bewertet. Die bewerteten Komponenten sind strikt an die fünfstufige Unterrichtssequenz abgestimmt, darunter das Lehrerbriefing, individuelle Anfragen, Diskussion mit Gleichaltrigen, Klarstellung der ganzen Klasse und das Ausfüllen von Selbstbewertungsprotokollen. Der Gesamtprozentsatz der Sitzungstreue wurde berechnet, indem der beobachtete Wert durch den maximal möglichen Wert geteilt wurde. Jede Sitzung, die unter einer 70%-Treueschwelle lag, wurde als Protokollabweichung verzeichnet. Um die Zuverlässigkeit der Inter-Rater sicherzustellen, bewertete ein zweiter, geschulter Beobachter unabhängig mindestens 20 % der Gesamtsitzungen. Die prozentuale Übereinstimmung wurde über alle Posten berechnet, und etwaige Bewertungsabweichungen wurden durch Konsensdiskussion gelöst, sobald die ursprüngliche Zustimmung unter 80 % fiel. Technische Hardware- oder Softwarefehler wurden in separaten Protokollen festgehalten, um sie von Problemen mit der Instruktionsgenauigkeit zu unterscheiden.
Statistische Analysen wurden mit einem reproduzierbaren, skriptbasierten Workflow durchgeführt, bei dem der zufällige Seed vor jeglichen Stichproben- oder Sensitivitätsprüfungen festgelegt wurde. Alle statistischen Tests waren zweiseitig, wobei die Signifikanz auf p < 0,05 gesetzt wurde. Kontinuierliche Variablen wurden als Mittelwerte und Standardabweichungen zusammengefasst, während kategoriale Variablen als Häufigkeiten und Prozentsätze angegeben wurden. Die Basisäquivalenz zwischen den Kohorten wurde beschreibend mittels unabhängiger Stichproben für kontinuierliche Daten und Chi-Quadrat-Tests für kategoriale Verteilungen bewertet. Die interne Konsistenz wurde mit Cronbachs Alpha gemessen, wobei Schwellenwerte von α ≥ 0,70 für allgemeine Skalen und α ≥ 0,80 für primäre Endpunktsmaße sowie korrigierte Punkt-Gesamt-Korrelationen angewendet wurden. Die basislinienbereinigte ANCOVA diente als primärer analytischer Ansatz. Für jedes primäre Endergebnis wurden separate Modelle angepasst, wobei der post-interventionelle oder Nachbeobachtungswert als abhängige Variable, die instruktive Gruppe als Hauptprädiktor und der entsprechende Baseline-Wert als obligatorische Kovariate angegeben wurde. Zusätzliche Kovariaten (Geschlecht, Basisleistungsband und vorherige KI-Exposition) wurden einbezogen, um Basisungleichgewichte oder deren theoretische Relevanz zu kontrollieren, und bereinigte Mittelwertdifferenzen, 95%-Konfidenzintervalle, Standardfehler und Werte des Modells R2 wurden berichtet. Change-Score-Vergleiche (T2–T1 und T3–T1) wurden als sekundäre Analysen mit unabhängigen Proben von Welchs t-Tests durchgeführt, wobei die Effektgrößen mit Cohens d quantifiziert wurden. Explorative Prozessanalysen bewerteten Pearson-Korrelationen zwischen Prozessvariablen und Ergebnisänderungen, ergänzt durch Multi-Prädiktor-lineare Regressionen mit Varianz-Inflationsfaktor-(VIF)-Überwachung zur Überprüfung der Multikollinearität. Schließlich wurden clustersensitive Prüfungen implementiert, um die verschachtelte Struktur der Schüler innerhalb der sechs unversehrten Klassen zu berücksichtigen. Unbedingte intraklassische Korrelationskoeffizienten (ICCs) wurden geschätzt, Ergebnisänderungen aggregiert und auf Klassenebene verglichen, und primäre ANCOVA-Berechnungen wurden mit cluster-robusten Standardfehlern als explorative Sensibilitätsprüfung wiederholt.
Qualitative Stichproben, Codierung und Integration von gemischten Methoden
Unmittelbar nach dem Fragebogen nach der Intervention wurde eine gezielte Teilstichprobe von 36 Studierenden für halbstrukturierte Interviews ausgewählt. Diese qualitative Kohorte umfasste Teilnehmer aus beiden Unterrichtsphasen, die hohe, mittlere oder niedrige Veränderungswerte im akademischen Selbstbild oder in der Kommunikationskompetenz aufwiesen. Der halbstrukturierte Interviewleitfaden untersuchte Erfahrungen mit Interaktion im Klassenzimmer, Selbstvertrauen bei der Erklärung von Ideen, Selbstbewertungsverhalten, Aufgabenbeteiligung und Kommunikationsbereitschaft und nutzte gezielte Eingaben, um Momente der Überarbeitung, Reaktionen auf unklares Feedback und Unterschiede im Engagement zu untersuchen. Die Interviews wurden nur nach Einholung der Zustimmung der Eltern und der Zustimmung der Schüler audioaufgezeichnet; ansonsten wurden strukturierte schriftliche Notizen gemacht. Alle persönlichen Namen, Klassennummern und identifizierenden Angaben wurden während der Transkription entfernt, und die Zeugnisse wurden mit den entsprechenden quantitativen Kennungen verknüpft. Der anfängliche qualitative Codierungsrahmen wurde deduktiv aus Konstrukten zur Interaktionsqualität, Selbstbewertung und Lernbeteiligung abgeleitet, wobei induktive thematische Codes nur hinzugefügt wurden, wenn die Daten nicht zum Baseline-Rahmen passten. Zwei unabhängige Codierer analysierten mindestens 20 % der Transkripte, um die Zuverlässigkeit zu überprüfen. Cohens Kappa-Koeffizienten wurden bewertet, wobei Werte zwischen 0,61–0,80 als erhebliche Übereinstimmung und Werte über 0,80 als starke Übereinstimmung betrachtet wurden. Die Codebuchdefinitionen wurden verfeinert und die doppelte Codierung wurde wiederholt, wann immer das anfängliche Kappa unter 0,61 fiel, und die endgültigen Definitionen zusammen mit der resultierenden qualitativen Code-Frequenzmatrix wurden archiviert (ergänzende Tabellen 9 und 10).
Quantitative Datenanalyse und qualitative Codierungsrahmenwerke wurden unabhängig vor der Einführung der Integration mit gemischten Methoden finalisiert. Eine zusammenhängende gemeinsame Darstellung wurde strukturell aufgebaut, um die drei quantitativen Prozessvariablen mit ihren entsprechenden qualitativen Themen zu verknüpfen. Integrierte Ergebnisse wurden systematisch als Konvergenz (wo Fragebogenmuster und Interviewthemen übereinstimmten), Expansion (bei der qualitative Erzählungen die quantitativen Trends zugrunde liegenden Mechanismen erklärten) oder Divergenz (bei denen Interviews einzigartige Barrieren oder ungleiche Beteiligung aufzeigten, die die quantitativen Muster erschwerten). Qualitative Ergebnisse wurden genutzt, um Klassenabläufe zu kontextualisieren, indem Lernbeteiligungswerte mit Themen wie aktivem Fragen und Diskussion mit Gleichaltrigen verknüpft wurden und Selbstbewertungswerte mit Erklärungen von Lückenbewusstsein und strategischen Anpassungen verknüpft wurden.