Lehre der Versuchsplanung
Diese Studie verwendete die grundlegende Open-Source-Version von DeepSeek und stützte sich auf die offene API-Schnittstelle der Plattform für Programm-Aufrufe. Der vollständige Satz aus fünf Prompt-Vorlagetexten, vier Ebenen von Beispielaufgaben, Transfer-Anmerkungskategorien-Tags sowie Regeln zur Zuordnung von Schreibfehler-Vorlagen wurde im ergänzenden Anhang zusammengestellt. Das System verwendete feste Aufrufparameter: einen Temperaturkoeffizienten von 0,7, und die erzeugte Textlänge wurde dynamisch je nach Art der Schreibaufgabe begrenzt. Es folgte strikt einer festgelegten Abfolge semantische Rekonstruktion > stilistische Anpassung > kulturelle Adaption und führte geschachtelte Prompt-Kettenaufrufe aus. Die Modell-Ausgaben wurden vom Dozenten manuell auf wirksame Texte für den Unterricht im Klassenzimmer überprüft und ausgewählt.
An dieser Studie nahmen drei Vollzeit-Lehrkräfte für englische Schreibkursstunden auf Hochschulniveau mit mehr als fünf Jahren Berufserfahrung als Gutachter bei der manuellen Bewertung teil. Alle Bewertenden erhielten vor der offiziellen Korrektur eine standardisierte Schulung, in der sie mit den Bewertungsdimensionen, dem 5-Punkte-Bewertungssystem, kulturellem Transfer, Syntax, Diskurs und weiteren Bewertungsdetails vertraut gemacht wurden, und absolvierten eine Vorkorrektur-Kalibrierung. Alle Schüleraufsätze wurden unabhängig voneinander von zwei Lehrkräften im verdeckten, doppelten Bewertungsverfahren korrigiert. Falls die Differenz zwischen den beiden Bewertungsergebnissen mehr als einen Punkt (von fünf) betrug, entschied eine dritte erfahrene Lehrkraft als Schiedsgutachter über die endgültige Bewertung, und der Durchschnitt der beiden gültigen Bewertungen wurde als endgültige manuelle Punktzahl für die jeweilige Arbeit festgelegt. Zwei Gruppen von Bewertenden waren in der Evaluierungsphase für unterschiedliche Forschungszwecke beteiligt. Drei Vollzeit-Lehrkräfte für englische Schreibfächer an Hochschulen führten im Rahmen des eigentlichen Experiments die verdeckte, doppelte Bewertung sämtlicher Schreibleistungen der Studierenden durch, wobei eine dritte erfahrene Lehrkraft als Schiedsgutachter einsprang, wenn die Abweichung der Bewertungen mehr als einen Punkt auf der 5-Punkte-Skala betrug. Im Gegensatz dazu nahmen fünf Bewertende an einem Test zur Bestimmung der Inter-Rater-Reliabilität mittels des Intraklassen-Korrelationskoeffizienten (ICC) teil, der separat durchgeführt wurde, um die Konsistenz der Bewertungsstandards zwischen den Gutachtern zu überprüfen. Der Unterschied in der Anzahl der Bewertenden resultiert aus unterschiedlichen funktionalen Anforderungen: die drei Kernlehrkräfte sicherten die praktische Bewertung der experimentellen Daten, während das erweiterte Gremium aus fünf Bewertenden stichhaltigere Belege für die Zuverlässigkeit des gesamten Bewertungssystems lieferte.
Syntaktische Komplexität, BERT-Textstruktur-Bewertung und semantische Ähnlichkeit werden alle in einem Bereich von 0–5 Punkten bewertet. Die Gewichtungen für jede Dimension wurden gemäß den Standards des Fremdsprachen-Schreibunterrichts und der dazugehörigen Forschung festgelegt: Syntax 0,35, Textstruktur 0,35 sowie Logik und Kultur 0,3. Die Gewichtungswerte basierten auf etablierten quantitativen Bewertungssystemen für Schreibfertigkeiten im jeweiligen Fachgebiet. Das automatische Bewertungsmodul der KI wurde anhand von Schwellenwerten kalibriert, die auf 15 vorab klassifizierten Musteressays beruhten. Die manuelle Bewertung erfolgte nach einheitlichem Fünf-Punkte-Bewertungsschema. Die maschinelle Bewertung und die menschliche Kalibrierung wurden für eine Vorversuchs-Verifizierung vor der offiziellen Evaluation kombiniert.
Die Lehraufgabe wurde anhand der dreistufigen Transferziele „Syntax-Struktur-Kultur“ durchgeführt, mit drei Trainingsrunden, die jeweils eine Woche dauerten. In der ersten Runde erfolgte eine umschreibende Bearbeitung auf Satzebene, um die syntaktische Vielfalt und Ausdrucksgenauigkeit zu verbessern; die zweite Runde beinhaltete eine strukturelle Neugestaltung auf Absatzebene, um die Gliederung der Absätze und die logische Kohärenz zu stärken; in der dritten Runde wurde ein Transfer auf kultureller Ebene durchgeführt, um das interkulturelle pragmatische Bewusstsein und die Anpassungsfähigkeit des sprachlichen Ausdrucks zu fördern. Da wiederholte Messungen von denselben Teilnehmern vor dem Training, während der drei aufeinanderfolgenden Trainingsrunden und nach dem Training erhoben wurden, wurde die Varianzanalyse mit wiederholten Messungen (RM-ANOVA) als primäre statistische Methode gewählt, um die Haupteffekte der Gruppe (experimentell vs. Kontrolle), die Haupteffekte des Messzeitpunkts sowie den Interaktionseffekt Gruppe × Zeit zu untersuchen, der angibt, ob sich die Leistungsänderungen im Verlauf des Trainings zwischen den beiden Kohorten unterschieden. Die Sphärizitätsannahme wurde mittels Mauchly-Test überprüft; bei Verletzung der Sphärizität wurde die Greenhouse-Geisser-Korrektur angewendet. T-Tests für unabhängige Stichproben wurden ausschließlich für post-hoc paarweise Gruppenvergleiche zu einzelnen Zeitpunkten verwendet, während die Pearson-Korrelation bzw. Cohens d weiterhin zur Beurteilung der Bewertungskonsistenz und zur Quantifizierung der Effektgröße dienten.
Alle statistischen Analysen wurden vor der Datenerhebung festgelegt. Um die Schreibindikatoren vor und nach der Intervention zwischen zwei Gruppen zu vergleichen, wurden t-Tests für unabhängige Stichproben verwendet, wobei die primäre Nullhypothese davon ausging, dass keine Gruppenunterschiede hinsichtlich der Schreibtransferleistung bestehen. Eine Pearson-Korrelationsanalyse diente zur Quantifizierung des linearen Zusammenhangs zwischen der automatischen Bewertung durch KI und den manuellen Bewertungen durch die Lehrkräfte; außerdem wurde Cohens d als standardisiertes Effektmaß für den Gruppenvergleich berechnet. Die Signifikanzschwelle wurde für alle Hypothesentests bei α = 0,05 festgelegt, und 95-%-Konfidenzintervalle wurden zusammen mit allen Teststatistiken berechnet. Alle statistischen Berechnungen wurden mit SPSS 26.0 durchgeführt. Es traten keine fehlenden Daten in den Testergebnissen der Schüler oder in den Fragebogendatensätzen auf, da alle Teilnehmer das vollständige dreirundige Training sowie die zugehörigen Bewertungen absolvierten; daher war keine Imputation oder Fallausschließung wegen fehlender Werte erforderlich.
Aufbau des Bewertungsindexsystems
Um die Leistung der Studierenden im Bereich des englischen Schreibtransfers umfassend zu bewerten, konstruierte diese Studie ein mehrdimensionales Bewertungssystem, das die dreistufigen Transferziele „Syntax-Struktur-Kultur“ abdeckte, Sprachkompetenz, Modellreaktion, Unterrichtsfeedback und Selbstwahrnehmung integrierte und sechs Kernindikatoren etablierte. Zunächst war der „Schreibtransferindex“ ein umfassender Bewertungsindikator, der syntaktische Vielfalt, strukturelle Klarheit und kulturelle Anpassungsfähigkeit umfasste und die automatische Bewertung des Systems mit der manuellen Bewertung durch die Lehrkraft zur quantitativen Analyse kombinierte. Die „Bewertung der syntaktischen Komplexität“ nutzte Technologien der natürlichen Sprachverarbeitung (Natural Language Processing, NLP), um Merkmale wie durchschnittliche Satzlänge, Anzahl der Satzverschachtelungsebenen und Häufigkeit der Verwendung von Verbphrasen zu extrahieren, um den Reichtum und die Komplexität der Sätze der Studierenden zu bewerten. Die Analyse der „Übereinstimmung mit dem akademischen Stil“ untersuchte den Anteil der Verwendung der Passivkonstruktion und den Anteil formaler Vokabeln mithilfe eines NLP-Modells, um festzustellen, ob der Text den stilistischen Normen des englischen wissenschaftlichen Schreibens entsprach. Darüber hinaus führte die Studie eine subjektive Bewertungsdimension ein, indem Feedback zur Akzeptanz und Praxistauglichkeit der vom Modell generierten Vorschläge durch Lehrerfragenbögen gesammelt wurde, um die tatsächliche Wirkung des KI-gestützten Unterrichts zu bewerten. „Veränderungen der Korrekturpunktzahlen der Lehrkräfte“ spiegelten die Auswirkung des KI-gestützten Unterrichts auf die Verbesserung der Schreibqualität wider, indem die Bewertungen der Lehrkräfte für die Aufsätze der Studierenden vor und nach dem Experiment verglichen wurden. Schließlich nutzte die „Selbsteinschätzung der Studierenden hinsichtlich ihrer Transferfähigkeit“ die Transferwahrnehmungstabelle, um die Studierenden bei der Selbsteinschätzung ihrer Beherrschung von Struktur, Syntax, Kultur und anderen Dimensionen zu unterstützen und so ihr metakognitives Bewusstsein und ihre Reflexionsfähigkeit zu stärken. Die genauen Beschreibungen und Datenquellen für jeden Indikator sind in Tabelle 3 dargestellt.
Syntaktische und stilistische Indikatoren wurden automatisch mithilfe von Abhängigkeitsanalyse und BERT-basierter Klassifizierung berechnet, wobei normalisierte Werte zwischen 0 und 5 resultierten; die manuelle Bewertung erfolgte anhand einer 5-Punkte-Skala. Bei den Berechnungsformeln für die syntaktische Komplexität wurde die Gesamtanzahl der Wörter geteilt durch die Anzahl der Nebensätze als zentraler Nenner verwendet. Rohdatenquelle: Schreibaufgaben aus Vortest und Nachtest aller 60 eingeschriebenen Studierenden.
Experimentelle Ergebnisse und Analyse
Um die umfassenden Leistungsunterschiede der Studierenden in den drei Dimensionen syntaktischer Transfer, struktureller Transfer und kultureller Transfer anschaulich darzustellen, vergleicht Abbildung 3 den durchschnittlichen Schreibtransferindex der Studierenden in der Versuchsgruppe und der Kontrollgruppe vor und nach dem Experiment: Abbildung 3 zeigt die Unterschiede in den durchschnittlichen Werten zwischen der Versuchsgruppe und der Kontrollgruppe in den drei Dimensionen syntaktischer Transfer, struktureller Transfer und kultureller Transfer. Die Versuchsgruppe wies nach dem Experiment eine signifikante Verbesserung der Transferfähigkeit in jeder Dimension auf, und der äußere Kreis des Spinnendiagramms ist deutlich größer als der innere Kreis, was darauf hinweist, dass die auf dem DeepSeek-Modell basierende Unterrichtsoptimierungsmethode eine positive Wirkung bei der Förderung der Entwicklung der englischen Schreibtransferfähigkeit der Studierenden hat. Im Gegensatz dazu blieben die verschiedenen Indikatoren für Transferfähigkeit in der Kontrollgruppe vor und nach dem Experiment weitgehend unverändert. Die Gesamtverbesserung war begrenzt, was darauf hindeutet, dass herkömmliche Unterrichtsmethoden oder KI-gestützte Werkzeuge, bei denen die Systemanweisungen nicht optimiert wurden, bei der Transferausbildung nur eine begrenzte Rolle spielen. Es war schwierig, das Lernpotenzial der Studierenden im mehrdimensionalen Sprachtransfer wirksam zu aktivieren.
Die durchschnittlichen Schreibtransferindizes der Experimentalgruppe in den Dimensionen syntaktischer Transfer, struktureller Transfer und kultureller Transfer vor dem Experiment betrugen jeweils 3,0, 2,9 und 2,8; nach dem Experiment stiegen sie auf 4,3, 4,1 und 4,5 an, was einer Steigerung von 1,3, 1,2 bzw. 1,7 entspricht. Dies weist darauf hin, dass die Unterrichtsmethode auf verschiedenen Transferstufen eine gute Interventionswirkung hatte. Die Werte der Kontrollgruppe vor dem Experiment lagen bei 3,0, 3,0 und 2,9. Nach dem Experiment erhöhten sie sich auf 3,4, 3,3 bzw. 3,2, was signifikant niedriger ist als bei der Experimentalgruppe. Besonders hervorzuheben ist, dass die Experimentalgruppe in der Dimension des kulturellen Transfers die stärkste Verbesserung zeigte und von 2,8 auf 4,5 anstieg, also um 1,7 Punkte – ein Anstieg, der deutlich höher liegt als der der Kontrollgruppe mit 0,3 Punkten. Dieses Ergebnis legt nahe, dass die vorgeschlagene Unterrichtsmethode eine bedeutende Rolle dabei spielt, Schülerinnen und Schülern zu helfen, englische kulturelle Ausdrucksnormen zu erkennen und sich an sie anzupassen. Dies spiegelte sich nicht nur in Anpassungen der Sprachform wider, sondern auch in der Steigerung des interkulturellen pragmatischen Bewusstseins der Lernenden sowie in der Vertiefung ihres Verständnisses für die kulturellen Ausdrucksgewohnheiten der Zielsprache. Der Sprachtransfer zeigte sich vor allem in der syntaktischen Komplexität und der Anpassung des Sprachstils sowie anderen Aspekten. Die Studie nutzte automatisierte NLP-Technologie, um Schreibtexte der Schüler eingehend zu analysieren, wichtige sprachliche Merkmale zu extrahieren und in Kombination mit Bewertungen durch Lehrkräfte systematisch Veränderungen in der Sprachtransferfähigkeit der Lernenden über drei Aufgabenrunden hinweg zu bewerten.
Syntaktische Komplexität und sprachlicher Stil
Hinsichtlich der syntaktischen Komplexität erfasste die Studie die durchschnittliche Satzlänge und die Anzahl der Klauselverschachtelungsebenen des von den Studierenden nach Abschluss der vorgegebenen Schreibaufgabe in jeder Runde erstellten Textes. Diese beiden Indikatoren wurden häufig verwendet, um die Komplexität des sprachlichen Ausdrucks zu messen. Sie spiegelten effektiv das Entwicklungsniveau der Studierenden in der Satzvielfalt und der Fähigkeit zur strukturellen Organisation wider, wie in Abbildung 4 dargestellt.
Bei der longitudinalen Entwicklung der syntaktischen Komplexität zeigte die Versuchsgruppe über die drei Aufgabenrunden hinweg einen deutlichen Aufwärtstrend, was auf eine wirksame Förderung der Transfertrainings auf die Fähigkeit der Studierenden zur sprachlichen Strukturierung hindeutet. Aus der Perspektive der durchschnittlichen Satzlänge stieg die Versuchsgruppe von 12,5 Wörtern in Aufgabe 1 auf 16,1 Wörter in Aufgabe 3 an, was einer Zunahme um 3,6 Wörter entspricht und signifikant höher lag als der Anstieg der Kontrollgruppe, die im selben Zeitraum lediglich um 0,9 Wörter zunahm (von 12,4 auf 13,3). Ebenso zeigte sich hinsichtlich der strukturellen Komplexität, gemessen an der Anzahl der Satzeinschachtelungsebenen, dass die Versuchsgruppe von 1,8 auf 2,7 Ebenen anstieg, während die Kontrollgruppe lediglich von 1,7 auf 1,9 Ebenen stieg und damit einen relativ langsamen Anstieg aufwies. Um weiter zu überprüfen, ob der Unterschied in der syntaktischen Komplexität zwischen den beiden Gruppen statistisch signifikant ist, wurden unabhängige Stichproben-t-Tests durchgeführt, um die durchschnittliche Satzlänge und die Anzahl der Satzeinschachtelungsebenen in den drei Phasen der Aufgabe zu analysieren. Die Ergebnisse zeigten einen signifikanten Unterschied zwischen der Versuchsgruppe und der Kontrollgruppe hinsichtlich der durchschnittlichen Satzlänge, t(58) = 4,23, p < 0,001, Cohen’s d = 0,98; ebenso bestand ein signifikanter Unterschied in der Anzahl der Satzeinschachtelungsebenen, t(58) = 3,15, p = 0,002, Cohen’s d = 0,78. Dieser Vergleich zeigte, dass das systematische Transfertraining nicht nur die Fähigkeit der Studierenden zur Konstruktion komplexer Sätze verbesserte, sondern auch ihre Beherrschung grammatischer Organisationsstrategien stärkte. Insbesondere in der dritten Phase der Aufgabe zeigten die Studierenden der Versuchsgruppe eine größere Flexibilität im Gebrauch mehrschichtiger Nebensätze und komplexer Satzstrukturen. Dies spiegelte eine bemerkenswerte Verschiebung ihres Sprachtransfers von einer „funktionalen“ auf eine eher „strategische“ Ebene wider. Der transferorientierte Trainingsansatz verbesserte kontinuierlich die syntaktischen Transferfähigkeiten der Studierenden und überwand damit effektiv die Grenzen des Einzelsatzschreibens sowie die festgelegten Ausdrucksmuster, die häufig im traditionellen Unterricht auftreten. Hinsichtlich der Anpassung des Sprachstils wurden die Schreibtexte der Studierenden vor und nach dem Experiment extrahiert. Mithilfe des NLP-Modells wurden der Anteil formaler Vokabeln und die Häufigkeit der Verwendung der Passivkonstruktion als zentrale Indikatoren zur Bewertung der Übereinstimmung des akademischen Sprachstils ermittelt. Diese Indikatoren spiegelten wider, ob die Studierenden über das sprachliche Bewusstsein und die Ausdrucksfähigkeit verfügen, um sich im englischen Schreiben an den Zielstil anzupassen. Die entsprechenden Ergebnisse sind in Abbildung 5 dargestellt.
Abbildung 5 zeigt die Veränderungen beim akademischen Stil-Matching der Versuchsgruppe und der Kontrollgruppe vor und nach der Aufgabe, wobei der Fokus hauptsächlich auf den beiden zentralen Indikatoren Anteil formaler Vokabeln und Häufigkeit der Passivkonstruktionen liegt. Insgesamt verbesserte sich nach Abschluss des Transfertrainings auf Basis des DeepSeek-Modells die Fähigkeit der Versuchsgruppe zur Anpassung an den akademischen Stil deutlich, was die Wirksamkeit dieser Unterrichtsmethode bei der Förderung des Bewusstseins der Studierenden für Sprachnormen und ihrer Anpassungsfähigkeit an akademische Schreibstile belegt. Hinsichtlich des Anteils formaler Vokabeln stieg die Versuchsgruppe von 0,42 vor der Aufgabe auf 0,56 nach der Aufgabe, was einen relativ deutlichen Anstieg darstellt. Im Gegensatz dazu stieg die Kontrollgruppe nur leicht von 0,43 auf 0,48, was auf eine begrenzte Verbesserung hindeutet. Dieses Ergebnis zeigt, dass die Studierenden der Versuchsgruppe nach systematischer Anleitung durch Prompts und Rückmeldungen des Modells im Schreibprozess stärker dazu neigten, formale Vokabeln zu verwenden, die den Anforderungen des akademischen Stils entsprechen, und dass sich ihr Sprachstil schrittweise den Standards des englischen wissenschaftlichen Schreibens annäherte. Bezüglich der Häufigkeit der Passivkonstruktionen stieg die Versuchsgruppe signifikant von 0,18 vor der Aufgabe auf 0,27 nach der Aufgabe, was einem Anstieg um 0,09 entspricht; die Kontrollgruppe hingegen stieg lediglich um 0,02.
Um weiter zu überprüfen, ob die oben genannten Veränderungen statistisch signifikant sind, wurde eine unabhängige Stichproben-t-Test-Analyse der Daten vor und nach der Aufgabe durchgeführt. Die Ergebnisse zeigten, dass die Versuchsgruppe eine signifikante Verbesserung im Anteil formaler Vokabeln aufwies, t(58) = 3,89, p < 0,001, Cohens d = 0,92; auch der Anstieg der Häufigkeit der Verwendung der Passivkonstruktion war signifikant, t(58) = 4,56, p < 0,001, Cohens d = 1,05. Dies zeigte, dass die Schüler der Versuchsgruppe bei der sprachstilistischen Anpassung deutliche Fortschritte erzielt hatten, und diese Fortschritte waren kein Zufall, sondern das Ergebnis der kombinierten Wirkung systematischer Hinweisgaben und Modell-Feedbacks.
Statistische Überprüfung
Zusätzlich wurde, um die Zuverlässigkeit von KI-generierten Inhalten im Lehrkontext weiter zu überprüfen, ein Vergleich der mittleren Bewertungen von KI-generierten und lehrergenerierten Inhalten bei verschiedenen Prompt-Typen durchgeführt. Die Übereinstimmung zwischen beiden wurde durch Berechnung des Pearson-Korrelationskoeffizienten ermittelt. Die entsprechenden Vergleichsergebnisse sind in Tabelle 4 dargestellt. Tabelle 4 zeigt die Konsistenz zwischen den von der KI generierten Bewertungen und den Bewertungen der Lehrkräfte bei fünf Typen von transferorientierten Prompts. Aus Sicht der mittleren Punktzahl lag die Bewertung durch die KI insgesamt leicht unter der Bewertung durch die Lehrkräfte, doch die Differenz befand sich bei den meisten Aufgabentypen im vertretbaren Bereich, was darauf hinweist, dass das DeepSeek-Modell bei der Bewertung von Schreibaufgaben mit Transfer eine hohe Stabilität und Referenzqualität aufweist. Bei syntaktischem Transfer betrug die durchschnittliche Bewertung durch die Lehrkräfte 4,1 und die KI-Bewertung 4,0, sodass lediglich eine Differenz von 0,1 bestand. Bei strukturellem und logischem Transfer lag die KI-Bewertung jeweils nur 0,1 Punkte unter der Bewertung der Lehrkräfte, was darauf hindeutet, dass das Modell die Bewertungskriterien der Lehrkräfte bei Aufgaben mit hohem strukturellem Sprachanteil und klaren Regeln gut nachbilden kann. Im Gegensatz dazu sind die Bewertungsabweichungen bei kulturellem Transfer und Registertransfer deutlicher: Die KI-Bewertungen betrugen hier 3,6 bzw. 3,7, also jeweils 0,2 Punkte weniger als die Bewertungen der Lehrkräfte. Dies spiegelt wider, dass die KI bei Aufgaben mit hoher Subjektivität, wie semantischen Implikationen und kultureller Pragmatik, noch gewisse Grenzen aufweist. Die Interrater-Reliabilität wurde mittels ICC (n = 5 Rater) ermittelt. Der Gesamt-ICC für die manuelle Bewertung betrug 0,86, und die ICCs für jede Dimension lagen zwischen 0,82 und 0,89, was auf eine zufriedenstellende Übereinstimmung zwischen den Bewertern hindeutet.
Eine weitere Analyse des Pearson-Korrelationskoeffizienten ergab, dass die Konsistenz der Bewertungen unter verschiedenen Aufgabenstellungen auf einem hohen Niveau lag. Dies zeigt, dass die KI-Bewertung nicht nur hinsichtlich des Wertes nahe bei der Einschätzung des Lehrers lag, sondern auch eine gute lineare Beziehung in ihrem Bewertungstrend aufweist. Dabei war der Konsistenzkoeffizient für die syntaktische Transfer-Aufgabe mit 0,87 am höchsten, während die Werte für die strukturelle und logische Transfer-Aufgabe bei 0,83 bzw. 0,85 lagen. Dies deutet darauf hin, dass die Bewertungsergebnisse der KI hinsichtlich syntaktischer Komplexität, Absatzorganisation und logischer Kohärenz mit der Einschätzung des Lehrers stark übereinstimmen. Dies könnte darauf zurückzuführen sein, dass diese Aufgaben klare Ziele und quantifizierbare sprachliche Merkmale aufweisen, was die Mustererkennung und eine stabile Bewertung durch das Modell erleichterte. Der Korrelationskoeffizient für die fachliche Transfer-Aufgabe beträgt 0,81. Obwohl dieser leicht gesunken war, zeigte er dennoch eine starke Bewertungsfähigkeit und legt nahe, dass die KI ein gewisses Maß an Beurteilungskompetenz auf der Ebene der stilistischen Anpassung besitzt. Der Konsistenzkoeffizient für die kulturelle Transfer-Aufgabe lag hingegen nur bei 0,79, was niedriger als bei den anderen Typen ist, aber dennoch im akzeptablen Bereich liegt.
Um die Anwendbarkeit verschiedener Arten von Prompts im Lehrkontext und deren Akzeptanz durch Lehrkräfte zu untersuchen, wurde ein Fragebogen zur Zufriedenheit mit der Prompt-Antwortreaktion konzipiert. Fünf Englischlehrer (mit den Nummern T1–T5) wurden eingeladen, die Generierungsvorschläge von fünf verschiedenen Prompt-Typen anhand einer fünfstufigen Skala (von sehr unzufrieden bis sehr zufrieden) zu bewerten, wie in Abbildung 6 dargestellt: Die Bewertungen der fünf Lehrkräfte für die fünf Prompt-Typen weichen leicht voneinander ab, insgesamt war die Anerkennung jedoch hoch. Dabei erzielten die Prompts „syntaktischer Transfer“ und „kultureller Transfer“ die höchsten Werte mit einem Durchschnitt von 4,0 und spiegeln eine hohe Praktikabilität und Anpassungsfähigkeit im Unterricht wider. Im Gegensatz dazu schnitt der Prompt-Typ „Register-Transfer“ relativ schlecht ab, mit einem Durchschnittswert von lediglich 2,4; einige Lehrkräfte wie T4 und T5 vergaben die niedrigsten Bewertungen, was darauf hinweist, dass die Leitfunktion und Anpassungsfähigkeit dieses Prompt-Typs im Unterrichtseinsatz noch verbessert werden müssen.
Auf individueller Ebene zeigten sich deutliche Unterschiede in den Bewertungstendenzen der Lehrkräfte. Die Gesamtpunktzahl von T1 war positiv, was auf ein hohes Maß an Akzeptanz des KI-unterstützten Schreibens hinweist, während die Bewertungen von T5 in mehreren Prompt-Dimensionen niedrig waren, insbesondere bei „Register Transfer“ und „Logic Transfer“. Dieser Unterschied könnte mit der Unterrichtserfahrung, der Sprachpräferenz oder der Vertrautheit der Lehrkräfte mit KI-Tools zusammenhängen, was darauf hindeutet, dass zukünftige Prompt-Konzepte personalisierte Anpassungsmechanismen berücksichtigen müssen, um die Akzeptanz bei verschiedenen Lehrergruppen zu erhöhen. Um den tatsächlichen Effekt des KI-unterstützten Unterrichts auf die Verbesserung der Schreibqualität der Schüler weiter zu überprüfen, verglich die Studie die Veränderungen der Gesamtpunktzahlen der Experimentalgruppe und der Kontrollgruppe, wie von den Lehrkräften bewertet, vor und nach dem Experiment. Die Vergleichsergebnisse sind in Abbildung 7 dargestellt.
Wie in Abbildung 7 dargestellt, zeigten die Gesamtpunktzahlen der Experimental- und Kontrollgruppe, wie von Lehrkräften vor und nach dem Experiment bewertet, signifikante Unterschiede. Insgesamt zeigte die Gesamtpunktzahl der Experimentalgruppe nach der unterrichtlichen Optimierungsmaßnahme, die auf dem DeepSeek-Modell basiert, einen signifikanten Anstieg. Im Gegensatz dazu war die Punktzahlanpassung in der Kontrollgruppe relativ geringfügig. Die durchschnittliche Bewertung der Experimentalgruppe durch die Lehrkräfte lag vor dem Experiment bei 59,1 Punkten und stieg nach dem Experiment signifikant auf 74,4 Punkte an, was einer Steigerung um 15,3 Punkte entspricht. Dies deutet darauf hin, dass der Einsatz von KI-gestütztem Unterricht einen positiven Einfluss auf die Schreibqualität der Schüler hatte. Aus dem Boxplot ging hervor, dass sich auch die Streubreite der Punktzahlen der Experimentalgruppe erweitert hatte. Insbesondere liegt der Punkte-„Box“ nach dem Experiment deutlich höher als vorher, und die oberen Maximal- sowie die unteren Minimalwerte sind angestiegen, was anzeigt, dass das allgemeine Niveau der Schüler signifikant gestiegen ist. Im Gegensatz dazu waren die Veränderungen der Punktzahlen in der Kontrollgruppe relativ gering. Vor dem Experiment lag die durchschnittliche Punktzahl der Kontrollgruppe bei 60,1 Punkten und stieg nach dem Experiment auf 64,9 Punkte, was einer Zunahme von 4,8 Punkten entspricht. Dieser Anstieg war deutlich geringer als der der Experimentalgruppe, und die Verteilung der Punktzahlen in der Kontrollgruppe veränderte sich vor und nach dem Experiment kaum, was darauf hinweist, dass herkömmliche Unterrichtsmethoden oder nicht optimierte KI-gestützte Werkzeuge nur eine begrenzte Wirkung auf die Verbesserung der Schreibqualität haben.
Darüber hinaus verwendete diese Studie die Transfer-Kognitionstabelle, um die Studierenden bei drei Runden der Selbsteinschätzung ihrer Fähigkeitsentwicklung in Bereichen wie Strukturumstellung, Satzumformung und kultureller Ausdruck zu begleiten, um den sich verändernden Trend des metakognitiven Bewusstseins der Studierenden und ihre Beherrschung von Transferstrategien widerzuspiegeln. Die Ergebnisse sind in Abbildung 8 dargestellt. Gemäß den Daten des Radarcharts zur Selbsteinschätzung der Studierenden bezüglich ihrer Transferfähigkeit, wie in Abbildung 8 gezeigt, wiesen die Selbsteinschätzungen der Studierenden in den fünf Dimensionen Strukturtransfer, syntaktischer Transfer, kultureller Transfer, Registertransfer und logischer Transfer über die drei Aufgabenrunden hinweg einen kontinuierlich ansteigenden Trend auf, was darauf hindeutet, dass unter der unterrichtsoptimierenden Lehrintervention basierend auf dem DeepSeek-Modell die Fähigkeit der Studierenden, Transferstrategien anzuwenden, signifikant verbessert wurde. In der ersten Runde der Aufgaben waren die Selbsteinschätzungswerte der Studierenden insgesamt niedrig. Unter den fünf Dimensionen erreichten „Strukturtransfer“ und „logischer Transfer“ jeweils 3,2 und 3,0 Punkte, während „kultureller Transfer“ und „Registertransfer“ 2,5 bzw. 2,7 Punkte erreichten, was darauf hinweist, dass die Studierenden bei der Identifizierung und Anwendung von Transferstrategien noch unerfahren waren. Bis zur zweiten Runde der Aufgaben hatten sich die Werte aller Kategorien verbessert: „Strukturtransfer“ stieg auf 3,8, „syntaktischer Transfer“ auf 3,5 und „logischer Transfer“ auf 3,7. Dies zeigte, dass die Studierenden unter Anleitung der Lehrenden und mit Unterstützung durch Modell-Feedback nach und nach die zentralen Aspekte grundlegender Transferoperationen erfasst und diese erstmals in der praktischen Textproduktion angewandt hatten. In der dritten Runde der Aufgaben stiegen die Selbsteinschätzungswerte der Studierenden deutlich an, wobei „Strukturtransfer“ und „logischer Transfer“ jeweils 4,5 und 4,3 erreichten, und die anderen Dimensionen lagen ebenfalls stabil über 4,0 Punkten, was den anhaltenden Effekt mehrfacher Transferübungen bei der Verbesserung der sprachlichen Formkontrolle und Textkonstruktionsfähigkeit der Studierenden zeigt. Zu diesem Zeitpunkt hatten die Studierenden eine grundlegende kognitive Schleife zwischen Verstehen, Ausführung und Reflexion von Transferstrategien ausgebildet. Neben der Lehrkräfte-Rückmeldung verteilte die Studie auch einen Fragebogen zur Zufriedenheit mit der KI-gestützten Schreibfunktion an alle Studierenden der Experimentalgruppe, wobei insgesamt 30 gültige Fragebögen eingesammelt wurden. Der Fragebogen bewertete die Leistung der KI in drei Funktionsmodulen: Umschreibungsvorschläge, strukturelle Optimierung und kulturelle Hinweise, und forderte die Studierenden auf, Optionen gemäß fünf Bewertungsstufen auszuwählen. Die Ergebnisse sind in Tabelle 5 dargestellt.
Laut den Ergebnissen der Studierenden-Zufriedenheitsumfrage zu KI-unterstützten Schreibfunktionen, wie in Tabelle 5 dargestellt, äußerten sich die Studierenden der Experimentalgruppe insgesamt positiv zur Leistung der KI in den drei Funktionsmodulen „Umschreibungsvorschläge“, „strukturelle Optimierung“ und „kulturelle Hinweise“, was die guten Anwendungsperspektiven von KI-gestützten Schreibsystemen bei der Verbesserung der Effizienz der Schreibförderung und der Qualität der Lehrunterstützung zeigt. Insgesamt gaben über 90 % der Studierenden bei den beiden Funktionsbereichen „Umschreibungsvorschläge“ und „strukturelle Optimierung“ an, „sehr zufrieden“ oder „zufrieden“ zu sein, wobei die Zufriedenheit mit „Umschreibungsvorschlägen“ am höchsten war und 91 % erreichte. Dies zeigt eine hohe Anerkennung der Fähigkeit der KI bei der syntaktischen Neugestaltung und sprachlichen Überarbeitung. Im Vergleich dazu war die Zufriedenheit mit der Funktion „kulturelle Hinweise“ etwas geringer, erreichte jedoch immer noch 83 %, was darauf hindeutet, dass, obwohl die KI bei der Anleitung zur kulturübergreifenden Ausdrucksweise gewisse Komplexität und Subjektivität aufweist, ihre Unterstützung dabei, native kulturelle Einflüsse zu erkennen und anzupassen, von den meisten Studierenden anerkannt wird. Hinsichtlich Unzufriedenheit lag der Anteil der Studierenden, die bei den drei Funktionen „unzufrieden“ oder „sehr unzufrieden“ ankreuzten, unter 5 %, was darauf schließen lässt, dass die KI-unterstützten Funktionen in den meisten Anwendungsszenarien eine gute Bedienbarkeit und Akzeptanz aufweisen. Bemerkenswert ist, dass der Anteil der Studierenden, die bei „kulturelle Hinweise“ die Bewertung „durchschnittlich“ wählten, relativ hoch war, was darauf hindeutet, dass die derzeitige KI bei der Bearbeitung kultureller Anpassungsfragen die Erwartungen der Studierenden noch nicht vollständig erfüllt und hier weiterer Verbesserungsbedarf besteht. Eine umfassende Analyse zeigt, dass das auf DeepSeek basierende Verfahren zur Optimierung von Anweisungen von den Studierenden weithin anerkannt wurde, insbesondere hinsichtlich der Unterstützung der Sprachform.
RM-ANOVA
Eine zweifaktorielle Varianzanalyse mit Messwiederholung (RM-ANOVA) wurde durchgeführt, um die Effekte der Gruppe (zwischensubjektiver Faktor: experimentelle Gruppe vs. Kontrollgruppe) und der Zeit (innerhalbssubjektiver Faktor: Pre-Test, Aufgabe 1, Aufgabe 2, Aufgabe 3, Post-Test) sowie deren Wechselwirkung auf die Transferleistung der Studierenden im englischen Schreiben zu untersuchen. Der Mauchly-Test zeigte eine Verletzung der Sphärizitätsannahme (p < 0,05), daher wurde die Greenhouse-Geisser-Korrektur angewandt, um die Freiheitsgrade für innerhalbssubjektive Effekte anzupassen. Alle Analysen basierten auf n = 30 Teilnehmenden pro Gruppe. Die Ergebnisse sind in Tabelle 6 dargestellt:
Die Ergebnisse der Varianzanalyse mit wiederholten Messungen und Greenhouse-Geisser-Korrektur zeigten signifikante Haupteffekte der Faktoren Gruppe, Zeit sowie der Gruppen-Zeit-Wechselwirkung über alle gemessenen Dimensionen hinweg (p < 0,001). Für den Gesamttransferindex wurde ein signifikanter Gruppeneffekt beobachtet (F(1,58) = 76,32), zusammen mit einem signifikanten Zeit-Effekt (F(2,14,124,12) = 92,75) und einer signifikanten Gruppe × Zeit-Wechselwirkung (F(2,14,124,12) = 68,49), was darauf hindeutet, dass sich die Veränderungen der Gesamttransferleistung im Zeitverlauf zwischen den Gruppen signifikant unterschieden.
Ebenso zeigte der syntaktische Transfer signifikante Effekte der Gruppe (F(1,58) = 52,18), der Zeit (F(2,11,122,38) = 71,26) und der Wechselwirkung zwischen Gruppe und Zeit (F(2,11,122,38) = 45,73), was auf unterschiedliche Entwicklungsverläufe in der Fähigkeit zum syntaktischen Transfer zwischen den Gruppen und Messzeitpunkten hinweist. Bei der strukturellen Übertragung wurden ebenfalls signifikante Gruppen- (F(1,58)=48,65), Zeit- (F(2,09,121,22) = 67,81) und Interaktionseffekte (F(2,09,121,22) = 41,36) gefunden, was auf konsistente Verbesserungen mit gruppenspezifischen Entwicklungsverläufen schließen lässt. Bemerkenswerterweise wies die kulturelle Übertragung die stärksten Effekte auf, mit einem signifikanten Gruppeneffekt (F(1,58) = 81,44), einem ausgeprägten Zeit-Effekt (F(2,07,119,96) = 98,52) sowie einer robusten Wechselwirkung zwischen Gruppe und Zeit (F(2,07,119,96) = 79,27), was auf das stärkste und am deutlichsten differenzierte Wachstumsmuster in dieser Dimension hindeutet. Insgesamt zeigen alle Indizes statistisch signifikante Effekte, was bestätigt, dass die Intervention über die Zeit hinweg einen stabilen und differenzierten Einfluss auf die Entwicklung des Transfers hatte.
VERFÜGBARKEIT VON DATEN:
Alle während dieser Studie generierten oder analysierten Daten sind in diesem Artikel enthalten. Die rohen Bewertungsdaten sind in Zusätzliche Tabelle 1 angegeben.

Abbildung 1: Schritte zur Transformation der Satzstruktur. (A) Strategien zum Kombinieren und Stärken von Verben zur Verbesserung der Satzstruktur. (B) Alternative Subjektumformungen, einschließlich gerundialer, infinitiver und nominalisierter Subjekte. (C) Nutzung nicht-finiter Phrasen zur Steigerung der Satzvielfalt und -prägnanz. (D) Beispiele überarbeiteter Endfassungen, die einen verbesserten akademischen Stil und eine interkulturell angemessenere englische Ausdrucksweise veranschaulichen. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 2: Aufgabenentwicklungsbaumdiagramm. Es zeigt die fortschreitende Struktur von vierstufigen Transferaufgaben, beginnend auf der Ebene des Satzes, über den Absatz und den Diskurs bis hin zur Kulturebene. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 3: Vergleich der Schreibtransferfähigkeit vor und nach dem Experiment. Das Radar-Diagramm zeigt die Testergebnisse vor und nach dem Experiment für die Experimental- und Kontrollgruppe in den Dimensionen syntaktischer, struktureller und kultureller Transfer. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 4: Diagramm zur Entwicklung der syntaktischen Komplexität. Dargestellt sind die Veränderungen der durchschnittlichen Satzlänge und der Anzahl der Nebensatzebenen über drei Trainingsaufgaben hinweg. Bitte klicken Sie hier, um eine vergrößerte Darstellung dieser Abbildung anzusehen.

Abbildung 5: Übereinstimmung akademischer Fachbegriffe. Diese Abbildung zeigt die Unterschiede im Anteil des formalen Wortschatzes und in der Häufigkeit des Passivs vor und nach der Intervention. Klicken Sie bitte hier, um eine vergrößerte Darstellung dieser Abbildung anzusehen.

Abbildung 6: Heatmap der Zufriedenheit mit Prompt-Antworten. Hier werden Bewertungen von fünf Arten von Prompt-Vorlagen durch teilnehmende Lehrkräfte zusammengefasst. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 7: Boxplot der Veränderungen in den Lehrereinschätzungen. Der Boxplot zeigt die Verteilung und Gesamtveränderungen der vom Lehrer bewerteten Schreibfähigkeiten für zwei Gruppen vor und nach dem Experiment. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 8: Radar-Diagramm zur selbst eingeschätzten Transferfähigkeit der Studierenden. Es zeigt die von den Studierenden vergebenen Bewertungswerte entlang fünf Transferdimensionen über drei Trainingsrunden hinweg. Bitte klicken Sie hier, um eine vergrößerte Darstellung dieser Abbildung anzusehen.
| Eingabe | Lehreraktion | Art der Aufforderung | Schüleraktion | Ausgabe | Bewertungskriterien |
| Ursprüngliche Schreibentwürfe der Schüler (Sätze/Absätze/Texte) | 1. Übertragungstypen und Aufgabenniveaus kennzeichnen 2. Bei Bedarf die Parameter der Aufforderung anpassen | Einfache Übertragungsaufforderung / Dreistufige verschachtelte Aufforderungskette | 1. Strategien zur Textübertragung erlernen 2. Entwürfe anhand des KI-Feedbacks überarbeiten 3. Selbstbewertung durchführen | Vom KI-System überarbeiteter Text + Endgültige, vom Schüler überarbeitete Fassung | Syntaktische Komplexität, strukturelle Nachvollziehbarkeit, kulturelle Angemessenheit, logische Kohärenz, Standardisierung des Sprachstils (Skala 0–5) |
Tabelle 1: Zusammenfassung der Arbeitsabläufe. Diese Tabelle fasst den gesamten operationellen Arbeitsablauf des KI-unterstützten Englisch-Schreib-Transfertrainings zusammen, einschließlich der Eingabematerialien, der Lehrer- und Schülertätigkeiten, der Prompt-Typen, der endgültigen Ausgaben und der entsprechenden Bewertungskriterien.
| Projektkategorie | Inhaltsverzeichnis |
| Verständnis der Missionsziele | Beschreiben Sie kurz die Migrationsziele dieser Runde von Schreibaufgaben, wie beispielsweise strukturelle Anpassung, kulturelle Adaption und Sprachumwandlung. |
| Verwendete Migrationsstrategie | Bitte listen Sie die von Ihnen angewandten Migrationsstrategien auf (mehrere Auswahlmöglichkeiten sind zulässig): |
| Strukturelle Anpassung |
| Satzumformung |
| Sprachwechsel |
| Kulturelle Manifestation |
| Stärkung der logischen Verbindung |
| Sonstiges:_______ |
| Beispiele und Anweisungen umschreiben | Wählen Sie 1–2 überarbeitete Sätze aus, zeigen Sie die Versionen vor und nach der Überarbeitung an, und erläutern Sie die Gründe für die Änderungen sowie die angestrebten Übertragungsziele. |
| Schwierigkeiten und auftretende Zweifel | Beschreiben Sie etwaige Herausforderungen, die während der Migration aufgetreten sind, oder Fragen, die Sie zu einem bestimmten Ausdruck hatten. |
Selbsteinschätzungsskala
(von 5 Punkten) | Bitte bewerten Sie Ihre Textumformulierung anhand der folgenden drei Aspekte: |
| • Genauigkeit der Strategieanwendung (/5) |
| • Natürliche Ausdrucksflüssigkeit (/5) |
| • Kulturelle Passung (/5) |
| Zukünftige Ziele zur Verbesserung der Schreibfähigkeiten | Beschreiben Sie kurz die Übertragbarkeit, die Sie in der nächsten Trainingsrunde stärken oder optimieren möchten. |
Tabelle 2: Kognitionstabelle zum Wissenstransfer. Eine Bewertungsskala von 1 bis 5 (1 = keine Beherrschung, 5 = vollständige Beherrschung) wird für die Selbsteinschätzung der Studierenden hinsichtlich Strategien des Wissenstransfers beim Schreiben verwendet.
| Indikatorname | Beschreibung | Datenquelle |
| Schreibübertragungsindex (0–5) | Ein quantitativer Indikator, der umfassend die Fähigkeit zur Sprachübertragung misst und drei Ebenen abdeckt: Syntax, Struktur und Kultur. | Automatische Bewertung durch das System + manuelle Bewertung durch Lehrkräfte |
| Syntaxkomplexitätsbewertung | Enthält durchschnittliche Satzlänge, Anzahl der Nebensatzeinbettungen, Reichhaltigkeit der Verbphrasen usw. | Automatische NLP-Analyse |
| Übereinstimmung mit akademischem Stil | Erfüllt es die Standards des englischsprachigen wissenschaftlichen Schreibens? | Beurteilung durch Natural-Language-Processing-Modell |
| Zufriedenheit mit der Prompt-Beantwortung | Akzeptanz und praktische Bewertung der vom Modell generierten Vorschläge durch Lehrkräfte | Lehrerfragebogen |
| Änderungen in der Lehrerbewertung | Vergleich der Bewertungen durch Lehrkräfte vor und nach dem Experiment, um die Verbesserung der Schreibqualität widerzuspiegeln | Aufzeichnungen der Lehrerbewertungen |
| Selbsteinschätzung der Übertragungsfähigkeit durch Studierende | Studierende bewerten selbst ihre Beherrschung verschiedener Übertragungsdimensionen | Ausfüllen des Migrationsbewusstseinsformulars |
Tabelle 3: Zusammenfassung der Evaluierungskennzahlen, Beschreibungen und Datenquellen. Diese Tabelle erläutert die Definitionen, Messmethoden und ursprünglichen Datenquellen für jede zentrale Evaluierungskennzahl dieser Studie.
| Prompt-Typ | Durchschnittliche Bewertung durch Lehrkräfte | Durchschnittliche KI-Bewertung | Pearsonscher Korrelationskoeffizient |
| Strukturelle Übertragung | 4 | 3.9 | 0.83 |
| Syntaktische Übertragung | 4.1 | 4 | 0.87 |
| Kulturelle Übertragung | 3.8 | 3.6 | 0.79 |
| Registerübertragung | 3.9 | 3.7 | 0.81 |
| Logische Übertragung | 4.2 | 4.1 | 0.85 |
Tabelle 4: Vergleich der Konsistenz zwischen KI-generierten Inhalten und Lehrerbewertungen. Die Ergebnisse zeigen die Übereinstimmung zwischen KI-generierten Inhalten und Lehrerbewertungen über verschiedene Prompt-Typen hinweg.
| Funktionsmerkmale | Sehr zufrieden | Zufrieden | Teils zufrieden | Unzufrieden | Sehr unzufrieden |
| Vorschlag zur Überarbeitung | 66% | 25% | 7% | 1,50% | 0,50% |
| Strukturelle Optimierung | 60% | 30% | 7% | 2% | 1% |
| Kulturelle Hinweise | 55% | 28% | 12% | 3,50% | 1,50% |
Tabelle 5: Umfragestatistiken zur Zufriedenheit der Studierenden mit KI-unterstützten Funktionen. Die Statistiken zeigen die Verteilung der Zufriedenheit der Studierenden hinsichtlich der KI-Umschreibung, der strukturellen Optimierung und der kulturellen Anweisungsfunktionen.
| Maß | Gruppe F(df) | Zeit F(df)GG | Gruppe × Zeit F(df)GG | p |
| Gesamttransferindex | 76,32 (1, 58) | 92,75 (2,14, 124,12) | 68,49 (2,14, 124,12) | <0,001 |
| Syntaktischer Transfer | 52,18 (1, 58) | 71,26 (2,11, 122,38) | 45,73 (2,11, 122,38) | <0,001 |
| Struktureller Transfer | 48,65 (1, 58) | 67,81 (2,09, 121,22) | 41,36 (2,09, 121,22) | <0,001 |
| Kultureller Transfer | 81,44 (1, 58) | 98,52 (2,07, 119,96) | 79,27 (2,07, 119,96) | <0,001 |
Tabelle 6: Zusammenfassung der Ergebnisse der Varianzanalyse mit Messwiederholung. Es werden die Ergebnisse der zweifaktoriellen Varianzanalyse mit Messwiederholung für die Gesamtleistung im Schriftsprachtransfer und deren drei Teilbereiche dargestellt, einschließlich der Haupteffekte von Gruppe, Zeit und der Wechselwirkung zwischen Gruppe und Zeit. Abkürzungen: GG = Greenhouse–Geisser-Korrektur.
Zusatzliche Tabelle 1: Auswertung der Rohdaten. Enthält die Rohdaten, die in allen Analysen dieser Studie verwendet wurden.Bitte klicken Sie hier, um die Datei herunterzuladen.