Het onderwijzen van experimenteel ontwerp
Deze studie maakte gebruik van de basis open-source versie van DeepSeek, waarbij werd vertrouwd op de open API-interface van het platform voor programmaanroepen. De volledige set van vijf prompt-sjablongesteksten, vier niveaus van taakvoorbeeldvermeldingen, transfer-annotatiecategorielabels en regels voor de mapping van schrijffout-sjabloonmatching zijn samengesteld in de aanvullende bijlage. Het systeem had vaste aanroepparameters: een temperatuurcoëfficiënt van 0,7, en de gegenereerde lengte werd dynamisch beperkt op basis van het type schrijfvraag. Het volgde strikt een vaste sequentie van semantische reconstructie > stilistische aanpassing > culturele adaptatie, waarbij geneste prompt-chain aanroepen werden uitgevoerd. De modeloutput werd door de instructeur handmatig geselecteerd voor effectieve teksten in het klaslokaalonderwijs.
Voor deze studie werden drie fulltime docenten academisch Engels schrijven met meer dan 5 jaar ervaring uitgenodigd om deel te nemen aan de handmatige scoretoekenning. Alle beoordelaars ontvingen gestandaardiseerde training voorafgaand aan de officiële scoring, waarbij zij zich verdiepten in de beoordelingsdimensies, het 5-puntssysteem, culturele transfer, syntaxis, discours en andere scorendetails, waarna zij een kalibratie voorafgaand aan de scoring voltooiden. Alle essays van studenten werden onafhankelijk door twee docenten gescoord in een blinde, dubbelblinde scoringmodus. Indien het verschil tussen de scores van de twee beoordelaars meer dan 1 punt bedroeg (op een schaal van 5), trad een derde senior docent op als arbiter, waarbij het gemiddelde van de twee geldige scores als de uiteindelijke handmatige score voor dat monster werd gehanteerd. Twee groepen beoordelaars waren betrokken bij de evaluatiefase voor verschillende onderzoeksdoeleinden. Drie fulltime docenten academisch Engels schrijven met meer dan 5 jaar onderwijservaring voerden de blinde, dubbele scoring uit van alle schrijfmonsters van studenten in het formele experiment, en een derde senior docent fungeerde als arbiter wanneer scoreverschillen meer dan 1 punt bedroegen op de 5-puntsschaal. Daarentegen namen vijf beoordelaars deel aan de test voor interbeoordelaarsbetrouwbaarheid met behulp van de Intraclass Correlation Coefficient (ICC), die afzonderlijk werd uitgevoerd om de consistentie van de beoordelingsnormen tussen de beoordelaars te verifiëren. Het verschil in het aantal beoordelaars vloeit voort uit verschillende functionele vereisten: drie kern-docenten waarborgden de praktische scoring van de experimentele data, terwijl het uitgebreide panel van vijf beoordelaars robuuster bewijs leverde voor de betrouwbaarheid van het gehele evaluatiesysteem.
Syntactische complexiteit, BERT-tekststructuurscore en semantische gelijkenis worden allemaal gescoord binnen een bereik van 0–5 punten. De wegingen voor elke dimensie werden vastgesteld volgens de normen voor het onderwijs en onderzoek in het schrijven van vreemde talen: syntaxis 0,35, tekststructuur 0,35, en logica en cultuur 0,3. De wegingswaarden waren gebaseerd op volwassen kwantitatieve evaluatiesystemen voor schrijfwerk in hetzelfde vakgebied. De AI-automatische scoremodule werd gekalibreerd met drempelwaarden op basis van 15 vooraf geclassificeerde modeleessays. De menselijke scoretoekenning volgde een uniforme vijfpunts graderingsschaal. De machinescore en menselijke kalibratie werden gecombineerd voor een verificatie voorafgaand aan het experiment vóór de formele evaluatie.
De onderwijstaak werd uitgevoerd rondom de drieniveau-transferdoelen van "syntaxis-structuur-cultuur", met drie trainingsrondes van elk één week. De eerste ronde bestond uit herschrijven op zinsniveau om de syntactische diversiteit en de nauwkeurigheid van de uitdrukking te verbeteren; de tweede ronde omvatte structurele reconstructie op paragraafniveau om de organisatie van paragrafen en de logische coherentie te versterken; de derde ronde hield transfer op cultureel niveau in om het cross-culturele pragmatische bewustzijn en de aanpasbaarheid van de uitdrukking te versterken. Gezien de herhaalde metingen die bij identieke deelnemers werden verzameld tijdens de pretest, drie opeenvolgende trainingsronden en de posttest, werd een herhaalde-metingen variantieanalyse (RM-ANOVA) gehanteerd als primaire statistische methode om de hoofdeffecten van de groep (experimenteel vs. controle), de hoofdeffecten van het testmoment, en het interactie-effect tussen groep × tijd te onderzoeken, wat weerspiegelde of de scoreveranderingen gedurende de training verschilden tussen de twee cohorten. De aanname van sfericiteit werd geverifieerd via de test van Mauchly; de correctie van Greenhouse–Geisser werd toegepast indien de sfericiteit werd geschonden. T-toetsen voor onafhankelijke steekproeven werden uitsluitend gereserveerd voor post-hoc paarsgewijze vergelijkingen tussen groepen op individuele tijdstippen, terwijl de correlatie van Pearson en de d van Cohen respectievelijk werden gebruikt voor de consistentie van de scores en de kwantificering van de effectgrootte.
Alle statistische analyses waren vooraf vastgesteld vóór de gegevensverzameling. Er werden t-toetsen voor onafhankelijke steekproeven gebruikt om de schrijfindicatoren voor en na de interventie tussen twee groepen te vergelijken, waarbij de primaire nulhypothese uitging van geen intergroepsverschillen in de transferprestaties van het schrijven. Pearson-correlatieanalyse werd gebruikt om de lineaire associatie tussen de automatische AI-score en de handmatige beoordelingen van de docent te kwantificeren, en de d van Cohen werd berekend als de gestandaardiseerde effectgrootte voor de vergelijkingen tussen de groepen. De significantiedrempel werd vastgesteld op α = 0.05 voor alle hypothesetoetsingen, en er werden 95% betrouwbaarheidsintervallen berekend naast alle toetsstatistieken. SPSS 26.0 werd gebruikt voor alle statistische berekeningen. Er waren geen ontbrekende gegevens in de testscores van de studenten en de vragenlijst-datasets, aangezien alle deelnemers de volledige training van drie ronden en de relevante beoordelingen hadden voltooid; daarom was er geen imputatie of verwijdering van casussen voor ontbrekende waarden nodig.
Constructie van het evaluatie-indexsysteem
Om de prestaties van studenten bij de transfertraining voor Engels schrijven volledig te evalueren, heeft deze studie een multidimensionaal evaluatiesysteem opgezet dat de transferdoelen op drie niveaus van "syntaxis-structuur-cultuur" beslaat, waarbij taalvaardigheid, modelrespons, feedback vanuit het onderwijs en zelfcognitie zijn geïntegreerd en zes kernindicatoren zijn vastgesteld. Ten eerste was de "index voor schrijftransfer" een integrale evaluatieindicator die syntactische diversiteit, structurele helderheid en culturele aanpassingsvermogen omvatte, waarbij automatische scoring van het systeem en handmatige scoring door de docent werden gecombineerd voor kwantitatieve analyse. De "score voor syntactische complexiteit" maakte gebruik van natural language processing-technologie om kenmerken zoals de gemiddelde zinslengte, het aantal niveaus van clausulestructuren en de frequentie van het gebruik van werkwoordfrasen te extraheren om de rijkdom en complexiteit van de zinnen van de studenten te evalueren. De analyse van "overeenkomst met academische stijl" onderzocht, op basis van een NLP (Natural Language Processing)-model, het aandeel passieve vorm en het aandeel formele woordenschat om te bepalen of de tekst voldeed aan de stylnormen van het Engels academisch schrijven. Daarnaast introduceerde de studie een subjectieve evaluatiedimensie, waarbij via vragenlijsten voor docenten feedback werd verzameld over de acceptatie en praktische bruikbaarheid van de door het model gegenereerde suggesties om de werkelijke impact van AI-ondersteund onderwijs te beoordelen. "Veranderingen in de beoordelingscijfers van docenten" weerspiegelde de impact van AI-ondersteund onderwijs op de verbetering van de schrijfkwaliteit door de cijfers van docenten voor de essays van studenten voor en na het experiment te vergelijken. Ten slotte maakte de "Zelfevaluatie van de transfervaardigheid door de student" gebruik van de tabel voor transfercognitie om studenten te begeleiden bij het zelf evalueren van hun beheersing van structuur, syntaxis, cultuur en andere dimensies, waardoor hun metacognitieve bewustzijn en reflectievermogen werden vergroot. De specifieke beschrijvingen en databronnen voor elke indicator worden getoond in Tabel 3.
Syntactische en stilistische indicatoren werden automatisch berekend via dependency parsing en BERT-gebaseerde classificatie, met genormaliseerde scores variërend van 0 tot 5; de handmatige evaluatie maakt gebruik van een 5-puntsschaal. De berekeningsformules voor syntactische complexiteit gebruikten het totale aantal woorden/aantal clausules als de centrale noemer. Bron van ruwe gegevens: pretest- en posttest-schrijfopdrachten van alle 60 ingeschreven studenten.
Experimentele resultaten en analyse
Om de uitgebreide verschillen in prestaties van studenten op de drie dimensies van syntactische transfer, structurele transfer en culturele transfer intuïtief te presenteren, vergeleek Figuur 3 de gemiddelde schrijftransferindex van studenten in de experimentele groep en de controlegroep vóór en na het experiment: Figuur 3 toonde het verschil in gemiddelde scores tussen de experimentele groep en de controlegroep op de drie dimensies van syntactische transfer, structurele transfer en culturele transfer. De experimentele groep vertoonde na het experiment een significante verbetering in transfervermogen in elke dimensie, waarbij de buitenste cirkel van het radardiagram aanzienlijk groter is dan de binnenste cirkel, wat aangeeft dat de optimalisatiemethode voor instructies op basis van het DeepSeek-model een positief effect heeft op het bevorderen van de ontwikkeling van het Engelse schrijftransfervermogen van studenten. In contrast hiermee bleven de verschillende indicatoren voor transfervermogen van de controlegroep relatief ongewijzigd vóór en na het experiment. De algehele verbetering was beperkt, wat erop wijst dat traditionele onderwijsmethoden of AI-ondersteunende hulpmiddelen waarvan de systeeminstructies niet waren geoptimaliseerd, een beperkte rol spelen bij transfertraining. Het bleek uitdagend om het leerpotentieel van studenten bij multidimensionale taaltransfer effectief te stimuleren.
De gemiddelde schrijfoverdrachtsindexen van de experimentele groep op de dimensies syntactische overdracht, structurele overdracht en culturele overdracht waren vóór het experiment respectievelijk 3,0, 2,9 en 2,8. Na het experiment stegen deze naar 4,3, 4,1 en 4,5, met stijgingen van respectievelijk 1,3, 1,2 en 1,7, wat aangeeft dat de onderwijsmethode een goed interventie-effect had op verschillende niveaus van overdracht. De scores van de controlegroep vóór het experiment waren 3,0, 3,0 en 2,9. Na het experiment stegen de waarden naar respectievelijk 3,4, 3,3 en 3,2, wat significant lager is dan die van de experimentele groep. Het is bijzonder noteworthy dat de experimentele groep de meest significante verbetering liet zien op de dimensie van culturele overdracht, met een stijging van 2,8 naar 4,5, een toename van 1,7 punt, wat significant hoger is dan de toename van 0,3 punt van de controlegroep. Dit resultaat suggereert dat de voorgestelde onderwijsmethode een belangrijke rol speelt bij het helpen van studenten om Engelse culturele expressienormen te identificeren en zich daaraan aan te passen. Dit kwam niet alleen naar voren in aanpassingen van de taalvorm, maar ook in de verbetering van het interculturele pragmatische bewustzijn van de studenten en de diepgang van hun begrip van de culturele expressiegewoonten van de doeltaal. Taaloverdracht kwam primair tot uiting in syntactische complexiteit, aanpassing van taalstijl en andere aspecten. De studie maakte gebruik van geautomatiseerde NLP-technologie om een diepgaande analyse van de schrijfteksten van de studenten uit te voeren, waarbij belangrijke taalkenmerken werden geëxtraheerd en gecombineerd met scores van docenten om systematisch veranderingen in het taaloverdrachtsvermogen van studenten over drie rondes van taken te evalueren.
Syntactische complexiteit en linguïstische stijl
Wat betreft de syntactische complexiteit registreerde de studie de gemiddelde zinslengte en het aantal niveaus van clausuisonderbreking in de tekst die door studenten werd gegenereerd na voltooiing van de aangewezen schrijfopdracht in elke ronde van opdrachten. Deze twee indicatoren werden veelvuldig gebruikt om de complexiteit van de taaluitdrukking te meten. Ze weerspiegelden effectief het ontwikkelingsniveau van de studenten op het gebied van zinsdiversiteit en structureel organisatievermogen, zoals weergegeven in Figuur 4.
In de longitudinale evolutie van de syntactische complexiteit vertoonde de experimentele groep een duidelijke opwaartse trend over de drie rondes van taken, wat weerspiegelt dat de transfertraining de vaardigheid van studenten om hun taalstructuur uit te drukken effectief heeft bevorderd. Wat betreft de gemiddelde zinslengte steeg de experimentele groep van 12,5 woorden in Taak 1 naar 16,1 woorden in Taak 3, een toename van 3,6 woorden, wat significant hoger was dan de toename van slechts 0,9 woorden bij de controlegroep in dezelfde periode (van 12,4 naar 13,3). In dezelfde zin steeg, vanuit het perspectief van de structurele complexiteit gemeten aan de hand van het aantal lagen van clausale nesteling, de experimentele groep van 1,8 lagen naar 2,7 lagen, terwijl de controlegroep steeg van 1,7 naar 1,9 lagen, wat wijst op een relatief trage toename. Om verder te verifiëren of het verschil in syntactische complexiteit tussen de twee groepen studenten statistisch significant is, maakte de studie gebruik van onafhankelijke steekproef t-toetsen om de gemiddelde zinslengte en het aantal niveaus van clausale nesteling in de drie fasen van de taak te analyseren. De resultaten toonden aan dat er een significant verschil bestaat tussen de experimentele groep en de controlegroep wat betreft de gemiddelde zinslengte, t(58) = 4,23, p < 0,001, Cohen’s d = 0,98; er was ook een significant verschil in het aantal niveaus van clausale nesteling, t(58) = 3,15, p = 0,002, Cohen’s d = 0,78. Deze vergelijking toonde aan dat systematische transfertraining niet alleen het vermogen van studenten om complexe zinnen te construeren verbeterde, maar ook hun beheersing van grammaticaal organisatieprocesen versterkte. In het bijzonder vertoonden studenten in de experimentele groep tijdens de derde fase van de taak een grotere flexibiliteit in het gebruik van meerlaagse clausules en complexe zinsstructuren. Dit weerspiegelde een merkbare verschuiving in hun taaltransfer van een "functioneel" niveau naar een meer "strategisch" niveau. Het op transfer gerichte trainingspad verbeterde voortdurend de syntactische transfervaardigheden van de studenten, waardoor de beperkingen van enkelvoudige zinsformuleringen en de vaste uitdrukkingspatronen die vaak in traditioneel onderwijs worden gezien, effectief werden overwonnen. Wat betreft de adaptatie van de taalstijl extracteerde de studie de geschreven teksten van studenten vóór en na het experiment. Er werd gebruikgemaakt van een NLP-model om het aandeel formele woordenschat en de frequentie van het gebruik van de lijdende vorm vast te stellen als kernindicatoren voor het evalueren van de aansluiting bij de academische taalstijl. Deze indicatoren weerspiegelden of studenten over het taalbewustzijn en het uitdrukkingsvermogen beschikken om zich aan te passen aan de doelstijl in het Engels schrijven. De relevante resultaten zijn weergegeven in Figuur 5.
Figuur 5 toont de veranderingen in de matching van de academische stijl van de experimentele groep en de controlegroep voor en na de taak, waarbij hoofdzakelijk wordt gefocust op de twee kernindicatoren: het aandeel formele woordenschat en de gebruiksfrequentie van de lijdende vorm. Over het algemeen was het vermogen tot aanpassing van de academische stijl van de experimentele groep significant verbeterd na het voltooien van de transfertraining op basis van het DeepSeek-model, wat de effectiviteit van deze onderwijsmethode aantoont bij het cultiveren van het bewustzijn van studenten voor taalnormen en hun vermogen om zich aan academische stijlen aan te passen. Wat betreft het aandeel formele woordenschat steeg de experimentele groep van 0,42 voor de taak naar 0,56 na de taak, een relatief significante stijging. In contrast nam de controlegroep slechts licht toe, van 0,43 naar 0,48, wat wijst op een beperkte verbetering. Dit resultaat toonde aan dat de studenten in de experimentele groep, na het ontvangen van systematische promptbegeleiding en modelfeedback, meer geneigd waren om tijdens het schrijfproces formele woordenschat te gebruiken die voldoet aan de eisen van de academische stijl, waardoor hun taalstijl geleidelijk dichter bij de normen van het Engels academisch schrijven kwam te liggen. Wat betreft de frequentie van het gebruik van de lijdende vorm steeg de experimentele groep significant van 0,18 voor de taak naar 0,27 na de taak, wat een toename van 0,09 vertegenwoordigt; daarentegen steeg de controlegroep met slechts 0,02.
Om verder te verifiëren of de bovenstaande veranderingen statistisch significant zijn, voerde de studie een t-toets voor onafhankelijke steekproeven uit op de gegevens voor en na de taak. De resultaten toonden aan dat de experimentele groep een significante verbetering vertoonde in het aandeel formele woordenschat, t(58) = 3.89, p < 0.001, Cohen's d = 0.92; de toename in de frequentie van het gebruik van de lijdende vorm was eveneens significant, t(58) = 4.56, p < 0.001, Cohen’s d = 1.05. Dit toonde aan dat de studenten in de experimentele groep aanzienlijke vooruitgang hadden geboekt in de aanpassing van de taalstijl, en dat deze vooruitgang niet toevallig was, maar het resultaat van het gecombineerde effect van systematische promptbegeleiding en modelfeedback.
Statistische verificatie
Daarnaast is in de studie, om de betrouwbaarheid van door AI gegenereerde inhoud in de onderwijspraktijk verder te verifiëren, ook de gemiddelde score van door AI gegenereerde inhoud vergeleken met die van door docenten gegenereerde inhoud onder verschillende prompttypes. De consistentie tussen beide werd geëvalueerd door de Pearson-correlatiecoëfficiënt te berekenen. De relevante vergelijkingsresultaten zijn weergegeven in Tabel 4. Tabel 4 toont de consistentie tussen de door AI gegenereerde inhoud en de scores van docenten bij vijf typen transfergeoriënteerde prompts. Vanuit het perspectief van de gemiddelde score lag de AI-score over het algemeen iets lager dan de score van de docent. Toch bleef het verschil bij de meeste taaktypen binnen een redelijke marge, wat aantoont dat het DeepSeek-model een hoge stabiliteit en referentiewaarde heeft bij het evalueren van schrijfoverdrachtstaken. Bij de syntactische transferprompt was de gemiddelde score van de docent 4,1 en de AI-score 4,0, met een verschil van slechts 0,1 tussen beide. Bij de structurele en logische transferprompts was de AI-score slechts 0,1 punt lager dan de score van de docent, wat aangeeft dat het model de evaluatiecriteria van de docent beter kan simuleren bij deze taken, die een hoge mate van taalstructuur en duidelijke regels bevatten. In tegenstelling hiermee zijn de scoreafwijkingen bij de culturele transfer- en registertransferprompts relatief duidelijk, met AI-scores van respectievelijk 3,6 en 3,7, wat 0,2 lager is dan de scores van de docenten; dit weerspiegelt dat AI nog steeds bepaalde beperkingen heeft bij taken met een hoge subjectiviteit, zoals semantische implicaties en culturele pragmatiek. De interbeoordelaarsbetrouwbaarheid werd getoetst via ICC (n = 5 beoordelaars). De totale ICC voor handmatige scoring was 0,86, en de ICC's voor elke dimensie varieerden van 0,82 tot 0,89, wat duidt op een bevredigende overeenkomst tussen de beoordelaars.
Verdere analyse van de Pearson-correlatiecoëfficiënt onthulde dat de consistentie van de scores onder verschillende prompts op een hoog niveau lag, wat aangeeft dat de AI-score niet alleen qua waarde dicht bij het oordeel van de docent lag, maar ook een goede lineaire relatie vertoonde in de scoretrend. Hiervan was de consistentiecoëfficiënt van de prompt voor syntactische transfer het hoogst met 0,87, terwijl de prompts voor structurele transfer en logische transfer respectievelijk 0,83 en 0,85 waren, wat aantoont dat de evaluatieresultaten van de AI op het gebied van syntactische complexiteit, paragraaforganisatie en logische coherentie sterk overeenkomen met het oordeel van de docent. Dit kan te wijten zijn aan het feit dat deze taken duidelijke doelstellingen en kwantificeerbare taalkenmerken hebben, wat de herkenning door het model en een stabiel oordeel heeft gefaciliteerd. De correlatiecoëfficiënt van de prompt voor domeintransfer is 0,81. Hoewel deze licht was gedaald, werd nog steeds een sterk evaluatievermogen aangetoond, wat aangeeft dat de AI een zekere mate van beoordelingsvermogen bezat op het niveau van stilistische aanpassing. De consistentiecoëfficiënt van de prompt voor culturele transfer was echter slechts 0,79, wat lager was dan bij de andere typen, maar nog steeds binnen een acceptabel bereik lag.
Om de toepasbaarheid van verschillende soorten prompts in de onderwijspraktijk en de mate van acceptatie door docenten te onderzoeken, is een vragenlijst over de tevredenheid over prompt-reacties ontworpen. Vijf docenten Engels (genummerd T1–T5) werden uitgenodigd om de generatiesuggesties van vijf soorten prompts te beoordelen met behulp van een vijfpuntsschaal (zeer ontevreden tot zeer tevreden), zoals weergegeven in Figuur 6: de scores van de vijf docenten voor de vijf soorten prompts variëren enigszins, maar de algemene erkenning was hoog. Hiervan scoorden de prompts voor "syntactische transfer" en "culturele transfer" het hoogst, met een gemiddelde van 4,0, wat wijst op een sterke praktische toepasbaarheid en aanpasbaarheid in het onderwijs. In tegenstelling hiertoe scoort de prompt voor "registertransfer" relatief laag, met een gemiddelde van slechts 2,4, waarbij sommige docenten, zoals T4 en T5, de laagste scores gaven, wat aangeeft dat de begeleidende werking en aanpasbaarheid in onderwijstoepassingen nog verbetering behoeven.
Op individueel niveau waren er duidelijke verschillen in de score-tendensen van de docenten. De totale score van T1 was positief, wat duidt op een hoge mate van acceptatie van AI-ondersteund schrijven, terwijl de scores van T5 laag waren in meerdere Prompt-dimensies, met name bij "registeroverdracht" en "logicaoverdracht". Dit verschil kan gerelateerd zijn aan de onderwijservaring van de docenten, taalvoorkeur of bekendheid met AI-tools, wat suggereert dat toekomstige Prompt-ontwerpen gepersonaliseerde adaptatiemechanismen moeten overwegen om de acceptatie door verschillende groepen docenten te vergroten. Om het werkelijke effect van AI-ondersteund onderwijs op het verbeteren van de schrijfkwaliteit van studenten verder te verifiëren, vergeleken de onderzoekers de veranderingen in de totale scores van de experimentele groep en de controlegroep, zoals geëvalueerd door docenten, vóór en na het experiment. De vergelijkingsresultaten zijn weergegeven in Figuur 7.
Zoals getoond in Figuur 7, vertoonden de totale scores van de experimentele groep en de controlegroep, zoals geëvalueerd door docenten vóór en na het experiment, significante verschillen. Over het algemeen vertoonde de totale score van de experimentele groep een significante stijgende trend na de onderwijskundige interventie voor instructieoptimalisatie op basis van het DeepSeek-model. In tegenstelling hiermee was de scoreverandering in de controlegroep relatief gering. De gemiddelde docentenscore van de experimentele groep vóór het experiment was 59,1 punten, en de gemiddelde score na het experiment steeg significant naar 74,4 punten, wat een stijging van 15,3 punten vertegenwoordigt. Dit gaf aan dat AI-ondersteund onderwijs een positieve invloed had op de schrijfkwaliteit van de studenten. Uit de boxplot bleek dat het distributiebereik van de scores van de experimentele groep eveneens was uitgebreid. In het bijzonder ligt de scorebox na het experiment significant hoger dan daarvoor, en zijn de maximale bovenwaarde en minimale onderwaarde toegenomen, wat erop wijst dat het algemene niveau van de studenten significant is verbeterd. Daarentegen waren de scoreveranderingen in de controlegroep relatief beperkt. Vóór het experiment was de gemiddelde score van de controlegroep 60,1 punten, en na het experiment was dit 64,9 punten, wat een stijging van 4,8 punten vertegenwoordigt. Deze stijging was veel lager dan die van de experimentele groep, en de scorebox van de controlegroep veranderde nauwelijks vóór en na het experiment, wat aantoont dat traditionele onderwijsmethoden of niet-geoptimaliseerde AI-ondersteunende tools een beperkt effect hebben op het verbeteren van de schrijfkwaliteit.
Daarnaast maakte deze studie gebruik van de transfercognitietabel om studenten te begeleiden bij drie rondes van zelfbeoordeling met betrekking tot hun vaardigheidsontwikkeling op onder andere het gebied van structurele aanpassing, zinsvorming en culturele expressie, om zo de trend in de metacognitieve bewustwording van de studenten en hun beheersing van transferstrategieën te reflecteren. De resultaten worden weergegeven in Figuur 8Volgens de gegevens in het radardiagram van de zelfbeoordeling door studenten van hun transfervermogen, zoals weergegeven in Figuur 8de zelfbeoordeling van studenten in de vijf dimensies van structurele transfer, syntactische transfer, culturele transfer, registertransfer en logische transfer over de drie taskronden vertoonde een voortdurend stijgende trend. Dit wijst erop dat het vermogen van studenten om transferstrategieën toe te passen aanzienlijk is verbeterd onder de instructie-optimalisatieveleisinterventie op basis van het DeepSeek-model. In de eerste ronde van taken waren de zelfbeoordelingsscores van de studenten over het algemeen laag. Van de vijf dimensies scoorden "structurele transfer" en "logische transfer" respectievelijk 3,2 en 3,0, terwijl "culturele transfer" en "registertransfer" 2,5 en 2,7 scoorden, wat aangeeft dat studenten nog onervaren waren in het identificeren en gebruiken van transferstrategieën. Tegen de tweede ronde van taken waren de scores van elk item verbeterd, waarbij "structurele transfer" steeg naar 3,8, "syntactische transfer" naar 3,5 en "logische transfer" naar 3,7. Dit toonde aan dat studenten, met de begeleiding van docenten en de ondersteuning van modelfeedback, geleidelijk de kernpunten van basis-transferoperaties hadden onder de knie gekregen en deze in eerste instantie hadden toegepast op feitelijk schrijven. In de derde ronde van taken stegen de zelfbeoordelingsscores van de studenten significant, waarbij "structurele transfer" en "logische transfer" respectievelijk 4,5 en 4,3 bereikten, en de andere dimensies eveneens stabiliseerden boven de 4,0 punten. Dit toont het aanhoudende effect aan van meerdere ronden transfertraining bij het verbeteren van de beheersing van taalvormen en het tekstconstructievermogen van studenten. In dit stadium hadden studenten een basis cognitieve gesloten lus gevormd tussen het begrijpen, uitvoeren en reflecteren op transferstrategieën. Naast de feedback van de docent is in het onderzoek ook een tevredenheidsenquête over de AI-ondersteunde schrijffunctie verspreid onder alle studenten in de experimentele groep, waarbij in totaal 30 geldige vragenlijsten zijn verzameld. De vragenlijst beoordeelde de prestaties van de AI in drie functionele modules: herschrijfvoorstellen, structurele optimalisatie en culturele prompts, waarbij studenten opties moesten selecteren op basis van vijf niveaus van standaarden. De resultaten worden weergegeven in Tabel 5.
Volgens de resultaten van de enquête naar studenttevredenheid over AI-ondersteunde schrijffuncties, weergegeven in Tabel 5, gaven studenten in de experimentele groep over het algemeen positieve reacties op de prestaties van de AI in de drie functionele modules voor herschrijfsuggesties, structurele optimalisatie en culturele prompts, wat wijst op de goede toepassingsperspectieven van AI-ondersteunde schrijfsystemen bij het verbeteren van de efficiëntie van schrijftrainingen en de kwaliteit van de onderwijsondersteuning. Over het algemeen gaven meer dan 90% van de studenten aan "zeer tevreden" of "tevreden" te zijn met de twee functionele items "herschrijfsuggesties" en "structurele optimalisatie", waarbij "herschrijfsuggesties" de hoogste tevredenheid behaalde met 91%, wat aantoont dat studenten een hoge mate van erkenning hadden voor het vermogen van AI op het gebied van syntactische reconstructie en taalpolijsting. In vergelijking hiermee was de tevredenheid met de functie "culturele prompts" relatief lager. Desondanks bereikte deze 83%, wat aangeeft dat hoewel AI een zekere complexiteit en subjectiviteit vertoont bij het begeleiden van crossculturele expressie, de rol bij het ondersteunen van studenten om moedertaal-culturele interferentie te identificeren en aan te passen nog steeds door de meeste studenten werd erkend. Wat betreft ontevredenheid was het percentage studenten dat "ontevreden" of "zeer ontevreden" koos over de drie functies minder dan 5%, wat aantoont dat de AI-ondersteunde functies een goede bruikbaarheid en acceptatie hadden in de meeste toepassingsscenario's. Het is vermeldenswaard dat het aandeel studenten dat "gemiddeld" scoorde bij het item "culturele prompts" relatief hoog was, wat suggereert dat de huidige AI mogelijk niet volledig voldoet aan de verwachtingen van studenten bij het behandelen van kwesties rond culturele adaptatie, en dat er nog ruimte voor verbetering is. Een uitgebreide analyse onthult dat de op DeepSeek gebaseerde methode voor instructieoptimalisatie breed is erkend door studenten, in het bijzonder voor de ondersteuning van de taalvorm.
RM-ANOVA
Er werd een twee-weg herhaalde-metingen variantieanalyse (RM-ANOVA) uitgevoerd om de effecten van groep (tussen-proefpersonenfactor: experimentele groep vs. controlegroep) en tijd (binnen-proefpersonenfactor: pre-test, Taak 1, Taak 2, Taak 3, post-test), alsook hun interactie op de transferprestaties van het Engelse schrijven van studenten te onderzoeken. De toets van Mauchly wees op een schending van de assumptie van sfericiteit (p < 0.05), waardoor de Greenhouse–Geisser-correctie is toegepast om de vrijheidsgraden voor de binnen-proefpersoneffecten aan te passen. Alle analyses waren gebaseerd op n = 30 deelnemers per groep. De resultaten worden getoond in Tabel 6:
De resultaten van de ANOVA met herhaalde metingen en Greenhouse-Geisser-correctie wezen op significante hoofdeffecten van Groep, Tijd en de interactie Groep × Tijd over alle gemeten dimensies (p < 0,001). Voor de Overall Transfer Index werd een significant Groepseffect waargenomen (F(1,58) = 76,32), naast een significant Tijdseffect (F(2,14,124,12) = 92,75) en een significante interactie Groep × Tijd (F(2,14,124,12) = 68,49), wat suggereert dat veranderingen in de algehele transferprestaties over de tijd significant verschilden tussen de groepen.
Op vergelijkbare wijze vertoonde syntactische transfer significante effecten van Groep (F(1,58) = 52,18), Tijd (F(2,11,122,38) = 71,26) en de interactie tussen Groep × Tijd (F(2,11,122,38) = 45,73), wat duidt op differentiële ontwikkelingspatronen in het vermogen tot syntactische transfer tussen de groepen en meetmomenten. Voor Structurele Transfer werden eveneens significante effecten gevonden voor Groep (F(1,58)=48,65), Tijd (F(2,09,121,22) = 67,81) en de interactie (F(2,09,121,22) = 41,36), wat wijst op consistente verbeteringen met groepsspecifieke trajecten. Opmerkelijk genoeg vertoonde Culturele Transfer de sterkste effecten, met een significant Groepseffect (F(1,58) = 81,44), een uitgesproken Tijdeffect (F(2,07,119,96) = 98,52) en een robuuste Groep × Tijd-interactie (F(2,07,119,96) = 79,27), wat suggereert dat het meest substantiële en gedifferentieerde groeipatroon in deze dimensie lag. Overal vertoonden alle indices statistisch significante effecten, wat bevestigt dat de interventie een stabiele en gedifferentieerde impact had op de ontwikkeling van transfer in de loop van de tijd.
DATAbeschikbaarheid:
Alle gegevens die tijdens deze studie zijn gegenereerd of geanalyseerd, zijn opgenomen in dit artikel. De ruwe evaluatiegegevens zijn opgenomen in Aanvullende Tabel 1.

Figuur 1: Stappen voor de transformatie van de zinsstructuur. (A) Strategieën voor het combineren en versterken van werkwoorden om de zinsstructuur te verbeteren. (B) Alternatieve transformaties van het onderwerp, waaronder gerundia, infinitieven en genominaliseerde onderwerpen. (C) Gebruik van niet-eindige zinsneden om de variatie en beknoptheid van zinnen te vergroten. (D) Voorbeelden van gepolijste eindversies die een verbeterde academische stijl en interculturele Engelse uitdrukking aantonen. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 2: Diagram van de evolutieboom van taken. Het presenteert de progressieve structuur van overdrachtstaken op vier niveaus, variërend van zin, paragraaf en discours tot het culturele niveau. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 3: Vergelijking van het vermogen tot schriftelijke transfer voor en na het experiment. Het radardiagram toont de pre-test- en post-testscores van de experimentele groep en de controlegroep op de dimensies syntactische, structurele en culturele transfer. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 4: Lijndiagram van de trend in syntactische complexiteit. De veranderingen in de gemiddelde zinslengte en de lagen van clausule-nesting over drie trainingstaken worden weergegeven. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 5: Matching van academische terminologie. Deze figuur toont variaties in de proportie formele woordenschat en de frequentie van de lijdende vorm vóór en na de interventie. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 6: Heatmap van de tevredenheid over prompt-antwoorden. Hier zijn de beoordelingen van vijf typen prompt-sjablonen van deelnemende docenten samengevat. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 7: Boxplot van veranderingen in de beoordelingen door docenten. De boxplot toont de distributie en de algemene veranderingen van door docenten beoordeelde schrijfscores voor twee groepen vóór en na het experiment. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 8: Radardiagram van de door studenten zelf beoordeelde transfercapaciteit. Het toont de zelfevaluatiescores van studenten over vijf transferdimensies in drie trainingsronden. Klik hier om een grotere versie van deze figuur te bekijken.
| Houdt u rekening met de volgende stappen bij het uitvoeren van dit protocol:
**Benodigdheden**
* Steriele 15 ml Falcon-buizen
* Centrifuge
* Pipetten en pipetpunten
* IJsschaal
* Microcentrifuge
* Vries-centrifuge
**Procedure**
1. **Voorbereiding van de monsters**: Plaats de cellen in een steriele 15 ml Falcon-buis en centrifugeer deze gedurende 5 minuten bij 300 x g bij 4 °C.
2. **Verwijderen van het medium**: Giet het supernatant voorzichtig weg zonder de celpellet te verstoren.
3. **Wassen van de cellen**: Voeg 10 ml koud phosphate-buffered saline (PBS) toe aan de buis, resuspendeer de cellen door zachtjes te pipetteren en centrifugeer opnieuw gedurende 5 minuten bij 300 x g bij 4 °C.
4. **Lysis van de cellen**: Voeg 1 ml koud lysisbuffer toe aan de celpellet. Meng de buffer met de cellen door de buis voorzichtig te schudden of door middel van vortexen gedurende 30 seconden op een lage snelheid.
5. **Incubatie**: Laat de cellen 15 minuten incuberen op ijs om de lysis te voltooien.
6. **Klarificatie van het lysaat**: Centrifugeer het mengsel gedurende 10 minuten bij 15.000 x g bij 4 °C in een microcentrifuge om celresten en onoplosbare fracties te pelletteren.
7. **Ophalen van het supernatant**: Draag het heldere supernatant over naar een nieuwe, gekoelde microcentrifugebuis. Dit supernatant bevat de oplosbare eiwitfractie.
8. **Opslag**: Bewaar de monsters onmiddellijk bij -80 °C voor verdere analyse of gebruik ze direct in vervolgexperimenten. | Bediening door de docent | Prompttype | Studentbediening | Uitvoer | Evaluatiecriteria |
| Originele schrijfconcepten van studenten (zinnen/paragrafen/essays) | 1. Label overdrachtstypen en taakniveaus
2. Pas promptparameters aan indien nodig | Enkelvoudige transfer-prompt / Drietraps geneste promptketen | 1. Leer transferstrategieën 2. Herzie concepten op basis van AI-feedback 3. Voltooi de zelfevaluatie | Door AI herziene tekst + Definitieve herziene versie van de student | Syntactische complexiteit, structurele rationaliteit, culturele adequaatheid, logische coherentie, standaardisatie van het register (schaal 0–5) |
Tabel 1: Samenvattende tabel van de workflow. Deze tabel vat de volledige operationele workflow van de AI-ondersteunde training voor de overdracht van Engels schrijven samen, inclusief de inputmaterialen, de handelingen van docent en student, de typen prompts, de uiteindelijke resultaten en de bijbehorende evaluatiecriteria.
| Projectcategorie | Inhoud |
| Begrip van de missiedoelstellingen | Beschrijf kort de migratiedoelen van deze ronde schrijftaken, zoals structurele aanpassingen, culturele adaptatie en taalconversie. |
| Gebruikte migratiestrategie | Geef own de migratiestrategieën op die u heeft toegepast (meerdere selecties zijn toegestaan): |
| Structurele aanpassing |
| Zinsvorming |
| Taalwisseling |
| Culturele manifestatie |
| Versterking van de logische samenhang |
| Overig: _______ |
| Herschrijf voorbeelden en instructies | Selecteer 1–2 herschreven zinnen, toon de versies vóór en na de herschrijving, en leg de redenen voor de wijzigingen en de beoogde transferdoelen uit. |
| Moeilijkheden en twijfels die zijn ondervonden | Beschrijf eventuele uitdagingen die u tijdens de migratie bent tegengekomen of vragen die u had over een specifieke uitdrukking. |
Zelfbeoordelingsscore
(uit 5 punten) | Beoordeel uw herschreven tekst op basis van de volgende drie aspecten: |
| • Nauwkeurigheid van de toepassing van de strategie (/5) |
| • Natuurlijke vloeiendheid van uitdrukking (/5) |
| • Culturele fit (/5) |
| Toekomstige doelen voor verbetering van het schrijfproces | Beschrijf kort de overdraagbaarheid die u in de volgende trainingsronde wilt versterken of optimaliseren |
Tabel 2: Tabel voor transfercognitie. Een schaal van 1–5 (1 = geen beheersing, 5 = volledige beheersing) is gehanteerd voor de zelfbeoordeling van studenten met betrekking tot strategieën voor schrijftransfer.
| Naam van de indicator | Beschrijving | Gegevensbron |
| Schrijfoverdrachtindex (0–5) | Een kwantitatieve indicator die het taaloverdrachtvermogen uitgebreid meet, waarbij drie niveaus worden bestreken: syntaxis, structuur en cultuur. | Automatische scoring door het systeem + handmatige scoring door docenten |
| Syntactische complexiteitsscore | Inclusief gemiddelde zinslengte, aantal ingebedde clausules, rijkdom van werkwoordfrasen, enz. | Automatische NLP-analyse |
| Overeenstemming van academische stijl | Voldoet het aan de normen voor Engels academisch schrijven? | Oordeel over modellen voor natuurlijke taalverwerking |
| Tevredenheid over het antwoord op de prompt | Acceptatie en praktische evaluatie door docenten van door modellen gegenereerde suggesties | Vragenlijst voor docenten |
| Wijzigingen in de beoordeling van de docentenbeoordeling | Vergelijking van de scores van docenten vóór en na het experiment om de verbetering in schrijfkwaliteit weer te geven | Beoordelingsgegevens van docenten |
| Zelfbeoordeeld transfervermogen van studenten | Studenten beoordelen zelf hun beheersing van verschillende transferdimensies | Vul het formulier voor migratiebewustzijn in |
Tabel 3: Overzicht van evaluatie-indicatoren, beschrijvingen en gegevensbronnen. Deze tabel verduidelijkt de definities, meetmethoden en oorspronkelijke gegevensbronnen voor elke kern-evaluatie-indicator in deze studie.
| Type prompt | Gemiddelde beoordeling door docenten | Gemiddelde AI-score | Pearson-correlatiecoëfficiënt |
| Structurele transfer | 4 | 3.9 | 0.83 |
| Syntactische transfer | 4.1 | 4 | 0.87 |
| Culturele transfer | 3.8 | 3.6 | 0.79 |
| Registertransfer | 3.9 | 3.7 | 0.81 |
| Logische transfer | 4.2 | 4.1 | 0.85 |
Tabel 4: Vergelijking van de consistentie tussen door AI gegenereerde inhoud en beoordelingen van docenten. De resultaten tonen de consistentie aan tussen door AI gegenereerde inhoud en beoordelingen van docenten over verschillende prompt-typen.
| Functie-items | Zeer tevreden | Tevreden | Over het algemeen | Ontevreden | Zeer ontevreden |
| Suggestie voor herschrijving | 66% | 25% | 7% | 1.50% | 0.50% |
| Structurele optimalisatie | 60% | 30% | 7% | 2% | 1% |
| Culturele tips | 55% | 28% | 12% | 3.50% | 1.50% |
Tabel 5: Enquêtegegevens over de tevredenheid van studenten met AI-ondersteunde functies.De statistieken tonen de verdeling van de tevredenheid van studenten voor AI-herschrijving, structurele optimalisatie en culturele promptfuncties.
| Meten | Groep F(df) | Tijd F(df)GG | Groep × Tijd F(df)GG | p |
| Algemene Transferindex | 76.32 (1, 58) | 92.75 (2.14, 124.12) | 68.49 (2.14, 124.12) | <0.001 |
| Syntactische overdracht | 52.18 (1, 58) | 71.26 (2.11, 122.38) | 45.73 (2.11, 122.38) | <0.001 |
| Structurele overdracht | 48.65 (1, 58) | 67.81 (2.09, 121.22) | 41.36 (2.09, 121.22) | <0.001 |
| Culturele overdracht | 81.44 (1, 58) | 98.52 (2.07, 119.96) | 79.27 (2.07, 119.96) | <0.001 |
Tabel 6: Samenvatting van de resultaten van de repeated-measures ANOVA. Hierin worden de resultaten van de two-way repeated-measures ANOVA voor de algemene schrijfoverdrachtprestatie en de drie subdimensies daarvan gepresenteerd, inclusief de hoofdeffecten van groep, tijd en de interactie tussen groep en tijd. Afkortingen: GG = Greenhouse–Geisser-correctie.
Aanvullende Tabel 1: Evaluatie van ruwe gegevens. Bevat de ruwe gegevens die zijn gebruikt in alle analyses in deze studie.Klik hier om dit bestand te downloaden.