$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Het ethische goedkeurings- en participatiewervingsproces, inclusief essayadministratie, dubbele beoordeling door ETS Criterion en experts, evaluatie van leerlingperceptie en statistische analyse, worden in deze sectie samengevat. Het benadrukt hoe nauwkeurigheid, eerlijkheid en SEM-gebaseerde perceptiemodellering zijn geïntegreerd in een uniforme XAI-validatiepijplijn. Het door XAI aangedreven AWE-evaluatiekader wordt geïllustreerd in Figuur 1.
Procedure:
De procedure bestond uit verschillende stappen. Eerst werd IRB-goedkeuring verkregen en werd geïnformeerde toestemming van alle deelnemers verzameld. Onafhankelijke, afhankelijke en controlevariabelen werden vervolgens gedefinieerd. Gestandaardiseerde schrijfopdrachten werden op Moodle uitgevoerd met drie neutrale essayonderwerpen, en er werden schrijfvoorbeelden verzameld terwijl werd gewaarborgd dat aan de essayvereisten werd voldaan, zoals woordenaantal, tijdslimiet en structuur. Dubbele scoring werd uitgevoerd met behulp van ETS Criterion-uitkomsten gecombineerd met menselijke expertbeoordelingen. Vragenlijsten voor de perceptie van leerlingen werden direct na het indienen van het essay verspreid. Er werden procedures voor gegevensscreening en kwaliteitscontrole ingevoerd om afwijkingen aan te pakken, zoals valsspelen of ongeldige reacties. Eerlijkheidsanalyse-drempels (ΔEO, RMSE-controles) werden ook toegepast. Ten slotte werden alle geanonimiseerde gegevens veilig opgeslagen op versleutelde, toegangsgecontroleerde servers.
Ethische goedkeuring en geïnformeerde toestemming
Deze studie kreeg ethische goedkeuring van de Institutional Review Board van de instelling van de auteurs. Alle procedures werden uitgevoerd in overeenstemming met de Verklaring van Helsinki en de toepasselijke regelgeving. Alle deelnemers waren volwassenen (≥18 jaar) en gaven schriftelijke geïnformeerde toestemming vóór deelname. Schrijfvoorbeelden en vragenlijstantwoorden werden bij de bron gedeïdentificeerd en opgeslagen op versleutelde, toegangsgecontroleerde servers; Alleen bevoegde onderzoekers hadden toegang. Menselijke beoordelaars waren blind voor de moedertaal, het vaardigheidsniveau en de demografie van de deelnemers. Deelname was vrijwillig, met het recht om zich op elk moment terug te trekken, en er waren geen misleiding of gevoelige interventies betrokken. Formele goedkeuringsdocumentatie kan op verzoek aan het tijdschrift worden verstrekt.
Variabel ontwerp
In totaal werden in de studie drie groepen variabelen gedefinieerd om de analyse te sturen. Tabel 1 vat de meet- en datatypen samen die in meetmethoden voor elk construct worden gebruikt en geeft de volledige operationele definities van de onafhankelijke, afhankelijke en controlevariabelen.
De nauwkeurigheid van AI-scoring was de eerste onafhankelijke variabele die werd beoordeeld in termen van RMSE- en Pearson-correlatiecoëfficiënt (r) tussen de uitkomsten van het ETS-criterium en de beoordelingen van de experts. Kalibratie uitgevoerd door experts leverde een ICC van 0,91 op, wat de betrouwbaarheid valideert.
De tweede onafhankelijke variabele was de taalkundige achtergrond van de leerlingen, die werd verdeeld in moedertaal- en niet-moedertaalsprekers, en verder werd onderverdeeld in Chinees, Spaans, Arabisch en andere groepen. Chinese studenten waren een van de doelgroepen omdat er voorlopige aanwijzingen van systematische onderschatting werden waargenomen.
De derde onafhankelijke variabele was de schrijfvaardigheid, die werd beoordeeld volgens de CEFR-niveaus A2 tot C1, zoals bevestigd door officiële certificaten en pre-class vaardigheidstesten, en ook was afgestemd op IELTS-equivalenties. Een andere moderator die werd geïntroduceerd in het AI Fairness Mediation Model schreef vaardigheid om te testen of gevoeligheid voor eerlijkheid verschilt per vaardigheidsniveau.
De perceptie van eerlijkheid en leertevredenheid waren de afhankelijke variabelen. De perceptie van eerlijkheid werd beoordeeld met behulp van een vragenlijst van acht vragen, beoordeeld op een Likert-schaal van zeven punten, die de individuele consistentie en groepsonpartijdigheid omvatte (Cronbachs 87; CVI 92). De tevredenheid van leerlingen werd beoordeeld met zes Likert-vragen die de bereidheid om te gebruiken en een waargenomen verbetering in vaardigheden aangaven (α = 0,85).
De variabelen werden gecontroleerd op basis van leeftijd, geslacht en schrijfervaring. Leeftijd werd verdeeld in drie groepen (18-22 jaar, 23-28 jaar en ≥29 jaar), en geslacht werd ingedeeld in man en vrouw. Schrijfervaring werd per jaar ingedeeld in drie niveaus van frequentie.
Schrijfopdrachtteksten
Gestandaardiseerde betogende essayopdrachten werden opgesteld om schrijfgegevens te verkrijgen voor drie neutrale onderwerpen: de impact van globalisering op lokale culturen, de voordelen en uitdagingen van online onderwijs, en de ethische grenzen van kunstmatige intelligentie. Deze thema's waren gericht op het balanceren van cognitieve moeilijkheid en toegankelijkheid enerzijds, en het verminderen van prestatieverschillen door eerdere kennis anderzijds. De verdeling van onderwerpen en beschrijvende statistieken voor essaylengte worden weergegeven in Tabel 2.
Elk essay moest 250 woorden zijn ±10% en binnen 45 minuten geschreven op een Moodle-gebaseerd platform. Hulpgereedschappen waren verboden en late inzendingen werden uitgesloten. De essays volgden een gestandaardiseerde structuur van inleiding, twee argumentatieparagrafen en conclusie. In totaal werden 764 geldige essays verzameld, met een gemiddelde lengte van 252,3 woorden (SD = 8,7).
Vergelijkingsgegevens van scores
De nauwkeurigheid van AWE-scoring werd beoordeeld met een dubbele procedure waarbij ETS-criterie-uitkomsten werden gecombineerd met menselijke expertbeoordelingen. Scores werden opgehaald van Criterion via de open API. Drie taalkundigen met meer dan tien jaar beoordelingservaring beoordeelden onafhankelijk alle essays. Voor de formele scoring voltooiden de beoordelaars drie kalibratiesessies. Tijdens de kalibratie bereikte de betrouwbaarheid tussen de beoordelaars ICC = 0,87; tijdens formele scoring steeg ICC tot 0,91, met dimensie-specifieke ICC's boven 0,88. Essays met scoreverschillen van meer dan twee punten werden gezamenlijk opgelost (18 gevallen). De scoreworkflow en betrouwbaarheidsresultaten worden samengevat in Tabel 3.
Leerlingperceptievragenlijst
De percepties van leerlingen over AI-feedback werden vastgelegd via een vragenlijst van 22 items gebaseerd op de TAM en uitgebreid met eerlijkheid. Het instrument bevatte drie domeinen: eerlijkheidsperceptie (8 items), tevredenheid (6 items) en moderatieve factoren zoals begrijpelijkheid en transparantie (8 items). Validatie door vijf experts leverde een CVI van 0,92 op, en pilottests met 60 leerlingen leverden een algehele betrouwbaarheid van α = 0,90 op. De vragenlijststructuur en psychometrische indices zijn weergegeven in Tabel 4.
Vragenlijsten in de hoofdstudie werden direct na het indienen van de essays afgenomen, en er waren minimale voltooiingstijden om gedachteloze voltooiing te verminderen. Van de 764 uitgevoerde enquêtes waren er 756 geldig na kwaliteitscontroles, en werd een resulterend effectief percentage van 98,95 behaald.
Dataverzameling en kwaliteitscontrole
De gegevens werden 8 weken (maart-april 2024) geregistreerd in vier fasen: werving en toestemming; essay schrijven; dubbele scoring en vragenlijstverdeling; en het samenstellen van de database. De vaardigheidscertificaten op basis van de schrijfprestaties vóór de les werden beoordeeld via een dubbele selectie, waarbij 16 deelnemers werden geëlimineerd. Vier mogelijke gevallen van valsspelen werden geëlimineerd door realtime monitoring, en drie verdachte AI-prestaties (afwijkingen van minstens 8 punten) werden vervolgens aangepast na een handmatige beoordeling. Acht ongeldige vragenlijsten werden geëlimineerd op basis van omgekeerde itemconsistentiecontroles.
Gegevensopslag en ethiek
Alle gegevens werden geanonimiseerd en opgeslagen met unieke identificaties die bestonden uit de moedertaal, vaardigheidsniveau en serienummer. Teksten, scores en vragenlijsten werden versleuteld en opgeslagen op ISO27001-conforme servers met beperkte toegang. De gegevens worden 3 jaar bewaard voordat ze permanent worden verwijderd. Ethische goedkeuring werd verkregen van de institutionele beoordelingscommissie en schriftelijke geïnformeerde toestemming werd van alle deelnemers verkregen.