$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Die intensive Globalisierung von Bildung und digitalen Technologien hat den Bedarf erhöht, das Schreibniveau auf Englisch wissenschaftlich und glaubwürdig für den Sprachunterricht, die akademische Entwicklungund den beruflichen Aufstieg zu bewerten. Konventionelle schriftliche Bewertungen, wie sie durch menschliche Bewertung praktiziert werden, können subjektive Aspekte des Schreibens wie die Gründlichkeit der Argumentation und kulturelleEignung messen. 2, sind jedoch anfällig für lange Bearbeitungszeiten, hohe Arbeitskosten und Vorurteile aufgrund von Erfahrung und Neigungen des Gutachters 3,4. Diese Einschränkungen sind besonders stark in der groß angelegten Praxis, wie internationalen Sprachtests (IELTS, TOEFL) oder anderen englischsprachigen Kursen, die an Universitäten unterrichtet werden, bei denen manuelles Bewerten nicht alles ist, was sofortiges Feedbackund Abdeckung angeht.
AWE-Systeme sind in diesem Zusammenhang aufgrund ihrer Echtzeitverarbeitung, Standardisierung und Skalierbarkeitweit verbreitet geworden. Beliebte Werkzeuge wie Grammarly (das sich auf Grammatikfehler und Stilverfeinerung konzentriert) und ETS Criterion (das formalen Schreibnormen entspricht) werden derzeit von Millionen von Schülern in der K-12-Bildung, Sprachschulen, Hochschulen und Einzelausbildung7 verwendet. Obwohl dies Vorteile sind, sind die technologische Effizienz und die Anwendbarkeit von Bildungssystemen von AWE-Systemenweiterhin umstritten. Technisch gesehen sind die bestehenden Systeme in objektiven Dimensionen, einschließlich Fehlererkennung und lexikalischer Diversität, hoch genau, wobei die Korrelation zur menschlichen Bewertung über 0,859 liegen kann. In subjektiveren Bereichen, wie der Inhaltsrelevanz, logischer Argumentation und der Organisation eines Textes, liegen die Korrelationen jedoch oft unter 0,7010. Ein solches Unverhältnis birgt die Gefahr, oberflächliche Genauigkeit unter den Lernenden zu fördern – auf Kosten der Gesamtkompetenz beim Schreiben11.
Die Frage der Gerechtigkeit begrenzt auch den pädagogischen Nutzen von AWE. Die aktuellen Studien neigen auch dazu, sich auf die aggregierten Genauigkeitsindikatoren zu konzentrieren und die Möglichkeit von Abweichungen, die systematisch einige Gruppe12 benachteiligten, zu vernachlässigen. Indikativerweise würden Merkmale von intersprachlichen Merkmalen, die von chinesischen oder spanischlernenden Lernenden geteilt werden, als Fehler angesehen, was zu einer systematischen Unterschätzung13,14 führen würde. Außerdem ist die subjektive Akzeptanz von KI-Feedback durch Lernende im Allgemeinenwenig bekannt. Umfragen zeigen, dass fast ein Drittel der nicht-muttersprachlichen Lernenden eine Unangemessenheit zwischen KI-Werten und tatsächlicher Leistung meldet, wobei die Prozesse wie technische Genauigkeit, Gruppengerechtigkeit und Lernzufriedenheit weiterhin schlecht verstandensind 16.
Diese Schwächen spiegeln die Schwächen des klassischen Genauigkeitsparadigmaswider. Ein Rahmenwerk, das nur die Ausrichtung zwischen KI und menschlicher Bewertung berücksichtigt, kann keine Fragen der Gerechtigkeit oder des Vertrauens der Lernenden in das System erfassen. In der Praxis muss der pädagogische Wert von AWE drei Voraussetzungen gleichzeitig erfüllen: technische Präzision, Fairness über Gruppen hinweg und Lernakzeptanz18. Das Fehlen eines solchen umfassenden Validierungsansatzes erklärt, warum AWE-Systeme weit verbreitet verbreiten, aber das Vertrauen in die Bildungspraxis begrenztist 19,20.
Um dieser Herausforderung zu begegnen, führt die vorliegende Studie ein mehrstufiges Validierungsrahmen ein, das technische Genauigkeit, Gruppen- und Einzelfairness sowie die Wahrnehmung der Lernenden in eine kohärente Struktur integriert. Der vorgeschlagene XAI-Rahmen ist so konzipiert, dass er praktisch innerhalb bestehender AWE-Plattformen implementiert werden kann, indem Lehrern und Schülern Fairness-Diagnosen und transparente Punkteerklärungen bereitgestellt werden, und kann in Schreibkursen oder Testvorbereitungskurzen angewendet werden, um seine Fähigkeit zur Verbesserung von Fairness, Interpretierbarkeit und Unterrichtsnützlichkeit in realen Bewertungskontexten zu bewerten.
In diesem Zusammenhang ist die Hypothese ein AFMM, um die vermittelnde Rolle wahrgenommener Fairness bei der Bestimmung des Zusammenhangs zwischen Genauigkeit und Zufriedenheit sowie die moderierende Rolle der Sprachkompetenz auf die Fairness-Sensibilität zu untersuchen. Daher trägt es auf zwei Arten bei: Theoretisch bereichert es die Bewertungsmodelle von AWE, indem es Fairness als eine der wichtigsten Validierungsdimensionen neben Genauigkeit und Wahrnehmung beschreibt, und praktisch, indem es Entwicklern Strategien zur Maximierung von Fairness, Pädagogen mit gruppensensitiven Systemauswahlkriterien und dem pädagogischen Wert von AWE bietet, indem es erklärt, wie die Wahrnehmungen der Lernenden entstehen. Neben Bildung ist der Rahmen auch mit dem übergeordneten Konzept von XAI übereinstimmt und zeigt, wie Fairness und Nutzerwahrnehmung Transparenz, Vertrauen und Akzeptanz in anderen Bereichen wie Gesundheitswesen, autonomen Systemen und Cybersicherheit erhöhen können.
Forschungsfragen:
1.To inwieweit zeigt das AWE-System technische Genauigkeit und Fairness über verschiedene Muttersprach- und Kompetenzgruppen hinweg?
2. Wie kann ein XAI-basiertes, mehrstufiges Bewertungssystem Transparenz und Gerechtigkeit bei der automatisierten Bewertung des englischen Schreibens verbessern?
LITERATURÜBERSICHT:
Die Faktoren, die die Akzeptanz von AWE-Rückmeldungen durch Studierende beeinflussen, wurden mit einem erweiterten Technology Acceptance Model (TAM)21 untersucht. Basierend auf Umfragedaten von 448 chinesischen Schülern, die SEM nutzen, wurde festgestellt, dass Nützlichkeit, Benutzerfreundlichkeit und Absicht einen signifikanten Einfluss auf subjektive Normen, Vertrauen, Selbstwirksamkeit, kognitives Feedback und Systemmerkmale haben. Die Studie beschränkte sich jedoch auf eine einzelne Nation und eine einzige Gruppe von Studierenden, was die Anwendbarkeit einer Verallgemeinerung einschränkt. Um zu untersuchen, wie chinesische EFL-Schüler auf Pigai AWE-Feedback22 reagieren, analysierte eine Studie wiederholte Einreichungen (n = 5) von Universitätsstudierenden. Er stellte einen frühen Schwerpunkt auf Fehlerkorrektur, eine geringe Aufnahme sprachlicher Rückmeldungen und eine allmähliche Vertiefung der Antwort fest. Die Stichprobengröße war jedoch sehr begrenzt, ebenso wie das AWE-System, das die Anwendbarkeit und Generalisierbarkeit einschränkt. Die Überzeugungen der EFL-Lehrkräfte bezüglich der Anwendung des KI-Bewertungstools (CoGrader) wurden untersucht, um die Faktoren zu identifizieren, die ihre Ansichten beeinflussen23. Durch eine Mixed-Methods-Studie mit zehn saudischen Universitätslehrern zeigten eine Umfrage und ein Interview, dass es eine gemischte positive Meinung gab, aber die Zurückhaltung, sich vollständig auf Zuverlässigkeit und vollständige Lehrerablösung zu verlassen. Dies erschwert die Verallgemeinerung aufgrund der begrenzten Stichprobe und der Ein-Länder-Einstellung.
Unter Berücksichtigung von Entwicklungen in der Korpuslinguistik und KI-Technologie untersuchte eine Studie AES-Frameworks24. Es setzte PCA ein, um linguistische Indikatoren zur Bewertung der Schreibqualität zu verbessern, und entdeckte, dass die Kombination von Mikromerkmalen mit aggregierten Eigenschaften die Schreibqualität effektiver definierte als aggregierte Merkmale allein. Der nichtlineare AES-Ansatz, der auf Random Forest Regression basiert, übertraf die anderen Ansätze. Darüber hinaus identifizierte SHAP für jedes bewertete Attribut wesentliche Sprachelemente und erhöhte so die Systemtransparenz mittels erklärbarer KI. Die Ergebnisse können dazu beitragen, multidimensionale Methoden in der Schreibanalyse und Ausbildung zu verbessern. Das Mensch-Maschine-Kollaborationssystem wurde eingeführt, um die Herausforderungen beim Annotieren arabischer Schriften zu bewältigen, die oft teuer und zeitaufwendig sind. Die Methode berücksichtigt Aufsätze, die auf sieben Merkmalen der Literatur basieren, mit Hilfe eines LLM. Validierungsprozesse und Prompting-Taktiken wurden personalisiert, um Konsistenz und Genauigkeit sicherzustellen. Die Zusammenarbeit führt zu einem höheren Angebot an beschrifteten Ressourcen und beeinträchtigt die Qualität der Bewertung nicht, weshalb es sich um eine skalierbare Datenannotationsmethode handelt, die für Sprachen mit weniger Ressourcen geeignet ist.
Der Einsatz von KI im Bildungsbereich bietet die Möglichkeit, die Notenanforderungen deutlich zu senken und die Schreibausbildungzu verbessern 25,26. Gleichzeitig haben Forscher betont, dass die Genauigkeit von KI nicht der einzige Aspekt ist, der für ihren verantwortungsvollen Einsatz relevant ist. Es gibt Prinzipien der Fairness und Verringerung von Vorurteilen, Sicherheit und Datenschutz, Rechenschaftspflicht, Erklärbarkeit, Transparenz, Bildungswirkung, Integrität und kontinuierlicher Entwicklung. Neuere Forschungen haben empirisch die Zero-Shot-Bewertung auf Basis von GPT-4o bewertet, mit Schwerpunkt auf diesen Anforderungen. Die Forschung konzentrierte sich auf die Wahrnehmungen, die Pädagogen gegenüber ADWTs in Bezug auf Bildungsintegritäthatten, 27. Die Querschnittsstudie mit 100 Doktoranden und Professoren aus 10 Fächern legt nahe, dass Lehrer trotz der Berücksichtigung der Vorteile von ADWTs zur Erreichung des Bildungsziels einige Einschränkungen aufweisen, wie eingeschränkte Zugänglichkeit, mangelndes Wissen und Sorge um ihre Auswirkungen auf Integrität und Kreativität. Die Forschung deutete darauf hin, dass mit zunehmender Integration von KI-Technologien in die Bildung ethische Anliegen und die Beteiligung der Interessengruppen für ihren erfolgreichen und verantwortungsvollen Einsatz notwendig sind. Forschungen untersuchten die Wirksamkeit von KI-Technologien im Vergleich zu menschlichen Bewertern bei der Bewertung von EFL-Schülern28 eingereichten Aufsätzen. Die Bewertung von 30 Essays zeigte, dass KI zwar hochwertige Kommentare in Bezug auf Inhalt, Sprache, Organisation und Korrektheit lieferte, aber konstant niedrigere Bewertungen als menschliche Bewerter. Darüber hinaus lieferte KI ausführlicheres Feedback, aber die Bewertungen verschiedener KI-Tools unterschieden sich nicht wesentlich.
Forschungslücke:
Derzeit untersucht die meiste Forschung zu AWE-Stipendien entweder die Genauigkeit oder die Akzeptanz der Nutzer. Nur sehr wenige untersuchen, ob Bewertungsunterschiede systematisch Muttersprach- oder Kompetenzgruppen benachteiligten. Während frühere Studien die Akzeptanz der Nutzer untersucht haben oder sich auf ein bestimmtes AWE-System aus einem bestimmten Land und Stichprobengröße beschränken, stellen sich Fragen zur Generalisierbarkeit. Obwohl sowohl SHAP als auch PCA XAI-Strategien sind und entwickelt wurden, um die Transparenz zu erhöhen, haben keine Studien Fairness-Mechanismen oder wie Lernende KI-Feedback aus dem AWE nutzen, untersucht. Es gibt keine umfassenden Rahmenwerke in der Literatur, die definierte Dimensionen von Genauigkeit, Fairnessanalyse und Lernwahrnehmungen berücksichtigen. Es gibt kein Beispiel für ein erklärbares Bewertungsmodell, das die Genauigkeit, Fairness und die Wahrnehmung der Lernenden berücksichtigt. Ein erklärbarer Rahmenwerk, TLEF, und ein kombiniertes Modell, AFMM, werden in dieser Forschung vorgeschlagen und validiert, um Genauigkeit, Fairness und die Wahrnehmung der Lernenden gleichzeitig bei mehrsprachigen und kompetenzdiversen Lernenden zu bewerten.