$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La mondialisation intensive de l’éducation et des technologies numériques a accru le besoin d’évaluer scientifiquement et de manière crédible le niveau d’écriture en anglais pour l’enseignement des langues, le développement académique et l’avancement professionnel1. Les évaluations d’écriture conventionnelles, telles que pratiquées par l’évaluation humaine, peuvent mesurer des aspects subjectifs de l’écriture comme la rigueur de l’argumentation et l’adéquation culturelle2, mais sont sujettes à de longs délais de révision, à des coûts de main-d’œuvre élevés et à des biais dus à l’expérience et aux penchants de l’évaluateur 3,4. Ces contraintes sont particulièrement marquées dans les pratiques à grande échelle, comme les tests de langues internationales (IELTS, TOEFL) ou d’autres cours d’anglais enseignés dans les universités où la notation manuelle ne peut pas être la seule chose requise en termes de retour instantané et de couverture5.
Les systèmes AWE sont devenus largement utilisés dans ce contexte en raison de leur traitement en temps réel, de leur standardisation et de leurscalabilité 6. Des outils populaires comme Grammarly (qui se concentre sur les erreurs grammaticales et le raffinement du style) et ETS Criterion (qui respecte les normes d’écriture formelles) sont actuellement utilisés par des millions d’élèves dans l’enseignement primaire et secondaire, les écoles de langues, l’enseignement supérieur et la formationindividuelle 7. Bien que ce soient les avantages, l’efficacité technologique et l’applicabilité éducative des systèmes AWE restentcontestées. Techniquement parlant, les systèmes existants sont très précis sur les dimensions objectives, y compris la détection d’erreurs et la diversité lexicale, où la corrélation avec le score humain peut être supérieure à 0,859. Cependant, dans des domaines plus subjectifs, tels que la pertinence du contenu, l’argumentation logique et l’organisation d’un texte, les corrélations deviennent souvent inférieures à 0,7010. Un tel déséquilibre risque de favoriser une précision superficielle parmi les apprenants au détriment de la compétence globale enécriture 11.
La question de l’équité limite également l’utilité éducative de l’AWE. Les études actuelles sont également portées sur les indicateurs agrégés de précision, négligeant la possibilité de déviations qui désavantageraient systématiquement certains groupes12. De manière indiquable, les caractéristiques de l’interlangue partagées par les apprenants chinois ou espagnol seraient confondues avec des erreurs, ce qui entraînerait une sous-estimationsystématique 13,14. De plus, l’acceptation subjective des retours d’IA par les apprenants est généralement peu connue15. Les enquêtes indiquent qu’environ un tiers des apprenants non natifs rapportent une inadéquation entre les scores de l’IA et la performance réelle, les processus de précision technique, d’équité de groupe et de satisfaction des apprenants étant encoremal compris 16.
Ces faiblesses reflètent les lacunes du paradigme classique deprécision 17. Un cadre qui ne considère que l’alignement entre l’IA et le score humain ne peut pas saisir les questions d’équité ou la confiance de l’apprenant dans le système. En pratique, la valeur éducative de l’AWE doit satisfaire simultanément trois conditions : la précision technique, l’équité entre les groupes et l’acceptation par lesapprenants 18. L’absence d’une telle approche de validation globale explique pourquoi les systèmes AWE bénéficient d’une adoption généralisée mais d’une confiance limitée dans la pratiqueéducative 19,20.
Pour relever ce défi, la présente étude introduit un cadre de validation multi-niveau qui intègre la précision technique, l’équité de groupe et individuelle, ainsi que la perception de l’apprenant dans une structure cohérente. Le cadre XAI proposé est conçu pour être mis en œuvre de manière pratique dans les plateformes AWE existantes en fournissant aux enseignants et aux élèves des diagnostics d’équité et des explications transparentes des notes, et peut être appliqué dans des cours d’écriture ou des cours de préparation à des examens afin d’évaluer sa capacité à améliorer l’équité, l’interprétabilité et l’utilité pédagogique dans des contextes d’évaluation réels.
Dans ce contexte, l’hypothèse est une AFMM visant à étudier le rôle médiateur de l’équité perçue dans la détermination de la relation entre précision et satisfaction, ainsi que le rôle modérateur de la maîtrise du langage sur la sensibilité à l’équité. Ainsi, il contribue de deux façons, à la fois théoriquement en enrichissant les modèles d’évaluation de l’AWE en décrivant l’équité comme l’une des dimensions clés de validation aux côtés de la précision et de la perception, et concrètement, en fournissant aux développeurs des stratégies pour maximiser l’équité, les éducateurs avec des critères de sélection système sensibles au groupe, et la valeur éducative de l’AWE en expliquant la manière dont les perceptions des apprenants se forment. En plus de l’éducation, le cadre s’inscrit également dans le concept plus large de XAI, démontrant comment l’équité et la perception des utilisateurs peuvent renforcer la transparence, la confiance et l’acceptation dans d’autres domaines tels que la santé, les systèmes autonomes et la cybersécurité.
Questions de recherche :
1.To dans quelle mesure le système AWE démontre-t-il une précision technique et une équité entre différents groupes de langue maternelle et de compétence ?
2. Comment un cadre d’évaluation multi-niveau basé sur XAI peut-il améliorer la transparence et l’équité dans l’évaluation automatisée de la rédaction en anglais ?
REVUE DE LA LITTÉRATURE :
Les facteurs qui influencent l’acceptation des retours AWE par les étudiants ont été examinés à l’aide d’un modèle d’acceptation technologique étendu (TAM)21. Sur la base des données d’enquête menées auprès de 448 étudiants chinois utilisant le MEB, il a été déterminé que l’utilité, la facilité d’utilisation et l’intention avaient une influence significative sur la norme subjective, la confiance, l’auto-efficacité, le retour cognitif et les caractéristiques du système. Cependant, l’étude s’est limitée à une seule nation et à un seul groupe d’étudiants, ce qui limite l’applicabilité de la généralisation. Pour explorer comment les étudiants chinois en langue étrangère réagissent aux retours PigaiAWE 22, une étude a analysé les soumissions répétées (n = 5) d’étudiants universitaires. Il a noté une attention précoce portée à la correction d’erreurs, une faible absorption de rétroaction linguistique et un approfondissement progressif de la réponse. Cependant, la taille de l’échantillon était très limitée, tout comme le système AWE, qui limite l’applicabilité et la généralisation. Les convictions des enseignants d’anglais langue étrangère concernant l’application de l’outil de notation IA (CoGrader) ont été examinées afin d’identifier les facteurs influençant leursopinions 23. À travers une étude mixte menée auprès de 10 enseignants universitaires saoudiens, une enquête et un entretien ont révélé qu’il y avait un avis positif mitigé, mais une réticence à être totalement sûr de la fiabilité et d’un remplacement complet des enseignants. Cela entrave la généralisation en raison de l’échantillon limité et du cadre d’un seul pays.
En tenant compte des avancées en linguistique des corpus et en technologie de l’IA, une étude a étudié les cadresAES 24. Elle a utilisé l’ACP pour améliorer les indicateurs linguistiques d’évaluation de la qualité de l’écriture et a découvert que combiner des micro-caractéristiques avec des caractéristiques agrégées définissait la qualité de l’écriture plus efficacement que les seules caractéristiques agrégées. L’approche non linéaire de l’AES basée sur la régression en forêt aléatoire a surpassé les autres approches. De plus, SHAP identifiait des éléments essentiels du langage pour chaque attribut évalué, augmentant la transparence du système grâce à une IA explicable. Les résultats contribuent peut-être à améliorer les méthodes multidimensionnelles dans l’écriture, l’évaluation et l’éducation. Le système de collaboration homme-machine a été introduit pour relever les défis liés à l’annotation des écrits arabes, souvent coûteux et chronophages. La méthode considère des essais basés sur sept aspects de la littérature avec l’aide d’un LLM. Les processus de validation et les tactiques d’incitation ont été personnalisés pour garantir cohérence et précision. Cette coopération entraîne une plus grande quantité de ressources étiquetées et n’affecte pas la qualité de l’évaluation, démontrant qu’il s’agit d’une méthode d’annotation évolutive adaptée aux langages à ressources plus faibles.
L’utilisation de l’IA dans le domaine éducatif offre une opportunité de réduire significativement les exigences de correction et d’améliorer l’enseignement del’écriture 25,26. Parallèlement, les chercheurs ont souligné que la précision de l’IA n’est pas le seul aspect pertinent pour son utilisation responsable. Il existe des principes d’équité et de réduction des préjugés, de sécurité et de confidentialité, de responsabilité, d’explicabilité, de transparence, d’impact éducatif, d’intégrité et de développement continu. Des recherches récentes ont évalué empiriquement le score zéro tir basé sur GPT-4o, en se concentrant sur ces exigences. La recherche s’est concentrée sur les perceptions que les éducateurs avaient envers les ADWT concernant l’aspect de l’intégrité éducative27. L’étude transversale impliquant 100 étudiants en master et professeurs dans 10 matières suggère que, malgré les avantages attribués par les enseignants aux ADWT pour atteindre l’objectif éducatif, elle présente certaines limites, telles qu’une accessibilité limitée, un manque de connaissances et des inquiétudes quant à son impact sur l’intégrité et la créativité. La recherche a suggéré qu’à mesure que les technologies d’IA s’intègrent davantage à l’éducation, les préoccupations éthiques et la participation des parties prenantes sont nécessaires pour leur utilisation réussie et responsable. Des recherches ont examiné l’efficacité des technologies d’IA par rapport aux évaluateurs humains dans l’évaluation des essais soumis par des élèvesEFL de 28 ans. L’évaluation de 30 essais a révélé que, bien que l’IA ait offert des commentaires de haute qualité en termes de contenu, de langage, d’organisation et de justesse, elle obtenait constamment des notes inférieures à celles des évaluateurs humains. De plus, l’IA a fourni un retour plus complet, mais les scores des différents outils d’IA n’étaient pas substantiellement différents.
Lacune de recherche :
Actuellement, la plupart des recherches sur la recherche de l’AWE examinent soit l’exactitude, soit l’acceptation par les utilisateurs. Très peu examinent si les différences de notation désavantagent systématiquement les groupes de langue maternelle ou de compétence. Bien que des études antérieures aient examiné l’acceptation par les utilisateurs ou soient limitées à un système AWE spécifique d’un pays et d’une taille d’échantillon spécifiques, des questions de généralisation se posent. Bien que SHAP et PCA soient toutes deux des stratégies XAI et aient été développées pour accroître la transparence, aucune étude n’a examiné les mécanismes d’équité ni la manière dont les apprenants utilisent le retour IA issu de l’AWE. Il n’existe pas de cadres étendus dans la littérature qui contemplent des dimensions définies de précision, d’analyse d’équité et de perception des apprenants. Il n’existe aucun exemple de modèle d’évaluation explicable qui prenne en compte la précision intra et inter-évaluateur, l’équité et les perceptions des apprenants. Un cadre explicable, TLEF, et un modèle combiné, AFMM, sont proposés et validés dans cette recherche afin d’évaluer la précision, l’équité et les perceptions des apprenants chez les apprenants multilingues et ayant une compétence diverse.