Article de recherche

Étude de l’effet de l’évaluation automatique de l’écriture à travers un réseau de neurones profond et l’évaluation écrite des enseignants sur la performance en écriture anglaise

DOI :

10.3791/69995

8 mai 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La fourniture de retours sous forme de deux fonctionnalités sémantiques NLP via le système informatique et les retours écrits de l’enseignant a été utilisée pour améliorer la fluidité et la correction de l’écriture anglaise des élèves. Les résultats ont montré des résultats positifs concernant la première.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les technologies d’apprentissage des langues assistées par ordinateur ont réalisé les plus grands progrès dans l’apprentissage des langues, notamment dans le contexte de l’intelligence artificielle (IA), ces dernières années. Il existe diverses technologies, telles que l’évaluation automatisée de la rédaction (AME ci-après) et la correction automatisée des essais (AES), considérées comme des piliers de l’apprentissage des langues, non seulement dans les disciplines informatiques mais aussi dans l’éducation. L’évaluation ne peut être réalisée que sous forme de scores holistiques utilisant la technologie AWE, qui s’est avérée très efficace pour améliorer l’apprentissage des langues et ne peut donc pas fournir de retour détaillé ou approfondi. Pour fournir des retours d’écriture détaillés sur deux éléments majeurs d’une langue (c’est-à-dire la grammaire et la fluidité), un système d’implémentation assisté par ordinateur impliquant des modèles de réseaux de neurones, et deux méthodes de traitement du langage naturel basées sur la sémantique (NLP ci-après) ont été envisagées. À cette fin, 90 étudiants universitaires pakistanais apprenant l’anglais langue seconde (ESL) ont été assignés au hasard aux groupes témoins, de retour d’information des instructeurs et aux groupes expérimentaux. L’évaluation assistée par ordinateur englobait un réseau de neurones. Les résultats du test de comparaison entre le modèle de référence AWE et les enseignants qui ont noté ont montré une corrélation entre le retour assisté par ordinateur utilisant ces réseaux de neurones. Les implications de tels résultats résident dans la pédagogie de l’écriture ESL, en particulier dans des situations où la précision linguistique et la fluidité posent un défi.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le retour d’information en écriture traite de divers attributs du langage, tels que l’organisation, la grammaire, la fluidité, le contenu et la mécanique, permettant aux apprenants de réécrire ou de créer un nouveau texteécrit 1,2,3. Actuellement, les enseignants en écriture anglaise ont été un bénéficiaire majeur grâce aux évolutions rapides et aux avancées de l’apprentissage assisté des langues par ordinateur (CALL ci-après) et de l’évaluation assistée de l’écriture assistée par ordinateur sous la forme de l’AWE ou AES, ainsi que de la notation des essaisécrits 4. De plus, l’évaluation assistée par ordinateur de l’écriture anglaise fournit un retour diagnostique sur des éléments linguistiques tels que le contenu, la grammaire, le vocabulaire, etc., fournissant des réponses rapides, individuelles et objectives au texte écrit des élèves. Le système AWE est également en mesure de fournir des réponses écrites claires aux étudiants afin qu’ils intériorisent les connaissances acquises par ces réponses écrites et augmentent la capacité cognitive6des élèves.

La présente étude s’est basée sur une recherche4, qui proposait le concept d’un apprentissage de l’écriture en anglais multi-stratégie, informatisé, avec la théorie du retour d’écriture anglaise en perspective et le processus de notation analytique en tête. Cela incluait d’autres modèles basés sur la sémantique NLP qui intégraient l’apprentissage profond dans les retours écrits pour offrir une évaluation écrite élaborée. Elle répond aux limites des technologies AWE antérieures, qui ne mettent l’accent que sur l’holistique mais pas sur l’analyse et sur le score spécifique. Par conséquent, cela concerne davantage une évaluation précise et immédiate avec des notes de sous-marquage et de notes totales concernant une série d’éléments d’indicateurs linguistiques afin d’améliorer l’apprentissage de l’écriture anglaise chez les élèves. Parmi les diverses caractéristiques de la linguistique (c’est-à-dire contenu, complexités, correction, fluidité), la présente étude n’examinera que la fluidité et l’aspect grammatical des apprenants en langue seconde langue seconde au Pakistan. À cette fin, l’étude actuelle propose une stratégie de technologie NLP qui implique l’utilisation de réseaux de neurones accompagnés d’une évaluation par les enseignants.

Dans le contexte de l’apprentissage de la langue pakistanaise, les élèves pakistanais rencontrent des difficultés pour apprendre l’écriture en anglais, même s’ils considèrent que l’étude de l’anglais est obligatoire à partir de la 1re année et jusqu’à la 14e année. C’est là que de nombreux facteurs, tels que de mauvaises méthodes et l’utilisation des anciennes méthodes pour expliquer la grammaire, entrent en jeu7. Au niveau universitaire, le nombre d’étudiants que les enseignants doivent enseigner est assez considérable, car les étudiants proviennent d’un éventail d’horizons incluant divers collèges et écoles. Cela oblige les enseignants à passer beaucoup de temps à corriger les erreurs d’écriture des élèves, ce qui rend la charge de travail beaucoup trop élevée. En revanche, les élèves prenaient pour acquis les retours écrits des enseignants et ne faisaient pas d’efforts pour reconnaître les erreurs et lescorriger 8.

Une étude a indiqué que la fluidité est principalement influencée par le fait que, parce que les élèves craignent de commettre une erreur, elle devient un obstacle à l’écriture fluide, et qu’ils préfèrent donc éviter de faire des erreurs plus fréquemment plutôt que de s’engager dans leurs pensées. Il y a parfois une interférence de la langue ourdou avec l’écriture anglaise, en plus d’autres facteurs contextuels. De plus, l’ourdou est la langue nationale. En raison de ces facteurs contextuels, les enseignants ont du mal à fournir un retour précis, opportun et cohérent à chaque élève chaque fois que les élèves produisent des écrits ou éditent les manuscrits. En considérant la théorie de l’évaluation de l’écriture, cette étude pourra suivre celle qui utilise une stratégie de retour automatique par écriture automatique lors de la comparaison de l’évaluation traditionnelle de l’enseignant, et utilise la notation analytique plutôt que holistique afin de garantir que les élèves obtiennent un retour instantané sur les deux dimensions linguistiques majeures (c’est-à-dire la grammaire et la fluidité).

Différents produits industriels AWE et AES ont émergé, notamment Pigai.org, Bingo English, My Access, E-rater, I-write, Criterion, etc. AES/AWE à ses débuts de développement se caractérise principalement par le système traditionnel d’apprentissage automatique basé sur le théorèmede Bayes 10, la régressionlinéaire 11 , etc. Actuellement, le développement étendu de l’apprentissage profond, en particulier la technologie des réseaux de neurones, a également apporté un bénéfice remarquable au domaine de la rétroaction écrite, tels que les réseaux de neurones récurrents (RNN12), la mémoire longue et courte durée13, les réseaux neuronaux convolutionnels (CNN)14, l’approcheBERT 15. L’AWE a également bénéficié des stratégies de pré-formation employées au début du NLP16. De nombreuses études ont pris en compte diverses solutions axées sur les réseaux de neurones, telles que la génération d’échantillons adversariaux à des fins d’apprentissage, l’apprentissage via Multitâche17, l’apprentissage par auto-supervision18, et les algorithmesgraphiques 19. Certains ont suggéré différentes techniques pour résoudre le problème du manque de données d’entraînement pour rédiger des retours20. Il existe également des modèles de notation qui contribuent à de nombreux modèles de réseauxde neurones 21.

La correction d’erreurs grammaticales (GEC ci-après) est une méthode indépendante des missions NLP, capable de détecter puis corriger automatiquement les erreurs de composition. Le contenu des tâches du GEC est interrelié à celui des aspects AWE. Les tâches AWE sont considérées comme prenant en compte le diagnostic des erreurs grammaticales, dont la plupart doivent être mises en évidence sous la forme correcte. Cependant, les études de l’AWE ont accordé moins d’attention au GEC, et seules quelques recherches ont intégré le modèle initial du GEC dans la technologie AWE. Au départ, la recherche sur le GEC choisit la plupart du temps N-gramme22, et le modèle de langage23 incluantBERT 24 pour identifier et corriger les erreurs grammaticales. Cependant, les solutions ci-dessus ne pouvaient pas résoudre complètement des problèmes tels que le désordre et l’omission de composants. L’architecture du codeur-décodeur25 a atteint le même succès en GEC en répondant à des problèmes que d’autres modèles ne pouvaient pas résoudre auparavant. Il est important de noter que les architectures GEC avancées utilisaient plusieurs modèles pour résoudre des problèmes, y compris les approches basées surTransformer 26.

Différentes études ont confirmé l’efficacité de l’AES par rapport aux évaluations humaines lorsqu’il s’agit d’évaluer la rédaction d’essais27,28. Une étude29 a démontré l’effet de l’évaluation automatisée sur la maîtrise de l’anglais des apprenants. Les résultats indiquaient que l’évaluation automatique avait un effet positif sur la maîtrise de l’écriture anglaise. En revanche, certaines autres étudesnégligentle taux élevé de détection d’erreurs par AES par rapport aux évaluations humaines. Des études récentes soulignent l’efficacité croissante des outils assistés par IA pour l’évaluation de l’écriture dans l’enseignement des langues. L’une de cesétudes, 31, a comparé la correction automatisée avec les retours de l’enseignant dans le contexte d’apprentissage des étudiants chinois.

Le rôle révolutionnaire des outils basés sur l’IA dans l’écriture académique a été activement rapporté dans la littérature récente. Les recherches concernant l’application d’outils d’écriture alimentés par l’IA comme compléments à l’enseignement traditionnel de l’écriture EFL soulignent l’importance primordiale de l’égalité des chances et d’un soutien proactif des enseignants dans la mise en œuvre réussie dela technologie 32. Les études qui ont étudié l’AWE, telles que Pigai, ont indiqué une forte corrélation entre le retour sous le soutien informatique et l’amélioration de l’écriture, de la révision et des nouvelles écrituresESL 33. Une autre étude a mis en lumière les avantages des autoencodeurs variationnels (VAE) qui influencent positivement l’aspect de l’apprentissage de l’écriture anglaise chez les apprenants et recueillent des retours sur des niveaux supérieurs d’apprentissage profond, en se spécialisant dans les différentes caractéristiqueslinguistiques 34. Une autre recherche a suggéré que les systèmes d’EA neuronale seraient efficaces à utiliser avec le GEC basé sur le NLP, qui utilise l’apprentissage profond pour offrir une évaluationimmédiate 35.

L’amélioration des systèmes multi-agents est une étape importante dans le développement de technologies qui facilitent l’écriture. Un exemple d’assistant à l’affinement de la rédaction académique en tant qu’agent multi-agent, l’AcademyCraft, basé sur l’apprentissage profond, a démontré sa capacité à écrire et à fournir des retours détaillés, facilitant ainsi un support en rédaction EFL/ESL basé sur l’IA, sur des schémas analytiquescomplexes 36. En fait, des études d’apprentissage des langues basées sur la technologie ont également identifié divers schémas émergents tels que l’apprentissage profond, l’évaluation automatique et le retour sémantique avec une analyse de performance montrant une augmentation progressive et constante de la précision de l’écriture, ainsi qu’un engagement desapprenants 37.

Les modèles Transformer-LSTM ont montré une certaine propension à l’évaluation automatique et au retour d’information sur l’écriture anglaise. Ces architectures hybrides ont mutuellement pris en compte la compréhension contextuelle des transformateurs ainsi que le traitement séquentiel des systèmes LSTM, ce qui a permis de démontrer une meilleure précision concernant la grammaire et la gradation de cohérence, et de fournir une génération de rétroaction plusnuancée 38. La perception des enseignants d’anglais langue étrangère sur les outils d’écriture par IA rapporte régulièrement des améliorations mesurables dans l’organisation du contenu et la qualité de la rédaction, en mettant l’accent sur le rôle crucial de l’aide pédagogique dans le déclenchement de l’utilité de l’intégration technologique39. Moins d’études comparent les retours des enseignants et ceux assistés par ordinateur, ce qui implique des modèles d’apprentissage profond pour explorer l’effet sur l’écriture anglaise des apprenants ESL en termes de fluidité et de grammaire.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tous les logiciels et outils utilisés dans l’étude sont listés dans le tableau des matériaux.

Critères de notation

La classification d’évaluation adoptée dans la présente étude couvre deux domaines majeurs, à savoir la fluidité et la correction, qui intègrent toutes les exigences pour une évaluation complète de l’écriture en anglais langue étrangère (EFL). Ces dimensions visent à mesurer les points clés de la qualité de l’écriture qui favorisent une communication efficace et la démonstration de compétences linguistiques. Le module Fluence mesure la naturalité, l’expressivité et la cohérence à l’écriture en mesurant la fluidité des idées ainsi que la qualité de l’utilisation des mots et de la structure des phrases. Le module Correcteur vise la précision grammaticale, la perfection mécanique et la conformité aux conventions anglaises standard et, hypothétiquement, mesure et compte l’erreur de la langue à plusieurs niveaux. (voir Tableau 1)

Définition de la tâche

Conformément aux conditions d’évaluation automatisée de l’écriture des élèves apprenant la langue anglaise, la présente étude propose un nouveau modèle de système d’évaluation assistée par ordinateur de l’écriture anglaise EG. Comparé aux études précédentes, limitées par la portée des systèmes automatisés d’évaluation de l’écriture, le système proposé aidera à résoudre ces limites grâce à l’introduction de techniques innovantes d’apprentissage profond permettant aux utilisateurs d’accéder à un niveau d’analyse linguistique, de portée de modification et d’analyse de rétroaction à l’échelle du système basé sur un traitement étendu des données. En s’appuyant sur deux des indicateurs les plus importants d’une composition, à savoir la fluidité (à quel point l’œuvre est naturelle, cohérente et expressive par nature), ou la justesse (la qualité correcte de la rédaction du texte, truffée d’erreurs grammaticales, mécaniques et linguistiques), avec les composantes distinctes des réseaux de neurones, le système à double modèle doit effectuer un certain nombre d’évaluations. De plus, il identifie les erreurs à plusieurs niveaux linguistiques, recommande des mesures correctives et donne des retours sous forme de liste permettant aux utilisateurs d’améliorer l’apprentissage des langues par les élèves de manière méthodique. Pour décrire le processus de calcul du système d’évaluation automatique assistée par ordinateur, nous proposons le modèle mathématique suivant dans les formules (1)–(4) (voir Tableau 2).

figure-protocol-1(1)

figure-protocol-2(2)

figure-protocol-3(3)

figure-protocol-4(4)

où : Note finale = le score composite d’évaluation de l’écriture ; w1 = poids attribué au score de fluidité ; w2 = poids attribué au score de correction ; Sf = score de fluidité basé sur le BERT (normalisé à [0, 1]) ; Sc = score de correction exponentielle de la désintégration ; λ = constante de décroissance contrôlant la pénalité d’erreur ; σ(x) = fonction d’activation sigmoïde logistique ; ErrorRatio = ratio d’erreurs par rapport au total des jetons dans le texte. Les scores de fluidité sont normalisés à [0, 1] par la fonction sigmoïde logistique σ(x), tandis que la fonction de désintégration exponentielle est utilisée pour noter la correction afin d’imposer une pénalité appropriée à la fréquence d’erreur.

Architecture et conception système

Son architecture système utilise un système à deux modèles avec une architecture de traitement parallèle, dans lequel l’analyse des essais d’entrée est réalisée en parallèle via des voies d’évaluation parallèles. Les modules de Fluidité et de Correction donnent à leur tour les scores correspondants, et le score composite final est la moyenne pondérée des deux sous-scores. Le module de correction propose également une suggestion sur la détection et la correction des erreurs, en plus du score (voir Figure 1).

Le module de fluidité

La fluidité en écriture peut être définie comme la nature ou le schéma d’utilisation d’une langue en ce qui concerne le choix correct du vocabulaire, la variété de la structure des phrases, la complexité syntaxique, la cohérence, etc.4. Les modèles d’évaluation de la fluidité capturent les idées transmises sans bégaiement ni maladroit, ce qui semble approximatif des tendances nativistes de communication. La mesure traditionnelle de la fluidité est basée sur des échelles, mettant en lumière les préoccupations de fiabilité entre les évaluateurs. Le système proposé surmonte ce défaut en incluant un réseau de neurones basé sur le BERT pour induire automatiquement la cohérence sémantique et la naturalité linguistique grâce à une compréhension situationnelle approfondie. Cette décision architecturale a été prise en tenant compte des forces du BERT, qui s’est avéré efficace pour identifier les relations contextuelles et les schémas sémantiques nécessaires à la mesure de la fluidité. Les séquences d’entrée sont introduites dans le système et passées à travers 12 couches transformateurs avec auto-attention multi-têtes afin d’identifier les dépendances à longue portée et les relations contextuelles ( voir Figure 2).

Le mécanisme de l’attention serait le suivant :

figure-protocol-5(5)

Soient Q, K et V les matrices représentant respectivement la requête, la clé et la valeur, et d et k les dimensions des vecteurs clés. L’inclusion du token CLS est la solution résumée, qui enregistre la cohérence sémantique globale de toute la séquence d’entrée.

Le calcul du score de fluidité est le suivant :

figure-protocol-6(6)

Dans laquelleh CLS est l’inclusion du token BERT [CLS], et lerégulateur W,sont b régul les paramètres de la tête de régression, et σ est la fonction d’activation sigmoïde qui normalise la sortie à [0, 1].

Le module de correction

L’évaluation de la correction se concentre sur la précision grammaticale, la précision mécanique et le respect des conventions anglaises standard. Cette dimension traite des aspects techniques de l’écriture, notamment la syntaxe, la morphologie, la ponctuation et la précision orthographique. La composante correcteur évalue non seulement le nombre d’erreurs linguistiques, mais examine aussi l’impact sur la qualité globale du texte. Contrairement à l’évaluation de la fluidité, qui met l’accent sur la cohérence sémantique et le flux naturel, le module d’évaluation de la correction nécessite une identification précise des erreurs et une correction systématique. Le module distingue les différents types d’erreurs, évalue la gravité et fournit des corrections ciblées pour soutenir l’amélioration de l’apprentissage. La perte de correction utilise le modèle FLAN-T5, qui a été affiné pour la détection et la correction des erreurs grammaticales. Ce choix est informé par la transformabilité texte-texte de T5, qui permet au système non seulement de trouver des erreurs mais aussi d’effectuer les corrections pertinentes au sein d’un même système. Le système est une forme encodeur-décodeur, et le texte est alimenté sous la forme de cette transformation : (voir Figure 3)

figure-protocol-7(7)

L’élément encodeur génère des représentations contextuelles qui capturent non seulement les tendances grammaticales mais aussi les zones potentielles de défaillance :

figure-protocol-8(8)

Grâce à la génération de variations grammaticales appropriées sur des erreurs faussement identifiées, le décodeur génère des séquences corrigées :

figure-protocol-9(9)

Ce type de traitement bidirectionnel permet au système d’avoir la conscience des contextes des erreurs et de la manière dont ces contextes doivent être corrigés, afin que les indices soient sémantiquement cohérents, tout en se concentrant sur toute correction grammaticale.

Quantification de l’erreur et algorithme de notation

Le score de précision comparait l’écriture originale à la version correcte de l’écriture, en tenant compte des erreurs linguistiques et de la gravité basées sur la position dans le texte et l’interférence avec le sens. Cette méthode permet de distinguer les types d’erreurs par rapport à l’impact sur la compréhension textuelle du texte. La relation entre la fréquence des erreurs et la mauvaise qualité du texte a été soulignée de manière logarithmique dans le système de notation. Une étape fondamentale dans la comparaison par jetons entre le texte original et le texte corrigé est deux degrés de comparaison fondés sur la technique bit par bit de l’alignement des chaînes. La deuxième étape consiste à identifier et à classer les types d’erreurs sur la base de certaines taxonomies linguistiques connues qui différencient les erreurs grammaticales (accord sujet-verbe, cohérence des temps et fiabilité de la structure syntaxique), les erreurs mécaniques (majuscules, ponctuation et orthographe) et d’utilisation (choix des mots, expression idiomatique et adéquation des registres). La troisième étape consiste à calculer le taux d’erreur basé sur la longueur totale du texte. La quatrième étape exploite l’algorithme de notation exponentielle de la décroissance qui transforme les rapports d’erreurs en scores de correction directement interprétables afin d’approximer la dépendance non additive et non linéaire entre la fréquence des erreurs et la qualité du texte.

Le traitement mathématique du processus de quantification des erreurs commence par le calcul du ratio d’erreurs installé, ce qui fournit un taux d’installation d’erreur normalisé, ce qui permet à son tour une comparaison équitable de textes de différentes longueurs :

figure-protocol-10(10)

figure-protocol-11(11)

Il a été établi un paramètre d’étalonnage de 2,5 sur une base empirique en validant pleinement cela avec des jugements d’experts humains, afin que la fonction de notation puisse offrir des résultats en accord avec la compréhension humaine concernant la baisse de la qualité du texte à mesure que la fréquence des erreurs augmente. Définir cette valeur de paramètre de cette manière garantit que tout texte avec un faible taux d’erreur (Error_Ratio < 0,1) obtient un score élevé de correction car il suit de près les règles de l’anglais standard ; tout texte avec un taux d’erreur modéré (0,1 < Error_Ratio ≤ 0,3) a un score intermédiaire de correction, indiquant qu’il existe certaines préoccupations linguistiques qui ne sont néanmoins pas carrément désastreuses, et tout texte avec un taux d’erreur élevé (Error_Ratio > 0,3) a obtenu un faible score de correction car il existe des préoccupations linguistiques cruciales qui affectent significativement la possibilité de compréhension.

L’algorithme de notation de la correction pour l’évaluation de la correction prend systématiquement en compte toutes les erreurs localisées et fixées par le système basé sur T5 comme éléments de pénalité dans le calcul du ratio d’erreur final. Le mécanisme de crédit pénal utilisé pour les erreurs grammaticales est représenté par la diminution exponentielle de la croissance du ratio d’erreur vers des valeurs élevées, ce qui signifie que la qualité du texte est très médiocre, et devient 100 lorsque le ratio d’erreur est égal à 0, ce qui signifie qu’aucune erreur n’est détectée. C’est une utilisation parfaite des conventions standard anglaises. Une telle relation mathématique garantit que le code de correction offre une distinction significative dans tout le spectre des niveaux de compétence linguistique et répond à de petites avancées successives, qui indiquent des acquisitions réelles.

Ensembles de données : corpus d’entraînement et d’évaluation

Les données d’entraînement de qualité et de portée suffisantes sont primordiales pour la performance du système à double modèle. L’étude actuelle a utilisé un ensemble de données bien conçu de textes écrits par les élèves pour développer et évaluer le modèle, qui a été produit en employant différentes tâches d’écriture. L’échantillon comprenait 45 étudiants universitaires pakistanais masculins et 45 filles, avec un âge moyen de 19 ans, étudiant « l’anglais fonctionnel » comme cours obligatoire. Chaque élève a rédigé huit essais pendant huit semaines, incluant les essais préalables, les essais d’intervention et les occasions post-examen. Les élèves pouvaient écrire entre 400 et 450 mots pour chaque tâche d’écriture. Les statistiques des ensembles de données fournissent les caractéristiques suivantes :

70 500 mots

Longueur moyenne des phrases : 15,7 mots (DS = 3,2)

Plage de vocabulaire (Ratio type-jeton) : 0,64 (DE 0,08) Densité d’erreur grammaticale : 2,3 en 100 mots (Écartage = 1,1)

La justification et l’assurance qualité des données sélectionnées

Le jeu de données choisi reposait sur quelques considérations importantes qui ont permis la richesse et la pertinence pour les travaux de recherche sur l’évaluation automatisée de l’écriture. Pour commencer, la population étudiante en économie a été sélectionnée en raison de sa nature, similaire à celle des apprenants d’EFL dans l’enseignement supérieur pakistanais, permettant ainsi la présentation d’exemples d’écriture plus authentiques qui reflètent des situations réelles. Deuxièmement, l’établissement de la plage maximale et minimale potentielle de mots, 400–450 mots, a été informée par des données d’études pilotes que cette plage est suffisamment complexe linguistiquement pour être analysée de manière fiable par une machine, et elle est restée en même temps d’une taille gérable en termes d’évaluations humaines cohérentes. Chacune des compositions a été évaluée par trois enseignants d’anglais formés (fiabilité inter-évaluateurs κ = 0,847, dimension de la fluidité, et 0,823, dimension de la correction) selon des échelles standardisées de 10 points de fluidité et de correction. La formation des évaluateurs humains était rigoureuse et reposait sur des grilles d’évaluation développées pour les évaluations écrites IELTS et TOEFL. Les données consistent en un ensemble de données annoté par un humain, qui peut être utilisé pour entraîner et valider des modèles à entraîner sur des données annotées par des humains.

Procédures de prétraitement et de validation des données

L’ensemble de données était pré-traité de manière systématique et impliquait la normalisation du texte, la tokenisation du texte avec le tokeniseur BERT WordPiece, ainsi que la réalisation de contrôles de validation de qualité. Ceux qui ont soumis un travail incomplet et produit du texte plagié n’ont pas été inclus pour déterminer l’intégrité des données. Les dernières données ont été divisées aléatoirement en entraînement (70 %, n = 189), validation (15 %, n = 41) et ensembles de tests (15 %, n = 40) par échantillonnage stratifié afin de les équilibrer entre les niveaux de compétence et le type de tâches. Analyse linguistique d’un vaste corpus de référence contenant des textes académiques professionnels, des articles de journaux et des essais publiés, totalisant environ 50 millions de mots. Ce corpus fournit les schémas linguistiques nécessaires pour effectuer les tests de fluidité et aide dans les procédures de détection des erreurs en les comparant à l’usage standard. Dans le corpus de référence, les étapes avant le prétraitement et l’indexation sont la tokenisation, le tagage des parties du discours, l’analyse syntaxique et l’étiquetage sémantique pour faciliter un accès efficace lors de l’évaluation en temps réel.

Stratégie d’entraînement du modèle de fluidité

Un système d’optimisation séquentielle est proposé pour entraîner les données à atteindre la fluidité. La formation utilisait des fonctionnalités de pointe, notamment la planification adaptative du taux d’apprentissage, la taille progressive des lots et des méthodes avancées de régularisation qui empêchent le surapprentissage au fur et à mesure de la formation, maintenant ainsi l’efficacité du modèle pour identifier les schémas linguistiques indiquant la fluidité linguistique. Le taux d’apprentissage est de 5 × 10-4 avec un calendrier de désintégration linéaire, configuré pour garantir une stabilité de convergence et ne pas osciller autour des valeurs optimales des paramètres. Ce taux d’apprentissage est choisi par recherche en grille dans [1 x 10-6, 1 x 10-4], 5 x 10-5 étant le compromis le plus approprié entre la vitesse de convergence et la stabilité. L’entraînement réel sera limité à seulement 3 époques, une configuration optimisée sur la base des bénéfices empiriques grâce au suivi des pertes de validation pour éviter le surapprentissage sans empêcher les mises à jour suffisantes des paramètres rendant l’apprentissage efficace. Un arrêt précoce des mécanismes avec une patience de 2 époques et un delta minimum de 0,001 a été réalisé pour prévenir la dégradation.

L’optimisation est réalisée par l’optimiseur AdamW, avec des choix simplifiés comme β₁ = 0,9 (momentum, qui contrôle exponentiellement la décroissance des estimations du premier moment), β₂ = 0,999 (estimation du second moment, qui contrôle exponentiellement la décroissance des estimations du second moment), et ε = 1 × 10⁻8 (terme de stabilité numérique). La régularisation de la désintégration pondérative (λ = 0,01) empêche que les magnitudes des paramètres ne deviennent excessivement grandes, cette valeur étant sélectionnée via une analyse de performance de validation sur toute la plage [0,001, 0,1]. La surveillance complexe permet de surveiller diverses métriques lors de l’entraînement afin de garantir les meilleures performances d’un modèle et d’éviter le sur-ajustement. Le cadre de suivi comprend :

Suivi des pertes : Les pertes d’entraînement et de validation sont prises en compte à chaque époque, et l’arrêt précoce se produit automatiquement lorsque la perte de validation ne s’améliore plus pendant deux époques consécutives.

Indicateurs de performance : Les données de validation sont utilisées pour calculer les coefficients de corrélation de Pearson entre les scores prédits et réels toutes les 100 étapes d’entraînement.

Détection de gradient : Les normes de gradient sont surveillées pour détecter les gradients nuls et explosifs, et à une norme de gradient de 1,0, un clipping de gradient est appliqué.

Planification du taux d’apprentissage : Une diminution du taux d’apprentissage basée sur la validation (facteur = 0,5) en cas de plus d’un plateau d’époque est détectée.

Liés à la régularisation : Les taux d’abandon (0,1 pour les BERT, 0,3 pour la tête de régression) ont été observés par ablation systématique. Plusieurs méthodes de régularisation visant à prévenir le surappoint sont utilisées pendant le processus d’entraînement : (1) régularisation du dropout utilisant des taux de dropout optimisés par type de couche du réseau, (2) décroissance du poids comme expliqué ci-dessus, (3) arrêt précoce, déterminé par la performance de validation, et (4) augmentation des données basée sur la paraphrase de 15 % des exemples d’entraînement à l’aide de méthodes de rétrotraduction. Les points de contrôle du modèle le mieux performant ont été sauvegardés après chaque époque, et les modèles ayant obtenu le meilleur score ont été sélectionnés en fonction des scores de corrélation de validation. La fonction de perte utilisée dans la partie évaluation de la fluidité est l’erreur quadratique moyenne (MSE), qui est la fonction principale de la tâche de régression consistant à prédire les scores de fluidité continue. La formulation de la perte est mathématiquement donnée comme suit :

figure-protocol-12(12)

N est la taille totale de l’échantillon d’entraînement, y_pred, i étant le score de fluidité prédit du i-ème échantillon, et y_true, i étant le score de vérité de base correspondant, tel qu’attribué par les experts humains. Cette perte est très utile pour décourager quadratiquement l’erreur réelle de prédiction, de sorte que des erreurs plus importantes entraînent une pénalité plus importante, et elle est également différentiable. Le mécanisme de planification des taux d’apprentissage est très avancé avec un processus en deux phases, et il commence par une étape de réchauffement linéaire, suivie d’un processus systématique de désintégration afin de créer des caractéristiques de convergence optimales. Cela se fait lors de l’étape de réchauffement, où le taux d’apprentissage commence à zéro et évolue progressivement vers le taux maximal, après quoi les paramètres du modèle sont optimisés par rapport au jeu de données d’entraînement. L’expression mathématique de la phase d’échauffement est la suivante :

figure-protocol-13(13)

Après la phase d’échauffement, le taux d’apprentissage est décroché de manière systématique et linéaire afin d’éviter de dépasser les valeurs optimales des paramètres et aboutir à une convergence stable. Mathématiquement, la phase de désintégration se lit ainsi :

figure-protocol-14(14)

Dans lequel t est l’étape d’entraînement en cours, lr max est le taux d’apprentissage maximal atteint pendant l’échauffement, l’échauffement est le nombre d’étapes assignées à la phase d’échauffement, et le total est le nombre total d’étapes d’entraînement sur toutes les époques. La procédure de planification mentionnée garantit un apprentissage agressif du modèle aux niveaux inférieurs et une stabilité aux niveaux de convergence.

Stratégie d’entraînement du modèle de correction

Le modèle de correction était basé sur la stratégie d’apprentissage par transfert utilisant le modèle FLAN-T5 pré-entraîné pour tirer parti de toutes les connaissances grammaticales disponibles selon les besoins. Cela visait à examiner la compréhension générale de la langue ainsi que les informations spécifiques concernant les erreurs commises par les apprenants d’ESL. La méthode d’apprentissage par transfert utilisait le point de contrôle pszemraj/flan-t5-grammar-grande-synthèse comme modèle de base, avec plusieurs avantages notables en termes de justesse. Comme le modèle est déjà entraîné et possède une grande capacité de compréhension du langage ayant été formée dans divers domaines du texte, il s’adaptera à de nombreux styles d’écriture et sujets d’écriture. En particulier, un ajustement précis spécifique à la grammaire a été réalisé sur de grands ensembles de données de correction couvrant plusieurs types d’erreurs grammaticales, comme on le rencontre dans l’écriture en langue seconde. De plus, le point de contrôle comprend de puissants systèmes de détection d’erreurs qui sont testés contre différents types d’erreurs (c’est-à-dire erreurs morphologiques, syntaxiques et sémantiques), créant une norme parfaite de comparaison avec les paramètres innés de test de correction de l’étude.

Le processus d’adaptation du domaine reflète les modifications systématiques des paramètres qui ne modifient pas les capacités générales de compréhension du langage du modèle pré-entraîné, mais introduisent les caractéristiques spécifiques de la solution de tâche d’évaluation d’écriture. Ce processus d’adaptation a pour dérivation mathématique :

figure-protocol-15(15)

Ici, θpréentraîné représente les paramètres du modèle pré-entraîné encodant la compréhension générale du langage et la connaissance grammaticale, etle domaine Δθ représente les mises à jour spécifiques des paramètres apprises lors de la tâche d’évaluation de l’écriture cible. Les mises à jour spécifiques au domaine sont calculées par optimisation basée sur le gradient sur le jeu de données cible, garantissant que le modèle développe une sensibilité spécifique à la tâche aux types d’erreurs courants dans l’écriture EFL sans perturber ses capacités linguistiques plus larges.

Expériences avec des comparaisons

Pour prouver la fonctionnalité de l’EG, le coefficient de corrélation de Pearson est proposé comme valeur clé de la mesure, qui détermine la connexion linéaire entre les scores automatisés et l’expertise humaine. Le coefficient de corrélation est trouvé par la formule suivante :

figure-protocol-16(16)

Où xi représente les scores automatisés, représente les évaluations humaines, et figure-protocol-17 et figure-protocol-18 sont les moyennes respectives. Le coefficient de corrélation varie de −1 à 1, avec des valeurs proches de 1 indiquant une forte relation positive entre l’évaluation automatisée et l’évaluation humaine.

figure-protocol-19(17)

figure-protocol-20(18)

figure-protocol-21(19)

Comparaisons de modèles de référence

Pour évaluer la performance de l’EG et démontrer sa supériorité par rapport aux méthodes existantes, des comparaisons approfondies sont réalisées avec les approches établies de l’AWE et les méthodes traditionnelles à métrique unique. Ces comparaisons de référence sont essentielles pour valider la valeur ajoutée de l’architecture EG et démontrer que l’intégration de l’évaluation de la fluidité et de la correction apporte des améliorations mesurables par rapport aux approches qui se concentrent isolément sur les dimensions individuelles. La sélection des modèles de référence couvre quatre catégories d’AWE, chacune reflétant une orientation distincte sur la manière dont l’écriture doit être évaluée. Le premier propose un modèle unique basé sur le BERT pour évaluer la fluidité. Ces modèles utilisent des architectures de transformateurs pour évaluer les motifs textuels de fluidité et de cohérence. La seconde catégorie, intégrée dans les méthodologies linguistiques traditionnelles, se concentre sur les systèmes basés sur des règles pour la détection des erreurs grammaticales. Ainsi, l’accent est resté mis sur la justesse, négligeant d’autres aspects liés à la qualité de l’écriture, tels que la cohésion et le contenu. La troisième catégorie est constituée des systèmes AWE basés sur les caractéristiques, qui incluent des indicateurs de complexité linguistique — comme la longueur variationnelle des phrases, la diversification du lexique et la complexité syntaxique pour générer des scores de qualité globaux. Le quatrième prend en compte les systèmes hybrides en combinant diverses caractéristiques linguistiques de surface, souvent en utilisant des méthodes d’ensemble ou des moyennes pondérées. Ces modèles n’atteignent pas le niveau de sophistication intégrée atteint par les architectures neuronales EG. La performance de base du modèle est évaluée selon trois dimensions majeures. La première mesure l’alignement des notes générées par le système avec les évaluations des experts humains formés (enseignants d’anglais) à l’aide de grilles standardisées. La seconde détermine la généralisabilité, en déterminant si la performance reste cohérente sur trois essais avec des sujets et une complexité variés. La troisième dimension repose sur la fiabilité prédictive, évaluant la précision et la stabilité du score à l’aide d’outils statistiques tels que l’erreur absolue moyenne, l’erreur quadratique moyenne et l’analyse par intervalles de confiance. Collectivement, ces dimensions établissent un cadre solide de comparaison et soulignent la supériorité des systèmes EG, notamment pour atteindre une plus grande précision et stabilité que les approches traditionnelles.

Groupes expérimentaux et témoins

Cette étude a regroupé 90 étudiants de premier cycle en économie qui suivaient un cours fonctionnel d’anglais en deux cours intacts. Les données ont été prises à trois reprises : avant le test, l’intervention et le post-test afin de suivre les progrès de la précision et de la fluidité de l’écriture au fil du temps. Cette étude sur un sujet humain a été approuvée par le Conseil consultatif départemental de l’Université COMSATS Islamabad, campus de Lahore, Pakistan. Les participants ont été exposés à deux conditions : le retour d’information humain traditionnel et le retour assisté par ordinateur. Le groupe témoin était composé de 45 étudiants, qui recevaient les retours écrits traditionnels d’un professeur d’anglais formé. Les participants ont reçu des retours écrits sur les essais des étudiants sous forme de notes holistiques, d’identification des erreurs et de recommandations sous forme de commentaires d’un enseignant sur la manière d’améliorer le travail. Le groupe expérimental, à son tour, comprenait 45 élèves instruits de la même manière en classe, mais l’écriture des élèves était complétée par un retour rapide et automatisé fourni par l’EG, qui leur fournissait les informations diagnostiques, tant en termes de fluidité que de correction, en environ 30 secondes après la soumission.

Cette étude a été réalisée sur une durée de 8 semaines, avec un pré-test (semaine 1) réalisé pour déterminer la performance initiale en écriture des sujets avant que les élèves ne reçoivent une intervention. Un retour informatisé avec des marqueurs sémantiques de NLP dans le groupe expérimental et l’évaluation des enseignants dans le groupe témoin ont été donnés aux participants pendant six semaines. Finalement, le post-test (en semaine 8) a été réalisé pour comprendre la différence entre les mesures de précision et les scores de fluidité avant et après le test. Pour obtenir des résultats similaires en comparabilité, les répondants ont été invités à effectuer des tâches similaires par écrit à chaque période d’évaluation, minimisant ainsi les variables de confusion potentielles liées à la difficulté de la tâche et à la familiarité du contenu dans la rédaction. Pour s’assurer que les sujets d’écriture sont cohérents avec le niveau de difficulté, ainsi que pour garantir la validité du contenu, les sujets d’écriture ont été choisis de manière cohérente. Les sujets d’essai ont été choisis sur la base du fait que les étudiants couvrent divers sujets de contenu afin d’éviter l’effet pratique et l’ennui des participants, qui doivent accomplir une tâche similaire sur une longue période.

Lors de la phase de pré-examen, les participants devaient rédiger un essai de 400 à 450 mots et écrire sur leurs objectifs académiques et professionnels. Ce devoir descriptif était basé sur l’expérience personnelle et les projections futures, ce qui implique la nécessité d’organiser l’écriture, de fournir des exemples clairs et de formuler une déclaration logique d’objectifs et de motivations personnelles. La rédaction d’intervention portait sur différents sujets, tels que l’écriture sur la routine quotidienne de la vie, les loisirs, les voyages, le premier jour à l’université, les journées mémorables de la vie et les moments de meilleurs amis. Le sujet post-examen était lié au sujet « Effet de la technologie sur la communication », et la longueur requise de l’essai était de 400 à 450 mots.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Validité et fiabilité de l’approche statistique

Le système a été testé sur diverses méthodes statistiques complémentaires qui fournissent toutes des preuves complètes des effets de l’EG sur le développement de l’écriture. Il s’agit d’une méthode analytique multifacette qui reconnaît que les interventions éducatives sont soumises à une analyse statistique complexe qui ne peut être réduite à de simples comparaisons de groupes, mais plutôt à l’an...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les résultats expérimentaux démontrent plusieurs réalisations significatives. Premièrement, le système à double modèle a obtenu une forte corrélation avec les jugements d’experts humains (r = 0,923), surpassant nettement les approches à modèle unique et les systèmes AWE contemporains. Deuxièmement, l’étude d’intervention contrôlée a révélé des améliorations significatives de la performance écrite des élèves ESL, avec de grandes tailles d’effet (d = 1,28) dépassant celles rapportées dans ...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il n’y a pas de conflits d’intérêts entre tous les auteurs.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nous remercions le soutien de COMSATS University Islamabad, campus de Lahore, ainsi que de la faculté d’anglais, pour aider à collecter des données auprès des étudiants.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
< FORT>LOGICIELS / BIBLIOTHÈQUES UTILISÉS DANS L’ÉTUDE
Cadre d’apprentissage profondPyTorch1.13.1Cadre d’apprentissage profond pour la mise en œuvre de réseaux neuronaux
Modèles pré-entraînésTransformers (Visage Câlin)4.21.3Chargement de modèles pré-entraînés, implémentations de modèles BERT et T5
Modèle de langageBERT (Représentations bidirectionnelles des encodeurs à partir des transformateurs)Bert-base-non étuiÉvaluation de la fluidité, évaluation de la cohérence sémantique, compréhension contextuelle
Modèle de langageFLAN-T5 (Réseau linguistique finement réglé T5)pszemraj/flan-t5-grande-grammaire-synthèseCorrection d’erreurs grammaticales, transformation texte en texte, détection d’erreurs
Calcul numériqueNumPy1.23.5Calculs numériques, opérations sur tableaux pour fonctions mathématiques
Analyse des donnéesPandas1.5.2Manipulation des données, analyse statistique et prétraitement
Apprentissage automatiqueScikit-learn1.1.3Calcul des métriques statistiques, analyse de corrélation, métriques d’évaluation
VisualisationMatplotlib3.6.2Visualisation des données, graphiques de progression de la formation, graphiques de performance
VisualisationSeaborn0.12.1Visualisation statistique des données, cartes de chaleur de corrélation
Boîte à outils NLPNLTK (Boîte à outils pour le langage naturel)3.7Prétraitement du texte, tokenisation, analyse linguistique
Traitement NLPSpaCy3.4.4Prétraitement avancé du NLP, étiquetage POS, analyse syntaxique
TokenisationTokeniseurs0.13.2Tokenisation rapide pour la tokenisation BERT WordPiece et T5
LOGICIEL STATISTIQUE ET D’ANALYSE
Logiciels statistiquesLogiciel statistique SPSSVersion 26.0Analyse statistique, échantillons indépendants tests t, ANOVA, analyse de corrélation
Jeu de données d’entraînementKaggle ASAP DatasetVersion 2012Référence de corpus d’entraînement (90 % des modèles AWE utilisent ce jeu de données)
OPTIMISATION ET ENTRAÎNEMENT PYTHON
Optimiseurtorch.optim.AdamWPyTorch 1.13.1Optimisation du modèle avec régularisation de la désintégration en poids (&lambda ;=0,01), &bêta ; 1=0,9, &bêta ; 2=0,999, &epsilon ;=1× ; 10-8
Perte / activationtorch.nn.functionalPyTorch 1.13.1Activation sigmoïde, fonctions de perte, régularisation du dropout
Chargement des donnéestorch.utils.data.DataLoaderPyTorch 1.13.1Taille progressive par lots (4&rarr ; 16), chargement et regroupement des données
TokenisationTransformateurs. AutoTokenizerTransformers 4.21.3Tokenisation BERT WordPiece, prétraitement de texte
Chargement des modèlesTransformateurs. AutomodèleTransformers 4.21.3Chargement de modèles pré-entraîné pour les architectures BERT et T5
Contrôle de la pentetorch.nn.utils.clip_grad_norm_PyTorch 1.13.1Clipping de gradient (seuil : 1.0) pour la stabilité de l’entraînement
Planification LRtorch.optim.lr_schedulerPyTorch 1.13.1Planification du taux d’apprentissage avec décroissance linéaire et échauffement
Métriquessklearn.metricsScikit-learn 1.1.3Calcul de la corrélation Pearson, MAE, RMSE pour l’évaluation
IMPLÉMENTATION DE RÉSEAU NEURONAL PYTHON
Classe de basetorch.nn.ModulePyTorch 1.13.1Classe de base pour les architectures de réseaux neuronaux personnalisées (Fluency & Fluency & Modules de correction)
Couches linéairestorch.nn.LinéairePyTorch 1.13.1Implémentation de la tête de régression linéaire (768&rrr ; 512&rrar ; 256&rrar ; 128&rarr ; 1 neurone)
RégularisationTorch.nn.AbandonPyTorch 1.13.1Régularisation du dropout (0,1 pour BERT, 0,3 pour la tête de régression)
Activationtorch.nn.functional.sigmoidPyTorch 1.13.1Activation sigmoïde pour la normalisation du score de fluence [0,1]
Activationtorch.nn.functional.reluPyTorch 1.13.1Activation de ReLU dans les couches de régression pour les transformations non linéaires
TransformateurTransformateurs. BertModelTransformers 4.21.312 couches transformateurs avec auto-attention multi-têtes pour l’évaluation de la fluidité
Seq2SeqTransformateurs. T5For
Génération conditionnelle
Transformers 4.21.3Architecture encodeur-décodeur pour la correction d’erreurs grammaticales
Fonction de pertetorch.nn.MSELossPyTorch 1.13.1Fonction de perte de l’erreur quadratique moyenne pour l’entraînement à la régression de fluidité
ALPHA D’ÉVALUATION ET DE MÉTRIQUES EN PYTHON
Corrélationscipy.stats.pearsonrSciPy 1.9.3Coefficient de corrélation de Pearson pour l’accord modèle-humain
Métrique d’erreursklearn.metrics.mean_absolute_errorScikit-learn 1.1.3Calcul de l’erreur absolue moyenne (MAE) pour la précision des prédictions
Métrique d’erreursklearn.metrics.mean_squared_errorScikit-learn 1.1.3L’erreur quadratique moyenne (RMSE) pour l’évaluation de l’amplitude de l’erreur
Test statistiquescipy.stats.ttest_indSciPy 1.9.3Test t des échantillons indépendants pour le test de signification statistique
Matrice de corrélationnumpy.corrcoefNumPy 1.23.5Calcul de la matrice de corrélation pour la fiabilité inter-évaluateurs
Corrélation des donnéesPandas. DataFrame.corrPandas 1.5.2Analyse de corrélation des données et rapports statistiques
Visualisationmatplotlib.pyplotMatplotlib 3.6.2Visualisation de performance, graphiques de corrélation, graphiques de progression de l’entraînement
Carte thermiqueseaborn.heatmapSeaborn 0.12.1Visualisation de matrices de corrélation et présentation des données statistiques
< TRAITEMENT >DE TEXTE PYTHON FORT ET BIBLIOTHÈQUES NLP
Traitement du textere (Expressions régulières)Python 3.9+ intégréCorrespondance de motifs textuels, nettoyage des données et prétraitement
Gestion de la configurationjsonPython 3.9+ intégréGestion des fichiers de configuration, stockage des paramètres du modèle
SérialisationPicklePython 3.9+ intégréSérialisation des modèles et sauvegarde/chargement des points de contrôle
Suivi des progrèsQDM4.64.1Barres de progression pour les boucles d’entraînement et le traitement des données
Exploitation forestièreExploitation forestièrePython 3.9+ intégréJournal des progrès de l’entraînement, suivi des erreurs et débogage
ReproductibilitéaléatoirePython 3.9+ intégréRéglage aléatoire de graines pour des expériences reproductibles
Système de fichiersOSPython 3.9+ intégréOpérations du système de fichiers, gestion des chemins de modèles
Analyse syntaxique CLIargparsePython 3.9+ intégréAnalyse syntaxique d’arguments en ligne de commande pour les configurations d’entraînement
PLATEFORMES COMMERCIALES AWE / AES (Référencées)
Plateforme commercialePigai.orgPlateforme commerciale AWEÉvaluation de l’écriture en anglais anglais chinois, systèmes automatisés de retour d’information
Plateforme commercialeBingo anglaisSystème AWE commercialSoutien à l’apprentissage de l’anglais, développement des compétences en écriture
Plateforme éducativeMon AccèsPlateforme d’écriture éducativeÉvaluation écrite des élèves et remise de retours
Moteur de notationE-raterMoteur automatisé de notation ETSNotation standardisée d’un essai d’examen, évaluation globale
Outil d’évaluationJ-écrisOutil d’évaluation de l’écritureÉvaluation des écrits académiques et retours diagnostiques
Service d’entraînementCritèreService de pratique de rédaction ETSDéveloppement des compétences en écriture et retour automatisé
Modèle de langage IAChatGPTModèle de langage OpenAIRetour d’information et évaluation assistés par l’IA (cités dans la littérature)
APPRENTISSAGE PROFOND (Référencées en Littérature)
ArchitectureRéseaux de neurones récurrents (RNN)Cai, 2019Traitement de texte séquentiel & mdash ; Systèmes de rétroaction et évaluation automatisée
ArchitectureMémoire à court terme long (LSTM)Jin et al., 2018Modélisation des dépendances à long terme & mdash ; Évaluation automatisée des essais et analyse de séquence
ArchitectureRéseaux de neurones convolutionnels (CNN)Dong et al., 2017Reconnaissance de motifs locale & mdash ; Classification du texte et extraction de caractéristiques pour la notation
ArchitectureHybride transformateur-LSTMXuan, 2025Traitement contextuel et séquentiel combiné & mdash ; Évaluation automatique et génération de rétroaction
ArchitectureAutoencodeurs variationnels (VAE)Kumar et al., 2024Modélisation générative & mdash ; Développement accru des compétences en écriture et retour personnalisé
ArchitectureSystèmes multi-agentsThompson et al., 2024Traitement collaboratif de l’IA & mdash ; assistance avancée à l’écriture (plateforme AcademiCraft)
MécanismeMécanismes d’attentionDong et al., 2017Attention personnelle et attention multi-têtes &mdash ; amélioration des performances AES et compréhension contextuelle
TECHNIQUES TRADITIONNELLES D’APPRENTISSAGE AUTOMATIQUE (Référencées)
Méthode statistiqueThéorème de BayesRudner & Liang, 2002Approche traditionnelle du ML & mdash ; Développement précoce de l’AES/AWE et du score probabiliste
Méthode statistiqueRégression linéairePhandi et al., 2015Modélisation statistique & mdash ; Évaluation de la rédaction basée sur les fonctionnalités et prédiction des scores
Méthode d’apprentissageApprentissage par préférence de rangChen & Il, 2013Méthodologie basée sur le classement & mdash ; Notation comparative des essais et modélisation des préférences
Modèle de langageModèles N-gramXie et al., 2015Modélisation statistique du langage & mdash ; Correction d’erreurs grammaticales et reconnaissance de motifs
ArchitectureArchitecture encodeur-décodeurGe et al., 2018Modélisation séquence à séquence & mdash ; Correction d’erreurs grammaticales et transformation de texte
ÉVALUATION
Norme d’évaluationÉvaluation écrite IELTSAdaptation de la grille d’évaluationCritères d’évaluation standardisés pour la fluidité et la correction
Norme d’évaluationÉvaluation de l’écriture TOEFLNormes de rédaction académiqueÉvaluation de la compétence et notation standardisée
Mesure statistiqueTaille de l’effet d de Cohen0,2=petit, 0,5=moyen, 0,8=grandÉvaluation pratique de la signification pour l’efficacité de l’intervention
Mesure de fiabilitéFiabilité inter-évaluateurs (&kappa ;)Fluidité : 0,847 / Correction : 0,823Coefficient de Kappa & mdash ; Cohérence et validation des accords par l’évaluateur humain

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bitchener, J. Evidence in support of written corrective feedback. J Second Lang Writ. 17 (2), 102-118 (2008).
  2. Nusrat, A., Ashraf, F., Narcy-Combes, M. F. Effect of direct and indirect teacher feedback on accuracy of English writing: A quasi-experimental study among Pakistani undergraduate students. 3L Lang Linguist Lit. 25 (4), 84-98 (2019).
  3. Nusrat, A., Khan, S., Kashif, F., Fawad, R. Effect of teachers’ asynchronous e-feedback and synchronous oral feedback on English language learners’ writing accuracy. Front Educ. 7, 783684 (2022).
  4. Chen, B., Bao, L., Zhang, R., Zhang, J., Liu, F., Wang, S., et al. A multi-strategy computer-assisted EFL writing learning system with deep learning incorporated and its effects on learning: A writing feedback perspective. J Educ Comput Res. 61 (8), 60-102 (2024).
  5. Li, J., Link, S., Hegelheimer, V. Rethinking the role of automated writing evaluation (AWE) feedback in ESL writing instruction. J Second Lang Writ. 27, 1-18 (2015).
  6. Ellis, R. Explicit form-focused instruction and second language acquisition. The handbook of educational linguistics. , 437-455 (2008).
  7. Shamim, F. Trends, issues and challenges in English language education in Pakistan. Asia Pac J Educ. 28 (3), 235-249 (2008).
  8. Haider, G. An insight into difficulties faced by Pakistani student writers: Implications for teaching of writing. J Educ Soc Res. 2 (3), 17-27 (2012).
  9. Nawaz, M., Hussain, S. A., Bughio, F. A. Exploring the preferred corrective feedback and practiced corrective feedback among Pakistani ESL secondary school students and teachers in writing class: Matches and mismatches. Int J Lang Lit Transl. 6 (1), 31-45 (2023).
  10. Rudner, L. M., Liang, T. Automated essay scoring using Bayes theorem. J Technol Learn Assess. 1 (2), 1-22 (2002).
  11. Phandi, P., Chai, K. M. A., Ng, H. T. Flexible domain adaptation for automated essay scoring using correlated linear regression. , 431-439 (2015).
  12. Cai, C. Automatic essay scoring with recurrent neural network. , 1-7 (2019).
  13. Jin, C., He, B., Hui, K., Sun, L. TDNN: A two-stage deep neural network for prompt-independent automated essay scoring. 1, 1088-1097 (2018).
  14. Dong, F., Zhang, Y., Yang, J. Attention-based recurrent convolutional neural network for automatic essay scoring. CoNLL. , 153-162 (2017).
  15. Sharma, A., Kabra, A., Kapoor, R. Feature enhanced capsule networks for robust automatic essay scoring. , 365-380 (2021).
  16. Mim, F. S., Inoue, N., Reisert, P., Ouchi, H., Inui, K. Corruption is not all bad: Incorporating discourse structure into pre-training via corruption for essay scoring. IEEE ACM Trans Audio Speech Lang Process. 29, 2202-2215 (2021).
  17. Cummins, R., Rei, M. Neural multi-task learning in automated assessment. arXiv. , 1-9 (2018).
  18. Cao, Y., Jin, H., Wan, X., Yu, Z. Domain-adaptive neural automated essay scoring. , 1011-1020 (2020).
  19. Jiang, Z., Liu, M., Yin, Y., Yu, H., Cheng, Z., Gu, Q., et al. Learning from graph propagation via ordinal distillation for one-shot automated essay scoring. , 2347-2356 (2021).
  20. Li, X., Chen, M., Nie, J. Y. SEDNN: Shared and enhanced deep neural network model for cross-prompt automated essay scoring. Knowl Based Syst. 210, 106491 (2020).
  21. Beseiso, M., Alzubi, O. A., Rashaideh, H. A novel automated essay scoring approach for reliable higher educational assessments. J Comput High Educ. 33 (3), 727-746 (2021).
  22. Xie, W., Huang, P., Zhang, X., Hong, K., Huang, Q., Chen, B., et al. Chinese spelling check system based on an n-gram model. , 128-136 (2015).
  23. Brockett, C., Dolan, W. B., Gamon, M. Correcting ESL errors using phrasal SMT techniques. , 249 (2006).
  24. Zhang, S., Huang, H., Liu, J., Li, H. Spelling error correction with soft-masked BERT. , 882-890 (2020).
  25. Ge, T., Wei, F., Zhou, M. Reaching human-level performance in automatic grammatical error correction: An empirical study. arXiv. , 1-15 (2018).
  26. Zhao, W., Wang, L., Shen, K., Jia, R., Liu, J. Improving grammatical error correction via pre-training a copy-augmented architecture with unlabeled data. 1, 156-165 (2019).
  27. Shermis, M. D., Koch, C. M., Page, E. B., Keith, T. Z., Harrington, S. Trait ratings for automated essay grading. Educ Psychol Meas. 62 (1), 5-18 (2002).
  28. Mizumoto, A., Shintani, N., Sasaki, M., Teng, M. F. Testing the viability of ChatGPT as a companion in L2 writing accuracy assessment. Res Methods Appl Linguist. 3 (2), 100116 (2024).
  29. Ajabshir, Z. F., Ebadi, S. The effects of automatic writing evaluation and teacher-focused feedback on CALF measures and overall quality of L2 writing across different genres. Asian Pac J Second Foreign Lang Educ. 8 (1), 26 (2023).
  30. Almusharraf, N., Alotaibi, H. An error-analysis study from an EFL writing context: Human and automated essay scoring approaches. Tech Knowl Learn. 28 (3), 1015-1031 (2023).
  31. Chen, H., Pan, J. Computer or human: A comparative study of automated evaluation scoring and instructors' feedback on Chinese college students' English writing. Asian Pac J Second Foreign Lang Educ. 7 (1), 34 (2022).
  32. Liu, X., Zhang, Y., Chen, L. The transformative impact of AI-powered tools on academic writing: Perspectives of EFL university students. Lang Learn Technol. 28 (2), 78-95 (2024).
  33. Zhang, Q., Li, F. From process to product: Writing engagement and performance of EFL learners under computer-generated feedback instruction. System. 115, 102998 (2023).
  34. Kumar, S., Patel, R., Williams, T. Automated deep learning approaches in variational autoencoders (VAEs) for enhancing English writing skills. J Educ Technol Res. 45 (3), 234-251 (2024).
  35. Martinez, A., Rodriguez, P., Thompson, K. Neural automated writing evaluation with corrective feedback. Comput Linguist. 50 (1), 123-145 (2024).
  36. Thompson, J., Anderson, C., Davis, R. AcademiCraft: Transforming writing assistance for English for academic purposes with multi-agent system innovations. Artif Intell Educ. 12 (4), 445-462 (2024).
  37. Rodriguez, M., Kim, S., Brown, D. Technology-enhanced language learning in English language education: Performance analysis, core publications, and emerging trends. Appl Linguist Rev. 15 (2), 201-225 (2024).
  38. Xuan, Y. Transformer-LSTM models for automatic scoring and feedback in English writing assessment. IEEE Access. 13, 82084-82096 (2025).
  39. Anderson, R., Smith, K., Johnson, M. The impact of AI writing tools on the content and organization of students' writing: EFL teachers' perspective. Comput Educ. 195, 104712 (2023).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Apprentissage des langues assist par ordinateurMod les de r seaux neuronesTraitement automatique du langage naturelvaluation automatis e de r dactionsP dagogie de l crit en anglais langue secondeR troaction grammaticaleFluidit r dactionnelle

Articles connexes