Enseigner la conception d'expériences
Cette étude a utilisé la version open-source de base de DeepSeek, s'appuyant sur l'interface API ouverte de la plateforme pour les appels de programme. L'ensemble complet des cinq textes modèles d'instructions, des quatre niveaux d'exemples de tâches, des balises de catégories d'annotations transférées et des règles de correspondance de mappage avec les modèles d'erreurs rédactionnelles a été compilé dans l'annexe complémentaire. Le système disposait de paramètres d'appel fixes : un coefficient de température de 0,7, et la longueur générée était limitée dynamiquement selon le type de question rédactionnelle. Il suivait strictement une séquence fixe de reconstruction sémantique > ajustement stylistique > adaptation culturelle, en exécutant des appels en chaîne imbriqués d'instructions. La sortie du modèle était sélectionnée manuellement par l'enseignant afin d'obtenir un texte pertinent pour l'enseignement en classe.
Cette étude a invité trois enseignants universitaires à temps plein, spécialisés en rédaction en anglais et ayant plus de cinq ans d'expérience, à participer à la notation manuelle. Tous les correcteurs ont reçu une formation normalisée avant la notation officielle, afin de se familiariser avec les dimensions d'évaluation, le système de notation sur 5 points, le transfert culturel, la syntaxe, le discours et d'autres détails de notation, et ont effectué une calibration préalable à la notation. Toutes les rédactions étudiantes ont été notées indépendamment par deux enseignants selon un mode de notation aveugle et doublement aveugle. Si l'écart entre les notes attribuées par les deux correcteurs dépassait 1 point (sur 5), un troisième enseignant expérimenté intervenait comme arbitre, et la moyenne des deux notes valides était retenue comme note manuelle finale pour cet échantillon. Deux groupes d'évaluateurs ont participé à la phase d'évaluation à des fins de recherche différentes. Trois enseignants universitaires à temps plein, spécialisés en rédaction en anglais et ayant plus de cinq ans d'expérience, ont réalisé une double notation aveugle de tous les échantillons de rédactions étudiantes lors de l'expérience formelle, et un troisième enseignant expérimenté a servi d'arbitre en cas d'écart supérieur à 1 point sur l'échelle de notation sur 5 points. En revanche, cinq évaluateurs ont participé à un test de fiabilité inter-juges fondé sur le coefficient de corrélation intraclasse (ICC), mené séparément afin de vérifier la cohérence des critères d'évaluation entre les évaluateurs. La différence dans le nombre d'évaluateurs s'explique par des exigences fonctionnelles distinctes : les trois enseignants principaux ont assuré la notation pratique des données expérimentales, tandis que le groupe élargi de cinq évaluateurs a fourni des preuves plus solides quant à la fiabilité de l'ensemble du système d'évaluation.
La complexité syntaxique, l'évaluation de la structure du texte par BERT et la similarité sémantique sont toutes notées sur une échelle de 0 à 5 points. Les poids attribués à chaque dimension ont été fixés selon les normes d'enseignement et de recherche en rédaction en langue étrangère : syntaxe 0,35, structure du texte 0,35, et logique et culture 0,3. Ces valeurs de poids reposent sur des systèmes d'évaluation quantitative éprouvés dans ce domaine. Le module de notation automatique par IA a été calibré à l'aide de seuils fondés sur 15 rédactions modèles préclassées. La notation humaine a suivi une échelle d'évaluation normalisée sur cinq points. La notation par machine et la calibration humaine ont été combinées pour une vérification préalable dans une expérimentation avant l'évaluation formelle.
La tâche d'enseignement a été réalisée selon les objectifs de transfert à trois niveaux « syntaxe-structure-culture », avec trois séries de formation, chacune durant une semaine. La première série comprenait une réécriture au niveau de la phrase afin d'améliorer la diversité syntaxique et la précision expressive ; la deuxième série impliquait une reconstruction structurelle au niveau du paragraphe pour renforcer l'organisation du paragraphe et la cohérence logique ; la troisième série portait sur le transfert au niveau culturel afin d'accroître la sensibilité pragmatique interculturelle et l'adaptabilité des expressions. Compte tenu des mesures répétées recueillies auprès des mêmes participants lors du pré-test, des trois séries successives de formation et du post-test, une analyse de variance à mesures répétées (RM-ANOVA) a été adoptée comme méthode statistique principale pour examiner les effets principaux du groupe (expérimental contre contrôle), les effets principaux du moment du test, ainsi que l'effet d'interaction groupe × temps, qui indiquait si les variations des scores au cours de la formation différaient entre les deux cohortes. L'hypothèse de sphéricité a été vérifiée à l'aide du test de Mauchly ; une correction de Greenhouse–Geisser a été appliquée en cas de violation de la sphéricité. Des tests t pour échantillons indépendants ont été utilisés uniquement pour des comparaisons post-hoc par paires entre groupes à des moments précis, tandis que la corrélation de Pearson et le d de Cohen ont été conservés respectivement pour évaluer la cohérence des notes et la taille de l'effet.
Toutes les analyses statistiques ont été prédéfinies avant la collecte des données. Des tests t pour échantillons indépendants ont été utilisés afin de comparer les indicateurs d'écriture avant et après entre deux groupes, l'hypothèse nulle principale supposant l'absence de différences intergroupes en matière de performance de transfert de l'écriture. Une analyse de corrélation de Pearson a été employée pour quantifier l'association linéaire entre la notation automatique par IA et les évaluations manuelles des enseignants, et le d de Cohen a été calculé comme taille d'effet standardisée pour les comparaisons entre groupes. Le seuil de significativité a été fixé à α = 0,05 pour tous les tests d'hypothèse, et des intervalles de confiance à 95 % ont été calculés conjointement avec toutes les statistiques de test. SPSS 26.0 a été utilisé pour effectuer tous les calculs statistiques. Aucune donnée manquante n'a été observée dans les résultats des tests des élèves ni dans les jeux de données des questionnaires, car tous les participants ont terminé l'ensemble de la formation en trois séances ainsi que les évaluations correspondantes ; par conséquent, aucune imputation ni suppression de cas pour valeurs manquantes n'a été nécessaire.
Construction du système d'indices d'évaluation
Afin d'évaluer de manière exhaustive les performances des étudiants dans la formation au transfert en écriture anglaise, cette étude a élaboré un système d'évaluation multidimensionnel couvrant les objectifs de transfert à trois niveaux « syntaxe-structure-culture », intégrant la capacité linguistique, la réponse du modèle, la rétroaction pédagogique et l'auto-perception, et a établi six indicateurs principaux. Premièrement, l'« indice de transfert en écriture » constituait un indicateur d'évaluation global englobant la diversité syntaxique, la clarté structurelle et l'adaptabilité culturelle, combinant la notation automatique du système et la notation manuelle par l'enseignant pour une analyse quantitative. Le « score de complexité syntaxique » utilisait la technologie du traitement automatique du langage naturel pour extraire des caractéristiques telles que la longueur moyenne des phrases, le nombre de niveaux d'imbrication des propositions et la fréquence d'utilisation des groupes verbaux, afin d'évaluer la richesse et la complexité des phrases des étudiants. L'analyse de « l'adéquation au style académique » examinait la proportion d'utilisation de la voix passive et la proportion de vocabulaire formel, à l'aide d'un modèle de traitement automatique du langage naturel (NLP), afin de déterminer si le texte respectait les normes stylistiques de l'écriture académique en anglais. En outre, l'étude a introduit une dimension d'évaluation subjective, recueillant, au moyen de questionnaires destinés aux enseignants, des retours sur l'acceptabilité et l'utilité pratique des suggestions générées par le modèle, afin d'évaluer l'impact réel de l'enseignement assisté par l'intelligence artificielle. Les « évolutions des notes attribuées par les enseignants » reflétaient l'effet de l'enseignement assisté par l'IA sur l'amélioration de la qualité de l'écriture, en comparant les notes attribuées par les enseignants aux rédactions des étudiants avant et après l'expérience. Enfin, l'« auto-évaluation par les étudiants de leur capacité de transfert » utilisait le tableau de cognition du transfert pour guider les étudiants dans l'auto-évaluation de leur maîtrise des dimensions structurelle, syntaxique, culturelle, et d'autres aspects, renforçant ainsi leur conscience métacognitive et leurs capacités de réflexion. Les descriptions détaillées et les sources de données pour chaque indicateur sont présentées dans Tableau 3.
Les indicateurs syntaxiques et stylistiques ont été calculés automatiquement à l'aide d'une analyse syntaxique en dépendances et d'une classification basée sur BERT, avec des scores normalisés allant de 0 à 5 ; l'évaluation manuelle utilise une échelle à 5 points. Les formules de calcul de la complexité syntaxique utilisaient le nombre total de mots divisé par le nombre de propositions comme dénominateur principal. Source des données brutes : compositions écrites du prétest et du posttest de l'ensemble des 60 étudiants inscrits.
Résultats expérimentaux et analyse
Afin de présenter de manière intuitive les différences globales de performance des étudiants selon les trois dimensions du transfert syntaxique, du transfert structurel et du transfert culturel, la figure 3 compare l'indice moyen de transfert écrit des étudiants du groupe expérimental et du groupe témoin avant et après l'expérience : la figure 3 montre la différence de scores moyens entre le groupe expérimental et le groupe témoin dans les trois dimensions du transfert syntaxique, du transfert structurel et du transfert culturel. Le groupe expérimental présente une amélioration significative des capacités de transfert dans chaque dimension après l'expérience, et le cercle extérieur du graphique en radar est nettement plus grand que le cercle intérieur, ce qui indique que la méthode d'optimisation de l'enseignement fondée sur le modèle DeepSeek exerce un effet positif sur le développement de la capacité des étudiants au transfert en écriture anglaise. En revanche, les différents indicateurs de capacité de transfert du groupe témoin sont restés relativement stables avant et après l'expérience. L'amélioration globale a été limitée, ce qui montre que les méthodes d'enseignement traditionnelles ou les outils d'assistance par IA n'ayant pas optimisé les instructions du système jouent un rôle restreint dans l'entraînement au transfert. Il était difficile de stimuler efficacement le potentiel d'apprentissage des étudiants dans le transfert linguistique multidimensionnel.
Les indices moyens de transfert écrits du groupe expérimental, dans les dimensions du transfert syntaxique, du transfert structurel et du transfert culturel avant l'expérience, étaient respectivement de 3,0, 2,9 et 2,8 ; ils ont augmenté après l'expérience à 4,3, 4,1 et 4,5, soit des augmentations respectives de 1,3, 1,2 et 1,7, ce qui indique que la méthode d'enseignement a eu un bon effet d'intervention à différents niveaux de transfert. Les scores du groupe témoin avant l'expérience étaient de 3,0, 3,0 et 2,9. Après l'expérience, ces valeurs ont augmenté respectivement à 3,4, 3,3 et 3,2, ce qui est nettement inférieur aux résultats du groupe expérimental. Il est particulièrement remarquable que, dans la dimension du transfert culturel, le groupe expérimental ait montré l'amélioration la plus significative, passant de 2,8 à 4,5, soit une augmentation de 1,7 point, bien supérieure à l'augmentation de 0,3 point observée dans le groupe témoin. Ce résultat suggère que la méthode d'enseignement proposée joue un rôle important dans l'aide aux étudiants pour identifier et s'adapter aux normes d'expression culturelle en anglais. Cela s'est manifesté non seulement par des ajustements de la forme linguistique, mais aussi par le renforcement de la conscience pragmatique interculturelle des étudiants et par la profondeur de leur compréhension des habitudes d'expression culturelle de la langue cible. Le transfert linguistique s'est principalement reflété dans la complexité syntaxique, l'adaptation du style linguistique et d'autres aspects. L'étude a utilisé une technologie NLP automatisée pour analyser en profondeur les textes écrits des étudiants, extraire des caractéristiques linguistiques clés, et combiné les évaluations des enseignants afin d'évaluer systématiquement les changements dans les capacités de transfert linguistique des étudiants au cours de trois séries de tâches.
Complexité syntaxique et style linguistique
En ce qui concerne la complexité syntaxique, l'étude a enregistré la longueur moyenne des phrases et le nombre de niveaux d'imbrication des propositions du texte produit par les étudiants après avoir accompli la tâche d'écriture désignée à chaque tour de tâches. Ces deux indicateurs étaient couramment utilisés pour mesurer la complexité de l'expression linguistique. Ils reflétaient efficacement le niveau de développement des étudiants en matière de diversité des phrases et de capacité d'organisation structurelle, comme illustré dans la Figure 4.
Dans l'évolution longitudinale de la complexité syntaxique, le groupe expérimental a présenté une tendance clairement ascendante au cours des trois séries de tâches, reflétant l'efficacité du transfert de formation sur la capacité des élèves à exprimer leur structure linguistique. En ce qui concerne la longueur moyenne des phrases, le groupe expérimental est passé de 12,5 mots dans la tâche 1 à 16,1 mots dans la tâche 3, soit une augmentation de 3,6 mots, nettement supérieure à l'augmentation du groupe témoin, qui n'a été que de 0,9 mot durant la même période (de 12,4 à 13,3). De même, en ce qui concerne la dimension de la complexité structurelle, mesurée par le nombre de niveaux d'emboîtement des propositions, le groupe expérimental est passé de 1,8 niveau à 2,7 niveaux, tandis que le groupe témoin est passé de 1,7 à 1,9 niveau, avec une augmentation relativement lente. Afin de vérifier davantage si la différence de complexité syntaxique entre les deux groupes d'élèves est statistiquement significative, l'étude a utilisé des tests t indépendants pour analyser la longueur moyenne des phrases et le nombre de niveaux d'emboîtement des propositions aux trois étapes de la tâche. Les résultats ont montré qu'il existe une différence significative entre le groupe expérimental et le groupe témoin en ce qui concerne la longueur moyenne des phrases, t(58) = 4,23, p < 0,001, d de Cohen = 0,98 ; il existait également une différence significative dans le nombre de niveaux d'emboîtement des propositions, t(58) = 3,15, p = 0,002, d de Cohen = 0,78. Cette comparaison a montré que la formation systématique au transfert améliore non seulement la capacité des élèves à construire des phrases complexes, mais renforce également leur maîtrise des stratégies d'organisation grammaticale. En particulier, lors de la troisième étape de la tâche, les élèves du groupe expérimental ont fait preuve d'une plus grande souplesse dans l'utilisation de propositions imbriquées et de structures de phrases complexes. Cela traduit un changement notable dans leur transfert linguistique, passant d'un niveau « fonctionnel » à un niveau plus « stratégique ». Le parcours de formation axé sur le transfert a continuellement renforcé les compétences syntaxiques des élèves en matière de transfert, permettant ainsi de surmonter efficacement les limites liées à l'écriture de phrases isolées et aux schémas d'expression figés souvent observés dans l'enseignement traditionnel. En ce qui concerne l'adaptation du style linguistique, l'étude a extrait les textes écrits par les élèves avant et après l'expérience. Elle a utilisé un modèle de traitement du langage naturel (NLP) pour déterminer la proportion de vocabulaire formel et la fréquence d'utilisation de la voix passive comme indicateurs principaux d'évaluation de l'adéquation au style académique. Ces indicateurs reflètent si les élèves possèdent la conscience linguistique et les capacités d'expression nécessaires pour s'adapter au style cible en écriture en anglais. Les résultats correspondants sont présentés dans Figure 5.
Figure 5 montre les changements dans l'adéquation au style académique du groupe expérimental et du groupe témoin avant et après la tâche, en se concentrant principalement sur deux indicateurs clés : la proportion de vocabulaire formel et la fréquence d'utilisation de la voix passive. Dans l'ensemble, après avoir suivi une formation au transfert basée sur le modèle DeepSeek, la capacité d'adaptation au style académique du groupe expérimental s'est nettement améliorée, démontrant ainsi l'efficacité de cette méthode pédagogique pour développer chez les étudiants la conscience des normes linguistiques et leur aptitude à s'adapter aux styles académiques. En ce qui concerne la proportion de vocabulaire formel, le groupe expérimental est passé de 0,42 avant la tâche à 0,56 après celle-ci, soit une augmentation relativement importante. En revanche, le groupe témoin n'a connu qu'une légère augmentation, passant de 0,43 à 0,48, ce qui suggère une amélioration limitée. Ce résultat indique qu'après avoir reçu une orientation systématique par le biais d'indications (prompts) et des retours du modèle, les étudiants du groupe expérimental ont eu davantage tendance à utiliser un vocabulaire formel conforme aux exigences du style académique lors de la rédaction, et que leur style linguistique s'est progressivement rapproché des normes de l'écriture académique en anglais. En ce qui concerne la fréquence d'utilisation de la voix passive, le groupe expérimental a augmenté de manière significative, passant de 0,18 avant la tâche à 0,27 après celle-ci, soit une hausse de 0,09 ; en revanche, le groupe témoin n'a augmenté que de 0,02.
Afin de vérifier davantage si les changements ci-dessus sont statistiquement significatifs, l'étude a réalisé un test t pour échantillons indépendants sur les données avant et après la tâche. Les résultats ont montré que le groupe expérimental présentait une amélioration significative de la proportion de vocabulaire formel, t(58) = 3,89, p < 0,001, d de Cohen = 0,92 ; l'augmentation de la fréquence d'utilisation de la voix passive était également significative, t(58) = 4,56, p < 0,001, d de Cohen = 1,05. Cela indique que les étudiants du groupe expérimental ont réalisé des progrès substantiels en matière d'adaptation du style linguistique, progrès qui n'étaient pas dus au hasard, mais résultant de l'effet combiné d'un guidage systématique par les consignes et des retours du modèle.
Vérification statistique
En outre, afin de vérifier davantage la fiabilité du contenu généré par l'IA dans la pratique enseignante, l'étude a également comparé les scores moyens du contenu généré par l'IA et de celui généré par les enseignants selon différents types de consignes. La cohérence entre les deux a été évaluée en calculant le coefficient de corrélation de Pearson. Les résultats comparatifs pertinents sont présentés dans le tableau 4. Le tableau 4 montre la cohérence entre les notes attribuées par l'IA et celles attribuées par les enseignants pour cinq types de consignes orientées vers le transfert. Du point de vue du score moyen, la note attribuée par l'IA était globalement légèrement inférieure à celle des enseignants. Toutefois, l'écart restait dans une fourchette raisonnable pour la plupart des types de tâches, ce qui indique que le modèle DeepSeek présente une grande stabilité et une valeur de référence élevée pour l'évaluation des tâches de transfert écrit. Dans le cas de la consigne de transfert syntaxique, la note moyenne attribuée par les enseignants était de 4,1, contre 4,0 pour l'IA, soit une différence de seulement 0,1. Pour les consignes de transfert structurel et logique, la note attribuée par l'IA était inférieure de seulement 0,1 point à celle des enseignants, ce qui indique que le modèle est capable de simuler correctement les critères d'évaluation des enseignants dans ces tâches, qui impliquent un haut degré de structure linguistique et des règles claires. En revanche, les écarts de notation sont plus marqués pour les consignes de transfert culturel et de transfert de registre, avec des notes attribuées par l'IA de 3,6 et 3,7 respectivement, soit 0,2 point de moins que les notes des enseignants, ce qui reflète que l'IA présente encore certaines limites lorsqu'elle traite des tâches fortement subjectives, telles que les implications sémantiques et les aspects pragmatiques culturels. La fiabilité inter-juges a été évaluée à l'aide du CCI (n = 5 évaluateurs). Le CCI global pour la notation manuelle était de 0,86, et les CCI pour chaque dimension variaient entre 0,82 et 0,89, indiquant un accord inter-juges satisfaisant.
Une analyse plus poussée du coefficient de corrélation de Pearson a révélé que la cohérence des scores selon diverses consignes était très élevée, indiquant que le score attribué par l'IA était non seulement proche du jugement de l'enseignant en valeur, mais présentait également une bonne relation linéaire dans sa tendance d'évaluation. Parmi eux, le coefficient de cohérence de la consigne de transfert syntaxique était le plus élevé, à 0,87, tandis que les consignes de transfert structurel et de transfert logique étaient respectivement de 0,83 et 0,85, ce qui indique que les résultats d'évaluation de l'IA en matière de complexité syntaxique, d'organisation des paragraphes et de cohérence logique sont très cohérents avec le jugement de l'enseignant. Cela pourrait s'expliquer par le fait que ces tâches ont des objectifs clairs et des caractéristiques linguistiques quantifiables, facilitant ainsi la reconnaissance par le modèle et un jugement stable. Le coefficient de corrélation de la consigne de transfert de domaine est de 0,81. Bien qu'il ait légèrement diminué, il démontre tout de même une capacité d'évaluation forte, indiquant que l'IA possède un certain niveau de jugement en matière d'adaptation stylistique. Toutefois, le coefficient de cohérence de la consigne de transfert culturel était de seulement 0,79, ce qui est inférieur à celui des autres types, mais reste tout de même dans une fourchette acceptable.
Afin d'examiner l'applicabilité de différents types de consignes dans la pratique enseignante et leur degré d'acceptation par les enseignants, un questionnaire évaluant la satisfaction quant à la réponse aux consignes a été conçu. Cinq enseignants d'anglais (numérotés T1 à T5) ont été invités à noter les suggestions générées par cinq types de consignes selon une échelle à cinq niveaux (de très insatisfait à très satisfait), comme indiqué dans Figure 6 : les notes attribuées par les cinq enseignants aux cinq types de consignes varient légèrement, mais la reconnaissance globale est élevée. Parmi eux, les consignes de « transfert syntaxique » et de « transfert culturel » obtiennent les scores les plus élevés, avec une moyenne de 4,0, reflétant une forte praticabilité et une bonne adaptabilité en contexte d'enseignement. En revanche, la consigne de « transfert de registre » obtient des notes relativement faibles, avec une moyenne de seulement 2,4, et certains enseignants, comme T4 et T5, ont attribué les notes les plus basses, indiquant que son orientation et son adaptabilité dans les applications pédagogiques doivent encore être améliorées.
Au niveau individuel, il existait des différences évidentes dans les tendances de notation des enseignants. Le score global de T1 était positif, indiquant un haut degré d'acceptation de la rédaction assistée par l'IA, tandis que les scores de T5 étaient faibles dans plusieurs dimensions de Prompt, notamment en ce qui concerne le « transfert de registre » et le « transfert logique ». Cette différence pourrait être liée à l'expérience pédagogique des enseignants, à leurs préférences linguistiques ou à leur familiarité avec les outils d'IA, suggérant que la conception future des Prompt devra prendre en compte des mécanismes d'adaptation personnalisés afin d'améliorer l'acceptation par différents groupes d'enseignants. Afin de vérifier davantage l'effet réel de l'enseignement assisté par l'IA sur l'amélioration de la qualité de la rédaction des étudiants, l'étude a comparé les changements des scores globaux du groupe expérimental et du groupe témoin, tels qu'évalués par les enseignants, avant et après l'expérience. Les résultats de cette comparaison sont présentés dans Figure 7.
Comme le montre la figure 7, les scores globaux du groupe expérimental et du groupe témoin, évalués par les enseignants avant et après l'expérience, présentaient des différences significatives. Dans l'ensemble, après l'intervention pédagogique d'optimisation de l'enseignement fondée sur le modèle DeepSeek, le score global du groupe expérimental a montré une tendance nettement croissante. En revanche, l'évolution des scores du groupe témoin a été relativement modérée. Le score moyen attribué par les enseignants au groupe expérimental avant l'expérience était de 59,1 points, et le score moyen après l'expérience a augmenté de manière significative pour atteindre 74,4 points, soit une hausse de 15,3 points. Cela indiquait que l'enseignement assisté par l'intelligence artificielle avait un impact positif sur la qualité de l'écriture des élèves. D'après le diagramme en boîte, on observe que la plage de distribution des scores du groupe expérimental s'est également élargie. En particulier, la boîte à moustaches des scores après l'expérience est nettement plus élevée qu'avant, et les valeurs maximale supérieure et minimale inférieure ont augmenté, ce qui indique une amélioration significative du niveau global des élèves. En revanche, les variations de scores dans le groupe témoin ont été relativement limitées. Avant l'expérience, le score moyen du groupe témoin était de 60,1 points, et après l'expérience, il s'élevait à 64,9 points, soit une augmentation de 4,8 points. Cette augmentation était bien inférieure à celle du groupe expérimental, et la boîte à moustaches du groupe témoin n'a guère changé avant et après l'expérience, ce qui indique que les méthodes d'enseignement traditionnelles ou les outils d'assistance par IA non optimisés ont un effet limité sur l'amélioration de la qualité de l'écriture.
En outre, cette étude a utilisé le tableau de la cognition transférée pour guider les étudiants à travers trois séries d'auto-évaluation de leur développement des compétences en ajustement structurel, transformation des phrases et expression culturelle, entre autres domaines, afin de refléter l'évolution de la conscience métacognitive des étudiants et de leur maîtrise des stratégies de transfert. Les résultats sont présentés dans Figure 8. D'après les données du graphique en radar concernant l'auto-évaluation par les étudiants de leurs capacités de transfert, illustrées dans Figure 8, l'auto-évaluation des étudiants dans les cinq dimensions — transfert structurel, transfert syntaxique, transfert culturel, transfert de registre et transfert logique — au cours des trois séries de tâches a montré une tendance croissante continue, indiquant qu'avec l'intervention pédagogique d'optimisation de l'enseignement fondée sur le modèle DeepSeek, la capacité des étudiants à utiliser les stratégies de transfert s'était nettement améliorée. Lors de la première série de tâches, les notes d'auto-évaluation des étudiants étaient généralement faibles. Parmi les cinq dimensions, le « transfert structurel » et le « transfert logique » ont obtenu respectivement 3,2 et 3,0, tandis que le « transfert culturel » et le « transfert de registre » ont obtenu 2,5 et 2,7, ce qui indique que les étudiants étaient encore peu expérimentés dans l'identification et l'utilisation des stratégies de transfert. Lors de la deuxième série de tâches, les notes de chaque item se sont améliorées, le « transfert structurel » passant à 3,8, le « transfert syntaxique » à 3,5 et le « transfert logique » à 3,7. Cela montre qu'avec l'accompagnement des enseignants et l'appui des retours du modèle, les étudiants ont progressivement maîtrisé les points clés des opérations de base de transfert et ont commencé à les appliquer à la rédaction effective. Lors de la troisième série de tâches, les notes d'auto-évaluation des étudiants ont augmenté de manière significative, le « transfert structurel » et le « transfert logique » atteignant respectivement 4,5 et 4,3, tandis que les autres dimensions se sont également stabilisées au-dessus de 4,0, démontrant l'effet durable de plusieurs séries d'entraînement au transfert pour améliorer le contrôle des formes linguistiques et les capacités de construction textuelle des étudiants. À ce stade, les étudiants avaient établi une boucle cognitive de base entre compréhension, exécution et réflexion des stratégies de transfert. Outre les retours des enseignants, l'étude a également distribué un questionnaire de satisfaction concernant la fonction d'écriture assistée par IA à tous les étudiants du groupe expérimental, et 30 questionnaires valides ont été recueillis. Le questionnaire évaluait la performance de l'IA dans trois modules fonctionnels — suggestions de réécriture, optimisation structurelle et indications culturelles — et demandait aux étudiants de choisir des options selon cinq niveaux de critères. Les résultats sont présentés dans Tableau 5.
D'après les résultats de l'enquête sur la satisfaction des étudiants concernant les fonctions d'écriture assistée par l'IA présentés dans le Tableau 5, les étudiants du groupe expérimental ont globalement formulé des commentaires positifs sur les performances de l'IA dans les trois modules fonctionnels que sont les suggestions de réécriture, l'optimisation de la structure et les indications culturelles, ce qui montre les bonnes perspectives d'application des systèmes d'écriture assistée par l'IA pour améliorer l'efficacité de l'entraînement à l'écriture et la qualité du soutien pédagogique. Dans l'ensemble, plus de 90 % des étudiants se sont déclarés « très satisfaits » ou « satisfaits » pour les deux fonctions « suggestions de réécriture » et « optimisation de la structure », la fonction « suggestions de réécriture » obtenant le taux de satisfaction le plus élevé, atteignant 91 %, ce qui indique que les étudiants reconnaissent fortement la capacité de l'IA en matière de restructuration syntaxique et de mise en forme linguistique. En comparaison, le taux de satisfaction concernant la fonction « indications culturelles » était relativement plus faible, bien qu'il atteigne tout de même 83 %, ce qui suggère que, malgré la complexité et la subjectivité inhérentes à l'accompagnement dans l'expression interculturelle, le rôle de l'IA pour aider les étudiants à identifier et corriger les interférences culturelles liées à leur langue maternelle est néanmoins reconnu par la majorité. En ce qui concerne l'insatisfaction, la proportion d'étudiants ayant choisi « insatisfait » ou « très insatisfait » pour les trois fonctions était inférieure à 5 %, indiquant que les fonctions assistées par l'IA présentent une bonne utilisabilité et un bon niveau d'acceptation dans la plupart des scénarios d'application. Il convient de noter que la proportion d'étudiants ayant attribué une évaluation « moyenne » à l'item « indications culturelles » était relativement élevée, ce qui suggère que l'IA actuelle pourrait ne pas pleinement répondre aux attentes des étudiants lorsqu'elle traite des questions d'adaptation culturelle, laissant ainsi une marge d'amélioration. Une analyse globale révèle que la méthode d'optimisation des instructions basée sur DeepSeek est largement reconnue par les étudiants, en particulier pour son soutien en matière de forme linguistique.
ANOVA-RM
Une analyse de variance à mesures répétées à deux facteurs (RM-ANOVA) a été réalisée pour examiner les effets du groupe (facteur inter-sujets : groupe expérimental contre groupe témoin) et du temps (facteur intra-sujets : pré-test, tâche 1, tâche 2, tâche 3, post-test), ainsi que leur interaction sur les performances des étudiants en transfert d'écriture en anglais. Le test de Mauchly a indiqué une violation de l'hypothèse de sphéricité (p < 0,05), de sorte que la correction de Greenhouse–Geisser a été appliquée pour ajuster les degrés de liberté des effets intra-sujets. Toutes les analyses étaient basées sur n = 30 participants par groupe. Les résultats sont présentés dans le Tableau 6 :
Les résultats de l'ANOVA à mesures répétées avec correction de Greenhouse–Geisser ont indiqué des effets principaux significatifs du groupe, du temps et de l'interaction groupe × temps sur toutes les dimensions mesurées (p < 0,001). Pour l'indice global de transfert, un effet de groupe significatif a été observé (F(1,58) = 76,32), ainsi qu'un effet de temps significatif (F(2,14,124,12) = 92,75) et une interaction groupe × temps significative (F(2,14,124,12) = 68,49), ce qui suggère que les changements dans la performance globale de transfert au fil du temps différaient significativement entre les groupes.
De même, le transfert syntaxique a révélé des effets significatifs du facteur Groupe (F(1,58) = 52,18), du Temps (F(2,11,122,38) = 71,26) et de l'interaction Groupe × Temps (F(2,11,122,38) = 45,73), indiquant des profils de développement différents dans la capacité de transfert syntaxique selon les groupes et les moments de mesure. Pour le transfert structurel, des effets significatifs du Groupe (F(1,58)=48,65), du Temps (F(2,09,121,22) = 67,81) et de l'interaction (F(2,09,121,22) = 41,36) ont également été identifiés, reflétant des améliorations régulières suivant des trajectoires dépendantes du groupe. Notamment, le transfert culturel a présenté les effets les plus marqués, avec un effet significatif du Groupe (F(1,58) = 81,44), un effet prononcé du Temps (F(2,07,119,96) = 98,52) et une interaction Groupe × Temps robuste (F(2,07,119,96) = 79,27), suggérant le profil de croissance le plus important et le plus différencié dans cette dimension. Dans l'ensemble, tous les indices montrent des effets statistiquement significatifs, confirmant que l'intervention a exercé un impact stable et différencié sur le développement du transfert au fil du temps.
DISPONIBILITÉ DES DONNÉES :
Toutes les données générées ou analysées au cours de cette étude sont incluses dans cet article. Les données brutes d'évaluation sont fournies dans le Tableau supplémentaire 1.

Figure 1 : Étapes de transformation de la structure des phrases. (A) Stratégies pour combiner et renforcer les verbes afin d'améliorer la structure des phrases. (B) Transformations alternatives du sujet, incluant les sujets en forme de gérondif, d'infinitif et de nominalisation. (C) Utilisation de phrases non finies pour accroître la variété et la concision des phrases. (D) Exemples de versions finales retravaillées illustrant un style académique amélioré et une expression anglaise adaptée au contexte interculturel. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 2 : Diagramme en arbre de l'évolution des tâches. Il présente la structure progressive de tâches de transfert à quatre niveaux, allant de la phrase, au paragraphe, au discours, jusqu'au niveau culturel. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 3 : Comparaison des capacités de transfert écrit avant et après l'expérience. Le graphique en radar présente les scores obtenus lors du pré-test et du post-test par le groupe expérimental et le groupe témoin selon les dimensions du transfert syntaxique, structurel et culturel. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 4 : Graphique des tendances de la complexité syntaxique. Les évolutions de la longueur moyenne des phrases et du nombre de niveaux d’imbrication des propositions au fil des trois tâches d’entraînement sont présentées. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 5 : Correspondance du vocabulaire académique. Cette figure montre les variations de la proportion de vocabulaire formel et de la fréquence de la voix passive avant et après l'intervention. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 6 : Carte thermique de satisfaction des réponses aux consignes. Les évaluations de cinq types de modèles de consignes fournies par les enseignants participants sont résumées ici. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 7 : Graphique en boîte des changements dans les évaluations par les enseignants. Le graphique en boîte illustre la répartition et les changements globaux des scores d'écriture évalués par les enseignants pour deux groupes avant et après l'expérience. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 8 : Graphique radar des capacités d'auto-évaluation du transfert par les étudiants. Il présente les scores d'auto-évaluation des étudiants selon cinq dimensions du transfert, mesurés lors de trois tours de formation. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
| Entrée | Opération de l'enseignant | Type de consigne | Opération de l'élève | Résultat | Critères d'évaluation |
| Brouillons écrits initiaux des élèves (phrases/paragraphes/essais) | 1. Identifier les types de transfert et les niveaux de tâche 2. Ajuster les paramètres de la consigne si nécessaire | Consigne de transfert unique / Chaîne de consignes imbriquées en trois étapes | 1. Apprendre les stratégies de transfert 2. Réviser les brouillons selon les retours de l'IA 3. Réaliser une auto-évaluation | Texte révisé par l'IA + Brouillon final révisé par l'élève | Complexité syntaxique, rationalité structurelle, pertinence culturelle, cohérence logique, normalisation du registre (échelle de 0 à 5) |
Tableau 1 : Tableau récapitulatif du flux de travail. Ce tableau résume l'ensemble du flux de travail opérationnel de la formation au transfert d'écriture en anglais assistée par l'intelligence artificielle, en couvrant les matériaux d'entrée, les opérations des enseignants et des étudiants, les types de consignes, les produits finaux et les critères d'évaluation correspondants.
| Catégorie du projet | Contenu |
| Compréhension des objectifs de la mission | Veuillez décrire brièvement les objectifs de migration de ce cycle de tâches rédactionnelles, tels que l'ajustement structurel, l'adaptation culturelle et la conversion linguistique. |
| Stratégie de migration utilisée | Veuillez indiquer les stratégies de migration que vous avez adoptées (sélection multiple autorisée) : |
| Ajustement structurel |
| Transformation de phrase |
| Changement de langue |
| Manifestation culturelle |
| Renforcement de la liaison logique |
| Autre : _______ |
| Réécriture d'exemples et d'instructions | Sélectionnez 1 à 2 phrases réécrites, présentez les versions avant et après la réécriture, puis expliquez les raisons des modifications et les objectifs de transfert souhaités. |
| Difficultés et doutes rencontrés | Décrivez les difficultés que vous avez rencontrées pendant la migration ou les questions que vous vous êtes posées concernant une expression particulière. |
Note d'auto-évaluation
(sur 5 points) | Veuillez évaluer votre réécriture de texte selon les trois critères suivants : |
| • Précision de l'application des stratégies (/5) |
| • Fluidité naturelle de l'expression (/5) |
| • Adéquation culturelle (/5) |
| Objectifs d'amélioration pour les prochaines rédactions | Décrivez brièvement les compétences transférables que vous souhaitez renforcer ou optimiser lors du prochain cycle de formation |
Tableau 2 : Tableau de la cognition transférée. Une échelle d'évaluation de 1 à 5 (1 = aucune maîtrise, 5 = maîtrise complète) est adoptée pour l'auto-évaluation par les étudiants des stratégies de transfert à l'écriture.
| Nom de l'indicateur | Description | Source des données |
| Indice de transfert écrit (0–5) | Un indicateur quantitatif mesurant de manière globale la capacité de transfert linguistique, couvrant trois niveaux : syntaxe, structure et culture. | Notation automatique par le système + notation manuelle par les enseignants |
| Score de complexité syntaxique | Y compris la longueur moyenne des phrases, le nombre d'emboîtements de propositions, la richesse des groupes verbaux, etc. | Analyse automatique par traitement du langage naturel (NLP) |
| Adéquation au style académique | Est-ce conforme aux normes de rédaction académique en anglais ? | Jugement par modèle de traitement du langage naturel |
| Satisfaction face aux réponses aux invites | Acceptation par les enseignants et évaluation pratique des suggestions générées par le modèle | Questionnaire destiné aux enseignants |
| Évolution des notes attribuées par les enseignants | Comparaison des notes données par les enseignants avant et après l'expérience, afin de refléter l'amélioration de la qualité de l'écriture | Registres de notation des enseignants |
| Capacité de transfert auto-évaluée par les étudiants | Les étudiants évaluent eux-mêmes leur maîtrise des différentes dimensions du transfert | Remplissage du formulaire de prise de conscience du transfert |
Tableau 3 : Résumé des indicateurs d'évaluation, de leurs descriptions et de leurs sources de données. Ce tableau précise les définitions, les méthodes de mesure et les sources de données d'origine pour chaque indicateur d'évaluation principal de cette étude.
| Type de prompt | Note moyenne des enseignants | Note moyenne de l'IA | Coefficient de corrélation de Pearson |
| Transfert structurel | 4 | 3.9 | 0.83 |
| Transfert syntaxique | 4.1 | 4 | 0.87 |
| Transfert culturel | 3.8 | 3.6 | 0.79 |
| Transfert de registre | 3.9 | 3.7 | 0.81 |
| Transfert logique | 4.2 | 4.1 | 0.85 |
Tableau 4 : Comparaison de la cohérence entre le contenu généré par l'IA et les évaluations des enseignants. Les résultats démontrent la cohérence entre le contenu généré par l'IA et les évaluations des enseignants selon différents types de consignes.
| Éléments fonctionnels | Très satisfait | Satisfait | Plutôt satisfait | Insatisfait | Très insatisfait |
| Suggestion de réécriture | 66% | 25% | 7% | 1,50% | 0,50% |
| Optimisation structurelle | 60% | 30% | 7% | 2% | 1% |
| Conseils culturels | 55% | 28% | 12% | 3,50% | 1,50% |
Tableau 5 : Statistiques des enquêtes sur la satisfaction des étudiants concernant les fonctions assistées par l'IA. Les statistiques montrent la répartition de la satisfaction des étudiants pour les fonctions de réécriture par l'IA, d'optimisation structurelle et de saisie culturelle.
| Mesure | Groupe F(dl) | Temps F(dl)GG | Groupe × Temps F(dl)GG | p |
| Indice global de transfert | 76.32 (1, 58) | 92.75 (2.14, 124.12) | 68.49 (2.14, 124.12) | <0.001 |
| Transfert syntaxique | 52.18 (1, 58) | 71.26 (2.11, 122.38) | 45.73 (2.11, 122.38) | <0.001 |
| Transfert structurel | 48.65 (1, 58) | 67.81 (2.09, 121.22) | 41.36 (2.09, 121.22) | <0.001 |
| Transfert culturel | 81.44 (1, 58) | 98.52 (2.07, 119.96) | 79.27 (2.07, 119.96) | <0.001 |
Tableau 6 : Résumé des résultats de l'ANOVA à mesures répétées. Il présente les résultats de l'ANOVA à deux facteurs avec mesures répétées concernant la performance globale en transfert d'écriture et ses trois sous-dimensions, incluant les effets principaux du groupe, du temps et de l'interaction groupe × temps. Abréviations : GG = correction de Greenhouse–Geisser.
Tableau supplémentaire 1 : Évaluation des données brutes. Comprend les données brutes utilisées dans toutes les analyses de cette étude.Veuillez cliquer ici pour télécharger ce fichier.