Исследовательская статья

Исследование влияния автоматизированной оценки письма через глубокую нейронную сеть и письменную оценку учителей на результаты письма по английскому

DOI:

10.3791/69995

8 мая 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Для повышения беглости и правильности английского письма использовалось предоставление обратной связи в виде двух семантических функций NLP, а также письменная обратная связь учителя. Результаты показали положительные результаты по первому.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Технологии компьютерного обучения языку добились наибольших успехов в изучении языков, особенно в контексте искусственного интеллекта (ИИ), за последние несколько лет. Существует множество технологий, таких как автоматизированная оценка письменных текстов (далее AWE) и автоматизированное оценивание эссе (AES), которые считаются столпами изучения языков не только в компьютерных дисциплинах, но и в образовании. Оценка может проводиться только в виде целостных баллов с использованием технологии AWE, которая была весьма эффективной для улучшения изучения языка и, следовательно, не может предоставить подробную или глубокую обратную связь. Для предоставления подробной обратной связи по двум основным элементам языка (то есть грамматике и беглости) рассматривалась система автоматизированной реализации с использованием моделей нейронных сетей и два метода обработки естественного языка на основе семантической основы (далее NLP). С этой целью 90 пакистанских студентов университетов, изучающих английский второй язык (ESL), были случайным образом распределены в контрольные, преподавательские и экспериментальные группы. Компьютерная оценка включала нейронную сеть. Результаты сравнительного теста между базовой моделью AWE и преподавателями, оценивавшими её, показали корреляцию между компьютерной обратной связью, использующей эти нейронные сети. Последствия таких результатов лежат в педагогике письма ESL, особенно в ситуациях, когда лингвистическая точность и беглость представляют вызов.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Обратная связь в письме охватывает различные характеристики языка, такие как организация, грамматика, беглость, содержание и механика, позволяя учащимся либо переписывать, либо создавать новый текст 1,2,3. В настоящее время учителя английского письма получили значительную выгоду благодаря быстрым изменениям и развитию компьютерного языкового обучения (далее CALL) и компьютерного тестирования письма в виде AWE или AES, а также оценки письменныхэссе 4. Кроме того, компьютерная оценка английского письма даёт диагностическую обратную связь по лингвистическим элементам, таким как содержание, грамматика, словарный запас и др., обеспечивая своевременные, индивидуальные и объективные ответы на письменный текст студентов. Система AWE также способна давать студентам чёткие письменные ответы, чтобы они усвоили знания, полученные через эти письменные ответы, и увеличили когнитивные способности6учеников.

Настоящее исследование основанона исследовании 4, которое предложило концепцию многостратегического компьютерного обучения английскому письму с учётом теории обратной связи английского письма и процесса аналитического оценивания. Это включало и другие семантические модели на основе NLP, которые интегрировали глубокое обучение в письменную обратную связь для обеспечения сложной письменной оценки обратной связи. Она решает ограничения прежней технологии AWE, которая делает акцент только на целостном, но не аналитическом и специфическом оценке. Следовательно, это больше касается точной и немедленной оценки с суб- и общими баллами по ряду лингвистических индикаторов, чтобы улучшить изучение английского письма среди учеников. Среди различных особенностей лингвистики (например, содержание, сложность, корректность, беглость) в данном исследовании рассматриваются только беглость и грамматический аспект учащихся ESL в Пакистане. С этой целью текущее исследование предлагает стратегию технологии НЛП, предполагающую использование нейронных сетей с оценкой учителями.

В контексте изучения пакистанского языка пакистанские ученики сталкиваются с трудностями при изучении английского письма, хотя рассматривают изучение английского как обязательный предмет, начиная с 1 класса и продолжая до 14 класса. Вот тут на картину вступают многочисленные факторы, такие как неправильные курсы и использование старых методов объясненияграмматики 7. На университетском уровне количество студентов, которых обязаны обучать учителя, довольно значительно, поскольку студенты имеют разнообразное происхождение, включая различные колледжи и школы. Это заставляет учителей тратить большую часть времени на исправление ошибок учеников, что делает нагрузку слишком высокой. С другой стороны, ученики воспринимали письменную обратную связь учителей как должное и не прилагали усилий, чтобы распознать ошибки и исправитьих 8.

Одно исследование показало, что беглость в основном зависит от того, что, поскольку студенты боятся ошибиться, она становится препятствием для беглого письма, и поэтому студенты предпочитают избегать ошибок чаще, чем заниматься мыслями. Иногда урду вмешивается в английский текст, а также другие контекстуальные факторы. Кроме того, урду является национальным языком. Из-за этих контекстуальных факторов учителям сложно предоставлять точную, своевременную и последовательную обратную связь каждому ученику, когда ученики создают письменные результаты или редактируют рукописи. Учитывая теорию оценки письма, это исследование позволит следовать исследованию, которая использует автоматическую обратную связь при машинном письме при сравнении традиционной оценки учителя и берёт аналитическую вместо целостной оценки, чтобы обеспечить мгновенную обратную связь по двум значимым лингвистическим измерениям (то есть грамматике и беглости)4.

Появились различные промышленные продукты AWE и AES, включая Pigai.org, Bingo English, My Access, E-rater, I-write, Criterion и др. На ранней стадии развития AES/AWE характеризуется преимущественно традиционной системой машинного обучения, основанной на теоремеБайеса 10, линейнойрегрессией 11 и др. В настоящее время расширенное развитие глубокого обучения, особенно технологии нейронных сетей, также значительно улучшило область написания обратной связи, такой как рекуррентные нейронные сети или RNN12, долгосрочная кратковременная память13, сверточные нейронные сети (CNN)14, подход BERT15. AWE также получил преимущества от стратегий предварительного обучения, применяемых в началеNLP 16. Многие исследования учитывали различные решения, ориентированные на нейронные сети, такие как генерация состязательных выборок для обучения, обучение черезмногозадачность 17, обучение с помощьюсамоконтроля 18 и алгоритмыграфов 19. Некоторые предложили различные методы решения проблемы отсутствия обучающих данных для написания обратнойсвязи 20. Существуют также модели оценки, которые вносят вклад во многие модели нейронныхсетей 21.

Коррекция грамматических ошибок (далее — GEC) — это независимый способ выполнения NLP-миссий, который способен автоматически обнаруживать и затем исправлять ошибки композиции. Содержание заданий GEC взаимосвязано с аспектами AWE. Задачи AWE считаются с учётом диагностики грамматических ошибок, большинство из которых необходимо выделить в правильной форме. Однако исследования AWE уделяли меньше внимания GEC, и лишь немногие интегрировали раннюю модель GEC в технологию AWE. Изначально исследования по GEC чаще всего выбираютN-грамму 22, а языковуюмодель 23 , включая BERT24 , для выявления и исправления грамматических ошибок. Однако вышеуказанные решения не смогли полностью решить такие проблемы, как беспорядок и пропуск компонентов. Архитектураенкодер-декодера 25 достигла такого же успеха в GEC, решив проблемы, которые ранее не могли решить другие модели. Важно отметить, что продвинутые архитектуры GEC использовали несколько моделей для решения задач, включая подходы на основетрансформаторов 26.

Другие исследования подтвердили эффективность AES по сравнению с человеческими оценками при оценке написанияэссе 27,28. Исследование29 продемонстрировало влияние автоматизированной оценки на беглость владения английским у учащихся. Результаты показали, что автоматическая оценка положительно влияет на беглость английского письма. В отличие от этого,некоторые другие исследованияигнорируют высокий уровень обнаружения ошибок AES по сравнению с человеческими оценками. Недавние исследования подчёркивают растущую эффективность инструментов с помощью ИИ для оценки письменных текстов в языковом образовании. В одном из такихисследований 31 было проведено сравнение автоматизированной оценки с обратной связью преподавателя в контексте обучения китайских студентов колледжей.

Революционная роль инструментов на базе ИИ в академическом письме активно освещается в современной литературе. Исследования, касающиеся применения инструментов письма на базе ИИ в качестве дополнения к традиционному образованию по письму английскому и английскому языку, подчеркивают первостепенное значение равных возможностей и проактивной поддержки учителей в успешном внедрении технологий32. Исследования, изучавшие AWE, такие как Пигай, показали сильную связь между обратной связью при поддержке компьютеров и улучшением написания, редактирования и новых текстов наESL 33. Другое исследование подчеркнуло преимущества вариационных автоэнкодеров (VAE), которые положительно влияют на обучение английскому письму у учащихся и получают обратную связь о более высоких уровнях глубокого обучения, специализируясь на различных лингвистическихособенностях 34. Другое исследование показало, что нейронные системы AWE будут эффективны для использования с GEC на основе NLP, который использует глубокое обучение для немедленной оценки35.

Совершенствование многоагентных систем — важный этап в разработке технологий, способствующих написанию текстов. Пример работы мультиагентом, ассистентом по академическому совершенствованию письма, AcademyCraft, основанный на глубоком обучении, продемонстрировал способности писать и давать подробную обратную связь, что облегчает поддержку письма на основе искусственного интеллекта на основе сложных аналитическихсхем 36. Фактически, исследования изучения языков на основе технологий также выявили различные возникающие паттерны, такие как глубокое обучение, автоматическая оценка и семантическая обратная связь, при этом анализ производительности показал постепенный и стабильный рост точности письма, а также вовлечённостьучащихся 37.

Модели Transformer-LSTM показали определённую склонность к автоматической оценке и обратной связи при английском письме. Такие гибридные архитектуры взаимно объединяли контекстуальное понимание трансформаторов вместе с последовательной обработкой систем LSTM, что привело к улучшению точности грамматической и когерентной градации и обеспечению более тонкого поколения обратнойсвязи 38. Восприятие учителями английского языка о инструментах написания ИИ постоянно показывает измеримые улучшения в организации содержания и качестве письма, акцентируя внимание на ключевой роли педагогической помощи в стимулировании полезности технологическойинтеграции 39. Существует меньше исследований, сравнивающих отзывы преподавателей с компьютерно поддерживаемой обратной связью, что подразумевает использование моделей глубокого обучения для изучения влияния на английское письмо учащихся ESL с точки зрения беглости и грамматики.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Всё программное обеспечение и инструменты, использованные в исследовании, перечислены в Таблице материалов.

Критерии оценки

Классификация оценки, принятая в данном исследовании, охватывает две основные области: беглость и корректность, которые включают все требования для комплексной оценки письма на английском языке как иностранном (EFL). Эти измерения предназначены для измерения ключевых моментов качества письма, которые помогают эффективно общаться и демонстрировать языковые навыки. Модуль «Беглость» измеряет естественность, выразительность и целостность в письме, измеряя плавность идей, а также то, насколько хорошо используются слова и структура предложений. Модуль корректности нацелен на точную грамматическую точность, механическую безупречность и соответствие стандартным английским конвенциям и, гипотетически, измеряет и считает ошибочность языка на нескольких уровнях. (см. Таблицу 1)

Определение задачи

В соответствии с условиями автоматизированной оценки письма учащихся, изучающих английский язык, настоящее исследование предлагает новую модель компьютерной системы оценки английского письма с использованием EG. По сравнению с предыдущими исследованиями, которые были ограничены сферой автоматизации систем оценки письменных текстов, предлагаемая система поможет устранить эти ограничения за счёт внедрения инновационных методов глубокого обучения, позволяющих пользователям определённый уровень лингвистического анализа, область модификаций и системный анализ обратной связи на основе обширной обработки данных. Руководствуясь двумя из самых значимых показателей сочинения — беглостью (насколько естественным, связным и выразительным является произведение) или правильностью (насколько правильно написан текст, наполненный грамматическими, механическими и языковыми ошибками), с отдельными компонентами нейронных сетей система двойной модели должна выполнять ряд оценок. Кроме того, он выявляет ошибки на нескольких языковых уровнях, рекомендует меры по исправлению и даёт обратную связь в виде списка, чтобы пользователи могли методично улучшать изучение языка. Для описания процесса вычисления системы автоматической оценки с помощью компьютера мы предлагаем следующую математическую модель в формулах (1)–(4) (см. Таблицу 2).

figure-protocol-1(1)

figure-protocol-2(2)

figure-protocol-3(3)

figure-protocol-4(4)

где: Итоговый балл = сводный балл по письменной оценке; w1 = вес, присваиваемый к баллу беглости речи; w2 = вес, присваиваемый баллу за правильность; Sf = балл беглости на основе BERT (нормализован до [0, 1]); Sc = экспоненциальная оценка корректности распада; λ = штраф за контрольную ошибку при постоянном затухании; σ(x) = логистическая сигмовидная активация; ErrorRatio = отношение ошибок к общему количеству токенов в тексте. Показатели беглости нормализуются до [0, 1] логистической сигмовидной функцией σ(x), тогда как экспоненциальное затухание используется для оценки правильности с целью наложения соответствующего штрафа на частоту ошибок.

Архитектура и проектирование системы

Архитектура системы использует двухмодельную систему с параллельной архитектурой обработки, при которой анализ входных эссе выполняется параллельно через параллельные пути оценки. Модули беглости и корректности, в свою очередь, дают соответствующие баллы, а итоговый составный балл — это взвешенное среднее по двум подоценкам. Модуль корректности также предлагает рекомендации по обнаружению и коррекции ошибок, помимо оценки (см. рисунок 1).

Модуль беглости

Беглость письма можно определить как характер или закономерность использования языка с точки зрения правильного выбора словарного запаса, разнообразия структуры предложений, синтаксической сложности, связности и т.д.4. Модели оценки беглости фиксируют передачу идей без заикания и неловкости, звуча примерно к нативистским тенденциям коммуникации. Традиционное измерение беглости основано на шкалах, что подчеркивает вопросы надёжности между участниками. Предлагаемая система преодолевает этот недостаток, поскольку включает нейронную сеть на основе BERT, которая автоматически индуцирует семантическую согласованность и лингвистическую естественность через глубокое ситуационное понимание. Это архитектурное решение было принято с учётом сильных сторон BERT, который оказался эффективен для выявления контекстуальных отношений и семантических закономерностей, необходимых для измерения беглости речи. Входные последовательности подаются в систему и проходят через 12 слоёв трансформаторов с многоголовной самоконцентрацией для выявления дальнодействующих зависимостей и контекстуальных отношений (см. рисунок 2).

Механизм внимания будет следующим:

figure-protocol-5(5)

Пусть Q, K и V — матрицы, представляющие запрос, ключ и значение соответственно, а d и k — размерности ключевых векторов. Вложение токена CLS — это сводное вложение, которое фиксирует общую семантическую когерентность всей входной последовательности.

Расчёт балла беглости выглядит следующим образом:

figure-protocol-6(6)

Где hCLS — это вложение токена BERT [CLS], аW reg — b reg — параметры регрессионной головки, а σ — сигмоидная активационная функция, нормализующая выход до [0, 1].

Модуль корректности

Оценка корректности сосредоточена на грамматической точности, механической точности и соблюдении стандартных английских норм. Это измерение охватывает технические аспекты письма, включая синтаксис, морфологию, пунктуацию и точность орфографии. Компонент корректности не только оценивает количество лингвистических ошибок, но и оценивает их влияние на общее качество текста. В отличие от оценки беглости, которая делает акцент на семантической когерентности и естественном потоке, модуль оценки корректности требует точного выявления ошибок и систематической коррекции. Модуль различает различные типы ошибок, оценивает степень их и предоставляет целенаправленные корректировки для поддержки улучшения обучения. Потеря корректности использует модель FLAN-T5, которая была доработана для грамматического обнаружения и коррекции ошибок. Этот выбор обусловлен возможностью преобразования текста в текст T5, которая позволяет системе не только находить неисправности, но и выполнять соответствующие исправления внутри одной системы. Система представляет собой форму энкодер-декодера, и текст подаётся в виде такого преобразования: (см. рисунок 3)

figure-protocol-7(7)

Элемент кодировщика генерирует контекстно-зависимые представления, которые отражают не только грамматические тенденции, но и потенциальные области неудач:

figure-protocol-8(8)

С помощью генерации соответствующих грамматических вариаций ошибок ошибок декодер генерирует исправленные последовательности:

figure-protocol-9(9)

Такой двухсторонний процесс позволяет системе осознавать контексты ошибок и понимать, как эти контексты должны быть исправлены, чтобы подсказки были семантически последовательными, но при этом сосредоточены на любых исправлениях в грамматике.

Количественная оценка ошибки и алгоритм подсчёта очков

Оценка точности сравнивала оригинальный текст с правильной версией письма, учитывая лингвистические ошибки и степень их серьёзности в зависимости от положения в тексте и вмешательства в смысл. Этот метод отражает различие между типами ошибок и их влиянием на понимание текста. Связь между частотой ошибок и низким качеством текста в системе оценок была подчёркивана логарифмически. Фундаментальный этап в сравнении токенов исходного и исправленного текста — это две степени сравнения, основанные на битовой технике выравнивания строк. Второй этап включает выявление и классификацию типов ошибок на основе известных лингвистических таксономий, которые различают грамматические ошибки (согласование подлежащего и глагола, согласованность времени и надёжность синтаксической структуры), механические (заглавные буквы, пунктуация и орфография) и ошибки употребления (выбор слов, идиоматическое выражение и уместность регистра). Третий этап — расчёт коэффициента ошибок на основе общей длины текста. Четвёртый этап использует алгоритм экспоненциального затухания, который преобразует отношение ошибок в напрямую интерпретируемые оценки корректности для приближения неаддитивной и нелинейной зависимости между частотой ошибок и качеством текста.

Математическая обработка процесса количественной оценки ошибок начинается с расчёта отношения установленных ошибок, что обеспечивает нормализованный коэффициент установки ошибок, что, в свою очередь, позволяет провести справедливое сравнение текстов разной длины:

figure-protocol-10(10)

figure-protocol-11(11)

Был установлен параметр калибровки 2,5 на эмпирической основе путём полной валидации с помощью экспертных суждений человека, чтобы функция оценки могла давать результаты, соответствующие человеческому пониманию в отношении снижения качества текста по мере увеличения частоты ошибок. Установка этого значения параметра таким образом гарантирует, что любой текст с низкой ошибкой (Error_Ratio < 0.1) имеет высокий балл корректности, так как он строго следует правилам стандартного английского; любой текст с умеренным уровнем ошибок (0.1 < Error_Ratio ≤ 0.3) имеет промежуточный балл корректности, указывающий на наличие лингвистических проблем, которые, тем не менее, не являются катастрофическими, И любой текст с высоким уровнем ошибок (Error_Ratio > 0,3) получил низкую точность из-за критических лингвистических вопросов, которые существенно влияют на возможность понимания.

Алгоритм оценки корректности для оценки корректности систематически учитывает все ошибки, обнаруженные и исправленные системой на основе T5, в качестве штрафных пунктов при расчёте конечного коэффициента ошибки. Механизм штрафного кредита, используемый для грамматических ошибок, представлен экспоненциальным снижением роста доли ошибок к высоким значениям, что означает, что качество текста очень низкое и достигает 100, когда коэффициент ошибок равен 0, то есть ошибок абсолютно не обнаружено. Это идеальное использование английских стандартных конвенций. Такое математическое отношение гарантирует, что код корректности имеет значительное различие во всем диапазоне уровней лингвистической компетентности и реагирует на небольшие последовательные продвижения, указывающие на реальные приобретения.

Наборы данных: корпус обучения и оценки

Обучающие данные достаточного качества и объёма имеют первостепенное значение для работы системы двойной модели. В текущем исследовании использовался хорошо спроектированный набор данных из учебников, написанных студентами, для разработки и оценки модели, которая была создана с помощью различных письменных заданий. Выборка включала 45 мужчин и 45 женщин из пакистанских университетов со средним возрастом 19 лет, изучающих «Функциональный английский» как обязательный курс. Каждый студент написал восемь эссе в течение восьми недель, включая предтестные, интервенционные эссе и послетестовые мероприятия. Студентам разрешалось написать от 400 до 450 слов для каждой письменной задачи. Статистика наборов данных предоставляет следующие характеристики:

70 500 слов

Средняя длина предложения: 15,7 слов (SD = 3,2)

Диапазон словарного запаса (соотношение типов и токенов): 0,64 (SD 0,08) Грамматическая плотность ошибок: 2,3 в 100 словах (SD = 1,1)

Обоснование и обеспечение качества данных выбранных данных

Выбранный набор данных был обусловлен несколькими важными факторами, которые позволили обеспечить глубину и актуальность исследовательской работы по автоматизированной оценке письма. Во-первых, студенты-экономисты были отобраны из-за характера, похожего на студентов EFL в пакистанском высшем образовании, что позволило представить более достоверные письменные образцы, отражающие реальные ситуации. Во-вторых, установление максимального и минимального потенциального диапазона слов — 400–450 слов — было обусловлено данными пилотных исследований, что этот диапазон достаточно лингвистически сложен, чтобы его надёжно анализировали машины, и при этом он оставался управляемым размером с точки зрения последовательных человеческих оценок. Каждое из произведений оценивалось тремя обученными преподавателями английского языка (надёжность между оценщиками κ = 0,847, размер беглости и 0,823, размер правильности) по стандартизированным 10-балльным шкалам оценки беглости и корректности. Обучение человеческих оценщиков было строгим и основывалось на разработанных критериях оценки для IELTS и TOEFL для письменных оценок. Данные состоят из аннотированного человеком набора данных, который может использоваться для обучения и валидации моделей для обучения на антропогенных данных.

Процедуры предварительной обработки и валидации данных

Набор данных систематически заранее обрабатывался и включал нормализацию текста, токенизацию текста с помощью токенизатора BERT WordPiece и проверку качества. Те, кто предоставил неполные работы и создал плагиат, не были включены для оценки целостности данных. Последние данные были случайным образом разделены на обучение (70%, n = 189), валидацию (15%, n = 41) и тестовые наборы (15%, n = 40) с помощью стратифицированной выборки для сбалансирования уровней владения и типом задач. Лингвистический анализ большого справочного корпуса, содержащего профессионально отредактированные академические тексты, статьи из газет и опубликованные эссе, объёмом примерно 50 миллионов слов. Этот корпус предоставляет языковые шаблоны, необходимые для проведения тестов беглости и помогает в процедурах обнаружения ошибок, сравнивая их со стандартным использованием. В референсном корпусе этапы перед предварительной обработкой и индексацией включают токенизацию, тегирование частями речи, синтаксический разбор и семантическую маркировку для эффективного доступа при оценке в реальном времени.

Стратегия обучения модели беглости

Предлагается система последовательной оптимизации для обучения данных для достижения беглости языка. Обучение использовало передовые функции, включая адаптивное планирование скорости обучения, прогрессивный размер партий и продвинутые методы регуляризации, которые предотвращают перенагонку по мере обучения, тем самым сохраняя эффективность модели в выявлении языковых закономерностей, указывающих на беглость языка. Скорость обучения составляет 5 × 10-4 с линейным графиком затухания, настроенным для обеспечения стабильности сходимости и отсутствия колебаний вокруг оптимальных значений параметров. Эта скорость обучения выбирается с помощью поиска по сетке в [1 x 10-6, 1 x 10-4], при этом 5 x 10-5 является наиболее подходящим компромиссом между скоростью сходимости и стабильностью. Реальная подготовка будет ограничена всего 3 эпохами — конфигурация, оптимизированная на основе эмпирических преимуществ отслеживания потерь валидации, чтобы предотвратить перенагон, не препятствуя достаточному обновлению параметров для повышения эффективности обучения. Раннее останавление механизмов с терпением 2 эпохи и минимальной дельтой 0,001 было проведено для предотвращения деградации.

Оптимизация выполняется оптимизатором AdamW, с упрощёнными вариантами, такими как β₁ = 0,9 (импульс, который экспоненциально регулирует затухание оценок первого момента), β₂ = 0,999 (оценка второго момента, которая экспоненциально управляет затуханием оценок второго момента) и ε = 1 × 10⁻8 (численный член устойчивости). Регуляризация снижения веса (λ = 0,01) предотвращает чрезмерное увеличение величин параметров, при этом это значение выбирается с помощью анализа эффективности валидации по всему диапазону [0,001, 0,1]. Комплексный мониторинг позволяет отслеживать различные метрики на протяжении всего обучения, чтобы обеспечить наилучшую производительность модели и избежать перенагона. В систему мониторинга входят:

Отслеживание потерь: Потери в обучении и валидации отслеживаются в каждой эпохе, и ранняя остановка происходит автоматически, когда потери валидации перестают улучшаться в течение двух последовательных эпох.

Показатели эффективности: Данные валидации используются для расчёта коэффициентов корреляции Пирсона между прогнозируемыми и фактическими баллами каждые 100 этапов обучения.

Градиентное измерение: Для обнаружения нулевых и взрывающихся градиентов контролируются нормы, и при норме градиента 1.0 применяется градиентное обрезывание.

Планирование скорости обучения: Фиксируется снижение скорости обучения на основе валидации (коэффициент = 0,5) при более чем одной эпохальной плато.

Связан с регуляризацией: Частота выброса (0,1 для BERT, 0,3 для регрессионной головки) была обнаружена методом систематической абляции. В процессе обучения используются несколько методов регуляризации, основанных на предотвращении перенагона: (1) регуляризация дропаута с использованием оптимизированных частот выбывания по типу слоя в сети, (2) снижение веса, как объяснялось выше, (3) ранняя остановка, определяемая результатами валидации, и (4) дополнение данных на основе перефразирования 15 процентов обучающих примеров с использованием методов обратного перевода. Контрольные точки самой эффективной модели сохранялись после каждой эпохи, а модели с наивысшими баллами выбирались на основе корреляционных показателей валидации. Функция потерь, используемая в части оценки беглости, — это средняя квадратическая ошибка (MSE), которая является основной целевой функцией регрессионной задачи прогнозирования непрерывных показателей беглости. Математически формулировка потерь задаётся следующим образом:

figure-protocol-12(12)

N — это общий размер обучающей выборки, y_pred, i — прогнозируемый балл беглости i-й выборки, а y_true, i — соответствующий базовый балл истинности, заданный экспертами-экспертами. Эта потеря очень полезна для предотвращения фактической ошибки предсказания квадратично, чтобы большие ошибки приводили к большому штрафу, и также дифференцируема. Механизм планирования скорости обучения очень продвинулся с двухфазным процессом и начинается с линейного этапа прогрева, за которым следует систематический процесс затухания для создания оптимальных характеристик сходимости. Это происходит на этапе разогрева, когда скорость обучения начинается с нуля и постепенно переходит к максимальной, после чего параметры модели оптимизируются относительно обучающего набора данных. Математическое выражение фазы разогрева выглядит так:

figure-protocol-13(13)

После фазы разогрева скорость обучения систематически снижается линейно, чтобы избежать перевышения оптимальных значений параметров, что приводит к устойчивой сходимости. Математически фаза распада выглядит так:

figure-protocol-14(14)

Где t — текущий тренировочный шаг, lr max — максимальная скорость обучения, достигнутая во время разминки, разминка — количество шагов, назначенных фазе разминки, а total — общее количество тренировочных шагов за все эпохи. Упомянутая процедура планирования обеспечивает агрессивное изучение модели на нижних уровнях и стабильность на уровнях сходимости.

Стратегия обучения модели корректности

Модель корректности основана на стратегии трансферного обучения с использованием предварительно обученной модели FLAN-T5 для использования всех доступных грамматических знаний по мере необходимости. Это было предназначено для изучения общего понимания языка, а также конкретной информации о ошибках, допущенных учащимися ESL. Используемый метод трансферного обучения использует контрольную точку pszemraj/flan-t5-large-grammar-synthesis в качестве базовой модели, с рядом заметных преимуществ с точки зрения корректности. Поскольку модель уже обучена и обладает высоким уровнем понимания языка, обученным в различных областях текста, она адаптируется к различным стилям письма и темам. В частности, была проведена грамматическая тонкая настройка на больших корректировочных наборах данных, охватывающих различные типы грамматических ошибок, как это встречается при написании на втором языке. Кроме того, контрольная точка включает мощные системы обнаружения ошибок, которые проверяются по различным типам ошибок (морфологическим, синтаксическим и семантическим), создавая идеальный стандарт сравнения с врождёнными параметрами коррекционного тестирования исследования.

Процесс адаптации доменной области отражает систематические изменения параметров, которые не изменяют общие возможности понимания языка предварительно обученной модели, но вводят специфические особенности решения задачи по оценке письма. Этот процесс адаптации имеет математическое вывод следующим образом:

figure-protocol-15(15)

Здесь предварительнообученное θ представляет параметры предварительно обученной модели, кодирующей общее понимание языка и грамматические знания, адомен Δθ — конкретные обновления параметров, полученные в ходе задачи по оценке целевого письма. Данно-специфичные обновления вычисляются с помощью градиентной оптимизации целевого набора данных, что гарантирует, что модель развивает специфическую чувствительность к типам ошибок, распространённым в EFL-письме, не нарушая её более широкие лингвистические возможности.

Эксперименты с сравнениями

Для подтверждения функциональности EG в качестве ключевого значения измерения предлагается коэффициент корреляции Пирсона, который определяет линейную связь между автоматизированными оценками и экспертизой человека. Коэффициент корреляции определяется формулой:

figure-protocol-16(16)

где xi представляет автоматические оценки, представляет человеческие оценки, а figure-protocol-17 и figure-protocol-18 — соответствующие средние. Коэффициент корреляции варьируется от −1 до 1, при этом значения около 1 указывают на сильную положительную связь между автоматизированной и человеческой оценкой.

figure-protocol-19(17)

figure-protocol-20(18)

figure-protocol-21(19)

Сравнение базовых моделей

Для оценки эффективности EG и демонстрации её превосходства над существующими методами проводятся углублённые сравнения с устоявшимся AWE и традиционными однометричными подходами. Эти исходные сравнения необходимы для подтверждения добавленной ценности архитектуры EG и демонстрации того, что интеграция беглости и оценки корректности обеспечивает измеримые улучшения по сравнению с подходами, сосредоточенными на отдельных измерениях в изоляции. Выбор базовых моделей охватывает четыре категории AWE, каждая из которых отражает определённую ориентацию на то, как следует оценивать письмо. В первом используется одна модель на базе BERT для оценки беглости. Эти модели используют архитектуры трансформаторов для оценки текстовых паттернов плавности и когерентности. Вторая категория, встроенная в традиционные лингвистические методологии, сосредоточена на системах на основе правил для обнаружения грамматических ошибок. Поэтому акцент оставался на правильности, игнорируя другие аспекты, связанные с качеством письма, такие как связность и содержание. Третья категория — это системы AWE, основанные на признаках, которые включают показатели лингвистической сложности — такие как вариационная длина предложений, разнообразие лексики и синтаксическая сложность для получения общих оценок качества. Четвёртая учитывает гибридные системы, сочетая различные поверхностные лингвистические особенности, часто используя ансамблевые методы или взвешенные средние. Эти модели не достигают уровня интегрированной сложности, достигнутого нейронными архитектурами EG. Производительность базовой модели оценивается по трём основным измерениям. Первый измеряет соответствие оценок, сгенерированных системой, с оценками обученных специалистов (преподавателей английского языка) с использованием стандартизированных рубрик. Второй определяет обобщаемость, определяя, остаётся ли производительность последовательной для трёх эссе с разной темой и сложностью. Третье измерение основано на предсказательной надёжности, оценивая точность и стабильность оценок с помощью статистических инструментов, таких как средняя абсолютная ошибка, ошибка среднего квадрата и анализ доверительных интервалов. В совокупности эти измерения создают надёжную основу для сравнения и подчёркивают превосходство систем EG, особенно в достижении большей точности и стабильности по сравнению с традиционными подходами.

Экспериментальные и контрольные группы

В этом исследовании приняли участие 90 студентов бакалавриата по экономике, которые изучали функциональный курс английского языка в двух целых классах. Данные собирались три раза: предтест, вмешательство и посттест, чтобы отслеживать прогресс в точности и беглости письма со временем. Это исследование на людях было одобрено Консультативным советом кафедры Университета COMSATS в Исламабаде, кампус Лахор, Пакистан. Участники столкнулись с двумя состояниями: традиционной человеческой обратной связью и компьютерной поддержкой. Контрольная группа состояла из 45 студентов, которые получали традиционную письменную обратную связь от обученного преподавателя английского языка. Участники получали письменную обратную связь о эссе студентов в виде целостных оценок, выявления ошибок и рекомендаций в виде комментариев преподавателя о том, как улучшить работу. Экспериментальная группа, в свою очередь, включала 45 учеников, которым обучались одинаково в классе, но письмо студентов дополнялось с помощью быстрой автоматической обратной связи, предоставляемой EG, которая предоставляла диагностическую информацию как по беглости, так и по корректности примерно в течение 30 секунд после подачи заявки.

Это исследование проводилось в течение 8 недель, при этом был проведён предварительный тест (Неделя 1) для определения начальной письменной способности испытуемых перед введением вмешательства. В течение шести недель участникам проводилась компьютерная обратная связь с семантическими маркерами NLP в экспериментальной группе и оценка учителями в контрольной группе. В конечном итоге посттест (на 8-й неделе) был проведён для понимания разницы между показателями точности и беглости до и после теста. Для получения схожих результатов в сопоставимости респондентов просили выполнять аналогичные письменные задачи в каждом периоде оценки, минимизируя потенциально смешивающие факторы, связанные с сложностью задачи и знакомостью содержания в тексте. Чтобы писательские задания соответствовали уровню сложности, а также чтобы установить достоверность содержания, подсказки были выбраны так, чтобы они были согласованы. Темы для эссе выбирались на основе того, что студенты охватывают различные предметные области, чтобы избежать эффекта практики и скуки у участников от необходимости выполнять одну и ту же задачу в течение длительного времени.

Во время предварительной стадии тестирования участников просили написать эссе объемом от 400 до 450 слов и рассказать об академических и карьерных целях. Это описательное задание основано на личном опыте и прогнозах на будущее, что подразумевает необходимость организовать текст, привести чёткие примеры и логично изложить личные цели и мотивацию. Задание по написанию интервенции было основано на различных темах, таких как рассказы о повседневной жизни, хобби, путешествиях, первом дне в университете, памятных днях жизни и моментах с лучшими друзьями. Посттестовый запрос был связан с темой «Влияние технологий на коммуникацию», а требуемая длина эссе составляла 400–450 слов.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Валидность и надёжность статистического подхода

Система была протестирована на различных дополнительных статистических методах, которые дают всесторонние доказательства влияния EG на развитие письма. Это многогранный аналитический метод, который признаёт, что образовательные вмешательства подвергаются сложному статистическому анализу, который нельзя свести к простым сравнениям групп, а скорее к анализу закономерностей изменений, масштаба эффек...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Экспериментальные результаты демонстрируют несколько значимых достижений. Во-первых, система двойной модели достигла сильной корреляции с экспертными суждениями человека (r = 0,923), значительно превосходя одномодельные подходы и современные системы AWE. Во-вторых, исследование контролируемого вмешательства выявило значительное улучшение в письменных способностях студентов ESL, при этом большие размеры эффектов (d = 1,28) превышают те, что описаны в современной литературе. В-третьих, сис...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Между всеми авторами нет конфликтов интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Мы признаём поддержку факультета английского языка COMSATS University Islamabad, кампус Лахор, в сборе данных от студентов.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
<СИЛЬНО>ПРОГРАММНОЕ ОБЕСПЕЧЕНИЕ / БИБЛИОТЕКИ, ИСПОЛЬЗУЕМЫЕ В ИССЛЕДОВАНИИ
Фреймворк глубокого обученияPyTorch1.13.1Фреймворк глубокого обучения для реализации нейронных сетей
Предварительно обученные моделиТрансформеры (Обнимающее лицо)4.21.3Предварительно обученная загрузка моделей, реализации моделей BERT и T5
Языковая модельBERT (Двунаправленные представления кодировщиков от трансформеров)bert-base-uncasedОценка беглости, оценка семантической когерентности, контекстуальное понимание
Языковая модельFLAN-T5 (Тонко настроенная языковая сеть T5)pszemraj/flan-t5-large-grammar-synthesisКоррекция грамматических ошибок, преобразование текста в текст, обнаружение ошибок
Численные вычисленияNumPy1.23.5Численные вычисления, операции с массивами для математических функций
Анализ данныхПанды1.5.2Обработка данных, статистический анализ и предварительная обработка
Машинное обучениеScikit-learn1.1.3Статистические метрики, корреляционный анализ, метрики оценки
ВизуализацияMatplotlib3.6.2Визуализация данных, графики прогресса обучения, таблицы эффективности
ВизуализацияСиборн0.12.1Визуализация статистических данных, тепловые карты корреляции
NLP ToolkitNLTK (Набор инструментов для естественного языка)3.7Предобработка текста, токенизация, лингвистический анализ
Обработка НЛПSpaCy3.4.4Продвинутая NLP-обработка, POS-тегирование, синтаксический анализ
ТокенизацияТокенайзеры0.13.2Быстрая токенизация для BERT WordPiece и токенизации T5
<СИЛЬНО>СТАТИСТИЧЕСКОЕ И АНАЛИТИЧЕСКОЕ ПРОГРАММНОЕ ОБЕСПЕЧЕНИЕ
Статистическое программное обеспечениеСтатистическое программное обеспечение SPSSВерсия 26.0Статистический анализ, независимые t-тесты, ANOVA, корреляционный анализ
Обучающий набор данныхKaggle ASAP DatasetВерсия 2012 годаОбучающий корпус (90% моделей AWE используют этот набор данных)
PYTHON ОПТИМИЗАЦИОННЫЕ И ОБУЧАЮЩИЕ БИБЛИОТЕКИ
Оптимизаторtorch.optim.AdamWPyTorch 1.13.1Оптимизация модели с регуляризацией затухания веса (λ=0.01), β 1=0.9, β 2=0,999, ε=1× 10-8
Потеря / Активацияtorch.nn.functionalPyTorch 1.13.1Активация сигмовидной формы, функции потерь, регуляризация выпадения
Загрузка данныхtorch.utils.data.DataLoaderPyTorch 1.13.1Прогрессивный пакетный размер (4→ 16), загрузка и пакетирование данных
ТокенизацияТрансформеры. AutoTokenizerТрансформеры 4.21.3Токенизация BERT WordPiece, предобработка текста
Загрузка моделейТрансформеры. AutoModelТрансформеры 4.21.3Предварительно обученная загрузка моделей для архитектур BERT и T5
Управление градиентомtorch.nn.utils.clip_grad_norm_PyTorch 1.13.1Градиентное клиппинг (порог: 1.0) для тренировки устойчивости
Расписание LRtorch.optim.lr_schedulerPyTorch 1.13.1Обучение планированию скорости с линейным затуханием и прогревом
Метрикиsklearn.metricsScikit-learn 1.1.3Корреляция Пирсона, расчёт MAE, RMSE для оценки
РЕАЛИЗАЦИЯ НЕЙРОННЫХ СЕТЕЙ PYTHON
Базовый классtorch.nn.ModulePyTorch 1.13.1Базовый класс для пользовательских архитектур нейронных сетей (Fluency & Модули корректности)
Линейные слоиtorch.nn.ЛинейныйPyTorch 1.13.1Реализация линейной регрессионной головки (768→ 512→ 256→ 128→ 1 нейрон)
Регуляризацияtorch.nn.Бросил учёбуPyTorch 1.13.1Регуляризация дропаута (0,1 для BERT, 0,3 для регрессионной головки)
Активацияtorch.nn.functional.sigmoidPyTorch 1.13.1Активация сигмовидного языка для нормализации балла беглости [0,1]
Активацияtorch.nn.functional.reluPyTorch 1.13.1Активация ReLU в регрессионных слоях для нелинейных преобразований
ТрансформаторТрансформеры. BertModelТрансформеры 4.21.312 слоёв трансформаторов с многоголовной самоконцентрацией для оценки беглости
Seq2SeqТрансформеры. T5For
ConditionalGeneration
Трансформеры 4.21.3Архитектура энкодер-декодера для коррекции грамматических ошибок
Функция потерьtorch.nn.MSELossPyTorch 1.13.1Функция потерь в среднем квадрате ошибки для обучения регрессии беглости
PYTHON — ОЦЕНКИ И МЕТРИКИ< СИЛЬНЫЕ>
Корреляцияscipy.stats.pearsonrSciPy 1.9.3Коэффициент корреляции Пирсона для согласования модели и человека
Метрика ошибкиsklearn.metrics.mean_absolute_errorScikit-learn 1.1.3Расчёт средней абсолютной ошибки (MAE) для точности прогнозирования
Метрика ошибкиsklearn.metrics.mean_squared_errorScikit-learn 1.1.3Ошибка корня среднего квадрата (RMSE) для оценки величины ошибки
Статистический тестscipy.stats.ttest_indSciPy 1.9.3Независимые выборки t-тестируют для статистического тестирования значимости
Корреляционная матрицаnumpy.corrcoefNumPy 1.23.5Расчёт корреляционной матрицы для надёжности между оценщиками
Корреляция данныхПанды. DataFrame.corrПанды 1.5.2Анализ корреляции данных и статистическая отчетность
Визуализацияmatplotlib.pyplotMatplotlib 3.6.2Визуализация результатов, графики корреляции, графики прогресса тренировок
Тепловая картаseaborn.heatmapСиборн 0.12.1Визуализация корреляционных матриц и представление статистических данных
<БИБЛИОТЕКИ СИЛЬНОЙ>PYTHON ОБРАБОТКИ ТЕКСТА И NLP
Обработка текстаre (Регулярные выражения)Встроенный Python 3.9+Сопоставление шаблонов текста, очистка и предобработка данных
Обработка конфигурацийjsonВстроенный Python 3.9+Обработка конфигурационных файлов, хранение параметров модели
СериализацияПиклВстроенный Python 3.9+Сериализация моделей и сохранение/загрузка контрольных точек
Отслеживание прогрессаTQDM4.64.1Индикаторы прогресса для обучающих циклов и обработки данных
ЛесозаготовкаЛесозаготовкаВстроенный Python 3.9+Логирование прогресса обучения, отслеживание ошибок и отладка
ВоспроизводимостьслучайныйВстроенный Python 3.9+Настройка случайного засея для воспроизводимых экспериментов
Файловая системаosВстроенный Python 3.9+Операции с файловой системой, управление путями модели
Парсинг CLIargparseВстроенный Python 3.9+Разбор аргументов в командной строке для обучающих конфигураций
<Сильные>КОММЕРЧЕСКИЕ ПЛАТФОРМЫ AWE / AES (Ссылка)
Коммерческая платформаPigai.orgКоммерческая платформа AWEОценка письма по китайскому английскому языку, автоматизированные системы обратной связи
Коммерческая платформаБинго ИнглишКоммерческая система AWEПоддержка изучения английского языка, развитие навыков письма
Образовательная платформаМой доступПлатформа для образовательного письмаОценка письма студентов и предоставление обратной связи
Система подсчёта очковE-рейтингАвтоматизированный система подсчёта очков ETSОценка эссе стандартизированных тестов, целостная оценка
Инструмент оценкиЯ-пишуИнструмент оценки письмаОценка академических текстов и диагностическая обратная связь
Практическая службаCriterionСервис практики написания ETSРазвитие навыков письма и автоматизированная обратная связь
Модель языка ИИChatGPTМодель языка OpenAIОбратная связь и оценка с помощью ИИ (упоминается в литературе)
DEEP LEARNING ARCHITECTURES (упоминается в литературе)
АрхитектураРекуррентные нейронные сети (RNN)Цай, 2019Последовательная обработка текста и mdash; Написание систем обратной связи и автоматизированная оценка
АрхитектураДолгосрочная краткосрочная память (LSTM)Jin и др., 2018Долгосрочное моделирование зависимостей и mdash; Автоматизированное оценивание эссе и анализ последовательности
АрхитектураСверточные нейронные сети (CNN)Донг и др., 2017Локальное распознавание паттернов и mdash; Классификация текста и извлечение признаков для оценки
АрхитектураТрансформер-LSTM гибридСюань, 2025Комбинированная контекстная и последовательная обработка — Автоматическое подсчёт очков и генерация обратной связи
АрхитектураВариационные автоэнкодеры (VAE)Кумар и др., 2024Генеративное моделирование и mdash; Улучшение навыков письма и персонализированная обратная связь
АрхитектураМногоагентные системыТомпсон и др., 2024Совместная обработка ИИ и mdash; Продвинутая помощь в написании (платформа AcademiCraft)
МеханизмМеханизмы вниманияДонг и др., 2017Самосознание и внимание с несколькими головами и mdash; улучшение производительности AES и понимания контекста
<сильные>ТРАДИЦИОННЫЕ МЕТОДЫ МАШИННОГО ОБУЧЕНИЯ (Ссылка)
Статистический методТеорема БайесаRudner & Лян, 2002Традиционный подход к машинному обучению и mdash; раннее развитие AES/AWE и вероятностное оценивание
Статистический методЛинейная регрессияPhandi и др., 2015Статистическое моделирование и mdash; Оценка письма на основе признаков и прогнозирование баллов
Метод обученияОбучение по предпочтениям рангаЧен и Он, 2013Методология на основе ранжирования и mdash; Сравнительное эссе оценивание и моделирование предпочтений
Языковая модельN-граммовые моделиСе и др., 2015Моделирование статистического языка и mdash; Коррекция грамматических ошибок и распознавание образов
АрхитектураАрхитектура кодировщик-декодераGe и др., 2018Моделирование последовательности в последовательность и mdash; Исправление грамматических ошибок и преобразование текста
<СИЛЬНЫЕ>СТАНДАРТЫ И РАМКИ ОЦЕНКИ
Стандарт оценкиОценка по письму IELTSАдаптация рубрики для оценки партитурыСтандартизированные критерии оценки беглости и корректности
Стандарт оценкиОценка письма TOEFLСтандарты академического письмаОценка компетентности и стандартизированное оценивание
Статистическая мераРазмер эффекта Коэна d0,2=малый, 0,5=средний, 0,8=большойОценка практической значимости для эффективности вмешательства
Показатель надёжностиНадёжность между оценщиками (κ)Беглость: 0.847 / Правильность: 0.823Коэффициент Каппы и mdash; Согласованность и валидация согласованности с человеческим оценщиком

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bitchener, J. Evidence in support of written corrective feedback. J Second Lang Writ. 17 (2), 102-118 (2008).
  2. Nusrat, A., Ashraf, F., Narcy-Combes, M. F. Effect of direct and indirect teacher feedback on accuracy of English writing: A quasi-experimental study among Pakistani undergraduate students. 3L Lang Linguist Lit. 25 (4), 84-98 (2019).
  3. Nusrat, A., Khan, S., Kashif, F., Fawad, R. Effect of teachers’ asynchronous e-feedback and synchronous oral feedback on English language learners’ writing accuracy. Front Educ. 7, 783684 (2022).
  4. Chen, B., Bao, L., Zhang, R., Zhang, J., Liu, F., Wang, S., et al. A multi-strategy computer-assisted EFL writing learning system with deep learning incorporated and its effects on learning: A writing feedback perspective. J Educ Comput Res. 61 (8), 60-102 (2024).
  5. Li, J., Link, S., Hegelheimer, V. Rethinking the role of automated writing evaluation (AWE) feedback in ESL writing instruction. J Second Lang Writ. 27, 1-18 (2015).
  6. Ellis, R. Explicit form-focused instruction and second language acquisition. The handbook of educational linguistics. , 437-455 (2008).
  7. Shamim, F. Trends, issues and challenges in English language education in Pakistan. Asia Pac J Educ. 28 (3), 235-249 (2008).
  8. Haider, G. An insight into difficulties faced by Pakistani student writers: Implications for teaching of writing. J Educ Soc Res. 2 (3), 17-27 (2012).
  9. Nawaz, M., Hussain, S. A., Bughio, F. A. Exploring the preferred corrective feedback and practiced corrective feedback among Pakistani ESL secondary school students and teachers in writing class: Matches and mismatches. Int J Lang Lit Transl. 6 (1), 31-45 (2023).
  10. Rudner, L. M., Liang, T. Automated essay scoring using Bayes theorem. J Technol Learn Assess. 1 (2), 1-22 (2002).
  11. Phandi, P., Chai, K. M. A., Ng, H. T. Flexible domain adaptation for automated essay scoring using correlated linear regression. , 431-439 (2015).
  12. Cai, C. Automatic essay scoring with recurrent neural network. , 1-7 (2019).
  13. Jin, C., He, B., Hui, K., Sun, L. TDNN: A two-stage deep neural network for prompt-independent automated essay scoring. 1, 1088-1097 (2018).
  14. Dong, F., Zhang, Y., Yang, J. Attention-based recurrent convolutional neural network for automatic essay scoring. CoNLL. , 153-162 (2017).
  15. Sharma, A., Kabra, A., Kapoor, R. Feature enhanced capsule networks for robust automatic essay scoring. , 365-380 (2021).
  16. Mim, F. S., Inoue, N., Reisert, P., Ouchi, H., Inui, K. Corruption is not all bad: Incorporating discourse structure into pre-training via corruption for essay scoring. IEEE ACM Trans Audio Speech Lang Process. 29, 2202-2215 (2021).
  17. Cummins, R., Rei, M. Neural multi-task learning in automated assessment. arXiv. , 1-9 (2018).
  18. Cao, Y., Jin, H., Wan, X., Yu, Z. Domain-adaptive neural automated essay scoring. , 1011-1020 (2020).
  19. Jiang, Z., Liu, M., Yin, Y., Yu, H., Cheng, Z., Gu, Q., et al. Learning from graph propagation via ordinal distillation for one-shot automated essay scoring. , 2347-2356 (2021).
  20. Li, X., Chen, M., Nie, J. Y. SEDNN: Shared and enhanced deep neural network model for cross-prompt automated essay scoring. Knowl Based Syst. 210, 106491 (2020).
  21. Beseiso, M., Alzubi, O. A., Rashaideh, H. A novel automated essay scoring approach for reliable higher educational assessments. J Comput High Educ. 33 (3), 727-746 (2021).
  22. Xie, W., Huang, P., Zhang, X., Hong, K., Huang, Q., Chen, B., et al. Chinese spelling check system based on an n-gram model. , 128-136 (2015).
  23. Brockett, C., Dolan, W. B., Gamon, M. Correcting ESL errors using phrasal SMT techniques. , 249 (2006).
  24. Zhang, S., Huang, H., Liu, J., Li, H. Spelling error correction with soft-masked BERT. , 882-890 (2020).
  25. Ge, T., Wei, F., Zhou, M. Reaching human-level performance in automatic grammatical error correction: An empirical study. arXiv. , 1-15 (2018).
  26. Zhao, W., Wang, L., Shen, K., Jia, R., Liu, J. Improving grammatical error correction via pre-training a copy-augmented architecture with unlabeled data. 1, 156-165 (2019).
  27. Shermis, M. D., Koch, C. M., Page, E. B., Keith, T. Z., Harrington, S. Trait ratings for automated essay grading. Educ Psychol Meas. 62 (1), 5-18 (2002).
  28. Mizumoto, A., Shintani, N., Sasaki, M., Teng, M. F. Testing the viability of ChatGPT as a companion in L2 writing accuracy assessment. Res Methods Appl Linguist. 3 (2), 100116 (2024).
  29. Ajabshir, Z. F., Ebadi, S. The effects of automatic writing evaluation and teacher-focused feedback on CALF measures and overall quality of L2 writing across different genres. Asian Pac J Second Foreign Lang Educ. 8 (1), 26 (2023).
  30. Almusharraf, N., Alotaibi, H. An error-analysis study from an EFL writing context: Human and automated essay scoring approaches. Tech Knowl Learn. 28 (3), 1015-1031 (2023).
  31. Chen, H., Pan, J. Computer or human: A comparative study of automated evaluation scoring and instructors' feedback on Chinese college students' English writing. Asian Pac J Second Foreign Lang Educ. 7 (1), 34 (2022).
  32. Liu, X., Zhang, Y., Chen, L. The transformative impact of AI-powered tools on academic writing: Perspectives of EFL university students. Lang Learn Technol. 28 (2), 78-95 (2024).
  33. Zhang, Q., Li, F. From process to product: Writing engagement and performance of EFL learners under computer-generated feedback instruction. System. 115, 102998 (2023).
  34. Kumar, S., Patel, R., Williams, T. Automated deep learning approaches in variational autoencoders (VAEs) for enhancing English writing skills. J Educ Technol Res. 45 (3), 234-251 (2024).
  35. Martinez, A., Rodriguez, P., Thompson, K. Neural automated writing evaluation with corrective feedback. Comput Linguist. 50 (1), 123-145 (2024).
  36. Thompson, J., Anderson, C., Davis, R. AcademiCraft: Transforming writing assistance for English for academic purposes with multi-agent system innovations. Artif Intell Educ. 12 (4), 445-462 (2024).
  37. Rodriguez, M., Kim, S., Brown, D. Technology-enhanced language learning in English language education: Performance analysis, core publications, and emerging trends. Appl Linguist Rev. 15 (2), 201-225 (2024).
  38. Xuan, Y. Transformer-LSTM models for automatic scoring and feedback in English writing assessment. IEEE Access. 13, 82084-82096 (2025).
  39. Anderson, R., Smith, K., Johnson, M. The impact of AI writing tools on the content and organization of students' writing: EFL teachers' perspective. Comput Educ. 195, 104712 (2023).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи