$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Всё программное обеспечение и инструменты, использованные в исследовании, перечислены в Таблице материалов.
Критерии оценки
Классификация оценки, принятая в данном исследовании, охватывает две основные области: беглость и корректность, которые включают все требования для комплексной оценки письма на английском языке как иностранном (EFL). Эти измерения предназначены для измерения ключевых моментов качества письма, которые помогают эффективно общаться и демонстрировать языковые навыки. Модуль «Беглость» измеряет естественность, выразительность и целостность в письме, измеряя плавность идей, а также то, насколько хорошо используются слова и структура предложений. Модуль корректности нацелен на точную грамматическую точность, механическую безупречность и соответствие стандартным английским конвенциям и, гипотетически, измеряет и считает ошибочность языка на нескольких уровнях. (см. Таблицу 1)
Определение задачи
В соответствии с условиями автоматизированной оценки письма учащихся, изучающих английский язык, настоящее исследование предлагает новую модель компьютерной системы оценки английского письма с использованием EG. По сравнению с предыдущими исследованиями, которые были ограничены сферой автоматизации систем оценки письменных текстов, предлагаемая система поможет устранить эти ограничения за счёт внедрения инновационных методов глубокого обучения, позволяющих пользователям определённый уровень лингвистического анализа, область модификаций и системный анализ обратной связи на основе обширной обработки данных. Руководствуясь двумя из самых значимых показателей сочинения — беглостью (насколько естественным, связным и выразительным является произведение) или правильностью (насколько правильно написан текст, наполненный грамматическими, механическими и языковыми ошибками), с отдельными компонентами нейронных сетей система двойной модели должна выполнять ряд оценок. Кроме того, он выявляет ошибки на нескольких языковых уровнях, рекомендует меры по исправлению и даёт обратную связь в виде списка, чтобы пользователи могли методично улучшать изучение языка. Для описания процесса вычисления системы автоматической оценки с помощью компьютера мы предлагаем следующую математическую модель в формулах (1)–(4) (см. Таблицу 2).
(1)
(2)
(3)
(4)
где: Итоговый балл = сводный балл по письменной оценке; w1 = вес, присваиваемый к баллу беглости речи; w2 = вес, присваиваемый баллу за правильность; Sf = балл беглости на основе BERT (нормализован до [0, 1]); Sc = экспоненциальная оценка корректности распада; λ = штраф за контрольную ошибку при постоянном затухании; σ(x) = логистическая сигмовидная активация; ErrorRatio = отношение ошибок к общему количеству токенов в тексте. Показатели беглости нормализуются до [0, 1] логистической сигмовидной функцией σ(x), тогда как экспоненциальное затухание используется для оценки правильности с целью наложения соответствующего штрафа на частоту ошибок.
Архитектура и проектирование системы
Архитектура системы использует двухмодельную систему с параллельной архитектурой обработки, при которой анализ входных эссе выполняется параллельно через параллельные пути оценки. Модули беглости и корректности, в свою очередь, дают соответствующие баллы, а итоговый составный балл — это взвешенное среднее по двум подоценкам. Модуль корректности также предлагает рекомендации по обнаружению и коррекции ошибок, помимо оценки (см. рисунок 1).
Модуль беглости
Беглость письма можно определить как характер или закономерность использования языка с точки зрения правильного выбора словарного запаса, разнообразия структуры предложений, синтаксической сложности, связности и т.д.4. Модели оценки беглости фиксируют передачу идей без заикания и неловкости, звуча примерно к нативистским тенденциям коммуникации. Традиционное измерение беглости основано на шкалах, что подчеркивает вопросы надёжности между участниками. Предлагаемая система преодолевает этот недостаток, поскольку включает нейронную сеть на основе BERT, которая автоматически индуцирует семантическую согласованность и лингвистическую естественность через глубокое ситуационное понимание. Это архитектурное решение было принято с учётом сильных сторон BERT, который оказался эффективен для выявления контекстуальных отношений и семантических закономерностей, необходимых для измерения беглости речи. Входные последовательности подаются в систему и проходят через 12 слоёв трансформаторов с многоголовной самоконцентрацией для выявления дальнодействующих зависимостей и контекстуальных отношений (см. рисунок 2).
Механизм внимания будет следующим:
(5)
Пусть Q, K и V — матрицы, представляющие запрос, ключ и значение соответственно, а d и k — размерности ключевых векторов. Вложение токена CLS — это сводное вложение, которое фиксирует общую семантическую когерентность всей входной последовательности.
Расчёт балла беглости выглядит следующим образом:
(6)
Где hCLS — это вложение токена BERT [CLS], аW reg — b reg — параметры регрессионной головки, а σ — сигмоидная активационная функция, нормализующая выход до [0, 1].
Модуль корректности
Оценка корректности сосредоточена на грамматической точности, механической точности и соблюдении стандартных английских норм. Это измерение охватывает технические аспекты письма, включая синтаксис, морфологию, пунктуацию и точность орфографии. Компонент корректности не только оценивает количество лингвистических ошибок, но и оценивает их влияние на общее качество текста. В отличие от оценки беглости, которая делает акцент на семантической когерентности и естественном потоке, модуль оценки корректности требует точного выявления ошибок и систематической коррекции. Модуль различает различные типы ошибок, оценивает степень их и предоставляет целенаправленные корректировки для поддержки улучшения обучения. Потеря корректности использует модель FLAN-T5, которая была доработана для грамматического обнаружения и коррекции ошибок. Этот выбор обусловлен возможностью преобразования текста в текст T5, которая позволяет системе не только находить неисправности, но и выполнять соответствующие исправления внутри одной системы. Система представляет собой форму энкодер-декодера, и текст подаётся в виде такого преобразования: (см. рисунок 3)
(7)
Элемент кодировщика генерирует контекстно-зависимые представления, которые отражают не только грамматические тенденции, но и потенциальные области неудач:
(8)
С помощью генерации соответствующих грамматических вариаций ошибок ошибок декодер генерирует исправленные последовательности:
(9)
Такой двухсторонний процесс позволяет системе осознавать контексты ошибок и понимать, как эти контексты должны быть исправлены, чтобы подсказки были семантически последовательными, но при этом сосредоточены на любых исправлениях в грамматике.
Количественная оценка ошибки и алгоритм подсчёта очков
Оценка точности сравнивала оригинальный текст с правильной версией письма, учитывая лингвистические ошибки и степень их серьёзности в зависимости от положения в тексте и вмешательства в смысл. Этот метод отражает различие между типами ошибок и их влиянием на понимание текста. Связь между частотой ошибок и низким качеством текста в системе оценок была подчёркивана логарифмически. Фундаментальный этап в сравнении токенов исходного и исправленного текста — это две степени сравнения, основанные на битовой технике выравнивания строк. Второй этап включает выявление и классификацию типов ошибок на основе известных лингвистических таксономий, которые различают грамматические ошибки (согласование подлежащего и глагола, согласованность времени и надёжность синтаксической структуры), механические (заглавные буквы, пунктуация и орфография) и ошибки употребления (выбор слов, идиоматическое выражение и уместность регистра). Третий этап — расчёт коэффициента ошибок на основе общей длины текста. Четвёртый этап использует алгоритм экспоненциального затухания, который преобразует отношение ошибок в напрямую интерпретируемые оценки корректности для приближения неаддитивной и нелинейной зависимости между частотой ошибок и качеством текста.
Математическая обработка процесса количественной оценки ошибок начинается с расчёта отношения установленных ошибок, что обеспечивает нормализованный коэффициент установки ошибок, что, в свою очередь, позволяет провести справедливое сравнение текстов разной длины:
(10)
(11)
Был установлен параметр калибровки 2,5 на эмпирической основе путём полной валидации с помощью экспертных суждений человека, чтобы функция оценки могла давать результаты, соответствующие человеческому пониманию в отношении снижения качества текста по мере увеличения частоты ошибок. Установка этого значения параметра таким образом гарантирует, что любой текст с низкой ошибкой (Error_Ratio < 0.1) имеет высокий балл корректности, так как он строго следует правилам стандартного английского; любой текст с умеренным уровнем ошибок (0.1 < Error_Ratio ≤ 0.3) имеет промежуточный балл корректности, указывающий на наличие лингвистических проблем, которые, тем не менее, не являются катастрофическими, И любой текст с высоким уровнем ошибок (Error_Ratio > 0,3) получил низкую точность из-за критических лингвистических вопросов, которые существенно влияют на возможность понимания.
Алгоритм оценки корректности для оценки корректности систематически учитывает все ошибки, обнаруженные и исправленные системой на основе T5, в качестве штрафных пунктов при расчёте конечного коэффициента ошибки. Механизм штрафного кредита, используемый для грамматических ошибок, представлен экспоненциальным снижением роста доли ошибок к высоким значениям, что означает, что качество текста очень низкое и достигает 100, когда коэффициент ошибок равен 0, то есть ошибок абсолютно не обнаружено. Это идеальное использование английских стандартных конвенций. Такое математическое отношение гарантирует, что код корректности имеет значительное различие во всем диапазоне уровней лингвистической компетентности и реагирует на небольшие последовательные продвижения, указывающие на реальные приобретения.
Наборы данных: корпус обучения и оценки
Обучающие данные достаточного качества и объёма имеют первостепенное значение для работы системы двойной модели. В текущем исследовании использовался хорошо спроектированный набор данных из учебников, написанных студентами, для разработки и оценки модели, которая была создана с помощью различных письменных заданий. Выборка включала 45 мужчин и 45 женщин из пакистанских университетов со средним возрастом 19 лет, изучающих «Функциональный английский» как обязательный курс. Каждый студент написал восемь эссе в течение восьми недель, включая предтестные, интервенционные эссе и послетестовые мероприятия. Студентам разрешалось написать от 400 до 450 слов для каждой письменной задачи. Статистика наборов данных предоставляет следующие характеристики:
70 500 слов
Средняя длина предложения: 15,7 слов (SD = 3,2)
Диапазон словарного запаса (соотношение типов и токенов): 0,64 (SD 0,08) Грамматическая плотность ошибок: 2,3 в 100 словах (SD = 1,1)
Обоснование и обеспечение качества данных выбранных данных
Выбранный набор данных был обусловлен несколькими важными факторами, которые позволили обеспечить глубину и актуальность исследовательской работы по автоматизированной оценке письма. Во-первых, студенты-экономисты были отобраны из-за характера, похожего на студентов EFL в пакистанском высшем образовании, что позволило представить более достоверные письменные образцы, отражающие реальные ситуации. Во-вторых, установление максимального и минимального потенциального диапазона слов — 400–450 слов — было обусловлено данными пилотных исследований, что этот диапазон достаточно лингвистически сложен, чтобы его надёжно анализировали машины, и при этом он оставался управляемым размером с точки зрения последовательных человеческих оценок. Каждое из произведений оценивалось тремя обученными преподавателями английского языка (надёжность между оценщиками κ = 0,847, размер беглости и 0,823, размер правильности) по стандартизированным 10-балльным шкалам оценки беглости и корректности. Обучение человеческих оценщиков было строгим и основывалось на разработанных критериях оценки для IELTS и TOEFL для письменных оценок. Данные состоят из аннотированного человеком набора данных, который может использоваться для обучения и валидации моделей для обучения на антропогенных данных.
Процедуры предварительной обработки и валидации данных
Набор данных систематически заранее обрабатывался и включал нормализацию текста, токенизацию текста с помощью токенизатора BERT WordPiece и проверку качества. Те, кто предоставил неполные работы и создал плагиат, не были включены для оценки целостности данных. Последние данные были случайным образом разделены на обучение (70%, n = 189), валидацию (15%, n = 41) и тестовые наборы (15%, n = 40) с помощью стратифицированной выборки для сбалансирования уровней владения и типом задач. Лингвистический анализ большого справочного корпуса, содержащего профессионально отредактированные академические тексты, статьи из газет и опубликованные эссе, объёмом примерно 50 миллионов слов. Этот корпус предоставляет языковые шаблоны, необходимые для проведения тестов беглости и помогает в процедурах обнаружения ошибок, сравнивая их со стандартным использованием. В референсном корпусе этапы перед предварительной обработкой и индексацией включают токенизацию, тегирование частями речи, синтаксический разбор и семантическую маркировку для эффективного доступа при оценке в реальном времени.
Стратегия обучения модели беглости
Предлагается система последовательной оптимизации для обучения данных для достижения беглости языка. Обучение использовало передовые функции, включая адаптивное планирование скорости обучения, прогрессивный размер партий и продвинутые методы регуляризации, которые предотвращают перенагонку по мере обучения, тем самым сохраняя эффективность модели в выявлении языковых закономерностей, указывающих на беглость языка. Скорость обучения составляет 5 × 10-4 с линейным графиком затухания, настроенным для обеспечения стабильности сходимости и отсутствия колебаний вокруг оптимальных значений параметров. Эта скорость обучения выбирается с помощью поиска по сетке в [1 x 10-6, 1 x 10-4], при этом 5 x 10-5 является наиболее подходящим компромиссом между скоростью сходимости и стабильностью. Реальная подготовка будет ограничена всего 3 эпохами — конфигурация, оптимизированная на основе эмпирических преимуществ отслеживания потерь валидации, чтобы предотвратить перенагон, не препятствуя достаточному обновлению параметров для повышения эффективности обучения. Раннее останавление механизмов с терпением 2 эпохи и минимальной дельтой 0,001 было проведено для предотвращения деградации.
Оптимизация выполняется оптимизатором AdamW, с упрощёнными вариантами, такими как β₁ = 0,9 (импульс, который экспоненциально регулирует затухание оценок первого момента), β₂ = 0,999 (оценка второго момента, которая экспоненциально управляет затуханием оценок второго момента) и ε = 1 × 10⁻8 (численный член устойчивости). Регуляризация снижения веса (λ = 0,01) предотвращает чрезмерное увеличение величин параметров, при этом это значение выбирается с помощью анализа эффективности валидации по всему диапазону [0,001, 0,1]. Комплексный мониторинг позволяет отслеживать различные метрики на протяжении всего обучения, чтобы обеспечить наилучшую производительность модели и избежать перенагона. В систему мониторинга входят:
Отслеживание потерь: Потери в обучении и валидации отслеживаются в каждой эпохе, и ранняя остановка происходит автоматически, когда потери валидации перестают улучшаться в течение двух последовательных эпох.
Показатели эффективности: Данные валидации используются для расчёта коэффициентов корреляции Пирсона между прогнозируемыми и фактическими баллами каждые 100 этапов обучения.
Градиентное измерение: Для обнаружения нулевых и взрывающихся градиентов контролируются нормы, и при норме градиента 1.0 применяется градиентное обрезывание.
Планирование скорости обучения: Фиксируется снижение скорости обучения на основе валидации (коэффициент = 0,5) при более чем одной эпохальной плато.
Связан с регуляризацией: Частота выброса (0,1 для BERT, 0,3 для регрессионной головки) была обнаружена методом систематической абляции. В процессе обучения используются несколько методов регуляризации, основанных на предотвращении перенагона: (1) регуляризация дропаута с использованием оптимизированных частот выбывания по типу слоя в сети, (2) снижение веса, как объяснялось выше, (3) ранняя остановка, определяемая результатами валидации, и (4) дополнение данных на основе перефразирования 15 процентов обучающих примеров с использованием методов обратного перевода. Контрольные точки самой эффективной модели сохранялись после каждой эпохи, а модели с наивысшими баллами выбирались на основе корреляционных показателей валидации. Функция потерь, используемая в части оценки беглости, — это средняя квадратическая ошибка (MSE), которая является основной целевой функцией регрессионной задачи прогнозирования непрерывных показателей беглости. Математически формулировка потерь задаётся следующим образом:
(12)
N — это общий размер обучающей выборки, y_pred, i — прогнозируемый балл беглости i-й выборки, а y_true, i — соответствующий базовый балл истинности, заданный экспертами-экспертами. Эта потеря очень полезна для предотвращения фактической ошибки предсказания квадратично, чтобы большие ошибки приводили к большому штрафу, и также дифференцируема. Механизм планирования скорости обучения очень продвинулся с двухфазным процессом и начинается с линейного этапа прогрева, за которым следует систематический процесс затухания для создания оптимальных характеристик сходимости. Это происходит на этапе разогрева, когда скорость обучения начинается с нуля и постепенно переходит к максимальной, после чего параметры модели оптимизируются относительно обучающего набора данных. Математическое выражение фазы разогрева выглядит так:
(13)
После фазы разогрева скорость обучения систематически снижается линейно, чтобы избежать перевышения оптимальных значений параметров, что приводит к устойчивой сходимости. Математически фаза распада выглядит так:
(14)
Где t — текущий тренировочный шаг, lr max — максимальная скорость обучения, достигнутая во время разминки, разминка — количество шагов, назначенных фазе разминки, а total — общее количество тренировочных шагов за все эпохи. Упомянутая процедура планирования обеспечивает агрессивное изучение модели на нижних уровнях и стабильность на уровнях сходимости.
Стратегия обучения модели корректности
Модель корректности основана на стратегии трансферного обучения с использованием предварительно обученной модели FLAN-T5 для использования всех доступных грамматических знаний по мере необходимости. Это было предназначено для изучения общего понимания языка, а также конкретной информации о ошибках, допущенных учащимися ESL. Используемый метод трансферного обучения использует контрольную точку pszemraj/flan-t5-large-grammar-synthesis в качестве базовой модели, с рядом заметных преимуществ с точки зрения корректности. Поскольку модель уже обучена и обладает высоким уровнем понимания языка, обученным в различных областях текста, она адаптируется к различным стилям письма и темам. В частности, была проведена грамматическая тонкая настройка на больших корректировочных наборах данных, охватывающих различные типы грамматических ошибок, как это встречается при написании на втором языке. Кроме того, контрольная точка включает мощные системы обнаружения ошибок, которые проверяются по различным типам ошибок (морфологическим, синтаксическим и семантическим), создавая идеальный стандарт сравнения с врождёнными параметрами коррекционного тестирования исследования.
Процесс адаптации доменной области отражает систематические изменения параметров, которые не изменяют общие возможности понимания языка предварительно обученной модели, но вводят специфические особенности решения задачи по оценке письма. Этот процесс адаптации имеет математическое вывод следующим образом:
(15)
Здесь предварительнообученное θ представляет параметры предварительно обученной модели, кодирующей общее понимание языка и грамматические знания, адомен Δθ — конкретные обновления параметров, полученные в ходе задачи по оценке целевого письма. Данно-специфичные обновления вычисляются с помощью градиентной оптимизации целевого набора данных, что гарантирует, что модель развивает специфическую чувствительность к типам ошибок, распространённым в EFL-письме, не нарушая её более широкие лингвистические возможности.
Эксперименты с сравнениями
Для подтверждения функциональности EG в качестве ключевого значения измерения предлагается коэффициент корреляции Пирсона, который определяет линейную связь между автоматизированными оценками и экспертизой человека. Коэффициент корреляции определяется формулой:
(16)
где xi представляет автоматические оценки, представляет человеческие оценки, а
и
— соответствующие средние. Коэффициент корреляции варьируется от −1 до 1, при этом значения около 1 указывают на сильную положительную связь между автоматизированной и человеческой оценкой.
(17)
(18)
(19)
Сравнение базовых моделей
Для оценки эффективности EG и демонстрации её превосходства над существующими методами проводятся углублённые сравнения с устоявшимся AWE и традиционными однометричными подходами. Эти исходные сравнения необходимы для подтверждения добавленной ценности архитектуры EG и демонстрации того, что интеграция беглости и оценки корректности обеспечивает измеримые улучшения по сравнению с подходами, сосредоточенными на отдельных измерениях в изоляции. Выбор базовых моделей охватывает четыре категории AWE, каждая из которых отражает определённую ориентацию на то, как следует оценивать письмо. В первом используется одна модель на базе BERT для оценки беглости. Эти модели используют архитектуры трансформаторов для оценки текстовых паттернов плавности и когерентности. Вторая категория, встроенная в традиционные лингвистические методологии, сосредоточена на системах на основе правил для обнаружения грамматических ошибок. Поэтому акцент оставался на правильности, игнорируя другие аспекты, связанные с качеством письма, такие как связность и содержание. Третья категория — это системы AWE, основанные на признаках, которые включают показатели лингвистической сложности — такие как вариационная длина предложений, разнообразие лексики и синтаксическая сложность для получения общих оценок качества. Четвёртая учитывает гибридные системы, сочетая различные поверхностные лингвистические особенности, часто используя ансамблевые методы или взвешенные средние. Эти модели не достигают уровня интегрированной сложности, достигнутого нейронными архитектурами EG. Производительность базовой модели оценивается по трём основным измерениям. Первый измеряет соответствие оценок, сгенерированных системой, с оценками обученных специалистов (преподавателей английского языка) с использованием стандартизированных рубрик. Второй определяет обобщаемость, определяя, остаётся ли производительность последовательной для трёх эссе с разной темой и сложностью. Третье измерение основано на предсказательной надёжности, оценивая точность и стабильность оценок с помощью статистических инструментов, таких как средняя абсолютная ошибка, ошибка среднего квадрата и анализ доверительных интервалов. В совокупности эти измерения создают надёжную основу для сравнения и подчёркивают превосходство систем EG, особенно в достижении большей точности и стабильности по сравнению с традиционными подходами.
Экспериментальные и контрольные группы
В этом исследовании приняли участие 90 студентов бакалавриата по экономике, которые изучали функциональный курс английского языка в двух целых классах. Данные собирались три раза: предтест, вмешательство и посттест, чтобы отслеживать прогресс в точности и беглости письма со временем. Это исследование на людях было одобрено Консультативным советом кафедры Университета COMSATS в Исламабаде, кампус Лахор, Пакистан. Участники столкнулись с двумя состояниями: традиционной человеческой обратной связью и компьютерной поддержкой. Контрольная группа состояла из 45 студентов, которые получали традиционную письменную обратную связь от обученного преподавателя английского языка. Участники получали письменную обратную связь о эссе студентов в виде целостных оценок, выявления ошибок и рекомендаций в виде комментариев преподавателя о том, как улучшить работу. Экспериментальная группа, в свою очередь, включала 45 учеников, которым обучались одинаково в классе, но письмо студентов дополнялось с помощью быстрой автоматической обратной связи, предоставляемой EG, которая предоставляла диагностическую информацию как по беглости, так и по корректности примерно в течение 30 секунд после подачи заявки.
Это исследование проводилось в течение 8 недель, при этом был проведён предварительный тест (Неделя 1) для определения начальной письменной способности испытуемых перед введением вмешательства. В течение шести недель участникам проводилась компьютерная обратная связь с семантическими маркерами NLP в экспериментальной группе и оценка учителями в контрольной группе. В конечном итоге посттест (на 8-й неделе) был проведён для понимания разницы между показателями точности и беглости до и после теста. Для получения схожих результатов в сопоставимости респондентов просили выполнять аналогичные письменные задачи в каждом периоде оценки, минимизируя потенциально смешивающие факторы, связанные с сложностью задачи и знакомостью содержания в тексте. Чтобы писательские задания соответствовали уровню сложности, а также чтобы установить достоверность содержания, подсказки были выбраны так, чтобы они были согласованы. Темы для эссе выбирались на основе того, что студенты охватывают различные предметные области, чтобы избежать эффекта практики и скуки у участников от необходимости выполнять одну и ту же задачу в течение длительного времени.
Во время предварительной стадии тестирования участников просили написать эссе объемом от 400 до 450 слов и рассказать об академических и карьерных целях. Это описательное задание основано на личном опыте и прогнозах на будущее, что подразумевает необходимость организовать текст, привести чёткие примеры и логично изложить личные цели и мотивацию. Задание по написанию интервенции было основано на различных темах, таких как рассказы о повседневной жизни, хобби, путешествиях, первом дне в университете, памятных днях жизни и моментах с лучшими друзьями. Посттестовый запрос был связан с темой «Влияние технологий на коммуникацию», а требуемая длина эссе составляла 400–450 слов.