Методическая статья

Динамическая письменная корректирующая обратная связь, интегрирующая доставку агентов ИИ для структурированной и итеративной поддержки эссе

DOI:

10.3791/71992

24 июля 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном исследовании оценивается STEP-DWCF-R (Структурированный, многоуровневый, основанный на доказательствах процесс динамической письменной корректирующей обратной связи с помощью роботизированного AI агента) для повышения эффективности письма IELTS с помощью многоэтапного ИИ и поддерживаемых преподавателями исправлений.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Автоматизированные системы обратной связи по написанию широко распространены, но большинство из них выдаёт статичные, фрагментированные комментарии, которые обеспечивают ограниченную поддержку для доработки. В данном исследовании оценивается фреймворк STEP-DWCF-R (Структурированный, многоуровневый, основанный на доказательствах процесс динамической письменной корректирующей обратной связи с помощью роботизированного AI агента), в котором обратная связь, сгенерированная ИИ, модерируемая учителем, передаётся через роботизированного агента ИИ в нескольких итеративных раундах в течение недельного цикла задач. В восьминедельном квазиэкспериментальном исследовании 32 учащихся EFL были рандомизированы либо по традиционной письменной корректирующей обратной связи (один раунд на задание), либо по STEP-DWCF-R. Обе группы завершили эссе по заданию IELTS 2 на начальном и после теста, которые были анонимизированы, рандомизированы и оценены двумя независимыми оценщиками (ICC = 0,86–0,93). Линейные модели с смешанными эффектами показали, что группа STEP-DWCF-R показала значительно большие улучшения общего диапазона (Δ = 1,03 против 0,31 полос) и по всем четырём аналитическим измерениям, при этом наибольшее улучшение наблюдалось в когерентности и когезии. Данные по процессу показали, что учащиеся STEP-DWCF-R в среднем выполняли 2,26 повторных раундов за задание, при этом количество ошибок линейно снижалось по разным раундам. Эти результаты свидетельствуют о том, что интегрированная структура STEP-DWCF-R, включающая обратную связь, генерируемую ИИ, модерацию учителей и итеративную доставку роботизированных агентов ИИ, связана с большим улучшением письма IELTS по сравнению с традиционной однораундовой обратной связью, что указывает на практические применения динамической обратной связи с использованием ИИ в контекстах EFL.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Письменная корректирующая обратная связь (WCF) остаётся центральным элементом педагогики второго письма. Данные показывают, что комплексная WCF со временем повышает точность учащихся и, в соответствии с практикой в классе, может сосуществовать с целенаправленными подходами, осуществимыми в аутентичныхконтекстах 1,2,3. Недавние исследования в классах показывают устойчивый рост точности и беглости благодаря устойчивому, всестороннему WCF. Исследования по сфере обратной связи предупреждают, что учителям следует стратегически ориентироваться на формы, а не оцениватьвсё как 4,5,6,7,8,9. Параллельно автоматизированная оценка письменных текстов (AWE) и автоматизированная письменная корректирующая обратная связь (AWCF) быстро развиваются. Результаты неоднозначны: некоторые исследования показывают улучшения в выполнении задач и грамматическом диапазоне с помощью программ в стиле AWCF или Criterion, в то время как другие не обнаруживают значительного преимущества по сравнению с обратной связью только от учителя или отмечают в основном локальные, поверхностные изменения. Чтобы отразить эту гетерогенность, мы сознательно триангуляируем несколько исследований AWCF, а не опираемся на один источник 10,11,12,13.

Также важны убеждения учащихся о том, кто даёт обратную связь: квазиэкспериментальная работа на воспринимаемом источнике показывает, что производительность и доверие могут измениться, когда идентичная обратная связь подаётся как «учитель» или «автоматизированная», что подчёркивает необходимость учитывать эффекты восприятия в проектахAWCF 14,15. Расширяя эту линию, новые исследования показывают, что образовательные роботы, благодаря своему воплощённому присутствию, могут также выступать в роли источников обратной связи, потенциально влияя на вовлечённость и доверие учащихся особымобразом 16.

Дополнительный направлений исследований является динамическая письменная корректирующая обратная связь (DWCF), которая делает акцент на частых, управляемых и комплексных циклах обратной связи с кодированием и быстрой пересмотром. Данные из различных источников свидетельствуют о том, что DWCF надёжно повышает точность (с частотным влиянием на беглость), хотя результаты могут различаться в зависимости от целей курса и численностиучащихся: 17, 18, 19, 20. Наконец, ранние исследования по обратной связи, опосредованной генеративным ИИ, показывают паритет обратной связи учителей о результатах письма и потенциальных преимуществах в сочетании с явным металингвистическим руководством, что стимулирует более тесную интеграцию человеческой и ИИ обратной связи в контекстах L221,22.

Для решения этих проблем мы предлагаем фреймворк STEP-DWCF-R (Structured, Tiered, Evidence-based Process for Dynamic Written Corrective Feedback with Robotic AI Agent) — новую многоступенчатую систему обратной связи DWCF, предназначенную для предоставления структурированной, итеративной и ориентированной на процесс поддержки письма. Наша система использует предиктивные и генеративные возможности Больших Языковых Моделей (LLM), предоставляемые через роботизированный интерфейс агента ИИ и модерацию преподавателей, чтобы сегментировать сложные задачи письма по управляемым категориям, предоставлять обратную связь через несколько раундов взаимодействия и оценивать её эффективность с использованием метрик, основанных на результатах и процессах. Преобразуя обратную связь в структурированный и интерактивный процесс, STEP-DWCF-R продвигает автоматизированную поддержку письма от статической коррекции ошибок к более увлекательной, воплощённой и ориентированной на обучение систему.

Наши взносы сосредоточены на трёх интегрированных авансах. Во-первых, мы предлагаем схему структурированного представления обратной связи, которая классифицирует ошибки (например, грамматику, когерентность), чтобы обратная связь LLM, передаваемая агентами роботизированного ИИ, была одновременно оперативной и педагогически интерпретируемой. Во-вторых, мы внедряем итеративный многоступенчатый процесс, который последовательно распределяет обратную связь по языку, структуре и рассуждению в нескольких раундах, чтобы снизить когнитивную нагрузку и углубить вовлечённость. В-третьих, мы расширяем оценку за пределы пост-баллов, включая процессно-ориентированные метрики, такие как снижение ошибок и принятие обратной связи, предоставляя более глубокий взгляд на влияние обучения. Рамки WCF представляют собой первые попытки систематизировать письменную корректирующую обратную связь в образовательных технологиях. Возникшие в области автоматизированной оценки написания (AWE) и автоматизированной оценки эссе (AES), эти системы делали упор на обнаружение ошибок и оценку квалификации13,14. Их вклад заключается в масштабируемости: тысячи учащихся могут получать обратную связь без узкого места, связанного с человеческой оценкой. Однако эти фреймворки обычно предоставляли статичные и фрагментированные комментарии, такие как проверки грамматики, лексические предложения или глобальные баллы, которые учащиеся с трудом превращали в значимыеисправления 23, 24, 25, 26.

Со временем исследования WCF эволюционировали и стали включать более технологически ориентированные подходы. Эти новые системы стремились охватить более широкие аспекты письма, используя вычислительныеметоды 13,21. В последнее время сфера деятельности расширилась ещё больше благодаря воплощённым технологиям, где образовательные роботы начали выступать в роли источника обратной связи в контекстах письма или репетиторства. Их физическое присутствие и интерактивные возможности вводят новые динамики доверия, вовлечённости и мотивации учащихся. Тем не менее, несмотря на эти изменения, доминирующая направленность WCF остаётся сосредоточенной нарезультатах 8,27: создание баллов или отдельных комментариев в одноразовом формате. С педагогической точки зрения эта ориентация несовпадает с формативной оценкой, где обратная связь должна сдерживать пересмотр между черновиками и поддерживать метакогнитивноевовлечённость 16,28,29,30,31. Таким образом, концептуальная граница WCF обнаруживает постоянный разрыв: обратная связь предоставляется, но не структурируется и не секвенируется для руководства процессами обучения.

В ответ на эти ограничения учёные начали изучать более динамичные подходы к написанию обратной связи. Ранние исследования подчеркнули важность итеративных циклов обратной связи, когда учащиеся повторяют несколько раз под руководством под руководством17,32. Также была предложена структурированная категоризация ошибок для улучшения интерпретации обратной связи и согласования её с педагогическимицелями 33,34. Понятие фреймворка DWCF консолидирует эти направления, встраивая три принципа проектирования: явные схемы ошибок, поэтапную и итеративную доставку, а также процессно-ориентированные метрикиоценки 19,35. Вместо того чтобы перегружать студентов множеством исправлений сразу, DWCF распределяет внимание по слоям письма — поверхностной точности, структурной связности и глубине аргументации — через последовательныеэтапы 17 и 33. Оценка выходит за рамки итоговых оценок и включает такие показатели процесса, как снижение уровней ошибок, принятие обратной связи и глубина редакции10, 19, 25. Несмотря на свои перспективы, практическое применение DWCF остаётся ограниченным, и большинство исследований не позволяют реализовать его в крупномасштабных, технологически опосредованныхконтекстах 10, 36, 37 (10, 36, 37). Этот разрыв подчёркивает необходимость фреймворков, которые не только теоретизируют DWCF, но и демонстрируют его осуществимость в реальных образовательных условиях. Рисунок 1 показывает более широкую теоретическую основу DWCF, предложенную в литературе. На рисунке даётся общее объяснение того, как динамическая письменная корректирующая обратная связь может работать на нескольких уровнях, включая как измеряемые результаты (например, точность, когерентность), так и теоретические, но неизмеренные конструкции в данном исследовании (например, снижение тревожности при письме, беглость и сложность). Она включена для теоретической ориентации, а не как прямая модель этого исследования. Элементы, соответствующие анализируемым здесь результатам и метрикам процессов, показаны на рисунке; Другие пути являются иллюстрационными и не были оценены в этом исследовании.

Появление LLM и мультимодальных систем предоставляет мощный способ для масштабного внедрения DWCF. LLM с возможностями нулевого и малого выстрела могут генерировать контекстно-зависимую обратную связь без обучения конкретнымзадачам 21,22. Недавние эксперименты указывают на их потенциал для директивной сегментации, поэтапного уточнения и генерации объяснений, что тесно соответствует принципам DWCF 13,37,38,39. Дополнительные исследования в области сотрудничества человека и ИИ показали, что итеративные циклы взаимодействия, адаптации и выборочного внедрения обратной связи ИИ могут улучшить как восприятие, так и качество доработок25,30. Когда эти процессы воплощаются в роботах, взаимодействие теоретически может стать мультимодальным — сочетая жест, голос и присутствие — что может дополнительно улучшить восприятие и мотивациюучащихся 40.

Основываясь на зоне ближайшего развития (ZPD)41, гипотезевхода 42 и теории приобретениянавыков 43, мы позиционируем STEP-DWCF-R как контроллер, связывающий поддержку учащихся, обработку ввода и развитие навыков. Конкретно, детализация, связанная с рубриками, своевременные консолидированные списки и многоэтапные циклы ИИ–, человека и робота, модерируемые учителями, работают на уровне интеграции, который опосредует ревизию и даёт наблюдаемые конечные точки, проанализированные здесь (IELTS Overall и TR/CC/LR/GRA; раунды, усваивание, постоянные ошибки, время). Такие конструкции, как снижение тревоги при написании, теоретизируются, но не измеряются в этом исследовании.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол был утверждён Этическим комитетом Школы начального образования колледжа дошкольного образования Шанжрао. Все участники были взрослыми (≥18 лет) и предоставили письменное информированное согласие до начала исследования.

1. Дизайн исследования

ПРИМЕЧАНИЕ: Из-за ограничений доступного класса по EFL (общее количество учащихся N = 32) участников рандомизировали на две группы по 16 человек. Этот размер выборки, хотя и невелик, был признан достаточным для пилотного исследования с учётом предварительного проектирования внутри субъекта и ожидаемых больших размеров эффекта на основе предыдущих исследованийDWCF 17,18,19,20.

  1. Рандомизуйте участников на две группы (n = по 16 каждая) с помощью простой рандомизации. Генерируйте последовательность распределения с помощью компьютерно сгенерированного списка случайных чисел. Скрытое распределение от преподавателя до завершения базовой оценки.
  2. Убедитесь, что обе группы обучаются одним и тем же преподавателем с одинаковыми материалами и часами контакта.
  3. Доставлять обратную связь либо через прямую человеческую коррекцию (WCF), либо через рабочий процесс STEP-DWCF-R, где обратная связь от ИИ и учителя подаётся через роботизированного агента ИИ.

2. Письменные задачи

  1. Проведите базовое эссе по заданию IELTS 2 на первой неделе в условиях экзамена (≥250 слов, 40 минут).
  2. Проведите шесть еженедельных письменных заданий (2–7 недели). Для каждой задачи:
    1. В WCF дайте один раунд человеческой обратной связи по эссе.
    2. В STEP-DWCF-R генерируйте обратную связь ИИ, модерируйте её с учителем-человеком и инструктуйте роботизированного агента ИИ интерактивно передавать обратную связь ученику.
    3. В STEP-DWCF-R повторяйте цикл обратной связи STEP-DWCF-R в течение 2–3 раундов до завершения правки.
  3. Проведите эссе по заданию IELTS Task 2 после теста на 8-й неделе в тех же условиях экзамена. Следуйте одному и тому же недельному календарю для каждой задачи в обеих группах. Доставьте обратную связь первого раунда в течение 24 часов после подачи черновика в STEP-DWCF-R. Требуйте от учащихся повторять и повторно сдавать в течение 48 часов. Следуйте тому же расписанию для следующих раундов и завершайте все циклы в течение недельного окна.

3. Рабочий процесс обратной связи

  1. Обрабатывайте каждый черновик обучающегося с помощью GPT-5 API (модель = "gpt-5", температура = 0,7, max_output_tokens = 2048), чтобы получить детализированную обратную связь по четырём фиксированным категориям: грамматика, словарный запас, организация и рассуждение. Точные системные запросы и схема вывода JSON предоставляются в открытом репозитории (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, функции build_prompt() и normalize_reasoning()).
  2. Модерировать обратную связь, сгенерированную ИИ, согласно следующим критериям: удалять ложные срабатывания или неточные комментарии; добавить пропущенные критические вопросы, соответствующие критерии IELTS; убедитесь, что комментарии были практичными и вдохновляющими; и сохранять согласованность с четырёхкатегорийной схемой. Логируйте решения о модерации вручную.
  3. Сохраните модерируемую обратную связь в формате JSON и загрузите её в интерфейс роботизированного AI-агента (лёгкое веб-приложение Flask).
  4. Подавайте обратную связь через веб-интерфейс. Отображайте структурированные таблицы для каждой категории (резюме, вопросы и советы по редактированию). Записывайте подтверждения учащихся и запросы на разъяснения через системные журналы. Инструктировать учащихся пересматривать и повторно сдавать свои черновики. Повторяйте цикл до трёх раз за задачу.
  5. Проверка и устранение неполадок.
    1. Проверьте успешную генерацию обратной связи ИИ, убедившись, что результат является действительным JSON, содержащим все четыре необходимые категории: грамматику, словарный запас, организацию и рассуждение. Подтвердите завершение модерации учителей, убедившись, что ложные срабатывания удалены, добавлены отсутствующие проблемы и модерируемый JSON-файл сохранен.
    2. Загрузите модерируемый JSON-файл в интерфейс роботизированного AI-агента на базе Flask через конечную точку загрузки. Подтвердите успешную загрузку через сообщение подтверждения интерфейса и запись в журнале базы данных. Автоматически фиксируйте повторные отправки обучающихся через журналы подачи форм.
    3. Обрабатывайте несоответствующие результаты ИИ (например, искажённый JSON, отсутствующие категории или неточный обратный связь) с помощью функций ensure_json() и normalize_reasoning(). Регенерируйте выходные данные API с корректированными параметрами запросов по мере необходимости. При необходимости при необходимости корректируйте JSON во время модерации учителя, чтобы убедиться, что все четыре категории присутствуют перед загрузкой.
      ПРИМЕЧАНИЕ: Примеры сырой обратной связи от ИИ, версий, модерируемых учителем, и результатов интерфейса доступны в репозитории (данные/папки и блокноты/).

4. Измерение результатов

  1. Определите основной результат как изменение общего балла IELTS (с 1 по 8-ю неделю).
  2. Определите вторичные результаты как изменения в ответе на задачу, когерентности и когезии, лексическом ресурсе, а также грамматическом диапазоне и точности.
  3. Назначьте двух независимых оценщиков с опытом оценки IELTS Task 2 для оценки всех эссе. Удалите имена и идентификаторы групп из всех эссе. Рандомизируйте порядок эссе и слепые оценщики по групповому заданию и времени. Используйте один и тот же запрос IELTS Task 2 как для базовой недели 1, так и для недели 8 после теста. Разрешайте разногласия по оценке более 0,5 диапазонов путем обсуждения до достижения консенсуса. Оценить надёжность между оценщиками с помощью коэффициента корреляции внутриклассовых уровней средних измерений (ICC[2,2]).

5. Измерение процесса

  1. Фиксируйте количество раундов повторения на задачу.
  2. Запись восприятия обратной связи (принятой, изменённой, отклонённой) учащимися.
  3. Отслеживайте постоянные ошибки между циклами.
  4. Записывайте время обратной связи от учителей, время доставки робота и время повторения учащихся.

6. Анализ данных

  1. Подгонять линейные модели смешанных эффектов с взаимодействием группы, времени и группы × времени.
  2. Применяйте обобщённые смешанные эффекты для измерений процесса.
  3. Отчёт о размерах эффектов, 95% доверительных интервалах и скорректированных p-значениях.
  4. Проводите проверки надёжности с помощью ANCOVA, моделей, специфичных для оценок, и надежных SE.

7. Доступность кода

Весь код, подсказки, схемы JSON и примерные файлы реализации, необходимые для воспроизведения системы STEP-DWCF-R, доступны на https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эксперименты и анализ

Все 32 учащихся предоставили исходные данные. Данные после тестирования были доступны для 16 учащихся в каждой группе (WCF и STEP-DWCF-R; Рисунок 2). Хронология исследования и показатели представлены на рисунке 3, а сквозная обратная связь показана на рисунке 4. Параметры экспериментальной настройки и реализации нашей системы ИИ приведены в Таблице 1. Анализы проходили по заранее заданному плану с намерением лечения. Сначала мы оцениваем исходную эквивалентность (Таблица 2), затем сообщаем первичный результат (Рисунок 5 и Таблица 3), затем вторичные результаты (Таблица 4) с проверками надёжности и надёжности.

Базовая эквивалентность

На начальном уровне (1-я неделя) группы были описательно схожи по заранее заданным ковариатам, включая демографию и результаты написания IELTS до получения обратной связи (Таблица 2). Индивидуальные баллы компонентов IELTS присваиваются по шагам 0,5 диапазона, тогда как таблица показывает групповые средние значения. Общие средние значения первой недели (WCF = 5.625, STEP-DWCF-R = 5.500) вычислены из тех же массивов, что и для генерации рисунка 5. Мы не проводим тесты гипотез на исходном уровне; любой остаточный дисбаланс устраняется с помощью предварительного пост-дизайна и термина Group × Time в модели смешанных эффектов, а посттестовое сравнение с учётом исходного уровня публикуется в разделе Протокол.

Исход первичных выборов

Рисунок 5 обобщает изменения до и после тестирования, а таблицы 3 и 5 отражают оценки модели и достижения после тестирования. На исходном уровне (неделя 1) групповые средние показатели составляли 5,625 для WCF и 5,500 для STEP-DWCF-R, что дало незначимую разницу групп в −0,125 полос (SE = 0,133, t = − 0,939, df = 29,90, p = 0,355, 95% CI [−0,397, 0,147]). Исходная линия в Таблице 3, таким образом, оценивает среднее значение WCF за первую неделю на уровне 5,625 с 95% ДИ [5,419, 5,831] (SE = 0,097, df = 15). С первой по восьмую неделю WCF улучшился на 0,3125 диапазона (SE = 0,128, t = 2,44, df = 15, p = 0,028, 95% CI [0,039, 0,586]; стандартизированный внутригрупповой эффект dz = 0,61). STEP-DWCF-R улучшился на 1,0313 полос (SE = 0,140, t = 7,34, df = 15, p = 2,44 × 10−6, 95% CI [0,732, 1,331]; dz = 1,84). Линейный контраст смешанных эффектов для взаимодействия группы × времени — то есть разница в различиях — составлял 0,7188 полос (SE = 0,190, t = 3,78, df = 29,75, p = 0,0007, 95% CI [0,330, 1,107]; Таблица 3), указывая на более значительные приросты в рамках STEP-DWCF-R. После тестирования (8-я неделя) оценённые предельные средние были благоприятны для STEP-DWCF-R на 0,5938 полос (тест Уэлча по групповым средним: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, 95% CI [0,359, 0,829]). В соответствии с этим, таблица достижений (Таблица 5) показывает, что на 8-й неделе 13% учащихся WCF достигли общего ≥ 6,5, а 0% — ≥ 7,0 (счёты 2/16 и 0/16), тогда как 81% учащихся STEP-DWCF-R достигли ≥ 6,5, а 25% — ≥ 7,0 (подсчёты 13/16 и 4/16). Таблица 3 отражает соответствующие оценки фиксированного эффекта и их неопределённость.

Результаты на уровне измерений

Таблица 4 суммирует изменения до публикации по четырём измерениям задачи 2. Ответ на задачи (TR) показал прирост Δ = 0,25 диапазона при WCF против Δ = 0,95 при STEP-DWCF-R, что дало ΔΔ = 0,70 при 95% ДИ [0,28, 1,12] и скорректированном по Хольму p = 0,006. Когерентность и когезия (CC) демонстрировали наибольший контраст: WCF Δ = 0,30, STEP-DWCF-R Δ = 1,15, следовательно, ΔΔ = 0,85 (95% CI [0,44, 1,26], adj-p = 0,002). Лексический ресурс (LR) следовал той же схеме: WCF Δ = 0,35 и STEP-DWCF-R Δ = 0,95, давая ΔΔ = 0,60 (95% CI [0,18, 1,02], adj-p = 0,012). Грамматический диапазон и точность (GRA) улучшены на Δ = 0,25 в WCF и Δ = 0,97 в STEP-DWCF-R; полученный ΔΔ = 0,72 имел 95% ДИ [0,31, 1,13] при adj-p = 0,004. По всем четырём измерениям группово×временные контрасты предпочитали STEP-DWCF-R после корректировки Хольма–Бонферрони.

Доказательства процесса

Рисунки 6 и 7 визуализируют результаты основного процесса. В течение 2–7 недель STEP-DWCF-R в среднем выполнил 2,26 повторных раундов на задание (95% CI [2,17, 2,35]; n = 96), тогда как WCF составлял 1,00 раунда для всех заданий (n = 96). Средняя разница составила 1,26 патрона (95% ДИ [1,17, 1,35]); тест Манна–Уитни подтвердил разделение распределений (U = 9216, z = 11,97, p < 10−30). В рамках STEP-DWCF-R средний уровень ошибок снижался по раунду: 13,78 в первом раунде (95% ДИ [13,02, 14,54]; n = 96), 8,94 на втором раунде (95% ДИ [8,42, 9,46]; n = 96) и 6,16 на третьем раунде (95% ДИ [5,20, 7,12]; n = 25). Линейная тенденция, соответствующая наблюдениям за раунд, оценивала снижение на 4,14 ошибки за выстрел (95% ДИ [3,51, 4,78] в абсолютной величине; p < 10−12). Показатели обратной связи и времени выполнения задачи не кодируются на рисунках 6 и 7 , поэтому они представлены в таблице 7.

Надёжность и надёжность

Соглашение между оценщиками для эссе 1-й и 8-й недель было хорошим или отличным. Два обученных оценщика оценивали все сценарии независимо и были ослеплены к группе и времени; используя коэффициент корреляции внутриклассов средних измерений (ICC[2,2]) по средним оценщикам, надёжность варьировалась от 0,86 до 0,93 по Total, а по четырём измерениям, а все нижние 95% пределы доверия превышали 0,80 (Таблица 6). Диагностические проверки для первичной модели смешанных эффектов показали примерно нормальные остатки без материальной гетероскедастичности, а модели, подогнанные к сводкам процессов на уровне задач, показали дисперсию, близкую к единице. Анализ чувствительности на основе того же набора данных за 1/8-ю неделю дал последовательные выводы: линейная регрессия с сравнением групп после тестирования с корректировкой исходных баллов оценила скорректированную разницу между группами в 0,575 полос на 8-й неделе (95% ДИ [0,336, 0,814], p = 3,15 × 10−5), а также сравнительно-специфическая смешанная модель, включающая случайный эффект для оценщика и использованные неусредненные баллы, дала оценку группы × времени в 0,72 диапазона (95% ДИ [0,33, 1.11], p = 0.0007), в соответствии с Таблицей 3. Результаты оставались без изменений при использовании устойчивых стандартных ошибок и когда анализ ограничивался полными случаями, что подтверждает вывод о том, что STEP-DWCF-R даёт больший прирост до публикации, чем WCF.

Качественные результаты

Для качественного анализа мы изучили трассы повторения STEP-DWCF-R по всем шести задачам и письменные размышления по итогам курса от 16 участников группы STEP-DWCF-R. Два кодировщика независимо кодировали материалы, используя сфокусированную дедуктивную структуру, основанную на четырёх категориях обратной связи (грамматика, словарный запас, организация, рассуждение) и обоснования освоения. Межкодировочное соглашение было существенным с каппой Коэна в 0,78, и разногласия решались путем обсуждения.

Анализ выявил пять ключевых тем: воспринимание проходило поэтапно, когда учащиеся определяли поверхностные особенности перед организацией и рассуждением; Отдельные материалы, связанные с рубриками, были более практичными и чаще применяемыми, чем повествовательные предложения; Комплементарность ИИ и учителей формировала приоритет, при этом перекрывающиеся сигналы увеличивали концентрацию, а модерация учителей разрешала конфликты; Преимущества достигли пика на ранних этапах с повторным использованием шаблонов организации и лексическими шаблонами в новых запросах; а учащиеся адаптировали стратегии между задачами. Эти темы формируют динамику процесса, рассматриваемую в разделе доказательств процесса. Также были зафиксированы обратная связь, постоянные ошибки и измерения времени выполнения задач. Краткое описание этих дополнительных показателей процесса приведено в таблице 7.

Интерпретация репрезентативных результатов

В совокупности данные результатов и процессов показывают, что фреймворк STEP-DWCF-R связан с лучшим улучшением письма IELTS по сравнению с традиционной однораундовой обратной связью. Первичный результат показывает разницу различий между группами в 0,72 диапазона, при этом группа STEP-DWCF-R улучшилась на 1,03 полосы в целом по сравнению с 0,31 полосами в группе WCF. Это преимущество было неизменным по всем четырём аналитическим измерениям, при этом наибольший контраст между когерентностью и когезией составлял 0,85 диапазона, что свидетельствует о том, что структурированная, связанная рубриками и многоступенчатая обратная связь, особенно способствовала развитию организации. Процессуальные данные также указывают на то, что итеративное взаимодействие лежит в основе этого преимущества. Учащиеся STEP-DWCF-R проходили в среднем 2,26 повторных раунда за задание, а количество ошибок линейно снижалось примерно на 4,1 ошибки за раунд. Например, репрезентативный цикл рабочих процессов включал GPT-5, генерирующий структурированную обратную связь JSON по четырём категориям, затем модерацию учителей для устранения ложных срабатываний и повышения оперативности, а затем передачу через интерфейс роботизированного AI-агента для многоэтапной проверки учащихся. Эти результаты подтверждают осуществимость и потенциальную эффективность интегрированного многокомпонентного рабочего процесса, объединяющего обратную связь, генерируемую ИИ, модерацию учителей и итеративную доставку роботизированных агентов ИИ, но их не следует рассматривать как доказательство какого-либо отдельного компонента в изоляции. Дисбаланс дозы 2–3 раунда против одного и скромный размер выборки в 32 означает, что наблюдаемые улучшения отражают совокупный эффект увеличения возможностей для редактирования и структурированной обратной связи. Эти результаты следует рассматривать как многообещающие пилотные доказательства, ожидающие подтверждения в более крупных, контролируемых компонентами исследованиях.

figure-results-1
Рисунок 1. Теоретическая основа DWCF (динамическая письменная корректирующая обратная связь). Рисунок даёт более широкое объяснение того, как может функционировать DWCF; Она включена для ориентации, а не как прямая модель этого исследования. Элементы, соответствующие анализируемым здесь результатам и метрикам процессов, показаны на рисунке; Другие пути являются показателями и не были оценены. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-2
Рисунок 2. Схема потока участников CONSORT. Тридцать два учащихся были оценены на соответствие; никто из них не был исключён. Все участники дали согласие и затем были рандомизированы в соотношении 1:1 либо с группой WCF (n = 16), либо с группой DWCF (n = 16). Все рандомизированные участники получили выделенное вмешательство; Потери из-за последующих выпусков или прекращения производства не было, и все 32 были включены в итоговый анализ. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-3
Рисунок 3. Хронология изучения и показатели. Испытание длилось 8 недель: на W1 участники выполнили базовое задание IELTS 2 и получали оценки; шесть еженедельных письменных заданий проводились с W2 по W7 (Задача 1–Задача 6), с групповой обратной связью (WCF или DWCF) и редактированием после каждой задачи. В период W2–W7 для каждой задачи регистрировались показатели процесса, включая раунды повторения, обратную связь, уровень постоянных ошибок и время выполнения задачи. На W8 была проведена и оценена послетестовая задача IELTS 2. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-4
Рисунок 4. Сквозная обратная связь. Учащиеся составляют прокторный первоначальный вариант, затем получают групповые обратные связи: WCF (один раунд обратной связи с людьми) или STEP-DWCF-R (обратная связь, генерируемая ИИ с модерацией учителей, передаваемая через роботизированных агентов ИИ, включающая 2–3 итеративных раунда). Учащиеся проходят повторные раунды соответственно. Результат — балл диапазона IELTS Task 2; Показатели процесса включают количество раундов, воспринимаемую обратную связь (принято/изменено/отклонено), уровень постоянных ошибок и время выполнения задачи. Система фиксирует идентификаторы на уровне предметов, категорию/степень тяжести, источник (ИИ против человека и робота), действия модерации и статус принятия предметов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-5
Рисунок 5. Изменение общего диапазона IELTS с 1-й на 8-й недели по группам. Точки дают оценочные средние групповые значения с 95% доверительными интервалами, а траектории указывают на больший прирост при STEP-DWCF-R. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

figure-results-6
Рисунок 6. Повторные раунды по задачам по группам (недели 2–7). Точки данных представляют собой индивидуальные раунды повторения задач для групп WCF (синий) и STEP-DWCF-R (оранжевый). Горизонтальные линии и полоски ошибок показывают групповые средние значения с 95% доверительными интервалами. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-7
Рисунок 7. Средние ошибки на один раунд в рамках STEP-DWCF-R с 95% ДИ. Очки показывают средний уровень ошибок в каждом раунде обратной связи (раунд 1, раунд 2, раунд 3), а вертикальные линии представляют собой 95% доверительные интервалы (CI). Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

КомпонентТехнические характеристики
Аппаратное обеспечениеПК с ядром Intel(R) 12-го поколения i7-12700H (2.30 ГГц), 32 ГБ ОПЕРАТИВНОЙ ПАМЯТИ, ВИДЕОКАРТОЙ NVIDIA RTX 3080Ti (16 ГГБ)
Операционная системаWindows 11
БэкендFlask~2.1 (Python~3.10)
ФронтендJinja2 server-rendered templates
Модели ИИAPI OpenAI GPT-5 (для генерации обратной связи), постобработка на основе схем
Планировщик обратной связиПользовательский контроллер для управления многоступенчатой обратной связью (3 цикла)
Схема ошибокГрамматика, словарный запас, организация, рассуждение
Контроль версийGitHub
ЛесозаготовкаАвтоматический журнал подач, обратной связи и правок для анализа

Таблица 1: Параметры экспериментальной настройки и реализации. Технические характеристики системы обратной связи ИИ, включая конфигурацию аппаратного обеспечения, операционную систему, бэкенд и фронтенд-фреймворки, настройки модели ИИ, планировщик обратной связи, категории схем ошибок, контроль версий и инфраструктуру логирования.

ПеременнаяWCF (n=16)STEP-DWCF-R (n=16)
Возраст (год), средний (SD)20.9 (1.5)21.1 (1.6)
Женщины, n (%)9 (56%)8 (50%)
Предшествующая подготовка к IELTS (да), n (%)7 (44%)6 (38%)
Годы предыдущего преподавания письма3.1 (1.2)3.2 (1.1)
Базовый IELTS Overall (группа)5.625 (0.387)5.500 (0.365)
Baseline TR (группа)5.56 (0.50)5.50 (0.50)
Baseline CC (группа)5.62 (0.49)5.53 (0.49)
Baseline LR (группа)5.60 (0.46)5.52 (0.46)
Baseline GRA (группа)5.56 (0.48)5.49 (0.45)

Таблица 2: Исходные характеристики участников по группам (Неделя 1). Демографические переменные и предтестовая Международная система тестирования английского языка (IELTS) Задача 2 по написанию для групп WCF и STEP-DWCF-R. Значения средние (стандартное отклонение) или n (%).

Фиксированный эффектОценкаSEdftp95% ДИ
Перехват (WCF, неделя~1)5.6250.0971558.1<.001[5.419, 5.831]
Группа (STEP-DWCF-R против WCF)-0.1250.13329.9-0.939.355[-0.397, 0.147]
Время (неделя~8 против недели~1)0.31250.128152.44.028[0.039, 0.586]
Группа × время0.71880.1929.753.78.0007[0.330, 1.107]

Таблица 3: Линейная модель смешанных эффектов для общего диапазона IELTS по результатам 1/8-й недели. Оценки с фиксированным эффектом, стандартные ошибки (SE), степени свободы (df), t-значения, p-значения и 95% доверительные интервалы (CI) для группового взаимодействия × времени и модельных терминов.

РазмерностьWCF Δ (группы)STEP-DWCF-R Δ (диапазоны)ΔΔ (95% ДИ)ADJ-P
Ответ на задачи (TR)0.250.950.70 (0.28, 1.12).006
Когерентность и сплочённость (CC)0.31.150.85 (0.44, 1.26).002
Лексический ресурс (LR)0.350.950.60 (0.18, 1.02).012
Грамматический диапазон и точность (GRA)0.250.970.72 (0.31, 1.13).004

Таблица 4: Результаты на уровне измерений (Задача 2): изменения до пост-после и различия между группами. Изменения до публикации (Δ) и различия в различиях (ΔΔ) с 95% доверительными интервалами (CI) и скорректированными по Холму p-значениями для ответа на задачу (TR), когерентности и когезии (CC), лексического ресурса (LR) и грамматического диапазона и точности (GRA).

ПорогWCF (%)STEP-DWCF-R (%)
В целом ≥ 6,51381
В целом ≥ 7.0025

Таблица 5: Посттестовое достижение диапазона (8-я неделя). Доля учащихся в группах WCF и STEP-DWCF-R, достигших IELTS Общий порог диапазона не менее 6,5 и не менее 7,0.

РезультатICC95% ДИ
В целом0.91[0.86, 0.94]
Ответ на задачи (TR)0.88[0.82, 0.92]
Когерентность и сплочённость (CC)0.9[0.85, 0.94]
Лексический ресурс (LR)0.89[0.83, 0.93]
Грамматический диапазон и точность (GRA)0.87[0.80, 0.91]

Таблица 6: Надёжность между оценщиками для результатов IELTS. Два слепых оценщика по N = 64 эссе (вместе, 1-я и 8-я недели). Среднее измеряет внутриклассовые коэффициенты корреляции (ICC[2,2]) с 95% доверительными интервалами (CI) для общих и размерных оценок.

МераГруппа WCFГруппа STEP-DWCF-R
Повторные раунды на задание12.26
Скорость принятия обратной связи (принята или изменена, %)68.582.3
Постоянный уровень ошибок после финального раунда (%)67.445.6
Время модерации учителя (минимум на задание)23.513.8
Время доставки агента ИИ (минимум на задачу)3.9
Время повторения учащимся (минимум на задание)44.871.2
Общее время на обратную связь + редактирование (минимум/задача)68.388.9

Таблица 7: Средние значения по 96 задачам (6 заданий × 16 учащихся). Уровень поглощения и устойчивых ошибок рассчитывался на уровне точек обратной связи. Временные показатели фиксировались через журналы учителей и системные временные метки. Время доставки агентов ИИ не применяется к группе WCF.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании сравнивали STEP-DWCF-R — многокомпонентную динамическую структуру для корректирующей обратной связи с роботизированным агентом ИИ — с однораундовым WCF в восьминедельном курсе IELTS. STEP-DWCF-R обеспечил более значительные предпостовые приросты в общем диапазоне и по TR, CC, LR и GRA. Учащиеся по STEP-DWCF-R также прошли больше повторных раундов и показали более быстрое снижение ошибок, при этом модели оценивали снижение примерно на 4,1 ошибки за раунд. Наибольшее улучшение наблюдалось в когерентности и когезии (ΔΔ = 0,85), что свидетельствует о том, что структурированная, связанная с рубриками обратная связь способствует более высокому уровню организации и точности. Эти результаты совпадают с предыдущими исследованиями DWCF, показывающими, что итеративная, всесторонняя обратная связь со временем улучшает точность письма 14,15,16,17.

Рабочий процесс STEP-DWCF-R включает три критически важных этапа. Во-первых, система ИИ генерирует детализированную обратную связь по четырём категориям (грамматика, словарь, организация, рассуждение) с использованием ограниченной JSON-схемы и стандартизированного системного запроса. Во-вторых, учитель модерирует результат, чтобы убрать ложноположительные результаты, добавить пропущенные критические вопросы, соответствующие критериям IELTS, обеспечить практическую и поощряющую формулировку, а также поддерживать согласованность с четырёхкатегорийной схемой. Этот этап модерации служит основным механизмом устранения неполадок, исправляя галлюцинации ИИ или чрезмерные оценки, которые в противном случае могли бы перегрузить учащихся. Примечательно, что время модерации учителя на задание было ниже в STEP-DWCF-R, чем в WCF (13,8 мин против 23,5 мин), поскольку ИИ генерировал первоначальную структурированную обратную связь, а учитель только модерировал её. В-третьих, модерируемая обратная связь предоставляется через веб-интерфейс роботизированного AI-агента, который фиксирует подтверждения и повторные отзывы учащихся в нескольких раундах.

По сравнению с существующими подходами, STEP-DWCF-R решает различные ограничения. Обычный однораундовый WCF остаётся ограниченным временем инструктора и обычно предоставляет ограниченные возможности для длительного повторения. Автоматизированные инструменты оценки письменных текстов обеспечивают масштабируемость, но часто дают статичные, фрагментированные комментарии, которые учащиеся с трудом могут превратить в содержательныеправки 20, 21, 22. Ранние исследования DWCF показали эффективность многораундовых циклов обратной связи, однако их зависимость от корректировок, написанных инструктором, вызывала опасения по осуществимости в крупныхклассах 14, 15, 16, 17. Недавние исследования генеративной обратной связи ИИ показывают паритет с отзывами учителей по результатам написания, но без структурированной модерации или итеративной подачи18,19. STEP-DWCF-R сочетает масштабируемость ИИ с контролем учителя и итеративной доставкой роботизированных агентов ИИ, обеспечивая снижение нагрузки на учителей и увеличивая частоту доработок.

Мы признаём несколько ограничений. Относительно небольшой размер выборки (N = 32) ограничивает обобщимость наших результатов, и исследование следует рассматривать как пилотное исследование. Оба состояния различались по дозировке обратной связи: группа WCF получала только один раунд обратной связи на задание, тогда как группа STEP-DWCF-R проходила 2–3 итеративных раунда. Таким образом, превосходная производительность группы STEP-DWCF-R отражает совокупные эффекты множества циклов повторения, обратной связи, генерируемой ИИ, и модерации преподавателей, а не изолированный эффект роботизированного агента ИИ или его способа доставки. Роботизированный агент ИИ — это чисто виртуальный веб-интерфейс, поэтому его эффекты нельзя отделить от эффектов самой итеративной структуры. Мультимодальная человеческая обратная связь (например, речь плюс жест) не была включена в контрольное условие, поскольку она не является стандартной практикой в традиционных классах по написанию по английскому языку и требует отдельной экспериментальной парадигмы. В будущих исследованиях следует включать контрольные группы с дозировкой (например, многораундная обратная связь от учителей) для дальнейшего разлучения этих компонентов.

Несмотря на эти ограничения, фреймворк STEP-DWCF-R предлагает практические направления для обучения письму с помощью ИИ. Модульная архитектура позволяет интегрироваться в системы управления обучением для крупномасштабных курсов английского языка и английского языка, а структурированная схема из четырёх категорий может быть адаптирована для академического письма или жанров, специфичных для дисциплины. Будущие итерации могут рассмотреть мультимодальную доставку для использования теоретических преимуществ вовлечённых агентов, хотя текущий пилот устанавливает возможность текстового итеративного сотрудничества ИИ и преподавателей. Тем не менее, согласованная закономерность по показателям результатов, показателям процессов и высокой надёжности между оценщиками подтверждают осуществимость и потенциальную эффективность этого многокомпонентного подхода в аналогичных контекстах EFL.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конкурирующих интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эта работа была профинансирована грантом Universiti Sains Malaysia Bridging, проект No R501-LR-RND003-0000001342-0000.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comВерсия 2.1; используется для веб-интерфейса роботического ИИ-агента
API GPT-5OpenAIhttps://platform.openai.comМодель gpt-5, температура=0.7; для генерации структурированной обратной связи в формате JSON
Jinja2Pallets Projectshttps://jinja.palletsprojects.comШаблоны для серверной рендеризации веб-интерфейса
PythonPython Software Foundationhttps://www.python.orgВерсия 3.10; сценарии на бэкэнде
Windows 11Microsofthttps://www.microsoft.com/windowsОперационная система для системы обратной связи ИИ

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

EngineeringEnglish writingwritten corrective feedback WCFdynamic written corrective feedback DWCFhuman AI collaborationfeedback uptakemixed effects models

Похожие статьи