$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Эксперименты и анализ
Все 32 учащихся предоставили исходные данные. Данные после тестирования были доступны для 16 учащихся в каждой группе (WCF и STEP-DWCF-R; Рисунок 2). Хронология исследования и показатели представлены на рисунке 3, а сквозная обратная связь показана на рисунке 4. Параметры экспериментальной настройки и реализации нашей системы ИИ приведены в Таблице 1. Анализы проходили по заранее заданному плану с намерением лечения. Сначала мы оцениваем исходную эквивалентность (Таблица 2), затем сообщаем первичный результат (Рисунок 5 и Таблица 3), затем вторичные результаты (Таблица 4) с проверками надёжности и надёжности.
Базовая эквивалентность
На начальном уровне (1-я неделя) группы были описательно схожи по заранее заданным ковариатам, включая демографию и результаты написания IELTS до получения обратной связи (Таблица 2). Индивидуальные баллы компонентов IELTS присваиваются по шагам 0,5 диапазона, тогда как таблица показывает групповые средние значения. Общие средние значения первой недели (WCF = 5.625, STEP-DWCF-R = 5.500) вычислены из тех же массивов, что и для генерации рисунка 5. Мы не проводим тесты гипотез на исходном уровне; любой остаточный дисбаланс устраняется с помощью предварительного пост-дизайна и термина Group × Time в модели смешанных эффектов, а посттестовое сравнение с учётом исходного уровня публикуется в разделе Протокол.
Исход первичных выборов
Рисунок 5 обобщает изменения до и после тестирования, а таблицы 3 и 5 отражают оценки модели и достижения после тестирования. На исходном уровне (неделя 1) групповые средние показатели составляли 5,625 для WCF и 5,500 для STEP-DWCF-R, что дало незначимую разницу групп в −0,125 полос (SE = 0,133, t = − 0,939, df = 29,90, p = 0,355, 95% CI [−0,397, 0,147]). Исходная линия в Таблице 3, таким образом, оценивает среднее значение WCF за первую неделю на уровне 5,625 с 95% ДИ [5,419, 5,831] (SE = 0,097, df = 15). С первой по восьмую неделю WCF улучшился на 0,3125 диапазона (SE = 0,128, t = 2,44, df = 15, p = 0,028, 95% CI [0,039, 0,586]; стандартизированный внутригрупповой эффект dz = 0,61). STEP-DWCF-R улучшился на 1,0313 полос (SE = 0,140, t = 7,34, df = 15, p = 2,44 × 10−6, 95% CI [0,732, 1,331]; dz = 1,84). Линейный контраст смешанных эффектов для взаимодействия группы × времени — то есть разница в различиях — составлял 0,7188 полос (SE = 0,190, t = 3,78, df = 29,75, p = 0,0007, 95% CI [0,330, 1,107]; Таблица 3), указывая на более значительные приросты в рамках STEP-DWCF-R. После тестирования (8-я неделя) оценённые предельные средние были благоприятны для STEP-DWCF-R на 0,5938 полос (тест Уэлча по групповым средним: SE = 0,115, t = 5,16, df = 29,74, p = 1,50 × 10−5, 95% CI [0,359, 0,829]). В соответствии с этим, таблица достижений (Таблица 5) показывает, что на 8-й неделе 13% учащихся WCF достигли общего ≥ 6,5, а 0% — ≥ 7,0 (счёты 2/16 и 0/16), тогда как 81% учащихся STEP-DWCF-R достигли ≥ 6,5, а 25% — ≥ 7,0 (подсчёты 13/16 и 4/16). Таблица 3 отражает соответствующие оценки фиксированного эффекта и их неопределённость.
Результаты на уровне измерений
Таблица 4 суммирует изменения до публикации по четырём измерениям задачи 2. Ответ на задачи (TR) показал прирост Δ = 0,25 диапазона при WCF против Δ = 0,95 при STEP-DWCF-R, что дало ΔΔ = 0,70 при 95% ДИ [0,28, 1,12] и скорректированном по Хольму p = 0,006. Когерентность и когезия (CC) демонстрировали наибольший контраст: WCF Δ = 0,30, STEP-DWCF-R Δ = 1,15, следовательно, ΔΔ = 0,85 (95% CI [0,44, 1,26], adj-p = 0,002). Лексический ресурс (LR) следовал той же схеме: WCF Δ = 0,35 и STEP-DWCF-R Δ = 0,95, давая ΔΔ = 0,60 (95% CI [0,18, 1,02], adj-p = 0,012). Грамматический диапазон и точность (GRA) улучшены на Δ = 0,25 в WCF и Δ = 0,97 в STEP-DWCF-R; полученный ΔΔ = 0,72 имел 95% ДИ [0,31, 1,13] при adj-p = 0,004. По всем четырём измерениям группово×временные контрасты предпочитали STEP-DWCF-R после корректировки Хольма–Бонферрони.
Доказательства процесса
Рисунки 6 и 7 визуализируют результаты основного процесса. В течение 2–7 недель STEP-DWCF-R в среднем выполнил 2,26 повторных раундов на задание (95% CI [2,17, 2,35]; n = 96), тогда как WCF составлял 1,00 раунда для всех заданий (n = 96). Средняя разница составила 1,26 патрона (95% ДИ [1,17, 1,35]); тест Манна–Уитни подтвердил разделение распределений (U = 9216, z = 11,97, p < 10−30). В рамках STEP-DWCF-R средний уровень ошибок снижался по раунду: 13,78 в первом раунде (95% ДИ [13,02, 14,54]; n = 96), 8,94 на втором раунде (95% ДИ [8,42, 9,46]; n = 96) и 6,16 на третьем раунде (95% ДИ [5,20, 7,12]; n = 25). Линейная тенденция, соответствующая наблюдениям за раунд, оценивала снижение на 4,14 ошибки за выстрел (95% ДИ [3,51, 4,78] в абсолютной величине; p < 10−12). Показатели обратной связи и времени выполнения задачи не кодируются на рисунках 6 и 7 , поэтому они представлены в таблице 7.
Надёжность и надёжность
Соглашение между оценщиками для эссе 1-й и 8-й недель было хорошим или отличным. Два обученных оценщика оценивали все сценарии независимо и были ослеплены к группе и времени; используя коэффициент корреляции внутриклассов средних измерений (ICC[2,2]) по средним оценщикам, надёжность варьировалась от 0,86 до 0,93 по Total, а по четырём измерениям, а все нижние 95% пределы доверия превышали 0,80 (Таблица 6). Диагностические проверки для первичной модели смешанных эффектов показали примерно нормальные остатки без материальной гетероскедастичности, а модели, подогнанные к сводкам процессов на уровне задач, показали дисперсию, близкую к единице. Анализ чувствительности на основе того же набора данных за 1/8-ю неделю дал последовательные выводы: линейная регрессия с сравнением групп после тестирования с корректировкой исходных баллов оценила скорректированную разницу между группами в 0,575 полос на 8-й неделе (95% ДИ [0,336, 0,814], p = 3,15 × 10−5), а также сравнительно-специфическая смешанная модель, включающая случайный эффект для оценщика и использованные неусредненные баллы, дала оценку группы × времени в 0,72 диапазона (95% ДИ [0,33, 1.11], p = 0.0007), в соответствии с Таблицей 3. Результаты оставались без изменений при использовании устойчивых стандартных ошибок и когда анализ ограничивался полными случаями, что подтверждает вывод о том, что STEP-DWCF-R даёт больший прирост до публикации, чем WCF.
Качественные результаты
Для качественного анализа мы изучили трассы повторения STEP-DWCF-R по всем шести задачам и письменные размышления по итогам курса от 16 участников группы STEP-DWCF-R. Два кодировщика независимо кодировали материалы, используя сфокусированную дедуктивную структуру, основанную на четырёх категориях обратной связи (грамматика, словарный запас, организация, рассуждение) и обоснования освоения. Межкодировочное соглашение было существенным с каппой Коэна в 0,78, и разногласия решались путем обсуждения.
Анализ выявил пять ключевых тем: воспринимание проходило поэтапно, когда учащиеся определяли поверхностные особенности перед организацией и рассуждением; Отдельные материалы, связанные с рубриками, были более практичными и чаще применяемыми, чем повествовательные предложения; Комплементарность ИИ и учителей формировала приоритет, при этом перекрывающиеся сигналы увеличивали концентрацию, а модерация учителей разрешала конфликты; Преимущества достигли пика на ранних этапах с повторным использованием шаблонов организации и лексическими шаблонами в новых запросах; а учащиеся адаптировали стратегии между задачами. Эти темы формируют динамику процесса, рассматриваемую в разделе доказательств процесса. Также были зафиксированы обратная связь, постоянные ошибки и измерения времени выполнения задач. Краткое описание этих дополнительных показателей процесса приведено в таблице 7.
Интерпретация репрезентативных результатов
В совокупности данные результатов и процессов показывают, что фреймворк STEP-DWCF-R связан с лучшим улучшением письма IELTS по сравнению с традиционной однораундовой обратной связью. Первичный результат показывает разницу различий между группами в 0,72 диапазона, при этом группа STEP-DWCF-R улучшилась на 1,03 полосы в целом по сравнению с 0,31 полосами в группе WCF. Это преимущество было неизменным по всем четырём аналитическим измерениям, при этом наибольший контраст между когерентностью и когезией составлял 0,85 диапазона, что свидетельствует о том, что структурированная, связанная рубриками и многоступенчатая обратная связь, особенно способствовала развитию организации. Процессуальные данные также указывают на то, что итеративное взаимодействие лежит в основе этого преимущества. Учащиеся STEP-DWCF-R проходили в среднем 2,26 повторных раунда за задание, а количество ошибок линейно снижалось примерно на 4,1 ошибки за раунд. Например, репрезентативный цикл рабочих процессов включал GPT-5, генерирующий структурированную обратную связь JSON по четырём категориям, затем модерацию учителей для устранения ложных срабатываний и повышения оперативности, а затем передачу через интерфейс роботизированного AI-агента для многоэтапной проверки учащихся. Эти результаты подтверждают осуществимость и потенциальную эффективность интегрированного многокомпонентного рабочего процесса, объединяющего обратную связь, генерируемую ИИ, модерацию учителей и итеративную доставку роботизированных агентов ИИ, но их не следует рассматривать как доказательство какого-либо отдельного компонента в изоляции. Дисбаланс дозы 2–3 раунда против одного и скромный размер выборки в 32 означает, что наблюдаемые улучшения отражают совокупный эффект увеличения возможностей для редактирования и структурированной обратной связи. Эти результаты следует рассматривать как многообещающие пилотные доказательства, ожидающие подтверждения в более крупных, контролируемых компонентами исследованиях.

Рисунок 1. Теоретическая основа DWCF (динамическая письменная корректирующая обратная связь). Рисунок даёт более широкое объяснение того, как может функционировать DWCF; Она включена для ориентации, а не как прямая модель этого исследования. Элементы, соответствующие анализируемым здесь результатам и метрикам процессов, показаны на рисунке; Другие пути являются показателями и не были оценены. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 2. Схема потока участников CONSORT. Тридцать два учащихся были оценены на соответствие; никто из них не был исключён. Все участники дали согласие и затем были рандомизированы в соотношении 1:1 либо с группой WCF (n = 16), либо с группой DWCF (n = 16). Все рандомизированные участники получили выделенное вмешательство; Потери из-за последующих выпусков или прекращения производства не было, и все 32 были включены в итоговый анализ. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 3. Хронология изучения и показатели. Испытание длилось 8 недель: на W1 участники выполнили базовое задание IELTS 2 и получали оценки; шесть еженедельных письменных заданий проводились с W2 по W7 (Задача 1–Задача 6), с групповой обратной связью (WCF или DWCF) и редактированием после каждой задачи. В период W2–W7 для каждой задачи регистрировались показатели процесса, включая раунды повторения, обратную связь, уровень постоянных ошибок и время выполнения задачи. На W8 была проведена и оценена послетестовая задача IELTS 2. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 4. Сквозная обратная связь. Учащиеся составляют прокторный первоначальный вариант, затем получают групповые обратные связи: WCF (один раунд обратной связи с людьми) или STEP-DWCF-R (обратная связь, генерируемая ИИ с модерацией учителей, передаваемая через роботизированных агентов ИИ, включающая 2–3 итеративных раунда). Учащиеся проходят повторные раунды соответственно. Результат — балл диапазона IELTS Task 2; Показатели процесса включают количество раундов, воспринимаемую обратную связь (принято/изменено/отклонено), уровень постоянных ошибок и время выполнения задачи. Система фиксирует идентификаторы на уровне предметов, категорию/степень тяжести, источник (ИИ против человека и робота), действия модерации и статус принятия предметов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 5. Изменение общего диапазона IELTS с 1-й на 8-й недели по группам. Точки дают оценочные средние групповые значения с 95% доверительными интервалами, а траектории указывают на больший прирост при STEP-DWCF-R. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 6. Повторные раунды по задачам по группам (недели 2–7). Точки данных представляют собой индивидуальные раунды повторения задач для групп WCF (синий) и STEP-DWCF-R (оранжевый). Горизонтальные линии и полоски ошибок показывают групповые средние значения с 95% доверительными интервалами. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 7. Средние ошибки на один раунд в рамках STEP-DWCF-R с 95% ДИ. Очки показывают средний уровень ошибок в каждом раунде обратной связи (раунд 1, раунд 2, раунд 3), а вертикальные линии представляют собой 95% доверительные интервалы (CI). Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
| Компонент | Технические характеристики |
| Аппаратное обеспечение | ПК с ядром Intel(R) 12-го поколения i7-12700H (2.30 ГГц), 32 ГБ ОПЕРАТИВНОЙ ПАМЯТИ, ВИДЕОКАРТОЙ NVIDIA RTX 3080Ti (16 ГГБ) |
| Операционная система | Windows 11 |
| Бэкенд | Flask~2.1 (Python~3.10) |
| Фронтенд | Jinja2 server-rendered templates |
| Модели ИИ | API OpenAI GPT-5 (для генерации обратной связи), постобработка на основе схем |
| Планировщик обратной связи | Пользовательский контроллер для управления многоступенчатой обратной связью (3 цикла) |
| Схема ошибок | Грамматика, словарный запас, организация, рассуждение |
| Контроль версий | GitHub |
| Лесозаготовка | Автоматический журнал подач, обратной связи и правок для анализа |
Таблица 1: Параметры экспериментальной настройки и реализации. Технические характеристики системы обратной связи ИИ, включая конфигурацию аппаратного обеспечения, операционную систему, бэкенд и фронтенд-фреймворки, настройки модели ИИ, планировщик обратной связи, категории схем ошибок, контроль версий и инфраструктуру логирования.
| Переменная | WCF (n=16) | STEP-DWCF-R (n=16) |
| Возраст (год), средний (SD) | 20.9 (1.5) | 21.1 (1.6) |
| Женщины, n (%) | 9 (56%) | 8 (50%) |
| Предшествующая подготовка к IELTS (да), n (%) | 7 (44%) | 6 (38%) |
| Годы предыдущего преподавания письма | 3.1 (1.2) | 3.2 (1.1) |
| Базовый IELTS Overall (группа) | 5.625 (0.387) | 5.500 (0.365) |
| Baseline TR (группа) | 5.56 (0.50) | 5.50 (0.50) |
| Baseline CC (группа) | 5.62 (0.49) | 5.53 (0.49) |
| Baseline LR (группа) | 5.60 (0.46) | 5.52 (0.46) |
| Baseline GRA (группа) | 5.56 (0.48) | 5.49 (0.45) |
Таблица 2: Исходные характеристики участников по группам (Неделя 1). Демографические переменные и предтестовая Международная система тестирования английского языка (IELTS) Задача 2 по написанию для групп WCF и STEP-DWCF-R. Значения средние (стандартное отклонение) или n (%).
| Фиксированный эффект | Оценка | SE | df | t | p | 95% ДИ |
| Перехват (WCF, неделя~1) | 5.625 | 0.097 | 15 | 58.1 | <.001 | [5.419, 5.831] |
| Группа (STEP-DWCF-R против WCF) | -0.125 | 0.133 | 29.9 | -0.939 | .355 | [-0.397, 0.147] |
| Время (неделя~8 против недели~1) | 0.3125 | 0.128 | 15 | 2.44 | .028 | [0.039, 0.586] |
| Группа × время | 0.7188 | 0.19 | 29.75 | 3.78 | .0007 | [0.330, 1.107] |
Таблица 3: Линейная модель смешанных эффектов для общего диапазона IELTS по результатам 1/8-й недели. Оценки с фиксированным эффектом, стандартные ошибки (SE), степени свободы (df), t-значения, p-значения и 95% доверительные интервалы (CI) для группового взаимодействия × времени и модельных терминов.
| Размерность | WCF Δ (группы) | STEP-DWCF-R Δ (диапазоны) | ΔΔ (95% ДИ) | ADJ-P |
| Ответ на задачи (TR) | 0.25 | 0.95 | 0.70 (0.28, 1.12) | .006 |
| Когерентность и сплочённость (CC) | 0.3 | 1.15 | 0.85 (0.44, 1.26) | .002 |
| Лексический ресурс (LR) | 0.35 | 0.95 | 0.60 (0.18, 1.02) | .012 |
| Грамматический диапазон и точность (GRA) | 0.25 | 0.97 | 0.72 (0.31, 1.13) | .004 |
Таблица 4: Результаты на уровне измерений (Задача 2): изменения до пост-после и различия между группами. Изменения до публикации (Δ) и различия в различиях (ΔΔ) с 95% доверительными интервалами (CI) и скорректированными по Холму p-значениями для ответа на задачу (TR), когерентности и когезии (CC), лексического ресурса (LR) и грамматического диапазона и точности (GRA).
| Порог | WCF (%) | STEP-DWCF-R (%) |
| В целом ≥ 6,5 | 13 | 81 |
| В целом ≥ 7.0 | 0 | 25 |
Таблица 5: Посттестовое достижение диапазона (8-я неделя). Доля учащихся в группах WCF и STEP-DWCF-R, достигших IELTS Общий порог диапазона не менее 6,5 и не менее 7,0.
| Результат | ICC | 95% ДИ |
| В целом | 0.91 | [0.86, 0.94] |
| Ответ на задачи (TR) | 0.88 | [0.82, 0.92] |
| Когерентность и сплочённость (CC) | 0.9 | [0.85, 0.94] |
| Лексический ресурс (LR) | 0.89 | [0.83, 0.93] |
| Грамматический диапазон и точность (GRA) | 0.87 | [0.80, 0.91] |
Таблица 6: Надёжность между оценщиками для результатов IELTS. Два слепых оценщика по N = 64 эссе (вместе, 1-я и 8-я недели). Среднее измеряет внутриклассовые коэффициенты корреляции (ICC[2,2]) с 95% доверительными интервалами (CI) для общих и размерных оценок.
| Мера | Группа WCF | Группа STEP-DWCF-R |
| Повторные раунды на задание | 1 | 2.26 |
| Скорость принятия обратной связи (принята или изменена, %) | 68.5 | 82.3 |
| Постоянный уровень ошибок после финального раунда (%) | 67.4 | 45.6 |
| Время модерации учителя (минимум на задание) | 23.5 | 13.8 |
| Время доставки агента ИИ (минимум на задачу) | — | 3.9 |
| Время повторения учащимся (минимум на задание) | 44.8 | 71.2 |
| Общее время на обратную связь + редактирование (минимум/задача) | 68.3 | 88.9 |
Таблица 7: Средние значения по 96 задачам (6 заданий × 16 учащихся). Уровень поглощения и устойчивых ошибок рассчитывался на уровне точек обратной связи. Временные показатели фиксировались через журналы учителей и системные временные метки. Время доставки агентов ИИ не применяется к группе WCF.