$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Интенсивная глобализация образования и цифровых технологий повысила необходимость научной и достоверной оценки уровня письма на английском языке для преподавания языков, академического развития икарьерного роста 1. Традиционные оценки письма, как это практикуется человеческим рейтингом, могут измерять субъективные аспекты письма, такие как тщательность аргументации и культурнаяпригодность 2, но подвержены длительному сроку выполнения, высоким затратам на труд и предвзятости из-за опыта и склонностейоценщика 3,4. Эти ограничения особенно остро проявляются в масштабных практиках, таких как международные языковые тесты (IELTS, TOEFL) или другие курсы английского языка, преподаваемые в университетах, где ручная оценка не может быть единственным, что требуется в плане мгновенной обратной связи и охват5.
AWE-системы получили широкое распространение в этом контексте благодаря своей обработке в реальном времени, стандартизации имасштабируемости 6. Такие популярные инструменты, как Grammarly (ориентированный на грамматические ошибки и доработку стиля) и ETS Criterion (который соответствует формальным нормам письма), в настоящее время используются миллионами учеников в K-12, языковых школах, высшем образовании и индивидуальнойподготовке 7. Хотя это и есть преимущества, технологическая эффективность и применимость систем AWE в обучении всё ещё вызываютспоры 8. Технически существующие системы обладают высокой точностью по объективным параметрам, включая обнаружение ошибок и лексическое разнообразие, при этом корреляция с человеческим баллом может превышать 0,859. Однако в более субъективных областях, таких как релевантность содержания, логическая аргументация и организация текста, корреляции часто становятся ниже 0,7010. Такая непропорциональность несёт риск способствовать поверхностной точности среди учащихся в ущерб общей компетентности в написании11.
Вопрос равенства также ограничивает образовательную полезность AWE. Текущие исследования также склонны сосредотачиваться на агрегированных показателях точности, игнорируя возможность отклонений, которые систематически ставят в невыгодное положение некоторуюгруппу 12. Показательно, характеристики межязыков, общих для изучающих китайский или испанский язык, будут ошибочно восприниматься за ошибки, что приведёт к систематическойнедооценке 13,14. Кроме того, субъективное принятие обратной связи ИИ учащимися, как правило, мало известно15. Опросы показывают, что почти треть неносителей учащихся сообщают о несоответствии между результатами ИИ и реальной успеваемостью, при этом процессы технической точности, группового равенства и удовлетворённости учащихся всё ещё плохопонимаются 16.
Эти слабости отражают недостатки классической парадигмыточности 17. Рамка, учитывающая только соответствие ИИ и человеческого оценивания, не может отражать вопросы равенства или доверия учащихся к системе. На практике образовательная ценность AWE должна одновременно соответствовать трём условиям: технической точности, справедливости между группами и принятиюучащихся 18. Отсутствие такого комплексного подхода к валидации помогает объяснить, почему системы AWE пользуются широким распространением, но ограниченным доверием к образовательнойпрактике 19,20.
Для решения этой проблемы настоящая работа вводит многоуровневую систему валидации, которая объединяет техническую точность, групповую и индивидуальную справедливость, а также восприятие учащимися в единую структуру. Предлагаемая структура XAI разработана для практической реализации в существующих платформах AWE, предоставляя учителям и учащимся диагностику справедливости и прозрачные объяснения результатов, а также может применяться на курсах письма или подготовке к тестам для оценки способности повысить справедливость, интерпретируемость и практическую полезность в реальных условиях оценивания.
В этом контексте гипотеза является AFMM для изучения посреднической роли воспринимаемой справедливости в определении связи между точностью и удовлетворённостью, а также сдерживающей роли языкового владения чувствительностью к справедливости. Таким образом, он вносит вклад двумя способами: теоретически обогащая модели оценки AWE, описывая справедливость как одно из ключевых измерений валидации наряду с точностью и восприятием, а на практике — предоставляя разработчикам стратегии максимизации справедливости, педагогам — группово-чувствительные критерии выбора, а также образовательную ценность AWE, объясняя способ формирования восприятия учащихся. Помимо образования, структура также соответствует более широкой концепции XAI, демонстрируя, как справедливость и восприятие пользователями могут повысить прозрачность, доверие и принятие в других сферах, таких как здравоохранение, автономные системы и кибербезопасность.
Вопросы по исследованиям:
1.To какой степени система AWE демонстрирует техническую точность и справедливость среди различных групп носителей родного языка и уровня владения?
2. Как многоуровневая система оценки на базе XAI может повысить прозрачность и равенство в автоматизированной оценке английского письма?
ОБЗОР ЛИТЕРАТУРЫ:
Факторы, влияющие на принятие обратной связи по AWE студентами колледжей, были изучены с помощью расширенной модели принятия технологий (TAM)21. На основе данных опроса 448 китайских студентов, использующих SEM, было установлено, что полезность, простота использования и намерение существенно влияют на субъективные нормы, доверие, самоэффективность, когнитивную обратную связь и характеристики системы. Однако исследование ограничивалось одной страной и одной группой студентов, что ограничивает применимость обобщения. Чтобы изучить, как китайские студенты по английскому языку реагируют на обратную связь PigaiAWE 22, было проведено исследование многократных подач заявок (n = 5) от студентов университета. В нём отмечалось раннее внимание к коррекции ошибок, низкое количество лингвистической обратной связи и постепенное углубление реакции. Однако размер выборки был очень ограничен, как и система AWE, которая ограничивает применимость и обобщаемость. Были изучены убеждения учителей английского языка относительно применения инструмента оценки ИИ (CoGrader), чтобы выявить факторы, влияющие на ихвзгляды 23. В ходе смешанного исследования 10 саудовских университетских преподавателей опрос и интервью показали смешанное положительное мнение, но нежелание полностью убедиться в надёжности и полной замене преподавателей. Это затрудняет обобщение из-за ограниченной выборки и положения одной страны.
Учитывая развитие корпусной лингвистики и технологий ИИ, исследование изучало рамкиAES 24. Было использовано PCA для улучшения лингвистических индикаторов оценки качества письма и было обнаружено, что сочетание микрохарактеристик с агрегированными характеристиками определяет качество письма эффективнее, чем само агрегированные характеристики. Нелинейный подход AES, основанный на регрессии случайных лесов, превзошел остальные подходы. Кроме того, SHAP выявлял ключевые языковые элементы для каждого оцениваемого атрибута, повышая прозрачность системы с помощью объяснимого ИИ. Результаты могут помочь улучшить многогранные методы в письменной оценке и обучении. Система сотрудничества человек-машина была введена для решения задач аннотирования арабских текстов, которые часто бывают дорогими и занимают много времени. Метод рассматривает эссе, основанные на семи особенностях литературы, с помощью LLM. Процессы валидации и тактики подсказок были персонализированы для обеспечения последовательности и точности. Сотрудничество приводит к увеличению количества маркированных ресурсов и не влияет на качество оценки, демонстрируя, что это масштабируемый метод аннотации данных, подходящий для языков с меньшими ресурсами.
Использование ИИ в образовательной сфере даёт возможность значительно снизить требования к оценке и повысить уровень письменного образованияна 25,26. В то же время исследователи подчёркивают, что точность ИИ — не единственный аспект, важный для его ответственного использования. Существуют принципы справедливости и снижения предвзятости, безопасности и конфиденциальности, подотчётности, объяснимости, прозрачности, образовательного эффекта, честности и постоянного развития. Недавние исследования эмпирически оценивают нулевой балл на основе GPT-4o с акцентом на эти требования. Исследование было сосредоточено на восприятии педагогов относительно ADWT относительно аспекта образовательнойчестности 27. Поперечное исследование с участием 100 аспирантов и преподавателей по 10 предметам показывает, что, несмотря на то, что преподаватели приписывают пользу ADWT для достижения образовательных целей, оно имеет некоторые ограничения, такие как ограниченная доступность, недостаток знаний и беспокойство о влиянии на честность и креативность. Исследование показало, что по мере интеграции технологий ИИ в образование для их успешного и ответственного использования необходимы этические вопросы и участие заинтересованных сторон. Исследования изучали эффективность технологий ИИ по сравнению с человеческими оценщиками при оценке эссе, поданных ученикамиEFL 28. Оценка 30 эссе показала, что, хотя ИИ предлагал качественные комментарии по содержанию, языку, организации и корректности, он постоянно ставил более низкие оценки, чем у людей. Кроме того, ИИ предоставил более подробную обратную связь, но оценки различных инструментов ИИ не отличались существенно.
Разрыв в исследованиях:
В настоящее время большинство исследований по стипендиям AWE оценивают либо точность, либо признание пользователями. Очень немногие исследуют, не вредит ли различия в оценке системно группам носителей языка или владения языком. Хотя предыдущие исследования изучали принятие пользователями или ограничивались конкретной системой AWE из конкретной страны и размером выборки, возникают вопросы о обобщённости. Хотя и SHAP, и PCA являются стратегиями XAI и были разработаны для повышения прозрачности, ни одно исследование не изучало механизмы справедливости или то, как учащиеся используют обратную связь ИИ из AWE. В литературе нет обширных рамок, учитывающих определённые измерения точности, анализа справедливости и восприятия учащихся. Не существует объяснённой модели оценки, учитывающей точность, справедливость и восприятие учащихся внутри и между оценщиками. В этом исследовании предлагаются и подтверждаются объяснимая структура — TLEF и объединённая модель AFMM, чтобы одновременно оценить точность, справедливость и восприятие учащихся среди многоязычных и разнообразных обучающихся.