Все методы с участием людей-участников проводились в соответствии с институциональными рекомендациями и декларацией Хельсинки. Протокол исследования был пересмотрен и утверждён институциональным экспертным советом городского строительного колледжа Гуанчжоу (одобрение IRB No GZCJ2026A016; дата утверждения: 2 января 2026 года). Утверждённое название исследования было «обучение, ориентированное на ученика с помощью ИИ, и академическое самовосприятие и коммуникативная компетентность подростков: исследование с использованием смешанных методов». Письменное разрешение было получено от участвующей школы перед проведением исследования. Было получено письменное информированное согласие от родителей или законных опекунов, а письменное согласие — от всех участвующих студентов. Студентам сообщили, что участие добровольное и что они могут в любой момент отказаться от участия без академических штрафов. Ни имена, ни контактные данные, идентификаторы школы, ни оценки или другая напрямую идентифицируемая информация не были внесены в платформу ИИ-чат-ботов или включены в публичный набор данных. Все процедуры исследования проводились в утверждённый период с 2 января 2026 года по 2 января 2027 года. Все инструменты и платформы, использованные в этом исследовании, перечислены в Таблице материалов
Дизайн исследования и классные задания
В этом исследовании использовался квазиэкспериментальный смешанный дизайн класса с двумя учебными условиями: группа обучения с помощью искусственного интеллекта, ориентированная на ученика, и обычная группа, ориентированная на ученика. Лонгитюдные измерения проводились в три временных момента: исходный уровень перед вмешательством (T1), сразу после финальной учебной сессии (T2) и на предварительно определённой краткосрочной последующей оценке (T3). Интервал T2–T3 фиксировался в журнале исследования и сохранялся согласованным между рукописями, набором данных, скриптами анализа и метками рисунков. Рисунок 1 обобщает набор, распределение классов, время оценки, исключения и качественную выборку. Поскольку административные и экологические ограничения препятствовали индивидуальной рандомизации, на уровне классов было назначено шесть целых классов, из которых три — в условиях с помощью искусственного интеллекта и три — в условиях сравнения. Каждый класс внес 29 учеников в итоговую аналитическую выборку. Уровень класса, предметная область, последовательность уроков, продолжительность занятий, классные задания, расписание оценки и время контакта с учителями были сопоставимы в зависимости от разных условий. Идентификаторы классов сохранялись для статистических проверок, чувствительных к кластеру.
Набор участников и скрининг на соответствие
Участники набирались напрямую из участвующих целых классов. Студенты и их родители или законные опекуны получили подробный информационный лист с описанием цели обучения, процедур в классе, активности с поддержкой ИИ, расписания анкет, необязательный компонент интервью, защиту конфиденциальности, права на вывод и планы хранения данных. Студенты включались в исследование, если они были зачислены в один из участвующих классов, посещали обычные занятия, давали письменное согласие, получали письменное согласие родителей или опекуна и заполняли базовую анкету перед первой сессией. В то же время студенты исключались из окончательной аналитической выборки, если они переводились из школы, пропускали более 25% сессий вмешательства, предоставляли недействительные анкетные записи или отзывали разрешение на использование данных. Одна из основных причин исключения была задокументирована для каждого исключенного участника. До ввода данных каждому допустимому участнику присваивался уникальный идентификационный код исследования. Были зафиксированы соответствующие демографические и образовательные ковариации, включая возраст, пол, идентификатор класса, базовый диапазон академических результатов, предыдущий опыт обучения с помощью ИИ и базовую знакомость с цифровым обучением. Для статистического отслеживания переменная группы инструкций кодировалась как 0 для условия сравнения и 1 для условия с помощью ИИ.
Учебные материалы и проведение вмешательств
Перед внедрением был разработан учебный блок из шести сессий (Дополнительная таблица 1), каждый классный урок длился 40–45 минут. Одинаковые учебные цели, темы уроков, рабочие листы, задания для обсуждения сверстников, формы самооценки и подсказки для рефлексии применялись в обоих учебных условиях. Структура анкеты, направления по оценке, обратные оценки и итоговые переменные на уровне шкалы соответствовали заблокированной карте оценок из Таблицы 1. Материалы воспроизводимости включали планы уроков (дополнительная таблица 1), листы с подсказками ИИ (дополнительная таблица 2), листы для учителей (дополнительная таблица 3), рабочие листы для учеников (дополнительная таблица 4), формы самооценки (дополнительная таблица 5), контрольные списки наблюдений (дополнительная таблица 6), технические журналы инцидентов (дополнительная таблица 7), руководства по интервью (дополнительная таблица 8) и качественный кодовый сборник (Дополнительная таблица 9). Участвующий учитель проходил обучение с использованием письменного руководства по проведению, охватывающему последовательность сессий, границы использования ИИ, процедуры сравнения групп, требования к конфиденциальности и контрольные списки по точности. Была проведена репетиция со студентами, не участвующими в учебе, для проверки времени выполнения занятий, доступа к устройству, ясности рабочего листа и сложности задания. Инструмент искусственного интеллекта представлял собой институционально одобренный чат-бот на базе ChatGPT, использующий архитектуру GPT-4. Для использования в классе была отключена история чата, память профиля, веб-сёрфинг, плагины, генерация изображений и автоматизированное оценивание. В рукописи используется общий термин «AI чат-бот-платформа» после первого упоминания, чтобы избежать рекламной лексики. Принципы проектирования подсказок были зафиксированы до вмешательства, а использование ИИ ограничилось только уточнением, генерацией примеров, сравнением объяснений, целевой поддержкой правки и подсказками для самооценки. Репрезентативные подсказки, образцы результатов ИИ и примеры модерации учителей были сохранены в составе материалов воспроизводимости.
Каждая сессия с помощью ИИ проводилась в пять структурированных этапов. Сначала был проведён 5-минутный брифинг для учителей, чтобы обозначить цели обучения, объяснить задачи, определить настроенную платформу чат-ботов на базе ИИ и напомнить учащимся, что результаты ИИ являются временными подсказками, а не авторитетными ответами. Студентам строго предписывали не вводить на платформу никакой идентифицируемой личной информации. Затем последовало 10-минутное индивидуальное задание с поддержкой ИИ, в ходе которого студенты использовали подготовленный лист с подсказками для запроса разъяснений, примеров, альтернативных объяснений или предложений по исправлению. Каждый ученик записал используемую категорию заданий, одну полезную идею с поддержкой ИИ, один пункт, требующий проверки, и окончательное решение о принятии. В-третьих, было проведено 12–15-минутное дискуссионное занятие, в ходе которого студенты сравнивали свои идеи, поддерживаемые ИИ, в небольших группах, выявляли неточности и совместно пересматривали свою работу. На этом этапе учитель распространялся по классу, применяя стандартизированное правило модерации, побуждая учеников устно обосновывать свои правки в соответствии с требованиями урока и исправляя ошибочные или чрезмерно уверенные результаты ИИ до завершения. В-четвёртых, была проведена 5–8-минутная сессия разъяснения на весь класс, чтобы разобраться с широко распространёнными заблуждеениями и исправить фактические ошибки. В завершение сессии завершилось 5-минутное самооценочное задание, в ходе которого ученики оценивали свои знания, записывали одно конкретное улучшение и отмечали один нерешённый вопрос. Эта точная оперативная последовательность сохранялась во всех классах вмешательства. Печатные листы с подсказками служили техническими резервными копиями, а технические отклонения, затрагивающие более трети класса, явно фиксировались. Анонимизированные примеры репрезентативных запросов-выводов-модерации были сохранены и задокументированы в дополнительных таблицах 2, 3.
Условие сравнения было реализовано с использованием одинаковой продолжительности сессии, учебных целей, последовательности тем, рабочих листов, интервалов для обсуждения с коллегами, форм самооценки и окон обратной связи от учителей. Однако подсказки, поддерживаемые ИИ, были заменены стандартизированными, подготовленными учителями направляющими, которые обучали студентов объяснять основные концепции, сравнивать примеры, выявлять слабые места и пересматривать свою работу. Идентичная пятиступенчатая структура, включающая инструктаж, индивидуальный опрос, обсуждение коллег, разъяснение по всему классу и итоговую самооценку, строго сохранялась. Никаких дополнительных занятий, внеклассных заданий, длительных периодов обратной связи или других оценочных заданий не предоставлялось ни для одного из этих условий. Посещаемость класса, поведенческие нарушения, замены учителями и неполные компоненты были задокументированы с использованием одного и того же формата логирования для обеих групп.
Сбор данных, мониторинг достоверности и количественный анализ
Оценочные анкеты проводились на начальном, постинтервенционном и последующем интервалах, используя согласованную формулировку заданий, шкалы ответов и правила оценки по всем трём волнам измерения. Инструменты включали проверенные шкалы, оценивающие академическое самовосприятие, коммуникативную компетентность, качество взаимодействия, самооценку и вовлечённость учащихся. Ответы собирались по стандартной 5-балльной шкале типа Ликерта от 1 (сильное несогласие) до 5 (сильное согласие), при этом более высокие баллы указывали на более высокий уровень целевого конструкта. Индивидуальные оценки шкалы рассчитывались как арифметическое среднее допустимых элементов после необходимого обратного кодирования. Недостающие значения задания заменялись средним баллом ученика в той же шкале и волне, при условии, что не более 20% заданий отсутствовали. Шкалы с более чем 20% отсутствующих элементов считались отсутствующими, а данные из полностью отсутствующей волны оценки не учитывались. До проведения статистического анализа исходный набор данных тщательно проверялся на нарушения диапазона, дублирующиеся записи, шаблоны отклика по прямой линии и аномальные сроки завершения. Записи отмечались как недействительные и исключались, если они содержали невозможные числовые значения, инвариантные ответы по всем вопросам или время завершения менее 1/3 медианной продолжительности, если явные журналы класса не подтверждали их подлинность. Основные анализы после вмешательства и последующего наблюдения включали студентов, предоставивших действительные исходные баллы и соответствующие данные результатов после вмешательства или последнего наблюдения, что позволило избежать одностороннего списочного удаления для частично заполненных расписаний. Перед введением данных был создан заблокированный словарь данных для определения имён переменных, меток, диапазонов отклика, пропущенных кодов значений, правил обратного оценивания, волновых идентификаторов и окончательных конструкций на уровне масштаба. Данные анкеты вводились в широком формате, с одной строкой на каждого ученика и суффиксами волн (_T1, _T2, _T3) для различения измеряемых волн. Числовые диапазоны и уникальные записи участников были вычислительно проверены, а закономерности отсутствующих исследовались в группах, классах и волнах по основному журналу посещаемости.
Стандартизированный контрольный список для наблюдения в классе использовался во время каждого учебного занятия для контроля точности реализации. Каждый педагогический компонент оценивался как 0 (не завершён), 1 (частично завершён) или 2 (полностью завершён). Оцениваемые компоненты строго соответствовали пятифазной последовательности обучения, включая инструктаж учителя, индивидуальный запрос, обсуждение с коллегами, разъяснение в классе и заполнение записей по самооценке. Общий процент верности сессии рассчитывался путём деления наблюдаемого балла на максимально возможный результат. Любая сессия, опускавшаяся ниже порога точности в 70%, фиксировалась как отклонение протокола. Для обеспечения надёжности между оценщиками второй обученный наблюдатель независимо оценивал не менее 20% от общего числа сессий. Процентное согласие рассчитывалось по всем статьям, а любые расхождения в рейтингах устранялись путем консенсусного обсуждения, когда первоначальное соглашение опускалось ниже 80%. Технические сбои аппаратного или программного обеспечения фиксировались в отдельных журналах, чтобы отличить их от проблем с точностью инструкций.
Статистический анализ проводился с использованием воспроизводимого скриптового рабочего процесса, в котором случайное семя фиксировалось до проведения выборки или проверок чувствительности. Все статистические тесты были двусторонними, значимость была установлена на уровне p < 0,05. Непрерывные переменные суммировались как средние значения и стандартные отклонения, тогда как категориальные переменные выражались как частоты и проценты. Исходная эквивалентность между когортами оценивалась описательно с использованием t-тестов независимых выборок для непрерывных данных и тестов хи-квадрата для категориальных распределений. Внутренняя согласованность измерялась с помощью альфа Кронбаха, применяя пороги α ≥ 0,70 для общих шкал и α ≥ 0,80 для первичных показателей результатов, а также скорректированные корреляции между пунктами и общим результатом. Базовый аналитический подход служил ANCOVA, скорректированный на базовый уровень. Для каждого первичного результата были подобраны отдельные модели: результат после вмешательства или последующей переменной был указан как зависимая переменная, учебная группа — основным предиктором, а соответствующий базовый балл — обязательным ковариатом. Были включены дополнительные ковариаты (пол, базовый диапазон академической успеваемости и предыдущее воздействие ИИ) для контроля исходных дисбалансов или их теоретической значимости, а также были зафиксированы скорректированные средние различия, 95% доверительные интервалы, стандартные ошибки и значения моделиR2 . Сравнения изменений (T2–T1 и T3–T1) проводились в качестве вторичного анализа с использованием независимых выборок T-тестов Уэлча, при этом размеры эффектов количественно оценивались с помощью d-теста Коэна. Исследовательский анализ процессов оценивал корреляции Пирсона между переменными процесса и изменениями исходов, дополняемые линейными регрессиями с мультипредикторными регресиями с мониторингом коэффициента инфляции дисперсии (VIF) для проверки мультиколлинеарности. Наконец, были внедрены проверки, чувствительные к кластерам, чтобы учесть вложённую структуру студентов в шести целых классах. Оценивались безусловные коэффициенты корреляции внутриклассов (ICC), изменения результатов агрегированы и сравнивались на уровне класса, а первичные расчёты ANCOVA повторялись с использованием стандартных ошибок, устойчивых к кластеру, в качестве исследовательской проверки чувствительности.
Качественная выборка, кодирование и интеграция смешанных методов
Сразу после послеинтервенционного опроса была отобрана целевая подвыборка из 36 студентов для полуструктурированных интервью. В эту качественную когорту входили участники из обеих учебных условий, которые демонстрировали высокие, средние или низкие оценки изменений в академической самоконцепции или коммуникативной компетентности. Полуструктурированное руководство по интервью исследовало опыт взаимодействия в классе, уверенность в объяснении идей, поведение самооценки, вовлечённость в выполнение задач и готовность к общению, используя целенаправленные подсказки для изучения моментов повторения, реакции на неясную обратную связь и вариации вовлечённости. Интервью записывались на аудиозапись только после получения согласия родителей и согласия ученика; в остальном делались структурированные письменные заметки. Все личные имена, номера классов и идентификационные данные были удалены при транскрипции, а транскрипты были связаны с соответствующими количественными идентификаторами. Первоначальная качественная структура кодирования была дедуктивно выведена из конструкций качества взаимодействия, самооценки и вовлечённости учащихся, при этом индуктивные тематические коды добавлялись только тогда, когда данные не соответствовали базовой структуре. Два независимых кодировщика проанализировали не менее 20% транскриптов для проверки надёжности. Были оценены коэффициенты каппы Коэна: значения от 0,61 до 0,80 рассматривались как существенное согласие, а значения выше 0,80 — как сильное согласие. Определения кодовой книги уточнялись, двойное кодирование повторялось всякий раз, когда начальная каппа опускалась ниже 0,61, а окончательные определения вместе с качественной матрицей частот кода архивировались (дополнительные таблицы 9 и 10).
Количественный анализ данных и фреймворки качественного кодирования были завершены независимо перед началом интеграции с использованием смешанных методов. Был структурно сконструирован целостный совместный дисплей, связывающий три количественных переменных процесса с соответствующими качественными темами. Интегрированные результаты систематически классифицировались как сходимость (где шаблоны анкет и темы интервью совпадали), расширение (где качественные нарративы объясняли механизмы, лежащие в основе количественных тенденций) или дивергенцию (когда интервью выявляли уникальные барьеры или неравномерное участие, усложняющие количественные закономерности). Качественные результаты были использованы для контекстуализации процессов в классе, связывая показатели вовлечённости учащихся с темами активного задания вопросов и обсуждения сверстников, а также связывая оценки самооценки с учётом осознания разрывов и стратегических корректировок.