Аналитический набор данных, сформированный после скрининга ответов
В результате рабочего процесса скрининга ответов был сформирован аналитический набор данных, содержащий 420 анонимизированных записей студентов из 448 представленных анкет. В журнале скрининга были зафиксированы все этапы принятия решений. Шесть записей были удалены из-за отсутствия согласия или несоответствия критериям отбора, пять дублирующих заявок были удалены, четыре записи были исключены, поскольку более 20% всех пунктов шкал отсутствовали, и 13 записей были исключены, так как они соответствовали двум или более показателям качества ответов. Девятнадцать ответов были отмечены из-за продолжительности заполнения <180 s, восемь ответов были отмечены из-за >90% однотипных ответов (straight-line responding), и для 21 респондента была выполнена импутация средним значением по шкале для 37 единичных пропущенных пунктов. Итоговый аналитический набор данных не содержал прямой идентифицирующей информации об участниках, ни одна из сохраненных записей не превышала порог исключения по пропущенным данным, и все сохраненные ответы на пункты находились в пределах заранее определенных диапазонов. Схема скрининга приведена в Таблице 3.
В итоговую выборку вошли 275 женщин и 145 мужчин, что составило 65,5% и 34,5% аналитического набора данных соответственно. Средний возраст составил 20,1 ± 1,2 года. Респонденты были распределены по четырем курсам бакалавриата: с 1-го по 4-й курс, которые составили 27,1%, 27,4%, 25,5% и 20,0% выборки соответственно. Набор данных также включал три категории учебных заведений и пять категорий академических специальностей. После пересмотра категорий ни одна опубликованная демографическая группа не содержала менее пяти респондентов. Демографические характеристики аналитического набора данных обобщены в Таблице 4.
Построение шкал, проверка диапазонов и примеры субоптимальных рабочих процессов
После кодирования пунктов и присвоения обратных баллов были вычислены пять переменных на уровне шкал: отрицательные эмоции, академическая прокрастинация, чувство принадлежности к школе, мышление высшего порядка и субъективное благополучие. Каждый показатель остался в пределах своего теоретического диапазона ответов. Показатели отрицательных эмоций варьировались от 1.048 до 3.143 по шкале от 1 до 4. Академическая прокрастинация, чувство принадлежности к школе и мышление высшего порядка варьировались от 1.312 до 4.250, от 2.333 до 4.444 и от 2.350 до 4.850 по соответствующим шкалам от 1 до 5. Субъективное благополучие варьировалось от 2.000 до 5.300 по шкале от 1 до 6. Проверка обратного кодирования не выявила расхождений между полученными переменными с обратными баллами и закрепленным правилом подсчета баллов в окончательном аналитическом наборе данных. Эти проверки подтвердили, что кодирование пунктов, присвоение обратных баллов, обработка пропущенных пунктов и агрегирование баллов были выполнены без обнаружимых ошибок в диапазонах.
В рамках данного рабочего процесса также были созданы примеры субоптимального аудита, иллюстрирующие способы обнаружения ошибок или сомнительных результатов перед финальным анализом. Во время одного из сеансов аудита было выявлено неправильно рассчитанное значение субъективного благополучия с обратной шкалой, так как в логе проверки подсчета сравнивались исходное значение, ожидаемая формула «обратный балл = 7 - исходный балл», производное значение и итоговый диапазон шкалы. Производная переменная была исправлена, показатель субъективного благополучия перерассчитан, а все последующие результаты описательного анализа, корреляции, сравнения, регрессии, диагностические данные и исходные данные для графиков были сформированы заново. В другом промежуточном рабочем файле в ходе проверки диапазонов было обнаружено значение пункта, выходящее за допустимые пределы; было установлено, что ошибка возникла при работе с электронной таблицей, а не в заблокированном исходном экспорте. Рабочая копия была исправлена и задокументирована без изменения каких-либо корректных экстремальных ответов. Также было рассмотрено предупреждение о надежности, когда один пункт показал более низкую скорректированную корреляцию «пункт-итог», чем остальные пункты той же шкалы; поскольку формулировка пункта, направление оценки и соответствие конструкту были верными, пункт был сохранен. Было выявлено несоответствие в предварительной визуализации, когда рисунок не совпадал с проверенной числовой исходной таблицей; рисунок был повторно создан на основе проверенной таблицы, а запись о источнике рисунка обновлена. Эти примеры демонстрируют, что данный рабочий процесс не только генерирует корректные результаты, но и позволяет обнаруживать ошибки кодирования, проблемы с диапазонами, предупреждения о надежности, несоответствия между рисунками и источниками, а также вопросы качества ответов с помощью контрольного журнала аудита.
Описательные характеристики и внутренняя согласованность
Пять переменных шкального уровня продемонстрировали приемлемую вариативность. Средний балл отрицательных эмоций составил 2.099 ± 0.391, а средний балл академической прокрастинации — 2.639 ± 0.484. Чувство принадлежности к школе и мышление высшего порядка показали умеренно высокие средние значения: 3.343 ± 0.390 и 3.627 ± 0.418 соответственно. Средний балл субъективного благополучия составил 3.784 ± 0.543. Ни одна из шкал не продемонстрировала выраженного эффекта пола или потолка, а доля респондентов с теоретическим минимумом или максимумом составила менее 2.0% для каждой шкалы.
Внутренняя согласованность была приемлемой для всех пяти шкал. Значения альфа Кронбаха варьировались от 0,834 до 0,899, что превышало заранее установленный порог 0,70. Наивысшая внутренняя согласованность наблюдалась для показателя отрицательных эмоций (альфа Кронбаха 0,899), за которым следовал показатель субъективного благополучия (0,895). Значения омега Макдональда варьировались от 0,842 до 0,906, и оценки омеги не изменили интерпретацию надежности. Анализ исправленной корреляции пунктов с итогом не выявил пунктов, требующих удаления. Описательная статистика и оценки надежности представлены в Таблице 5.
Структура корреляций между переменными на уровне шкал
Корреляционная матрица использовалась в качестве описательного показателя взаимосвязи и для проверки направления подсчета баллов. Перед расчетом коэффициентов корреляции Пирсона были изучены распределения шкал и двумерные диаграммы рассеяния. Ни одна из переменных не продемонстрировала сильной асимметрии или эксцесса, и ни на одном двумерном графике не было выявлено выраженного нелинейного паттерна, который мог бы сделать описательный корреляционный анализ Пирсона некорректным. Субъективное благополучие отрицательно коррелировало с негативными эмоциями (r = -0,496) и академической прокрастинацией (r = -0,294) и положительно коррелировало с чувством принадлежности к школе (r = 0,481) и мышлением высокого порядка (r = 0,386). Остальные взаимосвязи соответствовали той же логике подсчета баллов: негативные эмоции положительно коррелировали с академической прокрастинацией (r = 0,270) и отрицательно коррелировали с чувством принадлежности к школе (r = -0,346) и мышлением высокого порядка (r =-0,205); академическая прокрастинация отрицательно коррелировала с чувством принадлежности к школе (r = -0,222) и мышлением высокого порядка (r = -0,134); а чувство принадлежности к школе положительно коррелировало с мышлением высокого порядка (r = 0,310). Полная корреляционная матрица Пирсона представлена в Таблице 6.
Проверка чувствительности с помощью коэффициента Спирмена дала одинаковую интерпретацию направления связи для всех пар переменных. Корреляции Спирмена между субъективным благополучием и четырьмя предикторами составили: ρ = -0,502 для отрицательных эмоций, ρ = -0,301 для академической прокрастинации, ρ = 0,477 для чувства принадлежности к школе и ρ = 0,392 для мышления высокого порядка. Проверенная матрица Пирсона была использована в качестве исходной числовой таблицы для визуализации. На рисунке 2A представлена полная тепловая карта корреляций для пяти переменных на уровне шкал. На рисунке 2B показаны четыре корреляции с субъективным благополучием.
Контрастная демонстрация с использованием групп с высоким и низким уровнем субъективного благополучия
Правило группировки по 27% использовалось в качестве демонстрации контрастного рабочего процесса, а не как содержательная классификация реальных профилей благополучия. В результате применения этого правила были сформированы две группы равного размера: 113 респондентов в группе с высоким субъективным благополучием и 113 в группе с низким субъективным благополучием. Оставшиеся 194 респондента из средней части выборки были сохранены в полном аналитическом наборе данных, но исключены из данного контрастного сравнения. Случаев совпадения значений на границе групп, которые могли бы изменить распределение по группам, не наблюдалось.
В данном модуле было показано, что этот рабочий процесс позволяет создавать заданную переменную группировки, фильтровать аналитический набор данных, рассчитывать описательную статистику для конкретных групп, проводить сравнения групп с учетом соответствующих допущений и экспортировать проверенную исходную таблицу для визуализации. В группе с высоким уровнем субъективного благополучия наблюдался более низкий уровень негативных эмоций по сравнению с группой с низким уровнем субъективного благополучия (1.864 ± 0.358 против 2.335 ± 0.343; средняя разность = -0.472) и более низкий уровень академической прокрастинации (2.455 ± 0.476 против 2.801 ± 0.483; средняя разность = -0.346). Чувство принадлежности к школе и мышление высокого порядка были выше в группе с высоким уровнем субъективного благополучия, при этом средние разности составили 0.454 и 0.351 соответственно. Все четыре сравнения были значимыми (p < 0.001), при этом значения d Коэна составили -1.346 для негативных эмоций, -0.722 для академической прокрастинации, 1.279 для чувства принадлежности к школе и 0.860 для мышления высокого порядка. T-критерий Уэлча использовался в случаях, когда допущение о равенстве дисперсий не подтверждалось; в противном случае применялся стандартный t-критерий для независимых выборок. Эти результаты не следует интерпретировать как доказательство того, что выбранные предикторы определяют реальные профили благополучия учащихся, поскольку группы были сформированы на основе зависимой переменной, а затем сравнивались по коррелирующим переменным. Сравнение групп с высоким и низким уровнями представлено в Таблице 7.
Описательное сравнение по полу
Пол был исследован как описательная группирующая переменная. У женщин средний показатель отрицательных эмоций был несколько выше, чем у мужчин (2,129 ± 0,380 против 2,042 ± 0,407). Эта разница была статистически значимой, но имела небольшую величину (p = 0,033; d Коэна д = 0,224). Академическая прокрастинация, чувство принадлежности к школе, мышление высокого порядка и субъективное благополучие не продемонстрировали значимых гендерных различий. Средние показатели субъективного благополучия у респондентов женского и мужского пола были практически идентичны (3,781 ± 0,521 против 3,789 ± 0,583; p = 0,887; коэффициент Коэна д = -0,015). Критерий Уэлча t-проверки чувствительности тестов не изменили интерпретацию результатов сравнения по полу. Результаты различий по полу представлены в Таблица 8.
Регрессионная модель как пример построения модели и диагностической проверки
Модель множественной линейной регрессии была использована в качестве примера построения, диагностики и проверки модели на основе данных количественной оценки опросников. В качестве зависимой переменной был введен показатель субъективного благополучия, в то время как отрицательные эмоции, академическая прокрастинация, чувство принадлежности к школе и мышление высокого порядка были одновременно введены как предикторы на уровне шкалы. Целью данного модуля была демонстрация извлечения коэффициентов, проверки на мультиколлинеарность, диагностики остатков, оценки влияния, анализа чувствительности с поправкой на демографические данные, а также подготовки рисунков и источников.
Модель объяснила умеренную долю дисперсии субъективного благополучия, при этом R2 = 0.411 и скорректированный R2 = 0.406. Отрицательные эмоции продемонстрировали наибольший отрицательный стандартизированный коэффициент (B = -0.450, стандартизированный β = -0.324). Академическая прокрастинация также показала отрицательный коэффициент (B = -0.130, стандартизированный β = -0.116). Чувство принадлежности к школе и мышление высокого порядка продемонстрировали положительные стандартизированные коэффициенты β = 0.275 и β = 0.218 соответственно. Все четыре предиктора были статистически значимыми в подогнанной модели: отрицательные эмоции, чувство принадлежности к школе и мышление высокого порядка при p < 0.001, а академическая прокрастинация при p = 0.004. Мультиколлинеарность не была выявлена, так как все значения коэффициента усиления дисперсии (VIF) были ниже 1.24. Данные результаты регрессии представляют собой примеры проверки модели, а не окончательное психологическое объяснение благополучия студентов. В Таблице 9 приведены полные результаты регрессионного анализа.
Дополнительная модель с поправкой на демографические показатели была рассчитана путем добавления пола, возраста, курса обучения, категории учебного заведения и категории основной специальности к четырем психологическим предикторам. Скорректированная модель объяснила схожую долю дисперсии: R2 = 0.427 и скорректированный R2 = 0.414. Направление и статистическая интерпретация четырех психологических предикторов остались неизменными после учета демографических поправок. Модель чувствительности с поправкой на демографические показатели обобщена в Таблице 10. На Рисунке 3A представлены стандартизированные коэффициенты и 95% доверительные интервалы для четырех предикторов. На Рисунке 3B представлен диагностический график на основе стандартизированных прогнозируемых значений, стандартизированных остатков и расстояния Кука.
Диагностика регрессии и сохранение модели
Диагностика регрессии не выявила, что построенная модель определяется одним единственным влиятельным наблюдением. На графиках бивариативной и частичной регрессии не было обнаружено выраженной нелинейности. График остатков в зависимости от предсказанных значений не показал сильной гетероскедастичности или необычной кластеризации. Статистика Дарбина-Уотсона составила 1.93, что подтверждает приемлемую независимость остатков. График квантиль-квантиль (Q-Q plot) остатков не выявил серьезных отклонений от нормального распределения. Формальный тест на нормальность остатков оказался статистически значимым, W = 0.992, p = 0.031, однако Q-Q plot и размер выборки позволили сохранить линейную модель для дескриптивного анализа ассоциаций.
Две записи имели абсолютные стандартизированные остатки более 3,00. Ни одна запись не имела расстояния Кука более 1,00. Используя более чувствительный порог расстояния Кука >4/нгде n = 420 и 4/n = 0,0095; 17 записей были отмечены как потенциально влиятельные. Наибольшее расстояние Кука составило 0,037. Отмеченные случаи с остатками и влиянием были проверены по журналу скрининга, журналу верификации баллов и критериям соответствия. Ни в одном из них не было обнаружено признаков ошибок ввода данных, неправильного подсчета баллов, дублирующих ответов, несоответствия критериям отбора или задокументированных проблем с качеством ответов; следовательно, данные случаи были сохранены в окончательной модели. Проверка чувствительности к влиянию, исключающая случаи с расстоянием Кука >4/n, что привело к такой же интерпретации рабочего процесса, как и в основной модели. Максимальное абсолютное изменение стандартизированных коэффициентов составило 0,026, а скорректированный R2 изменилось с 0,406 до 0,405. Результаты диагностики и чувствительности обобщены в Таблица 11.
Внутренняя верификация аналитического конвейера
Рабочий процесс был повторен для очищенного и оцененного аналитического набора данных с использованием тех же правил оценки, порогов принятия решений и файла трассировки анализа. Были повторно проведены анализ внутренней согласованности, расчет описательной статистики, корреляционный анализ, сравнение групп с высокими и низкими показателями, сравнение по полу, регрессионное моделирование, диагностическая проверка и подготовка исходных данных для визуализации. Повторно полученные результаты совпали с исходными данными описательной статистики, корреляционной матрицей, значениями сравнения групп, коэффициентами регрессии, результатами диагностики и исходными файлами визуализации. Это подтвердило вычислительную стабильность аналитического конвейера при применении к одному и тому же фиксированному аналитическому набору данных. Данная проверка не является независимым подтверждением процедурной воспроизводимости, которая потребовала бы от независимого аналитика применить весь рабочий процесс к фиксированному необработанному экспорту данных и получить те же задокументированные результаты.

Рисунок 1: Рабочий процесс обработки данных о субъективном благополучии, полученных с помощью опросников. На схеме представлена последовательность протокола и основные результаты аудита, включая подготовку этических аспектов, настройку опросника, проведение опроса, экспорт необработанных данных, карту шкал, журнал скрининга, итоговый аналитический набор данных с баллами, верифицированные таблицы анализа, диагностику регрессии, исходные файлы рисунков и результаты визуализации. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Структура корреляций между переменными на уровне шкал. (A) Тепловая карта корреляции Пирсона, построенная на основе проверенной корреляционной матрицы в Таблице 6. (B) Профиль корреляций с центром на субъективном благополучии, построенный на основе той же проверенной исходной таблицы. Представлены все пять переменных на уровне шкал: отрицательные эмоции, академическая прокрастинация, чувство принадлежности к школе, мышление высокого порядка и субъективное благополучие. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 3: Визуализация коэффициентов регрессии и диагностических показателей. (A) Стандартизированные коэффициенты регрессии и 95% доверительные интервалы, полученные на основе основных результатов регрессионного анализа в Таблице 9. (B) Диагностический график регрессии, построенный по стандартизированным прогнозируемым значениям, стандартизированным остаткам и значениям расстояния Кука, обобщенным в Таблице 11. Более высокие значения расстояния Кука указывают на наблюдения, которые могут оказывать большее влияние на подогнанную модель. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Таблица 1: Структура опросника и система подсчета баллов по шкале.В этой таблице обобщена система измерений, включая название конструкта, исходный инструмент, ссылку на источник, статус адаптации или документации, номер пункта, диапазон ответов, направление оценки, необходимость обратного подсчета баллов, метод подсчета, итоговую переменную уровня шкалы и роль в протоколе. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 2: Критерии скрининга ответов и принятия аналитических решений.В данной таблице перечислены заранее определенные критерии для проверки согласия, отбора подходящих участников, анализа дублирующих ответов, обработки пропущенных данных, маркировки длительности ответов, выявления однообразных ответов, диапазонов допустимых значений, оценки надежности, классификации групп с высокими и низкими показателями, диагностики регрессии и проверок чувствительности. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 3: Схема отбора от поданных анкет до окончательного аналитического набора данных. В этой таблице указано количество поданных анкет, помеченных записей, удаленных записей, сохраненных записей и источников верификации на каждом этапе отбора. Продолжительность заполнения и однотипные ответы рассматривались как признаки качества ответов, а не как критерии автоматического исключения. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 4: Демографические характеристики аналитического набора данных.В этой таблице обобщены сохраненные анонимизированные записи студентов после скрининга ответов, включая пол, возраст, курс обучения в бакалавриате, категорию учебного заведения и категорию основной специальности. Перед представлением данных ячейки с демографическими сведениями были проверены на риск косвенной идентификации личности. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 5: Описательная статистика, проверка диапазона и внутренняя согласованность пяти переменных на уровне шкал. В данной таблице представлены номер пункта, теоретический диапазон, наблюдаемый диапазон, среднее значение, стандартное отклонение, альфа Кронбаха, омега Макдональда, а также концентрация пола/потолка для отрицательных эмоций, академической прокрастинации, чувства принадлежности к школе, мышления высокого порядка и субъективного благополучия. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 6: Матрица корреляции Пирсона для переменных на уровне шкал. В этой таблице представлены коэффициенты корреляции Пирсона между отрицательными эмоциями, академической прокрастинацией, чувством принадлежности к школе, мышлением высшего порядка и субъективным благополучием. Матрица использовалась для описательного анализа взаимосвязей и в качестве этапа проверки направления подсчета баллов. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 7: Контрастивное сравнение групп с высоким и низким уровнем субъективного благополучия. В данной таблице сравниваются показатели отрицательных эмоций, академической прокрастинации, чувства принадлежности к школе и мышления высокого порядка у респондентов, вошедших в верхние 27% и нижние 27% по показателям субъективного благополучия. Данное сравнение демонстрирует рабочий процесс группировки и сопоставления, а не содержательную классификацию профилей благополучия. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 8: Описательное сравнение по полу. В данной таблице представлены результаты описательного сравнения показателей негативных эмоций, академической прокрастинации, чувства принадлежности к школе, мышления высокого порядка и субъективного благополучия в зависимости от пола. Пол рассматривался как описательная группирующая переменная. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 9: Основная модель множественной линейной регрессии для прогнозирования субъективного благополучия. В данной таблице представлена основная регрессионная модель, в которой субъективное благополучие было зависимой переменной, а отрицательные эмоции, академическая прокрастинация, чувство принадлежности к школе и мышление высокого порядка были введены одновременно в качестве предикторов на уровне шкал. Приведены значения стандартной ошибки, доверительного интервала и фактора инфляции дисперсии. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 10: Регрессионная модель анализа чувствительности с поправкой на демографические данные для прогнозирования субъективного благополучия. В этой таблице представлены четыре психологических предиктора после корректировки по полу, возрасту, курсу обучения в бакалавриате, категории учебного заведения и категории академической специальности. Категориальные демографические переменные были введены с использованием фиктивного кодирования. Включены значения стандартной ошибки, доверительного интервала и фактора инфляции дисперсии. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 11: Диагностика регрессии и проверка чувствительности влияния. В данной таблице обобщены результаты анализа остатков, влияния и диагностики модели, включая стандартизированные остатки, расстояние Кука > 1,00, расстояние Кука > 4/n, максимальное расстояние Кука, статистику Дарбина-Уотсона, график Q-Q остатков, тест на нормальность остатков, график зависимости остатков от прогнозируемых значений, проверку линейности и анализ чувствительности влияния. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Дополнительный файл 1: Структура опросника, происхождение шкал и документация по подсчету баллов.В данном дополнительном файле представлены порядок проведения опроса, формулировка информированного согласия, демографические переменные, документация по исходным инструментам, коды пунктов, опорные значения ответов, информация об адаптации и статусе документации, направление подсчета баллов, правила обратного подсчета, построение итоговых переменных на уровне шкал, правила обработки пропущенных пунктов, поля связи с качеством ответов, правила проверки диапазонов и справочные связи для пяти конструктов опросника. Файл служит дополнением к опроснику/кодовой книге для документального оформления программирования шкал, подсчета баллов и верификации в рабочем процессе. Пожалуйста, нажмите здесь, чтобы скачать этот файл.