В данном исследовании анализировался только текст, созданный ИИ; в нем не принимали участия люди и животные, не использовались биологические образцы, медицинские карты, идентифицируемая личная информация или вмешательство в клиническое лечение. Следовательно, этическая экспертиза и официальное информированное согласие не требовались.
Дизайн исследования
В данном одномоментном исследовании оценивались удобочитаемость, качество и образовательная пригодность ответов, сгенерированных пятью моделями LLM в ответ на часто задаваемые вопросы о TN.
Определение наиболее часто задаваемых вопросов, связанных с ТН
25 ноября 2025 года два клинических эксперта с обширным опытом в области лечения боли независимо изучили действующие клинические рекомендации по невралгии тройничного нерва (НТН), включая Международную классификацию головных болей 3-го издания (ICHD-3), рекомендации Европейской академии неврологии, а также рекомендации Американской академии неврологии/Европейской федерации неврологических обществ1,10,11. После проведения консенсусного обсуждения они составили список из 20 вопросов, связанных с НТН, которые часто встречаются в клинической практике. Количество вопросов было определено априори для обеспечения сбалансированного охвата пяти заранее заданных тематических областей (по четыре вопроса на каждую область), при этом общее количество ответов, сгенерированных моделью, должно было оставаться в пределах диапазона, допустимого для ручной экспертной оценки и верификации. Для повышения воспроизводимости процесс отбора проводился согласно заранее определенной структуре по областям: сначала эксперты определяли потенциальные вопросы в каждой области, независимо проверяли их на клиническую значимость, доступность формулировок для пациента и отсутствие избыточности, после чего приходили к консенсусу по поводу итоговых четырех вопросов для каждой области. Окончательный список вопросов приведен в Таблице 1 и Дополнительном файле 1. Пятью заранее определенными тематическими областями стали: базовые знания о заболевании, этиология и факторы риска, диагностика, лечение, а также профилактика и реабилитация. Поскольку набор вопросов не был получен из логов поиска пациентов, онлайн-запросов или формальных интервью с пациентами, возможность систематической ошибки отбора признается ограничением исследования.
Модели ИИ и процедура сбора данных
25 ноября 2025 года окончательный набор из 20 вопросов, связанных с TN, был отправлен на пять общедоступных платформ больших языковых моделей (LLM): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen и GPT-5/ChatGPT. Доступ ко всем моделям осуществлялся через их стандартные общедоступные веб-интерфейсы чатов; доступ через интерфейс прикладного программирования (API) не использовался. Для каждой платформы использовалась модель по умолчанию, доступная на дату сбора данных, без изменения каких-либо параметров генерации. Поскольку общедоступные веб-интерфейсы не отображали идентификаторы снимков (snapshots) фоновых моделей, скрытые системные промпты, температуру, top-p, максимальное количество выходных токенов или другие параметры генерации, эти пункты были отмечены как «не отображаются в общедоступном веб-интерфейсе».
Языки запросов и ответов для всех моделей были английскими. Каждый стандартизированный запрос состоял исключительно из дословного вопроса на английском языке без каких-либо дополнительных инструкций для конкретной модели. Каждый вопрос отправлялся индивидуально в новой независимой чат-сессии без предыдущей истории переписки, загруженных файлов, плагинов, пользовательских инструкций или последующих уточняющих запросов. Полный список стандартизированных запросов и соответствующие необработанные ответы моделей представлены в Дополнительном файле 1. Метаданные моделей и настройки сбора данных обобщены в Дополнительной таблице 1.
Оценка читабельности
Читабельность ответов, сгенерированных LLM, оценивали с помощью нескольких общепринятых формул читабельности, доступных на онлайн-платформе для оценки читабельности (http://readabilityformulas.com/). Ввиду отсутствия общепризнанного «золотого стандарта» оценки читабельности и в соответствии с предыдущими исследованиями был использован комплексный набор широко применяемых индексов читабельности23,27. Для охвата взаимодополняющих аспектов читабельности, включая длину предложения, длину слова, количество слогов, сложность на основе количества символов, легкость чтения и расчетный уровень образования, были выбраны семь индексов, что позволило снизить зависимость от какой-либо одной формулы. В частности, рассчитывались индекс Коулмана-Лиау (CL), формула Linsear Write (LW), автоматизированный индекс читабельности (ARI), простой показатель «тарабарщины» SMOG (SMOG), индекс Ганнинга-Фога (GFOG), показатель легкости чтения Флеша (FRES) и уровень образования по Флешу-Кинкейду (FKGL). Эти индексы позволяют оценить сложность чтения или требуемый уровень образования и предоставляют количественные показатели читабельности текста (Таблица 2).
Оценка образованной пригодности и качества информации
Пригодность материалов для обучения оценивали с помощью инструмента оценки образовательных материалов для пациентов (Patient Education Materials Assessment Tool, PEMAT), который включает две области: понятность и возможность применения на практике28. Данный инструмент содержит 24 пункта, из которых 16 оценивают понятность и восемь — возможность применения. Каждый пункт оценивался дихотомически (0 = критерий не соблюден; 1 = критерий соблюден), что давало общую сумму баллов от 0 до 24, где более высокие значения указывали на большую пригодность для обучения пациентов. Общее качество информации оценивали с помощью глобального показателя качества (Global Quality Score, GQS)27 — широко используемой пятибалльной шкалы Лайкерта для оценки качества медицинской информации (Таблица 3).
25 ноября 2025 года два клинических эксперта с опытом управления TN более 3 лет оценили все ответы, сгенерированные ИИ, с помощью обоих инструментов оценки. Перед выставлением баллов все ответы ИИ были анонимизированы с помощью кодовых идентификаторов, а рецензенты не знали, какая платформа LLM использовалась, во время проведения оценок PEMAT и GQS. Разногласия разрешались третьим старшим экспертом, который выносил окончательный вердикт по баллам. Межэкспертная надежность оценивалась с помощью коэффициента каппа Коэна, где значения >0.75 указывали на отличное согласие, 0,40–0,75 — на приемлемое согласие, а <0,40 — на низкое согласие. Значения каппа Коэна как для PEMAT, так и для GQS превысили 0,75, что продемонстрировало отличную межэкспертную надежность.
Статистический анализ
Все статистические анализы были выполнены с использованием программного обеспечения R (версия 4.4.3). Нормальность распределения данных оценивали с помощью теста Шапиро-Уилка и графиков Q-Q. Переменные с нормальным распределением представляли в виде среднего значения ± стандартного отклонения и сравнивали с помощью однофакторного дисперсионного анализа (ANOVA) с последующим апостериорным тестом Тьюки, где это было применимо. Переменные с ненормальным распределением представляли в виде медиан и межквартильных размахов и сравнивали с помощью критерия Краскела-Уоллиса с последующим апостериорным тестом Данна с поправкой Бонферрони для попарных сравнений. Корреляции между индексами читабельности, баллами PEMAT и значениями GQS оценивали с помощью коэффициента ранговой корреляции Спирмена с применением поправки Бенджамини-Хохберга для множественного тестирования. Двустороннее скорректированное значение P < 0,05 считалось статистически значимым.