В данном исследовании была проведена систематическая оценка влияния больших языковых моделей (LLM) и различных категорий контента для санитарного просвещения на читабельность и качество генерируемых текстов. Во-первых, мы сравнили эффективность пяти LLM — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen и GPT-5 — с точки зрения пригодности для обучения пациентов, общего качества информации и нескольких показателей читабельности, включая оценку PEMAT, GQS и общепринятые индексы читабельности (ARI, FRES, GFOG, FKGL, CL, SMOG и LW). Во-вторых, мы изучили те же показатели результатов в пяти тематических областях медицинского просвещения: базовые знания о заболевании, этиология и факторы риска, диагностика, лечение, а также профилактика и реабилитация. Интегрируя эти два аналитических подхода, мы дополнительно исследовали, как тип модели и категория контента совместно влияют на качество и читабельность текста, выявляя тем самым систематические закономерности в материалах для обучения пациентов, созданных с помощью LLM.
Анализ удобочитаемости с использованием различных больших языковых моделей
Для систематического сравнения лингвистической сложности текстов, посвященных невралгии тройничного нерва и созданных пятью большими языковыми моделями — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen и GPT-5, — были использованы семь общепринятых индексов удобочитаемости. Общие результаты обобщены в Таблице 4, а распределения отдельных показателей удобочитаемости представлены на Рисунке 1A–G. Среди пяти моделей были наблюдаться статистически значимые различия по всем индексам удобочитаемости с P < 0.001 для каждого из них.
GPT-5 продемонстрировал самые высокие медианные значения ARI, GFOG, FKGL, CL и SMOG и самое низкое значение FRES, что указывает на генерацию текстов с более длинными структурами предложений, более сложным словарем и наибольшей общей когнитивной нагрузкой при чтении (Рисунок 1A–G). Напротив, Wenxin Yiyan продемонстрировал самую низкую лингвистическую сложность. Его медианные значения ARI, GFOG, FKGL, CL и SMOG были самыми низкими среди пяти моделей, в то время как показатель FRES был самым высоким.
Doubao, DeepSeek и Tongyi Qianwen продемонстрировали промежуточный уровень читабельности между GPT-5 и Wenxin Yiyan. Doubao и DeepSeek показали сопоставимые результаты по индексам уровней образования, включая ARI, GFOG, FKGL и CL; при этом оба имели значительно более высокие значения, чем Wenxin Yiyan, при всех P < 0.05. Эти результаты указывают на схожую общую сложность чтения для Doubao и DeepSeek, которая выше, чем у Wenxin Yiyan.
Tongyi Qianwen в целом демонстрировала значения, находящиеся между показателями Doubao/DeepSeek и GPT-5 по большинству индексов читабельности. Примечательно, что его показатель CL был ближе к значению GPT-5, что указывает на чуть большую лингвистическую сложность по сравнению с Doubao и DeepSeek, хотя он все равно оставался менее сложным, чем GPT-5. Индекс LW продемонстрировал характер распределения, отличный от других метрик читабельности. Wenxin Yiyan набрал наивысший балл LW (60.00), за которым следуют Tongyi Qianwen, DeepSeek и Doubao, в то время как GPT-5 имел самый низкий балл LW (46.50). Это расхождение отражает различия в том, как отдельные формулы читабельности оценивают длину предложения и сложность слов (Рисунок 1G).
В целом, среди пяти больших языковых моделей наблюдались существенные различия в лингвистической сложности. GPT-5 генерировала наиболее сложные с лингвистической точки зрения тексты, Wenxin Yiyan создавала наиболее доступный для чтения контент, а остальные модели демонстрировали промежуточные уровни читабельности, хотя структурные различия были очевидны.
Сравнение пригодности для обучения пациентов и общего качества различных больших языковых моделей
При оценке с помощью PEMAT были выявлены значительные различия в пригодности материалов для обучения пациентов между пятью языковыми моделями (Рисунок 1H; Таблица 4), при этом для всех P < 0.001. GPT-5 получила самый высокий балл PEMAT по оценке экспертов (9.40 ± 1.90), что указывает на более высокую пригодность для обучения в рамках данной системы сравнительного анализа. Однако этот результат не следует интерпретировать как доказательство того, что материалы, созданные GPT-5, повышают реальное понимание, удовлетворенность, доверие пациентов, их поведение в отношении здоровья или клинические исходы.
DeepSeek продемонстрировал средний балл по шкале PEMAT (6,80 ± 1,06) с относительно компактным распределением показателей, что указывает на стабильные результаты при создании материалов для обучения пациентов. Тем не менее, общая образовательная пригодность этой модели оставалась значительно ниже, чем у GPT-5 (P < 0,001). Модели Doubao, Tongyi Qianwen и Wenxin Yiyan показали более низкие баллы PEMAT (5,35 ± 1,04, 5,65 ± 1,09 и 5,35 ± 0,93 соответственно). Между этими тремя моделями не было обнаружено значимых различий, и все они показали результаты существенно хуже, чем DeepSeek и GPT-5 (все P < 0,01). Эти данные свидетельствуют о сопоставимой, но ограниченной образовательной пригодности данных моделей, особенно в отношении ясности инструкций, лингвистической организации и простоты понимания.
Аналогичная закономерность наблюдалась и для общего качества информации, оцениваемого с помощью GQS (Рисунок 1I). Между пятью моделями были выявлены статистически значимые различия, при этом во всех случаях P < 0.001. GPT-5 продемонстрировала самый высокий балл GQS (4.00 ± 0.65). Ее показатели были сосредоточены в диапазоне 4–5 с ограниченной вариабельностью, что указывает на стабильно высокую эффективность в отношении связности содержания, структурной полноты и практической полезности.
За ними следовали DeepSeek и Doubao с показателями GQS 3,35 ± 0,59 и 3,40 ± 0,50 соответственно. Распределения их баллов были сосредоточены в диапазоне от 3 до 4, что свидетельствует об умеренном качестве информации и приемлемой надежности. Напротив, Tongyi Qianwen и Wenxin Yiyan получили самые низкие баллы GQS (2,50 ± 0,51 и 2,20 ± 0,52 соответственно). Их распределения были смещены к нижнему концу шкалы, что указывает на недостатки в точности информации, структурной строгости и глубине содержания, которые могут снизить их полезность для обучения пациентов.
В целом, GPT-5 продемонстрировал самые высокие баллы по шкалам PEMAT и GQS согласно экспертной оценке в данном наборе данных, в то время как DeepSeek и Doubao показали промежуточные результаты. Tongyi Qianwen и Wenxin Yiyan получили более низкие оценки GQS. Эти результаты представляют собой данные экспертного бенчмаркинга и не должны интерпретироваться как доказательство клинической готовности или эффективности на уровне пациентов.
Сравнение читабельности, пригодности для обучения пациентов и общего качества в различных категориях образовательного контента по вопросам здравоохранения
Анализ по категориям содержания выявил значительные различия в удобочитаемости по пяти темам медицинского просвещения (Таблица 5). Для FRES были отмечены статистически значимые различия между тематическими категориями (P = 0.004). Более высокие значения FRES указывают на более легкую удобочитаемость. Тексты с базовыми знаниями о заболеваниях были наиболее удобочитаемыми (медиана = 28.50), за ними следовал контент по диагностике (медиана = 16.00), контент по этиологии и факторам риска (медиана = 12.50) и контент, связанный с лечением (медиана = 11.50). Напротив, тексты по профилактике и реабилитации продемонстрировали самую низкую удобочитаемость (медиана FRES = 1.00), что указывает на наибольшую сложность чтения.
Аналогичные закономерности наблюдались и для других индексов читабельности. Показатели GFOG и FKGL значимо различались между тематическими категориями (P = 0.002 и P = 0.036 соответственно), при этом оба индекса указывали на более высокий уровень сложности чтения для материалов по этиологии и факторам риска, а также по профилактике и реабилитации. Индекс SMOG также показал, что в текстах об этиологии и факторах риска содержится большая доля многосложных слов (P = 0.039). Наибольшие различия наблюдались для CL (P < 0.001). В текстах по профилактике и реабилитации зафиксированы самые длинные предложения (медиана = 21.01), что существенно повышало сложность чтения, в то время как в текстах с базовыми знаниями о заболевании предложения были самыми короткими (медиана = 14.88), что соответствовало наименьшей когнитивной нагрузке при чтении. Значимых различий между категориями контента для ARI или LW выявлено не было.
Статистически значимых различий в пригодности материалов для обучения пациентов между пятью категориями контента на основе показателей PEMAT выявлено не было (P = 0.252). Средние баллы PEMAT варьировались от 5.90 до 7.20, что указывает на относительную стабильность пригодности для обучения по всем темам, несмотря на заметные различия в лингвистической сложности. Аналогичным образом, общее качество информации, оцененное с помощью GQS, существенно не различалось между категориями контента (P = 0.822). Средние значения GQS составили от 2.95 до 3.25, что свидетельствует об относительной стабильности общего качества информации по всем тематическим разделам контента.
В целом, были отмечены существенные различия в доступности текстов по различным темам санитарного просвещения: наибольшая сложность чтения наблюдалась в материалах по этиологии и факторам риска, а также по профилактике и реабилитации, в то время как наиболее доступными оказались материалы, содержащие базовые знания о заболеваниях. Напротив, пригодность материалов для обучения пациентов и общее качество информации оставались относительно неизменными во всех категориях контента.
Корреляционный анализ между читабельностью, пригодностью для обучения пациентов и общим качеством
Матрица корреляции на Рисунке 2 демонстрирует стабильные и выраженные взаимосвязи между индексами удобочитаемости, что указывает на высокую внутреннюю согласованность. Большинство показателей удобочитаемости, включая ARI, GFOG, FKGL, CL и SMOG, проявили умеренную или сильную положительную корреляцию друг с другом, при этом коэффициенты корреляции варьировались от 0,64 до 0,97 (все P < 0,001). Эти результаты дополнительно подтверждают взаимодополняющий характер данных индексов при оценке лингвистической сложности. Напротив, FRES показал значимые отрицательные корреляции с несколькими показателями удобочитаемости, включая ARI, GFOG, FKGL, CL и SMOG, с абсолютными значениями коэффициентов корреляции более 0,70 (все P < 0,001). Такая закономерность отражает обратное направление шкалирования FRES, где более высокие баллы указывают на более высокую удобочитаемость. Индекс LW также продемонстрировал значимые отрицательные корреляции с другими индексами удобочитаемости, включая ARI, FKGL, GFOG и SMOG, с абсолютными коэффициентами корреляции в диапазоне от 0,75 до 0,90 (все P < 0,001). И наоборот, LW положительно коррелировал с FRES (коэффициент корреляции = 0,69, P < 0,001).
Также были отмечены четкие взаимосвязи между индексами удобочитаемости и общим качеством информации, измеренным с помощью GQS. GQS продемонстрировал слабую или умеренную положительную корреляцию с большинством показателей удобочитаемости, включая ARI, GFOG, FKGL, CL и SMOG, при этом коэффициенты корреляции варьировались от 0,326 до 0,391 (все P < 0,001). Эти результаты позволяют предположить, что большая лингвистическая сложность была связана с более высоким качеством информации по оценке экспертов. Напротив, GQS умеренно отрицательно коррелировал с FRES (коэффициент корреляции = −0,408, P < 0,001), что указывает на то, что тексты, требующие более высокого уровня чтения, в целом получали более высокие баллы GQS. GQS также показал умеренную отрицательную корреляцию с LW (коэффициент корреляции = −0,421, P < 0,001).
Связи между читабельностью и пригодностью материалов для обучения пациентов, оцененные с помощью PEMAT, в целом были более слабыми, но согласованными по направлению. Показатели PEMAT продемонстрировали слабые положительные корреляции с ARI, GFOG, FKGL, CL и SMOG, при этом коэффициенты корреляции варьировались от 0,305 до 0,434 (все P < 0,01). Напротив, показатели PEMAT были слабо отрицательно коррелированы с FRES и LW, с абсолютными коэффициентами корреляции 0,432 и 0,320 соответственно (оба P < 0,01). Эти результаты позволяют предположить, что в данном наборе данных большая лингвистическая сложность была связана с умеренно более высокой оценкой пригодности материалов для обучения, выставленной экспертами, хотя сила этих связей была ограниченной.
Важно отметить, что была наблюдаться умеренная положительная корреляция между показателями PEMAT и GQS (коэффициент корреляции = 0,645, P < 0,001). Это была самая сильная связь среди всех оцениваемых областей, что указывает на то, что ответы с более высокой образовательной пригодностью также имели тенденцию получать более высокие оценки общего качества информации.
ДОСТУПНОСТЬ ДАННЫХ:
Полный набор данных, поддерживающих данное исследование, представлен в качестве дополнительного материала. Дополнительный файл 1 содержит полный список стандартизированных вопросов, подсказок и 100 заархивированных ответов, созданных LLM. Дополнительная таблица 2 содержит экспертные листы оценки PEMAT и GQS, включая рейтинги PEMAT по отдельным пунктам (при их наличии), общие баллы PEMAT, баллы GQS, информацию о сравнении оценщиков и записи о вынесении окончательного решения в соответствующих случаях. Показатели читабельности, исходные данные для рисунков и код анализа в R представлены в Дополнительном файле 2. Поскольку результаты работы LLM могут меняться со временем из-за обновлений моделей, изменений интерфейса и модификаций на уровне платформы, для верификации и вторичного анализа следует использовать заархивированные выходные данные, а не вновь сгенерированные ответы.

Рисунок 1: Сравнение удобочитаемости, пригодности для обучения пациентов и общего качества информации пяти больших языковых моделей. (A–G) На этой панели представлены индексы удобочитаемости: автоматизированный индекс удобочитаемости (ARI), показатель легкости чтения Флеша (FRES), индекс тумана Ганнинга (GFOG), уровень класса Флеша-Кинкейда (FKGL), индекс Коулмана-Лиау (CL), простой показатель «тарабарщины» (SMOG) и формула Linsear Write (LW). (H) На этой панели показаны общие баллы PEMAT, а на панели (I) представлены общие показатели качества (GQS). На каждом боксплоте центральная линия обозначает медиану, прямоугольник указывает межквартильный размах (IQR), усы extending до 1.5 × IQR, а точки за пределами усов представляют собой выбросы. Сокращения: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch Kincaid Grade Level; CL = Coleman Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = инструмент оценки материалов для обучения пациентов по критериям понятности и применимости (Patient Education Materials Assessment Tool for Understandability and Actionability), печатный формат; Global Quality Score = GQS. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Матрица корреляции Спирмена между индексами читабельности, пригодностью для обучения пациентов и общим качеством информации для всех ответов, сгенерированных моделями. В матрице представлены коэффициенты корреляции Спирмена для попарных связей между ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT и GQS. Сокращения: ARI = Automated Readability Index (автоматизированный индекс читабельности); FRES = Flesch Reading Ease Score (показатель легкости чтения Флеша); GFOG = Gunning Fog Index (индекс «тумана» Ганнинга); FKGL = Flesch-Kincaid Grade Level (уровень сложности по Флешу-Кинкейду); CL = Coleman-Liau Index (индекс Коулмана-Лиау); SMOG = Simple Measure of Gobbledygook (простой показатель «тарабарщины»); LW = Linsear Write (индекс линейного письма); PEMAT = Patient Education Materials Assessment Tool (инструмент оценки материалов для обучения пациентов); GQS = Global Quality Score (общий показатель качества). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Таблица 1: Список из 20 вопросов, касающихся невралгии тройничного нерва. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 2: Инструменты, формулы и описания показателей читабельности. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 3: Критерии качества для глобального показателя качества (GQS). Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 4: Результаты анализа различных больших языковых моделей по наиболее распространенным вопросам, связанным с невралгией тройничного нерва. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 5: Результаты анализа по различным параметрам для наиболее распространенных вопросов, связанных с невралгией тройничного нерва. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 1: Показатели читабельности ответов, сгенерированных пятью большими языковыми моделями, по всем оцениваемым индексам читабельности. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 2: Оценки экспертов по пригодности для обучения пациентов (PEMAT) и общему качеству информации (GQS) для ответов, сгенерированных пятью большими языковыми моделями. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительный файл 1: Стандартизированные вопросы по невралгии тройничного нерва и полные ответы, сгенерированные пятью большими языковыми моделями.Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительный файл 2: Скрипты R и исходные данные, использованные для статистического анализа и построения рисунков. Пожалуйста, нажмите здесь, чтобы скачать этот файл.