Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de investigación

Legibilidad y calidad de la educación al paciente generada por modelos de lenguaje extensos para la neuralgia del trigémino: un estudio transversal

70 visualizaciones

⸱

DOI:

10.3791/70833

⸱

21 de agosto de 2026

En este artículo

Resumen

Aquí presentamos un protocolo para evaluar sistemáticamente la legibilidad, adecuación educativa y calidad de la información para pacientes sobre la neuralgia del trigémino generada por modelos de lenguaje de gran tamaño, con el fin de establecer puntos de referencia para los modelos y orientar la comunicación dirigida a los pacientes.

Resumen

Los modelos de lenguaje grandes (LLM) se utilizan cada vez más para la educación sanitaria de los pacientes, aunque la legibilidad y la calidad educativa de la información generada por LLM sobre la neuralgia del trigémino (TN) no han sido evaluadas suficientemente. Este estudio transversal de referencia comparó contenidos educativos sobre TN generados por cinco LLM disponibles públicamente (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen y GPT-5). Se presentaron a cada modelo veinte preguntas frecuentes sobre TN, que abarcaban conocimientos básicos de la enfermedad, etiología/factores de riesgo, diagnóstico, tratamiento y prevención/rehabilitación, utilizando instrucciones estandarizadas. La legibilidad se evaluó mediante siete índices establecidos, la idoneidad educativa mediante la Herramienta de Evaluación de Materiales Educativos para Pacientes para Comprendibilidad y Accionabilidad (PEMAT) y la calidad general de la información mediante la Puntuación Global de Calidad (GQS). Dos expertos clínicos evaluaron de forma independiente todas las respuestas, resolviendo las discrepancias mediante un árbitro principal. Los análisis estadísticos compararon el rendimiento de los modelos, las diferencias temáticas y las correlaciones entre las métricas de evaluación. Se observaron diferencias significativas entre los modelos en las puntuaciones de legibilidad, PEMAT y GQS. GPT-5 generó las respuestas más complejas lingüísticamente, pero obtuvo las calificaciones más altas en idoneidad educativa y calidad de la información. En contraste, Wenxin Yiyan produjo el texto más legible, pero generalmente obtuvo puntuaciones más bajas en PEMAT y GQS. La categoría del contenido influyó en la legibilidad, siendo los temas de prevención/rehabilitación y etiología/factores de riesgo más difíciles de leer, mientras que PEMAT y GQS se mantuvieron relativamente constantes entre los temas. Los índices de legibilidad mostraron una fuerte consistencia interna y correlaciones positivas débiles a moderadas con PEMAT y GQS, mientras que PEMAT y GQS mostraron una correlación positiva moderada. Estos hallazgos sugieren que la selección del modelo influye en la idoneidad educativa y en la calidad general de la información valoradas por expertos, mientras que la complejidad del tema afecta principalmente a la legibilidad. Dado que no se evaluaron la comprensión del paciente, la satisfacción, la confianza, los resultados sanitarios, la precisión factual ni la seguridad clínica, estos resultados deben interpretarse como un análisis de referencia valorado por expertos, y no como evidencia de preparación clínica.

Introducción

La neuralgia del trigémino (NT) es un síndrome de dolor neuropático caracterizado por episodios recurrentes de dolor facial unilateral, breve e intensamente severo, comúnmente descrito como una descarga eléctrica o punzante. Según la Clasificación Internacional de Trastornos de Cefalea, tercera edición (ICHD-3), el dolor se localiza típicamente en la distribución de una o más ramas del nervio trigémino, suele ser insoportable en intensidad y puede desencadenarse por estímulos inócuos como el tacto ligero, el lavado facial, el cepillado dental, hablar o masticar. Los ataques se caracterizan por un inicio súbito y una cesación abrupta, con duraciones que van desde fracciones de segundo hasta varios minutos1,2. Aunque la NT generalmente no es mortal, su dolor intenso e impredecible interrumpe sustancialmente las actividades diarias esenciales, incluyendo la alimentación, el habla, el sueño y la regulación emocional, lo que provoca una carga psicosocial considerable y una calidad de vida deteriorada. Evidencia proveniente de revisiones sistemáticas indica que las personas con NT enfrentan un riesgo significativamente elevado de depresión, ansiedad y trastornos del sueño en comparación con la población general3,4. En estudios de cohortes grandes, aproximadamente entre el 35 % y el 55 % de los pacientes con NT presentan síntomas clínicamente significativos de ansiedad o depresión, y la catastrofización del dolor es altamente prevalente, lo que sugiere una interacción bidireccional entre el dolor crónico severo, el insomnio y los trastornos afectivos5,6. Las estimaciones epidemiológicas indican que la prevalencia de la NT en la población general oscila entre aproximadamente el 0,03 % y el 0,3 %, con una mayor frecuencia entre mujeres y adultos mayores, y variaciones notables entre regiones geográficas, grupos étnicos y estratos de edad7,8. En países altamente poblados, como China e India, el envejecimiento acelerado de la población ha ido acompañado de un aumento sostenido en el número de personas afectadas por NT, lo que impone una carga creciente sobre los sistemas de salud y subraya la necesidad de enfoques más eficaces, escalables y basados en datos para la evaluación y el manejo de la enfermedad8,9.

El TN puede clasificarse en subtipos clásico, secundario e idiopático, con una evidencia creciente que demuestra diferencias sustanciales en los mecanismos etiológicos y las estrategias terapéuticas entre estas categorías1,10. Estudios actuales sugieren que los cambios estructurales relacionados con el conflicto neurovascular en la zona de entrada de la raíz del nervio trigémino, la hiperexcitabilidad del nervio periférico y la modulación alterada del dolor central contribuyen conjuntamente a la patogénesis de la enfermedad11,12. Las guías clínicas recomiendan la carbamazepina y la oxcarbazepina como tratamientos de primera línea, mientras que se consideran enfoques quirúrgicos o intervencionistas cuando la terapia farmacológica resulta ineficaz o mal tolerada10. A pesar de estos avances terapéuticos, el TN se caracteriza por un curso recidivante-remisivo, y la recurrencia prolongada del dolor sigue siendo común, lo que dificulta lograr una remisión permanente13. En consecuencia, el seguimiento a largo plazo y la gestión estructurada de la enfermedad crónica son esenciales para monitorear el riesgo de recurrencia, la respuesta al tratamiento y las complicaciones. Estudios longitudinales de cohorte indican que, bajo estrategias de manejo estandarizadas (incluyendo tratamiento farmacológico, intervención quirúrgica cuando está indicada y seguimiento integral), aproximadamente la mitad de los pacientes que reciben manejo conservador pueden lograr una reducción ≥50 % en la carga total del dolor dentro de los dos años, sin progresión inevitable de la enfermedad14. Estos hallazgos subrayan la importancia de mantener el compromiso del paciente y una educación sanitaria eficaz para la gestión prolongada de la enfermedad. La evidencia sugiere que los pacientes con una mejor comprensión de la etiología, la fisiopatología y las opciones de tratamiento de la enfermedad tienen más probabilidades de participar activamente y adherirse a los regímenes terapéuticos, lo que conduce a mejores resultados15. Sin embargo, los enfoques tradicionales de educación sanitaria suelen tener alcance y escalabilidad limitados. Con la amplia adopción de internet, especialmente plataformas en línea de preguntas y respuestas y redes sociales, los pacientes dependen cada vez más de fuentes digitales para obtener información médica16,17. No obstante, la variabilidad considerable en la alfabetización en salud individual y en la capacidad de acceder, procesar y comprender información básica sobre salud para tomar decisiones informadas representa una barrera importante para una educación eficaz del paciente18. Además, la calidad desigual de la información sanitaria en línea, incluyendo contenidos inexactos o engañosos, puede influir negativamente en las decisiones médicas y el bienestar psicológico de los pacientes19.

Las tecnologías de inteligencia artificial (IA), particularmente el rápido desarrollo de modelos de lenguaje de gran tamaño (LLMs) en los últimos años, han creado nuevas oportunidades para la comunicación científica médica y la educación en salud20. Entrenados con corpus textuales a gran escala, estos modelos pueden generar respuestas estructuradas y lógicamente coherentes mediante interacciones en lenguaje natural21. Sistemas internacionales representativos, como ChatGPT, han demostrado un potencial prometedor en la respuesta a preguntas médicas, la consulta con pacientes y la educación médica22,23. Varios LLMs funcionalmente similares han surgido en China, con una cobertura de usuarios y escenarios de aplicación en continua expansión24. A pesar de estos avances, la aplicación de los LLMs en la divulgación científica médica aún enfrenta desafíos importantes, incluyendo la fiabilidad de los datos de entrenamiento, la frecuencia de actualización, la precisión científica de las respuestas generadas y la falta de validación clínica25. Además, las diferencias entre modelos en estilo lingüístico, legibilidad, estructura lógica y precisión en las citas pueden influir directamente en la comprensión y la confianza de los pacientes en la información relacionada con la salud26. Hasta la fecha, las evaluaciones sistemáticas del rendimiento de los LLMs en la educación sanitaria relacionada con TN han sido limitadas.

Por lo tanto, este estudio tuvo como objetivo evaluar y comparar sistemáticamente el desempeño de cuatro modelos lingüísticos grandes (LLM) chinos ampliamente utilizados (Doubao, DeepSeek, Wenxin Yiyan y Tongyi Qianwen) y un LLM internacional representativo (ChatGPT) al responder preguntas de educación para pacientes relacionadas con la neuralgia del trigémino (TN). Mediante un diseño transversal, construimos un conjunto de preguntas sobre TN basado en guías clínicas y preocupaciones comunes de los pacientes, y evaluamos las respuestas generadas por cinco LLM disponibles públicamente (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen y GPT-5). La legibilidad se evaluó mediante múltiples métricas, y la comprensibilidad y la capacidad de acción se analizaron utilizando la Herramienta de Evaluación de Materiales de Educación para Pacientes (PEMAT). La calidad general de la información se evaluó mediante la Puntuación Global de Calidad (GQS). Además, analizamos cómo diferentes temas de educación sanitaria influyen en estas métricas de evaluación y en sus interrelaciones, con el fin de proporcionar orientación basada en evidencia para la selección y optimización de los LLM en la comunicación clínica sobre salud.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Este estudio analizó únicamente texto generado por inteligencia artificial y no involucró a participantes humanos, animales, especímenes biológicos, historiales médicos, información personal identificable ni intervenciones en la atención clínica. Por lo tanto, no fue necesaria la revisión ética ni el consentimiento informado formal.

Diseño del estudio

Este estudio transversal evaluó la legibilidad, calidad y adecuación educativa de las respuestas generadas por cinco LLM en respuesta a preguntas frecuentes sobre la TN.

Identificación de preguntas frecuentes relacionadas con la neuralgia del trigémino

El 25 de noviembre de 2025, dos expertos clínicos con amplia experiencia en medicina del dolor revisaron de forma independiente las actuales guías clínicas para la neuralgia del trigémino (NT), incluyendo la Clasificación Internacional de Trastornos de Cefalea, tercera edición (ICHD-3), la guía de la Academia Europea de Neurología y la guía de la Academia Americana de Neurología/Federación Europea de Sociedades Neurológicas1,10,11. Tras una discusión de consenso, elaboraron una lista de 20 preguntas relacionadas con la NT comúnmente encontradas en la práctica clínica. El número de preguntas se determinó a priori para proporcionar una cobertura equilibrada de los cinco dominios temáticos predefinidos, seleccionando cuatro preguntas para cada dominio, manteniendo al mismo tiempo el número total de respuestas generadas por el modelo dentro de un rango factible para la evaluación y verificación manual por expertos. Para mejorar la reproducibilidad, el proceso de selección siguió un marco predefinido basado en dominios: los expertos primero identificaron preguntas candidatas dentro de cada dominio, las revisaron de forma independiente en cuanto a relevancia clínica, redacción orientada al paciente y evitación de redundancias, y luego alcanzaron un consenso sobre las cuatro preguntas finales por dominio. La lista final de preguntas se proporciona en Tabla 1 y Archivo Suplementario 1. Los cinco dominios temáticos predefinidos fueron conocimientos básicos sobre la enfermedad, etiología y factores de riesgo, diagnóstico, tratamiento, y prevención y rehabilitación. Dado que el conjunto de preguntas no se derivó de registros de búsquedas de pacientes, consultas en línea ni entrevistas formales con pacientes, se reconoce como una limitación del estudio el potencial de sesgo de selección.

Modelos de IA y procedimiento de recopilación de datos

El 25 de noviembre de 2025, se envió el conjunto final de 20 preguntas relacionadas con TN a cinco plataformas públicamente accesibles de modelos de lenguaje grandes (LLM, por sus siglas en inglés): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen y GPT-5/ChatGPT. Se accedió a todos los modelos a través de sus interfaces de chat web públicas estándar; no se utilizó acceso mediante interfaz de programación de aplicaciones (API). Para cada plataforma, se empleó el modelo disponible públicamente por defecto en la fecha de recopilación de datos, sin modificar ningún parámetro de generación. Dado que las interfaces web públicas no mostraban identificadores de versión del modelo del backend, indicaciones del sistema ocultas, temperatura, top-p, número máximo de tokens de salida u otros parámetros de generación, estos elementos se registraron como «no mostrados en la interfaz web pública».

Los idiomas de los prompts y las respuestas fueron inglés para todos los modelos. Cada prompt estandarizado consistió únicamente en la pregunta en inglés textual, sin instrucciones adicionales específicas para el modelo. Cada pregunta se envió individualmente en una nueva sesión de chat independiente, sin historial previo de conversación, archivos cargados, complementos, instrucciones personalizadas ni preguntas de seguimiento. La lista completa de prompts estandarizados y las salidas brutas correspondientes de los modelos se proporciona en Supplementary File 1. Los metadatos de los modelos y la configuración de recopilación de datos se resumen en Supplementary Table 1.

Evaluación de legibilidad

La legibilidad de las respuestas generadas por modelos de lenguaje de gran tamaño (LLM) se evaluó utilizando varias fórmulas de legibilidad establecidas disponibles a través de una plataforma en línea de evaluación de legibilidad (http://readabilityformulas.com/). Dado que no existe un estándar universalmente aceptado como referencia para la evaluación de la legibilidad y en concordancia con estudios previos, se empleó un conjunto integral de índices de legibilidad ampliamente utilizados23,27. Se seleccionaron siete índices para captar aspectos complementarios de la legibilidad, incluyendo la longitud de la oración, la longitud de la palabra, la carga silábica, la complejidad basada en caracteres, la facilidad de lectura y el nivel escolar estimado, reduciendo así la dependencia de una única fórmula. Específicamente, se calcularon el Índice de Coleman-Liau (CL), la Fórmula Linsear Write (LW), el Índice Automatizado de Legibilidad (ARI), la Medida Simple de Gobbledygook (SMOG), el Índice Gunning Fog (GFOG), la Puntuación de Facilidad de Lectura de Flesch (FRES) y el Nivel Escolar de Flesch-Kincaid (FKGL). Estos índices estiman la dificultad de lectura o el nivel escolar y proporcionan medidas cuantitativas de la legibilidad del texto (Tabla 2).

Evaluación de la idoneidad educativa y la calidad de la información

La adecuación educativa se evaluó utilizando la Herramienta de Evaluación de Materiales Educativos para Pacientes (Patient Education Materials Assessment Tool, PEMAT), que comprende dos dominios: comprensibilidad y capacidad de acción28. El instrumento incluye 24 ítems, de los cuales 16 evalúan la comprensibilidad y ocho evalúan la capacidad de acción. Cada ítem se puntuó de forma dicotómica (0 = criterio no cumplido; 1 = criterio cumplido), obteniéndose una puntuación total que oscila entre 0 y 24, siendo las puntuaciones más altas indicativas de una mayor adecuación para la educación del paciente. La calidad general de la información se evaluó mediante la Puntuación Global de Calidad (Global Quality Score, GQS)27, una escala tipo Likert de cinco puntos ampliamente utilizada para evaluar la calidad de la información médica (Tabla 3).

El 25 de noviembre de 2025, dos expertos clínicos con más de 3 años de experiencia en el manejo de la neuralgia del trigémino evaluaron todas las respuestas generadas por inteligencia artificial utilizando ambos instrumentos de evaluación. Antes de la calificación, todas las respuestas generadas por inteligencia artificial se anonimizaron con identificadores codificados, y los revisores permanecieron ciegos respecto a la plataforma de modelos de lenguaje de gran tamaño durante las evaluaciones del PEMAT y del GQS. Las discrepancias se resolvieron mediante un tercer experto senior, quien determinó las puntuaciones finales. La fiabilidad entre evaluadores se evaluó mediante el coeficiente kappa de Cohen, en el que valores >0,75 indican un acuerdo excelente, de 0,40 a 0,75 un acuerdo aceptable y <0,40 un acuerdo deficiente. Los valores kappa de Cohen tanto para el PEMAT como para el GQS superaron 0,75, lo que demuestra una excelente fiabilidad entre evaluadores.

Análisis estadístico

Todos los análisis estadísticos se realizaron utilizando el software R (versión 4.4.3). La normalidad de los datos se evaluó mediante la prueba de Shapiro-Wilk y gráficos Q-Q. Las variables con distribución normal se resumieron como media ± desviación estándar y se compararon mediante análisis de varianza de un factor (ANOVA), seguido de la prueba post hoc de Tukey cuando correspondía. Las variables sin distribución normal se resumieron como medianas y rangos intercuartílicos y se compararon mediante la prueba de Kruskal-Wallis, seguida de la prueba post hoc de Dunn con corrección de Bonferroni para comparaciones por pares. Las correlaciones entre los índices de legibilidad, las puntuaciones PEMAT y los valores GQS se evaluaron utilizando el coeficiente de correlación de rangos de Spearman, aplicando la corrección de Benjamini-Hochberg para pruebas múltiples. Se consideró estadísticamente significativo un valor P ajustado bilateral < 0,05.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Este estudio evaluó sistemáticamente los efectos de los modelos de lenguaje grandes (LLMs) y de diferentes categorías de contenido educativo en salud sobre la legibilidad y calidad de los textos generados. En primer lugar, comparamos el desempeño de cinco LLMs—Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen y GPT-5—en cuanto a la adecuación para la educación del paciente, la calidad general de la información y múltiples métricas de legibilidad, incluyendo la puntuación PEMAT, GQS e índices de legibilidad establecidos (ARI...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Este estudio transversal de referencia comparó sistemáticamente la legibilidad, la idoneidad educativa y la calidad general de la información en materiales educativos sobre la neuralgia del trigémino (TN) generados por cinco modelos de lenguaje grandes (LLM) disponibles públicamente. Surgieron cuatro hallazgos principales. Primero, la legibilidad varió sustancialmente entre los modelos, siendo GPT-5 el que generó las respuestas más complejas lingüísticamente, mientras que Wenxin Yiyan produjo el contenido más legible. Se...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores declaran que no tienen intereses competitivos.

Agradecimientos

Esta investigación no recibió ninguna subvención específica de ninguna agencia financiadora de los sectores público, comercial o sin fines de lucro. Los autores agradecen a los colegas clínicos que proporcionaron comentarios sobre el conjunto de preguntas relacionadas con la neuralgia del trigémino y ayudaron a perfeccionar el marco de evaluación. También agradecemos a todos los colaboradores que apoyaron la preparación y revisión del manuscrito.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Plataforma de chat DeepSeekDeepSeekhttps://chat.deepseek.com/Interfaz pública de modelo de lenguaje de gran tamaño utilizada para generar respuestas
Plataforma de chat DoubaoDoubaohttps://www.doubao.com/chat/Interfaz pública de modelo de lenguaje de gran tamaño utilizada para generar respuestas
GPT 5 OpenAINo aplicableInterfaz pública de modelo de lenguaje de gran tamaño utilizada para generar respuestas
Software R, versión 4.4.3Foundation R para la Computación EstadísticaNo aplicableAnálisis estadístico y visualización
Calculadora en línea de fórmulas de legibilidadReadability FormulasNo aplicableHerramienta en línea utilizada para calcular índices de legibilidad
Plataforma de chat Tongyi QianwenTongyi Qianwenhttps://www.tongyi.com/Interfaz pública de modelo de lenguaje de gran tamaño utilizada para generar respuestas
Plataforma de chat Wenxin YiyanWenxin Yiyanhttps://yiyan.baidu.com/Interfaz pública de modelo de lenguaje de gran tamaño utilizada para generar respuestas

Referencias

  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Modelos de lenguaje extensosevaluación de la legibilidadcalidad educativaevaluación PEMATpuntuación de calidad globalcalidad de la información sanitariaanálisis comparativo de modeloscomprensión del paciente