Este estudio analizó únicamente texto generado por inteligencia artificial y no involucró a participantes humanos, animales, especímenes biológicos, historiales médicos, información personal identificable ni intervenciones en la atención clínica. Por lo tanto, no fue necesaria la revisión ética ni el consentimiento informado formal.
Diseño del estudio
Este estudio transversal evaluó la legibilidad, calidad y adecuación educativa de las respuestas generadas por cinco LLM en respuesta a preguntas frecuentes sobre la TN.
Identificación de preguntas frecuentes relacionadas con la neuralgia del trigémino
El 25 de noviembre de 2025, dos expertos clínicos con amplia experiencia en medicina del dolor revisaron de forma independiente las actuales guías clínicas para la neuralgia del trigémino (NT), incluyendo la Clasificación Internacional de Trastornos de Cefalea, tercera edición (ICHD-3), la guía de la Academia Europea de Neurología y la guía de la Academia Americana de Neurología/Federación Europea de Sociedades Neurológicas1,10,11. Tras una discusión de consenso, elaboraron una lista de 20 preguntas relacionadas con la NT comúnmente encontradas en la práctica clínica. El número de preguntas se determinó a priori para proporcionar una cobertura equilibrada de los cinco dominios temáticos predefinidos, seleccionando cuatro preguntas para cada dominio, manteniendo al mismo tiempo el número total de respuestas generadas por el modelo dentro de un rango factible para la evaluación y verificación manual por expertos. Para mejorar la reproducibilidad, el proceso de selección siguió un marco predefinido basado en dominios: los expertos primero identificaron preguntas candidatas dentro de cada dominio, las revisaron de forma independiente en cuanto a relevancia clínica, redacción orientada al paciente y evitación de redundancias, y luego alcanzaron un consenso sobre las cuatro preguntas finales por dominio. La lista final de preguntas se proporciona en Tabla 1 y Archivo Suplementario 1. Los cinco dominios temáticos predefinidos fueron conocimientos básicos sobre la enfermedad, etiología y factores de riesgo, diagnóstico, tratamiento, y prevención y rehabilitación. Dado que el conjunto de preguntas no se derivó de registros de búsquedas de pacientes, consultas en línea ni entrevistas formales con pacientes, se reconoce como una limitación del estudio el potencial de sesgo de selección.
Modelos de IA y procedimiento de recopilación de datos
El 25 de noviembre de 2025, se envió el conjunto final de 20 preguntas relacionadas con TN a cinco plataformas públicamente accesibles de modelos de lenguaje grandes (LLM, por sus siglas en inglés): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen y GPT-5/ChatGPT. Se accedió a todos los modelos a través de sus interfaces de chat web públicas estándar; no se utilizó acceso mediante interfaz de programación de aplicaciones (API). Para cada plataforma, se empleó el modelo disponible públicamente por defecto en la fecha de recopilación de datos, sin modificar ningún parámetro de generación. Dado que las interfaces web públicas no mostraban identificadores de versión del modelo del backend, indicaciones del sistema ocultas, temperatura, top-p, número máximo de tokens de salida u otros parámetros de generación, estos elementos se registraron como «no mostrados en la interfaz web pública».
Los idiomas de los prompts y las respuestas fueron inglés para todos los modelos. Cada prompt estandarizado consistió únicamente en la pregunta en inglés textual, sin instrucciones adicionales específicas para el modelo. Cada pregunta se envió individualmente en una nueva sesión de chat independiente, sin historial previo de conversación, archivos cargados, complementos, instrucciones personalizadas ni preguntas de seguimiento. La lista completa de prompts estandarizados y las salidas brutas correspondientes de los modelos se proporciona en Supplementary File 1. Los metadatos de los modelos y la configuración de recopilación de datos se resumen en Supplementary Table 1.
Evaluación de legibilidad
La legibilidad de las respuestas generadas por modelos de lenguaje de gran tamaño (LLM) se evaluó utilizando varias fórmulas de legibilidad establecidas disponibles a través de una plataforma en línea de evaluación de legibilidad (http://readabilityformulas.com/). Dado que no existe un estándar universalmente aceptado como referencia para la evaluación de la legibilidad y en concordancia con estudios previos, se empleó un conjunto integral de índices de legibilidad ampliamente utilizados23,27. Se seleccionaron siete índices para captar aspectos complementarios de la legibilidad, incluyendo la longitud de la oración, la longitud de la palabra, la carga silábica, la complejidad basada en caracteres, la facilidad de lectura y el nivel escolar estimado, reduciendo así la dependencia de una única fórmula. Específicamente, se calcularon el Índice de Coleman-Liau (CL), la Fórmula Linsear Write (LW), el Índice Automatizado de Legibilidad (ARI), la Medida Simple de Gobbledygook (SMOG), el Índice Gunning Fog (GFOG), la Puntuación de Facilidad de Lectura de Flesch (FRES) y el Nivel Escolar de Flesch-Kincaid (FKGL). Estos índices estiman la dificultad de lectura o el nivel escolar y proporcionan medidas cuantitativas de la legibilidad del texto (Tabla 2).
Evaluación de la idoneidad educativa y la calidad de la información
La adecuación educativa se evaluó utilizando la Herramienta de Evaluación de Materiales Educativos para Pacientes (Patient Education Materials Assessment Tool, PEMAT), que comprende dos dominios: comprensibilidad y capacidad de acción28. El instrumento incluye 24 ítems, de los cuales 16 evalúan la comprensibilidad y ocho evalúan la capacidad de acción. Cada ítem se puntuó de forma dicotómica (0 = criterio no cumplido; 1 = criterio cumplido), obteniéndose una puntuación total que oscila entre 0 y 24, siendo las puntuaciones más altas indicativas de una mayor adecuación para la educación del paciente. La calidad general de la información se evaluó mediante la Puntuación Global de Calidad (Global Quality Score, GQS)27, una escala tipo Likert de cinco puntos ampliamente utilizada para evaluar la calidad de la información médica (Tabla 3).
El 25 de noviembre de 2025, dos expertos clínicos con más de 3 años de experiencia en el manejo de la neuralgia del trigémino evaluaron todas las respuestas generadas por inteligencia artificial utilizando ambos instrumentos de evaluación. Antes de la calificación, todas las respuestas generadas por inteligencia artificial se anonimizaron con identificadores codificados, y los revisores permanecieron ciegos respecto a la plataforma de modelos de lenguaje de gran tamaño durante las evaluaciones del PEMAT y del GQS. Las discrepancias se resolvieron mediante un tercer experto senior, quien determinó las puntuaciones finales. La fiabilidad entre evaluadores se evaluó mediante el coeficiente kappa de Cohen, en el que valores >0,75 indican un acuerdo excelente, de 0,40 a 0,75 un acuerdo aceptable y <0,40 un acuerdo deficiente. Los valores kappa de Cohen tanto para el PEMAT como para el GQS superaron 0,75, lo que demuestra una excelente fiabilidad entre evaluadores.
Análisis estadístico
Todos los análisis estadísticos se realizaron utilizando el software R (versión 4.4.3). La normalidad de los datos se evaluó mediante la prueba de Shapiro-Wilk y gráficos Q-Q. Las variables con distribución normal se resumieron como media ± desviación estándar y se compararon mediante análisis de varianza de un factor (ANOVA), seguido de la prueba post hoc de Tukey cuando correspondía. Las variables sin distribución normal se resumieron como medianas y rangos intercuartílicos y se compararon mediante la prueba de Kruskal-Wallis, seguida de la prueba post hoc de Dunn con corrección de Bonferroni para comparaciones por pares. Las correlaciones entre los índices de legibilidad, las puntuaciones PEMAT y los valores GQS se evaluaron utilizando el coeficiente de correlación de rangos de Spearman, aplicando la corrección de Benjamini-Hochberg para pruebas múltiples. Se consideró estadísticamente significativo un valor P ajustado bilateral < 0,05.