É necessária uma assinatura do JoVE para visualizar este conteúdo. Faça login ou inicie seu teste gratuito.

Artigo de investigação

Legibilidade e Qualidade da Educação do Paciente por Modelos de Linguagem de Grande Escala para Neuralgia do Trigêmeo: Um Estudo Transversal

70 visualizações

⸱

DOI:

10.3791/70833

⸱

21 de agosto de 2026

Neste artigo

Resumo

Aqui, apresentamos um protocolo para avaliar de forma sistemática a legibilidade, adequação educacional e qualidade das informações geradas por modelos de linguagem de grande porte sobre a neuralgia do trigêmeo, com o objetivo de estabelecer parâmetros de referência para os modelos e orientar a comunicação voltada aos pacientes.

Resumo

Modelos linguísticos grandes (LLMs) estão sendo usados com frequência crescente na educação em saúde do paciente, embora a legibilidade e a qualidade educacional das informações geradas por LLMs sobre neuralgia do trigêmeo (TN) ainda não tenham sido suficientemente avaliadas. Este estudo transversal de referência comparou conteúdos educacionais sobre TN gerados por cinco LLMs disponíveis publicamente (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5). Vinte perguntas frequentes sobre TN, abrangendo conhecimentos básicos da doença, etiologia/fatores de risco, diagnóstico, tratamento e prevenção/reabilitação, foram apresentadas a cada modelo utilizando estímulos padronizados. A legibilidade foi avaliada por meio de sete índices estabelecidos, a adequação educacional foi medida com a Ferramenta de Avaliação de Materiais Educacionais para Pacientes quanto à Compreensibilidade e Capacidade de Ação (PEMAT) e a qualidade geral da informação foi determinada pelo Índice Global de Qualidade (GQS). Dois especialistas clínicos avaliaram independentemente todas as respostas, com desacordos resolvidos por um árbitro sênior. Análises estatísticas compararam o desempenho dos modelos, diferenças temáticas e correlações entre as métricas de avaliação. Foram observadas diferenças significativas entre os modelos quanto aos escores de legibilidade, PEMAT e GQS. O GPT-5 gerou as respostas mais linguisticamente complexas, mas obteve as classificações mais altas em adequação educacional e qualidade da informação. Em contraste, o Wenxin Yiyan produziu o texto mais legível, mas geralmente obteve escores mais baixos nos critérios PEMAT e GQS. A categoria do conteúdo influenciou a legibilidade, sendo os temas prevenção/reabilitação e etiologia/fatores de risco mais difíceis de ler, enquanto os escores PEMAT e GQS permaneceram relativamente consistentes entre os temas. Os índices de legibilidade mostraram forte consistência interna e correlações positivas fracas a moderadas com os escores PEMAT e GQS, enquanto PEMAT e GQS demonstraram correlação positiva moderada. Esses achados sugerem que a escolha do modelo influencia a adequação educacional e a qualidade geral da informação conforme avaliado por especialistas, enquanto a complexidade do tema afeta principalmente a legibilidade. Como a compreensão do paciente, satisfação, confiança, resultados em saúde, precisão factual e segurança clínica não foram avaliadas, esses resultados devem ser interpretados como uma análise de referência baseada na avaliação de especialistas, e não como evidência de prontidão clínica.

Introdução

A neuralgia do trigêmeo (NT) é uma síndrome de dor neuropática caracterizada por episódios recorrentes de dor facial unilateral, breve e extremamente intensa, comumente descrita como semelhante a choques elétricos ou pontadas. De acordo com a Classificação Internacional de Transtornos da Dor de Cabeça, 3ª edição (ICHD-3), a dor localiza-se tipicamente na distribuição de um ou mais ramos do nervo trigêmeo, é frequentemente de intensidade insuportável e pode ser desencadeada por estímulos inócuos, como toque leve, lavagem do rosto, escovação dos dentes, fala ou mastigação. Os ataques são marcados por início súbito e cessação abrupta, com duração variando de frações de segundo a vários minutos1,2. Embora a NT geralmente não seja ameaçadora à vida, a dor severa e imprevisível interrompe substancialmente atividades diárias essenciais, incluindo alimentação, fala, sono e regulação emocional, resultando em considerável carga psicossocial e qualidade de vida prejudicada. Evidências de revisões sistemáticas indicam que indivíduos com NT enfrentam risco significativamente elevado de depressão, ansiedade e distúrbios do sono em comparação com a população geral3,4. Em grandes estudos de coorte, aproximadamente 35–55% dos pacientes com NT apresentam sintomas clinicamente significativos de ansiedade ou depressão, e a catastrofização da dor é altamente prevalente, sugerindo uma interação bidirecional entre dor crônica severa, insônia e transtornos afetivos5,6. Estimativas epidemiológicas indicam que a prevalência da NT na população geral varia de aproximadamente 0,03% a 0,3%, com maior ocorrência entre mulheres e adultos mais velhos e variações notáveis entre regiões geográficas, grupos étnicos e faixas etárias7,8. Em países altamente povoados, como China e Índia, o envelhecimento populacional acelerado tem sido acompanhado por um aumento sustentado no número de indivíduos afetados pela NT, impondo, assim, uma carga crescente aos sistemas de saúde e destacando a necessidade de abordagens mais eficazes, escaláveis e baseadas em dados para avaliação e manejo da doença8,9.

A NT pode ser classificada em subtipos clássico, secundário e idiopático, com evidências crescentes demonstrando diferenças substanciais nos mecanismos etiológicos e nas estratégias terapêuticas entre essas categorias1,10. Estudos atuais sugerem que alterações estruturais relacionadas ao conflito neurovascular na zona de entrada da raiz do nervo trigêmeo, a hiperexcitabilidade do nervo periférico e a modulação central da dor alterada contribuem conjuntamente para a patogênese da doença11,12. As diretrizes clínicas recomendam carbamazepina e oxcarbazepina como tratamentos de primeira linha, enquanto abordagens cirúrgicas ou intervencionistas são consideradas quando a terapia farmacológica é ineficaz ou mal tolerada10. Apesar desses avanços terapêuticos, a NT caracteriza-se por um curso recidivante-remissivo, e a recorrência prolongada da dor permanece comum, dificultando a obtenção de remissão permanente13. Consequentemente, o acompanhamento a longo prazo e o manejo estruturado da doença crônica são essenciais para monitorar o risco de recorrência, a resposta ao tratamento e as complicações. Estudos longitudinais de coorte indicam que, sob estratégias padronizadas de manejo (incluindo tratamento farmacológico, intervenção cirúrgica quando indicada e acompanhamento abrangente), aproximadamente metade dos pacientes submetidos ao manejo conservador pode alcançar uma redução ≥50% na carga total da dor em até dois anos, sem progressão inevitável da doença14. Esses achados destacam a importância do engajamento contínuo do paciente e de uma educação em saúde eficaz para o manejo prolongado da doença. Evidências indicam que pacientes com melhor compreensão da etiologia, da fisiopatologia e das opções de tratamento da doença têm maior probabilidade de participar ativamente e aderir aos regimes terapêuticos, resultando em melhores desfechos15. No entanto, as abordagens tradicionais de educação em saúde frequentemente apresentam limitações quanto ao alcance e à escalabilidade. Com a ampla adoção da internet, especialmente plataformas online de perguntas e respostas e redes sociais, os pacientes dependem cada vez mais de fontes digitais para obter informações médicas16,17. Apesar disso, a variabilidade significativa na alfabetização em saúde individual e na capacidade de acessar, processar e compreender informações básicas de saúde para tomada de decisões informadas representa um grande obstáculo à educação eficaz do paciente18. Além disso, a qualidade desigual das informações de saúde online, incluindo conteúdos imprecisos ou enganosos, pode influenciar negativamente as decisões médicas e o bem-estar psicológico dos pacientes19.

As tecnologias de inteligência artificial (IA), particularmente o rápido desenvolvimento de modelos de linguagem de grande porte (MLGP) nos últimos anos, criaram novas oportunidades para a comunicação científica na área médica e para a educação em saúde20. Treinados em grandes corpora textuais, esses modelos podem gerar respostas estruturadas e logicamente coerentes por meio da interação em linguagem natural21. Sistemas internacionais representativos, como o ChatGPT, demonstraram potencial promissor para respostas a perguntas médicas, consultas a pacientes e educação médica22,23. Vários MLGP funcionalmente semelhantes surgiram na China, com cobertura de usuários e cenários de aplicação em constante expansão24. Apesar desses avanços, a aplicação de MLGP na divulgação científica médica ainda enfrenta desafios significativos, incluindo a confiabilidade dos dados de treinamento, frequência de atualização, a precisão científica das respostas geradas e a falta de validação clínica25. Além disso, diferenças entre modelos quanto ao estilo linguístico, legibilidade, estrutura lógica e precisão nas citações podem influenciar diretamente a compreensão e a confiança dos pacientes nas informações relacionadas à saúde26. Até o momento, avaliações sistemáticas do desempenho de MLGP na educação em saúde relacionada à NT têm sido limitadas.

Portanto, este estudo teve como objetivo avaliar e comparar de forma sistemática o desempenho de quatro grandes modelos linguísticos de uso comum na China (Doubao, DeepSeek, Wenxin Yiyan e Tongyi Qianwen) e um modelo linguístico internacional representativo (ChatGPT) na resposta a perguntas de educação do paciente relacionadas à nevralgia do trigêmeo (TN). Utilizando um delineamento transversal, construímos um conjunto de perguntas sobre TN com base em diretrizes clínicas e nas preocupações frequentes dos pacientes, e avaliamos as respostas geradas por cinco grandes modelos linguísticos disponíveis publicamente (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5). A legibilidade foi avaliada por meio de múltiplas métricas, e a compreensibilidade e a aplicabilidade foram analisadas utilizando a Ferramenta de Avaliação de Materiais de Educação do Paciente (PEMAT). A qualidade geral das informações foi avaliada por meio do Escore Global de Qualidade (GQS). Além disso, analisamos como diferentes temas de educação em saúde influenciam essas métricas de avaliação e suas inter-relações, com o objetivo de fornecer orientações baseadas em evidências para a seleção e otimização de grandes modelos linguísticos na comunicação clínica em saúde.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Este estudo analisou apenas texto gerado por IA e não envolveu participantes humanos, animais, espécimes biológicos, prontuários médicos, informações pessoais identificáveis ou intervenção na assistência clínica. Portanto, a análise ética e o consentimento formal não eram aplicáveis.

Desenho do estudo

Este estudo transversal avaliou a legibilidade, qualidade e adequação educacional das respostas geradas por cinco LLMs em resposta a perguntas frequentes sobre TN.

Identificação de perguntas frequentes relacionadas à NT

Em 25 de novembro de 2025, dois especialistas clínicos com ampla experiência em medicina da dor revisaram independentemente as diretrizes clínicas atuais para a neuralgia do trigêmeo (NT), incluindo a Classificação Internacional dos Transtornos da Dor de Cabeça, 3ª edição (ICHD-3), a diretriz da Academia Europeia de Neurologia e a diretriz da Academia Americana de Neurologia/Federação Europeia de Sociedades Neurológicas1,10,11. Após uma discussão de consenso, eles elaboraram uma lista de 20 perguntas relacionadas à NT frequentemente encontradas na prática clínica. O número de perguntas foi determinado a priori para proporcionar uma cobertura equilibrada dos cinco domínios temáticos pré-definidos, com quatro perguntas selecionadas para cada domínio, mantendo o número total de respostas geradas por modelo dentro de uma faixa viável para avaliação e verificação manual por especialistas. Para melhorar a reprodutibilidade, o processo de seleção seguiu uma estrutura pré-definida baseada em domínios: os especialistas identificaram primeiramente perguntas candidatas dentro de cada domínio, revisaram-nas independentemente quanto à relevância clínica, formulação centrada no paciente e ausência de redundância, e então chegaram a um consenso sobre as quatro perguntas finais por domínio. A lista final de perguntas está apresentada na Tabela 1 e no Arquivo Suplementar 1. Os cinco domínios temáticos pré-definidos foram conhecimento básico da doença, etiologia e fatores de risco, diagnóstico, tratamento, e prevenção e reabilitação. Como o conjunto de perguntas não foi derivado de registros de buscas de pacientes, consultas online ou entrevistas formais com pacientes, reconhece-se a possibilidade de viés de seleção como uma limitação do estudo.

Modelos de IA e procedimento de coleta de dados

Em 25 de novembro de 2025, o conjunto finalizado de 20 perguntas relacionadas a TN foi submetido a cinco plataformas publicamente acessíveis de modelos linguísticos grandes (LLM, na sigla em inglês): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5/ChatGPT. Todos os modelos foram acessados por meio de suas interfaces de chat padrão baseadas na web; não foi utilizado acesso por interface de programação de aplicações (API). Em cada plataforma, foi utilizado o modelo publicamente disponível padrão disponível na data da coleta de dados, sem modificação de quaisquer parâmetros de geração. Como as interfaces web públicas não exibiam identificadores de versão do modelo de back-end, prompts do sistema ocultos, temperatura, top-p, número máximo de tokens de saída ou outros parâmetros de geração, esses itens foram registrados como "não exibidos na interface web pública".

Os idiomas do prompt e da resposta foram o inglês para todos os modelos. Cada prompt padronizado consistia exclusivamente na pergunta em inglês, sem quaisquer instruções adicionais específicas ao modelo. Cada pergunta foi enviada individualmente em uma nova sessão de chat independente, sem histórico prévio de conversa, arquivos enviados, plug-ins, instruções personalizadas ou prompts de acompanhamento. A lista completa dos prompts padronizados e as respectivas saídas brutas dos modelos está fornecida no Arquivo Suplementar 1. Os metadados dos modelos e as configurações de coleta de dados são resumidos na Tabela Suplementar 1.

Avaliação da legibilidade

A legibilidade das respostas geradas por modelos de linguagem foi avaliada utilizando múltiplas fórmulas de legibilidade estabelecidas, disponíveis por meio de uma plataforma online de avaliação de legibilidade (http://readabilityformulas.com/). Diante da ausência de um padrão-ouro universalmente aceito para avaliação de legibilidade e em conformidade com estudos anteriores, empregou-se um conjunto abrangente de índices de legibilidade amplamente utilizados23,27. Sete índices foram selecionados para abranger aspectos complementares da legibilidade, incluindo comprimento da frase, comprimento da palavra, carga silábica, complexidade baseada em caracteres, facilidade de leitura e nível escolar estimado, reduzindo assim a dependência de qualquer fórmula única. Especificamente, foram calculados o Índice de Coleman-Liau (CL), a Fórmula Linsear Write (LW), o Índice de Legibilidade Automatizado (ARI), a Medida Simples de Gobbledygook (SMOG), o Índice Gunning Fog (GFOG), o Escore de Facilidade de Leitura de Flesch (FRES) e o Nível de Escolaridade Flesch-Kincaid (FKGL). Esses índices estimam a dificuldade de leitura ou o nível escolar e fornecem medidas quantitativas da legibilidade do texto (Tabela 2).

Avaliação da adequação educacional e qualidade das informações

A adequação educacional foi avaliada utilizando a Ferramenta de Avaliação de Materiais Educacionais para Pacientes (Patient Education Materials Assessment Tool, PEMAT), que compreende dois domínios: compreensibilidade e capacidade de ação28. O instrumento inclui 24 itens, sendo 16 para avaliar a compreensibilidade e oito para avaliar a capacidade de ação. Cada item foi pontuado de forma dicotômica (0 = critério não atendido; 1 = critério atendido), resultando em uma pontuação total variando de 0 a 24, em que pontuações mais altas indicam maior adequação para a educação do paciente. A qualidade geral da informação foi avaliada utilizando o Escore Global de Qualidade (Global Quality Score, GQS)27, uma escala Likert de cinco pontos amplamente utilizada para avaliar a qualidade da informação médica (Tabela 3).

Em 25 de novembro de 2025, dois especialistas clínicos com mais de três anos de experiência no manejo de TN avaliaram todas as respostas geradas por IA utilizando ambos os instrumentos de avaliação. Antes da pontuação, todas as respostas geradas por IA foram anonimizadas com identificadores codificados, e os revisores permaneceram cegos quanto à plataforma de LLM durante as avaliações PEMAT e GQS. Os desacordos foram resolvidos por um terceiro especialista sênior, que decidiu as pontuações finais. A confiabilidade entre avaliadores foi avaliada utilizando o coeficiente kappa de Cohen, em que valores >0,75 indicam concordância excelente, 0,40–0,75 indicam concordância aceitável e <0,40 indicam concordância pobre. Os valores de kappa de Cohen tanto para o PEMAT quanto para o GQS superaram 0,75, demonstrando excelente confiabilidade entre avaliadores.

Análise estatística

Todas as análises estatísticas foram realizadas utilizando o software R (versão 4.4.3). A normalidade dos dados foi avaliada por meio do teste de Shapiro-Wilk e dos gráficos Q-Q. As variáveis com distribuição normal foram resumidas como média ± desvio padrão e comparadas utilizando análise de variância unidirecional (ANOVA), seguida do teste post hoc de Tukey quando apropriado. As variáveis com distribuição não normal foram resumidas como medianas e intervalos interquartis e comparadas utilizando o teste de Kruskal-Wallis, seguido do teste post hoc de Dunn com correção de Bonferroni para comparações aos pares. As correlações entre os índices de legibilidade, os escores PEMAT e os valores GQS foram avaliadas utilizando o coeficiente de correlação de postos de Spearman, com aplicação da correção de Benjamini-Hochberg para testes múltiplos. Um valor de P ajustado bicaudal < 0,05 foi considerado estatisticamente significativo.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Este estudo avaliou sistematicamente os efeitos de modelos de linguagem grandes (LLMs) e de diferentes categorias de conteúdo educacional em saúde sobre a legibilidade e a qualidade dos textos gerados. Primeiro, comparamos o desempenho de cinco LLMs — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5 — em relação à adequação para educação do paciente, qualidade geral da informação e múltiplas métricas de legibilidade, incluindo o escore PEMAT, GQS e índices de legibilidade estabelecidos (ARI, FRES, GFOG, FKGL, CL, S...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Este estudo transversal de referência comparou de forma sistemática a legibilidade, a adequação educacional e a qualidade geral das informações em materiais educativos sobre neuralgia do trigêmeo (NT) gerados por cinco modelos de linguagem grandes (LLMs) de acesso público. Quatro principais achados emergiram. Primeiro, a legibilidade variou substancialmente entre os modelos, sendo o GPT-5 o que gerou respostas mais complexas linguisticamente, enquanto o Wenxin Yiyan produziu o conteúdo mais legível. Segundo, legibilidade...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Os autores declaram que não possuem interesses concorrentes.

Agradecimentos

Esta pesquisa não recebeu nenhuma bolsa específica de qualquer agência de fomento nos setores público, comercial ou sem fins lucrativos. Os autores agradecem aos colegas clínicos que forneceram feedback sobre o conjunto de perguntas sobre neuralgia do trigêmeo e auxiliaram no aprimoramento da estrutura de avaliação. Agradecemos também a todos os colaboradores que apoiaram a preparação e revisão do manuscrito.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Plataforma de chat DeepSeekDeepSeekhttps://chat.deepseek.com/Interface pública de modelo de linguagem de grande porte utilizada para gerar respostas
Plataforma de chat DoubaoDoubaohttps://www.doubao.com/chat/Interface pública de modelo de linguagem de grande porte utilizada para gerar respostas
GPT 5 OpenAINão aplicávelInterface pública de modelo de linguagem de grande porte utilizada para gerar respostas
Software R, versão 4.4.3Fundação R para Computação EstatísticaNão aplicávelAnálise estatística e visualização
Calculadora online de legibilidade Formulas de LegibilidadeFormulas de LegibilidadeNão aplicávelFerramenta online utilizada para calcular índices de legibilidade
Plataforma de chat Tongyi QianwenTongyi Qianwenhttps://www.tongyi.com/Interface pública de modelo de linguagem de grande porte utilizada para gerar respostas
Plataforma de chat Wenxin YiyanWenxin Yiyanhttps://yiyan.baidu.com/Interface pública de modelo de linguagem de grande porte utilizada para gerar respostas

Referências

  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Etiquetas

Modelos de Linguagem de Grande EscalaAvaliação de LegibilidadeQualidade EducacionalAvaliação PEMATGlobal Quality ScoreQualidade da Informação de SaúdeBenchmarking de ModelosCompreensão do Paciente