Este estudo analisou apenas texto gerado por IA e não envolveu participantes humanos, animais, espécimes biológicos, prontuários médicos, informações pessoais identificáveis ou intervenção na assistência clínica. Portanto, a análise ética e o consentimento formal não eram aplicáveis.
Desenho do estudo
Este estudo transversal avaliou a legibilidade, qualidade e adequação educacional das respostas geradas por cinco LLMs em resposta a perguntas frequentes sobre TN.
Identificação de perguntas frequentes relacionadas à NT
Em 25 de novembro de 2025, dois especialistas clínicos com ampla experiência em medicina da dor revisaram independentemente as diretrizes clínicas atuais para a neuralgia do trigêmeo (NT), incluindo a Classificação Internacional dos Transtornos da Dor de Cabeça, 3ª edição (ICHD-3), a diretriz da Academia Europeia de Neurologia e a diretriz da Academia Americana de Neurologia/Federação Europeia de Sociedades Neurológicas1,10,11. Após uma discussão de consenso, eles elaboraram uma lista de 20 perguntas relacionadas à NT frequentemente encontradas na prática clínica. O número de perguntas foi determinado a priori para proporcionar uma cobertura equilibrada dos cinco domínios temáticos pré-definidos, com quatro perguntas selecionadas para cada domínio, mantendo o número total de respostas geradas por modelo dentro de uma faixa viável para avaliação e verificação manual por especialistas. Para melhorar a reprodutibilidade, o processo de seleção seguiu uma estrutura pré-definida baseada em domínios: os especialistas identificaram primeiramente perguntas candidatas dentro de cada domínio, revisaram-nas independentemente quanto à relevância clínica, formulação centrada no paciente e ausência de redundância, e então chegaram a um consenso sobre as quatro perguntas finais por domínio. A lista final de perguntas está apresentada na Tabela 1 e no Arquivo Suplementar 1. Os cinco domínios temáticos pré-definidos foram conhecimento básico da doença, etiologia e fatores de risco, diagnóstico, tratamento, e prevenção e reabilitação. Como o conjunto de perguntas não foi derivado de registros de buscas de pacientes, consultas online ou entrevistas formais com pacientes, reconhece-se a possibilidade de viés de seleção como uma limitação do estudo.
Modelos de IA e procedimento de coleta de dados
Em 25 de novembro de 2025, o conjunto finalizado de 20 perguntas relacionadas a TN foi submetido a cinco plataformas publicamente acessíveis de modelos linguísticos grandes (LLM, na sigla em inglês): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5/ChatGPT. Todos os modelos foram acessados por meio de suas interfaces de chat padrão baseadas na web; não foi utilizado acesso por interface de programação de aplicações (API). Em cada plataforma, foi utilizado o modelo publicamente disponível padrão disponível na data da coleta de dados, sem modificação de quaisquer parâmetros de geração. Como as interfaces web públicas não exibiam identificadores de versão do modelo de back-end, prompts do sistema ocultos, temperatura, top-p, número máximo de tokens de saída ou outros parâmetros de geração, esses itens foram registrados como "não exibidos na interface web pública".
Os idiomas do prompt e da resposta foram o inglês para todos os modelos. Cada prompt padronizado consistia exclusivamente na pergunta em inglês, sem quaisquer instruções adicionais específicas ao modelo. Cada pergunta foi enviada individualmente em uma nova sessão de chat independente, sem histórico prévio de conversa, arquivos enviados, plug-ins, instruções personalizadas ou prompts de acompanhamento. A lista completa dos prompts padronizados e as respectivas saídas brutas dos modelos está fornecida no Arquivo Suplementar 1. Os metadados dos modelos e as configurações de coleta de dados são resumidos na Tabela Suplementar 1.
Avaliação da legibilidade
A legibilidade das respostas geradas por modelos de linguagem foi avaliada utilizando múltiplas fórmulas de legibilidade estabelecidas, disponíveis por meio de uma plataforma online de avaliação de legibilidade (http://readabilityformulas.com/). Diante da ausência de um padrão-ouro universalmente aceito para avaliação de legibilidade e em conformidade com estudos anteriores, empregou-se um conjunto abrangente de índices de legibilidade amplamente utilizados23,27. Sete índices foram selecionados para abranger aspectos complementares da legibilidade, incluindo comprimento da frase, comprimento da palavra, carga silábica, complexidade baseada em caracteres, facilidade de leitura e nível escolar estimado, reduzindo assim a dependência de qualquer fórmula única. Especificamente, foram calculados o Índice de Coleman-Liau (CL), a Fórmula Linsear Write (LW), o Índice de Legibilidade Automatizado (ARI), a Medida Simples de Gobbledygook (SMOG), o Índice Gunning Fog (GFOG), o Escore de Facilidade de Leitura de Flesch (FRES) e o Nível de Escolaridade Flesch-Kincaid (FKGL). Esses índices estimam a dificuldade de leitura ou o nível escolar e fornecem medidas quantitativas da legibilidade do texto (Tabela 2).
Avaliação da adequação educacional e qualidade das informações
A adequação educacional foi avaliada utilizando a Ferramenta de Avaliação de Materiais Educacionais para Pacientes (Patient Education Materials Assessment Tool, PEMAT), que compreende dois domínios: compreensibilidade e capacidade de ação28. O instrumento inclui 24 itens, sendo 16 para avaliar a compreensibilidade e oito para avaliar a capacidade de ação. Cada item foi pontuado de forma dicotômica (0 = critério não atendido; 1 = critério atendido), resultando em uma pontuação total variando de 0 a 24, em que pontuações mais altas indicam maior adequação para a educação do paciente. A qualidade geral da informação foi avaliada utilizando o Escore Global de Qualidade (Global Quality Score, GQS)27, uma escala Likert de cinco pontos amplamente utilizada para avaliar a qualidade da informação médica (Tabela 3).
Em 25 de novembro de 2025, dois especialistas clínicos com mais de três anos de experiência no manejo de TN avaliaram todas as respostas geradas por IA utilizando ambos os instrumentos de avaliação. Antes da pontuação, todas as respostas geradas por IA foram anonimizadas com identificadores codificados, e os revisores permaneceram cegos quanto à plataforma de LLM durante as avaliações PEMAT e GQS. Os desacordos foram resolvidos por um terceiro especialista sênior, que decidiu as pontuações finais. A confiabilidade entre avaliadores foi avaliada utilizando o coeficiente kappa de Cohen, em que valores >0,75 indicam concordância excelente, 0,40–0,75 indicam concordância aceitável e <0,40 indicam concordância pobre. Os valores de kappa de Cohen tanto para o PEMAT quanto para o GQS superaram 0,75, demonstrando excelente confiabilidade entre avaliadores.
Análise estatística
Todas as análises estatísticas foram realizadas utilizando o software R (versão 4.4.3). A normalidade dos dados foi avaliada por meio do teste de Shapiro-Wilk e dos gráficos Q-Q. As variáveis com distribuição normal foram resumidas como média ± desvio padrão e comparadas utilizando análise de variância unidirecional (ANOVA), seguida do teste post hoc de Tukey quando apropriado. As variáveis com distribuição não normal foram resumidas como medianas e intervalos interquartis e comparadas utilizando o teste de Kruskal-Wallis, seguido do teste post hoc de Dunn com correção de Bonferroni para comparações aos pares. As correlações entre os índices de legibilidade, os escores PEMAT e os valores GQS foram avaliadas utilizando o coeficiente de correlação de postos de Spearman, com aplicação da correção de Benjamini-Hochberg para testes múltiplos. Um valor de P ajustado bicaudal < 0,05 foi considerado estatisticamente significativo.