Cette étude a évalué systématiquement les effets des modèles linguistiques de grande taille (LLMs) et des différentes catégories de contenu éducatif en santé sur la lisibilité et la qualité des textes générés. Premièrement, nous avons comparé les performances de cinq LLMs — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen et GPT-5 — en ce qui concerne l'adaptabilité aux patients, la qualité globale de l'information et plusieurs indicateurs de lisibilité, notamment le score PEMAT, le GQS et des indices de lisibilité établis (ARI, FRES, GFOG, FKGL, CL, SMOG et LW). Deuxièmement, nous avons examiné les mêmes mesures de résultat dans cinq domaines thématiques du contenu éducatif en santé : connaissances de base sur la maladie, étiologie et facteurs de risque, diagnostic, traitement, ainsi que prévention et réadaptation. En intégrant ces deux perspectives analytiques, nous avons approfondi la manière dont le type de modèle et la catégorie de contenu influencent conjointement la qualité et la lisibilité du texte, identifiant ainsi des motifs systématiques dans les supports éducatifs pour patients générés par les LLMs.
Analyse de la lisibilité entre différents grands modèles linguistiques
Sept indices de lisibilité établis ont été utilisés pour comparer systématiquement la complexité linguistique des textes relatifs à la névralgie du trijumeau générés par cinq grands modèles linguistiques : Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen et GPT-5. Les résultats globaux sont résumés dans le Tableau 4, et les distributions des métriques individuelles de lisibilité sont présentées dans la Figure 1A–G. Des différences statistiquement significatives ont été observées entre les cinq modèles pour tous les indices de lisibilité, avec une valeur P < 0,001 pour chacun.
GPT-5 a présenté les valeurs médianes les plus élevées pour l'ARI, le GFOG, le FKGL, le CL et le SMOG, ainsi que la valeur FRES la plus faible, indiquant qu'il a produit des textes avec des structures de phrases plus longues, un vocabulaire plus complexe et une charge de lecture globale la plus importante (Figure 1A–G). En revanche, Wenxin Yiyan a montré la complexité linguistique la plus faible. Ses valeurs médianes d'ARI, de GFOG, de FKGL, de CL et de SMOG étaient les plus basses parmi les cinq modèles, tandis que sa valeur FRES était la plus élevée.
Doubao, DeepSeek et Tongyi Qianwen ont démontré des niveaux de lisibilité intermédiaires entre GPT-5 et Wenxin Yiyan. Doubao et DeepSeek ont présenté des performances comparables selon les indices de niveau scolaire, notamment l'ARI, le GFOG, le FKGL et le CL, et les deux ont obtenu des valeurs significativement plus élevées que Wenxin Yiyan, avec dans tous les cas une P < 0,05. Ces résultats indiquent une charge de lecture globale similaire pour Doubao et DeepSeek, caractérisée par une complexité linguistique supérieure à celle de Wenxin Yiyan.
Tongyi Qianwen a généralement fourni des valeurs intermédiaires entre celles de Doubao/DeepSeek et de GPT-5 selon la plupart des indices de lisibilité. Notamment, son score CL était plus proche de celui de GPT-5, suggérant une complexité linguistique légèrement supérieure à celle de Doubao et de DeepSeek, tout en restant inférieure à celle de GPT-5. L'indice LW présentait un profil de distribution différent de celui des autres mesures de lisibilité. Wenxin Yiyan a obtenu le score LW le plus élevé (60,00), suivi par Tongyi Qianwen, DeepSeek et Doubao, tandis que GPT-5 affichait le score LW le plus bas (46,50). Cette divergence reflète les différences dans la manière dont chaque formule de lisibilité pondère la longueur des phrases et la difficulté des mots (Figure 1G).
Dans l'ensemble, des différences substantielles en matière de complexité linguistique ont été observées entre les cinq grands modèles linguistiques. GPT-5 a produit le texte le plus complexe sur le plan linguistique, Wenxin Yiyan a généré le contenu le plus lisible, et les modèles restants ont présenté des niveaux intermédiaires de lisibilité, bien que des différences structurelles soient apparentes.
Comparaison de l'adaptabilité à l'éducation des patients et de la qualité globale entre les grands modèles linguistiques
Des différences significatives en matière d'adaptabilité à l'éducation des patients, évaluée à l'aide du PEMAT, ont été observées entre les cinq modèles linguistiques (Figure 1H ; Tableau 4), avec toutes les valeurs P < 0,001. GPT-5 a obtenu le score PEMAT le plus élevé selon les experts (9,40 ± 1,90), indiquant une meilleure pertinence éducative dans le cadre actuel de référence. Toutefois, ce résultat ne doit pas être interprété comme une preuve que les documents générés par GPT-5 améliorent réellement la compréhension, la satisfaction, la confiance, les comportements de santé ou les résultats cliniques des patients.
DeepSeek a obtenu un score PEMAT intermédiaire (6,80 ± 1,06), avec une distribution des scores relativement resserrée, suggérant une performance cohérente dans la génération de documents d'éducation des patients. Néanmoins, son adéquation éducative globale est restée nettement inférieure à celle de GPT-5 (P < 0,001). Doubao, Tongyi Qianwen et Wenxin Yiyan ont obtenu des scores PEMAT plus faibles (5,35 ± 1,04, 5,65 ± 1,09 et 5,35 ± 0,93, respectivement). Aucune différence significative n’a été observée entre ces trois modèles, et tous ont performé de manière significativement inférieure à DeepSeek et GPT-5 (tous les P < 0,01). Ces résultats indiquent une adéquation éducative comparable mais limitée pour ces modèles, particulièrement en ce qui concerne la clarté des instructions, l’organisation linguistique et la facilité de compréhension.
Un schéma similaire a été observé pour la qualité globale des informations, évaluée à l'aide du SGQ (Figure 1I). Des différences statistiquement significatives ont été identifiées parmi les cinq modèles, tous avec P < 0,001. GPT-5 a obtenu le score SGQ le plus élevé (4,00 ± 0,65). Ses notes étaient concentrées dans la plage 4–5, avec une variabilité limitée, indiquant une performance constamment élevée en matière de cohérence du contenu, de complétude structurelle et d'utilité pratique.
DeepSeek et Doubao suivaient, avec des scores GQS respectifs de 3,35 ± 0,59 et 3,40 ± 0,50. Leurs distributions de scores étaient centrées entre 3 et 4, suggérant une qualité d'information modérée et une fiabilité raisonnable. En revanche, Tongyi Qianwen et Wenxin Yiyan ont obtenu les scores GQS les plus faibles (2,50 ± 0,51 et 2,20 ± 0,52, respectivement). Leurs distributions étaient décalées vers l'extrémité inférieure de l'échelle, indiquant des limites en matière de précision des informations, de rigueur structurelle et de profondeur du contenu, ce qui pourrait réduire leur utilité pour l'éducation des patients.
Dans l'ensemble, GPT-5 a obtenu les scores PEMAT et GQS les plus élevés selon les experts sur cet ensemble de données, tandis que DeepSeek et Doubao ont montré des performances intermédiaires. Tongyi Qianwen et Wenxin Yiyan ont reçu des évaluations GQS plus faibles. Ces résultats représentent des évaluations de référence réalisées par des experts et ne doivent pas être interprétés comme une preuve de préparation clinique ou d'efficacité au niveau des patients.
Comparaison de la lisibilité, de l'adaptation à l'éducation des patients et de la qualité globale entre les catégories de contenus éducatifs en santé
L'analyse par catégorie de contenu a révélé des différences significatives en matière de lisibilité entre les cinq thèmes d'éducation sanitaire (Tableau 5). Pour le score FRES, des différences statistiquement significatives ont été observées parmi les catégories thématiques (P = 0,004). Des valeurs FRES plus élevées indiquent une lisibilité plus facile. Les textes sur les connaissances de base concernant les maladies étaient les plus lisibles (médiane = 28,50), suivis par les contenus sur le diagnostic (médiane = 16,00), les causes et les facteurs de risque (médiane = 12,50) et les contenus liés au traitement (médiane = 11,50). En revanche, les textes sur la prévention et la réadaptation présentaient la plus faible lisibilité (médiane FRES = 1,00), indiquant la plus grande difficulté de lecture.
Des schémas similaires ont été observés pour les autres indices de lisibilité. Les indices GFOG et FKGL différaient significativement selon les catégories thématiques (P = 0,002 et P = 0,036, respectivement), les deux indiquant des niveaux de lecture plus élevés pour les contenus portant sur l'étiologie et les facteurs de risque, ainsi que sur la prévention et la réadaptation. L'indice SMOG suggérait également que les textes sur l'étiologie et les facteurs de risque contenaient une proportion plus importante de mots polysyllabiques (P = 0,039). Les différences les plus marquées ont été observées pour CL (P < 0,001). Les textes sur la prévention et la réadaptation présentaient les phrases les plus longues (médiane = 21,01), augmentant considérablement la difficulté de lecture, tandis que les textes sur les connaissances de base sur la maladie avaient les phrases les plus courtes (médiane = 14,88), correspondant à la charge de lecture la plus faible. Aucune différence significative n’a été observée entre les catégories de contenu pour l’ARI ou LW.
Aucune différence statistiquement significative en matière d'adéquation éducative pour les patients n'a été observée entre les cinq catégories de contenu selon les scores PEMAT (P = 0,252). Les scores moyens au PEMAT variaient de 5,90 à 7,20, indiquant qu'en dépit de différences marquées en complexité linguistique, l'adéquation éducative est restée relativement constante selon les thèmes. De même, la qualité globale de l'information, évaluée à l'aide du GQS, ne différait pas de manière significative entre les catégories de contenu (P = 0,822). Les valeurs moyennes du GQS allaient de 2,95 à 3,25, ce qui indique que la qualité globale de l'information était relativement stable selon les thèmes abordés.
Dans l'ensemble, des différences substantielles de lisibilité ont été observées selon les thèmes d'éducation à la santé, les contenus sur l'étiologie et les facteurs de risque ainsi que les contenus sur la prévention et la réadaptation présentant la plus grande difficulté de lecture, tandis que les connaissances de base sur la maladie étaient les plus faciles à lire. En revanche, l'adaptabilité de l'éducation du patient et la qualité globale de l'information sont restées relativement constantes entre les catégories de contenu.
Analyse de corrélation entre la lisibilité, l'adaptation à l'éducation du patient et la qualité globale
La matrice de corrélation de la Figure 2 montre des associations cohérentes et robustes entre les indices de lisibilité, indiquant une forte cohérence interne. La plupart des métriques de lisibilité, notamment l'ARI, le GFOG, le FKGL, le CL et le SMOG, présentaient des corrélations positives modérées à fortes entre elles, avec des coefficients de corrélation allant de 0,64 à 0,97 (tous les P < 0,001). Ces résultats confirment davantage la complémentarité de ces indices pour évaluer la complexité linguistique. En revanche, le FRES présentait des corrélations négatives significatives avec plusieurs métriques de lisibilité, notamment l'ARI, le GFOG, le FKGL, le CL et le SMOG, les coefficients de corrélation absolus étant supérieurs à 0,70 (tous les P < 0,001). Ce schéma reflète le sens inverse du score du FRES, où des valeurs plus élevées indiquent une meilleure lisibilité. L'indice LW montrait également des corrélations négatives significatives avec d'autres indices de lisibilité, notamment l'ARI, le FKGL, le GFOG et le SMOG, les coefficients de corrélation absolus variant de 0,75 à 0,90 (tous les P < 0,001). En revanche, LW était positivement corrélé avec le FRES (coefficient de corrélation = 0,69, P < 0,001).
Des associations claires ont également été observées entre les indices de lisibilité et la qualité globale de l'information, telle que mesurée par le GQS. Le GQS a démontré des corrélations positives faibles à modérées avec la plupart des indicateurs de lisibilité, notamment l'ARI, le GFOG, le FKGL, le CL et le SMOG, les coefficients de corrélation variant de 0,326 à 0,391 (tous les P < 0,001). Ces résultats suggèrent qu'une complexité linguistique plus élevée était associée à une qualité d'information supérieure selon les experts. En revanche, le GQS était modérément négativement corrélé au FRES (coefficient de corrélation = −0,408, P < 0,001), indiquant que les textes nécessitant un niveau de lecture plus élevé obtenaient généralement des notes GQS plus élevées. Le GQS présentait également une corrélation négative modérée avec le LW (coefficient de corrélation = −0,421, P < 0,001).
Les associations entre la lisibilité et l'adéquation éducative pour les patients, évaluées à l'aide du PEMAT, étaient généralement plus faibles mais cohérentes en termes de direction. Les scores PEMAT présentaient de faibles corrélations positives avec l'ARI, le GFOG, le FKGL, le CL et le SMOG, les coefficients de corrélation variant de 0,305 à 0,434 (tous P < 0,01). En revanche, les scores PEMAT étaient faiblement négativement corrélés au FRES et au LW, avec des coefficients de corrélation absolus de 0,432 et 0,320 respectivement (les deux P < 0,01). Ces résultats suggèrent que, dans ce jeu de données, une complexité linguistique plus élevée était associée à une adéquation éducative modérément plus élevée selon l'évaluation d'experts, bien que la force de ces associations soit limitée.
Il est important de noter qu'une corrélation positive modérée a été observée entre les scores PEMAT et GQS (coefficient de corrélation = 0,645, P < 0,001). Il s'agissait de l'association la plus forte observée entre les domaines d'évaluation, indiquant que les réponses présentant une pertinence éducative plus élevée avaient également tendance à obtenir des évaluations plus élevées en matière de qualité globale de l'information.
DISPONIBILITÉ DES DONNÉES :
L'ensemble complet des données à l'appui de cette étude est fourni en tant que matériel supplémentaire. Document supplémentaire 1 contient la liste complète des questions normalisées, des invites et des 100 réponses générées par les modèles linguistiques de grande taille (LLM) archivées. Tableau supplémentaire 2 contient les grilles d'évaluation expertes PEMAT et GQS, y compris les notes PEMAT par item lorsqu'elles sont disponibles, les scores totaux PEMAT, les scores GQS, les informations de comparaison entre évaluateurs et les registres d'arbitrage le cas échéant. Les scores de lisibilité, les données brutes des figures et le code d'analyse R sont fournis en tant que Document supplémentaire 2. Étant donné que les sorties des LLM peuvent évoluer au fil du temps en raison de mises à jour des modèles, de changements d'interface ou de modifications au niveau de la plateforme, les sorties archivées, plutôt que les réponses régénérées, doivent être utilisées pour la vérification et les analyses secondaires.

Figure 1: Comparaison de la lisibilité, de l'adaptation à l'éducation des patients et de la qualité globale de l'information parmi cinq grands modèles linguistiques. (A–GCe panneau présente les indices de lisibilité : indice automatisé de lisibilité (ARI), score de facilité de lecture de Flesch (FRES), indice de brouillard de Gunning (GFOG), niveau scolaire de Flesch-Kincaid (FKGL), indice de Coleman-Liau (CL), mesure simple de galimatias (SMOG) et formule de lecture de Linsear (LW). (H) Ce panneau indique les scores totaux de PEMAT, et le panneau (I) montre les scores de qualité globale (GQS). Dans chaque boîte à moustaches, la ligne centrale représente la médiane, la boîte indique l'intervalle interquartile (IQR), les moustaches s'étendent jusqu'à 1,5 × IQR, et les points au-delà des moustaches représentent les valeurs aberrantes. Abréviations : ARI = indice de lisibilité automatisé ; FRES = score de facilité de lecture de Flesch ; GFOG = indice de brouillard de Gunning ; FKGL = niveau scolaire Flesch-Kincaid ; CL = indice de Coleman-Liau ; SMOG = mesure simple de gobbledegook ; LW = Linsear Write ; PEMAT = outil d'évaluation des documents pédagogiques pour les patients (compréhensibilité et applicabilité), format imprimable ; Global Quality Score = GQS. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 2 : Matrice de corrélation de Spearman entre les indices de lisibilité, l'adaptabilité à l'éducation du patient et la qualité globale de l'information dans toutes les réponses générées par le modèle. La matrice présente les coefficients de corrélation de Spearman pour les associations par paires entre ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT et GQS. Abréviations : ARI = Automated Readability Index ; FRES = Flesch Reading Ease Score ; GFOG = Gunning Fog Index ; FKGL = Flesch-Kincaid Grade Level ; CL = Coleman-Liau Index ; SMOG = Simple Measure of Gobbledygook ; LW = Linsear Write ; PEMAT = Patient Education Materials Assessment Tool ; GQS = Global Quality Score. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
Tableau 1 : Liste de 20 questions relatives à la névralgie du trijumeau. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 2 : Outils, formules et descriptions d'accessibilité à la lecture. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 3 : Critères de qualité du score global de qualité (GQS). Veuillez cliquer ici pour télécharger ce fichier.
Tableau 4 : Résultats de l'analyse de différents grands modèles linguistiques pour les questions les plus fréquentes relatives à la névralgie du trijumeau. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 5 : Résultats d'analyse selon différentes dimensions pour les questions les plus fréquentes relatives à la névralgie du trijumeau. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 1 : Scores de lisibilité des réponses générées par les cinq grands modèles linguistiques à travers tous les indices de lisibilité évalués. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 2 : Évaluations par des experts de l'adaptabilité à l'éducation des patients (PEMAT) et de la qualité globale de l'information (GQS) pour les réponses générées par les cinq grands modèles linguistiques. Veuillez cliquer ici pour télécharger ce fichier.
Fichier supplémentaire 1 : Questions normalisées sur la névralgie du trijumeau et réponses complètes générées par les cinq grands modèles linguistiques. Veuillez cliquer ici pour télécharger ce fichier.
Fichier supplémentaire 2 : Scripts R et données sources utilisés pour les analyses statistiques et la création des figures. Veuillez cliquer ici pour télécharger ce fichier.