Afin d'étudier de manière systématique d'éventuels biomarqueurs mitochondriaux candidats associés au LLF dans le traitement de la DN, nous avons conçu un flux de travail analytique en quatre phases (Figure 1). Dans la phase I, nous avons intégré des données transcriptomiques provenant des jeux de données GSE142025 (ensemble d'apprentissage, rein entier, n=36) et GSE96804 (ensemble de validation, glomérule, n = 61) avec 1 136 gènes mitochondriaux provenant de la base de données MitoCarta 3.0 et 517 cibles prédites de 9 ingrédients actifs provenant de la base de données TCMSP. L'intersection de ces trois ensembles de gènes a permis d'identifier 9 gènes candidats. Dans la phase II, quatre modèles d'apprentissage automatique (RF, KNN, PLS et SVM) ont été appliqués pour hiérarchiser les gènes caractéristiques, en utilisant un RMSE < 0,281 comme seuil. Une validation croisée entre jeux de données, réalisée par analyse ROC (AUC > 0,7 dans les deux jeux de données), a identifié quatre biomarqueurs candidats : CAT, FABP1, MAOB et MAOA. Dans la phase III, nous avons effectué une analyse GSEA afin d'identifier les voies KEGG enrichies, une analyse d'infiltration immunitaire à l'aide de CIBERSORT, une prédiction des modifications m6A, et construit des réseaux lncRNA-miRNA-mRNA, ingrédient actif–biomarqueur, ainsi que ingrédient actif–biomarqueur–voie, suivie d'un dockage moléculaire. Dans la phase IV, les effets pharmacodynamiques du LLF et les variations de l'expression des ARNm des quatre biomarqueurs candidats ont été évalués chez un modèle murin db/db de DN.
Évaluation de gènes candidats pour le traitement de la DN par le LLF
Dans le jeu de données GSE142025, 3 810 gènes différentiellement exprimés (DEG) ont été identifiés entre les groupes DN et témoin, incluant 1 904 DEG surexprimés et 1 906 DEG sous-exprimés (Figure 2A,B). Treize principes actifs provenant du LLF ont été prédits à l’aide de la base de données TCMSP, à savoir le bêta-sitostérol, le kaempférol, la taxifoline, la lucidumoside D, la lucidumoside D_qt, le (20S)-24-ène-3,20-diol-3-acétate, l’ériodictyol, la syringarésine diglucoside_qt, la lucidusculine, l’olitoriside, l’olitoriside_qt, la lutéoline et la quercétine (Tableau 2). Quatre principes actifs — la lucidumoside D_qt, le (20S)-24-ène-3,20-diol-3-acétate, la syringarésine diglucoside_qt et l’olitoriside_qt — n’ont prédit aucun gène cible potentiel, tandis que les neuf autres principes actifs ont permis de prédire 517 gènes cibles potentiels. En croisant les 3 810 DEG, les 1 136 gènes liés au métabolisme redox (MRG) et les 517 gènes cibles potentiels, neuf gènes candidats ont été identifiés : GPX1, BAX, CASP8, MAOA, MAOB, CAT, AKR1B10, ALDH2 et FABP1 (Figure 2C). Un réseau reliant les principes actifs aux gènes candidats a ensuite été construit (Figure 2D). Ces neuf gènes candidats étaient enrichis dans 341 termes GO, incluant la réponse aux substances toxiques, le processus catabolique des composés organiques hydroxylés et la détoxification cellulaire (Figure 2E). De plus, ils étaient associés à 52 voies KEGG, telles que le métabolisme du tryptophane, les voies de neurodégénérescence et le métabolisme de l’histidine (Figure 2F).
Recherche de biomarqueurs candidats pour le traitement de la DN dans le LLF
Le réseau PPI a révélé sept nœuds et huit interactions, avec MAOA, ALDH2, MAOB et AKR1B10 interagissant (Figure 3A). Les gènes présentant des valeurs de RMSE inférieures à 0,281 dans quatre modèles d'apprentissage automatique ont été identifiés comme gènes caractéristiques : CAT, MAOB, MAOA, BAX et FABP1 (Figure 3B-E). L'analyse d'expression a montré que CAT, FABP1, MAOB et MAOA présentaient des différences significatives entre les groupes DN et témoins, et étaient cohérents dans les deux jeux de données GSE142025 et GSE96804 (Figure 3F,G). De plus, leurs valeurs d'AUC dans l'analyse des courbes ROC dépassaient 0,7 dans les deux jeux de données, indiquant que ces gènes pourraient efficacement distinguer les échantillons DN des échantillons témoins et servir de biomarqueurs candidats pour le traitement de la DN dans le LLF (Figure 4A-H).
Enrichissement significatif de biomarqueurs candidats dans les voies inflammatoires et liées au système immunitaire
L'analyse GSEA a identifié quatre biomarqueurs candidats fortement enrichis dans la voie de signalisation des chimioquines et dans les interactions cytokines-récepteurs de cytokines (Figure 5A-D). Parmi eux, la voie de signalisation de la peroxydase présentait une association significative avec CAT, MAOA et MAOB.
Corrélation de biomarqueurs candidats avec les cellules immunitaires
Des différences notables dans l'expression de neuf types de cellules immunitaires — lymphocytes B naïfs, macrophages M0, macrophages M1, macrophages M2, mastocytes activés, cellules NK activées, lymphocytes T CD4 mémoire au repos+ lymphocyte T, CD4 naïf+ lymphocyte T, et CD8+ des lymphocytes T—ont été observés entre les échantillons DN et les échantillons témoins (P < 0.05) (Figure 6A,B). Une corrélation positive significative (cor = 0,6) a été observée entre les cellules B naïves et les cellules NK activées, tandis qu'une corrélation négative significative (cor = -0,69) a été détectée entre les cellules B naïves et les mastocytes activés. (Figure 6C). Tous les biomarqueurs candidats ont présenté de fortes corrélations négatives avec les CD8+ Lymphocytes T et mastocytes activés, et corrélations positives avec les lymphocytes NK activés et les lymphocytes B naïfs (Figure 6D).
Interaction de protéines m6A modifiées clés avec des biomarqueurs candidats
La modification de la méthylation de l'ARN m6A affecte profondément la synthèse et le métabolisme de l'ARN et est impliquée dans la pathogenèse de diverses maladies29. Les emplacements des sites de modification m6A sur les biomarqueurs candidats ainsi que leurs positions à forte confiance dans les structures secondaires sont illustrés dans la Figure 7A-H. Une analyse approfondie a révélé que les protéines clés modifiées par m6A interagissant avec CAT incluaient AQR et RBM22, tandis que FABP1 interagissait à la fois avec SF3A3 et AQR. MAOA interagissait avec IGF2BP3 et IGF2BP2, et MAOB avec TIA1 (Tableau 3).
Prédictions de liaison in silico favorables pour la taxifoline, le bêta-sitostérol et l'ériodictyol dans le traitement de la DN par LLF
Dans miRNet, CAT a été prédit interagir avec 24 miARN, tandis que FABP1 était associé à cinq miARN. De plus, MAOB et MAOA étaient liés respectivement à 29 et 26 miARN. Parmi ceux-ci, 23 ARNlnc ont été identifiés dans les deux bases de données TarBase et Starbase. Un réseau régulateur ARNlnc-miARN-mARN a ensuite été construit, intégrant quatre biomarqueurs candidats, 74 miARN et 23 ARNlnc (Figure 8A). Les ingrédients actifs potentiels ciblant les biomarqueurs candidats comprenaient la lutéoline, le bêta-sitostérol, l'ériodictyol, la kaempférol, la quercétine et la taxifoline (Figure 8B). En outre, un réseau ingrédient actif-biomarqueur-voie métabolique a été établi à partir des ingrédients actifs, des biomarqueurs candidats et des cinq voies principales identifiées par l'analyse d'enrichissement des ensembles de gènes (GSEA) (Figure 8C). Par exemple, la taxifoline ciblait CAT dans la voie des peroxysomes. Les énergies de liaison entre CAT et la taxifoline (-8,8 kcal/mol), FABP1 et le bêta-sitostérol (-8,1 kcal/mol), et MAOB et l'ériodictyol (-9,8 kcal/mol) étaient toutes inférieures à -5 kcal/mol, suggérant des affinités élevées entre ces biomarqueurs candidats et leurs ingrédients actifs respectifs27. La taxifoline, le bêta-sitostérol et l'ériodictyol ont été identifiés comme des ingrédients actifs potentiels présentant des prédictions de liaison in silico favorables dans le traitement de la DN par LLF (Figure 8D-F). Toutefois, ils sont indiqués comme des constituants prédits par base de données et non comme des intermédiaires bioactifs confirmés responsables des effets observés in vivo.
Valider les biomarqueurs candidats dans le modèle murin de DN
Évaluation pharmacodynamique du LLF dans le traitement des souris atteintes de DN
Pendant la période d'administration, les taux de glucose sanguin et d'albumine microscopique urinaire chez les souris ont été surveillés (Figure 9A-D). Par rapport au groupe témoin, les taux de glucose sanguin et d'albumine microscopique urinaire dans le groupe modèle de DN étaient significativement augmentés (P < 0,01) ; par rapport au groupe modèle de DN, le glucose sanguin des souris du groupe traité a diminué de manière significative après 4 semaines d'administration (P < 0,01) et l'albumine microscopique urinaire des souris du groupe traité a diminué de manière significative après 8 semaines d'administration (P < 0,05). Ces résultats suggèrent que le LLF pourrait être bénéfique dans le traitement de la DN.
Évaluation histopathologique de l'LLF dans le traitement des souris atteintes de DN
Après coloration à l'HE, le groupe témoin présentait des structures glomérulaires nettes dans le tissu rénal. En revanche, le groupe modèle de DN montrait une pyknose nucléaire glomérulaire et une hyperchromasie, ainsi qu'une infiltration de cellules inflammatoires autour des glomérules, par rapport au groupe normal. Le traitement par LLF a atténué les lésions pathologiques rénales chez les souris db/db (Figure 9E).
Analyse par RT-PCR de l'expression de biomarqueurs candidats chez les souris atteintes de DN
Après la mise en place réussie d'un modèle murin de DN et l'observation d'une amélioration significative des symptômes suite au traitement par LLF, la RT-qPCR a été utilisée pour analyser les variations des biomarqueurs candidats. Par rapport au groupe témoin, le groupe DN présentait une expression significativement réduite de CAT et MAOA (P < 0,05 ou P < 0,001). En revanche, le groupe traité montrait une expression de CAT et MAOA significativement plus élevée que celle du groupe DN (P < 0,05). Toutefois, aucune différence statistiquement significative n'a été observée dans l'expression de MAOB et FABP1 entre les groupes (Figure 9F-I).
Disponibilité des données
Les jeux de données d'expression génique analysés dans cette étude sont accessibles publiquement à partir du Gene Expression Omnibus (GEO) sous les numéros d'accès GSE142025 et GSE96804. Les scripts R utilisés pour les analyses bioinformatiques, ainsi que les données brutes expérimentales (glycémie, microalbuminurie et données de RT-qPCR), sont fournis dans le Fichier supplémentaire 1. Toutes les autres bases de données, logiciels et ressources web utilisés dans cette étude sont répertoriés dans le Tableau des matériaux.

Figure 1: Déroulement de l'étude. ensembles de données transcriptomiques, gènes liés aux mitochondries et cibles prédits de Fructus Ligustri Lucidi ont été intégrés pour identifier les gènes candidats. Quatre algorithmes d'apprentissage automatique ont ensuite été utilisés pour hiérarchiser les gènes caractéristiques, suivis d'une validation croisée entre jeux de données, d'une caractérisation fonctionnelle et d'une validation expérimentale chez des souris db/db. Abréviations : DN = néphropathie diabétique ; DEGs = gènes différentiellement exprimés ; MRGs = gènes liés aux mitochondries ; LLF = Ligustri Lucidi Fructus ; RF = forêt aléatoire ; KNN = plus proches voisins ; PLS = moindres carrés partiels ; SVM = machine à vecteurs de support ; RMSE = erreur quadratique moyenne ; GSEA = analyse d'enrichissement des ensembles de gènes ; RT-qPCR = réaction de transcription inverse suivie d'une amplification en chaîne par polymérase en temps réel. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 2 : Analyse de criblage et caractérisation fonctionnelle des gènes candidats pour le traitement de la DN par le LLF. (A) Diagramme volcanaire montrant les gènes différentiellement exprimés entre les échantillons de DN et les témoins dans GSE142025. (B) Carte thermique des 10 gènes les plus surexprimés et des 10 gènes les plus sous-exprimés, classés selon la valeur absolue du |log2FC|. (C) Diagramme de Venn montrant l'intersection des gènes différentiellement exprimés (DEG), des gènes mitochondriaux (MRG) et des gènes cibles du LLF prédits. (D) Réseau entre ingrédients actifs et gènes candidats. (E) Analyse d'enrichissement de l'ontologie génique (Gene Ontology) des gènes candidats. La hauteur des barres représente la significativité de l'enrichissement, et le score z indique la direction prédite de la régulation fonctionnelle. (F) Analyse d'enrichissement des voies de Kyoto Encyclopedia of Genes and Genomes (KEGG) pour les gènes candidats. Abréviations : DN = néphropathie diabétique ; LLF = Ligustri Lucidi Fructus ; DEGs = gènes différentiellement exprimés ; MRGs = gènes liés aux mitochondries ; GO = ontologie génique (Gene Ontology) ; KEGG = Kyoto Encyclopedia of Genes and Genomes. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 3 : Identification par apprentissage automatique de biomarqueurs candidats. (A) Réseau d'interactions protéine-protéine des protéines codées par les gènes candidats. (B) Distribution cumulative inverse des résidus pour les modèles RF, KNN, PLS et SVM. (C) Boîtes à moustaches montrant les distributions des résidus des quatre modèles ; le point rouge indique l'erreur quadratique moyenne. (D) Importance fondée sur le RMSE des gènes candidats dans les quatre modèles d'apprentissage automatique. (E) Intersection des gènes descripteurs satisfaisant au critère RMSE < 0,281 dans les quatre modèles. (F,G) Expression des gènes descripteurs sélectionnés dans GSE142025 et GSE96804, respectivement. Abréviations : RF = forêt aléatoire ; KNN = plus proches voisins ; PLS = moindres carrés partiels ; SVM = machine à vecteurs de support ; RMSE = erreur quadratique moyenne. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 4 : Courbes caractéristiques de la performance (ROC) des quatre biomarqueurs candidats. Courbes ROC pour CAT, FABP1, MAOB et MAOA respectivement dans le jeu de données d'entraînement (A-D) GSE142025 et dans le jeu de données de validation (E-H) GSE96804. L'AUC représente la surface sous la courbe caractéristique de la performance. Abréviations : ROC = courbe caractéristique de la performance ; AUC = aire sous la courbe. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 5 : Analyse d'enrichissement des ensembles de gènes des biomarqueurs candidats. Analyse d'enrichissement des ensembles de gènes (GSEA) montrant les voies KEGG significativement enrichies associées à (A) CAT, (B) FABP1, (C) MAOA et (D) MAOB dans le jeu de données GSE142025. Abréviations : GSEA = analyse d'enrichissement des ensembles de gènes ; KEGG = Kyoto Encyclopedia of Genes and Genomes. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 6 : Infiltration des cellules immunitaires et son association avec des biomarqueurs candidats dans la DN. (A) Proportions relatives des 22 types de cellules immunitaires estimées par CIBERSORT dans les échantillons de DN et témoins. (B) Comparaison des fractions de cellules immunitaires significativement différentes entre les groupes DN et témoins. (C) Matrice de corrélation entre les types de cellules immunitaires différemment abondants. (D) Corrélations de Spearman entre l'expression de CAT, FABP1, MAOA et MAOB et les types de cellules immunitaires différemment abondants. Abréviations : DN = néphropathie diabétique. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 7 : Sites de modification m6A prédits et structures secondaires de l'ARN des transcrits biomarqueurs candidats. Sites de modification m6A prédits dans (A) CAT, (B) FABP1, (C) MAOA et (D) MAOB. Structures secondaires de l'ARN prédites, montrant les régions associées au m6A avec une forte confiance pour (E) CAT, (F) FABP1, (G) MAOA et (H) MAOB. Les régions surlignées en jaune indiquent les régions de séquence prédites contenant des sites de modification m6A. Abréviation : m6A = N6-méthyladénosine. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 8 : Réseaux régulateurs et dockage moléculaire des ingrédients actifs potentiels du LLF. (A) Réseau régulateur prédictif lncRNA–miRNA–mRNA impliquant les biomarqueurs candidats. (B) Réseau des ingrédients actifs potentiels du LLF et des biomarqueurs candidats. (C) Réseau ingrédient actif–biomarqueur–voie métabolique basé sur les résultats de l'analyse d'enrichissement des ensembles de gènes (GSEA). (D–F) Conformations de dockage moléculaire prédictives de (D) CAT avec la taxifoline, (E) FABP1 avec le bêta-sitostérol, et (F) MAOB avec l'ériodictyol. Abréviations : LLF = Ligustri Lucidi Fructus ; lncRNA = ARN non codant long ; miRNA = microARN ; GSEA = analyse d'enrichissement des ensembles de gènes. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 9 : Effets du traitement par LLF sur les indicateurs biochimiques, l'histopathologie rénale et l'expression des biomarqueurs candidats chez les souris db/db. (A,B) Niveaux de glucose sanguin au départ et à la semaine 8, respectivement. (C,D) Niveaux d'albumine microscopique urinaire au départ et à la semaine 8, respectivement. (E) Exemples de coupes rénales colorées à l'hématoxyline-éosine provenant des groupes Témoin, DN et Traitement (grossissement, ×40 ; barre d'échelle = 25 µm). (F-I) Niveaux relatifs d'expression rénale d'ARNm de Cat, Maoa, Maob et Fabp1, respectivement, mesurés par RT-qPCR. #P < 0,05, ##P < 0,01 et ###P < 0,001 par rapport au groupe Témoin ; *P < 0,05, **P < 0,01 et ***P < 0,001 par rapport au groupe DN. Abréviations : LLF = Ligustri Lucidi Fructus ; DN = néphropathie diabétique ; RT-qPCR = réaction de transcription inverse suivie d'une amplification quantitative par polymérase en chaîne. Veuillez cliquer ici pour consulter une version agrandie de cette figure.
| amorce | séquences |
| CAT F | TCACTGACGAGATGGCACAC |
| CAT R | ATCGAACGGCAATAGGGGTC |
| FABP1 F | CAATAGGTCTGCCCGAGGAC |
| FABP1 R | GTCATGGTCTCCAGTTCGCA |
| MAOB F | GCACTGAAACAGCCTCACAC |
| MAOB R | TCGTGCAGGGACATCCAAAG |
| MAOA F | ACTTACCCATTCCGTGGTGC |
| MAOA R | ACCACAGGGCAGATACCTCA |
| M-GAPDH F | CCTTCCGTGTTCCTACCCC |
| M-GAPDH R | GCCCAAGATGCCCTTCAGT |
Tableau 1 : Séquences des amorces utilisées pour l'analyse RT-qPCR des tissus rénaux de souris. Abréviations : F = amorce sens ; R = amorce antisens ; RT-qPCR = réaction de polymérase quantitative par transcription inverse.
| ID MOL | Nom de la molécule | OB (%) | DL | Nombre cible |
| MOL000358 | beta-sitosterol | 36,91 | 0,75 | 100 |
| MOL000422 | kaempferol | 41,88 | 0,24 | 103 |
| MOL004576 | taxifolin | 57,84 | 0,27 | 92 |
| MOL005146 | Lucidumoside D | 48,87 | 0,71 | 104 |
| MOL005147 | Lucidumoside D_qt | 54,41 | 0,47 | 0 |
| MOL005169 | (20S)-24-ène-3,20-diol-3-acétate | 40,23 | 0,82 | 0 |
| MOL005190 | érodichtyol | 71,79 | 0,24 | 101 |
| MOL005195 | syringarésinol diglucoside_qt | 83,12 | 0,8 | 0 |
| MOL005209 | Lucidusculine | 30,11 | 0,75 | 105 |
| MOL005211 | Olitoriside | 65,45 | 0,23 | 100 |
| MOL005212 | Olitoriside_qt | 103,23 | 0,78 | 0 |
| MOL000006 | lutéoline | 36,16 | 0,25 | 102 |
| MOL000098 | quercétine | 46,43 | 0,28 | 103 |
Tableau 2 : Treize principes actifs du Ligustri Lucidi Fructus identifiés à l'aide de la base de données TCMSP. Abréviations : OB = biodisponibilité orale ; DL = caractère proche d'un médicament.
| ARNm | Protéine | RF | SVM |
| CAT | AQR | 0.7 | 0.98 |
| CAT | RBM22 | 0.8 | 0.97 |
| FABP1 | AQR | 0.65 | 0.94 |
| FABP1 | SF3A3 | 0.7 | 0.8 |
| MAOA | IGF2BP2 | 0.75 | 0.97 |
| MAOA | IGF2BP3 | 0.75 | 0.97 |
| MAOB | TIA1 | 0.85 | 0.89 |
Tableau 3 : Interactions prédites entre quatre ARNm de biomarqueurs mitochondriaux et des protéines liant les ARN associées à la m6A. CAT, FABP1, MAOA et MAOB désignent des ARNm de biomarqueurs humains ; AQR, RBM22, SF3A3, IGF2BP2, IGF2BP3 et TIA1 désignent des protéines liant les ARN. Des scores RF et SVM > 0,5 indiquent des interactions ARN–protéine prédites. Abréviations : RF = forêt aléatoire ; SVM = machine à vecteurs de support.
Fichier supplémentaire 1. Scripts de bioinformatique et données brutes expérimentales. Cette archive contient les scripts R utilisés pour le traitement des données, l'analyse des expressions différentielles, l'enrichissement fonctionnel, l'apprentissage automatique, l'analyse des caractéristiques de fonctionnement du récepteur, l'analyse d'enrichissement des ensembles de gènes, l'analyse de corrélation de Spearman et l'analyse d'infiltration des cellules immunitaires par CIBERSORT, ainsi que les données brutes relatives à la glycémie, à la microalbuminurie et aux expériences de RT-qPCR. Veuillez cliquer ici pour télécharger ce fichier.