$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
En raison de ses nombreuses utilisations potentielles, telles que la classification des composés, la sélection des composés, l’exploration des liens structure-activité et la navigation à travers les interactions structure-propriété, le concept d’espace chimique est aujourd’hui largement utilisé dans le processus de découverte et de développement de médicaments14. De plus, la création de bases de données NP est une procédure fondamentale pour effectuer diverses études informatiques, y compris la conception de chimiothèques, la caractérisation et la comparaison de l’espace chimique, l’étude du SAR et le criblage virtuel, entre autres études, en raison de l’augmentation de la quantité d’informations chimiques. En revanche, l’entraînement aux algorithmes d’intelligence artificielle (IA) est une autre application cruciale. L’IA fait référence à un groupe de techniques informatiques qui permettent aux machines d’imiter les processus cognitifs humains, y compris la résolution de problèmes et l’apprentissage par l’expérience15,16.
Bien que les bases de données sur les composés chimiques, y compris les bases de données NP, soient des outils importants dans la découverte de médicaments, il est également possible de détecter des molécules potentiellement touchées à l’aide de diverses techniques de criblage virtuel17. De plus, plusieurs candidats médicaments ont été trouvés dans les bases de données NP qui ont le potentiel de traiter des maladies, notamment la maladie à coronavirus18, la maladie d’Alzheimer19 et la leishmaniose20, entre autres. Cependant, en raison des contraintes actuelles dans le traitement des « mégadonnées », l’espace chimique de toutes les molécules potentielles dans un échantillon biologique ou environnemental particulier peut être extrêmement vaste et la plupart du temps inexploré21. Bien qu’il n’existe pas de techniques uniques ou universelles pour les représentations chimiques de l’espace, une méthode largement utilisée consiste à créer des matrices de similarité qui incluent toutes les comparaisons par paires22. La majorité des informations pertinentes peuvent être réduites en un petit nombre de variables (bien que des informations soient perdues) à l’aide de l’ACP et d’autres techniques de réduction de la dimensionnalité, ce qui permet de visualiser l’espace chimique23.
La diversité d’une chimiothèque peut être évaluée de diverses façons, en grande partie en fonction des données examinées et, surtout, de l’objectif de l’étude. La représentation moléculaire est un élément crucial de l’analyse de la diversité, en plus de la mesure de la diversité24. Bien que les échafaudages chimiques et les descripteurs moléculaires soient les deux approches utilisées pour représenter les molécules le plus fréquemment dans l’analyse chimioinformatique, certaines d’entre elles ont l’inconvénient d’être plus difficiles à comprendre25 et n’identifient pas nécessairement les collections ; Par exemple, il est typique que divers composés aient des profils de propriétés extrêmement comparables. Par conséquent, la prise en compte de diverses représentations de structures offre une image plus complète de la diversité des bibliothèques de composés. C’est la base du concept de multivers chimique, qui peut être défini comme un groupe ou une collection d’espaces chimiques pour le même ensemble de données, chacun défini par un ensemble de descripteurs26.
Étant donné que les CDP utilisent de multiples représentations qui peuvent être divisées en trois ou deux dimensions pour analyser la diversité mondiale des ensembles de données sur les composés à l’aide d’une variété de métriques, ils permettent de comparer et de catégoriser les bibliothèques chimiques12.