Natuurlijke producten (NP's), dit zijn chemische verbindingen die door levende wezens worden gemaakt, worden al eeuwenlang gebruikt als traditionele behandelingen. Individuele NP's zijn in de moderne tijd gemaakt als medicijnen en met succes geëxploiteerd als leidende verbindingen bij het ontdekken van geneesmiddelen1. Mariene, schimmel-, bacteriële, plantaardige en endogene stoffen die door mens en dier worden gemaakt, zijn opgenomen in de categorie bioactieve stoffen, evenals gif en gif dat door verschillende dieren wordt geproduceerd2. Als gevolg hiervan vormde het aantal medicijnen dat door NP's werd gemaakt veertig jaar lang een belangrijke bron van nieuwe farmacologische stoffen3, waarbij wordt benadrukt dat NP's cruciaal zijn geweest bij de ontwikkeling van nieuwe medicijnen, met name voor de behandeling van kanker en infectieziekten, evenals voor andere therapeutische aandoeningen zoals multiple sclerose en hart- en vaatziekten4. Bovendien waren 64,9% van de 185 kleine verbindingen die tussen 1981 en 2019 werden toegelaten voor de behandeling van kanker, ongemodificeerde NP's of synthetische geneesmiddelen met een NP-farmacofoor3.
Chemo-informatica, een gevestigde interdiscipline die berust op het concept van chemische ruimte, is gebruikt om de chemische ruimte van de fysisch-chemische kwaliteiten van NP's te analyseren en te visualiseren die verband houden met geneesmiddelachtige eigenschappen5. Chemo-informatica heeft een substantiële impact aangetoond op het ontwerp en de ontdekking van geneesmiddelen op basis van NP's6. De chemische ruimte van een groep verbindingen is niet altijd uniek. Het zal afhangen van de verzameling descriptoren die worden gebruikt om het te definiëren, wat betekent dat het bestuderen van de chemische ruimte van NP's, net als elke andere set verbindingen, bijzondere uitdagingen met zich meebrengt die berusten op moleculaire representatie7. Dit streven kan worden benaderd met behulp van een verscheidenheid aan moleculaire descriptoren en datavisualisatietechnieken. De meest gebruikte technieken daarentegen zijn hoofdcomponentenanalyse (PCA), steigerbomen, zelforganiserende kaarten, generatieve topografische kartering (GTM) en een nieuwe visualisatietechniek die boomkaarten (TMAP's) wordt genoemd8. Ook het verzamelen, evalueren en verspreiden van de chemische informatie van NP in databases met verbindingen is een van de toepassingen van chemo-informatica in NP-onderzoek. In tegenstelling tot de introductie van big data is dit vooral relevant9.
Hier worden de open-source NP-databases BIOFACQUIM10 en PeruNPDB11 gebruikt om het protocol te beschrijven dat zoekt naar visualisatie en karakterisering van de chemische ruimte van datasets van natuurlijke verbindingen met behulp van verschillende moleculaire representaties, visuele representaties van dergelijke ruimtes creëert en structuur-eigenschapsrelaties binnen chemische ruimtes onderzoekt, met de nadruk op toepassingen voor het ontdekken van geneesmiddelen.