21 oktober 2022
Het hier ingediende protocol verklaart de volledige in silico-pijplijn die nodig is om circRNA's te voorspellen en functioneel te karakteriseren uit RNA-sequencing transcriptoomgegevens die gastheer-pathogeeninteracties bestuderen.
Circulaire RNA's spelen een belangrijke regulerende rol in verschillende biologische processen. Dit protocol is geschikt voor beginners om circulaire RNA-analyse uit te voeren op het gebied van gastheer- en pathogeeninteracties. Hier hebben we een paar van de tools samengesteld om een gestroomlijnd protocol te creëren dat nodig is voor veilige RNA-voorspelling en -kwantificering, veilige RNA-functionele verrijking, veilig RNA, micro-RNA-interactievoorspelling en CCE RNA-netwerkconstructies.
Dit stroomlijningsprotocol kan worden toegepast op klinische monsters om bepaalde kandidaten, diagnostische en prognostische waarden te identificeren in een gastheer- en pathogeeninteractieomgeving. Ik verwacht dat degenen die geen voorafgaande programmeerkennis hebben, moeite zullen hebben met de beginfase van deze techniek. Daarom zou ik adviseren om de basisprincipes van de programmeertalen die in deze techniek worden gebruikt, te leren.
Ik geloof dat meestal kijken naar hoe de programmeertaal wordt toegepast om informatiever en gemakkelijker te begrijpen te zijn in vergelijking met alleen lezen. Om te beginnen open je een Linux-terminal en voer je in de map van het referentiegenoom van de host de commando's bwa index en hisat2-build uit om het genoom te indexeren. Bereid een yml-configuratiebestand voor met de naam van het bestand, het pad van de hulpprogramma's, het pad naar de gedownloade referentiebestanden en het pad naar de indexbestanden.
Geef het bibliotheektype van de RNA-sequentiegegevens op en voer het gereedschap Ciriquant uit met behulp van de standaard- of handmatige parameters. Bereid een tekstbestand voor met een lijst met gegevens die de ID's van de RNA-sequentiegegevens bevatten, het pad naar de GTF-bestanden die door Ciriquant zijn uitgevoerd en de groepering van de RNA-sequentiegegevens, ongeacht of het een controlegroep of een behandelde groep is. Voer op de Linux-terminal prep_Ciriquant uit met een voorbereid tekstbestand als invoer.
Deze run genereert een lijst met bestanden. Bereid een tweede tekstbestand voor met een lijst met gegevens die de RNA-sequentie-ID's en het pad naar hun respectieve string tie-uitvoer bevatten. De bestandsindeling moet vergelijkbaar zijn met het eerder voorbereide tekstbestand zonder dat de groeperingskolom wordt uitgevoerd.
Voer prepde uit. py met dit tekstbestand als invoer om de gentellingmatrixbestanden te genereren. Voer Ciri_DE_Replicate uit met de library_info.
CSV, circRNA_BSJ. CSV en gene_count_matrix. CSV-bestanden als invoer om de uiteindelijke circRNA_DE uit te voeren.
TSV-bestand. Als u het aantal differentieel uitgedrukte of DE-circRNA's wilt filteren en bepalen, opent u het circRNA_DE. tsv-bestand met R of een andere spreadsheetsoftware.
Pak de inhoud van het CircR-bestand uit en pak het uit nadat u het hebt gedownload van de CircR GitHub-pagina met behulp van de relevante software, zoals WinRar of 7-Zip. In een nieuwe directory waar de analyse zal worden uitgevoerd. Installeer vervolgens de vereiste softwaretoepassingen zoals SAMTools, miRanda, RNAhybrid en Pybedtools voordat u de circRNA miRNA-analyse uitvoert.
Indexeer het referentiegenoombestand van het organisme van belang met behulp van de SAMtools FAIDX-opdracht en bereid een invoerbestand voor dat bestaat uit de coördinaten van de DE-circRNA's van belang in een door tabs gescheiden bedbestand. Voer vervolgens Circr uit. py met behulp van Python3.
En als argumenten specificeren het circRNA-invoerbestand, het snellere genoom van het organisme van belang, de genoomversie van het geselecteerde organisme, het aantal threads en de naam van het uitvoerbestand in de opdrachtregel. Zodra de Circr-analyse is voltooid, voert het programma een circRNA-miRNA-interactiebestand uit in het CSV-formaat. Bereid een door tabs gescheiden bestand voor met de circRNA's van belang en hun doel-miRNA.
De eerste kolom bestaat uit de naam circRNA. De tweede kolom geeft het type RNA uit de eerste kolom aan. De derde kolom is het doel-miRNA.
En de vierde kolom specificeert het type RNA uit de derde kolom. Om de ceRNA-netwerkkaart te construeren, opent u de Cytoscape-software, navigeert u naar het bestand, importeert u, netwerkt u het bestand, selecteert u het voorbereide bestand en uploadt u het. Druk op de stijlknop om de visuele stijl van het netwerk te wijzigen.
Druk vervolgens op de pijl aan de rechterkant van de vulkleur, kies type voor de kolom, discrete toewijzing voor het toewijzingstype en selecteer de gewenste kleur voor elk RNA-type. Navigeer daarna naar vorm om de vorm van de knooppunten te wijzigen en volg de stappen die eerder zijn weergegeven. Voor genontologie en KEGG-analyse van het oudergen van de circRNA's, zorg voor de clusterprofiler en org. Hs.eg.
DB-pakketten zijn geïnstalleerd in onze studio. Importeer de DE-circRNA-informatie in de werkruimte van de R-studio. Als de gebruiker de ouderlijke gennamen wil converteren naar andere formaten zoals de entrezid, gebruik dan een functie zoals bidder.
Gebruik de gen-ID als invoer en voer de genontologie en verrijkingsanalyse uit met behulp van de enrichGO-functie binnen het clusterprofiel of -pakket met behulp van standaardparameters. Voer ten slotte de KEGG-verrijkingsanalyse uit met behulp van de gen-ID als invoer en de enrichKEGG-functie binnen het clusterprofielpakket. De bubble plot van gen ontologie verrijkingsanalyse van DE circRNA oudergenen is weergegeven in deze figuur.
De genverhouding op de x-as is het aantal genen in die invoerlijst dat geassocieerd is met een bepaalde genontologieterm gedeeld door het totale aantal genen in die term. De puntgrootte in de grafiek wordt weergegeven door de telwaarde, het aantal genen in de invoerlijst dat is gekoppeld aan een bepaalde term voor genontologie. Hoe groter de grootte van de stippen, hoe groter het aantal inputgenen dat aan de term is gekoppeld.
De stippen in de grafiek zijn kleurgecodeerd op basis van de pvalue die wordt berekend door de waargenomen frequentie van een annotatieterm te vergelijken met de frequentie die bij toeval wordt verwacht. De verrijking is statistisch significant en wordt alleen op de bubbelplot uitgezet als de pwaarde lager is dan 0,01. Hier omvatten de top drie verrijkingen voor de biologische processen de biogenese van het ribonucleoproteïnecomplex, de reactie op het virus en de regulatie van de respons op een biotische stimulus.
Terwijl voor de moleculaire functies alleen de katalytische activiteit die inwerkt op RNA en enkelstrengs RNA-binding statistisch verrijkt zijn. Voor de cellulaire componenten is alleen het retromeercomplex statistisch verrijkt. Deze representatieve afbeelding toont de KEGG-verrijkingsanalyse van de DE-circRNA-oudergenen in een bellenplot.
Slechts twee KEGG-termen werden in dit geval verrijkt, de influenza A en de virale levenscyclusroutes. Een van de belangrijkste dingen bij het proberen van deze procedure is om ervoor te zorgen dat het juiste type eigenschap van de RNA-circ-dataset die u gebruikt bij het uitvoeren van een blessure. De bio-formatische pijplijn die hier wordt aangeboden, helpt bij het voorspellen van de potentiële seculiere RNA's en de functionele annotaties.
Er zal echter nog steeds een goed geleide verificatie nodig zijn om solide bewijs te leveren. Dit protocol stelt onderzoekers in staat om veilig RNA en hun potentiële functionele rollen in de verschillende codes en pathogene interacties te ontdekken, die ze verder kunnen bestuderen.
Bekijk het volledige transcript en krijg toegang tot duizenden wetenschappelijke video's
Dit protocol beschrijft een uitgebreide in silico-pipeline voor het voorspellen en functioneel karakteriseren van circulaire RNA's (circRNA's) op basis van RNA-sequencinggegevens in de context van gastheer-pathogeeninteracties. Het is ontworpen om beginners met beperkte programmeerkennis te helpen bij het effectief uitvoeren van circRNA-analyses.
Bio-informatische identificatie en karakterisering van circRNA's op basis van RNA-seq-gegevens maakt vroege ontdekking mogelijk van nieuwe regulerende elementen die betrokken zijn bij interacties tussen gastheer en pathogeen. Deze in silico-pipeline ondersteunt het voorspellend vertrouwen bij de selectie van targets en functionele annotatie voorafgaand aan arbeidsintensieve validatie in het laboratorium. Het integreren van circRNA-analyse in de ontdekkingsfase verbetert de triage van de portfolio en vermindert de risico's van downstream translationeel onderzoek.
Dit protocol plaatst de ontdekking van circRNA vóór de validatie in het laboratorium, waardoor een brug wordt geslagen tussen vroege ontdekking en preklinisch onderzoek in gastheer-pathogeenstudies.