9 maggio 2017
Questo protocollo delinea un flusso di lavoro comparativo de novo per l'assemblaggio e l'annotazione del trascrittoma per i bioinformatici alle prime armi. Il flusso di lavoro è disponibile gratuitamente tramite CyVerse e collegato dal Data Store. Vengono utilizzate la riga di comando e le interfacce utente grafiche, ma tutto il codice necessario è disponibile per il copia e incolla.
L'obiettivo generale di questa procedura è quello di valutare, assemblare, annotare e confrontare l'espressione genica differenziale attraverso la trascrittomica De Novo, a partire da file FASTQ grezzi. Questo metodo può aiutare a rispondere a domande di biologia comparativa e molecolare, tra cui quali trascritti si trovano all'interno di un organismo, cosa fanno tali trascritti all'interno di quegli organismi e quali sono le differenze tra le condizioni sperimentali. Il vantaggio principale di questa tecnica è che fornisce un ambiente interattivo.
Fornisce risorse computazionali su richiesta e consente ai ricercatori di iniziare immediatamente ad analizzare i loro dati RNA-Seq. Questo metodo è particolarmente utile per i ricercatori che confrontano esperimenti all'interno di un singolo organismo che coinvolge più tessuti, condizioni, punti temporali per capire come cambiano i sistemi biologici. Questo metodo si concentra su organismi non modello senza genomi, ma può essere applicato anche a organismi con assemblaggi di genoma disponibili, anche quelli con decine o centinaia di migliaia di scaffold nel loro assemblaggio.
Per iniziare, accedi a Atmosphere nell'ambiente di scoperta. Richiedi un account CyVerse gratuito accedendo alla pagina di registrazione. Utilizza un'email istituzionale per registrarti all'account.
Quindi, vai alla scheda App e servizi e richiedi l'accesso ad Atmosphere. L'accesso all'ambiente di rilevamento viene concesso automaticamente. Accedere all'ambiente di rilevamento, abbreviato in DE. Quindi, selezionare la scheda Dati per visualizzare un menu contenente tutte le cartelle nell'archivio dati.
Creare una cartella principale del progetto che ospiterà tutti i dati associati al progetto. Trova la barra degli strumenti nella parte superiore della finestra dei dati e seleziona File, Nuova cartella. Non utilizzare spazi o caratteri speciali nei nomi delle cartelle o nei nomi dei file di output di input.
Utilizzare invece caratteri di sottolineatura o trattini dove appropriato. Caricare i file di sequenza FASTQ non elaborati e la cartella 1_Raw_Sequence in una sottocartella denominata Cartella A_Raw_Reads. Per i file di dimensioni inferiori a due gigabit, utilizzare la funzione di caricamento semplice dell'archivio dati per accedere alla barra degli strumenti della finestra dei dati facendo clic sul pulsante Dati nel desktop principale di DE.
Seleziona Carica, Caricamento semplice dal desktop. Quindi, selezionare il pulsante Sfoglia per accedere ai file di sequenziazione FASTQ non elaborati sul computer locale. Valuta le letture di sequenziamento grezze caricate utilizzando l'app FastQC in DE. Selezionare il pulsante App sul desktop principale di DE per aprire una finestra contenente tutte le app di analisi disponibili in DE. Cerca nella finestra lo strumento FastQC nella barra degli strumenti di ricerca nella parte superiore della finestra.
Aprire la versione multi-file se è presente più di un file FASTQ. Seleziona File e crea una nuova cartella, quindi seleziona questa cartella come cartella di output. Caricare i file di lettura FASTQ nella finestra degli strumenti denominata Seleziona dati di input e selezionare Avvia analisi.
Cerca l'app programmabile Trimmomatic nel DE e aprila. Carica la cartella dei file di lettura FASTQ grezzi nella sezione delle impostazioni. Selezionare se i file di sequenziazione sono a estremità singola o accoppiata.
Utilizzare il file di controllo standard fornito selezionando il pulsante Sfoglia e incollando il percorso del file nella casella di visualizzazione. Selezionare il file di controllo Trimmomatic e avviare l'analisi. Per letture di sequenza di ritaglio di qualità, cerca e apri l'app Sickle nel DE. Selezionare le letture FASTQ tagliate come letture di input e rinominare i file di output.
Includi le impostazioni di qualità nelle opzioni. Apri la versione più recente dell'istanza Atmosphere accedendo alla pagina wiki. Seleziona il link per la versione più recente dell'immagine della Trinità e del Trinotato.
Seleziona il pulsante Accedi per avviare, quindi assegna un nome all'istanza Atmosphere. Selezionare una dimensione di istanza media3 o grande3. Avvia l'istanza e attendi che venga compilata.
Se un'immagine Atmosphere non viene avviata, puoi provare a richiedere un'istanza più piccola o puoi richiedere a Jetstream un'allocazione maggiore. Tutti i dettagli sono sul wiki complementare. Sposta i file di output Trinity nella cartella, 3_Assembly, nel DE ed etichetta la cartella, A_Trinity_de_novo_assembly.
L'esecuzione di Trinity richiede la conoscenza della riga di comando e diversi giorni o forse settimane per completare analisi di grandi dimensioni. Sono disponibili risorse gratuite collegate al wiki per aiutare a comprendere la riga di comando. Assegna a ciascun trascrittoma che è stato assemblato una sottocartella all'interno della cartella A_Trinity_de_novo_assembly.
Utilizza nomi univoci, inclusi i nomi scientifici degli organismi e dei trattamenti associati a ciascun trascrittoma, quindi crea un'altra sottocartella chiamata Cartella B_rnaQUAT_Output nella cartella 3_Assembly. Apri l'app intitolata De Novo rnaQUAST. Assegna un nome all'analisi e seleziona Cartella B_rnaQUAST_Output come cartella di output.
Cercare il decodificatore di trascrizione ed eseguire transdecodificatore sul file fasta di output De Novo Trinity Assembly nell'ambiente di individuazione. Apri l'app deseq2 nel DE.Name'analisi e seleziona la cartella di output come 4_Differential_Expresssion. Nella sezione Input, selezionare il file della tabella dei conteggi dall'esecuzione di Trinity Assembly.
Inoltre, selezionare la colonna in cui è possibile trovare i nomi dei contig. Immettere le intestazioni di colonna dal file della tabella dati dei conteggi per determinare quali colonne vengono confrontate. Includi le virgole tra ciascuna delle condizioni.
Non includere la prima intestazione di colonna che contiene i nomi contig. Per le repliche, ripetere lo stesso nome. Nella seconda riga, fornire i nomi delle due condizioni da confrontare.
Corrisponde ai nomi delle intestazioni di colonna forniti nella prima riga. Di seguito è riportato un confronto sistematico delle letture di sequenziamento dopo ogni fase di pre-elaborazione. Dopo il taglio, la lettura dovrebbe avere un contenuto GC e un contenuto di sequenza meno asimmetrici e avere una proporzione maggiore rispetto alle letture con un punteggio di qualità elevato.
Per assemblare i trascrittomi De Novo sono necessarie letture di alta qualità. I risultati del controllo qualità rapido dipendono dagli organismi e dai campioni da sequenziare. L'uniformità di tutti i campioni che verranno confrontati a valle è l'obiettivo principale delle letture di pre-elaborazione.
rnaQUAST sfrutta il codice boost per generare statistiche riassuntive sugli assemblaggi basati su geni core noti nei cladi tassonomici. L'accuratezza degli assemblatori è rivelata dal numero di discrepanze per trascrizione e dal numero di trascrizioni che corrispondono ai geni canonici. Le ultime quattro sottotrame qui presentate forniscono statistiche riassuntive del contig e della lunghezza delle isoforme, nonché la copertura delle isoforme previste.
NAx rappresenta la percentuale di contigs con una lunghezza maggiore della lunghezza dell'asse y. La frazione assemblata è il singolo trascritto assemblato più lungo diviso per la sua lunghezza. Dove frazione coperta è la percentuale di isoforme complete assemblate del trascritto come previsto dai geni procariotici o eucariotici principali di BUSCO.
Dopo aver visto questo video, dovresti avere una buona comprensione di come assemblare e inserire i trascrittomi. Inoltre, questo protocollo consentirà di rilevare l'espressione genica differenziale tra due condizioni. In generale, le persone hanno difficoltà con i pacchetti bioinformatici perché ce ne sono così tanti, ci sono molte impostazioni e variabili associate ad essi, e di solito è necessario avere conoscenza della riga di comando per essere effettivamente eseguiti.
È importante etichettare e organizzare gli input dei dati e gli output dell'analisi in modo che altri ricercatori possano capire cosa è stato fatto. È necessario includere i passaggi dell'ordine completati, le versioni del programma e le informazioni di esempio. Inoltre, ometti gli spazi nella cartella o nei nomi dei file.
Nuovi strumenti e nuove versioni degli strumenti vengono costantemente integrati, ma vengono mantenute anche le vecchie versioni degli strumenti. Tutte le modifiche saranno registrate sulla wiki complementare. Seguendo questa procedura, è possibile eseguire altri metodi bioinformatici come l'analisi di rete, l'arricchimento di OB e l'identificazione delle vie metaboliche per aiutare a rispondere a domande come la variazione del fenotipo, le condizioni che modificano i profili di espressione e l'identificazione di geni di interesse per la genomica funzionale.
Questo protocollo delinea un flusso di lavoro per l'assemblaggio e l'annotazione del transcriptome de novo, progettato per bioinformatici alle prime armi. Fornisce un ambiente interattivo per l'analisi dei dati RNA-Seq, accessibile tramite CyVerse.
This workflow enables biopharma R&D teams to generate high-quality transcriptomic data from non-model organisms, supporting target validation in underexplored biological systems. By providing an interactive, cloud-based environment for de novo assembly and differential expression analysis, it reduces barriers to mechanistic de-risking in early discovery. The approach enhances predictive confidence when studying organism-specific responses to experimental perturbations, informing portfolio prioritization.
The method fits within the early discovery continuum, supporting hypothesis testing and pathway clarification before lead identification efforts.