9. Mai 2017
Dieses Protokoll beschreibt einen vergleichenden Arbeitsablauf für die Assemblierung und Annotation von De-novo-Transkriptomen für unerfahrene Bioinformatiker. Der Workflow ist vollständig über CyVerse kostenlos verfügbar und über den Data Store verbunden. Es werden Befehlszeilen und grafische Benutzeroberflächen verwendet, aber der gesamte benötigte Code steht zum Kopieren und Einfügen zur Verfügung.
Das übergeordnete Ziel dieses Verfahrens ist es, die differentielle Genexpression durch De-Novo-Transkriptomik zu bewerten, zusammenzustellen, zu annotieren und zu vergleichen, beginnend mit FASTQ-Rohdateien. Diese Methode kann helfen, Fragen in der vergleichenden und molekularen Biologie zu beantworten, einschließlich der Frage, welche Transkripte sich in einem Organismus befinden, was diese Transkripte in diesen Organismen bewirken und was die Unterschiede zwischen den experimentellen Bedingungen sind. Der Hauptvorteil dieser Technik besteht darin, dass sie eine interaktive Umgebung bietet.
Es stellt auf Abruf Rechenressourcen zur Verfügung und ermöglicht es Forschern, sofort mit der Analyse ihrer RNA-Seq-Daten zu beginnen. Diese Methode ist besonders nützlich für Forscher, die Experimente innerhalb eines einzelnen Organismus vergleichen, an dem mehrere Gewebe, Bedingungen und Zeitpunkte beteiligt sind, um zu verstehen, wie sich biologische Systeme verändern. Diese Methode konzentriert sich auf Nicht-Modellorganismen ohne Genom, kann aber auch auf Organismen mit verfügbaren Genomassemblierungen angewendet werden, sogar auf solche mit Zehn- oder Hunderttausenden von Gerüsten in ihrer Anordnung.
Um zu beginnen, erhalten Sie Zugriff auf Atmosphere in der Discovery-Umgebung. Fordern Sie ein kostenloses CyVerse-Konto an, indem Sie zur Registrierungsseite navigieren. Verwenden Sie eine institutionelle E-Mail-Adresse, um sich für das Konto zu registrieren.
Navigieren Sie als Nächstes zur Registerkarte Apps und Dienste und fordern Sie Zugriff auf Atmosphere an. Der Zugriff auf die Discovery-Umgebung wird automatisch gewährt. Melden Sie sich bei der Discovery-Umgebung an, abgekürzt als DE. Wählen Sie dann die Registerkarte Daten aus, um ein Menü mit allen Ordnern im Datenspeicher aufzurufen.
Erstellen Sie einen Hauptprojektordner, in dem alle mit dem Projekt verknüpften Daten gespeichert werden. Suchen Sie die Symbolleiste oben im Datenfenster, und wählen Sie Datei, Neuer Ordner aus. Verwenden Sie keine Leerzeichen oder Sonderzeichen in den Ordnernamen oder in den Namen der Eingabeausgabedateien.
Verwenden Sie stattdessen gegebenenfalls Unterstriche oder Bindestriche. Laden Sie rohe FASTQ-Sequenzdateien und den Ordner 1_Raw_Sequence in einen Unterordner mit dem Namen Ordner A_Raw_Reads hoch. Verwenden Sie für Dateien unter zwei Gigabit die einfache Upload-Funktion des Datenspeichers, um zur Symbolleiste des Datenfensters zu navigieren, indem Sie auf die Schaltfläche Daten im Hauptdesktop von DE klicken.
Wählen Sie Hochladen, Einfacher Upload vom Desktop aus. Wählen Sie dann die Schaltfläche Durchsuchen aus, um zu den unformatierten FASTQ-Sequenzierungsdateien auf dem lokalen Computer zu navigieren. Bewerten Sie hochgeladene Rohsequenzierungs-Reads mit der FastQC-App in der DE. Wählen Sie auf dem DE-Hauptdesktop die Schaltfläche Apps aus, um ein Fenster mit allen in der DE verfügbaren Analyse-Apps zu öffnen. Durchsuchen Sie das Fenster nach dem FastQC-Tool in der Suchsymbolleiste am oberen Rand des Fensters.
Öffnen Sie die Version mit mehreren Dateien, wenn mehr als eine FASTQ-Datei vorhanden ist. Wählen Sie Datei aus, erstellen Sie einen neuen Ordner, und wählen Sie dann diesen Ordner als Ausgabeordner aus. Laden Sie die FASTQ-Lesedateien in das Tool-Fenster mit dem Namen Select Input Data (Eingabedaten auswählen) und wählen Sie Launch Analysis (Analyse starten) aus.
Suchen Sie in der DE nach der programmierbaren Trimmomatic App und öffnen Sie diese. Laden Sie den Ordner mit den rohen FASTQ-Lesedateien in den Abschnitt "Einstellungen" hoch. Wählen Sie aus, ob es sich bei den Sequenzdateien um Single- oder Paired-End-Dateien handelt.
Verwenden Sie die bereitgestellte Standardsteuerdatei, indem Sie auf die Schaltfläche Durchsuchen klicken und den Dateipfad in das Anzeigefeld einfügen. Wählen Sie die Trimmomatic-Steuerdatei aus und starten Sie die Analyse. Um qualitativ hochwertige Trimmsequenzen zu lesen, suchen und öffnen Sie die Sichel-App in der DE. Wählen Sie die gekürzten FASTQ-Lesevorgänge als Eingabelesevorgänge aus und benennen Sie die Ausgabedateien um.
Fügen Sie Qualitätseinstellungen in die Optionen ein. Öffnen Sie die aktuellste Version der Atmosphere-Instanz, indem Sie zur Wiki-Seite navigieren. Wählen Sie den Link für die neueste Version des Trinity- und Trinotate-Bildes aus.
Wählen Sie die Schaltfläche Login To Launch (Bei Start anmelden) aus und benennen Sie dann die Atmosphere-Instanz. Wählen Sie eine Instanzgröße von mittel3 oder groß3 aus. Starten Sie die Instance und warten Sie, bis sie erstellt wurde.
Wenn ein Atmosphärenbild nicht hochgefahren werden kann, können Sie versuchen, sich für eine kleinere Instanz zu bewerben, oder Sie können sich bei Jetstream für eine größere Zuordnung bewerben. Alle Details finden Sie im Begleit-Wiki. Verschieben Sie die Trinity-Ausgabedateien in den Ordner 3_Assembly in der DE, und beschriften Sie den Ordner mit A_Trinity_de_novo_assembly.
Das Ausführen von Trinity erfordert Befehlszeilenkenntnisse und mehrere Tage oder möglicherweise Wochen, um umfangreiche Analysen durchzuführen. Es gibt kostenlose Ressourcen, die im Wiki verlinkt sind, um die Befehlszeile zu verstehen. Geben Sie jedem Transkriptom, das zusammengestellt wurde, einen Unterordner innerhalb des Ordners A_Trinity_de_novo_assembly
.Verwenden Sie eindeutige Namen, einschließlich der wissenschaftlichen Namen von Organismen und Behandlungen, die mit jedem Transkriptom verbunden sind, und erstellen Sie dann einen weiteren Unterordner mit dem Namen Ordner B_rnaQUAT_Output im Ordner 3_Assembly. Öffnen Sie die App mit dem Namen De Novo rnaQUAST. Benennen Sie die Analyse, und wählen Sie Ordner B_rnaQUAST_Output als Ausgabeordner aus.
Suchen Sie nach dem Transkript-Decoder, und führen Sie den Transdecoder in der De Novo Trinity Assembly-Ausgabe-Fasta-Datei in der Discovery-Umgebung aus. Öffnen Sie die deseq2-App im DE.Name der Analyse und wählen Sie den Ausgabeordner als 4_Differential_Expresssion aus. Wählen Sie im Abschnitt Eingabe die Datei mit der Tabelle counts aus der Ausführung der Trinity Assembly aus.
Wählen Sie außerdem die Spalte aus, in der die Contig-Namen zu finden sind. Geben Sie die Spaltenüberschriften aus der Datentabellendatei "counts" ein, um zu bestimmen, welche Spalten verglichen werden. Fügen Sie die Kommas zwischen den einzelnen Bedingungen ein.
Fügen Sie nicht die erste Spaltenüberschrift ein, die die Contig-Namen enthält. Wiederholen Sie für Replikate denselben Namen. Geben Sie in der zweiten Zeile die Namen der beiden Bedingungen an, die verglichen werden sollen.
Stimmen Sie mit den Namen der Spaltenüberschriften überein, die in der ersten Zeile angegeben sind. Hier sehen Sie einen systematischen Vergleich der Sequenzierungs-Reads nach jedem Vorverarbeitungsschritt. Nach dem Kürzen sollte der Lesevorgang weniger verzerrte GC-Inhalte und Sequenzinhalte aufweisen und einen größeren Anteil an Lesevorgängen mit einer hohen Qualitätsbewertung aufweisen.
Für die Assemblierung von De-Novo-Transkriptomen sind qualitativ hochwertige Reads erforderlich. Die Ergebnisse einer schnellen Qualitätskontrolle hängen von den Organismen und Proben ab, die sequenziert werden. Die Einheitlichkeit aller Proben, die nachgelagert verglichen werden, ist das Hauptziel der Vorverarbeitung von Reads.
rnaQUAST nutzt den Boost-Code, um zusammenfassende Statistiken über Assemblierungen basierend auf bekannten Kerngenen in taxonomischen Kladen zu erstellen. Die Genauigkeit von Assemblern wird durch die Anzahl der Diskrepanzen pro Transkript und die Anzahl der Transkripte, die mit kanonischen Genen übereinstimmen, verdeutlicht. Die letzten vier hier vorgestellten Teildiagramme liefern zusammenfassende Statistiken der Contig- und Isoformlänge sowie die Abdeckung der erwarteten Isoformen.
NAx stellt den Prozentsatz der Contigs dar, die länger sind als die Länge der y-Achse. Der assemblierte Bruch ist das längste einzelne zusammengesetzte Transkript geteilt durch seine Länge. Dabei ist der abgedeckte Anteil der Prozentsatz der vollständig assemblierten Isoformen des Transkripts, wie er von den prokaryotischen oder eukaryotischen Kerngenen aus BUSCO erwartet wird.
Nachdem Sie sich dieses Video angesehen haben, sollten Sie ein gutes Verständnis dafür haben, wie Transkriptome zusammengesetzt und eingegeben werden. Darüber hinaus ermöglicht Ihnen dieses Protokoll, die differentielle Genexpression zwischen zwei Bedingungen zu erkennen. Im Allgemeinen haben Einzelpersonen Schwierigkeiten mit bioinformatischen Paketen, weil es so viele von ihnen gibt, es gibt viele Einstellungen und Variablen, die mit ihnen verbunden sind, und normalerweise müssen Sie Kenntnisse über die Befehlszeile haben, um sie tatsächlich auszuführen.
Es ist wichtig, Ihre Dateneingaben und Analyseausgaben zu beschriften und zu organisieren, damit andere Forscher verstehen können, was getan wurde. Sie sollten die abgeschlossenen Bestellschritte, Programmversionen und Beispielinformationen angeben. Lassen Sie außerdem alle Leerzeichen in den Ordner- oder Dateinamen weg.
Neue Tools und neue Versionen der Tools werden ständig integriert, aber auch alte Versionen der Tools werden beibehalten. Alle Änderungen werden im Begleit-Wiki aufgezeichnet. Im Anschluss an dieses Verfahren können andere bioinformatische Methoden wie Netzwerkanalyse, GO-Anreicherung und Identifizierung des Stoffwechselwegs durchgeführt werden, um Fragen wie Phänotypvariation, Bedingungen, die Expressionsprofile verändern, und Identifizierung von Genen, die für die funktionelle Genomik von Interesse sind, zu beantworten.
Dieses Protokoll beschreibt einen Arbeitsablauf für de novo Transkriptom-Assemblierung und -Annotation, der für angehende Bioinformatiker konzipiert ist. Es bietet eine interaktive Umgebung für die Analyse von RNA-Seq-Daten, die über CyVerse zugänglich ist.
This workflow enables biopharma R&D teams to generate high-quality transcriptomic data from non-model organisms, supporting target validation in underexplored biological systems. By providing an interactive, cloud-based environment for de novo assembly and differential expression analysis, it reduces barriers to mechanistic de-risking in early discovery. The approach enhances predictive confidence when studying organism-specific responses to experimental perturbations, informing portfolio prioritization.
The method fits within the early discovery continuum, supporting hypothesis testing and pathway clarification before lead identification efforts.