$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. Generieren Virus Stocks
Hinweis: Ein Flussdiagramm der Nassbank Aspekt dieses Protokoll in Abbildung 1 dargestellt ist , um die Details der viralen Lager Produktion und die anschließende Infektion von Gewebekulturzellen werden in der Regel auf verschiedene Arten von Retroviren gelten.. Bei einigen Experimenten kann die Zielzelle , die endogene virale Rezeptor (en) nicht exprimieren, und in solchen Fällen ist die Konstruktion von pseudotypisierten retroviralen Partikeln heterologe virale Hüll - Glycoprotein, zB das G - Glykoprotein von vesikulären Stomatitis - Virus (VSV-G) beherbergt wird erforderlich für die Infektion 44,45.
Hinweis: Vorkehrung getroffen werden sollten, wenn sie mit HIV-1 zu arbeiten. Obwohl spezifische Leitlinien von Institution zu Institution variieren, alle Virus-basierten Arbeiten sollten in einem eigenen, Betreiber beschränkt biologischen Sicherheitsschrank durchgeführt werden (in der Regel als Gewebekultur Haube bezeichnet). Persönliche Schutzausrüstungdas schließt Gesichtsschutz, Überschuhe, Doppelhandschuh-Schicht und eine Ganzkörper-Overall Anzug sollte jederzeit getragen werden. Alle flüssigen Abfälle aus virusbezogenen Experimenten ergeben, sollten mit Bleichmittel (10% Endkonzentration), und alle Abfälle einschließlich Feststoffe inaktiviert werden sollte vor der Entsorgung autoklaviert werden.
- Einen Tag vor der Transfektion Platte 3,3 x 10 6 HEK293T - Zellen in 10 ml Dulbecco-modifiziertem Eagle Medium (DMEM) , ergänzt mit 10% (v / v) fötalem Rinderserum und 1% (v / v) Penicillin / Streptomycin (10.000 U / ml Lager) in jedem der fünf 100-mm-Schalen.
Hinweis: Ergänzte-DMEM bezeichnet als DMEM-FPS von diesem Punkt an. - Am nächsten Tag, Transfektion der Zellen mit 10 ug Plasmid voller Länge retroviralen molekulare Klone oder 9 ug Kuvert gelöscht single-round-Vektoren mit 1 ug eines VSV-G-Expressionskonstrukt unter Verwendung von im Handel erhältlichen Transfektionsreagenzien oder Calciumphosphat tragen.
- Inkubieren Sie die cells bei 37 ° C in einer befeuchteten Zellkultur - Inkubator mit 5% CO 2 (dieser Zustand im folgenden als "Gewebekultur - Inkubator"). Nach etwa 48 Stunden, ernten die virushaltigen Zellmedien eine volumetrische Pipette und es durch ein 0,45-um-Filter durch Schwerkraftfluss passieren.
- Konzentriere das Virus durch Ultrazentrifugation bei 200.000 · g für 1 Stunde bei 4 ° C. Resuspendieren des Virus-Pellet in 500 ul DMEM-FPS, enthaltend 20 U DNase, und Inkubieren bei 37 ° C für 1 Stunde.
Hinweis: Die DNase Schritt die Rückgewinnung von unerwünschten Plasmidsequenzen zu reduzieren hilft, indem die Hauptlast der Plasmid DNA eliminiert, die aus dem Transfektionsverfahren anhält.
- Bestimmen Sie p24 - Konzentration 46 mit einem HIV-1 - p24 - Antigen - Capture - Kit nach den Anweisungen des Herstellers.
Hinweis: Virus - Konzentration kann auch durch reverse Transkriptase - Aktivitätstest 47,48 bestimmt werden. Alternativ kann die Ebene der funktionellen Virusbestimmt werden MOI durch die Messung. Dies wird am leichtesten unter Verwendung von fluoreszenzaktivierter Zellsortierung mit Viren durchgeführt, die fluoreszierenden Reportergene wie enhanced green fluorescent protein exprimieren. MOI Bestimmung kann besonders nützlich sein, wenn sie mit primären Zellen arbeiten, die nicht das gleiche Niveau der Infektion als optimierte Zelllinien unterstützen.
2. Infect Zellen, die mit Virus
- Platte 3,0 x 10 5 HEK293T Zellen pro Vertiefung in einer Platte mit 6 Vertiefungen in 2,5 ml DMEM-FPS und über Nacht in einem Gewebekultur - Inkubator inkubiert.
Anmerkung: Die Anzahl der einzelnen Integrationsstellen mit diesem Protokoll wiederhergestellt ist direkt proportional zu der Anzahl der Zellen und die Menge des aktiven Virus bei der Infektion verwendet. - Infect Zellen mit einer endgültigen viralen p24-Konzentration von 500 ng / ml in einem Endvolumen von 500 & mgr; l frisches DMEM-FPS für 2 h in einem Gewebekultur-Inkubator, fügen dann 2 ml DMEM-FPS vorgewärmt auf 37 ° C pro Vertiefung und weiterhin Inkubation.
- Beim48 Stunden nach der Infektion, die Medien zu entfernen und die Zellen mit 2 ml phosphatgepufferter Salzlösung (PBS) waschen. 0,5 ml Trypsin-EDTA vorgewärmt auf 37 ° C, und nach ein paar Sekunden visuell inspizieren die Vertiefungen für die Zell dislodgement.
- 2 ml vorgewärmt DMEM-FPS und Resuspendieren der Zellen durch vorsichtiges Auf- / Ab-Pipettieren mit einer volumetrischen Pipette ~ 10-mal. Die Lösung wird in einem 75 cm 2 Gewebekulturflasche mit 18 ml vorgewärmten DMEM-FPS, und Inkubation der Zellen in einem Gewebekultur - Inkubator.
- Nach minimal von fünf Tagen nach Beginn der Infektion, sammeln Sie die Zellen, die durch die Medien zu entfernen, waschen mit 5 ml PBS, 2 ml vorgewärmtes Trypsin-EDTA und resuspendieren mit 5 ml vorgewärmten DMEM-FPS durch Pipettieren. Zentrifugieren Sie die Lösung für 5 min bei Raumtemperatur bei 2500 · g, und den Überstand verwerfen.
Hinweis: Obwohl die Integration unter diesen Bedingungen Plateaus bei etwa 48 Stunden nach der Infektion 49,50 werden die weiteren 3 Tagen Kultur erforderlich sufficiently die Konzentration von nicht integrierten DNA-Moleküle zu verdünnen, die von zellbasierten DNA Rekombination oder viral-vermittelten Autointegration ergeben. - Extrahieren genomischer DNA aus dem Zellpellet eines im Handel erhältlichen Kits (siehe zB 51). Eluieren der DNA aus dem zugeführten Ionenaustauschsäule mit 200 ul 10 mM Tris-HCl, pH 8,5.
Hinweis: Eine Teilmenge von Zellen sollte bei 48 Stunden nach der Infektion (Schritt 2.3) für eine Infektiosität Assay verteilt werden, um richtige Virus-Infektion vor der NGS zu gewährleisten.
3. Fragment genomischer DNA durch Ultraschallbehandlung oder durch Restriktionsenzymverdau
Hinweis: Beschallen Fragmente genomischer DNA in einer nahezu sequenzunabhängig und ist somit der bevorzugte Modus der Fragmentierung bei der Sequenzierung Proben mit einem niedrigen erwarteten Wiederfindungsrate (zB infizierte Patientenzellen oder bei relativ niedrigen MOI eingeleitet Infektionen). Darüber hinaus ermöglicht der Beschallung ein PCR-Duplikate eines parti zu unterscheidendere Integrationsort Sequenz aus einzigartige Integration an der gleichen Stelle, die die klonale Expansion von Provirus-enthaltenden Zellen in infizierten Patienten (siehe Schritt 11 unten) 39,52-54 zu unterscheiden , ist entscheidend.
Hinweis: Die DNA gespalten unmittelbar stromabwärts von dem stromaufwärtigen LTR zu verringern Amplifikation der internen viralen Sequenzen während LM-PCR werden sollte. Das Restriktionsenzym BglII , das 43 bp stromabwärts von der stromaufwärts U5 - Sequenz liegt , und das ist nicht kompatibel für die anschließende Ligation mit MseI-erzeugten DNA - Enden funktioniert gut mit vielen HIV-1 - Stämme (1B). Wenn DNA durch Beschallung der Vorbereitung, die interne-Spalter Restriktionsenzym sollte nach Linkerligation angewendet werden (siehe Abbildung 1C - E und Schritt 4.3).
- Für Beschallung, auf ein Endvolumen von 120 & mgr; l 10 & mgr; g genomische DNA in Nuclease-freiem Wasser mischen. mit Hilfe von Parametern für eine durchschnittliche Bruchgröße von 500 bp (zwei Runden der folgenden para beschallenm: Einschaltdauer: 5%; Intensität: 3; Zyklen pro Burst: 200; Zeit: 80 sec).
- Reinige beschallter DNA eine PCR-Reinigungs-Kit. Reparatur der DNA-Enden unter Verwendung eines DNA-End-Reparatur-Set und reinigen die DNA unter Verwendung eines PCR-Reinigungs-Kit. A-Schwanz der DNA unter Verwendung von Klenow - exo - Enzym und reinigen die A-tailed DNA eine PCR - Reinigungs - Kit. Siehe 51,52 für weitere Details der Kit - Nutzung.
- Für Restriktionsendonuklease-Verdau, schneiden 10 ug genomische DNA über Nacht bei 37 ° C in einem Volumen von 100 & mgr; l mit Puffer vom Hersteller und einem Cocktail von Enzymen geliefert (100 U jeweils), die 5'-TA-Überhänge erzeugen, sowie eine inkompatibel Enzym wie BglII spaltet stromabwärts von dem stromaufwärtigen viralen LTR. Reinige die DNA am nächsten Tag ein PCR-Reinigungs-Kit verwenden.
Anmerkung: Keine der Restriktionsenzyme innerhalb des Terminals ~ 30 bp der viralen DNA Ende schneiden sollte, die von der LM-PCR-Protokolls amplifiziert wird. Dieses Protokoll verstärkt spezifisch die U5Ende der HIV-1-DNA.
4. Anneal Linkeroligonukleotide und Ligat zu Fragmentierte genomischer DNA
Hinweis: Bereiten eines asymmetrischen Linker einen Überhang enthält, der mit den oben genannten DNA - Fragmente (siehe Tabelle 1 für die Sequenzen von Oligonukleotiden , verwendet in diesem Protokoll) kompatibel ist. Der Linker an die mit beschallter DNA verwendet werden , müssen eine kompatible T-3' - Überhang enthalten, während der Linker für MseI-verdaute DNA ein kompatibles 5'-TA - Überhang enthalten (Abbildung 1). Der kurze Linker-Strang muss zusätzlich eine nicht verlängerbare chemische Modifikation enthalten, wie 3'-Amin, die nachfolgenden Amplifikationsreaktionen in Richtung auf die DNA von Interesse zu beschränken.
Hinweis: Wenn mehrere verschiedene Integrationsstelle Bibliotheken parallel vorbereitet und / oder beim Multiplexen einzigartige Proben auf dem gleichen Sequenzierungslauf, wird empfohlen, für jede Probe einzigartigen Linker zu verwenden, das Potenzial für die Probenquer Contamin zu begrenzenation während der PCR. Dies bedeutet, zusätzlich die Verwendung von einzigartigen Linker-Primern für jede Probe während der semi-nested PCR (unten beschrieben). Einzigartige Linker Stränge und Linker - Primer können durch Verwürfeln der Linkeroligonukleotid Sequenzen in Tabelle 1 aufgeführt , während die Aufrechterhaltung ähnliche Gesamt% GC - Gehalt und der geltenden Überhang Positionen ausgelegt sein.
- Tempern die kurzen und langen Linkers Stränge in 35 ul 10 mM Tris-HCl, pH 8,0 bis 0,1 mM EDTA (Endkonzentration von 10 & mgr; M jedes Oligonucleotid) durch Erhitzen auf 90 ° C und langsames Abkühlen auf Raumtemperatur in 1 ° -Schritten C pro min.
- Vorbereitung mindestens vier parallel Ligierungsreaktionen pro genomische DNA-Probe, die 1,5 uM ligierten Linker enthalten, 1 & mgr; g fragmentierte DNA und 800 U T4 DNA-Ligase in 50 ul. über Nacht bei 12 ° C ligieren. Reinige den nächsten Tag mit einem PCR Purification Kit.
- Für die Proben durch Beschallung hergestellt, verdauen das gereinigte Ligationsreaktion mit 100 U eines schränkungenEnzym spaltet von der stromaufwärtigen LTR nachgeschalteten (beispielsweise BglII für HIV-1) unter dem Hersteller über Nacht Bedingungen empfohlen. Reinige den DNA eine PCR Purification Kit.
5. Amplify Viral LTR-Host-Genomic DNA Junctions von Semi-Nested-PCR
Hinweis: Um für eine optimale Bibliothek Vielfalt gewährleisten, mindestens 4-8 parallel PCRs in Abhängigkeit von der DNA-Konzentration der rückgewonnenen Ligationsreaktion sollte für jede Probe sowohl für PCR Runden hergestellt werden. DNA-Template Konzentration sollte durch Spektrophotometrie quantifiziert werden. In diesem Protokoll verwenden die ersten und zweiten Runde der PCR verschachtelte LTR-spezifischen Primern, aber die gleiche Linker-spezifischen Primer für beide Runden (Tabelle 1) verwendet. Die zweite Runde LTR-spezifischen Primer und die Linker-spezifischen Primer kodieren Adaptersequenzen für DNA-Clustering sowie Sequenzierungsprimer-Bindungsstellen. Die verschachtelte LTR-spezifischen Primer kodiert auch eine 6-nt-Index-Sequenz, which kann unter verschiedenen Primern zum Multiplexen Bibliotheken innerhalb der gleichen Sequenzierungslauf variiert werden.
- Bereiten ersten Runde PCRs die Zutaten pro Röhrchen enthält , wie in Tabelle 2 aufgeführt.
Hinweis: Der Linker-spezifischen Primer birgt 22 nt der Komplementarität an den Linker, einer Schmelztemperatur von 53 ° C, einen GC-Gehalt von 45%, und dessen 3'-Ende befindet 15-16 bp stromaufwärts vom 3'-Termini von die verschiedenen Linker langen Strängen (Tabelle 1). Die erste Runde 27 nt LTR-Primer hat eine Schmelztemperatur von 59 ° C, einen GC-Gehalt von 48%, und dessen 3'-Ende 34 bp stromaufwärts von dem HIV-1 U5-Terminus entfernt. Der Bereich der zweiten Runde 26 nt LTR-Primer, die für die HIV-1 LTR komplementär ist, hat eine Schmelztemperatur von 60 ° C, einen GC-Gehalt von 50%, und dessen 3'-Ende 18 bp stromaufwärts von dem viralen U5 befindet Terminus. Es wird empfohlen, dass Oligonukleotid Schmelztemperatur und GC-Gehalt dieser Parameter, wenn die Benutzer nachahmen solltenDesign von PCR - Primern mit veränderten Sequenzen (einschließlich der für die Verwendung mit anderen Retroviren) 21. - Führen Sie erste PCR-Runde unter den folgenden Thermocycler-Parameter: Ein Zyklus: 94 ° C für 2 min; 30 Zyklen: 94 ° C für 15 sec, 55 ° C für 30 sec, 68 ° C für 45 sec; einen Zyklus: 68 ° C für 10 min.
- Pool Reaktionen und zu reinigen, um ein PCR-Reinigungs-Kit verwenden. Bereiten zweite Runde PCRs die Zutaten pro Röhrchen , das gemäß Tabelle 3. Führen Sie die zweite Runde der PCR - Thermocycler - Parameter unter Verwendung der in Schritt 5.2 beschrieben. Pool, die Reaktionen und reinigen die DNA, die eine kommerzielle PCR-Reinigungs-Kits nach den Anweisungen des Herstellers.
Hinweis: Eine Vielzahl von empfohlenen Index Sequenzen kompatibel mit DNA - Clustering NGS 71 zur Verfügung stehen.
6. Führen Sie QC und NGS (In der Regel durch eine Sequenzierung Anlage abgeschlossen)
- (QC-Test # 1) bestätigen Schritt 5.3 Bibliothek DNA-Konzentration unter Verwendung eines FluorMeter 55. Kurz gesagt, bereiten Standards und experimentellen Proben in einem Gesamtvolumen von 200 ul Nuklease-freies Wasser. Wirbelröhren für 2-3 sec, für 2 min bei Raumtemperatur inkubieren, und dann die Proben in das Fluorometer gelesen.
Anmerkung: Proben mit einer Mindestkonzentration von 2 nM DNA-Bibliothek in einem Mindestvolumen von 15 & mgr; l enthalten. - (QC - Test # 2) DNA - Fragment Größenverteilung bestätigen einen bandbasierten Assay 56 verwendet wird .
Hinweis: Eine ideale Verteilung eine relativ breite DNA Spitze ist zentriert um 500 bp in der Länge. Wenn eine erhebliche Menge an Material größer als 1 kb ist, dann ist es empfehlenswert, eine Größe Wahlverfahren zu integrieren, um längere DNA-Spezies zu eliminieren, die Brücke Verstärkung während Clustering behindern wird. Im Gegensatz dazu, wenn ein signifikanter Peak um 100 bis 200 bp ergibt, wurden ein Primer-Dimer kann während der PCR gebildet. In diesem Fall sollte das Verfahren optimiert werden, um die Bildung von Primer-Dimeren zu minimieren. - (QC-Test # 3) Confirm richtigen Einbau von Adaptern in DNA - Bibliothek durch quantitative PCR 57.
- Führen Sie NGS nach der Anwendung der Literatur des Herstellers. Nutzen Sie einen Spike-in von 10% (w / w) & PHgr; X174-DNA, die durch die Bereitstellung ausgewogene Basenzusammensetzung zur Sequenzierung Laufechtzeit-Qualitätsmetriken zu optimieren.
Hinweis: Die Integration Site-Sequenzierungsexperimenten typischerweise auf einzelne Ende 150 bp (SE150) oder Paired-End 150 bp (PE150) Sequenzierung unterzogen werden. PE150 ist besonders nützlich , um den Linker - Befestigungspunkt auf jedem DNA - Molekül zu erfassen (beispielsweise wenn Integrationsstellen auf Anzeichen einer Wirtszelle klonalen Expansion prüfenden).
7. Verwenden Sie ein Customized Python oder Perl-Skript Sequenzierungsdaten für LTR-Sequenzen enthält, Crop entfernt LTR und Linker-Sequenzen zu parsen und Karte zu Referenzgenom mit BLAT
- Scan FASTA-Dateien für LTR-Sequenz enthalten liest, Ernte LTR und Linker-Sequenzen entfernt von Host-genomischen DNA-Sequenz undexportieren diese Sequenzen auf eine neue FASTA-Datei. Karte abgeschnitten liest sowohl mit einem Referenzgenom (zB menschliche Genom Versionen hg19 oder GRCh38) und das virale Genom mit BLAT 58, mit Ausgangsintegrationsstelle Koordinaten in eine separate .txt - Datei exportiert werden , mit den folgenden Einstellungen:
stepsize = 6, minIdentity = 97 und maxIntron = 0 - Parsen der BLAT Ausgangs .txt - Datei entfernen autointegrations (dh Nachweis , dass der LTR Ende in eine innere Region des viralen DNA - Genoms integriert ist) und andere Sequenzen Abbildung auf die HIV-1 - Genoms, und schaffen eine separate Ausgabe .txt - Datei , in der alle doppelten Integrationsstellen haben in einzelne, einzigartige koordinieren Treffer verdichtet.
8. Erstellen Sie .bed Dateien mit 15-Nt Intervalle Integrations Umgebung, wandeln diese zu FASTA-Dateien und Konstruieren Sequence Logos zur Anzeige Basiseinstellungen Umgebung Integration Seiten
- Erstellen Sie .bed Dateien, die ein Intervall von Basen Liste fürjeder Integrationsstelle. Mindestens 15 Basen (5 stromaufwärts und 10 stromabwärts) sind für die Sequenzlogo Generation vorgeschlagen. Generieren Sie eine FASTA - Datei aus diesen .bed Dateien durch die fastaFromBed Funktion von bedtools 59 verwenden und diesen Befehl ein :
fastaFromBed -fi / Verzeichnis / to / Referenz / Genom / -name -s -bed 15_base_pair_file.bed -FO output_file.fasta
Hinweis: Die Invariante viralen 5'-CA-3 'Dinucleotid verbunden ist DNA während der Integration zu hosten, und die Überprüfung der Kreuzung der LTR-Terminus an zelluläre DNA ist ein wichtiger erster Filter zu identifizieren Bona-fide-Integrationsstellen. Wir stellen zusätzlich Sequenz Logos von dieser Wirtspopulation DNA-Sequenz, die experimentellen Ergebnisse zu verifizieren. Als Retroviren umgebenden Präferenzen Basis Unterschrift zeigen ihre Integrationsstellen 14,15 dienen die Sequenz Logos , dass die abgebildeten genomischen Websites durch IN-vermittelte Integration entstand zur Validierung im Vergleich zu anderen Rekombinationsmechanismen wie nicht-homologe DNAEnde 60,61 Beitritt. - Verwenden Sie WebLogo 3 (http://weblogo.threeplusone.com/create.cgi) Sequenz Logos aus den FASTA-Dateien zu erstellen. Klicken Sie auf "Wählen Sie Datei 'FASTA-Datei hochladen und verwenden Sie die folgenden Einstellungen: Ausgabeformat, PDF (Vektor); Logo Größe, groß; Erste Positionsnummer, -5; Logo Bereich -5 bis 5; Y-Achsen-Skala, 0,1, Y-Achsen-tic Abstand, 0,5, Farbschema, klassisch (NA).
9. Erstellen Zentralbasenpaar .bed Dateien, Check für die Probe Kreuzkontamination und Karte der Verteilung von Unique Integration Seiten Relativ zu Einschlägige Genomic Eigenschaften
- Da retrovirale Integration über die tDNA Stränge in einer gestaffelten Art und Weise erfolgt, stellen Sie die genauen Koordinaten der Integrationsstellen für die korrekte Zuordnung der genomischen Verteilung relativ zu genomischer Merkmale des zentralen bp des Zielortes Doppelarbeit zu reflektieren.
- Daher ist für 5 bp aus dem i-Offset-Viren wie HIV-1, erstellen Sie eine .bed Datei mit dem zentralen bp Duplizierenntegration Ort durch zwei Basen stromabwärts für Integrationen Abbildung auf den Plus-Strang und zwei Upstream-Basen für Integrationen Abbildung auf die Minus-Strang.
- Um zu überprüfen , für die Probenkreuzkontamination, die Berechnung der Anzahl der Integrationsstellen häufig zwischen den verschiedenen Bibliotheken unter Verwendung der bedtools Funktion schneiden zentrale bp schneiden .bed Dateien für zwei verschiedene Proben und über diesen Befehl ein :
bedtools intersect -a -b central_basepair_1.bed central_basepair_2.bed -f 1.00 -r -s> overlap1v2.txt - Zählen Sie die Anzahl der Zeilen in der Ausgabe overlap1v2.txt-Datei, um die genaue Anzahl der Websites häufig unter den beiden Bibliotheken zu quantifizieren, indem Sie den folgenden Befehl:
wc -l overlap1v2.txt - Laden Sie die RefSeq Anmerkung .bed Datei für die Version des Referenzgenoms , die für die Integration Standortkartierung von der UCSC Genomannotation Datenbank verwendet wurde (zB http://hgdownload.cse.ucsc.edu/goldenPath/hg38/datenbank) 62.
- Berechnen Sie die Anzahl der Integrationsstellen fallen innerhalb RefSeq Gene mithilfe des bedtools Funktion schneiden die zentrale Basenpaar .bed Datei zu schneiden , die für die Probe erzeugt wurde , mit der RefSeq .bed Datei nach diesem Befehl:
bedtools intersect -a -b central_basepair_1.bed RefSeq_hg38.bed -u> RefSeq_sample1.bed
- Zählen Sie die Anzahl der Zeilen in der Ausgabe RefSeq_sample1.bed-Datei, um die genaue Anzahl der Websites, fallen in RefSeq Gene zu quantifizieren, indem Sie den folgenden Befehl:
wc -l RefSeq_sample1.bed - Wiederholen Sie die Schritte 9.3 und 9.4 für die Zuordnung von Integrationsstellen zu anderen Annotation von Interesse, für die ein Intervall .bed Datei zur Verfügung steht. Laden Sie die aktuelle CpG-Insel Anmerkung .bed-Datei für das Referenzgenom von Interesse aus der UCSC Genomannotation Datenbank, wie in Schritt 9.4 gerichtet.
- Berechnen Sie die Anzahl der Integrationsstellen innerhalb eines bestimmten di fallenHaltung (in diesem Beispiel dargestellt ist ein 5 kb Fenster) von CpG - Inseln durch die bedtools Fensterfunktion verwendet und im Anschluss an diesen Befehl ein :
bedtools Fenster -w 2500 central_basepair_1.bed -b CpG_hg38.bed -u> CpG_sample1.bed
- Zählen Sie die Anzahl der Zeilen in der Ausgabe CpG_sample1.bed-Datei, um die genaue Anzahl der Websites innerhalb von 2,5 kb stromaufwärts oder stromabwärts von CpG-Inseln mit dem folgenden Befehl fallen zu quantifizieren:
wc -l CpG_sample1.bed - Wiederholen Sie die Schritte 9.6 und 9.7 für die Zuordnung von Integrationsstellen in der Nähe TSS. Generieren Sie eine alternative Version der RefSeq.bed-Datei, wobei genomische Mapping auf mehr als ein Gen-Koordinaten wurden nur ein einziges Gen, die an dieser Position angepasst. Dies verhindert, dass zu hohe Schätzung der Gendichte Integrationsstellen umgeben. Berechnen Sie die Gendichte im 1 Mb Region jeder Integrationsstelle umgeben von den bedtools Fensterfunktion verwendet und im Anschluss an diesen Befehl ein :
Bedtools Fenster -W 500000 central_basepair_1.bed -b RefSeq_hg38_NonRedundant.bed -u> GeneDensity_sample1.bed - Berechnen Sie die durchschnittliche Gendichte für alle Integrationen in dem Datensatz mit diesem Befehl folgt vor:
awk '(sum + = $ 7) END (print "Average =" sum / NR)' GeneDensity_sample1.bed
10. Statistisch Integration Site - Distributionen unter Samples Vergleichen Mit Zweischwänziges exakte Test nach Fisher und Zweischwänziges Wilcoxon Rangsummentest in R
Hinweis: Die Verwendung des exakten Fisher-Test zum Vergleich der Anteil der Integrationsstellen innerhalb RefSeq Gene oder in einem Fenster von CpG-Inseln oder TSS, sondern verwenden Sie die Summe Wilcoxon-Rank-Test für die Verteilung in Gendichte Vergleich der Integrationsstellen umgeben. Das R - Programm ist bei http://www.r-project.org/ zur Verfügung.
Zweischwänziges exakten Fisher-Test:
- Mit den Zahlen berechnet wie in den Schritten 9.4 und 9.7 angewiesen, create Matrizen für jeden Vergleich in R der beobachteten Ereignisse (Integrationen innerhalb einer Anmerkung oder innerhalb eines Fensters eine Anmerkung umgibt) im Vergleich zu Orten bleiben durch diesen Befehl folgt vor :
(Annotation_of_interest <- Matrix (c (SampleA # in, SampleA # verbleibenden SampleB # in, SampleB # Rest-), nrow = 2, dimnames = list (c ( 'Mitte', 'Rest'), c ( 'SampleA', 'SampleB')))) - Berechnen Sie den P - Wert für den Vergleich von zweiseitigen exakten Fisher-Test mit dem folgenden Befehl ein :
fisher.test (annotation_of_interest, alternative = 'two.sided') $ p.value
Zweischwänziges Wilcoxon Rangsummentest: - Erstellen Sie eine durch Tabulatoren getrennte TXT-Datei, in der jede Spalte den Beispielnamen in der oberen Zelle enthält, gefolgt durch die folgenden Gen Dichtewerte für alle Integrationsstellen in dieser Bibliothek (aus der .bed Datei in Schritt 9.9 erzeugt) erhalten haben. Importieren Sie diese durch Tabulatoren getrennte TXT - Datei in R mit dem folgenden Befehl und navigating auf die richtige Datei-Verzeichnis:
FILE-NAME <- as.data.frame (read.delim (file.choose (), header = T, check.names = FALSE, füllen = TRUE, sep = ' t')) - Berechnen Sie den P - Wert für den Vergleich von zweiseitigen Wilcoxon - Rangsummentest mit dem folgenden Befehl ein :
wilcox.test (Dateiname $ SampleA, Dateiname $ SampleB, alternative = 'two.sided', gepaart = F, genau = T) $ p.value
Hinweis: P - Werte können nur bis zu einer bestimmten (extrem niedrige) Grenze in R berechnet werden, wonach Null wird durch das Programm zurückgegeben werden. Für massiv verschiedenen Proben , die eine P = 0 in R ergeben, schätzen den P - Wert als <2,2 x 10 -308.
11. Untersuchen Sie Raw Sequenzierungsdaten für Nachweis der klonalen Expansion der Zellen mit integrierten Virus-DNA
Hinweis: Ein kleines Potential für im Referenzgenom gleichen nt genau an der mehr als eine Integration vorhanden ist. Alternativ kann eine einzelne integration Ereignis kann aufgrund der während der Bibliothek Vorbereitung Verwendung von PCR in Sequenzierungsdaten redundant vorhanden sein und / oder durch Zell Vervielfältigung vor der DNA-Präparation. Neuere Analysen der genomischen DNA von HIV-infizierten Patienten haben diese Möglichkeiten zeichnen sich durch eine einzigartige Beschallung Scherstellen / Linker Befestigungspunkte zu identifizieren innerhalb von DNA - Sequenzen mit identischen Integrationsstellen 52-54 (die nur vor der PCR auftreten können). Derzeit gibt es eine Debatte darüber, ob Proviren in klonal expandierten Zellen tragen zur latenten Virusreservoir beherbergte, und somit ist es von besonderem Interesse, ihr Niveau der Expansion zu charakterisieren, wenn bei menschlichen Patienten Integrationsstellen zu studieren.
- Ähnlich wie bei dem in Schritt genannten Verfahren 8.1, erzeugen .bed Dateien ein Intervall von Basen erstreckt, in diesem Fall die Auflistung, 25 nt stromabwärts von jedem einzigartigen Integrationsstelle (upstream Basen sind hier nicht erforderlich). Generieren Sie eine FASTA-Datei aus diesen .bed Dateien (wie angewiesen inSchritt 8.1) durch die fastaFromBed Funktion von bedtools mit und im Anschluss an diesen Befehl ein :
fastaFromBed -fi / Verzeichnis / to / Referenz / Genom / -name -s -bed 25_base_pair_file.bed -FO output_file.fasta
Hinweis: Um die Spezifität der einzelnen verbessern suchen, wird empfohlen, mindestens 25 nt stromabwärts von jeder Integrationsstelle zu extrahieren für klonalen Expansion analysiert. - Vorzugsweise ein individuelles Skript finden Sie in der Rohsequenzdaten FASTA-Datei für alle Strings eine exakte Übereinstimmung mit dem 25 nt stromabwärts von jedem einzigartigen Integrationsstelle und deponieren diese Sequenzen in eine neue Datei enthält. Trim LTR und Linker-Sequenzen aus den rohen Saiten. Merge PE-Sequenz liest, indem liest auf der Rückseite Ergänzung Umwandlung, Trimmen LTR und Linker-Sequenzen, und dann READ2 Strings ihre READ1 Paar zuweisen, wenn die Strings nt mindestens 20 überlappende teilen.
- Scannen Sie die Linker-Befestigungspunkte von jeder Integrationsstelle Block. Klassifizieren jedes Integration als "klonal expandierten &# 34; wenn Linker Befestigungspunkte sind ≥3 auseinander bp.
Hinweis: Ein Protokoll zur klonalen Expansion Analyse ohne Sequenz verschmelzenden liest wurde 52 beschrieben.
Anmerkung: Fragmentation des Genoms an der exakt gleichen Stelle durch Beschallung führt zu einer Unterschätzung des Ausmaß der klonalen Expansion und Methoden , um die sich ergebende experimentelle Bias korrigiert wurden 63,64 beschrieben.