June 23rd, 2012
Gepoolde DNA-sequencing is een snelle en kosteneffectieve strategie voor zeldzame varianten geassocieerd met complexe fenotypes in grote cohorten op te sporen. Hier beschrijven we de computationele analyse van gecombineerde, next-generation sequencing van 32 kanker-gerelateerde genen met behulp van de SPLINTER softwarepakket. Deze methode is schaalbaar, en van toepassing op alle fenotype van belang.
Het algemene doel van deze procedure is om genen te identificeren binnen een populatie van individuen die een overwicht van zeldzame functionele variatie vertonen. Dit wordt bereikt door eerst een populatie van DNA-monsters samen te voegen. De tweede stap is het maken en sequencen van een volgende generatie sequencingbibliotheek.
Dit wordt gevolgd door de uitlijning van reads naar de referentiesequentie en het maken van een foutmodel. De laatste stap is computationele analyse met behulp van het splinteralgoritme. Uiteindelijk wordt splinteranalyse van gepoolde volgende generatie sequencing gebruikt om genen te tonen binnen populaties die een overwicht van zeldzame functionele variantie bevatten. Demonstratie van de procedure.
Vandaag zal Francesco Vilania, een afgestudeerde student in het lab van mijn mentor en onze medewerker, Rob Mitra, aanwezig zijn en hij zal worden vergezeld door Enrique Ramos, een afgestudeerde student in mijn laboratorium. Het belangrijkste voordeel van deze techniek boven bestaande methoden zoals genotypen van enkelvoudige individuen, is dat het je toelaat om zeer precies zeldzame sequentievarianten te detecteren in een gemengde populatie van DNA-moleculen zonder enige voorafgaande informatie te vereisen. Deze methode kan helpen bij het beantwoorden van sleutelvraagstukken in de genetica en genomica, zoals hoe de frequentie van nieuwe ziekteveroorzakende zeldzame varianten in grote cohortstudies kan worden bepaald.
Elk splinterexperiment vereist de aanwezigheid van een negatieve en positieve controle om optimale nauwkeurigheid te verkrijgen, bereid de PCR-reactiemix voor met behulp van PFU ultra hoge trouw. DNA-polymerase. De negatieve controle is een PCR-product van elke DNA-sequentie die bekend is zonder genetische variatie, zoals een gekloonde vectorruggengraat.
Hier wordt een 1.934 basenpaar amplicon van de M 13 MP 18 vector gebruikt. De positieve controle kan elke set van eerder gevalideerde sequentievarianten zijn die aanwezig zijn in de hele populatie. Als deze gegevens niet beschikbaar zijn, heeft dit lab een kunstmatige positieve controle ontworpen die bestaat uit een 331 basenpaar per PCR-product van een mix van geëngINEERDE sequenties gecloneerd in de PGMT easy-vector zoals vermeld in deze tabel.
Deze sequenties worden gecombineerd om verschillende minderheidsallelfrequenties van echte varianten binnen de patiëntenpool na te bootsen. Na PCR-amplificatie van monsters zoals besproken in het schriftelijke protocol dat bij dit video behoort, reinigt u elk PCR-product van overtollige primers met behulp van kyogen kayak snelle kolomzuivering, of 96-welfilterplaten met vacuüm manifold voor grootschalige opruiming. Eenmaal gezuiverd, kwantificeer elk PCR-product met behulp van standaardtechnieken.
Bereid je voor om alle PCR-producten en controles te combineren in een pool genormaliseerd op molecuulnummer. Pooling per concentratie zal resulteren in overrepresentatie van kleine amplicons over grotere producten. In plaats daarvan, pool een genormaliseerd aantal moleculen per amplicons.
Kies willekeurige getallen die groot genoeg zijn om de nauwkeurigheid tijdens het pipetten te behouden. Trek de PCR-producten en controles. Ligatie van de PCR-producten is noodzakelijk omdat fragmentatie van kleine PCR-aanvragers waarschijnlijk de representatie naar hun uiteinden zal beïnvloeden.
Om deze reden lijgen we de pull PCR-producten in grote con voorafgaand aan hun fragmentatie. Bereid mix voor voor afsluiting met stompe uiteinden met behulp van T vier Ligase, T vier PNK en PEG zoals vermeld in het protocol. Incubeer de reactie bij 22 graden Celsius gedurende 17 uur.
Volg met incubatie bij 65 graden Celsius gedurende 20 minuten en houd bij vier graden Celsius. Controleer vervolgens de ligatie door 50 nanogram monster in een arogel te laden. Succesvolle ligatie zal resulteren in een band met hoog molecuulgewicht die in de baan aanwezig is.
Bereid u voor op DNA-fragmentatie via een willekeurige sonificatiestrateeg door de monster 10 tot een te verdunnen in Qiagen PB Buffer om het minder viskeus te maken. Fragmenteer vervolgens de grote conus van PCR-producten met behulp van een 24-monsters diagnonode bio ruptuur, soniceer bij hoog vermogen gedurende 25 minuten met 40 seconden aan en 20 seconden uit per minuut. Controleer de resultaten van DNA-fragmentatie op een agrogel en ga verder met illuminum sequencing zoals beschreven in de tekst.
Om te beginnen met sequencing, lees uitlijning. Ofwel converteer de ruwe sequencingleestbestanden naar scarf-formaat, of comprimeer ze. Compressie is optioneel.
Het bespaart tijd en ruimte voor de volgende analysestappen zonder enige relevante informatie te verliezen. Gebruik het inbegrepen uitlijningshulpmiddel om de ruwe leest uit te lijnen naar de geannoteerde snellere referentiesequentie. Specifiek voor de gerichte regio's omvatten de PCR-reacties evenals de positieve en negatieve controles.
Het invoerformaat moet in scarf-formaat of gecomprimeerd zijn. Voer vervolgens bestandsmarkering uit zoals beschreven in de tekst. Elke uitvoering genereert een uniek profiel van sequencingfout om te worden gekarakteriseerd voor nauwkeurige variantaanroep om fouten voor elke uitvoering te modelleren.
Een interne controle waarvan bekend is dat deze is ingezet voor sequentievariatie, wordt opgenomen in elke poolmonsterbibliotheek Vanaf het uitgelijnde getagde bestand. Genereer een foutmodelbestand met behulp van het inbegrepen hulpmiddel met de negatieve controlereferentiesequentie, alle negatieve controlesequenties kunnen worden gebruikt of alternatief alleen een subset wanneer gespecificeerd door zijn vijf prime en drie prime uiteinden. Unieke leest en pseudo-tellingen moeten altijd worden toegepast.
Het hulpmiddel genereert drie bestanden met namen die eindigen met nul, een of twee als de uitvoerbestandsnaamparameter. Deze bestanden komen overeen met een nul eerste en tweede ordefoutmodel respectievelijk voor variantaanroep met splinter. Het tweede ordefoutmodel moet altijd worden gebruikt voor visualisatie van het profiel van de runfoutratio.
Het Pearl-script dat wordt gebruikt om de foutmodelgrafiek te plotten, kan worden gebruikt om een PDF-foutplot te genereren op het nulordefoutmodelbestand. Het plotbestand zal runspecifieke fouttrends onthullen en kan worden gebruikt om het maximale aantal leesbases voor de analyse te veronderstellen. De volgende sectie zal demonstreren hoe splinter op het uitgelijnde bestand kan worden uitgevoerd met behulp van het foutmodel om
Pooled DNA sequencing is een efficiënte methode voor het identificeren van zeldzame genetische varianten die verband houden met complexe eigenschappen in grote populaties. Dit artikel beschrijft de computationele analyse van pooled sequencing data van 32 kanker-gerelateerde genen met behulp van de SPLINTER softwarepakket.
Detecting rare genomic variants in large populations is critical for target validation in complex disease research, where common variants fail to explain phenotypic variability. The SPLINTER-enabled pooled sequencing approach provides a cost-effective, scalable method to interrogate therapeutic hypotheses by identifying low-frequency functional variants without prior variant knowledge. This supports early discovery de-risking by enabling allele frequency estimation and variant confirmation in disease-relevant cohorts, directly informing portfolio prioritization and mechanistic follow-up.
The method fits within the discovery continuum from hypothesis generation to lead identification, providing variant detection outputs that inform target selection and assay readiness.