$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Ici, nous démontrons une suite de protocoles de séquençage de l’erreur-corrigé pouvant être facilement mises en œuvre afin d’étudier les mutations avec VAFs faibles dans différentes maladies. Le facteur le plus important est l’incorporation de UMIs avec chaque molécule avant séquençage car ils permettent la correction d’erreurs des lectures brutes. Les méthodes décrites ici permettent aux chercheurs d’incorporer UMIs personnalisés aux panneaux de gène commercialement disponibles et individu-conçues oligos de gène-spécifique.
Protocole standard de NGS s’oppose à la détection des mutations avec VAF inférieure à 2 % en raison du taux d’erreur de séquençage, et cela limite l’application de NGS dans les études où la détection de variants rares est cruciale. En contournant le taux d’erreur standard de NGS, ECS permet la détection sensible de ces variantes brutes. Par exemple, détection de mutations pathogènes lorsque ces mutations surviennent tout d’abord (donc avoir VAF faible) est impérative d’informer l’intervention précoce de la maladie14,15. Dans la recherche sur la leucémie, la détection du résiduel minimal maladie (après le traitement des cellules leucémiques résiduelles) informe la stratification du risque et pourrait être utilisée pour informer des options de traitement de manière que les évaluations de cytométrie en flux binaire ne peut pas. En outre, ECS s’applique pour détecter des acides nucléiques tumorales circulantes et d’évaluer le potentiel métastatique chez les patients de tumeur solide en évaluant la présence/absence, ainsi la charge variant de certaines mutations qui sont caractéristiques du primaire 16de tumeur.
Comme le montre le tableau 1, le pouvoir d’utiliser le modèle d’erreur de position spécifique axée sur la distribution binomiale pour appeler les variantes dépend en grande partie le nombre de bibliothèques séquencés ainsi que la profondeur du séquençage utilisée pour construire le modèle de l’erreur. La robustesse du modèle erreur augmente avec le nombre plus élevé d’échantillons et plus en profondeur le séquençage. Il est recommandé d’utiliser au moins 10 échantillons séquencés avec une moyenne de correction erreur lecture couverture de 3000 x par exemple pour créer un profil d’erreur pour chaque échantillon. L’approche axée sur la position est similaire à MAGERI, mais au lieu d’utiliser un taux d’erreur global pour tous les six types différents de substitution (A > C/T > G, A > G/T > C, A > T/T > A, C > A/G > T, C > G/G > C C > T/G > A)13, nous modélisons chaque substitution indépendamment à chaque position. Par exemple, un taux d’erreur de C > T à une position donnée génomique est différent d’un autre poste. Notre démarche tienne également compte un effet de lot de séquençage, comme le taux de substitution base observé en un seul passage de séquençage pourrait être différent d’une autre course. C’est pourquoi il est important de modéliser chaque poste pour tous les types de substitution, surtout quand les échantillons de séquençage différents cycles d’essai sont mis en commun pour construire le modèle.
Une considération importante lors de la conception d’une expérience de l’ECS est le seuil de détection souhaitée. La beauté des études NGS est qu’ils peuvent être facilement redimensionnées en ce qui concerne les gènes et les objectifs d’intérêt, seuil de détection (dépend de la profondeur de séquençage) et nombre de personnes interrogées. Par exemple, si les chercheurs s’intéressent à trouver des mutations rares dans deux amplicons avec un seuil de détection de 0,0001, ils peuvent mettre au maximum 75 échantillons en une séquence unique exécuté à l’aide de chimie MiSeq V2 qui génère jusqu'à 15 millions de lectures (2 amplicons * 10 000 molécules * 10 lit pour corriger des erreurs * 75 échantillons = 15 millions séquençage lectures). Les chercheurs peuvent varier le nombre de molécules d’entrer dans la séquence ou le nombre d’échantillons groupés en une séquence unique pour régler le seuil de détection. Dans nos études, nous avons cherché à trouver avec un seuil de détection des mutations de 0,0001 VAF (01:10, 000) en utilisant le panneau de gène Illumina. Nous utilisons systématiquement 250 ng de démarrage ADN pour s’assurer que les molécules suffisantes sont saisis afin d’atteindre le seuil de détection susmentionnés. Les chercheurs peuvent choisir de commencer par la plus faible quantité d’ADN (50 ng est recommandé) si la limite de détection souhaitée est > 0,001 VAF.
Comme les UMIs sont ajoutés sur les index d’i5, paramètres de séquencement doivent être modifiées en conséquence. Par exemple, nous avons utilisé 16 N UMIs et les réglages de séquençage étaient fin paires 2 x 144 lectures, 8 cycles d’Index 1 et 16 d’indice 2 au lieu de l’habituels 8 cycles d’Index 2. L’augmentation de l’indice 2 cycle est compensée par une diminution du nombre total de cycles alloués pour le lit. Si chercheurs choisissent d’utiliser 12N UMIs10,17, les paramètres doivent être changés en 12 cycles de Index 2.
Cette méthode de séquençage de l’UMI-basé est optimisée pour corriger les erreurs de séquençage. Il reste sous-optimal en traitant de jackpotting PCR, qui est un problème pour toute méthode basée sur l’amplification. Nous avons effectué des séances d’après séquençage et validation post-bio-informatique à l’aide de ddPCR, et nous peine détecter des faux positifs en raison de jackpotting PCR. Néanmoins, il est recommandé que les chercheurs mener les expériences à l’aide de haute-fidélité polymérase pour s’assurer que les erreurs de l’amplification basse.