June 23rd, 2012
Объединенные секвенирования ДНК является быстрым и экономически эффективной стратегией для обнаружения редких вариантов, связанные с комплексными фенотипов в больших группах. Здесь мы опишем вычислительный анализ объединенных следующего поколения, последовательность из 32 связанных с раком генов с помощью пакета SPLINTER программного обеспечения. Этот метод является масштабируемым, и применимы к любой фенотип интерес.
Общая цель этой процедуры состоит в том, чтобы идентифицировать гены в популяции индивидуумов, демонстрирующих преобладание редких функциональных вариаций. Это достигается путем объединения популяции образцов ДНК. Вторым шагом является создание и секвенирование библиотеки секвенирования следующего поколения.
За этим следует выравнивание операций чтения по ссылочной последовательности и создание модели ошибки. Заключительным этапом является вычислительный анализ с использованием алгоритма осколков. В конечном счете, анализ фрагментов объединенного секвенирования нового поколения используется для выявления генов в популяциях, содержащих преобладание редкой функциональной вариативности.
Сегодня будет Франческо Вилания, аспирант в лаборатории моего наставника и нашего сотрудника, Роба Митры, и к нему присоединится Энрике Рамос, аспирант моей лаборатории. Основное преимущество этой методики перед существующими методами, такими как отдельные отдельные генотипы, заключается в том, что она позволяет очень точно обнаруживать редкие варианты последовательности в смешанной популяции молекулы ДНК, не требуя при этом никакой предварительной информации. Этот метод может помочь ответить на ключевые вопросы в области генетики и геномики, например, как определить частоту новых заболеваний, вызывающих редкие варианты, в больших когортных исследованиях.
Каждый эксперимент с осколками требует наличия отрицательного и положительного контроля для получения оптимальной точности, приготовления реакционной смеси ПЦР с использованием PFU сверхвысокой точности. ДНК-полимераза. Отрицательный контроль представляет собой продукт ПЦР из любой известной последовательности ДНК без генетической изменчивости, такой как клонированный векторный каркас.
Здесь используется ампликон 1, 934 пары оснований из вектора M 13 MP 18. Положительным контролем может быть любой набор ранее валидированных вариантов последовательности, присутствующих во всей популяции. Если эти данные недоступны, эта лаборатория разработала искусственно положительный контроль, состоящий из 331 основания на продукт ПЦР из смеси модифицированных последовательностей, клонированных в легкий вектор PGMT, как указано в этой таблице.
Эти последовательности комбинируются для имитации различных частот минорных аллелей истинных вариантов в пуле пациентов. После ПЦР-амплификации образцов, как описано в письменном протоколе, прилагаемом к этому видео, очистите каждый продукт ПЦР от избытка праймеров с помощью быстрой очистки колонки kyogen kayak или 96-луночных фильтровальных пластин с вакуумным коллектором для крупномасштабной очистки. После очистки количественно оцените каждый продукт ПЦР с помощью стандартных методов.
Приготовьтесь объединить все продукты ПЦР и контрольные элементы в пул, нормализованный по количеству молекул. Объединение по концентрации приведет к чрезмерному представлению небольших ампликонов над более крупными продуктами. Вместо этого объедините нормализованное количество молекул на ампликоны.
Выбирайте произвольные числа, которые достаточно велики для поддержания точности во время пипетирования. Вытащите ПЦР-продукты и контроль. Лигирование ПЦР-продуктов необходимо, потому что фрагментация мелких заявителей на ПЦР, скорее всего, приведет к смещению представительства в их сторону.
По этой причине мы ликонируем продукты ПЦР до их фрагментации. Приготовьте смесь для лигирования тупым концом с использованием Т-4 лигазы, Т-4 PNK и ПЭГ, как указано в протоколе. Инкубируйте реакцию при температуре 22 градуса Цельсия в течение 17 часов.
Затем инкубируйте при температуре 65 градусов Цельсия в течение 20 минут и держите при температуре четыре градуса Цельсия. Проверьте лигирование, загрузив 50 нанограммов образца в возникший гель. Успешное лигирование приведет к тому, что на дорожке будет присутствовать полоса с высокой молекулярной массой.
Подготовьтесь к фрагментации ДНК с помощью стратегии случайной ультразвуковой обработки, разбавив образец в соотношении 10 к одному в буфере Qiagen PB, чтобы сделать его менее вязким. Затем фрагментируйте большой конус продуктов ПЦР с помощью биоразрыва 24 диагностического узла на 24 образцах, обрабатывайте ультразвуком с высокой мощностью в течение 25 минут с 40 секундами включения и 20 секунд выключения в минуту. Проверьте результаты фрагментации ДНК на агрогеле и приступайте к светящему секвенированию, как описано в тексте.
Чтобы начать секвенирование, прочтите выравнивание. Либо конвертируйте необработанную секвенцию, считайте файлы в формат шарфа, либо сожмите их. Сжатие не является обязательным.
Это экономит время и пространство для последующих этапов анализа без потери важной информации. С помощью входящего в комплект инструмента выравнивания выровняйте необработанные чтения по аннотированной более быстрой ссылочной последовательности. Специфичные для целевых областей включают реакции ПЦР, а также положительный и отрицательный контроль.
Формат ввода должен быть в формате шарфа или сжатым. Затем выполните добавление тегов к файлам, как описано в тексте. Каждый прогон создает уникальный профиль ошибки секвенирования, который должен быть охарактеризован для точного вызова вариантов для ошибок модели для каждого прогона.
Внутренний контроль вариаций последовательностей, о котором известно, что он развернут, включен в каждую библиотеку образцов пула из выровненного файла с тегами. Сгенерируйте файл модели ошибки с помощью прилагаемого инструмента с отрицательной управляющей опорной последовательностью, можно использовать всю отрицательную управляющую последовательность или только подмножество, если оно задано пятью простыми и тремя простыми концами. Всегда следует применять уникальные операции чтения и псевдосчетчики.
Инструмент сгенерирует три файла, названных в качестве параметра имени выходного файла, заканчивающихся на ноль, один или два. Эти файлы соответствуют нулевой модели ошибок первого и второго порядка соответственно для вызова варианта с помощью splinter. Модель ошибок второго порядка всегда должна использоваться для визуализации профиля частоты ошибок прогона.
Скрипт Pearl, используемый для построения графика модели ошибок, может быть использован для создания графика ошибок в формате PDF в файле модели ошибок нулевого порядка. Файл графика будет выявлять тенденции ошибок, специфичных для прогона, и может быть использован для вывода максимального количества баз чтения для анализа. В следующем разделе будет показано, как запустить splinter на выровненном файле с использованием модели ошибок для обнаружения редких вариантов последовательности.
Первым шагом в анализе является запуск splinter на выровненном файле с использованием ссылочной последовательности и модели ошибок. Одиночные базы чтения могут быть исключены из анализа, если они обнаружены дефектными. Пороговое значение P-значения определяет, насколько строгим будет анализ вызова вариантов.
Минимальная отсечка в отметке минус 1,301 – хорошее начало. Опция размера пула оптимизирует алгоритм дискриминации сигнала к шуму, устраняя потенциальную дисперсию с частотами второстепенных аллелей, меньшими, чем у одного аллеля в фактическом пуле. Опция размера пула должна быть установлена на ближайшее значение, которое больше фактического числа аллелей, анализируемых в эксперименте.
Дисперсия, вызванная на более низких частотах, будет игнорироваться как шум. После ввода всех параметров и имен файлов запускаем splinter. Этот файл возвращает все совпадения, которые являются статистически значимыми по всей выборке с описанием положения варианта, типа варианта.
P-значение на цепь ДНК, частота варианта и общий охват на цепь ДНК. Флакон со списком используется осколком для нормализации покрытия по всей выборке. Первое поле указывает на интересующий ампликон, тогда как второе поле указывает на позицию, в которой присутствует мутация.
N указывает, что остальная часть последовательности не содержит мутаций. Нормализация, анализ положительного контроля является ключом к максимальному повышению чувствительности и специфичности для конкретного прогона. Это важно, потому что, скорее всего, первоначального отсечки минус 1,301 будет недостаточно для устранения всех ложных срабатываний.
Каждый анализ осколков покажет фактическое P-значение для каждого названного варианта, приоритет которого невозможно предсказать. Тем не менее, весь анализ может быть повторен с использованием наименее строгого P-значения, отображаемого на исходном выходе для известных истинно положительных базовых положений. Это позволит сохранить все истинно положительные результаты, исключив большинство, если не все, ложноположительные результаты, которые обычно имеют гораздо менее значимые значения P по сравнению с истинно положительными.
Для автоматизации этого процесса можно использовать скрипт тестера cutoff. Для скрипта тестера cutoff требуется выходной файл splinter и список положительных контрольных попаданий в виде файла, разделенного табуляцией, как тот, который используется для нормализации. В результате на выходе будет получен список отсечек, которые постепенно достигают оптимального.
Последняя строка представляет собой наиболее оптимальную границу для прогона и поэтому может быть использована для анализа данных. Оптимальным результатом является достижение чувствительности и специфичности одного. Однако, если он не достигнут, анализ осколков можно оптимизировать, изменив количество встроенных баз чтения.
Окончательный отсечка может быть применен к данным с помощью скрипта cutoff cut, который отфильтрует выходной файл сплинтера от попаданий ниже оптимального отсечки. На этом шаге будет сгенерирован окончательный выходной файл сплинтера, который будет содержать снипы и инделы, присутствующие в образце. Обратите внимание, что вывод для вставок немного отличается от вывода замен или удалений.
Точность как функция покрытия для одного аллеля в объединенной выборке визуализируется на этом типе графика. Точность оценивается как площадь под кривой, сокращенно UC кривой оператора приемника и колеблется от случайной точности 0,5 до идеальной точности 1,0. В этом примере UC построен в виде функции покрытия по аллелю для обнаружения одиночных мутантных аллелей в пулах из 200 501 000 аллелей.
Здесь UC отображается как функция общего числа вставок, удалений и замен. Этот график погрешностей показывает вероятность включения ошибочного основания в заданной позиции. Профиль ошибок показывает низкую частоту ошибок с возрастающей тенденцией к трем простым концам чтения секвенирования.
Примечательно, что различные референсные нуклеотиды демонстрируют разные вероятности ошибок. Этот график показывает точность осколка в оценке частоты аллеля для позиций, которые имели более чем 25-кратное покрытие на аллель. Сравнение частот объединенных аллелей ДНК, оцененных по сплинтеру, с количеством аллелей, измеренным с помощью полногеномных ассоциативных исследований или результатов GWAS.
В очень высокой корреляции популяция из 974 особей была выбрана и нацелена на более чем 20 килобаз для секвенирования. Splinter применялся для выявления редких вариантов. В соответствии со стандартным протоколом у каждого индивидуума было проведено генотипирование, ранее выполненное с помощью gwas в соответствии между генотипированием меченых и новых вариантов.
Вызванные в объединенный образец были отличными. Три варианта, два из которых были редкими в популяции, были названы denovo по результатам секвенирования и были подтверждены индивидуальным пиросеквенированием, частотами минорных аллелей или математическим соответствием между пиросеквенированием и вытягиваемым секвенированием. После того, как вы закончите поиск редкой дисперсии в объединенной выборке, многие люди захотят знать, каковы функциональные последствия выявленной дисперсии.
Таким образом, аннотация вашего отклонения становится следующим шагом в процессе после разработки. Этот метод проложил путь для исследователей в области секвенирования ДНК к быстрому и экономически эффективному изучению редких вариантов для характеристики редких вариантов в больших популяционных исследованиях. После просмотра этого видео у вас должно сложиться хорошее понимание того, как обнаруживать редкие варианты последовательности в пуле, образце ДНК с помощью осколка.
Сеquenирование пуломированной ДНК является эффективным методом для выявления редких генетических вариантов, связанных со сложными признаками в больших популяциях. В данной статье описывается вычислительный анализ данных пуломированного секвенирования из 32 генов, связанных с раком, с использованием программного пакета SPLINTER.
Detecting rare genomic variants in large populations is critical for target validation in complex disease research, where common variants fail to explain phenotypic variability. The SPLINTER-enabled pooled sequencing approach provides a cost-effective, scalable method to interrogate therapeutic hypotheses by identifying low-frequency functional variants without prior variant knowledge. This supports early discovery de-risking by enabling allele frequency estimation and variant confirmation in disease-relevant cohorts, directly informing portfolio prioritization and mechanistic follow-up.
The method fits within the discovery continuum from hypothesis generation to lead identification, providing variant detection outputs that inform target selection and assay readiness.