23 июня 2012 г.
Объединенные секвенирования ДНК является быстрым и экономически эффективной стратегией для обнаружения редких вариантов, связанные с комплексными фенотипов в больших группах. Здесь мы опишем вычислительный анализ объединенных следующего поколения, последовательность из 32 связанных с раком генов с помощью пакета SPLINTER программного обеспечения. Этот метод является масштабируемым, и применимы к любой фенотип интерес.
Общая цель данной процедуры — идентификация генов в популяции индивидуумов с преобладанием редких функциональных вариаций. Это достигается путем первоначального объединения пула образцов ДНК данной популяции. Вторым этапом является создание и секвенирование библиотеки для секвенирования следующего поколения.
Затем следует выравнивание ридов по референсной последовательности и создание модели ошибок. Заключительным этапом является компьютерный анализ с использованием алгоритма splinter. В конечном итоге анализ splinter данных пулированного секвенирования следующего поколения (Next generation sequencing) используется для выявления генов в популяциях, характеризующихся преобладанием редких функциональных вариантов. Демонстрация процедуры.
Сегодня с нами будет Франческо Вилания, аспирант лаборатории моего наставника и нашего коллаборатора Роба Митры, а также Энрике Рамос, аспирант моей лаборатории. Основное преимущество данной методики перед существующими методами, такими как генотипирование отдельных особей, заключается в том, что она позволяет очень точно обнаруживать редкие варианты последовательностей в смешанной популяции молекул ДНК без необходимости в какой-либо предварительной информации. Этот метод может помочь ответить на ключевые вопросы в области генетики и геномики, например, как определить частоту новых редких вариантов, вызывающих заболевания, в крупномасштабных когортных исследованиях.
Для достижения оптимальной точности в каждом эксперименте со сплайсерами необходимо использовать отрицательный и положительный контроли; подготовьте реакционную смесь для ПЦР, используя высокоточную ДНК-полимеразу PFU ultra high fidelity. В качестве отрицательного контроля используется продукт ПЦР любой последовательности ДНК, в которой заведомо отсутствует генетическая вариабельность, например, клонированный остов вектора.
В данном случае используется ампликон длиной 1 934 п.н. из вектора M 13 MP 18. В качестве положительного контроля может быть использован любой набор ранее валидированных вариантов последовательностей, присутствующих во всей популяции. Если такие данные отсутствуют, данной лабораторией был разработан искусственный положительный контроль, представляющий собой ПЦР-продукт длиной 331 п.н., полученный из смеси сконструированных последовательностей, клонированных в вектор PGMT easy, как указано в данной таблице.
Эти последовательности объединяют для имитации различных частот встречаемости минорных аллелей истинных вариантов в пуле пациентов. После ПЦР-амплификации образцов, описанной в письменном протоколе к данному видео, очистите каждый ПЦР-продукт от избытка праймеров с помощью колонок для быстрой очистки Kyogen Kayak или 96-луночных фильтрующих планшетов с вакуумным манифольдом для крупномасштабной очистки. После очистки количественно определите содержание каждого ПЦР-продукта с использованием стандартных методов.
Подготовьтесь к объединению всех ПЦР-продуктов и контролей в пул, нормализованный по количеству молекул. Объединение по концентрации приведет к избыточному представительству коротких ампликонов по сравнению с более длинными продуктами. Вместо этого объедините нормализованное количество молекул для каждого ампликона.
Выберите произвольные числа, достаточно большие для обеспечения точности при дозировании пипеткой. Возьмите ПЦР-продукты и контроли. Лигирование ПЦР-продуктов необходимо, так как фрагментация коротких ПЦР-ампликонов, скорее всего, приведет к смещению репрезентативности в сторону их концов.
По этой причине мы лигируем продукты ПЦР в большой вектор перед их фрагментацией. Подготовьте смесь для лигирования тупых концов, используя T4 лигазу, T4 ПНК и ПЭГ, как указано в протоколе. Инкубируйте реакционную смесь при 22 °C в течение 17 часов.
Затем инкубируйте смесь при 65 °C в течение 20 минут, после чего храните при 4 °C. Далее проверьте эффективность лигирования, нанеся 50 нг образца на агарозный гель. Успешное лигирование будет характеризоваться наличием полосы с высокой молекулярной массой в соответствующей лунке.
Подготовьте образец к фрагментации ДНК методом случайного соникации, разбавив его в 10 раз буфером Qiagen PB Buffer для снижения вязкости. Затем фрагментируйте крупные конкатемеры продуктов ПЦР с помощью прибора Diagen Node BioRuptor на 24 образца, проводя соникацию на высокой мощности в течение 25 минут с циклом 40 секунд работы и 20 секунд отдыха в каждой минуте. Проверьте результаты фрагментации ДНК с помощью агарозного геля и приступайте к секвенированию на платформе Illumina, как описано в тексте.
Для начала секвенирования выполните выравнивание чтений. Преобразуйте необработанные файлы чтений секвенирования в формат scarf или сжмите их. Сжатие является необязательным.
Это позволяет сэкономить время и пространство для последующих этапов анализа без потери любой значимой информации. С помощью прилагаемого инструмента выравнивания выполните выравнивание необработанных чтений по аннотированной ускоренной референсной последовательности. Специфические для целевых регионов данные включают реакции ПЦР, а также положительный и отрицательный контроли.
Входной формат должен быть в формате scarf или сжатым. Затем выполните тегирование файлов, как описано в тексте. Каждый запуск генерирует уникальный профиль ошибок секвенирования, который необходимо охарактеризовать для точного вызова вариантов с целью моделирования ошибок для каждого запуска.
В библиотеку каждого пула образцов из выровненного файла с тегами включен внутренний контроль с известной вариацией последовательности. С помощью прилагаемого инструмента создайте файл модели ошибок, используя референсную последовательность отрицательного контроля; можно использовать всю последовательность отрицательного контроля или ее часть, указав 5'- и 3'-концы. Всегда следует применять уникальные чтения и псевдоподсчеты.
Инструмент создаст три файла, имена которых будут соответствовать параметру выходного файла с окончанием 0, 1 или 2. Эти файлы соответствуют моделям ошибок нулевого, первого и второго порядка соответственно для вызова вариантов с помощью splinter. Для визуализации профиля частоты ошибок запуска следует всегда использовать модель ошибок второго порядка.
Скрипт Perl, используемый для построения графика модели ошибок, может быть применен для создания PDF-графика ошибок на основе файла модели ошибок нулевого порядка. Этот график выявит тенденции ошибок, специфичные для конкретного запуска, и может быть использован для определения максимального количества считываемых оснований для анализа. В следующем разделе будет продемонстрировано, как запустить программу splinter для выровненного файла с использованием модели ошибок для обнаружения редких вариантов последовательностей.
Первым этапом анализа является запуск программы splinter для выровненного файла с использованием референсной последовательности и модели ошибок. Одиночные основания ридов могут быть исключены из анализа, если они окажутся дефектными. Пороговое значение P-value определяет строгость анализа выявления вариантов.
Хорошим начальным значением является минимальный порог отсечения -1,301. Опция размера пула (pool size) оптимизирует дискриминацию сигнала от шума в алгоритме путем устранения потенциальной вариабельности при частоте минорных аллелей ниже, чем частота одного аллеля в фактическом пуле. Опцию размера пула следует установить на ближайшее значение, которое превышает фактическое количество аллелей, проанализированных в эксперименте.
Вариации, выявленные при низких частотах, будут игнорироваться как шум. После ввода всех параметров и имен файлов запустите splinter. Этот файл возвращает все статистически значимые попадания по всей выборке с описанием положения и типа варианта.
Значение P-value для частоты варианта на одну цепь ДНК и общее покрытие на одну цепь ДНК. Файл списка (list vial) используется программой splinter для нормализации покрытия по всему образцу. Первое поле указывает на интересующий ампликон, в то время как второе поле указывает позицию, в которой присутствует мутация.
N означает, что остальная часть последовательности не содержит никаких мутаций. Нормализация и анализ положительного контроля имеют ключевое значение для максимизации чувствительности и специфичности конкретного анализа. Это важно, поскольку, скорее всего, первоначального порогового значения -1,301 будет недостаточно для устранения всех ложноположительных результатов.
В каждом анализе сплинтеров будет указано фактическое значение P-value для каждого выявленного варианта, которое не могло быть предсказано заранее. Тем не менее, весь анализ можно повторить, используя наименее строгое значение P-value, отображаемое в первоначальном результате для известных истинно положительных базовых позиций. Это позволит сохранить все истинно положительные результаты, исключив при этом большинство, если не все, ложноположительные, которые обычно имеют гораздо менее значимые значения P-value по сравнению с истинно положительными.
Для автоматизации этого процесса можно использовать скрипт для определения порогового значения (cutoff tester script). Для работы этого скрипта требуется выходной файл Splinter и список положительных контрольных хитов в виде файла с разделителями-табуляторами, аналогичного тому, который используется для нормализации. В результате будет получен список пороговых значений, последовательно приводящих к оптимальному.
Последняя линия представляет собой наиболее оптимальный порог отсечения для данного запуска и, следовательно, может быть использована для анализа данных. Оптимальным результатом является достижение чувствительности и специфичности, равных единице. Однако, если это не удалось, анализ сплинтеров можно оптимизировать, изменив количество включенных считываемых оснований.
Окончательный порог отсечения можно применить к данным с помощью скрипта cutoff cut, который отфильтрует выходной файл splinter, удалив хиты с показателями ниже оптимального порога. На этом этапе будет создан итоговый выходной файл splinter, содержащий однонуклеотидные полиморфизмы (snips) и индели, присутствующие в образце. Пожалуйста, обратите внимание, что формат вывода для инсерций несколько отличается от формата для замен или делеций.
На графиках данного типа визуализируется точность в зависимости от покрытия для одного аллеля в объединенном образце. Точность оценивается как площадь под кривой (AUC) рабочей характеристики приемника и варьирует от случайной точности 0,5 до идеальной точности 1,0. В данном примере AUC представлена как функция покрытия на один аллель при выявлении одиночных мутантных аллелей в пулах из 200, 500 и 1000 аллелей.
Здесь график UC построен в зависимости от общего количества вставок, делеций и замен. На данном графике ошибок показана вероятность включения ошибочного основания в определенной позиции. Профиль ошибок демонстрирует низкий уровень ошибок с тенденцией к его повышению к 3'-концу секвенируемого рида.
Заметно, что разные референсные нуклеотиды характеризуются различными вероятностями ошибок. На данном графике показана точность программы splinter при оценке частоты аллелей для позиций, где покрытие на аллель превышало 25x. Представлено сравнение частот аллелей в пуле ДНК, оцененных с помощью splinter, с количеством аллелей, измеренным в ходе полногеномных поисков ассоциаций или GWAS.
При очень высокой корреляции была отобрана популяция из 974 человек, для которых было проведено секвенирование целевых участков длиной более 20 килобаз. Для обнаружения редких вариантов применялся метод Splinter. Согласно стандартному протоколу, для каждого индивидуума было предварительно выполнено генотипирование для проверки соответствия GWAS между генотипированием тегированных и новых вариантов.
Результаты анализа объединенного образца были отличными. Три варианта, два из которых были редко встречающимися в популяции, были определены как novo на основе данных секвенирования и подтверждены индивидуальным пиросеквенированием; частоты минорных аллелей или математическое соответствие между пиросеквенированием и секвенированием пула были на высоком уровне. После того как вы обнаружили редкий вариант в объединенном образце, часто возникает необходимость определить функциональные последствия выявленного варианта.
Таким образом, следующим этапом процесса после разработки становится аннотация ваших вариантов. Этот метод открыл исследователям в области секвенирования ДНК возможность быстро и экономично изучать редкие варианты для их характеристики в рамках популяционных исследований с большим количеством участников. После просмотра этого видео вы должны получить четкое представление о том, как выявлять редкие варианты последовательностей в пуле образцов ДНК с помощью системы splinter.
Секвенирование объединенного пула ДНК представляет собой эффективный метод выявления редких генетических вариантов, связанных со сложными признаками в больших популяциях. В данной статье подробно описывается компьютерный анализ данных пулового секвенирования 32 генов, связанных с раком, с использованием программного пакета SPLINTER.
Выявление редких геномных вариантов в больших популяциях имеет решающее значение для валидации мишеней при исследовании сложных заболеваний, в которых распространенные варианты не объясняют фенотипическую вариабельность. Метод пул-секвенирования с использованием технологии SPLINTER представляет собой экономически эффективный и масштабируемый способ проверки терапевтических гипотез путем идентификации низкочастотных функциональных вариантов без предварительного знания о них. Это способствует снижению рисков на ранних этапах поиска за счет возможности оценки частоты аллелей и подтверждения вариантов в когортах пациентов с соответствующими заболеваниями, что напрямую влияет на приоритизацию портфеля разработок и последующие механистические исследования.
Данный метод вписывается в континуум открытий — от формулирования гипотезы до идентификации ведущих соединений, обеспечивая результаты детектирования вариантов, которые позволяют определить выбор мишени и готовность анализа.