Спектральные данные МС/МС были получены из обезличенных образцов остаточных ПТФ, которые были собраны с использованием процедур, соответствующих утвержденным советом директоров и правилам, как описано ранее 21,29,30.
ПРИМЕЧАНИЕ: На рисунке 1 представлен обзор полного рабочего процесса, состоящего из пяти модулей. Все входы, выходы и программные инструменты обобщены в дополнительной таблице 1.

Рисунок 1: Краткое описание модулей рабочего процесса клинической метапротеомики в Galaxy. Полный рабочий процесс клинической метапротеомики состоит из пяти модулей: создание базы данных, обнаружение, верификация, количественная оценка и интерпретация данных. (A) Обширная всеобъемлющая база данных включает последовательности белков микробных видов, которые, как считается, присутствуют в образце, человека и распространенных загрязнителей. Программный инструмент MetaNovo напрямую сопоставлял спектральные данные МС/МС с пептидами и делал выводы о белках и их исходном организме на основе необработанных данных МС и большой входной базы данных последовательностей белков, создавая сокращенную базу данных33. Затем сокращенная база данных MetaNovo объединяется с человеческими и загрязняющими белками для создания базы данных для обнаружения пептидов. (В)Два алгоритма идентификации пептидов, SearchGUI/PeptideShaker и MaxQuant, сопоставляют пептидные последовательности со спектрами MS/MS и базой данных белков-мишеней-приманок49. (с)Пептиды, идентифицированные с помощью SearchGUI/PeptideShaker и MaxQuant, затем проверяются с помощью PepQuery2. PepQuery2 тщательно повторно исследует предположительно идентифицированные последовательности микробных пептидов и их согласованные спектры МС/МС с другими потенциальными совпадениями с протеомом и/или загрязнителями человека-хозяина, тем самым проверяя высоконадежные микробные совпадения40,41. Верифицированные пептиды используются для создания верифицированной базы данных белковых последовательностей, которая будет использоваться для количественного определения пептидов и белков. (D) MaxQuant42 осуществляет поиск данных МС/МС по верифицированной последовательности белков и количественное определение микробных пептидов и предполагаемых белков наряду с человеческими белками. (E) Unipept45 и MSstatsTMT46 используются на заключительном этапе для аннотирования белков с таксономией и функциональной информацией (образцы ферментной комиссии), а также для построения вулканических диаграмм и графиков сравнения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
1. Мечение ТМТ и генерация спектров МС/МС
- Чтобы подготовиться к анализу на рассеянный склероз, выполните сбор клинических образцов в соответствии с рекомендациями и правилами.
ПРИМЕЧАНИЕ: Поскольку в этом протоколе особое внимание уделяется биоинформатическому рабочему процессу, процедуры сбора клинических образцов могут отличаться от тех, которые использовались для данной рукописи. Здесь белки были триптически расщеплены в пептидную смесь, помечены, фракционированы и проанализированы с помощью масс-спектрометрии для получения спектральных данных МС/МС для последующего анализа с использованием платформы Galaxy. Подробные инструкции по обработке образцов были ранее описаны Boylan et al.29 и Afiuni-Zadel et al.30.
- Выделите белки из клинических образцов и расщепите их в пептиды с помощью трипсина29,30.
- Маркируйте белки с помощью реагента Tandem Mass Tag (TMT)-11-plex. Этот реагент для мечения поможет в количественном определении пептидов и белков 31,32.
- Случайным образом разделите помеченные образцы на четыре экспериментальные группы, основанные на TMT.
- Для каждой экспериментальной группы включить один объединенный эталонный образец, помеченный уникальным тегом TMT, который будет служить общим эталоном для сравнения с каждым отдельным образцом в четырех экспериментальных группах31,32.
- Выполнение автономного фракционирования объединенных образцов с помощью инверсионно-фазовой жидкостной хроматографии (RPLC) с высоким pH-29,30.
- Анализ фракций методом жидкостной хроматографии-тандема МС (ЖХ-МС/МС) с помощью гибридного квадруполь-масс-спектрометра Orbitrap 29,30. Сохраните сгенерированные спектральные данные MS/MS в формате Thermo Raw (thermo.raw).
ПРИМЕЧАНИЕ: При необходимости, файлы Thermo Raw преобразуются в формат Mascot Generic Format (.mgf) для обеспечения совместимости с различным программным обеспечением. В этом тексте аббревиатуры «RAW» и «MGF» обозначают формат файлов входных наборов данных MS/MS. На рисунках наборы данных MS/MS представлены теми же значками RAW для простоты.
2. Настройка модуля
ПРИМЕЧАНИЕ: Выбор кнопок и меню выделен жирным шрифтом. Примеры файлов, расчетных процессов и параметров инструментов доступны в разделе Дополнительные таблицы. Более подробную информацию о том, как использовать Galaxy, можно найти на странице часто задаваемых вопросов о GTN (https://training.galaxyproject.org/training-material/faqs/galaxy/).
- Сервер Galaxy Europe
- Доступ к серверу Galaxy Europe (Galaxy EU; https://usegalaxy.eu/).
- Создайте учетную запись или войдите в систему. Для создания новой учетной записи требуется действующий адрес электронной почты. Войдите в систему как пользователь, чтобы использовать Galaxy.
- Подготовка истории галактики
- Если пользователь импортирует примеры входных данных из Дополнительной таблицы 2 , выполните шаги 2.2.1.1-2.2.1.3.
- Откройте примеры истории галактик по ссылкам, приведенным в дополнительной таблице 2.
- Нажмите серую кнопку «Импортировать эту историю », расположенную в левом верхнем углу (в центре) панели. Переименуйте историю и нажмите «Копировать историю». При желании добавьте их наборы данных в эту историю, нажав кнопку «Загрузить » в крайней левой панели, и добавьте файлы для загрузки.
- Нажмите кнопку Пуск > Закрыть. Загруженные файлы появятся на панели истории справа. Перед использованием подождите, пока цвет наборов данных станет зеленым.
ПРИМЕЧАНИЕ: При импорте (копировании) существующей истории, не создавайте отдельную (новую) историю.
- Если пользователь создает новую историю и загружает свои данные, выполните шаги 2.2.2.1.-2.2.2.2.
- На панели «История» (справа) нажмите значок + (плюс) один раз, чтобы создать новую историю под названием «Безымянная история». Нажмите на значок карандаша рядом с историей и нажмите «Сохранить». Те же шаги по добавлению наборов данных в существующую (примерную) историю применимы и к загрузке своих данных.
- В крайнем левом углу панели нажмите «Загрузить » и добавьте файлы для загрузки. Нажмите кнопку Пуск > Закрыть. Загруженные файлы появятся в новой истории. Подождите, пока цвет наборов данных станет зеленым.
- Если пользователь анализирует несколько файлов MS/MS одновременно, выполните шаги 2.2.3.1.-2.2.3.3.
- Поместите их в коллекцию наборов данных, чтобы выбрать их в качестве одного входа. Нажмите на значок галочки на панели История и выберите (проверьте) наборы данных.
- Нажмите на кнопку, которая указывает количество выбранных наборов данных (например, 4 из 8 выбранных), и в выпадающем меню выберите Построить список наборов данных. Во всплывающем окне введите название коллекции (например, MGF Data, RAW Data). При необходимости выберите, будут ли исходные наборы данных скрыты после сбора данных.
- Нажмите синюю кнопку «Создать коллекцию » в правом нижнем углу всплывающего окна. Нажмите на значок галочки на панели «История», чтобы отменить выбор наборов данных.
ПРИМЕЧАНИЕ: Каждый из пяти модулей должен быть запущен в своей собственной (импортированной или новой) истории Galaxy для улучшения пользовательского опыта. Чтобы избежать избыточности, в последующих инструкциях модуля настройка будет опущена, а основное внимание будет уделено шагам рабочего процесса.
- Импорт и запуск рабочего процесса
ПРИМЕЧАНИЕ: Всем пользователям, независимо от того, используют ли они примеры данных или свои данные, настоятельно рекомендуется использовать и/или адаптировать модульные рабочие процессы с предустановленными параметрами (Дополнительная таблица 2). Таким образом, пользователи могут избежать необходимости искать и задавать параметры для каждого инструмента. При желании пользователи могут найти инструменты, нажав на кнопку Инструменты в крайнем левом углу и введите название инструмента (как можно точнее) в строку поиска на соседней панели. Инструменты для сопоставления появятся автоматически. Нажмите на правильный результат поиска и установите соответствующие параметры (см. Дополнительный файл 1). Перед запуском инструмента пользователи могут настроить уведомления по электронной почте, чтобы предупредить их о завершении задания, нажав кнопку в конце параметров. Для удобства есть два Бежать кнопки: одна в правом верхнем углу центральной панели, а другая после полей параметров. Дополнительная таблица 3 предоставляет дополнительные учебные ресурсы. Версии инструментов и баз данных являются актуальными и функционируют на момент написания статьи (июнь 2024 года), но могут изменяться по мере обновления системы «Гэлакси» и связанных с ней инструментов и баз данных.
- Откройте расчетную схему в новой вкладке по ссылкам в Дополнительной таблице 2.
- Нажмите кнопку «Импорт » в правом верхнем углу панели. Откроется новая вкладка с зеленым полем, подтверждающим, что рабочий процесс был импортирован. В зеленом поле также будут две опции: начать использовать этот рабочий процесс сразу или вернуться на предыдущую страницу.
- Нажмите первую кнопку («начать использовать этот рабочий процесс...»), чтобы открыть вкладку «Рабочий процесс » на центральной панели интерфейса, на которой отображаются все сохраненные рабочие процессы. Найдите только что импортированный рабочий процесс и нажмите синюю кнопку воспроизведения (треугольник). При этом отобразятся поля ввода.
ПРИМЕЧАНИЕ: Для каждого предоставленного рабочего процесса поля ввода соответствуют примерам входных данных (Дополнительная таблица 2). Если пользователь анализирует свои данные, его входные данные должны быть названы соответствующим образом, чтобы гарантировать, что для каждого модуля используются правильные файлы.
- Если пользователь хочет просмотреть рабочие процессы на сервере Galaxy EU, выполните шаги 2.3.2.1-2.3.2.4.
- Нажмите кнопку «Рабочий процесс » на верхней панели веб-сайта Galaxy. На этой вкладке щелкните вложенную вкладку Мои рабочие процессы , чтобы отобразить все импортированные рабочие процессы. Чтобы просмотреть рабочий процесс, нажмите кнопку «Редактировать » со значком карандаша , чтобы открыть редактор рабочих процессов.
- В редакторе рабочих процессов можно взаимодействовать с рабочим процессом, например щелкать и перетаскивать для реорганизации, нажимать на инструменты для их просмотра, изменять параметры и т. д. После внесения изменений сохраните отредактированный рабочий процесс, нажав на значок диска в верхней части правой панели, и при желании запустите рабочий процесс, нажав на значок воспроизведения (также в верхней части правой панели).
- Создавайте пользовательские рабочие процессы для анализа пользовательских входных данных. В зависимости от знаний пользователя в области метапротеомики и опыта работы с платформой Galaxy, постройте рабочий процесс, а затем проанализируйте данные.
- Если пользователь менее опытен, протестируйте различные инструменты на истории, а затем извлеките рабочий процесс из их завершенного анализа.
ПРИМЕЧАНИЕ: Этот извлеченный рабочий процесс может быть расширен, пересмотрен и повторно использован, что позволяет пользователям точно воспроизводить свою работу. Более подробные инструкции можно найти в разделе часто задаваемых вопросов о рабочих процессах GTN (https://training.galaxyproject.org/training-material/faqs/galaxy/#workflows).
- Нажмите на каждое поле ввода и выберите соответствующее поле ввода. В разделах с 3 по 7 описываются входные данные модуля. Убедитесь, что все входные данные имеют приемлемый формат, чтобы избежать ошибок. Нажмите «Допустимые форматы» под каждым полем ввода, чтобы проверить, все ли файлы совместимы с инструментами. После этого нажмите кнопку Запустить рабочий процесс.
ПРИМЕЧАНИЕ: Если пользователь предпочитает настраивать инструменты вручную, учебные материалы для каждого модуля этого рабочего процесса клинической метапротеомики представлены на веб-сайте GTN (https://gxy.io/GTN:P00019). Расчетное время выполнения для ключевых инструментов включено в дополнительную таблицу 2, но время выполнения зависит от размера входных данных, зависимостей инструмента (например, требований к памяти по сравнению с выделенной памятью), запланированного времени обслуживания, ошибок и т. д. Статусы заданий обозначаются цветом набора данных, и когда набор данных выбран (щелкнут), появится сообщение, в котором будет указано, ожидает ли задание постановки в очередь (серый), выполняется (оранжевый) или завершилось сбоем (красный). Когда задание будет завершено, набор данных станет зеленым (без подтверждающего сообщения). Пользователи могут подписаться на получение уведомлений по электронной почте, которые будут оповещать их о завершении заданий (см. ПРИМЕЧАНИЕ в начале шага 2.3). В приведенных ниже инструкциях по настройке модулей будут опущены явные шаги по настройке, так как они одинаковы для каждого модуля (см. раздел 2 и часто задаваемые вопросы по GTN, если это необходимо) и будут описаны ключевые инструменты для каждого модуля. Полный список используемых инструментов приведен в дополнительной таблице 1 . Названия инструментов выделены жирным шрифтом. Для справки, все названия, версии и описания инструментов включены в Таблицу материалов. Если пользователь выполняет примеры рабочих процессов из дополнительной таблицы 2, обратитесь к именам файлов примеров, включенным в скобки в конце каждого шага. Если пользователь запускает инструменты независимо, примеры имен файлов могут быть проигнорированы. Чтобы переименовать набор данных, нажмите на значок карандаша в правом верхнем углу набора данных. В поле «Имя» введите новое имя и нажмите «Сохранить».
3. Модуль 1: Создание базы данных белковых последовательностей
ПРИМЕЧАНИЕ: Если пользователь хочет использовать примеры входных данных и рабочего процесса из дополнительной таблицы 2, обязательно следуйте инструкциям в разделе 2. Для модуля 1 импортируйте входные данные и рабочий процесс для DATABASE GENERATION. Столбец вывода Дополнительной таблицы 2 содержит примеры завершенных выходных журналов для справки. Для всех модулей соответствующее учебное пособие по GTN можно найти в дополнительной таблице 3.
- Составьте список видов, которые связаны с интересующей болезнью или состоянием и/или местом сбора пробы.
- Получите этот список видов из обзора литературы. В качестве альтернативы, если образцы были ранее проанализированы, можно получить список видов с помощью 16S рРНК или метагеномного секвенирования.
- Сохраните этот список видов в виде табличного файла (например, Species.tabular).
ПРИМЕЧАНИЕ: Используя список видов, будет создана большая всеобъемлющая база данных белковых последовательностей известных болезнетворных микроорганизмов, а с помощью MetaNovo эта большая база данных, содержащая миллионы белковых последовательностей, затем будет сокращена до более управляемой базы данных, содержащей белки, присутствующие в образцах. Шаг по сокращению базы данных имеет решающее значение, поскольку многие инструменты поиска в базе данных не могут обрабатывать миллионы последовательностей. Сокращенная база данных будет объединена с человеческими и загрязняющими белками для создания компактной базы данных, которая будет использоваться для идентификации пептидов в следующем модуле (раздел 4).
- Используйте список видов (Species.tabular) в качестве входных данных для UniProt (скачать proteome как fasta) для создания базы данных последовательностей белков (Species UniProt FASTA.fasta).
- Запустите Protein Database Downloader , чтобы создать еще две базы данных белковых последовательностей: Human SwissProt (только для рассмотрения) и загрязняющие белки (Human SwissProt Protein Database.fasta, Contaminants [cRAP] Protein Database.fasta). Загрязняющие белки также называются общим хранилищем адвентитивных белков, или cRAP.
- Используйте три базы данных белков в качестве входных данных для файлов FASTA Merge и Filter Unique Sequences , чтобы исключить дубликаты и создать большую базу данных белковых последовательностей (Human UniProt Microbial Proteins cRAP для MetaNovo.fasta).
- Используйте большую (всеобъемлющую) базу данных (начиная с шага 3.4) и наборы данных MS (MGF) в качестве входных данных для MetaNovo33 для создания сокращенной базы данных (MetaNovo Compact Database.fasta).
- Запустите FASTA Merge Files и отфильтруйте уникальные последовательности в базе данных, созданной MetaNovo, базах данных Human SwissProt (только для обзора) и cRAP, чтобы создать сокращенную (целевую) базу данных последовательностей микробных, человеческих и загрязняющих белков, которые будут использоваться для обнаружения пептидов (Human UniProt Microbial Proteins [от MetaNovo] и cRAP.fasta).
4. Модуль 2: Обнаружение пептидов с помощью поиска в базе данных
ПРИМЕЧАНИЕ: Если пользователь хочет использовать примеры входных данных и рабочего процесса из дополнительной таблицы 2, обязательно следуйте инструкциям в разделе 2. Для модуля 2 импортируйте входные данные и рабочий процесс для DISCOVERY. Для всех модулей соответствующее учебное пособие по GTN можно найти в дополнительной таблице 3. SearchGUI 34,35,36 и PeptideShaker 37 являются отдельными программами, но будут рассматриваться как одна программа идентификации и обработки пептидов, поскольку они используются в тандеме. Для обеспечения совместимости программного обеспечения наборы данных MS/MS будут преобразованы из RAW в MGF для SearchGUI/PeptideShaker с помощью инструмента msconvert (в предоставленном рабочем процессе). MaxQuant38 может обрабатывать RAW-файлы.
- Запустите FastaCLI для добавления последовательностей белков-приманок в сокращенную (целевую) базу данных для создания базы данных последовательностей белков-приманок (FastaCLI, MetaNovo, Human SwissProt, cRAP с decoys.fasta).
ПРИМЕЧАНИЕ: FastCLI потребуется запустить только для SearchGUI/PeptideShaker. MaxQuant может добавлять приманки и загрязняющие вещества в базу данных белковых последовательностей. Здесь сокращенная база данных уже содержит загрязнители (cRAP), поэтому MaxQuant настроен на добавление только ложных целей.
- Запустите SearchGUI/PeptideShaker и MaxQuant для поиска наборов данных РС в сокращенной базе данных, чтобы идентифицировать пептиды и в конечном итоге отнести их к белковым последовательностям с помощью поиска в базе данных последовательностей. Параметры инструмента см. в дополнительной таблице 4 .
ПРИМЕЧАНИЕ: Здесь будут использоваться две программы идентификации пептидов (SearchGUI/PeptideShaker и MaxQuant) для идентификации пептидных и белковых последовательностей с помощью поиска в базе данных последовательностей. Эти программы идентифицируют пептиды в спектрах МС/МС и ведут поиск в базе данных последовательностей белков, сопоставляя наблюдаемые и теоретические данные о пептидах, включая массы и спектры пептидов. В следующем модуле идентифицированные пептиды будут проверены с помощью PepQuery2 для подтверждения того, что микробные пептиды были получены (раздел 5).
- Запустите SearchGUI для создания архивного файла, содержащего PSM (Search GUI on data [#].searchgui_archive).
- Используйте архивный файл SearchGUI в качестве входных данных для PeptideShaker для создания отчета PSM, отчета о пептидах и отчета о белках (Peptide Shaker on data [#]: [имя отчета].tabular).
- Запустите MaxQuant для создания файлов белковых групп и пептидов (MaxQuant Protein Groups.tabular, MaxQuant Peptides.tabular).
ПРИМЕЧАНИЕ: Для MaxQuant требуется файл экспериментального дизайна, который содержит условия эксперимента, группы выборок и отношения между образцами (Experimental Design Discovery MaxQuant.tabular). Этот файл информирует MaxQuant о том, как организовать и проанализировать данные MS. Пример приведен в Дополнительной таблице 5. При использовании пользовательских данных пользователи должны изменить этот файл в соответствии со своими наборами данных MS.
- Используйте инструменты обработки текста для управления выходными данными обеих программ. Ознакомьтесь с рабочим процессом DISCOVERY в дополнительной таблице 2 , чтобы узнать, какие инструменты применимы для SearchGUI/PeptideShaker и MaxQuant.
ПРИМЕЧАНИЕ: В Galaxy реализованы следующие инструменты для работы с текстом. Ключевые инструменты выделены ниже, поэтому пользователям настоятельно рекомендуется обратиться к DISCOVERY Workflow, чтобы увидеть дополнительные инструменты, которые здесь не рассматриваются. Инструкции по просмотру рабочего процесса см. в разделе 2.
- Выберите микробные совпадения (Select microbial PSMs.tabular from SGPS, Select microbial peptides (MQ).tabular).
- Используйте Фильтр и Запрос Таблица39 для выбора достоверных PSM и запроса их номеров присоединения белков (Фильтрация уверенных микробных PSM.tabular, запрос результатов по данным [# и #].tabular).
- Используйте команду Cut для извлечения пептидных последовательностей в виде нового набора данных (Cut on data [#].tabular).
- Используйте Group для получения уникальных записей (например, уникальных пептидных последовательностей) для каждой программы (MQ Peptides.tabular, SGPS Distinct Peptides.tabular).
- Объедините два списка пептидов в один набор данных (SGPS-MQ Peptides.tabular).
- Группа для удаления дубликатов пептидных последовательностей. Окончательный список различных микробных пептидов будет использоваться для верификации PepQuery2 (Distinct Peptides.tabular).
5. Модуль 3: Верификация микробных пептидов
ПРИМЕЧАНИЕ: Если пользователь хочет использовать примеры входных данных и рабочего процесса из дополнительной таблицы 2, обязательно следуйте инструкциям в разделе 2. Для модуля 2 импортируйте входные данные и рабочий процесс для ВЕРИФИКАЦИИ. Для всех модулей соответствующее учебное пособие по GTN можно найти в дополнительной таблице 3.
- Используйте следующие данные в качестве входных данных для PepQuery2 40,41 Список различных микробных пептидов (Distinct Peptides for PepQuery.tabular); Наборы спектральных данных МС (МГР); база данных Human UniProt Reference (вместе с изоформами) (Human UniProt+Isoforms FASTA.fasta) и базы данных последовательностей белков cRAP (cRAP.fasta). Смотрите параметры в Дополнительной таблице 6.
Примечание: Проверка наличия пептидов и белков имеет решающее значение для получения точных данных и существенного понимания протеома биологической системы. PepQuery2 позволяет проводить валидацию новых, специфичных для заболевания пептидов, представляющих интерес, с чувствительностью и специфичностью. Идентифицированные микробные пептиды (из модуля 2) будут проверены на соответствие последовательностям белков человека и загрязняющих веществ, чтобы убедиться в их микробном происхождении (во избежание ошибочного присвоения пептидов человека). Верифицированные пептиды будут использованы для создания базы данных последовательностей верифицированных белков, что необходимо для уменьшения количества ложноположительных результатов во время количественного определения белка в следующем модуле (раздел 6).
- Один ранжированный файл PSM будет сгенерирован для каждого набора данных MS/MS, используемого в качестве входных данных (PepQuery2 в коллекции [#]: psm_rank.tabular). Запустите команду Свернуть коллекцию для файлов ранжирования PSM, чтобы создать один объединенный набор данных (Collapse Collection on data [#] .tabular) и Фильтр для сохранения уверенных PSM (Filter on [PSM rank collection].tabular).
- Выполните команду Удалить начало , чтобы исключить заголовки столбцов, и команду Вырезать , чтобы извлечь проверенные последовательности пептидов в виде нового набора данных.
- Запустите команду Cut для отчетов о пептидах из SearchGUI/PeptideShaker и MaxQuant (SGPS Peptide Report.tabular, MaxQuant Peptide Report.tabular), чтобы извлечь пептидные последовательности и записи белков в виде нового набора данных пептид-белок (для каждой программы) и Удалить начало , чтобы исключить заголовки столбцов.
- Объедините пептидные последовательности и белковые записи из обеих программ, чтобы создать новый (комбинированный) набор данных пептид-белок.
- Запустите Query Tabular для объединенного набора данных о пептидах и белках и проверенных пептидов, чтобы присвоить проверенные пептиды связанным с ними записям белков (Peptide and Protein from Peptide Reports.tabular). Записи белков каталогизируются по их номерам присоединения к белкам (также известным как идентификаторы UniProt).
- Group для сохранения уникальных верифицированных пептидов и связанных с ними идентификаторов UniProt.
- Запустите Query Tabular для извлечения идентификаторов UniProt (UniProt-ID из verified Peptides.tabular).
- Поместите идентификаторы UniProt в UniProt , чтобы получить связанные с ними белковые последовательности в виде новой базы данных (UniProt.fasta).
- Запустите FASTA Merge Files and Filter Unique Sequences в базе данных белковых последовательностей, созданной UniProt, базе данных Human UniProt (вместе с изоформами) и базах данных загрязняющих веществ, чтобы создать проверенную базу данных, которая будет использоваться для количественного определения пептидов (Quantitation Database for MaxQuant.fasta).
6. Модуль 4: Количественная оценка MaxQuant
ПРИМЕЧАНИЕ: Если пользователь хочет использовать примеры входных данных и рабочего процесса из дополнительной таблицы 2, обязательно следуйте инструкциям в разделе 2. Для модуля 2 импортируйте входные данные и рабочий процесс для QUANTIFICATION. Для всех модулей соответствующее учебное пособие по GTN можно найти в дополнительной таблице 3.
- Используйте проверенную базу данных последовательностей белков и наборы данных MS (RAW) в качестве входных данных для MaxQuant42.
ПРИМЕЧАНИЕ: Помните, что для MaxQuant требуется файл экспериментального дизайна, и он может быть тем же файлом, который используется для идентификации пептидов (шаг 4.2). При необходимости измените имена файлов. Верифицированная база данных из предыдущего модуля необходима для снижения количества ложных срабатываний во время количественного определения белка. Количественное определение белка позволяет исследователям измерять и сравнивать распространенность пептидов и белков в биологических образцах. Этот шаг необходим для понимания дифференциальной экспрессии белка путем получения информации о количественных изменениях в различных условиях.
- Сгенерируйте файлы Evidence, Protein Groups и Peptides (MaxQuant Evidence.tabular, MaxQuant Protein Groups.tabular, MaxQuant Peptides.tabular).
- Выберите микробные пептиды из файла MaxQuant Peptides (Select microbial peptides.tabular).
- Вырежьте только последовательности микробных пептидов (Cut on data [#].tabular).
- Группа для получения перечня количественных микробных пептидов (Quantified Peptides.tabular).
7. Модуль 5: Интерпретация данных
ПРИМЕЧАНИЕ: Если пользователь хочет использовать примеры входных данных и рабочего процесса из дополнительной таблицы 2, обязательно следуйте инструкциям в разделе 2. Для модуля 2 импортируйте входные данные и рабочий процесс для ИНТЕРПРЕТАЦИИ ДАННЫХ. Для всех модулей соответствующее учебное пособие по GTN можно найти в дополнительной таблице 3. Результаты количественной оценки MaxQuant в предыдущем модуле будут использоваться здесь для таксономических и функциональных аннотаций с помощью Unipept и статистического анализа с помощью MSstatsTMT. Unipept позволяет исследователям идентифицировать и количественно оценивать микроорганизмы в различных средах и интегрируется с общедоступными базами данных (например, UniProt) для получения обновленных аннотаций. MSstatsTMT был разработан для надежного статистического анализа данных количественной протеомики на основе масс-спектрометрии с использованием маркировки TMT.
- Используйте список количественных микробных пептидов (Quantified Peptides.tabular) в качестве входных данных для Unipept 43,44,45 для выполнения таксономических и функциональных аннотаций. Параметры и список выходных данных см. в дополнительной таблице 7.
- В данном случае интерес представляют результаты работы Unipept — дерево таксономии микроорганизмов и дерево белков комиссии по микробным ферментам (EC) (Microbial Taxonomy Tree.d3_hierarchy, Microbial EC Proteins Tree.d3_hierarchy).
- Чтобы просмотреть деревья, нажмите на набор данных, чтобы открыть параметры. Нажмите на кнопку Визуализировать (4-й вариант слева) > просмотрщике таксономии Unipept.
- Чтобы просмотреть таксономические и функциональные аннотации в таблице (Unipept peptinfo.tabular): нажмите на значок глаза в правом верхнем углу набора данных. Прокрутите, чтобы увидеть каждый пептид в отдельной строке и информацию в разных столбцах.
- Перед выполнением статистического анализа с помощью MSstatsTMT выполните команду Select в файле MaxQuant Protein Groups, чтобы создать два новых набора данных: микробные и человеческие белки (Microbial Proteins.tabular, Human Proteins.tabular). Белки имеют теги таксономии, которые обозначают их происхождение.
- Исключите загрязняющие белки с помощью метки «con_».
- Сохраняйте микробные и человеческие белки, которые обозначаются микробными (например, «_9LACO») и «_HUMAN» метками соответственно (Microbial-Proteins.tabular, Human-Proteins.tabular).
- Для выполнения статистического анализа будет использоваться MSstatsTMT 42,46,47. Используйте файл MaxQuant Evidence (из модуля 4) и выбранные микробные белки (или человеческие белки) из предыдущего шага в качестве входных данных. Этот рабочий процесс отдает приоритет микробным белкам, но также предлагает возможность охарактеризовать человеческие белки. Параметры и список выходных данных см. в дополнительной таблице 8.
ПРИМЕЧАНИЕ: Для MSstatsTMT требуется файл аннотаций и матрица сравнения (также известная как матрица контраста). Файл аннотаций будет определять, как будут сочетаться количественные оценки, в то время как матрица сравнения будет учитывать различные группы выборки. Примеры этих файлов (Annotation.tabular, Comparison Matrix.tabular) включены в Дополнительную таблицу 9 и Дополнительную таблицу 10.
- Результаты MSstatsTMT представляют интерес для вулкана и графики сравнения для микробных белков (Microbial Proteins Volcano Plot.pdf, Microbial Proteins Comparison.pdf). Чтобы просмотреть графики, нажмите на значок глаза в правом верхнем углу набора данных.