$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В области протеомики произошла революция благодаря широкому распространению репозиториев данных с открытым доступом и бесплатных программныхинструментов1, которые сыграли важную роль в развитии исследовательских возможностей и продвижении культуры обмена данными. Создание централизованных ресурсов, таких как PRIDE2, и разработка стандартизированных форматов данных в рамках Инициативы по стандартам протеомики (PSI) Организации протеомики человека (HUPO)3 создали беспрецедентную возможность для повторного использования и интеграции данных. Тем не менее, анализ и интерпретация протеомных данных по-прежнему сопряжены со значительными техническими барьерами, особенно для биологов и врачей, которые хотят выполнить ортогональную валидацию своих собственных экспериментальныхрезультатов. Данная рукопись напрямую решает эту проблему, представляя независимый от поставщика вычислительный рабочий процесс, чтобы предоставить исследователям доступную основу для независимого запроса, анализа и интеграции общедоступных данных протеомики со своими собственными выводами, тем самым способствуя надежной ортогональной валидации без необходимости проведения дополнительных экспериментов в мокрой лаборатории. Эта работа особенно подходит для исследователей, стремящихся ортогонально подтвердить дифференциальную экспрессию специфических белков, идентифицированных в их собственных экспериментах, и генерировать новые гипотезы путем изучения паттернов экспрессии белков, представляющих интерес в широком спектре опубликованных исследований. Предоставляя пошаговое руководство, мы стремимся дать возможность более широкому кругу ученых использовать весь потенциал общедоступных данных протеомики, что в конечном итоге повышает надежность и влияние их исследований.
В протеомике на основе масс-спектрометрии (МС) сканирование MS1 и MS2 имеет основополагающее значение для сбора данных. Сканирование MS1, или обзорное сканирование, обнаруживает и измеряет отношение массы к заряду (m/z) всех ионов в образце, обеспечивая всесторонний обзор популяции ионов5. Сканирование MS2, также называемое фрагментационным сканированием, включает в себя выделение и фрагментацию определенных ионов-предшественников, выбранных из сканирования MS1, генерируя спектры ионов фрагментов для идентификации пептидов6.
Data-dependent acquisition (DDA) отбирает наиболее распространенные ионы из сканирования MS1 для фрагментации MS2, создавая более простые спектры, которые упрощают анализ. Тем не менее, DDA может привести к стохастической выборке и отсутствию значений в сложных выборках, ограничивая воспроизводимость7. В отличие от этого, независимый от данных сбор данных (DIA) систематически фрагментирует все ионы в пределах заданных m/z окон, обеспечивая всесторонний охват и сводя к минимуму пропущенные значения. Это повышает количественную точность и воспроизводимость8, хотя DIA требует передовых вычислительных инструментов для деконволюции своих очень сложных спектров MS29.
PRIDE (https://www.ebi.ac.uk/pride)2является ведущим репозиторием в составе консорциума ProteomeXchange Consortium (https://www.proteomexchange.org)10, глобальной платформы для обмена данными протеомики. Пользователи могут эффективно перемещаться по этому обширному ресурсу, используя поиск по ключевым словам для поиска интересующих их наборов данных.
DIA-NN11, программный пакет, использующий глубокие нейронные сети, является золотым стандартом для анализа протеомико-данных независимо от данных (DIA). Он отличается высокой точностью идентификации и количественной оценки, что делает его особенно эффективным для обработки сложных наборов данных DIA12. Для рабочих процессов сбора данных, зависящих от данных (DDA), MSFragger13, интегрированный в конвейер FragPipe, обеспечивает сверхбыструю идентификацию пептидов. Его инновационный подход к индексации фрагмент-ионов обеспечивает быстрое согласование спектров, превосходя традиционные инструменты более чем в 100 раз.
Вооружившись этими всеобъемлющими базами данных и передовыми инструментами, исследователи могут легко повторно использовать протеомные данные для проверки перекрестных исследований и новых биологических открытий. Эта доступность привела к идентификации многочисленных белковых биомаркеров при различных заболеваниях14,15, улучшила прогноз16 и позволила классифицировать молекулярные подтипы на основе протеомных профилей17.