$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El campo de la proteómica se ha visto revolucionado por la adopción generalizada de repositorios de datos de acceso abierto y herramientas de software libre1, que han sido fundamentales para avanzar en las capacidades de investigación y promover una cultura de intercambio de datos. El establecimiento de recursos centralizados, como PRIDE2, y el desarrollo de formatos de datos estandarizados por parte de la Iniciativa de Estándares de Proteómica (PSI) de la Organización de Proteoma Humano (HUPO)3 han creado una oportunidad sin precedentes para la reutilización e integración de datos. Sin embargo, el análisis y la interpretación de los datos proteómicos aún presentan barreras técnicas significativas, particularmente para los biólogos y científicos médicos que desean realizar la validación ortogonal de sus propios resultados experimentales4. Este manuscrito aborda directamente este desafío al presentar un flujo de trabajo computacional independiente del proveedor para proporcionar un marco accesible para que los investigadores consulten, analicen e integren de forma independiente los datos de proteómica pública con sus propios hallazgos, facilitando así una validación ortogonal sólida sin la necesidad de experimentos adicionales en el laboratorio húmedo. Este trabajo es particularmente apropiado para los investigadores que buscan validar ortogonalmente la expresión diferencial de proteínas específicas identificadas en sus propios experimentos y generar nuevas hipótesis mediante la exploración de los patrones de expresión de sus proteínas de interés en una amplia gama de estudios publicados. Al proporcionar una guía paso a paso, nuestro objetivo es capacitar a una gama más amplia de científicos para aprovechar todo el potencial de los datos proteómicos públicos, mejorando en última instancia la solidez y el impacto de su investigación.
En la proteómica basada en espectrometría de masas (MS), los escaneos MS1 y MS2 son fundamentales para la adquisición de datos. Los escaneos MS1, o escaneos de encuesta, detectan y miden las relaciones masa-carga (m / z) de todos los iones en una muestra, proporcionando una descripción general completa de la población de iones5. Los escaneos MS2, también llamados escaneos de fragmentación, implican aislar y fragmentar iones precursores específicos elegidos del escaneo MS1, generando espectros de iones de fragmentos para la identificación de péptidos6.
La adquisición dependiente de datos (DDA) selecciona los iones más abundantes de los escaneos MS1 para la fragmentación de MS2, produciendo espectros más simples que agilizan el análisis. Sin embargo, el DDA puede conducir a un muestreo estocástico y valores faltantes en muestras complejas, lo que limita la reproducibilidad7. Por el contrario, la adquisición independiente de datos (DIA) fragmenta sistemáticamente todos los iones dentro de ventanas m/z predefinidas, lo que garantiza una cobertura completa y minimiza los valores faltantes. Esto mejora la precisión cuantitativa y la reproducibilidad8, aunque DIA exige herramientas computacionales avanzadas para desconvolucionar sus espectros MS29 altamente complejos.
PRIDE (https://www.ebi.ac.uk/pride)2es un repositorio líder dentro del Consorcio ProteomeXchange (https://www.proteomexchange.org)10, una plataforma global para compartir datos proteómicos. Los usuarios pueden navegar de manera eficiente por este vasto recurso utilizando búsquedas de palabras clave para localizar conjuntos de datos de interés.
DIA-NN11, un paquete de software que aprovecha las redes neuronales profundas, es una herramienta estándar de oro para analizar datos proteómicos de adquisición independiente de datos (DIA). Sobresale en la precisión de identificación y cuantificación, lo que lo hace particularmente efectivo para procesar conjuntos de datos DIA complejos12. Para flujos de trabajo de adquisición dependiente de datos (DDA), MSFragger13, integrado en la canalización FragPipe, ofrece una identificación de péptidos ultrarrápida. Su innovador enfoque de indexación de iones de fragmento permite una rápida coincidencia espectral, superando a las herramientas tradicionales en más de 100 veces en velocidad.
Equipados con estas bases de datos integrales y herramientas avanzadas, los investigadores pueden reutilizar fácilmente los datos proteómicos para la validación de estudios cruzados y nuevos descubrimientos biológicos. Esta accesibilidad ha impulsado la identificación de numerosos biomarcadores de proteínas en diversas enfermedades14,15, ha mejorado la predicción del pronóstico16 y ha permitido la clasificación de subtipos moleculares basada en perfiles proteómicos17.