Artículo de método

Navegación por los datos proteómicos basados en espectrometría de masas utilizando herramientas computacionales gratuitas

DOI:

10.3791/68707

19 de agosto de 2025

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los datos proteómicos basados en espectrometría de masas están disponibles en bases de datos abiertas y se puede acceder a ellos mediante herramientas gratuitas. Dada la complejidad de las búsquedas y descripciones de bases de datos, muchos biólogos carecen del conocimiento para utilizar estos conjuntos de datos. Aquí, proporcionamos una guía sobre el uso de herramientas gratuitas para búsquedas básicas de datos proteómicos.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los datos proteómicos basados en espectrometría de masas (MS), incluida la adquisición dependiente de datos (DDA) y la adquisición independiente de datos (DIA), se utilizan ampliamente en la investigación biológica. Sin embargo, la aplicación de estos conjuntos de datos en estudios de validación aún es limitada debido a la falta de demostraciones claras sobre cómo buscar y analizar datos proteómicos de manera efectiva. Para llenar este vacío, seleccionamos un conjunto de datos DDA y un conjunto de datos DIA depositados en el repositorio de datos PRoteomics IDEntifications Database (PRIDE) para ilustrar mejor el flujo de trabajo de análisis de datos proteómicos y el posprocesamiento posterior de los resultados de búsqueda de proteínas. Para fines de demostración, utilizamos dos herramientas computacionales gratuitas: FragPipe (v22.0) para conjuntos de datos DDA y DIA-NN (2.1.0) para conjuntos de datos DIA. Los pasos de posprocesamiento, como la generación de gráficos de volcanes y listas de proteínas desreguladas, se demostraron utilizando el código R. Este estudio proporciona protocolos básicos para buscar y analizar datos proteómicos, sirviendo como una guía esencial para principiantes para manejar de manera efectiva conjuntos de datos proteómicos. A través de este trabajo, nuestro objetivo es capacitar a los investigadores con el conocimiento necesario para aprovechar los datos proteómicos en sus investigaciones biológicas.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El campo de la proteómica se ha visto revolucionado por la adopción generalizada de repositorios de datos de acceso abierto y herramientas de software libre1, que han sido fundamentales para avanzar en las capacidades de investigación y promover una cultura de intercambio de datos. El establecimiento de recursos centralizados, como PRIDE2, y el desarrollo de formatos de datos estandarizados por parte de la Iniciativa de Estándares de Proteómica (PSI) de la Organización de Proteoma Humano (HUPO)3 han creado una oportunidad sin precedentes para la reutilización e integración de datos. Sin embargo, el análisis y la interpretación de los datos proteómicos aún presentan barreras técnicas significativas, particularmente para los biólogos y científicos médicos que desean realizar la validación ortogonal de sus propios resultados experimentales4. Este manuscrito aborda directamente este desafío al presentar un flujo de trabajo computacional independiente del proveedor para proporcionar un marco accesible para que los investigadores consulten, analicen e integren de forma independiente los datos de proteómica pública con sus propios hallazgos, facilitando así una validación ortogonal sólida sin la necesidad de experimentos adicionales en el laboratorio húmedo. Este trabajo es particularmente apropiado para los investigadores que buscan validar ortogonalmente la expresión diferencial de proteínas específicas identificadas en sus propios experimentos y generar nuevas hipótesis mediante la exploración de los patrones de expresión de sus proteínas de interés en una amplia gama de estudios publicados. Al proporcionar una guía paso a paso, nuestro objetivo es capacitar a una gama más amplia de científicos para aprovechar todo el potencial de los datos proteómicos públicos, mejorando en última instancia la solidez y el impacto de su investigación.

En la proteómica basada en espectrometría de masas (MS), los escaneos MS1 y MS2 son fundamentales para la adquisición de datos. Los escaneos MS1, o escaneos de encuesta, detectan y miden las relaciones masa-carga (m / z) de todos los iones en una muestra, proporcionando una descripción general completa de la población de iones5. Los escaneos MS2, también llamados escaneos de fragmentación, implican aislar y fragmentar iones precursores específicos elegidos del escaneo MS1, generando espectros de iones de fragmentos para la identificación de péptidos6.

La adquisición dependiente de datos (DDA) selecciona los iones más abundantes de los escaneos MS1 para la fragmentación de MS2, produciendo espectros más simples que agilizan el análisis. Sin embargo, el DDA puede conducir a un muestreo estocástico y valores faltantes en muestras complejas, lo que limita la reproducibilidad7. Por el contrario, la adquisición independiente de datos (DIA) fragmenta sistemáticamente todos los iones dentro de ventanas m/z predefinidas, lo que garantiza una cobertura completa y minimiza los valores faltantes. Esto mejora la precisión cuantitativa y la reproducibilidad8, aunque DIA exige herramientas computacionales avanzadas para desconvolucionar sus espectros MS29 altamente complejos.

PRIDE (https://www.ebi.ac.uk/pride)2es un repositorio líder dentro del Consorcio ProteomeXchange (https://www.proteomexchange.org)10, una plataforma global para compartir datos proteómicos. Los usuarios pueden navegar de manera eficiente por este vasto recurso utilizando búsquedas de palabras clave para localizar conjuntos de datos de interés.

DIA-NN11, un paquete de software que aprovecha las redes neuronales profundas, es una herramienta estándar de oro para analizar datos proteómicos de adquisición independiente de datos (DIA). Sobresale en la precisión de identificación y cuantificación, lo que lo hace particularmente efectivo para procesar conjuntos de datos DIA complejos12. Para flujos de trabajo de adquisición dependiente de datos (DDA), MSFragger13, integrado en la canalización FragPipe, ofrece una identificación de péptidos ultrarrápida. Su innovador enfoque de indexación de iones de fragmento permite una rápida coincidencia espectral, superando a las herramientas tradicionales en más de 100 veces en velocidad.

Equipados con estas bases de datos integrales y herramientas avanzadas, los investigadores pueden reutilizar fácilmente los datos proteómicos para la validación de estudios cruzados y nuevos descubrimientos biológicos. Esta accesibilidad ha impulsado la identificación de numerosos biomarcadores de proteínas en diversas enfermedades14,15, ha mejorado la predicción del pronóstico16 y ha permitido la clasificación de subtipos moleculares basada en perfiles proteómicos17.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NOTA: Consulte la Figura 1para obtener una descripción general del flujo de trabajo y la Tabla de materiales para obtener descripciones detalladas del software utilizado.

figure-protocol-1
Figura 1: Descripción general del diseño del estudio. Haga clic aquí para ver una versión más grande de esta figura.

1. Ejemplo de configuración de archivos y software

NOTA: Todas las aplicaciones son gratuitas para uso de investigación individual y se pueden ejecutar en una computadora personal (Windows y Linux son compatibles).

  1. Cree un nuevo directorio para un proyecto.
  2. Descargar JMU_LM2_8526_55.raw, JMU_LM2_8568_51.raw, JMU_LM2_8696_37.raw, JMU_LM2_2112_87.raw, JMU_LM2_2195_91.raw, JMU_LM2_2377_73.raw, 20150127_liver_XH03_T_01.raw, 20150127_liver_XH03_T_02.raw, 20150127_liver_XH03_T_03.raw, 20150127_liver_XH03_P_01.raw, 20150127_liver_XH03_P_02.raw, 20150127_liver_XH03_P_03.raw de PRIDE.
    NOTA: Los dos grupos de archivos se pueden descargar desde https://www.ebi.ac.uk/pride/archive/projects/PXD039273 y https://www.ebi.ac.uk/pride/archive/projects/PXD006512 por separado (Figura 2).
  3. Descargue e instale las herramientas de software necesarias.
    1. Descargue la última versión de DIA-NN como archivo .msi. DIA-NN está disponible gratuitamente como archivo .msi para Windows o archivo .zip para Linux desde https://github.com/vdemichev/DiaNN/releases/tag/2.0
    2. Descargue la versión más reciente de MSFileReader como un archivo .exe. MSFileReader está disponible gratuitamente como un archivo .exe de https://github.com/thermofisherlsms/MSFileReader/blob/main/MSFileReader_x64.exe, que es necesario para procesar datos DIA de Thermo Fisher formateados sin procesar.
    3. Descargue la versión más reciente del SDK de .NET como un archivo .exe. El SDK de .NET está disponible gratuitamente como un archivo .exe de https://dotnet.microsoft.com/en-us/download, que es necesario en Windows para ejecutar MSFileReader.
    4. Descargue la última versión de FragPipe como archivo .zip. FragPipe está disponible gratuitamente como un archivo .zip de https://github.com/Nesvilab/FragPipe/releases. Se recomienda el archivo zip con jre ya que contiene un tiempo de ejecución de Java para Windows, que es necesario para ejecutar FragPipe. MSFragger está incrustado en FragPipe.
  4. Descargue la versión más reciente de R y los archivos de script de Rstudio y R desde el archivo complementario 1 y el archivo complementario 2. R y RStudio se pueden descargar libremente desde https://cran.rstudio.com/bin/windows/base/R-4.5.0-win.exe y https://posit.co/download/rstudio-desktop/.
  5. Descomprima los archivos comprimidos y haga clic en el botón . exe o .msi Files para instalar las aplicaciones.

2. Análisis de datos DIA utilizando DIA-NN

  1. Descargue el archivo de referencia proteome fasta de UniProt. Para descargar el proteoma de referencia de Homo sapiens (información de isoforma no incluida) vaya a https://www.uniprot.org/proteomes/UP000005640 (Figura 3A).
  2. Haga clic en el botón Agregar FASTA para cargar el archivo de proteoma de referencia en DIA-NN.
  3. Seleccione las dos opciones Resumen de FASTA para búsqueda / generación de bibliotecas sin biblioteca y Predicción de espectros, RT y lMs basados en aprendizaje profundo en la parte de generación de iones precursores. Haga clic en el botón Ejecutar para generar una biblioteca espectral predicha (Figura 3B).
    1. Una vez que se generó el archivo de biblioteca espectral predicho, reutilícelo para otros experimentos dentro de la misma configuración de adquisición experimental haciendo clic en el botón Espectral para agregar la biblioteca predicha.
  4. Anule la selección de las dos opciones en la parte de generación de iones precursores y haga clic en el botón Tipo que se correlaciona con el formato de archivo en la parte de entrada para cargar los datos DIA.
  5. Establezca la Precisión de masa y la Precisión de MS1 en Algoritmo en 0,0 ppm.
  6. Ajuste la configuración del rango de masa del precursor y del fragmento en la parte de generación de iones precursores en función de la configuración experimental.
  7. Mantenga las otras configuraciones predeterminadas.
    1. La generación de precursores de DIA-NN utiliza tripsina / P (se escinde después de K / R a menos que vaya seguida de prolina) con 1 escisión perdida para modelar la digestión parcial; deshabilita la escisión M de términos N para péptidos no canónicos (p. ej., inmunopeptidómicos) o aumenta las escisiones perdidas a 2 para péptidos más largos.
    2. Habilite explícitamente las modificaciones variables (deshabilitadas de forma predeterminada) para estudios de modificación postraduccional (PTM) (por ejemplo, Ox (M) para oxidación, K-GG para ubiquitinación) y expanda los filtros de péptidos (longitud: 7-30 aa; carga: 1-4+; precursor m / z: 300-1800) de acuerdo con la configuración experimental (por ejemplo, longitud: 5-50 aa, carga = 1-6) para PTM grandes o digestión no tríptica.
    3. La configuración del algoritmo aprovecha la calibración automática (precisión de masa = 0.0 ppm) para una alineación de masa precisa (anulación con tolerancias manuales (por ejemplo, 10 ppm) para instrumentos de baja resolución) y Match Between Runs (MBR) transfiere ID entre ejecuciones (deshabilita para muestras heterogéneas).
    4. La puntuación de la red neuronal aumenta la confianza en la identificación (se conserva a menos que la calidad de los datos sea deficiente), mientras que la espectrometría de masas cuantitativa sin etiquetar (UMS) permite una cuantificación de alta precisión sin etiquetas; cambiar a la cuantificación MS2 para etiquetas isobáricas (por ejemplo, TMT). Utilice la búsqueda sin biblioteca solo con datos DIA de alta resolución para evitar los requisitos de biblioteca espectral.
  8. Haga clic en el botón Ejecutar . Espere los resultados hasta que se muestre Finished en la interfaz de operación que indica que la ejecución ha finalizado (Figura 3C).

3. Análisis de datos DDA usando FragPipe

  1. Haga clic en el icono de Fragpipe en la carpeta ~\FragPipe\fragpipe\bin después de la instalación. Todas las configuraciones dependientes se pueden ver en la pestaña Configuración. Compruebe si los tres módulos (MSFragger, IonQuant, diaTracer, DIA-NN y Python) existen en su ordenador. Si no es así, descárguelos haciendo clic en Descargar/Actualizar o Descargar (Figura 4A).
  2. Cambie a la siguiente pestaña, Flujo de trabajo. Seleccione Predeterminado para el flujo de trabajo y haga clic en Cargar flujo de trabajo. Haga clic en Agregar archivos para agregar rutas de archivo. Asigne el nombre del experimento y el número de biorreplicación en Asignar archivos o simplemente déjelo (Figura 4B).
  3. Ahora, haga clic en Base de datos y vaya a esa pestaña. Cargue un archivo fasta o descargue cualquier archivo fasta según la especie de las muestras. Durante la descarga, elija las opciones Solo secuencias revisadas, Agregar señuelos y Agregar contaminantes comunes para una ejecución simple (Figura 4C).
  4. Luego haga clic en MSFragger para cambiar la pestaña. Elija la configuración predeterminada de Búsqueda cerrada y haga clic en Cargar.
    NOTA: La búsqueda cerrada es básicamente una búsqueda de las modificaciones que ha establecido, mientras que la búsqueda abierta explorará todas las modificaciones posibles de los datos, lo que requiere más tiempo y memoria.
  5. Para la coincidencia de picos, mantenga la configuración predeterminada, excepto que se recomienda elegir Ninguno para Calibración y optimización, ya que ahorrará tiempo.
  6. Para la digestión de proteínas, ajuste los parámetros de acuerdo con las condiciones experimentales. Mantenga la siguiente configuración predeterminada (Figura 5A).
    NOTA: Las tolerancias de masa de precursores y fragmentos (± 20 ppm) definen el error de masa máximo permitido para hacer coincidir los espectros experimentales con los péptidos teóricos, con valores más ajustados recomendados para instrumentos de alta resolución. Las reglas enzimáticas (tripsina estricta) especifican la especificidad de la escisión (después de K/R, a menos que vaya seguida de P), y las escisiones omitidas (2) permiten péptidos parcialmente digeridos. Los filtros de longitud de péptidos (5-50 residuos) y masa (500-5000 Da) excluyen candidatos poco probables. Las modificaciones variables (por ejemplo, +15,9949 Da en metionina para oxidación, +79,96633 Da en S/T/Y para fosforilación) permiten la detección de alteraciones químicas, mientras que las combinaciones Max (5) limitan las modificaciones simultáneas por péptido para gestionar el espacio de búsqueda. El máximo de mods variables por sitio (por ejemplo, 3 en M) controla la frecuencia de modificación. La base de datos dividida mejora la eficiencia de los proteomas grandes, y el error isotópico (0/1/2) representa picos isotópicos mal asignados. Estos ajustes equilibran colectivamente la sensibilidad, la especificidad y la carga computacional en la identificación de péptidos.
  7. Cambie a la pestaña Validación. Anule la selección de Predecir RT y Predecir espectros, que es para datos DIA (Figura 5B).
  8. Haga clic en la pestaña Quant (MS1). Seleccione Ejecutar cuanto MS1 y haga clic en Cargar valores predeterminados de cuanto. Seleccione IonQuant y mantenga la configuración predeterminada (Figura 6A). Deshabilite MBR para tiempos de retención inestables o deshabilite la normalización de intensidad si se producen sesgos de escalado global; habilite Mantener índice en el disco para conservar RAM con grandes conjuntos de datos.
    NOTA: Quant (MS1) optimiza de forma predeterminada la cuantificación sin etiquetas utilizando MaxLPQ (cuantificación de proteínas basada en MaxLFQ, un algoritmo que extiende el método MaxLFQ a grupos de proteínas), lo que requiere ≥1 ion único por proteína (aumente a ≥2 para una mayor rigurosidad a costa de la cobertura). Match Between Runs (MBR) transfiere las identificaciones entre ejecuciones utilizando la tolerancia del tiempo de retención (RT) (por defecto 0,4 min; apriete a 0,2 min para cromatografía estable o afloje por variabilidad de gradiente) y la tolerancia de movilidad iónica (IM) (por defecto 0,05 1/k0 [movilidad inversa reducida]; ajuste en función de la precisión de IM), filtrado por ≤1% FDR (tasa de descubrimiento falso; ion MBR por defecto FDR=0,01; inferior a 0,005 para rigor). La inferencia de proteínas utiliza uniquer + rascor (asignación de péptidos de cuchilla para la agrupación de proteínas). La detección de características emplea una tolerancia de masa de 10 ppm (aumentar a 20 ppm para MS de baja resolución o disminuir a 5 ppm para alta resolución).
  9. Ahora, haga clic en la pestaña Ejecutar . Seleccione Directorio de salida. Haga clic en EJECUTAR para comenzar a analizar los datos (Figura 6B).
    NOTA: Para los datos de proteómica sin etiquetas que no se centran en modificaciones o que utilizan la cuantificación basada en etiquetas, no se utilizan las pestañas PTM, Glyco y Quant (isobárico).

4. Análisis aguas abajo de DIA-NN / FragPipe

NOTA: Los códigos detallados utilizados en este estudio se incluyen como Archivo Suplementario 1 y Archivo Suplementario 2. Las versiones de paquetes utilizadas en este estudio se pueden encontrar en el Archivo complementario 3.

  1. Abra RStudio y lea los datos de expresión de proteínas generados por DIA-NN o FragPipe. Los datos de matriz de grupos de proteínas que terminan con .pg_matrix.tsv de DIA-NN y los datos de proteínas combinados que terminan con .tsv de FragPipe se utilizan normalmente para el análisis.
  2. Elimine los valores faltantes sin completar NA y filtre los grupos de proteínas identificados y cuantificados con menos de dos péptidos únicos.
    NOTA: Las cifras de DIA en este estudio fueron generadas por grupos de proteínas filtradas, mientras que las cifras de DDA fueron de grupos de proteínas sin filtrar.
  3. Normalice las intensidades de las proteínas utilizando el escalado mediano o la normalización de cuantiles en todas las muestras. Los datos de DIA en este estudio se normalizaron por normalización mediana, mientras que los datos de DDA por normalización de cuantiles para demostrar mejor los dos métodos.
    NOTA: La normalización de la mediana es robusta contra valores atípicos y adecuada para escenarios en los que la mayoría de las proteínas permanecen sin cambios en las muestras, lo que hace que la abundancia de proteínas de la mediana sea un punto de referencia estable. Sin embargo, puede fallar en escenarios con proteínas altamente expresadas diferencialmente18. La normalización de cuantiles garantiza una distribución uniforme de la abundancia de proteínas en las muestras, lo que es útil cuando se comparan muestras con distribuciones dispares. Se ha demostrado que reduce el poder estadístico y puede normalizar en exceso los datos, enmascarando potencialmente las verdaderas diferencias biológicas18. En proteómica, la normalización de la mediana se usa ampliamente en estudios sin etiquetas para eliminar los sesgos sistemáticos relacionados con el rendimiento del instrumento de EM. Se prefiere la normalización cuantil para conjuntos de datos a gran escala, análisis de expresiones diferenciales y análisis de clústeres19,20.
  4. Calcule los cambios log2 veces (p. ej., PDAC Serum versus Normal) y los valores p de la prueba t. Calcule los valores p corregidos utilizando el método de Benjamini-Hochberg. Defina umbrales de significación (p. ej., |log2FC| > 1, p_adj (FDR) < 0,05).
    NOTA: Los valores p de corte utilizados en las figuras de este estudio representan valores brutos, ya que el empleo de valores p ajustados (p_adj) eliminaría todas las proteínas detectables dentro del poder estadístico de estos conjuntos de datos limitados.
  5. Compruebe la existencia de valores faltantes/NA y exclúyalos. Genere un gráfico de volcán para visualizar impactos significativos.
  6. Seleccione proteínas significativamente desreguladas. Aplique la normalización de la puntuación Z a los valores de expresión de proteínas. Traza un mapa de calor agrupado con anotaciones de grupos de muestra.
  7. Asigne proteínas a los ID de Entrez usando org. Hs.eg.db. Realice el enriquecimiento de GO (proceso biológico) y el análisis de la vía KEGG.
    NOTA: Las categorías de procesos biológicos (BP) se seleccionan comúnmente en el análisis de ontología genética (GO) porque describen los procesos o programas biológicos más grandes logrados por múltiples actividades moleculares20. Estos términos se centran en las funciones celulares que fallan en enfermedades como el cáncer, incluidos procesos esenciales como la regulación del ciclo celular, los procesos metabólicos, etc. Además de BP, el análisis de GO también incluye categorías de función molecular (MF) y componente celular (CC). Los términos MF describen las actividades bioquímicas de los productos génicos, como el transporte de iones o las capacidades de unión al ADN. Los términos CC definen las ubicaciones celulares donde los productos génicos llevan a cabo sus funciones, como el núcleo, la membrana mitocondrial o el citoesqueleto.
  8. Consulte STRINGdb para las interacciones (puntuación de confianza ≥ 400). Genere una red interactiva usando visNetwork.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para ilustrar mejor la búsqueda de conjuntos de datos proteómicos, seleccionamos dos tipos de conjuntos de datos para este análisis. Con el objetivo de demostrar proteínas desreguladas en contextos clínicos, buscamos en PRIDE utilizando palabras clave como clinic. Específicamente, seleccionamos un conjunto de datos adecuado para el análisis DIA del Clinical Proteomic Tumor Analysis Consortium (CPTAC)21, y otro adecuado para el análisis DDA del Chinese Human Proteom...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El protocolo presentado ilustra el análisis de datos proteómicos mediante la integración de herramientas gratuitas como DIA-NN y FragPipe. El éxito depende de pasos críticos como la selección precisa de iones precursores y la configuración de precisión de masa para la generación de bibliotecas espectrales en DIA-NN (paso 2.3)27, que dependen del instrumento y son cruciales para la identificación completa de péptidos. Del mismo modo, la configuración meticulosa de ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

F.Z. es el fundador de Molemuse Biotech Studio.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este proyecto cuenta con el apoyo de Molemuse Biotech Studio.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
SDK de .NET v. 9.0.203Microsofthttps://dotnet.microsoft.com/en-us/download
DIA-NN v. 2.1.0https://github.com/vdemichev/DiaNN/releases/tag/2.0 
FragPipe v. 22.0https://github.com/Nesvilab/FragPipe/releases
MSFileReader v. 3.1 Termo Fisherhttps://github.com/thermofisherlsms/MSFileReader/blob/main/MSFileReader_x64.exe
R 4.5.0https://cran.rstudio.com/bin/windows/base/R-4.5.0-win.exe
Rstudio v. 2024.12.1+563https://posit.co/download/rstudio-desktop/

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pedrioli, P. G. A., et al. A common open representation of mass spectrometry data and its application to proteomics research. Nat Biotechnol. 22 (11), 1459-1466 (2004).
  2. Perez-Riverol, Y., et al. The PRIDE database at 20 years: 2025 update. Nucl Acids Res. 53 (D1), D543-D553 (2025).
  3. Deutsch, E. W., et al. Proteomics Standards Initiative at Twenty Years: Current Activities and Future Work. J Proteome Res. 22 (2), 287-301 (2023).
  4. Schubert, O. T., Röst, H. L., Collins, B. C., Rosenberger, G., Aebersold, R. Quantitative proteomics: challenges and opportunities in basic and applied research. Nat Protoc. 12 (7), 1289-1294 (2017).
  5. Wang, X., Shen, S., Rasam, S. S., Qu, J. MS1 ion current-based quantitative proteomics: A promising solution for reliable analysis of large biological cohorts. Mass Spectro Rev. 38 (6), 461-482 (2019).
  6. Vaudel, M. MS2-Based Quantitation. Proteome Inform. , 155-177 (2016).
  7. Meyer, J. G. Qualitative and Quantitative Shotgun Proteomics Data Analysis from Data-Dependent Acquisition Mass Spectrometry. Shotgun Proteomics. 2259, 297-308 (2021).
  8. Fröhlich, K., et al. Data-Independent Acquisition: A Milestone and Prospect in Clinical Mass Spectrometry-Based Proteomics. Mol Cell Proteomics. 23 (8), 100800(2024).
  9. Zhang, F., Ge, W., Ruan, G., Cai, X., Guo, T. Data-Independent Acquisition Mass Spectrometry-Based Proteomics and Software Tools: A Glimpse in 2020. Proteomics. 20 (17-18), 1900276(2020).
  10. Deutsch, E. W., et al. The ProteomeXchange consortium at 10 years: 2023 update. Nucl Acids Res. 51 (D1), D1539-D1548 (2023).
  11. Demichev, V., Messner, C. B., Vernardis, S. I., Lilley, K. S., Ralser, M. DIA-NN:neural networks and interference correction enable deep proteome coverage in high throughput. Nat Meth. 17 (1), 41-44 (2020).
  12. Zhang, F., et al. A Comparative Analysis of Data Analysis Tools for Data-Independent Acquisition Mass Spectrometry. Mol Cell Proteomics. 22 (9), 100623(2023).
  13. Kong, A. T., Leprevost, F. V., Avtonomov, D. M., Mellacheruvu, D., Nesvizhskii, A. I. MSFragger: ultrafast and comprehensive peptide identification in mass spectrometry-based proteomics. Nat Meth. 14 (5), 513-520 (2017).
  14. Anderson, N. L., Anderson, N. G. The Human Plasma Proteome. Mol Cell Proteomics. 1 (11), 845-867 (2002).
  15. Kowal, J., et al. Proteomic comparison defines novel markers to characterize heterogeneous populations of extracellular vesicle subtypes. Proc Natl Acad Sci. 113 (8), E968-E977 (2016).
  16. Cao, L., et al. Proteogenomic characterization of pancreatic ductal adenocarcinoma. Cell. 184 (19), 5031-5052.e26 (2021).
  17. Dong, L., et al. Proteogenomic characterization identifies clinically relevant subgroups of intrahepatic cholangiocarcinoma. Cancer Cell. 40 (1), 70-87.e15 (2022).
  18. Dubois, E., Galindo, A. N., Dayon, L., Cominetti, O. Comparison of normalization methods in clinical research applications of mass spectrometry-based proteomics. 2020 IEEE Conf Computat Intelligence Bioinfo Computat Biol. , 1-10 (2020).
  19. Dressler, F. F., Brägelmann, J., Reischl, M., Perner, S. Normics: Proteomic Normalization by Variance and Data-Inherent Correlation Structure. Mol Cell Proteomics. 21 (9), 100269(2022).
  20. Dimmer, E. C., et al. The Gene Ontology - Providing a Functional Role in Proteomic Studies. Proteomics. 8 (23-24), pmic.200800002(2008).
  21. Lih, T. M., et al. Detection of Pancreatic Ductal Adenocarcinoma-Associated Proteins in Serum. Mol Cell Proteomics. 23 (1), 100687(2024).
  22. Chinese Human Proteome Project (CNHPP) Consortium. Proteomics identifies new therapeutic targets of early-stage hepatocellular carcinoma. Nature. 567 (7747), 257-261 (2019).
  23. Kanehisa, M., Furumichi, M., Sato, Y., Matsuura, Y., Ishiguro-Watanabe, M. KEGG: biological systems database as a model of the real world. Nucl Acids Res. 53 (D1), D672-D677 (2025).
  24. Campello, E., Ilich, A., Simioni, P., Key, N. S. The relationship between pancreatic cancer and hypercoagulability: a comprehensive review on epidemiological and biological issues. Br J Cancer. 121 (5), 359-371 (2019).
  25. Fang, L., Xu, Q., Qian, J., Zhou, J. Y. Aberrant Factors of Fibrinolysis and Coagulation in Pancreatic Cancer. OncoTargets Ther. 14, 53-65 (2021).
  26. Vlodavsky, I., Elkin, M., Ilan, N. Impact of heparanase and the tumor microenvironment on cancer metastasis and angiogenesis: basic aspects and clinical applications . Rambam Maimonides Med J. 2 (1), (2011).
  27. Fröhlich, K., et al. Benchmarking of analysis strategies for data-independent acquisition proteomics using a large-scale dataset comprising inter-patient heterogeneity. Nat Comm. 13 (1), 2622(2022).
  28. Polasky, D. A., et al. MSFragger-Labile: A Flexible Method to Improve Labile PTM Analysis in Proteomics. Mol Cell Proteomics. 22 (5), 100538(2023).
  29. Gerault, M. A., Camoin, L., Granjeaud, S. DIAgui: a Shiny application to process the output from DIA-NN. Bioinfo Adv. 4 (1), (2024).
  30. Hsiao, Y., et al. Analysis and Visualization of Quantitative Proteomics Data Using FragPipe-Analyst. J Proteome Res. 23 (10), 4303-4315 (2024).
  31. Yu, F., Deng, Y., Nesvizhskii, A. I. MSFragger-DDA+ enhances peptide identification sensitivity with full isolation window search. Nat Comm. 16 (1), 3329(2025).
  32. Li, K., Teo, G. C., Yang, K. L., Yu, F., Nesvizhskii, A. I. diaTracer enables spectrum-centric analysis of diaPASEF proteomics data. Nat Comm. 16 (1), 95(2025).
  33. Qiao, R., Li, H., Bian, H., Xin, L., Shan, B. De Novo sequencing-assisted homology search for DIA data analysis enables low abundance peptide variants discovery. Biorvix. 10, (2025).
  34. Meissner, F., Geddes-McAlister, J., Mann, M., Bantscheff, M. The emerging role of mass spectrometry-based proteomics in drug discovery. Nat Rev Drug Disc. 21 (9), 637-654 (2022).
  35. Zheng, Y., et al. Multi-omics data integration using ratio-based quantitative profiling with Quartet reference materials. Nat Biotechnol. 42 (7), 1133-1149 (2024).
  36. Bubis, J. A., et al. Challenging the Astral mass analyzer to quantify up to 5,300 proteins per single cell at unseen accuracy to uncover cellular heterogeneity. Nat Meth. 22 (3), 510-519 (2025).
  37. Leutert, M., Entwisle, S. W., Villén, J. Decoding Post-Translational Modification Crosstalk With Proteomics. Mol Cell Proteomics. 20, 100129(2021).
  38. Schneider, M., et al. A Scalable, Web-Based Platform for Proteomics Data Processing, Result Storage and Analysis. Proteome Res. 24 (3), 1241-1249 (2025).
  39. Jalili, V., et al. The Galaxy platform for accessible, reproducible and collaborative biomedical analyses: 2020 update. Nucl Acids Res. 48 (W1), W395-W402 (2020).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

An lisis de datos prote micosadquisici n dependiente de datosadquisici n independiente de datoscuantificaci n de prote nasgr fico de volc nan lisis de ontolog a g nicaan lisis de rutas KEGGred de interacci n de prote nas

Artículos relacionados