19 de agosto de 2025
Los datos proteómicos basados en espectrometría de masas están disponibles en bases de datos abiertas y se puede acceder a ellos mediante herramientas gratuitas. Dada la complejidad de las búsquedas y descripciones de bases de datos, muchos biólogos carecen del conocimiento para utilizar estos conjuntos de datos. Aquí, proporcionamos una guía sobre el uso de herramientas gratuitas para búsquedas básicas de datos proteómicos.
Nuestro trabajo proporciona una guía para que los biólogos analicen datos proteómicos complejos utilizando herramientas gratuitas. Nuestro objetivo es capacitarlos para validar los hallazgos y explorar conjuntos de datos públicos. Muchos biólogos no pueden usar datos públicos de proteomas debido a la falta de una guía clara.
Nuestro trabajo une esto, permitiendo la validación sin nuevos experimentos con la vida silvestre. Nuestro trabajo utiliza software gratuito de última generación que es independiente del proveedor. Estas herramientas son más rápidas, más sensibles y proporcionan un descubrimiento de proteoma más preciso que muchas herramientas tradicionales.
Para comenzar, descargue el archivo FASTA del proteoma de referencia de la base de datos UniProt. Haga clic en el botón agregar FASTA para cargar el archivo de proteoma de referencia en el software DIA-NN. Seleccione las dos opciones, resumen FASTA para la generación de bibliotecas de búsqueda libre de bibliotecas y predicción de espectros, RT e IM basados en aprendizaje profundo en la sección de generación de iones precursores.
Luego, haga clic en el botón ejecutar para generar una biblioteca espectral predicha. Anule la selección de las dos opciones en la sección de generación de iones precursores. Haga clic en el botón de tipo que corresponde al formato de archivo en la sección de entrada para cargar los datos DIA.
Ahora, establezca tanto la precisión de masa como la precisión de MS1 en cero partes por millón en la sección de algoritmo. Ajuste la configuración del rango de masa del precursor y del fragmento en la sección de generación de iones precursores de acuerdo con la configuración experimental. Mantenga las otras configuraciones de software sin cambios.
A continuación, haga clic en el botón Ejecutar. Esperar hasta que finalice se muestra en la interfaz de operación, lo que indica que el análisis se ha completado. Haga clic en el icono de la tubería de fragmentación ubicado en la carpeta bin después de la instalación.
Vaya a la pestaña de configuración para ver todas las configuraciones dependientes. Compruebe si los módulos MSFragger, IonQuant, diaTracer, DIA-NN y Python están disponibles en su sistema. Si falta algún módulo, haga clic en descargar actualizar o descargar para recuperarlo.
Ahora, cambie a la pestaña de flujo de trabajo. Seleccione predeterminado en el menú desplegable del flujo de trabajo y haga clic en cargar flujo de trabajo. Luego, haga clic en agregar archivos para ingresar las rutas de los archivos.
Asigne el nombre del experimento y el número de réplica biológica en asignar archivos o déjelo en blanco. A continuación, haga clic en la pestaña de la base de datos para cambiar a ella. Cargue un archivo FASTA desde el disco o descargue uno que corresponda a la especie de muestra.
Durante la descarga, seleccione las opciones solo secuencias revisadas, agregue señuelos y agregue contaminantes comunes para una ejecución simple. Haga clic en la pestaña MSFragger para cambiar la vista. Seleccione la configuración predeterminada de búsqueda cerrada y haga clic en cargar.
En la configuración de coincidencia máxima, conserve todos los valores predeterminados. Tanto para la calibración como para la optimización, seleccione ninguno para reducir el tiempo de procesamiento. Para la digestión de proteínas, ajuste los parámetros en función de los requisitos de su experimento y mantenga la configuración predeterminada restante.
Ahora, cambie a la pestaña de validación. Desmarque predecir RT y predecir espectros, ya que estas opciones están diseñadas para flujos de trabajo de adquisición independientes de datos. Haga clic en la pestaña MS1 cuanto.
Seleccione ejecutar MS1 quant y luego haga clic en cargar valores predeterminados de quant. Elija ion quant y deje todos los demás ajustes en los valores predeterminados. Finalmente, haga clic en la pestaña ejecutar para continuar.
Seleccione el directorio de salida deseado y haga clic en ejecutar para comenzar a analizar los datos. En pacientes con adenocarcinoma ductal pancreático, o PDAC, SERPINA5 y HPSE mostraron una expresión significativamente reducida, mientras que FGB mostró una mayor expresión en suero en comparación con individuos normales. En muestras de tumores de carcinoma hepatocelular, ENO3, PLS3, MTAP, SERPINB9 e ITPR2 mostraron una expresión reducida en relación con los tejidos emparejados, mientras que ME1, CYP27A1, RPS16 y ATP5PF aumentaron significativamente.
La visualización del mapa de calor reveló una expresión de proteínas consistentemente elevada en el suero de pacientes con PDAC en comparación con individuos normales. El análisis de enriquecimiento de la ontología génica del suero PDAC reveló una regulación positiva significativa de los procesos relacionados con la coagulación y la hemostasia. El análisis de GO de tumores de carcinoma hepatocelular identificó enriquecimiento en nucleótidos y procesos metabólicos, incluido el metabolismo de nucleótidos de purina y las vías metabólicas de NAD.
El análisis de enriquecimiento de la vía KEGG del suero PDAC reveló una activación significativa de la vía del complemento y las cascadas de coagulación, junto con la degradación de glicosaminoglicanos. El análisis de KEG en muestras de tumores de carcinoma hepatocelular identificó un enriquecimiento en la señalización de PPAR, el metabolismo del carbono y las vías de enfermedades neurodegenerativas, aunque con menor significación estadística. La red de interacción proteína-proteína para las proteínas séricas PDAC reguladas al alza reveló un grupo central que involucra el factor de coagulación 11, la cadena beta de fibrinógeno y el inhibidor de la serina proteasa plasmática, así como varias proteínas aisladas, incluidas HPSE, similar al antígeno CD5 y CRISP3.
Vea la transcripción completa y acceda a miles de videos científicos
Este estudio proporciona una guía completa para que los biólogos analicen datos proteómicos complejos utilizando herramientas gratuitas y de vanguardia.
Mass spectrometry-based proteomics is increasingly central to early discovery and translational research, yet data complexity and lack of accessible workflows limit its broader adoption in biopharma R&D. This article demonstrates how free, vendor-agnostic computational tools enable robust interrogation and validation of public proteomic datasets, supporting hypothesis-driven research without new experimental burden. Streamlined data analysis workflows enhance predictive confidence and facilitate cross-study comparisons, directly impacting target validation and biomarker discovery pipelines.
This workflow positions mass spectrometry data analysis from early discovery through lead identification and translational research, leveraging public repositories and free computational tools.