Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de método

Identificación de biomarcadores moleculares relacionados con el sistema inmunitario en el trastorno del espectro autista mediante la proteómica de adquisición independiente de datos y el aprendizaje automático

565 visualizaciones

DOI:

10.3791/68949

26 de septiembre de 2025

* These authors contributed equally

En este artículo

Resumen

Aquí, presentamos un protocolo que utiliza espectrometría de masas de adquisición independiente de datos y aprendizaje automático que identificó ocho proteínas relacionadas con el sistema inmunológico como biomarcadores precisos para el diagnóstico temprano del trastorno del espectro autista, validado por un ensayo inmunoabsorbente ligado a enzimas.

Resumen

Este estudio presenta un protocolo reproducible para identificar biomarcadores de proteínas séricas asociados con el trastorno del espectro autista (TEA) utilizando espectrometría de masas de adquisición independiente de datos (DIA) combinada con aprendizaje automático (ML). DIA permite un perfil imparcial y de alta resolución del proteoma sérico, incluidas las proteínas de baja abundancia, al tiempo que garantiza la reproducibilidad en todas las muestras. Se aplicaron enfoques de ML para seleccionar paneles de proteínas informativos para el diagnóstico y mejorar la robustez del modelo. El análisis incluyó suero de 99 niños con TEA y 70 controles de la misma edad. Se agotaron las proteínas de alta abundancia, los péptidos se prepararon utilizando procedimientos estandarizados de digestión y fraccionamiento, y la DIA se realizó en un espectrómetro de masas de alta resolución. El procesamiento y la cuantificación de los datos identificaron proteínas expresadas diferencialmente, que se sometieron a análisis de enriquecimiento funcional. Ocho proteínas relacionadas con el sistema inmunitario surgieron como fuertes candidatos para el desarrollo de biomarcadores. Un modelo de regresión logística entrenado en estas proteínas logró una precisión del 95,27%, un valor Kappa de 0,9025 y un AUC de 1,000 en validación cruzada. Estos hallazgos demuestran el potencial de la proteómica basada en DIA, combinada con el aprendizaje automático, como un marco sólido para el descubrimiento de biomarcadores en TEA y para la adaptación en investigaciones clínicas más amplias.

Introducción

El trastorno del espectro autista (TEA) es un grupo de trastornos del neurodesarrollo de inicio temprano caracterizados por heterogeneidad en la etiología y la presentación clínica. Las características principales incluyen déficits persistentes en la comunicación e interacción social, así como comportamientos, intereses o actividades restringidos y repetitivos. En los Estados Unidos, la prevalencia es de aproximadamente 2.3% entre niños de 8 años y alrededor de 2.2% entre adultos, lo que subraya su impacto en la salud pública 1,2,3,4. Los factores de riesgo son diversos, incluidas las predisposiciones genéticas, la desregulación inmunológica y las exposiciones ambientales prenatales 5,6,7. El diagnóstico y la intervención tempranos pueden mejorar significativamente los resultados del desarrollo, lo que hace que la identificación de biomarcadores objetivos y confiables sea un enfoque importante de la investigación del TEA 8,9,10. Este protocolo se basa en nuestro trabajo publicado anteriormente aplicando la proteómica de adquisición independiente de datos (DIA) y el aprendizaje automático para identificar proteínas relacionadas con el sistema inmunológico como biomarcadores potenciales para el diagnóstico temprano de TEA11.

A pesar de los extensos esfuerzos, actualmente no existen biomarcadores específicos y universalmente validados para el diagnóstico clínico de TEA12. Los candidatos propuestos, como las alteraciones en el microbioma intestinal13, la interleucina-6 (IL-6) elevada14, los cambios en el factor neurotrófico derivado del cerebro (BDNF) 15 y los marcadores de estrés oxidativo como el glutatión16, siguen siendo preliminares y carecen de reproducibilidad para uso clínico. La proteómica se ha convertido en un enfoque prometedor para identificar firmas moleculares específicas de enfermedades, y varios estudios han investigado diferentes muestras biológicas (sangre, saliva, orina, PBMC) para proteínas expresadas diferencialmente 8,17,18,19,20,21,22 . Por ejemplo, Bao et al. demostraron que las proteínas inflamatorias identificadas por la proteómica de Olink pueden ayudar en el diagnóstico temprano de TEA (17), mientras que otros estudios sugieren que las vías proteómicas y metabólicas compartidas pueden producir biomarcadores robustos a pesar de la heterogeneidad genética del TEA23.

La espectrometría de masas DIA ha ganado cada vez más atención por su perfil de proteínas completo y reproducible. A diferencia de la adquisición dependiente de datos (DDA) tradicional, que fragmenta selectivamente los iones más intensos, DIA fragmenta todos los iones precursores a través de ventanas m/z predefinidas. Esto proporciona una cobertura de proteoma más profunda y una mejor reproducibilidad en grandes cohortes, una ventaja clave para las comparaciones clínicas14. Los estudios de evaluación comparativa muestran que DIA detecta péptidos más cuantificables que DDA, particularmente para proteínas de baja abundancia, con menor variación entre ejecuciones14.

Sobre la base de estos avances, aplicamos análisis proteómicos basados en DIA a muestras de suero de 99 niños con TEA y 70 controles, luego del agotamiento de proteínas de alta abundancia. Nuestros hallazgos destacan el potencial de las proteínas relacionadas con el sistema inmunitario como marcadores moleculares para el diagnóstico temprano de TEA y demuestran el valor de la proteómica basada en DIA en el descubrimiento de biomarcadores cuando se combina con una metodología rigurosa11.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

El protocolo se llevó a cabo de conformidad con la Declaración de Helsinki y el protocolo fue aprobado por la Junta de Revisión Institucional del Hospital de Salud Maternoinfantil de Changsha; Se obtuvo el consentimiento informado de los sujetos.

1. Identificación de niños con autismo con DSM-5

  1. Recopilar historial médico e información de antecedentes
    1. Historia del desarrollo
      1. Recopilar información sobre el desarrollo temprano del paciente, incluida la progresión del lenguaje, las habilidades sociales y motoras.
      2. Tenga en cuenta cualquier retraso o anomalía en el desarrollo (p. ej., retraso en el lenguaje, dificultades en la interacción social).
    2. Antecedentes familiares
      1. Pregunte sobre cualquier historial familiar de autismo u otros trastornos del neurodesarrollo.
    3. Nivel funcional actual
      1. Evaluar el desempeño del paciente en la vida diaria, incluido el aprendizaje, el trabajo, las interacciones sociales y las habilidades para la vida independiente.
  2. Uso de los criterios diagnósticos del DSM-5
    1. Déficits persistentes en la comunicación social y la interacción social
      1. Asegúrese de que se cumplan al menos dos de los tres criterios siguientes:
        1. Déficits en la reciprocidad socioemocional: busque una falta de contacto visual normal, expresiones faciales o lenguaje corporal y dificultad para formar amistades o relaciones apropiadas para su edad.
        2. Déficits en los comportamientos comunicativos no verbales: busque desafíos en el uso de gestos, expresiones faciales o tono de voz para transmitir emociones y una comprensión limitada de las señales no verbales de los demás.
        3. Déficits en el desarrollo, mantenimiento y comprensión de las relaciones: busque dificultad para adaptarse a diferentes contextos sociales y falta de interés en los compañeros o incapacidad para participar en juegos imaginativos.
    2. Patrones restringidos y repetitivos de comportamiento, intereses o actividades
      1. Asegúrese de que se cumplan al menos dos de los siguientes cuatro criterios:
        1. Movimientos motores estereotipados o repetitivos (p. ej., aleteo de manos, balanceo del cuerpo o uso repetitivo de objetos).
        2. Insistencia en la igualdad o patrones ritualizados de comportamiento: busque angustia extrema por cambios menores en la rutina.
        3. Intereses fijos y altamente restringidos: busque un enfoque anormalmente intenso en temas o actividades específicas.
        4. Hiper o hiporreactividad a la información sensorial: busque respuestas atípicas a estímulos sensoriales como sonidos, luces o tacto.
  3. Evaluación del inicio y la gravedad de los síntomas
    1. Momento de los síntomas: confirme que los síntomas estaban presentes en la primera infancia (generalmente antes de los 3 años), incluso si se hacen más evidentes más tarde.
    2. Impacto de los síntomas: confirme que los síntomas causan un deterioro significativo en las áreas sociales, ocupacionales u otras áreas importantes del funcionamiento.
    3. Niveles de gravedad
      NOTA: Según el DSM-5, la gravedad del TEA se clasifica en tres niveles (Tabla complementaria S1).
      1. Clasifique como nivel 1 si el paciente solo requiere un soporte leve.
      2. Categorizar como nivel 2 si el paciente requiere apoyo sustancial (moderado).
      3. Clasifique como nivel 3 si el paciente requiere un apoyo muy sustancial (grave).
  4. Exclusión de otras causas potenciales
    1. Examen médico Realice las evaluaciones médicas necesarias (p. ej., pruebas genéticas, imágenes cerebrales) para descartar otras afecciones que puedan causar síntomas similares (p. ej., síndromes genéticos, discapacidades auditivas, discapacidades intelectuales).
    2. Evaluación de la comorbilidad: Evaluar la presencia de condiciones comórbidas (p. ej., trastorno por déficit de atención con hiperactividad, trastornos de ansiedad, depresión, epilepsia, etc.).

2. Preparación de muestras para análisis de espectrometría de masas DIA

  1. Cumplimiento ético y recogida de muestras
    1. Obtenga el consentimiento informado de los padres o tutores legales de niños de 3 a 7 años diagnosticados con trastorno del espectro autista (TEA).
    2. Clasifique a los pacientes en niveles de gravedad 1 a 3 de acuerdo con los criterios de diagnóstico descritos en el DSM-5 estadounidense para el autismo (paso 1.3.3).
    3. Recolecte muestras de suero de los participantes. Asegúrese de que todas las muestras se procesen dentro de las cuatro horas posteriores a la extracción de sangre para evitar la degradación de las proteínas. Mantenga las muestras en hielo durante el procesamiento.
  2. Eliminación de proteínas de alta abundancia
    1. Utilice un kit comercial para agotar las proteínas de alta abundancia a partir de 60 μl de suero por muestra, siguiendo las instrucciones del fabricante. Brevemente, equilibre la columna de agotamiento con el tampón de unión, cargue la muestra de suero y deje que pase a través de la columna bajo el flujo por gravedad. Recoja el flujo continuo, que contiene la fracción de proteína de baja abundancia.
    2. Mida la concentración total de proteínas mediante un ensayo de BCA. Normalice todas las muestras a una concentración final de 0,5-1,0 μg/μL antes de la digestión en solución. Asegúrese de que cada muestra contenga al menos 100 μg de proteína para su posterior análisis.
  3. Digestión de proteínas
    NOTA: La digestión de proteínas se realizó utilizando el método FASP descrito por Wisniewski et al.24.
    1. Agregue el detergente, ditiotreitol (DTT) y yodoacetamida (IAA) en el tampón UA (tampón de urea) para bloquear la cisteína reducida.
    2. Digestión de la suspensión de proteínas con tripsina en una proporción de 50:1 durante la noche a 37 °C.
  4. Desalación de péptidos, limpieza y fraccionamiento de fase inversa de pH alto
    1. Centrifugar las mezclas de péptidos a 16.000 × g durante 15 min a °C para eliminar los residuos insolubles.
    2. Transfiera el sobrenadante (que contiene péptidos digeridos) a un nuevo tubo de microcentrífuga de baja unión para minimizar las pérdidas de adsorción.
    3. . Preparar microcolumnas C18 (empaquetadas internamente con resina C18) preacondicionando con metanol al 100% (20 μL) y equilibrando con ácido trifluoroacético (TFA) al 0,1% (v/v) en agua (tampón A; 20 μL).
    4. Cargue la muestra de péptido en la microcolumna. Lave la columna con 20 μL de tampón A para eliminar sales, detergentes y contaminantes no peptídicos.
    5. Eluir péptidos purificados con 20 μL de acetonitrilo al 80% que contiene 0,1% de TFA.
    6. Seque los péptidos eluidos al vacío con un concentrador de vacío centrífugo. Almacene los péptidos secos a -8 °C hasta su uso posterior.
    7. Reconstituya péptidos secos en ácido fórmico al 0,1% antes del análisis LC-MS/MS.
    8. 2.4.8.Cuantificar la concentración de péptidos midiendo la absorbancia a 280 nm (OD280) utilizando un espectrofotómetro, teniendo en cuenta las contribuciones de los residuos de triptófano y tirosina para una cuantificación precisa.
      Para fraccionar mezclas de péptidos utilizando HPLC de fase inversa de pH alto, utilice una columna C18 (3,5 μm, 2,1 x 150 mm) en un sistema HPLC con un caudal de 0,3 ml/min, fase móvil A: 10 mM de formiato de amonio en agua, pH 10 (ajustado con hidróxido de amonio), fase móvil B: 10 mM de formiato de amonio en acetonitrilo al 90%, pH 10. Realice una elución en gradiente para recolectar 60 fracciones por muestra durante ~ 60 min.
    9. Combine cada tercera fracción para reducir la redundancia, lo que da como resultado 20 fracciones agrupadas por muestra. Seque cada fracción agrupada al vacío para su análisis posterior.
      NOTA: Las fracciones peptídicas resultantes ahora están listas para el análisis nano-LC-MS/MS.

3. Envío para análisis de espectrometría de masas DIA

  1. Análisis de espectrometría de masas DIA
    1. Enriquecer el péptido de adquisición dependiente de datos (DDA) de la fracción HPRP con péptidos estándar iRT y separarlos mediante cromatografía líquida de alta resolución de fase inversa (RP-HPLC) en un sistema de nano-HPLC con una columna (75 μm x 150 mm; 2 μm de perlas C18, 120 Å) a un caudal de 300 nL/min con fase móvil A: 0,1% de ácido fórmico en agua, fase móvil B: ácido fórmico al 0,1% en acetonitrilo al 95%.
    2. Eluir los péptidos durante 60 min con un gradiente lineal de tampón B establecido de la siguiente manera: 0 - 2 min, gradiente lineal del 2% al 5% tampón B; 2 - 42 min, gradiente lineal del 5% al 20% del tampón B; 42 - 50 min, gradiente lineal del 20% al 35% del tampón B; 50 - 52 min, gradiente lineal del 35% al 90% del tampón B; 52 - 60 min, el tampón B se mantiene al 90%.
    3. Analice los péptidos eluidos en el espectrómetro de masas referenciado. Adquiera datos de MS utilizando un método top20 dependiente de los datos, eligiendo dinámicamente los iones precursores más abundantes del escaneo de la encuesta (350 - 1500 m / z) para la fragmentación de HCD.
    4. Ejecute el instrumento con el modo de reconocimiento de péptidos habilitado. Utilice una masa de bloqueo de 445.120025 Da como estándar interno para la calibración de masas. Adquiera los escaneos completos de MS a una resolución de 70,000 a m/z 200 y 17,500 a m/z 200 para escaneo MS/MS. Establezca el tiempo máximo de inyección en 50 ms para MS y 30 ms para MS/MS, la energía de colisión normalizada en 28, la ventana de aislamiento en 1,6 Th y la duración de la exclusión dinámica en 30 s.
  2. Análisis LC-MS/MS para la adquisición independiente de datos (DIA)
    1. Aumente los péptidos de cada muestra con iRT por igual y por separado.
    2. Realice LC-MS/MS en un espectrómetro de masas cuadrupolo acoplado con un sistema de nano-HPLC. Establezca la condición LC de la misma manera que para el método DDA anterior. Realice un escaneo de estudio de 400 a 1.200 m/z con una resolución de 60.000 con un objetivo AGC de 3E6 y un tiempo de inyección de 30 ms. Adquiera los escaneos DIA MS/MS con una resolución de 15.000 con una ventana de aislamiento de 20 m/z y con un objetivo AGC de 1E6 y un tiempo de inyección de 50 ms. Establezca la energía de colisión normalizada en 30.
    3. Registre los espectros de escaneos completos de MS y DIA en tipos de perfil y centroide, respectivamente.
  3. Búsqueda en la base de datos de secuencias
    1. Analizar los datos de DDA MS utilizando el software DIA2.
    2. Busque los datos de MS en la base de datos humana UniProtKB (186,532 entradas en total, descargadas el 10/2019), enriquecidas con proteínas que consisten en 11 secuencias de péptidos iRT.
    3. Seleccione la tripsina como enzima de la digestión. Defina los dos sitios de escisión perdidos máximos y la tolerancia de masa de 4,5 ppm para iones precursores y 20 ppm para iones de fragmentos para la búsqueda en la base de datos. Definir la carbamidotetilación de cisteínas como una modificación fija y acetilación de la proteína N-terminal y la oxidación de la metionina como modificaciones variables para la búsqueda en bases de datos.
    4. Filtre los resultados de búsqueda de la base de datos y expórtelos con una tasa de descubrimiento falso (FDR) del <1% a nivel de péptidos, espectro emparejado y proteínas, respectivamente.
  4. Realizar procesamiento de datos sin procesar
    1. Analizar los datos de DIA MS se analizaron con el software DIA [34, 35] para la generación de una biblioteca espectral a partir de los resultados de búsqueda. Utilice la configuración predeterminada para la búsqueda y el iRT dinámico para la predicción del tiempo de retención. Asegúrese de que la corrección de interferencias para la exploración MS/MS esté habilitada.
    2. Exporte los resultados con <1% de FDR a nivel de péptido.

4. Análisis diferencial de proteínas

  1. Realice pruebas de hipótesis utilizando la prueba t de Student combinada con cambio de pliegue (FC) en http://www.omickits.com/open/tooldetail?id=70.
    1. Inicie sesión en la plataforma en la nube y navegue hasta la herramienta Análisis de pruebas de hipótesis . Cargue el archivo de datos de cuantificación de proteínas preprocesado (por ejemplo, formato CSV o TXT).
    2. En la configuración de parámetros, seleccione la prueba t de Student como método estadístico y el umbral de significación en el valor p < 0,05. Defina el umbral de cambio de pliegue como FC > 1,5 o FC < 1/1,5. Haga clic en Ejecutar análisis y espere a que se generen los resultados.
    3. Descargue el archivo de salida que contiene los valores p, log2(FC) y el estado de significación de cada proteína.
      NOTA: Este enfoque de doble criterio equilibra la significación estadística con la relevancia biológica, lo que garantiza una identificación sólida de proteínas expresadas diferencialmente (DEP).

5. Análisis de la ruta de la señal

  1. Visualización de gráficos de volcanes
    1. Vaya a la herramienta en http://www.omickits.com/open/tooldetail?id=63 y, a continuación, a la página de la herramienta de trazado de volcanes .
      1. Cargue el archivo de resultados del análisis DEP de la sección 4.
      2. Configure el parámetro de visualización: eje X: log2 (Fold Change) - indica la dirección del cambio; Eje Y: -log10 (valor p) - refleja la significación estadística; Código de colores: Rojo : proteínas significativamente reguladas al alza (p < 0,05 y FC > 1,5); Azul : proteínas significativamente reguladas a la baja (p < 0,05 y FC < 0,667); Gris : proteínas no significativas (p ≥ 0,05 o 1/1,5 ≤ FC ≤ 1,5).
      3. Haga clic en Generar imagen y descargue la imagen de alta resolución (formato PDF/SVG) para su publicación.
  2. Mapa de calor de agrupación jerárquica
    1. Navegue a la herramienta en http://www.omickits.com/open/tooldetail?id=17
      1. Acceda a la herramienta de mapa de calor de clustering .
      2. Cargue la matriz de expresión DEP filtrada.
      3. Establezca los siguientes parámetros: Método de normalización: puntuación Z por filas para eliminar las diferencias de escala; Métrica de distancia: distancia euclidiana; Método de agrupación: agrupación jerárquica de enlace completo; Opcional: habilite la agrupación en clústeres de columnas y/o filas en función de la agrupación de muestras.
      4. Haga clic en Ejecutar para generar el mapa de calor.
      5. Descargue y guarde el mapa de calor como una imagen lista para su publicación.
        NOTA: El mapa de calor representa visualmente la similitud y divergencia de los patrones de expresión de proteínas entre las muestras.
  3. Análisis de enriquecimiento y anotación funcional GO
    1. Instale y cargue los paquetes de R necesarios:
      library(clusterProfiler)
      library(org. Hs.eg.db)

      Biblioteca (ggplot2)
    2. Convierta los ID de proteínas (por ejemplo, Uniprot o símbolos de genes) en ID de Entrez:
      entrez_ids <- bitr(diff_proteins, fromType = "UNIPROT", toType = "ENTREZID", OrgDb = org. Hs.eg.db)
    3. Realice análisis de enriquecimiento de GO:
      go_enrich <- enrichGO(gen = entrez_ids$ENTREZID, OrgDb = org. Hs.eg.db, keyType = "ENTREZID", ont = "BP")
    4. Visualice los resultados usando diagramas de puntos:
      1. dotplot(go_enrich, showCategory = 20)
        Fórmula:
        Factor enriquecido = (a/b) / (c/d)
        Dónde:
        a = número de DEP anotados en el término;
        b = número total de DEP;
        c = número de proteínas de fondo anotadas en el término;
        d = número total de proteínas de fondo.
  4. Análisis de enriquecimiento y anotación de rutas KEGG
    1. Realice un análisis de enriquecimiento de KEGG:
      kegg_enrich <- enriquecerKEGG(gen = entrez_ids$ENTREZID, organismo = "tiene")
    2. Visualice los resultados de la vía KEGG:
      barplot(kegg_enrich, showCategory = 20)
    3. Personalice los gráficos usando ggplot2 para el formato de publicación.

6. Cribado inicial de proteínas mediante análisis de curva ROC

  1. Preparación de datos: Cargue el conjunto de datos de proteómica que contiene todas las proteínas expresadas diferencialmente (DEP) identificadas en los grupos de trastorno del espectro autista (TEA) y control. Asegúrese de que el conjunto de datos incluya valores de expresión de proteínas para ambos grupos, con etiquetas claras que indiquen muestras de TEA y control.
  2. Realice análisis de la curva ROC.
    1. Utilice el paquete pROC en R para realizar un análisis de la curva de características operativas del receptor (ROC) para cada proteína.
    2. Evalúe la capacidad de cada proteína para distinguir entre los grupos de TEA y control calculando el área bajo la curva (AUC).
      AUC = 0,5: Sin discriminación (equivalente a azar aleatorio).
      0,7 ≤ AUC < 0,8: Discriminación aceptable.
      0,8 ≤ AUC < 0,9: Excelente discriminación.
      AUC ≥ 0,9: Discriminación sobresaliente.
      NOTA: El AUC representa la probabilidad de que un individuo seleccionado al azar del grupo de TEA tenga un nivel de proteína más alto que un individuo seleccionado al azar del grupo de control. Un AUC más alto indica un mejor rendimiento diagnóstico, con valores superiores a 0,8 generalmente considerados clínicamente significativos en estudios de biomarcadores.
    3. Registre los valores de AUC para todas las proteínas.
  3. Seleccione biomarcadores candidatos.
    1. Identificar proteínas con un AUC superior a 0,7 como biomarcadores candidatos.
    2. Exporte la lista de biomarcadores candidatos para su posterior análisis.
  4. Visualiza los resultados.
    1. Utilice el paquete ggplot2 en R para crear visualizaciones de las curvas ROC para las proteínas de mayor rendimiento.
    2. Incluya los valores AUC en las leyendas del gráfico para mayor claridad.

7. Cribado secundario mediante Random Forest

  1. Preparar datos de entrada.
    1. Utilice la lista de biomarcadores candidatos obtenidos del análisis ROC como entrada para el análisis de bosques aleatorios.
    2. Asegúrese de que el conjunto de datos tenga el formato adecuado, con filas que representen muestras y columnas que representen valores de expresión de proteínas.
  2. Entrene el modelo de bosque aleatorio.
    1. Aplique el algoritmo de bosque aleatorio mediante el paquete randomForest en R.
    2. Establezca el número de árboles (ntree) en 500 y el número de variables muestreadas aleatoriamente en cada división (mtry) en la raíz cuadrada del número total de entidades.
    3. Evalúe la importancia de la característica mediante la métrica MeanDecreaseAccuracy, que mide la reducción de la precisión del modelo cuando se quita una característica específica.
    4. Entrene un modelo de bosque aleatorio mediante el paquete randomForest en R:
      R. biblioteca (randomForest)
      # Ejemplo: grupo de predicción (por ejemplo, TEA vs. control) utilizando niveles de proteína

      rf_model <- randomForest(x = protein_data,
      y = as.factor(grupo),
      importance = TRUE, # Necesario para calcular la importancia de la característica
      ntree = 500) # Número de árboles
    5. Extraiga métricas de importancia de características mediante la función importance():
      R. importance_scores <- importancia(rf_model)
    6. Recupere los valores de MeanDecreaseAccuracy y ordénelos en orden descendente:
      R. mean_dec_acc <- importance_scores[ , "MeanDecreaseAccuracy"]
      importance_rank <- sort(mean_dec_acc, decreciente = TRUE)
    7. Visualice la importancia de las características mediante la función varImpPlot() incorporada:
      R. varImpPlot(rf_model, main = "Importancia de la característica (disminución media de la precisión)")
      NOTA: La métrica MeanDecreaseAccuracy refleja qué tan esencial es cada característica para el rendimiento predictivo del modelo. Una gran disminución en la precisión al retirarla indica una gran importancia. Este enfoque es particularmente útil para el descubrimiento de biomarcadores, ya que ayuda a priorizar proteínas o genes con el mayor poder discriminatorio entre grupos.
    8. Exporte las puntuaciones de importancia para informes o análisis posteriores:
      R. importance_table <- data.frame(
      Característica = nombres(importance_rank),
      MeanDecreaseAccuracy = importance_rank
      )
      write.csv(importance_table, "feature_importance.csv", row.names = FALSE)
    9. Clasifique las proteínas en función de sus puntuaciones MeanDecreaseAccuracy.
    10. Seleccione las 15 proteínas principales con las puntuaciones MeanDecreaseAccuracy más altas como las características más significativas para el modelado posterior.
    11. Exporte la lista de estas proteínas para su posterior validación.
      NOTA: Las proteínas con valores bajos de MeanDecreaseAccuracy pueden tener un impacto mínimo en el rendimiento del modelo si se eliminan.
    12. Destacar la relevancia biológica de las proteínas seleccionadas, en particular las relacionadas con las funciones o vías inmunitarias implicadas en el TEA.

8. Combine los resultados para la selección final de biomarcadores.

NOTA: Asegúrese de que R esté instalado con los siguientes paquetes: pROC, randomForest y ggplot2. Asegúrese de que el conjunto de datos de proteómica se preprocese y normalice antes del análisis. Guarde las listas de biomarcadores candidatos y gráficos de visualización como archivos separados como referencia.

  1. Integrar los hallazgos.
    1. Cruce los resultados del análisis ROC y la detección aleatoria de bosques para identificar proteínas superpuestas.
    2. Priorizar las proteínas que aparecen en ambos análisis como biomarcadores candidatos altamente confiables.
    3. Realice pasos de validación adicionales, como la validación cruzada de dejar uno fuera (LOOCV), para confirmar la solidez de los biomarcadores seleccionados.
    4. Utilice modelos de regresión logística para evaluar la precisión predictiva del conjunto de biomarcadores combinados.
    5. Cree curvas ROC y gráficos de recuperación de precisión para el conjunto final de biomarcadores utilizando el paquete ggplot2.
    6. Incluya métricas como AUC y valores de recuperación de precisión para demostrar el potencial diagnóstico de los biomarcadores seleccionados.

9. Selección de características bidireccional

  1. Preparar datos y definir el modelo.
    1. Cargue el conjunto de datos que contiene los valores de expresión de proteínas y las etiquetas correspondientes (por ejemplo, TEA frente a control). Asegúrese de que el conjunto de datos esté preprocesado y normalizado.
    2. Definir el modelo inicial: Utilice un modelo lineal generalizado (GLM) con una familia binomial para la clasificación.
    3. Utilice AIC como métrica de evaluación para comparar modelos durante la selección de características.
  2. Realice la selección de operaciones hacia adelante.
    1. Comience con un modelo vacío que contenga solo el término de intersección.
    2. Agregue una entidad a la vez en función de la mayor reducción de AIC.
    3. Registre el valor AIC después de cada suma. Deténgase cuando no se observe una reducción adicional de AIC.
  3. Realice la selección de operaciones hacia atrás.
    1. Entrene un modelo con todas las características disponibles.
    2. Elimine una entidad a la vez en función del menor aumento de AIC.
    3. Registre el valor AIC después de cada eliminación. Deténgase cuando no se observe una reducción adicional de AIC.
    4. Combina pasos hacia adelante y hacia atrás.
  4. Alterna entre la selección hacia adelante y hacia atrás.
    1. Realice una ronda de selección de operaciones hacia adelante, seguida inmediatamente de una ronda de selección de operaciones hacia atrás. Repita este proceso hasta que no se observen más mejoras en AIC.
    2. Enfoque alternativo: Comience con la selección de características hacia atrás y, a continuación, realice la selección de características hacia adelante. Evalúe el efecto de volver a agregar entidades eliminadas previamente al modelo.
  5. Finalice las características seleccionadas.
    1. Exporte la lista final de entidades seleccionadas y sus coeficientes correspondientes (Figura complementaria S1).

10. Validación cruzada de la selección bidireccional de características mediante regresión logística con el método de dejar uno fuera

NOTA: Asegúrese de que R esté instalado con los siguientes paquetes: caret, pROC y ggplot2. El conjunto de datos de proteómica debe preprocesarse y normalizarse antes del análisis. Guarde la matriz de confusión, la curva ROC y el resumen del modelo como archivos independientes como referencia.

  1. Prepare los datos y defina el modelo.
    1. Cargue el conjunto de datos que contiene los valores de expresión de proteínas y las etiquetas correspondientes (por ejemplo, ASD frente a control) desde el archivo GLMSTEP/bothFitModel.txt. Asegúrese de que el conjunto de datos esté preprocesado y normalizado.
    2. Defina el modelo inicial utilizando un modelo lineal generalizado (GLM) con una familia binomial para la clasificación.
    3. Utilice la precisión y el coeficiente Kappa como métricas de evaluación para evaluar el rendimiento del modelo durante la validación cruzada.
  2. Realice la validación cruzada de dejar uno fuera.
    1. Inicialice la validación cruzada mediante el paquete de intercalación en R para implementar la validación cruzada de dejar uno fuera (LOOCV).
    2. Ajuste el modelo de regresión logística utilizando las ocho características seleccionadas.
    3. Registre la precisión y el coeficiente Kappa para cada iteración de validación cruzada.
  3. Analice los resultados de la validación cruzada.
    1. Resumir los resultados.
      NOTA: Los resultados del proceso LOOCV se verán como (como en este estudio): Modelo lineal generalizado, 169 muestras, 8 predictores, 2 clases: 'A', 'B', Remuestreo: Validación cruzada Leave-One-Out, Resumen de tamaños de muestra: 168, 168, 168, 168, 168, 168, ... , Resultados de remuestreo: Precisión Kappa 0.9526627 0.9024531.
    2. Interprete las métricas.
      NOTA: Aquí, el modelo logró una precisión de 0,9527 y un coeficiente Kappa de 0,9025, lo que indica una excelente concordancia entre los resultados previstos y observados.
      1. Observe el coeficiente Kappa para medir el poder predictivo del modelo. El coeficiente Kappa varía de -1 a 1, donde 0 indica predicción aleatoria y 1 indica concordancia perfecta.
        NOTA: En este estudio, el valor Kappa de 0,9025 refleja el fuerte poder predictivo del modelo.
  4. Evaluar los coeficientes del modelo.
    1. Examine los coeficientes del modelo de regresión logística para comprender la contribución de cada característica. Evalúe la desviación nula, la desviación residual y el AIC para confirmar el ajuste del modelo.
      NOTA: Por ejemplo, en este estudio, obtuvimos desviación nula: 2.2928e + 02 en 168 grados de libertad, desviación residual: 2.2378e-07 en 160 grados de libertad, AIC: 18, número de iteraciones de puntuación de Fisher: 25.
  5. Visualiza los resultados.
    1. Cree una matriz de confusión para visualizar el rendimiento predictivo del modelo.
    2. Represente la curva de características operativas del receptor (ROC) para evaluar el rendimiento de clasificación del modelo.
    3. Interprete el resultado s. Calcular el área bajo la curva (AUC) para obtener el índice de rendimiento de clasificación del modelo.
      NOTA: La curva ROC demuestra el equilibrio entre la tasa de verdaderos positivos y la tasa de falsos positivos. El área bajo la curva (AUC) debe estar cerca de 1, lo que indica un excelente rendimiento de clasificación. La curva ROC refleja los cambios en la tasa de verdaderos positivos y la tasa de falsos positivos del modelo en diferentes umbrales. Cuanto mayor sea el valor AUC, mejor será el rendimiento del modelo.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

El estudio incluyó a 99 niños con TEA y 70 controles de la misma edad (3-7 años), con distribución equilibrada por sexo (Tabla complementaria S2). El suero se recolectó después de un ayuno nocturno utilizando protocolos estandarizados: la sangre se extrajo en tubos separadores de suero, se dejó coagular a temperatura ambiente durante 30 min y luego se centrifugó a 1.500 × g durante 10 min a 4 ° C. El sobrenadante se alícuota y se almacenó a -80 °C hasta su poste...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

El protocolo descrito en este manuscrito describe un enfoque integral para identificar biomarcadores moleculares relacionados con el sistema inmunológico en el trastorno del espectro autista (TEA) utilizando técnicas de adquisición de masas de adquisición independiente de datos (DIA) y aprendizaje automático. Los pasos importantes dentro del protocolo garantizan resultados confiables y reproducibles, al tiempo que destacan las áreas donde pueden ser necesarias modificaciones o resolución...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores no tienen conflictos de intereses que declarar.

Agradecimientos

Gracias a todos los miembros del laboratorio central y a los que han ayudado con este proyecto.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Reactivos y productos químicosAcetonitrilo (grado HPLC)Fisher ScientificA18-50
Reactivos y productos químicosEl bicarbonato de amonio (NH? ¿HCO?)Sigma-Aldrich38939
Reactivos y productos químicosFormiato de amonioSigma-Aldrich90265
Reactivos y productos químicosAlbúmina de suero bovino (BSA)Thermo Fisher Scientific23212
Reactivos y productos químicosDitiotreitol (DTT)Sigma-Aldrich43815
Reactivos y productos químicosÁcido fórmico (0,1%)Thermo Fisher Scientific28905
Reactivos y productos químicosYodoacetamida (IAA)Sigma-AldrichI1149
Reactivos y productos químicosMetanol (grado HPLC)Fisher ScientificA452-4
Reactivos y productos químicosÁcido trifluoroacético (TFA)Sigma-AldrichT6508
Reactivos y productos químicosUreaSigma-AldrichU5378
fuerte y reactivos especializadosKit de ensayo de proteínas BCAThermo Fisher Scientific23227
fuerte y reactivos especializadosCartuchos C18 Sep-PakAguasWAT023590
fuerte y reactivos especializadosC18 StageTips (casero)3M Empore™
fuerte y reactivos especializadosKit de agotamiento de proteínas de alta abundanciaMillipore Sigma122642
fuerte y reactivos especializadosPéptidos estándar iRTBiognosys AG
fuerte y reactivos especializadosKit ELISA de lisozimaCompañía de biotecnología fina de Wuhan Ltd.
fuerte y reactivos especializadosMezcla de enzimas tripsina / LysCPromegaV5071
EquipoCentrífugaEppendorf5430R
EquipoSistema Easy-nLC 1200Thermo Fisher Scientific
EquipoEspectrofotómetro Nanodrop OneThermo Fisher ScientificND-UNO-W
EquipoEspectrómetro de masas HF-X Exactivo QThermo Fisher Scientific
EquipoConcentrador SpeedVacThermo Fisher ScientificSPD131DDA
EquipoCentrífuga de rotor de cuchara de selladoVarios
EquipoColumna XBridge BEH130 de WatersAguasC18, 3.5 μ m, 2.1&veces; 150 milímetros
EquipoSistema HPLC Agilent 1260Agilent1260 Infinito II
Software y herramientas en líneaBioconductor (paquetes R)bioconductor.org
Software y herramientas en líneaintercalación (paquete R)CRANcaret_6.0-93
Software y herramientas en líneaclusterProfiler (paquete R)Bioconductor4.0.5
Software y herramientas en líneaDIA-NNSoftware DIA-NNv1.8
Software y herramientas en líneaggplot2 (paquete R)CRAN3.4.0
Software y herramientas en líneaMaxQuantInstituto Max Planck1.6.17
Software y herramientas en líneaomickits.comPlataforma en la nube de OmiKitshttp://www.omickits.com
Software y herramientas en líneapROC (paquete R)CRAN1.18.0
Software y herramientas en línearandomForest (paquete R)CRAN4.7-1.1
Software y herramientas en líneaEspectronauta Pulsar XBiognosys AG17
Software y herramientas en líneaBase de datos humana UniProtKBuniprot.orgVersión 2019_10
Otros materialesTubos de microcentrífuga de baja uniónEppendorf30120094
Otros materialesTubos separadores de suero (SST)BD Biociencias367988
Otros materiales3M Empore™ Discos C183M

Referencias

  1. Ophir, Y., Rosenberg, H., Tikochinski, R., Dalyot, S., Lipshits-Braziler, Y. Screen time and autism spectrum disorder: A systematic review and meta-analysis. JAMA Netw Open. 6 (12), e2346775(2023).
  2. He, S., Zhou, F., Tian, G., Cui, Y., Yan, Y. Effect of anesthesia during pregnancy, delivery, and childhood on autism spectrum disorder: A systematic review and meta-analysis. J Autism Dev Disord. 54 (12), 4540-4554 (2024).
  3. Alkhonezan, S. M., Alkhonezan, M. M., Alshayea, Y., Bukhari, H., Almhizai, R. Factors influencing the lives of parents of children with autism spectrum disorder in saudi arabia: A comprehensive review. Cureus. 15 (11), e48325(2023).
  4. Larson, C., Thomas, H. R., Crutcher, J., Stevens, M. C., Eigsti, I. M. Language networks in autism spectrum disorder: A systematic review of connectivity-based fmri studies. Rev J Autism Dev Disord. 12 (1), 110-137 (2025).
  5. Kodak, T., Bergmann, S. Autism spectrum disorder: Characteristics, associated behaviors, and early intervention. Pediatr Clin North Am. 67 (3), 525-535 (2020).
  6. Zwaigenbaum, L., et al. Early intervention for children with autism spectrum disorder under 3 years of age: Recommendations for practice and research. Pediatrics. 136 (Suppl 1), S60-S81 (2015).
  7. Whitehouse, A. J. O., et al. Effect of preemptive intervention on developmental outcomes among infants showing early signs of autism: A randomized clinical trial of outcomes to diagnosis. JAMA Pediatr. 175 (11), e213298(2021).
  8. Ngounou Wetie, A. G., et al. A pilot proteomic analysis of salivary biomarkers in autism spectrum disorder. Autism Res. 8 (3), 338-350 (2015).
  9. Mota, F. S. B., et al. Potential protein markers in children with autistic spectrum disorder (asd) revealed by salivary proteomics. Int J Biol Macromol. 199, 243-251 (2022).
  10. Corbett, B. A., et al. A proteomic study of serum from children with autism showing differential expression of apolipoproteins and complement proteins. Mol Psychiatry. 12 (3), 292-306 (2007).
  11. Hu, E., et al. Data independent acquisition proteomics and machine learning reveals that proteins associated with immunity are potential molecular markers for early diagnosis of autism. Clin Chim Acta. 573, 120238(2025).
  12. Shen, L., et al. Biomarkers in autism spectrum disorders: Current progress. Clin Chim Acta. 502, 41-54 (2020).
  13. Yap, C. X., et al. Autism-related dietary preferences mediate autism-gut microbiome associations. Cell. 184 (24), 5916-5931.e17 (2021).
  14. Zhang, H., et al. The use of data independent acquisition based proteomic analysis and machine learning to reveal potential biomarkers for autism spectrum disorder. J Proteomics. 278, 104872(2023).
  15. Francis, K., et al. Brain-derived neurotrophic factor (bdnf) in children with asd and their parents: A 3-year follow-up. Acta Psychiatr Scand. 137 (5), 433-441 (2018).
  16. Bjorklund, G., et al. The impact of glutathione metabolism in autism spectrum disorder. Pharmacol Res. 166, 105437(2021).
  17. Bao, X. H., et al. Olink proteomics profiling platform reveals non-invasive inflammatory related protein biomarkers in autism spectrum disorder. Front Mol Neurosci. 16, 1185021(2023).
  18. Ngounou Wetie, A. G., et al. Comparative two-dimensional polyacrylamide gel electrophoresis of the salivary proteome of children with autism spectrum disorder. J Cell Mol Med. 19 (11), 2664-2678 (2015).
  19. Suganya, V., Geetha, A., Sujatha, S. Urine proteome analysis to evaluate protein biomarkers in children with autism. Clin Chim Acta. 450, 210-219 (2015).
  20. Shen, L., et al. Itraq-based proteomic analysis reveals protein profile in plasma from children with autism. Proteomics Clin Appl. 12 (3), e1700085(2018).
  21. Shen, L., et al. Proteomics study of peripheral blood mononuclear cells (pbmcs) in autistic children. Front Cell Neurosci. 13, 105(2019).
  22. Mesleh, A., et al. Blood proteomics analysis reveals potential biomarkers and convergent dysregulated pathways in autism spectrum disorder: A pilot study. Int J Mol Sci. 24 (8), 7443(2023).
  23. Yang, J., et al. Association between plasma proteome and childhood neurodevelopmental disorders: A two-sample mendelian randomization analysis. EBioMedicine. 78, 103948(2022).
  24. Wisniewski, J. R., Zougman, A., Nagaraj, N., Mann, M. Universal sample preparation method for proteome analysis. Nat Methods. 6 (5), 359-362 (2009).
  25. Wu, Y., et al. Quantitative proteomics analysis of serum and urine with dia mass spectrometry reveals biomarkers for pediatric obstructive sleep apnea. Arch Bronconeumol. 61 (2), 67-75 (2025).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Biomarcadores inmunol gicosproteoma s ricobiomarcadores proteicosexpresi n proteica diferencialenriquecimiento funcionalregresi n log stica