需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

利用数据非依赖性采集蛋白质组学与机器学习鉴定自闭症谱系障碍中的免疫相关分子生物标志物

565 次观看

DOI:

10.3791/68949

2025年9月26日

* These authors contributed equally

本文内容

摘要

本文介绍了一种结合数据非依赖性采集质谱技术与机器学习的实验方案,通过该方案鉴定出八种与免疫相关的蛋白质,可作为自闭症谱系障碍早期诊断的准确生物标志物,并已通过酶联免疫吸附测定验证。

摘要

本研究提出了一种可重复的实验方案,用于通过数据非依赖性采集(DIA)质谱技术结合机器学习(ML)方法,鉴定与自闭症谱系障碍(ASD)相关的血清蛋白质生物标志物。DIA技术能够对血清蛋白质组(包括低丰度蛋白质)进行无偏倚、高分辨率的分析,同时确保样本间的可重复性。研究应用机器学习方法筛选具有诊断价值的蛋白质组合,并提升模型的稳健性。分析样本包括99名ASD患儿和70名年龄匹配的健康对照儿童的血清。通过去除高丰度蛋白质,采用标准化的酶解和分级处理方法制备肽段,并在高分辨率质谱仪上进行DIA分析。数据处理与定量分析鉴定出差异表达蛋白,并进一步开展功能富集分析。结果发现8种免疫相关蛋白是潜在生物标志物的有力候选。基于这些蛋白构建的逻辑回归模型在交叉验证中达到95.27%的准确率、0.9025的Kappa值以及1.000的AUC值。这些结果表明,基于DIA的蛋白质组学结合机器学习,可作为ASD生物标志物发现的可靠框架,并有望推广应用于更广泛的临床研究。

引言

自闭症谱系障碍(ASD)是一组病因和临床表现具有异质性的早发性神经发育障碍。其核心特征包括社会交流与互动的持续性缺陷,以及局限性、重复性的行为、兴趣或活动。在美国,8岁儿童中的患病率约为2.3%,成人中约为2.2%,凸显了其对公共卫生的重大影响1,2,3,4。风险因素多种多样,包括遗传易感性、免疫调节异常以及产前环境暴露5,6,7。早期诊断和干预可显著改善发育结局,因此识别客观且可靠的生物标志物已成为ASD研究的主要方向8,9,10。本实验方案基于我们先前发表的研究,该研究应用数据非依赖性采集(DIA)蛋白质组学结合机器学习,识别与免疫相关的蛋白质作为ASD早期诊断的潜在生物标志物11

尽管已付出大量努力,目前仍缺乏针对临床孤独症谱系障碍(ASD)诊断特异且经过普遍验证的生物标志物12。已提出的一些候选标志物——例如肠道微生物组的改变13、白细胞介素-6(IL-6)水平升高14、脑源性神经营养因子(BDNF)的变化15,以及谷胱甘肽等氧化应激标志物16——仍处于初步研究阶段,尚无法在临床应用中实现可重复性。蛋白质组学已成为识别疾病特异性分子特征的有前景方法,已有若干研究利用不同生物样本(血液、唾液、尿液、外周血单个核细胞)探索差异表达的蛋白质8,17,18,19,20,21,22。例如,Bao 等人证明,通过 Olink 蛋白质组学鉴定的炎症相关蛋白可能有助于早期 ASD 诊断(17);而其他研究则提示,尽管 ASD 具有遗传异质性,共享的蛋白质组学和代谢通路仍可能产生可靠的生物标志物23

数据非依赖采集(DIA)质谱技术因其全面且可重复的蛋白质组分析能力而受到越来越多的关注。与传统的数据依赖采集(DDA)方法——仅选择性地碎裂信号最强的离子——不同,DIA在预设的质荷比(m/z)窗口内对所有前体离子进行碎裂。这种方法可在大规模队列研究中实现更深度的蛋白质组覆盖和更高的可重复性,因而在临床比较研究中具有显著优势14。基准测试研究表明,DIA比DDA能够检测到更多可定量的肽段,尤其对于低丰度蛋白质,且具有更低的运行间变异14

在这些进展的基础上,我们对99名自闭症谱系障碍(ASD)儿童和70名对照儿童的血清样本进行了基于数据非依赖采集(DIA)的蛋白质组学分析,并在去除高丰度蛋白质后进行检测。我们的研究结果凸显了免疫相关蛋白质作为ASD早期诊断分子标志物的潜力,并表明当DIA蛋白质组学与严谨的方法学相结合时,在生物标志物发现中具有重要价值11

访问受限。请登录或开始试用以查看此内容。

方案

该方案遵循赫尔辛基宣言进行,并经长沙妇幼保健院机构审查委员会批准;已获得受试者的知情同意。

1. 使用DSM-5识别自闭症儿童

  1. 采集病史和背景信息
    1. 发育史
      1. 收集患者早期发育情况的信息,包括语言、社交和运动技能的发展过程。
      2. 记录任何发育迟缓或异常情况(例如语言发育迟缓、社交互动困难)。
    2. 家族史
      1. 询问家族中是否有自闭症或其他神经发育障碍的病史。
    3. 当前功能水平
      1. 评估患者在日常生活中的表现,包括学习、工作、社交互动以及独立生活能力。
  2. 使用 DSM-5 诊断标准
    1. 社会沟通和社会互动方面的持续性缺陷
      1. 确保以下三项标准中至少满足两项:
        1. 社会情感互动缺陷——观察是否存在正常的目光接触、面部表情或肢体语言缺乏,以及难以建立与年龄相符的友谊或人际关系。
        2. 非语言交流行为缺陷——观察是否存在使用手势、面部表情或语调表达情绪的困难,以及对他人非语言线索的理解有限。
        3. 建立、维持和理解人际关系方面的缺陷——观察是否存在适应不同社交情境的困难,对同龄人缺乏兴趣,或无法参与想象性游戏。
    2. 局限、重复的行为模式、兴趣或活动
      1. 确保以下四项标准中至少满足两项:
        1. 刻板或重复的运动动作(例如拍手、身体摇晃或重复使用物品)。
        2. 坚持同一性或仪式化的行为模式——观察对日常生活中微小变化是否表现出极度不安。
        3. 高度局限、固着的兴趣——观察是否存在对特定主题或活动异常强烈的专注。
        4. 对感觉输入的过度或低度反应——观察是否存在对声音、光线或触觉等感官刺激的非典型反应。
  3. 症状起始时间和严重程度评估
    1. 症状出现时间——确认症状在幼儿期即已存在(通常在3岁前),即使症状在后期才更加明显。
    2. 症状影响——确认这些症状在社交、职业或其他重要功能领域造成了显著损害。
    3. 严重程度分级
      注意:根据 DSM-5,自闭症谱系障碍(ASD)的严重程度分为三个等级(补充表 S1)。
      1. 若患者仅需轻度支持,则归为1级。
      2. 若患者需要大量支持(中等程度),则归为2级。
      3. 若患者需要极大量的支持(严重程度),则归为3级。
  4. 排除其他可能病因
    1. 医学检查:进行必要的医学评估(例如基因检测、脑部影像学检查),以排除可能导致类似症状的其他疾病(例如遗传综合征、听力障碍、智力障碍)。
    2. 共病评估:评估是否存在共病情况(例如注意缺陷多动障碍、焦虑障碍、抑郁症、癫痫等)。

2. DIA 质谱分析的样品制备

  1. 伦理合规与样本采集
    1. 获取3至7岁被诊断为自闭症谱系障碍(Autism Spectrum Disorder, ASD)儿童的父母或法定监护人的知情同意。
    2. 根据美国《精神障碍诊断与统计手册第五版》(DSM-5)中关于自闭症的诊断标准(步骤1.3.3),将患者分为严重程度1至3级。
    3. 采集参与者的血清样本。确保所有样本在血液采集后四小时内完成处理,以防止蛋白质降解。处理过程中样本需始终置于冰上。
  2. 高丰度蛋白质的去除
    1. 使用商用试剂盒,按照生产商说明书,从每份样本的60 µL血清中去除高丰度蛋白质。简要步骤如下:用结合缓冲液平衡去除柱,加载血清样本,并在重力流作用下使其通过柱体。收集穿流液,其中含有低丰度蛋白质组分。
    2. 采用BCA法测定总蛋白浓度。在溶液内消化前,将所有样本归一化至终浓度0.5–1.0 µg/µL。确保每份样本含有至少100 µg蛋白质,用于后续分析。
  3. 蛋白质消化
    注:蛋白质消化采用Wisniewski等人24描述的FASP方法进行。
    1. 在UA缓冲液(尿素缓冲液)中加入去垢剂、二硫苏糖醇(DTT)和碘乙酰胺(IAA),以封闭还原态的半胱氨酸。
    2. 以50:1的酶底比,在37 °C下过夜使用胰蛋白酶消化蛋白质悬液。
  4. 肽段脱盐、纯化及高pH反相分级
    1. 将肽段混合物在 °C条件下以16,000 × g离心15分钟,以去除不溶性杂质。
    2. 将上清液(含消化后的肽段)转移至新的低吸附微量离心管中,以最小化吸附损失。
    3. 通过使用100%甲醇(20 µL)预处理,再用含0.1%(v/v)三氟乙酸(TFA)的水溶液(缓冲液A;20 µL)平衡,制备C18微柱(自制填充C18树脂)。
    4. 将肽段样本加载至微柱上。用20 µL缓冲液A洗涤柱体,以去除盐类、去垢剂及非肽类污染物。
    5. 用含0.1% TFA的80%乙腈20 µL洗脱纯化的肽段。
    6. 使用离心真空浓缩仪在真空下干燥洗脱的肽段。将干燥后的肽段储存于-8 °C,待后续使用。
    7. 在进行LC-MS/MS分析前,用0.1%甲酸重新溶解干燥的肽段。
    8. 通过分光光度计在280 nm处测量吸光度(OD280)来定量肽段浓度,定量时需考虑色氨酸和酪氨酸残基的贡献,以实现准确测定。
      为对肽段混合物进行高pH反相HPLC分级,在HPLC系统上使用C18柱(3.5 µm,2.1 x 150 mm),流速为0.3 mL/min,流动相A为水中含10 mM甲酸铵,pH 10(用氢氧化铵调节pH),流动相B为90%乙腈中含10 mM甲酸铵,pH 10。进行梯度洗脱,约60分钟内每样本收集60个组分
    9. 每第三个组分合并,以减少冗余,每样本得到20个合并组分每个合并组分在真空下干燥,用于下游分析。
      注:所得肽段组分现已准备好进行纳米液相色谱-串联质谱(nano-LC-MS/MS)分析

3. 提交用于DIA质谱分析

  1. DIA 质谱分析
    1. 将HPRP组分中的数据依赖性采集(DDA)肽段与iRT标准肽段混合,使用纳米高效液相色谱系统上的反相高效液相色谱法(RP-HPLC)进行分离,色谱柱规格为75 µm × 150 mm,填料为2 µm C18颗粒(120 Å),流动相A为含0.1%甲酸的水溶液,流动相B为含0.1%甲酸的95%乙腈溶液,流速为300 nL/min。
    2. 使用缓冲液B进行60分钟的线性梯度洗脱,具体设置如下:0 - 2分钟,缓冲液B从2%线性梯度升至5%;2 - 42分钟,缓冲液B从5%线性梯度升至20%;42 - 50分钟,缓冲液B从20%线性梯度升至35%;50 - 52分钟,缓冲液B从35%线性梯度升至90%;52 - 60分钟,维持缓冲液B在90%。
    3. 在引用的质谱仪上分析洗脱的肽段。采用数据依赖的top20方法采集MS数据,从全扫描(350–1500 m/z)中动态选择最丰富的前体离子进行HCD碎裂。
    4. 运行仪器 肽识别模式 启用锁质量校正,以445.120025 Da作为内标进行质量校准。全扫描MS的分辨率设置为在m/z 200处70,000,MS/MS扫描的分辨率设置为在m/z 200处17,500。MS的最大注入时间设为50 ms,MS/MS设为30 ms,归一化碰撞能量设为28,隔离窗口设为1.6 Th,动态排斥时间设为30 s。
  2. 数据非依赖性采集(DIA)的液相色谱-串联质谱分析
    1. 将每个样品的肽段与iRT等量且分别进行加标。
    2. 在配备纳米液相色谱系统的四极杆质谱仪上进行液相色谱-串联质谱(LC-MS/MS)分析。液相色谱条件设置同上述DDA方法。进行m/z 400至1,200范围的全扫描,分辨率设为60,000,自动增益控制(AGC)目标值为3E6,注入时间设为30 ms。以分辨率15,000采集DIA MS/MS扫描,隔离窗口为20 m/z,AGC目标值为1E6,注入时间设为50 ms。归一化碰撞能量设为30。
    3. 分别以轮廓模式和质心模式记录全扫描质谱和DIA扫描的谱图。
  3. 序列数据库搜索
    1. 使用 DIA 软件分析 DDA MS 数据2.
    2. 在UniProtKB人类数据库(共186,532条条目,2019年10月下载)中搜索质谱数据,该数据库添加了包含11种iRT肽段序列的蛋白质。
    3. 选择胰蛋白酶作为消化酶。在数据库搜索中设定最大漏切位点为两个,前体离子质量容差为4.5 ppm,碎片离子质量容差为20 ppm。设定半胱氨酸的羧氨甲基化为固定修饰,蛋白质的乙酰化为可变修饰。 N-末端及甲硫氨酸氧化作为数据库搜索中的可变修饰。
    4. 筛选数据库搜索结果并导出 <肽谱匹配和蛋白质水平的错误发现率(FDR)均为1%。
  4. 执行原始数据处理
    1. 使用DIA软件[34, 35]分析DIA MS数据,以从搜索结果中生成谱图库。搜索时采用默认参数设置,并使用动态iRT进行保留时间预测。确保启用MS/MS扫描的干扰校正功能。
    2. 导出结果 <肽段水平上1%错误发现率(FDR)。

4. 差异蛋白分析

  1. 使用 Student's t-检验结合倍数变化(FC)在 http://www.omickits.com/open/tooldetail?id=70 进行假设检验。
    1. 登录云平台,进入 假设检验分析 工具。上传预处理后的蛋白质定量数据文件(例如 CSV 或 TXT 格式)。
    2. 在参数设置中,选择 Student's t-检验作为统计方法,并设定显著性阈值为 p 值 < 0.05。将倍数变化阈值定义为 FC > 1.5 或 FC < 1/1.5。点击 运行分析,等待结果生成。
    3. 下载包含每个蛋白质的 p 值、log2(FC) 及显著性状态的结果文件。
      注:该双标准方法兼顾统计显著性与生物学相关性,确保稳健地鉴定差异表达蛋白(DEPs)。

5. 信号通路分析

  1. 火山图可视化
    1. 访问以下网址的工具:http://www.omickits.com/open/tooldetail?id=63,然后进入 火山图工具 页面。
      1. 上传第4节中的DEP分析结果文件。
      2. 配置可视化参数:X轴:log2(倍数变化) — 表示变化方向;Y轴:-log10(p值) — 反映统计显著性;颜色编码:红色:显著上调的蛋白质(p   < 0.05 且 FC > 1.5);蓝色:显著下调的蛋白质(p < 0.05 且 FC < 0.667);灰色:无显著差异的蛋白质(p ≥ 0.05 或 1/1.5 ≤ FC ≤ 1.5)。
      3. 点击 生成图像,并下载高分辨率图像(PDF/SVG格式)用于发表。
  2. 层次聚类热图
    1. 访问以下网址的工具: http://www.omickits.com/open/tooldetail?id=17 
      1. 进入 聚类热图 工具。
      2. 上传经过筛选的DEP表达矩阵。
      3. 设置以下参数:标准化方法:按行进行Z-score标准化,以消除量纲差异;距离度量:欧氏距离;聚类方法:完全连接层次聚类;可选:根据样本分组情况启用列和/或行聚类。
      4. 点击 运行 生成热图。
      5. 下载并保存为可用于发表的图像。
        注:热图可直观展示不同样本间蛋白质表达模式的相似性与差异性。
  3. GO功能注释与富集分析
    1. 安装并加载所需的R软件包:
      library(clusterProfiler)
      library(org.Hs.eg.db)

      library(ggplot2)
    2. 将蛋白质ID(例如Uniprot或基因符号)转换为Entrez ID:
      entrez_ids <- bitr(diff_proteins, fromType = "UNIPROT", toType = "ENTREZID", OrgDb = org.Hs.eg.db)
    3. 进行GO富集分析:
      go_enrich <- enrichGO(gene = entrez_ids$ENTREZID, OrgDb = org.Hs.eg.db, keyType = "ENTREZID", ont = "BP")
    4. 使用点图可视化结果:
      1. dotplot(go_enrich, showCategory = 20)
        公式:
        富集因子 = (a/b) / (c/d)
        其中:
        a = 注释到该术语的DEP数量;
        b = DEP总数;
        c = 背景蛋白中注释到该术语的数量;
        d = 背景蛋白总数。
  4. KEGG通路注释与富集分析
    1. 进行KEGG富集分析:
      kegg_enrich <- enrichKEGG(gene = entrez_ids$ENTREZID, organism = "hsa")
    2. 可视化KEGG通路结果:
      barplot(kegg_enrich, showCategory = 20)
    3. 使用ggplot2自定义图表以符合发表格式要求。

6. 使用 ROC 曲线分析对蛋白质进行初步筛选

  1. 数据准备:加载蛋白质组学数据集,其中包含从自闭症谱系障碍(ASD)组和对照组中鉴定出的所有差异表达蛋白(DEPs)。确保数据集包含两组的蛋白表达值,并有明确标签标明ASD样本和对照样本。
  2. 进行ROC曲线分析。
    1. 使用R语言中的pROC包对每个蛋白进行受试者工作特征(ROC)曲线分析。
    2. 通过计算曲线下面积(AUC)评估每个蛋白区分ASD组与对照组的能力。
      AUC = 0.5:无区分能力(相当于随机判断)。
      0.7 ≤ AUC < 0.8:可接受的区分能力。
      0.8 ≤ AUC < 0.9:优良的区分能力。
      AUC ≥ 0.9:卓越的区分能力。
      注:AUC表示从ASD组中随机选择一个个体其蛋白水平高于从对照组中随机选择一个个体的概率。AUC越高,诊断性能越好;在生物标志物研究中,通常认为AUC大于0.8具有临床意义。
    3. 记录所有蛋白的AUC值。
  3. 筛选候选生物标志物。
    1. 将AUC大于0.7的蛋白确定为候选生物标志物。
    2. 导出候选生物标志物列表以供进一步分析。
  4. 结果可视化。
    1. 使用R语言中的ggplot2包绘制表现最佳蛋白的ROC曲线图。
    2. 在图例中包含AUC值以提高可读性。

7. 使用随机森林进行二次筛选

  1. 准备输入数据。
    1. 将ROC分析获得的候选生物标志物列表作为输入,用于随机森林分析。
    2. 确保数据集格式正确,其中行代表样本,列代表蛋白质表达值。
  2. 训练随机森林模型。
    1. 使用 R 语言中的 randomForest 包应用随机森林算法。
    2. 将树的数量(ntree)设为500,每个分割处随机采样的变量数(mtry)设为特征总数的平方根。
    3. 使用平均减少准确率(MeanDecreaseAccuracy)指标评估特征重要性,该指标通过测量移除特定特征后模型准确率的下降程度来评估特征的重要性。
    4. 使用 R 语言中的 randomForest 包训练随机森林模型:
      R. library(randomForest)
      # 示例:利用蛋白质水平预测分组(例如,自闭症谱系障碍 vs. 对照组)

      rf_model <- randomForest(x = protein_data,
      y = as.factor(组别),
      importance = TRUE, # 需要计算特征重要性
      ntree = 500) # 决策树数量
    5. 提取特征重要性指标 使用 importance() 函数:
      R. 重要性评分 <- 重要性(rf_model)
    6. 获取 MeanDecreaseAccuracy 值并按降序排列:
      R. 平均决策准确率 <- 重要性评分[ , "平均减少准确率"]
      重要性排序 <- 按均值解码准确率降序排列
    7. 使用内置的 varImpPlot() 函数可视化特征重要性:
      R. varImpPlot(rf_model, main = "特征重要性(准确率平均下降值)")
      注意: 平均下降准确率 该指标反映了每个特征对模型预测性能的重要性。移除后若准确率显著下降,则表明该特征重要性较高。此方法在生物标志物发现中尤为有用,有助于优先筛选出在不同组别间具有最强区分能力的蛋白质或基因。
    8. 导出重要性评分以用于报告或下游分析:
      R. 重要性表 <- 数据框(
      特征 = 按重要性排序的名称
      MeanDecreaseAccuracy = 重要性排序
      )
      write.csv(importance_table, "feature_importance.csv", 行名 = FALSE)
    9. 根据蛋白质的平均减少准确率(MeanDecreaseAccuracy)得分进行排序。
    10. 选择平均减少准确率(MeanDecreaseAccuracy)得分最高的前15种蛋白质作为后续建模的最重要特征。
    11. 导出这些蛋白质列表以进行进一步验证。
      注意:若移除平均准确度下降值(MeanDecreaseAccuracy)较低的蛋白质,可能对模型性能影响甚微。
    12. 强调所选蛋白质的生物学相关性,特别是与免疫功能或自闭症谱系障碍(ASD)相关通路有关的蛋白质。

8. 汇总结果以确定最终生物标志物。

注意:确保已安装包含以下软件包的 R:pROC、randomForest 和 ggplot2。在分析前,确保蛋白质组学数据集已完成预处理和标准化。将候选生物标志物列表和可视化图谱分别保存为独立文件以供参考。

  1. 整合研究结果。
    1. 交叉比对ROC分析和随机森林筛选的结果,识别重叠的蛋白质。
    2. 优先选择在两项分析中均出现的蛋白质,作为高可信度的候选生物标志物。
    3. 进行额外的验证步骤,例如留一法交叉验证(LOOCV),以确认所选生物标志物的稳健性。
    4. 使用逻辑回归模型评估联合生物标志物组合的预测准确性。
    5. 利用ggplot2软件包为最终确定的生物标志物组合绘制ROC曲线和精确率-召回率图。
    6. 纳入AUC值和精确率-召回率等指标,以展示所选生物标志物的诊断潜力。

9. 双向特征选择

  1. 准备数据并定义模型。
    1. 加载包含蛋白质表达值及相应标签的数据集(例如,自闭症谱系障碍 vs. 对照组)。确保数据集已进行预处理和标准化。
    2. 定义初始模型:使用广义线性模型(GLM),并选择二项分布族进行分类。
    3. 使用AIC作为评估指标,在特征选择过程中比较不同模型。
  2. 执行前向特征选择。
    1. 从仅包含截距项的空模型开始。
    2. 每次添加一个使AIC下降最多的特征。
    3. 记录每次添加后的AIC值。当AIC不再进一步降低时停止。
  3. 执行后向特征选择。
    1. 使用所有可用特征训练一个模型。
    2. 每次移除一个导致AIC增加最小的特征。
    3. 记录每次移除后的AIC值。当AIC不再进一步降低时停止。
    4. 结合前向和后向步骤。
  4. 交替进行前向和后向选择。
    1. 先进行一轮前向特征选择,紧接着进行一轮后向特征选择。重复此过程,直到AIC不再有进一步改善。
    2. 替代方法:先进行后向特征选择,再进行前向特征选择。评估将先前移除的特征重新加入模型的影响。
  5. 确定最终选定的特征。
    1. 导出最终选定的特征列表及其对应的系数(补充图S1)。

10. 使用留一法进行逻辑回归双向特征选择的交叉验证

注意:确保已安装 R,并包含以下软件包:caret、pROC 和 ggplot2。蛋白质组学数据集应在分析前完成预处理和标准化。将混淆矩阵、ROC 曲线和模型摘要分别保存为独立文件以供参考。

  1. 准备数据并定义模型。
    1. 从 GLMSTEP/bothFitModel.txt 文件中加载包含蛋白质表达值及相应标签(例如,自闭症谱系障碍 vs. 对照组)的数据集。确保数据集已进行预处理和标准化。
    2. 使用广义线性模型(GLM),并选择二项分布族进行分类,以定义初始模型。
    3. 采用准确率和 Kappa 系数作为评估指标,在交叉验证过程中评估模型性能。
  2. 执行留一交叉验证(LOOCV)。
    1. 使用 R 语言中的 caret 包初始化交叉验证,以实现留一交叉验证(LOOCV)。
    2. 使用所选的八个特征拟合逻辑回归模型。
    3. 记录每次交叉验证迭代中的准确率和 Kappa 系数。
  3. 分析交叉验证结果。
    1. 汇总结果。
      注:本研究中,LOOCV 过程的结果如下:广义线性模型,169 个样本,8 个预测变量,2 个类别:'A'、'B',重采样方法:留一交叉验证,样本量汇总:168, 168, 168, 168, 168, 168, ...,重采样结果:准确率 Kappa 0.9526627 0.9024531。
    2. 解释评估指标。
      注:此处,模型的准确率为 0.9527,Kappa 系数为 0.9025,表明预测结果与实际观察结果之间具有极好的一致性。
      1. 通过 Kappa 系数评估模型的预测能力。Kappa 系数取值范围为 -1 至 1,其中 0 表示随机预测,1 表示完全一致。
        注:在本研究中,Kappa 值为 0.9025,反映出模型具有很强的预测能力。
  4. 评估模型系数。
    1. 检查逻辑回归模型的系数,以了解每个特征的贡献。评估零偏差、残差偏差和 AIC,以确认模型的拟合优度。
      注:例如,在本研究中,我们得到的结果为:零偏差:2.2928e+02(自由度为 168),残差偏差:2.2378e-07(自由度为 160),AIC:18,Fisher 评分迭代次数:25。
  5. 可视化结果。
    1. 构建混淆矩阵,以直观展示模型的预测性能。
    2. 绘制受试者工作特征(ROC)曲线,以评估模型的分类性能。
    3. 解释结果。计算曲线下面积(AUC),以获得模型的分类性能指标。
      ​注:ROC 曲线展示了真正率与假正率之间的权衡关系。曲线下面积(AUC)应接近 1,表示分类性能优异。ROC 曲线反映了模型在不同阈值下真正率和假正率的变化情况。AUC 值越大,模型性能越好。

访问受限。请登录或开始试用以查看此内容。

结果

本研究纳入了99名自闭症谱系障碍(ASD)儿童和70名年龄匹配的对照组儿童(3-7岁),性别分布均衡(补充表 S2)。血清采集采用标准化方案:受试者经隔夜空腹后抽取血液至血清分离管中,在室温下静置凝固30分钟,随后于4 °C条件下以1,500 × g离心10分钟。取上清液分装后储存于−80 °C,待进一步处理。为提高检测灵敏度,去除了高丰度蛋白(如白蛋白、IgG、结合珠蛋白)。采用BCA法测定蛋白浓度,并在消化前将样品浓度标准化至0.5-1.0 µg/µL。随后进行胰蛋白酶/LysC消化,使用C18柱对肽段进行脱盐处理,并冻干24

进行LC-MS/MS分析时,每个样品注入约2 µg的肽段,上样至与纳米液相色谱系统联用的质谱仪。肽段使用纳米液相色谱系统在0.1%甲酸溶液中以300 nL/min的流速,采用5%至30%乙腈的60分钟梯度进行分离。全扫描质谱...

访问受限。请登录或开始试用以查看此内容。

讨论

本论文所述方案概述了一种利用数据非依赖性采集(DIA)质谱技术与机器学习方法,在自闭症谱系障碍(ASD)中识别免疫相关分子生物标志物的综合策略。方案中的关键步骤可确保结果的可靠性与可重复性,同时指出了可能需要进行修改或故障排除的环节(表2)。

该方案中的一个关键步骤是血清样本的采集与处理。血清可通过离心或使用促凝管获取。血液样本必须在采集后4小时内完成处理,以防止蛋白质降解,否则可能影响后续分析。处理过程应在冰上进行,以维持蛋白质的完整性。延迟处理可能导致低丰度蛋白质的丢失,而这些蛋白质在生物标志物发现中往往最具信息价值。若处理延迟,应立即添加蛋白酶抑制剂,或将样本短期保存于4 °C;但应避免在室温下长期储存8,9,10

该方案的另一个关键环节是去除高丰度蛋白。白蛋白和免疫球蛋白可能掩盖低丰度蛋白的检测,而...

访问受限。请登录或开始试用以查看此内容。

披露

作者声明无利益冲突。

致谢

感谢中心实验室的所有成员以及在本项目中提供帮助的各位。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
试剂和化学品乙腈(HPLC级)Fisher ScientificA18-50
试剂和化学品碳酸氢铵(NH?HCO?)Sigma-Aldrich38939
试剂和化学品甲酸铵Sigma-Aldrich90265
试剂和化学品牛血清白蛋白(BSA)Thermo Fisher Scientific23212
试剂和化学品二硫苏糖醇(DTT)Sigma-Aldrich43815
试剂和化学品甲酸(0.1%)Thermo Fisher Scientific28905
试剂和化学品碘乙酰胺(IAA)Sigma-AldrichI1149
试剂和化学品甲醇(HPLC级)Fisher ScientificA452-4
试剂和化学品三氟乙酸(TFA)Sigma-AldrichT6508
试剂和化学品尿素Sigma-AldrichU5378
试剂盒和专用试剂BCA蛋白检测试剂盒Thermo Fisher Scientific23227
试剂盒和专用试剂C18 Sep-Pak小柱WatersWAT023590
试剂盒和专用试剂C18 StageTips(自制)3M Empore™
试剂盒和专用试剂高丰度蛋白去除试剂盒Millipore Sigma122642
试剂盒和专用试剂iRT标准肽Biognosys AG
试剂盒和专用试剂溶菌酶ELISA试剂盒武汉菲恩生物科技有限公司 有限公司
试剂盒和专用试剂胰蛋白酶/LysC酶混合液PromegaV5071
设备离心机Eppendorf5430R
设备Easy-nLC 1200系统Thermo Fisher Scientific
设备Nanodrop One分光光度计Thermo Fisher ScientificND-ONE-W
设备Q Exactive HF-X质谱仪Thermo Fisher Scientific
设备SpeedVac浓缩仪Thermo Fisher ScientificSPD131DDA
设备水平转子离心机Various
设备Waters XBridge BEH130色谱柱WatersC18, 3.5 μm, 2.1×150 mm
设备Agilent 1260 HPLC系统Agilent1260 Infinity II
软件和在线工具Bioconductor(R软件包)bioconductor.org
软件和在线工具caret(R软件包)CRANcaret_6.0-93
软件和在线工具clusterProfiler(R软件包)Bioconductor4.0.5
软件和在线工具DIA-NNDIA-NN软件v1.8
软件和在线工具ggplot2(R软件包)CRAN3.4.0
软件和在线工具MaxQuant马克斯·普朗克研究所1.6.17
软件和在线工具omickits.comOmiKits云平台http://www.omickits.com
软件和在线工具pROC(R软件包)CRAN1.18.0
软件和在线工具randomForest(R软件包)CRAN4.7-1.1
软件和在线工具Spectronaut Pulsar XBiognosys AG17
软件和在线工具UniProtKB人数据库uniprot.orgRelease 2019_10
其他材料低吸附微量离心管Eppendorf30120094
其他材料血清分离管(SST)BD Biosciences367988
其他材料3M Empore™ C18圆盘3M

参考文献

  1. Ophir, Y., Rosenberg, H., Tikochinski, R., Dalyot, S., Lipshits-Braziler, Y. Screen time and autism spectrum disorder: A systematic review and meta-analysis. JAMA Netw Open. 6 (12), e2346775(2023).
  2. He, S., Zhou, F., Tian, G., Cui, Y., Yan, Y. Effect of anesthesia during pregnancy, delivery, and childhood on autism spectrum disorder: A systematic review and meta-analysis. J Autism Dev Disord. 54 (12), 4540-4554 (2024).
  3. Alkhonezan, S. M., Alkhonezan, M. M., Alshayea, Y., Bukhari, H., Almhizai, R. Factors influencing the lives of parents of children with autism spectrum disorder in saudi arabia: A comprehensive review. Cureus. 15 (11), e48325(2023).
  4. Larson, C., Thomas, H. R., Crutcher, J., Stevens, M. C., Eigsti, I. M. Language networks in autism spectrum disorder: A systematic review of connectivity-based fmri studies. Rev J Autism Dev Disord. 12 (1), 110-137 (2025).
  5. Kodak, T., Bergmann, S. Autism spectrum disorder: Characteristics, associated behaviors, and early intervention. Pediatr Clin North Am. 67 (3), 525-535 (2020).
  6. Zwaigenbaum, L., et al. Early intervention for children with autism spectrum disorder under 3 years of age: Recommendations for practice and research. Pediatrics. 136 (Suppl 1), S60-S81 (2015).
  7. Whitehouse, A. J. O., et al. Effect of preemptive intervention on developmental outcomes among infants showing early signs of autism: A randomized clinical trial of outcomes to diagnosis. JAMA Pediatr. 175 (11), e213298(2021).
  8. Ngounou Wetie, A. G., et al. A pilot proteomic analysis of salivary biomarkers in autism spectrum disorder. Autism Res. 8 (3), 338-350 (2015).
  9. Mota, F. S. B., et al. Potential protein markers in children with autistic spectrum disorder (asd) revealed by salivary proteomics. Int J Biol Macromol. 199, 243-251 (2022).
  10. Corbett, B. A., et al. A proteomic study of serum from children with autism showing differential expression of apolipoproteins and complement proteins. Mol Psychiatry. 12 (3), 292-306 (2007).
  11. Hu, E., et al. Data independent acquisition proteomics and machine learning reveals that proteins associated with immunity are potential molecular markers for early diagnosis of autism. Clin Chim Acta. 573, 120238(2025).
  12. Shen, L., et al. Biomarkers in autism spectrum disorders: Current progress. Clin Chim Acta. 502, 41-54 (2020).
  13. Yap, C. X., et al. Autism-related dietary preferences mediate autism-gut microbiome associations. Cell. 184 (24), 5916-5931.e17 (2021).
  14. Zhang, H., et al. The use of data independent acquisition based proteomic analysis and machine learning to reveal potential biomarkers for autism spectrum disorder. J Proteomics. 278, 104872(2023).
  15. Francis, K., et al. Brain-derived neurotrophic factor (bdnf) in children with asd and their parents: A 3-year follow-up. Acta Psychiatr Scand. 137 (5), 433-441 (2018).
  16. Bjorklund, G., et al. The impact of glutathione metabolism in autism spectrum disorder. Pharmacol Res. 166, 105437(2021).
  17. Bao, X. H., et al. Olink proteomics profiling platform reveals non-invasive inflammatory related protein biomarkers in autism spectrum disorder. Front Mol Neurosci. 16, 1185021(2023).
  18. Ngounou Wetie, A. G., et al. Comparative two-dimensional polyacrylamide gel electrophoresis of the salivary proteome of children with autism spectrum disorder. J Cell Mol Med. 19 (11), 2664-2678 (2015).
  19. Suganya, V., Geetha, A., Sujatha, S. Urine proteome analysis to evaluate protein biomarkers in children with autism. Clin Chim Acta. 450, 210-219 (2015).
  20. Shen, L., et al. Itraq-based proteomic analysis reveals protein profile in plasma from children with autism. Proteomics Clin Appl. 12 (3), e1700085(2018).
  21. Shen, L., et al. Proteomics study of peripheral blood mononuclear cells (pbmcs) in autistic children. Front Cell Neurosci. 13, 105(2019).
  22. Mesleh, A., et al. Blood proteomics analysis reveals potential biomarkers and convergent dysregulated pathways in autism spectrum disorder: A pilot study. Int J Mol Sci. 24 (8), 7443(2023).
  23. Yang, J., et al. Association between plasma proteome and childhood neurodevelopmental disorders: A two-sample mendelian randomization analysis. EBioMedicine. 78, 103948(2022).
  24. Wisniewski, J. R., Zougman, A., Nagaraj, N., Mann, M. Universal sample preparation method for proteome analysis. Nat Methods. 6 (5), 359-362 (2009).
  25. Wu, Y., et al. Quantitative proteomics analysis of serum and urine with dia mass spectrometry reveals biomarkers for pediatric obstructive sleep apnea. Arch Bronconeumol. 61 (2), 67-75 (2025).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签