$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
NHANES方案已获得国家健康统计中心(NCHS)研究伦理审查委员会批准,并从所有参与者中获得了书面知情同意。这项工作是对去标识化公共使用数据的二次分析;因此,无需额外的机构伦理批准。所有作者都阅读并批准了最终稿件。
1. 研究设计与数据来源
本研究作为对NHANES的二次分析,NHANES是一系列横断面、具有全国代表性的调查,由美国疾病控制与预防中心(CDC)管理,NCHS研究伦理审查委员会监督。公共使用的NHANES数据集已完全去标识化,并用于二次分析。数据来自1999–2000、2001–2002、2003–2004和2005–2006年周期。
每个周期下载了公共的NHANES组成文件,包括(i)包含参与者标识符(SEQN)和调查设计变量的人口统计文件,(ii)包含子宫内膜异位症自我报告的生殖健康问卷文件,以及(iii)用于综合指数计算所需的实验室文件(C反应蛋白、甘油三酯和空腹血浆葡萄糖)。分析这些指标时,还获得了检查/人体测量数据(如身体质量指数)及对比指标所需的实验室指标(如中性粒细胞、淋巴细胞、血小板)。在每个两年周期内,组件文件通过SEQN合并,并检查合并后的数据集以确保每个SEQN只有一条记录。随后将循环级数据集附加,构建1999–2006年合并的分析文件。
分析样本限制在20至54岁的女性中。如果缺少子宫内膜异位症状态、缺少任何复合指标成分(如C反应蛋白、甘油三酯或空腹血浆葡萄糖),或在完整病例策略下缺少完全调整模型所需的必要协变量,则排除参与者。保留了复杂的调查设计变量(地层和初级抽样单元),以及用于包含空腹测量分析所需的空腹实验室子样本权重。当合并多个NHANES周期时,根据NHANES分析指导,通过将2年子样本权重除以合并周期数,生成多周期权重,并在所有分析中应用权重、分层和PSU变量。参与者纳入和排除步骤已在流程图中记录( 见图1)。
2. 子宫内膜异位症的定义
子宫内膜异位症的状态是通过生殖健康问卷题定义的:“你是否曾被医生或其他医疗专业人员告知你患有子宫内膜异位症?”回答“是”的参与者被归类为子宫内膜异位症病例,回答“否”的参与者被归类为对照组。由于该定义基于自我报告,而非腹腔镜或组织学确认,因此将潜在的误分类作为研究局限性进行了处理。
3. 综合指数(CTI)的定义
C反应蛋白-甘油三酯-葡萄糖复合指数作化,以联合反映全身炎症和代谢紊乱。从NHANES实验室文件中提取了C反应蛋白(mg/L)、甘油三酯(mg/dL)和空腹血糖(mg/dL)的实验室测量数据。甘油三酯-葡萄糖指数以[三酰甘油×空腹血浆葡萄糖/2]的自然对数计算。CTI的计算公式如下:CTI = 0.412 × ln(CRP) + TyG。CTI值越高,表示低度炎症和胰岛素抵抗的综合负担越高。
如果任何C反应蛋白值在日志转化前需要处理(例如检测限值或以下),则会在所有周期中一致应用一条预定规则,并有文档记录以支持可重复性(例如,将非正值替换为日志转化前观察到的最小正可测量值)。四分位数割点从完整分析样本的加权分布中确定,并在类别分析中一致应用,以四分位1为参考类别。
4. 协变量
根据流行病学推理和既有文献,预先设定了协变量以减少混杂因素。人口统计变量包括年龄、种族/族裔、教育水平和婚姻状况。生活方式变量包括吸烟史(≥100支烟,终生吸烟量<100支)和酒精消费(≥12杯/年,<12杯)。共病史包括自报的高血压、糖尿病、中风、冠心病和癌症。人体测量和实验室变量包括体重指数、血红蛋白、中性粒细胞计数、淋巴细胞计数和血小板计数;这些指标还支持在适用情况下计算对照炎症指标(如中性粒细胞与淋巴细胞比值、血小板与淋巴细胞比值、系统免疫炎症指数、系统炎症反应指数)。在选定周期中包含生殖变量(如重力和胎儿性)并根据NHANES文档进行编码。类别协变量在模型录入前已转换为指示变量。
由于C反应蛋白是复合指标的组成部分,为避免过度调整和共线性,C反应蛋白未作为独立共变量在多变量回归模型中录入。相反,C反应蛋白和甘油三酯-葡萄糖指数作为鉴别分析中的对照标记进行评估。
5. 统计分析
所有分析均考虑了NHANES复杂调查设计,以生成具有全国代表性的估计。调查设计通过将多周期子样本权重、层级和PSU变量与分析数据集关联来确定。连续变量被汇总为带标准差的加权均值,类别变量则以加权计数和百分比汇总。基线特征在病例与对照组之间进行了比较,采用适合NHANES的调查加权程序,基线特征汇总于 表1。
通过调查加权逻辑回归评估了复合指数与子宫内膜异位症之间的关联。拟合了三个顺序模型以展示调整:未调整模型、年龄和种族/族裔调整模型,以及包含人口因素、生活方式变量、共病史、人体测量/实验室协变量和生殖史变量的完全调整模型。复合指数进行了连续分析(每1单位增长)和类别分析(以四分位数为参考),回归估计汇总于 表2。 通过将每个四分位数赋予加权中位数并连续建模,测试了跨四分位数的线性趋势。
使用预定结位置的调查加权限制立方体样条评估非线性剂量-响应关系,样条曲线如 图2所示。通过比较分段和单斜坡规格的模型拟合,评估阈值效应,并通过比较分段和单斜坡规格的模型拟合度进行评估,并在 表3中报告了拐点两侧的估计拐点和斜坡参数。
进行了亚组分析,探讨预先指定因素(如年龄组、种族/族裔、教育水平、婚姻状况及特定生活方式因素)对效应的调整。通过在调查加权框架内加入连续综合指数和子组指标之间的交叉产物项来测试交互作用,亚组关联总结见 图3。
判别性表现通过基于基于调查加权逻辑模型的模型预测概率的受试者作特征分析进行评估。曲线下面积估计包括复合指数、常用炎症指标和成分标志物,AUC摘要见补充表1;补充图1提供了扩展的ROC比较。
缺失数据采用完整病例分析处理,排除缺失子宫内膜异位症状态、缺失综合指标成分或缺失完全调整模型所需关键协变量的参与者。在进行鲁棒性评估时,对在预设的补补模型下缺失的协变量应用多重补补,并将推断估计值与完整案例估计进行比较。
分析使用R(版本4.4.1)及材料表中列出的其他统计软件进行。用于调查推断、样条建模、分段回归和 ROC 估计的关键包被记录下来,并保留会话信息(作系统和 R 会话细节)以支持复制。
6. 过程终点与输出
一旦按照预设的纳入/排除标准构建了统一的多周期数据集(见图1),并根据文档规则生成了复合指数和协变量,并在同一调查设计规范下执行了预先指定的加权回归、非线性/阈值评估、亚组和辨别分析,分析工作流程即被视为完成。该工作流程的主要输出组织为基线摘要 (表1)、顺序调整模型的回归估计(表2)、阈值模型参数 (表3)、样条可视化(图2)、子组摘要可视化 (图3)和辨别总结(补充表1 和 补充图1)。
7. 内部独立验证
内部独立验证通过将合并数据集拆分为推导队列和基于NHANES周期的非重叠验证队列进行。1999–2000年和2001–2002年周期的参与者被分配到衍生队列,2003–2004年和2005–2006年周期的参与者被分配到验证队列。在每个队列中,采用相同的纳入/排除标准、复合指数计算、协变量编码规则和调查加权策略。
在推导队列中,采用完全调整后的规范拟合了调查加权逻辑回归模型。主分析中使用的非线性和阈值评估程序应用于推导队列,判别能力则基于模型预测概率使用ROC/AUC方法进行评估。同样的建模策略随后在验证队列中重复,未修改变量定义、编码规则或权重规格。推导与验证估计被总结为队列间关联估计的比较(图4)和推导与验证ROC曲线(图5),对应的数值总结见 表4。