该协议描述了一个用于心脏病预测的机器学习框架,结合了生成对抗网络的数据增强、基于统计和元启发式的特征选择以及可解释的人工智能。
方法文章
该协议描述了一个用于心脏病预测的机器学习框架,结合了生成对抗网络的数据增强、基于统计和元启发式的特征选择以及可解释的人工智能。
心脏病是全球主要的死亡原因之一,因此其早期预测成为重要的临床和计算难题。多项研究分别解决了数据稀缺性、特征选择和模型可解释性等挑战,但提出以协同方式解决这些挑战的综合框架的研究较少。本文提出了一个全面的预测框架,利用:(1)生成对抗网络(GAN)来应对阶级不平衡和数据稀缺;(2)一种混合特征选择方法,结合了通过韦尔奇 t检验和科恩d效应大小进行统计预滤波,以及通过哈里斯霍克优化进行元启发式优化;以及(3)各种可解释的人工智能方法,包括SHAP、部分依赖图和比值比。该框架在克利夫兰和Statlog数据集上进行了评估,结果与选定基线和现有方法相比,取得了较强的准确性、F1分数和ROC-AUC值。该模型提供了一个稳健且可解释的心脏病预测计算框架,将机器学习性能与临床可解释性相结合。
心血管疾病是全球发病和死亡率的主要原因之一,估计每年造成1790万人死亡1。心脏病的早期和准确预测对于及时干预和改善患者预后至关重要。在此背景下,使用机器学习(ML)算法进行心脏病预测面临三大挑战:高质量医学数据的有限、包含冗余或无关变量的高维特征空间,以及复杂模型的黑箱特性,这可能阻碍临床信任和采纳2.近期研究将机器学习与可解释人工智能(XAI)方法结合用于心脏病预测3。许多研究者也利用机器学习进行心脏病的预测和检测。生成式人工智能的最新发展,尤其是生成式对抗网络(GAN),在医疗领域的数据增强充满希望。同时,元启发式算法如哈里斯鹰优化(HHO)和粒子群优化(PSO)已被证明在特征选择和模型优化方面非常有效。XAI技术,如SHAP和偏依赖图(PDP),也已成为解释复杂模型预测的重要工具。已有许多关于机器学习模型用于心血管风险预测的研究。
然而,现有文献往往单独讨论这些问题。一些研究侧重于利用GANs 9进行数据增强,另一些则专注于使用元启发式算法10 或基于XAI方法11的模型可解释性进行特征选择。基于SMOTE的增强技术已被探索用于心力衰竭生存预测12。基于KNN的心脏病诊断也报告了13例。这些独立的方法未能充分发挥通过综合框架共同解决数据稀缺性、特征选择、模型训练和可解释性所能实现的综合效益。
近期研究探讨了相关方法。2026年《医学前沿》杂志上的一项研究提出了带有填充插值和中位数补值的PSO优化异构分类器用于心脏病诊断,在合并数据集上实现了91.3%的准确率14。其他近期工作包括将元启发式优化应用于医学图像分割15,XAI用于卒中预测16,混合优化用于心律失常分类17,以及SHAP增强的临床决策支持系统18。然而,很少有研究将生成增强、双准则统计特征选择与HHO优化以及多方法XAI结合在单一集成框架中。
本文旨在通过提出一个系统整合数据增强、混合特征选择、模型优化与训练以及可解释性分析的心脏病预测框架来弥补这一空白。在数据增强阶段,GAN用于综合基于患者特征(如年龄、血压、胆固醇水平和心电图测量)的表格临床数据。虽然GAN广泛用于医学图像生成,本研究将其应用于克利夫兰心脏病数据集,该数据集包含13个数值和类别特征,以解决样本量有限(n=303)和类别不平衡的问题。在混合特征选择阶段,韦尔奇t检验和科恩d效应量与HHO结合,识别统计稳健且临床相关的特征子集。在模型优化和训练阶段,PSO用于优化人工神经网络的权重,而逻辑回归和随机森林模型则因其性能与解释性之间的平衡而进行训练。在可解释阶段,采用了包括SHAP、PDP和比值比在内的互补XAI技术,以提供全局和局部模型的解释。
所提框架的整体工作流程如 图1所示。 表1 总结了拟议方法与现有特征选择方法之间的主要区别[见表1]。

图1:拟议心脏病预测框架概述。 该工作流程包括四个主要阶段:(1)利用GAN进行数据预处理和增强以应对数据稀缺性;(2)结合统计过滤(韦尔奇 t检验与科恩d)和哈里斯鹰优化的混合特征选择;(3)使用可解释的分类器进行模型训练,包括逻辑回归和随机森林,以及PSO优化的人工神经网络;以及(4)使用SHAP、偏依赖图和比值比进行可解释性分析。缩写:GANs = 生成对抗网络;PSO = 粒子群体优化;ANN = 人工神经网络。 请点击此处查看该图的放大版本。
| 进路类别 | 统计检验(例如t检验) | 效应量(例如,Cohen的d) | 元启发式优化(例如,HHO/PSO) | 可解释性焦点 |
| 传统统计 | 是的 | 很少 | 不 | 中等 |
| 纯粹优化 | 不 | 不 | 是的 | 低 |
| 现有混合方法 | 有时候 | 很少 | 是的 | 变量 |
| 拟议框架 | 是的(韦尔奇t检验) | 是的(科恩的 D 0.5 ≥) | 是的(HHO) | 高(XAI积分) |
表1:心脏病预测中特征选择方法的比较。 比较的方法包括传统统计、纯优化、现有混合方法以及提出的框架,涵盖统计检验、效应量、元启发式优化和可解释性关注。
本研究的主要贡献如下。首先,为了解决数据稀缺性和类不平衡,实现了带有二元交叉熵损失和亚当优化的标准GAN,并在无法使用张量流时使用高斯微扰缓冲。其次,为了解决特征冗余问题,提出了一种混合特征选择策略,结合统计预滤波与使用V形传递函数的HHO。这种双重标准方法旨在选择既统计显著又临床相关的特征。第三,为解决模型不透明度,集成了多方法可解释性套件,包括SHAP蜂群图和瀑布图、PDP以及95%置信区间的比值比。为临床用户提供了一个简单的调和协议:如果PDP显示非线性趋势,应优先考虑SHAP解释,而非逻辑回归系数。第四,为了支持可重复性和结构化验证,该框架包含分层交叉验证、公平性审计、消融研究、MIMIC-III的外部验证协议以及关键超参数的文档。
访问受限。请登录或开始试用以查看此内容。
伦理声明、数据集、软件与数据准备
本研究的发现基于UCI机器学习存储库的心脏病数据集。由于这是一个公开可访问且匿名化的资源,其使用无需伦理委员会批准。作者还核实了该手稿的原创性,确认此前未曾发表或提交至其他期刊。
克利夫兰心脏病数据集分为训练组和测试集,分别为80/20。该数据集通常包含303个实例;因此,大约使用了242个样本进行训练,61个样本作为清洁测试集保留。GAN或高斯回归方法生成的合成样本仅被添加到训练数据中,以降低数据泄漏风险。最终的增强训练集约包含242个真实样本和1000个合成样本,共计1242个训练样本。没有使用固定的静态验证集。相反,在模型训练过程中采用分层交叉验证,每个折叠将增强后的训练数据拆分为训练和验证子集。
数据集被加载到Pandas DataFrame中并检查缺失值。带有缺失值的数值特征通过 scikit-learn 的 SimpleImputer 类的中位数补补处理,使用 strategy = 'medin'。带有缺失值的类别特征通过SimpleImputer的模式补补处理,策略='most_frequent'。缺失机制通过使用 df.isnull().sum() / len(df) 计算每个特征的缺失百分比来记录。通过比较有缺失数据样本中其他特征的平均值,使用t 检验表示数值特征,卡方检验用于类别特征,评估了非随机缺失模式。失踪随后被记录为“随机完全缺失”(MCAR)、随机缺失(MAR)或“非随机缺失”(MNAR),如适用。
对于缺失较大的数据集,建议通过比较中位数/模式补补与链式多重补补(MICE)进行敏感性分析,使用花式补补。迭代补断,max_iter = 10,并使用花式插补 KNN 补补。KNN,k = 5。准确率差小于0.03被视为补补方法12的鲁棒性。由于缺失性有限,该敏感性分析在克利夫兰数据集中被视为可选,但建议用于缺失值超过5%的其他临床数据集。通过生成缺失矩阵热图,使用缺失函数库(msno.matrix(df))对缺失模式进行了可视化。通过缺失模式的聚类来判断缺失值是否系统性共存,这可能表明MNAR机制需要临床专家的参与。
数值特征通过z分数归一化进行了标准化。scikit-learn的StandardScaler被拟合到训练数据上,然后应用于训练和测试集。类别变量采用单热编码编码。胸痛类型(cp)包含四个类别,通过pandas.get_dummies转换为四个二元指标栏。地中海贫血(thal)包含三类,被转换为三个二元指示列。由于GAN生成器和判别器在单热编码前使用了与原始数据集对应的13个特征的固定输入/输出维度,合成样本在原始13特征空间中生成,然后通过与真实数据相同的一热编码流水线。这既保持了与GAN架构的兼容性,又允许使用编码特征进行模型训练。
数学定义与质量指标
弗雷歇特距离用于比较真实和合成特征分布。两个分布 F 和 G 之间的弗雷歇距离 Fr(F, G) 定义如下:
Fr2(F,G)=minX,YE|X-Y|2 (1)
其中 E 表示期望值,最小化适用于所有分布分别为 F 和 G 的随机变量 X和Y,19。
哈里斯鹰优化(HHO)被用作元启发式优化方法。HHO的灵感来源于哈里斯鹰20的合作狩猎行为。探索与开发阶段的过渡由逃逸能量E控制。在探索阶段,其中 |E|≥1,更新定义如下:
X(t+1) = X兰特 (t) - r1 |Xrand (t) - 2r2X (t)|
在开发阶段,其中 |E|<1,更新由逃逸能量E = 2E(1 − t/T)和跳跃强度J = 2(1 − r5)决定。在软围城条件下,其中 是 ≥ 0.5,|E|≥0.5版本,更新定义如下:
X(t+1) = ΔX(t) - E|JX兔子 (t) - X(t)|
在硬围城条件下,≥ 0.5 和 |E|<0.5版本,更新定义如下:
X(t+1) = X只兔子 (t) - E|ΔX(t)|
公平性采用统计平价和误差率平衡,遵循Hardt等人20 页和Lima等人21页的建议。采用人口统计平价差、均衡赔率差和基于年龄的校准误差作为公平度指标。

ΔEO = max(|TPRA - TPRB |,|FPRA - FPRB |)
ΔBS=|BS年龄<50 - BS年龄>50 |
其中BS是Brier评分:

仪表盘可解释性基于SHAP值,这些值是通过联盟博弈论计算的18。

其中 Φi 代表特征 i 的 SHAP 归因, F。f(S) 表示所有特征的集合,代表特征子集 S 的模型预测。
基于GAN的数据增强
为解决数据稀缺性和类别不平衡问题,使用生成对抗网络(GAN)生成合成样本。生成器架构采用 TensorFlow/Keras 配置。它接受从标准正态分布 N(0,1) 中采样的 100 维噪声矢量,随后通过 ReLU 激活对密度层分别为 128、256 和 512 单位。输出层包含13个单元,对应原始特征尺寸,并使用S形激活。
判别器架构接受一个13维特征向量作为输入。它由密集层组成,分别有512、256和128个单元,采用LeakyReLU激活,激活时间为α = 0.2。输出层包含一个带有S形激活的单元,用于对真实样本与合成样本进行二分类。
GAN训练了100个时代,批次规模为64个。Adam优化器的学习率为0.0002,β1 = 0.5,β2 = 0.999。在每个时代,判别器交替训练于真实批次和合成批次,生成器则被训练以欺骗判别器。训练后,将1000个随机噪声向量输入生成器,生成1000个合成样本,这些样本仅加入训练集。
在GAN训练期间,通过测量每10个时代后100个生成样本中每个合成特征的方差来监测模式坍缩。如果连续三次检查中任何特征的方差低于对应实际数据方差的10%,则怀疑模式崩溃。缓解策略包括将学习率降低至1×10⁻4、将批次规模增加到128、重新开始训练并使用不同权重初始化,或用带梯度惩罚的Wasserstein GAN(WGAN-GP)替代标准GAN,如Arjovsky等人17所描述。该实现使用了带有高斯微扰退回的标准GAN以确保在TensorFlow不可用时仍能生成合成数据。
合成数据质量通过使用自定义实现计算真实特征分布与合成特征分布之间的弗雷歇特距离来评估。分类器,如逻辑回归,也被训练用来区分实样本和合成样本;近乎偶然的分类准确性被视为高保真度的体现。计算出精确回忆AUC,值大于0.9时被认为表明分布捕获良好。还比较了真实与合成数据集中特征对之间的皮尔逊相关性,差异低于0.05视为相关结构的可接受保留。
当TensorFlow/Keras不可用或GAN训练失败时,采用高斯微扰退回方法。对于每个类别,每个特征的均值(μ)和标准差(σ)均值由训练集计算出来。合成样品随后按以下方式生成:
X合成 = μ + ε × σ × 0.05,其中 ε ~ N(0,1)
类别标签是根据原始类别分布比例生成的。这一备用功能旨在支持在无深度学习依赖的环境中实现可重复性。
混合特征选择
采用了两阶段混合特征选择策略。第一阶段进行了统计预过滤。对于特征集X中的每个特征习习,根据二元结果变量将值分为两组:G0表示y=0,表示无疾病;G1表示y=1,表示疾病存在。Welch的两样本 t检验采用scipy.stats.ttest_ind,equal_var = 假。随后计算了科恩的d效应大小:
d = (均值1 − 均值2) / pooled_std
其中:
pooled_std = sqrt((std12 + std22)/2)
特征名称、p值和Cohen的d值被存储在结果表中。若特征满足两个条件,则选中:p值<0.05和|科恩的d|≥ 0.5。最终的特征集被定义为Xfiltered。
韦尔奇t检验之所以被使用,是因为它适用于连续的数值特征,如年龄、海平面和旧峰。对于性别和超声等二元类别特征,t检验在比较两组时产生的结果与比例检验相当。多类别特征如cp和thal被单热编码,每个二元指标分别针对结果变量进行测试。这种方法被认为合适,因为克利夫兰数据集包含30多个样本,特征在分析前已标准化,且equal_var = 对组间不等方差的错误解释。对于严重违反正态性的特征,Mann-Whitney U检验被视为一种替代的非参数检验。
阈值p<0.05遵循常规统计显著性,而|科恩的d|≥0.5对应中大效应值。对于样本量小或结局罕见的数据集,建议采用自助调整、Hedges的g修正或放松的探索阈值,并获得专家临床意见。例如,可以使用1000次自助重抽样计算Cohen的d置信区间,Hedges的g可用于校正小样本偏差。具有边界统计量的特征,如p值介于0.03到0.08之间或|d|在排除前,记录了0.4至0.6之间的数值,以便临床专家审查。
第二阶段,哈里斯鹰优化(HHO)应用于统计过滤特征集。HHO的人口规模设为20,最大迭代次数设定为50。每个解都用长度等于 Xfiltered 中特征数量的二元向量表示,其中 1 表示某个特征被选中,0 表示未被选中。连续的HHO位置被用V形传递函数映射到二进制矢量:
T(x) = |tanh(x)|
如果 T(x) > 0.5,则二进制值设为 1,否则为 0。选择V形函数是因为它支持在二进制转换过程中实现平衡的探索和利用。
每个解的适应度函数通过逻辑回归定义。仅使用二元向量选定的特征训练逻辑回归模型,并使用scikit-learn的cross_val_score进行五重交叉验证。适应度的计算方法如下:
适应度 = 1 − 平均精度
鹰的位置种群在[−1, 1]范围内均始初始化,使用numpy.random.uniform(−1, 1, (population_size, n_features)),随机种子固定为42以保证可重复性。每次迭代中,评估所有鹰的适应度,确定最佳鹰的位置为兔子,并利用基于逃逸能量的HHO勘探和利用方程更新鹰的位置。收敛后,表现最好的二元向量被选为最后一个特征子集Xfinal。
所选特征是通过一次HHO优化运行并采用固定随机种子记录的。对于需要更高统计置信度的应用,建议使用30次不同的随机种子进行独立运行,并且可选择至少80%的运行中出现共识特征。报告的实现基于单次代表性运行,初步测试显示收敛一致。
模型训练与优化
考虑了三种模型:逻辑回归、随机森林和PSO优化的人工神经网络(ANN)。逻辑回归通过分层五重交叉验证训练以维持类别分布。正则化强度C通过搜索空间C
[0.001, 0.01, 0.1, 1, 10]进行了优化。对于每个折叠和每个C值,模型在训练折叠上训练,并在验证折叠上进行评估。选择了能够最大化各折叠平均验证准确率的C值。
随机森林模型通过超参数调优进行训练。搜索空间包括 max_depth = [5, 10, 15, None],min_samples_split = [2, 5, 10]。采用ROC-AUC作为优化指标,通过GridSearchCV进行带有5折交叉验证的网格搜索,评分=“roc_auc”。所选随机森林模型采用了max_depth=10和min_samples_split=5。使用oob_score=真实的标准实现了袋外(OOB)得分估计。
通过计算训练准确性与OOB分数之间的差距来评估过拟合:
overfitting_gap = training_accuracy − oob_score
过拟合差距低于0.05被视为良好泛化的标志,而大于0.10则表示需要减少max_depth或增加min_samples_split。OOB得分为0.9296,典型训练准确率在0.94至0.96之间,差距约为0.01至0.03。
人工神经网络分类器也通过粒子群优化(PSO)进行了优化。人工神经网络架构由输入层、一层包含64个神经元的隐藏层(使用ReLU激活)以及一个输出层(含一个神经元,使用乙状结肠激活)组成。PSO初始化时有50个粒子和50次迭代,用于优化初始网络权重。随后,人工神经网络通过标准反向传播进行训练。由于PSO优化是在相同的训练数据上进行的,没有嵌套交叉验证,这一部分被谨慎对待。未来应用建议采用嵌套交叉验证,外部10折循环用于评估,内层10折循环用于PSO超参数选择。泛化间隙低于0.08被认为是可接受的,而大于0.15的间隙则表示可能存在过拟合,需要模型简化。
模型评估
模型评估采用了对最终特征集Xfinal的分层10重交叉验证。在每个折叠中,逻辑回归和随机森林模型都基于训练数据进行训练,并在验证数据上进行评估。准确性、精准度、回忆率、F1分数和ROC-AUC均通过scikit-learn的classification_report和roc_auc_score计算。所有指标的平均和标准差在10个折点上均值和标准差均被计算。
每个折叠的推广差距也计算如下:
generalization_gap = training_accuracy − validation_accuracy
报告了所有10个折面的平均泛化差距。平均差距低于0.08被认为表示过拟合最小,而差距超过0.15则表明存在过拟合,需要正则化或降低模型复杂度。进行了Wilcoxon符号秩检验,将所提出的框架与基线方法在10个重层上进行比较,条件为α = 0.01。
可解释性分析
可解释性分析采用模型特定性和模型无关性方法进行。对于逻辑回归,拟合最终模型并提取每个选定特征的系数值。比值比以exp(系数)计算,95%置信区间则利用系数的标准误计算。
对于随机森林,使用feature_importances_属性从训练模型中提取基尼重要性分数,并归一化为1。SHAP的解释是通过SHAP库生成的。KernelExplainer 对象是利用训练好的模型和背景数据集创建的,后台数据集(例如 100 个随机选择的训练样本)。SHAP值是通过shap_values计算测试集中所有实例的。蜂群总结图使用shap.summary_plot生成,平均绝对SHAP值条形图则使用shap.bar_plot生成。
为SHAP分析识别的顶尖特征生成了部分依赖图(PDP)。对于每个选定特征,都会创建一系列跨越特征范围的数值。每个值被替换到特征列,同时保持其他特征保持不变,计算所有实例的平均预测概率。特征值与matplotlib的平均预测值进行绘制。通过100次自助重抽样迭代,加入了95%的置信区间。
通过绘制个别实例的预测轨迹,随特征值变化,生成了针对选定特征的个别条件期望(ICE)图。PDP线路覆盖在ICE地块上。通过计算逻辑回归比值比与随机森林SHAP值之间的Spearman秩相关性,使用scipy.stats.spearmanr比较解释方法。临床解释方法之间的差异被记录下来。当SHAP和逻辑回归系数冲突时,会检查该特征的PDP。如果PDP显示非线性趋势,SHAP解释优先于逻辑回归系数,因为随机森林能够捕捉线性模型无法捕捉的非线性关系。
用于使用 MIMIC-III 进行外部验证的框架泛化协议
为将该框架应用于MIMIC-III数据库,提出了一种外部验证协议。访问MIMIC-III需要PhysioNet批准并完成所需的人体受试者培训。拟议的队列包括18岁及以上首次ICU住院且ICD-9代码为410–414的急性心肌梗死或ICD-10代码I20–I25的缺血性心脏病患者。排除标准包括目标特征缺失超过30%、住院时间少于24小时、年龄超过90岁、既往心脏手术经历或先天性心脏病。
拟结局为入院72小时内发生重大不良心脏事件(MACE),定义为院内死亡率、心源性休克或需要干预的心室心律失常的综合指标。心率和血压等时间序列特征将在ICU住院前24小时内通过均值、中位数、最小值、最大值和趋势进行汇总,趋势则以线性回归随时间的斜率估计。最大心率会被用作映射中的塔拉赫等效值。
克利夫兰数据集特征将映射到MIMIC-III变量上。例如,thalach会映射到ICU住院前24小时内记录的最大心率,CP映射到结构化疼痛评估和NLP提取的胸痛记录,Oldpeak则映射到心电图报告中的ST段偏离。将创建一个映射表以记录所有特征对齐情况。
在应用完整流程之前,将通过100份随机抽取的心电图报告验证oldpeak的NLP提取效果。准确度、回忆和F1评分将由两位临床医生手动标注计算。如果F1分数低于0.85,则会修订正则表达式模式,或使用图表事件中的结构化心电图数据作为替代方案。随后,预处理流程将在提取的MIMIC-III数据上重复运行,GAN将被重新训练以进行增强,混合特征选择会重新应用,模型会被重新训练,会生成解释,并将性能指标与克利夫兰数据集结果进行比较。
临床仪表盘的实现
基于网络的临床仪表盘原型采用了如Flask或Django等框架设计。HL7/FHIR API端点计划用于EHR集成,认证和授权配置符合机构安全策略。数据映射功能旨在将电子健康记录数据转换为模型输入格式。
用户界面包含三种主要视图。预筛查视图显示患者人口统计数据和计算风险评分,并以颜色编码风险等级。决策支持视图显示了SHAP瀑布图,显示特定患者的主要贡献因素。干预规划视图通过调整可调整的风险因素和显示更新的风险预测,实现了假设分析。还包含导出功能,可将报告保存为PDF文件或与电子健康记录系统集成。
为未来临床部署,计划至少五名临床医生进行仪表盘可用性评估。评估将使用系统可用性量表,目标得分大于68,任务完成时间较单纯电子健康记录使用减少至少20%,并采用5分满意度量表以提升解释清晰度和信任度。该可用性评估计划作为未来步骤,但未在本研究中实施。
访问受限。请登录或开始试用以查看此内容。
实验环境与性能指标
所有实验均在Python 3.9中使用scikit-learn、TensorFlow和SHAP库进行。采用了分层10折交叉验证。评估指标包括准确性、精度、召回率、F1评分和ROC-AUC。
与选定基线方法的性能比较
| 方法 | 准确性 | 精度 | 召回 | F1评分 | 中华民国-美军 |
| 逻辑回归 | 0.930 ± 0.020 | 0.914 ± 0.029 | 0.955 ± 0... |
访问受限。请登录或开始试用以查看此内容。
本文所述框架为开发可解释的心脏病预测模型提供了可重复的方法。 图4展示了整合这些解释的临床仪表盘原型,实现了三阶段工作流程:预筛查、SHAP决策支持和干预规划[见图4]。若干关键步骤需要密切关注,以确保该框架的成功执行。
如表5所示,现有心脏病预测研究的比较显示出三个关键维度上存在方法学上的空白。首先,关于数据增强,有几项研究未采用增强技术,而Ishaq等人使用SMOTE,Sahoo等人9人采用了生成方法,如GAN/VAE。其次,在特征选择方面,有些研究省略了这一步骤,而另一些研究,如Vijayashree和Sultana10以及Lale等,则依赖于没有统计预过滤的元启发式方法。第三,关于可解释性,若干研究的解释性有限,一些基于XAI的研究,如El-Sofany
访问受限。请登录或开始试用以查看此内容。
作者无需声明利益冲突。
作者感谢首都(赫尔万)大学和阿拉伯开放大学提供研究设施的支持。该研究未获得公共、商业或非营利部门的任何资助机构的具体资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 克利夫兰心脏病数据集 | UCI机器学习存储库 | https://archive.ics.uci.edu/ml/datasets/heart+disease | 用于模型开发/评估的基准心脏病数据集 |
| 姜戈 | Django 软件基金会 | 无 | 仪表盘实现的替代网络框架 |
| 花式猜测 | 花式开发者 | 无 | 可选的MICE和KNN补值敏感性分析 |
| 烧瓶 | 托盘项目 | 无 | 仪表盘实现的Web框架 |
| HL7/FHIR API 标准 | HL7国际 | 无 | EHR/仪表盘集成的计划标准 |
| 克拉斯 | Keras 开发者 | 无 | 用于GAN架构的TensorFlow/Keras神经网络API |
| Matplotlib | Matplotlib 开发者 | 无 | 绘图库 |
| MIMIC-III数据库 | 物理网 | https://physionet.org/content/mimiciii/1.4/ | 用于计划外部验证的重症监护数据库 |
| Missingno。 | Missingno 开发者 | 无 | 缺失矩阵可视化 |
| 数字派 | NumPy 开发者 | 无 | 数值计算 |
| 熊猫 | Pandas开发者 | 无 | 数据操作 |
| 物理网 | 物理网 | https://physionet.org/ | MIMIC-III 的访问平台/源代码 |
| 蟒蛇 | Python 软件基础 | 无 | 版本 3.9/3.9.7 |
| Scikit-Learn | Scikit-Learn 开发者 | 无 | 机器学习库,包括预处理、模型训练、交叉验证和指标 |
| 科幻 | SciPy 开发者 | 无 | 统计检验,包括韦尔奇s t检验与斯皮尔曼相关性 |
| SHAP | SHAP 开发者 | 无 | 可解释的人工智能库 |
| Statlog 心脏病数据集 | UCI机器学习存储库 | https://archive.ics.uci.edu/ml/datasets/statlog+(心) | 基准心脏病数据集 |
| 张量流 | 谷歌 | 无 | GAN实现的深度学习框架 |
| UCI机器学习存储库 | 加州大学欧文分校 | https://archive.ics.uci.edu/ | 克利夫兰和统计日志数据集的存储源 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可