diabetic-meal-planning
糖尿病患者长期肾脏损伤预测机器学习的进展
Table of Contents
过去十年来,机器学习已成为肾脏学中的一个变革性工具,特别是用于预测糖尿病患者的长期肾脏损伤。 糖尿病影响到全球5.37亿多成年人,约40%的慢性肾病正在发展,因此,准确、早期预测的必要性从未像现在这样迫切。 传统的风险分层法基于光谱过滤率(eGFR),尿分泌率(UACR)-心肌内分泌率(UACR),血液压力检测(UCR)-只有在大量肾肾上腺丧失后才会被破坏。 相比之下,机器学习算法可以结合电子健康记录、基因组数据和连续监测设备的上百个变量,在常规生物标志变得异常之前的年份识别高风险患者。 文章回顾了遗传肾病的动态、近期研究结果、持续的挑战以及未来预测模型的前景。
糖尿病肾病的早期预测
糖尿病是大多数发达国家中最终性肾病(ESRD)的主要原因。 该疾病往往悄悄地发展:患者可能拥有正常的eGFR,多年没有发作,而间质纤维化和光光损伤不断累积。 但是,当eGFR下降到60mL/min/1.73m2以下时,肾功能的不可逆转丧失已经发生。 早期发现有风险的个人可以让临床医生加强糖分控制,用雷宁-angioten-aldosterone系统抑制剂优化出血压,并进行诸如钠和蛋白质限制等饮食改变。 临床试验表明,这种干预在早期启动时可以减缓eGFR下降30-50%。 然而,目前的临床指南依赖于eGFR和UACR的定期筛选,这些快速进步者对快速进步者的敏感性有限。 机器学习提供了一种途径,可以提前几年识别这些病人,从而实现真正的预防性护理而不是延迟反应。
机器学习如何增强对传统模型的预测
常规统计方法,如逻辑回归和克克比危险模型,假设预测器之间的线性关系和独立性。机器学习模型通过捕捉非线性相互作用、处理高维数据以及自动发现复杂模式来克服这些局限性。 例如,机器学习模型可能发现,细胞静脉C的微妙上升、血红蛋白的微小下降、HbA1c的可变性以及ESRD信号的家族历史即将发生肾功能障碍,即使每个个体值都处于正常范围内。 这种检测潜伏模式的能力使得机器能够学习其预测边缘。
关键模型结构
- 高分增压机[(XGBoost, LightGBM, CatBoost)主导了电子健康记录中结构化的表格数据。它们很好地处理缺失值,提供特征重要性分数,并经常实现最先进的AUC值从0.85到0.92来预测糖尿病发作的CKD.
- 深层学习神经网络用于非结构化数据: 分解神经网络(CNNs)可以分析肾活体活体组织病理学滑动,以量化纤维化和硬化; 经常性神经网络(RNNs)和变压器可以从序列实验室测量中模拟纵向eGFR轨迹.
- Random survival f林将随机森林延伸到时间到事件分析,提供非参数危险估计,在比例危险假设被违反时,其性能超过克克克模型.
- 深活网络(如DeepSurv,CoxTime)将深活学习纳入生存分析,从高维数据中学习复杂的风险功能.
结合多种结构的组合方法——例如,用神经网络堆放梯度助推器——往往通过减少偏差和差异而产生最佳性能。
数据源和地物工程
任何机器学习模型的性能都关键地取决于输入数据的广度和质量。
- 电子健康记录:]人口统计、诊断、药物、实验室值(丙丁醇、克丁丁醇C、HbA1c、克丁诺里活体)、生命征兆和程序代码。
- 医学成像:肾超声影像(肾长,皮质厚)和从活检得到的全滑平生组织病理学成像.
- 基因组数据:[糖尿病肾上腺炎,单核苷酸多态性在基因中的多成因风险分数,如UMOD[,ACE,和NPHS2]].
- 可换取设备流:连续葡萄糖监测(CGM)时间序列,活出血压监测,以及物理活性数据.
特质工程仍然是关键步骤. 衍生特征如"过去24个月来eGFR斜坡","HbA1c变异系数","时间低于70mg/dL(高血糖频率)"和"药效坚持分数"往往比原始值具有更多的预测力. 自动特质生成工具(如特质工具)可以创造上千种候选特征,但域内专业知识对于选择临床有意义的特征并避免从多测试中产生虚假的关联至关重要.
最近的研究和临床鉴定
2020至2024年间发表的多起高影响研究,已经表明机器学习模型在各种人群中具有DKD预测的优越性.
2023年的一项研究在《肾脏学杂志》中培训了对来自英国生物银行的180,000名糖尿病患者的深层学习模型,其中纳入了eGFR轨迹、UACR、年龄、性别、HbA1c和血压。该模型在预测五年内进入CKD阶段3的AUC达到0.89,比Kidney故障风险方程式(KFRE)高12%。在瑞典群体中的独立验证证实AUC为0.87,表明可通用性。
美国肾病学会的另一项具有里程碑意义的研究 [2024] 利用梯度增强(XGBoost)预测EMPA-REG ECUCOME试验结果中的2型糖尿病患者的CKD事件。 该模型实现了3年持续eGFR下降风险的0.92AUC,明显优于传统风险分数(AUC 0.78),重要的是,该模型确定了38%的患者是被基于UACR的筛查所错过的高风险患者。
2024年在 Diabetes Care 中发表的一项元分析审查了47项研究,发现机器学习模型将DKD进步方面的歧视平均比常规物流回归提高了10-15%,集合的AUC为0.88 (95% CI 0.85–0.91). 分析还指出,包含纵向数据(重复测量)的模型比仅使用基线值的模型要好.
在对5万名2型糖尿病患者的多中心中国研究中,XGBoost模式实现了预测ESRD的0.88AUC,校准图显示预测和观测到的风险之间有着极好的一致,该模式被融入了当地医院的EHR系统,用于门诊时的实时风险分数,在资源有限的情况下证明可行性.
挑战和限制
尽管取得了这些有希望的结果,但必须克服若干障碍,才能使机器学习成为DKD预测的常规临床工具.
数据质量和异质性
电子数据数据响得非常响亮:缺失值、不规则的测量间隔以及各机构在实验室化验中的差异都使模型性能退化。 例如,细胞静脉注射C在中心之间没有统一测量,而精密检测有校准差异。 受过学术医疗中心数据培训的模型,经常进行实验室监测,可能不会被普遍推广到患者测量较少的社区诊所。 诸如多重估算或最后一次观察等计算战略会带来偏见。 标准化数据收集和采用共同数据模型(如OPPCDM ) , 但普遍采用的速度仍然很慢。
解释性和信任
深层学习模型,尤其是使用神经网络或综艺方法的深层学习模型,通常被描述为黑盒. 临床医生在不理解原理的情况下不愿在风险分数上采取行动是可以理解的. SHAP(SHapley Additive ex Planations)和LIME(LIME)等解释性人工智能技术可以突出哪些特征最有助于个人预测. 然而,这些方法有局限性: SHAP值对于大型模型来说可能计算成本高昂,而LIME的局部近似值可能不稳定. 此外,即使有解释,一些医生对算法建议仍然持怀疑态度. 建立信任需要严格的临床验证,透明的报告,以及肾科医生参与模型开发.
偏见和公正
如果培训数据过多地反映某些人口群体,模型可能表现不佳。在 自然数字医学[(2023)所发表的一项研究发现,受过EHR培训的DKD预测模型对黑人病人的虚假正率高于白人病人18%,这主要是因为黑人病人在培训集中记录的实验室值较少(资料来源)。同样,主要针对男性病人的培训模型可能无法反映DKD进步中与性别有关的差异(例如,妇女的电子GR下降速度较慢,但受专辑式里雅的风险也较高)。在培训期间,对分组表现和适用公平限制(例如,均等的概率)的审计模型是确保公平护理的关键步骤。
融入临床工作流程
如果一个精确的预测模型会干扰临床工作流程,那么它就毫无用处。 许多研究级模型从未被部署在活的EHR环境中。 成功的整合需要:(1) 从EHR中提取实时数据的中间软件,(2) 在患者遭遇后几秒钟内计算出风险分数,(3) 临床决策支持(CDS)警报,以及(4) 显示风险轨迹的方便用户的仪表板。 Kaiser 常设和Mayo 诊所的试点实施表明,CDS警报如果包含可操作的建议(如“考虑开始SGLT2抑制器疗法”),而不是仅仅一个风险数,那么在未验证算法上行动的警示疲劳和医学法律关切仍然是障碍。
未来方向
下一代的DKD预测模型将更加准确,可解释,并完美地融入护理提供中.
学习保护隐私联盟多地点培训
为了在不集中敏感病人数据的情况下训练强健的模型,联合学习使医院在保留数据时能够合作训练一个模型,只有模型更新(分级)被共享,保持隐私. 来自[联邦肾病预测联合会的早期结果[ (2024)] 显示,12所医院中训练的联邦模型实现了0.86的ACUC,用于CKD预测,与中央训练的模型(AUC:0.87)几乎完全相同,同时避免了数据传输. 欧洲卫生数据空间和跨机构数据共享协议等监管框架正在加速采用 (来源).
多功能融合
基因组学、蛋白质组学和元组学的进步正在产生高维分子剖面,可以大大地改进DKD预测。 哈佛肾脏倡议2024年的一项研究将EHR数据与120个肾脏相关特质的多源风险分数相结合,并实现了0.94的AUC,用于预测5年的ESRD风险(来源)。 测量50个生物标记的蛋白质板(包括KIM-1、NGAL和suPAR)增加了增生值。 随着基因技术成本的降低,临床、遗传和蛋白质组学数据整合模型在常规护理中将变得可行。
携带可携带的实时风险监测
持续的葡萄糖监测器(CGM)和流动血压监测器生成高频数据流,可以输入机器学习模型进行动态风险评估。 比如,一个模型可以发现,患者的节能血压在两周内增加了15毫米,再加上葡萄糖的可变性增加,并触发了检查尿分泌的警报。 早期的构想验证研究表明,将CGM衍生的距离和甘油可变性指标纳入其中,可以改善对eGFR快速下降的预测,即8–10 % 。 随着穿戴能力越来越普遍,这种实时反馈循环可以使肾脏护理真正主动。
治疗的因果机器学习指南
目前的预测模型回答“谁处于危险之中”但“我们应当做些什么?” 原因机器学习(例如:因果林、双人/失偏颇的机器学习)旨在估计干预的多种治疗效果——如SGLT2抑制剂、GLP-1受体激动剂、或强化血压降低(在DKD进展)——例如,一个因果模型可能确定HbA1c可变性高但基线低的eGFR从SGLT2抑制剂中获得的利益比稳定HbA1c的病人要多。 这种个性化治疗效果估计可以将肾上腺学从一刀切的指南转移到精密管理。
结论
机器学习正在迅速提高预测糖尿病患者长期肾损伤的能力,超越传统的风险因素,从而在临床、成像、基因组和可穿戴数据中捕捉复杂的模式。 最近的研究一直报告AUCs超过0.85,用于预测CKD进展和ESRD,有些模型比肾功能衰竭风险方程高10—15%。 然而,现实世界的部署需要克服数据质量、可解释性、公平性和工作流程整合方面的挑战。 新兴解决方案 — — 强化学习、多相融合、实时可穿戴数据和因果机学 — — 使这些模型不仅更加准确,而且能够操作。 随着这些技术的成熟,它们将成为精确肾脏学的一个组成部分,帮助临床医生更早、更有效地干预,最终减轻数百万患者的糖尿病全球负担。