Table of Contents
糖尿病数据革命:AI和大数据是如何被隐藏的生物标志所揭开的
全球糖尿病负担继续以惊人的速度上升。 国际糖尿病联合会估计,2021年,超过5.37亿成年人患有糖尿病,预计到2045年将达到7.83亿。 这种代谢障碍不仅是发病和死亡的主要原因,而且给全球医疗体系造成了巨大压力。 虽然基础生物学建立了胰岛素抗药性、β细胞功能障碍和代谢障碍等关键机制,但这种疾病在个人之间呈现出显著的异质性。 一些患者经历着肾上腺病或复发性等并发症的快速发展,而另一些患者则保持了几十年的甘化控制而未明显下降。 这种变化在历史上阻碍了早期诊断和个人化治疗战略。
人工智能和大数据正在推动生物标记如何被发现和验证的地震变化。 研究人员可以同时询问数千个分子特征,而不是一次测试一个假设,从而可以出现人类专家无法预测的数据驱动模式。 这一范例正在产生越来越多的新式糖尿病生物标记:结合数百种基因变体的多源风险分数、蛋白质特征捕获早期β细胞应激反应、连续糖监测器的代谢特征以及从深层学习中得出的以成像为基础的标记。 本文审视AI和大数据如何加速生物标记器的发现,并重塑糖尿病护理的未来,从早期检测到精确管理。
通过机器学习重新定义生物标志
传统的生物标志发现依赖于候选方法,研究人员根据先前的知识选择有限的一组分子,并在临床组群中对其进行测试。 虽然这产生了HbA1c和C-peptide等有价值的标记,但这一过程缓慢,带有假设性,而且往往无法囊括糖尿病的全部复杂性。AI通过允许假说无高维数据探索来翻转这一范式。机器学习算法通过包括基因组学、转录组学、蛋白质组学、分泌学和临床记录在内的庞大数据集筛选出与疾病发起、发展或治疗反应相关的规律。
监督学习:症状出现前的预测风险
梯度增强机、随机林和深神经网络等监督学习模型都接受了标记数据集(如曾经或没有发展糖尿病的病人)的培训,以确定最具有预测性的特点。 2020年的一项里程碑式研究在 Nature Medicine[ 中采用了梯度提升英国初级保健记录,以预测2型糖尿病,其发生面积在0.92的接收者操作特征曲线(AUC)之下。 该模型将HbA1c、三甘油、腰与口比以及肝酶和白血细胞等较不传统的变量计算成一个比任何单一标记都强的复合风险分数。 这一多发性特征说明了AI驱动的发现的功率。
深层学习进一步扩大了可能性。 接受视网膜基金图像培训的神经网络现在检测糖尿病复发性,其准确度与眼科医生相当。 意外的是,这些网络还可以预测系统生物标记,如HbA1c和仅图像产生的血压,表明AI捕捉到与总体代谢健康相关的微血管变化。 这种现象被称为域转移,为发现替代标记打开了大门,否则这些标记可能仍然隐藏。 例如,2022年,DepDR财团的一项研究证明,对复发性图像的深度学习可以预测未来糖尿病肾病的风险,为风险分层增加一个新的维度。
无监督学习:发现疾病亚型
诸如集群、主要成分分析和自动编码器等不受监督的学习方法在数据中揭示了没有预先界定的标签的隐藏结构。 当这些模型应用于2型糖尿病的大批患者时,这些模型发现了独特的内分泌类型——在疾病进展和复杂风险方面有所不同的生物意义亚型。 瑞典的具有里程碑意义的ANDIS研究使用k-指由六个临床变量(年龄、BMI、HbA1c、β细胞功能、胰岛素抗药性以及自体)组成的克-指群,以识别五个糖尿病群,包括一种严重的胰岛素-脱氧性形式,迅速发展到胰岛素依赖性。 这些分类群代表了一种直接为治疗选择提供依据的新分类学,它超越了二元类型1和2的分类。
近期的工作将相机数据整合到集群中。例如,2023年对 Framingham Heart Research[ 的一次分析将元体和蛋白质组学结合到临床特征中,以识别三种亚型的心血管病症,这些亚型生物标志对有针对性的干预至关重要,使临床医生能够确定哪些病人可能受益于早期的侵略性治疗,而不是仅从生活方式改变中受益。
半监督和加强学习
类似半监督学习的杠杆作用等新兴方法,加上大量无标签数据的有限标签数据,这在只有一小部分患者有完整后续数据的大型生物库中很常见。 正在探索强化学习,以动态生物标记器发现,模型学习基于患者轨迹的生物标记器测量的最佳时机。 虽然这些方法仍然具有实验性,但有望提高发现效率,特别是罕见的糖尿病型,如单致性或成人潜在自发性糖尿病(LADA)的发现效率。
大数据:AI-Powered发现的燃料
AI模型的强度仅能与所培训的数据一样高。 在糖尿病研究中,生物库、电子健康记录、连续葡萄糖监测器(CGM)和相通的相通技术都提供了训练强大模型所需的体积、种类和速度。 然而,仅靠原始数据是不够的;不同数据类型和来源的整合才是真正价值的出现之处。 挑战在于统一不同的数据集,同时保持完整性和确保代表性。
多功能融合
最有前途的生物标志候选人来自多组基因层的融合,捕捉遗传学、转录、蛋白质和代谢物的相互作用。 比如,精密医学的跨微生物(TOPMed)方案将全基因组测序与蛋白质组和元化数据结合,来自1万多人。 一个深入的学习框架确定了一个由23个蛋白质和14个代谢物组成的网络,预测2型糖尿病的发病率,在5年内精确度达88%。 纤维素生长因子21(FGF21)和甘化因等多分子与代谢健康有联系,但综合模型揭示了单组基因组方法所隐含的协同互动。
蛋白质组学尤其肥沃。SomaScan等基于Aptamer的平台同时测量了7000多颗蛋白质。应用到这种高维数据的机器学习已经为1型和2型糖尿病确定了新的生物标记。对于1型,一个由4个蛋白质组成的小组——包括免疫检查站蛋白PD-L1和化疗CXCL10——可以预测从自体正向性到临床疾病的岁月发展。对于2型,像脂肪素和脱毛素这样的蛋白质已经出现,作为脂肪组织功能障碍和胰岛素抗药性的早期标记。同样,元素组学也强调分链氨基酸(BCAs)和芳香氨酸是未来糖尿病的预测器,而AI模型则将它们纳入超过传统度的风险分数。
佩戴和紧急人力资源的实时世界数据
易穿戴的仪器正在产生连续的生理数据流. 持续的葡萄糖监测器(CGM)每天产生高达288个读数,产生丰富的糖分可变性时间剖面. 斯坦福大学的研究人员利用来自8000多非糖尿病成年人的CGM数据定义了"葡萄糖不稳定指数",这是基于葡萄糖出行频率和振幅的AI派量子. 这一度量度预测未来2型糖尿病比HbA1c更好,甚至仅是用糖分快活,即使适应了传统风险因素之后,这种活性生物标记器代表了超过静态实验室值的重大步骤,捕捉出实时代谢波动.
适用于EHRs的自然语言处理(NLP)是另一个丰富的资源. 通过挖掘非结构临床说明——物理叙述,出院摘要,放射学报告——NLP模型提取出"白糖尿病"等细微的苯基,药物坚持模式,以及结构化的症状描述等结构化领域缺失. Mayo Clinic[的2024年研究,NLP用临床说明来识别2型糖尿病的亲子症状,发现有睡眠障碍和情绪变化的关联,在诊断前几个月,这些文字衍生特征增强了生物标志模型,提高了预测准确性和临床相关性.
将生物标志作为源头
医学成像正在成为糖尿病生物标记的非入侵源。除了视网膜基金摄影外,CT和核磁共振扫描还提供了胰腺脂肪组成、肝脏质地和腹部脂肪分布的定量测量。 深层学习算法可以从标准临床扫描中分解和量化这些特征。 比如,对CT的胰腺脂肪的自动测量与β细胞功能和未来糖尿病风险相关。 同样,AI模型产生的心电共振特征在临床症状出现前就与糖尿病心肌病相关。 这些成像生物标记器补充了分子特征,提供了血液测试无法提供的空间和解剖环境。
从法官到副法官:临床影响和挑战
AI发现的生物标记器正在日益进入临床实践. 2型糖尿病的多源风险分数(PRS)在商业上是可用的,一些医疗系统利用它们进行分层筛查. 糖尿病肾病早期检测蛋白质板正在大型多中心试验中验证. FDA的"生物标记器资格方案"接受了AI授权证据,用于CT扫描的深度学习分析,以量化胰腺脂肪作为糖尿病进展的预测器. 此外,持续的糖监测数据正在被整合入电子健康记录,从而能够进行实时风险评估和治疗调整.
然而,仍然存在重大障碍,数据质量和标准化是长期存在的问题。EHR包含编码错误、缺失值和特定地点的变异,这些变化可能带来偏差。 许多AI发现的生物标记由于人口差异或分析文物而未能在独立群体中复制。在临床采用之前,必须严格地进行各种人群的外部验证,包括经常在生物库中代表不足的少数民族。AI时代缺乏生物标记验证的标准化协议,使翻译工作更加复杂。
解释性是另一个主要障碍。 深层学习模式臭名昭著地不透明;临床医生如果无法解释为何会给某个病人打出标签,就不可能在风险分数上采取行动。 SHAP和LIME等解释性AI方法提供了近似值,但监管机构仍在制定框架来评估这些模式的安全、公平和问责。 美国食品和药品管理局和欧洲药品管理局(EMA)发布了基于AI的医疗器械的指南草案,但不断演变的监管给开发者带来了不确定性。
伦理考虑的出现是巨大的。 生物标记风险预测可能引发焦虑,导致保险歧视,或者如果模型主要接受来自白人、富裕人群的数据培训,就长期存在健康差距。 公平获得先进的生物标记测试和透明的风险沟通是不可谈判的,可以负责任地部署。 健康公平与AI工作组[ 已经建议了框架,以确保培训数据具有多样性,在算法结果方面保持公平,但实施仍然不完善。
未来地平线:数字双子和联邦学习
下一个前沿是创建“数码双胞胎”——个体患者的虚拟表现,将纵向生物标志数据、遗传信息、生活方式因素和治疗历史结合起来。 这些模型在临床应用前模拟疾病轨迹和测试干预策略,从而实现个性化的护理。 2024年更新的“ 糖尿病护理 中强调了数字双胞胎在预防一型糖尿病胰岛素剂量优化和复杂症方面的早期成功。 随着生物标志数据从可穿戴物和CGMs中变得更为活性和持续性,这些虚拟模型将提前几年变得更加准确,有可能预测并发症的发生。
联邦学习提供了一条在保护隐私的同时克服数据仓的路径。 AI模型不是集中集中敏感患者数据,而是在多个医院接受当地培训,只有模型更新共享。 欧洲和亚洲五个机构糖尿病复健筛查试点项目表明,联邦模型在保持数据的同时实现了与集中模型相类似的精度。 这种方法可以在不降低保密性的情况下在不同的人群中大规模发现生物标志。 结合不同的隐私技术,联邦学习可以在遵守GDPR等法规的同时加快发现速度。
单细胞基因组技术是另一个令人兴奋的前沿。 通过剖析人类岛或血液样本中的单个细胞,研究人员可以识别与疾病有关的罕见细胞状态。 AI模型分析单细胞RNA测序数据揭示出与糖尿病发展相关的新亚型β细胞和免疫细胞。 这些细胞特异生物标记器可以导致有针对性地治疗以保存β细胞功能或调节免疫反应。
结论
AI和大数据不仅在加速糖尿病生物标记的发现 — — 它们从根本上重新定义了生物标记是什么。 不再局限于单一分子或静态测量,今天的生物标记是动态的、多维的特征,能够捕捉遗传学、新陈代谢、环境和行为的相互作用。 从多源风险分数和蛋白质板到CGM衍生的不稳定指数和基于成像的脂肪量化,这些新工具预示着一个更早发现糖尿病、更精确分类和实时适应的个性化策略的未来。
要实现这一承诺,就必须持续投资数据基础设施、严格的验证标准、可解释的AI方法以及公平获得高级测试。 协作努力,如我们所有研究计划和国际财团,对于建立多样化数据集至关重要。 AI和大数据的整合正在将糖尿病从一刀切的疾病转变为个人一级能够理解和治疗的条件。这不仅是一项科学进步,而且是临床上的一项当务之急,需要认真管理,以确保所有患者都能受益,而不论其背景如何。