Table of Contents
导言:糖尿病流行与大数据的承诺
糖尿病包括一型糖尿病、二型糖尿病和妊娠期,仍然是全球最紧迫的卫生挑战之一。 国际糖尿病联合会认为,2021年,约有5.37亿成年人患有糖尿病,预测到2045年将超过7.83亿。 糖尿病造成了惊人的经济负担,每年花费9,660亿美元的医疗开支。 传统的药物发现,这个众所周知的缓慢而昂贵的过程,往往需要10至15年的时间,超过26亿美元才能将单一的新型治疗方法带入市场。 在这方面,大数据分析已经成为一种变革力量,压缩了发现时间,并提供了十年前无法想象的精确方法。
医疗方面的大数据是指电子健康记录(EHRs),基因组测序,可穿戴设备,医学成像和临床试验所产生的大量复杂的数据集。 当利用机器学习、人工智能和先进的生物统计学进行综合和分析时,这些数据揭示了隐藏的规律、生物标记和治疗目标。 对于糖尿病研究,大数据正在加速新药候选者的识别,优化临床试验设计,使治疗方案个性化。 本文扩展了大数据分析如何重塑糖尿病治疗发现的地貌,提供了详细的洞察力、现实世界实例和未来方向。
大数据在糖尿病研究中作用的扩大
大数据并不是单一技术,而是数据来源和分析工具的生态系统。 在糖尿病研究中,五个主要数据流正在汇合:
- 电子健康记录:纵向病人病史,包括诊断,药物,实验室值(如HbA1c,禁用葡萄糖)和同分症. EHR现在能捕捉数百万个病人年的数据,使得能够进行大规模观测研究,而这种研究在后勤上不可能进行传统的随机试验.
- 基因组和多体型数据:全基因组测序、转录组、蛋白质组学和千人所生的元组学,揭示出基因偏好和分子亚型。 人类基因组测序的成本已经下降到600美元以下,因此可以生成像英国生物银行50万个出产物这样的人口规模数据集。
- 可换取的装置和传感器:连续的葡萄糖显示器(CGM),健身跟踪器,以及智能胰岛素笔能生成实时生理学数据. 单个CGM传感器每天产生超过288个葡萄糖读取,提供密集的时间数据,可以揭示对干预的动态响应.
- 临床试验数据:遗留试验数据集外加观测研究和登记册中的真实世界证据(RWE),制药业持有以前已排入井中的数据的微字节,现在正在被开采,以进行二次探明.
- 公共和专有数据库:英国生物库,全欧研究方案,芬根等资源,以及糖尿病遗传学倡议提供公开取用的数据来加速发现.
数据异质性、缺失值、隐私限制(HIPAA/GDPR)和数据标准的差异要求数据进行有力的协调和安全的联邦学习方法。 研究人员越来越多地使用支持隐私保护分析的平台,如合成数据生成和差异隐私,以解开洞察力,而不损害病人的保密性。例如, 观测健康数据科学与信息学网络利用共同数据模型使来自20个国家的3亿多患者的EHR数据标准化,从而能够进行全球规模的分析。
正在采取行动的大型数据的一个里程碑性例子是Diabetes Remission Clinic Tribulation(DIRECT),该研究利用EHR数据来识别那些通过卡路里限制可以实现还原的患者. 对数千名参加试验的学员进行事后特别分析后发现,新陈代谢的特征预示着成功,从而完善了患者的选择标准,并扩大了后续试验的资金投入. 另一显著的努力是ACCORD研究,其广泛的数据集被多次重新分析,以发现对强化葡萄糖控制有不同心血管反应的子群.
数据分析如何加速药物发现
药物发现管道 — — 从目标识别到临床前测试、临床试验和监管批准 — — 从每个阶段的大数据中获益。 下面我们研究数据分析加速新糖尿病治疗进展的关键机制。
目标确定和验证
历史上,药物目标是通过迷幻或艰苦的实验室实验发现的。今天,机器学习算法将地雷基因组和记录仪数据集用于确定基因、蛋白质和与糖尿病因果相联的路径。例如,基因组-维德协会研究(GWAS)已经确定了400多个与2型糖尿病有关的遗传地块。然而,只有一小部分被验证为可药用目标。大数据分析 — 特别是诸如 Mendelian随机化[和全域关联研究 — 让研究人员能够以强有力的因果关系确定目标的优先次序,减少晚期失败的风险。
一项显著的成功是,GLP-1受体激动剂[类,现在是一个糖尿病疗法的支柱。早期基因组分析指出,GLP-1R基因是胰岛素分泌的主要调节器。随后,利用[UK Biobank[]]和[FinnnGen的数据进行了大规模蛋白研究,证实影响GLP-1R表达的基因变体与低快取葡萄糖和减少心血管事件有关,这些发现为开发诸如血浆和硫酸盐等药物提供了生物理由,这些药物使糖尿病管理发生了革命性变化。最近,预测蛋白质结构的深层学习模型(e.g.,AlphaFold)在GLP-1R上确定了全聚菌结合点,使得能利用的副作用比可注射的活性肽更小的可得到的小型分子的设计。
另一个例子是AMP T2D财团,该财团将来自人类胰岛体的转录数据与基因关联信号相融合,以识别基因[TCF7L2[作为一个高自信目标. 功能研究显示TCF7L2在β细胞中调制出Wnt信号,而这个路径的小型分子抑制剂现在处于临床前发育状态.
应对毒品的预测模型
大数据最令人兴奋的应用之一是预测个体患者如何应对某种药物。 传统的试验平均治疗效果跨越了不同的人群,常常是缺失的次人群,这些人群受益(或受到伤害 ) 。 接受过基线实验室值、人口统计学、基因组标记和前期药物史培训的机器学习模型可以将患者分解成不同的反应群体。
例如,斯坦福德医学[的一项研究利用了10 000名2型糖尿病患者的EHR数据来预测元素衰竭(),该模型在自然医学[ 中公布了0.85的AUC,确定了在18个月内需要附加治疗的病人,这些工具可以为临床试验的纳入标准提供参考,确保只有可能的响应者才能被录取——施洗样本大小,降低成本并加快市场销售时间。
除了美容素,还开发了多源风险分数(PRS),预测对硫酰亚胺、硫酰亚胺和DPP-4抑制剂的反应。 2024年对 UK Biobank 中12,000名患者的元分析显示,在硫酰亚胺反应中,最高的PRS十分位数中的个人比最低十分数中的人的HbA1c减少量大了2.3倍。 制药公司现在利用PRS来丰富第二阶段试验,以快速证明接受,有可能将开发时间表缩短1至2年。
同样,深层学习算法分析CGM数据可以提前几天预测下潜运动事件. Google Health 和 JDRF[]开发的模型在利用之前的CGM数据预测夜行性下潜运动时达到了92%的敏感性,这些预测不仅改善了患者的安全,而且允许制药公司为新胰岛素模拟或β细胞保护疗法设计更短,更丰富的第二阶段研究.
优化临床试验设计
临床试验是药物开发中限制速率的步骤。大数据分析通过下列方法减少这一瓶颈:
- 适应性试验设计[:利用多臂的临时数据,巴耶斯统计模型调整随机化比率或提前投放无效武器. FDA最近关于适应设计的指导鼓励这一方法( FDA指导). 在糖尿病中, VERIFY试验使用了一个能节省18个月和4000万美元的无缝的第二/第三阶段适应设计.
- 数字双胞胎[:AI基于历史患者数据生成的合成控制,将安慰剂臂部的需求减少30-50%,将入学时间缩短了30-50 % 。 最近的Takeda药业[飞行员使用数字双胞胎来模拟一个200位患者安慰剂臂部,取代实际入学时间,并在保持统计力的同时将试运行时间缩短了14个月。
- 受聘者[:自然语言处理从EHR中提取合格标准,以匹配患者的试疗. A 默克图斯中心研究发现,这种工具提高了40%的招生效率. 试疗平台[现在将糖尿病患者匹配到全球2000多起活性试疗,罕见一型糖尿病亚型的入院率增加了3倍.
- Site Choice[:预测模型确定有高入学率潜力且协议遵守良好的临床地点,并尽量减少延迟。 一个受过500个糖尿病试验历史数据培训的模型实现了25%的场地激活时间。
例如,针对糖尿病相关心力衰竭的RADICAL-HF试验使用云分析平台来统一30个站点的数据,从而能够实时监测和适应性变化. 试验提前了6个月完成招生,并为新型SGLT2抑制剂组合提供了早期证据.
另一个创新方法是使用纵向EHR数据来构建与历史对照的概率分数。 RECOVERY试验2型糖尿病治疗证明,这种外部控制武器可以将同时出现的安慰剂组的需求降低40%,同时仍然能产生与传统随机设计相一致的强效估计。
真实世界证据和市场后监测
药物进入市场后,大数据继续发挥着关键作用。 来自保险索赔、紧急卫生要求和登记簿的实地世界证据有助于查明罕见的不良事件,验证更广泛的人群的有效性并发现新的迹象(药物重新用途 ) 。 FDA的"真实世界证据方案"[ FDA RWE框架 已经接受RWE支持扩大对几种糖尿病的标签,包括根据美国退伍军人事务部医疗系统35万患者的数据,使用SGLT2抑制剂来治疗心力衰竭。
典型的病例是美因成虫重新使用抗糖尿病前预防。 对糖尿病预防方案数据集的后热分析,加上来自10万名患者的EHR数据,证实美因成虫会减少高危个体中2型糖尿病的发育。 这导致临床指南建议对先发性糖尿病进行美因成虫,这种做法现在节省了数十亿未来的医疗费用。 最近,瑞典国家糖尿病登记[ (覆盖50万名患者)的大数据分析促使监管批准慢性肾病中的达帕格利夫洛津,这是真实世界心血管结果数据中出现的新迹象。
RWE还能够持续进行药物检测。 A 韩语信号检测研究 使用200万糖尿病患者的EHRs,识别出3个以前未识别的与低血糖有关的药物-药物相互作用,从而导致更新的包插入和临床决策支持提示。
个案研究和成功事例
最近的一些举措表明,大数据对糖尿病治疗发现产生了实际影响。
案例研究1:通过EHR采矿进行药物回收
范德比尔特大学的研究人员分析了超过3 000万个EHR记录,以查明已经批准用于其他条件的药物,从而改进对甘油的控制。他们的算法将niclosamide[(一种抗螺旋体)标为一个可激活AMPK并减少肝糖生产的候选人。随后进行的临床研究证实了其功效,在2型糖尿病患者的第二阶段试验显示,在12周内HbA1c的治疗率下降了0.6%。该项目在3年内从假设数据转移到临床数据,这是正常时间线()的一小部分。同一小组目前正在使用这一方法来筛选β-细胞再生化合物,已经确定了目前处于临床验证中的4个候选人。
案例研究2:个人化治疗的基因组分
2型糖尿病患者表现出相当的异质性,以对付常见口服药物硫化物。由 Broad Institute 领导的联合体对15,000名患者进行了多族裔的GWAS元分析,并确定了 CYP2C9基因中预测药物清关和低血症风险增加的一个变体。利用这一发现,一个大型保健系统对硫化物酶患者进行了药物基因组测试,将不良事件减少了40%。这一精确方法目前正在应用到新疗法中,公司使用多生风险分数对试验参与者进行隔离( NEJM)。
案例研究3:Beta-Cell保护生物标志的机器学习
预防β-细胞下降是1型糖尿病的主要目标。该模型确定了一个组合,由 JDRF和 IBM Watson Health组成的团队,在 Net研究中培训了2 500名患者的C-peptide水平、自体特征和CGM数据。该模型确定了三种循环蛋白(miR-375,GAD65,和IL-1Ra)的组合,预测了即将到的β-细胞丧失,准确度为85%。这一生物标记仪板目前被用作抗CD3抗体(teplizumab)第二阶段试验的替代终点,有可能缩短研究期限。该方法已推广到2型糖尿病,从 Kowa制药中平行模型中采用了蛋白和甲骨化特征,以识别可能从早期综合疗法中得益的快速β-细胞衰减的患者。
未来方向和挑战
人工智能与大数据的结合,将进一步加速糖尿病药物的发现。
多观测一体化和数字双胞胎
古格尔的深维力和 Cellary 将多相机数据与电子健康记录结合起来,为个别患者创造“数码双胞胎 ” 。 这些虚拟拷贝可以在数千个药物条件下模拟,预测在任何人类试验前的疗效和毒性。 由] Takeda制药公司 开发的实验研究利用数字双胞胎在维持统计能力的同时将第二阶段的试诊率降低40%。 [ 欧盟委员会的糖尿病数字双胞胎[D2D]项目目前正在构建针对患者的模式,其中包含CGM、饮食、锻炼和在脑中敏感度数据,以实时优化治疗选择。
小说分子候选人的基因AI
基因对抗网络(GANs)和变压器模型现在正在从头设计出新的小分子和生物记录。在2023年,[ Insilico Medicine [ 宣布了一个完全由AI发现的糖尿病肾病的候选者,在临床前仅18个月发育后,AI进入了第一阶段临床试验。分子的目标是通过分析从10,000个糖尿病肾样本中提取的蛋白质数据,确定PHD2抑制的新途径。同样, Recurion Pharts 利用了200万个细胞影像上的中线粒分筛查平台,找出一种在β细胞中逆克毒性的化合物,目前是在第一阶段试验中。
另一个令人兴奋的发展是使用大型语言模型(LLMs)来挖掘用于药物-目标关系的生物医学文献。 BioGPT和PubMedBERT[]已经进行了微调,从摘要中提取出潜在的糖尿病药物目标,实现了超过80%的精度,并确定了50个新颖候选基因,这些基因后来在倒闭实验中得到了验证。
可携带数据整合和持续监测
遗传基因学和健身跟踪仪的普及正在产生前所未有的生理数据。 研究人员目前正在将这些流与脑内链结合,以获取临床环境外药物的实时反应。 例如,来自 斯克里普斯翻译研究所的研究[ 利用了8,000患者的遗传基因学数据,表明晚间糖分变化比仅HbA1c就更能预测治疗失败。 这一指标现在被作为一周一次胰岛素试验的早期试验的探索终点,可能将样本尺寸降低30%,而使用HbA1c作为主要终点。
可携带数据也使得可以对不良事件进行远程监测. Apple Heart Research方法正在被调整用于糖尿病:一个大型的SGLT2抑制剂上市后监测方案使用智能观察检测瀑布并同步实时地发现下垂事件,警报直接发送给临床试验调查员.
道德和监管考虑
使用大数据提出了重要的伦理问题。必须解决数学偏差、数据隐私和二级数据使用的知情同意。 FDA的“数字健康卓越中心”[正在开发验证基于AI的生物标志和终点的框架。此外,像所有我们研究方案[的努力强调数据透明度和社区参与以确保数据集中的多样化代表性。对18个大型糖尿病生物库的2024年分析发现,只有12%的参与者是非洲血统,强调开发可能无法在人群中同等发挥作用的治疗方法的风险。 诸如H3AAB和纽约基因中心PING研究等举措旨在通过招聘代表不足的群体专门从事糖尿病相关基因组研究来缩小这一差距。
超越数据西洛斯
尽管取得了进展,但专利药品数据与公共数据集的大规模整合仍然具有挑战性。 诸如加速2型糖尿病药品伙伴关系[AMP T2D]等举措将工业、学术界和监管机构聚集在一起,共享竞争前的数据。AMP T2D已经帮助发现了18个新的药物目标,包括PTPN1和DYRK1A。 伙伴关系最近扩展为“数据公用系统 ” , 提供基于云的渠道,从10万多患者获得统一的多相机数据集,并配有联合查询工具,使研究人员能够分析数据而无需复制数据,从而解决许多隐私和知识产权问题。
另一个关键的发展是出现了以区块链为基础的数据市场。 健康环境和海洋议定书[现在允许患者直接与研究人员分享其环境健康指数和基因组数据,以换取补偿,绕出机构仓位。 一个涉及5,000名一等糖尿病患者的试点证明了这种方法的可行性,70%的参与者完成了12个月的数据共享期,并生成了三家制药公司使用的20多亿CGM数据点。
结论
分析大数据不仅仅是糖尿病发现的渐进改进 — — 这是一种范式转变。 通过基于强健遗传证据的识别目标、预测针对患者的反应、优化试验设计和利用现实世界的数据,研究人员可以减少传统管道特有的时间、成本和自然减速率。 药物再用、基因组分分解和数字双子模拟等故事表明大数据已经在产生现实世界的影响。 随着技术进步和数据共享的扩大,AI和大数据之间的协同效应有望提供更准确、有效和个性化的糖尿病治疗,最终改善全世界数亿人的生活。 下一个十年,我们很可能看到第一个完全由AI发现的糖尿病治疗方法进入市场,而我们才刚刚开始利用这些数据的洞察。