Table of Contents

Введение: эпидемия диабета и обещание больших данных

Сахарный диабет, охватывающий диабет 1 типа, диабет 2 типа и гестационные формы, остается одной из самых насущных глобальных проблем здравоохранения. По данным Международной диабетической федерации, в 2021 году около 537 миллионов взрослых людей жили с диабетом, причем прогнозы взлетели до 783 миллионов к 2045 году. Болезнь накладывает ошеломляющее экономическое бремя, обходится примерно в 966 миллиардов долларов в год в расходы на здравоохранение. Традиционное открытие лекарств, печально известный медленный и дорогостоящий процесс, часто занимает 10-15 лет и более 2,6 миллиарда долларов, чтобы вывести на рынок одну новую терапевтическую силу. В этом контексте аналитика больших данных возникла как преобразующая сила, сжимающая сроки открытия и обеспечивающая точные подходы, которые были невообразимы десять лет назад.

Большие данные в здравоохранении относятся к массивным, сложным наборам данных, генерируемым электронными медицинскими записями (EHR), геномным секвенированием, носимыми устройствами, медицинской визуализацией и клиническими испытаниями. При интеграции и анализе с использованием машинного обучения, искусственного интеллекта и передовой биостатистики эти данные раскрывают скрытые закономерности, биомаркеры и терапевтические цели. Для исследований диабета большие данные ускоряют идентификацию новых кандидатов на лекарства, оптимизируют конструкции клинических испытаний и персонализируют схемы лечения. Эта статья расширяет то, как аналитика больших данных меняет ландшафт терапевтического открытия диабета, предоставляя подробную информацию, реальные примеры и будущие направления.

Расширяющаяся роль больших данных в исследованиях диабета

Большие данные — это не единая технология, а экосистема источников данных и аналитических инструментов.В исследованиях диабета сходятся пять первичных потоков данных:

  • Электронные записи о здоровье : Продольные истории болезни пациентов, включая диагнозы, лекарства, лабораторные значения (например, HbA1c, глюкоза натощак) и сопутствующие заболевания. EHR теперь захватывают миллионы данных за годы пациентов, что позволяет проводить крупномасштабные обсервационные исследования, которые были бы логистически невозможными с традиционными рандомизированными испытаниями.
  • Геномные и мультиомические данные: Секвенирование всего генома, транскриптомика, протеомика и метаболомика у тысяч людей, выявляющие генетические предрасположенности и молекулярные подтипы. Стоимость секвенирования генома человека упала ниже 600 долларов, что делает возможным генерирование наборов данных в масштабе популяции, таких как 500 000 экзомов британского Биобанка.
  • Носимые устройства и датчики: Непрерывные глюкозомониторы (CGM), фитнес-трекеры и интеллектуальные инсулиновые ручки, генерирующие физиологические данные в реальном времени. Один датчик CGM производит более 288 показаний глюкозы в день, предлагая плотные временные данные, которые могут выявить динамические реакции на вмешательства.
  • Данные клинических испытаний: Наследственные наборы данных испытаний плюс реальные данные (RWE) из обсервационных исследований и реестров. Фармацевтическая промышленность содержит петабайт ранее изолированных данных, которые в настоящее время добываются для вторичной информации.
  • Публичные и имущественные базы данных: такие ресурсы, как Британский биобанк, Исследовательская программа «Все мы», FinnGen и Инициатива по генетике диабета, предоставляют открытые доступные данные для ускорения открытия.

Интеграция этих разрозненных источников данных представляет собой огромные проблемы. Гетерогенность данных, недостающие значения, ограничения конфиденциальности (HIPAA / GDPR) и различия в стандартах данных требуют надежной гармонизации данных и безопасных подходов к обучению. Исследователи все чаще используют платформы, поддерживающие аналитику, сохраняющую конфиденциальность, такую как синтетическая генерация данных и дифференциальная конфиденциальность, чтобы разблокировать идеи без ущерба для конфиденциальности пациентов. Например, сеть Науки о данных в области здравоохранения и информатики (OHDSI) стандартизирует данные EHR от более чем 300 миллионов пациентов в 20 странах, используя общую модель данных, что позволяет проводить анализ в глобальном масштабе.

Знаковым примером больших данных в действии является клиническое исследование ремиссии диабета (DiRECT) , в котором использовались данные EHR для выявления пациентов, которые могли достичь ремиссии посредством ограничения калорий. Пост-хок анализы тысяч участников исследования выявили метаболические сигнатуры, которые предсказывали успех, что привело к уточненным критериям отбора пациентов и расширенному финансированию последующих испытаний. Другим заметным усилием является исследование ACCORD, обширный набор данных которого был повторно проанализирован несколько раз, чтобы выявить подгруппы с дифференциальными сердечно-сосудистыми реакциями на интенсивный контроль глюкозы.

Как анализ данных ускоряет обнаружение наркотиков

Спектр открытия лекарств — от идентификации цели до доклинических испытаний, клинических испытаний и одобрения регулирующих органов — выигрывает от больших данных на каждом этапе. Ниже мы рассмотрим ключевые механизмы, с помощью которых анализ данных ускоряет прогресс в направлении новых методов лечения диабета.

Идентификация и валидация целей

Исторически цели лекарств были обнаружены с помощью случайности или кропотливых лабораторных экспериментов. Сегодня алгоритмы машинного обучения добывают геномные и транскриптомные наборы данных для точного определения генов, белков и путей, причинно связанных с диабетом. Например, исследования ассоциации генома (GWAS) выявили более 400 генетических локусов, связанных с диабетом типа 2. Однако только часть проверена как цели, поддающиеся лечению. Аналитика больших данных - особенно такие методы, как Менделевская рандомизация и исследования ассоциации в масштабах транскриптома - позволяют исследователям расставлять приоритеты для целей с сильными причинными доказательствами, снижая риск поздней стадии сбоя.

Одним из заметных успехов является класс агонистов рецепторов GLP-1, в настоящее время являющийся основой терапии диабета. Ранние геномные анализы указывали на ген GLP-1R в качестве ключевого регулятора секреции инсулина. Последующие крупномасштабные протеомные исследования с использованием данных из UK Biobank и FinnGen FinnGen подтвердили, что генетические варианты, влияющие на экспрессию GLP-1R, связаны с более низкой глюкозой натощак и снижением сердечно-сосудистых событий. Эти результаты предоставили биологическое обоснование для разработки таких препаратов, как семаглутид и тирзепатид, которые произвели революцию в управлении диабетом. Совсем недавно модели глубокого обучения, которые предсказывают белковые структуры (например, AlphaFold), идентифицировали аллостерические сайты связывания на GLP-1R, что позволяет создавать перорально биодоступные небольшие молекулы с меньшим количеством побочных эффектов, чем инъ

Другой пример взят из консорциума AMP T2D, который интегрировал транскриптомные данные с островков поджелудочной железы человека с сигналами генетической ассоциации для идентификации гена TCF7L2 в качестве высоконадежной мишени. Функциональные исследования показали, что TCF7L2 модулирует передачу сигналов Wnt в бета-клетках, и ингибиторы малых молекул этого пути в настоящее время находятся в доклиническом развитии.

Прогнозное моделирование реакции на наркотики

Одно из самых интересных применений больших данных - прогнозирование того, как отдельные пациенты будут реагировать на данный препарат. Традиционные испытания показали средние эффекты лечения среди разнородной популяции, часто отсутствующей субпопуляции, которая приносит пользу (или вредна). Модели машинного обучения, обученные на базовых лабораторных значениях, демографии, геномных маркерах и предшествующей истории лекарств, могут расслоить пациентов на отдельные группы респондентов.

Например, исследование, проведенное Стэнфордской медициной , использовало данные EHR от 10 000 пациентов с диабетом 2 типа для прогнозирования недостаточности метформина , опубликованные в Nature Medicine. Модель достигла AUC 0,85, идентифицируя пациентов, которым потребуется дополнительная терапия в течение 18 месяцев. Такие инструменты могут информировать критерии включения клинических испытаний, гарантируя, что будут зарегистрированы только вероятные ответчики — сокращение размеров выборки, снижение затрат и ускорение времени выхода на рынок.

Помимо метформина, были разработаны оценки полигенного риска (PRS) для прогнозирования ответа на сульфонилмочевины, тиазолидиндионы и ингибиторы DPP-4. Метаанализ 2024 года 12 000 пациентов в UK Biobank показал, что у лиц с самым высоким децилем PRS для ответа сульфонилмочевины было в 2,3 раза больше снижение HbA1c по сравнению с теми, кто находился в самом низком дециле. Фармацевтические компании теперь используют PRS для обогащения испытаний фазы II для быстрого доказательства концепции, потенциально сокращая сроки разработки на 1-2 года.

Аналогичным образом, алгоритмы глубокого обучения, анализирующие данные о ЦГМ, могут прогнозировать гипогликемические события за несколько дней. Модель, разработанная Google Health и JDRF, достигла 92% чувствительности при прогнозировании ночной гипогликемии, используя только шесть часов предыдущих данных о ЦГМ. Эти прогнозы не только улучшают безопасность пациентов, но и позволяют фармацевтическим компаниям разрабатывать более короткие, более информативные исследования фазы II для новых аналогов инсулина или методов защиты бета-клеток.

Оптимизация дизайна клинических испытаний

Клинические испытания являются шагом к ограничению скорости разработки лекарств. Анализ больших данных уменьшает это узкое место за счет:

  • Адаптивные пробные конструкции: Используя промежуточные данные из нескольких рук, байесовские статистические модели корректируют коэффициенты рандомизации или рано снижают неэффективные руки.Руководство FDA по адаптивным конструкциям поощряет этот подходРуководство FDA При диабете Верификационное исследование использовало бесшовный адаптивный дизайн фазы II/III, который сэкономил 18 месяцев и 40 миллионов долларов.
  • Цифровые двойники: искусственно созданные синтетические средства управления, основанные на исторических данных о пациентах, уменьшают потребность в плечах плацебо, сокращая время регистрации на 30-50%.Недавний пилот Такеда Фармацевтика использовал цифровых близнецов для моделирования руки плацебо с 200 пациентами, заменяя фактическое зачисление и уменьшая продолжительность испытаний на 14 месяцев при сохранении статистической мощности.
  • Набор пациентов : Природный язык обработки извлекает критерии приемлемости из EHRs, чтобы соответствовать пациентам к испытаниям. Исследование Центра Mercatus показало, что такие инструменты повышают эффективность набора на 40%. Платформа TrialReach теперь соответствует диабетическим пациентам более 2000 активных испытаний во всем мире, с 3-кратным увеличением показателей регистрации для редких подтипов диабета 1 типа.
  • Выбор сайта: Предиктивные модели идентифицируют клинические сайты с высоким потенциалом регистрации и хорошим соблюдением протокола, минимизируя задержки. Модель, обученная на исторических данных из 500 испытаний диабета, достигла 25%-ного сокращения времени активации сайта.

Например, в исследовании RADICAL-HF для сердечной недостаточности, связанной с диабетом, использовалась облачная аналитическая платформа для согласования данных с 30 сайтов, что позволило осуществлять мониторинг в реальном времени и адаптивные изменения. Испытание завершило регистрацию на шесть месяцев раньше запланированного срока и предоставило ранние доказательства новой комбинации ингибиторов SGLT2.

Другой инновационный подход заключается в использовании продольных данных EHR для построения согласованных с историческими контрольными показателями показателей склонности. Испытание RECOVERY для лечения диабета 2 типа показало, что такие внешние контрольные группы могут снизить потребность в параллельных группах плацебо до 40%, при этом все еще производя надежные оценки эффективности, соответствующие традиционным рандомизированным конструкциям.

Реальные данные и пострыночный надзор

После того, как препарат выходит на рынок, большие данные продолжают играть решающую роль. Реальные данные (RWE) из страховых требований, EHR и реестров помогают выявлять редкие нежелательные явления, проверять эффективность в более широких популяциях и открывать новые показания (перепрофилирование лекарств). Программа реальных доказательств FLT:0]FDA в реальном мире FDA RWE Framework ] приняла RWE для поддержки расширенной маркировки для нескольких препаратов от диабета, включая использование ингибиторов SGLT2 для сердечной недостаточности на основе данных 350 000 пациентов в системе здравоохранения США Департамент по делам ветеранов .

Классический случай - перепрофилирование метформина для профилактики преддиабета.Пост-хок-анализ набора данных Программы профилактики диабета , в сочетании с данными EHR от 100 000 пациентов, подтвердил, что метформин снижает прогрессирование диабета 2 типа у лиц с высоким риском. Это привело к клиническим рекомендациям, рекомендующим метформин для преддиабета, практика, которая в настоящее время экономит миллиарды в будущих расходах на здравоохранение. Совсем недавно анализ больших данных из шведского Национального регистра диабета (покрывающий 500 000 пациентов) вызвал одобрение регулирующих органов для дапаглифлозина при хроническом заболевании почек - новое указание, которое появилось из реальных данных о сердечно-сосудистых исходах.

RWE также обеспечивает непрерывную фармаконадзор. A Корейское исследование обнаружения сигналов с использованием EHR от 2 миллионов пациентов с диабетом выявило три ранее непризнанных взаимодействия между лекарственными средствами, связанных с гипогликемией, что привело к обновленным вставкам пакетов и оповещениям о поддержке клинических решений.

Тематические исследования и истории успеха

Несколько недавних инициатив иллюстрируют ощутимое влияние больших данных на терапевтическое открытие диабета.

Тематическое исследование 1: Переработка лекарств через майнинг EHR

Исследователи из Университета Вандербильта проанализировали более 30 миллионов записей EHR для выявления лекарств, уже одобренных для других состояний, которые могут улучшить гликемический контроль. Их алгоритм пометил никлосамид (антигельминтовый) в качестве кандидата, который активирует AMPK и снижает выработку глюкозы в печени. Последующие доклинические исследования подтвердили его эффективность, а исследование фазы II у пациентов с диабетом 2 типа показало снижение HbA1c на 0,6% в течение 12 недель. Проект переместился от гипотезы к клиническим данным менее чем за три года — часть нормальной временной шкалы Природные научные отчеты . Та же команда теперь использует подход к скринингу бета-клеточных регенеративных соединений, идентифицировав четыре кандидата, которые в настоящее время находятся в доклинической проверке.

Тематическое исследование 2: Геномная стратификация для персонализированной терапии

Пациенты с диабетом 2 типа проявляют значительную гетерогенность в ответ на сульфонилмочевину, обычное пероральное лекарство. Консорциум во главе с Широким институтом выполнил многоэтнический метаанализ GWAS 15 000 пациентов и определил вариант в гене CYP2C9, который предсказывает снижение клиренса лекарств и повышенный риск гипогликемии. Используя этот вывод, большая система здравоохранения внедрила фармакогеномное тестирование для сульфонилмочевины-наивных пациентов, уменьшая нежелательные явления на 40%. Этот точный подход в настоящее время применяется к новым терапевтическим средствам, с компаниями, использующими полигенные оценки риска для стратификации участников исследования NEJM. Более поздняя работа консорциума DIAMANTE расширила это до 100 000 пациентов в пяти родословных, идентифицируя 20 новых вариантов

Тематическое исследование 3: Машинное обучение для биомаркеров защиты бета-клеток

Предотвращение снижения бета-клеток является основной целью для диабета 1 типа. Команда из JDRF и IBM Watson Health обучила модель глубокого обучения уровням С-пептидов, профилям аутоантител и данным CGM от 2500 пациентов в исследовании TrialNet. Модель идентифицировала комбинацию из трех циркулирующих белков (miR-375, GAD65 и IL-1Ra), которые предсказывают неминуемую потерю бета-клеток с точностью 85%. Эта биомаркерная панель в настоящее время используется в качестве суррогатной конечной точки в испытании анти-CD3-антитела (теплизумаб), потенциально сокращая продолжительность исследования на три года. Подход был расширен до диабета 2 типа, где параллельная модель из Kowa Pharmaceuticals использует протеомные и метаболомные про

Будущие направления и вызовы

Интеграция искусственного интеллекта с большими данными способна еще больше ускорить открытие лекарств от диабета.

Многоомичная интеграция и цифровые близнецы

Вместо того, чтобы анализировать геномику, протеомику и метаболомику в изоляции, новые платформы, такие как DeepVariant и Cellarity Google, объединяют данные мультиомики с электронными медицинскими записями для создания «цифровых близнецов» отдельных пациентов. Эти виртуальные копии могут быть смоделированы в тысячах лекарственных условий, предсказывающих эффективность и токсичность перед любым испытанием на людях. Пилотное исследование от Takeda Pharmaceuticals использовало цифровых близнецов для сокращения регистрации на II фазу испытаний на 40% при сохранении статистической мощности. Проект Европейской комиссии Digital Twin for Diabetes (D2D) в настоящее время строит модели для конкретных пациентов, которые включают данные о CGM, диете, физических упражнениях и чувствительности к инсулину для оптимизации выбора терапии в режиме реального времени.

Генерирующий ИИ для новых молекулярных кандидатов

Генеративные состязательные сети (GAN) и трансформаторные модели в настоящее время разрабатывают новые небольшие молекулы и биологические препараты с нуля. В 2023 году Insilico Medicine объявила о кандидате на диабетическую нефропатию, полностью открытую с помощью ИИ, который вошел в клинические испытания фазы I после всего 18 месяцев доклинического развития. Молекула нацелена на новый путь, включающий ингибирование PHD2, идентифицированный посредством анализа протеомных данных из 10 000 образцов диабетических почек. Аналогично, Recursion Pharmaceuticals использовала свою фенотипическую платформу скрининга на 2 миллионах клеточных изображений для идентификации соединения, которое обращает вспять глюкотоксичность в бета-клетках, теперь в испытаниях фазы I.

Еще одним интересным событием является использование больших языковых моделей (LLM) для разработки биомедицинской литературы для отношений «нарко-целевой». BioGPT и PubMedBERT были точно настроены для извлечения потенциальных целей лекарств от диабета из рефератов, достижения точности выше 80% и выявления 50 новых генов-кандидатов, которые впоследствии были подтверждены в экспериментах по нокдауну.

Интеграция носимых данных и постоянный мониторинг

Распространение CGM и фитнес-трекеров генерирует беспрецедентные объемы физиологических данных. Исследователи теперь интегрируют эти потоки с EHR для захвата реальных ответов на лекарства за пределами клинических условий. Например, исследование из Исследовательского трансляционного института Скриппса ] использовало данные CGM от 8000 пациентов, чтобы показать, что ночная изменчивость глюкозы является лучшим предиктором неудачи лечения, чем только HbA1c. Эта метрика теперь принимается в качестве исследовательской конечной точки в ранних фазных испытаниях инсулинов раз в неделю, потенциально уменьшая размеры выборки на 30% по сравнению с использованием HbA1c в качестве основной конечной точки.

Носимые данные также позволяют осуществлять удаленный мониторинг неблагоприятных событий. Методология Apple Heart Study адаптируется для лечения диабета: большая программа постмаркетингового наблюдения за ингибитором SGLT2 использует смарт-часы для обнаружения падений и синкопе для выявления гипогликемических событий в режиме реального времени, с оповещениями, направленными непосредственно исследователям клинических испытаний.

Этические и нормативные соображения

Использование больших данных поднимает важные этические вопросы. Алгоритмическая предвзятость, конфиденциальность данных и информированное согласие на вторичное использование данных должны быть решены. FDA Digital Health Center of Excellence разрабатывает рамки для проверки биомаркеров и конечных точек на основе ИИ. Кроме того, такие усилия, как Все исследовательские программы США , подчеркивают прозрачность данных и участие сообщества в обеспечении разнообразного представления в наборах данных. Анализ 2024 года 18 крупных биобанков диабета показал, что только 12% участников были африканского происхождения, подчеркивая риск разработки методов лечения, которые могут не работать одинаково среди населения. H3Africa и Исследование PING Нью-Йоркского центра генома направлены на устранение этого разрыва путем набора недопредставленных групп специально для геномики, связанной с диабетом.

Преодоление Data Silos

Несмотря на прогресс, масштабная интеграция запатентованных фармацевтических данных с общедоступными наборами данных остается сложной задачей. Инициативы, такие как Ускоряющее партнерство лекарственных средств для диабета 2 типа (AMP T2D) , объединяют промышленность, научные круги и регулирующие органы для обмена предконкурентными данными. AMP T2D уже способствовал открытию 18 новых целевых показателей лекарственных средств, включая PTPN1 и DYRK1A. Партнерство недавно расширилось в «общее использование данных», которое обеспечивает облачный доступ к гармонизированным мультиомическим наборам данных от более чем 100 000 пациентов, с помощью федеративных инструментов запросов, которые позволяют исследователям анализировать данные, никогда не копируя их, решая многие проблемы конфиденциальности и интеллектуальной собственности.

Другим важным событием является появление рынков данных на основе блокчейна. Healthereum и Ocean Protocol теперь позволяют пациентам делиться своими EHR и геномными данными непосредственно с исследователями в обмен на компенсацию, минуя институциональные шахты. Пилот с участием 5000 пациентов с диабетом 1 типа продемонстрировал осуществимость этого подхода, причем 70% участников завершили 12-месячный период обмена данными и создали более 2 миллиардов точек данных CGM, используемых тремя фармацевтическими компаниями.

Заключение

Аналитика больших данных - это не просто постепенное улучшение в открытии лекарств от диабета - это смена парадигмы. Путем обеспечения идентификации целей на основе надежных генетических данных, прогнозирования конкретных ответов пациентов, оптимизации проектов испытаний и использования реальных данных исследователи могут сократить время, стоимость и скорость истощения, характерные для традиционных трубопроводов. Истории о перепрофилировании лекарств, геномной стратификации и цифровых двойных симуляций демонстрируют, что большие данные уже оказывают реальное влияние. По мере развития технологий и обмена данными, синергия между ИИ и большими данными обещает обеспечить более точную, эффективную и персонализированную терапию диабета, в конечном итоге улучшая жизнь сотен миллионов людей во всем мире. В следующем десятилетии, вероятно, будет наблюдаться первый полностью открытый ИИ терапевтический доступ к рынку, преобразованный данными, которые мы только начинаем использовать.