Table of Contents
Понимание распознавания образов в скрининге диабетической сетчатки с помощью ИИ
Диабетическая ретинопатия (ДР) остается одной из наиболее значительных причин предотвратимой слепоты среди взрослых трудоспособного возраста во всем мире. По оценкам Всемирной организации здравоохранения (ВОЗ): 422 миллиона человек живут с диабетом, и примерно у трети из них будет развиваться некоторая форма диабетической ретинопатии. Состояние прогрессирует на этапах - от легкой непролиферативной диабетической ретинопатии до пролиферативной диабетической ретинопатии и диабетического макулярного отека - каждый увеличивает риск необратимой потери зрения. Раннее выявление с помощью регулярного скрининга является единственной наиболее эффективной стратегией предотвращения слепоты. Тем не менее, глобальная нехватка квалифицированных офтальмологов и огромный объем пациентов, нуждающихся в ежегодных экзаменах, создают огромный разрыв в уходе. Искусственный интеллект, особенно модели глубокого обучения, обученные распознаванию образов, появился в качестве мощного инструмента для преодоления этого разрыва, позволяя масштабируемый, точный и экономически эффективный скрининг.
В основе этих систем ИИ лежит распознавание образов: способность алгоритмов идентифицировать и интерпретировать клинически релевантные функции на изображениях сетчатки. В отличие от традиционных подходов к компьютерному зрению, которые полагаются на ручные правила, современные модели глубокого обучения учатся непосредственно на основе данных. Они обнаруживают сложные шаблоны - такие как микроаневризмы, точечные и пятнистые кровоизлияния, жесткие экссудаты, пятна хлопчатобумажной шерсти, венозные бисеры и неоваскуляризация - которые характеризуют различные стадии диабетической ретинопатии. Эти шаблоны часто слишком тонкие, чтобы даже опытные клиницисты могли постоянно обнаруживать, но ИИ может отмечать их с высокой чувствительностью и специфичностью. Понимание того, как распознавание образов работает в этом контексте, имеет важное значение для разработчиков, клиницистов и администраторов здравоохранения, стремящихся эффективно развертывать инструменты скрининга с помощью ИИ.
Главная Технологии: как ИИ учится распознавать шаблоны
Распознавание образов в скрининге диабетической сетчатки с помощью ИИ опирается преимущественно на сверточные нейронные сети (CNN), класс архитектур глубокого обучения, предназначенных для обработки данных, подобных сетке, таких как изображения. CNN состоит из слоев фильтров, которые свершаются по входному изображению, обнаруживая все более абстрактные особенности — кромки, текстуры, формы и, в конечном счете, специфичные для поражения паттерны. Обучение этих сетей требует обширных наборов данных помеченных фотографий сетчатки. Например, общедоступный набор данных для выявления диабетической ретинопатии сетчатки содержит десятки тысяч изображений, оцененных экспертами. Во время обучения модель итеративно корректирует свои внутренние параметры, чтобы минимизировать разницу между своими предсказаниями и наземными ярлыками правды. На протяжении миллионов итераций она интернализует визуальные сигнатуры патологии.
Одной из ключевых сильных сторон CNN является их способность изучать иерархические представления. Ранние слои обнаруживают низкоуровневые особенности, такие как яркие пятна (возможные экссудаты) или небольшие темные круги (потенциальные микроаневризмы). Более глубокие слои объединяют их в более сложные паттерны — кластеры кровоизлияний, зоны с аномальным ростом сосудов — которые соответствуют клинически определенной тяжести заболевания. Это иерархическое обучение отражает, в некотором роде, когнитивный процесс экспертов-людей, которые сначала сканируют отдельные поражения, прежде чем интегрировать результаты в глобальную оценку. Однако ИИ может обрабатывать сотни изображений в час без усталости, и его производительность может быть настроена на чувствительность (ловить почти все случаи реферативного DR) или специфичность (минимизация ложных срабатываний, которые приводят к ненужным рефералам).
Сбор данных и соображения качества
Разработка надежной системы ИИ начинается со сбора данных. Качество и разнообразие обучающих изображений напрямую влияют на способность модели обобщать различные популяции, типы камер и условия освещения. В идеале наборы данных должны включать изображения из нескольких этнических групп, возрастов и тяжести заболеваний. На практике многие ранние модели были обучены преимущественно на наборах данных из европейских или восточноазиатских популяций, что привело к снижению точности при применении к африканским или латиноамериканским когортам. Для решения этой проблемы такие организации, как Национальный институт глаз Фонд исследований, которые собирают различные изображения сетчатки. Кроме того, изображения должны быть захвачены в соответствии со стандартизированными протоколами - правильная фокусировка, соответствующее освещение и правильная центрация - для уменьшения артефактов, которые путают распознавание образов.
Другим критическим фактором является разрешение изображения. Современные камеры на глазу производят изображения с разрешением от 5 до 20 мегапикселей. Изображения с более низким разрешением могут заслонять небольшие повреждения, такие как микроаневризмы, которые могут составлять всего 10-100 микрон в диаметре. Модели ИИ часто используют изображения с фиксированным размером ввода (например, 512×512 пикселей) для вычислительной эффективности, но это может принести в жертву мелкие детали. Исследователи разработали подходы с несколькими разрешениями, которые анализируют изображения в разных масштабах, имитируя, как клиницисты увеличивают и выводят изображения. Например, глобальный вид обнаруживает большие кровоизлияния, в то время как обрезанный пластырь с высоким разрешением исследует кандидатов на микроаневризму. Такие стратегии улучшают распознавание образов без существенного увеличения вычислительной стоимости.
От сырых изображений к действенным инсайтам: трубопровод развития
Создание готового к производству инструмента скрининга ИИ включает в себя четко определенный конвейер, охватывающий аннотацию данных, обучение модели, проверку, нормативное оформление и клиническую интеграцию. Каждый шаг зависит от надежных возможностей распознавания образов. Давайте подробно рассмотрим эти этапы.
Аннотация к книге: Labeling the Patterns
Аннотированные изображения служат золотым стандартом для контролируемого обучения. В контексте диабетической ретинопатии опытные грейдеры — лицензированные офтальмологи или сертифицированные специалисты по сетчатке — назначают оценку степени тяжести каждому изображению. Наиболее распространенной системой классификации является шкала тяжести Международной клинической диабетической ретинопатии (ICDR), которая классифицирует DR на пять уровней: отсутствие видимой ретинопатии, мягкая NPDR, умеренная NPDR, тяжелая NPDR и пролиферативный DR. Диабетический макулярный отек (DME) — это отдельная классификация, основанная на наличии экссудатов или утолщения сетчатки в пределах одного диаметра диска фовеи.
Аннотация трудоемкая и склонна к межклассовой изменчивости. Даже специалисты расходятся во мнениях по пограничным случаям. Для повышения согласованности многие проекты используют двухэтапный процесс: первичный градуир маркирует каждое изображение, а старший градуар рассматривает случайную выборку. Разногласия выносятся третьим экспертом. Некоторые исследовательские группы в настоящее время используют инструменты аннотации с помощью ИИ, которые предварительно идентифицируют подозрительные области, позволяя людям-градурам сосредоточиться на проверке, а не на сканировании всего изображения. Этот гибридный подход сокращает время аннотации до 40% при сохранении высокого качества.
Тренировка распознавателя шаблонов
После сборки аннотированных изображений следующая задача — обучение модели. Разработчики разделяют набор данных на наборы обучения (обычно 70-80%), валидации (10-15%) и теста (10-15%). Тренинговый набор используется для обновления весов модели; набор проверки направляет настройку гиперпараметра (скорость обучения, количество слоев, скорость отсева); тестовый набор обеспечивает объективную оценку производительности в реальном мире. Обычно используется трансфертное обучение: CNN предварительно обученный на большом наборе данных естественного изображения (например, ImageNet) тонко настроен на изображения сетчатки. Это распознавание шаблонов скачков начинается, потому что ранние слои уже изучили общие функции, такие как края и текстуры, уменьшая количество меченых медицинских данных, необходимых.
Во время обучения увеличение данных имеет решающее значение для повышения надежности. Случайные вращения, переворачивания, корректировки яркости и изменения контраста имитируют разнообразие реальных изображений, с которыми столкнется модель. Без увеличения модель может перестраиваться под конкретные условия освещения или бренды камеры, нарушая обобщение. После обучения модель оценивается с использованием таких показателей, как площадь под кривой рабочих характеристик приемника (AUC-ROC), чувствительность, специфичность, положительная прогностическая ценность и отрицательная прогностическая ценность. Для диабетической ретинопатии чувствительность не менее 90% для обнаружения реферабельного DR (умеренный NPDR или хуже) часто считается минимальным допустимым порогом.
Пути валидации и регулирования
Перед развертыванием инструменты скрининга с помощью ИИ должны пройти тщательную клиническую проверку. Управление по контролю за продуктами и лекарствами США (FDA) установило путь для медицинских устройств на основе ИИ / мл, требуя доказательств того, что модель последовательно работает на различных клинических сайтах и популяциях пациентов. В 2018 году FDA разрешило первую систему скрининга диабетической ретинопатии на основе ИИ, IDx-DR (теперь называемую LumineticsCore), которая анализирует изображения, полученные совместимой камерой глазного дна, и обеспечивает результат точки ухода. Знаковое исследование продемонстрировало чувствительность 87,2% и специфичность 90,7% для обнаружения более легкой DR. С тех пор несколько других систем получили нормативный клиренс или достигли сопоставимых результатов в проспективных исследованиях.
Валидация должна также оценивать алгоритмическую справедливость. Модель, которая хорошо работает в одной демографической группе, но плохо в другой, может усугубить неравенство в здравоохранении. Для мониторинга реальной производительности и обнаружения дрейфа требуется наблюдение за постиндустриальным рынком — изменения в точности распознавания образов из-за новых моделей камер, сдвига населения или вариаций распространенности заболеваний. Непрерывное обучение, где модель обновляется новыми данными, является активной областью исследований, хотя нормативные рамки для таких адаптивных алгоритмов все еще развиваются.
Клинические преимущества скрининга, основанного на распознавании образов
При интеграции в клинические рабочие процессы инструменты скрининга с помощью ИИ обеспечивают измеримые преимущества, выходящие за рамки простой диагностической точности. Эти преимущества напрямую связаны с возможностями распознавания образов моделей глубокого обучения.
Повышение точности и последовательности
Человеческие грейдеры проявляют внутринаблюдательную и межнаблюдательную изменчивость, особенно для легких NPDR, где микроаневризмы редки. Исследование, сравнивающее оценку ИИ с группой специалистов по сетчатке, показало, что система ИИ достигла более высокого согласия с консенсусной оценкой, чем любой отдельный специалист. Эта согласованность жизненно важна для крупномасштабных программ скрининга, где единые критерии должны применяться к тысячам пациентов. Алгоритмы распознавания образов не устают, не отвлекаются или не зависят от предыдущих случаев. Они применяют одни и те же изученные критерии к каждому изображению, устраняя основной источник диагностической ошибки.
Эффективность и пропускная способность
В типичных клиниках офтальмологии обученный грейдер может оценивать от 30 до 50 изображений в час. Системы ИИ могут обрабатывать от 200 до 500 изображений в час на стандартном оборудовании, с облачными решениями, масштабирующимися еще выше. Эта пропускная способность позволяет системам здравоохранения проводить скрининг целых диабетических популяций в течение короткого периода времени. Например, Национальная служба здравоохранения в Соединенном Королевстве пилотировала скрининг диабетической ретинопатии с помощью ИИ на нескольких участках, сообщая, что технология сократила время от захвата изображения до получения уведомления от недель до менее 24 часов. Раннее обнаружение затем позволяет своевременно направлять на лечение - фотокоагуляция, инъекции против VEGF или витрэктомия - что может снизить риск тяжелой потери зрения до 95% при раннем применении.
Расширение доступа в недостаточно обслуживаемых регионах
Во многих странах с низким и средним уровнем дохода (ССНД) на 100 000 населения приходится менее одного офтальмолога по сравнению с пятью-десяти на 100 000 населения в странах с высоким уровнем дохода. Мобильные микроавтобусы, оснащенные портативными камерами для глазного дна и программным обеспечением для искусственного интеллекта с возможностью автономного подключения, могут обеспечить обнаружение диабетической ретинопатии в отдаленных деревнях. В Индии система ухода за глазами Aravind развернула скрининг на основе искусственного интеллекта в сельских лагерях, достигнув более 90% чувствительности с помощью облачной обработки. Модель распознавания образов была обучена частично на местных наборах данных для учета более высокой распространенности катаракты и других сопутствующих заболеваний. Эти инициативы демонстрируют, что ИИ может демократизировать доступ к высококачественной диагностической экспертизе, уменьшая предотвратимую слепоту во всем мире.
Проблемы и подводные камни в распознавании моделей диабетической ретинопатии
Несмотря на свои обещания, скрининг диабетической ретинопатии с помощью ИИ не без ограничений. Понимание этих проблем имеет важное значение для ответственного развертывания.
Качество изображения и артефакты
Плохое качество изображения — размытие, недо- или сверх-обнаружение, артефакты ресниц, пыль на линзах — может ухудшить распознавание образов. Многие модели ИИ обучаются на чистых, хорошо ориентированных изображениях из клинических испытаний, но реальные настройки производят значительное количество неразлагаемых изображений. Некоторые системы включают встроенный модуль оценки качества, который отклоняет плохие изображения и побуждает оператора повторно захватывать. Другие пытаются спасти частично информативные изображения, но это рискует упустить повреждения. Интеграция классификаторов качества изображения с конвейерами распознавания образов остается активной исследовательской задачей.
Конфиденциальность данных и безопасность
Сетчатые изображения считаются защищенной информацией о здоровье в большинстве юрисдикций. Облачный скрининг ИИ требует надежного шифрования, анонимизации и соблюдения правил, таких как HIPAA в США и GDPR в Европе. Некоторые поставщики медицинских услуг предпочитают локальное развертывание для хранения данных в своей сети, но это ограничивает доступ к последним обновлениям моделей. Федеративное обучение - где модели обучаются в нескольких учреждениях без обмена сырыми данными - предлагает многообещающий компромисс, позволяя улучшить распознавание образов у разных групп населения при сохранении конфиденциальности.
Обобщение и предубеждения
Если обучающие наборы данных не имеют разнообразия, модель распознавания образов может плохо работать на недопредставленных группах. Например, более темная пигментация дна может влиять на контраст, а некоторые этнические группы имеют разные модели распространенности диабетической ретинопатии. Исследование 2020 года показало, что модель ИИ, обученная в первую очередь на кавказских глазах, имела более низкую специфичность для афроамериканских пациентов. Разработчики должны обеспечить, чтобы наборы данных валидации отражали целевую популяцию. Регулирующие органы теперь требуют демографического анализа подгрупп в представлениях до рынка. Непрерывный мониторинг после развертывания также необходим для выявления и исправления смещения.
Клиническая интеграция и рабочий процесс
Инструмент скрининга ИИ так же хорош, как и его интеграция в клинический рабочий процесс. Если система неуклюжая, медленная или создает ложные тревоги, которые тратят время клинициста, принятие пострадает. Лучшие практики включают в себя предоставление оценки доверия наряду с бинарными результатами, выделение подозрительных областей на изображении (функция, называемая картами заметности) и помечение случаев, которые требуют человеческого обзора. Модель распознавания образов не должна быть черным ящиком; методы объяснимости, такие как Gradient-взвешенная карта активации класса (Grad-CAM), могут накладывать тепловые карты на исходное изображение, показывая, какие области повлияли на решение. Это создает доверие и помогает клиницистам проверять результаты ИИ.
Будущие направления: развитие распознавания образов за пределами диабетической ретинопатии
Методы распознавания образов, разработанные для скрининга диабетической ретинопатии, уже адаптируются для других заболеваний сетчатки — возрастной макулярной дегенерации, глаукомы, гипертонической ретинопатии и даже системных состояний, таких как прогнозирование риска сердечно-сосудистых заболеваний. Исследователи изучают мультимодальный ИИ, который сочетает изображения глазного дна с оптической когерентной томографией (OCT), клинические данные (кровяное давление, HbA1c) и геномную информацию для более комплексной оценки риска. Кроме того, слабо контролируемые и полуконтролируемые методы обучения уменьшают бремя аннотации, используя немаркированные или частично меченные изображения.
Еще одним рубежом является распознавание образов в режиме реального времени в сверхширокоугольной визуализации, которая захватывает 200 ° сетчатки по сравнению с 30-50° стандартных камер глазного дна. Это более широкое поле выявляет периферические поражения, которые могут указывать на более агрессивное заболевание, но повышенная сложность требует моделей, способных обрабатывать большие панорамы. Достижения в архитектурах на основе трансформаторов, первоначально разработанных для обработки естественного языка, в настоящее время применяются к медицинской визуализации и могут превзойти CNN в захвате пространственных зависимостей на большие расстояния, улучшая обнаружение тонких шаблонов, таких как ранние пятна хлопковой шерсти.
Наконец, интеграция с платформами телемедицины позволит осуществлять хранение и пересылку или синхронную дистанционную оценку. Поставщики первичной медико-санитарной помощи или оптометристы могут захватывать изображения, отправлять их в облачный сервис ИИ и получать результаты в течение нескольких минут. Последующие встречи могут быть автоматически забронированы для пациентов с реферативным DR. По мере расширения сетей 5G и усиления периферийных вычислений распознавание образов с помощью ИИ станет невидимой, но важной частью обычной диабетической помощи, помогая сохранить зрение миллионам людей во всем мире.
Основой этой трансформации остается распознавание образов. Преподавая машины, чтобы увидеть, что может пропустить человеческий глаз, мы не заменяем клиницистов - мы расширяем их способности, делая скрининг на уровне экспертов доступным в любое время и в любом месте. Постоянное сотрудничество между учеными-данными, офтальмологами, регулирующими органами и должностными лицами общественного здравоохранения обеспечит, чтобы эти инструменты развивались этически и справедливо, выполняя обещание ИИ бороться с диабетической ретинопатией и ее разрушительными последствиями.