Разработка моделей глубокого обучения для точной диагностики множественной миеломы при визуализации костей
Введение в множественную миелому и диагностические проблемы
Множественная миелома (ММ) является злокачественным заболеванием плазматических клеток, на долю которого приходится примерно 1,8% всех видов рака и примерно 10% гематологических злокачественных новообразований. Болезнь возникает в костном мозге, где аномальные плазматические клетки размножаются неконтролируемо, что приводит к остеолитической костной дисфункции, анемии, почечной недостаточности и иммунной дисфункции. Точная и ранняя диагностика имеет первостепенное значение для улучшения выживаемости и качества жизни, но болезнь часто сопровождается неспецифическими симптомами — усталостью, болью в костях, рецидивирующими инфекциями — которые задерживают обнаружение.
Обычные диагностические пути для ММ включают электрофорез сывороточного белка, анализы свободной легкой цепи, аспирацию и биопсию костного мозга и исследования изображений. Хотя эти методы были золотым стандартом в течение десятилетий, они несут значительные ограничения. Биопсии костного мозга являются инвазивными и пробуют только один участок, потенциально отсутствующие очаговые поражения. Рентгеновские скелетные исследования, долго используемые для выявления литических поражений, имеют низкую чувствительность к ранним или малым поражениям. МРТ и КТ улучшают обнаружение, но являются ресурсоемкими и требуют экспертной интерпретации. Кроме того, ручная оценка медицинских изображений подвержена вариабельности и усталости между наблюдателями, особенно в центрах большого объема. Эти пробелы мотивировали поиск автоматизированных, точных и масштабируемых диагностических инструментов, с глубоким обучением, появляющимся в качестве преобразующего решения.
Глубокое обучение в медицинской визуализации: праймер
Глубокое обучение, подполе машинного обучения, использует многослойные искусственные нейронные сети для автоматического изучения иерархических представлений из данных. В медицинской визуализации сверточные нейронные сети (CNN) стали архитектурой рабочей лошадки, потому что они преуспевают в захвате пространственных иерархий - этапов, текстур, форм и патологических особенностей более высокого уровня. В отличие от традиционных конвейеров компьютерного зрения, которые требуют ручных экстракторов функций, CNN изучают соответствующие функции непосредственно из пиксельных данных во время обучения.
Успех глубокого обучения в таких задачах, как скрининг диабетической ретинопатии, обнаружение узелков легких и классификация рака молочной железы, стимулировал его применение к визуализации костей для ММ. Ключевые достижения включают доступность больших аннотированных наборов данных, мощных графических процессоров и обучения передаче - метод, который предварительно тренирует модель на общем наборе данных изображения (например, ImageNet), а затем тонко настраивает его на меньший медицинский набор данных. Этот подход значительно уменьшает количество меченых данных, необходимых и ускоряет конвергенцию.
Для получения отличного обзора принципов глубокого обучения, применяемых к радиологии, читатели могут ознакомиться с полным обзором Радиологического общества Северной Америки (] Обзор RSNA.
Методология разработки моделей глубокого обучения в костной визуализации
Приобретение и курирование данных
Основой любой надежной системы глубокого обучения является высококачественный, разнообразный и тщательно аннотированный набор данных. Для визуализации костной ткани ММ обычно включает в себя КТ с низкими дозами всего тела, МРТ всего тела или позитронно-эмиссионную томографию (ПЭТ) / КТ. Одно исследование может включать сотни тысяч осевых срезов, каждый из которых требует тщательной маркировки опытными радиологами или гематологами. Аннотации часто принимают форму ограничивающих коробок вокруг литических поражений, масок сегментации для пораженных областей кости или глобального диагноза уровня изображения (положительный / отрицательный для ММ).
Учреждения сталкиваются со значительными препятствиями в сборе данных: проблемы конфиденциальности пациентов (GDPR, HIPAA), гетерогенные протоколы визуализации в центрах, дисбаланс классов (нормальное сканирование намного превышает ненормальное) и чистая стоимость аннотации. Для смягчения этих проблем исследователи разработали полуавтоматизированные инструменты аннотации и использовали общедоступные наборы данных, такие как архив изображений рака (TCIA) или исследование CoMMpass Фонда исследований множественной миеломы (MMRF). Увеличение данных - случайные вращения, сальто, масштабирование, корректировки контраста - еще больше расширяет эффективный размер набора данных и улучшает обобщение модели.
В фундаментальном исследовании Кембриджского университета (FLT:0) Nature Communications, 2020 ] продемонстрирован CNN, обученный более чем 5000 КТ-сканированиям из нескольких стран, достигая чувствительности 92% для обнаружения литических поражений, связанных с MM.
Выбор модели архитектуры
В то время как общие CNN (например, ResNet, DenseNet) могут использоваться для классификации целых сканов или областей, многие исследователи теперь используют архитектуры на основе U-Net для задач сегментации. U-Net, первоначально предназначенный для сегментации биомедицинских изображений, использует структуру кодера-декодера с пропуском соединений, которые сохраняют пространственную информацию. Для MM U-Net может очерчивать точные границы литических поражений, обеспечивая количественные показатели, такие как количество поражений, объем и нагрузка. Гибридные подходы, такие как каскадные CNN, которые сначала идентифицируют подозрительные области, а затем классифицируют их, также набирают тягу.
Механизмы внимания, популяризированные архитектурой Transformer в обработке естественного языка, были адаптированы для медицинской визуализации. Ворота внимания позволяют сети сосредоточиться на клинически значимых областях при подавлении фонового шума. В визуализации костей ММ это означает, что модель может подчеркнуть пери-повреждающие изменения костного мозга, которые могут предшествовать явному литическому разрушению, потенциально позволяя более раннюю диагностику.
Трехмерные (3D) CNN, которые обрабатывают объемные данные напрямую, показали превосходную производительность по сравнению с 2D-анализом с использованием среза, потому что они фиксируют истинную трехмерную природу костных поражений. Однако 3D-модели требуют значительно большего объема памяти и вычислительных ресурсов. Сбалансированный подход заключается в использовании метода 2.5D - подпитывания смежных осевых, корональных и сагиттальных срезов в 2D-сеть - который наносит компромисс между производительностью и практичностью.
Стратегии обучения и валидация
Обучение модели начинается с разделения набора данных на обучение (обычно 70-80%), валидацию (10-15%) и тестирование (10-15%), что гарантирует отсутствие перекрытия между наборами. Во время обучения модель минимизирует функцию потери - часто комбинацию бинарной кросс-энтропии для классификации и потери риса для сегментации - с использованием стохастического градиентного спуска или оптимизаторов Адама. Планирование скорости обучения, ранняя остановка и распад веса являются стандартными методами для предотвращения переобучения.
Метрики валидации должны быть тщательно подобраны, чтобы отразить клиническую полезность. Для сегментации поражения распространены коэффициент сходства Dice (DSC) и расстояние Хаусдорфа. Для классификации важны чувствительность (призыв), специфичность, положительная прогностическая ценность (точность) и площадь под кривой рабочих характеристик приемника (AUC-ROC). Радиологи, ухаживающие за пациентами с миеломой, особенно ценят высокую чувствительность, чтобы избежать пропущенных диагнозов, в то время как специфичность уменьшает ненужные последующие биопсии и беспокойство пациента.
Скрупулезная внешняя проверка данных из другого учреждения или машины визуализации имеет решающее значение для демонстрации обобщенности. Многие опубликованные модели терпят неудачу на этом этапе из-за смещения домена - различий в моделях сканеров, параметрах приобретения или демографии пациентов. Федеративное обучение, где модели обучаются на нескольких сайтах без обмена сырыми данными, является новым решением этой проблемы.
Клинические преимущества и текущая эффективность
Модели глубокого обучения для визуализации костей ММ достигли замечательной точности в контролируемых исследованиях. Типичные показатели производительности включают значения AUC выше 0,90, чувствительность выше 85% и специфичность около 90% для обнаружения остеолитических поражений на КТ. Для МРТ всего тела модели показали сопоставимую или превосходную производительность для радиологов при выявлении диффузной инфильтрации костного мозга.
Основные преимущества ручного перевода включают:
- Скорость: CNN может обработать всю КТ-сканирование за секунды против 15-30 минут для радиолога.
- Согласованность: Автоматизированный анализ устраняет меж- и внутринаблюдательную изменчивость.
- Чувствительность к тонким поражениям: Глубокое обучение может обнаружить изменения в микрон-масштабе трабекулярной структуры кости, которые ускользают от человеческого глаза.
- Количественная оценка: Модели обеспечивают объективные показатели, такие как общий объем поражения, который коррелирует с бременем болезни и прогнозом.
- Перенос: В загруженных больницах система ИИ может отмечать случаи с высокой вероятностью для немедленного рассмотрения, сокращая время на лечение.
Однако крайне важно умерить энтузиазм реальностью. Большинство сообщенных результатов получены в результате ретроспективных исследований с тщательно отобранными данными. Перспективные многоцентровые испытания все еще скудны. Систематический обзор 2023 года в Европейская радиология см. обзор здесь отметил, что только 12% исследований выполнили внешнюю валидацию и еще меньше оценили интеграцию клинических рабочих процессов.
Интеграция в клинические рабочие процессы
Развертывание модели глубокого обучения в реальной клинической обстановке требует гораздо большего, чем хорошо обученная нейронная сеть.
- Регуляторное одобрение: В США FDA классифицирует такое программное обеспечение как SaMD (Software as a Medical Device). Большинство современных моделей для MM ещё не получили клиренс, хотя несколько компаний преследуют его.
- Пользовательский интерфейс: Радиологам нужен бесшовный способ просмотра выходов ИИ (например, наложения повреждений, оценки уверенности) в рамках их существующей системы PACS (система архивирования изображений и связи).
- Интерпретируемость: Клиницисты не решаются доверять «черному ящику». Объясняемые методы ИИ, такие как карты активации класса (CAM) или тепловые карты внимания, могут показать, какие области изображения модель считала важными, создавая доверие и помогая в анализе ошибок.
- Обеспечение качества: Непрерывный мониторинг производительности модели на входящих случаях необходим для обнаружения дрейфа данных, например, устанавливается новый КТ-сканер, который изменяет характеристики изображения.
Пилотные развертывания были описаны в таких центрах, как Дана-Фарберский институт рака, где ИИ-инструмент для обнаружения ММ тестируется параллельно со стандартной радиологией. Ранние отчеты показывают, что инструмент сокращает время отчетности на 40% без увеличения ложных срабатываний.
Будущие направления и исследовательские рубежи
Мультимодальное глубокое обучение
Одна только костная визуализация может не захватить полную картину активности болезни ММ. Сочетание визуализации с клиническими данными, лабораторными значениями (например, сывороточный M-белок, бета-2 микроглобулин) и геномными маркерами может привести к более точным прогностическим моделям. Мультимодальные архитектуры, которые объединяют функции изображения со структурированными данными, являются активной областью исследований. Например, функции CNN, извлекающие изображения, могут поступать в нейронную сеть, которая также принимает уровни креатинина и кальция, выводя оценку риска для предстоящих событий, связанных со скелетом.
Объясняемый и надежный ИИ
Органы регулирования и клиницисты все чаще требуют прозрачности. Разрабатываются такие методы, как концептуальные объяснения или контрфактические объяснения, показывающие, как изображение должно измениться, чтобы перевернуть диагноз. Цель состоит не только в том, чтобы понять, почему модель приняла решение, но и определить случаи, когда это может быть неправильно, например, когда доброкачественный остров костей путают с литическим поражением.
Ультра-раннее обнаружение и скрининг
Многим случаям множественной миеломы предшествует предраковое состояние, называемое моноклональной гаммопатией неопределенного значения (MGUS). На этой стадии визуализация костей обычно нормальна, но могут присутствовать тонкие микроархитектурные изменения. Модели глубокого обучения, обученные периферической количественной КТ с высоким разрешением (HR-pQCT) или анализ текстуры обычной КТ, потенциально могут идентифицировать людей с высоким риском прогрессирования до развития явного заболевания. Если это будет подтверждено, это откроет дверь для скрининговых программ, аналогичных маммографии для рака молочной железы.
Ресурсно-ограниченные настройки
Существенным препятствием для широкого распространения является вычислительная стоимость больших 3D-телефонов CNN. Легкие модели, такие как архитектуры на основе MobileNet или оптимизированные для поиска нейронные архитектуры сети, могут работать на портативных устройствах или облачных платформах с ограниченной доступностью графического процессора. В сочетании с телерадиологией эти модели могут привести к обнаружению костного поражения на уровне экспертов в недостаточно обслуживаемых регионах, где отсутствуют специальные радиологи.
Проблемы и этические соображения
Хотя перспективы глубокого обучения для диагностики ММ значительны, остаются некоторые препятствия. Неоднородность данных, классовый дисбаланс и необходимость больших аннотированных наборов данных продолжают препятствовать прогрессу. Кроме того, алгоритмическая предвзятость - где модель плохо работает на определенных демографических группах из-за недостаточной представленности в данных обучения - является серьезной проблемой, которую необходимо решать с помощью разнообразного сбора данных и аудитов справедливости.
Существует также риск чрезмерной зависимости от ИИ. Система, которая отмечает все неоднозначные результаты как положительные, может привести к ненужной биопсии и беспокойству пациентов. И наоборот, модель с низкой чувствительностью может задержать диагностику. Парадигма «человек в круге» остается важной, где ИИ служит вторым считывателем или инструментом сортировки, а не заменой радиологу.
Наконец, клиницисты должны понимать ограничения: модели глубокого обучения часто хрупки для состязательных возмущений — небольших, незаметных изменений изображения, которые могут изменить прогноз.
Заключение
Модели глубокого обучения продемонстрировали выдающийся потенциал в точной диагностике множественной миеломы от визуализации костей, превосходя традиционные методы в скорости, последовательности и чувствительности. Достижения в архитектурах CNN, методах обучения и доступности данных привели нас к порогу клинического развертывания. Тем не менее, путь от исследований к обычному уходу требует строгой проспективной проверки, одобрения регулирующих органов, бесшовной интеграции рабочих процессов и приверженности справедливости и прозрачности.
Сотрудничество между радиологами, гематологами, учеными-данными и экспертами по регулированию будет иметь решающее значение для реализации полного потенциала ИИ в преобразовании диагностики множественной миеломы. По мере созревания области мы можем ожидать, что глубокое обучение не только улучшит диагностику, но и позволит более раннее обнаружение, персонализированное планирование лечения и, в конечном итоге, лучшие результаты для пациентов с этим сложным заболеванием.