Математические модели в инженерии
Разработка моделей глубокого обучения для автоматической сегментации опухолей головного мозга
Table of Contents
Введение в сегментацию опухолей мозга
Опухоли головного мозга представляют собой значительную нагрузку на здоровье во всем мире, причем многоформная глиобластома является наиболее агрессивной и распространенной первичной злокачественной опухолью головного мозга у взрослых. Точная сегментация опухолей головного мозга от медицинской визуализации имеет решающее значение для диагностики, планирования лечения и мониторинга прогрессирования заболевания. Магнитно-резонансная томография (МРТ) является предпочтительной модальностью из-за ее превосходного контраста мягких тканей, обеспечивая множественные последовательности, такие как T1-взвешенные, T2-взвешенные, FLAIR и постконтрастные T1-взвешенные (T1ce) изображения. Каждая последовательность выделяет различные аспекты опухолевой патологии: некротический ядро, усиление опухоли и отек брюшины.
Ручная сегментация, выполняемая радиологами или клиницистами, является трудоемкой, субъективной и склонной к межнаблюдательной изменчивости. Процесс обычно занимает от 30 минут до нескольких часов на пациента в зависимости от сложности опухоли. Это узкое место препятствует крупномасштабным клиническим исследованиям и эффективному рабочему процессу в онкологических отделениях. Следовательно, существует настоятельная потребность в автоматизированных, надежных и быстрых методах сегментации. Глубокое обучение появилось в качестве преобразующей технологии для удовлетворения этой потребности, что позволяет разрабатывать модели, которые достигают производительности, приближающейся к уровням экспертов-людей на контрольных наборах данных.
Автоматизированная сегментация опухоли головного мозга с использованием глубокого обучения - это не просто исследовательское любопытство; она имеет прямые клинические последствия. Она облегчает количественную объемную обработку опухоли для оценки ответа на лечение, помогает в хирургическом планировании путем очерчивания границ опухоли и поддерживает контурирование лучевой терапии. Кроме того, она может быть интегрирована в системы поддержки клинических решений для обеспечения объективных измерений, которые улучшают результаты пациентов. Эта статья обеспечивает углубленное исследование последних разработок в моделях глубокого обучения для автоматической сегментации опухоли головного мозга, охватывающих методологические достижения, оставшиеся проблемы и будущие направления.
Подходы к глубокому обучению
Свёрточные нейронные сети (CNN)
Модели глубокого обучения, особенно сверточные нейронные сети (CNN), стали краеугольным камнем сегментации медицинских изображений. В отличие от традиционных методов машинного обучения, которые требуют ручной разработки функций, CNN автоматически изучают иерархические представления функций из необработанных пиксельных данных. Для сегментации опухоли мозга задача обычно формулируется как задача классификации по воксельному методу: каждому пикселю (или вокселю в 3D) присваивается метка, соответствующая различным опухолевым субрегионам (например, цельная опухоль, опухолевое ядро, усиливающее опухоль). Введение полностью сверточных сетей (FCN) позволило сквозное обучение, где сеть выводит карту сегментации тех же пространственных измерений, что и вход.
Ранние подходы, основанные на CNN, использовали патч-схему классификации, но они были вычислительно неэффективны и страдали от потери пространственного контекста. Прорыв произошел с архитектурами кодера-декодера, которые объединяют выборку по декодированию для захвата семантических функций высокого уровня и выборку по выборке для восстановления пространственного разрешения. Пропуск связей между слоями кодера и декодера сохраняет мелкозернистые детали, что имеет решающее значение для точного очерчивания границ.
U-Net и его вариации
Архитектура U-Net, изначально введенная для сегментации биомедицинских изображений, остаётся наиболее широко распространённой основой для задач сегментации опухолей головного мозга. Её симметричная конструкция кодера-декодера с пропускными связями позволяет эффективно изучать как локальные, так и глобальные особенности. Кодер состоит из повторяющихся свёрточных слоев с последующим максимальным объединением, в то время как декодер использует доверхсвёртывание. За годы работы было предложено множество расширений:
- Внимание U-Net: Включает в себя вентиляционные ворота, которые фокусируются на соответствующих областях, подавляя нерелевантные фоновые особенности. Это улучшает сегментацию небольших или неправильно сформированных опухолевых субрегионов.
- Остаточный U-Net: Использует остаточные блоки для обучения более глубоких сетей без исчезающих градиентов, улучшая возможности извлечения функций.
- nnU-Net (no-new-U-Net): Автоматизированная структура, которая динамически настраивает сетевую архитектуру, предварительную обработку и постобработку на основе характеристик набора данных. Она последовательно достигла верхних позиций в задачах биомедицинской сегментации, включая проблему сегментации опухолей головного мозга (BraTS).
Эти варианты U-Net были адаптированы для обработки 3D объемных данных путем замены 2D-извилин 3D-извилинами. 3D U-Net обрабатывают целые тома МРТ, фиксируя межсрезовые корреляции, что необходимо для точной объемной сегментации. Однако 3D-модели требуют значительных вычислительных ресурсов, что приводит к компромиссам между глубиной и использованием памяти.
V-Net и DeepMedic
В то время как U-Net предназначен для 2D-изображений, V-Net был введен специально для объемной сегментации медицинских изображений. Он использует 3D-кодер-декодер с остаточными связями и использует функцию потери Dice для прямой оптимизации перекрытия между прогнозируемой и наземной сегментацией правды. Архитектура V-Net была особенно успешной для сегментации простаты и легких, но также применяется к опухолям головного мозга, когда позволяют ограничения памяти.
DeepMedic — еще одна влиятельная архитектура, которая фокусируется на многомасштабном анализе. Она состоит из двух параллельных путей обработки: один, который обрабатывает изображение в полном разрешении, а другой, который обрабатывает уменьшенную версию для захвата большего контекста. Выходы объединяются для создания окончательной сегментации. DeepMedic эффективно уравновешивает локальные детали и глобальный контекст без необходимости очень глубоких сетей, что делает его вычислительно эффективным.
Функции потерь и метрики оценки
Выбор функции потери существенно влияет на производительность модели. Для сегментации опухоли головного мозга, где области опухоли часто малы относительно здоровой ткани мозга (классовый дисбаланс), стандартная потеря кросс-энтропии может привести к прогнозам, смещенным на задний план. Следовательно, обычно используются специализированные функции потери:
- Потеря риса: На основе коэффициента сходства риса (DSC) измеряется совпадение между предсказанием и наземной истиной. Она инвариантна абсолютным размерам регионов, смягчая классовый дисбаланс.
- Обобщенная потеря риса: Расширение, которое присваивает вес класса для лечения многоклассовых дисбалансов, таких как различные подрегионы опухоли.
- Основные потери: Добавляет модулирующий фактор к кросс-энтропийной потере, которая снижает вес простых примеров и фокусирует обучение на жестких, неправильно классифицированных примерах.
- Убыток от границы: Убыток на расстоянии, который наказывает за ошибки границ, улучшая точность контура.
Метрики оценки обычно включают оценку Dice для перекрытия, расстояние Хаусдорфа для соглашения границы, точность, отзыв и специфичность.Проблема BraTS использует оценку Dice для всей опухоли, опухолевого ядра и усиливающей опухоли, наряду с расстоянием Хаусдорфа на 95-м процентиле.
Проблемы в модельном развитии
Ограниченные и несбалансированные аннотированные данные
Одним из наиболее существенных препятствий является нехватка больших, качественных аннотированных наборов данных. Аннотирование опухолей головного мозга в объемах 3D МРТ является трудоемким и требует специалистов нейрорадиологов. Публично доступный набор данных BraTS, который включает в себя многоинституциональные предоперационные МРТ-сканирования, является фактическим стандартом для бенчмаркинга, но он включает в себя всего несколько тысяч случаев. Небольшие наборы данных увеличивают риск переобучения и ограничивают обобщение невидимыми популяциями или оборудованием для визуализации.
Дисбаланс классов является еще одной серьезной проблемой. В типичном срезе МРТ опухолевые пиксели составляют небольшую фракцию (часто менее 10% площади мозга). Подрегионы, такие как усиливающая опухоль, еще меньше. Модели, обученные стандартным функциям потери, как правило, игнорируют классы меньшинств, что приводит к плохой сегментации этих клинически важных субрегионов. Используются такие методы, как избыточная выборка, увеличение данных и повторное взвешивание потерь, но не полностью решают проблему.
Вариабельность в появлении опухоли
Опухоли головного мозга широко варьируются по размеру, форме, местоположению, интенсивности и контрастности. Глиобластома часто имеет нерегулярные формы, некротические ядра и окружающие отеки. Низкосортные глиомы могут быть более диффузными и менее четко определенными. Метастатические опухоли могут быть множественными и небольшими. Эта неоднородность затрудняет обобщение одной модели по всем типам и классам опухолей. Более того, появление опухоли изменяется с течением времени из-за эффектов лечения (псевдопрогрессия, радиационный некроз), добавляя еще один слой сложности.
Сдвиг домена через протоколы визуализации
Параметры получения МРТ (например, напряжённость поля, параметры последовательности, производитель) вносят вариабельность во внешний вид изображения. Модель, обученная на данных одного сканера или учреждения, часто плохо работает на данных другого, явление, известное как сдвиг домена. Ликвидация черепа, нормализация интенсивности и совместная регистрация в стандартный шаблон являются стандартными этапами предварительной обработки, но они не могут полностью компенсировать различия в контрастности изображения и шуме. Методы адаптации и обобщения домена являются активными областями исследований.
Вычислительные и ограничения памяти
Обработка полных 3D томов МРТ с глубокими CNNs является вычислительно интенсивной. Типичный 3D U-Net может иметь более 50 миллионов параметров и требует высокопроизводительных графических процессоров с 16-32 ГБ памяти, ограничивая доступность для небольших исследовательских групп или клинического развертывания на стандартном оборудовании. Сжатие модели, обрезка, квантование и дистилляция знаний исследуются для уменьшения объема памяти и времени вывода без ущерба для точности.
Качество и межнаблюдательная изменчивость
Даже среди экспертов наблюдается умеренная и существенная изменчивость в сегментации подобластей опухоли головного мозга, особенно в отношении границ отеков и опухолевых ядер. Эта двусмысленность в достижимой эффективности создает верхнюю границу. Некоторые недавние усилия включают неопределенность аннотации в обучение модели, используя мягкие метки или множественные аннотации в каждом случае. Однако отсутствие последовательной истины остается проблемой как для обучения, так и для оценки.
Последние достижения и будущие направления
Самоконтролируемое и полуконтролируемое обучение
Для облегчения зависимости от больших аннотированных наборов данных, методы самоконтролируемого обучения (SSL) получили тягу. Модели SSL-преподавания на немаркированных данных с использованием предлоговых задач, которые заставляют сеть изучать значимые представления. Для МРТ мозга оказались эффективными предлоговые задачи, такие как контрастное обучение, моделирование маскированных изображений или реконструкция отсутствующих модальностей. Затем предварительно обученный кодер может быть точно настроен на небольшом маркированном наборе для сегментации, уменьшая требуемое усилие аннотации до 90%. Полуконтролируемые подходы, которые сочетают небольшой маркированный набор с большим немаркированным набором, используя регуляризацию консистенции или псевдомаркировку, также показывают перспективу.
Видение трансформаторов (ViT) и гибридных моделей
Трансформаторы, первоначально разработанные для обработки естественного языка, были адаптированы для задач компьютерного зрения, включая сегментацию медицинских изображений. Модели, такие как UNETR (UNEt TRansformers), используют Трансформатор в качестве кодера для захвата зависимостей на большие расстояния и глобального контекста, который CNN может пропустить из-за ограниченных восприимчивых полей. Swin UNETR, вариант, основанный на Swin Transformer со смещенными окнами, достигает самых современных результатов на бенчмарке BraTS 2021. Гибридные архитектуры, объединяющие слои CNN и Transformer, направлены на использование сильных сторон обоих: локальное извлечение функций из CNN и глобальный контекст из Transformers. Эти модели часто требуют больше данных и вычислительных ресурсов, но могут превзойти чистые CNN.
Диффузионные модели для увеличения данных
Генеративные модели, в частности модели диффузии, используются для создания синтетических медицинских изображений для увеличения данных. Путем создания реалистичных МРТ-сканирований с контролируемыми формами и местоположениями опухолей эти модели решают проблему нехватки данных и дисбаланса классов. Синтетические изображения могут быть сопряжены с автоматически генерируемыми сегментациями или использоваться самоконтролируемым образом. Предварительные результаты показывают, что обучение на расширенных наборах данных улучшает показатели сегментации Dice на 1-3% на тест-множестве BraTS. Однако обеспечение того, чтобы генерируемые данные добросовестно представляли клиническую реальность без введения артефактов, остается открытой проблемой.
Многомодальная и многозадачная интеграция
Модели сегментации опухолей головного мозга обычно используют четыре МРТ-последовательности (T1, T1ce, T2, FLAIR) в качестве входных каналов. В недавней работе исследуется интеграция дополнительных модальностей, таких как диффузионная тензорная визуализация (DTI), перфузио-взвешенная визуализация (PWI) или спектроскопия MR, для предоставления дополнительной информации о инфильтрации опухоли и васкулярности. Одновременное многозадачное обучение, где модель предсказывает карты сегментации и другие клинически релевантные результаты (например, классификация опухолей, молекулярное прогнозирование подтипа) в одном переднем проходе, использует общие представления и может улучшить общую производительность. Например, прогнозирование как сегментации всей опухоли, так и статуса мутации IDH было достигнуто с помощью совместной тренировки.
Объяснение и оценка неопределенности
Для клинического принятия модели должны быть прозрачными и передавать уверенность в своих прогнозах. Методы объяснимости, такие как карты выносливости, Grad-CAM и атрибуция концепции, подчеркивают, какие области входа повлияли на решение модели. Оценка неопределенности, используя методы выбытия Монте-Карло или ансамбля, количественно определяет надежность каждого прогнозируемого вокселя. Это позволяет клиницистам сосредоточиться на регионах, где модель неопределенна и потенциально пересматривает сегментацию. Включение неопределенности в планирование лечения может снизить риск ошибок.
Сегментация в реальном времени и развертывание края
Современные модели глубокого обучения обычно требуют от нескольких секунд до нескольких минут для сегментирования 3D-тома на GPU. Для интраоперационного использования или немедленного представления отчетности требуется более быстрый вывод. Такие методы, как квантование модели (с использованием полуточного FP16 или INT8), обрезка сети и эффективный дизайн архитектуры (например, энкодеры на основе MobileNetV3) позволяют сегментировать в режиме реального времени на процессоре или мобильных устройствах. Развертывание моделей на краю (в консоли сканера МРТ или портативном устройстве) может оптимизировать клинические рабочие процессы, хотя сохраняются препятствия для регулирования и кибербезопасности.
Федеративное обучение для сотрудничества в области сохранения конфиденциальности
Медицинские данные очень чувствительны и подчиняются правилам конфиденциальности, таким как HIPAA и GDPR. Федеративное обучение позволяет нескольким учреждениям совместно обучать модель без обмена данными о пациентах; обмениваются только обновлениями моделей. Несколько крупномасштабных инициатив, включая проблему Федеративной сегментации опухолей (FeTS), продемонстрировали, что федеративные модели могут достигать производительности, сопоставимой с централизованно обученными моделями, сохраняя конфиденциальность данных. Этот подход открывает доступ к различным наборам данных из нескольких больниц, улучшая обобщение моделей в демографии и оборудовании для визуализации.
Регуляторный и клинический перевод
Несмотря на многочисленные исследовательские работы, только несколько инструментов автоматизированной сегментации получили одобрение регулирующих органов (маркировка FDA или CE). Перевод исследований в клиническую практику требует тщательной проверки на больших многоцентровых наборах данных, интеграции с больничными ИТ-системами (PACS, DICOM) и демонстрации клинической полезности. Регулирующие органы требуют не только точности, но и надежности для крайних случаев, интерпретируемости и обнаружения отказов. Путь к клиническому принятию длинный, но сотрудничество между научными кругами, промышленностью и клиническими отделами ускоряет его.
Заключение
Модели глубокого обучения фундаментально продвинули область автоматизированной сегментации опухолей головного мозга, достигнув производительности, которая конкурирует с экспертами-людьми по бенчмаркам данных. Эволюция от простых CNN до сложных архитектур, таких как U-Net, V-Net и Vision Transformers, улучшила точность и надежность. Однако проблемы, связанные с дефицитом данных, сдвигом домена, дисбалансом классов и вычислительными ограничениями, сохраняются. Новые решения - самоконтролируемое обучение, генеративное увеличение, гибридные модели и федеративное обучение - постепенно устраняют эти ограничения.
Будущее автоматизированной сегментации опухолей головного мозга заключается в беспрепятственной интеграции в клинические рабочие процессы, вывод в реальном времени и интерпретируемые результаты, которые способствуют доверию среди клиницистов. По мере того, как модели становятся более способными справляться с присущей изменчивостью опухолей головного мозга, они позволят более персонализировать и точную нейроонкологическую помощь. Продолжение сотрудничества между исследовательскими группами, клиническими центрами и регулирующими органами имеет важное значение для перевода этих технологических прорывов в рутинную практику. Конечной целью является не только автоматизация утомительной задачи, но и улучшение результатов пациентов за счет более быстрого, более точного и воспроизводимого анализа опухолей.