Как глубокое обучение автоматизирует обнаружение легочных узлов при скрининге Cts
Рак легких остается ведущей причиной смертности от рака во всем мире, составляя почти 1,8 миллиона смертей в год. Широкое распространение компьютерной томографии с низкими дозами (LDCT) для скрининга рака легких оказалось спасительным вмешательством, обусловленным в основном результатами ключевых испытаний, таких как Национальное исследование скрининга легких (NLST) и испытание NELSON. Эти исследования продемонстрировали значительное снижение смертности от рака легких, когда группы высокого риска подвергались регулярному скринингу. Однако успех этих программ создал огромное узкое место: огромный объем данных визуализации с высоким разрешением, которые должны быть интерпретированы. Один скрининговый КТ-экзамен может генерировать сотни осевых срезов, и радиологам поручено тщательно сканировать эти изображения для выявления тонких легочных узлов, которые могут представлять собой ранние стадии злокачественных новообразований. Этот процесс по своей сути трудоемкий, трудоемкий и подвержен ошибкам восприятия и значительной вариабельности между чтецами.
Глубокое обучение, сложное подмножество искусственного интеллекта, стало мощным решением этой клинической задачи. Автоматизируя обнаружение и характеристику легочных конкреций с уровнем скорости, точности и последовательности, превосходящим традиционные методы, глубокое обучение коренным образом меняет ландшафт скрининга рака легких. Эта технология быстро переходит из исследовательских лабораторий в клинические рабочие процессы, служа критическим инструментом поддержки принятия решений, который повышает возможности радиологов, а не заменяет их.
Клинический императив для раннего выявления рака легких
Обоснование для широкого скрининга ясно. Когда рак легких обнаруживается на ранней стадии (I стадия), пятилетняя выживаемость составляет примерно 60%. Эта частота падает до менее 10% для раковых заболеваний, обнаруженных на отдаленной стадии (II стадия). NLST, который рандомизировал более 53 000 лиц с высоким риском, обнаружил, что скрининг с LDCT привел к 20% относительному снижению смертности от рака легких по сравнению с рентгеном грудной клетки. Этот вывод установил LDCT в качестве стандарта ухода за группами высокого риска в Соединенных Штатах.
Несмотря на эту явную пользу, реализация масштабных программ скрининга оказалась сложной. Одной из основных трудностей является высокий уровень положительных результатов. В NLST почти 25% всех скрининговых экзаменов изначально были классифицированы как положительные, хотя подавляющее большинство из них в конечном итоге были определены как ложные положительные. Обработка этих ложноположительных результатов подвергает пациентов ненужному облучению, инвазивным процедурам и значительной тревоге. Это возлагает огромную ответственность на интерпретирующего радиолога, чтобы точно различать доброкачественные узелки и те, которые требуют дальнейшего исследования, все это при одновременном управлении растущей рабочей нагрузкой на фоне общенациональной нехватки радиологов.
От ручных чтений до традиционного компьютерного обнаружения (CAD)
До появления глубокого обучения основной технологической помощью для радиологов было традиционное компьютерное обнаружение (CAD). Эти системы были разработаны с использованием классических методов компьютерного зрения, опираясь на ручные функции для идентификации потенциальных узелков. Инженеры разрабатывали алгоритмы для поиска конкретных форм (например, круглых или овальных), порогов интенсивности (на основе единиц Хоунсфилда) и краевых градиентов. Хотя в теории эти ранние системы САПР были подвержены высоким ложноположительным показателям, часто помечая нормальные анатомические структуры, такие как кровеносные сосуды или бифуркации дыхательных путей, как подозрительные узелки.
Эта плохая специфичность подорвала доверие радиологов к технологии. Вместо повышения эффективности традиционная САПР часто нарушала рабочий процесс, требуя от радиологов тратить драгоценное время на устранение нерелевантных выводов. В результате клиническое принятие САПР первого поколения для КТ было ограничено. Фундаментальным ограничением было то, что эти системы не могли учиться; они могли применять только жесткие, заранее определенные правила, созданные их программистами. Они не смогли уловить огромную изменчивость в морфологии узлов, включая различия в размерах, текстуре, маржинальных характеристиках (гладкие, лобулятные, спультированные) и плотности (твердые, частично твердые, наземные стекла).
Глубокое обучение: сдвиг парадигмы в извлечении функций
Глубокое обучение представляет собой фундаментальный сдвиг парадигмы в том, как компьютеры интерпретируют медицинские изображения. Вместо того, чтобы полагаться на правила, закодированные вручную, модели глубокого обучения, в частности сверточные нейронные сети (CNN), учатся непосредственно на данных. CNN обучается на массивном наборе данных с меченными изображениями КТ, где экспертные радиологи тщательно аннотировали местоположение и границы каждого узла. Во время этого процесса обучения сеть автоматически учится определять иерархические паттерны и функции, которые наиболее предсказывают присутствие узла.
Нижние слои сети учатся обнаруживать простые особенности, такие как края, углы и капли. Более глубокие слои объединяют эти простые особенности для распознавания более сложных паттернов, таких как текстуры, пространственные отношения и, в конечном итоге, полная морфология узелка. Эта способность учиться сквозной передаче от пикселей к патологии — это то, что дает моделям глубокого обучения их превосходную производительность. Они не ограничены человеческой интуицией о том, как должен выглядеть узелок и могут обнаружить тонкие, нелинейные паттерны, которые невидимы для человеческого глаза или традиционных алгоритмов.
Учитывая, что КТ по своей сути объемные, исследователи быстро перешли от 2D CNN к 3D CNN. 2D CNN анализирует один осевой срез за раз, потенциально пропуская непрерывность между срезами. 3D CNN, с другой стороны, обрабатывает объемный блок данных, фиксируя трехмерную структуру узелка и его связь с окружающей анатомией. Это особенно важно для обнаружения небольших узелков или тех, которые примыкают к сосудистой системе, где 3D-контекст имеет решающее значение для точной классификации.
Ключевые архитектуры глубокого обучения для обнаружения узлов
Несколько конкретных архитектур глубокого обучения были с большим успехом адаптированы для трубопровода обнаружения легочных узлов.Выбор архитектуры часто зависит от конкретного этапа в трубопроводе, будь то генерация кандидата, ложноположительная редукция или сегментация.
- Регион-базированные CNNs (R-CNN): Быстрее R-CNN архитектура является двухступенчатым детектором, который стал основой для многих высокопроизводительных систем обнаружения узлов. На первом этапе используется сеть предложений регионов (RPN) для генерации набора областей-кандидатов, которые, вероятно, будут содержать узелки. Второй этап затем классифицирует каждый регион-кандидат как узел или неузел и уточняет его координаты ограничивающих коробок. Этот подход придает приоритет высокой чувствительности.
- Одноступенчатые детекторы (RetinaNet, YOLO): Одноступенчатые детекторы, такие как RetinaNet, выполняют классификацию и локализацию в одном проходе через сеть. Они часто быстрее двухступенчатых детекторов, что делает их пригодными для приложений в реальном времени. RetinaNet специально использует функцию «фокальной потери», которая очень эффективна при работе с экстремальным дисбалансом класса, присущим обнаружению узлов, где подавляющее большинство патчей изображения принадлежат к нормальному фону.
- Сети кодера-декодера (U-Net, V-Net): Для задач, требующих сегментации на уровне пикселей (например, точное определение границы узелка), стандартными являются архитектуры кодера-декодера. U-Net, адаптированный к 3D как V-Net, использует путь сжатия для захвата контекста и расширяющийся путь для точной локализации. Эти сети отлично подходят для создания подробных масок узелков, которые необходимы для точного измерения объема и оценки роста с течением времени.
Трубопровод глубокого обучения для обнаружения легочных узлов
Готовая к производству система обнаружения конкреций глубокого обучения обычно следует структурированному трубопроводу. Этот трубопровод предназначен для максимизации как чувствительности, так и специфичности при сохранении клинического удобства использования.
- Приобретение и предварительная обработка данных: Сырые КТ-изображения значительно различаются по толщине, разрешению и дозе. Первый шаг заключается в стандартизации данных. Это включает в себя повторную выборку объемов в изотропном разрешении (например, 1 мм х 1 мм х 1 мм), применение окна легкого для нормализации интенсивности единицы Хоунсфилда (обычно между 1200 и 600 HU), а иногда выполнение автоматической сегментации легких для исключения стенки грудной клетки и средостения, тем самым уменьшая вычислительное пространство поиска.
- Поколение Кандидата (Высокая чувствительность): Модель оптимизирована для достижения почти идеальной чувствительности. На этом этапе цель состоит в том, чтобы пропустить нулевые узелки. Алгоритм сканирует весь объем легких с помощью подхода с раздвижным окном, генерируя тысячи регионов-кандидатов. Этот шаг неизбежно приведет к множеству ложных срабатываний, но приоритетом является обеспечение захвата всех истинных узелков.
- Ложное положительное снижение (высокая специфичность): Кандидаты, сгенерированные на предыдущем этапе, подаются в более сложный, вычислительно дорогой классификатор. Эта вторичная модель специально обучена отличать истинные узелки от многочисленных нормальных анатомических структур (судов, дыхательных путей, трещин), которые были отмечены на первом этапе. Современные системы могут снизить ложноположительный коэффициент до менее чем одного ложноположительного на сканирование при сохранении чувствительности выше 90%.
- Классификация и оценка риска злокачественности: После подтверждения узелка система присваивает оценку риска злокачественности. Это может быть двоичная классификация (доброкачественная против злокачественной) или категорическая оценка, согласованная с клиническими рекомендациями, такими как Lung-RADS (Lung Imaging Reporting and Data System). Эта оценка предоставляет лучевому врачу информацию, позволяющую принимать решения о интервалах последующего наблюдения или необходимости биопсии.
Роль общественных наборов данных в обучении надежным моделям
Быстрый прогресс в этой области был бы невозможен без общедоступных высококачественных аннотированных наборов данных. Консорциум базы данных изображений легких и инициатива по ресурсу базы данных изображений (LIDC-IDRI) являются наиболее ярким примером. Этот набор данных содержит более 1000 КТ-сканирований от Национального института рака, с узелками, аннотированными до четырех опытных торакальных радиологов. Этот процесс аннотации с несколькими считывателями помогает фиксировать изменчивость человеческой интерпретации и обеспечивает богатую правду для учебных моделей.
Задача LUNA16 (LUng Nodule Analysis 2016) , построенная на LIDC-IDRI путем стандартизации рамок оценки. Она обеспечила четкий ориентир для сравнения различных алгоритмов, требуя от участников представления результатов по определенному подмножеству сканирований. LUNA16 стал фактическим стандартом для оценки систем обнаружения узлов, стимулирования конкуренции и инноваций. Эти ресурсы сыграли важную роль в проверке того, что модели глубокого обучения могут соответствовать или превосходить производительность экспертов-людей в контролируемых средах тестирования.
Оценка эффективности: метрики, которые имеют значение в клинических условиях
Оценка эффективности модели глубокого обучения для клинического использования требует перехода за пределы простой точности.Для оценки ее готовности к реальному миру используется несколько ключевых показателей.
- Чувствительность (Recall): Это измеряет способность модели находить фактические узелки. Высокая чувствительность имеет первостепенное значение при скрининге, чтобы избежать отсутствующих раковых заболеваний. Цель часто >95% для узелков выше определенного порога размера (например, 4 мм).
- Специфика: Это измеряет способность модели правильно идентифицировать нормальную ткань (истинные негативы). Высокая специфичность необходима для минимизации ложных срабатываний, которые вызывают беспокойство пациента и ненужные процедуры наблюдения.
- Ложные положительные результаты на сканирование (FP/Scan): Это критический показатель для клинической интеграции. Система, которая добавляет 5-10 ложных маркеров на сканирование, является разрушительной и неэффективной. Ведущие алгоритмы последовательно достигают менее 1 FP/скан, демонстрируя практический уровень точности.
- Зона под операционной кривой приемника (AUC-ROC): Это обеспечивает единую оценку, суммирующую производительность модели по различным порогам чувствительности/специфичности. AUC 0,90 или выше обычно считается отличным в этой области.
- Время вывода: Скорость имеет решающее значение для интеграции рабочего процесса. Модель должна быть в состоянии обрабатывать полный объем КТ, от исходных данных DICOM до конечного вывода, в течение нескольких минут, в идеале секунд, чтобы идти в ногу с занятой клинической практикой.
Интеграция глубокого обучения в рабочие процессы радиологии
Окончательная ценность глубокого обучения реализуется только тогда, когда оно легко интегрируется в существующий рабочий процесс радиолога. Наиболее успешные реализации функционируют как интеллектуальный помощник, повышая производительность человека без добавления трения. Эта интеграция обычно происходит через Радиологическую информационную систему (RIS) и Систему архивирования изображений и связи (PACS).
В модели Second-reader ИИ анализирует сканирование автономно. Его результаты сравниваются с первоначальным отчетом радиолога. Если обнаруживается значительное расхождение узелков, помеченных ИИ, которое пропустил радиолог), то случай помечается для повторного обзора. В модели concurrent-reader результаты ИИ отображаются радиологу в режиме реального времени, поскольку они интерпретируют сканирование, часто в качестве накладных маркеров на изображениях. Наиболее продвинутые системы используют triage модель, где ИИ предварительно обрабатывает сканирование и расставляет их приоритеты на основе вероятности критического нахождения. Сканирование с высокой вероятностью содержания злокачественного узелка перемещается в верхнюю часть рабочего списка радиолога, сокращая время оборота для наиболее неотложных случаев.
Для успешной интеграции пользовательский интерфейс должен быть интуитивно понятен. Результаты должны отображаться в виде стандартных наложений DICOM, показывающих местоположение, размер и вероятность злокачественности для каждого обнаруженного узла. Система должна позволять радиологу принимать, отвергать или изменять результаты ИИ одним щелчком мыши. При правильной реализации глубокое обучение снижает когнитивную нагрузку на радиолога, уменьшает время чтения и повышает диагностическую уверенность, особенно для тонких или легко упускаемых из виду поражений.
Обращение к ограничениям и написание пути вперед
Несмотря на свои огромные перспективы, внедрение глубокого обучения в скрининге рака легких не лишено значительных проблем. Одной из наиболее актуальных проблем является сдвиг домена . Модели, обученные на наборе данных LIDC-IDRI, который был собран с использованием старых сканеров и протоколов с начала 2000-х годов, могут не работать так же хорошо на современных сверхнизких дозах сканирования от разных поставщиков (GE, Siemens, Canon, Philips). Обеспечение надежного обобщения требует обучения на разнообразных, многовендорных, многоинституциональных наборах данных, которые отражают полный спектр клинической практики.
Интерпретируемость остаётся ключевым препятствием для построения доверия. Радиологи, по понятным причинам, не решаются полагаться на «черный ящик». Такие методы, как отображение выносливости и Grad-CAM (Gradient-weighted Class Activation Mapping) могут частично решить эту проблему, генерируя тепловые карты, которые показывают, какие области изображения модель считала наиболее важными для своего решения. Эти инструменты помогают подтвердить, что модель фокусируется на самом узелке, а не на ложных корреляциях.
В Соединенных Штатах FDA очистило все большее число устройств компьютерного обнаружения (CADe) и компьютерной диагностики (CADx), основанных на ИИ. Эти разрешения требуют тщательных исследований валидации, демонстрирующих безопасность и эффективность. Регуляторный фокус смещается в сторону создания рамок для «заблокированных» алгоритмов, которые переобучены новым данным, обеспечивая постоянное улучшение без необходимости нового представления 510 (k) для каждой итерации.
Наконец, альгоритмическая предвзятость является критической проблемой. Если модель обучается преимущественно на данных из одной демографической группы, ее эффективность может быть значительно хуже для других групп населения. Обширная проверка в различных расовых, этнических и социально-экономических группах имеет важное значение для обеспечения того, чтобы преимущества ускоренного скрининга ИИ распределялись справедливо и не усугубляли существующие различия в здравоохранении.
Будущие направления
Будущее глубокого обучения в скрининге рака легких выходит далеко за рамки простого обнаружения. Долгосрочный анализ является основной областью активных исследований. Системы ИИ разрабатываются для автоматической регистрации текущего КТ-сканирования пациента с их предыдущим сканированием, точного измерения роста или стабильности узлов с течением времени и расчета точного времени удвоения объема. Эта способность имеет решающее значение для дифференциации индолентных узелков от агрессивных злокачественных новообразований.
Другим перспективным направлением является многозадачное обучение. Вместо того, чтобы просто обнаруживать узелки, будущие модели будут автоматически количественно оценивать кальций коронарной артерии, оценивать тяжесть эмфиземы, измерять минеральную плотность костей и обнаруживать другие случайные результаты. Это обеспечивает комплексную оценку здоровья от одного скринингового экзамена. Кроме того, интеграция данных визуализации с клиническими данными, геномными профилями и биомаркерами (поле, известное как радиогеномика и биомаркеры) обещает предоставить персонализированные оценки риска, которые выходят за рамки просто морфологии узелка для прогнозирования его биологического поведения и оптимальной стратегии лечения.
По мере того, как эти технологии будут развиваться, роль радиолога будет все больше смещаться в сторону ИИ, освобождая врача от необходимости фокусироваться на когнитивных задачах более высокого порядка: клинической корреляции, дифференциальной диагностике, коммуникации с пациентами и персонализированном планировании управления. Глубокое обучение не означает автоматизацию работы радиолога; оно заключается в том, чтобы дать им возможность оказывать более быструю, точную и всеобъемлющую помощь пациентам, которые в ней больше всего нуждаются.