Как Pacs может облегчить интеграцию больших данных для корреляции геномных и графических данных
Введение: Конвергенция визуализации и геномики в современном здравоохранении
Современный ландшафт здравоохранения определяется беспрецедентным взрывом данных. Одна только медицинская визуализация генерирует петабайты информации ежегодно из таких модальностей, как МРТ, КТ, ПЭТ и цифровая патология. Одновременно стоимость геномного секвенирования резко упала, что позволяет осуществлять рутинный сбор данных о геноме и транскриптоме для исследований и клинической помощи. Истинная ценность, однако, заключается не в любом наборе данных в изоляции, а в корреляции между фенотипами изображений и геномными профилями - область, часто называемая радиогеномика . Системы архивирования изображений и связи (PACS), долгое время являющаяся основой рабочего процесса радиологии, уникально позиционируются как интеграционный центр для этих массивных, гетерогенных наборов данных. Эта статья исследует, как PACS может развиваться из простых архивов изображений в платформы, которые облегчают интеграцию больших данных, обеспечивая мощные корреляции между геномными и визуализирующими данными.
Эволюция PACS: от архива к интеграционной платформе
Традиционные PACS были разработаны для решения конкретной проблемы: замена пленки цифровым хранилищем и предоставление рентгенологам возможности просматривать изображения из нескольких модальностей на рабочих станциях. За десятилетия базовая архитектура созрела вокруг стандарта DICOM (Digital Imaging and Communications in Medicine), который определяет, как форматируются и обмениваются изображения, структурированные отчеты и другие объекты данных. Однако геномные данные изначально не соответствуют DICOM. Чтобы преодолеть этот разрыв, современные PACS должны принять расширенную модель данных, которая включает в себя другие стандарты обмена информацией о здоровье, такие как HL7 FHIR (Fast Healthcare Interoperability Resources) и открытые API. Эта эволюция превращает PACS в настоящее озеро данных или хранилище данных, способное принимать, хранить и запрашивать не только изображения, но и вызовы геномных вариантов, уровни экспрессии и клинические аннотации.
Ключевые технические возможности для интеграции больших данных
- Масштабируемое хранение: На локальном хранилище быстро становится экономически невыгодным. Ведущие поставщики PACS теперь предлагают гибридные облачные архитектуры, которые могут масштабироваться до сотен петабайт, поддерживая объем необработанных данных секвенирования целого генома (обычно 100-200 ГБ на геном).
- Теги DICOM недостаточны для геномных метаданных. PACS должен поддерживать расширяемые схемы метаданных, часто путем интеграции с озерами данных, которые индексируют как объекты DICOM, так и не-DICOM с помощью постоянных уникальных идентификаторов, таких как MRN пациента или идентификатор исследования.
- Запрос и извлечение: Соотношение конкретного вывода изображений (например, особенности текстуры опухоли) с генетической мутацией требует быстрой перекрестной ссылки. Современные PACS используют инвертированные индексы, базы данных NoSQL и репозитории, доступные для поиска, такие как Elasticsearch, чтобы включить субсекундные запросы через миллиарды записей.
Эти возможности составляют основу, на которой может быть построена корреляция геномных изображений. Без них усилия по интеграции данных остаются фрагментированными и изолированными.
Большие проблемы данных в корреляции геномных изображений
Интеграция геномных данных с данными визуализации — это не просто техническое упражнение, оно включает в себя преодоление четырех классических проблем больших данных: объема, скорости, разнообразия и достоверности.
Объем
Одно исследование геномики рака может включать в себя экзомные последовательности тысяч пациентов, каждый из которых связан с продольными исследованиями изображений. Необработанные терабайты быстро становятся петабайтами при факторинге в необработанных файлах последовательностей, выровненных считываниях (BAM / CRAM) и производных файлах формата вызова варианта (VCF). PACS должен быть разработан для обработки этой шкалы без ухудшения производительности для рабочих процессов чтения радиологии.
Скорость
В клинических условиях время обращения критично. Радиолог, который выявляет подозрительное поражение, должен иметь возможность запрашивать геномный профиль пациента в течение нескольких секунд. Это требует приема и индексации данных в режиме реального времени, которые не поддерживают многие устаревшие PACS. Новые решения используют потоковые автобусы событий (например, Apache Kafka) для распространения обновлений от трубопроводов секвенирования до уровня данных PACS.
разнообразие
Данные визуализации в основном неструктурированы (пиксельные массивы), в то время как геномные данные структурированы как зависящие от ссылок вариации, аннотации и матрицы экспрессии. Кроме того, клинические данные из EHRs добавляют еще один слой разнообразия. PACS, который может интегрировать эти разрозненные типы, должен поддерживать несколько моделей данных - DICOM для изображений, HL7 FHIR для клинических данных и доменные форматы, такие как VCF или GFF для геномики. Стандарты совместимости, такие как FHIR Genomics, появились для гармонизации этих форматов, но принятие остается неравномерным.
неповоротливость
Качество данных является постоянной проблемой. Изображение артефактов, ошибок секвенирования и несоответствий аннотации может привести к ложным корреляциям. PACS может помочь, обеспечив соблюдение правил управления данными в момент приема внутрь - например, требуя метрики качества для каждого геномного файла и помечая изображения с известными отклонениями протокола приобретения. Версия как изображений, так и геномных данных имеет важное значение для поддержания воспроизводимости.
Как PACS облегчает корреляцию данных с геномной визуализацией
С учетом изложенных проблем становятся понятными конкретные механизмы, с помощью которых PACS может обеспечить корреляцию. Следующие подходы представляют собой как современные передовые методы, так и перспективные проекты.
Связь пациентов с помощью постоянных идентификаторов
Наиболее фундаментальным шагом является обеспечение того, чтобы каждое исследование изображений и каждый набор геномных данных были связаны с одним и тем же идентификатором пациента. В исследовательской среде это часто означает использование идентификатора субъекта исследования, который отображает модальности. PACS может хранить этот идентификатор в зарезервированных атрибутах DICOM (например, (0010,0020) идентификатор пациента) и в отдельном индексе, который связан с внешними геномными базами данных. Для клинического использования MRN выполняет эту роль. Современные PACS выставляют RESTful API, которые позволяют платформе геномных данных нажимать и вытягивать метаданные визуализации, связанные с данным пациентом, эффективно создавая виртуальную таблицу перекрестных ссылок.
Включение структурированных отчетов DICOM для геномных аннотаций
Структурированные отчеты DICOM (SR) были первоначально разработаны для передачи измерений и наблюдений из исследований визуализации. Они могут быть расширены, чтобы включать геномные результаты. Например, шаблон DICOM SR для отчета о патологии рака может включать поля для названия гена, типа варианта, аллельной частоты и мутационной нагрузки опухоли. Храня эти SR вместе с изображениями, PACS становится единственным источником истины как для изображений, так и для геномных результатов. Такие поставщики, как Изменить здравоохранение и Секта изучают эти расширения в PACS следующего поколения.
Интеграция FHIR для обмена данными в реальном времени
Стандарт HL7 FHIR обеспечивает современный, веб-подход к обмену данными здравоохранения. PACS, который реализует конечные точки FHIR, может служить метаданными визуализации в качестве ресурсов FHIR ImagingStudy, в то время как геномные данные представлены с использованием профилей FHIR Genomics (например, ресурс MolecularSequence, описывающий вариант). Это позволяет аналитической платформе извлекать как изображения, так и геномные данные с использованием одного и того же шаблона API. Руководство по реализации FHIR Genomics специально рассматривает корреляцию генетических данных с клиническими и визуализирующими наблюдениями, что делает его критическим стандартом для поставщиков PACS.
Облачные озера данных и аналитические трубопроводы
Многие медицинские учреждения перемещают свои PACS в облако для использования масштабируемого хранилища объектов (например, Amazon S3, Google Cloud Storage) и мощных аналитических услуг. В этой архитектуре PACS действует как каталог данных: он хранит изображения и обеспечивает быстрое извлечение, в то время как геномные данные находятся в параллельном озере данных. Корреляция достигается за счет совместного планирования запросов - например, с помощью Amazon Athena или Google BigQuery для запуска SQL-запросов, которые объединяют таблицы метаданных DICOM с таблицами геномных вариантов. Этот разъединенный подход позволяет хранить каждый тип данных в оптимальном формате, все еще позволяя перекрестную ссылку. Например, радиолог, просматривающий КТ грудной клетки, может вызвать облачную функцию, которая запрашивает геномную базу данных для любых мутаций в EGFR или KRAS, связанных с тем же пациентом, и отображает эту информацию в качестве наложения на рабочую станцию PACS.
Преимущества коррелированных данных для клинической помощи и исследований
Интеграция геномных и визуализационных данных через PACS дает ощутимые преимущества в нескольких областях.
Персонализированное планирование лечения
Онкология является наиболее продвинутым вариантом использования. Опухоли с конкретными генетическими изменениями по-разному реагируют на терапию. Соотнося биомаркеры визуализации, такие как размер опухоли, текстура или перфузионные характеристики с геномными драйверами, клиницисты могут выбирать таргетную терапию с большей уверенностью. Например, пациент с немалой клеточной мутацией рака легких с мутацией EGFR, показанной как на геномном анализе, так и на КТ, может быть кандидатом на озимертиниб. PACS, который представляет этот интегрированный взгляд, уменьшает когнитивное бремя просеивания через отдельные системы.
Улучшенная диагностическая точность
Определенные фенотипы визуализации тесно связаны с конкретными генетическими синдромами. PACS, который перекрестно ссылается на результаты визуализации пациента с геномной базой данных, может предупредить рентгенолога о возможном наследственном состоянии, таком как выявление нескольких полипов толстой кишки на КТ-колонографии и пометка известной мутации APC. Этот вид автоматизированной корреляции может привести к более ранней диагностике таких состояний, как семейный аденоматозный полипоз или нейрофиброматоз.
Ускорение исследований радиогеномики
Крупномасштабные исследования, такие как Атлас генома рака (TCGA) и Британский биобанк, уже предоставляют связанные изображения и геномные данные. Однако большинство институциональных PACS не связаны с этими базами данных. Путем обеспечения локальной корреляции PACS может облегчить внутренние исследования радиогеномики. Например, отделение радиологии больницы может добывать свой собственный архив для обнаружения функций визуализации, которые предсказывают конкретный геномный подтип, а затем проверять эти результаты на внешних когортах. Архив изображений рака Архив изображений рака предоставляет богатый ресурс общедоступных наборов данных, которые могут использоваться для засева таких исследований.
Сокращение избыточного тестирования
При интегрировании визуализации и геномных данных клиницисты могут избежать заказа дополнительных тестов, которые уже имеются. Если геномный профиль пациента уже хранится и связан с PACS, онкологу может не понадобиться повторять биопсию для получения той же генетической информации. Это экономит время, снижает затраты и избавляет пациента от ненужных инвазивных процедур.
Рассмотрение вопросов осуществления для организаций здравоохранения
Принятие PACS, который может обрабатывать интеграцию больших данных, требует тщательного планирования в нескольких измерениях.
Управление данными и безопасность
Геномные данные считаются высокочувствительными, часто классифицируются как защищенная информация о здоровье (PHI) даже после деидентификации из-за риска повторной идентификации. PACS должен обеспечивать надежные средства контроля доступа, шифрование в покое и в пути и журналирование аудита. Ролевой доступ может гарантировать, что только уполномоченные клиницисты и исследователи могут просматривать комбинированный набор данных. Кроме того, управление согласием имеет решающее значение: пациенты должны выбрать свои геномные данные, которые будут связаны с визуализацией и использоваться для исследований. поставщики PACS должны предлагать интеграцию с системами управления согласием.
Стандартизация и совместимость
Без общих стандартов данных интеграция остается точечной и хрупкой. Организации должны отдавать предпочтение PACS, поддерживающим DICOM, HL7 FHIR и появляющимся стандартам, таким как FHIR Genomics. Они также должны участвовать в таких инициативах, как профили IHE (Интеграция медицинского предприятия), которые определяют рабочие процессы для корреляции визуализации-геномики. Радиология IHE и домены ITI опубликовали профили, такие как «Радиомика и интеграция геномики», которые предоставляют технические спецификации.
Интеграция рабочих процессов
Для того чтобы корреляция была полезной в клинической практике, она должна быть встроена в рабочий процесс радиолога и онколога. Зритель PACS должен отображать резюме соответствующих геномных выводов, не требуя от пользователя запуска отдельного приложения. Некоторые поставщики предлагают «панели геномики», которые появляются в виде боковой панели в зрителе, обновляемой в режиме реального времени из источника геномных данных. Аналогично, геномный аналитик должен иметь возможность просматривать исследования визуализации, связанные с конкретным вариантом, из платформы геномики, в идеале через глубокую ссылку на PACS.
Планирование затрат и ресурсов
Хранение петабайт изображений и геномных данных в облаке сопряжено со значительными затратами. Организации должны оценивать общие затраты на модели владения (TCO), включая расходы на выход, если данные часто перемещаются. Поможет многоуровневая стратегия хранения: горячее хранение для активно доступных изображений и геномных файлов, холодное хранение для исторических данных и архивное хранение для исследований, которые не ожидаются для повторного использования. PACS, поддерживающие интеллектуальное управление жизненным циклом данных, могут автоматизировать эти переходы.
Будущие направления: ИИ, мультиомика и корреляция в реальном времени
Интеграция визуализации и геномики - это только начало. Следующая волна будет включать в себя объединение дополнительных слоев омики - протеомики, метаболомики, микробиомики - с данными визуализации. PACS нужно будет обрабатывать эти новые типы данных, возможно, путем расширения DICOM для их размещения или путем использования модульной архитектуры озера данных. Искусственный интеллект будет играть двойную роль: во-первых, модели глубокого обучения могут автоматически извлекать функции визуализации (такие как форма опухоли, нерегулярность маржи или текстура), которые служат в качестве входных данных для генотипической корреляции; во-вторых, ИИ может использоваться для прогнозирования геномных профилей только из изображений, генерируя «виртуальные биопсии». Например, модель может предсказать вероятность конкретной мутации от КТ, а PACS может затем пометить это предсказание клиницисту для подтверждения фактическим геномным тестированием.
Корреляция в реальном времени также находится на горизонте. По мере того, как технологии секвенирования становятся быстрее, геномные данные могут передаваться непосредственно в PACS во время встречи с пациентом. Это позволит по-настоящему персонализировать протоколы визуализации: пациент, который, как известно, имеет наследственный синдром рака, может автоматически назначаться для более частого скрининга или скрининга с более высоким разрешением, при этом PACS управляет правилами поддержки принятия решений.
Заключение
PACS больше не являются пассивными системами хранения; они развиваются в интеллектуальные платформы данных, которые могут преодолеть разрыв между медицинской визуализацией и геномикой. Применяя масштабируемое хранение, гибкие модели метаданных и современные стандарты совместимости, такие как FHIR и DICOM SR, PACS может облегчить корреляцию изображений и геномных данных в масштабе. Преимущества - персонализированное лечение, улучшенная диагностическая точность, ускоренные исследования и снижение избыточного тестирования - глубоки. Однако организации должны решать проблемы, связанные с объемом данных, разнообразием, управлением и интеграцией рабочих процессов. По мере того, как индустрия здравоохранения движется к действительно точной медицине, PACS, которые охватывают интеграцию больших данных, станут незаменимыми инструментами для раскрытия полного потенциала как визуализации, так и геномной информации.