Достижения в технологиях глубокого секвенирования для обнаружения редких вариантов
Введение в глубокое секвенирование
Глубокое секвенирование, часто синонимичное с высокой пропускной способностью секвенирования, описывает процесс считывания образца ДНК или РНК многократно для достижения высокой глубины охвата на базу. Это повторное считывание не является избыточным: оно обеспечивает статистическую мощность, необходимую для отличия подлинных редких вариантов от ошибок секвенирования. Концепция возникла с появлением платформ секвенирования следующего поколения (NGS) в середине 2000-х годов, которые заменили трудоемкий метод Сэнгера. Ранние инструменты NGS производили миллионы коротких считываний за прогон, но частота ошибок 0,1-1 % означала, что варианты, присутствующие на частотах ниже 1-5%, было трудно назвать уверенно. За последнее десятилетие комбинация лучшей химии, улучшенного оборудования и сложных стратегий коррекции ошибок подтолкнула порог обнаружения к менее чем 0,1% вариантной частоте аллелей (VAF), что позволило исследователям идентифицировать мутации, которые ранее были невидимыми.
Важность нахождения редких вариантов — тех, которые встречаются менее чем у 1% населения или при низких клональных фракциях внутри человека — нельзя переоценить. При раке, например, мутации драйверов часто существуют в виде незначительных субклонов, которые могут сеять устойчивость к терапии. При редких генетических заболеваниях сложные гетерозиготные варианты или мозаичные мутации могут объяснить случаи, когда стандартное клиническое секвенирование экзомов возвращает отрицательные результаты. Глубокое секвенирование также лежит в основе исследований соматического мозаицизма в старении, квазивидов патогена и циркулирующей опухолевой ДНК (ctDNA) в жидкой биопсии. В этой статье рассматриваются основные технологические достижения, которые сделали глубокое секвенирование рутинным инструментом, текущий ландшафт приложений, постоянные препятствия и наиболее перспективные направления для следующего поколения обнаружения редких вариантов.
Ключевые технологические достижения
Платформы секвенирования следующего поколения
Современные платформы NGS отличаются длиной чтения, пропускной способностью, стоимостью за базу и профилями ошибок, но все они заметно улучшились в своей способности обеспечивать глубокое, точное покрытие. Химия секвенирования по синтезу Illumina остается доминирующей рабочей лошадкой для редких вариантов исследований из-за ее очень низких частот ошибок вызова базы (~0,1% для большинства инструментов) и способности генерировать миллиарды считываний за пробег. Серия NovaSeq X, выпущенная в 2022 году, проталкивает пропускную способность до более чем 10 миллиардов считываний на проточную ячейку, позволяя сверхглубокое секвенирование целых экзомов или целевых панелей на долю стоимости более ранних моделей. MGI Tech использует аналогичный, но отличный метод комбинаторного синтеза зондов-якорей (cPAS), который обеспечивает сопоставимую точность и даже более высокую пропускную способность в некоторых конфигурациях, что делает его конкурентоспособным вариантом для крупных популяционных исследований. Системы Ion Torrent Термо Фишера используют полупроводниковое обнаружение ионов водорода
Уникальные молекулярные идентификаторы (UMI) и исправление ошибок
Одним из наиболее преобразующих нововведений для обнаружения редких вариантов является использование уникальных молекулярных идентификаторов или UMI. UMI представляет собой короткую случайную последовательность нуклеотидов, прикрепленных к каждому фрагменту ДНК до амплификации. Поскольку каждый оригинальный фрагмент получает отдельный штрих-код, секвенирующие считывания, которые происходят из одной и той же исходной молекулы, могут быть сгруппированы в «семьи». После амплификации и секвенирования считывания в пределах одного семейства, в то время как истинные варианты появляются почти у всех членов семьи, в то время как ошибки секвенирования, которые являются случайными и происходят после прикрепления штрих-кода, появляются только в меньшинстве считываний. Требуя, чтобы вариант был замечен в определенной доле считываний в пределах семейства (например, от 80% до трех порядков величины), UMI могут подавлять фоновую частоту ошибок на уровне от двух до трех порядков, достигая уровней ошибок на уровне 10-5. Коммерчески доступные UMI-методы, такие как Duplex Sequencing (
Алгоритмы передовой биоинформатики
Необработанные данные экспериментов по глубокому секвенированию бесполезны без надежных вычислительных конвейеров. Современные инструменты биоинформатики эволюционировали специально для решения проблем обнаружения редких вариантов. Ключевые достижения включают:
- Обозначающие алгоритмы: Такие инструменты, как Strelka2, Mutect2 и Vardict, включают в себя калибровку оценки базового качества и фильтрацию смещения ориентации для уменьшения ложных срабатываний от артефактов систематического секвенирования.
- Моделирование ошибок с UMI: Программное обеспечение, такое как fgbio и smCounter2, использует считывания консенсуса UMI для сжатия дубликатов считывания и построения последовательностей консенсуса, исправленных ошибками.
- Машинообразовательные классификаторы: Глубокие нейронные сети, в том числе обученные на известных истинных вариантах от крупных консорциумов, могут отличить подлинные редкие мутации от платформоспецифичного шума лучше, чем эвристические пороги. Например, Clair3 и DeepVariant были адаптированы для сверхглубоких данных и показывают снижение ложноположительных показателей.
- Гаплотипы-знающие вызовы: Методы, которые фазовые считываются в гаплотипы (такие как WhatsHap и LongPhase) улучшают чувствительность к гетерозиготным вариантам соединений и помогают разрешать низкочастотные варианты в повторяющихся областях.
Вместе эти инструменты позволяют исследователям уверенно сообщать о вариантах, присутствующих в VAF, до 0,01%, когда глубина секвенирования достаточна, и используются UMI. Без них огромный объем данных глубокого секвенирования - часто терабайты в эксперименте - был бы неуправляемым.
Приложения в медицине и исследованиях
Редкие заболевания генетика
Редкие заболевания, определяемые как условия, затрагивающие менее 1 из 2000 человек, являются коллективно распространенными, воздействуя на примерно 300 миллионов человек во всем мире. Многие из них вызваны ультраредкими вариантами, которые не захватываются стандартным секвенированием экзомов на глубине от 30 до 50 ×. Глубокое секвенирование целевых генных панелей или целых экзомов на глубине от 200 × до 500 × доказало свою высокую эффективность в выявлении мозаичных мутаций (присутствующих только в фракции клеток) и низкоуровневых соматических вариантов, которые способствуют таким расстройствам, как туберкулезный склероз, синдромы избыточного роста и эпилепсия. В знаковом исследовании, опубликованном в Генетика в медицине (2021), исследователи применили целенаправленное глубокое секвенирование (1000 ×) до 100 пациентов с недиагностированными генетическими условиями и достигли диагностического выхода 32%, по сравнению с 10-20% для стандартного секвенирования экзомов. Кроме того,
Геномика рака и жидкая биопсия
Рак — это заболевание геномной нестабильности, при котором опухоли содержат гетерогенные популяции клеток, несущих различные мутации. Глубокое секвенирование биопсий опухолей при сотнях до тысяч разрядов показывает незначительные субклоны, которые могут содержать мутации резистентности к целевым методам лечения. Например, обнаружение мутации EGFR T790M в немелкоклеточном раке легкого (часто присутствует в VAF 0,1-1 % в циркулирующей опухолевой ДНК) в настоящее время является стандартной практикой в клиническом управлении. Жидкая биопсия — анализ ДНК без клеток (cfDNA) из крови — полностью зависит от глубокого секвенирования, потому что ctDNA может составлять менее 0,1% от общей cfDNA в ранней стадии рака. Коммерческие анализы, такие как Guardant360 и FoundationOne Liquid, используют глубокое секвенирование с UMI для достижения чувствительности 85-95% для мутаций, присутствующих в VAF выше 0,1 %. Основное исследование в Глубокое секвен
Генетика населения и эволюционные исследования
Глубокое секвенирование больших популяций изменило наше понимание генетического разнообразия человека. Проект 1000 геномов и база данных агрегации генома (gnomAD) каталогизировали миллионы редких вариантов, но большинство из них основаны на глубинах секвенирования 30–100×. Недавние усилия, такие как программа UK Biobank Whole-Exome Sequencing (200,000 участников при 50×) и программа NHLBI Trans-Omics for Precision Medicine (TOPMed), использовали более глубокий охват для улучшения обнаружения очень редких и частных вариантов. Такие данные необходимы для интерпретации функционального воздействия вариантов в клинической генетике: вариант, наблюдаемый у 0,01% населения, может быть доброкачественным, в то время как действительно новый вариант имеет более высокую вероятность патогенности. В эволюционной биологии глубокое секвенирование древней ДНК и нечеловеческих видов (например, вымерших гомининов, бактерий в микробиоме человека) позволяет уверенно идентифицировать низкочастотные полиморфизмы, которые раскрывают прошлые события отбора, узкие места популяции и динамику примесей.
Текущие вызовы
Управление данными и хранение
Взрыв глубины секвенирования приводит к соразмерному увеличению объема данных. Один человеческий экзом, секвенированный до 500 ×, может генерировать 50-100 гигабайт сырых файлов FASTQ, в то время как целый геном при 100 × превышает 200 гигабайт. Хранение, передача и анализ этих наборов данных требуют значительной вычислительной инфраструктуры, которая не доступна всем лабораториям. Облачные решения (например, DNAnexus, AWS, Google Cloud) обеспечивают более широкий доступ, но затраты на выход данных и долгосрочный архивный остаются нетривиальными. Алгоритмы сжатия (такие как CRAM и fastqz) уменьшают размеры файлов, но они также вводят компромиссы в разрешении при повторном анализе данных годы спустя. Разработка эффективных, совместимых форматов данных, которые сохраняют возможность вызывать редкие варианты, будет иметь решающее значение, поскольку глубокое секвенирование становится более распространенным.
Точность vs. стоимость
Хотя затраты на секвенирование резко снизились (с 10 миллионов долларов за геном в 2007 году до примерно 600 долларов сегодня), сверхглубокое секвенирование для обнаружения редких вариантов по-прежнему требует дополнительных расходов: многократные проточные клеточные прогоны, подготовка библиотек UMI и передовые вычислительные ресурсы. Для многих клинических применений вопрос заключается в том, оправдывает ли предельная выгода увеличения глубины с 500× до 5000× десятикратное увеличение стоимости. Этот компромисс наиболее очевиден в исследованиях в масштабах популяции или ограниченных ресурсами настройках. Гибридные подходы, такие как глубокое секвенирование целевых областей в сочетании с умеренной глубиной для остальных, изучаются для баланса чувствительности с доступностью. Кроме того, разработка недорогих высокоточных платформ, таких как серия MGI DNBSEQ и новая система Ultima Genomics может помочь снизить базовую стоимость сверхглубоких прогонов.
Фазирование гаплотипов и структурные вариации
Большинство платформ глубокого секвенирования производят короткие считывания (150-300 б/с), которые редко охватывают целые гаплотипы или сложные структурные варианты (SVs). Это ограничение затрудняет определение того, находятся ли два редких варианта на одной хромосоме (в цис) или на разных копиях (в транс), что необходимо для интерпретации гетерозиготности соединения при рецессивных заболеваниях. Аналогичным образом, глубокое короткое секвенирование часто пропускает вставки среднего размера, делеции и инверсии, потому что длина чтения недостаточна для уникального выравнивания через точки разрыва. Недавние алгоритмические достижения, такие как секвенирование с связным чтением (10x Genomics, теперь часть Bio-Rad) и гаплотаггинг, могут частично преодолеть эти проблемы, но они добавляют сложность протокола. Интеграция длинного чтения в качестве сопутствующего подхода становится все более распространенной, как обсуждается ниже.
Будущие направления
Интеграция секвенирования Long-Read
Технологии секвенирования с длинным чтением от Pacific Biosciences (HiFi читает, ~15–25 кб) и Oxford Nanopore (чтения превышают 100 кб) все чаще используются в сочетании с глубокими данными с коротким чтением. Длинные считывают естественные фазовые варианты в расширенных геномных областях и могут непосредственно обнаруживать структурные варианты и повторяющиеся расширения, которые невидимы для платформ с коротким чтением. Для редкого обнаружения вариантов сочетание фаз с длинным чтением с глубокой чувствительностью к короткому чтению обеспечивает мощную синергию: короткие чтения идентифицируют варианты на очень низких частотах аллелей, а длинные чтения присваивают их материнским или отцовским гаплотипам. Недавние исследования использовали этот комбинированный подход для поиска редких, вызывающих заболевание структурных вариантов у пациентов с неразрешенными генетическими условиями, достигая диагностического подъема на 15–20% по сравнению с коротким секвенированием экзома. По мере улучшения точности с коротким чтением (HiFi теперь имеет > 99,9% точности на базу), линии между «глубоким» и «длинным» будут раз
Машинное обучение для интерпретации вариантов
Помимо обнаружения в сыром виде, клиническую значимость редких вариантов необходимо интерпретировать. Модели машинного обучения, обученные на больших, курируемых базах данных (ClinVar, gnomAD), в настоящее время превосходят традиционные системы, основанные на правилах, в прогнозировании патогенности. Такие инструменты, как PrimateAI, EVE и SpliceAI, используют глубокие нейронные сети для оценки вариантов пропускания, сплайс-сайта и регулирования. Для данных глубокого секвенирования эти модели могут быть улучшены путем включения в качестве входных признаков информации о частоте аллелей, глубине чтения и смещении нити. В ближайшем будущем мы ожидаем, что сквозные трубопроводы глубокого обучения, которые принимают данные о секвенировании в сыром виде и выводят список причинных вариантов с оценками достоверности, минуя многие из используемых в настоящее время эвристических шагов фильтрации. Однако эти модели требуют обширной проверки в различных популяциях, чтобы избежать предубеждений, которые могут привести к неправильной классификации редких вариантов в недопредставленных этнических группах.
Портативные и точечные устройства
Миниатюрные устройства секвенирования, в первую очередь MinION и Flongle Оксфорда Нанопора, позволили выполнять глубокое секвенирование в удаленных или ограниченных ресурсами условиях. Эти устройства использовались для наблюдения за вирусным геномом в режиме реального времени (например, Эбола, SARS-CoV-2), обнаружения бактерий, устойчивых к антибиотикам, в полевых больницах и быстрого генотипирования редких заболеваний в сельских клиниках. Текущая частота ошибок Nanopore (около 5-10% для необработанных считываний) ограничила его использование для сверхредкого обнаружения вариантов, но улучшения в химии (R10.4 пор) и дуплексном секвенировании уменьшили ошибки до примерно 1% в высококачественных прогонах. В сочетании с усилением вращающегося круга и UMIs портативное глубокое секвенирование может вскоре стать жизнеспособным инструментом для диагностики редких генетических условий в регионах, где отсутствуют центральные средства секвенирования. Такие компании, как Bionano Genomics, также разрабатывают оптические технологии картирования, которые дополняют NGS для обнаружения структурных вариантов в формате настольных компьютеров.
Заключение
Достижения в технологиях глубокого секвенирования фундаментально изменили ландшафт обнаружения редких вариантов. Более высокие пропускные платформы, корректирующие ошибки молекулярные штрих-коды и сложные алгоритмы биоинформатики теперь позволяют исследователям и клиницистам с высокой степенью уверенности идентифицировать мутации на частотах аллелей ниже 0,01%. Эти возможности имеют прямое применение в диагностике редких заболеваний, биопсии раковых жидкостей и популяционной генетике, а также позволяют создавать новые возможности для исследований старения, клональной гемопоэзии и микробной эволюции. Тем не менее, проблемы, связанные с хранением данных, стоимостью, фазированием гаплотипа и обнаружением структурных вариантов, остаются значительными. Интеграция секвенирования с длинным чтением, машинным обучением и портативными устройствами, вероятно, будет еще больше снижаться, что делает его стандартным инструментом как в исследовательских, так и в клинических лабораториях по всему миру. Падение стоимости секвенирования, как отслеживается Национальным институтом исследований генома человека ], предполагает, что эпоха доступного, всеобъемлющего