Новые методы в длинночтовом секвенировании для комплексного анализа генома
Технологии секвенирования с длинным чтением коренным образом изменили геномику, позволив исследовать сложные геномы с разрешением, ранее недостижимым с помощью методов короткого чтения. Считывая непрерывные фрагменты ДНК длиной от десятков до сотен тысяч пар оснований, эти методы позволяют ученым разрешать повторяющиеся области, обнаруживать большие структурные варианты и фазовые гаплотипы с высокой степенью уверенности. В этой статье рассматриваются новейшие новые методы секвенирования с длинным чтением, исследуются технологические инновации, вычислительные достижения и интегративные подходы, которые расширяют границы анализа генома.
Последние достижения в платформах секвенирования с длинным чтением
За последние несколько лет был достигнут значительный прогресс в химии, аппаратном и программном обеспечении, лежащих в основе секвенирования с длинным чтением. Ключевые производители представили новые реагенты, проточные ячейки и системы визуализации, которые существенно увеличивают длину считывания, точность базовых вызовов и общую пропускную способность. Например, последнее поколение секвенирования одномолекулярных в реальном времени (SMRT) от Pacific Biosciences (PacBio) теперь обычно достигает средней длины чтения, превышающей 15 килобаз, в то время как Oxford Nanopore Technologies (ONT) продемонстрировала считывания, превышающие 2 мегабазы. Эти расширенные считывания имеют решающее значение для охвата сложных геномных функций, таких как центромеры, теломеры и сегментные дублирования, которые часто сопротивляются сборке только из коротких считываний.
Улучшения в протоколах подготовки библиотек также способствуют качеству данных. Показано, что методы, которые минимизируют повреждение ДНК, уменьшают фрагментацию и оптимизируют молекулярную нагрузку, увеличивают как выход, так и длину длинных считываний. Для PacBio принятие рабочего процесса «HiFi» (высокоточность) использует секвенирование с круговым консенсусом (CCS) для создания одного высокоточного консенсуса, считываемого из нескольких проходов одной и той же молекулы с круговым шаблоном. Этот подход резко снижает частоту ошибок с >10% в сырых длинных считываниях до <0,1%, производя считывания, которые являются как длинными, так и точными. Аналогичным образом, ONT улучшила свою библиотеку химии, такую как набор секвенирования лигирования и набор быстрого секвенирования, чтобы уменьшить химерные артефакты и улучшить пропускную способность пор.
С вычислительной стороны алгоритмы базисного вызова эволюционировали от простых скрытых моделей Маркова до глубоконейронных сетевых архитектур (например, Guppy, Bonito и недавно выпущенный Dorado). Эти модели обучаются на больших наборах данных для исправления систематических ошибок, таких как неточности длины гомополимера, и вызова модифицированных оснований непосредственно из необработанного сигнала. Результатом является резкое улучшение точности консенсуса без ущерба для длины считывания. Новые методы также используют машинное обучение для фильтрации низкокачественных считываний, обнаружения точек разрыва структурных вариантов и даже прогнозирования состояний метилирования ДНК из того же самого запуска секвенирования.
Ключевые технологии, управляющие инновациями
Секвенирование HiFi PacBio
Секвенирование HiFi PacBio, коммерчески доставляемое на системах Sequel IIe и Revio, представляет собой сдвиг парадигмы в точности длинного чтения. Путем циркулирования каждой молекулы ДНК и ее многократного секвенирования (обычно 15-30 проходов), технология обеспечивает согласованное считывание, которое достигает точности > 99,9% даже в повторяющихся областях. Типичные длины считывания HiFi варьируются от 10 до 25 килобаз, хотя протоколы могут быть настроены для получения более длинных фрагментов за счет пропускной способности. Эта комбинация длины и точности делает считывания HiFi идеальными для сборки генома de novo, где они могут производить смежные сборки со средними значениями N50, превышающими 50 мегабаз в высоко полиморфных или повторяющихся геномах.
Недавние инновации в химии PacBio, такие как улучшенные ферменты полимеразы, которые включают нуклеотиды быстрее и с более высокой точностью, и усовершенствованная оптика обработки сигналов, которая уменьшает шум, оказали дальнейшее повышательное давление как на пропускную способность, так и на качество. Система Revio, введенная в 2022 году, использует новую SMRT Cell, способную генерировать до 130 гигабаз данных HiFi на клетку, что делает секвенирование HiFi генома человека реальностью в рамках одного проточного прогона. Это открыло дверь для популяционных исследований структурных изменений и геномики редких заболеваний, где высококачественная информация на большие расстояния все чаще признается необходимой.
Оксфордские нанопорные технологии
Платформы Oxford Nanopore (MinION, GridION, PromethION) предлагают отчетливо комплементарный подход: секвенирование в реальном времени нативных, немодифицированных цепочек ДНК или РНК по мере их прохождения через белковую нанопору. Отличительной чертой технологии является ее способность производить сверхдлинные показания, при этом некоторые эксперименты дают молекулы, превышающие 2 миллиона пар оснований. Эти показания играют важную роль для охвата высоко повторяющихся областей, таких как центромерные спутники и рибосомные массивы ДНК, а также для разрешения сложных структурных вариантов, которые невидимы для короткочитанных подходов.
Секвенирование нанопор показало быстрое улучшение точности на основе за счет улучшенных конфигураций пор, оптимизированных моторных белков и сложных алгоритмов расчета оснований. Последние поры R10.4.1 в сочетании с моделями расчета оснований с высокой точностью в программном обеспечении Dorado обычно достигают медианной точности чтения выше 99,5% (Q20 +) при умеренной длине считывания. Кроме того, способность обнаруживать модифицированные основания, такие как 5-метилцитозин, 5-гидроксиметилцитозин и 6-метиладенин, из того же электрического сигнала без дополнительной подготовки образца сделала Nanopore мощным инструментом для интегрированного генетического и эпигенетического анализа.
Новые методы в технологии нанопор включают подходы «Read Until», которые позволяют выбирать цели в режиме реального времени, где секвенирование может динамически направляться для обогащения для областей, представляющих интерес. Кроме того, адаптеры и схемы штрих-кодирования теперь позволяют мультиплексировать сотни образцов на проточную клетку, значительно снижая затраты на образец и делая секвенирование с длинным чтением доступным для клинических и полевых применений.
Новые технологии и будущие направления
Гибридные сборочные подходы
В то время как оба чтения PacBio HiFi и ONT могут независимо производить высококачественные сборки, многие исследователи принимают гибридные стратегии, которые сочетают в себе лучшее из обеих платформ. Наиболее распространенный подход использует HiFi-считывания (высокая точность, умеренная длина) в качестве задней части для формирования контига, затем каркасы и заполняют пробелы с ультрадлинными прочтениями Nanopore. Инструменты, такие как shasta , canu , hifiasm , и verkko были разработаны для обработки этих гибридных наборов входов, часто производя сборки, которые являются одновременно смежными и высокоточными. Недавние работы над полным геномом человека (консорциум Telomere-to-Telomere) в значительной степени полагались на такие гибридные стратегии для закрытия ранее неразрешимых про
Вычислительные алгоритмы для исправления ошибок и сборки
Профили ошибок длинных чтений принципиально отличаются от коротких чтений, что требует специализированных алгоритмов. Новые инструменты коррекции ошибок, такие как medaka (для ONT) и pbmm2 / ccs (для PacBio), были усовершенствованы для использования высококачественных областей каждого чтения для улучшения консенсуса по всему набору данных. Для сборки были адаптированы графические подходы, которые представляют весь набор чтения в виде струнного графа или де Брюйн-графа.miniasm и flye, например, производят черновые сборки из неисправленных считываний, которые затем могут быть отполированы с помощью данных HiFi. Модели глубокого обучения все чаще используются для решения неоднозначных путей через график сборки, особенно в регионах с высокой гетерозиготностью
Помимо сборки, вычислительные конвейеры для обнаружения структурных вариантов (SV) из длинных считываний созрели. Такие вызывающие устройства, как Sniffles2, Picky и cuteSV, используют кластеризацию и выравнивание последовательностей с разбивкой по точкам останова для идентификации делеций, дублирования, инверсий, транслокаций и вставок мобильных элементов. Эти инструменты теперь достигают чувствительности > 95% для SV > 50 bp, что значительно улучшается по сравнению с SV-звонками на основе короткого чтения, которые часто пропускают события в повторяющихся областях.
Интеграция с эпигеномным анализом
Одним из наиболее интересных новых методов является одновременный опрос последовательности генома и эпигенома из одного набора данных с длинным чтением. Прямое обнаружение нанопорами модификаций ДНК созрело до такой степени, что количественная оценка уровня метилирования возможна при разрешении одной базы. Секвенирование HiFi, хотя и не непосредственное обнаружение модификаций в исходном сигнале, может быть объединено с бисульфитным преобразованием или ферментативным метилированием-чувствительными подходами для обеспечения длинночитаемых эпигеномных профилей. Эта интеграция оказывается бесценной в геномике рака, где крупномасштабные структурные изменения часто сопровождаются широко распространенным эпигенетическим перепрограммированием. Теперь подходы с длинным чтением могут фазировать как генетические, так и эпигенетические изменения вдоль отдельных гаплотипов, показывая, как модели метилирования распространяются и изменяются в структурных перестройках.
Прямая РНК-секвенирование и транскриптомика
Oxford Nanopore также предлагает прямое РНК-секвенирование (DRS), которое последовательности нативных молекул РНК без обратной транскрипции или амплификации. Этот метод сохраняет модификации РНК (например, m6A, псевдоуридин) и обеспечивает полноразмерную изоформную информацию транскрипта. Возникающие улучшения включают более высокую пропускную способность, лучшую чувствительность пор для РНК и модели базового вызова, обученные специально для обнаружения модификации РНК. Прямое РНК-секвенирование открывает новые окна в альтернативное сплайсинг, анализ длины хвоста поли-А и функциональное влияние редактирования РНК в сложных транскриптомах.
Применение в комплексном анализе генома
Полная сборка генома и проекты T2T
Достижение консорциумом Telomere-to-Telomere (T2T) первой действительно полной последовательности генома человека в 2022 году является знаковой демонстрацией силы секвенирования с длинным чтением. Объединив >30× охват считываний HiFi и >70× охват сверхдлинных считываний Nanopore (и используя ручное курирование с оптическими картами), команда решила каждый пробел, включая сложную Y-хромосому. Аналогичные усилия в настоящее время предпринимаются для многих других видов, от растениеводства до находящихся под угрозой исчезновения млекопитающих. Новые методы в долгочитаемой метагеномике также позволяют реконструировать полные, круговые геномы из ранее нехарактерных микробов в сложных образцах окружающей среды.
Структурные вариации в открытии болезней человека
Длинночтенное секвенирование стало золотым стандартом для обнаружения и характеристики структурных вариантов (SV) в геномах человека. Исследования каталогизировали десятки тысяч SV на геном, многие из которых пропущены или плохо разрешены короткими прочтениями. Новые методы теперь позволяют точное отображение точек разрыва даже в сегментарных дубликатах и повторах с низкой сложностью. В клинических контекстах секвенирование с длинным чтением используется для решения «геномных загадок» у пациентов с редкими заболеваниями, которые ускользали от стандартного экзома или секвенирования генома. Способность полностью фазовых вариантов и обнаруживать сложные гетерозиготность или структурные события de novo приводит к диагностическим результатам вверх.
Генетика населения и эволюционные исследования
Высококачественные эталонные геномы, полученные из длинночитанных сборок, позволяют проводить более точный сравнительный геномный анализ по популяциям и видам. Например, у крупных обезьян секвенирование с длинным чтением выявило специфичные для линии расширения семейств генов и ретротранспозоны, которые невидимы для короткочитанных подходов. Аналогичным образом, у растений с большими, богатыми повторами геномами (например, пшеница, кукуруза, хвойные), секвенирование с длинным чтением позволило провести первые комплексные исследования структурных изменений, связанных с одомашниванием и адаптацией. Новые методы, такие как исследования «пангенома», где сравниваются несколько длинночитаемых сборок от разных людей, обеспечивают более полную картину геномного разнообразия внутри вида.
Геномика рака и жидкая биопсия
Все чаще применяются методы длительного чтения к геномам рака, где распространены массивные перестройки, изменения числа копий и эпигенетические изменения. Исследования с использованием длинных считываний выявили ранее скрытые слияния генов и внехромосомную циркулярную ДНК (экДНК), которые стимулируют онкогенез. В жидкой биопсии нанопорное секвенирование циркулирующей ДНК без клеток (цфДНК) может обнаруживать опухолевые структурные варианты и паттерны метилирования с высокой чувствительностью. Новые методы целенаправленного длительного секвенирования в жидкой биопсии являются перспективными для неинвазивного мониторинга рака и раннего выявления.
Проблемы и ограничения
Несмотря на эти достижения, секвенирование с длинным чтением сталкивается с несколькими постоянными проблемами. Точность на основе, хотя и улучшена, все еще отстает от платформ с коротким чтением (коэффициент ошибок Illumina <0,1%) для определенных контекстов, особенно в гомополимеровых трактах и высоко повторяющихся регионах. Ошибки с базовым чтением, особенно на уровне индивидуального чтения, могут сбивать с толку одномолекулярные приложения, такие как фазирование или метилирование, вызывающие на низкой глубине. Пропускная способность и стоимость остаются барьерами для крупномасштабных популяционных исследований; хотя затраты снижаются, высокоглубокий длинный читаемый геном человека все еще стоит более 1000-3000 долларов США для HiFi или Nanopore по сравнению с ~ 200 долларами США для стандартного короткого чтения генома.
Подготовка библиотеки к сверхдлинным чтениям требует ДНК с высоким молекулярным весом, которую может быть трудно получить из ткани с фиксированным формалином, встроенным парафином (FFPE) или деградированными судебно-медицинскими образцами. Стрижка, фрагментация и повреждение ДНК во время экстракции уменьшают долю действительно длинных молекул. Новые методы в мягкой экстракции ДНК (например, с использованием агарозных пробок или протоколов на основе магнитных шариков) смягчают эту проблему, но добавляют сложность.
Вычислительные требования также нетривиальны. Большой объем исходных данных сигналов от нанопорных секвенсоров (или больших BAM-файлов от HiFi) требует значительной мощности хранения и обработки. Базовый вызов в реальном времени, хотя и возможен на GPU, потребляет значительные электрические и вычислительные ресурсы. Кроме того, сборка больших геномов de novo из длинных считываний остается вычислительно тяжелой задачей, хотя недавние улучшения в алгоритмах сократили как время выполнения, так и объем памяти.
Перспективы и будущие направления
Следующие пять лет обещают дальнейшие прорывы в секвенировании с длинным чтением. С аппаратной стороны новые твердотельные нанопоры и датчики интегральных схем могут резко увеличить пропускную способность и снизить затраты. Такие компании, как PacBio, разрабатывают настольные системы, которые приносят HiFi в клиническую лабораторию, в то время как ONT продолжает миниатюризировать свои устройства для полевых применений. На химическом фронте активно развивается способность секвенировать более длинные шаблоны (>>2 Мб) без ущерба для точности. Одновременно ожидается, что новые модели базовых вызовов, использующие архитектуры трансформаторов и самоконтролируемое обучение, будут продвигать точность чтения в сыром виде за пределы 30 кв. (99,9%) для нанопор.
Интеграция с пространственной транскриптомикой и одноклеточной геномикой является еще одним новым фронтиром. Длинночтовое секвенирование одноклеточной кДНК или гДНК может обеспечить полноразмерную изоформную информацию и фазированные вызовы вариантов при клеточном разрешении. Ранние работы в этой области показали, что гибридные подходы, сочетающие длинночитаемые и короткочитаемые одноклеточные данные, могут выявить альтернативное сплайсинг и мутации, характерные для клеточного типа, которые пропускаются только короткими считываниями.
Наконец, переход к «пангеномным» эталонным геномам, где совместно анализируются многие высококачественные длинные ассемблеры от разных людей, коренным образом изменит то, как мы интерпретируем генетические вариации человека. Способность обнаруживать редкие, большие SV и изучать влияние повторных расширений на регуляцию генов и болезни станет рутинной по мере созревания этих методов. Новые методы секвенирования с длинным чтением не просто улучшают существующие геномные анализы; они позволяют совершенно новые формы биологического исследования, от полной оркестрации эпигенетических меток в мегабазовых областях до отслеживания вирусных квазивидов в реальном времени у инфицированного хозяина.
Заключение
Новые методы в секвенировании с длинным чтением быстро трансформируют нашу способность анализировать сложные геномы. Благодаря достижениям в области химии, аппаратного обеспечения и вычислений, такие технологии, как PacBio HiFi и Oxford Nanopore, теперь обеспечивают точные, сверхдлинные показания, которые могут охватывать самые непокорные геномные особенности - повторяющиеся области, центромеры и большие структурные варианты - с беспрецедентной точностью. Гибридные подходы и интеграция с эпигеномным анализом еще больше расширяют объем информации, полученной из одного эксперимента. В то время как проблемы остаются в стоимости, пропускной способности и вычислительной нагрузке, траектория ясна: секвенирование с длинным чтением станет стандартом для сборки de novo, обнаружения структурных вариантов и всесторонней характеристики генома как в исследовательских, так и в клинических условиях. Поскольку эти методы продолжают развиваться, они обещают разблокировать более глубокие идеи в генетической структуре, функции и разнообразии, которые будут стимулировать достижения в медицине, сельском хозяйстве и эволюционной биологии.