Civil &: строительная инженерия
Достижения в области вычислительных инструментов для сборки и аннотации генома
Table of Contents
Последние достижения в вычислительных инструментах трансформировали геномику, позволив исследователям собирать и аннотировать геномы с беспрецедентной точностью и скоростью. Эти улучшения имеют решающее значение для расшифровки огромного разнообразия жизни, от микробных патогенов до сложных эукариотических организмов. Область перешла от трудоемких ручных процессов к автоматизированным масштабируемым трубопроводам, которые могут обрабатывать терабайты данных секвенирования. В результате сборка и аннотация генома стали основополагающими для прорывов в персонализированной медицине, улучшении урожая, биологии сохранения и эволюционных исследованиях.
Оригинальное название: Genome Assembly
Геномная сборка — это вычислительный процесс реконструкции исходной последовательности ДНК из фрагментированных считываний, производимых платформами секвенирования. Сложность этой задачи возникает из повторяющихся последовательностей, полиплоидных геномов и огромного размера эукариотических геномов. Ранние сборщики опирались на короткие считывания из технологии Illumina, которая часто разрушала повторы и производила фрагментированные сборки. Современные инструменты преодолевают эти ограничения с помощью сложных алгоритмов и интеграции технологий множественного секвенирования.
Алгоритмы Ассамблеи Де Ново
Сборка de novo реконструирует геном без ссылки, что делает его необходимым для изучения новых организмов или видов без тесно связанного с ним эталонного генома. Алгоритмы используют различные подходы:
- Консенсус с закладкой верст (OLC): Подходит для длинных считываний, OLC перекрытая считывание читается непосредственно для создания контигов. Инструменты, такие как Canu и Flye, используют OLC с исправлениями для данных PacBio или Oxford Nanopore.
- Де Брюйн граф: Эффективный для коротких чтений, этот метод разделяет считывания на k-меры и строит граф. Бархат и SPAdes являются классическими примерами, с SPAdes теперь обрабатывает гибридные данные.
- Граф струн: Эволюция OLC, эффективная для памяти, используемая миниазмом и Равеном для быстрой сборки с длинным чтением.
Долгосрочное секвенирование и его влияние
Технологии с длинным чтением (PacBio HiFi, Oxford Nanopore) генерируют считывания длиной от десятков до сотен килобаз. Эти считывания охватывают повторяющиеся области, позволяя полностью собирать сложные геномы. Ключевые инструменты включают:
- Canu: Вилка сборщика Celera, рассчитанная на высокие долгие считывания шума. Она выполняет коррекцию ошибок перед сборкой.
- FLT:0 Flye: FLT:1 использует метод повторного графирования, который обрабатывает повторы без их разрушения, создавая очень смежные сборки.
- Шаста: Шаста: Шаста: 1, оптимизированный для Оксфорда Нанопора, гласит: Шаста быстр и эффективен для памяти, подходит для больших геномов.
- Ифиазм: Специализируется на данных PacBio HiFi, производя поэтапные сборки с разрешением гаплотига.
Гибридные подходы
Гибридная сборка сочетает в себе точность коротких показаний с смежностью длинных показаний. Эта стратегия особенно полезна для полировки и заполнения зазоров. Типичные рабочие процессы включают:
- Соберите черновик с длинными прочтениями (например, с использованием Flye).
- Польский язык с короткими прочтениями, использующими Pilon или FreeBayes.
- Масштабируемый до крупных проектов, таких как проект Vertebrate Genomes Project (VGP), где гибридные подходы позволили собрать почти полные скопления сотен геномов позвоночных.
Внешние ресурсы: Концентратор сборки NCBI предоставляет агрегированную статистику сборки и загрузок. Для практических учебных пособий платформа Galaxy предлагает доступные рабочие процессы сборки.
Аннотация к геному: расшифровка чертежа
После того, как геном собран, аннотация идентифицирует функциональные элементы: гены, кодирующие белки, некодирующие РНК, регуляторные мотивы, повторяющиеся области, псевдогены и структурные варианты. Аннотация может быть разделена на структурную аннотацию (определяющую границы генов) и функциональную аннотацию (назначение функций предсказанным генам). Недавние вычислительные достижения значительно улучшили точность, интегрируя предсказания ab initio, транскриптомные доказательства и сравнительную геномику.
Предсказание гена Ab Initio
Методы Ab initio используют статистические модели структуры генов для идентификации кодирующих областей. Они требуют тренировочного набора известных генов. Такие инструменты, как AUGUSTUS, GeneMark-ES и GlimmerHMM, являются общими. Более новые версии используют машинное обучение для улучшения чувствительности, особенно для неканонических сайтов сплайсинга. GeneMark-EP+, например, использует подход самообучения, который работает без ранее существовавшей аннотации.
Доказательная аннотация
Доказательные подходы используют РНК-сек, гомологию белка и другие экспериментальные данные для проверки прогнозов. Это теперь стандартно в проектах эукариотического генома. Ключевые трубопроводы включают:
- BRAKER1/2/3: Интегрирует GeneMark-ET (обученный РНК-секу) и AUGUSTUS для полностью автоматизированной эукариотической аннотации. BRAKER2 использует белковые подсказки для организмов без РНК-сека.
- MAKER2: Гибкий конвейер, который сочетает в себе предсказания ab initio, гомологию и РНК-секвенирование. Его можно запускать итеративно для улучшения качества аннотации.
- Прокка: Приспособлен для прокариотических геномов, используя базы данных, такие как Pfam, TIGRFAMs и COGs для быстрой аннотации.
Машинное обучение в аннотации
Глубокое обучение вошло в аннотацию генома с моделями, которые могут предсказывать промоторы, сплайс-сайты и даже функциональное воздействие вариантов. Инструменты, такие как DeepGene и DeepSplice, используют сверточные нейронные сети для достижения более высокой точности, чем традиционные HMM. EVM (Evidence Modeler) объединяет несколько наборов предсказаний с использованием весов, полученных из данных, часто давая лучшую окончательную аннотацию. FGENESH++ использует подход на основе машинного обучения для сложных геномов, таких как растения.
Сравнительный и общинный подходы
Сравнительная геномика использует эволюционное сохранение для идентификации функциональных элементов. Проект ENCODE впервые применил это для человека. Программное обеспечение, такое как PhyloCSF, обнаруживает консервативные последовательности кодирования белка, в то время как GERP++ идентифицирует ограниченные области. Базы данных сообщества, такие как Ensembl, предоставляют автоматизированные обновления аннотации для многих видов, устанавливая стандарты контроля качества.
Интегрированные трубопроводы и автоматизация
Спрос на высококачественные геномы в масштабе привел к разработке полностью автоматизированных трубопроводов, которые управляют как сборкой, так и аннотацией. Эти системы обрабатывают предварительную обработку данных, коррекцию ошибок, сборку, полирование, лесоводство и аннотацию в упрощенном порядке. Примеры включают:
- GAAP (Genome Assembly and Annotation Pipeline): Разработан для бактериальных и грибковых геномов, он объединяет такие инструменты, как SPAdes, Velvet, Prokka и BUSCO.
- NextDenovo + NextPolish: Популярная комбинация для сборки и полировки с длинным чтением, часто используемая с чтениями HiFi.
- nf-core/assembflow: Трубопровод на основе Nextflow, который предлагает модульные рабочие процессы для сборки и аннотации, совместимые с контейнерными средами.
- JBrowse2/IGV: Инструменты визуализации, позволяющие исследователям вручную курировать аннотации и выявлять неправильные сборки.
Автоматизация не устраняет необходимости ручного курирования.Сочетание вычислительных предсказаний с экспертным обзором остается золотым стандартом для эталонных геномов.
Оценка качества
Надежные показатели качества имеют важное значение. Инструмент BUSCO оценивает полноту путем поиска сохранившихся ортологов с одной копией. NA50/N90 Статистика измеряет смежность. Инструменты, такие как QUAST и gazzali, предоставляют подробные отчеты о сборке. Для аннотации используются бенчмарки CEGMA и OMA Проект биогенома Земли определил стандарты, требующие >90% полноты BUSCO для проектов геномов.
Будущие направления
Следующее десятилетие принесет несколько преобразующих событий:
- Сборки теломер-теломеров (T2T): Полные геномы человека теперь возможны благодаря сверхдлинным считываниям и передовым алгоритмам сборки (например, Verkko). Проекты T2T расширяются до модельных организмов.
- Пангеномы на основе графов: Вместо одной линейной ссылки, диаграммы пангенома захватывают вариации популяций.
- Аннотация в реальном времени: Потоковые инструменты аннотации, которые обрабатывают данные по мере их секвенирования, могут ускорить клинические применения, такие как выявление патогенов в вспышке.
- Интеграция эпигеномики: Аннотация метилирования ДНК, гистоновых меток и доступности хроматина потребует новых вычислительных подходов, которые сочетают сборку с функциональными данными.
- AI-управляемая коррекция ошибок: Модели глубокого обучения, обученные на больших наборах валидированных геномов, могут прогнозировать и исправлять ошибки сборки с высокой точностью, уменьшая ручное курирование.
Внешний ресурс: НЦБИ Эукариотическая Геномная Аннотация трубопровода демонстрирует современные передовые методы для автоматизированной аннотации эукариотических геномов.
В целом, вычислительные инструменты для сборки и аннотации генома достигли зрелости, что делает крупномасштабные проекты осуществимыми и экономически эффективными. Сочетание секвенирования с длинным чтением, машинного интеллекта и интегрированных трубопроводов снизило барьеры для изучения сложных геномов. По мере того, как эти инструменты продолжают развиваться, они будут раскрывать весь потенциал геномики, от понимания древа жизни до обеспечения точной медицины. Исследователи должны быть в курсе последних разработок, чтобы выбрать лучшие подходы для своих конкретных организмов и вопросов.