Цивільно-імперські послуги; структурне будівництво
Поспішні інструменти для складання геномів та анотації
Table of Contents
Останні досягнення в обчислювальних інструментах мають трансформовані геноми, що дозволяють дослідникам зібрати і анотувати геноми з неприпустимою точністю і швидкістю. Ці поліпшення є критичними для декодування величезного різноманіття життя, від мікробіальних патогенів до складних екукаріотичних організмів. Поле перемістилося з трудомістких, ручних процесів для автоматизованих, масштабних трубопроводів, які можуть обробляти терабайти від закопування даних. В результаті нарощування геномів і анотації стали фундаментальними для проривів в осінноваційній медицині, поліпшення культур, збереження біології і еволюціонарні дослідження.
Фонд: Геноме Асамблея
Геноме зібрання є обчислювальний процес реконструювання оригінальної послідовності ДНК від фрагментованих читань, що виробляються за допомогою очисних платформ. Складність цього завдання виникає з повторюваних послідовностей, поліплеїдних геномів, а розмір ери еукаріотичних геномів. Ранні змішувачі спираються на короткі читання з технології Ілюміна, які часто згортають повтори і виробляють фрагментовані збірки. Сучасні інструменти долають ці обмеження через складні алгоритми і інтеграцію декількох технологій віджимання.
Де Ново Асамблеї Алгоритми
Де б не було зібрано, що реконструює геном без посилання, що робить його важливим для вивчення нових організмів або видів без тісно пов'язаних з довідковим геном. Алгоритми використовують різні підходи:
- Overlap-layout-consensus (OLC): Підходить для довгих зчитувань, OLC перезапущені читання безпосередньо для побудови контигів. Інструменти, такі як Canu і Flye] ]] використовується OLC з корекціями для PacBio або Oxford Nanopore даних.
- De Bruijn Графік: Ефективний для коротких читаєнь, цей метод розбиває читання на к-мерів і будує графік. Velvet і SPAdes - це класичні приклади, з допомогою SPAdes тепер використовують гібридні дані.
- Страчний графік: Рентген-революція ПЛК, що використовується мініазм і Ран] для швидкого збирання довгого читу.
Довгоготуйте скуштування та його вплив
Довгий технології (PacBio HiFi, Оксфорд Nanopore) генерує десятки до сотні кілометрів довга. Ці дані про триптихальні області, що дозволяють завершити збір складних геномів. Ключові інструменти включають:
- Кана: Окунь Келера Асамблелер, призначений для високо-незвісних довгих читань. Він виконує корекцію помилок перед складанням.
- Flye:] Використовуйте повторний графічний підхід, який ручить повторювати повтори без їх згоряння, що виробляє висококонтурні зборки.
- Шста: Оптимізований для читання нанопорів Оксфорда, Штаста є швидким і пам'ясним, придатним для великих геномів.
- Hifiasm: Спеціалізована для даних PacBio HiFi, виробництво фазових збірок з роздільною здатністю сідла.
Гібридні підходи
Гібридна збірка поєднує точність коротких читань з контигумістю довгих читань. Ця стратегія особливо корисно для полірування і зазорів. Типові робочі процеси передбачають:
- Сприяє розширенню проекту з тривалими читаннями (наприклад, за допомогою Flye).
- Полір з короткими зчитуваннями за допомогою Pilon] або FreeBayes.
- У масштабі великих проектів, як проект «Вертебррати Геноме» (VGP), де гібридні підходи ввімкнули близько неповні збірки сотень геномів хребетних.
Зовнішні ресурси: NCBI Асамблея хаб забезпечує сукупну статистику збірки та завантаження. Для практичних уроків, Galaxy платформа] пропонує доступні зборні робочі процеси.
Геноме анотація: Декодування Блакитного друку
Після складання геному анотація визначаються функціональні елементи: гени білково-кодування, незгодні РНК, нормативні мотиви, регулятивні райони, псевдогени та структурні варіанти. Анотація може бути розділена на структурну анотацію (розширюючі межі генів) та функціональну анотацію (прикладні функції для прогнозування генів). Останні обчислювальні досягнення значно покращили точність шляхом інтегрування аб initio прогнозування, транографічних доказів та порівняльних геномів.
Ab Initio Gene Прогнозування
Аб інітіо методи використовують статистичні моделі структури гена для визначення конденсованих регіонів. Вони вимагають навчального набору відомих генів. Інструменти, такі як AUGUSTUS, GeneMark-ES], і GlimmerHMM]. Нові версії важіль машинного навчання для підвищення чутливості, зокрема для неканонічних ділянок шлаків. GeneMark-EP+ , наприклад, використовує самостійний підхід, який працює без попереднього вивчення анотації.
Евіденція-Основи
РНК-сек, білкова гомологія та інші експериментальні дані для оцінки. Це зараз стандарт у проектах екукаротичного геному. Ключові трубопроводи включають:
- BRAKER1/2/3: Інтеграція GeneMark-ET (РНК-сек навчений) і AUGUSTUS для повністю автоматизованої анотації еукаротичного. BRAKER2 використовує білкові натяки для організмів без РНК-сека.
- MAKER2:] Гнучкий трубопровод, який поєднує в собі аб ініціопрогування, гомологію та РНК-сек. Він може бути курсувати ітеративно для підвищення якості анотації.
- Прокка: Призначений для прокаріотичних геномів, використовуючи бази даних, такі як Pfam, TIGRFAM, COG для швидкого анотування.
Машинне навчання в анотації
Глибоке навчання вводило анотацію геномів, з моделями, які можуть прогнозувати промоторів, ділянок шезлонги та навіть функціональний вплив варіантів. Інструменти, такі як DeepGene та DeepSplice] використовують конвюктивні нейромережі для досягнення точності, ніж традиційні HMMs. EVM (Evidence Modeler) поєднує в собі декілька наборів прогнозування, використовуючи ваги, які навчаються з даних, часто зводяться в кращому кінцевому анотуванні ++-на основі:
Порівняльні та об'єктивні підходи
Порівняльна героміка важіль еволюціонарна консервація для виявлення функціональних елементів. проекту DECODE піонером цього для людини. Програмне забезпечення, як PhyloCSF] виявляє консервовані послідовності білків, а GERP++ ідентифікує обмежені регіони. База даних спільноти, такі як Ensembl забезпечує автоматизоване анотування по багатьох видах, налаштування стандартів контролю якості.
Інтегровані труби та автоматики
Вимоги до високоякісних геномів у масштабі приводили розробку повністю автоматизованих трубопроводів, які вправляють як монтаж, так і анотацію. Ці системи керують даними, що передоброблюють, корекція помилок, збірка, полірування, розсіювання та анотацію в потоковій моді. Приклади включають:
- Гаапа (Genome Assembly and Annotation Pipeline):] Призначений для бактеріальних і грибкових геномів, він інтегрує інструменти, такі як СПАдес, Світловець, Прокка та БАСКО.
- NextDenovo + NextPolish: Популярне поєднання для довгого складання та полірування, часто використовується з зчитуванням HiFi.
- nf-core/assembflow: На основі трубопроводу, що забезпечує модульні робочі процеси для складання та анотації, сумісні з контейнерними середовищами.
- JBrowse2 / IGV:] Інструменти візуалізації, які дозволяють дослідникам вручну замісити анотацію і виявити незбираючі речовини.
Автоматизація не усуває потреби у ручному вилікуванні. Поєднання обчислювальних прогнозів з експертним оглядом залишається золотом стандартом для довідкових геномів.
Оцінка якості
Визначені значення метрики Robust. BUSCO] інструмент оцінює повноту, шукаючи консервовані однокопні ортологи. NA50/N90] Статистика вимірює контигуність. Інструменти, такі як QUAST і газзаli] забезпечують докладні звіти збірки. Для анотації CEGMA[F:9] і [[F:11F:]
Майбутні напрямки
Наступного десятиліття буде принести кілька трансформаційних розробок:
- Telomere-to-telomere (T2T) збірки: Повний геном людини тепер можливо завдяки наддовгих читає і розширених алгоритмів складання (наприклад, Verkko). Проекти T2T розширюється до моделювальних організмів.
- Графічні пангеноми: Замість одного лінійного посилання, пангеноми графіки захоплення варіації по популяціях. Інструменти, як мініграф, вг, так і PanGenome Граф Builder, є провідним цим зміном.
- Реал-часове анотування: Потокові анотаційні інструменти, які обробляти дані, як це послідовно може прискорити клінічні програми, такі як виявлення збудників в області спалаху.
- Інтеграція епігномів: Анотування метилювання ДНК, йоготонів та хроматину доступність зажадає нові обчислювальні підходи, які об'єднують збірку з функціональними даними.
- Реконструкція похибки ай-диску: Глибокі моделі навчання, що навчаються на великих наборах перевірених геномів, можуть прогнозувати та виправити помилки складання з високою точністю, зменшенням ручного вилікування.
Зовнішній ресурс: NCBI Eukaryotic Genome анотаційний трубопровод] показує актуальні кращі практики автоматизованого анотування геномів екуаріотичного геномів.
У резюме, обчислювальні інструменти для складання геномів і анотації досягали зрілість, що робить масштабні проекти психічними і економічно вигідними. Поєднання довгопрочитаного відсихання, машинного інтелекту, інтегрованих трубопроводів має знижені бар’єри для вивчення складних геномів. Як ці інструменти продовжують розвиватися, вони розблокують повний потенціал геномів, від розуміння дерева життя, щоб забезпечити точність медицини. Дослідники повинні бути поінформовані про останні розробки, щоб вибрати кращі підходи до їх специфічних організмів і питань.