Table of Contents
計算ツールの最近の進歩は、幾何学を変革し、研究者が予期しない精度と速度でゲノムを組み立て、アノテートできるようにしました。これらの改善は、微生物病原体から複雑なユーカリ生物まで、広大な多様性を解読するために不可欠です。この分野は、労働集中的な手動プロセスから自動化されたスケーラブルなパイプラインに移動し、シーケンシングデータのテラバイトを処理することができます。その結果、遺伝子組み換えおよび基礎的な改善が、臨床的改善と生物学的改善につながります。
財団:ゲノムアセンブリ
Genomeアセンブリは、シーケンシングプラットフォームによって生成されたフラグメンドリードから元のDNAシーケンスを再構築する計算プロセスです。このタスクの複雑さは、繰り返しシーケンス、多重性ゲノム、およびユーカリゲノムの層サイズから生じる。初期のアセンブラは、イルミナ技術からの短い読み取りに依存し、多くの場合、繰り返しを崩壊させ、フラグメンドアセンブリを生成しました。これらのツールは、これらのアルゴリズムと複数の統合技術を組み合わせることを克服します。
デノボアセンブリアルゴリズム
ノヴォアセンブリは、参照なしでゲノムを再構築し、密接に関連した基準ゲノムなしで、新しい生物や種を研究するために不可欠です。アルゴリズムは異なるアプローチを使用します。
- [オーバーラップレイアウトコンセンサス(OLC):])は、長い読み物に適した、OCLはコンティグを直接読み出します。 Canu[]と[[]]])PacBioまたはOxford Nanoporeデータに対する補正でOLCを使用する。
- De Bruijn graph:[ 短読みで効率的で、このメソッドはk-mersに読み込まれ、グラフを作成しました。VelvetとSPADEは、ハイブリッドデータを扱うSPAdesで、古典的な例です。
- 文字列グラフ:]] で用いられる OLC のメモリ効率性進化() のミニアスム と ]] レイベン で、急速な長持ちアセンブリに使用されます。
長読みシーケンシングとその影響
長読技術(PacBio HiFi、オックスフォードナノポール)は、数十から数百キロの長い読み取り速度を生成します。これらは、スパン繰り返し領域を読み、複雑なゲノムの完全なアセンブリを可能にします。 主なツールは次のとおりです。
- Canu:]]高ノイズロング読み取り用に設計されたCeleraアセンサのフォーク。 アセンブリの前にエラー補正を行います。
- Flye:]]]は、それらを衝突することなく繰り返し処理する繰り返しグラフのアプローチを使用して、非常に輪郭を描きます。
- Shasta:]] Oxford Nanoporeの読み取りに最適化されたShastaは高速でメモリ効率が高く、大きなゲノムに適しています。
- Hifiasm:]] PacBio HiFiデータに特化した、フェーズドアセンブリをハプロットで生成します。
ハイブリッドアプローチ
ハイブリッドアセンブリは、長い読みの矛盾と短い読みの正確さを組み合わせます。この戦略は、特に研磨とギャップ充填に役立ちます。典型的なワークフローには、次のものが含まれます。
- 長い読み物(Flye を使っているなど)でドラフトを組み立てます。
- ] を使って短い読み物でポーランド語 または ] でフリーベイズ 。
- ハイブリッドアプローチが数百の脊椎遺伝子のほぼ完全なアセンブリを可能にしたVertebrate Genomes Project(VGP)のような大規模なプロジェクトにスケールアップ。
外部リソース: [NCBIアセンブリハブ[は、集計されたアセンブリ統計を提供し、ダウンロードします。 実用的なチュートリアルでは、 []Galaxyプラットフォーム[]]は、アクセス可能なアセンブリワークフローを提供します。
ゲノムアノテーション:ブループリントのデコード
ゲノムが組み立てられたら、アノテーションは機能要素を識別します:タンパク質コーディング遺伝子、非コーディングRNA、規制モチーフ、繰り返し領域、擬遺伝子、および構造的変形。アノテーションは、構造的アノテーション(遺伝子境界線の決定)と機能的なアノテーション(予測遺伝子の割り当て機能)に分けることができます。最近の計算的進歩は、アビトイオの予測、トランジション、および比較的根拠を統合することにより、大幅に改善された精度を向上しました。
アブ・イニティオ遺伝子予測
アブ・イノシオメソッドは、遺伝子構造の統計モデルを使用して、コーディング領域を特定します。 それらは、既知の遺伝子の訓練セットを必要とします。 ]AUGUSTUS、 GeneMark-ES]、 GlimmerHMM]]などのツールは共通です。 新規バージョンは、自動生成機能のない、特に、非自動生成サイトを使用せずに、動作するような動作を改善するために機械学習を有効活用します。
証拠ベースのアノテーション
証拠ベースのアプローチは、RNA-seq、タンパク質の均質学、および予測を検証するために他の実験データを使用します。 これは、ユーカリゲノムプロジェクトで標準的です。 主なパイプラインは次のとおりです。
- BRAKER1/2/3:[]] GeneMark-ET(RNA-seqが訓練された)とAUGUSTUSを完全に自動化されたユーカリのアノテーションに統合します。 BRAKER2は、RNA-seqなしで生物のタンパク質ヒントを使用します。
- MAKER2:]] ab initio予測、均質学、RNA-seq証拠を結合する柔軟なパイプライン。 誤記品質を向上させるために、反復的に実行することができます。
- Prokka:]] 急なアノテーションのためのPfam、TIGRFAM、COGなどのデータベースを使用して、prokaryoticゲノムのために調整しました。
注釈で機械学習
ディープラーニングは、プロモーター、スプライスサイト、および多様体の機能的影響を予測できるモデルで、ゲノムアノテーションに入りました。のようなツールは、DeepGeneと]]DeepSplice[は、従来のHMMよりも高い精度を実現する、コンボショナルニューラルネットワークを使用します。 EVM:]:[FLT:]]]] - と、および[FLT:[FLT:[FLT:[FLT:]] - は、] - と、多くの場合、複雑なモデルを組み合わせて、より、複雑なモデルを組み合わせて、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、より、
比較とコミュニティのアプローチ
比較ゲノムは、機能要素を識別するために進化した保存を有効活用しています。 []]ENCODE project]は、人間のためにこれを開拓しました。 PhyloCSF]のようなソフトウェアは、保存されたタンパク質コーディングシーケンスを検出しますが、 ]]GERP++は、制約された領域を識別します。 [FLT:FLT:[FLT:]は、さまざまな種類の認証を自動生成します。 [FLT:[F]は、多くの種類の認証を生成します。 [FLT:[FLT:]は、テストは、テストされた認証された認証された認証された認証された認証された認証を、]は、テストを、テストされた認証された認証された認証された認証された認証された認証された認証された認証された認証された認証された認証された認証された認証された認証された認証された認証された認証された認証された認証された認証された認証を、および保存された認証された認証された認証された認証された認証された認証された認証された認証された認証された認証された
一貫したパイプラインとオートメーション
スケールで高品質のゲノムの需要は、アセンブリとアノテーションの両方を管理する完全自動化されたパイプラインの開発を主導しています。 これらのシステムは、データプリ処理、エラー補正、アセンブリ、研磨、足場の分離、および合理化されたファッションの注釈を処理する。 以下が含まれます。
- [GAAP(ゲノムアセンブリとアノテーションパイプライン):[[])は、細菌や真菌ゲノムのために設計されており、それは、スパード、ベルベット、プロッカ、およびBUSCOなどのツールを統合します。
- []NextDenovo + NextPolish:[ 頻繁にHiFiの読みと使用される長い準備および磨くための一般的な組み合わせ。
- [nf-core/assembflow:[] アセンブリおよびアノテーションのためのモジュラーワークフローを提供し、コンテナ化された環境と互換性のあるNextflowベースのパイプライン。
- []JBrowse2/IGV:[ 研究者が誤記を治し、アセンブリを識別できるように可視化ツール。
自動化は、手動のキュレーションの必要性を排除しません。 エキスパートレビューによる計算予測の組み合わせは、参照のゲノムのための金基準を維持します。
品質評価
徹底した品質メトリックは必須です。 []]BUSCO] は、保存された単相のオルソロログを検索することで、完全性を評価するツールです。 [] NA50/N90[ 統計測定法は、適合性を測定します。 ]QUAST および []NA50/N90[[[[]]] は、 [[FLT:[F] 基準は、 [[F] 基準は、 [[FLT:[[F] [[[[[[F]]]]] 基準は、 [[[[[[[[[[[[[[[[[[[[[[FLT]]]]]]]]]]]]]]]]]]]、[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[
今後の方向性
今後10年は、いくつかの変革の展開をもたらすでしょう。
- [テロメア対テロメア(T2T)アセンブリ:[]]超長読みと高度なアセンブリアルゴリズム(例えば、Verkko)のおかげで、完全な人間ゲノムができるようになりました。 T2Tプロジェクトは、モデル生物に拡大しています。
- [グラフベースのパンゲノム:[の代わりに、パンゲノムグラフは、人口の変動をキャプチャします。 ミニグラフ、vg、およびパンゲノムグラフビルダーなどのツールは、このシフトを主導しています。
- リアルタイムアノテーション:[ 配列されたようにデータを処理するアノテーションツールを合理化することで、病原体を発生時に特定するなどの臨床アプリケーションを加速できます。
- 流行の統合:[ DNAメチル化、ヒストンマーク、およびクロマチンのアクセシビリティの注釈は、機能的なデータとアセンブリを結合する新しい計算アプローチが必要になります。
- []AI主導のエラー補正:[ 検証されたゲノムの大規模なセットで訓練されたディープラーニングモデルは、高精度でアセンブリエラーを予測し、正しい調整することができ、手動のキュレーションを減らすことができます。
外部リソース: NCBIユーカリ遺伝学の注釈パイプライン[]は、ユーカリ性ゲノムの自動注釈のための現在のベストプラクティスを提示します。
要約では、ゲノムアセンブリとアノテーションのための計算ツールは、大規模プロジェクトの実現可能で費用効果が大きい成熟度に達しました。 長期シーケンシング、機械インテリジェンス、および統合パイプラインの組み合わせは、複雑なゲノムを研究するための障壁を下げました。 これらのツールは進化し続けるにつれて、彼らは精密医学を有効にするために、生命の木を理解することから、ゲノミクスのフルポテンシャルを解除します。 研究者は、特定の生物や生物のアプローチを選択する最新の開発について常に通知しなければなりません。