कम्प्यूटेशनल टूल में हाल के अग्रिमों ने जीनोमिक्स को बदल दिया है, जिससे शोधकर्ताओं को असंतुष्ट सटीकता और गति के साथ जीनोम को इकट्ठा करने और उन्हें एननोटेट करने में सक्षम बनाया गया है। ये सुधार जीवन की विशाल विविधता को कम करने के लिए महत्वपूर्ण हैं, माइक्रोबियल रोगजनकों से लेकर जटिल eukaryotic जीवों तक। क्षेत्र श्रम-गहनशील, स्वचालित प्रक्रियाओं से स्वचालित, स्केलेबल पाइपलाइनों तक पहुंच गया है जो अनुक्रमण डेटा के terabytes को संभाल सकता है। नतीजतन, जीनोम असेंबली और एनोटेशन व्यक्तिगत चिकित्सा, फसल सुधार, संरक्षण जीवविज्ञान, और विकासात्मक अध्ययन में सफलता के लिए नींव बन गया है।

The Foundation of the Genome Assembly, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the New Zealand, the United States.

जेनोम असेंबली मूल डीएनए अनुक्रम को अनुक्रमण प्लेटफार्मों द्वारा उत्पादित खंडित रीडिंग से पुनर्निर्मित करने की कम्प्यूटेशनल प्रक्रिया है। इस कार्य की जटिलता दोहराए गए अनुक्रमों, पॉलीप्लॉयड जीनोम और यूकेरियोटिक जीनोम के सराहा आकार से उत्पन्न होती है। प्रारंभिक assemblers Illumina प्रौद्योगिकी से लघु रीडिंग पर निर्भर करते हैं, जो अक्सर दोहराने और खंडित विधानसभाओं का उत्पादन करते हैं। आधुनिक उपकरण परिष्कृत एल्गोरिदम और एकाधिक अनुक्रमण प्रौद्योगिकियों के एकीकरण के माध्यम से इन सीमाओं को दूर करते हैं।

De Novo विधानसभा Algorithms

De novo विधानसभा एक संदर्भ के बिना एक जीनोम पुनर्निर्माण, यह एक बारीकी से संबंधित संदर्भ जीनोम के बिना उपन्यास जीवों या प्रजातियों का अध्ययन करने के लिए आवश्यक बना। Algorithms विभिन्न दृष्टिकोणों का उपयोग करते हैं:

  • Overlap-layout-consensus (OLC): लंबे समय तक पढ़ने के लिए उपयुक्त, OLC ने सीधे दावे के निर्माण के लिए पढ़े। Canu]]] और Flye] PacBio या ऑक्सफोर्ड नैनोपोर डेटा के लिए सुधार के साथ OLC का उपयोग करें।
  • D Bruijn graph: लघु पढ़ने के लिए कुशल, यह विधि k-mers में पढ़ती है और एक graph बनाती है। मखमली और स्पैड क्लासिक उदाहरण हैं, अब स्पैड्स हाइब्रिड डेटा को संभालने के साथ।
  • String graph: OLC का एक स्मृति कुशल विकास, miniasm]]]] द्वारा इस्तेमाल किया गया और Raven]]] तेजी से लंबे समय से पढ़ने वाली असेंबली के लिए।

लंबे समय तक चलने वाली अनुक्रमण और इसका प्रभाव

लंबे समय तक चलने वाली तकनीकें (पैबायो हिफ़ी, ऑक्सफोर्ड नैनोपोर) सैकड़ों किलोबाइट लंबे समय तक पढ़ती हैं। ये स्पैन दोहराव वाले क्षेत्रों को पढ़ते हैं, जिससे जटिल जीनोम की पूरी असेंबली को सक्षम बनाया गया है।

  • Canu: Celera इकट्ठे करने वाले के एक फोर्क, जिसे उच्च-शोर लंबे समय तक पढ़ा जाता है। यह असेंबली से पहले त्रुटि सुधार करता है।
  • Flye: एक दोहराई गई ग्राफ दृष्टिकोण का उपयोग करता है जो उन्हें बिना किसी तरह के दोहराने के लिए दोहराता है, जिससे अत्यधिक सुसंगति होती है।
  • Shasta: ऑक्सफोर्ड नैनोपोर के लिए अनुकूलित, शास्ता तेजी से और स्मृति कुशल है, जो बड़े जीनोम के लिए उपयुक्त है।
  • Hifiasm: PacBio HiFi डेटा के लिए विशेषीकृत, haplotig रिज़ॉल्यूशन के साथ चरणबद्ध असेंबली का उत्पादन।

हाइब्रिड दृष्टिकोण

हाइब्रिड असेंबली लंबे समय तक पढ़ने की जटिलता के साथ शॉर्ट रीडिंग की सटीकता को जोड़ती है। यह रणनीति विशेष रूप से पॉलिशिंग और अंतराल-भरने के लिए उपयोगी है। विशिष्ट वर्कफ़्लोज़ में शामिल हैं:

  1. लंबे समय तक पढ़ने के साथ एक ड्राफ्ट इकट्ठा (उदाहरण के लिए, फ्लाई का उपयोग करना)।
  2. ]Pilon] या ]]फ्रीबेये ] का उपयोग करके छोटे पढ़ने के साथ पोलिश।
  3. वेर्टेब्रेट जेनोम परियोजना (VGP) जैसी बड़ी परियोजनाओं में वृद्धि हुई, जहां हाइब्रिड दृष्टिकोण ने सैकड़ों वर्टेब्रेट जीनोम की नजदीकी असेंबली को सक्षम किया है।

बाह्य संसाधन: NCBI विधानसभा हब, समग्र विधानसभा आँकड़े और डाउनलोड प्रदान करता है। व्यावहारिक ट्यूटोरियल के लिए, Galaxy प्लेटफॉर्म सुलभ विधानसभा कार्यप्रवाह प्रदान करता है।

Genome Annotation: ब्लूप्रिंट को डिकोड करना

एक बार जब एक जीनोम इकट्ठा हो जाता है, तो एनोटेशन कार्यात्मक तत्वों की पहचान करता है: प्रोटीन कोडिंग जीन, गैर कोडिंग आरएनए, नियामक रूपांकनों, दोहराने वाले क्षेत्रों, छद्मजनों और संरचनात्मक रूपों। एनोटेशन को संरचनात्मक एनोटेशन (जेन सीमाओं को अलग करना) और कार्यात्मक एनोटेशन (अनुमानित जीनों के लिए कार्य) में विभाजित किया जा सकता है। हाल के कम्प्यूटेशनल अग्रिमों ने एबी इनिटियो भविष्यवाणियों, ट्रांसक्रिप्टोमिक सबूतों और तुलनात्मक जीनोमिक्स को एकीकृत करके नाटकीय रूप से सटीकता में सुधार किया है।

A shythary of the shythary of the shythary.

Ab initio तरीके कोडिंग क्षेत्रों की पहचान करने के लिए जीन संरचना के सांख्यिकीय मॉडल का उपयोग करते हैं। उन्हें ज्ञात जीनों का एक प्रशिक्षण सेट की आवश्यकता होती है। AUGUSTUS], GeneMark-ES, और GlimmerHMM]] जैसे उपकरण आम हैं। नए संस्करण संवेदनशीलता में सुधार के लिए मशीन लर्निंग का लाभ उठाते हैं, विशेष रूप से गैर-कैनोनिकल स्प्लिस साइटों के लिए। GeneMark-EP+, उदाहरण के लिए, एक आत्म-प्रशिक्षण दृष्टिकोण का उपयोग करता है जो पूर्व-विस्तारक्तीकरण के बिना काम करता है।

साक्ष्य आधारित एनोटेशन

साक्ष्य आधारित दृष्टिकोण RNA-seq, प्रोटीन समोगिरि और अन्य प्रयोगात्मक डेटा का उपयोग भविष्यवाणियों को मान्य करने के लिए करते हैं। यह अब eukaryotic जीनोम परियोजनाओं में मानक है।

  • BRAKER1 / 2/3:] Integrates GeneMark-ET (RNA-seq प्रशिक्षित) and AUGUSTUS पूरी तरह से स्वचालित eukaryotic annotation के लिए. BRAKER2 RNA-seq के बिना जीवों के लिए प्रोटीन संकेत का उपयोग करता है।
  • MAKER2: एक लचीली पाइपलाइन जो ab initio भविष्यवाणियों, homology और RNA-seq सबूतों को जोड़ती है। यह घोषणा की गुणवत्ता में सुधार के लिए इसे अनिवार्य रूप से चलाया जा सकता है।
  • Prokka: Prokaryotic जीनोम के लिए टेलर, तेजी से एनोटेशन के लिए Pfam, TIGRFAM, और COG जैसे डेटाबेस का उपयोग करना।

मशीन लर्निंग इन एनोटेशन

दीप लर्निंग ने जीनोम एनोटेशन में प्रवेश किया है, मॉडल जो प्रोमोटर्स, स्प्लिस साइटों और यहां तक कि वेरिएंट के कार्यात्मक प्रभाव की भविष्यवाणी कर सकते हैं। डीपजेन और डीपस्प्लिस पारंपरिक एचएमएम की तुलना में उच्च सटीकता प्राप्त करने के लिए एक महत्वपूर्ण भूमिका निभाने के लिए एक महत्वपूर्ण भूमिका निभाते हैं। EVM ] (Evidence Modeler) डेटा से सीखे गए वजन का उपयोग करके कई भविष्यवाणी सेट को जोड़ती है, अक्सर सर्वश्रेष्ठ अंतिम एनोटेशन पैदा करती है। [FLT: 6]

तुलनात्मक और सामुदायिक दृष्टिकोण

तुलनात्मक जीनोमिक्स कार्यात्मक तत्वों की पहचान के लिए विकासवादी संरक्षण का लाभ उठाते हैं। ENCODE परियोजना ने इसे मानव के लिए अग्रणी बनाया। PhyloCSF]]] जैसे सॉफ्टवेयर ने कई प्रजातियों में स्वचालित एनोटेशन अपडेट प्रदान किया, जबकि GERP++]] को प्रशिक्षित क्षेत्रों की पहचान की। [[FLT:]]Eensembl] जैसे सामुदायिक डेटाबेस कई प्रजातियों में स्वचालित एनोटेशन अपडेट प्रदान करते हैं, गुणवत्ता नियंत्रण के लिए मानकों को निर्धारित करते हैं।

एकीकृत पाइपलाइन और स्वचालन

पैमाने पर उच्च गुणवत्ता वाले जीनोम की मांग ने पूरी तरह से स्वचालित पाइपलाइनों के विकास को प्रेरित किया है जो दोनों विधानसभा और एनोटेशन का प्रबंधन करते हैं। ये सिस्टम एक सुव्यवस्थित फैशन में डेटा प्रीप्रोसेसिंग, त्रुटि सुधार, असेंबली, पॉलिशिंग, मचान और एनोटेशन को संभालती हैं। उदाहरणों में शामिल हैं:

  • GAAP (Genome Assembly and Annotation Pipeline): बैक्टीरिया और कवक जीनोम के लिए बनाया गया, यह स्पाडे, मखमली, प्रोका और BUSCO जैसे उपकरणों को एकीकृत करता है।
  • ]अगला डेनोवो + नेक्स्टपॉलिश: लंबे समय तक चलने वाली असेंबली और पॉलिशिंग के लिए एक लोकप्रिय संयोजन, अक्सर HiFi पढ़ने के साथ प्रयोग किया जाता है।
  • nf-core/assembflow: A Nextflow आधारित पाइपलाइन जो विधानसभा और घोषणा के लिए मॉड्यूलर वर्कफ़्लो प्रदान करती है, जो कंटेनरीकृत वातावरण के साथ संगत है।
  • JBrowse2 / IGV: विज़ुअलाइज़ेशन टूल जो शोधकर्ताओं को मैन्युअल रूप से एनोटेशन को ठीक करने और गलत-असेंबलियों की पहचान करने की अनुमति देते हैं।

स्वचालन मैनुअल क्यूरेशन की आवश्यकता को समाप्त नहीं करता है। विशेषज्ञ समीक्षा के साथ कम्प्यूटेशनल भविष्यवाणियों का संयोजन संदर्भ जीनोम के लिए सोने का मानक बना हुआ है।

गुणवत्ता आकलन

मजबूत गुणवत्ता मीट्रिक आवश्यक हैं। BUSCO टूल संरक्षित एकल-कॉपी ऑर्थोलॉग की खोज करके पूर्णता का आकलन करता है। NA50/N90 ] सांख्यिकी माप संघननन। QUAST]]]] और ]GAzzali] विस्तृत विधानसभा रिपोर्ट प्रदान करते हैं। एनोटेशन के लिए, CEGMA]]]BU:F:

भविष्य निर्देश

अगले दशक में कई बदलावों को शामिल किया जाएगा:

  • ]Telomere-to-telomere (T2T) विधानसभाओं: पूर्ण मानव जीनोम अब अति-लंबे पढ़ने और उन्नत विधानसभा एल्गोरिदम (जैसे, Verkko) के लिए धन्यवाद संभव है। T2T परियोजनाओं मॉडल जीवों के लिए विस्तार कर रहे हैं।
  • ग्राफ आधारित pangenomes: एक एकल रैखिक संदर्भ के बजाय, pangenome graph आबादी भर में भिन्नता को कैप्चर करता है। मिनीग्राफ, vg, और PanGenome ग्राफ बिल्डर जैसे उपकरण इस बदलाव का नेतृत्व कर रहे हैं।
  • ]Real-time annotation: स्ट्रीमिंग annotation उपकरण है कि यह अनुक्रमित है के रूप में प्रक्रिया डेटा नैदानिक अनुप्रयोगों में तेजी ला सकता है, जैसे कि एक प्रकोप में रोगजनकों की पहचान।
  • ]Epigenomics के एकीकरण:Annotating DNA methylation, histone निशान, and chromatin accessibility will be required new computational दृष्टिकोण that combine the विधानसभा with functional data.
  • AI-driven त्रुटि सुधार: दीप लर्निंग मॉडल जो मान्य जीनोम के बड़े सेट पर प्रशिक्षित है, वे उच्च परिशुद्धता के साथ विधानसभा त्रुटियों की भविष्यवाणी कर सकते हैं और सही कर सकते हैं, मैनुअल क्यूरेशन को कम कर सकते हैं।

बाह्य संसाधन: NCBI Eukaryotic Genome Annotation पाइपलाइन eukaryotic genomes के स्वचालित एनोटेशन के लिए वर्तमान सर्वोत्तम प्रथाओं का प्रदर्शन करता है।

संक्षेप में, जीनोम असेंबली और एनोटेशन के लिए कम्प्यूटेशनल टूल एक परिपक्वता तक पहुंच गया है जो बड़े पैमाने पर परियोजनाओं को व्यवहार्य और लागत प्रभावी बनाता है। लंबे समय तक चलने वाली अनुक्रमण, मशीन इंटेलिजेंस और एकीकृत पाइपलाइनों का संयोजन ने जटिल जीनोम का अध्ययन करने के लिए बाधाओं को कम कर दिया है। चूंकि ये उपकरण विकसित होने के लिए जारी रखते हैं, वे जीनोमिक्स की पूरी क्षमता को अनलॉक करेंगे, जिससे कि सटीक दवा को सक्षम करने के लिए जीवन के पेड़ को समझने से। शोधकर्ताओं को अपने विशिष्ट जीवों और प्रश्नों के लिए सर्वोत्तम दृष्टिकोण चुनने के लिए नवीनतम विकास के बारे में सूचित रहना चाहिए।