Table of Contents
پیشرفت های اخیر در ابزارهای محاسباتی، ژنومیک های تحول یافته را تغییر داده اند، محققان را قادر می سازد تا ژنوم های بی سابقه و سرعت را جمع آوری کنند.این پیشرفت ها برای رمزگشایی تنوع گسترده زندگی، از پاتوژن های میکروبی گرفته تا ارگانیسم های پیچیده ای از کاروتتیک، فرآیندهای دستی به خودکار، مقیاس پذیر، مطالعات لوله ای که می تواند به طور منظم از بهبود داده های توالی یافته، و بنیادی، به عنوان یک ژنوم، و پیشرفت های پیشرفت های پیشرفت، استفاده کند، منتقل شده است.
بنیاد: مجمع ژنوم
Genome مونتاژ فرایند محاسباتی بازسازی توالی DNA اصلی از خواندن های پراکنده تولید شده توسط سیستم عامل های توالی است. پیچیدگی این کار از توالی های تکراری، ژنوم پلیپلوئید و اندازه کامل ژنوم های یوکاریوتیتیک اولیه متکی به خواندن کوتاه از تکنولوژی Illumina است که اغلب از بین رفته و تکرار شده است و از طریق این الگوریتم های پیچیده ادغام شده است.
الگوریتم های مجمع نووو
مونتاژ De Novo یک ژنوم را بدون مرجع بازسازی می کند و برای مطالعه ارگانیسم های جدید یا گونه ها بدون ژنوم مرجع نزدیک ضروری است. Algorithms از رویکردهای مختلف استفاده می کند:
- [[ویرایش] [[[ویرایش] [[۱]] [۱]] [[۱۰]]] [[۱]]] [۱]] [۱]] [۱]] [۱] [۱]] [۱]] [۱]] [۱]] [۱۰]] [۱۰]] [FLT] [۱۰]:۵] از OLC برای اصلاح یا پردازش داده های نانو استفاده کنید.
- نمودار برجگان: کارآمد برای خواندن کوتاه، این روش تقسیم به kmers و ساخت یک گراف. مخملی و SPAdes نمونه های کلاسیک، با SPAdes در حال حاضر در حال انجام داده های هیبریدی.
- [[۱] [۱۰] [[۱]] [۱] [۱] [۱]] [۱] [۱] [۱] [۱] [۱] [۱]] [۱] [۱] [۱] [۱] [۱] [۱] [۱۰] [۱۰] [۱] [۱۰] [۲] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [و [۳] [۳] [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر]]]]]]]]]]]]]]]]]]]]]] [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [براى]]]]] [بر [بر
دانلود بازی Long-Read Sequencing و تاثیر آن
تکنولوژی های بلند مدت (PacBio HiFi، آکسفورد نانوپوتر) ده ها تا صدها کیلو پایه را تولید می کنند.این موارد مناطق تکراری را شامل می شوند که امکان تشکیل کامل ژنوم های پیچیده را فراهم می کند.
- [[۱] [۱۰] [۱۰] [۱۰] [۱] [۱]] [۱]] [۱] [۱] [۱] [۱]] [۱]] [۱] [۱] [۱] [۱]] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱]] [۱] [۱] [۱] [۱] [۱] [۱]]]]]]]]] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱]]] [۱] [۱
- [[۱] [۱۰] [۱۰] [۱] [۱۰] [۱]] [۱]] [۱] [۱] [۱] [۱]] از یک روش تکرار کننده استفاده کنید که بدون فرو ریختن آنها، تکرار می شود، و به طور کامل مجامعی را تولید می کند.
- Shasta: بهینه سازی برای آکسفورد نانوپوتر، Shasta سریع و کارآمد حافظه، مناسب برای ژنوم های بزرگ است.
- Hifiasm: تخصصی برای داده های PacBio HiFi، تولید مجموعه های فازd با حل هاپلوتig.
روش های هیبریدی
تجمع ترکیبی دقت خواندن کوتاه را با پیچیدگی خواندن طولانی ترکیب می کند، این استراتژی به ویژه برای تمیز کردن و تخلیه جریان های کاری معمولی مفید است:
- یک پیش نویس را با خواندن طولانی (به عنوان مثال، استفاده از Flye) جمع کنید.
- در این میان، زبان آلمانی با استفاده از ، [[FLT1]] یا [[FLT 2:FreeBayes[[ویرایش]
- مقیاس شده به پروژه های بزرگ مانند پروژه ژنوم های ویتبrate (VGP)، که در آن رویکردهای هیبریدی به طور کامل مجموعه ای از صدها ژنوم مهره دار را فعال کرده اند.
منابع خارجی: مجلس مرکزی آمار مونتاژ و دانلود را برای آموزش های عملی فراهم می کند، ] پلت فرم کار مونتاژ قابل دسترس را ارائه می دهد.
دانلود بازی Genome Annotation: De Encrypt the Blueprint
هنگامی که یک ژنوم مونتاژ می شود، annotation عناصر عملکردی را شناسایی می کند: ژن های پروتئینی، RNA های غیر کد کننده، فولات تنظیمی، مناطق تکراری، شبه ژن ها و انواع ساختاری. Annotation می تواند به یک اشاره ساختاری (خطای مرزهای ژن) و یک اشاره نسبی (به عنوان توابع نشانه برای پیش بینی ژن ها) تقسیم شود.
پیش بینی ژن Initio
روش های Ab Initio از مدل های آماری ساختار ژن برای شناسایی مناطق کد نویسی استفاده می کنند. [۱] آنها نیاز به یک مجموعه آموزش از ژن های شناخته شده دارند. ابزارها مانند ]FLT:1 ، GeneMark-ES ، و GlmerHMM [F:5: آموزش و یا روش معمول برای بهبود بهره برداری از یک سیستم عامل، به ویژه استفاده می کند.
عدم قطعیت مبتنی بر شواهد
رویکردهای مبتنی بر شواهد از RNA-seq، همگرایی پروتئین و سایر داده های تجربی برای اعتباربخشی به پیش بینی ها استفاده می کنند، این در حال حاضر در پروژه های ژنوم یوکاریوتی استاندارد است.
- BRAKER1/2 / 3 ادغام ژنMark-ET (RNA-seq آموزش دیده) و AUGUSTUS برای یک اشاره کامل خودکار به Eukaryotic استفاده می کند. BRAKER2 از سیگنال های پروتئین برای ارگانیسم ها بدون RNA-seq استفاده می کند.
- MAKER2: یک خط لوله انعطاف پذیر که پیش بینی های اکیدایو، هم شناسی و شواهد معادل RNA را ترکیب می کند، می تواند آن را به طور غریزی برای بهبود کیفیت نامربوط اجرا کند.
- PROkka: برای ژنوم های پروکاریوتی، با استفاده از پایگاه های داده مانند Pfam، TIGRFAMs و COG ها برای یادآوری سریع.
یادگیری ماشین در Annotation
یادگیری عمیق وارد یک مفهوم ژنوم شده است، با مدل هایی که می توانند تبلیغ کنندگان را پیش بینی کنند، سایت های splice و حتی تاثیر عملکردی انواع مختلف را دارند. ابزارها مانند DeepGene و DeepSplice [FLT3] از شبکه های عصبی یکپارچه برای دستیابی به دقت بالاتر از مدل های HMM استفاده می کنند.
رویکرد های مقایسه ای و اجتماعی
genomics مقایسه ای از حفاظت تکاملی برای شناسایی عناصر عملکردی استفاده می کند. ENCODE] پیشگام این برای نرم افزار انسان مانند PhyloCSF [[FLT3] شناسایی توالی های رمزگذاری پروتئین محافظه کارانه، در حالی که GERP] [F5] [FLT] استانداردهای کنترل اجتماعی مانند پایگاه های داده های ذخیره سازی را مشخص می کند.
خط لوله های یکپارچه و اتوماسیون
تقاضا برای ژنوم های با کیفیت بالا در مقیاس باعث توسعه خطوط لوله کاملا خودکار شده است که هر دو مونتاژ و annotation را مدیریت می کند.این سیستم ها پیش پردازش داده ها، تصحیح خطا، مونتاژ، داربست و اشاره در یک روش ساده شامل:
- ]GAAP (Genome Assembly and Annotation Pipeline): برای ژنوم های باکتریایی و قارچی طراحی شده است، آن را ادغام ابزار مانند SPAdes، مخملی، Prokka و BUSCO.
- NextDenovo + NextPolish: ترکیب محبوب برای مونتاژ طولانی مدت و لهستانی، اغلب با HiFi می خوانند.
- - هسته / گردش: یک خط لوله مبتنی بر جریان بعدی که ارائه می دهد جریان کار ماژولار برای مونتاژ و annotation، سازگار با محیط های containerized.
- JBrowse2 / IGV: ابزارهای تجسمی که به محققان اجازه می دهد تا به صورت دستی یادداشت برداری و شناسایی گرد و غبارهای اشتباه.
اتوماسیون نیاز به یادآوری دستی را از بین نمی برد، ترکیب پیش بینی های محاسباتی با بررسی تخصصی، استاندارد طلایی برای ژنوم های مرجع باقی مانده است.
کیفیت ارزیابی کیفیت کیفیت
در این میان، شاخص های کیفیت بالا، به صورت زیر است:[۱] [۱] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱۰] [۱] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱] [۱] [۳] [۱۰] [۱] [۱] [۱] [۲] [۳] [۱] [۱] [۱۰] [۲] [۲] [۲] [۱] [۱۰]]]]]] [۱۰] [۳] [۳] [۱] [۳] [۳] [۱]] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۱] [۱] [۱] [۱] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۲] [۳] [۳
مسیر های آینده
دهه بعد چندین تحول را به همراه خواهد آورد:
- Telomere-to-telomere (T2T) مجامع: ژنوم های کامل انسان در حال حاضر به لطف خواندن و الگوریتم های مونتاژ پیشرفته (به عنوان مثال، Verkko) در حال گسترش به ارگانیسم های مدل.
- پانکم های مبتنی بر Graph: به جای یک مرجع خطی، نمودار های پانوراما تنوع در سراسر جمعیت را ثبت می کنند.
- عدم قطعیت زمان واقعی: جریان دادن ابزار اشاره که پردازش داده ها به عنوان آن توالی می تواند سرعت برنامه های بالینی مانند شناسایی پاتوژن ها در یک شیوع.
- Integration of اپیgenomics: methylation DNA، علامت های Histone و دسترسی به کرومین نیاز به روش های محاسباتی جدید که ترکیب مونتاژ با داده های عملکردی.
- اصلاح خطای مبتنی بر هوش: مدل های یادگیری عمیق آموزش دیده در مجموعه های بزرگ از ژنوم های معتبر می توانند خطاهای مونتاژ را با دقت بالا پیش بینی و اصلاح کنند، کاهش نشانه های دستی.
منبع خارجی: NCBI Eukaryotic Gennotation خط لوله بهترین شیوه های فعلی برای یادآوری خودکار از ژنوم های اکاریوتی را نشان می دهد.
به طور خلاصه، ابزارهای محاسباتی برای مونتاژ ژنوم و اشاره به بلوغ رسیده اند که پروژه های بزرگ مقیاس قابل اجرا و مقرون به صرفه را می سازد. ترکیبی از توالی طولانی مدت، هوش ماشین و خط لوله یکپارچه موانع را برای مطالعه ژنوم های پیچیده کاهش می دهد، زیرا این ابزارها همچنان به تکامل ادامه می دهند، آنها پتانسیل کامل genomi را باز می کنند، از درک درختان برای انتخاب دقیق ترین روش های پزشکی خود را برای انتخاب دقیق ترین روش های خاص.