Table of Contents
Những cải tiến này là cần thiết để giải quyết sự đa dạng lớn của sự sống, từ vi khuẩn thành các sinh vật phức tạp phức tạp. các lĩnh vực này đã di chuyển từ việc tăng cường lao động, kinh nghiệm bằng tay đến các đường ống tự động, có thể xử lý các dữ liệu xếp xếp dãy. kết quả là, sự hội tụ gen và sự không có tác động đến các đột phá cá nhân trong y học, mùa màng, bảo tồn sinh học và các nghiên cứu sinh học.
Tổ chức: Hội nghị Genome
Sự phức tạp của công việc này xuất phát từ chuỗi lặp đi lặp lại, bộ gen đa chiều, và kích thước tuyệt đối của bộ gen eukarytictic. Các bộ gen tập hợp lúc đầu phụ thuộc vào đọc ngắn từ công nghệ Illomina, thường bị sụp đổ và tạo ra các hội nghị.
Thuật toán phân loại của Hội nghị
Việc phân hủy một bộ gen tái tạo lại mà không cần tham khảo, làm cho nó cần thiết cho việc nghiên cứu sinh vật hay loài mới lạ mà không có một bộ gen liên quan chặt chẽ.
- Overlap-layout-consenus: thích hợp cho từ lâu, OLC chồng chéo trực tiếp đọc để xây dựng các contig. Công cụ như Canu và [FL:] [FLT:] [FL:5]] Dùng các tổ hợp phím [FL:5] để sửa chữa cho trò chơi PacBio hoặc dữ liệu Oxford.
- Đồ thịDe Bruijn: Tiện ích cho đọc ngắn, phương pháp này chia thành k-mers và xây dựng một đồ thị. Velvet và SPAdes là những ví dụ cổ điển, với SPAdes bây giờ xử lý dữ liệu lai.
- Đồ thị: ) Một tiến hóa có hiệu quả trí nhớ của OLC, được dùng bởi và Thao tác ) cho hội nghị đọc nhanh.
Đọc lâu và gây ảnh hưởng
Công nghệ đọc dài (PacBio HiFi, Oxford Nanopore) tạo ra đọc hàng chục đến hàng trăm kilo cơ sở. Những phương pháp này đọc lại khoảng thời gian lặp lại, cho phép tập hợp toàn bộ bộ bộ bộ bộ gen phức tạp. Công cụ khóa gồm:
- Canu: Một ngã ba của bộ thu thập tiếng Celera, được thiết kế để có khả năng đọc cao độ. Nó thực hiện lỗi sửa chữa trước khi lắp ráp.
- : dùng một phương pháp lặp lại đồ thị xử lý lặp đi lặp lại mà không làm sụp đổ chúng, tạo ra những hội nghị rất liên tục.
- , được làm báp têm cho Oxford Nanopore đọc, Shasta là nhanh và hiệu quả trí nhớ, phù hợp với bộ gen lớn.
- Hifiasm:) Chuyên về dữ liệu PacBio HiFi, tạo ra các hội nghị giai đoạn với độ phân giải haplotig.
Những phương pháp pha lọc
Sự kết hợp lai kết hợp độ chính xác của đọc ngắn với độ tương thích của việc đọc dài. Phương pháp này đặc biệt hữu ích cho việc đánh bóng và điền vào khoảng trống. Dòng công việc điển hình bao gồm:
- Hãy tập hợp bản nháp với chữ đọc dài (v. d., dùng Flye).
- Tiếng Ba Lan đọc ngắn Plon hoặc ) FreeBayes .
- Phóng to các dự án lớn như Dự án Gen Vertebrate (VGP), nơi các phương pháp tiếp cận lai đã tạo ra các hội nghị gần như hoàn thiện của hàng trăm bộ gen sống.
Tài nguyên bên ngoài: Trung tâm [FLT: 0] [FLT: 0] [FLT: 1] [FLT:] cung cấp số liệu thống kê và tải về tổng hợp. Đối với các hướng dẫn thực tiễn, ) Galaxiy cung cấp các công việc hội nghị dễ truy cập.
Chú giải hệ gen: Giải mã dấu vân tay xanh
Một khi bộ gen được lắp ráp, sự chú thích có thể phân chia thành các yếu tố chức năng: gen có chức năng: bộ gen phân tách protein, không phân tách, động cơ điều khiển, các vùng lặp đi lặp lại, giả tạo và biến thể cấu trúc. Sự chú giải có thể được chia thành các yếu tố cấu trúc (định giới gen) và chức năng chú giải (các chức năng để dự đoán gen). Những tiến bộ máy tính gần đây đã cải tiến đáng kể sự chính xác bằng cách tích hợp nhất abitio, dự đoán phiên bản, bằng chứng minh và bằng chứng bằng chứng minh và bằng tiến trình cân đối.
Dự đoán gen AbIiio
Tuy phương pháp này dùng mô hình thống kê để nhận diện vùng mã hóa. Họ yêu cầu một tập huấn các gen đã biết. Công cụ như [FLT ) ), [FLT: 1], GAR [F:] [FLT: 2] [FLT:] [FBT:] [FLT:]], [FLT:], và [FLT] [FLT] [FLT:]]]]] [FLTTT: 1]]],] là phổ biến. Các phiên bản mới hơn để cải tiến tính nhạy cảm, đặc biệt là các trang inter-E+, Gene+, sử dụng khả năng tự hướng dẫn không có khả năng tiếp cận.
Chú giải bằng chứng
Các phương pháp tiếp cận dựa trên bằng chứng sử dụng chất độc, chất đạm và các dữ liệu thử nghiệm khác để xác thực các dự đoán.
- và ERTUS để có thể tự động tạo chú thích. BRLT:1] sử dụng các gợi ý protein cho các sinh vật không có sự phát triển của RNA-seq.
- [FLT: 1] Một đường ống linh hoạt kết hợp ab iniio, smraology, và eseq bằng chứng. Nó có thể chạy lặp lại để cải thiện chất lượng chú giải.
- Prokka:) Được gắn đuôi cho bộ gen prokaryticiation, sử dụng cơ sở dữ liệu như Pfam, TIGRFAMs, và COGs cho sự chú ý nhanh chóng.
Máy học cách chú giải
Việc học tập sâu đã nhập vào ký hiệu gen, với các mô hình có thể dự đoán nơi gây nên, các trang thiết bị phức tạp, và thậm chí ảnh hưởng đến chức năng của biến thể. Công cụ như [FLT: 0]DepGene ) và ) ), ) dự đoán] vỏ bọc [FLTTT:], [FLTT:], cấu trúc nhiều lần dựa trên dữ liệu, thường không phải là kết hợp nhất. [LT] [VT]
Những cách đối chiếu và cộng đồng
Dự án gen tương đối đưa ra lời khuyên bảo tồn chức năng. Dự án [FLT: 0] [FLT:] làm tiên phong cho con người. Phần mềm như ) Viết tắt PhyCF [FLT:] phát hiện trình trình protein-coding], trong khi PLT] xác định các cơ sở dữ liệu như [FL: FL] [FLS] [FLT] [FLT] cung cấp bản cập nhật tự động cho nhiều loại chuẩn bị, không cho phép kiểm soát.
Đường ống và sự tự động
Nhu cầu cho bộ gen chất lượng cao ở quy mô đã thúc đẩy sự phát triển của các đường ống tự động quản lý cả quy mô và cách chú giải. Những hệ thống này xử lý dữ liệu trước khi xử lý, sửa lỗi, sửa chữa, lắp ráp, đánh bóng, dàn giáo và chú thích theo một cách có dòng chảy. ví dụ:
- GAAP (Grater Conerline: ) Được thiết kế cho vi khuẩn và bộ gen nấm, nó tích hợp các công cụ như SPAdes, Velvet, Prokka, và BUSCO.
- Tiếp theoDenovo + NextPolish:) một tổ hợp phổ biến cho việc đọc và đánh bóng dài, thường được dùng với HiFi đọc.
- Nef-core/asampam:) Một đường ống tiếp theo dựa trên dòng chảy cung cấp các dòng công việc theo mô- tơ cho lắp ráp và chú thích, tương thích với môi trường công-te- hóa.
- JBrowse2 / IGV: công cụ hiển thị cho phép các nhà nghiên cứu tự sửa chữa chú thích và xác định các dấu ngoặc kép sai.
Việc tự động hóa không loại bỏ việc cần phải sửa chữa bằng tay. Sự kết hợp của các dự đoán tính toán với việc xem xét chuyên gia vẫn còn là tiêu chuẩn vàng cho bộ gen tham khảo.
Đánh giá chất lượng
Phương pháp chuyển đổi chất lượng là thiết yếu. Giá trị [FLT [FLT:] [FT:] [FTT:] [FTTT] [FTTT/N] [FT] [FTTT] [FTTT] thống kê [FTTTTTTT] [FTT].] xác định các số liệu thống kê [FLT]. Công cụ như [FT: 4] [FT] [FTTT] và [FTKK] [FT] Dự án sinh học: TK] [FT] [FT], Bản đ, Bản đ, Bản đ, Bản đ, Bản tóm tắt là một bản sao [FL], Bản đ, Bản đ, Bản đ, Bản đ, Bản dịch linh mục [T], Bản đ, Bản đ, Bản dịch linh mục [T], Bản dịch linh mục [T], Bản dịch linh mục [T], Bản dịch: Bản dịch: T], Bản dịch linh mục [T], Bản dịch: T], T],
Hướng tương lai
Thập kỷ tới sẽ mang lại một số sự thay đổi:
- Các hội nghị Telomere-to-telomere (T2T): ) Toàn bộ bộ bộ bộ gen người bây giờ có thể nhờ vào việc đọc siêu dài và tăng cường các thuật toán (v. g., Verkko). Các dự án T2T đang mở rộng thành các sinh vật mô hình.
- Quần đảo dựa trên đồ họa graph: thay vì một tham chiếu tuyến tính, đồ thị pangenome thu được sự biến thể trên dân số. Công cụ như thư mục thu nhỏ, vg, và Xây dựng đồ thị Pangenome đang dẫn đầu chuyển đổi này.
- Ghi chú thời gian: các công cụ lưu ý quá trình xử lý dữ liệu khi được sắp xếp trình tự có thể tăng tốc ứng dụng lâm sàng, như xác định mầm bệnh trong một đợt bùng phát.
- Sự kết hợp của các biểu sinh: báo cáo về DNA giảm cường, dấu hiệu của bệnh nhân và sự tiếp cận của chrotin sẽ yêu cầu phương pháp tính toán mới kết hợp với dữ liệu chức năng.
- Sửa lỗi điều khiển trí:) Mô hình nghiên cứu sâu được đào tạo trên những tập hợp lớn bộ gen có khả năng dự đoán và sửa lỗi lắp ráp với độ chính xác cao, giảm độ cong thủ công.
Tài nguyên bên ngoài: Tài nguyên [FLT: 0] NBI Eukaryicticicicmo Gen grition hiển thị các tập tục tốt nhất hiện thời để tự động ghi chú bộ gen biểu diễn tự động bộ gen màu sắc.
Tóm lại, công cụ tính toán cho việc lắp ráp gen và chú thích đã đạt đến sự thành thục mà làm cho các dự án lớn có thể đạt được và hiệu quả chi phí. sự kết hợp của việc đọc thông tin dài, trí thông minh máy móc và các đường ống tích hợp đã giảm những rào cản để nghiên cứu bộ gen phức tạp. khi những công cụ này tiếp tục tiến hóa, chúng sẽ mở rộng tiềm năng của gen, từ việc hiểu biết về cây sự sống để cho phép sự chính xác của y học. các nhà nghiên cứu phải tiếp tục thông tin về những tiến bộ mới nhất để chọn những phương pháp tốt nhất cho các sinh vật và câu hỏi cụ thể.