Table of Contents
Viime aikoina edistysaskeleet laskentatyökaluja ovat muuttaneet genomiikan, jonka avulla tutkijat voivat koota ja annotisoida genomioita ennennäkemättömällä tarkkuudella ja nopeudella. Nämä parannukset ovat ratkaisevan tärkeitä dekoodaus valtavan elämän monimuotoisuuden, mikrobipatogeenistä monimutkaiseen eukaryoottisiin organismeihin. Kenttä on siirtynyt työvaltaisista manuaalisista prosesseista automatisoituihin, skaalautuviin putkiin, jotka pystyvät käsittelemään teratavuja sekvenssidatasta. Tämän seurauksena genomikokoamisesta ja havainnoinnista on tullut perusta personoitujen lääketieteen, satojen parantamisen, suojelubiologian ja evoluution opinnoille.
Säätiö: Genome Assembly
Genomi kokoonpano on laskentaprosessi rekonstruoimalla alkuperäisen DNA-sekvenssiä hajanaisista lukemista tuotettu sekvensointi alustojen. Monimutkaisuus tämän tehtävän syntyy toistuvia sekvenssejä, polyploidinen genomit, ja pelkkä koko eukaryoottisia genomit. Varhaiset kokoonpanijat luottavat lyhyitä lukemia Illumina teknologia, joka usein romahti ja tuotti pirstoutuneita kokoonpanoja. Moderni työkalut voittaa nämä rajoitukset kautta kehittyneitä algoritmit ja integrointi useita sekvensointi tekniikoita.
De Novo Assembly Algorithms
De novo-koostumus rekonstruoi genomin ilman viittausta, mikä tekee siitä olennaisen uuden organismin tai lajin tutkimisen kannalta, jolla ei ole läheistä sukua. Algoritmeilla on erilaiset lähestymistavat:
- Yli-lap-layout-konensus (OLC):[] Sopii pitkille lukukausille, OVC limittyi suoraan kontigs. Työkalut kuten Canu[] ja ]Flye[] käyttävät OVC:tä PacBio- tai Oxford Nanopore-tietojen korjauksiin.
- De Bruijn-kaavio:[ Tehokas lyhyille lukuille, tämä menetelmä jakautuu k-mers ja rakentaa kaavion. Velvet ja Spades ovat klassisia esimerkkejä, joissa SPAdes käsittelee nyt hybrididataa.
- String kaavio:[] OVC:n muistitehokas kehitys, jota käyttävät miniasm ja ]Raven[] nopean pitkän lukemisen kokoonpanoon.
Pitkäkestoinen jaksotus ja sen vaikutukset
Pitkän aikavälin teknologia (PacBio HiFi, Oxford Nanopore) tuottaa lukee kymmeniä tai satoja kilobaseleja pitkiä. Nämä lukevat span toistuvia alueita, mikä mahdollistaa täydellisen kokoonpanon monimutkaisia genomeja.
- Canu:[] haarukka Celera Assembler, suunniteltu korkea-meluinen pitkä lukee. Se suorittaa virhekorjaus ennen kokoonpanoa.
- Lentää:[] Käyttää toista kaaviota lähestymistapaa, joka käsittelee toistoja ilman romahtaa niitä, tuottaa hyvin toisiinsa liittyviä kokoonpanoja.
- Hasta:[ Optimoitu Oxford Nanopore lukee, Shasta on nopea ja muistitehokas, sopii suurille genomeille.
- Hifiasm:[ Erikoistunut PacBio HiFi-tietoihin, tuottaa vaiheistettuja kokoonpanoja haplotig-resoluutiolla.
Hybridimenetelmät
Hybridikokoonpanossa yhdistyvät lyhytlukuisten tarkkuus ja pitkäikäisen lukemisen vaikeus. Tämä strategia on erityisen hyödyllinen kiillotukselle ja aukon täyttymiselle. Tyypillisiä työnkulkuja ovat:
- Kokoa luonnos pitkillä lukemilla (esim. Flyen avulla).
- Puolan lyhyet kirjaimet Pilon tai FreeBayes.
- Skaalattu suuriin hankkeisiin, kuten Vertebrate Genomes -projektiin (VGP), jossa hybridit ovat mahdollistaneet lähes täydellisen sadon selkärankaisten genomien kokoonpanon.
Ulkoiset resurssit: NCBI-kokoonpanon keskus tarjoaa kootut kokoonpanotilastot ja lataukset. Käytännön opetusohjelmia varten Galaxy-alusta tarjoaa helposti käytettävissä olevia kokoonpanotyönkulkuja.
Genomi Huomautus: Suunnitelman purku
Kun genomi on koottu, annotaatio tunnistaa toiminnalliset elementit: proteiinikoodausgeenit, koodaamattomat RNA:t, sääntely-aiheet, toistuvat alueet, pseudogeenit ja rakenteelliset muunnokset. Notification voidaan jakaa rakenteellisiin merkityksiin (geenirajojen delineating) ja toiminnallisiin annotaatioihin (funktioiden osoittaminen ennustetuille geeneille). Viimeaikaiset laskennalliset edistysaskeleet ovat parantaneet merkittävästi tarkkuutta integroimalla ab initio -ennustuksia, transkriptomisia todisteita ja vertailevaa genomiikkaa.
Ab Initio Gene Ennuste
Ab initio -menetelmät käyttävät tilastollisia geenirakenteen malleja koodausalueiden tunnistamiseen. Ne vaativat koulutussarjan tunnettuja geenejä. Työkalut kuten [AUGUSTUS[], ]GeneMark-ES[], ja [[]GlimmerHMM[] ovat yleisiä. Uudemmat versiot vipuvoimakoneen oppimista parantaa herkkyyttä, erityisesti ei-kanonaalisia katkoksia sivustoja. GeneMark-EP+, esimerkiksi, käyttää itsekoulutus lähestymistapaa, joka toimii ilman olemassa olevaa merkkiä.
Todisteet - Perusded Anotement
Näyttöön perustuvat lähestymistavat käyttävät RNA-sekvenssiä, proteiinihomologya ja muuta kokeellista tietoa ennustusten validoimiseen. Tämä on nyt vakiona eukaryoottisissa genomiprojekteissa.
- BRAKER1/2/3:[ Integroi GeneMark-ET (RNA-seq) ja AGUSTUS täysin automatisoituun eukaryoottisuuteen. BRAKER2 käyttää proteiinivihjeitä organismeille ilman RNA-sekakv.
- MAKER2:[ joustava putki, jossa yhdistyvät ab initio ennustukset, homology, ja RNA-sek-todisteita. Sitä voidaan käyttää iteratiivisesti parantaa merkintälaatua.
- Prokka:[] Räätälöidään prokaryoottisiin genomiin käyttämällä tietokantoja kuten Pfam, TIGRFAMs ja COGs nopeaan merkitsemiseen.
Koneen oppiminen huomautukset
Syväoppiminen on tullut genomi-annotaatioksi, jossa on malleja, jotka voivat ennustaa promoottorien, levittimien sivustoja ja jopa varianttien toiminnallista vaikutusta. Työkalut kuten [DeepGene[] ja []DeepSplice[[] käyttävät konvolutionaalisia hermoverkkoja saavuttaakseen suuremman tarkkuuden kuin perinteiset HMM:t. [EVM[] (Evidence Modeler) yhdistää useita ennusteita käyttäen tiedoista opittuja painoja, jotka usein tuottavat parhaan lopullisen huomautuksen. [FGENESH+[ käyttää koneen oppimislähtöistä lähestymistapaa monimutkaisiin genomeihin.
Vertailevat ja yhteisön lähestymistavat
Vertailugenomiikka auttaa evoluution säilymistä toiminnallisten elementtien tunnistamisessa. []ENCODE-hanke[ on tämän ihmisen kannalta edelläkävijä. Ohjelmistot kuten [PhyloCSF havaitsee proteiinikoodaussekvenssit, kun taas [GERP++ tunnistaa rajoitetut alueet. Yhteisön tietokannat, kuten Ensemble[, tarjoavat automatisoituja merkintäpäivityksiä monilla lajeilla, asettavat laadunvalvontastandardeja.
Integroidut putkistot ja automaatio
Korkealaatuisten genomien kysyntä mittakaavassa on johtanut täysin automatisoitujen putkistojen kehittämiseen, jotka hallinnoivat sekä kokoonpanoa että sen merkitystä. Nämä järjestelmät käsittelevät tietojen esikäsittelyä, virheiden korjaamista, kokoonpanoa, kiillotusta, rakennustelineitä ja nimellisyyksiä virtaviivaistetulla tavalla. Esimerkkejä ovat:
- GAAP (Genome Assembly and Annual Pipeline):[] Suunniteltu bakteeri- ja sienigenomeille, se yhdistää työkaluja kuten SPAdes, Velvet, Prokka ja BUSCO.
- NextDenovo + NextPolish: Suosittu yhdistelmä pitkäikäiseen kokoonpanoon ja kiillotukseen, jota käytetään usein HiFin kanssa.
- f-ydin/assembflow:[ Nextflow-pohjainen putki, joka tarjoaa modulaarisia työvirtoja kokoonpanoon ja noteeraukseen, yhteensopivat konttiympäristöjen kanssa.
- JBrowse2 / IGV: Visualisointityökalut, joiden avulla tutkijat voivat kurata käsin merkityksiä ja tunnistaa väärin.
Automaatio ei poista manuaalisen kuraation tarvetta. Laskennallisten ennusteiden ja asiantuntija-arvion yhdistelmä on edelleen viitegenomien kultainen standardi.
Laadunarviointi
]BUSCO[-työkalu arvioi täydellisyyden etsimällä säilyneitä yksikopioortologeja. NA50/N90[-tilastomittareita. Työkalut kuten [ QUAST[] ja gazzali[ antavat yksityiskohtaiset kokoonpanoraportit. Merkintöjä varten CEGMA[[ ja . on käytetty ]-analyysia.
Tulevaisuuden suunnat
Seuraava vuosikymmen tuo mukanaan useita muutoskehitystoimia:
- Teleomeeri-komposiitista (T2T):[ Täydelliset ihmisen perimät ovat nyt mahdollisia ultrapitkän lukemisen ja kehittyneiden kokoonpanoalgoritmien (esim. Verkko) ansiosta. T2T-projektit laajenevat mallieliöiksi.
- Graafinen-pohjainen pangenome:[] sijaan yhden lineaarisen referenssi, pangenomi kaaviot kaappaa vaihtelua populaatioiden. Työkalut kuten minigrafi, vg, ja PanGenome Graph Builder ovat johtavat tätä muutosta.
- Reaaliaikainen huomautus:[] Tietojen käsittelyssä käytettävien merkkityökalujen virtaus voisi nopeuttaa kliinisiä sovelluksia, kuten taudinaiheuttajien tunnistamista epidemiassa.
- Epigenomiikan integrointi:[ DNA:n metyylinotaation, histonimerkkien ja kromatinin saavutettavuuden merkitseminen edellyttää uusia laskentamenetelmiä, joissa yhdistyvät kokoonpano ja toiminnalliset tiedot.
- AI-lähtöinen virhekorjaus:[] Syväoppiminen mallit koulutettu suuri joukko validoituja genomeja voi ennustaa ja korjata kokoonpanovirheitä suurella tarkkuudella, mikä vähentää manuaalista kuraatiota.
Ulkoiset resurssit: NCBI Eukaryotic Genome Annovation -putki esittelee nykyiset parhaat käytännöt eukaryoottisten genomien automaattisen merkitsemisen osalta.
Yhteenvetona voidaan todeta, että genomien koostamisen ja annotaatioiden laskentatyökalut ovat saavuttaneet kypsyyden, joka tekee laaja-alaisista hankkeista toteuttamiskelpoisia ja kustannustehokkaita. Pitkän aikavälin sekvensointi, koneäly ja integroidut putkistot ovat vähentäneet esteitä monimutkaisten genomien tutkimiselle. Näiden työkalujen kehittyessä ne avaavat genomiikan täyden potentiaalin elämän puusta tarkkuuden parantamiseen. Tutkijoiden on pysyttävä ajan tasalla viimeisimmistä kehitysvaiheista voidakseen valita parhaat toimintatavat tiettyjä organismeja ja kysymyksiä varten.