Langgelezen sequencing technologieën hebben fundamenteel genomics getransformeerd door het mogelijk maken van het ondervragen van complexe genomen met een resolutie die voorheen onbereikbaar was met korte-lees methoden. Door het lezen van continue DNA-fragmenten tientallen tot honderdduizenden basenparen in lengte, deze technieken machtigen wetenschappers om repetitieve regio's op te lossen, detecteren grote structurele varianten, en fase haplotypes met hoog vertrouwen. Dit artikel bekijkt de nieuwste opkomende technieken in lang-lezen sequencing, onderzoeken van de technologische innovaties, computationele vooruitgang, en integratieve benaderingen die de grenzen van genoomanalyse uitbreiden.

Recente vooruitgang in lange-lezen sequencing platforms

De afgelopen jaren hebben opmerkelijke vooruitgang gezien in de chemie, hardware en software die ten grondslag ligt aan langlezen sequencing. Belangrijkste fabrikanten hebben nieuwe reagentia, stroomcellen en beeldvormingssystemen geïntroduceerd die de leeslengte, de nauwkeurigheid van de basis-calling en de totale doorvoer aanzienlijk verhogen. Zo bereikt de nieuwste generatie van single-molecule real-time (SMRT) sequencing van Pacific Biosciences (PacBio) nu routinematig mediane leeslengten van meer dan 15 kilobases, terwijl Oxford Nanopore Technologies (ONT) demonstreert dat ze 2 megabases overtreffen. Deze uitgebreide leessessies zijn van cruciaal belang voor het overkoepelen van complexe genomica zoals centromeren, telomeren en segmentale duplicaties, die vaak bestand zijn tegen assemblage van korte lezingen alleen al.

Verbeteringen in bibliotheek voorbereiding protocollen verder bijdragen aan de gegevenskwaliteit. Methoden die DNA schade te minimaliseren, te verminderen fragmentatie, en het optimaliseren van moleculaire belasting hebben aangetoond dat zowel de opbrengst en de lengte van lange lees. Voor PacBio, de goedkeuring van de .HiFi workflow (high-fidelity) maakt gebruik van circulaire consensus sequencing (CCS) om een enkele, zeer nauwkeurige consensus te genereren uit meerdere passen van dezelfde circulaire template molecule. Deze aanpak drastisch vermindert foutenpercentages van >10% in ruwe lange lezingen tot < 0,1%, het produceren van lezingen die zowel lang als nauwkeurig zijn. Ook heeft ONT verbeterde de bibliotheekchemie . Zoals de ligation sequencing kit en snelle sequencing kit kit .

Aan de computationele kant zijn basis-calling algoritmen geëvolueerd van eenvoudige verborgen Markov-modellen tot diepneurale netwerkarchitecturen (bijvoorbeeld Guppy, Bonito en de onlangs vrijgegeven Dorado). Deze modellen zijn getraind in grote datasets om systematische fouten te corrigeren, zoals homopolymeerlengte-onwaarheden, en om aangepaste bases direct vanuit het ruwe signaal te bellen. Het resultaat is een dramatische verbetering van de consensusnauwkeurigheid zonder de leeslengte op te offeren. Opkomende technieken maken ook gebruik van machine learning om lage kwaliteit te filteren, structurele variant breakpoints te detecteren en zelfs DNA-methylatietoestanden te voorspellen van dezelfde sequencing run.

Kerntechnologieën, die innovatie stimuleren

PacBio HiFi-sequentie

Pac Bio

Recente innovaties in de Pac Bio. chemie hebben een verdere opwaartse druk op zowel de doorvoer als de kwaliteit van de ruis veroorzaakt.Het Revio-systeem, dat in 2022 werd geïntroduceerd, maakt gebruik van een nieuwe URL-cel die tot 130 gigabanes van HiFi-gegevens per cel kan genereren, waardoor HiFi in één enkele stroomcel een realiteit kan maken. Hierdoor is de deur geopend voor studies op populatieschaal naar structurele variatie en zeldzame ziektegenomica, waar informatie van hoge kwaliteit, lange afstand steeds meer als essentieel wordt erkend.

Oxford Nanopore Technologies

Oxford Nanopore . platforms (MinION, GridION, Promethion) bieden een duidelijk complementaire aanpak: real-time sequencing van inheemse, ongemodificeerde DNA of RNA strengen als ze passeren door een eiwit nanopore. De technologie . kenmerken is zijn vermogen om ultra-lange lees-en leesprocessen te produceren, met sommige experimenten die moleculen meer dan 2 miljoen baseparen. Deze lezingen zijn instrumentaal voor het overslaan van zeer repetitieve gebieden, zoals centrale satellieten en ribosomale DNA arrays, en voor het oplossen van complexe structurele varianten die onzichtbaar zijn voor korte-leesbare benaderingen.

Nanopore sequencing heeft snelle verbeteringen in per-base nauwkeurigheid door betere porie configuraties, geoptimaliseerde motoreiwitten en geavanceerde base-calling algoritmes gezien. De nieuwste R10.4.1 poriën, gecombineerd met de high-precision base-calling modellen in de Dorado software, bereiken routinematig mediane leesnauwkeurigheid boven 99,5% (Q20+) op matige leeslengtes. Bovendien heeft het vermogen om gemodificeerde bases te detecteren, zoals 5-methylcytosine, 5-hydroxymethylcytosine, en 6-methyladenine, van hetzelfde elektrische signaal zonder extra monstervoorbereiding, Nanopore een krachtig instrument voor geïntegreerde genetische en epigenetische analyse.

Tot de opkomende technieken in nanopore-technologie behoren .Lees tot de eerste stappen die een real-time doelselectie mogelijk maken, waarbij de sequentie-run dynamisch kan worden gestuurd om te verrijken voor de regio's van belang. Bovendien maken adapters en barcoderingssystemen nu een hoge doorvoer van honderden monsters per stroomcel mogelijk, waardoor de kosten per monster sterk worden verlaagd en langlezen sequencing toegankelijk wordt voor klinische en veldtoepassingen.

Opkomende technieken en toekomstige richtingen

Hybride assemblagebenaderingen

Terwijl zowel PacBio HiFi als ONT-lezers onafhankelijk hoogwaardige assemblages kunnen produceren, nemen veel onderzoekers hybride strategieën die het beste van beide platformen combineren. De meest voorkomende aanpak gebruikt HiFi-lezingen (hoge nauwkeurigheid, matige lengte) als rugbeen voor ..ruggengraatvorming, dan steigert en vult gaten met ultralange Nanopore leest. Tools zoals shasta, canu[, [hifiasm[, en []verkko[[ zijn ontwikkeld om deze hybride inputsets te behandelen, waarbij vaak assembles worden geproduceerd die zowel contigueus als zeer accuraat zijn. Recent werk aan het complete menselijke genoom (het consortium Telomere‐to‐Telomere) heeft zwaar op dergelijke hybride strategieën vertrouwd om eerder onoplosbare hiaten in centralen, segmentale duplicaten en ribosomaal DNA te dichten.

Computational algoritmen voor foutcorrectie en assemblage

De foutprofielen van lange lezingen verschillen fundamenteel van korte lezingen, die gespecialiseerde algoritmen vereisen. Nieuwe foutcorrectietools, zoals medaka (voor ONT) en pbmm2 / [ccs[ (voor PacBio) zijn verfijnd om de hoge kwaliteit van elke lezing te benutten om de consensus over de gehele dataset te verbeteren. Voor assemblage zijn de grafiekbenaderingen die de gehele leesset als tekenreeks of een de Bruijngrafiek vertegenwoordigen, aangepast voor lange lezingen. De miniasm[ en ]flye[] assemblers produceren ontwerpsamenstellingen van ongecorrigeerde lezingen die vervolgens kunnen worden gepolijst met HiFi-gegevens. Diepleerde modellen worden steeds vaker gebruikt om dubbelzinnige wegen te vinden door middel van de assemblagegrafiek, met name in regio's van hoge heterozygo-inhoud.

Naast de assemblage zijn de computationele pijpleidingen voor het detecteren van structurele varianten (SV's) uit lange lezingen gerijpt. Oproepen zoals Sniffles2, Picky[ en cuteSV[ gebruiken breakpoint-spanning leesclustering en sequence-alignment om verwijderingen, duplicaties, inversies, translocaties en mobiele elementen te identificeren. Deze instrumenten bereiken nu gevoeligheid >95% voor SV's >50 bp, een dramatische verbetering ten opzichte van kort-lees-gebaseerde SV-aanroepen, die vaak gebeurtenissen in repetitieve regio's mist.

Integratie met Epigenomic Analysis

Een van de meest opwindende technieken is de gelijktijdige ondervraging van genoomsequentie en epigenoom uit één langleesset. Nanopore heeft directe detectie van DNA-wijzigingen tot een punt uitgebreid waar kwantitatieve methylatie-niveauschatting mogelijk is bij een enkele basisresolutie. HiFi-sequencing, terwijl niet direct wijzigingen in het ruwe signaal worden gedetecteerd, kan worden gecombineerd met bisulfietconversie of enzymatische methylatie-gevoelige benaderingen om langlees epigenomic profielen te bieden. Deze integratie is van onschatbare waarde in kankergenomica, waar grootschalige structurele variaties vaak gepaard gaan met wijdverbreide epigenetische herprogrammering. Lang-leesbare benaderingen kunnen nu zowel genetische als epigenetische veranderingen langs individuele haplotypes faseren, waarbij onthullen hoe methylatiepatronen worden opgebouwd en veranderd in structurele herindelingen.

Directe RNA-sequentie en transscriptomics

Oxford Nanopore biedt ook directe RNA sequencing (DRS), die native RNA moleculen sequenties zonder reverse transcription of versterking. Deze techniek behoudt RNA wijzigingen (bijv. m6A, pseudouridine) en biedt volledige transcript isoform informatie. Opkomende verbeteringen omvatten hogere doorvoer, betere porie gevoeligheid voor RNA, en basis-calling modellen getraind specifiek voor RNA modificatie detectie. Direct RNA sequencing opent nieuwe vensters in alternatieve splicing, poly-A staart lengte analyse, en de functionele impact van RNA-editing in complexe transcriptomen.

Toepassingen in Complexe Genome Analyse

Complete Genoom Assembly en T2T-projecten

Het Telomere-to-Telomere (T2T) consortium heeft de eerste werkelijk complete menselijke genoomsequentie in 2022 bereikt, en is een mijlpaal voor de demonstratie van langlezen sequencing. Door de combinatie van >30× dekking van HiFi leest en >70× dekking van ultralange Nanopore leest (en met behulp van handmatige curation met optische kaarten), heeft het team elke kloof opgelost, inclusief het uitdagende Y chromosoom. Soortgelijke inspanningen zijn nu gaande voor veel andere soorten, van gewasplanten tot bedreigde zoogdieren. Opkomende technieken in de lange-readagenomie maken het ook mogelijk om complete, circulaire genomen van voorheen niet-gekenmerkte microben in complexe milieumonsters te reconstrueren.

Structurele Variant Ontdekking bij de Mensziekte

Langgelezen sequencing is de gouden standaard voor het ontdekken en karakteriseren van structurele varianten (SV's) in menselijke genomen geworden. Studies hebben tienduizenden SV's per genoom gecatalogiseerd, waarvan er vele worden gemist of slecht opgelost door korte lezingen. Opkomende technieken maken het nu mogelijk nauwkeurige breakpoint mapping, zelfs in segmentale duplicaties en low-complexity herhalingen. In klinische contexten, lang-lees sequencing wordt gebruikt om ..genemische mysteries op te lossen . . bij patiënten met zeldzame ziekten die hebben ontweek standaard exoom of genoom sequencing. Het vermogen om volledige fase varianten en de verbinding heterozygosity of de novo structurele gebeurtenissen is rijden diagnostische opbrengsten omhoog.

Bevolkingsgenetische en evolutieve studies

Hoogwaardige referentie-genomen die zijn verkregen uit langgelezen samenstellingen maken nauwkeuriger vergelijkende genomic analyses mogelijk over populaties en soorten. Zo hebben lange-lezen-sequenties van genfamilies en retrotransponen, die onzichtbaar zijn voor kortgelezen benaderingen, aangetoond. Ook in planten met grote, herhaalde-rijke genomen (bv. tarwe, maïs, naaldbomen), hebben langgelezen sequencing de eerste uitgebreide onderzoeken naar structurele variatie in verband met gedomesticeerde en adaptatie mogelijk gemaakt. Opkomende technieken zoals .pan‐genome-studies , waarbij meerdere langgelezen samenstellingen van verschillende individuen direct worden vergeleken , bieden een vollediger beeld van genomic diversiteit binnen een soort.

Kanker Genomics en vloeibare biopsie

Langgelezen technieken worden steeds vaker toegepast op kankergenomen, waar massale herschikkingen, veranderingen van het aantal kopieën en epigenetische veranderingen gebruikelijk zijn. Studies met behulp van langlezen hebben eerder verborgen genfusies en extrachromosomale circulair DNA (ecDNA) geïdentificeerd die oncogenese veroorzaken. In vloeibare biopsie, nanopore sequencing van circulerend celvrij DNA (cfDNA) kunnen tumorspecifieke structurele varianten en methylatiepatronen met hoge gevoeligheid detecteren. Opkomende methoden voor gerichte lang-lezen sequencing in vloeibare biopsie zijn veelbelovend voor niet-invasieve kankermonitoring en vroege detectie.

Uitdagingen en beperkingen

Ondanks deze vooruitgang, staat langlezen sequencing voor verschillende uitdagingen. Per-base nauwkeurigheid, terwijl verbeterd, blijft achter op short-read platforms (Illumina . < 0,1% foutenpercentage) voor bepaalde contexten, met name in homopolymeren en zeer repetitieve regio's. Base-calling fouten, vooral op individueel-leesniveau, kunnen verwarren single-molecule toepassingen zoals fasering of methylering op lage diepte. Doorvoer en kosten blijven barrières voor grootschalige populatiestudies; hoewel de kosten dalen, een hoge diepgaande lang-lees menselijk genoom kost nog steeds meer dan $ 1.000 . $ 3.000 voor HiFi of Nanopore, vergeleken met ~ 200 voor een standaard kort-lees genoom.

Voor de voorbereiding van ultralange lectuur is een hoogmoleculaire-gewicht DNA nodig, dat moeilijk te verkrijgen is van formeel vast, paraffine-ingebouwd (FFPE) weefsel of gedegradeerde forensische monsters. Scheerwerk, fragmentatie en DNA-schade tijdens de extractie verminderen de fractie van echt lange moleculen. Opkomende technieken in zachte DNA-extractie (bijvoorbeeld met behulp van agarosepluggen of magnetische kraal-gebaseerde protocollen) verminderen dit probleem maar voegen complexiteit toe.

De grote hoeveelheid ruwe signaalgegevens van nanopore sequencers (of de grote BAM bestanden van HiFi) vereist een aanzienlijke opslag- en verwerkingskracht. Real-time basis-calling, terwijl mogelijk op een GPU, verbruikt aanzienlijke elektrische en rekenmiddelen. Bovendien, de novo assemblage van grote genomen uit lange lezingen blijft een rekenbare zware taak, hoewel recente verbeteringen in algoritmen hebben zowel runtime als geheugen voetafdruk verminderd.

Vooruitzichten en toekomstige aanwijzingen

De komende vijf jaar beloven verdere doorbraken in langlezen sequencing. Aan de hardwarezijde kunnen nieuwe solid-state nanopores en geïntegreerde circuitsensoren de doorvoer drastisch verhogen en de kosten verlagen. Bedrijven zoals PacBio ontwikkelen banktopsystemen die HiFi naar het klinisch laboratorium brengen, terwijl ONT zijn apparaten voor veldtoepassingen miniaturiseert. Op het vlak van chemie wordt verwacht dat het vermogen om langere templates (>>2 Mb) te sequenceren zonder dat de nauwkeurigheid wordt opgeofferd actief wordt nagestreefd. Daarnaast worden nieuwe basis-callingmodellen die transformatorarchitecturen en zelf-gezagsgerichte leerkracht gebruiken, verwacht dat ze de nauwkeurigheid van ruwe leesresultaten verder zullen brengen dan Q30 (99,9%) voor nanopore.

Integratie met ruimtelijke transcriptomica en single-cell genomica is een andere opkomende grens. Langlezen rangschikking van barcoded single-cell cDNA of gDNA kan volledige isoform informatie en gefaseerde variant oproepen bij cellulaire resolutie bieden. Vroege werkzaamheden op dit gebied heeft aangetoond dat hybride benaderingen die langlezen en kortleesbare single-cell gegevens combineren cel-type-specifieke alternatieve spplicing en mutaties die worden gemist door korte-reads alleen.

Ten slotte zal de verschuiving naar .pangenomische . referentie genomen, waar veel hoogwaardige langlezen samenstellingen van verschillende individuen gezamenlijk worden geanalyseerd, fundamenteel veranderen hoe we menselijke genetische variatie interpreteren. Het vermogen om zeldzame, grote SV's te detecteren en de impact van herhaalde uitbreidingen op genregulatie en ziekte te bestuderen zal routine worden naarmate deze technieken rijp worden. Opkomende langlezen sequencing technieken zijn niet alleen het verbeteren van bestaande genomic analyses; ze maken volledig nieuwe vormen van biologisch onderzoek mogelijk, van de volledige orkestratie van epigenetische markeringen in megabase-schaal regio's tot de real-time tracking van virale quasi-soorten in een geïnfecteerde gastheer.

Conclusie

Door de vooruitgang in chemie, hardware en berekeningen, zijn technologieën zoals PacBio HiFi en Oxford Nanopore nu het leveren van nauwkeurige, ultralange lezingen die de meest recalcitrante genomica kunnen omvatten. Doorlopende regio's, centra en grote structurele varianten met ongekende trouw. Hybride benaderingen en integratie met epigenomic analyse zijn verder uit te breiden van de reikwijdte van informatie verkregen uit een enkel experiment. Terwijl uitdagingen blijven in kosten, doorvoer en computational last, is het traject duidelijk: lang-lezen sequencing zal de standaard worden voor de novo assemblage, structurele variant ontdekking, en uitgebreide genoomkarakterisering in zowel onderzoek als klinische settings. Aangezien deze technieken blijven evolueren, beloven ze dieper inzichten te ontsluiten in genetische structuur, functie en diversiteit die vooruitgang in de geneeskunde, landbouw, en evolutionaire biologie zal stimuleren.