Lang gelesene Sequenzierungstechnologien haben die Genomik grundlegend verändert, indem sie die Abfrage komplexer Genome mit einer Auflösung ermöglichten, die zuvor mit Kurzlesemethoden nicht erreichbar war. Durch das Lesen kontinuierlicher DNA-Fragmente von Zehntausenden bis Hunderttausenden Basenpaaren in der Länge ermöglichen diese Techniken Wissenschaftlern, sich wiederholende Regionen aufzulösen, große strukturelle Varianten und Phasenhaplotypen mit hoher Sicherheit zu erkennen. Dieser Artikel behandelt die neuesten aufkommenden Techniken der Langlesesequenzierung und untersucht die technologischen Innovationen, computergestützten Fortschritte und integrativen Ansätze, die die Grenzen der Genomanalyse erweitern.

Neuere Fortschritte bei Long-Read-Sequenzierungsplattformen

In den letzten Jahren wurden bemerkenswerte Fortschritte in der Chemie, Hardware und Software, die der Long-Read-Sequenzierung zugrunde liegen, erzielt. Schlüsselhersteller haben neue Reagenzien, Flusszellen und Bildgebungssysteme eingeführt, die die Leselänge, die Genauigkeit der Basenanrufe und den Gesamtdurchsatz erheblich verbessern. So erreicht die neueste Generation der Single-Molekül-Echtzeitsequenzierung (SMRT) von Pacific Biosciences (PacBio) jetzt routinemäßig mittlere Leselängen von mehr als 15 Kilometern, während Oxford Nanopore Technologies (ONT) gezeigt hat, dass die Lesewerte 2 Megabasen übersteigen. Diese erweiterten Lesewerte sind entscheidend für die Spannweite komplexer genomischer Merkmale wie Zentromere, Telomere und segmentale Duplikationen, die oft der Montage von kurzen Lesewerten widerstehen.

Verbesserungen der Protokolle zur Vorbereitung von Bibliotheken tragen weiter zur Datenqualität bei. Methoden, die DNA-Schäden minimieren, die Fragmentierung reduzieren und die molekulare Belastung optimieren, erhöhen nachweislich sowohl die Ausbeute als auch die Länge langer Lesevorgänge. Für PacBio wird bei der Einführung des "HiFi"-Workflows (High-Fidelity) eine einzige, hochgenaue Konsensus-Sequenzierung (CCS) verwendet, um einen einzigen, hochgenauen Konsensus-Lesewert aus mehreren Durchgängen des gleichen zirkulären Template-Moleküls zu erzeugen. Dieser Ansatz reduziert die Fehlerraten von > 10 % bei rohen Langlesungen auf < 0,1 % und erzeugt sowohl lange als auch genaue Lesevorgänge. In ähnlicher Weise hat ONT seine Bibliothekschemie verbessert - wie das Ligations-Sequenzierungs-Kit und das Rapid-Sequenzierungs-Kit -, um chimäre Artefakte zu reduzieren und die Durchgangsraten auf der Pore zu verbessern.

Auf der Computerseite haben sich Basenaufrufalgorithmen von einfachen versteckten Markov-Modellen zu tiefen neuronalen Netzwerkarchitekturen entwickelt (z. B. Guppy, Bonito und das kürzlich veröffentlichte Dorado), die auf großen Datensätzen trainiert werden, um systematische Fehler wie Homopolymerlängenungenauigkeiten zu korrigieren und modifizierte Basen direkt aus dem Rohsignal aufzurufen. Das Ergebnis ist eine dramatische Verbesserung der Konsensgenauigkeit, ohne die Leselänge zu beeinträchtigen. Neue Techniken nutzen auch maschinelles Lernen, um Lesewerte von geringer Qualität herauszufiltern, strukturelle Variantenbruchpunkte zu erkennen und sogar DNA-Methylierungszustände aus dem gleichen Sequenzierungslauf vorherzusagen.

Schlüsseltechnologien, die Innovationen vorantreiben

PacBio HiFi Sequenzierung

Die HiFi-Sequenzierung von PacBio, die kommerziell auf den Systemen Sequel IIe und Revio geliefert wird, stellt einen Paradigmenwechsel in der Langlesegenauigkeit dar. Durch die Zirkulierung jedes DNA-Moleküls und die Sequenzierung mehrmals (typischerweise 15-30 Durchgänge) erzeugt die Technologie eine Konsenslesegenauigkeit von > 99,9%, die auch in sich wiederholenden Regionen eine Genauigkeit erreicht. Typische HiFi-Leselängen reichen von 10 bis 25 Kilometern, obwohl Protokolle so abgestimmt werden können, dass längere Fragmente auf Kosten des Durchsatzes erzeugt werden. Diese Kombination von Länge und Genauigkeit macht HiFi-Lesevorgänge ideal für die de novo Genom-Assembler, wo sie zusammenhängende Einheiten mit Median-Kontig-N50-Werten von mehr als 50 Megabasen in hoch polymorphen oder repemberreichen Genomen herstellen können.

Neuere Innovationen in der Chemie von PacBio – wie verbesserte Polymeraseenzyme, die Nukleotide schneller und mit höherer Genauigkeit enthalten, und verfeinerte Signalverarbeitungsoptiken, die das Rauschen reduzieren – haben den Durchsatz und die Qualität weiter nach oben gedrückt. Das 2022 eingeführte Revio-System verwendet eine neue SMRT-Zelle, die bis zu 130 Gigabasen HiFi-Daten pro Zelle erzeugen kann, wodurch die vollständige Humangenom-Sequenzierung in einem einzigen Flusszellenlauf Realität wird. Dies hat die Tür für bevölkerungsspezifische Studien zu strukturellen Variationen und seltener Krankheitsgenomik geöffnet, wo qualitativ hochwertige, weitreichende Informationen zunehmend als wesentlich anerkannt werden.

Oxford Nanopore Technologies

Die Plattformen von Oxford Nanopore (MinION, GridION, PromethION) bieten einen deutlich komplementären Ansatz: Echtzeit-Sequenzierung von nativen, unmodifizierten DNA- oder RNA-Strängen beim Durchlaufen einer Protein-Nanopore. Das Markenzeichen der Technologie ist ihre Fähigkeit, ultralange Messwerte zu erzeugen, wobei einige Experimente Moleküle mit mehr als 2 Millionen Basenpaaren ergeben. Diese Messwerte sind für die Spanne von sich stark wiederholenden Regionen wie zentromerischen Satelliten und ribosomalen DNA-Arrays von entscheidender Bedeutung und für die Auflösung komplexer Strukturvarianten, die für Kurzleseansätze unsichtbar sind.

Die Nanoporensequenzierung hat durch bessere Porenkonfigurationen, optimierte Motorproteine und ausgeklügelte Basenalgorithmen eine schnelle Verbesserung der Genauigkeit pro Base erzielt. Die neuesten R10,4,1-Poren in Kombination mit den hochgenauen Basenalgorithmenmodellen in der Dorado-Software erzielen routinemäßig mediane Lesegenauigkeiten über 99,5% (Q20+) bei moderaten Leselängen. Darüber hinaus hat die Fähigkeit, modifizierte Basen wie 5-Methylcytosin, 5-Hydroxymethylcytosin und 6-Methyladenin aus dem gleichen elektrischen Signal ohne zusätzliche Probenvorbereitung zu erkennen, Nanopore zu einem leistungsstarken Werkzeug für integrierte genetische und epigenetische Analyse gemacht.

Zu den aufkommenden Techniken der Nanoporentechnologie gehören „Read Until-Ansätze, die eine Echtzeit-Zielauswahl ermöglichen, bei der der Sequenzierungslauf dynamisch gesteuert werden kann, um für interessierende Regionen anzureichern. Darüber hinaus ermöglichen Adapter und Barcoding-Schemata jetzt ein Hochdurchsatz-Multiplexing von Hunderten von Proben pro Durchflusszelle, wodurch die Kosten pro Probe erheblich reduziert und eine lang lesende Sequenzierung für klinische und feldbasierte Anwendungen zugänglich gemacht wird.

Aufkommende Techniken und zukünftige Richtungen

Hybridanflüge

Während sowohl PacBio HiFi als auch ONT-Reads unabhängig voneinander qualitativ hochwertige Assemblys produzieren können, verwenden viele Forscher Hybridstrategien, die das Beste aus beiden Plattformen kombinieren. Der häufigste Ansatz verwendet HiFi-Reads (hohe Genauigkeit, mittlere Länge) als Rückgrat für die Kontigbildung, dann Gerüste und füllt Lücken mit ultralangen Nanopore-Reads. Tools wie shasta, canu, hifiasm und verkko wurden entwickelt, um diese Hybrid-Input-Sets zu handhaben, wobei häufig zusammenhängende und hochgenaue Assemblys hergestellt wurden.

Computeralgorithmen zur Fehlerkorrektur und Montage

Die Fehlerprofile von langen Lesevorgängen unterscheiden sich grundlegend von kurzen Lesevorgängen, was spezielle Algorithmen erfordert. Neue Fehlerkorrekturwerkzeuge wie medaka (für ONT) und pbmm2 / ccs (für PacBio) wurden verfeinert, um die hochwertigen Regionen jedes Lesevorgangs zu nutzen, um den Konsens über den gesamten Datensatz zu verbessern. Für die Montage wurden graphenbasierte Ansätze, die den gesamten Lesesatz als Zeichenfolgegraph oder als de Bruijn-Graphen darstellen, für lange Lesevorgänge angepasst. Die miniasm und flye-Assembler erzeugen beispielsweise Entwurfsbaugruppen aus unkorrigierten Lesevorgängen, die dann mit HiFi-Daten poliert werden können. Deep Learning-Modelle werden zunehmend verwendet, um mehrdeutige Pfade durch den Assembler zu lösen Graphen, insbesondere

Über die Montage hinaus sind computergestützte Pipelines zur Erkennung struktureller Varianten (SVs) aus langen Lesevorgängen ausgereift. Anrufer wie Sniffles2, Picky und cuteSV verwenden Breakpoint-übergreifende Leseclustering- und Sequenz-Alignment-Funktionen, um Löschungen, Duplikationen, Inversionen, Translokationen und mobile Element-Insertionen zu identifizieren. Diese Tools erreichen jetzt eine Empfindlichkeit > 95% für SVs > 50 bp, eine dramatische Verbesserung gegenüber kurzlesbaren SV-Aufrufen, die oft Ereignisse in sich wiederholenden Regionen verpassen.

Integration mit Epigenomic Analysis

Eine der spannendsten neuen Techniken ist die gleichzeitige Abfrage von Genomsequenz und Epigenom aus einem einzigen Long-Read-Datensatz. Nanopore's direkter Nachweis von DNA-Modifikationen ist so weit gereift, dass eine quantitative Methylierungs-Level-Schätzung bei Einzel-Basen-Auflösung möglich ist. HiFi-Sequenzierung kann, ohne direkt Veränderungen im Rohsignal zu erkennen, mit Bisulfit-Konversion oder enzymatischen Methylierungs-sensitiven Ansätzen kombiniert werden, um lang gelesene epigenomische Profile zu erhalten. Diese Integration erweist sich als unschätzbar in der Krebsgenomik, wo groß angelegte strukturelle Variationen oft von einer weit verbreiteten epigenetischen Umprogrammierung begleitet werden. Long-Read-Ansätze können nun sowohl genetische als auch epigenetische Veränderungen entlang einzelner Haplotypen phasenweise durchführen und zeigen, wie Methylierungsmuster propagiert und über strukturelle Umlagerungen hinweg verändert werden.

Direct RNA Sequencing und Transcriptomics

Oxford Nanopore bietet auch direkte RNA-Sequenzierung (DRS), die native RNA-Moleküle ohne Reverse-Transkription oder Amplifikation sequenziert. Diese Technik bewahrt RNA-Modifikationen (z. B. m6A, Pseudouridin) und liefert vollständige Transkript-Isoforminformationen. Zu den aufkommenden Verbesserungen gehören ein höherer Durchsatz, eine bessere Porensensitivität für RNA und Basenanrufmodelle, die speziell für den RNA-Modifikationsnachweis ausgebildet wurden. Direkte RNA-Sequenzierung öffnet neue Fenster in alternative Spleißen, Poly-A-Schwanzlängenanalyse und die funktionelle Wirkung der RNA-Editierung in komplexen Transkriptomen.

Anwendungen in der komplexen Genomanalyse

Komplette Genom-Assembler und T2T-Projekte

Das Konsortium Telomere-to-Telomere (T2T) hat die erste wirklich vollständige menschliche Genomsequenz im Jahr 2022 erreicht und ist ein wegweisender Beweis für die Leistungsfähigkeit der Long-Read-Sequenzierung. Durch die Kombination von > 30-facher Abdeckung von HiFi-Reads und > 70-facher Abdeckung von ultralangen Nanopore-Reads (und durch manuelle Kuration mit optischen Karten) hat das Team jede Lücke, einschließlich des anspruchsvollen Y-Chromosoms, geschlossen. Ähnliche Bemühungen werden jetzt für viele andere Arten unternommen, von Kulturpflanzen bis hin zu gefährdeten Säugetieren. Neue Techniken der Long-Read-Metagenomik ermöglichen auch die Rekonstruktion vollständiger, kreisförmiger Genome aus zuvor nicht charakterisierten Mikroben in komplexen Umweltproben.

Strukturvariantenentdeckung bei menschlichen Erkrankungen

Long-read-Sequenzierung ist zum Goldstandard für die Entdeckung und Charakterisierung von Strukturvarianten (SVs) in menschlichen Genomen geworden. Studien haben Zehntausende von SVs pro Genom katalogisiert, von denen viele durch kurze Lesarten verpasst oder schlecht aufgelöst werden. Neue Techniken ermöglichen jetzt eine präzise Breakpoint-Mapping auch in segmentalen Duplikationen und Low-Komplexity-Wiederholungen. In klinischen Kontexten wird Long-read-Sequenzierung verwendet, um "Genomic Mystery" bei Patienten mit seltenen Krankheiten zu lösen, die sich der Standard-Exom- oder Genom-Sequenzierung entzogen haben. Die Fähigkeit, Varianten vollständig zu phasen und zusammengesetzte Heterozygotie oder de novo strukturelle Ereignisse zu erkennen, treibt die diagnostischen Erträge nach oben.

Populationsgenetik und Evolutionsstudien

Hochwertige Referenzgenome, die aus Langlese-Assemblierungen generiert wurden, ermöglichen genauere vergleichende genomische Analysen über Populationen und Arten hinweg. So hat die Langlese-Sequenzierung bei Menschenaffen linienspezifische Erweiterungen von Genfamilien und Retrotransposons ergeben, die für Kurzlese-Ansätze unsichtbar sind. Ebenso hat die Langlese-Sequenzierung bei Pflanzen mit großen, repetierreichen Genomen (z. B. Weizen, Mais, Koniferen) erste umfassende Untersuchungen der mit Domestikation und Anpassung verbundenen strukturellen Variation ermöglicht. Aufkommende Techniken wie "Pan-Genom" -Studien, bei denen mehrere Langlese-Assemblierungen von verschiedenen Individuen direkt verglichen werden - liefern ein vollständigeres Bild der genomischen Vielfalt innerhalb einer Spezies.

Krebsgenomik und flüssige Biopsie

Langlesetechniken werden zunehmend auf Krebsgenome angewendet, wo massive Umlagerungen, Kopienzahländerungen und epigenetische Veränderungen häufig sind. Studien mit Langlese haben bisher verborgene Genfusionen und extrachromosomale zirkulare DNA (ecDNA) identifiziert, die die Onkogenese vorantreiben. In der Flüssigbiopsie kann die Nanoporensequenzierung zirkulierender zellfreier DNA (cfDNA) tumorspezifische Strukturvarianten und Methylierungsmuster mit hoher Empfindlichkeit erkennen. Neue Methoden zur gezielten Langlesesequenzierung in der Flüssigbiopsie sind vielversprechend für die nicht-invasive Krebsüberwachung und -früherkennung.

Herausforderungen und Einschränkungen

Trotz dieser Fortschritte steht die Long-Read-Sequenzierung vor mehreren anhaltenden Herausforderungen. Die Genauigkeit der Pro-Basen-Sequenzierung liegt zwar verbessert, bleibt aber für bestimmte Kontexte, insbesondere in Homopolymer-Trakten und stark repetitiven Regionen, immer noch hinter den Short-Read-Plattformen (Illumina's <0,1% Fehlerrate), zurück. Base-Calling-Fehler, insbesondere auf der Ebene des Individual-Reads, können Einzelmolekülanwendungen wie Phasen- oder Methylierungsaufrufe in geringer Tiefe verwirren. Durchsatz und Kosten bleiben Barrieren für groß angelegte Bevölkerungsstudien; obwohl die Kosten sinken, kostet ein High-Deep-Long-Read-Humangenom immer noch nach oben von $ 1.000 bis $ 3.000 für HiFi oder Nanopore, verglichen mit ~ $ 200 für ein Standard-Kurzlese-Genom.

Bibliotheksvorbereitung für ultralange Lesevorgänge erfordert hochmolekulare DNA, die aus formalinfixiertem, paraffineingebettetem (FFPE) Gewebe oder abgebauten forensischen Proben schwer zu erhalten sein kann. Scherung, Fragmentierung und DNA-Schäden während der Extraktion reduzieren den Anteil wirklich langer Moleküle. Aufkommende Techniken der sanften DNA-Extraktion (z. B. mit Agarose-Plugs oder magnetischen Perlen-basierten Protokollen) mildern dieses Problem, erhöhen aber die Komplexität.

Auch die Anforderungen an die Rechenleistung sind nicht trivial. Die große Menge an Rohsignaldaten von Nanoporen-Sequencern (oder die großen BAM-Dateien von HiFi) erfordern eine erhebliche Speicher- und Verarbeitungsleistung. Die Echtzeit-Basisaufrufung, die zwar auf einer GPU möglich ist, verbraucht erhebliche elektrische und rechnerische Ressourcen. Darüber hinaus ist die De-Novo-Montage großer Genome aus langen Lesevorgängen nach wie vor eine rechenintensive Aufgabe, obwohl die jüngsten Verbesserungen bei Algorithmen sowohl die Laufzeit als auch den Speicherbedarf reduziert haben.

Ausblick und zukünftige Richtungen

Die nächsten fünf Jahre versprechen weitere Durchbrüche in der Long-Read-Sequenzierung. Auf der Hardware-Seite könnten neue Festkörper-Nanoporen und integrierte Schaltungssensoren den Durchsatz drastisch erhöhen und Kosten senken. Unternehmen wie PacBio entwickeln Benchtop-Systeme, die HiFi in das klinische Labor bringen, während ONT seine Geräte weiterhin für Feldanwendungen miniaturisiert. Auf der Chemie-Front wird die Möglichkeit, längere Vorlagen (>>2 Mb) zu sequenzieren, ohne die Genauigkeit zu beeinträchtigen. Gleichzeitig wird erwartet, dass neuartige Basis-Calling-Modelle, die Transformatorarchitekturen und selbstüberwachtes Lernen nutzen, die Rohlesegenauigkeit über Q30 (99,9%) für Nanopore hinausbringen.

Die Integration in räumliche Transkriptomik und Einzelzellgenomik ist eine weitere neue Grenze. Langlesen-Sequenzierung von barcodierter Einzelzell-cDNA oder gDNA kann Isoforminformationen in voller Länge und phasenweise abrufbare Varianten bei zellulärer Auflösung liefern. Frühe Arbeiten in diesem Bereich haben gezeigt, dass hybride Ansätze, die lang- und kurzgelesene Einzelzelldaten kombinieren, zelltypspezifisches alternatives Spleißen und Mutationen aufdecken können, die allein durch Kurzlesen übersehen werden.

Schließlich wird die Verschiebung hin zu „pangenomischen Referenzgenomen, in denen viele hochwertige Langlese-Assemplare von verschiedenen Individuen gemeinsam analysiert werden, grundlegend verändern, wie wir die menschliche genetische Variation interpretieren. Die Fähigkeit, seltene, große SVs zu erkennen und die Auswirkungen von Wiederholungserweiterungen auf die Genregulation und Krankheit zu untersuchen, wird mit der Reife dieser Techniken zur Routine werden. Aufkommende Langlese-Sequenzierungstechniken verbessern nicht nur bestehende genomische Analysen, sondern ermöglichen völlig neue Formen der biologischen Untersuchung, von der vollständigen Orchestrierung epigenetischer Markierungen über Megabasen-Regionen bis hin zur Echtzeit-Tracking von viralen Quasispezies in einem infizierten Wirt.

Schlussfolgerung

Aufkommende Techniken der Long-Read-Sequenzierung verändern unsere Fähigkeit, komplexe Genome zu analysieren. Durch Fortschritte in Chemie, Hardware und Berechnung liefern Technologien wie PacBio HiFi und Oxford Nanopore nun genaue, ultralange Lesungen, die die widerspenstigen genomischen Merkmale - repetitive Regionen, Zentromere und große strukturelle Varianten - mit beispielloser Genauigkeit umfassen können. Hybridansätze und die Integration mit Epigenomikanalyse erweitern den Umfang der Informationen aus einem einzigen Experiment. Während die Herausforderungen in Bezug auf Kosten, Durchsatz und Rechenaufwand bestehen bleiben, ist die Flugbahn klar: Langlesen-Sequenzierung wird der Standard für die de novo-Assemblierung, die Entdeckung von strukturellen Varianten und die umfassende Genomcharakterisierung werden sowohl in der Forschung als auch in der klinischen Umgebung. Da diese Techniken sich weiterentwickeln, versprechen sie tiefere Einblicke in genetische Struktur, Funktion und Vielfalt, die Fortschritte in Medizin, Landwirtschaft und Evolutionsbiologie vorantreiben werden.