advanced-manufacturing-techniques
Techniques émergentes dans le séquençage à longue lecture pour l'analyse génomique complexe
Table of Contents
En lisant des fragments continus d'ADN de dizaines à des centaines de milliers de paires de bases, ces techniques permettent aux scientifiques de résoudre des régions répétitives, de détecter de grandes variantes structurelles et de phaser des haplotypes avec une grande confiance. Cet article passe en revue les dernières techniques émergentes de séquençage de la longue lecture, en examinant les innovations technologiques, les progrès de calcul et les approches intégratives qui élargissent les frontières de l'analyse génomique.
Progrès récents dans les plates-formes de séquençage à longue lecture
Les fabricants clés ont introduit de nouveaux réactifs, des cellules de flux et des systèmes d'imagerie qui stimulent considérablement la longueur de lecture, la précision des repères de base et le débit global. Par exemple, la dernière génération de séquençage en temps réel à simple molécule (SMRT) de Pacific Biosciences (PacBio) permet maintenant d'obtenir des longueurs de lecture médianes supérieures à 15 kilobases, tandis que Oxford Nanopore Technologies (ONT) a démontré des lectures dépassant 2 mégabases. Ces lectures étendues sont essentielles pour couvrir des caractéristiques génomiques complexes telles que les centromères, les télomères et les duplications segmentales, qui résistent souvent à l'assemblage de lectures courtes.
Les améliorations apportées aux protocoles de préparation des bibliothèques contribuent davantage à la qualité des données. On a montré que les méthodes qui réduisent les dommages causés par l'ADN, réduisent la fragmentation et optimisent la charge moléculaire augmentent à la fois le rendement et la longueur des lectures longues. Pour PacBio, l'adoption du flux de travail de -HiFi (haute fidélité) utilise le séquençage par consensus circulaire (SCC) pour générer un consensus unique et très précis lu à partir de plusieurs passages de la même molécule modèle circulaire.
Du côté informatique, les algorithmes de référence sont passés de modèles simples Markov cachés à des architectures de réseau neurologique profond (p. ex. Guppy, Bonito et le Dorado récemment publié). Ces modèles sont formés à de grands ensembles de données pour corriger des erreurs systématiques, comme des inexactitudes de longueur d'homopolymère, et pour appeler des bases modifiées directement du signal brut. Le résultat est une amélioration spectaculaire de la précision de consensus sans sacrifier la longueur de lecture.
Technologies clés qui stimulent l'innovation
Séquence HiFi de PacBio
Le séquençage HiFi de PacBio, livré commercialement sur les systèmes Sequel IIe et Revio, représente un changement de paradigme dans la précision de lecture longue. En circulant chaque molécule d'ADN et en la séquençage à plusieurs reprises (généralement 15–30 passes), la technologie produit un consensus qui atteint une précision de >99,9% même dans les régions répétitives. Les longueurs de lecture typiques HiFi varient de 10 à 25 kilobases, bien que les protocoles puissent être ajustés pour produire des fragments plus longs au détriment du débit. Cette combinaison de longueur et de précision rend HiFi lit idéal pour l'assemblage de novo, où ils peuvent produire des assemblages contigus avec des valeurs médianes de N50 contigus dépassant 50 mégabases dans des génomes hautement polymorphes ou riches en répétition.
Les innovations récentes en chimie du PacBio, telles que l'amélioration des enzymes polymérases qui intègrent des nucléotides plus rapides et plus fidèles, et l'optique améliorée de traitement des signaux qui réduisent le bruit, ont exercé une pression accrue sur le débit et la qualité. Le système Revio, introduit en 2022, utilise une nouvelle cellule SMRT capable de générer jusqu'à 130 gigabases de données HiFi par cellule, ce qui rend le HiFi entièrement humain séquençage d'une réalité à l'intérieur d'un seul cycle de cellules à flux.
Technologies nanopores d'Oxford
Les plateformes Oxford Nanopore (MinION, GridION, PromethION) offrent une approche distinctement complémentaire : le séquençage en temps réel de brins d'ADN ou d'ARN natifs non modifiés à travers un nanopore protéique. La technologie , qui caractérise la technologie, est sa capacité à produire des lectures ultra-longues, avec des expériences produisant des molécules dépassant 2 millions de paires de bases.
Le séquençage des nanopores a connu des améliorations rapides de la précision par base grâce à de meilleures configurations poreuses, à des protéines motrices optimisées et à des algorithmes sophistiqués d'appel de base. Les derniers pores R10.4.1, combinés aux modèles d'appel de base à haute précision du logiciel Dorado, obtiennent systématiquement des précisions de lecture médiane supérieures à 99,5 % (Q20+) à des longueurs de lecture modérées.
Les nouvelles techniques de nanopores comprennent des approches -Lisez les approches jusqu'à ce que la sélection des cibles en temps réel, où le séquençage peut être dirigé de façon dynamique pour enrichir les régions d'intérêt. De plus, les adaptateurs et les systèmes de codage à barres permettent maintenant le multiplexage à haut débit de centaines d'échantillons par cellule de flux, réduisant grandement les coûts par échantillon et rendant le séquençage à longue distance accessible aux applications cliniques et sur le terrain.
Nouvelles techniques et orientations futures
Approches de l'assemblée hybride
Bien que PacBio HiFi et ONT lisent puissent produire des assemblages de haute qualité de façon indépendante, de nombreux chercheurs adoptent des stratégies hybrides qui combinent le meilleur des deux plateformes. L'approche la plus courante utilise HiFi lit (haute précision, longueur modérée) comme l'os arrière pour la formation de contig, puis échafaude et remplit des lacunes avec des lectures ultra-longues de nanopore. Des outils comme shasta, canu[, hifiasm[ et verkko[ ont été développés pour gérer ces ensembles d'entrée hybrides, produisant souvent des assemblages à la fois contigus et très précis.
Algorithmes calculateurs pour correction d'erreur et Assemblage
Les profils d'erreurs de lectures longues diffèrent fondamentalement des lectures courtes, nécessitant des algorithmes spécialisés. De nouveaux outils de correction d'erreurs, tels que medaka (pour ONT) et pbmm2 / ccs[ (pour PacBio), ont été affinés pour tirer parti des régions de haute qualité de chacune lue pour améliorer le consensus sur l'ensemble de l'ensemble des données. Pour l'assemblage, les approches basées sur des graphiques qui représentent l'ensemble des lectures comme un diagramme à cordes ou un graphique de Bruijn ont été adaptés pour de longues lectures.
Au-delà de l'assemblage, les pipelines de calcul pour détecter les variantes structurales (SV) à partir de longues lectures ont mûri. Les appelants comme Sniffes2[, Picky[ et cuteSV[ emploient le regroupement de lecture par spandpoint et l'alignement de séquence pour identifier les suppressions, les duplications, les inversions, les translocations et les insertions d'éléments mobiles.
Intégration à l'analyse épigénomique
L'une des techniques émergentes les plus intéressantes est l'interrogation simultanée de la séquence génomique et de l'épigénome à partir d'un seul ensemble de données à lecture longue. La détection directe des modifications de l'ADN par nanopore a atteint un point où une estimation quantitative du niveau de méthylation est possible à une résolution à une seule base. Le séquençage HiFi, sans détecter directement les modifications du signal brut, peut être combiné avec la conversion de bisulfite ou des approches sensibles à la méthylation enzymatique pour fournir des profils épigénomiques à lecture longue. Cette intégration s'avère inestimable dans la génomique du cancer, où les variations structurelles à grande échelle s'accompagnent souvent d'une reprogrammation épigénétique généralisée.
Séquence directe de l'ARN et transcription
Cette technique préserve les modifications de l'ARN (p. ex. m6A, pseudouridine) et fournit des informations sur l'isoforme de transcription de longueur complète. Les améliorations émergentes comprennent un débit plus élevé, une meilleure sensibilité des pores pour l'ARN et des modèles de calage de base formés spécifiquement pour la détection de modifications de l'ARN. Le séquençage direct de l'ARN ouvre de nouvelles fenêtres en étirement alternatif, une analyse de longueur de queue poly-A et l'impact fonctionnel de l'édition de l'ARN dans des transcriptomes complexes.
Applications dans l'analyse génomique complexe
Projets complets de montage génomique et de T2T
Le consortium Telomere-to-Telomere (T2T) réalise la première séquence génomique humaine vraiment complète en 2022, une démonstration marquante de la puissance de séquençage des feuilles longues. En combinant >30× couverture des lectures HiFi et >70× couverture des lectures ultra-longues de nanopores (et en utilisant la curation manuelle avec des cartes optiques), l'équipe a résolu toutes les lacunes, y compris le chromosome Y difficile. Des efforts similaires sont actuellement en cours pour de nombreuses autres espèces, des plantes cultivées aux mammifères en danger.
Découverte de la variation structurelle dans les maladies humaines
Les études ont catalogué des dizaines de milliers de SV par génome, dont beaucoup sont ratés ou mal résolus par de courtes lectures. Les techniques émergentes permettent maintenant une cartographie précise des points de rupture, même dans les doubles emplois segmentaires et les répétitions à faible complexité. Dans les contextes cliniques, le séquençage des lectures longues est utilisé pour résoudre les mystères génomiques chez les patients atteints de maladies rares qui ont échappé à l'exome standard ou au séquençage génomique.
Génétique de la population et études évolutionnaires
Par exemple, dans les grands singes, le séquençage à longue distance a révélé des expansions spécifiques à la lignée des familles de gènes et des rétrotransposons invisibles aux approches à courte lecture. De même, chez les plantes à génomes riches en répétition (p. ex. blé, maïs, conifères), le séquençage à longue lecture a permis de réaliser les premières études exhaustives de la variation structurelle associée à la domestication et à l'adaptation.
La génomique du cancer et la biopsie liquide
Les techniques de lecture longue sont de plus en plus appliquées aux génomes cancéreux, où les réarrangements massifs, les changements de nombre de copies et les altérations épigénétiques sont fréquents. Des études utilisant des lectures longues ont permis d'identifier des fusions géniques précédemment cachées et de l'ADN extrachromosomique circulaire (ADNc) qui conduisent à la cogenèse.
Défis et limites
Malgré ces progrès, le séquençage des feuilles longues est confronté à plusieurs défis persistants. La précision par base, tout en s'améliorant, reste à la traîne des plateformes à lecture courte (taux d'erreur d'Illumina <0,1%) pour certains contextes, en particulier dans les domaines homopolymères et les régions très répétitives. Les erreurs d'appel de base, surtout au niveau de lecture individuelle, peuvent confondre des applications à simple molécule telles que l'appel à faible profondeur par gradation ou méthylation.
La préparation de la bibliothèque pour les lectures ultra-longues nécessite un ADN de poids moléculaire élevé, qui peut être difficile à obtenir à partir de tissus de paraffine fixe ou de tissus de paraffine (FFPE) ou d'échantillons médico-légaux dégradés. L'audition, la fragmentation et les dommages à l'ADN pendant l'extraction réduisent la fraction de molécules vraiment longues.
Les demandes de calcul ne sont pas non plus triviales. Le volume important de données brutes provenant des séquenceurs nanopores (ou des grands fichiers BAM de HiFi) nécessite une puissance de stockage et de traitement importante. L'appel de base en temps réel, bien que possible sur un GPU, consomme des ressources électriques et informatiques importantes.
Perspectives et orientations futures
Les cinq prochaines années promettent d'autres percées dans le séquençage des lectures longues. Du côté matériel, de nouvelles nanopores à l'état solide et des capteurs de circuits intégrés pourraient augmenter considérablement le débit et réduire les coûts. Des entreprises comme PacBio développent des systèmes de table qui apportent HiFi au laboratoire clinique, tandis que l'ONT continue de miniaturiser ses appareils pour les applications sur le terrain.
L'intégration à la transcriptomique spatiale et à la génomique à cellules uniques constitue une autre frontière émergente. Le séquençage à longue distance de l'ADNc à cellules simples codées à barres ou de l'ADNg peut fournir des informations isoformes complètes et des appels de variantes échelonnés à résolution cellulaire.
Enfin, le passage à des génomes de référence -pangenomic- , où de nombreux ensembles de lecture longue de haute qualité provenant de différents individus sont analysés conjointement, modifiera fondamentalement la façon dont nous interprétons la variation génétique humaine. La capacité de détecter les grands SV rares et d'étudier l'impact des expansions répétées sur la régulation des gènes et la maladie deviendra courante à mesure que ces techniques mûriront.
Conclusion
Grâce aux progrès de la chimie, du matériel et du calcul, les technologies comme PacBio HiFi et Oxford Nanopore offrent maintenant des lectures ultra-longues précises qui peuvent couvrir les caractéristiques génomiques les plus récalcitrantes — régions répétitives, centromères et grandes variantes structurelles — avec une fidélité sans précédent. Les approches hybrides et l'intégration à l'analyse épigénomique élargissent encore la portée de l'information obtenue à partir d'une seule expérience. Bien que les défis demeurent en termes de coûts, de débit et de charge informatique, la trajectoire est claire : le séquençage des lectures longues deviendra la norme pour le montage de novo, la découverte de variantes structurelles et la caractérisation complète du génome dans les milieux de recherche et les milieux cliniques.