civil-and-structural-engineering
Progrès dans les technologies de séquençage profond pour la détection de la variation rare
Table of Contents
Introduction au séquençage profond
Le séquençage profond, souvent synonyme de séquençage à haut débit, décrit le processus de lecture d'un échantillon d'ADN ou d'ARN plusieurs fois plus pour obtenir une couverture élevée par base. Cette lecture répétée n'est pas redondante : elle fournit la puissance statistique nécessaire pour distinguer les variantes rares véritables des erreurs de séquençage. Le concept est apparu avec l'avènement des plates-formes de séquençage de prochaine génération (NGS) au milieu des années 2000, qui ont remplacé la méthode de Sanger à forte intensité de main-d'oeuvre. Les premiers instruments NGS ont produit des millions de lectures courtes par course, mais des taux d'erreur de 0,1 à 1 % ont fait que les variantes présentes à des fréquences inférieures à 1 à 5 % étaient difficiles à appeler avec confiance.
Dans le cancer, par exemple, les mutations de conducteurs sont souvent des sous-clones mineurs qui peuvent résister aux traitements. Dans les maladies génétiques rares, les variantes hétérozygotes composées ou les mutations de mosaïque peuvent expliquer des cas où l'exomère clinique standard donne des résultats négatifs. Le séquençage profond sous-tend également les études de la mosaïque somatique dans le vieillissement, de la diversité des quasi-espèces pathogènes et de l'ADN tumoral circulant (ADNct) dans les biopsies liquides. Cet article passe en revue les principales avancées technologiques qui ont fait un séquençage profond d'un outil de routine, le paysage actuel des applications, les obstacles persistants et les orientations les plus prometteuses pour la prochaine génération de détection de variantes rares.
Principaux progrès technologiques
Plateformes de séquence de prochaine génération
Les plates-formes modernes de NGS diffèrent en termes de longueur de lecture, de débit, de coût par base et de profils d'erreurs, mais elles se sont toutes nettement améliorées en raison de leur capacité à fournir une couverture profonde et précise. La chimie séquentielle par synthèse (SBS) demeure le cheval de travail dominant pour les études de variantes rares en raison de ses taux d'erreur de base très bas (~0,1 % pour la plupart des instruments) et de sa capacité à générer des milliards de lectures par course. La série NovaSeq X, publiée en 2022, pousse le débit à plus de 10 milliards de lectures par cellule de flux, ce qui permet un séquençage ultra profond des exomes entiers ou des panneaux ciblés à une fraction du coût des modèles précédents.
Identificateurs moléculaires uniques (IUM) et correction d'erreur
[L'UMI est une séquence aléatoire courte de nucléotides attachée à chaque fragment d'ADN avant l'amplification. Comme chaque fragment d'origine reçoit un code à barres distinct, les lectures séquentielles qui proviennent de la même molécule d'origine peuvent être regroupées en familles. . Après l'amplification et l'séquence, les lectures au sein d'une famille sont comparées entre elles. De vraies variantes apparaissent dans presque tous les membres de la famille, tandis que les erreurs séquentielles – qui sont aléatoires et se produisent après l'attachement du code à barres – n'apparaissent que dans une minorité de lectures. En exigeant qu'une variante soit vue dans une fraction spécifiée de lectures au sein d'une famille (p. ex., 80 % ou plus), les UMI peuvent supprimer le taux d'erreur de fond de deux à trois ordres de grandeur, atteignant des niveaux d'erreur aussi bas que 10 à 5.
Algorithmes de bioinformatique avancés
Les données brutes issues d'expériences de séquençage profond sont inutiles sans pipelines de calcul robustes. Les outils bioinformatiques modernes ont évolué pour répondre spécifiquement aux défis de la détection de variantes rares.
- Dénuisant algorithmes:[ Des outils tels que Strelka2, Mutect2 et Vardict intègrent le recalibrage de la qualité de base et le filtrage des biais d'orientation pour réduire les faux positifs des artefacts séquentielle systématique.
- Modèle d'erreur avec UMIs:[ Des logiciels comme fgbio et smCounter2 utilisent des lectures de consensus UMI pour effondrer les lectures de duplicata et construire des séquences de consensus corrigées par erreur.
- Les classificateurs d'apprentissage de la machine:[ Les réseaux neuronaux profonds, y compris ceux formés sur des variantes connues de grands consortiums, peuvent distinguer les mutations rares réelles du bruit propre à la plateforme mieux que les seuils heuristiques.
- Haplotype-aware call:[ Les méthodes qui lit la phase en haplotypes (comme WhatsHap et LongPhase) améliorent la sensibilité des variantes hétérozygotes composées et aident à résoudre les variantes de basse fréquence dans les régions répétitives.
Ensemble, ces outils permettent aux chercheurs de signaler avec confiance les variantes présentes dans les VAF jusqu'à 0,01 % lorsque la profondeur de séquençage est suffisante et que les UMI sont utilisés. Sans eux, le volume massif de données de séquençage profond – souvent téraoctets par expérience – serait inexploitable.
Applications en médecine et en recherche
Génétique des maladies rares
Les maladies rares, définies comme des affections touchant moins d'une personne sur 2 000, sont communes collectivement, et elles touchent environ 300 millions de personnes dans le monde. Beaucoup sont causées par des variantes ultra-rares qui ne sont pas capturées par un séquençage standard à 30× à 50× profondeur. Le séquençage profond de panneaux de gènes ciblés ou d'exomes entiers à 200× à 500× s'est révélé très efficace pour identifier les mutations de mosaïque (présentes dans une fraction seulement de cellules) et les variantes somatiques de faible niveau qui contribuent à des troubles tels que la sclérose tubéreuse, les syndromes de surcroissance et l'épilepsie. Dans une étude historique publiée dans Genetics in Medicine (2021), les chercheurs ont appliqué un séquençage ciblé à 100 patients présentant des conditions génétiques non diagnostiquées et ont obtenu un rendement diagnostique de 32 %, comparativement à 10-20 % pour un séquençage standard.
La génomique du cancer et la biopsie liquide
Le séquençage profond de la biopsie tumorale à des centaines à des milliers de fois de couverture par pli révèle des sous-clones mineurs pouvant contenir des mutations de résistance à des thérapies ciblées. Par exemple, la détection de la mutation EGFR T790M dans le cancer du poumon non à petites cellules (souvent présente à des FVV de 0,1 à 1 % dans l'ADN tumoral circulant) est maintenant une pratique courante en gestion clinique. La biopsie liquide, l'analyse de l'ADN sans cellules (cfDNA) provenant du sang, repose entièrement sur un séquençage profond parce que l'ADNc peut constituer moins de 0,1 % du total de l'ADNcf dans le cancer au début du stade.Un essai commercial comme Guardant360 et FoundationOne Liquide utilise un séquençage profond avec les UMI pour atteindre des sensibilités de 85 à 95 % pour les mutations présentes à des FVV supérieures à 0,1 %. Un essai pivot dans le New England Journal of Medicine [2018] a démontré
Génétique de la population et études évolutionnaires
Le séquençage profond de grandes populations a transformé notre compréhension de la diversité génétique humaine. Le projet 1000 Génomes et la base de données sur l'agrégation génomique (gnomAD) ont catalogué des millions de variantes rares, mais la plupart d'entre elles sont basées sur des profondeurs séquentielles de 30 à 100×. Des efforts récents comme le programme UK Biobank Whole-Exome Sequencening (200 000 participants à 50×) et le programme NHLBI Trans-Omics for Precision Medicine (TOPMed) ont utilisé une couverture plus approfondie pour améliorer la détection de variantes très rares et privées. Ces données sont essentielles pour interpréter l'impact fonctionnel des variantes en génétique clinique : une variante observée dans 0,01 % de la population peut être bénigne, alors qu'une variante vraiment nouvelle a une probabilité plus élevée de pathogénicité.
Défis en cours
Gestion et stockage des données
L'explosion de la profondeur de séquençage produit des augmentations proportionnelles du volume de données. Un seul exome humain séquencé à 500× peut générer 50 à 100 gigaoctets de fichiers FASTQ bruts, tandis qu'un génome entier à 100× dépasse 200 gigaoctets. Le stockage, le transfert et l'analyse de ces ensembles de données nécessitent une infrastructure informatique importante qui n'est pas disponible pour tous les laboratoires. Les solutions basées sur le cloud (p. ex. DNAnexus, AWS, Google Cloud) permettent un accès plus large, mais les coûts de l'évacuation des données et des archives à long terme restent non triviaux.
Précision et coût
Bien que les coûts de séquençage aient chuté de façon spectaculaire (de 10 millions de dollars par génome en 2007 à environ 600 $ aujourd'hui), le séquençage ultra profond pour la détection de variantes rares nécessite encore des dépenses supplémentaires : des essais de cellules à flux multiples, des préparations de bibliothèques UMI et des ressources informatiques avancées. Pour de nombreuses applications cliniques, la question est de savoir si l'avantage marginal d'augmenter la profondeur de 500× à 5 000× justifie la dixuple augmentation des coûts.
Haplotype Phasing et les variantes structurelles
La plupart des plates-formes de séquençage profond produisent des lectures courtes (150 à 300 pb) qui couvrent rarement des haplotypes entiers ou des variantes structurelles complexes (SVs). Cette limitation rend difficile de déterminer si deux variantes rares résident sur le même chromosome (en cis) ou sur différentes copies (en trans), ce qui est essentiel pour interpréter l'hétérozygotie des composés dans les maladies récessives. De même, le séquençage profond des lectures courtes manque souvent d'insertions, de suppressions et d'inversions de taille moyenne parce que la longueur de lecture est insuffisante pour s'aligner uniquement sur les points de rupture.
Orientations futures
Intégration du séquençage à longue lecture
Les techniques de séquençage à lecture longue de Pacific Biosciences (HiFi reads, ~15–25 kb) et Oxford Nanopore (lissés au-delà de 100 kb) sont de plus en plus utilisées en conjonction avec des données à lecture courte profonde. Long reads vallonations en phase naturelle dans des régions génomiques étendues et peut détecter directement des variantes structurelles et des expansions répétitives invisibles aux plates-formes à lecture courte. Pour la détection de variantes rares, la combinaison de l'échelonnement à lecture longue avec une sensibilité à lecture courte profonde offre une synergie puissante : les lectures courtes identifient des variantes à très basses fréquences allèles, et les lectures longues les assignent aux haplotypes maternels ou paternels.
Apprentissage automatique pour l'interprétation variée
Au-delà de la détection brute, il faut interpréter la signification clinique des variantes rares.Les modèles d'apprentissage automatique formés sur de grandes bases de données curées (ClinVar, gnomAD) surpassent désormais les systèmes traditionnels fondés sur des règles pour prédire la pathogénicité.Les outils tels que PrimateAI, EVE et SpliceAI utilisent des réseaux neuronaux profonds pour évaluer les variantes de défaut, de site d'éclisse et de régulation.Pour les données de séquençage profond, ces modèles peuvent être améliorés en intégrant la fréquence des allèles, la profondeur de lecture et les données de biais de brin comme caractéristiques d'entrée.
Dispositifs portatifs et dispositifs de soins au point de service
Les dispositifs de séquençage miniaturisés, notamment Oxford Nanopore , MinION et Flongle, ont permis d'effectuer un séquençage profond dans des environnements éloignés ou limités en ressources. Ces dispositifs ont été utilisés pour la surveillance du génome viral en temps réel (p. ex. Ebola, SRAS-CoV-2), la détection de bactéries résistantes aux antibiotiques dans les hôpitaux de campagne et le génotypage rapide des maladies rares dans les cliniques rurales. Le taux d'erreur actuel de Nanopore (environ 5-10 % pour les lectures brutes) a limité son utilisation pour la détection des variantes ultra-rares, mais les améliorations de la chimie (R10,4 pore) et duplex séquençage ont réduit les erreurs à environ 1 % dans les parcours de haute qualité.
Conclusion
Les progrès réalisés dans les techniques de séquençage profond ont fondamentalement modifié le paysage de la détection de variantes rares.Les plates-formes à haut débit, les codes à barres moléculaires correcteurs d'erreurs et les algorithmes bioinformatiques sophistiqués permettent maintenant aux chercheurs et aux cliniciens d'identifier des mutations à des fréquences allèles inférieures à 0,01 % avec une grande confiance.Ces capacités ont des applications directes dans le diagnostic de maladies rares, la biopsie liquide du cancer et la génétique de la population, tout en permettant de nouvelles pistes de recherche sur le vieillissement, l'hématopoïèse clonale et l'évolution microbienne.