Table of Contents
Introduzione alla Sequenziamento Profondo
Il sequenziamento profondo, spesso sinonimo di sequenziamento ad alto rendimento, descrive il processo di lettura di un campione di DNA o RNA molte volte per raggiungere un'alta profondità di copertura per base. Questa lettura ripetuta non è ridondante: fornisce il potere statistico necessario per distinguere le varianti rare reali da errori di sequenziamento. Il concetto è emerso con l'avvento di piattaforme di sequenziamento di prossima generazione (NGS) nella metà degli anni 2000, che ha sostituito il metodo di abbreviato
L'importanza di trovare varianti rare, quelle che si verificano in meno dell'1% di una popolazione o a basse frazioni clonali all'interno di un individuo, non può essere sovrastata. In cancro, per esempio, le mutazioni del conducente spesso esistono come subcloni minori che possono semiresistere resistenza alla terapia.
Avanzamenti tecnologici chiave
Piattaforme di Sequenziamento di prossima generazione
Le piattaforme NGS moderne si differenziano per la lunghezza del letto, il throughput, il costo per base e i profili di errore, ma tutte sono migliorate notevolmente nella loro capacità di fornire una copertura profonda e accurata.
Identificazione molecolare unica (UMI) e correzione di errore
Una delle innovazioni più trasformative per il rilevamento delle varianti rare è l'uso di identificatori molecolari, o UMI. Un UMI è una breve sequenza casuale di nucleotidi attaccati a ogni frammento del DNA prima dell'amplificazione. Poiché ogni frammento originale riceve un codice a barre distinto, il sequenziamento legge che derivano dalla stessa molecola originale può essere raggruppato in "famiglie".
Algoritmi di bioinformatica avanzata
I dati grezzi provenienti da esperimenti di sequenziamento profondo sono inutili senza robusti condotti computazionali. I moderni strumenti di bioinformatica si sono evoluti per affrontare specificamente le sfide del rilevamento delle varianti rare.
- Noizzare algoritmi:[] Strumenti come Strelka2, Mutect2, e Vardict incorporano la ricalibrazione del punteggio di qualità base e il filtro bias di orientamento per ridurre i falsi positivi da artefatti di sequenziamento sistematico.
- Modellazione di errore con UMI:[] Software come fgbio e smCounter2 utilizza il consenso UMI legge per collassare le letture duplicate e costruire sequenze di consenso corrette da errori.
- Classificatori per macchine-learning:[] Le reti neurali profonde, comprese quelle addestrate su vere varianti di grandi consorzi, possono distinguere le vere e proprie rare mutazioni dal rumore specifico della piattaforma meglio delle soglie euriste.
- Aplotype-aware call:[] I metodi che la fase legge in aplotipi (come WhatsHap e LongPhase) migliorano la sensibilità per le varianti eterozigose composte e aiutano a risolvere le varianti a bassa frequenza nelle regioni ripetitive.
Insieme, questi strumenti consentono ai ricercatori di segnalare con fiducia varianti presenti a VAFs a partire dallo 0,01% quando la profondità di sequenziamento è sufficiente e gli UMI sono impiegati. Senza di loro, il volume massiccio di dati di sequenziamento profondo — spesso terabyte per esperimento — sarebbe ingestibile.
Applicazioni in Medicina e Ricerca
Genetica della malattia rara
Le malattie rare, definite come condizioni che interessano meno di 1 su 2.000 persone, sono collettivamente comuni, che colpiscono un mosaico stimato di 300 milioni di persone in tutto il mondo. Molti sono causati da varianti ultra-rare che non sono catturate da esempi standard che sequenziano a 30× a 50× profondità.
Cancro genomica e biopsia liquida
La ricerca sul cancro al seno (in inglese) è un'analisi del tumore al seno (in inglese) che può essere utilizzata come terapia di base (in inglese)
Popolazione Genetica e Studi Evolutivi
I 1000 Genomes Project e il Genome Aggregation Database (gnomAD) hanno catalogato milioni di varianti rare, ma la maggior parte di questi sono basati su profondità di sequenziamento 30-100×.
Sfide in corso
Gestione e memorizzazione dei dati
L'esplosione nella profondità di sequenziamento produce aumenti commisurati del volume di dati. Un singolo esoma umano, sequenziato a 500×, può generare 50–100 gigabyte di file FASTQ grezzi, mentre un genoma intero a 100× supera 200 gigabyte.
Precisione vs. costo
Anche se i costi di sequenziamento sono scesi drasticamente (da $10 milioni al genoma nel 2007 a circa 600 dollari oggi), la sequenziazione ultra-deep per il rilevamento delle varianti rare richiede ancora costi aggiuntivi: più flussi di celle, preparazioni di librerie UMI e risorse computazionali avanzate.
Aplotipo di Phasing e Varianti strutturali
La maggior parte delle piattaforme di sequenziamento profonde producono brevi letture (150–300 bp) che raramente coprono interi aplotipi o complesse varianti strutturali (SVs). Questa limitazione rende difficile determinare se due rare varianti risiedono sullo stesso cromosoma (in cis) o su diverse copie (in transalgoritmo), che è essenziale per interpretare l'eterozigosità dei composti nelle malattie recessive.
Le direzioni future
Integrazione del Sequenziamento a lungo termine
Le tecnologie di sequenziamento a lungo termine delle Bioscienze del Pacifico (HiFi reads, ~15–25 kb) e Oxford Nanopore (leggi superiori a 100 kb) sono sempre più utilizzate in combinazione con i dati a lettura corta profonda.
Imparare a macchina per l'interpretazione di variant
Oltre al rilevamento delle frequenze, il significato clinico delle varianti rare deve essere interpretato. Modelli di apprendimento automatico formati su grandi database curati (ClinVar, gnomAD) ora superano i tradizionali sistemi basati sulle regole nella previsione della causalità.
Dispositivi portatili e a punta di altezza
I dispositivi di sequenziamento miniaturizzati, in particolare la Minion e il Flongle di Oxford Nanopore, hanno reso possibile eseguire un sequenziamento profondo in ambienti strutturali remoti o limitati dalle risorse. Questi dispositivi sono stati utilizzati per la sorveglianza del genoma virale in tempo reale (ad esempio, Ebola, SARS‐CoV‐2), il rilevamento di batteri resistenti agli antibiotici negli ospedali da campo e il rapido genotiparsi delle malattie rare in corrente rurale
Conclusioni
I progressi nella profonda tecnologia di sequenziamento hanno alterato fondamentalmente il paesaggio di rara rilevazione variante. Le piattaforme di calcolo più elevate, correzione degli errori codici a barre molecolari, e gli algoritmi di bioinformatica sofisticati ora permettono ai ricercatori e ai medici di identificare le mutazioni alle frequenze inferiori allo 0,01% con alta fiducia.