advanced-manufacturing-techniques
Técnicas emergentes en secuencias de lectura larga para el análisis complejo del genoma
Table of Contents
Las tecnologías de secuenciación de larga distancia han transformado fundamentalmente la genómica permitiendo el interrogatorio de genomas complejos con una resolución que no se pudo alcanzar con métodos de lectura corta. Al leer fragmentos continuos de ADN decenas a cientos de miles de pares de base de longitud, estas técnicas facultan a los científicos para resolver regiones repetitivas, detectar grandes variantes estructurales y haplotipos de fase con alta confianza.
Avances recientes en plataformas de secuenciación de larga duración
Los últimos años han sido testigos de avances notables en la química, el hardware y el software subyacentes de secuencias de larga duración. Los fabricantes clave han introducido nuevos reactivos, células de flujo y sistemas de imagen que aumentan sustancialmente la longitud de lectura, precisión de montaje base y rendimiento general.Por ejemplo, la última generación de monoméreos en tiempo real (SMRT) secuenciación de mega-ciencias de montaje del Pacífico (PacBio) actualmente alcanzan
Los avances en los protocolos de preparación de bibliotecas contribuyen aún más a la calidad de los datos. Los métodos que minimizan el daño del ADN, reducen la fragmentación y optimizan la carga molecular se han demostrado para aumentar tanto el rendimiento como la longitud de lecturas largas.Para PacBio, la adopción del flujo de trabajo "HiFi" (alta fidelidad) utiliza secuencia de consenso circular (CCS) para generar un consenso único y muy preciso leído desde múltiples pases de la misma molécula de error circularizado.
En el lado computacional, algoritmos de escala base han evolucionado desde simples modelos de Markov ocultos a arquitecturas de redes profundas (por ejemplo, Guppy, Bonito y el recientemente lanzado Dorado). Estos modelos se entrenan en conjuntos de datos grandes para corregir errores sistemáticos, como las imprecisiones de longitud homopolímero, y para llamar bases modificadas directamente desde la señal prima.
Tecnologías clave que impulsan la innovación
Secuenciación de PacBio HiFi
La secuencia de HiFi de PacBio, realizada comercialmente en los sistemas Sequel IIe y Revio, representa un cambio de paradigma en la precisión de lectura larga. Mediante la circularización de cada molécula de ADN y secuenciación de múltiples veces (normalmente 15–30 pases), la tecnología produce un consenso leído que produce √99.9% de precisión incluso en las regiones repetitivas.
Innovaciones recientes en la química de PacBio, como enzimas mejoradas de polimerasa que incorporan nucleótidos más rápidos y con mayor fidelidad, y óptica de procesamiento de señales refinada que reducen el ruido, han colocado una presión más elevada tanto en la potencia como en la calidad.El sistema Revio, introducido en 2022, utiliza una nueva célula SMRT capaz de generar hasta 130 gigabases de datos estructurales de HiFi cada célula
Oxford Nanopore Technologies
Las plataformas de Oxford Nanopore (MinION, GridION, PromethION) ofrecen un enfoque distinto complementario: secuenciación en tiempo real de las cadenas nativas, no modificadas de ADN o ARN mientras pasan a través de una proteína nanopore. El sello de la tecnología es su capacidad de producir lecturas ultralong, con algunos experimentos que producen moléculas superiores a 2 millones de pares base.
El análisis de la secuela de nanopore ha visto mejoras rápidas en la precisión por base a través de mejores configuraciones de poro, proteínas motoras optimizadas y algoritmos de escala base sofisticados. Los últimos poros R10.4.1 combinados con los modelos de alto grado de precisión de base en el software Dorado, generalmente consiguen valores de lectura mediana superiores al 99,5% (Q20+) a longitudes de lectura moderadas.
Las técnicas emergentes en la tecnología de nanopore incluyen enfoques “Leer hasta” que permiten seleccionar objetivos en tiempo real, donde la secuencia de secuenciación puede ser dirigida dinámicamente para enriquecer para regiones de interés. Además, los adaptadores y los esquemas de códigos de barras permiten ahora un múltiplo de alto rendimiento de cientos de muestras por célula de flujo, reduciendo considerablemente los costos por muestreo y haciendo accesibles de larga lectura para aplicaciones clínicas y basadas en campo.
Técnicas emergentes y futuras direcciones
Enfoques de la Asamblea Híbrida
Los conjuntos de alta calidad de PacBio HiFi y ONT pueden producirse de forma independiente, muchos investigadores están adoptando estrategias híbridas que combinan lo mejor de ambas plataformas.El enfoque más común utiliza las lecturas de HiFi (alta precisión, longitud moderada) como columna vertebral para la formación de contig, luego las andamios y las lagunas de lecturas de Nanopore de ultralong.
Algoritmos computacionales para corrección de errores y Asamblea
Los perfiles de errores de lectura larga difieren fundamentalmente de lecturas cortas, que requieren algoritmos especializados. Nuevas herramientas de corrección de errores, como medaka (para ONT) y graph]pbmm2 /
Más allá del montaje, los oleoductos computacionales para detectar variantes estructurales (VS) de lecturas largas han madurado. Los calentadores como Sniffles2, Picky], y cuteSV emplean herramientas de transiluminación de secuencia de disperación
Integración con análisis epignómico
Una de las técnicas emergentes más emocionantes es el interrogatorio simultáneo de la secuencia del genoma y el epigenoma de un único conjunto de datos de larga data. La detección directa de las modificaciones del ADN de Nanopore ha madurado hasta un punto en que la estimación cuantitativa del nivel de metilación es posible en una resolución de base única.
Secuenciación directa del ARN y transcripciones
Oxford Nanopore también ofrece secuenciación directa del ARN (DRS), que secuencia las moléculas nativas del ARN sin transcripción o amplificación inversa. Esta técnica conserva modificaciones del ARN (por ejemplo, m6A, pseudouridine) y proporciona información isoforma de la transcripción completa de la longitud de la transcripción. Las mejoras emergentes incluyen mayor rendimiento, mejor sensibilidad porolica para el ARN, y modelos de detección de eslabamiento funcional de la longitud de la correlación alternativa.
Aplicaciones en Complejo Análisis de Genoma
Completa Asamblea General de Genomas y proyectos T2T
El logro del consorcio Telomere‐to-Telomere (T2T) de la primera secuencia de genoma humano verdaderamente completa en 2022 es una demostración histórica de la potencia de secuenciación de largo alcance. Al combinar √°30× cobertura de HiFi lee y √°70× cobertura de las lecturas de ultralong Nanopore (y utilizando curación manual con mapas ópticos), el equipo resolvió cada brecha, incluyendo el complejo de la muestra desafiante
Descubrimiento de la variabilidad estructural en la enfermedad humana
El secuenciador de lectura larga se ha convertido en el estándar de oro para descubrir y caracterizar las variantes estructurales (VS) en los genomas humanos. Estudios han catalogado decenas de miles de VS por genoma, muchos de los cuales se pierden o se resuelven mal por lecturas cortas. Las técnicas emergentes permiten ahora mapear puntos de ruptura precisos incluso en duplicaciones segmentarias y repeticiones de baja complejidad.
Population Genetics and Evolutionary Studies
Los genomas de referencia de alta calidad generados por las asambleas de larga data están permitiendo análisis genómicos comparativos más precisos entre las poblaciones y las especies. Por ejemplo, en los simios grandes, la secuenciación de lecturas largas ha revelado expansiones específicas de linaje de familias de genes y retrotransposones que son invisibles para los enfoques de lectura corta.
Genómica del cáncer y Biopsia líquida
Las técnicas de lectura prolongada se aplican cada vez más a los genomas del cáncer, donde se producen reorganizaciones masivas, cambios de número de copia y alteraciones epigenéticas. Estudios que utilizan lecturas largas han identificado fusiones genéticas ocultas previamente y ADN circular extracromosómico (ECDNA) que impulsan la oncogenesis. En la biopsia líquida, secuenciación de nanopores del ADN libre de células circulantes (cf.
Desafíos y limitaciones
A pesar de estos avances, la secuenciación de larga distancia enfrenta varios desafíos persistentes. La precisión de base, mientras se mejora, sigue rezagada por plataformas de lectura corta (Illumina’s ⁇ 0.1%) para ciertos contextos, especialmente en los tractos homopolímeros y regiones altamente repetitivas. Los errores de cálculo de base, especialmente a nivel individual, pueden confundir aplicaciones de metiloléculas como phas
La preparación de la biblioteca para lecturas de ultralong requiere ADN de alto peso molecular, que puede ser difícil de obtener de tejido formalizado, parafinado (FFPE) o muestras forenses degradadas. La extracción, fragmentación y daño de ADN durante la extracción reducen la fracción de moléculas realmente largas. Técnicas emergentes en extracción de ADN suave (por ejemplo, usando tapones de agarose o protocolo de adiposa magnética).
Las exigencias informáticas también son no tripuladas. El gran volumen de datos de señal cruda de secuenciadores de nanopore (o los grandes archivos BAM de HiFi) requiere un almacenamiento y potencia de procesamiento sustancial. El cálculo de base en tiempo real, mientras que es posible en una GPU, consume recursos eléctricos y computacionales significativos. Además, el montaje de novo de grandes genomas de lecturas largas sigue siendo una tarea computacionalmente pesada, aunque las mejoras recientes en funcionamiento de los pies y los dos tienen reducidos
Perspectivas y futuras direcciones
Los próximos cinco años prometen nuevos avances en secuenciación de lecturas largas. En el lado hardware, los nuevos nanoporos de estado sólido y sensores de circuito integrado podrían aumentar drásticamente la rentabilidad y reducir costos. Empresas como PacBio están desarrollando sistemas de encuadernación que llevan HiFi al laboratorio clínico, mientras que ONT continúa minimizando sus dispositivos para aplicaciones de campo. En el frente de química, la capacidad de secuenciar modelos más largos (supervitallar)
La integración con la transcripción espacial y la genómica de una célula es otra frontera emergente. La secuenciación de una célula de códigos de barras cDNA o gDNA puede proporcionar información isoform de longitud completa y llamadas de variantes graduales a resolución celular. El trabajo temprano en esta área ha demostrado que los enfoques híbridos que combinan datos de células individuales de lectura larga y lectura corta pueden revelar la eliminación alternativa específica de tipo celular y mutaciones cortas que se pierden por falta.
Finalmente, el cambio hacia los genomas de referencia “pangenomic”, donde se analizan conjuntamente muchas asambleas de alta calidad de larga data de diferentes individuos, alterará fundamentalmente cómo interpretamos la variación genética humana. La capacidad de detectar SVs raras y grandes y estudiar el impacto de las expansiones de repetición en la regulación de genes y la enfermedad se volverá rutinaria a medida que estas técnicas maduran.
Conclusión
Las técnicas emergentes en la secuenciación de larga duración están transformando rápidamente nuestra capacidad para analizar los genomas complejos. A través de los avances en química, hardware y computación, tecnologías como PacBio HiFi y Oxford Nanopore están ofreciendo ahora lecturas precisas y de ultra larga duración que pueden abarcar las características genómicas más recalcitrantes, regiones repetitivas, centromeres y grandes variantes estructurales con una fidelidad sin precedentes.