Mostrando postagens com marcador genoma de gorila. Mostrar todas as postagens
Mostrando postagens com marcador genoma de gorila. Mostrar todas as postagens

segunda-feira, 27 de junho de 2022

 

Montagem de sequência de leitura longa do genoma do gorila

CIÊNCIA
1 de abril de 2016
Vol. 352 , Edição 6281

Melhorando o genoma do gorila

O acesso a genomas completos e de alta qualidade de primatas não humanos também nos ajudará a entender a biologia humana. Gordon et ai. usou a tecnologia de sequenciamento de leitura longa para melhorar os dados do genoma em nosso parente próximo, o gorila. O sequenciamento de um único indivíduo diminuiu a fragmentação de montagem e recuperou genes anteriormente perdidos e loci não codificantes. O mapeamento de sequências de leitura curta de gorilas adicionais ajudou a reconstruir uma sequência de gorilas “pan” documentando a variação genética. A comparação com genomas humanos revelou diferenças específicas da espécie variando em tamanho de uma a milhares de bases de comprimento, incluindo algumas que provavelmente afetarão a regulação dos genes.
Ciência , esta edição p. 10.1126/science.aae0344

Resumo Estruturado

INTRODUÇÃO

A sequência precisa e a montagem dos genomas são fundamentais para nossa compreensão da evolução e da variação genética. Apesar dos avanços na tecnologia de sequenciamento de leitura curta que diminuíram o custo e aumentaram o rendimento, a montagem do genoma inteiro de genomas de mamíferos permanece problemática devido à presença de DNA repetitivo.

JUSTIFICATIVA

O objetivo deste estudo foi sequenciar e montar o genoma do gorila das planícies ocidentais usando principalmente a tecnologia de sequenciamento de molécula única em tempo real (SMRT) e um novo algoritmo de montagem que aproveita as leituras de sequências longas (> 10 kbp). Comparamos especificamente as propriedades desse conjunto com conjuntos de genoma de gorilas que foram gerados usando mais abordagens de leitura de sequência curta de rotina para determinar o valor e o impacto biológico de um conjunto de genoma de leitura longa.

RESULTADOS

Geramos uma sequência shotgun de genoma completo SMRT de 74,8 vezes a partir de DNA de sangue periférico isolado de um gorila de planície ocidental ( Gorilla gorilla gorilla) chamada Susie. Aplicamos um algoritmo de montagem de grafos de string, Falcon, e algoritmo de consenso, Quiver, para gerar um assembly de 3,1 Gbp com um contig N50 de 9,6 Mbp. Dados de sequência de leitura curta de mais seis genomas de gorilas foram mapeados para reduzir erros de indel e melhorar a precisão da montagem final. Estimamos que 98,9% da eucromatina do gorila foi montada em 1854 sequências contig. A montagem representa uma melhoria na contiguidade: >800 vezes em relação à montagem publicada do genoma do gorila e >180 vezes em relação a uma atualização mais recente da montagem do gorila. A maioria das lacunas de sequência estão agora fechadas, aumentando consideravelmente o rendimento de modelos genéticos completos. Estimamos que 87% dos exons ausentes e 94% dos genes incompletos sejam recuperados. Descobrimos que a sequência da maioria das repetições comuns completas é resolvida, com os ganhos mais significativos ocorrendo para os retrotransposons mais longos e ricos em G+C. Embora regiões complexas, como o locus de histocompatibilidade principal, sejam sequenciadas e montadas com precisão, tanto a heterocromatina quanto as duplicações segmentares grandes e de alta identidade não são porque os comprimentos de leitura são insuficientemente longos para atravessar essas estruturas repetitivas. A montagem de leitura longa produz um mapa muito mais fino de variação estrutural até 50 bp de comprimento, facilitando a descoberta de milhares de diferenças de variantes estruturais específicas da linhagem que ocorreram desde a divergência das linhagens humanas e de chimpanzés. Isso inclui a ruptura de genes específicos e a perda de regiões reguladoras previstas entre as duas espécies.

CONCLUSÃO

A montagem do genoma que resulta do uso dos dados de leitura longa fornece uma imagem mais completa do conteúdo do gene, variação estrutural e biologia de repetição, melhorando as inferências genéticas e evolutivas da população. A tecnologia de sequenciamento de leitura longa agora torna prático para laboratórios individuais gerar genomas de referência de alta qualidade para genomas complexos de mamíferos.
Montagem de sequência de leitura longa do genoma do gorila.
A ) Susie, uma fêmea de gorila de planície ocidental, foi usada como amostra de referência para o sequenciamento e montagem do genoma completo [fotografia cortesia de Max Block]. B e C ) Um mapa de árvore representando as diferenças na fragmentação dos conjuntos de genoma de gorilas de leitura longa e leitura curta. Os retângulos são os maiores contigs que compõem cumulativamente 300 Mbp (~10%) da montagem.
ABRIR NO VISUALIZADOR

Abstrato

A sequência e montagem precisas de genomas é um primeiro passo crítico para estudos de variação genética. Geramos uma montagem de alta qualidade do genoma do gorila usando uma única molécula, tecnologia de sequência em tempo real e um algoritmo de montagem de novo de gráfico de string. A nova montagem melhora a contiguidade em duas a três ordens de magnitude em relação a montagens lançadas anteriormente, recuperando 87% dos exons de referência ausentes e modelos de genes incompletos. Embora regiões de grandes duplicações segmentares de alta identidade permaneçam em grande parte não resolvidas, essa montagem abrangente fornece uma nova visão biológica da diversidade genética, variação estrutural, perda de genes e representação de estruturas repetidas dentro do genoma do gorila.

 

Long-read sequence assembly of the gorilla genome

SCIENCE
1 Apr 2016
Vol 352Issue 6281

Improving on the gorilla genome

Access to complete, high-quality genomes of nonhuman primates will also help us understand human biology. Gordon et al. used long-read sequencing technology to improve genome data on our close relative the gorilla. Sequencing from a single individual decreased assembly fragmentation and recovered previously missed genes and noncoding loci. Mapping short-read sequences from additional gorillas helped reconstruct a “pan” gorilla sequence documenting genetic variation. Comparison with human genomes revealed species-specific differences ranging in size from one to thousands of bases in length, including some that are likely to affect gene regulation.
Science, this issue p. 10.1126/science.aae0344

Structured Abstract

INTRODUCTION

The accurate sequence and assembly of genomes is critical to our understanding of evolution and genetic variation. Despite advances in short-read sequencing technology that have decreased cost and increased throughput, whole-genome assembly of mammalian genomes remains problematic because of the presence of repetitive DNA.

RATIONALE

The goal of this study was to sequence and assemble the genome of the western lowland gorilla by using primarily single-molecule, real-time (SMRT) sequencing technology and a novel assembly algorithm that takes advantage of long (>10 kbp) sequence reads. We specifically compare the properties of this assembly to gorilla genome assemblies that were generated by using more routine short sequence read approaches in order to determine the value and biological impact of a long-read genome assembly.

RESULTS

We generated 74.8-fold SMRT whole-genome shotgun sequence from peripheral blood DNA isolated from a western lowland gorilla (Gorilla gorilla gorilla) named Susie. We applied a string graph assembly algorithm, Falcon, and consensus algorithm, Quiver, to generate a 3.1-Gbp assembly with a contig N50 of 9.6 Mbp. Short-read sequence data from an additional six gorilla genomes was mapped so as to reduce indel errors and improve the accuracy of the final assembly. We estimate that 98.9% of the gorilla euchromatin has been assembled into 1854 sequence contigs. The assembly represents an improvement in contiguity: >800-fold with respect to the published gorilla genome assembly and >180-fold with respect to a more recently released upgrade of the gorilla assembly. Most of the sequence gaps are now closed, considerably increasing the yield of complete gene models. We estimate that 87% of the missing exons and 94% of the incomplete genes are recovered. We find that the sequence of most full-length common repeats is resolved, with the most significant gains occurring for the longest and most G+C–rich retrotransposons. Although complex regions such as the major histocompatibility locus are accurately sequenced and assembled, both heterochromatin and large, high-identity segmental duplications are not because read lengths are insufficiently long to traverse these repetitive structures. 
The long-read assembly produces a much finer map of structural variation down to 50 bp in length, facilitating the discovery of thousands of lineage-specific structural variant differences that have occurred since divergence from the human and chimpanzee lineages. This includes the disruption of specific genes and loss of predicted regulatory regions between the two species. We show that use of the new gorilla genome assembly changes estimates of divergence and diversity, resulting in subtle but substantial effects on previous population genetic inferences, such as the timing of species bottlenecks and changes in the effective population size over the course of evolution.

CONCLUSION

The genome assembly that results from using the long-read data provides a more complete picture of gene content, structural variation, and repeat biology, improving population genetic and evolutionary inferences. Long-read sequencing technology now makes it practical for individual laboratories to generate high-quality reference genomes for complex mammalian genomes.
Long-read sequence assembly of the gorilla genome.
(A) Susie, a female Western lowland gorilla, was used as the reference sample for full-genome sequencing and assembly [photograph courtesy of Max Block]. (B and C) A treemaps representing the differences in fragmentation of the long-read and short-read gorilla genome assemblies. The rectangles are the largest contigs that cumulatively make up 300 Mbp (~10%) of the assembly.
OPEN IN VIEWER

Abstract

Accurate sequence and assembly of genomes is a critical first step for studies of genetic variation. We generated a high-quality assembly of the gorilla genome using single-molecule, real-time sequence technology and a string graph de novo assembly algorithm. The new assembly improves contiguity by two to three orders of magnitude with respect to previously released assemblies, recovering 87% of missing reference exons and incomplete gene models. Although regions of large, high-identity segmental duplications remain largely unresolved, this comprehensive assembly provides new biological insight into genetic diversity, structural variation, gene loss, and representation of repeat structures within the gorilla genome. The approach provides a path forward for the routine assembly of mammalian genomes at a level approaching that of the current quality of the human genome.