N
NatiStream
Transcript
Hiển thị

Introduction to Variant Calling and GATK Workflow

This chapter introduces the concept of variant calling on whole genome sequencing data using the GATK best practices workflow. It explains that variant calling starts with sequencing reads and produces a VCF file that stores identified variants. GATK is presented as an industry-standard Java-based toolkit for analyzing next-generation sequencing data, especially human whole genome and exome data. The germline short variant discovery workflow consists of three main steps: data pre-processing, variant calling, and filtering/annotation. Data pre-processing involves quality control, trimming adapters, and mapping reads to a reference genome using BWA-MEM.

Chương này giới thiệu khái niệm gọi biến thể trên dữ liệu giải trình tự toàn bộ hệ gen bằng quy trình thực hành tốt nhất của GATK. Nó giải thích rằng gọi biến thể bắt đầu từ các đoạn đọc giải trình tự và tạo ra tệp VCF lưu trữ các biến thể được xác định. GATK được giới thiệu là một bộ công cụ dựa trên Java tiêu chuẩn ngành để phân tích dữ liệu giải trình tự thế hệ tiếp theo, đặc biệt là dữ liệu toàn bộ hệ gen và exome của người. Quy trình phát hiện biến thể ngắn dòng mầm bao gồm ba bước chính: tiền xử lý dữ liệu, gọi biến thể, và lọc/chú thích. Tiền xử lý dữ liệu bao gồm kiểm soát chất lượng, cắt bỏ adapter, và ánh xạ các đoạn đọc lên hệ gen tham chiếu bằng BWA-MEM.

Music foreign Music all my previous videos we have mainly been focusing on RNA seek or single cell rnacy but in this video we are Switching gears and talking about other type of high throughput data that is a whole genome sequencing so this video we will be talking about variant calling which is a very commonly performed analysis on whole genome sequencing on whole exome

[Nhạc] nước ngoài [Nhạc] tất cả các video trước đây của tôi chúng ta chủ yếu tập trung vào RNA seek hoặc single cell rnacy nhưng trong video này chúng ta đang chuyển hướng và nói về loại dữ liệu thông lượng cao khác đó là giải trình tự toàn bộ hệ gen vì vậy video này chúng ta sẽ nói về variant calling đây là một phân tích rất thường được thực hiện trên giải trình tự toàn bộ hệ gen trên toàn bộ exome

sequencing data so today I want to demonstrate how to perform a variant calling that is called variance on whole genome sequencing data using get K best practice workflow so the aim of uh we're in calling analysis um is to start with sequencing reads and perform some steps to determine what variants are present in these reads so basically the intuition behind this analysis is to generate a

Dữ liệu giải trình tự vì vậy hôm nay tôi muốn trình diễn cách thực hiện variant calling được gọi là variance trên dữ liệu giải trình tự toàn bộ hệ gen bằng cách sử dụng quy trình thực hành tốt nhất của get K vì vậy mục tiêu của phân tích uh chúng ta đang gọi là phân tích calling um là bắt đầu với các reads giải trình tự và thực hiện một số bước để xác định những biến thể nào có mặt trong các reads này vì vậy về cơ bản trực giác đằng sau phân tích này là tạo ra một

file a variant call format file that is a VCF file that stores variants that are present in the data so the diagram at the bottom is like a high level overview of the steps that are typically performed in a variant calling analysis so the DNA sample is First Fed into a sequencer which gives out reads which are stored in faster or fast queue format and these reads are aligned to a

Tệp định dạng variant call tức là tệp VCF lưu trữ các biến thể có mặt trong dữ liệu vì vậy sơ đồ ở dưới cùng giống như tổng quan cấp cao về các bước thường được thực hiện trong phân tích variant calling vì vậy mẫu DNA trước tiên được đưa vào máy giải trình tự để tạo ra các reads được lưu trữ ở định dạng faster hoặc fast queue và những reads này được căn chỉnh với một

reference genome so we get align reads which are in bam or Sam file format and using these aligned reads um we employ a variant calling algorithm that essentially calls variance identifies these variants and store them in a file called variant call format file that is a VCF file so today we are going to start with sequencing reads and we are going to perform various steps go into

Hệ gen tham chiếu vì vậy chúng ta nhận được các reads đã căn chỉnh ở định dạng tệp bam hoặc Sam và sử dụng những reads đã căn chỉnh này um chúng ta áp dụng một thuật toán variant calling mà về cơ bản gọi variance xác định những biến thể này và lưu trữ chúng trong một tệp gọi là tệp định dạng variant call tức là tệp VCF vì vậy hôm nay chúng ta sẽ bắt đầu với các reads giải trình tự và chúng ta sẽ thực hiện nhiều bước khác nhau đi vào

the details of each of these steps and ultimately call variance in our data and generate a VCF file So since today we are using a gadki best practice workflow I want to talk about what is Gad K so Gad K stands for genome analysis toolkit and is the industry standard toolkit for analyzing and identifying variants and get is basically designed for whole uh human

Chi tiết của từng bước này và cuối cùng gọi variance trong dữ liệu của chúng ta và tạo ra một tệp VCF Vì vậy vì hôm nay chúng ta đang sử dụng quy trình thực hành tốt nhất của gadki tôi muốn nói về Gad K là gì vì vậy Gad K là viết tắt của genome analysis toolkit và là bộ công cụ tiêu chuẩn công nghiệp để phân tích và xác định các biến thể và get về cơ bản được thiết kế cho toàn bộ uh người

whole genome and whole exome sequencing data so gadki essentially is a package of command line tools that are written in Java and these tools they have plethora of tools and these tools can be used individually or can be chained together into complete workflows and these tools can be used for Next Generation sequencing data processing genotyping and variant Discovery variant

Dữ liệu giải trình tự toàn bộ hệ gen và toàn bộ exome vì vậy gadki về cơ bản là một gói các công cụ dòng lệnh được viết bằng Java và những công cụ này chúng có vô số công cụ và những công cụ này có thể được sử dụng riêng lẻ hoặc có thể được xâu chuỗi với nhau thành các quy trình hoàn chỉnh và những công cụ này có thể được sử dụng cho xử lý dữ liệu giải trình tự thế hệ tiếp theo genotyping và khám phá biến thể variant

filtering and evaluation gadke also provides end-to-end workflows which are gadki best practice uh workflows which are tailored for specific use cases and gadke is very evolving and adapting to emerging sequencing Technologies and has a very active user community and extensive amount of documentation there has never been a time or an occasion where I haven't found a solution to a problem on

Lọc và đánh giá gadke cũng cung cấp các quy trình đầu cuối đó là các quy trình thực hành tốt nhất của gadki được điều chỉnh cho các trường hợp sử dụng cụ thể và gadke rất phát triển và thích ứng với các công nghệ giải trình tự mới nổi và có một cộng đồng người dùng rất năng động và lượng tài liệu phong phú chưa bao giờ có thời điểm hay dịp nào mà tôi không tìm thấy giải pháp cho một vấn đề trên

gadki Forum or in the documentation and so today for this demonstration I decided to follow and demonstrate a best practice get key workflow in the previous video where we were discussing a VCF file format we did take a look at uh how different types of variants were represented in a VCF file so we took a look at how a snip or an insertion or a deletion or even a

Diễn đàn Gadki hoặc trong tài liệu và vì vậy hôm nay cho phần trình diễn này tôi quyết định làm theo và trình diễn một quy trình get key thực hành tốt nhất trong video trước nơi chúng ta đang thảo luận về định dạng tệp VCF chúng ta đã xem xét uh cách các loại biến thể khác nhau được biểu diễn trong tệp VCF vì vậy chúng ta đã xem cách một snip hoặc một insertion hoặc một deletion hoặc thậm chí một

structural variant was represented in a VCF file so variant is nothing but it's an alteration in a DNA sequence and this alteration can be benign or pathogenic or of unknown significance so one of the criteria to determine the various steps you would essentially perform in a variant calling analysis would be dependent on whether you want to call germline mutations or somatic

Biến thể cấu trúc được biểu diễn trong tệp VCF vì vậy biến thể không gì khác ngoài một sự thay đổi trong trình tự DNA và sự thay đổi này có thể lành tính hoặc gây bệnh hoặc có ý nghĩa chưa biết vì vậy một trong những tiêu chí để xác định các bước khác nhau mà bạn về cơ bản sẽ thực hiện trong phân tích variant calling sẽ phụ thuộc vào việc bạn muốn gọi đột biến germline hay somatic

mutations whether the variant is a germline variant that you're interested or a somatic germline variants or mutations are the ones that are inherited from the parents via the germ cell that is the sperm and the oocyte whereas somatic mutations are the mutations that are acquired but are not inherited so to give you an example of a somatic mutation or let's say a variant

Đột biến liệu biến thể là biến thể germline mà bạn quan tâm hay biến thể somatic các biến thể hoặc đột biến germline là những biến thể được di truyền từ cha mẹ qua tế bào mầm tức là tinh trùng và trứng trong khi đột biến somatic là những đột biến mắc phải nhưng không được di truyền vì vậy để cho bạn một ví dụ về đột biến somatic hoặc giả sử một biến thể

is present in a stem cell in an infant so all the cells that are derived from the stem cell will have that variant but that variant will not be present on all in all the other cells in that infant in order to distinguish whether the mutation or a variant is germline or somatic one has to sequence the tumor sample along with a matched normal so consider an example of an individual

Có mặt trong một tế bào gốc ở một đứa trẻ sơ sinh vì vậy tất cả các tế bào có nguồn gốc từ tế bào gốc sẽ có biến thể đó nhưng biến thể đó sẽ không có mặt trên tất cả các tế bào khác trong đứa trẻ đó để phân biệt liệu đột biến hoặc biến thể là germline hay somatic người ta phải giải trình tự mẫu khối u cùng với một mẫu bình thường tương ứng hãy xem xét một ví dụ về một cá nhân

with lung cancer if we want to identify somatic mutations from this individual along with the tumor biopsy from the lung one has to also get a matched normal from the blood so um germline mutations are also involved in pathogenesis but it has been found that somatic variants are typically more involved in a disease and hence they are of special interest without having a

Bị ung thư phổi nếu chúng ta muốn xác định các đột biến somatic từ cá nhân này cùng với sinh thiết khối u từ phổi người ta cũng phải lấy một mẫu bình thường tương ứng từ máu vì vậy um các đột biến germline cũng liên quan đến sinh bệnh học nhưng người ta đã phát hiện ra rằng các biến thể somatic thường liên quan nhiều hơn đến một bệnh và do đó chúng được đặc biệt quan tâm mà không có một

matched normal one cannot distinguish whether the variant is germline or somatic because every genome contains tens of thousands of mutations and so a match normal from the same donor is necessary to identify whether the mutation is germline or somatic so for today's demonstration we are going to call germline variants and we are going to use germline short variant

Mẫu bình thường tương ứng người ta không thể phân biệt liệu biến thể là germline hay somatic bởi vì mỗi hệ gen chứa hàng chục nghìn đột biến và vì vậy một mẫu bình thường tương ứng từ cùng một người hiến tặng là cần thiết để xác định liệu đột biến là germline hay somatic vì vậy cho phần trình diễn hôm nay chúng ta sẽ gọi các biến thể germline và chúng ta sẽ sử dụng quy trình thực hành tốt nhất của gadki khám phá biến thể ngắn germline

Discovery gadki best practice workflow I will add the link to this workflow in the description section below so basically this workflow has three steps the first step is data pre-processing which mainly involves getting analysis ready reads uh and using these analysis ready reads we call a variant calling algorithm to call variance which is the second step and once we have the

Tôi sẽ thêm liên kết đến quy trình này trong phần mô tả bên dưới vì vậy về cơ bản quy trình này có ba bước bước đầu tiên là tiền xử lý dữ liệu chủ yếu liên quan đến việc lấy các reads sẵn sàng cho phân tích uh và sử dụng những reads sẵn sàng cho phân tích này chúng ta gọi một thuật toán variant calling để gọi variance đây là bước thứ hai và một khi chúng ta có

variance called we use these variants and filter them and annotate and predict the effects of these variants on genes so today we are going to mainly focus on various steps that go in data preprocessing and calling variance on analysis ready reads using gatkey's haplotype caller and calling raw Snips and indels uh once you have called this these raw variants you can filter and

Variance được gọi chúng ta sử dụng những biến thể này và lọc chúng và chú thích và dự đoán tác động của những biến thể này lên các gen vì vậy hôm nay chúng ta sẽ chủ yếu tập trung vào các bước khác nhau trong tiền xử lý dữ liệu và gọi variance trên các reads sẵn sàng cho phân tích bằng cách sử dụng haplotype caller của gatkey và gọi các Snips và indels thô uh một khi bạn đã gọi những biến thể thô này bạn có thể lọc và

annotate them and there are various tools like snip F or vep that can be used which annotates and predict the effects of these variants however for today's demonstration we are going to just stick with the first two steps so talking about data preprocessing steps we start with raw unmapped reads A in fastq files and we first perform quality control making sure that there

Chú thích chúng và có nhiều công cụ khác nhau như snip F hoặc vep có thể được sử dụng để chú thích và dự đoán tác động của những biến thể này tuy nhiên cho phần trình diễn hôm nay chúng ta sẽ chỉ dừng lại ở hai bước đầu tiên vì vậy nói về các bước tiền xử lý dữ liệu chúng ta bắt đầu với các reads thô chưa được ánh xạ A trong các tệp fastq và chúng ta đầu tiên thực hiện kiểm soát chất lượng đảm bảo rằng không

are no adapter sequences if there are then essentially we would trim them out and make sure that everything else with the reads um checks out I mean there are no major issues with the reads flag and once the quality control checks out we move on to mapping these reads to a reference genome and for that we need an algorithm to map the reads to the reference genome and here we are going

Có các trình tự adapter nếu có thì về cơ bản chúng ta sẽ cắt bỏ chúng và đảm bảo rằng mọi thứ khác với các reads um đều ổn ý tôi là không có vấn đề lớn nào với cờ reads và một khi kiểm tra chất lượng đạt yêu cầu chúng ta chuyển sang ánh xạ những reads này với một hệ gen tham chiếu và để làm điều đó chúng ta cần một thuật toán để ánh xạ các reads với hệ gen tham chiếu và ở đây chúng ta sẽ

to use pwa mem so bwa stands for Burrows wheeler aligner and it's basically used to map reads against a reference genome and bwa consists of three algorithms bwa backtrack bwa SW and bwa mem and each of these algorithms are designed for specific purposes so bwa backtrack is designed for Illumina sequence reads up to 100 base pairs bwa SW and mem are designed for sequences for longer

Sử dụng pwa mem vì vậy bwa là viết tắt của Burrows wheeler aligner và về cơ bản nó được sử dụng để ánh xạ các reads với một hệ gen tham chiếu và bwa bao gồm ba thuật toán bwa backtrack bwa SW và bwa mem và mỗi thuật toán này được thiết kế cho các mục đích cụ thể vì vậy bwa backtrack được thiết kế cho các reads giải trình tự Illumina lên đến 100 cặp base bwa SW và mem được thiết kế cho các trình tự dài hơn

sequences ranging from 70 base pairs to 1mb we are going to go with bwa meme because it is recommended for high quality queries as it is faster and more accurate in addition to that it can also perform gapped alignment for identification of indels and it can effectively map paired entries it can also perform soft clipping that is it can clip ends if they do not match and

Các trình tự từ 70 cặp base đến 1mb chúng ta sẽ chọn bwa meme vì nó được khuyến nghị cho các truy vấn chất lượng cao vì nó nhanh hơn và chính xác hơn ngoài ra nó cũng có thể thực hiện căn chỉnh có khoảng trống để xác định các indels và nó có thể ánh xạ hiệu quả các cặp reads nó cũng có thể thực hiện soft clipping tức là nó có thể cắt các đầu nếu chúng không khớp và

it has a moderate memory requirement so when aligning raw reads to a reference genome using an aligner like bwa mem uh the reads are the Align reads are stored in a Sam or bam file and sometimes the Sam of the BAM file will miss certain information the information we are talking about here is a read group so basically the term read group refers to a set of read that are

Nó có yêu cầu bộ nhớ vừa phải vì vậy khi căn chỉnh các reads thô với một hệ gen tham chiếu bằng cách sử dụng một aligner như bwa mem uh các reads là các reads đã căn chỉnh được lưu trữ trong tệp Sam hoặc bam và đôi khi tệp Sam của BAM sẽ thiếu một số thông tin nhất định thông tin chúng ta đang nói ở đây là một read group vì vậy về cơ bản thuật ngữ read group đề cập đến một tập hợp các read được

1 / 6