Building a large language model begins with pre-training on massive internet text datasets. Raw web data must be filtered, deduplicated, and cleaned before it can be used to train neural networks.
Việc xây dựng một mô hình ngôn ngữ lớn bắt đầu bằng tiền huấn luyện trên các tập dữ liệu văn bản khổng lồ từ internet. Dữ liệu web thô phải được lọc, loại bỏ trùng lặp và làm sạch trước khi có thể được sử dụng để huấn luyện mạng nơ-ron.
hi everyone so I've wanted to make this video for a while it is a comprehensive but General audience introduction to large language models like Chachi PT and what I'm hoping to achieve in this video is to give you kind of mental models for thinking through what it is that this tool is it is obviously magical and amazing in some respects it's uh really good at some things not very good at
Chào mọi người, tôi đã muốn làm video này từ lâu rồi. Đây là một giới thiệu toàn diện nhưng dành cho khán giả phổ thông về các mô hình ngôn ngữ lớn như ChatGPT, và điều tôi hy vọng đạt được trong video này là cung cấp cho các bạn những mô hình tư duy để suy nghĩ về công cụ này thực chất là gì. Rõ ràng nó rất kỳ diệu và tuyệt vời ở một số khía cạnh, nó thực sự giỏi ở một số thứ và không giỏi lắm ở
other things and there's also a lot of sharp edges to be aware of so what is behind this text box you can put anything in there and press enter but uh what should we be putting there and what are these words generated back how does this work and what are you talking to exactly so I'm hoping to get at all those topics in this video we're going to go through the entire pipeline of how
những thứ khác, và cũng có rất nhiều góc cạnh sắc bén cần lưu ý. Vậy điều gì đằng sau ô văn bản này? Bạn có thể đặt bất cứ thứ gì vào đó và nhấn enter, nhưng chúng ta nên đặt gì vào đó và những từ này được tạo ra như thế nào? Cách nó hoạt động ra sao và chính xác thì bạn đang nói chuyện với cái gì? Tôi hy vọng sẽ đề cập đến tất cả những chủ đề đó trong video này. Chúng ta sẽ đi qua toàn bộ quy trình cách
this stuff is built but I'm going to keep everything uh sort of accessible to a general audience so let's take a look at first how you build something like chpt and along the way I'm going to talk about um you know some of the sort of cognitive psychological implications of the tools okay so let's build Chachi PT so there's going to be multiple stages arranged sequentially the first stage is
những thứ này được xây dựng, nhưng tôi sẽ giữ mọi thứ ở mức dễ tiếp cận với khán giả phổ thông. Vậy hãy cùng xem trước tiên cách bạn xây dựng một thứ như ChatGPT, và trong suốt quá trình đó tôi sẽ nói về một số hàm ý tâm lý nhận thức của những công cụ này. Được rồi, vậy hãy xây dựng ChatGPT. Sẽ có nhiều giai đoạn được sắp xếp tuần tự. Giai đoạn đầu tiên được
called the pre-training stage and the first step of the pre-training stage is to download and process the internet now to get a sense of what this roughly looks like I recommend looking at this URL here so um this company called hugging face uh collected and created and curated this data set called Fine web and they go into a lot of detail on this block post on how they
gọi là giai đoạn tiền huấn luyện, và bước đầu tiên của giai đoạn tiền huấn luyện là tải xuống và xử lý internet. Để hiểu đại khái nó trông như thế nào, tôi khuyên bạn nên xem URL này. Công ty có tên Hugging Face đã thu thập, tạo ra và tuyển chọn bộ dữ liệu này gọi là FineWeb, và họ đi vào rất nhiều chi tiết trong bài đăng blog này về cách họ
constructed the fine web data set and all of the major llm providers like open AI anthropic and Google and so on will have some equivalent internally of something like the fine web data set so roughly what are we trying to achieve here we're trying to get ton of text from the internet from publicly available sources so we're trying to have a huge quantity of very high
xây dựng bộ dữ liệu FineWeb, và tất cả các nhà cung cấp LLM lớn như OpenAI, Anthropic, Google, v.v. đều sẽ có thứ tương đương nội bộ giống như bộ dữ liệu FineWeb. Vậy đại khái chúng ta đang cố đạt được gì ở đây? Chúng ta đang cố lấy một lượng lớn văn bản từ internet từ các nguồn công khai, nên chúng ta đang cố có một lượng khổng lồ các tài liệu có chất lượng
quality documents and we also want very large diversity of documents because we want to have a lot of knowledge inside these models so we want large diversity of high quality documents and we want many of them and achieving this is uh quite complicated and as you can see here takes multiple stages to do well so let's take a look at what some of these stages look like in a bit for now I'd
rất cao, và chúng ta cũng muốn sự đa dạng rất lớn của các tài liệu vì chúng ta muốn có nhiều kiến thức bên trong những mô hình này. Vậy chúng ta muốn sự đa dạng lớn của các tài liệu chất lượng cao và chúng ta muốn có nhiều tài liệu như vậy, và việc đạt được điều này khá phức tạp, như bạn có thể thấy ở đây, cần nhiều giai đoạn để làm tốt. Vậy hãy cùng xem một số giai đoạn này trông như thế nào. Hiện tại tôi
like to just like to note that for example the fine web data set which is fairly representative what you would see in a production grade application actually ends up being only about 44 terabyt of dis space um you can get a USB stick for like a terabyte very easily or I think this could fit on a single hard drive almost today so this is not a huge amount of data at the end
chỉ muốn lưu ý rằng, ví dụ, bộ dữ liệu FineWeb, khá đại diện cho những gì bạn sẽ thấy trong một ứng dụng cấp sản xuất, thực ra cuối cùng chỉ khoảng 44 terabyte dung lượng đĩa. Bạn có thể mua một USB khoảng một terabyte rất dễ dàng, hoặc tôi nghĩ thứ này gần như có thể vừa trên một ổ cứng duy nhất ngày nay. Vậy đây không phải là lượng dữ liệu khổng lồ vào cuối
of the day even though the internet is very large we're working with text and we're also filtering it aggressively so we end up with about 44 terabytes in this example so let's take a look at uh kind of what this data looks like and what some of these stages uh also are so the starting point for a lot of these efforts and something that contributes most of the data by the end of it is
cùng, mặc dù internet rất lớn, chúng ta đang làm việc với văn bản và cũng đang lọc nó một cách quyết liệt, nên cuối cùng chúng ta có khoảng 44 terabyte trong ví dụ này. Vậy hãy cùng xem dữ liệu này trông như thế nào và một số giai đoạn này là gì. Điểm khởi đầu cho nhiều nỗ lực này và là thứ đóng góp phần lớn dữ liệu vào cuối quá trình là
Data from common crawl so common craw is an organization that has been basically scouring the internet since 2007 so as of 2024 for example common CW has indexed 2.7 billion web pages uh and uh they have all these crawlers going around the internet and what you end up doing basically is you start with a few seed web pages and then you follow all the links and you just
dữ liệu từ Common Crawl. Common Crawl là một tổ chức về cơ bản đã quét internet từ năm 2007. Ví dụ tính đến năm 2024, Common Crawl đã lập chỉ mục 2,7 tỷ trang web, và họ có tất cả những trình thu thập dữ liệu này đi khắp internet, và về cơ bản điều bạn làm là bắt đầu với một vài trang web hạt giống rồi theo tất cả các liên kết và bạn cứ
keep following links and you keep indexing all the information and you end up with a ton of data of the internet over time so this is usually the starting point for a lot of the uh for a lot of these efforts now this common C data is quite raw and is filtered in many different ways so here they Pro they document this is the same diagram they document a little
tiếp tục theo liên kết và bạn tiếp tục lập chỉ mục tất cả thông tin và cuối cùng bạn có một lượng lớn dữ liệu của internet theo thời gian. Vậy đây thường là điểm khởi đầu cho nhiều nỗ lực này. Giờ dữ liệu Common Crawl này khá thô và được lọc theo nhiều cách khác nhau, nên ở đây họ ghi lại, đây là cùng một sơ đồ, họ ghi lại một chút
bit the kind of processing that happens in these stages so the first thing here is something called URL filtering so what that is referring to is that there's these block lists of uh basically URLs that are or domains that uh you don't want to be getting data from so usually this includes things like U malware websites spam websites marketing websites uh racist websites adult sites and things
về kiểu xử lý diễn ra trong những giai đoạn này. Thứ đầu tiên ở đây là thứ gọi là lọc URL. Điều đó đề cập đến việc có những danh sách chặn về cơ bản là các URL hoặc tên miền mà bạn không muốn lấy dữ liệu từ đó. Thường thì điều này bao gồm những thứ như trang web chứa mã độc, trang web spam, trang web tiếp thị, trang web phân biệt chủng tộc, trang web người lớn và những thứ
like that so there's a ton of different types of websites that are just eliminated at this stage because we don't want them in our data set um the second part is text extraction you have to remember that all these web pages this is the raw HTML of these web pages that are being saved by these crawlers so when I go to inspect here this is what the raw HTML actually
tương tự. Vậy có vô số loại trang web chỉ bị loại bỏ ở giai đoạn này vì chúng ta không muốn chúng trong bộ dữ liệu của mình. Phần thứ hai là trích xuất văn bản. Bạn phải nhớ rằng tất cả những trang web này, đây là HTML thô của những trang web này được các trình thu thập lưu lại, nên khi tôi vào kiểm tra ở đây, đây là những gì HTML thô thực sự
looks like you'll notice that it's got all this markup uh like lists and stuff like that and there's CSS and all this kind of stuff so this is um computer code almost for these web pages but what we really want is we just want this text right we just want the text of this web page and we don't want the navigation and things like that so there's a lot of filtering and processing uh and heris
trông như thế nào. Bạn sẽ nhận thấy nó có tất cả những thẻ đánh dấu này như danh sách và những thứ tương tự, và có CSS và đủ thứ như vậy. Vậy đây gần như là mã máy tính cho những trang web này, nhưng thứ chúng ta thực sự muốn chỉ là văn bản này, phải không? Chúng ta chỉ muốn văn bản của trang web này và chúng ta không muốn phần điều hướng và những thứ như vậy. Nên có rất nhiều bước lọc và xử lý và các
that go into uh adequately filtering for just their uh good content of these web pages the next stage here is language filtering so for example fine web filters uh using a language classifier they try to guess what language every single web page is in and then they only keep web pages that have more than 65% of English as an example and so you can get a sense that
phương pháp để lọc đầy đủ chỉ lấy nội dung tốt của những trang web này. Giai đoạn tiếp theo ở đây là lọc ngôn ngữ. Ví dụ, FineWeb lọc bằng một bộ phân loại ngôn ngữ, họ cố đoán mỗi trang web đang ở ngôn ngữ nào và sau đó họ chỉ giữ lại những trang web có hơn 65% là tiếng Anh, như một ví dụ. Và bạn có thể hình dung rằng
this is like a design decision that different companies can uh can uh take for themselves what fraction of all different types of languages are we going to include in our data set because for example if we filter out all of the Spanish as an example then you might imagine that our model later will not be very good at Spanish because it's just never seen that much data of that
đây là một quyết định thiết kế mà các công ty khác nhau có thể tự đưa ra cho mình: chúng ta sẽ đưa bao nhiêu phần trăm của các loại ngôn ngữ khác nhau vào bộ dữ liệu của mình, bởi vì ví dụ nếu chúng ta lọc bỏ hết tiếng Tây Ban Nha, thì bạn có thể tưởng tượng rằng mô hình của chúng ta sau này sẽ không giỏi tiếng Tây Ban Nha vì nó chưa bao giờ thấy nhiều dữ liệu của ngôn ngữ
language and so different companies can focus on multilingual performance to uh to a different degree as an example so fine web is quite focused on English and so their language model if they end up training one later will be very good at English but not may be very good at other languages after language filtering there's a few other filtering steps and D duplication and things like that um
đó. Và vì vậy các công ty khác nhau có thể tập trung vào hiệu suất đa ngôn ngữ ở mức độ khác nhau, như một ví dụ. Vậy FineWeb khá tập trung vào tiếng Anh, và do đó mô hình ngôn ngữ của họ, nếu họ huấn luyện một mô hình sau này, sẽ rất giỏi tiếng Anh nhưng có thể không giỏi lắm ở các ngôn ngữ khác. Sau khi lọc ngôn ngữ, có một vài bước lọc khác và khử trùng lặp và những thứ tương tự.
finishing with for example the pii removal this is personally identifiable information so as an example addresses Social Security numbers and things like that you would try to detect them and you would try to filter out those kinds of web pages from the data set as well so there's a lot of stages here and I won't go into full detail but it is a fairly extensive part of the
Kết thúc bằng ví dụ như loại bỏ PII. Đây là thông tin nhận dạng cá nhân, ví dụ như địa chỉ, số An sinh xã hội và những thứ tương tự. Bạn sẽ cố phát hiện chúng và cố lọc bỏ những loại trang web đó khỏi bộ dữ liệu. Vậy có rất nhiều giai đoạn ở đây và tôi sẽ không đi vào chi tiết đầy đủ, nhưng đây là một phần khá mở rộng của
pre-processing and you end up with for example the fine web data set so when you click in on it uh you can see some examples here of what this actually ends up looking like and anyone can download this on the huging phase web page and so here are some examples of the final text that ends up in the training set so this is some article about tornadoes in 2012 um so there's some t tadoes in 2020
quá trình tiền xử lý, và cuối cùng bạn có ví dụ như bộ dữ liệu FineWeb. Khi bạn nhấp vào nó, bạn có thể thấy một số ví dụ ở đây về những gì nó thực sự trông như thế nào, và bất kỳ ai cũng có thể tải xuống trên trang web Hugging Face. Và đây là một số ví dụ về văn bản cuối cùng nằm trong tập huấn luyện. Đây là một bài báo về lốc xoáy năm 2012, có một số trận lốc xoáy vào năm 2020
in 2012 and what happened uh this next one is something about did you know you have two little yellow 9vt battery sized adrenal glands in your body okay so this is some kind of a odd medical article so just think of these as basically uh web pages on the internet filtered just for the text in various ways and now we have a ton of text 40 terabytes off it and that now is the
và 2012 và những gì đã xảy ra. Cái tiếp theo là về việc bạn có biết bạn có hai tuyến thượng thận nhỏ cỡ viên pin 9V màu vàng trong cơ thể mình không. Được rồi, vậy đây là một bài báo y khoa kỳ lạ nào đó. Vậy chỉ cần nghĩ về những thứ này về cơ bản là các trang web trên internet được lọc chỉ lấy văn bản theo nhiều cách khác nhau, và giờ chúng ta có một lượng lớn văn bản, 40 terabyte của nó, và đó giờ là
starting point for the next step of this stage now I wanted to give you an intuitive sense of where we are right now so I took the first 200 web pages here and remember we have tons of them and I just take all that text and I just put it all together concatenate it and so this is what we end up with we just get this just raw text raw internet text and there's a ton of it even in
điểm khởi đầu cho bước tiếp theo của giai đoạn này. Giờ tôi muốn cho bạn một cảm giác trực quan về việc chúng ta đang ở đâu. Tôi đã lấy 200 trang web đầu tiên ở đây, và nhớ rằng chúng ta có vô số trang, và tôi chỉ lấy tất cả văn bản đó và ghép tất cả lại với nhau, nối lại, và đây là những gì chúng ta có được. Chúng ta chỉ có văn bản thô này, văn bản internet thô, và có rất nhiều, ngay cả trong
these 200 web pages so I can continue zooming out here and we just have this like massive tapestry of Text data and this text data has all these p patterns and what we want to do now is we want to start training neural networks on this data so the neural networks can internalize and model how this text flows right so we just have this giant texture of text and now we want to get
200 trang web này. Tôi có thể tiếp tục thu nhỏ ở đây và chúng ta chỉ có tấm thảm khổng lồ này của dữ liệu văn bản, và dữ liệu văn bản này có tất cả những mẫu này, và điều chúng ta muốn làm bây giờ là bắt đầu huấn luyện mạng nơ-ron trên dữ liệu này để mạng nơ-ron có thể tiếp thu và mô hình hóa cách văn bản này diễn ra. Vậy chúng ta chỉ có tấm thảm văn bản khổng lồ này và giờ chúng ta muốn có
neural Nets that mimic it okay now before we plug text into neural networks we have to decide how we're going to represent this text uh and how we're going to feed it in now the way our technology works for these neuron Lots is that they expect a one-dimensional sequence of symbols and they want a finite set of symbols that are possible and so we have to decide what are the symbols and then we
các mạng nơ-ron bắt chước nó. Được rồi, giờ trước khi đưa văn bản vào mạng nơ-ron, chúng ta phải quyết định cách biểu diễn văn bản này và cách đưa nó vào. Cách công nghệ của chúng ta hoạt động cho những mạng nơ-ron này là chúng mong đợi một chuỗi ký hiệu một chiều và chúng muốn một tập hợp hữu hạn các ký hiệu khả dĩ. Vậy chúng ta phải quyết định các ký hiệu là gì và sau đó chúng ta