A large language model like Llama 2 70B is essentially two files: a parameters file and code to run it. The parameters file, which is a lossy compression of internet text, is obtained through expensive training on a huge GPU cluster with a large dataset. Model inference is computationally cheap compared to training. The neural network predicts the next word, which is related to compression, and during inference it generates text by sampling. The Transformer architecture is well understood mathematically, but the function of billions of parameters is largely inscrutable.
Một mô hình ngôn ngữ lớn như Llama 2 70B về cơ bản là hai tệp: một tệp tham số và mã để chạy nó. Tệp tham số, là một bản nén mất mát của văn bản internet, thu được thông qua quá trình huấn luyện tốn kém trên một cụm GPU lớn với một tập dữ liệu lớn. Suy luận mô hình có chi phí tính toán thấp so với huấn luyện. Mạng nơ-ron dự đoán từ tiếp theo, liên quan đến nén, và trong quá trình suy luận, nó tạo ra văn bản bằng cách lấy mẫu. Kiến trúc Transformer được hiểu rõ về mặt toán học, nhưng chức năng của hàng tỷ tham số phần lớn không thể hiểu được.
hi everyone so recently I gave a 30-minute talk on large language models just kind of like an intro talk um unfortunately that talk was not recorded but a lot of people came to me after the talk and they told me that uh they really liked the talk so I would just I thought I would just re-record it and basically put it up on YouTube so here we go the busy person's intro to large
Xin chào mọi người, gần đây tôi đã có một bài nói chuyện 30 phút về các mô hình ngôn ngữ lớn, kiểu như một bài giới thiệu. Tiếc là bài nói đó không được ghi lại, nhưng nhiều người đã đến gặp tôi sau đó và nói rằng họ rất thích bài nói. Vì vậy, tôi nghĩ mình sẽ ghi lại và đăng lên YouTube. Vậy chúng ta bắt đầu: Giới thiệu về mô hình ngôn ngữ lớn dành cho người bận rộn.
language models director Scott okay so let's begin first of all what is a large language model really well a large language model is just two files right um there will be two files in this hypothetical directory so for example working with a specific example of the Llama 270b model this is a large language model released by meta Ai and this is basically the Llama series of
Giám đốc mô hình ngôn ngữ Scott. Được rồi, hãy bắt đầu. Trước hết, mô hình ngôn ngữ lớn thực sự là gì? Một mô hình ngôn ngữ lớn chỉ là hai tệp. Sẽ có hai tệp trong thư mục giả định này. Ví dụ, làm việc với một ví dụ cụ thể là mô hình Llama 2 70B, đây là một mô hình ngôn ngữ lớn do Meta AI phát hành, thuộc dòng mô hình Llama.
language models the second iteration of it and this is the 70 billion parameter model of uh of this series so there's multiple models uh belonging to the Llama 2 Series uh 7 billion um 13 billion 34 billion and 70 billion is the biggest one now many people like this model specifically because it is probably today the most powerful open weights model so basically the weights
Phiên bản thứ hai của nó, và đây là mô hình 70 tỷ tham số của dòng này. Có nhiều mô hình thuộc dòng Llama 2: 7 tỷ, 13 tỷ, 34 tỷ và 70 tỷ là lớn nhất. Nhiều người thích mô hình này vì nó có lẽ là mô hình mã nguồn mở mạnh nhất hiện nay. Các trọng số, kiến trúc và bài báo đều được Meta công bố, vì vậy bất kỳ ai cũng có thể dễ dàng làm việc với mô hình này.
and the architecture and a paper was all released by meta so anyone can work with this model very easily uh by themselves uh this is unlike many other language models that you might be familiar with for example if you're using chat GPT or something like that uh the model architecture was never released it is owned by open aai and you're allowed to use the language model through a web
Điều này khác với nhiều mô hình ngôn ngữ khác mà bạn có thể quen thuộc, ví dụ như ChatGPT. Kiến trúc mô hình chưa bao giờ được công bố, nó thuộc sở hữu của OpenAI và bạn chỉ được sử dụng mô hình qua giao diện web, nhưng không thực sự có quyền truy cập vào mô hình đó. Trong trường hợp này, mô hình Llama 2 70B chỉ là hai tệp trên hệ thống tệp của bạn: tệp tham số và mã chạy các tham số đó.
interface but you don't have actually access to that model so in this case the Llama 270b model is really just two files on your file system the parameters file and the Run uh some kind of a code that runs those parameters so the parameters are basically the weights or the parameters of this neural network that is the language model we'll go into that in a bit because this is a 70 billion
Các tham số về cơ bản là trọng số hoặc tham số của mạng nơ-ron, là mô hình ngôn ngữ. Chúng ta sẽ đi sâu vào vấn đề đó một chút. Vì đây là mô hình 70 tỷ tham số, mỗi tham số được lưu trữ dưới dạng 2 byte, do đó tệp tham số có kích thước 140 gigabyte. Đó là 2 byte vì đây là số float 16. Ngoài các tham số này, bạn cũng cần một đoạn mã để chạy mạng nơ-ron, và đoạn mã này được triển khai trong tệp run.
parameter model uh every one of those parameters is stored as 2 bytes and so therefore the parameters file here is 140 gigabytes and it's two bytes because this is a float 16 uh number as the data type now in addition to these parameters that's just like a large list of parameters uh for that neural network you also need something that runs that neural network and this piece of code is
Đây có thể là tệp C hoặc Python hoặc bất kỳ ngôn ngữ lập trình nào khác. Nó có thể được viết bằng bất kỳ ngôn ngữ nào, nhưng C là một ngôn ngữ rất đơn giản để minh họa. Chỉ cần khoảng 500 dòng C, không có phụ thuộc nào khác, để triển khai kiến trúc mạng nơ-ron và sử dụng các tham số để chạy mô hình.
implemented in our run file now this could be a C file or a python file or any other programming language really uh it can be written any arbitrary language but C is sort of like a very simple language just to give you a sense and uh it would only require about 500 lines of C with no other dependencies to implement the uh neural network architecture uh and that uses basically
Vậy chỉ có hai tệp này. Bạn có thể lấy hai tệp này và dùng MacBook của mình. Đây là một gói hoàn toàn độc lập, tất cả những gì cần thiết. Bạn không cần kết nối internet hay bất cứ thứ gì khác. Bạn lấy hai tệp này, biên dịch mã C, nhận được một tệp nhị phân mà bạn có thể trỏ đến các tham số và nói chuyện với mô hình ngôn ngữ này.
the parameters to run the model so it's only these two files you can take these two files and you can take your MacBook and this is a fully self-contained package this is everything that's necessary you don't need any connectivity to the internet or anything else you can take these two files you compile your C code you get a binary that you can point at the parameters and
Ví dụ, bạn có thể gửi văn bản như 'Hãy viết một bài thơ về công ty Scale AI' và mô hình ngôn ngữ này sẽ bắt đầu tạo văn bản. Trong trường hợp này, nó sẽ làm theo hướng dẫn và đưa ra một bài thơ về Scale AI. Lý do tôi chọn Scale AI ở đây, và bạn sẽ thấy điều đó xuyên suốt bài nói, là vì sự kiện tôi trình bày bài nói này ban đầu được tổ chức bởi Scale AI, vì vậy tôi đề cập đến họ trong các slide để làm cho nó cụ thể.
you can talk to this language model so for example you can send it text like for example write a poem about the company scale Ai and this language model will start generating text and in this case it will follow the directions and give you a poem about scale AI now the reason that I'm picking on scale AI here and you're going to see that throughout the talk is because the event that I
Đây là cách chúng ta có thể chạy mô hình. Chỉ cần hai tệp, chỉ cần một MacBook. Tôi hơi gian lận một chút vì video này không thực sự chạy mô hình 70 tỷ tham số, mà chỉ chạy mô hình 7 tỷ tham số. Mô hình 70B sẽ chạy chậm hơn khoảng 10 lần, nhưng tôi muốn cho bạn ý tưởng về việc tạo văn bản trông như thế nào. Không cần nhiều để chạy mô hình, đây là một gói rất nhỏ, nhưng độ phức tạp tính toán thực sự đến khi chúng ta muốn có được các tham số đó.
originally presented uh this talk with was run by scale Ai and so I'm picking on them throughout uh throughout the slides a little bit just in an effort to make it concrete so this is how we can run the model just requires two files just requires a MacBook I'm slightly cheating here because this was not actually in terms of the speed of this uh video here this was not running a 70 billion
Vậy làm thế nào để có được các tham số và chúng đến từ đâu? Bởi vì bất cứ thứ gì trong tệp run.c, kiến trúc mạng nơ-ron và lượt truyền xuôi của mạng đó, mọi thứ đều được hiểu về mặt thuật toán và mở, nhưng điều kỳ diệu thực sự nằm ở các tham số và cách chúng ta thu được chúng.
parameter model it was only running a 7 billion parameter Model A 70b would be running about 10 times slower but I wanted to give you an idea of uh sort of just the text generation and what that looks like so not a lot is necessary to run the model this is a very small package but the computational complexity really comes in when we'd like to get those parameters so how do we get the
Để có được các tham số, về cơ bản, quá trình huấn luyện mô hình, như chúng ta gọi, phức tạp hơn nhiều so với suy luận mô hình, phần mà tôi đã trình bày trước đó. Suy luận mô hình chỉ là chạy nó trên MacBook của bạn. Huấn luyện mô hình là một quá trình rất phức tạp. Về cơ bản, những gì chúng ta đang làm có thể được hiểu như một dạng nén của một phần lớn Internet.
parameters and where are they from uh because whatever is in the run.
Vì Llama 2 70B là một mô hình mã nguồn mở, chúng ta biết khá nhiều về cách nó được huấn luyện vì Meta đã công bố thông tin đó trong một bài báo. Đây là một số con số liên quan: bạn lấy một phần của Internet, khoảng 10 terabyte văn bản, thường đến từ một cuộc thu thập dữ liệu Internet. Hãy tưởng tượng thu thập rất nhiều văn bản từ nhiều trang web khác nhau và tập hợp chúng lại.
C file um the neural network architecture and sort of the forward pass of that Network everything is algorithmically understood and open and so on but the magic really is in the parameters and how do we obtain them so to obtain the parameters um basically the model training as we call it is a lot more
Sau đó, bạn mua một cụm GPU. Đây là những máy tính rất chuyên dụng cho khối lượng công việc tính toán nặng như huấn luyện mạng nơ-ron. Bạn cần khoảng 6.000 GPU và chạy trong khoảng 12 ngày để có được Llama 2 70B, và điều này sẽ tốn khoảng 2 triệu đô la. Về cơ bản, quá trình này nén phần lớn văn bản đó thành một thứ bạn có thể coi như một tệp zip.
involved than model inference which is the part that I showed you earlier so model inference is just running it on your MacBook model training is a competition very involved process process so basically what we're doing can best be sort of understood as kind of a compression of a good chunk of Internet so because llama 270b is an open source model we know quite a bit
Các tham số mà tôi đã trình bày trong slide trước tốt nhất nên được coi như một tệp zip của Internet. Trong trường hợp này, đầu ra là các tham số 140 GB. Bạn có thể thấy tỷ lệ nén ở đây khoảng 100 lần. Nhưng đây không chính xác là tệp zip vì tệp zip là nén không mất dữ liệu. Những gì đang xảy ra ở đây là nén mất dữ liệu. Chúng ta chỉ có được một dạng tổng thể của văn bản mà chúng ta đã huấn luyện. Chúng ta không có bản sao giống hệt trong các tham số này, vì vậy bạn có thể nghĩ về nó như nén mất dữ liệu.
about how it was trained because meta released that information in paper so these are some of the numbers of what's involved you basically take a chunk of the internet that is roughly you should be thinking 10 terab of text this typically comes from like a crawl of the internet so just imagine uh just collecting tons of text from all kinds of different websites and collecting it
Một điều cần chỉ ra ở đây là những con số này thực sự là con số nhỏ theo tiêu chuẩn hiện tại. Nếu bạn nghĩ về các mạng nơ-ron tiên tiến như những gì bạn có thể sử dụng trong ChatGPT, Claude hoặc Bard, những con số này có thể lớn hơn gấp 10 lần hoặc hơn. Vì vậy, bạn chỉ cần nhân lên khá nhiều. Đó là lý do tại sao các đợt huấn luyện ngày nay có thể tốn hàng chục hoặc thậm chí hàng trăm triệu đô la, với các cụm rất lớn, tập dữ liệu rất lớn. Quá trình này rất phức tạp để có được các tham số. Một khi bạn có các tham số đó, chạy mạng nơ-ron tương đối rẻ về mặt tính toán.
together so you take a large cheun of internet then you procure a GPU cluster um and uh these are very specialized computers intended for very heavy computational workloads like training of neural networks you need about 6,000 gpus and you would run this for about 12 days uh to get a llama 270b and this would cost you about $2 million and what this is doing is basically it is
Được rồi, vậy mạng nơ-ron này thực sự đang làm gì? Tôi đã đề cập rằng có các tham số này. Mạng nơ-ron về cơ bản chỉ cố gắng dự đoán từ tiếp theo trong một chuỗi. Bạn có thể nghĩ về nó theo cách đó. Bạn đưa vào một chuỗi các từ, ví dụ 'con mèo ngồi trên thảm', chuỗi này đi vào mạng nơ-ron. Các tham số được phân bố khắp mạng nơ-ron này, có các nơ-ron và chúng được kết nối với nhau, và chúng đều kích hoạt theo một cách nhất định. Đầu ra là dự đoán cho từ tiếp theo.
compressing this uh large chunk of text into what you can think of as a kind of a zip file so these parameters that I showed you in an earlier slide are best kind of thought of as like a zip file of the internet and in this case what would come out are these parameters 140 GB so you can see that the compression ratio here is roughly like 100x uh roughly speaking but this is not exactly a zip
Ví dụ, trong trường hợp này, mạng nơ-ron có thể dự đoán rằng trong ngữ cảnh của bốn từ này, từ tiếp theo có thể là 'thảm' với xác suất 97%. Đây là vấn đề cơ bản mà mạng nơ-ron thực hiện. Bạn có thể chứng minh bằng toán học rằng có mối quan hệ rất chặt chẽ giữa dự đoán và nén, đó là lý do tại sao tôi ám chỉ việc huấn luyện mạng nơ-ron này như một dạng nén của Internet. Bởi vì nếu bạn có thể dự đoán từ tiếp theo rất chính xác, bạn có thể sử dụng nó để nén tập dữ liệu. Vì vậy, nó chỉ là một mạng nơ-ron dự đoán từ tiếp theo: bạn đưa vào một số từ, nó đưa ra từ tiếp theo.
file because a zip file is lossless compression What's Happening Here is a lossy compression we're just kind of like getting a kind of a Gestalt of the text that we trained on we don't have an identical copy of it in these parameters and so it's kind of like a lossy compression you can think about it that way the one more thing to point out here is these numbers here are actually by
Lý do mà những gì bạn nhận được từ quá trình huấn luyện thực sự là một tạo tác kỳ diệu là vì nhiệm vụ dự đoán từ tiếp theo, bạn có thể nghĩ là một mục tiêu rất đơn giản, nhưng thực ra nó là một mục tiêu khá mạnh mẽ. Nó buộc bạn phải học rất nhiều về thế giới bên trong các tham số của mạng nơ-ron. Ở đây tôi lấy một trang web ngẫu nhiên tại thời điểm tôi thực hiện bài nói này, tôi lấy từ trang chính của Wikipedia và nó nói về Ruth Handler. Hãy nghĩ về việc là mạng nơ-ron, bạn được cho một số lượng từ và cố gắng dự đoán từ tiếp theo trong chuỗi.
today's standards in terms of state-of-the-art rookie numbers uh so if you want to think about state-of-the-art neural networks like say what you might use in chpt or Claude or Bard or something like that uh these numbers are off by factor of 10 or more so you would just go in then you just like start multiplying um by quite a bit more and that's why these training runs today are
Trong trường hợp này, tôi đánh dấu màu đỏ một số từ chứa nhiều thông tin. Ví dụ, nếu mục tiêu của bạn là dự đoán từ tiếp theo, có lẽ các tham số của bạn phải học rất nhiều kiến thức này. Bạn phải biết về Ruth và Handler, khi bà sinh ra và mất, bà là ai, bà đã làm gì, v.v. Vì vậy, trong nhiệm vụ dự đoán từ tiếp theo, bạn học rất nhiều về thế giới và tất cả kiến thức này được nén vào các trọng số, các tham số.
many tens or even potentially hundreds of millions of dollars very large clusters very large data sets and this process here is very involved to get those parameters once you have those parameters running the neural network is fairly computationally cheap okay so what is this neural network really doing right I mentioned that there are these parameters um this
Bây giờ, làm thế nào để chúng ta thực sự sử dụng các mạng nơ-ron này? Một khi chúng ta đã huấn luyện chúng, tôi đã chỉ cho bạn rằng suy luận mô hình là một quá trình rất đơn giản. Về cơ bản, chúng ta tạo ra những gì tiếp theo, chúng ta lấy mẫu từ mô hình, chọn một từ, sau đó tiếp tục đưa nó trở lại và nhận từ tiếp theo, và tiếp tục đưa nó trở lại. Chúng ta có thể lặp lại quá trình này và mạng này sau đó mơ ra các tài liệu Internet.
neural network basically is just trying to predict the next word in a sequence you can think about it that way so you can feed in a sequence of words for example C set on a this feeds into a neural net and these parameters are dispersed throughout this neural network and there's neurons and they're connected to each other and they all fire in a certain way you can think
Ví dụ, nếu chúng ta chỉ chạy mạng nơ-ron, hay như chúng ta nói thực hiện suy luận, chúng ta sẽ nhận được những giấc mơ trang web. Bạn gần như có thể nghĩ về nó theo cách đó, bởi vì mạng này được huấn luyện trên các trang web và sau đó bạn có thể thả nó ra. Ở bên trái, chúng ta có một giấc mơ mã Java, ở giữa có một thứ trông giống như giấc mơ sản phẩm Amazon, và ở bên phải có một thứ trông giống như bài viết Wikipedia.
about it that way um and out comes a prediction for what word comes next so for example in this case this neural network might predict that in this context of for Words the next word will probably be a Matt with say 97% probability so this is fundamentally the problem that the neural network is performing and this you can show mathematically that there's a very close
Tập trung một chút vào cái ở giữa làm ví dụ: tiêu đề, tác giả, số ISBN, mọi thứ khác đều hoàn toàn do mạng tạo ra. Mạng đang mơ văn bản từ phân phối mà nó được huấn luyện, nó chỉ bắt chước các tài liệu này. Nhưng tất cả đều là loại ảo giác. Ví dụ, số ISBN này, tôi đoán gần như chắc chắn không tồn tại. Mạng chỉ biết rằng những gì đến sau 'ISBN:' là một số có độ dài như vậy và có các chữ số, và nó chỉ đặt vào bất cứ thứ gì có vẻ hợp lý.
relationship between prediction and compression which is why I sort of allude to this neural network as a kind of training it is kind of like a compression of the internet um because if you can predict uh sort of the next word very accurately uh you can use that to compress the data set so it's just a next word prediction neural network you give it some words it gives you the next
Vì vậy, nó đang mô phỏng phân phối của tập dữ liệu huấn luyện. Ở bên phải, 'cá mũi đen' tôi đã tra cứu và nó thực sự là một loại cá. Những gì đang xảy ra ở đây là văn bản này không được tìm thấy nguyên văn trong các tài liệu huấn luyện, nhưng thông tin này, nếu bạn thực sự tra cứu, thực tế là đúng về loài cá này. Vì vậy, mạng có kiến thức về loài cá này, nó biết nhiều về nó. Nó sẽ không lặp lại chính xác các tài liệu mà nó thấy trong tập huấn luyện, nhưng nó là một dạng nén mất dữ liệu của Internet. Nó nhớ tổng thể, nó biết kiến thức, và nó tạo ra hình thức, tạo ra hình thức đúng và điền vào một số kiến thức của nó.
word now the reason that what you get out of the training is actually quite a magical artifact is that basically the next word predition task you might think is a very simple objective but it's actually a pretty powerful objective because it forces you to learn a lot about the world inside the parameters of the neural network so here I took a random web page um at the
Bạn không bao giờ chắc chắn 100% liệu những gì nó đưa ra là ảo giác, câu trả lời không chính xác hay câu trả lời đúng. Một số thứ có thể được ghi nhớ và một số thì không, và bạn không biết chính xác cái nào là cái nào. Nhưng phần lớn, nó chỉ là ảo giác hoặc mơ văn bản Internet từ phân phối dữ liệu của nó. Được rồi, bây giờ hãy chuyển sang cách mạng này hoạt động, làm thế nào nó thực sự thực hiện nhiệm vụ dự đoán từ tiếp theo, những gì xảy ra bên trong nó.
time when I was making this talk I just grabbed it from the main page of Wikipedia and it was uh about Ruth Handler and so think about being the neural network and you're given some amount of words and trying to predict the next word in a sequence well in this case I'm highlighting here in red some of the words that would contain a lot of information and so for example in if
Đây là nơi mọi thứ trở nên phức tạp hơn một chút. Đây là sơ đồ của mạng nơ-ron. Nếu chúng ta phóng to vào sơ đồ đồ chơi của mạng nơ-ron này, đây là cái mà chúng ta gọi là kiến trúc mạng nơ-ron Transformer, và đây là sơ đồ của nó. Điều đáng chú ý về các mạng nơ-ron này là chúng ta thực sự hiểu đầy đủ chi tiết về kiến trúc. Chúng ta biết chính xác các phép toán nào xảy ra ở các giai đoạn khác nhau của nó. Vấn đề là 100 tỷ tham số này được phân bố khắp toàn bộ mạng nơ-ron.
your objective is to predict the next word presumably your parameters have to learn a lot of this knowledge you have to know about Ruth and Handler and when she was born and when she died uh who she was uh what she's done and so on and so in the task of next word prediction you're learning a ton about the world and all this knowledge is being compressed into the weights uh the parameters
Về cơ bản, hàng tỷ tham số này nằm rải rác khắp mạng nơ-ron và tất cả những gì chúng ta biết là cách điều chỉnh các tham số này một cách lặp đi lặp lại để làm cho toàn bộ mạng tốt hơn trong nhiệm vụ dự đoán từ tiếp theo. Vì vậy, chúng ta biết cách tối ưu hóa các tham số này, chúng ta biết cách điều chỉnh chúng theo thời gian để có được dự đoán từ tiếp theo tốt hơn, nhưng chúng ta không thực sự biết 100 tỷ tham số này đang làm gì. Chúng ta có thể đo lường rằng nó đang cải thiện trong việc dự đoán từ tiếp theo, nhưng chúng ta không biết các tham số này hợp tác như thế nào để thực hiện điều đó.
now how do we actually use these neural networks well once we've trained them I showed you that the model inference um is a very simple process we basically generate uh what comes next we sample from the model so we pick a word um and then we continue feeding it back in and get the next word and continue feeding that back in so we can iterate this process and this network then dreams
Chúng ta có một số mô hình mà bạn có thể cố gắng suy nghĩ ở mức độ cao về những gì mạng có thể đang làm. Chúng ta hiểu rằng chúng xây dựng và duy trì một loại cơ sở dữ liệu kiến thức, nhưng ngay cả cơ sở dữ liệu kiến thức này cũng rất kỳ lạ, không hoàn hảo và kỳ quặc. Một ví dụ lan truyền gần đây là cái mà chúng ta gọi là lỗi đảo ngược. Ví dụ, nếu bạn vào ChatGPT và nói chuyện với GPT-4, mô hình ngôn ngữ tốt nhất hiện tại, và hỏi 'Mẹ của Tom Cruise là ai?', nó sẽ trả lời là Mary Lee Pfeiffer, đúng. Nhưng nếu bạn hỏi 'Con trai của Mary Lee Pfeiffer là ai?', nó sẽ nói không biết.
internet documents so for example if we just run the neural network or as we say perform inference uh we would get sort of like web page dreams you can almost think about it that way right because this network was trained on web pages and then you can sort of like Let it Loose so on the left we have some kind of a Java code dream it looks like in the middle we have some kind of a what
Vì vậy, kiến thức này rất kỳ lạ, nó có tính một chiều. Bạn phải hỏi nó từ một hướng nhất định. Điều đó thực sự kỳ lạ và về cơ bản chúng ta không thực sự biết, bởi vì tất cả những gì bạn có thể đo lường là nó có hoạt động hay không và với xác suất nào. Nói tóm lại, hãy nghĩ về LLM như những tạo tác phần lớn không thể hiểu được. Chúng không giống bất cứ thứ gì bạn có thể xây dựng trong một ngành kỹ thuật, như một chiếc xe hơi nơi chúng ta hiểu tất cả các bộ phận. Đây là những mạng nơ-ron đến từ một quá trình tối ưu hóa dài, và chúng ta hiện không hiểu chính xác cách chúng hoạt động.
looks like almost like an Amazon product dream um and on the right we have something that almost looks like Wikipedia article focusing for a bit on the middle one as an example the title the author the ISBN number everything else this is all just totally made up by the network uh the network is dreaming text uh from the distribution that it was trained on it's it's just mimicking
Mặc dù có một lĩnh vực gọi là khả năng giải thích hoặc khả năng giải thích cơ học, cố gắng đi vào và tìm hiểu tất cả các bộ phận của mạng nơ-ron này đang làm gì. Bạn có thể làm điều đó ở một mức độ nào đó, nhưng không hoàn toàn vào lúc này. Nhưng hiện tại, chúng ta coi chúng chủ yếu như các tạo tác thực nghiệm. Chúng ta có thể đưa ra một số đầu vào và đo lường đầu ra. Về cơ bản, chúng ta có thể đo lường hành vi của chúng, chúng ta có thể xem xét văn bản mà chúng tạo ra trong nhiều tình huống khác nhau.
these documents but this is all kind of like hallucinated so for example the ISBN number this number probably I would guess almost certainly does not exist uh the model Network just knows that what comes after ISB and colon is some kind of a number of roughly this length and it's got all these digits and it just like puts it in it just kind of like puts in whatever looks reasonable so
Vì vậy, tôi nghĩ điều này đòi hỏi các đánh giá tinh vi tương ứng để làm việc với các mô hình này, bởi vì chúng chủ yếu là thực nghiệm. Bây giờ chúng ta hãy chuyển sang cách chúng ta thực sự có được một trợ lý. Cho đến nay, chúng ta chỉ nói về các bộ tạo tài liệu Internet. Đó là giai đoạn đầu tiên của huấn luyện, chúng ta gọi đó là tiền huấn luyện. Bây giờ chúng ta chuyển sang giai đoạn thứ hai của huấn luyện, mà chúng ta gọi là tinh chỉnh, và đây là nơi chúng ta có được cái mà chúng ta gọi là mô hình trợ lý.
it's parting the training data set Distribution on the right the black nose days I looked at up and it is actually a kind of fish um and what's Happening Here is this text verbatim is not found in a training set documents but this information if you actually look it up is actually roughly correct with respect to this fish and so the network has knowledge about this fish it knows a lot
Bởi vì chúng ta không thực sự chỉ muốn một bộ tạo tài liệu, điều đó không hữu ích lắm cho nhiều nhiệm vụ. Chúng ta muốn đưa câu hỏi cho một thứ gì đó và nó tạo ra câu trả lời dựa trên những câu hỏi đó. Vì vậy, chúng ta thực sự muốn một mô hình trợ lý. Cách bạn có được các mô hình trợ lý này về cơ bản là thông qua quy trình sau: chúng ta giữ nguyên quá trình tối ưu hóa, huấn luyện sẽ giống nhau, chỉ là nhiệm vụ dự đoán từ tiếp theo, nhưng chúng ta sẽ thay thế tập dữ liệu mà chúng ta đang huấn luyện.
about this fish it's not going to exactly parrot the documents that it saw in the training set but again it's some kind of a l some kind of a lossy compression of the internet it kind of remembers the gal it kind of knows the knowledge and it just kind of like goes and it creates the form it creates kind of like the correct form and fills it with some of its knowledge and you're
Trước đây, chúng ta cố gắng huấn luyện trên các tài liệu Internet. Bây giờ chúng ta sẽ thay thế nó bằng các tập dữ liệu mà chúng ta thu thập thủ công. Cách chúng ta thu thập chúng là sử dụng nhiều người. Thông thường, một công ty sẽ thuê người và đưa cho họ hướng dẫn gắn nhãn, yêu cầu họ đưa ra các câu hỏi và sau đó viết câu trả lời cho chúng. Đây là một ví dụ về một mẫu duy nhất có thể được đưa vào tập huấn luyện của bạn.
never 100% sure if what it comes up with is as we call hallucination or like an incorrect answer or like a correct answer necessarily so some of the stuff could be memorized and some of it is not memorized and you don't exactly know which is which um but for the most part this is just kind of like hallucinating or like dreaming internet text from its data distribution okay let's now switch
Có một người dùng và nó nói điều gì đó như 'Bạn có thể viết một đoạn giới thiệu ngắn về sự liên quan của thuật ngữ monopsony trong kinh tế học không?' và sau đó có trợ lý, và một lần nữa người đó điền vào phản hồi lý tưởng. Phản hồi lý tưởng và cách nó được chỉ định và nó nên trông như thế nào đều đến từ tài liệu gắn nhãn mà chúng tôi cung cấp cho những người này. Các kỹ sư tại một công ty như OpenAI, Anthropic hoặc bất cứ đâu sẽ đưa ra các tài liệu gắn nhãn này.
gears to how does this network work how does it actually perform this next word prediction task what goes on inside it well this is where things complicate a little bit this is kind of like the schematic diagram of the neural network um if we kind of like zoom in into the toy diagram of this neural net this is what we call the Transformer neural network architecture and this is kind of
Giai đoạn tiền huấn luyện là về một số lượng lớn văn bản nhưng có thể chất lượng thấp vì nó chỉ đến từ Internet, với hàng chục hoặc hàng trăm terabyte văn bản và không phải tất cả đều có chất lượng rất cao. Nhưng trong giai đoạn thứ hai này, chúng tôi ưu tiên chất lượng hơn số lượng. Chúng tôi có thể có ít tài liệu hơn nhiều, ví dụ 100.000, nhưng tất cả các tài liệu này bây giờ là các cuộc hội thoại và chúng phải là các cuộc hội thoại chất lượng rất cao. Về cơ bản, mọi người tạo ra chúng dựa trên hướng dẫn gắn nhãn.
like a diagram of it now what's remarkable about these neural nuts is we actually understand uh in full detail the architecture we know exactly what mathematical operations happen at all the different stages of it uh the problem is that these 100 billion parameters are dispersed throughout the entire neural network work and so basically these buildon parameters uh of
Vì vậy, chúng tôi thay thế tập dữ liệu và huấn luyện trên các tài liệu hỏi đáp này. Quá trình này được gọi là tinh chỉnh. Một khi bạn làm điều này, bạn có được cái mà chúng tôi gọi là mô hình trợ lý. Mô hình trợ lý này bây giờ tuân theo hình thức của các tài liệu huấn luyện mới của nó. Ví dụ, nếu bạn đưa cho nó một câu hỏi như 'Bạn có thể giúp tôi với mã này không? Có vẻ như có một lỗi. In Hello World', mặc dù câu hỏi cụ thể này không nằm trong tập huấn luyện, mô hình sau khi tinh chỉnh hiểu rằng nó nên trả lời theo phong cách của một trợ lý hữu ích cho những loại câu hỏi này và nó sẽ làm điều đó.
billions of parameters are throughout the neural nut and all we know is how to adjust these parameters iteratively to make the network as a whole better at the next word prediction task so we know how to optimize these parameters we know how to adjust them over time to get a better next word prediction but we don't actually really know what these 100 billion parameters are doing we can
Vì vậy, nó sẽ lấy mẫu từng từ một từ trái sang phải, từ trên xuống dưới, tất cả các từ này là phản hồi cho truy vấn này. Thật đáng chú ý và cũng mang tính thực nghiệm và chưa được hiểu đầy đủ rằng các mô hình này có thể thay đổi hành vi của chúng dựa trên dữ liệu tinh chỉnh.
measure that it's getting better at the next word prediction but we don't know how these parameters collaborate to actually perform that um we have some kind of models that you can try to think through on a high level for what the network might be doing so we kind of understand that they build and maintain some kind of a knowledge database but even this knowledge
database is very strange and imperfect and weird uh so a recent viral example is what we call the reversal course uh so as an example if you go to chat GPT and you talk to GPT 4 the best language model currently available you say who is Tom Cruz's mother it will tell you it's merily feifer which is correct but if you say who is merely Fifer's son it will tell you it doesn't know so this
knowledge is weird and it's kind of one-dimensional and you have to sort of like this knowledge isn't just like stored and can be accessed in all the different ways you have sort of like ask it from a certain direction almost um and so that's really weird and strange and fundamentally we don't really know because all you can kind of measure is whether it works or not and with what
probability so long story short think of llms as kind of like most mostly inscrutable artifacts they're not similar to anything else you might built in an engineering discipline like they're not like a car where we sort of understand all the parts um there are these neural Nets that come from a long process of optimization and so we don't currently understand exactly how they
work although there's a field called interpretability or mechanistic interpretability trying to kind of go in and try to figure out like what all the parts of this neural net are doing and you can do that to some extent but not fully right now U but right now we kind of what treat them mostly As empirical artifacts we can give them some inputs and we can measure the