Recent advances in machine learning have transformed what computers can do, driven by increasing scale in computation, data, and model size. Generative AI now creates images, speech, and text from descriptions, while major gains in computer vision and speech recognition show rapid progress.
Những tiến bộ gần đây trong học máy đã thay đổi những gì máy tính có thể làm, nhờ quy mô ngày càng tăng về tính toán, dữ liệu và kích thước mô hình. AI sinh tạo hiện tạo ra hình ảnh, giọng nói và văn bản từ mô tả, trong khi những bước tiến lớn trong thị giác máy tính và nhận dạng giọng nói cho thấy sự phát triển nhanh chóng.
Thank you so much.
Cảm ơn rất nhiều.
I'm I'm really delighted to be here.
Tôi thực sự rất vui khi được ở đây.
My colleague Tong had asked me in 2020 to come to Vietnam and give a talk and uh unfortunately co happened and so I wasn't able to actually make it in person although I did do a virtual talk but a uh in-person talk is a very different experience and so I'm delighted to actually be able to make it this year.
Đồng nghiệp của tôi, Tong, đã mời tôi vào năm 2020 đến Việt Nam và có một buổi nói chuyện, và thật không may, COVID đã xảy ra, nên tôi không thể thực sự đến trực tiếp mặc dù tôi đã có một buổi nói chuyện ảo, nhưng một buổi nói chuyện trực tiếp là một trải nghiệm rất khác, và vì vậy tôi rất vui vì thực sự có thể đến được trong năm nay.
This is my first trip
Đây là chuyến đi đầu tiên của tôi
to Vietnam.
Đến Việt Nam.
So I've now been here for 44 hours or something.
Vậy là tôi đã ở đây được 44 giờ hoặc gì đó.
Um and I'm having a great time so far.
Ừm và tôi đang có khoảng thời gian tuyệt vời cho đến nay.
I'd like to thank the organizers for having me and uh I'm just really excited to be here.
Tôi muốn cảm ơn ban tổ chức đã mời tôi và ừm tôi thực sự rất hào hứng được ở đây.
I think the potential of AI to transform the world is very large and I think Vietnam is in a very good position with your sort of strong um you know education system u bringing many
Tôi nghĩ tiềm năng của AI để biến đổi thế giới là rất lớn và tôi nghĩ Việt Nam đang ở một vị trí rất tốt với hệ thống giáo dục mạnh mẽ của các bạn, ừm, bạn biết đấy, việc đưa nhiều người
many people uh into this field is going to be really important.
Nhiều người ừm vào lĩnh vực này sẽ thực sự quan trọng.
All right.
Được rồi.
So uh I'm going to basically just give a very broad overview of some of the exciting things that are happening in the field of machine learning and AI.
Vậy ừm tôi sẽ cơ bản chỉ đưa ra một tổng quan rất rộng về một số điều thú vị đang diễn ra trong lĩnh vực học máy và AI.
Um and I'm presenting the work of many people at Google.
Ừm và tôi đang trình bày công trình của nhiều người tại Google.
This is not all my work.
Đây không phải là tất cả công trình của tôi.
We have wonderful people doing lots of great work.
Chúng tôi có những người tuyệt vời đang làm rất nhiều công việc tuyệt vời.
Some of which I'm involved
Một số trong đó tôi có tham gia
in.
Vào.
Some of which I think is just cool and you should learn about.
Một số trong đó tôi nghĩ chỉ là thú vị và bạn nên tìm hiểu về nó.
So um a few observations.
Vậy ừm một vài quan sát.
So first, in recent years, machine learning and AI have really changed our expectations of what is possible with computers, and I'll talk about that in a minute.
Đầu tiên, trong những năm gần đây, học máy và AI đã thực sự thay đổi kỳ vọng của chúng ta về những gì có thể làm được với máy tính, và tôi sẽ nói về điều đó trong một phút.
So we used to think of computers as kind of these fairly unintelligent things, but with AI, we're now able to actually have
Chúng ta từng nghĩ về máy tính như những thứ khá là không thông minh, nhưng với AI, chúng ta giờ đây có thể thực sự có
computers that can start to understand um you know, some of the kinds of information that people effortlessly understand.
Những máy tính có thể bắt đầu hiểu ừm bạn biết đấy, một số loại thông tin mà con người hiểu một cách dễ dàng.
Uh that previously was very hard for computers.
Ừm mà trước đây rất khó đối với máy tính.
Second thing is that increasing the scale of these AI systems using larger scale computation systems, using larger amounts of training data, increasing the model sizes that we're training, all of those seem to improve
Điều thứ hai là việc tăng quy mô của các hệ thống AI này bằng cách sử dụng các hệ thống tính toán quy mô lớn hơn, sử dụng lượng dữ liệu huấn luyện lớn hơn, tăng kích thước mô hình mà chúng ta đang huấn luyện, tất cả những điều đó dường như cải thiện
better uh the results of these systems.
Tốt hơn ừm kết quả của các hệ thống này.
Um, and that's kind of a a key ingredient to how we've been able to make progress and how we'll probably continue to make progress in this field.
Ừm, và đó là một thành phần quan trọng cho cách chúng ta đã có thể đạt được tiến bộ và cách chúng ta có thể sẽ tiếp tục đạt được tiến bộ trong lĩnh vực này.
And the third thing is the kinds of computations we want to run on computers and the hardware in which we want to run them is actually changing quite a lot.
Và điều thứ ba là các loại tính toán mà chúng ta muốn chạy trên máy tính và phần cứng mà chúng ta muốn chạy chúng thực sự đang thay đổi khá nhiều.
Uh you know the machine learning algorithms that we use actually look very different than the sort of traditional handwritten C++ or JavaScript code that many computer applications you're familiar with are built out of.
Ừm bạn biết đấy, các thuật toán học máy mà chúng ta sử dụng thực sự trông rất khác so với loại mã C++ hoặc JavaScript viết tay truyền thống mà nhiều ứng dụng máy tính mà bạn quen thuộc được xây dựng từ đó.
And so we want to be able to build hardware that can enable us to do a better job of running these computations more efficiently.
Và vì vậy chúng ta muốn có thể xây dựng phần cứng có thể cho phép chúng ta làm tốt hơn việc chạy các tính toán này một cách hiệu quả hơn.
Um so in the last decade there's been a lot of progress on some of the sort of most fundamental problems in artificial intelligence and computer vision and you know language understanding and speech uh understanding.
Ừm vậy trong thập kỷ qua đã có rất nhiều tiến bộ về một số vấn đề cơ bản nhất trong trí tuệ nhân tạo và thị giác máy tính và bạn biết đấy, hiểu ngôn ngữ và hiểu giọng nói.
Um, so we've been able to actually solve a lot of these problems pretty well where now you can feed in the pixels of an image and get out, you know, some sense of uh maybe a
Ừm, vậy chúng ta đã có thể thực sự giải quyết khá tốt nhiều vấn đề này, đến mức giờ đây bạn có thể đưa vào các pixel của một hình ảnh và nhận ra, bạn biết đấy, một chút cảm nhận về ừm có thể là một
category of what is in that image.
Danh mục về những gì có trong hình ảnh đó.
That's a leopard or feed in the raw audio waveform and then get a transcript of what is being said.
Đó là một con báo hoặc đưa vào dạng sóng âm thanh thô và sau đó nhận được bản ghi lại những gì đang được nói.
How cold is it outside?
Ngoài trời lạnh đến mức nào?
Um, hello, how are you?
Ừm, xin chào, bạn khỏe không?
Or and get the translated version of that.
Hoặc và nhận được phiên bản dịch của nó.
That's that's machine translation.
Đó là dịch máy.
or in some cases feed in a pixel uh pixels of an image and get not just a category but actually a full description of what is in that image in the same way a human might be able to sort of give you a you know one-s sentence description of an image but I think one of the most exciting things about generative AI in the last sort of three to five years is
Hoặc trong một số trường hợp, đưa vào pixel ừm các pixel của một hình ảnh và nhận được không chỉ một danh mục mà thực sự là một mô tả đầy đủ về những gì có trong hình ảnh đó theo cách mà con người có thể đưa ra cho bạn một mô tả một câu về một hình ảnh, nhưng tôi nghĩ một trong những điều thú vị nhất về AI tạo sinh trong khoảng ba đến năm năm qua là
that we've actually been able to reverse those arrows in a lot of cases and so all of a sudden we can now generate you know hundreds or thousands thousand of images of leopards if you say I'd like images of leopards or um you know you can go the other direction and have very high quality um uh texttospech systems like so that computers can have very natural sounding voices um you know
Rằng chúng ta đã thực sự có thể đảo ngược những mũi tên đó trong nhiều trường hợp và vì vậy đột nhiên chúng ta có thể tạo ra, bạn biết đấy, hàng trăm hoặc hàng nghìn hình ảnh về báo nếu bạn nói tôi muốn hình ảnh về báo hoặc ừm bạn biết đấy, bạn có thể đi theo hướng ngược lại và có các hệ thống chuyển văn bản thành giọng nói chất lượng rất cao ừm ừm để máy tính có thể có giọng nói nghe rất tự nhiên ừm bạn biết đấy
translation being reversible is not that surprising.
Dịch thuật có thể đảo ngược không quá ngạc nhiên.
uh but also generative images in the sense of giving a description of an image you want and then being able to actually produce you know realistic looking imagery or in some cases videos of these things and so I think this reversal of the capabilities is key to you know some of the excitement that you see in this field
Ừm nhưng cũng có thể tạo hình ảnh theo nghĩa đưa ra mô tả về một hình ảnh bạn muốn và sau đó có thể thực sự tạo ra, bạn biết đấy, hình ảnh trông chân thực hoặc trong một số trường hợp là video về những thứ này và vì vậy tôi nghĩ sự đảo ngược khả năng này là chìa khóa cho, bạn biết đấy, một số sự hào hứng mà bạn thấy trong lĩnh vực này
and I think it's also important to look at the progress rate in some of these kinds of problems so uh there's a Stanford designed contest of called the imageet challenge where your system is given a bunch of images like this and there's a set of a thousand different categorical labels and the system has to take in just the pixels of an image and produce the correct label for a bunch of
Và tôi nghĩ cũng quan trọng khi nhìn vào tốc độ tiến bộ trong một số loại vấn đề này, vậy ừm có một cuộc thi do Stanford thiết kế gọi là thử thách ImageNet, nơi hệ thống của bạn được đưa cho một loạt hình ảnh như thế này và có một tập hợp một nghìn nhãn danh mục khác nhau và hệ thống phải tiếp nhận chỉ các pixel của một hình ảnh và tạo ra nhãn đúng cho một loạt
images it's never seen before.
Hình ảnh mà nó chưa từng thấy trước đây.
Um and prior to 2013 uh most computer vision models were not using a full endtoend learned approach using neural networks and in 2013 uh IASGver Alex Kashesky and Jeffrey Hinton came out with a very famous paper uh affectionately known as AlexNet that for the first time used an end toend neural network to uh do this problem and made a dramatic improvement in the
Ừm và trước năm 2013 ừm hầu hết các mô hình thị giác máy tính không sử dụng cách tiếp cận học đầu-cuối hoàn toàn bằng mạng nơ-ron và vào năm 2013 ừm IASGver Alex Kashesky và Jeffrey Hinton đã công bố một bài báo rất nổi tiếng ừm thường được gọi một cách trìu mến là AlexNet, lần đầu tiên sử dụng một mạng nơ-ron đầu-cuối để ừm giải quyết vấn đề này và đã tạo ra một cải thiện đáng kể về
accuracy So from 50.9% up to 63.3%.
Độ chính xác. Vậy từ 50,9% lên 63,3%.
This was like a revolutionary field uh paper in the field of computer vision.
Đây giống như một bài báo mang tính cách mạng ừm trong lĩnh vực thị giác máy tính.
That year I think there were 29 entrance to the contest and only one of them used a deep neural network.
Năm đó tôi nghĩ có 29 bài dự thi và chỉ một trong số đó sử dụng mạng nơ-ron sâu.
Uh the next year I think 28 of 30 used a neural network.
Ừm năm tiếp theo tôi nghĩ 28 trong số 30 bài dự thi sử dụng mạng nơ-ron.
So this is like a huge shift in a very established field of computer vision because people saw how important and capable these systems were.
Vậy đây giống như một sự thay đổi lớn trong một lĩnh vực thị giác máy tính rất lâu đời vì mọi người thấy được tầm quan trọng và khả năng của các hệ thống này.
But it's also kind of easy to lose sight of how much progress we've made since then, right?
Nhưng cũng khá dễ để mất dấu về mức độ tiến bộ mà chúng ta đã đạt được kể từ đó, phải không?
We've been able to actually improve the accuracy quite substantially from, you know, that groundbreaking paper through now people really focusing
Chúng tôi đã thực sự có thể cải thiện độ chính xác khá đáng kể từ, bạn biết đấy, bài báo đột phá đó cho đến nay khi mọi người thực sự tập trung
on that, bringing more people into this sort of approach to solving computer vision problems.
Vào điều đó, thu hút nhiều người hơn vào cách tiếp cận này để giải quyết các vấn đề thị giác máy tính.
uh there's sort of a similar story in speech recognition.
Uh có một câu chuyện tương tự trong nhận dạng giọng nói.
So this is actually just over the last over a 5year period rather than about a 10-year period.
Vậy nên đây thực ra chỉ là trong khoảng thời gian hơn 5 năm chứ không phải khoảng 10 năm.
And there's been very major reductions in the word error rate.
Và đã có những giảm thiểu rất lớn về tỷ lệ lỗi từ.
Uh so going from 13.25% down to 2 and a half%.
Uh vậy nên từ 13,25% xuống còn 2,5%.
And 2 and a half% is really a much more usable speech recognition system.
Và 2,5% thực sự là một hệ thống nhận dạng giọng nói dễ sử dụng hơn nhiều.
If your speech recognition system, you know,
Nếu hệ thống nhận dạng giọng nói của bạn, bạn biết đấy,
gets roughly one in seven words wrong, that's a very different experience than something that gets one in 40 words wrong.
Sai khoảng một trong bảy từ, đó là một trải nghiệm rất khác so với một cái sai một trong 40 từ.
So I mentioned the fact that um computation is a really important uh capability for these models and having more computational power that is better suited for machine learning algorithms actually is something that can really drive progress in this field because all of a sudden you can train larger models, you can train them on more data with you know more efficiency.
Vậy nên tôi đã đề cập đến thực tế rằng um tính toán là một khả năng thực sự quan trọng uh cho các mô hình này và có nhiều sức mạnh tính toán hơn phù hợp hơn cho các thuật toán học máy thực sự là điều có thể thúc đẩy tiến bộ trong lĩnh vực này bởi vì đột nhiên bạn có thể huấn luyện các mô hình lớn hơn, bạn có thể huấn luyện chúng trên nhiều dữ liệu hơn với bạn biết đấy hiệu quả cao hơn.
Um, so
Um, vậy nên
ML optimized hardware actually turns out to be a lot more efficient because if you really build hardware targeted at exactly the kinds of computations you want to be able to do and discard all the other things you may not maybe not don't need for machine learning, uh you get major improvements in efficiency.
Phần cứng tối ưu hóa cho ML thực ra hóa ra hiệu quả hơn nhiều bởi vì nếu bạn thực sự xây dựng phần cứng nhắm mục tiêu chính xác vào các loại tính toán bạn muốn có thể thực hiện và loại bỏ tất cả những thứ khác mà bạn có thể không cần cho học máy, uh bạn sẽ có những cải thiện lớn về hiệu quả.
Um, and so this really uh enables larger scale models with both
Um, và vì vậy điều này thực sự uh cho phép các mô hình quy mô lớn hơn với cả
lower economic costs and also lower energy costs.
Chi phí kinh tế thấp hơn và cũng chi phí năng lượng thấp hơn.
Um, and there's two important properties I will tell you about.
Um, và có hai thuộc tính quan trọng tôi sẽ kể cho bạn.
So, first, all of the machine learning algorithms I'm going to talk to you about today are really essentially different compositions of uh linear algebra operations.
Vậy, đầu tiên, tất cả các thuật toán học máy tôi sẽ nói với bạn hôm nay thực sự về cơ bản là các tổ hợp khác nhau của uh các phép toán đại số tuyến tính.
So, um that's one property.
Vậy, um đó là một thuộc tính.
The second property is that all these neural networkbased models are quite tolerant of noise.
Thuộc tính thứ hai là tất cả các mô hình dựa trên mạng nơ-ron này khá chịu được nhiễu.
So they actually don't need you to carry out,
Vậy nên chúng thực sự không cần bạn thực hiện,
you know, computations to many, many significant digits.
Bạn biết đấy, các phép tính đến nhiều, nhiều chữ số có nghĩa.
And just as it's easier for you to multiply, you know, shorter numbers, it's also easier for computers to multiply shorter numbers.
Và cũng như việc bạn nhân, bạn biết đấy, các số ngắn hơn dễ dàng hơn, máy tính cũng dễ dàng nhân các số ngắn hơn.