The speaker, a leading figure in AI and founding member of Google Brain, discusses the transformative potential of AI, highlighting progress in machine learning, the importance of scale, and the shift to generative AI. Increasing scale of AI systems (more computation, data, model size) improves results. Machine learning algorithms differ from traditional code, requiring specialized hardware. Generative AI has reversed capabilities, enabling text-to-image, text-to-speech, and image generation. Progress in computer vision and speech recognition has been dramatic, with deep neural networks driving improvements.
Diễn giả, một nhân vật hàng đầu trong lĩnh vực AI và là thành viên sáng lập của Google Brain, thảo luận về tiềm năng biến đổi của AI, nhấn mạnh những tiến bộ trong học máy, tầm quan trọng của quy mô và sự chuyển dịch sang AI tạo sinh. Việc tăng quy mô của các hệ thống AI (nhiều tính toán hơn, dữ liệu hơn, kích thước mô hình lớn hơn) cải thiện kết quả. Các thuật toán học máy khác với mã truyền thống, đòi hỏi phần cứng chuyên dụng. AI tạo sinh đã đảo ngược khả năng, cho phép tạo hình ảnh từ văn bản, chuyển văn bản thành giọng nói và tạo hình ảnh. Tiến bộ trong thị giác máy tính và nhận dạng giọng nói rất ấn tượng, với mạng nơ-ron sâu thúc đẩy cải tiến.
figure in the realm of computer science who has made significant and Lasting contributions to the field of AI his work at Google has been instrumental in propelling the company to the Forefront of AI research and development he is one of the founding members of Google brain a team that pioneered the development of large-scale AI neural networks a Cornerstone of modern AI systems his expertise and
Một nhân vật trong lĩnh vực khoa học máy tính, người đã có những đóng góp đáng kể và lâu dài cho lĩnh vực AI. Công việc của ông tại Google đã đóng vai trò quan trọng trong việc đưa công ty lên vị trí tiên phong trong nghiên cứu và phát triển AI. Ông là một trong những thành viên sáng lập của Google Brain, một nhóm tiên phong phát triển các mạng nơ-ron AI quy mô lớn, nền tảng của các hệ thống AI hiện đại. Chuyên môn và
Leadership have played a crucial role in shaping AI strategy and solidified his position as a leading voice in the AI Community please make your R Applause stage all right thank you so much I'm I'm really really delighted to be here um I my colleague Tong had asked me in 2020 to come to Vietnam and give a talk and uh unfortunately covid happened and so I wasn't able to actually make it in
khả năng lãnh đạo của ông đã đóng vai trò quan trọng trong việc định hình chiến lược AI và củng cố vị thế của ông như một tiếng nói hàng đầu trong cộng đồng AI. Xin mời ông lên sân khấu. [Vỗ tay] Cảm ơn rất nhiều. Tôi thực sự rất vui khi được ở đây. Đồng nghiệp của tôi, Tong, đã mời tôi đến Việt Nam vào năm 2020 để thuyết trình, nhưng thật không may, Covid đã xảy ra và tôi không thể đến
person although I did do a virtual talk but a uh inperson talk as a very different experience and so I'm delighted to actually be able to make it this year this is my first trip to Vietnam so I've now been here for 44 hours or something um and I'm having a great time so far I'd like to thank the organizers for having me and uh I'm just really excited to be here I think
trực tiếp, mặc dù tôi đã có một bài nói chuyện ảo. Nhưng một bài nói chuyện trực tiếp là một trải nghiệm rất khác, và tôi rất vui vì cuối cùng đã có thể đến được năm nay. Đây là chuyến đi đầu tiên của tôi đến Việt Nam, vì vậy tôi đã ở đây được khoảng 44 giờ và tôi đang có khoảng thời gian tuyệt vời. Tôi muốn cảm ơn ban tổ chức đã mời tôi và tôi thực sự rất hào hứng khi được ở đây. Tôi nghĩ
the potential of AI to transform the world is very large and I think Vietnam is in a very good position with your sort of strong uh you know education system uh bringing men many many people uh into this field is going to be really important all right so uh I'm going to basically just give a very broad overview of some of the exciting things that are happening in the field
tiềm năng của AI trong việc thay đổi thế giới là rất lớn và tôi nghĩ Việt Nam đang ở vị trí rất tốt với hệ thống giáo dục mạnh mẽ, đưa nhiều người vào lĩnh vực này sẽ thực sự quan trọng. Được rồi, tôi sẽ đưa ra một cái nhìn tổng quan rộng về một số điều thú vị đang xảy ra trong lĩnh vực
of machine learning and AI um and I'm presenting the work of many people at Google this is not all my work we have wonderful people doing lots of great work some of which I'm involved in some of which I think is just cool and you should learn about so um a few observations so first in recent years machine learning and AI have really changed our expectations of what
học máy và AI, và tôi trình bày công trình của nhiều người tại Google, không phải tất cả đều là công trình của tôi. Chúng tôi có những con người tuyệt vời làm rất nhiều công việc tuyệt vời, một số tôi tham gia, một số tôi nghĩ chỉ là thú vị và bạn nên biết về chúng. Một vài quan sát: Đầu tiên, trong những năm gần đây, học máy và AI thực sự đã thay đổi kỳ vọng của chúng ta về những gì
is possible with computers and I'll talk about that in a minute so we used to think of computers as kind of these fairly unintelligent things but with AI we're now able to actually have computers that can start to understand um you know some of the kinds of information that people effortlessly understand uh that previously was very hard for computers second thing is that
có thể với máy tính, và tôi sẽ nói về điều đó trong một phút. Chúng ta từng nghĩ máy tính là những thứ khá kém thông minh, nhưng với AI, giờ đây chúng ta có thể có những máy tính bắt đầu hiểu được một số loại thông tin mà con người dễ dàng hiểu, trước đây rất khó cho máy tính. Thứ hai là
increasing the scale of these AI systems using larger scale computation systems using larger amounts of training data increasing the model sizes that we're training all of those seem to improve better uh the results of these systems um and that's kind of a a key ingredient to how we've been able to make progress and how we'll probably continue to make progress in those
việc tăng quy mô của các hệ thống AI này bằng cách sử dụng hệ thống tính toán quy mô lớn hơn, sử dụng lượng dữ liệu huấn luyện lớn hơn, tăng kích thước mô hình mà chúng ta huấn luyện - tất cả những điều đó dường như cải thiện kết quả của các hệ thống này, và đó là một thành phần quan trọng giúp chúng ta tiến bộ và có thể sẽ tiếp tục tiến bộ trong những
fields and the third thing is the kinds of computations we want to run on computers and the hardware in which we want to run them is actually changing quite a lot uh you know the machine learning algorithms that we use actually look very different than the sort of traditional handwritten C++ or JavaScript code that many Computer Applications you're familiar with are
lĩnh vực đó. Và điều thứ ba là các loại tính toán chúng ta muốn chạy trên máy tính và phần cứng mà chúng ta muốn chạy chúng thực sự đang thay đổi khá nhiều. Các thuật toán học máy mà chúng ta sử dụng thực sự trông rất khác so với mã C++ hoặc JavaScript truyền thống được viết tay mà nhiều ứng dụng máy tính bạn quen thuộc được
built out of and so we want to be able to build Hardware that can enable us to do a better job of running these computations more efficiently um so in the last decade there's been a lot of progress on some of the sort of most fundamental problems in artificial intelligence and computer vision and you know language understanding and speech uh understanding um so we've been able to
xây dựng từ đó. Vì vậy, chúng ta muốn có thể xây dựng phần cứng cho phép chúng ta thực hiện tốt hơn các tính toán này một cách hiệu quả hơn. Trong thập kỷ qua, đã có nhiều tiến bộ trong một số vấn đề cơ bản nhất của trí tuệ nhân tạo, thị giác máy tính, hiểu ngôn ngữ và hiểu giọng nói. Chúng ta đã có thể
actually solve a lot of these problems pretty well where now you can feed in the pixels of an image and get out you know some sense of uh maybe a category of what is in that image that's a leopard or feed in the Raw audio waveform and then get a transcript of what is being said how cold is it outside um hello how are you or and get the transl version of that's that's machine
thực sự giải quyết nhiều vấn đề này khá tốt, nơi bạn có thể đưa vào các pixel của một hình ảnh và nhận ra một số ý nghĩa về danh mục của những gì trong hình ảnh đó, đó là một con báo, hoặc đưa vào dạng sóng âm thanh thô và nhận được bản ghi lại những gì đang được nói: 'Ngoài trời lạnh bao nhiêu? Xin chào, bạn khỏe không?' và nhận được phiên bản dịch, đó là máy
translation or in some cases feed in a pixel uh pixels of an image and get not just a category but actually a full description of what is in that image in the same way a human might be able to sort of give you a you know one- sentence description of an image but I think one of the most exciting things about generative AI in the last sort of three to five years is that we've
dịch, hoặc trong một số trường hợp, đưa vào các pixel của một hình ảnh và nhận được không chỉ một danh mục mà còn là một mô tả đầy đủ về những gì trong hình ảnh đó, giống như cách con người có thể đưa ra một mô tả một câu về một hình ảnh. Nhưng tôi nghĩ một trong những điều thú vị nhất về AI tạo sinh trong khoảng ba đến năm năm qua là chúng ta đã
actually been able to reverse those arrows in a lot of cases and so all of a sudden we can now generate you know hundreds or thousands of images of leopards if you say I'd like images of leopards or um you know you can go the other direction and have very high quality um uh text to speech systems like so that computers can have very natural sounding voices um you know
thực sự có thể đảo ngược các mũi tên đó trong nhiều trường hợp, và vì vậy đột nhiên chúng ta có thể tạo ra hàng trăm hoặc hàng nghìn hình ảnh về báo nếu bạn nói 'Tôi muốn hình ảnh về báo', hoặc bạn có thể đi theo hướng khác và có các hệ thống chuyển văn bản thành giọng nói chất lượng rất cao, để máy tính có thể có giọng nói rất tự nhiên.
translation being bit reversible is not that surprising U but also generative images in the sense of giving a description of an image you want and then being able to actually produce you know realistic looking imagery or in some cases videos of these things and so I think this reversal of the capabilities is key to you know some of the excitement that you see in this
Dịch thuật có thể đảo ngược không quá ngạc nhiên, nhưng cũng có hình ảnh tạo sinh theo nghĩa đưa ra mô tả về một hình ảnh bạn muốn và sau đó có thể thực sự tạo ra hình ảnh trông thực tế, hoặc trong một số trường hợp là video về những thứ đó. Và tôi nghĩ sự đảo ngược khả năng này là chìa khóa cho sự hào hứng mà bạn thấy trong
field and I think it's also important to look at the progress rate in some of these kinds of problems so uh there's a a Stanford designed contest of called the imag net challenge where your system is given a bunch of images like this and there's a set of a thousand different categorical labels and the system has to take in just the pixels of an image and produce the correct label for a bunch of
lĩnh vực này. Và tôi cũng nghĩ điều quan trọng là nhìn vào tốc độ tiến bộ trong một số loại vấn đề này. Có một cuộc thi do Stanford thiết kế gọi là thử thách ImageNet, nơi hệ thống của bạn được đưa một loạt hình ảnh như thế này và có một tập hợp một nghìn nhãn danh mục khác nhau, và hệ thống phải chỉ từ các pixel của hình ảnh và tạo ra nhãn chính xác cho một loạt
images it's never seen before um and prior to 2013 um most computer vision models were not using a full endtoend learned approach using neural networks and in 201 uh 13 uh ilas leter Alex keski and Jeffrey Hinton came out with a very famous paper uh affectionately known as Alex net that for the first time used an endtoend neural network to uh do this problem and made a dramatic Improvement
hình ảnh chưa từng thấy trước đây. Trước năm 2013, hầu hết các mô hình thị giác máy tính không sử dụng phương pháp học đầu cuối đầy đủ với mạng nơ-ron. Và vào năm 2013, Alex Krizhevsky, Ilya Sutskever và Geoffrey Hinton đã công bố một bài báo rất nổi tiếng, thường được gọi là AlexNet, lần đầu tiên sử dụng mạng nơ-ron đầu cuối để giải quyết vấn đề này và đã cải thiện đáng kể
in the accuracy so from 50.9% up to 63.3% this was like a revolutionary field uh paper in the field of computer vision that year I think there were 29 entrance to the contest and only one of them used a deep neural network uh the next year I think 28 of 30 used a neural network so this is like a huge shift in a very established field of computer vision because people saw how important
độ chính xác từ 50,9% lên 63,3%. Đây giống như một bài báo cách mạng trong lĩnh vực thị giác máy tính năm đó. Tôi nghĩ có 29 bài dự thi và chỉ một trong số đó sử dụng mạng nơ-ron sâu. Năm sau, tôi nghĩ 28 trên 30 sử dụng mạng nơ-ron. Vì vậy, đây là một sự thay đổi lớn trong một lĩnh vực thị giác máy tính rất ổn định, bởi vì mọi người thấy tầm quan trọng
and capable these systems were but it's also kind of easy to lose sight of how much progress we've made since then right we've been able to actually improve the accuracy quite substantially from you know that groundbreaking paper through now people really focusing on that bringing more people into this sort of approach is solving computer vision problems uh there's sort of a
và khả năng của các hệ thống này. Nhưng cũng dễ dàng mất dấu chúng ta đã tiến bộ bao nhiêu kể từ đó. Chúng ta đã có thể cải thiện độ chính xác khá đáng kể từ bài báo đột phá đó cho đến nay, khi mọi người thực sự tập trung vào việc đưa nhiều người hơn vào phương pháp này để giải quyết các vấn đề thị giác máy tính. Có một
similar story in speech recognition so this is actually just over the last over a five-year period rather than about a 10-year period And there's been very major reductions in the word error rate uh so going from 13.25% down to 2 and a half% and 2 and a half% is really a much more usable speech recognition system if your speech recognition system you know gets roughly one in seven words wrong
câu chuyện tương tự trong nhận dạng giọng nói. Điều này thực sự chỉ trong khoảng thời gian năm năm thay vì mười năm, và đã có những giảm rất lớn về tỷ lệ lỗi từ, từ 13,25% xuống còn 2,5%. Và 2,5% thực sự là một hệ thống nhận dạng giọng nói khả dụng hơn nhiều. Nếu hệ thống nhận dạng giọng nói của bạn sai khoảng một trong bảy từ,
that's a very different experience than something that gets one in 40 words wrong so I mentioned the fact that um computation is a really important uh capability for these models and having more computational power that is better suited for machine learning algorithms actually is something that can really Drive progress in this field because all of a sudden you can train larger models
đó là một trải nghiệm rất khác so với một hệ thống sai một trong 40 từ. Tôi đã đề cập rằng tính toán là một khả năng thực sự quan trọng cho các mô hình này, và có nhiều sức mạnh tính toán hơn phù hợp hơn với các thuật toán học máy thực sự có thể thúc đẩy tiến bộ trong lĩnh vực này, bởi vì đột nhiên bạn có thể huấn luyện các mô hình lớn hơn,
you can train them on more data with you know more efficiency um so ml optimized Hardware actually turns out to be a lot more efficient because if you really build Hardware targeted at exactly the kinds of computations you want to be able to do and discard all the other things you may not maybe not don't need for machine learning uh you get major improvements in efficiency um and so this really uh
huấn luyện chúng trên nhiều dữ liệu hơn với hiệu quả cao hơn. Phần cứng tối ưu hóa cho học máy hóa ra lại hiệu quả hơn nhiều, bởi vì nếu bạn thực sự xây dựng phần cứng nhắm chính xác vào các loại tính toán bạn muốn thực hiện và loại bỏ tất cả những thứ khác mà bạn có thể không cần cho học máy, bạn sẽ đạt được những cải thiện lớn về hiệu quả. Và điều này thực sự