N
NatiStream
Transcript
Hiển thị

The Decade of Agents

Andrej Karpathy predicts that AI agents will take a decade to mature, drawing on his 15 years of experience. He argues that current agents lack intelligence, multimodality, computer use, and continual learning. Early reinforcement learning on games was a misstep; agents need real-world interaction. The foundation must be a large language model built through pre-training, which acts like 'crappy evolution' bootstrapping intelligence from internet data. Agents struggle to go off the data manifold of internet content.

Andrej Karpathy dự đoán rằng các tác nhân AI sẽ mất một thập kỷ để trưởng thành, dựa trên 15 năm kinh nghiệm của ông. Ông cho rằng các tác nhân hiện tại thiếu trí thông minh, đa phương thức, khả năng sử dụng máy tính và học tập liên tục. Việc học tăng cường sớm trên các trò chơi là một bước đi sai lầm; các tác nhân cần tương tác với thế giới thực. Nền tảng phải là một mô hình ngôn ngữ lớn được xây dựng thông qua tiền huấn luyện, hoạt động như 'sự tiến hóa tồi tệ' khởi tạo trí thông minh từ dữ liệu internet. Các tác nhân gặp khó khăn khi đi ra ngoài không gian dữ liệu của nội dung internet.

Reinforcement learning is terrible.

Học tăng cường thật tệ.

It just so happens that everything that we had before is much worse.

Thực ra mọi thứ chúng ta có trước đây còn tệ hơn nhiều.

I'm actually optimistic.

Tôi thực sự lạc quan.

I think this will work.

Tôi nghĩ điều này sẽ hiệu quả.

I think it's tractable.

Tôi nghĩ nó khả thi.

I'm only sounding pessimistic because when I go on my Twitter timeline, I see all this stuff that makes no sense to me.

Tôi chỉ tỏ ra bi quan vì khi lướt Twitter, tôi thấy toàn thứ vô nghĩa.

A lot of it is, I think, honestly just uh fundraising.

Nhiều thứ trong số đó, tôi nghĩ, thực sự chỉ là gây quỹ.

We're not actually building animals.

Chúng ta không thực sự xây dựng động vật.

We're building ghosts.

Chúng ta đang xây dựng những bóng ma.

These

Những

like sort of ethereal spirit entities because they're fully digital and they're kind of like mimicking humans.

Giống như các thực thể linh hồn thanh tao vì chúng hoàn toàn kỹ thuật số và bắt chước con người.

And it's a different kind of intelligence.

Và đó là một dạng trí thông minh khác.

It's business as usual because we're in an intelligence explosion already and have been for decades.

Mọi chuyện vẫn như thường lệ vì chúng ta đã ở trong một vụ nổ trí tuệ từ nhiều thập kỷ nay.

Everything is gradually being automated.

Mọi thứ đang dần được tự động hóa.

Has been for hundreds of years.

Đã diễn ra hàng trăm năm nay.

Don't write blog posts.

Đừng viết blog.

Don't do slides.

Đừng làm slide.

Don't do any of that.

Đừng làm bất cứ điều gì như thế.

Like build the code, arrange it, get it to work.

Hãy viết code, sắp xếp nó, làm cho nó chạy.

It's the only way to go.

Đó là cách duy nhất.

Otherwise, you're missing knowledge.

Nếu không, bạn đang thiếu kiến thức.

If you have a perfect AI tutor, maybe you can get extremely far.

Nếu bạn có một gia sư AI hoàn hảo, có thể bạn sẽ tiến xa.

The geniuses of today are barely scratching the surface of what a human mind can do.

Những thiên tài ngày nay chỉ mới chạm đến bề mặt của những gì tâm trí con người có thể làm.

I think - today I'm speaking with Andre Karpathy.

Tôi nghĩ - hôm nay tôi đang nói chuyện với Andre Karpathy.

Andre, why do you say that this will be the decade of agents and not the year of agents?

Andre, tại sao anh nói đây sẽ là thập kỷ của các tác nhân, chứ không phải năm của các tác nhân?

- Mhm.

- Ừm.

Uh well first of all uh thank you for uh having me here.

Ừ, trước hết cảm ơn anh đã mời tôi đến đây.

I'm excited to be here.

Tôi rất vui được ở đây.

So the quote that you've just mentioned it's the decade of agents.

Câu nói anh vừa nhắc đến là thập kỷ của các tác nhân.

That's actually a reaction to an existing pre-existing quote I should say where I think a lot of some of the labs I'm not actually sure who said this but they were alluding to this being the year of agents - uh with respect to LLMs and uh how they were going to evolve.

Đó thực ra là phản ứng với một câu nói có sẵn trước đó, tôi nghĩ một số phòng thí nghiệm, tôi không thực sự biết ai đã nói điều này, nhưng họ ám chỉ đây là năm của các tác nhân - liên quan đến LLM và cách chúng sẽ phát triển.

And I think um I was triggered by that because I feel like there's some overpredictions going

Và tôi nghĩ tôi đã bị kích thích bởi điều đó vì tôi cảm thấy có một số dự đoán quá mức đang diễn ra

on in the industry and uh in my mind this is really a lot more accurately described as the decade of agents and we have some very early agents that are actually like extremely impressive and that I use daily uh you know cloud and codeex and so on but I still feel like there's uh so much work to be done and so I think my like my reaction is like we'll be working with these things for

trong ngành và theo tôi, điều này thực sự chính xác hơn khi được mô tả là thập kỷ của các tác nhân và chúng ta có một số tác nhân rất sớm thực sự ấn tượng và tôi sử dụng hàng ngày như Cloud và Codex, v.v., nhưng tôi vẫn cảm thấy còn rất nhiều việc phải làm và vì vậy phản ứng của tôi là chúng ta sẽ làm việc với những thứ này trong

decade they're going to get better uh and uh it's going to be wonderful but I think I was just reacting to the timelines I suppose of of the uh implication - and what do you think will take a decade to accomplish?

một thập kỷ, chúng sẽ trở nên tốt hơn và điều đó thật tuyệt vời, nhưng tôi nghĩ tôi chỉ phản ứng với các mốc thời gian thôi - và anh nghĩ điều gì sẽ mất một thập kỷ để hoàn thành?

What are the bottlenecks?

Những nút thắt là gì?

- Well, um actually make it work.

- Ừm, thực sự là làm cho nó hoạt động.

So in my mind, I mean when you're talking about an agent, I guess or what the labs have in mind and what maybe I have in mind as well is it's uh you should think of it almost like an employee or like an intern that you would hire to work with you.

Theo tôi, khi nói về một tác nhân, tôi đoán ý của các phòng thí nghiệm và có thể cả tôi nữa là bạn nên nghĩ về nó gần như một nhân viên hoặc một thực tập sinh mà bạn thuê để làm việc cùng.

Uh so for example, you work with some employees here.

Ví dụ, bạn làm việc với một số nhân viên ở đây.

Um when would you prefer to have an agent like Cloud or

Khi nào bạn muốn có một tác nhân như Cloud hoặc

Codeex uh do that work?

Codex làm công việc đó?

Like currently of course they can't.

Hiện tại tất nhiên chúng không thể.

What would it take for them to be able to do that?

Cần gì để chúng có thể làm được điều đó?

Why don't you do it today?

Tại sao bạn không làm điều đó hôm nay?

And the reason you don't do it today is because they just don't work.

Và lý do bạn không làm hôm nay là vì chúng không hoạt động.

So like they don't have enough intelligence.

Chúng không đủ thông minh.

They're not multimodal enough.

Chúng chưa đa phương thức.

They can't do computer use and all this kind of stuff.

Chúng không thể sử dụng máy tính và những thứ tương tự.

And they don't do a lot of things.

Và chúng không làm được nhiều thứ.

You know, they don't have continual learning.

Bạn biết đấy, chúng không có học liên tục.

You can't just tell them something and they'll remember it.

Bạn không thể nói với chúng điều gì đó và chúng sẽ nhớ.

And they're just cognitively lacking.

Và chúng thiếu hụt về mặt nhận thức.

And it's just not working.

Và nó không hoạt động.

And I just think that it will take about a decade to work through all of those issues.

Và tôi chỉ nghĩ rằng sẽ mất khoảng một thập kỷ để giải quyết tất cả những vấn đề đó.

- Interesting.

- Thú vị.

So, um, as a professional podcaster and a a viewer of AI from afar, it's sort of easy to identify for me like, oh, here's what's lacking.

Vì vậy, ừm, với tư cách là một podcaster chuyên nghiệp và một người xem AI từ xa, tôi dễ dàng nhận ra những gì còn thiếu.

Continual learning is lacking or multimodality is lacking.

Học liên tục còn thiếu hoặc đa phương thức còn thiếu.

But I don't really have a good um way of trying to put a timeline on it.

Nhưng tôi thực sự không có cách tốt để ước lượng thời gian.

Like if somebody's like, how long will continual learning take?

Ví dụ nếu ai đó hỏi, học liên tục sẽ mất bao lâu?

I - there's no like prior I have about like

Tôi - không có kinh nghiệm trước đó về việc

this is a project that should take 5 years, 10 years, 50 years.

Đây là một dự án nên mất 5 năm, 10 năm hay 50 năm.

- Why a decade?

- Tại sao là một thập kỷ?

Why not one year?

Tại sao không phải một năm?

Why not 50 years?

Tại sao không phải 50 năm?

- Um, yeah, I guess this is where you get into like a bit of I guess my own intuition a little bit and also just kind of doing a bit of an extrapolation of with respect to my own experience in the field, right?

- Ừm, tôi đoán đây là lúc bạn đi vào trực giác của riêng tôi và cũng là ngoại suy từ kinh nghiệm của tôi trong lĩnh vực này.

So, I guess I've been in AI for - almost two decades.

Vậy, tôi đã làm việc trong AI gần hai thập kỷ.

I mean, it's going to be maybe 15 years or so, not that long.

Ý tôi là, có lẽ khoảng 15 năm, không lâu lắm.

um you had Richard Sutton here who

Ừm, bạn đã có Richard Sutton ở đây, người

was around of course for much longer but I do have about 15 years of experience of people making predictions of seeing how they actually uh turned out and also I was in the industry for a while and I was in research and I've worked in the industry for a while so I guess I kind of have uh just a general intuition that I have left from that uh and uh I feel like the problems are uh tractable

Đã có mặt lâu hơn nhiều, nhưng tôi có khoảng 15 năm kinh nghiệm về việc mọi người đưa ra dự đoán và thấy chúng thực sự diễn ra như thế nào, và tôi cũng đã làm việc trong ngành một thời gian và trong nghiên cứu, vì vậy tôi có một trực giác chung từ đó, và tôi cảm thấy các vấn đề có thể giải quyết được.

they're surmountable - but uh they're still difficult and if I just average it out that just kind of feels like a ticket I guess to me - this is actually quite interesting I want to like hear not only the history but what people in the room felt was about to happen at various different - breakthrough moments like what were the ways in which their feelings were either

Chúng có thể vượt qua - nhưng vẫn khó khăn, và nếu tôi tính trung bình, nó có vẻ như một con số phù hợp với tôi - điều này thực sự thú vị, tôi muốn nghe không chỉ lịch sử mà còn cảm xúc của mọi người trong phòng tại các thời điểm đột phá khác nhau, những cách mà cảm xúc của họ hoặc là

overly pessimistic or overly optimistic?

Quá bi quan hay quá lạc quan?

- Yeah.

- Ừ.

- Yeah.

- Ừ.

Should we just go through each of them one by one?

Chúng ta nên đi qua từng cái một?

- Oh yeah.

- Ồ, được.

I mean that's a giant question because of course you're talking about 15 years of stuff that happened.

Ý tôi là đó là một câu hỏi lớn vì tất nhiên bạn đang nói về 15 năm sự kiện đã xảy ra.

I mean AI is actually like so wonderful because there have been a number of I would say seismic shifts - that were like the entire field has sort of like suddenly looked a different way, right?

Ý tôi là AI thực sự tuyệt vời vì đã có một số thay đổi lớn, tôi có thể nói là những cú sốc địa chấn, khiến toàn bộ lĩnh vực đột nhiên nhìn theo một hướng khác.

And I guess I've maybe lived through two or three of those.

Và tôi nghĩ tôi đã trải qua hai hoặc ba trong số đó.

- And I still think there will continue to be some because they come with some kind of like almost surprising irregularity.

- Và tôi vẫn nghĩ sẽ còn tiếp tục có một số, bởi vì chúng đến với sự bất thường gần như đáng ngạc nhiên.

- Well, my when my career began, of course, like when I started to work on deep learning, when I became interested in deep learning, this was just kind of like by chance of being right next to Jeff Hinton at University of Toronto.

- Chà, khi sự nghiệp của tôi bắt đầu, tất nhiên, khi tôi bắt đầu làm việc với deep learning, khi tôi trở nên quan tâm đến deep learning, điều này chỉ là tình cờ khi ở cạnh Jeff Hinton tại Đại học Toronto.

And Jeff Hinton, of course, is kind of like the godfather figure of AI and he was training all these neural networks and I thought it was incredible and interesting, but this was not like the main thing that everyone in AI was doing by far.

Và Jeff Hinton, tất nhiên, giống như một nhân vật cha đỡ đầu của AI và ông ấy đang huấn luyện tất cả các mạng nơ-ron này và tôi nghĩ nó thật phi thường và thú vị, nhưng đây không phải là điều chính mà mọi người trong AI đang làm.

Yeah, - this was a niche subject on the side.

Ừ, - đó là một chủ đề nhỏ bên lề.

That's kind of maybe like the first like dramatic sort of seismic shift that came with the Alexet and so on.

Đó có lẽ là cú sốc địa chấn đầu tiên với AlexNet và những thứ tương tự.

- I would say like Alex sort of reoriented everyone and everyone started to train neural networks.

- Tôi sẽ nói rằng Alex đã định hướng lại mọi người và mọi người bắt đầu huấn luyện mạng nơ-ron.

Uh but it was still like very like per task per specific task.

Ừ, nhưng nó vẫn rất cụ thể cho từng nhiệm vụ.

So maybe I have an image classifier or I have a neural machine translator or something like that.

Vì vậy, có thể tôi có một bộ phân loại hình ảnh hoặc một trình dịch máy nơ-ron hoặc thứ gì đó tương tự.

And people became very slowly actually interested in basically kind of agents I would say.

Và mọi người bắt đầu quan tâm rất chậm đến các tác nhân, tôi có thể nói vậy.

uh um and people started to

Ừ, và mọi người bắt đầu

think okay well maybe we have a check mark next to the visual cortex or something like that but what about the other parts of the brain and how can we get an actual like full agent or an full entity that can actually interact in the world and I would say the Atari uh sort of uh deep reinforcement learning shift in 2013 or so uh was part of that early effort of agents in my mind because it

Nghĩ rằng, được rồi, có lẽ chúng ta đã có dấu kiểm bên cạnh vỏ não thị giác, nhưng còn các phần khác của não thì sao và làm thế nào để có được một tác nhân hoàn chỉnh hoặc một thực thể hoàn chỉnh có thể tương tác trong thế giới thực, và tôi sẽ nói rằng sự thay đổi trong deep reinforcement learning với Atari vào khoảng năm 2013 là một phần của nỗ lực ban đầu về tác nhân trong tâm trí tôi, bởi vì nó

was an attempt to try to get agents that not just perceive the world but also take actions and interact and get rewards from environments and at the time this was Atari games - right - and I kind of feel like that was a misstep actually uh and it was a misstep that actually even the early openi that I was a part of course uh kind of adopted because at that time the

Là một nỗ lực để có được các tác nhân không chỉ nhận thức thế giới mà còn hành động và tương tác và nhận phần thưởng từ môi trường, và lúc đó là các trò chơi Atari - phải - và tôi cảm thấy đó thực sự là một bước đi sai lầm, và đó là bước đi sai lầm mà ngay cả OpenAI thời kỳ đầu mà tôi là một phần cũng đã áp dụng, bởi vì lúc đó

sitegeist was reinforcement learning environments games playing beat games get lots of different types of games and open was doing a lot of that.

Tinh thần thời đại là reinforcement learning, môi trường trò chơi, đánh bại trò chơi, có nhiều loại trò chơi khác nhau và OpenAI đã làm rất nhiều điều đó.

So that was maybe like another like prominent part of I would say AI where maybe for two or three or four years everyone was doing reinforcement learning on games - and uh basically that was a little bit of a misstep

Vì vậy, đó có lẽ là một phần nổi bật khác của AI, nơi trong hai, ba hoặc bốn năm, mọi người đều làm reinforcement learning trên trò chơi - và về cơ bản đó là một bước đi sai lầm

- and what I was trying to do at open a actually is like I was always a little bit suspicious of games as being like this thing that would actually lead to AGI because in my mind you want something like an accountant or uh like something that's actually interacting with the real world and I just didn't see how games kind of like add up to it and so my project at OpenAI for example

- và điều tôi cố gắng làm tại OpenAI thực ra là tôi luôn hơi nghi ngờ về trò chơi như một thứ sẽ dẫn đến AGI, bởi vì trong tâm trí tôi, bạn muốn một thứ gì đó như kế toán viên hoặc thứ gì đó thực sự tương tác với thế giới thực, và tôi không thấy trò chơi có thể dẫn đến điều đó, vì vậy dự án của tôi tại OpenAI chẳng hạn

was um within in the scope of the universe project on an on an agent that was using keyboard and mouse to operate web pages.

Là trong phạm vi của dự án Universe, về một tác nhân sử dụng bàn phím và chuột để vận hành các trang web.

And I really wanted to have something that like interacts with, you know, the actual digital world that can do knowledge work.

Và tôi thực sự muốn có một thứ tương tác với thế giới kỹ thuật số thực tế, có thể làm công việc tri thức.

- And it just so turns out that um this was extremely early, way too early.

- Và hóa ra điều này cực kỳ sớm, quá sớm.

so early that we shouldn't have been working on that, you know, uh because um if you're just stumbling your way around and keyboard mashing and mouse clicking and trying to get rewards in these environments, um your reward is too sparse and you just won't learn and you're going to burn a forest uh

Quá sớm đến nỗi chúng tôi không nên làm việc đó, bạn biết đấy, bởi vì nếu bạn chỉ loay hoay với bàn phím và chuột và cố gắng nhận phần thưởng trong những môi trường đó, phần thưởng của bạn quá thưa thớt và bạn sẽ không học được gì, và bạn sẽ đốt cháy một khu rừng

computing and you're never actually going to get something off the ground.

Tính toán và bạn sẽ không bao giờ thực sự có được thứ gì đó khởi sắc.

- And so what you're missing is this uh power of representation in the neural network.

- Và điều bạn thiếu là sức mạnh của biểu diễn trong mạng nơ-ron.

- And so for example, today people are training those computer using agents, but they're doing it on top of a large language model.

- Và ví dụ, ngày nay người ta huấn luyện các tác nhân sử dụng máy tính, nhưng họ làm điều đó trên nền tảng của một mô hình ngôn ngữ lớn.

And so you actually have to get the language model first.

Và vì vậy bạn thực sự phải có mô hình ngôn ngữ trước.

you have to get the representations first and you have to do that by all the pre-training and all the LLM stuff.

Bạn phải có các biểu diễn trước và bạn phải làm điều đó thông qua tất cả quá trình tiền huấn luyện và tất cả các thứ liên quan đến LLM.

So I kind of feel like maybe loosely speaking it was like people keep maybe trying to

Vì vậy, tôi cảm thấy có lẽ nói một cách lỏng lẻo thì giống như mọi người có thể liên tục cố gắng

get the full thing too early a few times where people like really try to go after agents too early I would say and that was Atari and Universe - uh and even my own experience and you actually have to do some things first before you sort of get to those agents.

Đạt được toàn bộ thứ quá sớm một vài lần khi mọi người thực sự cố gắng theo đuổi các tác nhân quá sớm, tôi sẽ nói vậy, và đó là Atari và Universe, và thậm chí cả kinh nghiệm của riêng tôi, và bạn thực sự phải làm một số việc trước khi bạn có thể đạt được những tác nhân đó.

Um, and maybe now the agents are a lot more competent, but maybe we're still missing uh sort of some parts uh of that stack.

Ừm, và có lẽ bây giờ các tác nhân đã thành thạo hơn nhiều, nhưng có lẽ chúng ta vẫn đang thiếu một số phần của ngăn xếp đó.

But I would say maybe those are like the three like major buckets of what people were doing.

Nhưng tôi sẽ nói có lẽ đó là ba nhóm chính về những gì mọi người đang làm.

Uh, training neural nets per tasks trying to the first round of agents uh and then maybe the LLMs and actually seeking the representation power of the neural

Ừm, huấn luyện mạng nơ-ron cho từng nhiệm vụ, cố gắng thực hiện đợt tác nhân đầu tiên, và sau đó có thể là LLM và thực sự tìm kiếm sức mạnh biểu diễn của mạng nơ-ron

networks before you uh tack on everything else on top.

trước khi bạn thêm mọi thứ khác lên trên.

- Interesting.

- Thú vị.

Yeah, I guess if I were to steal man, the sort of the sudden perspective would be that humans actually can just take on everything at once, right?

Vâng, tôi đoán nếu tôi ăn cắp, thì quan điểm đột ngột sẽ là con người thực sự có thể tiếp nhận mọi thứ cùng một lúc, phải không?

Even animals can take on everything at once, right?

Ngay cả động vật cũng có thể tiếp nhận mọi thứ cùng một lúc, phải không?

Animals are maybe a better example because they don't even have the scaffold of language.

Động vật có lẽ là một ví dụ tốt hơn vì chúng thậm chí không có giàn giáo của ngôn ngữ.

They just get thrown out into the world and they just have to make

Chúng chỉ bị ném ra thế giới và chúng phải tự tìm hiểu

sense of everything without any labels.

mọi thứ mà không có bất kỳ nhãn nào.

Um, - and the vision for AGI then should just be something which like just looks at sensory data, looks at the computer screen, and it just like figures out what's going on from scratch.

Ừm, - và tầm nhìn cho AGI sau đó chỉ nên là thứ gì đó giống như chỉ nhìn vào dữ liệu cảm giác, nhìn vào màn hình máy tính, và nó chỉ tự tìm ra chuyện gì đang xảy ra từ đầu.

I mean, if a human was put in a similar situation, had to be trained from scratch, but I mean, this is like a human growing up or an animal growing up.

Ý tôi là, nếu một con người được đặt trong tình huống tương tự, phải được huấn luyện từ đầu, nhưng ý tôi là, điều này giống như một con người lớn lên hoặc một con vật lớn lên.

So, why shouldn't that be the vision for AI rather than

Vậy tại sao đó không phải là tầm nhìn cho AI thay vì

like this thing where we're doing millions of years of training?

thứ như thế này nơi chúng ta đang thực hiện hàng triệu năm huấn luyện?

I think that's a really good question and I think um I mean so Sutton was on your podcast and I saw the podcast and I had a write up about that podcast almost that gets into a little bit of how I see things and I kind of feel like I'm very careful to make analogies to animals because they came about by a

Tôi nghĩ đó là một câu hỏi thực sự hay và tôi nghĩ ừm, ý tôi là Sutton đã tham gia podcast của bạn và tôi đã xem podcast đó và tôi đã có một bài viết về podcast đó gần như đề cập đến cách tôi nhìn nhận mọi thứ và tôi cảm thấy mình rất cẩn thận khi đưa ra những phép loại suy với động vật bởi vì chúng xuất hiện thông qua một quá trình tối ưu hóa rất khác.

very different optimization process.

Rất khác.

- Animals are evolved and they actually come with a huge amount of hardware that's built in.

- Động vật được tiến hóa và chúng thực sự đi kèm với một lượng lớn phần cứng được tích hợp sẵn.

Um, and when, for example, my example in the post was the zebra.

Ừm, và ví dụ, trong bài viết của tôi, ví dụ là con ngựa vằn.

A zebra gets born and a few minutes later it's running around and following its mother.

Một con ngựa vằn được sinh ra và vài phút sau nó đã chạy nhảy và theo mẹ nó.

That's an extremely complicated thing to do.

Đó là một việc cực kỳ phức tạp để làm.

- Yeah.

- Vâng.

- Um, that's not reinforcement learning.

- Ừm, đó không phải là học tăng cường.

That's something that's baked in.

Đó là thứ gì đó được tích hợp sẵn.

And evolution obviously has some way of encoding the weights of our neural nets in ATCGS.

Và tiến hóa rõ ràng có một cách nào đó để mã hóa trọng số của mạng nơ-ron của chúng ta trong ATCGS.

And I have no idea how that works, but it apparently works.

Và tôi không biết điều đó hoạt động như thế nào, nhưng nó dường như hoạt động.

So, I kind of feel like uh brains just were came from a very different process.

Vì vậy, tôi cảm thấy rằng bộ não chỉ đến từ một quá trình rất khác.

And I'm very hesitant to take inspiration from it because we're not actually running that process.

Và tôi rất ngần ngại khi lấy cảm hứng từ nó bởi vì chúng ta không thực sự chạy quá trình đó.

So in my post, I

Vì vậy, trong bài viết của tôi, tôi

kind of said we're not actually building animals.

Đã nói rằng chúng ta không thực sự xây dựng động vật.

Uh we're building ghosts.

Ừm, chúng ta đang xây dựng những bóng ma.

- Yeah.

- Vâng.

- Or spirits or whatever people want to call it.

- Hoặc linh hồn hay bất cứ thứ gì mọi người muốn gọi.

Uh because um we're not uh we're not doing training by evolution.

Ừm bởi vì chúng ta không thực hiện huấn luyện bằng tiến hóa.

Uh we're doing training by basically imitation of humans and the data that they've put on the internet.

Ừm, chúng ta đang thực hiện huấn luyện bằng cách bắt chước con người và dữ liệu họ đã đưa lên internet.

And so you end up with these like sort of ethereal spirit entities because they're fully digital and they're kind of like mimicking humans.

Và vì vậy bạn kết thúc với những thực thể linh hồn thanh tao này bởi vì chúng hoàn toàn kỹ thuật số và chúng giống như bắt chước con người.

And it's a different kind of intelligence.

Và đó là một loại trí thông minh khác.

Like if you imagine a space of intelligences, we're we're starting off at a different point

Giống như nếu bạn tưởng tượng một không gian của các trí thông minh, chúng ta đang bắt đầu từ một điểm khác

almost.

gần như.

We're not we're not really building animals, but I think it's also possible to make them a bit more animallike over time.

Chúng ta không thực sự xây dựng động vật, nhưng tôi nghĩ cũng có thể làm cho chúng giống động vật hơn theo thời gian.

And I think we should be doing that.

Và tôi nghĩ chúng ta nên làm điều đó.

And so I kind of feel like so just I guess one more point is I do feel like Sutton basically has a very like his framework is like we want to build animals and I actually think that would be wonderful if we can get

Và vì vậy tôi cảm thấy, chỉ một điểm nữa, tôi nghĩ Sutton về cơ bản có một khuôn khổ rất giống như chúng ta muốn xây dựng động vật và tôi thực sự nghĩ điều đó sẽ tuyệt vời nếu chúng ta có thể làm cho nó hoạt động, điều đó sẽ thật tuyệt vời.

that to work that would be amazing.

Nếu có một thuật toán duy nhất mà bạn có thể chạy trên internet và nó học mọi thứ, điều đó sẽ thật phi thường.

If there was a single like - algorithm that you can just you know run on the internet and it learns everything that would be incredible.

Tôi gần như nghi ngờ rằng tôi không thực sự chắc chắn nó có tồn tại hay không và chắc chắn đó không phải là những gì động vật làm - bởi vì động vật có vòng lặp bên ngoài của tiến hóa, - phải không?

I almost suspect that I'm not actually sure that it exists and that's certainly actually not what animals do - because animals have this outer loop of evolution, - right?

Ừm, và rất nhiều thứ trông giống như học tập thực ra là sự trưởng thành của não bộ nhiều hơn và tôi nghĩ rằng thực sự rất ít học tăng cường ở động vật và tôi nghĩ rất nhiều học tăng cường thực ra giống như các nhiệm vụ vận động hơn.

Um, and a lot of what looks like learning is actually a lot more maturation of the brain and I think that actually very little reinforcement learning for animals and I think a lot of the reinforcement learning is actually like more like motor tasks.

Nó không phải là các nhiệm vụ trí tuệ.

It's not intelligence tasks.

Vì vậy, tôi thực sự nghĩ rằng con người không thực sự sử dụng RL một cách đại khái là những gì tôi sẽ nói.

So I actually kind of think humans don't actually like really use RL roughly speaking is what I would say.

Bạn có thể đọc câu cuối cùng không?

Can you read the last sentence?

Bạn có thể đọc câu cuối cùng không?

A lot of that intelligence is not motor task.

Rất nhiều trí thông minh đó không phải là nhiệm vụ vận động.

It's what?

Nó là gì?

Sorry.

Xin lỗi.

A lot of the reinforcement learning in my perspective would be things that are a lot more like motor like uh simple kind of like task throwing a hoop or something like that.

Theo quan điểm của tôi, phần lớn học tăng cường sẽ là những thứ giống như vận động hơn, như những nhiệm vụ đơn giản kiểu như ném vòng hoặc gì đó tương tự.

Um but I don't think that humans use reinforcement learning for a lot of intelligence tasks like problem solving and so on.

Ừm, nhưng tôi không nghĩ con người sử dụng học tăng cường cho nhiều nhiệm vụ trí tuệ như giải quyết vấn đề, v.v.

- Interesting.

- Thú vị.

That doesn't mean we don't have we shouldn't do that for research but I just feel like that's what animals do or don't.

Điều đó không có nghĩa là chúng ta không nên làm điều đó cho nghiên cứu, nhưng tôi chỉ cảm thấy đó là những gì động vật làm hoặc không.

- I'm going to take us a second to digest that because there's a lot of different ideas.

- Tôi sẽ dành một chút thời gian để tiếp thu điều đó vì có rất nhiều ý tưởng khác nhau.

Maybe one clarifying question I can ask to um understand a perspective.

Có lẽ tôi có thể hỏi một câu làm rõ để hiểu quan điểm.

So I think you suggest that look evolution is doing the kind of thing that pre-training does in the sense of building something which can then understand the world.

Vì vậy, tôi nghĩ bạn gợi ý rằng, hãy nhìn xem, tiến hóa đang làm loại việc mà tiền huấn luyện làm, theo nghĩa xây dựng một thứ gì đó sau đó có thể hiểu thế giới.

The difference I guess is that evolution has to be titrated in the case of humans through 3 gigabytes of DNA.

Sự khác biệt, tôi đoán, là tiến hóa phải được định lượng trong trường hợp của con người thông qua 3 gigabyte DNA.

And so that's very unlike the weights of a model.

Và điều đó rất khác so với các trọng số của một mô hình.

I mean literally the weights of the model are a brain which obviously is

Ý tôi là, theo nghĩa đen, các trọng số của mô hình là một bộ não, rõ ràng là

not encoded in the sperm and the egg or does not exist in the sperm and the egg.

Không được mã hóa trong tinh trùng và trứng hoặc không tồn tại trong tinh trùng và trứng.

So it has to be grown and also the information for every single synapse in the brain simply cannot exist in the 3 gigabytes that exist in the DNA.

Vì vậy, nó phải được phát triển và thông tin cho mọi khớp thần kinh trong não đơn giản là không thể tồn tại trong 3 gigabyte có trong DNA.

Evolution seems closer to finding the algorithm - which then does the lifetime learning.

Tiến hóa dường như gần với việc tìm ra thuật toán - sau đó thực hiện học tập suốt đời.

Now maybe the lifetime learning is not analogous to RL to your point.

Bây giờ có lẽ học tập suốt đời không tương tự như RL theo quan điểm của bạn.

Is that compatible with the thing you were saying or would you disagree with that?

Điều đó có tương thích với điều bạn đang nói hay bạn sẽ không đồng ý với điều đó?

- I think so.

- Tôi nghĩ vậy.

I would agree with you that there's some miraculous compression going on because obviously the weights of the neural net are not stored in ATCGs.

Tôi đồng ý với bạn rằng có một sự nén kỳ diệu nào đó đang diễn ra vì rõ ràng các trọng số của mạng nơ-ron không được lưu trữ trong ATCG.

There's some kind of a dramatic compression and there's some kind of like learning algorithms encoded that that take over and do some of the learning online.

Có một loại nén mạnh mẽ và có một số loại thuật toán học tập được mã hóa để tiếp quản và thực hiện một số học tập trực tuyến.

So I definitely agree with you on that.

Vì vậy, tôi chắc chắn đồng ý với bạn về điều đó.

Basically I would say I'm a lot more kind of like practically minded.

Về cơ bản, tôi sẽ nói rằng tôi thiên về thực tế hơn nhiều.

I don't come at it from the perspective of like let's build animals.

Tôi không tiếp cận nó từ góc độ như 'hãy xây dựng động vật'.

I come from it perspective of like let's build useful things.

Tôi tiếp cận từ góc độ như 'hãy xây dựng những thứ hữu ích'.

So I have a hard hat on and I'm just observing that look we're not going to do evolution because I don't know how to do that.

Vì vậy, tôi đội mũ cứng và chỉ quan sát rằng, chúng ta sẽ không làm tiến hóa vì tôi không biết làm thế nào.

Uh but it does turn out we can build these ghost spirit-l like

Ừm, nhưng hóa ra chúng ta có thể xây dựng những thực thể giống như ma quỷ này

entities by imitating internet documents.

bằng cách bắt chước các tài liệu internet.

This works and it's actually kind of like it's a way to bring you up to something that has a lot of sort of built-in knowledge and intelligence in some way.

Điều này hiệu quả và thực sự nó giống như một cách để đưa bạn lên một thứ có nhiều kiến thức và trí thông minh tích hợp sẵn theo một cách nào đó.

Uh similar to maybe what evolution has done.

Ừm, tương tự như những gì tiến hóa đã làm.

So that's why I kind of call pre-training this kind of like crappy evolution.

Vì vậy, đó là lý do tại sao tôi gọi tiền huấn luyện là một loại tiến hóa tồi tệ.

It's like the practically possible version with our

Nó giống như phiên bản khả thi trong thực tế với

technology and what we have available to us to get to a starting point where we can actually do things like reinforcement learning and so on.

công nghệ và những gì chúng ta có sẵn để đạt đến điểm khởi đầu nơi chúng ta thực sự có thể làm những việc như học tăng cường, v.v.

M just to steelman the other perspective because after doing this in an interview and thinking about it a bit he has an important point here evolution does not give us the knowledge really right it gives us the algorithm to find the

Tôi chỉ muốn bảo vệ quan điểm khác vì sau khi làm điều này trong một cuộc phỏng vấn và suy nghĩ một chút, anh ấy có một điểm quan trọng: tiến hóa không thực sự cho chúng ta kiến thức, đúng không? Nó cho chúng ta thuật toán để tìm ra

knowledge and that seems different from pre-raining so if perhaps the perspective is that pre-training helps build the kind of entity which can learn better it teaches metal learning and therefore it is some similar to like finding an algorithm um but if it's like evolution gives us knowledge and pre-training gives us knowledge they're not that analogy seems to break down

kiến thức và điều đó có vẻ khác với tiền huấn luyện. Vì vậy, có lẽ quan điểm là tiền huấn luyện giúp xây dựng loại thực thể có thể học tốt hơn, nó dạy học siêu cấp và do đó nó tương tự như việc tìm ra một thuật toán. Nhưng nếu tiến hóa cho chúng ta kiến thức và tiền huấn luyện cho chúng ta kiến thức, thì sự tương tự đó dường như sụp đổ.

- so it's subtle and I You're you're right to push back on it, but basically the thing that pre-training is doing, so you're basically getting the next token predictor on over the internet and you're training that into a neural net.

- Vì vậy, nó tinh tế và bạn đúng khi phản bác lại, nhưng về cơ bản, điều mà tiền huấn luyện làm, bạn về cơ bản có được bộ dự đoán token tiếp theo trên internet và bạn huấn luyện nó thành một mạng nơ-ron.

It's doing two things actually that are kind of like unrelated.

Nó thực sự làm hai việc không liên quan đến nhau.

Number one, it's picking up all this knowledge as I call it.

Thứ nhất, nó thu thập tất cả kiến thức này như tôi gọi.

Number two, it's actually becoming intelligent.

Thứ hai, nó thực sự trở nên thông minh.

Um, by observing the algorithmic patterns in the internet, it actually kind of like boots up all these like little circuits and algorithms inside the neural net to do things like in context learning and all this kind of stuff.

Ừm, bằng cách quan sát các mẫu thuật toán trên internet, nó thực sự khởi động tất cả các mạch và thuật toán nhỏ bên trong mạng nơ-ron để làm những việc như học trong ngữ cảnh và tất cả những thứ này.

And actually, you don't actually need or want the knowledge.

Và thực sự, bạn không thực sự cần hoặc muốn kiến thức.

I actually think that's probably actually holding back the neural networks overall because it's actually like getting them to rely on the knowledge a little too much sometimes.

Tôi thực sự nghĩ rằng điều đó có lẽ đang kìm hãm các mạng nơ-ron nói chung vì nó thực sự khiến chúng phụ thuộc quá nhiều vào kiến thức đôi khi.

For example, I kind of feel like agents one thing they're not very good at is going off the data manifold of what exists on the internet.

Ví dụ, tôi cảm thấy rằng các tác nhân có một điều không giỏi là đi ra khỏi đa tạp dữ liệu của những gì tồn tại trên internet.

1 / 10