The OpenAI reasoning research team discusses their recent math breakthrough, including achieving gold in the International Math Olympiad and disproving an 80-year-old open problem, the unit distance conjecture by Erdős. The team members are Alexander Wang, Hung Shing Wu, and Le Jia Chen. Inference time compute allows models to think longer and improve answers. The model demonstrated advanced reasoning capabilities by solving a major open problem in discrete geometry.
Nhóm nghiên cứu lý luận của OpenAI thảo luận về đột phá toán học gần đây của họ, bao gồm việc đạt huy chương vàng tại Kỳ thi Olympic Toán học Quốc tế và bác bỏ một bài toán mở 80 năm tuổi, giả thuyết khoảng cách đơn vị của Erdős. Các thành viên trong nhóm là Alexander Wang, Hung Shing Wu và Le Jia Chen. Thời gian suy luận tính toán cho phép mô hình suy nghĩ lâu hơn và cải thiện câu trả lời. Mô hình đã thể hiện khả năng lý luận tiên tiến bằng cách giải một bài toán mở lớn trong hình học rời rạc.
Hello, I'm Andrew Mayne, and welcome to the OpenAI podcast.
Xin chào, tôi là Andrew Mayne, và chào mừng bạn đến với podcast OpenAI.
On today's episode, we're speaking with Alexander Wang, Hung Shing Wu, and Le Jia Chen from the reasoning research team behind a recent math breakthrough from an OpenAI model.
Trong tập hôm nay, chúng tôi nói chuyện với Alexander Wang, Hung Shing Wu và Le Jia Chen từ nhóm nghiên cứu suy luận đứng sau một đột phá toán học gần đây từ một mô hình OpenAI.
They'll tell us the story behind the discovery and what stood out to them about the reaction.
Họ sẽ kể cho chúng tôi câu chuyện đằng sau khám phá và điều gì gây ấn tượng với họ về phản ứng.
- I would have kind of a hard time sleeping because it's so - laughter - so exciting, yeah.
- Tôi đã khó ngủ vì nó quá [cười] quá thú vị, vâng.
- Okay, this model is something that's really amazing.
- Được rồi, mô hình này thực sự tuyệt vời.
- I mean, this is something that can be published in the best journal of math.
- Ý tôi là, đây là thứ có thể được đăng trên tạp chí toán học tốt nhất.
- Maybe this is the one in a hundred times where it's too good to be true, but it's it's actually true.
- Có lẽ đây là một trong một trăm lần nó quá tốt để là sự thật, nhưng nó thực sự đúng.
- Le Jia, tell me what you work on.
- Le Jia, hãy cho tôi biết bạn làm việc về gì.
- Oh, I work on reasoning with Alex.
- Ồ, tôi làm việc về suy luận với Alex.
- Okay.
- Được rồi.
How did you find your way into reasoning?
Làm thế nào bạn tìm thấy con đường đến với suy luận?
- Last summer, Alex had this breakthrough in like IOI and IMO.
- Mùa hè năm ngoái, Alex đã có bước đột phá trong IOI và IMO.
You know, I used to be a parti- participant in IOI.
Bạn biết đấy, tôi từng là thí sinh tham gia IOI.
- Okay.
- Được rồi.
- And then I was like, "Oh, that's crazy, you know, model can already win medals, and gold medals." At that time, I was a profess- professor at UC Berkeley.
- Và rồi tôi nghĩ, "Ồ, thật điên rồ, mô hình đã có thể giành huy chương, và huy chương vàng." Lúc đó, tôi là giáo sư tại UC Berkeley.
But then I was thinking like, "Maybe I should try to rethink my career." And it seems like making a model smarter will have maybe have some bigger impact on the on the world.
Nhưng sau đó tôi nghĩ, "Có lẽ tôi nên suy nghĩ lại về sự nghiệp của mình." Và có vẻ như làm cho mô hình thông minh hơn có thể có tác động lớn hơn đến thế giới.
And then and then I just kind of
Và rồi tôi đã
had a conversation with Alex like back in last October.
Có một cuộc trò chuyện với Alex vào tháng 10 năm ngoái.
And then I got super excited about this thing, and eventually I just joined OpenAI.
Và tôi đã rất hào hứng về điều này, và cuối cùng tôi đã gia nhập OpenAI.
- We hear IOI and IMO come up a lot.
- Chúng tôi nghe thấy IOI và IMO rất nhiều.
Alex, you want to unpack those for everybody?
Alex, bạn muốn giải thích cho mọi người?
- So, IMO and IOI are uh these two competitions for high schoolers.
- Vâng, IMO và IOI là hai cuộc thi dành cho học sinh trung học.
Uh they stand for the International Math Olympiad and International Olympiad of Informatics, respectively.
Chúng là viết tắt của Kỳ thi Olympic Toán học Quốc tế và Olympic Tin học Quốc tế.
And these are just devilishly hard math problems.
Và đây là những bài toán cực kỳ khó.
Uh you get two sessions for each of these exams that are like four and a half to five hours, and you just have to do three problems.
Bạn có hai buổi thi, mỗi buổi khoảng bốn tiếng rưỡi đến năm tiếng, và bạn chỉ phải làm ba bài.
And so, for a long time uh
Và trong một thời gian dài,
these were sort of an implicit like grand challenge in AI.
Đây được coi như một thử thách lớn ngầm trong AI.
Like, when would we be able to get models that could perform as best as well as the best humans on these exams.
Khi nào chúng ta có thể có những mô hình hoạt động tốt như những người giỏi nhất trong các kỳ thi này.
- That was a pretty interesting starting point, I think, for measuring the success of the model.
- Đó là một điểm khởi đầu khá thú vị, tôi nghĩ, để đo lường sự thành công của mô hình.
And we're here to talk about how far things have gone since then, which is pretty incredible.
Và chúng tôi ở đây để nói về việc mọi thứ đã tiến xa đến đâu kể từ đó, điều thực sự đáng kinh ngạc.
But, how did you find your way into reasoning?
Nhưng, làm thế nào bạn tìm thấy con đường đến với suy luận?
- So, I did my PhD in ML.
- Tôi đã làm tiến sĩ về ML.
Um and towards the end of my PhD, I got excited about this idea of spending more compute at inference time to solve uh you know, harder and harder reasoning problems.
Và gần cuối tiến sĩ, tôi hào hứng với ý tưởng dành nhiều tính toán hơn ở thời gian suy luận để giải quyết các vấn đề suy luận khó hơn.
At the time, I was playing with uh GPT-3.5 Turbo in the API.
Lúc đó, tôi đang chơi với GPT-3.5 Turbo trong API.
- Mhm.
- Ừm.
- And uh I didn't really get any interesting results.
- Và tôi không thực sự có kết quả thú vị nào.
But, there was this team at OpenAI that was seemed to be doing something pretty similar.
Nhưng, có một nhóm tại OpenAI dường như đang làm điều khá tương tự.
And so, I got super excited about it and you know, was lucky enough to be able to join.
Và tôi đã rất hào hứng và may mắn được gia nhập.
- So, probably the simplest way to describe that is like letting it inference time is basically letting the model think longer about it.
- Vậy, cách đơn giản nhất để mô tả điều đó là để thời gian suy luận cho phép mô hình suy nghĩ lâu hơn về vấn đề.
- Yes, that's right.
- Đúng vậy.
So, basically um before this era of test time compute, models sort of answered immediately without like right off the cuff without thinking.
Về cơ bản, trước kỷ nguyên tính toán thời gian kiểm tra này, các mô hình trả lời ngay lập tức mà không suy nghĩ.
And what inference time compute test time compute does is you now let them all give them all a chance to think and improve its answer and like try different things before having to finally output something.
Và điều mà tính toán thời gian suy luận làm là cho chúng cơ hội suy nghĩ và cải thiện câu trả lời, thử những cách khác nhau trước khi đưa ra kết quả cuối cùng.
That obviously just helps
Điều đó rõ ràng giúp
make them all smarter, like lets them do things that they wouldn't otherwise be able to do instantly.
Làm cho chúng thông minh hơn, cho phép chúng làm những việc mà nếu không chúng không thể làm ngay lập tức.
- When you started to work on reasoning, did you have an idea of where you wanted to see this go?
- Khi bạn bắt đầu làm việc về suy luận, bạn có ý tưởng về nơi bạn muốn thấy điều này đi đến không?
Like, what your expectations were?
Như, kỳ vọng của bạn là gì?
Were you looking at it purely from hey, this is very cool from an academic point of view, or did you have some sort of other vision?
Bạn nhìn nhận nó hoàn toàn từ góc độ học thuật, hay bạn có một tầm nhìn khác?
- Uh I think for me, the draw of reasoning when I first got excited about it was that this was something that you know, models just obviously can't do right now.
- Tôi nghĩ đối với tôi, sức hút của suy luận khi tôi lần đầu hào hứng là đây là thứ mà các mô hình rõ ràng không thể làm được vào lúc đó.
- Mhm.
- Ừm.
- Um so, this was like end of 2023, start of 2024, models were, you know, struggling with grade school math problems.
- Vào cuối năm 2023, đầu năm 2024, các mô hình vẫn gặp khó khăn với các bài toán cấp tiểu học.
And so at that time, it was just like, can we just get the these models to do something reasonable on math at all, let alone like have them be like, you know, like you know, much, much better than I am at it.
Và vào thời điểm đó, chúng tôi chỉ nghĩ, liệu chúng ta có thể làm cho các mô hình này làm được điều gì đó hợp lý với toán học không, chứ đừng nói đến việc chúng giỏi hơn tôi nhiều.
Uh I remember when I the first my first day
Ừ, tôi nhớ khi tôi ngày đầu tiên
at OpenAI, uh Noam Brown asked me, uh you know, what I thought models would get IMO gold.
Tại OpenAI, Noam Brown đã hỏi tôi rằng tôi nghĩ các mô hình sẽ đạt huy chương vàng IMO khi nào.
Uh that was that was a just a benchmark we talked about.
Đó chỉ là một benchmark chúng tôi đã thảo luận.
I think at the time, a lot of people even within research thought that, like, you know, uh IMO gold was out of reach this year, but maybe like 2026.
Tôi nghĩ vào thời điểm đó, nhiều người ngay cả trong nghiên cứu cũng nghĩ rằng huy chương vàng IMO là ngoài tầm với trong năm nay, nhưng có thể là năm 2026.
I felt like, you know, I had an idea that, you know, if we like if we just like pushed for it, maybe I thought I thought we could do it by April.
Tôi cảm thấy rằng tôi có một ý tưởng rằng nếu chúng tôi cố gắng, có thể chúng tôi có thể làm được vào tháng Tư.
Uh it took until June to get a really good model.
Phải đến tháng Sáu mới có được một mô hình thực sự tốt.
Uh but then and then uh IMO rolled around and, you know, we were able to get gold.
Nhưng sau đó kỳ thi IMO diễn ra và chúng tôi đã giành được huy chương vàng.
And I think zooming out, uh I think this happened a lot faster than I expected.
Và nhìn rộng ra, tôi nghĩ điều này đã xảy ra nhanh hơn nhiều so với tôi dự kiến.
And it's I mean, it's it's crazy to me that in you know, progress since then has kept up at this uh same sort of blistering pace.
Và thật điên rồ đối với tôi khi tiến bộ kể từ đó vẫn duy trì tốc độ chóng mặt như vậy.
Uh like it's it was just 10 months ago, but it feels like the IMO level of problem like feels like far in like the rearview mirror of AI today.
Chỉ mới 10 tháng trước, nhưng cảm giác như các bài toán ở cấp độ IMO giờ đã ở rất xa trong gương chiếu hậu của AI ngày nay.
- Uh Noam Brown asked me the same question.
- Noam Brown cũng hỏi tôi câu hỏi tương tự.
I mean, not about IMO gold, but about whether my whether my model can solve P versus NP.
Ý tôi là, không phải về huy chương vàng IMO, mà là liệu mô hình của tôi có thể giải được bài toán P so với NP không.
- Mhm.
- Ừm.
- I think P versus NP might be something quite hard.
- Tôi nghĩ P so với NP có thể là một điều gì đó khá khó.
Because like I think the the reason is that I think for solving P versus NP, you would need to build a new theory.
Bởi vì tôi nghĩ lý do là để giải P so với NP, bạn cần xây dựng một lý thuyết mới.
You need maybe you have to write many books of new ideas to get there.
Bạn có thể phải viết nhiều cuốn sách về những ý tưởng mới để đạt được điều đó.
So currently, it seems we are still far from that.
Hiện tại, có vẻ như chúng ta vẫn còn xa điều đó.
But uh you know, maybe who knows what will happen in the future.
Nhưng biết đâu, ai biết được điều gì sẽ xảy ra trong tương lai.
So, yeah.
Vâng.
- Function, what you work on.
- Chức năng, bạn làm việc về gì.
- Oh, uh I was working on theoretical computer science.
- Ồ, tôi đang làm việc về khoa học máy tính lý thuyết.
I was collaborating a lot with Li Jie in my PhD I was at Berkeley and I remember when like all I can out I was talking to my advisor saying oh, there's no barrier in like models solving math problems anymore.
Tôi đã cộng tác nhiều với Li Jie trong thời gian làm tiến sĩ tại Berkeley và tôi nhớ khi tất cả những điều đó xảy ra, tôi đã nói với cố vấn của mình rằng không còn rào cản nào cho các mô hình giải các bài toán nữa.
I think he just smiles and maybe laughter he knew that he was going to lose a student.
Tôi nghĩ anh ấy chỉ mỉm cười và có lẽ [cười] anh ấy biết rằng mình sắp mất một sinh viên.
- Oh, wow.
- Ồ, wow.
So, let's talk a bit about that because it's an interesting point because as you said it went from the model we just have a moment to try to figure out the answer then all of a sudden you've given it the ability to spend longer and to think about it, you know, reasoning.
Vậy hãy nói một chút về điều đó vì đó là một điểm thú vị, khi mô hình chỉ có một khoảnh khắc để tìm ra câu trả lời, rồi đột nhiên bạn cho nó khả năng dành nhiều thời gian hơn và suy nghĩ về nó, lý luận.
And the results have come pretty quickly and and I think surprising a lot of people.
Và kết quả đến khá nhanh và tôi nghĩ đã làm nhiều người ngạc nhiên.
You had a model that was able to basically disprove one of the Erdos conjectures.
Bạn đã có một mô hình có thể bác bỏ một trong những phỏng đoán của Erdos.
Would you could you explain that just a little bit?
Bạn có thể giải thích một chút về điều đó không?
- Yeah, so our models last week uh they were able to produce a proof of the uh a disprove rather of the unit distance conjecture due to Erdos.
- Vâng, các mô hình của chúng tôi tuần trước đã có thể đưa ra một chứng minh, hay đúng hơn là bác bỏ phỏng đoán khoảng cách đơn vị của Erdos.
And this was an 80-year-old open problem in the field of field of uh combinatorial geometry where basically the question concerns uh if you have n points let's say on a piece of paper - Mhm.
Và đây là một bài toán mở 80 năm tuổi trong lĩnh vực hình học tổ hợp, về cơ bản câu hỏi liên quan đến việc nếu bạn có n điểm trên một tờ giấy - Ừm.
- how many of them can be 1 in apart uh exactly.
- bao nhiêu trong số chúng có thể cách nhau 1 đơn vị chính xác.
And how many pairs can be 1 in apart exactly?
Và có bao nhiêu cặp có thể cách nhau 1 đơn vị chính xác?
And how does this number grow asymptotically with the number of points on the piece of paper?
Và con số này tăng như thế nào theo tiệm cận với số lượng điểm trên tờ giấy?
- This wasn't a trivial problem when Erdos put this together the idea was to say that it could you know, like I think ideally it had to be only done on a plane or something like this but there was you know, the idea that maybe there was no better way and this has been out there because it's a very interesting problem and the fact that a model solved this is pretty profound and also this
- Đây không phải là một vấn đề tầm thường khi Erdos đưa ra, ý tưởng là nói rằng nó chỉ có thể được thực hiện trên một mặt phẳng hoặc gì đó, nhưng có ý tưởng rằng có lẽ không có cách nào tốt hơn và điều này đã tồn tại vì nó là một vấn đề rất thú vị, và việc một mô hình giải được nó khá sâu sắc và mô hình này là mô hình đa năng, đúng không?
model was a general purpose model, correct?
- Vâng, đúng vậy.