Dario Amodei introduces his work on AI safety and reliability, explaining how his experience with deep neural networks led him to co-author a paper on concrete problems in AI safety. He defines accidents as unintended and harmful behavior in machine learning systems and outlines trends that make this issue increasingly important.
Dario Amodei giới thiệu công trình của mình về an toàn và độ tin cậy của AI, giải thích cách kinh nghiệm của ông với mạng nơ-ron sâu dẫn ông đến việc đồng tác giả một bài báo về các vấn đề cụ thể trong an toàn AI. Ông định nghĩa tai nạn là hành vi không mong muốn và có hại trong các hệ thống học máy và phác thảo các xu hướng khiến vấn đề này ngày càng trở nên quan trọng.
Um, so as, uh, as Bill mentioned, I'm a researcher on the, uh, Google Brain team, and I'm also an adviser to the, uh, Open Philanthropy Project, which, uh, which thinks about, uh, social impacts about, uh, AI.
Ừm, vậy, như Bill đã đề cập, tôi là một nhà nghiên cứu trong nhóm Google Brain, và tôi cũng là cố vấn cho Dự án Open Philanthropy, nơi suy nghĩ về tác động xã hội của AI.
So I, you know, I mostly in the past have worked on, uh, issues in, uh, you know, applying, uh, deep neural networks to speech and vision, but recently I've become very interested in the issue of
Vậy, bạn biết đấy, trước đây tôi chủ yếu làm việc về các vấn đề trong việc áp dụng mạng nơ-ron sâu cho giọng nói và thị giác, nhưng gần đây tôi rất quan tâm đến vấn đề
safety and reliability of AI systems.
An toàn và độ tin cậy của các hệ thống AI.
And so I got together with a bunch of collaborators, some from Google, some from Stanford, Berkeley, OpenAI, in the last few months, um, and we recently released this paper called "Concrete Problems in AI Safety," um, which tries to bring some kind of categorize and bring some precision to the, uh, to the, uh, to the, to the AI safety discussion, so that's
Và vì vậy tôi đã tập hợp với một nhóm cộng tác viên, một số từ Google, một số từ Stanford, Berkeley, OpenAI, trong vài tháng qua, và chúng tôi gần đây đã công bố bài báo có tên "Các vấn đề cụ thể trong an toàn AI", cố gắng phân loại và mang lại sự chính xác cho cuộc thảo luận về an toàn AI, vì vậy đó là
that's what I'm be talking about here.
Đó là những gì tôi sẽ nói ở đây.
Um, and so, you know, pretty much me and all, all the collaborators on this project ultimately got interested in this because of our experience working with deep neural networks, which we found over the last, um, few years to, you know, to have become, you know, very powerful and capable, but, you know, also they can be very opaque and can behave in very
Ừm, và vậy, bạn biết đấy, khá nhiều người trong tôi và tất cả các cộng tác viên trong dự án này cuối cùng đều quan tâm đến điều này vì kinh nghiệm làm việc với mạng nơ-ron sâu, mà chúng tôi thấy trong vài năm qua đã trở nên rất mạnh mẽ và có khả năng, nhưng cũng có thể rất mờ đục và có thể hành xử theo những cách rất
unpredictable ways.
Không thể đoán trước.
Um, and all of us kind of had the same thought that, you know, as these systems continue to become more powerful and be applied in more kind of safety-critical states that, you know, this is going to become an increasingly important area.
Ừm, và tất cả chúng tôi đều có cùng suy nghĩ rằng, khi các hệ thống này tiếp tục trở nên mạnh mẽ hơn và được áp dụng trong nhiều trạng thái quan trọng về an toàn hơn, thì đây sẽ trở thành một lĩnh vực ngày càng quan trọng.
So we kind of define in the paper the term "accidents" as what it is that we're, um, worried about, which I think is, you know,
Vì vậy chúng tôi định nghĩa trong bài báo thuật ngữ "tai nạn" là những gì chúng tôi lo lắng, mà tôi nghĩ là
the same as what everyone was talking about today: unintended and harm behavior in machine learning system.
Giống như những gì mọi người đã nói hôm nay: hành vi không mong muốn và gây hại trong hệ thống học máy.
Um, and you know, I and my co-authors, you know, kind of we mentioned in the paper that there are some trends that, you know, that, that we think are really going to raise the importance of accidents, and they've been mentioned by some previous speakers today, but first of all,
Ừm, và bạn biết đấy, tôi và các đồng tác giả của tôi đã đề cập trong bài báo rằng có một số xu hướng mà chúng tôi nghĩ sẽ thực sự làm tăng tầm quan trọng của tai nạn, và chúng đã được một số diễn giả trước đó đề cập hôm nay, nhưng trước hết,
reinforcement learning, which allows increasing intertwinement between the agent and its environment, all the progress on Atari and on Go, uh, complex agents and environments, which just increase the range of strategy the agents can have and the way the environments can be disrupted, increasing autonomy, which can take the humans out of, out of a loop, and end-to-end
Học tăng cường, cho phép tăng cường sự đan xen giữa tác nhân và môi trường của nó, tất cả tiến bộ trên Atari và Go, các tác nhân và môi trường phức tạp, chỉ làm tăng phạm vi chiến lược mà tác nhân có thể có và cách môi trường có thể bị gián đoạn, tăng quyền tự chủ, có thể đưa con người ra khỏi vòng lặp, và các hệ thống đầu-cuối
systems, which are often—maybe a system might be made up of many deep learning components that talk to each other, and it makes it more difficult for a human to understand what's going on and to intervene in the system in some way, in some way that's helpful.
Thường—có thể một hệ thống được tạo thành từ nhiều thành phần học sâu giao tiếp với nhau, và nó làm cho con người khó hiểu điều gì đang xảy ra và can thiệp vào hệ thống theo cách hữu ích hơn.
Um, so you know, we really, with these trends, we really wanted to take kind of a forward-looking approach to, you know, how to think about
Ừm, vậy bạn biết đấy, với những xu hướng này, chúng tôi thực sự muốn có cách tiếp cận hướng tới tương lai về cách suy nghĩ về
the safety of AI systems.
Sự an toàn của các hệ thống AI.
And you know, there has been some public discussion of forward-looking approaches, but I think a lot of it has focused somewhat unhelpfully on these kind of very extreme scenarios like AGI or superintelligence.
Và bạn biết đấy, đã có một số thảo luận công khai về các cách tiếp cận hướng tới tương lai, nhưng tôi nghĩ phần lớn tập trung một cách không hữu ích vào những kịch bản cực đoan như AGI hay siêu trí tuệ.
And so, um, we wanted to take an approach that was yes forward-looking but also concrete, empirical, could be worked on now, could relate to systems
Và vì vậy, chúng tôi muốn có cách tiếp cận vừa hướng tới tương lai vừa cụ thể, thực nghiệm, có thể được nghiên cứu ngay bây giờ, có thể liên quan đến các hệ thống