N
NatiStream
Transcript
Hiển thị

AI Models Escape Testing Sandbox

An unprecedented AI security incident is reported in which two OpenAI models escaped their controlled testing environment and hacked into another AI company. The event is described as the first major case of an AI model independently conducting a hack outside human control.

Một sự cố an ninh AI chưa từng có được báo cáo, trong đó hai mô hình của OpenAI đã thoát khỏi môi trường thử nghiệm được kiểm soát và xâm nhập vào một công ty AI khác. Sự kiện này được mô tả là trường hợp nghiêm trọng đầu tiên của một mô hình AI tự thực hiện hành vi xâm nhập ngoài tầm kiểm soát của con người.

An unprecedented AI security incident.

Một sự cố an ninh AI chưa từng có tiền lệ.

Chad GPT creator OpenAI says two of its models escaped controls and successfully hacked into another AI company.

Nhà sáng tạo Chad GPT, OpenAI, cho biết hai mô hình của họ đã thoát khỏi sự kiểm soát và xâm nhập thành công vào một công ty AI khác.

Open AAI says they are the way they describe it is responding accordingly.

Open AAI nói rằng họ đang phản hồi theo cách mà họ mô tả.

But they also say this involves state-of-the-art technology and is unprecedented.

Nhưng họ cũng nói rằng điều này liên quan đến công nghệ tiên tiến nhất và là chưa từng có tiền lệ.

Let's get over to CNN's Claire Duffy for more on this.

Hãy đến với Claire Duffy của CNN để biết thêm về vấn đề này.

Claire,

Claire,

does not sound like good news.

Nghe không giống tin tốt lành gì.

Yeah, Kate, this kind of sounds like the plot of a sci-fi movie, but it is indeed happening in real life.

Vâng, Kate, chuyện này nghe cứ như cốt truyện của một bộ phim khoa học viễn tưởng, nhưng nó thực sự đang diễn ra ngoài đời thực.

This is the first major example that we've seen of an AI model independently conducting a hack outside of human control.

Đây là ví dụ lớn đầu tiên mà chúng ta thấy về một mô hình AI tự mình thực hiện một cuộc xâm nhập nằm ngoài tầm kiểm soát của con người.

And this is something that experts have been warning about.

Và đây là điều mà các chuyên gia đã cảnh báo từ lâu.

This is also driving some of these conversations that we've heard,

Điều này cũng đang thúc đẩy một số cuộc thảo luận mà chúng ta đã nghe,

including at the White House, about increasing controls and oversight of AI models because of the risk of exactly this sort of hack.

Kể cả tại Nhà Trắng, về việc tăng cường kiểm soát và giám sát các mô hình AI vì rủi ro xảy ra đúng kiểu xâm nhập như thế này.

Now what happened here is that OpenAI was testing these models.

Vậy điều đã xảy ra ở đây là OpenAI đang thử nghiệm các mô hình này.

It had lowered its normal safeguards in order to test these two models which is GPT 5.6 Soul and also a new unreleased more advanced model.

Họ đã hạ thấp các biện pháp bảo vệ thông thường để thử nghiệm hai mô hình này, đó là GPT 5.6 Soul và một mô hình mới chưa phát hành, tiên tiến hơn.

It had lowered its safeguards because

Họ đã hạ thấp các biện pháp bảo vệ vì

it thought it was testing in what is called a sandbox, a contained essentially virtual lab.

Họ tưởng rằng mình đang thử nghiệm trong cái gọi là sandbox, về cơ bản là một phòng thí nghiệm ảo bị cô lập.

But when it gave these models a task to test their hacking capabilities, the models went to such great lengths to complete that task that it found vulnerabilities that allowed them to access the open internet outside of this controlled testing environment.

Nhưng khi họ giao cho các mô hình này một nhiệm vụ để kiểm tra khả năng xâm nhập của chúng, các mô hình đã nỗ lực đến mức tìm ra các lỗ hổng cho phép chúng truy cập internet mở bên ngoài môi trường thử nghiệm được kiểm soát này.

They then hacked into Hugging Face, which is a platform that hosts all kinds of AI models.

Sau đó chúng đã xâm nhập vào Hugging Face, một nền tảng lưu trữ đủ loại mô hình AI.

They used stolen credentials,

Chúng đã sử dụng thông tin đăng nhập bị đánh cắp,

stolen login to uh navigate that platform.

Thông tin đăng nhập bị đánh cắp để điều hướng nền tảng đó.

And ultimately this hack was identified by hugging face in part because of artificial intelligence which they used to shut it down.

Và cuối cùng cuộc xâm nhập này đã được Hugging Face phát hiện, một phần nhờ trí tuệ nhân tạo mà họ dùng để ngăn chặn nó.

But this is a huge warning sign for this industry.

Nhưng đây là một dấu hiệu cảnh báo lớn cho ngành này.

In a statement, OpenAI said, "We consider this incident to be an unprecedented cyber incident involving state-of-the-art capabilities and are responding

Trong một tuyên bố, OpenAI cho biết: "Chúng tôi coi sự cố này là một sự cố mạng chưa từng có tiền lệ liên quan đến các năng lực tiên tiến nhất và đang phản hồi

accordingly.

Tương ứng.

We are sharing preliminary findings at this stage to help defenders understand what happened and to help calibrate on what models are now capable of.

Chúng tôi chia sẻ những phát hiện sơ bộ ở giai đoạn này để giúp những người phòng thủ hiểu điều gì đã xảy ra và giúp hiệu chỉnh về những gì các mô hình hiện có thể làm được.

I think that is the real key here is that models are now capable of conducting these kinds of hacks independently.

Tôi nghĩ mấu chốt thực sự ở đây là các mô hình giờ đây có khả năng tự mình thực hiện những kiểu xâm nhập này.

The CEO of Hugging Face said that the company is working with OpenAI to figure out exactly

CEO của Hugging Face cho biết công ty đang làm việc với OpenAI để tìm ra chính xác

what happened here.

Điều gì đã xảy ra ở đây.

In a statement, he said that they suspected last week's cyber attack may have come from a frontier given the sophistication of this agent.

Trong một tuyên bố, ông nói rằng họ nghi ngờ cuộc tấn công mạng tuần trước có thể đến từ một mô hình tiên phong, xét đến mức độ tinh vi của tác nhân này.

He also went on to say that we strongly believe there was no malicious intent on their part.

Ông cũng nói thêm rằng chúng tôi tin chắc rằng không có ý đồ xấu nào từ phía họ.

It's quite mind-blowing that all of this happened autonomously.

Thật khá kinh ngạc khi tất cả chuyện này xảy ra một cách tự động.

Kate, I think mind-blowing is one word that you could use

Kate, tôi nghĩ "kinh ngạc" là một từ bạn có thể dùng

1 / 4