N
NatiStream
Transcript
Hiển thị

EU AI Act and Watermarking Requirements

The EU AI Act introduces requirements for marking AI-generated content, with Anthropic planning to implement watermarks in text and code by August 2026. The code of practice includes sections for providers and deployers, with exemptions for assistive AI functions. Watermarking images is easier due to more data, but text watermarking is more challenging.

Đạo luật AI của EU đưa ra các yêu cầu về việc đánh dấu nội dung do AI tạo ra, với Anthropic dự định triển khai đánh dấu trong văn bản và mã nguồn vào tháng 8 năm 2026. Bộ quy tắc thực hành bao gồm các phần cho nhà cung cấp và nhà triển khai, với các miễn trừ cho các chức năng AI hỗ trợ. Việc đánh dấu hình ảnh dễ dàng hơn do có nhiều dữ liệu hơn, nhưng đánh dấu văn bản khó khăn hơn.

One of the most frustrating things about AI is that it's hard to know if someone used it or not.

Một trong những điều gây khó chịu nhất về AI là rất khó để biết liệu ai đó có sử dụng nó hay không.

Sure, there's all the common tells like the M dashes and the you're absolutely right and the it's not X, it's Y's and all these types of patterns, but it's generally pretty hard to actually know if a given piece of text or line of code was really written with AI.

Chắc chắn, có tất cả các dấu hiệu phổ biến như dấu gạch ngang M, cụm từ 'bạn hoàn toàn đúng', và kiểu 'không phải X, mà là Y' cùng những mẫu tương tự, nhưng nhìn chung rất khó để thực sự biết một đoạn văn bản hay dòng mã cụ thể có được viết bằng AI hay không.

And this has scared a lot of

Và điều này đã khiến nhiều

people and for reasons that are good.

người lo sợ, và vì những lý do chính đáng.

If it's impossible to know what text was written with AI and what was written by a human, the world will devolve into a pile of slop really, really fast.

Nếu không thể biết văn bản nào được viết bằng AI và văn bản nào do con người viết, thế giới sẽ nhanh chóng trở thành một đống rác rưởi.

The European Union agrees and that's why they just introduced the AI act which has a specific goal of making it easier to know and label AI generated media and text and anthropic is complying with it.

Liên minh châu Âu đồng ý với điều đó và đó là lý do họ vừa giới thiệu Đạo luật AI, với mục tiêu cụ thể là giúp dễ dàng nhận biết và gắn nhãn nội dung và văn bản do AI tạo ra, và Anthropic đang tuân thủ điều đó.

Normally these types of watermarks are things that only apply to media gen things like images, videos, audio, etc.

Thông thường, các loại hình mờ này chỉ áp dụng cho các sản phẩm truyền thông như hình ảnh, video, âm thanh, v.v.

because there's a lot of data there that's relatively easy to sneak watermarks into.

Bởi vì có rất nhiều dữ liệu ở đó và việc nhúng hình mờ tương đối dễ dàng.

But when it comes to text, it's a lot harder.

Nhưng khi nói đến văn bản, việc đó khó hơn nhiều.

Which is why it's pretty crazy that Anthropics already updated their docs on this, saying that they plan to do marking of all AI generated content across all platforms.

Đó là lý do tại sao khá điên rồ khi Anthropic đã cập nhật tài liệu của họ về vấn đề này, nói rằng họ có kế hoạch đánh dấu tất cả nội dung do AI tạo ra trên tất cả các nền tảng.

Cloud models launched in the EU on or after August 2nd, 2026 will

Các mô hình Cloud ra mắt tại EU vào hoặc sau ngày 2 tháng 8 năm 2026 sẽ

support machine readable markings at launch.

hỗ trợ đánh dấu có thể đọc bằng máy khi ra mắt.

Generated text will carry embedded watermarks and generated files will include digitally signed Providence metadata where supported.

Văn bản được tạo ra sẽ mang hình mờ nhúng và các tệp được tạo sẽ bao gồm siêu dữ liệu Providence có chữ ký số nếu được hỗ trợ.

Oh boy.

Ôi trời.

This means our friends at Anthropic will be marking not just the text they output, but the code they output as well.

Điều này có nghĩa là những người bạn của chúng tôi tại Anthropic sẽ đánh dấu không chỉ văn bản họ xuất ra mà còn cả mã họ xuất ra.

This is a very scary change and I have a feeling it's not going to do what is

Đây là một thay đổi rất đáng sợ và tôi có cảm giác nó sẽ không đạt được điều

intended.

mong muốn.

As always, there's a lot of layers to this one from the relatively good intent of this EU act to the questionable implementations we're going to be seeing all across the field and also the impact this will have on us actually using the models.

Như mọi khi, vấn đề này có nhiều khía cạnh, từ ý định tương đối tốt của Đạo luật EU này đến các triển khai đáng ngờ mà chúng ta sẽ thấy trên khắp các lĩnh vực, cũng như tác động của nó đối với việc chúng ta thực sự sử dụng các mô hình.

I'll talk about all of that, the workarounds, and more after a real quick break for today's sponsor.

Tôi sẽ nói về tất cả những điều đó, các cách giải quyết, và hơn thế nữa sau một quảng cáo ngắn cho nhà tài trợ hôm nay.

Picking the right

Việc chọn đúng

database has never been more important, but it's also never been harder.

cơ sở dữ liệu chưa bao giờ quan trọng hơn, nhưng cũng chưa bao giờ khó hơn.

You can go with industry standards like Postgress for your application or ClickHouse for your data warehouse.

Bạn có thể chọn các tiêu chuẩn ngành như Postgres cho ứng dụng của mình hoặc ClickHouse cho kho dữ liệu của bạn.

But how do you pick the right thing if you don't even know what you're building yet?

Nhưng làm thế nào để bạn chọn đúng thứ nếu bạn chưa biết mình đang xây dựng cái gì?

Wouldn't it be nice if there was a great solution that combine the best both of those?

Sẽ thật tuyệt nếu có một giải pháp tuyệt vời kết hợp những điểm tốt nhất của cả hai?

You know, like if

Bạn biết đấy, như thể

Postgress was just managed by Clickhouse.

Postgres chỉ được quản lý bởi ClickHouse.

Yeah, they're actually doing this now.

Vâng, họ thực sự đang làm điều này bây giờ.

And it couldn't be cooler.

Và điều đó không thể tuyệt hơn.

You get enterprisecale Postgress with all the benefits of Clickhouse, too.

Bạn có được Postgres cấp doanh nghiệp với tất cả lợi ích của ClickHouse.

The Postgress database is what you should use for your apps.

Cơ sở dữ liệu Postgres là thứ bạn nên sử dụng cho các ứng dụng của mình.

It's super fast and built on top of real NVMe drives on the same machine resulting in absurd performance up to 10 times faster for IO

Nó cực kỳ nhanh và được xây dựng trên các ổ NVMe thực sự trên cùng một máy, mang lại hiệu suất đáng kinh ngạc, nhanh hơn tới 10 lần cho các khối lượng công việc

heavy workloads.

nặng về I/O.

Where things get magic is the ClickHouse integration.

Điều kỳ diệu nằm ở tích hợp ClickHouse.

All of the changes in Postgress get synced to your ClickHouse.

Tất cả các thay đổi trong Postgres được đồng bộ sang ClickHouse của bạn.

So you can do massive analytics calls without slowing down your production DB.

Vì vậy, bạn có thể thực hiện các truy vấn phân tích lớn mà không làm chậm cơ sở dữ liệu sản xuất của mình.

And if you're worried about latency, don't be.

Và nếu bạn lo lắng về độ trễ, đừng lo.

Your data is replicated within seconds.

Dữ liệu của bạn được sao chép trong vài giây.

And if you want to access that analytics data from the Postgress DB in your app,

Và nếu bạn muốn truy cập dữ liệu phân tích đó từ cơ sở dữ liệu Postgres trong ứng dụng của mình,

you can with PG Click House.

bạn có thể làm điều đó với PG ClickHouse.

This would have saved my butt when I was building the T3 chat wrapped feature last year and I had to query data from all sorts of different places in order to pull it together.

Điều này sẽ cứu tôi khi tôi xây dựng tính năng T3 chat wrapped năm ngoái và tôi phải truy vấn dữ liệu từ nhiều nơi khác nhau để tổng hợp lại.

Setup couldn't be easier.

Việc thiết lập không thể dễ dàng hơn.

You click start, you add a new database, you get a connection string and now you're good to go with a real Postgress database with all the power of

Bạn nhấp vào bắt đầu, thêm cơ sở dữ liệu mới, nhận chuỗi kết nối và bây giờ bạn đã sẵn sàng với một cơ sở dữ liệu Postgres thực sự với tất cả sức mạnh của

ClickHouse behind it.

ClickHouse phía sau.

Stop compromising on your database today at soy.link/clickhouse.

Hãy ngừng thỏa hiệp về cơ sở dữ liệu của bạn ngay hôm nay tại soy.link/clickhouse.

The best place to start on this chaos is probably the official code that the EU has put out.

Nơi tốt nhất để bắt đầu với sự hỗn loạn này có lẽ là mã chính thức mà EU đã đưa ra.

This is the code of practice on transparency of AI generated content.

Đây là quy tắc thực hành về tính minh bạch của nội dung do AI tạo ra.

There's two different sections in this code.

Có hai phần khác nhau trong quy tắc này.

There's section one for the providers which is rules for marking and detection of AI generated and manipulated content and section two is for deployers rules for labeling of deep

Phần một dành cho các nhà cung cấp, quy định về việc đánh dấu và phát hiện nội dung do AI tạo ra và thao túng, và phần hai dành cho các nhà triển khai, quy định về việc gắn nhãn cho deep

fakes and AI generated and manipulated text.

fake và văn bản do AI tạo ra và thao túng.

This code was drawn up by independent experts in a multistakeholder process facilitated by the AI office of the EU.

Quy tắc này được soạn thảo bởi các chuyên gia độc lập trong một quy trình đa bên do Văn phòng AI của EU điều phối.

It helps providers and deployers of generative AI systems to comply with the AI acts obligations for labeling and marking of AI generated content.

Nó giúp các nhà cung cấp và triển khai hệ thống AI tạo sinh tuân thủ các nghĩa vụ của Đạo luật AI về ghi nhãn và đánh dấu nội dung do AI tạo ra.

Even though adherence to the code is voluntary, the transparency requirements under article

Mặc dù việc tuân thủ quy tắc này là tự nguyện, các yêu cầu về tính minh bạch theo Điều

50 are legal obligations.

50 là các nghĩa vụ pháp lý.

AI needs to be deployed in ways where users know they're talking to AI.

AI cần được triển khai theo cách mà người dùng biết họ đang nói chuyện với AI.

That is totally fair.

Điều đó hoàn toàn hợp lý.

Providers of AI systems generation shall ensure the outputs of AI systems are marked in a machine readable format in detectable as artificially generated or manipulated.

Các nhà cung cấp hệ thống AI tạo sinh phải đảm bảo rằng đầu ra của hệ thống AI được đánh dấu ở định dạng máy đọc được và có thể phát hiện là do AI tạo ra hoặc chỉnh sửa.

The inclusion of text content here is a bit concerning.

Việc bao gồm nội dung văn bản ở đây hơi đáng lo ngại.

Providers shall ensure that their technical solutions are effective, interoperable, robust, and reliable as far as this is technically feasible, taking into account the specificities and limitations of various types of content, the costs of implementation, and the generally acknowledged state-of-the-art as may be reflected in relevant technical standards.

Các nhà cung cấp phải đảm bảo rằng các giải pháp kỹ thuật của họ hiệu quả, có khả năng tương tác, mạnh mẽ và đáng tin cậy trong phạm vi khả thi về mặt kỹ thuật, có tính đến các đặc thù và hạn chế của các loại nội dung khác nhau, chi phí triển khai và trình độ kỹ thuật tiên tiến được công nhận chung như có thể được phản ánh trong các tiêu chuẩn kỹ thuật liên quan.

So, this

Vì vậy, điều này

is the only section that is obligatory for companies in this ruling.

Là phần duy nhất bắt buộc đối với các công ty trong phán quyết này.

The rest of the code is more suggestions.

Phần còn lại của quy tắc chỉ là các đề xuất.

But that one piece there, that uh section two here, the providers must ensure that outputs are marked in a machine readable format.

Nhưng một phần ở đó, phần 2 ở đây, các nhà cung cấp phải đảm bảo rằng đầu ra được đánh dấu ở định dạng máy đọc được.

That's where this all starts to become a show.

Đó là nơi tất cả bắt đầu trở thành một chương trình.

There's an interesting call at the end here of the section two.

Có một lời kêu gọi thú vị ở cuối phần 2.

This obligation shall not

Nghĩa vụ này sẽ không

apply to the extent the AI systems perform an assistive function for standard editing or do not substantially alter the input data provided by the deployer of semantics thereof or where authorized by the law to detect, prevent, investigate or prosecute criminal offenses.

Áp dụng trong phạm vi các hệ thống AI thực hiện chức năng hỗ trợ cho việc chỉnh sửa tiêu chuẩn hoặc không thay đổi đáng kể dữ liệu đầu vào do người triển khai cung cấp hoặc ngữ nghĩa của dữ liệu đó, hoặc khi được pháp luật cho phép để phát hiện, ngăn chặn, điều tra hoặc truy tố tội phạm.

What this means is if you have an AI system that is like editing or autocorrecting or things for

Điều này có nghĩa là nếu bạn có một hệ thống AI giống như chỉnh sửa hoặc tự động sửa lỗi hoặc những thứ cho

existing documents, images, whatever, that does not need to have the same level of like transparency and encoded metadata proving that it was AI.

Các tài liệu, hình ảnh hiện có, v.v., thì không cần phải có cùng mức độ minh bạch và siêu dữ liệu được mã hóa chứng minh rằng nó là AI.

So if I use AI to like do a small correction like to remove a zit from my face, that doesn't need to be marked the same way.

Vì vậy, nếu tôi sử dụng AI để chỉnh sửa nhỏ như xóa mụn trên mặt, thì không cần phải đánh dấu theo cách tương tự.

If I'm writing an essay and I ask for the agent to find little things that I could improve in the essay or like clean up the grammar and stuff, it doesn't need to apply the same way there.

Nếu tôi đang viết một bài luận và yêu cầu trợ lý tìm những điểm nhỏ có thể cải thiện trong bài luận hoặc làm sạch ngữ pháp, thì nó cũng không cần áp dụng theo cách tương tự.

But the actual output from the LLM, it does.

Nhưng đầu ra thực tế từ LLM thì có.

Very interesting.

Rất thú vị.

And with that, we now need to talk a little bit more about watermarks.

Và với điều đó, bây giờ chúng ta cần nói thêm một chút về hình mờ.

Going to start from a weird point.

Bắt đầu từ một điểm kỳ lạ.

So, hear me out.

Vì vậy, hãy nghe tôi nói.

This image could be AI generated.

Hình ảnh này có thể do AI tạo ra.

It might not be.

Có thể không.

It's hard to know for sure.

Thật khó để biết chắc chắn.

I don't know where this image would have been taken, but Maria posted it online on Twitter a few days ago.

Tôi không biết hình ảnh này được chụp ở đâu, nhưng Maria đã đăng nó lên Twitter vài ngày trước.

In fact, when Maria posted it, there was no marking here that said

Thực tế, khi Maria đăng nó, không có dấu hiệu nào ở đây cho biết

it was generated with AI.

Nó được tạo ra bằng AI.

So, clearly this photo is real, right?

Vì vậy, rõ ràng bức ảnh này là thật, phải không?

Let me go a step further.

Để tôi đi xa hơn một bước.

These two images are the same, right?

Hai hình ảnh này giống nhau, phải không?

Like obviously these are the exact same image with no differences between them.

Rõ ràng đây là cùng một hình ảnh không có sự khác biệt nào giữa chúng.

What if I told you there was not a single bite shared between these two images?

Nếu tôi nói với bạn rằng không có một byte nào được chia sẻ giữa hai hình ảnh này thì sao?

One of these is a PNG and the other is a JPEG.

Một trong số này là PNG và cái còn lại là JPEG.

This is what makes watermarking for media both really

Đây là điều làm cho việc đánh dấu hình mờ cho phương tiện truyền thông trở nên thực sự

easy and really hard.

Dễ dàng và thực sự khó khăn.

That image we were just looking at, it's not huge, but it's not small either.

Hình ảnh chúng ta vừa xem không lớn lắm, nhưng cũng không nhỏ.

It's 623 kilob.

Nó có dung lượng 623 kilobyte.

And the relationship between the size of the file and what we see not that simple.

Và mối quan hệ giữa kích thước tệp và những gì chúng ta thấy không đơn giản như vậy.

When you have this much data in a file, there's a lot of room to stuff things into it.

Khi bạn có nhiều dữ liệu như vậy trong một tệp, có rất nhiều chỗ để nhồi nhét mọi thứ vào đó.

a lot of which won't even be perceivable to humans.

Nhiều trong số đó thậm chí sẽ không thể nhận biết được bằng mắt người.

Let's say I want to add some special encoding to make sure that I know this image is the one I have here on my computer.

Giả sử tôi muốn thêm một số mã hóa đặc biệt để đảm bảo rằng tôi biết hình ảnh này là hình ảnh tôi có trên máy tính của mình.

I could put it in the image metadata and things like that, but I want it to be harder to get rid of.

Tôi có thể đặt nó trong siêu dữ liệu hình ảnh và những thứ tương tự, nhưng tôi muốn nó khó bị loại bỏ hơn.

1 / 5