Anthropic bắt đầu nhúng hình mờ vô hình vào mọi văn bản Claude tạo ra từ 2/8/2026, trong khi giới lập trình đã tìm cách vô hiệu hóa cơ chế này.
Anthropic đã bắt đầu nhúng một hình mờ không thể nhận biết bằng mắt thường vào toàn bộ văn bản do các mô hình Claude mới nhất tạo ra. Thay đổi này có hiệu lực đối với các mô hình được ra mắt tại Liên minh châu Âu từ ngày 2/8/2026, và công ty cho biết sẽ áp dụng trên phạm vi toàn cầu.
Anthropic công bố kế hoạch này trong một bài viết hỗ trợ, sau khi ký Bộ quy tắc thực hành về tính minh bạch theo Đạo luật AI của Liên minh châu Âu, cho thấy đây không hẳn là một động thái hoàn toàn tự nguyện. Hình mờ được áp dụng trên mọi kênh sử dụng Claude, từ chatbot và giao diện lập trình ứng dụng đến Claude Code cũng như các đối tác điện toán đám mây như AWS, Google Cloud và Microsoft Foundry.
Theo giải thích của Anthropic, khi một mô hình Claude được hỗ trợ tạo văn bản, mô hình sẽ trực tiếp đan một hình mờ vào chính văn bản đó mà không làm thay đổi ý nghĩa, chất lượng hay khả năng đọc của phản hồi. Vì hình mờ là một phần của văn bản, nó sẽ đi cùng nội dung khi được sao chép và dán sang nơi khác, đồng thời có thể vẫn tồn tại sau một số thao tác chỉnh sửa.
Cơ chế này vì vậy phức tạp hơn so với những phương thức đánh dấu thông thường mà người dùng thường hình dung. Đối với tệp tin, Anthropic bổ sung thêm một lớp bảo vệ thứ hai là siêu dữ liệu có chữ ký theo tiêu chuẩn mở C2PA, ghi lại đơn vị đã tạo ra tệp và liệu tệp có bị chỉnh sửa sau đó hay không.
Anthropic hiện chưa công bố hình mờ được tạo ra bằng cách nào. Bài viết hỗ trợ mô tả đây là cơ chế ở cấp mô hình, tức mô hình được huấn luyện để tích hợp cơ chế này, đồng thời là cơ chế gốc của văn bản chứ không phải một công cụ bên ngoài như trình tạo siêu dữ liệu. Tuy nhiên, tài liệu về phương thức phát hiện cũng như kỹ thuật chính xác vẫn chưa được công bố.
Giới nghiên cứu suy đoán đây là một dấu hiệu thống kê, theo đó mô hình điều chỉnh lựa chọn từ ngữ theo một độ lệch rất nhỏ nhưng có thể phát hiện được, thuộc cùng nhóm phương pháp mà Google sử dụng trong SynthID Text, song đây vẫn chỉ là suy đoán cho đến khi Anthropic công bố công cụ phát hiện chính thức.
Giới lập trình bắt đầu tìm cách vô hiệu hóa hình mờ
Việc thiếu minh bạch về kỹ thuật không khiến những người quan tâm đến quyền riêng tư chùn bước, và một số chuyên gia đã bắt đầu phát triển các phương pháp nhằm phá cơ chế hình mờ bí mật của Anthropic. Dự án mikiane/claude-watermark-cleaner, hiện có 106 lượt gắn sao trên GitHub, loại bỏ các ký tự Unicode vô hình rồi viết lại văn bản bằng một mô hình không phải Claude để làm xáo trộn mẫu token.
Một dự án khác quy mô lớn hơn là guillaumemeyer/watermarks-remover, với 4.600 lượt gắn sao, có khả năng loại bỏ dấu hình mờ trong văn bản Claude đồng thời xử lý cả C2PA và các tín hiệu cùng nhóm với SynthID trên các định dạng PNG, JPEG, SVG, PDF và DOCX.
Các tác giả dự án này cho rằng hình mờ thống kê trong văn bản không phải là cách đáng tin cậy để chứng minh nguồn gốc, đồng thời lưu ý rằng chưa thể bảo đảm hiệu quả của bất kỳ phương pháp loại bỏ nào cho đến khi Anthropic công bố công cụ phát hiện và các ngưỡng xác định.
Lịch sử của chính Anthropic càng làm gia tăng phản ứng liên quan đến quyền riêng tư. Vào tháng 3, công ty đã loại bỏ một cơ chế theo dõi ẩn trong Claude Code sau khi các nhà nghiên cứu phát hiện hệ thống này gắn dấu vào thông tin vị trí và việc sử dụng máy chủ trung gian của một số người dùng thông qua các ký tự Unicode không được công bố, tương tự kiểu đánh dấu âm thầm hiện đang là tâm điểm của kế hoạch hình mờ lần này.
Bản thân cơ chế này cũng có giới hạn: hình mờ chỉ chứng minh rằng Claude đã tham gia vào quá trình xử lý văn bản, chứ không chứng minh Claude đã viết toàn bộ nội dung. Một văn bản gốc chỉ được Claude chỉnh sửa một phần nhỏ vẫn có thể bị hệ thống xử lý tương tự như văn bản hoàn toàn do AI tạo ra, trong khi việc chỉnh sửa ở mức độ lớn lại có thể loại bỏ hình mờ, và việc không phát hiện thấy hình mờ cũng không chứng minh văn bản do con người viết.
Tại Mỹ, dự luật COPIED Act cũng theo đuổi ý tưởng tương tự nhằm xây dựng một phương thức tiêu chuẩn hóa để nhúng hình mờ vào nội dung do AI tạo ra. Anthropic hiện chưa cho biết khi nào sẽ công bố công cụ phát hiện để bất kỳ ai cũng có thể xác minh hình mờ này.




































































