Pew Research quét gần 490.000 trang web bằng công cụ phát hiện AI, phát hiện tỷ lệ nội dung do AI viết tăng vọt, tập trung nhiều nhất ở tên miền .com.
Nội dung do AI viết hiện diện ở khắp mọi nơi, theo đúng nghĩa đen. Theo một nghiên cứu của Pew Research Center công bố hôm thứ Năm, hiện cứ 10 trang web tiếng Anh thì có một trang cho thấy dấu hiệu đáng kể của việc được viết bằng AI. Nếu thu hẹp mẫu chỉ còn những trang được xuất bản kể từ khi ChatGPT ra mắt vào tháng 11/2022, tỷ lệ này tăng lên 35%.
Các kết quả được đưa ra sau khi nhóm nghiên cứu thu thập khoảng 490.000 trang từ kho lưu trữ web Common Crawl, bao phủ giai đoạn từ tháng 1/2021 đến tháng 7/2026, sau đó đưa phần văn bản qua Open Pangram, một mô hình phát hiện nội dung AI do Pangram Labs phát triển.
Dấu vết của AI không phân bố đồng đều giữa các loại tên miền. Các trang thuộc tên miền .com cho thấy dấu hiệu nội dung do AI viết với tỷ lệ cao gấp khoảng 10 lần so với các tên miền .edu hoặc .gov, vốn đều ở mức gần 1%, và cao khoảng gấp đôi tỷ lệ 4,6% của các trang .org.
Năm 2021, cả bốn loại tên miền này còn có tỷ lệ gần như tương đồng, nhưng khoảng cách đã nới rộng đáng kể theo thời gian. Xét trên quy mô lớn, tỷ lệ nội dung có dấu hiệu do AI viết trên các tên miền .com đã tăng từ khoảng 1% vào tháng 1/2021 lên 9,35% vào tháng 1/2026, tức chỉ trong vòng năm năm.
Cách Pew phát hiện nội dung do máy tạo ra
Công cụ phát hiện không đánh dấu dựa trên bất kỳ từ hay cụm từ đơn lẻ nào, mà thay vào đó đánh giá các mẫu thống kê trên những tập văn bản lớn. Tuy nhiên, một số dấu hiệu riêng lẻ đã trở nên phổ biến hơn rõ rệt kể từ năm 2023: dấu gạch ngang dài xuất hiện với tần suất cao gần gấp đôi, dấu phẩy Oxford tăng 63%, trong khi những từ thường được AI ưa dùng như “delve”, “interplay” và “testament” đã tăng hơn gấp đôi về tần suất xuất hiện.
Cấu trúc song hành phủ định, chẳng hạn kiểu diễn đạt “không chỉ là X, mà còn là Y”, đã tăng gần gấp ba kể từ năm 2023, dù Pew lưu ý cấu trúc này nhìn chung vẫn tương đối hiếm.
Pew cũng thận trọng lưu ý về những giới hạn của phương pháp này: các mô hình phát hiện có thể phân loại sai từng trang theo cả hai chiều, và việc một trang có dấu hiệu đáng kể của nội dung do AI viết không đồng nghĩa toàn bộ trang đó được máy tạo ra, bởi nhiều nội dung trong số này có thể chỉ được AI hỗ trợ thay vì hoàn toàn do AI tạo sinh.
Một nghiên cứu độc lập khác cũng sử dụng công cụ phát hiện của Pangram Labs từng phát hiện văn bản do AI tạo ra trong khoảng 9% số bài báo tại Mỹ trong năm nay, bao gồm cả các trang bình luận tại những cơ quan truyền thông như The New York Times.
Khoảng cách giữa các loại tên miền phản ánh đối tượng xuất bản và mục đích xuất bản khác nhau. Các trang học thuật và chính phủ phải trải qua quy trình biên tập, phê duyệt của tổ chức và chu kỳ xuất bản chậm hơn, trong khi các tên miền .com bao gồm mọi loại hình, từ các tòa soạn báo chí đến những trang trại nội dung tiếp thị liên kết liên tục sản xuất trang mới với tốc độ mà không một biên tập viên con người nào có thể duy trì.
Dù vậy, việc phát hiện AI có thể trở nên dễ dàng hơn theo thời gian, không phải nhờ các mẫu ngôn ngữ mà nhờ chính công nghệ nền tảng, khi các công ty AI lớn như Anthropic đã bắt đầu nghiên cứu cơ chế dấu vân tay văn bản ở cấp độ mô hình nhằm giúp nhận diện nội dung do AI tạo ra chính xác hơn.



































































