Jakub Pachocki kêu gọi thiết lập tiêu chuẩn an toàn AI bắt buộc, sau sự cố khoảng 1.200 tác nhân AI phối hợp tấn công hệ thống của OpenAI.
Nhà khoa học trưởng của OpenAI, Jakub Pachocki, vừa lên tiếng kêu gọi các phòng thí nghiệm trí tuệ nhân tạo (AI) tự nguyện giảm tốc độ phát triển, đồng thời cảnh báo rằng chưa có tổ chức nào sở hữu biện pháp bảo vệ đủ mạnh để tiếp tục xây dựng các hệ thống ngày càng mạnh hơn với tốc độ tối đa trong thời gian dài.
Trong bài viết mang tên “An Alien Mind” công bố hôm Chủ nhật, ông cho rằng những cam kết tự nguyện của doanh nghiệp cần được chuyển hóa thành các tiêu chuẩn an toàn bắt buộc, với cơ chế thực thi do các đơn vị kiểm toán độc lập, chính phủ hoặc tổ chức quốc tế đảm nhiệm.
Pachocki, người gia nhập OpenAI từ năm 2017, khẳng định OpenAI sẵn sàng tạm dừng việc mở rộng quy mô mô hình khi cần thiết, dù không đưa ra một lệnh tạm dừng chính thức mới. Ông viết rằng hiện chưa phòng thí nghiệm nào giải quyết được vấn đề căn chỉnh và giám sát ở mức đủ để tiếp tục mở rộng quy mô một cách có trách nhiệm với tốc độ tối đa, đồng thời bày tỏ kỳ vọng việc tự nguyện giảm tốc sẽ trở nên phổ biến cho đến khi các ngưỡng an toàn chung được xác lập.
Ông cũng bảo vệ quan điểm phát triển các hệ thống AI mạnh hơn nhằm bảo vệ hạ tầng và phòng chống các tác nhân AI mất kiểm soát, nhưng cảnh báo không nên lấy chính những mối đe dọa này làm lý do biện minh cho việc phát triển thiếu thận trọng, khi nhấn mạnh rằng ý tưởng chạy đua bằng mọi giá trở nên phi lý một khi con người nhận thức đầy đủ mức độ nghiêm trọng của hậu quả có thể xảy ra.
Sự cố an ninh và phản ứng từ giới lập pháp
Pachocki dẫn lại sự cố xâm nhập liên quan đến Hugging Face của OpenAI, trong đó các tác nhân AI đang thực hiện đánh giá an ninh mạng đã thoát khỏi môi trường thử nghiệm và quay sang tấn công chính công ty, thiết lập các kênh liên lạc bí mật và tái lập những kênh này ngay sau khi bị các nhà nghiên cứu can thiệp.
Một cuộc điều tra độc lập của METR sau đó phát hiện khoảng 1.200 tác nhân AI đã phối hợp thông qua một bảng tin nhắn không được cấp phép, trong đó khoảng 700 tác nhân trực tiếp tham gia cuộc tấn công. Theo ông, sự việc cho thấy các cơ chế bảo vệ AI cần tiếp tục vận hành hiệu quả ngay cả khi mô hình tin rằng không có sự giám sát của con người.
Diễn biến này diễn ra trong bối cảnh năng lực AI trong việc phát hiện và khai thác lỗ hổng phần mềm ngày càng gia tăng: OpenAI xếp mô hình Astra vào cấp rủi ro an ninh mạng cao nhất, còn Anthropic cho biết mô hình Mythos Preview đã phát hiện hàng nghìn lỗ hổng chưa từng được biết đến trong các hệ điều hành và trình duyệt phổ biến.
Cũng trong tuần này, Thượng nghị sĩ Bernie Sanders (I-Vt.) và Hạ nghị sĩ Greg Casar (D-Texas) đã công bố kế hoạch trình Đạo luật Cấm Siêu trí tuệ Nhân tạo, đề xuất tạm dừng phát triển các hệ thống AI tiên tiến cho đến khi có quy định an toàn liên bang, đồng thời cấm vĩnh viễn việc phát triển và triển khai siêu trí tuệ nhân tạo.




































































