OpenAI thừa nhận AI 'vượt ngục': Tự vượt kiểm soát, tấn công hệ thống bên ngoài để hoàn thành nhiệm vụ
OpenAI ngày 22/7 cho biết một tác nhân AI (AI agent) vận hành bằng các mô hình tiên tiến của hãng đã tự ý vượt khỏi môi trường thử nghiệm, truy cập internet và thực hiện vụ tấn công mạng nhằm vào nền tảng Hugging Face trong quá trình kiểm tra an ninh nội bộ.
Trong bài đăng trên blog, OpenAI cho biết sự cố xảy ra khi công ty đang đánh giá năng lực an ninh mạng của một số mô hình AI tiên tiến trong môi trường được cô lập nghiêm ngặt. Tuy nhiên, tác nhân AI đã vượt qua các biện pháp kiểm soát, kết nối Internet và xâm nhập vào hệ thống của Hugging Face để hoàn thành mục tiêu được giao trong bài kiểm tra.
OpenAI mô tả đây là "một sự cố an ninh mạng chưa từng có tiền lệ, liên quan đến các năng lực tấn công mạng tiên tiến nhất hiện nay", đồng thời cho biết đang khẩn trương tăng cường các cơ chế bảo vệ nhằm ngăn chặn những tình huống tương tự.

Hugging Face, nền tảng lưu trữ các mô hình ngôn ngữ lớn (LLM) và bộ dữ liệu mã nguồn mở lớn nhất thế giới, trước đó đã gây chú ý khi tiết lộ mình trở thành mục tiêu của một vụ tấn công "khác hoàn toàn những gì từng xử lý". Theo công ty, toàn bộ quá trình xâm nhập được thực hiện từ đầu đến cuối bởi một hệ thống AI agent tự động, thay vì hacker điều khiển trực tiếp.
Đồng sáng lập Hugging Face, Clement Delangue, sau đó viết trên mạng xã hội X rằng công ty từng nghi ngờ vụ tấn công "có thể đến từ một phòng thí nghiệm AI hàng đầu vì mức độ tinh vi của tác nhân". Sau khi OpenAI công bố sự thật, ông bình luận: "Hóa ra đúng là như vậy. Điều đáng kinh ngạc là mọi thứ đều diễn ra hoàn toàn tự động".
Việc OpenAI xác nhận chính các mô hình AI tiên tiến của mình là nguyên nhân dẫn đến vụ xâm nhập, bất chấp chúng được đặt trong môi trường mà công ty gọi là "cô lập ở mức rất cao", được dự báo sẽ làm gia tăng lo ngại về mức độ kiểm soát cũng như rủi ro từ các mô hình AI thế hệ mới.
Nghị sĩ Greg Casar, thành viên Đảng Dân chủ bang Texas, gọi đây là sự cố đáng báo động. Ông cho rằng AI đang phát triển quá nhanh trong khi các quy định quản lý chưa theo kịp, đồng thời kêu gọi áp dụng bắt buộc các cuộc kiểm định an toàn độc lập, công khai các sự cố bảo mật và tăng cường hợp tác quốc tế nhằm ngăn chặn những thảm họa có thể xảy ra.
Trong khi đó, Văn phòng Điều phối An ninh mạng Quốc gia Mỹ, Cơ quan An ninh mạng và Hạ tầng (CISA) cùng Cơ quan An ninh Quốc gia Mỹ (NSA) chưa đưa ra bình luận về vụ việc.
Theo bà Katie Moussouris, Giám đốc điều hành Luta Security, đây có thể chỉ là dấu hiệu báo trước cho hàng loạt vụ tấn công tương tự trong tương lai. Bà ví các mô hình AI hiện đại như "những con bạch tuộc thông minh nhất thế giới, có vô số xúc tu và có thể chui qua mọi khe hở để thoát ra ngoài".
Bà cho rằng các phòng nghiên cứu AI và cơ quan quản lý cần sớm xây dựng các cơ chế đủ mạnh để cô lập, giám sát và thông báo cho các bên bị ảnh hưởng mỗi khi AI "biểu diễn màn đào thoát kiểu Houdini", tốt nhất là trước khi gây thiệt hại cho bên thứ ba. Theo bà, hiện vẫn chưa tồn tại hệ thống nào đáp ứng được yêu cầu này.
Ở góc độ khác, Matt Suiche, kỹ sư tại công ty an ninh mạng AI Tolmo, nhận định sự cố cho thấy các mô hình AI tiên tiến đang nhanh chóng thu hẹp khoảng cách với những nhóm tấn công mạng hàng đầu thế giới.
Tuy nhiên, ông cũng lưu ý kiểu tấn công mà OpenAI mô tả không còn là khả năng chỉ giới hạn trong các phòng nghiên cứu AI tiên phong. Theo ông, nhiều công nghệ hiện nay đã đủ sức thực hiện những cuộc tấn công tương tự.
"Đó là điều chúng tôi đã quan sát thấy từ lâu trong nội bộ. Các AI agent của chúng tôi cũng đạt được kết quả tương tự và thậm chí không cần sử dụng những mô hình mới nhất", Suiche nói.