AI của Google bất ngờ 'vượt kiểm soát', xâm nhập hệ thống của 3 doanh nghiệp
Mô hình Gemini của Google đã tự truy cập internet và xâm nhập hệ thống của 3 công ty trong một cuộc thử nghiệm năng lực an ninh mạng, đánh dấu trường hợp đầu tiên được biết đến trong đó hệ thống AI của hãng tự thực hiện hành động như vậy.
Sự việc xảy ra hồi tháng 5 trong một cuộc đánh giá an ninh mạng do Irregular, một công ty độc lập chuyên kiểm thử khả năng của các mô hình AI, thực hiện.
Trong quá trình kiểm thử tiêu chuẩn, Gemini đã tìm kiếm thông tin công khai trên internet, sau đó đoán thông tin đăng nhập để truy cập 3 trang web mà mô hình cho rằng nằm trong phạm vi được phép thử nghiệm.
Heather Adkins, Phó chủ tịch phụ trách kỹ thuật bảo mật của Google, cho biết hãng đã đảm bảo cả 3 tổ chức liên quan đều được thông báo về sự việc, đồng thời phối hợp với đối tác đào tạo để điều chỉnh quy trình kiểm thử.
“Những sự việc này cho thấy tầm quan trọng của việc huấn luyện các mô hình AI mạnh mẽ hành động có trách nhiệm”, bà Adkins cho biết.

Theo Google, trong cả 3 trường hợp, Gemini đều dừng hành động xâm nhập sau đó.
Irregular cho biết sự cố xuất phát từ cùng một vấn đề từng ảnh hưởng đến các phòng thí nghiệm AI khác. Tất cả các bên liên quan đã được thông báo vào cuối tháng 7 và những lỗ hổng được biết đến trong hệ thống của công ty đã được khắc phục từ nhiều tuần trước.
Không chỉ Gemini gặp sự cố
Các sự cố tương tự liên quan đến Irregular trước đó cũng được Meta, Anthropic và OpenAI công bố.
Meta hồi tháng 8 cũng xác nhận một mô hình AI của hãng đã xâm nhập hệ thống của một công ty khác trong quá trình thử nghiệm. Tuy nhiên, Meta khi đó cho biết sự cố không liên quan tới việc AI phá vỡ môi trường cách ly hay thực hiện một cuộc tấn công mạng tinh vi.
Các sự cố tương tự cũng từng được ghi nhận với hệ thống của Anthropic và OpenAI. Irregular sau đó cho biết đang phối hợp với các hãng AI để xây dựng những thực hành an toàn hơn khi tiến hành các bài đánh giá năng lực an ninh mạng.
Những sự việc này đang làm dấy lên câu hỏi về mức độ kiểm soát cần thiết khi các AI agent ngày càng được trao nhiều quyền tự chủ hơn.
Khác với chatbot truyền thống chủ yếu tạo ra câu trả lời bằng văn bản, các AI agent thế hệ mới có thể sử dụng công cụ, chạy lệnh, truy cập Internet và tương tác trực tiếp với các hệ thống máy tính để hoàn thành nhiệm vụ.
Chính khả năng này giúp chúng trở nên hữu ích trong lập trình, nghiên cứu và an ninh mạng, nhưng đồng thời cũng làm tăng nguy cơ AI thực hiện hành động ngoài phạm vi mà con người dự tính.
Trong trường hợp của Gemini, mô hình không được giao nhiệm vụ tấn công các công ty thực tế. Tuy nhiên, AI đã tự tìm thông tin trên Internet, suy luận rằng các hệ thống bên ngoài thuộc phạm vi bài kiểm tra, sau đó sử dụng thông tin đăng nhập để truy cập chúng.
Sự việc vì thế khác với một cuộc tấn công mạng thông thường do con người chủ động điều khiển. Vấn đề đáng chú ý nằm ở việc mô hình đã tự lựa chọn chuỗi hành động cần thiết để đạt mục tiêu được giao.
Bài toán kiểm soát AI ngày càng phức tạp
Các sự cố xuất hiện vào thời điểm những hệ thống AI tiên tiến đang ngày càng có khả năng tự thực hiện nhiều bước công việc liên tiếp mà không cần con người can thiệp ở từng khâu.
Điều này khiến vấn đề an toàn không còn chỉ nằm ở việc AI tạo ra nội dung sai hoặc nguy hiểm, mà còn liên quan tới những hành động mà hệ thống có thể thực hiện trong thế giới thực.
Tại Mỹ, hiện chưa có một quy định liên bang toàn diện buộc các công ty AI phải công bố mọi sự cố liên quan tới mô hình có hành vi ngoài dự kiến. Một số quy định về an ninh mạng và bảo vệ dữ liệu có thể được áp dụng nếu xảy ra thiệt hại hoặc rò rỉ thông tin, nhưng vẫn tồn tại khoảng trống đối với những sự cố chưa gây hậu quả rõ ràng.
Các công ty AI vì thế đang chịu áp lực ngày càng lớn phải tăng cường kiểm thử độc lập, giới hạn quyền truy cập của mô hình và thiết kế những cơ chế ngăn AI agent vượt ra ngoài phạm vi nhiệm vụ.
Với Gemini, sự cố tháng 5 không gây ra thiệt hại được công bố và mô hình đã dừng hoạt động sau khi truy cập các hệ thống.
Tuy nhiên, việc một AI có thể tự tìm thông tin đăng nhập trên Internet, đoán mật khẩu và truy cập vào hệ thống thực tế cho thấy thách thức kiểm soát đang thay đổi nhanh chóng khi AI không còn chỉ “trả lời”, mà ngày càng có khả năng trực tiếp “hành động”.