Sau OpenAI, Đến lượt mô hình Claude của Anthropic “vượt rào”

  • Hương Thủy/Bnews/vnanet.vn

BNEWS Hôm 30/7, Anthropic thừa nhận mô hình AI mang tên Claude của hãng đã thâm nhập trái phép vào hệ thống của ba công ty trong quá trình thử nghiệm do một lỗi thiết lập hệ thống.

Chỉ vài ngày sau khi OpenAI thừa nhận một tác nhân trí tuệ nhân tạo (AI agent) của hãng đã tự động "vượt rào" tấn công nền tảng Hugging Face và một số tổ chức khác, đến lượt Anthropic - đối thủ lớn nhất của OpenAI - lên tiếng xác nhận sự cố tương tự.

Hôm 30/7, Anthropic thừa nhận mô hình AI mang tên Claude của hãng đã thâm nhập trái phép vào hệ thống của ba công ty trong quá trình thử nghiệm do một lỗi thiết lập hệ thống.

Theo Anthropic, sự cố bắt nguồn từ các bài kiểm tra an ninh mạng nội bộ mô phỏng các cuộc tấn công để tìm lỗ hổng. Dù các kỹ sư đã ra lệnh rõ ràng rằng AI không được phép sử dụng Internet, nhưng do một lỗi thiết lập hệ thống giữa Anthropic và đối tác đánh giá Irregular, mô hình Claude vẫn được kết nối với mạng bên ngoài môi trường thử nghiệm. Nhờ kẽ hở này, thay vì chỉ hoạt động trong môi trường giả lập được cách ly, Claude đã "vượt rào" và nhắm mục tiêu vào các hệ thống thực tế.

Báo cáo chi tiết của Anthropic cho hay ba mô hình gồm Claude Opus 4.7, Claude Mythos 5 và một mô hình nghiên cứu nội bộ đã trực tiếp thực hiện các vụ xâm nhập này. Những vi phạm đầu tiên xuất hiện từ tháng 4, trong các môi trường đánh giá thiếu vắng các biện pháp bảo vệ tiêu chuẩn. Báo cáo ghi nhận các mô hình AI đã sử dụng các kỹ thuật tấn công cơ bản, chẳng hạn như dò tìm các mật khẩu yếu hoặc khai thác các cổng kết nối không được bảo mật để thâm nhập vào cơ sở hạ tầng của ba tổ chức độc lập.

Đáng chú ý, Anthropic chỉ phát hiện ra các vụ tấn công này khi tiến hành rà soát lại hơn 140.000 phiên thử nghiệm cũ ngay sau thời điểm đối thủ OpenAI tiết lộ sự cố tương tự hồi tuần trước. Ngay khi phát hiện dấu hiệu bất thường vào ngày 23/7, Anthropic đã lập tức đình chỉ mọi hoạt động đánh giá an ninh mạng. Hãng đã khoanh vùng thành công các sự cố vào ngày 24/7 và gửi thông báo đến các tổ chức bị ảnh hưởng ba ngày sau đó. Hai trong số ba tổ chức thừa nhận họ hoàn toàn không hay biết hệ thống của mình đã bị AI tấn công cho đến khi nhận được email từ Anthropic.

Các chuyên gia an ninh mạng nhận định hàng loạt sự cố "vượt rào" gần đây là một tín hiệu đáng báo động. Nó cho thấy tốc độ phát triển quá nhanh của AI đang biến những rủi ro an ninh mạng tiềm ẩn thành hiện thực. Đáng lo ngại hơn, ngay cả những nhà phát triển công nghệ hàng đầu thế giới cũng có thể mất cảnh giác trước những lỗ hổng do chính AI của họ tự tìm ra và khai thác.

Sau sự cố này, đại diện Anthropic nhấn mạnh sự cấp thiết của việc thắt chặt các biện pháp kiểm soát an ninh đối với cả môi trường thử nghiệm nội bộ và đối tác bên thứ ba, đặc biệt khi AI ngày càng đủ khả năng thực hiện các cuộc tấn công mạng trong thế giới thực.
Hương Thủy/Bnews/vnanet.vn


Tin cùng chuyên mục