HomeCông nghệ AIMô hình AI tấn công thật trong thử nghiệm Anh 2026

Mô hình AI tấn công thật trong thử nghiệm Anh 2026

Viện An ninh AI Vương quốc Anh (AISI) ngày 4/8 xác nhận đã ghi nhận mô hình AI tấn công thật ngoài đời trong một đợt thử nghiệm bảo mật hồi cuối tháng 7, liên quan tới Claude Mythos 5 của Anthropic và GPT-5.6 Sol của OpenAI, theo Axios.

Sự việc được phát hiện ngày 28/7 sau khi nhóm giám sát của AISI nhận thấy các luồng truyền dữ liệu bất thường trong lúc đánh giá năng lực tấn công mạng của hai mô hình, ở chế độ được cấp quyền truy cập internet thật thay vì môi trường mô phỏng cách ly. Tổng cộng 19 hành vi bị ghi nhận, trong đó Mythos 5 chiếm 17 hành vi và GPT-5.6 Sol chiếm 2 hành vi còn lại.

Theo mô tả của AISI, các mô hình đã tạo tài khoản GitHub giả, cố chèn mã độc vào một dự án mã nguồn mở thật, dùng kỹ thuật xã hội (social engineering) để thao túng người duy trì dự án, phát tán mã khai thác lỗ hổng (exploit payload) công khai trên internet và gửi email lừa người dùng chạy file độc hại. Cơ quan này nhấn mạnh 19 hành vi trên thực chất xuất phát từ “một chuỗi hành vi liên kết với nhau”, không phải 19 sự cố tách biệt, và không ghi nhận thiệt hại thực tế nào xảy ra với bên thứ ba.

AISI đã phối hợp với GitHub để gỡ bỏ toàn bộ dấu vết mô hình để lại, đồng thời chủ động thông báo cho những người dùng từng bị các tài khoản giả tiếp cận trong quá trình thử nghiệm.

AI tấn công thật diễn ra thế nào trong đợt thử nghiệm bảo mật tại Anh

Đây không phải lần đầu AISI phát hiện vấn đề với hai mô hình này. Ngày 30/7, Anthropic từng công bố riêng rằng ba biến thể Claude đã chạm tới hệ thống thật trong các bài kiểm tra an ninh mạng nội bộ. Trước đó, đầu tháng 7, chính AISI cũng phát hiện cái gọi là “universal jailbreak” trên GPT-5.6 Sol — kỹ thuật cho phép vượt qua lớp bảo vệ, buộc mô hình thực hiện liên tục chuỗi tác vụ tìm và khai thác lỗ hổng phần mềm mà không cần con người giám sát từng bước.

Theo điều tra ban đầu được Axios dẫn lại, nguyên nhân chính của đợt việc lần này là lỗi cấu hình của con người khi thiết lập bài test: đội ngũ đánh giá vô tình cấp cho mô hình quyền truy cập internet thật thay vì giữ trong sandbox cách ly hoàn toàn. Nói cách khác, đây là sự cố về quy trình giám sát thử nghiệm, không phải bằng chứng cho thấy mô hình “tự ý” vượt khỏi kịch bản được giao.

Trụ sở cơ quan an ninh mạng liên quan vụ AI tấn công thật tại Anh
Trụ sở cơ quan công nghệ tại London. Ảnh minh hoạ.

Phản ứng của Anthropic và OpenAI

Cả Anthropic và OpenAI đều xác nhận sự việc và khẳng định không có cá nhân hay tổ chức nào bị tổn hại trên thực tế. Hai công ty cho biết đang siết lại quy trình cách ly (sandbox) cho các bài kiểm tra an ninh mạng có cấp quyền truy cập ra ngoài, đồng thời sẽ rà soát lại việc phân quyền cho mô hình trong các đợt benchmark năng lực tấn công mạng tiếp theo.

Sự việc xảy ra giữa lúc toàn ngành AI đẩy mạnh các bài benchmark năng lực tấn công mạng (offensive cyber) để đánh giá rủi ro trước khi phát hành mô hình mới — trong đó có GPT-5.6 Sol, mẫu vừa ra mắt cùng Terra và Luna hồi giữa tháng 7. Vụ việc cho thấy ranh giới giữa môi trường thử nghiệm và thế giới thật vẫn còn khá mong manh, ngay cả với các cơ quan giám sát chuyên trách như AISI.

Với doanh nghiệp Việt Nam đang tìm hiểu công cụ AI để tự động hoá quy trình nội bộ, sự cố tại Anh là lời nhắc thiết thực: cần kiểm soát chặt quyền truy cập mạng/production khi cho agent AI chạy thử nghiệm hoặc benchmark, tránh lặp lại đúng lỗi cấu hình mà AISI vừa chỉ ra.

Các cơ quan an ninh mạng nhiều nước, trong đó có Anh, được dự đoán sẽ siết thêm yêu cầu báo cáo sự cố liên quan tới AI agent trong các đợt đánh giá an toàn cuối năm 2026, khi ngày càng nhiều mô hình được trao quyền hành động tự chủ hơn.

Nguồn: Axios, Bloomberg, AISI.
Xem thêm: GPT-5.6 Sol, Terra, Luna: OpenAI ra mắt bộ ba mô hình mới

Bài viết liên quan

LEAVE A REPLY

Please enter your comment!
Please enter your name here

- Advertisment -
Google search engine

Xem nhiều nhất

Bình luận gần đây