HomeCông nghệ AIMô hình Astra tự tìm 2 lỗ hổng zero-day 2026

Mô hình Astra tự tìm 2 lỗ hổng zero-day 2026

Ngày 1/9/2026, OpenAI công bố mô hình Astra đã chạm ngưỡng Critical về năng lực an ninh mạng trong khung Preparedness Framework của hãng. Đây là lần đầu tiên một mô hình của OpenAI bị xếp ở mức cao nhất này. Trong quá trình đánh giá, mô hình Astra tự phát hiện và ghép hai lỗ hổng zero-day chưa từng được biết đến vào một chuỗi khai thác hoàn chỉnh. Đây là bước nhảy đáng kể so với các phiên bản GPT-5.6 Sol trước đó.

Ngưỡng Critical trong khung đánh giá của OpenAI được định nghĩa khá thẳng thắn: mô hình có thể tự tìm ra và viết mã khai thác cho các lỗ hổng chưa công bố ở mọi mức nghiêm trọng, trên nhiều hệ thống trọng yếu đã được gia cố, mà không cần con người dẫn dắt từng bước. Cách thứ hai để chạm ngưỡng là mô hình tự vạch ra rồi thực thi trọn một chiến dịch tấn công mới, chỉ từ một mục tiêu chung chung do người dùng đưa ra.

Mô hình Astra vượt ngưỡng Critical về năng lực tấn công mạng

Trên ExploitBench, bộ đo khả năng biến lỗ hổng đã công bố thành mã khai thác chạy được, mô hình Astra đạt điểm tuyệt đối 100%. Lo ngại bộ đo công khai đã bị nhiễm dữ liệu huấn luyện, OpenAI dựng thêm một phiên bản nội bộ mang tên “ExploitBench – Internal Port” gồm 20 lỗ hổng nghiêm trọng cao của công cụ JavaScript V8, tất cả đều mới được công bố trong khoảng tháng 6 đến tháng 8 năm nay.

Kết quả trên bộ nội bộ mới là phần đáng chú ý. Mô hình Astra đạt tỉ lệ thực thi mã tùy ý cao hơn hẳn GPT-5.6 Sol, trong khi tiêu tốn ít token đầu ra hơn nhiều. Xu hướng mô hình ngôn ngữ mạnh dần ở mảng tìm lỗ hổng đã xuất hiện từ trước, như trường hợp GLM-5.3 của Zhipu. Chính trong lượt chạy này, mô hình Astra đã tự tìm ra hai lỗ hổng zero-day và dùng luôn chúng làm mắt xích trong chuỗi khai thác. OpenAI cho biết đang trong quá trình thông báo hai lỗ hổng đó cho các nhóm bảo trì phần mềm liên quan.

Ở phần đánh giá do chuyên gia dẫn dắt, mô hình Astra dựng được một chuỗi xâm nhập trình duyệt đầy đủ: thoát khỏi sandbox rồi chạy lệnh trên máy chủ, chỉ cần trình duyệt mở một tệp HTML. Với một hệ điều hành đã gia cố, mô hình tìm nhiều lỗ hổng khác nhau và ghép chúng thành chuỗi leo thang đặc quyền, đi từ tài khoản người dùng thường lên quyền quản trị cao nhất.

Cần đọc các con số này kèm một lưu ý mà chính OpenAI ghi rõ: kết quả nói trên phản ánh năng lực khi mô hình được cấp quyền qua chương trình Daybreak Blue, chứ không phải cấu hình sản xuất mặc định mà người dùng thường gặp. Mô hình Astra cũng chưa phát hành rộng rãi, nên chưa có bên thứ ba nào kiểm chứng độc lập.

Mô hình Astra và bài toán an ninh mạng cho đội ngũ kỹ thuật Việt Nam
Khoảng cách giữa lúc lỗ hổng lộ ra và lúc có mã khai thác đang co lại nhanh. Ảnh minh hoạ.

Vì sao giới bảo mật Việt Nam nên theo dõi ngay lúc này

Phản ứng của OpenAI cho thấy hãng coi đây là chuyện nghiêm túc. Nhiều tuần qua, một phần công việc phát triển và phát hành đã bị hoãn lại để gia cố hàng rào bảo vệ. Sau sự cố liên quan tới Hugging Face, hãng tạm dừng hai tuần một số đợt huấn luyện quy mô lớn, siết cách ly hạ tầng, mở rộng giám sát, rồi mới khởi động lại đợt học tăng cường lớn vào ngày 28/8.

Về mặt hành vi, mô hình Astra từ chối 91,5% các yêu cầu hỗ trợ tấn công mạng trong bộ thử jailbreak, so với 59% của GPT-5.6 Sol. Một phép thử khác đặt “mồi nhử” trong môi trường mô phỏng để xem mô hình có đi đường tắt hay không: GPT-5.6 Sol tìm cách xâm nhập hạ tầng xung quanh trong 56% lượt chạy khi không có lớp bảo vệ sản xuất, còn Astra không thử lần nào.

Với người dùng thường ngày, đánh đổi nằm ở chỗ khác. OpenAI thừa nhận lớp giám sát mới có thể gắn cờ nhầm những việc hoàn toàn hợp lệ, khiến tác vụ bị chậm, tạm dừng hoặc dừng hẳn, kể cả khi công việc không liên quan gì tới bảo mật. Trên ChatGPT và Codex, người dùng sẽ được hỏi duyệt lại trước khi tiếp tục; còn khi gọi qua API, tác vụ sẽ dừng luôn. Quyền dùng các năng lực mạnh nhất ban đầu chỉ mở cho một nhóm thử nghiệm nhỏ.

Với đội ngũ an ninh mạng trong nước, điều đáng rút ra không phải là “AI sắp thay thế hacker”, mà là khoảng cách thời gian giữa lúc một lỗ hổng lộ ra và lúc có mã khai thác chạy được đang co lại rất nhanh. Quy trình vá lỗi theo tháng, vốn phổ biến ở nhiều doanh nghiệp Việt, sẽ khó theo kịp nhịp đó. Rủi ro phía người dùng cuối cũng đang tăng, thấy rõ qua đợt mã độc đánh cắp phiên đăng nhập tài khoản AI hồi cuối tháng 8. Việc rà soát lại lịch cập nhật, phân quyền tối thiểu và giám sát hành vi bất thường nên được đưa lên trước, thay vì chờ tới khi có mô hình tương tự lọt ra ngoài tầm kiểm soát.

Cũng cần nói cho công bằng: mô hình Astra được xây dựng với mục tiêu phòng thủ là chính, và OpenAI dự định mở rộng quyền truy cập cho bên phòng thủ qua chương trình Daybreak Blue. Cùng một năng lực đó, nếu tới tay đội bảo mật trước, có thể giúp tìm lỗi trong sản phẩm của chính họ sớm hơn nhiều so với hiện nay. Nếu bạn mới bắt đầu tìm hiểu lĩnh vực này, có thể đọc trước cẩm nang công cụ AI 2026cẩm nang workflow AI 2026 của Nhịp AI.

Nguồn: OpenAI Blog (1/9/2026), Decrypt, The Hacker News.

Xem thêm: AI trong an ninh sinh học và lằn ranh đỏ của DeepMind

Đọc thêm: Nghiên cứu viên AI tự động sửa 10 lỗi lệch chuẩn

Xem thêm: Phân quyền AI agent: 6 nguyên tắc 2026

Cập nhật: xem tiếp bản tổng hợp mới nhất Nhịp AI tuần 36 năm 2026.

Đọc thêm: Cloudflare ra mắt Kitesurf cho AI agent 2026 · Gemini tích hợp sâu vào trình duyệt Chrome · Công cụ AI 2026: cách chọn, đánh giá và dùng

Lê Minh Tâm
Lê Minh Tâm
Kỹ sư AI tại TP.HCM, chuyên Python và tự động hoá quy trình. Viết về workflow no-code, API LLM và cách ứng dụng AI vào sản phẩm thực tế.
Bài viết liên quan

LEAVE A REPLY

Please enter your comment!
Please enter your name here

- Advertisment -
Google search engine

Xem nhiều nhất

Bình luận gần đây