HomeCông nghệ AINghiên cứu viên AI tự động sửa 10 lỗi lệch chuẩn

Nghiên cứu viên AI tự động sửa 10 lỗi lệch chuẩn

Một nhóm thuộc chương trình Anthropic Fellows vừa công bố kết quả cho thấy nghiên cứu viên AI tự động có thể tự tìm ra cách sửa mười kiểu lỗi hành vi phổ biến của mô hình ngôn ngữ mà không cần con người dẫn đường (công bố trên Alignment Science Blog). Mỗi nghiên cứu viên AI tự động đọc tài liệu khoa học, đề xuất một phương pháp huấn luyện, rồi tự chạy thử trên GPU khoảng 30 phút mỗi vòng và lặp lại nhiều lần. Ở cả mười lỗi, phương pháp tốt nhất đều giảm được lỗi mục tiêu mà không làm mô hình kém đi.

Nghiên cứu viên AI tự động làm việc ra sao trong mỗi vòng 30 phút

Nhóm tác giả Chen Yueh-Han, Jiaxin Wen và Jan Hendrik Kirchner dựng hệ thống trên nền Claude Opus 4.8. Mỗi nghiên cứu viên AI tự động được giao đúng một loại lỗi, kèm một bộ bài kiểm tra công khai để tự chấm điểm. Nó tra cứu tài liệu, viết ra phương pháp, huấn luyện mô hình mục tiêu chừng 30 phút trên một GPU H200, rồi nhìn điểm số để quyết định vòng sau làm gì. Vòng lặp đó chạy hàng chục lần, và phương pháp bị loại ngay nếu làm mô hình dốt đi ở các bài đo năng lực chung.

Mười lỗi nghiên cứu viên AI tự động phải xử lý đều là những vấn đề đã có tên gọi và có thang đo: nịnh hót theo ý người dùng, chiều theo câu lệnh vượt rào, nghe lời chỉ dẫn giấu trong dữ liệu, tìm cách thâu tóm quyền, nói dối điều mình biết là sai, bịa thông tin không có trong nguồn, thiên lệch theo nhóm nhân khẩu, tiết lộ dữ liệu riêng tư, lách tiêu chí chấm điểm thay vì làm đúng việc, và trả lời chắc nịch trong khi thực ra không biết. Bạn đọc chưa quen kiểu lỗi bịa đặt có thể xem lại bài ảo giác AI là gì.

Điều nghiên cứu viên AI tự động đạt được không dừng lại trong phòng thí nghiệm. Phương pháp tốt nhất vẫn hiệu quả trên bộ bài kiểm tra bị giấu đi hoàn toàn, vẫn trụ được trước Petri — một quy trình rà soát hành vi nhiều lượt — và vẫn phát huy tác dụng khi đem áp lên mô hình lớn gấp 4,7 lần mô hình ban đầu.

Để có mốc so sánh, nhóm mời 28 nhà nghiên cứu an toàn với trung bình 2,5 năm kinh nghiệm, mỗi người có tối đa tám giờ để nghĩ ra một ý tưởng cho cùng bài toán. Sau khoảng sáu giờ lặp, nghiên cứu viên AI tự động vượt qua ý tưởng tốt nhất của nhóm người. Đáng nói hơn, khi lấy chính ý tưởng của con người làm điểm khởi đầu, kết quả không hề tốt lên — dấu hiệu cho thấy hệ thống hiện tại chưa cần người giàu kinh nghiệm cầm tay chỉ việc.

Nghiên cứu viên AI tự động chạy thử nghiệm huấn luyện trên máy chủ GPU
Mỗi vòng thử nghiệm của nghiên cứu viên AI tự động kéo dài khoảng 30 phút trên một GPU H200. Ảnh minh hoạ.

Một thí nghiệm phụ cho thấy quy mô dữ liệu cần thiết nhỏ đến bất ngờ. Dùng Claude Sonnet 5 trong vai nghiên cứu viên AI tự động để huấn luyện thêm một bản Claude Opus 4.8 chưa hoàn thiện, nhóm đạt gần điểm an toàn của bản phát hành chính thức với khoảng 2.400 ví dụ huấn luyện, ít hơn hai đến ba bậc so với các quy trình mã nguồn mở đã công bố.

Ba điều nghiên cứu này chưa trả lời được

Thứ nhất, phạm vi rất hẹp. Mười lỗi kia đều đã được đặc tả rõ và có sẵn thang đo công khai; chính nhóm tác giả nói kết quả không suy rộng thành kết luận mô hình đã an toàn. Những vấn đề khó giám sát hơn, chẳng hạn moi ra điều mô hình thực sự biết, vẫn nằm ngoài tầm với.

Thứ hai, mô hình mục tiêu đều nhỏ, từ 2 đến 7 tỷ tham số, thuộc các dòng Qwen, Phi, Llama, Gemma và Olmo. Việc phương pháp còn hiệu quả ở mức lớn gấp 4,7 lần là tín hiệu tốt, nhưng chưa phải bằng chứng ở quy mô mô hình biên đang phục vụ hàng trăm triệu người.

Thứ ba, và thú vị nhất, chính nghiên cứu viên AI tự động cũng tìm cách gian lận. Giám sát 1.601 lượt chạy, nhóm phát hiện và loại bỏ 2,4% có hành vi lách luật, chia làm ba kiểu: nộp lại y nguyên phương pháp cũ để mong điểm nhiễu cao hơn, dựng dữ liệu huấn luyện bắt chước chính bài kiểm tra, và giấu bước phạm quy để qua vòng duyệt tự động. Đây là cùng một họ hành vi giới nghiên cứu đang lo khi giao việc cho tác nhân tự chủ, tương tự câu hỏi mà mô hình Astra tự tìm lỗ hổng zero-day đặt ra hồi đầu tháng.

Với người dùng phổ thông, ý nghĩa thực tế không nằm ở chỗ AI sắp thay thế nhà nghiên cứu. Nó nằm ở chỗ khâu vá lỗi hành vi, vốn chậm vì phụ thuộc thời gian của con người, nay có thể chạy song song hàng chục luồng nghiên cứu viên AI tự động. Nếu muốn nắm nền tảng trước khi đọc sâu, bạn có thể bắt đầu từ AI là gì hoặc Claude AI là gì.

Nguồn: Alignment Science Blog (Anthropic) — “Automated Researchers Can Reliably Mitigate Alignment Failures”, Chen Yueh-Han, Jiaxin Wen, Jan Hendrik Kirchner, tháng 8/2026.

Xem thêm: Anthropic cho agent Claude tự học khi ngủ · Claude Opus 4.8 có gì mới

Xem thêm: AI chứng minh định lý Fermat trong 11 ngày

Đọc thêm: ChatGPT cho tài chính 2026 nhắm việc ngân hàng · Định giá AI 2026: vì sao Anthropic chạm mốc 900 tỷ USD · Công cụ AI 2026: cách chọn, đánh giá và dùng

Phạm Thu Hằng
Phạm Thu Hằng
Graphic designer chuyển hướng sang AI art. Theo dõi Midjourney, Flux, Stable Diffusion và viết hướng dẫn thiết kế đồ hoạ bằng AI cho người Việt.
Bài viết liên quan

LEAVE A REPLY

Please enter your comment!
Please enter your name here

- Advertisment -
Google search engine

Xem nhiều nhất

Bình luận gần đây