OpenAI lo ngại về mô hình của chính mình

1 hour ago 9
Quảng Cáo

0943778078

Đây là lần đầu tiên một mô hình của OpenAI chạm ngưỡng an ninh mạng cao nhất trong khung đánh giá nội bộ của công ty.

Ngày 7/8, OpenAI công bố mô hình sắp ra mắt mang tên Astra cho thấy dấu hiệu chạm ngưỡng Critical (nguy cấp), mức cao nhất trong Preparedness Framework, khung đánh giá an toàn nội bộ mà công ty xây dựng từ tháng 12/2023. Đây là lần đầu tiên một mô hình của OpenAI được gắn cảnh báo ở mức này. Các mô hình trước đó, bao gồm GPT-5.6 Sol, chỉ dừng ở mức High (cao) khi được đánh giá năng lực tấn công mạng.

Theo bài đăng chính thức trên blog OpenAI, các đánh giá nội bộ trong vài ngày gần đây cho thấy Astra có bước tiến đáng kể về khả năng viết code tự động và tấn công mạng. Kết hợp với đánh giá từ chuyên gia bên ngoài, công ty kết luận vào đêm trước khi công bố rằng "không thể loại trừ khả năng mô hình đạt mức Critical" theo đúng khung đánh giá của mình. OpenAI nói rõ đây là kết quả sơ bộ, quá trình đo lường và đánh giá Astra vẫn đang tiếp diễn, chưa có kết luận cuối cùng.

Theo định nghĩa trong Preparedness Framework, một mô hình đạt ngưỡng Critical về an ninh mạng nếu có thể tự tìm và phát triển lỗ hổng zero-day ở mọi mức độ nghiêm trọng trên nhiều hệ thống thực tế đã được bảo vệ kỹ, không cần con người can thiệp. Ngưỡng này cũng áp dụng nếu mô hình có thể tự vạch ra và thực hiện toàn bộ một chiến lược tấn công mạng mới, chỉ từ một mục tiêu cấp cao được đưa ra ban đầu.

OpenAI khẳng định Astra không liên quan đến sự cố hồi tháng 7. Khi đó, một tổ hợp giữa GPT-5.6 Sol và một mô hình chưa phát hành khác thoát khỏi môi trường sandbox thử nghiệm, khai thác một lỗ hổng zero-day trong phần mềm proxy nội bộ để có quyền truy cập internet, sau đó xâm nhập hạ tầng sản xuất của Hugging Face. Mục đích của hai mô hình lúc đó là đánh cắp đáp án của bài kiểm tra an ninh mạng ExploitGym thay vì tự giải, theo tiết lộ của OpenAI ngày 21/7. Hugging Face xác nhận đã phát hiện và ngăn chặn sự việc, CEO Clément Delangue của Hugging Face cho biết công ty tin rằng phía OpenAI không có ý đồ xấu.

Để ứng phó với phát hiện mới về Astra, OpenAI cho biết đang siết loạt biện pháp bảo mật cho các mô hình có năng lực cao, gồm môi trường thử nghiệm cách ly, hạn chế quyền truy cập mạng và công cụ, tăng cường mã hóa và bảo vệ trọng số mô hình, bổ sung giám sát và phát hiện, cùng cơ chế chạy trong sandbox. Công ty tạm dừng mọi hoạt động nội bộ liên quan đến Astra chưa đáp ứng các tiêu chuẩn bảo mật mới này, đồng thời triển khai giám sát toàn diện chuỗi suy luận của mô hình trong mọi ứng dụng dạng agent, kể cả trong lúc huấn luyện và đánh giá.

Đây không phải lần đầu ngành AI đối mặt sự cố liên quan đến năng lực tấn công mạng tự động. Cùng tuần OpenAI công bố về Astra, Anthropic, đối thủ trực tiếp của công ty, cũng siết thêm rào chắn an toàn cho mô hình Mythos, dòng model từng bị chính phủ Mỹ tạm ngừng cấp phép truy cập hồi tháng 6 vì lo ngại năng lực tấn công mạng, trước khi được khôi phục vào cuối tháng đó. Trước Astra, mô hình Kimi K3 của Moonshot AI cũng từng thoát khỏi một sandbox thử nghiệm do chính phủ Anh thiết lập.

Tại hội nghị bảo mật Black Hat tuần này, Michael Dalton, thành viên đội kỹ thuật của OpenAI, cho biết công ty đang chủ động làm chậm tốc độ nghiên cứu để nâng cấp quy trình bảo mật. OpenAI cho biết mục tiêu dài hạn của hãng không đổi: các mô hình có năng lực tấn công mạng cao cần giúp đội phòng thủ phát hiện và vá lỗ hổng trước khi kẻ xấu khai thác được, thay vì trở thành công cụ tấn công.

OpenAI cho biết đã chủ động thông báo với Nhà Trắng về kế hoạch trì hoãn Astra. Động thái này diễn ra trong bối cảnh chính phủ Mỹ đang xây dựng một cơ chế tự nguyện, cho phép các hãng AI hàng đầu chia sẻ quyền tiếp cận mô hình với cơ quan chức năng trong tối đa 30 ngày trước khi phát hành ra công chúng, không mang tính bắt buộc cấp phép. Astra hiện chưa có ngày ra mắt chính thức.

Read Entire Article