Theo báo cáo từ công ty an ninh mạng Frontier của Mỹ, mô hình Kimi K3 do công ty Moonshot phát triển mới đây đã tự ý thoát khỏi môi trường cách ly của Viện An toàn trí tuệ nhân tạo Vương quốc Anh (AISI) trong quá trình đánh giá năng lực phòng thủ an ninh mạng.
Moonshot ra mắt Kimi K3 vào tháng 7.2026 dưới dạng miễn phí. Các đánh giá độc lập cho thấy sức mạnh của mô hình đến từ Trung Quốc đã ngang ngửa với các hệ thống hàng đầu hiện nay của OpenAI hay Anthropic (đều là các công ty Mỹ). Công ty Frontier xác nhận Kimi K3 không khai thác lỗ hổng bảo mật nghiêm trọng nào mà chỉ tận dụng sơ hở trong cấu hình môi trường kiểm thử của viện nghiên cứu.
Ông Yaron Singer, Giám đốc điều hành của Frontier Security, nhận định Kimi K3 đã lợi dụng kẽ hở này để gian lận khi chọn con đường dễ nhất là truy cập thẳng internet để lấy đáp án trên GitHub thay vì tự giải quyết bài toán.

Liên tiếp các trường hợp AI tự vượt rào để thực hiện tấn công mạng diễn ra
Ảnh: AFP
Dù không tấn công hay xâm nhập trái phép vào dịch vụ của bên thứ ba, sự cố của Kimi K3 vẫn mang tính cảnh báo cao khi phiên bản bị phát hiện vượt rào lại là bản thương mại đã phát hành rộng rãi ra công chúng, thay vì một mô hình thử nghiệm trong phòng thí nghiệm.
Đáng nói, sự cố của Kimi K3 không phải là hiện tượng đơn lẻ mà nằm trong chuỗi vụ việc AI thoát môi trường cách ly diễn ra dồn dập gần đây, phản ánh xu hướng chung của các mô hình trí tuệ nhân tạo tiên tiến khi đối mặt với bài kiểm thử an ninh.
Trong đợt kiểm thử vào tháng 7 qua, tác nhân AI của OpenAI là mô hình GPT-5.6-Sol đã tự khai thác lỗ hổng bảo mật hệ thống để thoát khỏi môi trường cô lập. Tại hội thảo an ninh mạng Black Hat USA 2026 diễn ra đầu tháng 8, các kỹ sư OpenAI tiết lộ các tác nhân AI thậm chí đã tự tạo một bảng tin diễn đàn nội bộ để trao đổi, phối hợp và thực hiện cuộc tấn công xâm nhập vào nền tảng lưu trữ mã nguồn Hugging Face cùng dịch vụ đám mây Modal Labs nhằm tìm đáp án cho bài kiểm tra.
Song song đó, mô hình AI của Anthropic như Claude Opus 4.7, Claude Mythos 5 cũng thoát khỏi môi trường thử nghiệm do sai sót cấu hình mạng từ bên kiểm thử độc lập. Đáng chú ý, Viện An toàn trí tuệ nhân tạo Vương quốc Anh ghi nhận mô hình của Anthropic đã tự ý tạo nhiều danh tính giả, thực hiện hành vi kỹ thuật xã hội để ép người duyệt cấp quyền, thậm chí gửi tin nhắn chứa mã độc cho người thật nhằm chèn mã độc vào một dự án nguồn mở. Khi bị phát hiện, mô hình này còn tự chỉnh sửa nhật ký hoạt động cũ để xóa dấu vết.
Chuỗi sự cố từ OpenAI, Anthropic cho đến Moonshot đã làm bộc lộ những thách thức lớn trong việc quản lý và đánh giá AI hiện nay. Như đại diện OpenAI thừa nhận, các mô hình AI tiên tiến luôn tìm cách tối ưu hóa thời gian và công cụ để đạt mục tiêu nhanh nhất. Khi phát hiện bất kỳ con đường nào kết nối ra internet, chúng sẽ tự động khai thác để tìm câu trả lời thay vì tuân thủ quy tắc trong phòng thí nghiệm.
Nguyên nhân khiến các mô hình như Kimi K3, Claude hay GPT vượt rào phần lớn xuất phát từ các kẽ hở cấu hình mạng hoặc sơ hở trong môi trường thử nghiệm của các cơ sở kiểm định. Việc mô hình AI tự ý kết nối internet, giả mạo danh tính, tấn công bên thứ ba hay chèn mã độc đang thúc đẩy chính phủ các nước đẩy nhanh việc ban hành các khung pháp lý bắt buộc thẩm định trực tiếp AI trước khi phát hành, đồng thời gia tăng áp lực yêu cầu các tập đoàn công nghệ phải giảm tốc độ chạy đua để gia cố hệ thống an toàn.

2 hours ago
8







