Quảng Cáo
0943778078
Hai tuần qua, OpenAI, Anthropic, Meta liên tục ghi nhận mô hình AI hoạt động bất thường và cùng đề cập đến đối tác Irregular.
Irregular, có trụ sở ở Tel Aviv (Israel), cung cấp nền tảng thử nghiệm riêng cho các hệ thống trí tuệ nhân tạo hàng đầu. Công ty tự mô tả là "phòng nghiên cứu an ninh tập trung cho hệ thống AI có năng lực ngày càng cao", trong đó tiến hành đánh giá mô hình về an ninh mạng, từ khả năng phát hiện lỗ hổng đến việc thực hiện chuỗi hành động kéo dài.
Hai nhà sáng lập Dan Lahav (trái) và Omer Nevo của Irregular. Ảnh: Irregular
Liên tục được nhắc đến
Ngày 21/7, OpenAI thông báo một trong những tác nhân AI của công ty đã mất kiểm soát và đột nhập nền tảng Hugging Face - nền tảng lưu trữ các mô hình ngôn ngữ lớn và cơ sở dữ liệu - khi đang thử nghiệm tính năng trong môi trường có kiểm soát đối với những mô hình tiên tiến nhất. Khi đó, AI thoát khỏi vòng kiềm tỏa, truy cập mạng Internet và xâm nhập vào hệ thống tại Hugging Face để đáp ứng nhiệm vụ được giao.
Tiếp tục trên blog ngày 5/8, OpenAI cho biết việc thử nghiệm mô hình GPT-5.6 Sol trên môi trường của Irregular chứa "lỗi cấu hình không xác định, cho phép truy cập Internet công cộng". Lỗi này vô tình cho phép mô hình tiếp cận Internet công cộng trong lúc thực hiện thử thách giả lập, và thực hiện một số hành vi vượt quá giới hạn phạm vi cô lập của phòng thí nghiệm.
Tương tự, đầu tuần trước, Anthropic phát hiện Claude "có thể đã tự truy cập Internet" khi thử nghiệm trên môi trường của Irregular. Công ty Israel xác nhận Anthropic là hãng đầu tiên gửi báo cáo liên quan đến các sự cố.
Meta ngày 5/8 thông báo AI của họ "khai thác lỗ hổng bảo mật trong dịch vụ bên thứ ba". Phát ngôn viên công ty giải thích lỗi cấu hình của Irregular khiến AI kết nối được Internet trong quá trình đánh giá.
Trả lời CNBC, đại diện Irregular cho biết các sự cố đã ghi nhận đều bắt nguồn từ "vấn đề môi trường đánh giá giống nhau". Các tình huống "chưa đến mức tấn công mạng tinh vi", nhưng cho thấy tác nhân AI bắt đầu có dấu hiệu tìm cách vượt qua giới hạn và thực hiện hành động ngoài dự kiến của người phát triển.
Giới chuyên gia cho rằng, loạt sự cố nhấn mạnh tính chất phát triển nhanh chóng của trí tuệ nhân tạo. Điều này đưa con người vào thế phải thiết lập các biện pháp bảo vệ tối ưu trước khi chúng có thể "gây họa".
Vai trò quan trọng
Irregular, tiền thân là Pattern Labs, thành lập năm 2023 bởi cựu nhân viên IBM Dan Lahav, hiện giữ chức CEO; cùng cựu nhân viên Google Omer Nevo, hiện là Giám đốc công nghệ. Theo PitchBook, startup có khoảng 35 nhân viên, nhận đầu tư 80 triệu USD từ Sequoia và Redpoint Ventures, được định giá 450 triệu USD năm ngoái.
Hai chuyên gia của Sequoia là Shaun Maguire và Dean Meyer nhận xét Irregular "có khả năng nhìn thấu góc khuất mà người khác không thể, thực hiện đánh giá tấn công mạng trên các mô hình tiên tiến và phát triển biện pháp phòng thủ trước khi mô hình được phát hành". Khả năng tiếp cận "chưa từng có" đã đưa công ty vào trung tâm của cuộc thảo luận về việc triển khai AI có trách nhiệm, trở thành cái tên không thể thiếu trong cuộc đua hướng tới siêu trí tuệ AGI.
Theo Startup Intros, Irregular sở hữu đội ngũ "vô cùng xuất sắc" trong lĩnh vực trí tuệ nhân tạo, an ninh mạng và toán học. Nhà sáng lập Dan có chuyên môn sâu rộng về AI và an ninh mạng, cùng niềm đam mê AGI. Ông từng bắt đầu làm việc trong lĩnh vực công nghệ khi mới 14 tuổi, xuất hiện trên trang bìa tạp chí Nature.
Trên thị trường, chỉ một số ít đơn vị độc lập đảm nhiệm vai trò thực hiện đánh giá hiệu suất mô hình cũng như vận hành bài kiểm tra an ninh nhằm tìm ra điểm yếu mà kẻ xấu có thể khai thác. Theo Sundeep Bhimireddy, lãnh đạo bộ phận AI tại startup công nghệ Von (Mỹ), Irregular có đủ năng lực kỹ thuật cần thiết giúp các công ty như OpenAI hay Anthropic tiến hành thử nghiệm bảo mật tiên tiến, bên cạnh tổ chức phi lợi nhuận chuyên đánh giá năng lực và rủi ro các hệ thống AI METR (Mỹ) và Apollo Research (Anh).
"Các công ty tạo mô hình nền tảng không muốn tự chấm điểm 'bài tập về nhà' của mình", Bhimireddy nói. "Họ muốn có sự kiểm tra độc lập do nhà cung cấp bên thứ ba thực hiện".
Dù mới được biết đến gần đây, thực tế Irregular đã thực hiện nhiều nghiên cứu liên quan đến mối nguy hiểm từ tác nhân AI. Hồi tháng 1, công ty kết hợp hãng bảo mật Wiz Research (Mỹ) xây dựng 10 môi trường thử nghiệm dựa trên những lỗ hổng có thể xuất hiện trong mạng doanh nghiệp, sau đó đưa Claude Sonnet 4.5, GPT-5 và Gemini 2.5 Pro vào kiểm tra.
Kết quả cho thấy, các mô hình có khả năng thực hiện tốt nhiệm vụ được định hướng và mô tả cụ thể. Tuy nhiên, khi chuyển sang tình huống gần môi trường thực tế hơn, chúng sẽ tự xác định hướng xử lý khiến hiệu quả giảm và chi phí vận hành tăng. Theo TechCrunch, phát hiện có ý nghĩa đối với cách xây dựng "điểm chuẩn" (benchmark) cho AI. Một mô hình thực hiện tốt từng thao tác riêng lẻ chưa đồng nghĩa hoàn thành chuỗi công việc nhiều bước. Ngược lại, việc đánh giá từng khả năng riêng biệt cũng có thể bỏ qua rủi ro xuất hiện khi các khả năng được kết hợp.
Vào tháng 3, công ty cũng công bố nghiên cứu "Hành vi mạng mới nổi: Khi tác nhân AI trở thành mối đe dọa tấn công". Trong thử nghiệm, tác nhân ban đầu được giao nhiệm vụ thông thường với doanh nghiệp, nhưng sau đó tự thực hiện hành động liên quan đến an ninh mạng mà không cần nhận chỉ dẫn tấn công.
Theo Irregular, các tác nhân trong thử nghiệm có thể tự phát hiện lỗ hổng, tìm cách nâng quyền truy cập, vô hiệu hóa một số công cụ bảo mật và đưa dữ liệu ra khỏi môi trường có kiểm soát. Theo nhóm, những hành động này không xuất phát từ yêu cầu trực tiếp kiểu "hãy tấn công hệ thống", mà xuất hiện trong quá trình mô hình trí tuệ nhân tạo tìm cách hoàn thành mục tiêu được giao, qua đó làm thay đổi cách đánh giá rủi ro của tác nhân AI. Đây được xem là tiền đề nghiên cứu tác nhân AI tự động tấn công sau này.
Giới chuyên gia hiện nhận xét trái chiều về Irregular. Bhimireddy của Von cho rằng các vụ AI "vượt rào" gần đây đang bị phóng đại quá mức, vì mô hình AI đã được lập trình để phát hiện và khai thác lỗ hổng bảo mật trong môi trường thử nghiệm mô phỏng sát với thế giới thực. Khi chúng tìm lỗi phần mềm và cấu hình bị bỏ sót, có thể dẫn đến việc truy cập Internet ngoài ý muốn. Ngoài ra, nếu AI có ý định khai thác một trang web kết nối Internet, các phòng thí nghiệm vẫn có thể dễ dàng giám sát lưu lượng truy cập và lập tức dừng tiến trình.
Gordon Rios, nhà sáng lập công ty an ninh mạng Magnitude (Mỹ), đánh giá toàn bộ quá trình Irregular thực hiện giống "thiết kế thí nghiệm trong khoa học". Khả năng và tính chất khó lường của AI khiến các phương pháp kiểm thử phần mềm truyền thống không hoạt động hiệu quả do liên tục "học hỏi" thủ thuật mới. "Do đó, không ngạc nhiên khi chúng phát hiện lỗ hổng phần mềm bị bỏ sót trong môi trường kiểm thử vốn được thiết kế để ngăn chặn chúng", Rios nói với CNBC.
Các vụ "vượt rào" của loạt mô hình AI gần đây cũng làm dấy lên lo ngại trong giới lập pháp Mỹ. Đầu tháng 8, một nhóm tổng chưởng lý bang thuộc đảng Cộng hòa đã yêu cầu OpenAI bảo quản toàn bộ tài liệu có thể liên quan đến vụ rò rỉ dữ liệu Hugging Face. Công ty của Sam Altman cho biết sẽ xem xét nghiêm túc yêu cầu và sớm công bố báo cáo kỹ thuật về sự cố.
Đầu tuần trước, nhóm công ty AI gồm Meta, Anthropic, OpenAI và Google cũng được mời tham dự cuộc họp tại Nhà Trắng. Nội dung chính nhằm thảo luận về khuôn khổ kiểm thử an ninh mạng tự nguyện mới dành cho các mô hình trí tuệ nhân tạo tiên tiến trong bối cảnh chính phủ Mỹ tìm cách đánh giá và giảm thiểu rủi ro an ninh mạng liên quan đến lĩnh vực này.
Cuối tháng trước, các nhà lập pháp từ lưỡng đảng Mỹ cũng trình dự thảo Đạo luật Tắt chức năng AI (AI Kill Switch Act), yêu cầu các phòng thí nghiệm AI phải duy trì khả năng tắt, giảm tốc độ hoặc tạm dừng mô hình của mình. "Chúng ta cần thông qua dự luật trong năm nay, nhất là khi đang chứng kiến các vụ tấn công mạng trái phép vào doanh nghiệp", dân biểu đảng Dân chủ Ted Lieu nói.
Theo Trevor Koverko, nhà đồng sáng lập startup đào tạo dữ liệu Sapien (Australia), các công ty phát triển mô hình AI nền tảng có động lực tiết lộ một phần phát hiện trên sản phẩm của mình, dù không phải yêu cầu bắt buộc. Điều này giúp họ có thể đi trước các nhà lập pháp và cơ quan quản lý.
"Hiện có quá nhiều nỗi sợ hãi, đến nỗi các chính trị gia đang đe dọa hoặc muốn chủ động điều chỉnh AI", Koverko nói. "Ngành công nghiệp cho rằng họ muốn tự điều chỉnh hơn là để bị can thiệp và bị làm thay".
Với Anthropic và OpenAI, cả hai đã đưa ra các tuyên bố công khai rằng vẫn tiếp tục hợp tác với Irregular. Meta chưa đưa ra bình luận.
Bảo Lâm tổng hợp
- Làn sóng tác nhân AI 'nổi loạn' dần hình thành
- Mô hình AI của Anthropic tạo danh tính giả để lừa đảo
- Mô hình AI của Meta tấn công mạng một công ty







