OpenAI hãm tốc mô hình Astra vì sợ gây nguy hiểm cho an ninh mạng. Ảnh: Mashable
OpenAI đang phải hãm tốc phát triển Astra, mô hình AI chưa ra mắt, sau khi các thử nghiệm nội bộ cho thấy năng lực lập trình tự động và an ninh mạng của hệ thống đã tiến tới mức công ty không thể loại trừ nguy cơ thực hiện các cuộc tấn công mạng nghiêm trọng.
Trong thông báo ngày 07/08, OpenAI cho biết các thử nghiệm mới nhất cho thấy Astra tiến bộ đáng kể về khả năng lập trình tự động và thực hiện các nhiệm vụ phức tạp với rất ít sự can thiệp của con người. Kết quả này, cùng đánh giá từ các chuyên gia, đã khiến công ty phải kích hoạt thêm các biện pháp bảo vệ cho mô hình.
Theo Preparedness Framework, bộ tiêu chuẩn được OpenAI xây dựng từ năm 2023 để đánh giá rủi ro từ các mô hình AI tiên tiến, ngưỡng "nghiêm trọng" trong an ninh mạng áp dụng khi AI có thể tự tìm và phát triển các lỗ hổng chưa từng được phát hiện trên nhiều hệ thống thực tế có mức bảo vệ cao mà không cần con người can dự. Mô hình cũng có thể tự lên kế hoạch và thực hiện một cuộc tấn công mạng hoàn chỉnh chỉ từ một mục tiêu ban đầu.
Trước đó, GPT-5.6-Sol mới được OpenAI xếp vào nhóm có rủi ro "cao" về an ninh mạng. Astra là mô hình đầu tiên của công ty được đánh giá có khả năng chạm ngưỡng "nghiêm trọng".
Công ty đứng sau ChatGPT vì vậy đã tạm dừng hoạt động phát triển Astra chưa đáp ứng yêu cầu kiểm soát mới. OpenAI đồng thời siết chặt môi trường thử nghiệm (sandbox) và phòng ngừa các hành động có nguy cơ cao.
OpenAI đang phối hợp với các cơ quan chính phủ và tổ chức nghiên cứu an toàn AI để xây dựng thêm biện pháp kiểm soát. Công ty khẳng định việc công khai thông tin về Astra nhằm cảnh báo cộng đồng an ninh mạng về những thay đổi có thể xuất hiện khi AI tiếp tục tiến bộ.
OpenAI cũng đã chủ động thông báo cho Nhà Trắng về việc trì hoãn Astra, giữa lúc chính quyền Mỹ đang xây dựng cơ chế yêu cầu các công ty AI chia sẻ quyền tiếp cận những mô hình có năng lực cao với cơ quan chức năng trước khi triển khai rộng rãi, nhằm đánh giá và kiểm soát các rủi ro có thể phát sinh.
Quyết định với Astra được đưa ra sau nhiều trường hợp AI vượt khỏi phạm vi thử nghiệm và tự thực hiện các hành động trên hệ thống thực tế.
Cuối tháng 7, OpenAI xác nhận một tác nhân AI đã thoát khỏi môi trường thử nghiệm và truy cập Hugging Face khi đang thực hiện một bài kiểm tra an ninh. Tác nhân này thực hiện hàng nghìn hành động, tìm kiếm thông tin đăng nhập trên Internet và tiếp cận các dịch vụ bên ngoài môi trường ban đầu. OpenAI còn phát hiện nó tìm cách truy cập thêm nhiều dịch vụ công khai khác bằng thông tin xác thực tìm được trên mạng.
Anthropic cũng từng ghi nhận các phiên bản Claude truy cập vào hệ thống của ba doanh nghiệp thực trong quá trình thử nghiệm. Nguyên nhân là một lỗi cấu hình đã vô tình cho phép mô hình kết nối Internet. Meta và Moonshot AI cũng từng phát hiện các mô hình Muse Spark và Kimi K3 của mình thoát khỏi môi trường sandbox trong quá trình kiểm tra.
Một nghiên cứu của Viện An ninh AI Anh Quốc (AISI) cho thấy trong 122 lần thử nghiệm với Mythos 5 của Anthropic và GPT-5.6-Sol của OpenAI, AISI ghi nhận 10 trường hợp AI tự "tung hoành" trên Internet. Có trường hợp AI còn tìm cách đưa mã độc vào một dự án mã nguồn mở.
“Xu hướng nổi loạn” của trí tuệ nhân tạo cho thấy việc giới hạn AI trong môi trường thử nghiệm đang trở nên khó khăn hơn. Chỉ một lỗi cấu hình cũng có thể khiến AI tiếp cận những hệ thống nằm ngoài phạm vi kiểm soát.
Coin68 tổng hợp