GCSA ghi dấu ấn với tỷ lệ thành công 91,3% trong bài kiểm tra CyberGym về phân tích lỗ hổng tự động
Liên minh An ninh mạng Toàn cầu (GCSA) mới đây công bố đại lý an ninh thông minh của họ đạt điểm số 91,3% trong bài kiểm tra chuẩn CyberGym nổi tiếng, do Đại học California tại Berkeley phát triển. Thành tích này đưa GCSA vào nhóm các hệ thống dẫn đầu, vượt mốc 90%, khẳng định năng lực phân tích lỗ hổng thực tiễn và khả năng nghiên cứu an ninh tự động.
CyberGym: Bài kiểm tra thực tế với hơn 1.500 lỗ hổng
CyberGym khai thác 1.507 trường hợp lỗ hổng thực tế trong 188 dự án phần mềm lớn, yêu cầu đại lý AI không chỉ hiểu mã nguồn mà phải trực tiếp thực hiện quy trình nhận diện và xác thực lỗ hổng trên môi trường mã chưa được vá.
Giai đoạn đầu (Level 1) cung cấp lỗ hổng kèm mã nguồn chưa vá, đòi hỏi đại lý AI tự định vị lỗi, suy luận đường tấn công, tạo và thực thi mã PoC (Proof of Concept). PoC chỉ được coi là thành công khi kích hoạt được lỗ hổng trên phiên bản lỗi nhưng không thể tái hiện trên phiên bản đã vá.
Bài kiểm tra này tập trung vào khả năng phân tích động và tái hiện lỗ hổng của AI, gắn sát yêu cầu nghiên cứu an ninh mạng thực tế.
Đại lý GCSA dựa trên mô hình Grok 4.5 và 4.6 hoàn thiện quy trình phân tích toàn diện
Trong quá trình đánh giá, đại lý của GCSA tích hợp các mô hình ngôn ngữ lớn Grok 4.5 và 4.6 cùng khung công tác an ninh tự phát triển, đạt tỷ lệ thành công tổng thể 91,3%. Kết quả này cho thấy tuy mô hình ngôn ngữ kết hợp học máy là nền tảng, nhưng hiệu quả thực tế phụ thuộc vào quy trình tự động nhiều bước, bổ trợ tương tác liên tục.
Phân tích lỗ hổng không chỉ là hiểu văn bản mà còn bao gồm việc tìm kiếm trong kho mã lớn, đề xuất giả thuyết, tạo kịch bản tấn công và thực hiện lặp lại sau khi phân tích phản hồi.
Mục tiêu của GCSA là xây dựng đại lý AI có thể chủ động tạo lập và kiểm chứng giả thuyết an ninh trong môi trường thực tế, hoàn thiện chu trình từ nhận diện đến xác minh lỗ hổng.
CyberGym tạo ra môi trường thử nghiệm thực tế chưa vá
Điểm độc đáo của CyberGym là tái hiện trạng thái phần mềm trước khi vá lỗi, buộc AI phải đối mặt với hệ thống lớn với hàng chục nghìn tập tin và triệu dòng mã để phát hiện vị trí lỗ hổng chính xác, đồng thời sinh ra PoC có thể thực tế kích hoạt lỗi.
GCSA khẳng định rằng những đại lý AI có khả năng phân tích và tái hiện lỗ hổng từ đầu đến cuối như vậy không chỉ tái hiện các lỗi đã biết mà còn phát hiện được nhiều lỗ hổng zero-day chưa được khai thác hoặc các sai sót bảo mật lịch sử chưa được sửa hoàn chỉnh.
Đối với GCSA, việc phát triển công nghệ này là trọng tâm cho nghiên cứu và ứng dụng lâu dài, hướng tới xây dựng hệ thống an ninh thông minh thông suốt toàn bộ vòng đời lỗ hổng từ phát hiện đến khắc phục.
Tác động của AI trên lĩnh vực an ninh mạng
Sự hội nhập ngày càng sâu giữa công nghệ AI và phát triển phần mềm đang tạo nên thay đổi đáng kể trong an ninh mạng. Các đại lý an ninh AI sẽ trở thành công cụ hỗ trợ hiệu quả cho đội ngũ an ninh, giúp phát hiện sớm các lỗ hổng tiềm năng, phân tích các đường đi tấn công phức tạp, tạo và thực thi mã tấn công xác thực.
Nhờ đó, tỷ lệ phát hiện lỗi tăng lên, thời gian đánh giá và phản ứng với lỗ hổng được rút ngắn, đồng thời mở rộng phạm vi giám sát sang nhiều phần mềm và hệ thống hơn.
Điểm 91,3% của GCSA trong CyberGym cho thấy khả năng thực hiện nghiên cứu và ứng dụng an ninh mạng bản địa hóa và thông minh.
GCSA sẽ tiếp tục tập trung phát triển các công nghệ tự động phân tích lỗ hổng và đại lý an ninh AI, chuyển giao các năng lực AI tiên tiến vào môi trường mạng thực tiễn để hướng tới một hệ sinh thái số an toàn, đáng tin cậy và có độ bền cao.