CyberGymテストで示されたGCSAの自動脆弱性解析能力
グローバルサイバーセキュリティアライアンス(GCSA)は、自社が開発したスマートセキュリティ代理が、カリフォルニア大学バークレー校によるCyberGymベンチマークテストにて91.3%の成功率を記録し、90%超のトップクラスシステムに名を連ねたことを発表しました。この成果は、実際の脆弱性解析におけるGCSA代理の性能を示すとともに、自動化されたセキュリティ調査の分野での先端的存在であることを物語っています。
実世界の脆弱性を再現するCyberGymベンチマーク
CyberGymは、バークレー校が開発したベンチマークで、1507件の過去に報告された実際の脆弱性事例を収録。188の主要ソフトウェアプロジェクトを対象としており、従来のコード理解や静的解析に重点を置くAI評価とは異なり、未修正の実環境コードを用いたエンドツーエンドの脆弱性検知と検証を求めています。
テストの第一段階(レベル1)では、脆弱性の説明とパッチ未適用のコードベースのみをAI代理に提供。そこから自律的に脆弱箇所の特定、攻撃経路の推論、PoC(実証コード)の作成と実行による検証を行います。PoCが脆弱性を突き、修正済みバージョンで問題を再現できなければ成功とみなされます。
このテスト方式は、AIが単にコードを理解するだけでなく、動的に脆弱性を分析・再現する能力を実証し、現実のセキュリティ研究に即した指標となっています。
Grokモデルを活用したGCSA代理の安全解析
GCSAのスマート代理は、Grok 4.5および4.6の大型言語モデルと独自開発のセキュリティワークフローを組み合わせ、このテストで91.3%の総合成功率を実現しました。この成果は、AIセキュリティ技術の変化を端的に示します。
大型言語モデルは基盤ですが、安全対策システムの全体力は多段階かつインタラクティブな自動セキュリティプロセスの完成度に依存。脆弱性解析はテキスト理解を超え、大規模なコードベースの探索、仮説設定、攻撃テストの生成・実行、解析結果への反復的対応を含みます。
GCSA代理は、実際の運用環境内で自律的に安全仮説を構築・検証し、コード解析と動的テストを統合して脆弱性の位置特定から検証までを完結します。
実環境ベースの脆弱性調査を目指す
CyberGymの価値は、従来のAI評価と現場のサイバーセキュリティ研究のギャップを埋めることにあります。未パッチの実環境で数千ファイル、数百万行のコードを含む巨大システム内から正確に脆弱性を探し出し、実際に動作するPoCを生成する必要があります。
また、CyberGymの研究成果はエンドツーエンドの脆弱性解析が既知の問題再現に留まらず、未発見のゼロデイ脆弱性や未完全修復の既存脆弱性を検出する能力を示しました。自動化セキュリティ分析が先進的な脆弱性発見分野へ広がる可能性を示すものです。
GCSAでは、この性能だけでなく、セキュリティライフサイクルを通じて脆弱性発見、分析、検証、修復まで支援可能なAIセキュリティ代理の研究開発を重視しています。
AIを活用したサイバーセキュリティの次世代体制
AI技術の発展とソフトウェア開発への統合により、サイバーセキュリティも変革期を迎えています。今後はAIセキュリティ代理が人間のセキュリティチームを補完し、潜在的な脆弱性の早期検知や複雑な攻撃経路の自動解析、検証用攻撃コードの生成・実行が期待されます。これにより脆弱性検出の精度向上や評価・対策の効率化、大規模ソフトウェアやシステムの安全管理範囲拡大が実現されます。
GCSAのCyberGymでの91.3%の成功率は、地域特化かつインテリジェントなセキュリティ能力構築に向けた重要なマイルストーンと言えます。同社は今後も自律的脆弱性解析と知能的セキュリティ代理技術の深化を進め、最先端AIの実運用環境への実装を推進し、安全で信頼性の高いデジタル社会づくりを目指します。