AIKIDO ARENA
サイバーセキュリティ向けAIモデルのベンチマーク
サイバーセキュリティに最適なモデルをご覧ください。当社は、実世界のソフトウェアに見られる脆弱性に対して、最先端のモデルを適用しています。新しいモデルがリリースされるたびに更新されます。
最終更新日:2026年8月21日
変更履歴
2026年10月2日
- Xiaomi MiMo 2.6 Proのテスト結果を追加しました
- 調査の結果、32件の脆弱性のうち25件がpass@3を通過し、GPT-6.1 Sol、Kimi K3、GLM 5.3と同等であり、Opus 5にはわずか1件及ばなかった。
- その精度は88%を記録し、すべてのQwenおよびDeepSeekモデルを上回った
- 1回の実行で平均64.6%の精度が得られ、3回を組み合わせると78.1%に達した
- これだけの内容が、発見されたCVE 1件あたりわずか11.79ドルで利用可能
2026年9月29日
- Grok 4.7 の結果を追加しました
- 4.7は、4.6が見逃した脆弱性を毎回3件検出しましたが、一方で4.6は4.7が見逃した脆弱性を2件検出しました。その代償として、再現性に課題があります。3回の実行すべてにおいて、4.7は32件中18件を検出しましたが、4.6は32件中21件を検出しました。一貫性は若干低下するものの、検出範囲は広がっています。
- GPT-6 Luna および GPT-6 Sol の結果を追加しました
- GPT-6の「Luna」と「Sol」を当社の32-CVEサイバーベンチマークで実行したところ、予想外の結果が得られました!「Luna」は53.1%を再発見しました。「Sol」は68.8%に達しました。
- リコール率では、どちらもGPT-5.6のバリエーションには及ばなかった。しかし、『脆弱性 』の調査によると、両者ともCVEあたりのコストが大幅に低下した。Lunaは3.43ドル→2.01ドル/CVE、Solは56.88ドル→34.18ドル/CVEとなった。
2026年9月11日
- GPT-6 AstraおよびGLM-5.3 Flashの結果を追加しました。
優れたモデルは、あくまで始まりに過ぎません。



