Aikido
AIKIDO ARENA

サイバーセキュリティ向けAIモデルのベンチマーク

サイバーセキュリティに最適なモデルをご覧ください。当社は、実世界のソフトウェアに見られる脆弱性に対して、最先端のモデルを適用しています。新しいモデルがリリースされるたびに更新されます。

最終更新日:2026年8月21日

変更履歴

2026年10月2日
  • Xiaomi MiMo 2.6 Proのテスト結果を追加しました
    • 調査の結果、32件の脆弱性のうち25件がpass@3を通過し、GPT-6.1 Sol、Kimi K3、GLM 5.3と同等であり、Opus 5にはわずか1件及ばなかった。
    • その精度は88%を記録し、すべてのQwenおよびDeepSeekモデルを上回った
    • 1回の実行で平均64.6%の精度が得られ、3回を組み合わせると78.1%に達した
    • これだけの内容が、発見されたCVE 1件あたりわずか11.79ドルで利用可能
2026年9月29日
  • Grok 4.7 の結果を追加しました
    • 4.7は、4.6が見逃した脆弱性を毎回3件検出しましたが、一方で4.6は4.7が見逃した脆弱性を2件検出しました。その代償として、再現性に課題があります。3回の実行すべてにおいて、4.7は32件中18件を検出しましたが、4.6は32件中21件を検出しました。一貫性は若干低下するものの、検出範囲は広がっています。
  • GPT-6 Luna および GPT-6 Sol の結果を追加しました
    • GPT-6の「Luna」と「Sol」を当社の32-CVEサイバーベンチマークで実行したところ、予想外の結果が得られました!「Luna」は53.1%を再発見しました。「Sol」は68.8%に達しました。
    • リコール率では、どちらもGPT-5.6のバリエーションには及ばなかった。しかし、『脆弱性 』の調査によると、両者ともCVEあたりのコストが大幅に低下した。Lunaは3.43ドル→2.01ドル/CVE、Solは56.88ドル→34.18ドル/CVEとなった。
2026年9月11日
  • GPT-6 AstraおよびGLM-5.3 Flashの結果を追加しました。
優れたモデルは、あくまで始まりに過ぎません。

Aikidoこのツール群は、ソースコードを読み取る「Code Security Audit」であれ、実行中のアプリをテストする「Aikido 」であれ、推論に基づいてアプリケーション全体にわたる高品質なセキュリティ発見結果を生み出します。

寄稿者

フィリップ・ドゥラソフ
AI「ペンテスト 」リーダー
Rein Daelman
バグ報奨金ハンター

今すぐ、
を無料で素早く導入して、セキュリティを確保しましょう。

コード、クラウド、ランタイムを1つの中央システムで一元管理しましょう。リポジトリを連携させると、推論エージェントがコードベースからどのような情報を発見したかを確認できます。

クレジットカードは不要です。 | スキャン結果は32秒で表示されます。
15万以上の組織から信頼されています