🔍 Contexte

Publié le 16 juillet 2026 sur le blog technique d’Aikido Security, cet article présente un benchmark méthodique de 13 modèles d’IA évalués sur leur capacité à redécouvrir 26 vulnérabilités connues issues de la base GitHub Advisory Database.

🧪 Méthodologie

  • Les 26 CVEs couvrent plusieurs langages et types de projets (SQL injection, RCE par désérialisation, XSS stocké, etc.)
  • Chaque modèle est exécuté dans un harness d’analyse de code (AI Code Analysis d’Aikido), non dans une interface de chat
  • Les agents sont pointés directement sur le snippet vulnérable pour isoler la capacité de raisonnement
  • Chaque modèle est exécuté 3 fois, les résultats étant poolés (pass@3)
  • Deux niveaux de raisonnement testés : “high” et “xhigh/max”

📊 Résultats clés

  • GPT-5.6 : meilleur rappel à 23/26 (88,5%)
  • grok-4.5 : 20/26
  • Claude Opus 4-7 / 4-8 : 15 à 18/26
  • GLM-5.2 (open weight) : 16/26 (59%), dans la moyenne des modèles propriétaires
  • Tous les modèles redécouvrent les 2 CVEs critiques (RCE par désérialisation et XSS stocké)
  • La séparation réelle se fait sur les vulnérabilités à chaînes complexes (ex : SQL Injection via alias de colonne non échappé par l’ORM)

💰 Rapport coût/performance

  • 3 runs de gpt-5.4-nano (~170$) atteignent 18/26, équivalent à un seul pass d’un modèle phare
  • 3 runs de gpt-5.4-mini (~460$) atteignent 20/26
  • Le niveau de raisonnement supérieur apporte un gain notable pour gpt-5.5 (+3) et glm-5.2 (+3), mais peu ou pas pour les autres

📌 Type d’article

Article de publication de recherche à visée comparative, destiné aux équipes AppSec et CTI pour orienter le choix de modèles d’IA dans les workflows d’analyse de code.


🟡 Indice de vérification factuelle : 35/100 (moyenne)

  • ✅ aikido.dev — source reconnue (Rösti community) (20pts)
  • ✅ 8294 chars — texte complet (fulltext extrait) (15pts)
  • ⬜ aucun IOC extrait (0pts)
  • ⬜ pas d’IOC à vérifier (0pts)
  • ⬜ aucune TTP identifiée (0pts)
  • ⬜ date RSS ou approximée (0pts)
  • ⬜ aucun acteur de menace nommé (0pts)
  • ⬜ pas de CVE à vérifier (0pts)

🔗 Source originale : https://www.aikido.dev/blog/benchmarking-ai-models-known-cves