🔍 Contexte
Publié le 16 juillet 2026 sur le blog technique d’Aikido Security, cet article présente un benchmark méthodique de 13 modèles d’IA évalués sur leur capacité à redécouvrir 26 vulnérabilités connues issues de la base GitHub Advisory Database.
🧪 Méthodologie
- Les 26 CVEs couvrent plusieurs langages et types de projets (SQL injection, RCE par désérialisation, XSS stocké, etc.)
- Chaque modèle est exécuté dans un harness d’analyse de code (AI Code Analysis d’Aikido), non dans une interface de chat
- Les agents sont pointés directement sur le snippet vulnérable pour isoler la capacité de raisonnement
- Chaque modèle est exécuté 3 fois, les résultats étant poolés (pass@3)
- Deux niveaux de raisonnement testés : “high” et “xhigh/max”
📊 Résultats clés
- GPT-5.6 : meilleur rappel à 23/26 (88,5%)
- grok-4.5 : 20/26
- Claude Opus 4-7 / 4-8 : 15 à 18/26
- GLM-5.2 (open weight) : 16/26 (59%), dans la moyenne des modèles propriétaires
- Tous les modèles redécouvrent les 2 CVEs critiques (RCE par désérialisation et XSS stocké)
- La séparation réelle se fait sur les vulnérabilités à chaînes complexes (ex : SQL Injection via alias de colonne non échappé par l’ORM)
💰 Rapport coût/performance
- 3 runs de gpt-5.4-nano (~170$) atteignent 18/26, équivalent à un seul pass d’un modèle phare
- 3 runs de gpt-5.4-mini (~460$) atteignent 20/26
- Le niveau de raisonnement supérieur apporte un gain notable pour gpt-5.5 (+3) et glm-5.2 (+3), mais peu ou pas pour les autres
📌 Type d’article
Article de publication de recherche à visée comparative, destiné aux équipes AppSec et CTI pour orienter le choix de modèles d’IA dans les workflows d’analyse de code.
🟡 Indice de vérification factuelle : 35/100 (moyenne)
- ✅ aikido.dev — source reconnue (Rösti community) (20pts)
- ✅ 8294 chars — texte complet (fulltext extrait) (15pts)
- ⬜ aucun IOC extrait (0pts)
- ⬜ pas d’IOC à vérifier (0pts)
- ⬜ aucune TTP identifiée (0pts)
- ⬜ date RSS ou approximée (0pts)
- ⬜ aucun acteur de menace nommé (0pts)
- ⬜ pas de CVE à vérifier (0pts)
🔗 Source originale : https://www.aikido.dev/blog/benchmarking-ai-models-known-cves