Benchmark : 13 modèles d'IA testés sur la redécouverte de CVEs connus
🔍 Contexte Publié le 16 juillet 2026 sur le blog technique d’Aikido Security, cet article présente un benchmark méthodique de 13 modèles d’IA évalués sur leur capacité à redécouvrir 26 vulnérabilités connues issues de la base GitHub Advisory Database. 🧪 Méthodologie Les 26 CVEs couvrent plusieurs langages et types de projets (SQL injection, RCE par désérialisation, XSS stocké, etc.) Chaque modèle est exécuté dans un harness d’analyse de code (AI Code Analysis d’Aikido), non dans une interface de chat Les agents sont pointés directement sur le snippet vulnérable pour isoler la capacité de raisonnement Chaque modèle est exécuté 3 fois, les résultats étant poolés (pass@3) Deux niveaux de raisonnement testés : “high” et “xhigh/max” 📊 Résultats clés GPT-5.6 : meilleur rappel à 23/26 (88,5%) grok-4.5 : 20/26 Claude Opus 4-7 / 4-8 : 15 à 18/26 GLM-5.2 (open weight) : 16/26 (59%), dans la moyenne des modèles propriétaires Tous les modèles redécouvrent les 2 CVEs critiques (RCE par désérialisation et XSS stocké) La séparation réelle se fait sur les vulnérabilités à chaînes complexes (ex : SQL Injection via alias de colonne non échappé par l’ORM) 💰 Rapport coût/performance 3 runs de gpt-5.4-nano (~170$) atteignent 18/26, équivalent à un seul pass d’un modèle phare 3 runs de gpt-5.4-mini (~460$) atteignent 20/26 Le niveau de raisonnement supérieur apporte un gain notable pour gpt-5.5 (+3) et glm-5.2 (+3), mais peu ou pas pour les autres 📌 Type d’article Article de publication de recherche à visée comparative, destiné aux équipes AppSec et CTI pour orienter le choix de modèles d’IA dans les workflows d’analyse de code. ...