Benchmark : 13 modÚles d'IA testés sur la redécouverte de CVEs connus
đ Contexte PubliĂ© le 16 juillet 2026 sur le blog technique dâAikido Security, cet article prĂ©sente un benchmark mĂ©thodique de 13 modĂšles dâIA Ă©valuĂ©s sur leur capacitĂ© Ă redĂ©couvrir 26 vulnĂ©rabilitĂ©s connues issues de la base GitHub Advisory Database. đ§Ș MĂ©thodologie Les 26 CVEs couvrent plusieurs langages et types de projets (SQL injection, RCE par dĂ©sĂ©rialisation, XSS stockĂ©, etc.) Chaque modĂšle est exĂ©cutĂ© dans un harness dâanalyse de code (AI Code Analysis dâAikido), non dans une interface de chat Les agents sont pointĂ©s directement sur le snippet vulnĂ©rable pour isoler la capacitĂ© de raisonnement Chaque modĂšle est exĂ©cutĂ© 3 fois, les rĂ©sultats Ă©tant poolĂ©s (pass@3) Deux niveaux de raisonnement testĂ©s : âhighâ et âxhigh/maxâ đ RĂ©sultats clĂ©s GPT-5.6 : meilleur rappel Ă 23/26 (88,5%) grok-4.5 : 20/26 Claude Opus 4-7 / 4-8 : 15 Ă 18/26 GLM-5.2 (open weight) : 16/26 (59%), dans la moyenne des modĂšles propriĂ©taires Tous les modĂšles redĂ©couvrent les 2 CVEs critiques (RCE par dĂ©sĂ©rialisation et XSS stockĂ©) La sĂ©paration rĂ©elle se fait sur les vulnĂ©rabilitĂ©s Ă chaĂźnes complexes (ex : SQL Injection via alias de colonne non Ă©chappĂ© par lâORM) đ° Rapport coĂ»t/performance 3 runs de gpt-5.4-nano (~170$) atteignent 18/26, Ă©quivalent Ă un seul pass dâun modĂšle phare 3 runs de gpt-5.4-mini (~460$) atteignent 20/26 Le niveau de raisonnement supĂ©rieur apporte un gain notable pour gpt-5.5 (+3) et glm-5.2 (+3), mais peu ou pas pour les autres đ Type dâarticle Article de publication de recherche Ă visĂ©e comparative, destinĂ© aux Ă©quipes AppSec et CTI pour orienter le choix de modĂšles dâIA dans les workflows dâanalyse de code. ...