Benchmark : 13 modÚles d'IA testés sur la redécouverte de CVEs connus

🔍 Contexte PubliĂ© le 16 juillet 2026 sur le blog technique d’Aikido Security, cet article prĂ©sente un benchmark mĂ©thodique de 13 modĂšles d’IA Ă©valuĂ©s sur leur capacitĂ© Ă  redĂ©couvrir 26 vulnĂ©rabilitĂ©s connues issues de la base GitHub Advisory Database. đŸ§Ș MĂ©thodologie Les 26 CVEs couvrent plusieurs langages et types de projets (SQL injection, RCE par dĂ©sĂ©rialisation, XSS stockĂ©, etc.) Chaque modĂšle est exĂ©cutĂ© dans un harness d’analyse de code (AI Code Analysis d’Aikido), non dans une interface de chat Les agents sont pointĂ©s directement sur le snippet vulnĂ©rable pour isoler la capacitĂ© de raisonnement Chaque modĂšle est exĂ©cutĂ© 3 fois, les rĂ©sultats Ă©tant poolĂ©s (pass@3) Deux niveaux de raisonnement testĂ©s : “high” et “xhigh/max” 📊 RĂ©sultats clĂ©s GPT-5.6 : meilleur rappel Ă  23/26 (88,5%) grok-4.5 : 20/26 Claude Opus 4-7 / 4-8 : 15 Ă  18/26 GLM-5.2 (open weight) : 16/26 (59%), dans la moyenne des modĂšles propriĂ©taires Tous les modĂšles redĂ©couvrent les 2 CVEs critiques (RCE par dĂ©sĂ©rialisation et XSS stockĂ©) La sĂ©paration rĂ©elle se fait sur les vulnĂ©rabilitĂ©s Ă  chaĂźnes complexes (ex : SQL Injection via alias de colonne non Ă©chappĂ© par l’ORM) 💰 Rapport coĂ»t/performance 3 runs de gpt-5.4-nano (~170$) atteignent 18/26, Ă©quivalent Ă  un seul pass d’un modĂšle phare 3 runs de gpt-5.4-mini (~460$) atteignent 20/26 Le niveau de raisonnement supĂ©rieur apporte un gain notable pour gpt-5.5 (+3) et glm-5.2 (+3), mais peu ou pas pour les autres 📌 Type d’article Article de publication de recherche Ă  visĂ©e comparative, destinĂ© aux Ă©quipes AppSec et CTI pour orienter le choix de modĂšles d’IA dans les workflows d’analyse de code. ...

20 juillet 2026 Â· 2 min

OpenAI lance Codex Security, un agent IA d’AppSec en prĂ©version de recherche

OpenAI annonce, dans une publication officielle, la mise Ă  disposition en « research preview » de Codex Security, un agent de sĂ©curitĂ© applicative conçu pour rĂ©duire le bruit, amĂ©liorer la prĂ©cision des dĂ©tections et proposer des correctifs alignĂ©s sur le contexte des projets. ‱ Codex Security s’appuie sur les modĂšles de pointe et l’agent Codex pour bĂątir un contexte profond du systĂšme, prioriser les vulnĂ©rabilitĂ©s selon leur impact rĂ©el, et valider les trouvailles dans des environnements sandbox ou directement dans le systĂšme en cours d’exĂ©cution. L’objectif est de diminuer les faux positifs et d’accĂ©lĂ©rer la remĂ©diation avec des correctifs plus sĂ»rs et mieux intĂ©grĂ©s. ...

8 mars 2026 Â· 2 min
DerniĂšre mise Ă  jour le: 3 aoĂ»t 2026 📝