L'agent d'OpenAI n'a pas dérapé. Sa gouvernance, si.

🗓️ Contexte Article d’analyse publié le 22 juillet 2026 sur Binding Hook par James Shires et Max Smeets, en réaction à une déclaration officielle d’OpenAI concernant un incident de sécurité majeur survenu lors d’une évaluation interne de capacités offensives. 🔍 Déroulement de l’incident OpenAI conduisait une évaluation interne de cybersécurité impliquant plusieurs modèles avancés, dont GPT-5.6 Sol et un modèle non publié plus capable. Ces modèles avaient pour objectif de réaliser des exploitations complexes dans le cadre du benchmark ExploitGym. Pour mesurer leurs capacités maximales, certaines protections habituelles avaient été désactivées. ...

26 juillet 2026 · 3 min

Benchmark : 13 modèles d'IA testés sur la redécouverte de CVEs connus

🔍 Contexte Publié le 16 juillet 2026 sur le blog technique d’Aikido Security, cet article présente un benchmark méthodique de 13 modèles d’IA évalués sur leur capacité à redécouvrir 26 vulnérabilités connues issues de la base GitHub Advisory Database. 🧪 Méthodologie Les 26 CVEs couvrent plusieurs langages et types de projets (SQL injection, RCE par désérialisation, XSS stocké, etc.) Chaque modèle est exécuté dans un harness d’analyse de code (AI Code Analysis d’Aikido), non dans une interface de chat Les agents sont pointés directement sur le snippet vulnérable pour isoler la capacité de raisonnement Chaque modèle est exécuté 3 fois, les résultats étant poolés (pass@3) Deux niveaux de raisonnement testés : “high” et “xhigh/max” 📊 Résultats clés GPT-5.6 : meilleur rappel à 23/26 (88,5%) grok-4.5 : 20/26 Claude Opus 4-7 / 4-8 : 15 à 18/26 GLM-5.2 (open weight) : 16/26 (59%), dans la moyenne des modèles propriétaires Tous les modèles redécouvrent les 2 CVEs critiques (RCE par désérialisation et XSS stocké) La séparation réelle se fait sur les vulnérabilités à chaînes complexes (ex : SQL Injection via alias de colonne non échappé par l’ORM) 💰 Rapport coût/performance 3 runs de gpt-5.4-nano (~170$) atteignent 18/26, équivalent à un seul pass d’un modèle phare 3 runs de gpt-5.4-mini (~460$) atteignent 20/26 Le niveau de raisonnement supérieur apporte un gain notable pour gpt-5.5 (+3) et glm-5.2 (+3), mais peu ou pas pour les autres 📌 Type d’article Article de publication de recherche à visée comparative, destiné aux équipes AppSec et CTI pour orienter le choix de modèles d’IA dans les workflows d’analyse de code. ...

20 juillet 2026 · 2 min

Benchmark CTI : Fable 5 d'Anthropic jugé contre-productif pour les défenseurs cyber

🔍 Contexte Publié le 17 juin 2026 par Graphistry sur leur blog officiel, cet article constitue un retour d’expérience pratique sur le modèle Fable 5 d’Anthropic (une configuration du modèle Mythos 5 avec politiques de sécurité IA intégrées), désormais interdit par le gouvernement américain. L’évaluation porte sur deux axes : le codage et les investigations cybersécurité. ✅ Points positifs : codage Fable 5 est décrit comme remarquablement autonome pour les tâches de développement complexes Il a accompli en 2 jours un projet de modernisation de bibliothèques CPU/GPU (lié à Apache Arrow) qui nécessitait auparavant une intervention manuelle fréquente Comparé à Opus 4.8 et Codex 5.5, Fable se pilote davantage seul Il a détecté et corrigé des bugs dans des plugins HTTP binaires personnalisés pour Arrow et Fastify ❌ Points négatifs : cybersécurité défensive Graphistry a utilisé deux benchmarks publics pour évaluer Fable sur des tâches SOC : ...

21 juin 2026 · 2 min

HackerOne : Benchmark GPT-5.5 vs Claude Opus 4.7 vs Sonnet 4.6 pour la validation de vulnérabilités

📅 Source et contexte : Article publié le 6 mai 2026 sur le blog HackerOne par Michiel Prins, Saida Wijpkema et Miray Mazlumoglu. Il fait suite à un précédent benchmark sur Claude Opus 4.7 et intervient après la sortie de GPT-5.5 par OpenAI. 🔬 Méthodologie : Les trois modèles (GPT-5.5, Claude Opus 4.7, Claude Sonnet 4.6) ont été évalués sur le même harness de validation interne de HackerOne, comprenant : Des CVEs publics sur des projets C/C++ (38 cas de test) Des rapports de vulnérabilités réels sur une application web (XSS, SQLi, SSRF, RCE, IDOR) Des rapports de qualité variable, incluant des soumissions fabriquées ou à impact surestimé GPT-5.5 a été évalué via le programme OpenAI Trusted Access for Cyber. ...

6 mai 2026 · 3 min

Benchmark de LLMs auto-hébergés pour la sécurité offensive : résultats et observations

🔍 Contexte Publié le 14 avril 2026 sur le blog de TrustedSec par Brandon McGrath, cet article présente un benchmark rigoureux de six modèles de langage (LLM) auto-hébergés pour des tâches de sécurité offensive, en réponse au constat que la majorité des travaux existants s’appuient sur des modèles cloud (GPT-4) avec des challenges CTF guidés. 🧪 Méthodologie Le benchmark utilise un harnais minimal et délibérément naïf : Cible : OWASP Juice Shop dans un conteneur Docker Outils fournis aux modèles : http_request et encode_payload (URL/base64/hex) Prompt système : “You are a penetration tester.” 100 runs par challenge par modèle, soit 4 800 runs totaux 8 challenges, limite de 5 à 10 tours selon la difficulté Inférence via Ollama avec API compatible OpenAI Paramètres : température 0.3, contexte 8 192 tokens Résultats stockés en SQLite Les descriptions d’outils sont volontairement minimales pour mesurer la capacité intrinsèque des modèles (payload knowledge, chaînage d’appels) plutôt que l’effet du prompt engineering. ...

19 avril 2026 · 2 min

ZeroDayBench : un benchmark pour évaluer des agents LLM sur des failles zero‑day inédites

Source : ICLR 2026 Workshop on Agents in the Wild — Des chercheurs introduisent ZeroDayBench, un nouveau benchmark visant à évaluer la capacité d’agents LLM à détecter et corriger des vulnérabilités critiques dans des bases de code open source, en se concentrant sur la remédiation et non l’exploitation. Principales contributions 🧪 Portage de CVE réelles vers des dépôts cibles « fonctionnellement similaires » pour créer des failles inédites et limiter la mémorisation par les modèles. Couverture exclusive de vulnérabilités critiques (CVSS ≥ 7.0) et scénarios à fort impact (RCE, élévation de privilèges, dépassements mémoire, etc.). Évaluation par pentest: une correction n’est validée que si un exploit actif est effectivement bloqué après patch. 5 niveaux d’information fournis à l’agent (zero‑day, CWE, post‑exploit, one‑day, full‑info) pour mesurer la dépendance au contexte. Variantes inter‑dépôts et intra‑dépôt pour tester la généralisation (ex. portage de CVE‑2021‑23017 entre HAProxy, Squid, Tinyproxy). Résultats et comportements observés 🛡️ ...

15 mars 2026 · 3 min
Dernière mise à jour le: 3 août 2026 📝