SentinelLABS benchmark les LLM frontier sur l'analyse autonome de malware avec fast16

🔬 Contexte Publié le 22 juillet 2026 par Juan Andrés Guerrero-Saade et Gabriel Bernadett-Shapiro (SentinelLABS), cet article présente un benchmark original conçu pour évaluer les capacités des modèles de langage frontier dans le cadre d’une investigation autonome de malware sur le long terme. 🧪 Le benchmark : fast16 comme cas d’étude Le benchmark s’appuie sur fast16, un implant Windows de sabotage datant de 2005, conçu pour altérer des solveurs haute précision utilisés dans la modélisation d’armes nucléaires. Ce malware présente une architecture en couches : ...

29 juillet 2026 · 2 min

CAIBench : un méta‑benchmark pour évaluer les agents IA en cybersécurité (CTF, Attack & Defense, robotique, privacy)

Source : AliasRobotics — contexte : publication de recherche présentant CAIBench, un méta‑benchmark modulaire et reproductible pour mesurer les capacités offensives, défensives, de connaissance et de respect de la vie privée des modèles et agents IA en cybersécurité. CAIBench intègre cinq familles d’évaluations (plus de 10 000 instances) : CTF Jeopardy, Attack & Defense CTF, CyberRange, benchmarks de connaissances et évaluations privacy. Les auteurs introduisent des nouveautés clés : une évaluation simultanée offensive/défensive (A&D), des défis orientés robotique (RCTF2) et un banc dédié à la protection des données personnelles (CyberPII-Bench). L’infrastructure combine environnements Docker (exécution pratique) et évaluations scriptées (connaissances, privacy). ...

2 novembre 2025 · 2 min
Dernière mise à jour le: 13 août 2026 📝