SentinelLABS benchmark les LLM frontier sur l'analyse autonome de malware avec fast16

🔬 Contexte Publié le 22 juillet 2026 par Juan Andrés Guerrero-Saade et Gabriel Bernadett-Shapiro (SentinelLABS), cet article présente un benchmark original conçu pour évaluer les capacités des modèles de langage frontier dans le cadre d’une investigation autonome de malware sur le long terme. 🧪 Le benchmark : fast16 comme cas d’étude Le benchmark s’appuie sur fast16, un implant Windows de sabotage datant de 2005, conçu pour altérer des solveurs haute précision utilisés dans la modélisation d’armes nucléaires. Ce malware présente une architecture en couches : ...

29 juillet 2026 · 2 min

Des groupes ransomware utilisent l'IA pour amplifier leurs négociations d'extorsion

📰 Cet article est une newsletter d’analyse publiée le 16 juillet 2026 par Risky Business (Tom Uren), couvrant l’évolution des tactiques ransomware intégrant l’intelligence artificielle dans les opérations d’extorsion. 🎯 FulcrumSec : l’IA au service de la négociation FulcrumSec est un groupe d’extorsion de données actif depuis septembre 2025. Il utilise des techniques d’accès initiales simples : Exploitation de credentials hardcodés ou exposés Applications non patchées Stockage mal configuré Le groupe revendique la compromission de 25 organisations et le vol de plusieurs téraoctets de données. Sa particularité est d’utiliser l’IA non pas pour hacker, mais pour analyser les données volées afin d’établir une position de négociation solide et justifier ses demandes de rançon. ...

23 juillet 2026 · 3 min

GhostWriter : attaque par empoisonnement de mémoire longue durée sur agents LLM

📰 Source : TechXplore / Phys.org — Article publié le 19 juillet 2026, basé sur un preprint arXiv (DOI: 10.48550/arxiv.2607.06595) des chercheurs George Torres, Sharad Shrestha et Satyajayant Misra de la New Mexico State University. 🎯 Contexte Les agents LLM dotés de mémoire persistante à long terme (ex. : assistants personnels basés sur ChatGPT, Gemini) sont désormais capables d’agir de manière autonome : gestion d’emails, prise de rendez-vous, mise à jour de code. Cette mémoire persistante introduit de nouvelles surfaces d’attaque. ...

20 juillet 2026 · 2 min

JADEPUFFER : premier ransomware agentique autonome piloté par LLM documenté

🔍 Contexte Publié le 1er juillet 2026 par l’équipe Sysdig Threat Research Team (TRT), cet article présente la première documentation publique d’un ransomware agentique piloté de bout en bout par un grand modèle de langage (LLM), désigné sous le nom JADEPUFFER. 🎯 Vecteur d’accès initial JADEPUFFER a exploité CVE-2025-3248, une faille d’authentification manquante dans l’endpoint de validation de code de Langflow (framework open-source de construction d’agents LLM), permettant l’exécution arbitraire de Python sans authentification. Tous les payloads étaient délivrés en Python encodé en Base64 via cet endpoint RCE. ...

3 juillet 2026 · 4 min

DuneSlide : Deux vulnérabilités RCE critiques via injection de prompt dans Cursor IDE

🔍 Contexte Publié le 1er juillet 2026 par Cato AI Labs (blog Cato Networks), cet article présente la découverte de deux vulnérabilités critiques dans Cursor IDE, un environnement de développement intégré basé sur l’IA utilisé par plus de la moitié des entreprises du Fortune 500. 🚨 Vulnérabilités identifiées Les deux vulnérabilités, regroupées sous le nom DuneSlide, ont obtenu un score CVSS de 9.8 et ont été assignées les identifiants CVE-2026-50548 et CVE-2026-50549. ...

2 juillet 2026 · 3 min

Benchmark CTI : Fable 5 d'Anthropic jugé contre-productif pour les défenseurs cyber

🔍 Contexte Publié le 17 juin 2026 par Graphistry sur leur blog officiel, cet article constitue un retour d’expérience pratique sur le modèle Fable 5 d’Anthropic (une configuration du modèle Mythos 5 avec politiques de sécurité IA intégrées), désormais interdit par le gouvernement américain. L’évaluation porte sur deux axes : le codage et les investigations cybersécurité. ✅ Points positifs : codage Fable 5 est décrit comme remarquablement autonome pour les tâches de développement complexes Il a accompli en 2 jours un projet de modernisation de bibliothèques CPU/GPU (lié à Apache Arrow) qui nécessitait auparavant une intervention manuelle fréquente Comparé à Opus 4.8 et Codex 5.5, Fable se pilote davantage seul Il a détecté et corrigé des bugs dans des plugins HTTP binaires personnalisés pour Arrow et Fastify ❌ Points négatifs : cybersécurité défensive Graphistry a utilisé deux benchmarks publics pour évaluer Fable sur des tâches SOC : ...

21 juin 2026 · 2 min

DarkMoon : moteur open source de pentest autonome avec agents IA et orchestration Docker

📰 Source : LinuxFR — Article publié le 20 juin 2026 par Mehdi, édité par Benoît Sibaud. 🔍 Contexte général DarkMoon est un moteur de pentest automatisé open source publié sous licence GNU GPLv3. Le projet est récent : premier commit en novembre 2025, dépôt rendu public en mai 2026, avec environ 500 clonages et 1300 téléchargements d’images Docker au moment de la publication. ⚙️ Architecture et fonctionnement L’outil repose sur trois composants principaux : ...

21 juin 2026 · 3 min

IA dans les forums cybercriminels : usages, outils et scepticisme observés par Sophos CTU

🔍 Contexte Publié le 17 juin 2026 par la Sophos Counter Threat Unit (CTU), ce rapport analyse les discussions et activités liées à l’intelligence artificielle (IA) observées sur des forums cybercriminels et canaux Telegram souterrains. L’analyse couvre des observations depuis janvier 2026. 🔑 Accès et partage de connaissances Les chercheurs CTU ont observé la vente de clés API pour des outils d’IA générative (ChatGPT, Claude, Grok) via des comptes partagés et des plateformes alternatives. Des personas comme CyberThreat et VOLTC proposent un accès mutualisé à ces outils. Un manque de connaissances est notable : les acteurs se tournent vers des canaux dédiés pour apprendre les bases, le jailbreaking et les techniques de prompt engineering. Depuis janvier 2026, des offres de recrutement de prompt engineers OpenAI ont été observées. ...

19 juin 2026 · 3 min

Anthropic cartographie l'usage malveillant de l'IA sur MITRE ATT&CK : 832 comptes analysés

🗓️ Contexte Publié le 3 juin 2026 par Anthropic (Kyla Guru, Alex Moix, Jacob Klein), ce rapport analyse 832 comptes bannis de la plateforme Claude entre mars 2025 et mars 2026 pour violation de la politique d’utilisation liée à des activités cyber malveillantes. Les résultats ont partiellement alimenté le Verizon Data Breach Investigation Report (DBIR) 2026. 📊 Méthodologie 13 873 observations d’activités malveillantes mappées sur le framework MITRE ATT&CK V18 482 sous-techniques uniques couvrant les 14 tactiques ATT&CK Nouveau score de risque : ARiES (AI Risk Enablement Score), composite de 0 à 100 basé sur trois dimensions : Threat (0–35), Vulnerability (0–35), Impact (0–30) Données collectées via Claude.ai, Claude Code et l’API Anthropic 🔑 Résultats clés 1. Croissance du risque : ...

7 juin 2026 · 4 min

Bugonomics : analyse économique de la découverte de vulnérabilités assistée par LLM

🔬 Contexte et source Article académique publié sur arXiv (soumis le 23 mai 2026) par des chercheurs de Bynario, Vanta et University College London. Il s’appuie sur les données publiques des campagnes Anthropic Mythos Preview et Mozilla Firefox pour analyser les implications économiques des LLM dans la découverte de vulnérabilités. 📐 Concept central : le « bugonomics » Les auteurs introduisent le terme bugonomics comme cadre d’analyse des coûts et incitations liés à la production d’artefacts de sécurité. Ils distinguent explicitement plusieurs catégories économiquement distinctes : ...

7 juin 2026 · 3 min
Dernière mise à jour le: 9 août 2026 📝