GhostWriter : attaque par empoisonnement de mémoire longue durée sur agents LLM

📰 Source : TechXplore / Phys.org — Article publiĂ© le 19 juillet 2026, basĂ© sur un preprint arXiv (DOI: 10.48550/arxiv.2607.06595) des chercheurs George Torres, Sharad Shrestha et Satyajayant Misra de la New Mexico State University. 🎯 Contexte Les agents LLM dotĂ©s de mĂ©moire persistante Ă  long terme (ex. : assistants personnels basĂ©s sur ChatGPT, Gemini) sont dĂ©sormais capables d’agir de maniĂšre autonome : gestion d’emails, prise de rendez-vous, mise Ă  jour de code. Cette mĂ©moire persistante introduit de nouvelles surfaces d’attaque. ...

20 juillet 2026 Â· 2 min

SingGuard-NSFA : framework de guardrails extensibles pour agents IA avec taxonomie de 185 risques

🔍 Contexte PubliĂ© en juillet 2026 sur GitHub par la SingGuard Team de l’AI Security Lab d’Ant Group, cet article prĂ©sente SingGuard-NSFA, un framework de guardrails de sĂ©curitĂ© conçu spĂ©cifiquement pour les agents IA autonomes (LLMs capables d’invoquer des outils, exĂ©cuter du code et orchestrer des plans multi-Ă©tapes). 🎯 ProblĂ©matique adressĂ©e Les guardrails de sĂ©curitĂ© existants ont Ă©tĂ© conçus pour filtrer le contenu textuel, non pour dĂ©tecter les menaces opĂ©rationnelles propres aux agents IA : ...

20 juillet 2026 Â· 2 min

Ghostcommit : injection de prompt dans des images PNG pour voler des secrets via des agents IA

🔬 Contexte PubliĂ© le 11 juillet 2026 sur BleepingComputer, cet article prĂ©sente les travaux de l’ASSET Research Group de l’UniversitĂ© du Missouri-Kansas City (chercheurs Sudipta Chattopadhyay et Murali Ediga). Un proof-of-concept a Ă©tĂ© publiĂ© sur GitHub et les vendeurs concernĂ©s ont Ă©tĂ© notifiĂ©s. ⚙ MĂ©canisme de l’attaque Ghostcommit exploite un angle mort structurel dans la chaĂźne de revue de code assistĂ©e par IA : Une pull request malveillante est soumise avec un fichier AGENTS.md (fichier de convention lu automatiquement par les agents IA) pointant vers une image docs/images/build-spec.png Les instructions malveillantes (lire le fichier .env, encoder chaque octet en entier, Ă©mettre le rĂ©sultat comme constante de module) sont inscrites en texte lisible Ă  l’intĂ©rieur du PNG Les outils de revue de code (CodeRabbit, Bugbot) n’ouvrent pas les fichiers image et ne dĂ©tectent rien Un faux validateur de provenance (50 lignes) et un post-mortem fabriquĂ© renforcent la crĂ©dibilitĂ© de la convention pour contourner les vĂ©rifications de cohĂ©rence 💣 Exfiltration des secrets Le payload reste dormant jusqu’à ce qu’un dĂ©veloppeur demande une fonctionnalitĂ© routiniĂšre Ă  l’agent L’agent lit AGENTS.md au dĂ©marrage, suit le pointeur vers l’image, ouvre .env et gĂ©nĂšre un module avec une constante _PROV_CANARY encodant le contenu du .env sous forme de tuple d’entiers Python En test rĂ©el, Cursor pilotĂ© par Claude Sonnet a exfiltrĂ© l’intĂ©gralitĂ© du .env en 311 entiers dĂšs le premier essai Les scanners de secrets ne dĂ©tectent pas l’exfiltration car ils ne reconvertissent pas les tuples d’entiers en ASCII 📊 DonnĂ©es de contexte Sur 6 480 pull requests analysĂ©es dans les 300 dĂ©pĂŽts publics les plus actifs sur 90 jours : 73% des PRs fusionnĂ©es l’ont Ă©tĂ© sans revue humaine substantielle ni revue automatisĂ©e Les instructions malveillantes Ă©taient en texte clair dans le PNG (incluant les mots « malicious prompt injection ») et ont quand mĂȘme passĂ© les revues đŸ› ïž Comportement selon les outils Cursor et Antigravity : ont suivi les instructions et exfiltrĂ© le .env sous Sonnet, Gemini et GPT-5.5 Claude Code (Anthropic) : a refusĂ© explicitement sous tous les modĂšles testĂ©s Opus sous Antigravity : a Ă©crit le secret puis l’a supprimĂ© aprĂšs avoir reconnu le pattern de social engineering Conclusion : l’outil (harness) importe plus que le modĂšle sous-jacent 🔗 Techniques connexes En 2025, Trail of Bits avait dĂ©montrĂ© des images exploitant le pipeline de redimensionnement des IA (downscaling) pour injecter des prompts lisibles par l’IA mais invisibles Ă  l’Ɠil humain (ayant trompĂ© Gemini CLI) Le malware macOS Gaslight avait intĂ©grĂ© de faux messages d’erreur systĂšme pour tromper les outils d’analyse IA Manifold Security avait dĂ©montrĂ© une revue IA trompĂ©e par une identitĂ© git usurpĂ©e 📄 Nature de l’article Article de type publication de recherche prĂ©sentant un proof-of-concept d’attaque par injection de prompt via image contre des agents IA de revue de code, avec donnĂ©es empiriques et rĂ©sultats de tests comparatifs. ...

14 juillet 2026 Â· 3 min

Claude Code : stĂ©ganographie de prompt via marqueurs Unicode cachĂ©s dans les requĂȘtes API

🔍 Contexte : Le 30 juin 2026, un chercheur du blog Thereallo a publiĂ© une analyse technique de Claude Code (version 2.1.196), l’agent de codage d’Anthropic, dans le cadre d’un audit de confidentialitĂ© personnel. đŸ§© DĂ©couverte principale : Le binaire de Claude Code contient une fonction qui modifie silencieusement le system prompt envoyĂ© au modĂšle en substituant l’apostrophe du mot “Today’s” par diffĂ©rents caractĂšres Unicode visuellement identiques (', ’, ÊŒ, Êč) et en changeant le sĂ©parateur de date (- → /). Cette technique est qualifiĂ©e de stĂ©ganographie de prompt. ...

11 juillet 2026 Â· 3 min

GitLost : injection de prompt dans GitHub Agentic Workflows permettant la fuite de dépÎts privés

🔍 Contexte PubliĂ© le 6 juillet 2026 par Noma Labs (blog Noma Security), cet article prĂ©sente la dĂ©couverte d’une vulnĂ©rabilitĂ© critique baptisĂ©e GitLost, affectant les GitHub Agentic Workflows, une fonctionnalitĂ© rĂ©cente de GitHub combinant GitHub Actions avec un agent IA (Claude ou GitHub Copilot). đŸ§© Description de la vulnĂ©rabilitĂ© La vulnĂ©rabilitĂ© repose sur une injection de prompt indirecte (indirect prompt injection). Les GitHub Agentic Workflows permettent d’automatiser des interactions avec des dĂ©pĂŽts via du langage naturel, en lisant des issues GitHub et en exĂ©cutant des actions en rĂ©ponse. ...

11 juillet 2026 Â· 2 min

DuneSlide : Deux vulnérabilités RCE critiques via injection de prompt dans Cursor IDE

🔍 Contexte PubliĂ© le 1er juillet 2026 par Cato AI Labs (blog Cato Networks), cet article prĂ©sente la dĂ©couverte de deux vulnĂ©rabilitĂ©s critiques dans Cursor IDE, un environnement de dĂ©veloppement intĂ©grĂ© basĂ© sur l’IA utilisĂ© par plus de la moitiĂ© des entreprises du Fortune 500. 🚹 VulnĂ©rabilitĂ©s identifiĂ©es Les deux vulnĂ©rabilitĂ©s, regroupĂ©es sous le nom DuneSlide, ont obtenu un score CVSS de 9.8 et ont Ă©tĂ© assignĂ©es les identifiants CVE-2026-50548 et CVE-2026-50549. ...

2 juillet 2026 Â· 3 min

AutoJack : une chaĂźne RCE via agent IA exploitant AutoGen Studio et MCP WebSocket

🔍 Contexte : Le 18 juin 2026, l’équipe Microsoft Defender Security Research publie une analyse technique dĂ©taillant une chaĂźne d’exploitation baptisĂ©e AutoJack, dĂ©couverte dans AutoGen Studio, l’interface de prototypage open-source du framework multi-agents AutoGen de Microsoft Research. ⚙ MĂ©canisme d’attaque : La chaĂźne combine trois faiblesses indĂ©pendantes dans la surface MCP WebSocket d’AutoGen Studio : Issue 1 (CWE-1385) : La liste blanche d’origines (http://127.0.0.1, http://localhost) bloque les navigateurs externes mais pas un agent de navigation headless tournant sur la mĂȘme machine, dont le JavaScript hĂ©rite de l’identitĂ© localhost. Issue 2 (CWE-306) : Le middleware d’authentification exclut explicitement les chemins /api/mcp/* et /api/ws/*, sans que le handler WebSocket MCP n’implĂ©mente sa propre vĂ©rification. RĂ©sultat : le WebSocket MCP est accessible sans authentification quelle que soit la configuration auth. Issue 3 (CWE-78) : Le paramĂštre server_params passĂ© en query string est dĂ©codĂ© en base64, parsĂ© en StdioServerParams, et transmis directement Ă  stdio_client() sans liste blanche des exĂ©cutables autorisĂ©s, permettant de spawner calc.exe, powershell.exe -enc ... ou bash -c '...'. 🎯 ScĂ©nario d’exploitation : Un attaquant hĂ©berge une page web contenant un script JavaScript qui ouvre une connexion WebSocket vers ws://localhost:8081/api/mcp/ws/<session_id>?server_params=<base64(json)>. Lorsqu’un agent AutoGen Ă©quipĂ© de capacitĂ©s de navigation (ex: MultimodalWebSurfer) visite cette page, le script s’exĂ©cute avec l’identitĂ© localhost, contourne l’auth, et AutoGen Studio spawne la commande arbitraire sous le compte du dĂ©veloppeur. Aucune interaction utilisateur supplĂ©mentaire n’est requise au-delĂ  de faire visiter la page Ă  l’agent. ...

23 juin 2026 Â· 3 min

Cline (4,2M installs) : deux contournements de sécurité permettent l'exécution de code arbitraire

🔍 Contexte PubliĂ© le 17 juin 2026 par Ax Sharma (Head of Research, Manifold Security), cet article de recherche documente deux chemins d’exĂ©cution de code locale Ă  haute sĂ©vĂ©ritĂ© dans Cline, l’extension VS Code d’agent de codage IA comptant environ 4,2 millions d’installations sur le VS Code Marketplace et OpenVSX. 🎯 ScĂ©nario d’attaque L’attaque cible un workflow dĂ©veloppeur courant : cloner un dĂ©pĂŽt inconnu et demander Ă  Cline de le configurer. Le contenu du dĂ©pĂŽt (README malveillant ou autre contenu lu par l’agent) manipule l’agent pour exĂ©cuter des commandes shell arbitraires sous le compte du dĂ©veloppeur. L’impact potentiel inclut l’accĂšs aux clĂ©s SSH, credentials AWS/GCP, cookies de navigateur, code source et tout ce que le dĂ©veloppeur peut atteindre via VPN. Il s’agit d’un pattern confused-deputy dans l’IA agentique. ...

19 juin 2026 Â· 3 min

Microsoft Copilot Cowork : exfiltration de fichiers via injection de prompt indirecte

🔍 Contexte PubliĂ© le 27 mai 2026 par PromptArmor, cet article de recherche documente une attaque d’exfiltration de fichiers affectant Microsoft Copilot Cowork, une fonctionnalitĂ© Frontier disponible dans Microsoft 365. L’attaque exploite une injection de prompt indirecte combinĂ©e Ă  une approbation automatique non documentĂ©e de certaines actions sensibles. ⚙ MĂ©canisme d’attaque La chaĂźne d’attaque repose sur plusieurs Ă©tapes : La victime possĂšde des fichiers sensibles (PII, donnĂ©es financiĂšres) accessibles via SharePoint ou OneDrive La victime charge un fichier de compĂ©tence (Skill) empoisonnĂ© dans Copilot Cowork — vecteur courant car les Skills sont automatiquement chargĂ©s depuis un chemin OneDrive spĂ©cifique La victime demande Ă  Copilot Cowork un rĂ©capitulatif de sa semaine, dĂ©clenchant la compĂ©tence malveillante L’injection manipule l’agent pour qu’il envoie un message Teams contenant des balises HTML image malveillantes pointant vers un site contrĂŽlĂ© par l’attaquant, avec les liens de tĂ©lĂ©chargement prĂ©-authentifiĂ©s des fichiers en paramĂštres de requĂȘte À l’ouverture du message Teams par la victime, les liens sont exfiltrĂ©s et l’attaquant peut tĂ©lĂ©charger les fichiers 🎯 Facteur aggravant : approbation automatique Contrairement Ă  ce qu’indique la documentation Microsoft, l’envoi d’emails et de messages Teams Ă  l’utilisateur actif ne requiert aucune approbation humaine. Les utilisateurs ne disposent d’aucun paramĂštre pour modifier ce comportement. L’activitĂ© malveillante n’est pas visible dans l’interface Copilot Cowork. ...

27 mai 2026 Â· 3 min

Rapport CTI : Opérations APT ciblant les systÚmes d'IA d'entreprise (2025-2026)

🌐 Contexte PubliĂ© le 14 mai 2026 sur le blog Krypt3ia, ce rapport de threat intelligence analyse l’évolution du paysage offensif autour de la prolifĂ©ration des systĂšmes d’IA en entreprise entre 2025 et 2026. Il s’appuie sur des frameworks reconnus (MITRE ATT&CK, MITRE ATLAS, OWASP LLM Top 10) et des rapports publics de Google, Microsoft, OpenAI et Anthropic. 🎯 Évolution de la surface d’attaque Les systĂšmes d’IA (LLM, RAG, agents autonomes, copilotes dĂ©veloppeurs) sont dĂ©sormais intĂ©grĂ©s dans les opĂ©rations critiques des entreprises. Ils constituent ce que le rapport nomme une “soft privileged infrastructure” : accĂšs Ă  des donnĂ©es sensibles, autoritĂ© dĂ©lĂ©guĂ©e, positionnement de confiance dans les workflows, sans les contrĂŽles de sĂ©curitĂ© Ă©quivalents Ă  un opĂ©rateur humain privilĂ©giĂ©. ...

20 mai 2026 Â· 3 min
Derniùre mise à jour le: 26 juillet 2026 📝