🔍 Contexte

PubliĂ© le 10 septembre 2026 par Check Point Research, cet article prĂ©sente PuzzleMask, une nouvelle technique d’attaque ciblant les pipelines LLM Ă  double Ă©tage (gatekeeper → target model). La recherche dĂ©montre comment des payloads malveillants peuvent ĂȘtre dissimulĂ©s dans de la prose ordinaire en anglais, sans recours Ă  des encodages exotiques (Base64, emojis, formatage invisible).

⚙ MĂ©canisme de l’attaque

La technique repose sur un wrapper en prose soigneusement construit qui encapsule un payload interdit. Le principe exploite la différence de capacités entre :

  • Le gatekeeper LLM (modĂšle lĂ©ger, sans raisonnement approfondi ni interprĂ©teur de code) qui classe le prompt comme bĂ©nin
  • Le modĂšle cible (modĂšle puissant avec accĂšs Ă  un interprĂ©teur Python et haute capacitĂ© de raisonnement) qui extrait et exĂ©cute le payload

Dans tous les tests, le modĂšle cible ayant rĂ©ussi l’extraction a utilisĂ© >1 minute de temps de rĂ©flexion et >2 scripts Python exĂ©cutĂ©s.

đŸ§Ș RĂ©sultats expĂ©rimentaux

Gatekeepers testés :

  • gpt-4o-mini-2024-07-18
  • gpt-oss-safeguard:20b
  • claude-3-haiku-20240307
  • llama-guard3:8b

ModÚle cible : gpt-5-thinking-high avec interpréteur Python

Payloads testés :

  • print flag last word
  • print macarena full lyrics
  • encrypt documents; rm plain copies

RĂ©sultats : 23 prompts obfusquĂ©s gĂ©nĂ©rĂ©s — 100% ont passĂ© les gatekeepers sans dĂ©tection ; >90% ont Ă©tĂ© correctement extraits et traitĂ©s par le modĂšle cible.

🎯 PortĂ©e et limites

La technique permet de soumettre un prompt arbitraire sans revue par le systĂšme de contrĂŽle rapide. Elle n’est pas un jailbreak en soi : elle ne contourne pas les garde-fous internes du modĂšle cible, mais uniquement le gatekeeper externe. Elle peut nĂ©anmoins ĂȘtre combinĂ©e avec un jailbreak comme payload.

Le pipeline de génération est actuellement coûteux en ressources (>15 minutes pour des payloads courts), ce qui limite son usage à grande échelle dans sa forme actuelle.

📄 Nature de l’article

Publication de recherche offensive en sĂ©curitĂ© IA, visant Ă  documenter une nouvelle classe de vulnĂ©rabilitĂ© dans les architectures LLM Ă  pipeline multi-Ă©tages et Ă  sensibiliser la communautĂ© CTI Ă  ce vecteur d’attaque Ă©mergent.

🧠 TTPs et IOCs dĂ©tectĂ©s

TTP

  • T1027 — Obfuscated Files or Information (Defense Evasion)
  • T1059.006 — Command and Scripting Interpreter: Python (Execution)

IOC

  • Chemins : ~/Documents

⚠ À propos de ces IOC — ils sont extraits automatiquement de l’article original le 11 septembre 2026 et n’ont pas fait l’objet d’une vĂ©rification externe. Un indicateur peut avoir Ă©tĂ© rĂ©attribuĂ© depuis : une IP de C2 peut redevenir un service lĂ©gitime, un domaine sinkholĂ© peut changer de propriĂ©taire. Aucune garantie d’exactitude ni d’actualitĂ© — contrĂŽlez leur validitĂ© avant tout usage opĂ©rationnel, en particulier avant de les injecter dans une blocklist ou un SIEM.


🟡 Indice de vĂ©rification factuelle : 59/100 (moyenne)

  • ✅ research.checkpoint.com — source reconnue (liste interne) (20pts)
  • ✅ 15000 chars — texte complet (fulltext extrait) (15pts)
  • ✅ 1 IOC(s) (6pts)
  • ⬜ pas d’IOC vĂ©rifiĂ© (0pts)
  • ✅ 2 TTP(s) MITRE (8pts)
  • ✅ date extraite du HTML source (10pts)
  • ⬜ aucun acteur de menace nommĂ© (0pts)
  • ⬜ pas de CVE Ă  vĂ©rifier (0pts)

🔗 Source originale : https://research.checkpoint.com/2026/puzzlemask-abusing-plain-prose-as-a-covert-ai-attack-vector/