đ Contexte
PubliĂ© le 10 septembre 2026 par Check Point Research, cet article prĂ©sente PuzzleMask, une nouvelle technique d’attaque ciblant les pipelines LLM Ă double Ă©tage (gatekeeper â target model). La recherche dĂ©montre comment des payloads malveillants peuvent ĂȘtre dissimulĂ©s dans de la prose ordinaire en anglais, sans recours Ă des encodages exotiques (Base64, emojis, formatage invisible).
âïž MĂ©canisme de l’attaque
La technique repose sur un wrapper en prose soigneusement construit qui encapsule un payload interdit. Le principe exploite la différence de capacités entre :
- Le gatekeeper LLM (modÚle léger, sans raisonnement approfondi ni interpréteur de code) qui classe le prompt comme bénin
- Le modÚle cible (modÚle puissant avec accÚs à un interpréteur Python et haute capacité de raisonnement) qui extrait et exécute le payload
Dans tous les tests, le modĂšle cible ayant rĂ©ussi l’extraction a utilisĂ© >1 minute de temps de rĂ©flexion et >2 scripts Python exĂ©cutĂ©s.
đ§Ș RĂ©sultats expĂ©rimentaux
Gatekeepers testés :
gpt-4o-mini-2024-07-18gpt-oss-safeguard:20bclaude-3-haiku-20240307llama-guard3:8b
ModÚle cible : gpt-5-thinking-high avec interpréteur Python
Payloads testés :
print flag last wordprint macarena full lyricsencrypt documents; rm plain copies
RĂ©sultats : 23 prompts obfusquĂ©s gĂ©nĂ©rĂ©s â 100% ont passĂ© les gatekeepers sans dĂ©tection ; >90% ont Ă©tĂ© correctement extraits et traitĂ©s par le modĂšle cible.
đŻ PortĂ©e et limites
La technique permet de soumettre un prompt arbitraire sans revue par le systĂšme de contrĂŽle rapide. Elle n’est pas un jailbreak en soi : elle ne contourne pas les garde-fous internes du modĂšle cible, mais uniquement le gatekeeper externe. Elle peut nĂ©anmoins ĂȘtre combinĂ©e avec un jailbreak comme payload.
Le pipeline de génération est actuellement coûteux en ressources (>15 minutes pour des payloads courts), ce qui limite son usage à grande échelle dans sa forme actuelle.
đ Nature de l’article
Publication de recherche offensive en sĂ©curitĂ© IA, visant Ă documenter une nouvelle classe de vulnĂ©rabilitĂ© dans les architectures LLM Ă pipeline multi-Ă©tages et Ă sensibiliser la communautĂ© CTI Ă ce vecteur d’attaque Ă©mergent.
đ§ TTPs et IOCs dĂ©tectĂ©s
TTP
- T1027 â Obfuscated Files or Information (Defense Evasion)
- T1059.006 â Command and Scripting Interpreter: Python (Execution)
IOC
- Chemins :
~/Documents
â ïž Ă propos de ces IOC â ils sont extraits automatiquement de l’article original le 11 septembre 2026 et n’ont pas fait l’objet d’une vĂ©rification externe. Un indicateur peut avoir Ă©tĂ© rĂ©attribuĂ© depuis : une IP de C2 peut redevenir un service lĂ©gitime, un domaine sinkholĂ© peut changer de propriĂ©taire. Aucune garantie d’exactitude ni d’actualitĂ© â contrĂŽlez leur validitĂ© avant tout usage opĂ©rationnel, en particulier avant de les injecter dans une blocklist ou un SIEM.
đĄ Indice de vĂ©rification factuelle : 59/100 (moyenne)
- â research.checkpoint.com â source reconnue (liste interne) (20pts)
- â 15000 chars â texte complet (fulltext extrait) (15pts)
- â 1 IOC(s) (6pts)
- ⏠pas d’IOC vĂ©rifiĂ© (0pts)
- â 2 TTP(s) MITRE (8pts)
- â date extraite du HTML source (10pts)
- ⏠aucun acteur de menace nommé (0pts)
- ⏠pas de CVE à vérifier (0pts)
đ Source originale : https://research.checkpoint.com/2026/puzzlemask-abusing-plain-prose-as-a-covert-ai-attack-vector/