📄 Contexte : Article de recherche académique publié sur arXiv (juillet 2026) par des chercheurs d’ETH Zurich, Anthropic, University of Haifa, Technische Universität Berlin et Tel Aviv University. L’étude évalue la capacité des grands modèles de langage (LLMs) à effectuer de la cryptanalyse sur des primitives cryptographiques réelles.
🔬 CryptanalysisBench : Le benchmark comprend 191 tâches réparties sur six familles de primitives cryptographiques (chiffrements par blocs, fonctions de hachage, AEAD, KEM, PKE, signatures numériques), issues principalement de quatre compétitions de standardisation NIST (AES, SHA-3, LWC, PQC). Il est structuré en trois niveaux :
- Tier 1 (49 schémas) : primitives avec des attaques pratiques connues
- Tier 2 (142 schémas) : primitives sans attaque pratique connue, évaluées en version complète et en variantes réduites
- Challenge set : primitives de production à la frontière de la cryptanalyse (AES 7 tours, ChaCha, PRESENT, SIMON, SPECK, SKINNY, KATAN)
🤖 Modèles évalués : Cinq modèles frontier ont été testés : Claude Opus 4.8, Claude Sonnet 5, Claude Mythos 5, GPT-5.5 et le modèle open-weights GLM-5.2.
📊 Résultats principaux :
- Tier 1 : taux de réussite de 65% (GLM-5.2) à 86% (Claude Mythos 5)
- Tier 2 : 6 à 12 schémas cassés en version complète, 24 à 61 en variantes réduites
- Les échecs sont majoritairement dus à des problèmes d’implémentation plutôt qu’à une absence d’analyse correcte
🚨 Découvertes inédites :
- SpoC AEAD : attaque de récupération de clé complète 128 bits découverte indépendamment par Mythos 5 et Sonnet 5, exploitant une mauvaise gestion des messages vides (absence de permutation d’initialisation), nécessitant seulement deux requêtes oracle
- KINDI KEM : erreur dans la preuve de sécurité CCA publiée, exploitée via une attaque par oracle de déchiffrement permettant la récupération de la clé secrète
🔍 Analyse comportementale : Les modèles Claude exhibent davantage de rappel explicite d’attaques connues, tandis que GPT-5.5 et GLM-5.2 reconstruisent les attaques depuis le code source. L’augmentation du budget temps de 2h à 16h améliore significativement les résultats (Tier 1 : 86% → 96% pour Mythos 5).
📌 Type d’article : Publication de recherche académique visant à établir un benchmark public pour mesurer et anticiper les capacités de cryptanalyse des LLMs, utilisable comme outil de stress-test des candidats à la standardisation cryptographique.
🔴 Indice de vérification factuelle : 25/100 (basse)
- ⬜ arxiv.org — source non référencée (0pts)
- ✅ 153625 chars — texte complet (fulltext extrait) (15pts)
- ⬜ aucun IOC extrait (0pts)
- ⬜ pas d’IOC à vérifier (0pts)
- ⬜ aucune TTP identifiée (0pts)
- ✅ date extraite du HTML source (10pts)
- ⬜ aucun acteur de menace nommé (0pts)
- ⬜ pas de CVE à vérifier (0pts)
🔗 Source originale : https://arxiv.org/abs/2607.18538