Kimi K3 : premier modèle open-weight à résoudre des scénarios d'attaque cyber multi-étapes

🔬 Contexte Publié le 19 août 2026 par Irregular (hello@irregular.com), cet article présente les résultats d’une évaluation de Kimi K3, un modèle de langage open-weight de 2,8 billions de paramètres (mixture-of-experts, 104 milliards de paramètres actifs), sur trois suites de benchmarks offensifs en cybersécurité. 📊 Suites d’évaluation utilisées Atomic Tasks : tâches techniques bornées (cryptographie, falsification de certificats, exploitation de navigateur, corruption mémoire, manipulation de protocoles, compromission multi-hôtes) CyScenarioBench : scénarios d’attaque multi-étapes nécessitant le maintien d’un état d’attaque cohérent FrontierCyber : recherche de vulnérabilités en conditions réelles sur des cibles réelles 🏆 Résultats clés Atomic Tasks : performances solides, notamment dans la construction de chaînes d’attaque complètes à partir d’accès partiels, la création d’outils personnalisés et la validation de chaque étape CyScenarioBench : premier modèle open-weight à enregistrer un solve vérifié, surpassant GLM-5.2 qui n’avait résolu aucun challenge de cette suite FrontierCyber : aucun solve vérifié, mais progression notable ; les capacités de recherche de vulnérabilités n’ont pas abouti à un impact de sécurité validé 📈 Comparaison et tendances Fin 2025 : tous les modèles publiquement évalués obtenaient 0% sur CyScenarioBench Début 2026 : les modèles fermés (closed frontier) ont commencé à enregistrer des solves Août 2026 : Kimi K3 atteint ce même seuil, illustrant la réduction rapide de l’écart entre modèles open-weight et modèles fermés de pointe Les modèles fermés conservent un avantage sur les tâches les plus complexes, notamment en fiabilité et efficacité sur de longues sessions 📌 Nature de l’article Il s’agit d’une publication de recherche produite par Irregular, visant à évaluer et documenter les capacités offensives en cybersécurité des grands modèles de langage open-weight, dans une perspective de suivi de la trajectoire capacitaire des LLMs appliqués à la cybersécurité offensive. ...

1 septembre 2026 · 2 min

GLM-5.3 : capacités cyber émergentes et découverte de 2 436 vulnérabilités réelles

🧠 Contexte Publié le 14 août 2026 sur le blog de Z.ai, cet article présente GLM-5.3, un grand modèle de langage (LLM) développé par Z.ai, construit sur la même base que GLM-5.2 mais avec un post-entraînement significativement étendu via reinforcement learning à grande échelle. 🔬 Capacités cyber émergentes Lors du scaling du post-entraînement, Z.ai a observé une émergence non anticipée de capacités offensives en cybersécurité. GLM-5.3 ne se contente pas d’identifier des vulnérabilités isolées : il est capable de raisonner sur des chaînes d’exploitation complètes (multi-stage exploitation chains). ...

16 août 2026 · 2 min

L'acteur 'Trim' transforme des IA frontier en plateforme offensive commerciale via jailbreaking

🎯 Contexte Cet article publié le 21 juillet 2026 par Cato CTRL (équipe de threat intelligence de Cato Networks) documente l’évolution d’un acteur cybercriminel russophone opérant sous le pseudonyme “Trim”, depuis un tutoriel de jailbreaking IA jusqu’à la commercialisation d’une plateforme offensive automatisée. 📅 Chronologie des activités 13 mars 2026 — Phase 1 : Partage de connaissances Trim publie sur un forum cybercriminel russophone un guide détaillé de contournement des filtres de sécurité de Claude Opus (Anthropic). Il documente six techniques nommées : ...

23 juillet 2026 · 3 min
Dernière mise à jour le: 7 septembre 2026 📝