Kimi K3 : premier modèle open-weight à résoudre des scénarios d'attaque cyber multi-étapes

🔬 Contexte Publié le 19 août 2026 par Irregular (hello@irregular.com), cet article présente les résultats d’une évaluation de Kimi K3, un modèle de langage open-weight de 2,8 billions de paramètres (mixture-of-experts, 104 milliards de paramètres actifs), sur trois suites de benchmarks offensifs en cybersécurité. 📊 Suites d’évaluation utilisées Atomic Tasks : tâches techniques bornées (cryptographie, falsification de certificats, exploitation de navigateur, corruption mémoire, manipulation de protocoles, compromission multi-hôtes) CyScenarioBench : scénarios d’attaque multi-étapes nécessitant le maintien d’un état d’attaque cohérent FrontierCyber : recherche de vulnérabilités en conditions réelles sur des cibles réelles 🏆 Résultats clés Atomic Tasks : performances solides, notamment dans la construction de chaînes d’attaque complètes à partir d’accès partiels, la création d’outils personnalisés et la validation de chaque étape CyScenarioBench : premier modèle open-weight à enregistrer un solve vérifié, surpassant GLM-5.2 qui n’avait résolu aucun challenge de cette suite FrontierCyber : aucun solve vérifié, mais progression notable ; les capacités de recherche de vulnérabilités n’ont pas abouti à un impact de sécurité validé 📈 Comparaison et tendances Fin 2025 : tous les modèles publiquement évalués obtenaient 0% sur CyScenarioBench Début 2026 : les modèles fermés (closed frontier) ont commencé à enregistrer des solves Août 2026 : Kimi K3 atteint ce même seuil, illustrant la réduction rapide de l’écart entre modèles open-weight et modèles fermés de pointe Les modèles fermés conservent un avantage sur les tâches les plus complexes, notamment en fiabilité et efficacité sur de longues sessions 📌 Nature de l’article Il s’agit d’une publication de recherche produite par Irregular, visant à évaluer et documenter les capacités offensives en cybersécurité des grands modèles de langage open-weight, dans une perspective de suivi de la trajectoire capacitaire des LLMs appliqués à la cybersécurité offensive. ...

1 septembre 2026 · 2 min
Dernière mise à jour le: 2 septembre 2026 📝