🔬 Contexte

Publié le 19 août 2026 par Irregular (hello@irregular.com), cet article présente les résultats d’une évaluation de Kimi K3, un modèle de langage open-weight de 2,8 billions de paramètres (mixture-of-experts, 104 milliards de paramètres actifs), sur trois suites de benchmarks offensifs en cybersécurité.

📊 Suites d’évaluation utilisées

  • Atomic Tasks : tâches techniques bornées (cryptographie, falsification de certificats, exploitation de navigateur, corruption mémoire, manipulation de protocoles, compromission multi-hôtes)
  • CyScenarioBench : scénarios d’attaque multi-étapes nécessitant le maintien d’un état d’attaque cohérent
  • FrontierCyber : recherche de vulnérabilités en conditions réelles sur des cibles réelles

🏆 Résultats clés

  • Atomic Tasks : performances solides, notamment dans la construction de chaînes d’attaque complètes à partir d’accès partiels, la création d’outils personnalisés et la validation de chaque étape
  • CyScenarioBench : premier modèle open-weight à enregistrer un solve vérifié, surpassant GLM-5.2 qui n’avait résolu aucun challenge de cette suite
  • FrontierCyber : aucun solve vérifié, mais progression notable ; les capacités de recherche de vulnérabilités n’ont pas abouti à un impact de sécurité validé

📈 Comparaison et tendances

  • Fin 2025 : tous les modèles publiquement évalués obtenaient 0% sur CyScenarioBench
  • Début 2026 : les modèles fermés (closed frontier) ont commencé à enregistrer des solves
  • Août 2026 : Kimi K3 atteint ce même seuil, illustrant la réduction rapide de l’écart entre modèles open-weight et modèles fermés de pointe
  • Les modèles fermés conservent un avantage sur les tâches les plus complexes, notamment en fiabilité et efficacité sur de longues sessions

📌 Nature de l’article

Il s’agit d’une publication de recherche produite par Irregular, visant à évaluer et documenter les capacités offensives en cybersécurité des grands modèles de langage open-weight, dans une perspective de suivi de la trajectoire capacitaire des LLMs appliqués à la cybersécurité offensive.


🔴 Indice de vérification factuelle : 25/100 (basse)

  • ⬜ irregular.com — source non référencée (0pts)
  • ✅ 3357 chars — texte complet (fulltext extrait) (15pts)
  • ⬜ aucun IOC extrait (0pts)
  • ⬜ pas d’IOC à vérifier (0pts)
  • ⬜ aucune TTP identifiée (0pts)
  • ✅ date extraite du HTML source (10pts)
  • ⬜ aucun acteur de menace nommé (0pts)
  • ⬜ pas de CVE à vérifier (0pts)

🔗 Source originale : https://www.irregular.com/research/assessing-kimi-k3-against-offensive-security-benchmarks