SentinelLABS benchmark les LLM frontier sur l'analyse autonome de malware avec fast16
🔬 Contexte Publié le 22 juillet 2026 par Juan Andrés Guerrero-Saade et Gabriel Bernadett-Shapiro (SentinelLABS), cet article présente un benchmark original conçu pour évaluer les capacités des modèles de langage frontier dans le cadre d’une investigation autonome de malware sur le long terme. 🧪 Le benchmark : fast16 comme cas d’étude Le benchmark s’appuie sur fast16, un implant Windows de sabotage datant de 2005, conçu pour altérer des solveurs haute précision utilisés dans la modélisation d’armes nucléaires. Ce malware présente une architecture en couches : ...