🔬 Contexte
Publié le 22 juillet 2026 par Juan Andrés Guerrero-Saade et Gabriel Bernadett-Shapiro (SentinelLABS), cet article présente un benchmark original conçu pour évaluer les capacités des modèles de langage frontier dans le cadre d’une investigation autonome de malware sur le long terme.
🧪 Le benchmark : fast16 comme cas d’étude
Le benchmark s’appuie sur fast16, un implant Windows de sabotage datant de 2005, conçu pour altérer des solveurs haute précision utilisés dans la modélisation d’armes nucléaires. Ce malware présente une architecture en couches :
- Un service Windows (
svcmgmt.exe) avec deux composants embarqués - Un framework opérationnel chiffré piloté par Lua
- Un driver kernel contenant un moteur de patching avec 101 règles, initialement confondu avec un rootkit filesystem
Le benchmark comporte 8 niveaux progressifs, chacun introduisant de nouveaux artefacts (installeurs LS-DYNA, PKPM, MOHID, ANSYS AUTODYN, rapports publics, etc.) et testant la capacité du modèle à maintenir une investigation cohérente face à des preuves contradictoires.
🤖 Résultats par modèle
| Modèle | Résultat |
|---|---|
| GPT-5.6 Sol | Seul modèle à compléter les 8 niveaux (3 runs) |
| GPT-5.5 | Bloqué au niveau 1, incapable de converger |
| GLM-5.2 | Run unique ($100 budget), niveau 1 partiel |
| Opus 4.7 / 4.8 | Avancés mais surpromotion de jalons, pas de clôture complète |
| Opus 4.6, GPT-5.4, Grok 4.2, Gemini 3.1 Pro, DeepSeek R | Échec autonome, convergence sur conclusion erronée (rootkit) |
🏆 Capacité distinctive : la récupération à l’échelle projet
Ce qui distingue GPT-5.6 Sol est sa capacité de project-scale recovery : retrait des conclusions contredites, cartographie du blast radius, réparation de la cause, propagation de la correction dans tous les artefacts dépendants, vérification adversariale, et décision de convergence.
🛠️ Méthodologie technique
- Harness
/reverseavec IDA Pro 9.3 dans un workspace sandboxé (pas d’egress réseau via nono shell) - Évaluation sur IDB annotés (pas sur rapports prose) pour éviter les raccourcis déductifs
- Coût total : plus de 23 milliards de tokens, taux de cache read à 93,58%
📌 Type d’article
Article de recherche et benchmark publié par SentinelLABS, visant à caractériser objectivement les capacités réelles des modèles frontier pour l’analyse de malware autonome, avec mise à disposition publique des IDB gold-master sur GitHub.
🧠 TTPs et IOCs détectés
IOC
- Fichiers :
svcmgmt.exe
Malware / Outils
- fast16 (other)
🟡 Indice de vérification factuelle : 51/100 (moyenne)
- ✅ sentinelone.com — source reconnue (liste interne) (20pts)
- ✅ 30153 chars — texte complet (fulltext extrait) (15pts)
- ✅ 1 IOC(s) (6pts)
- ⬜ pas d’IOC vérifié (0pts)
- ⬜ aucune TTP identifiée (0pts)
- ✅ date extraite du HTML source (10pts)
- ⬜ aucun acteur de menace nommé (0pts)
- ⬜ pas de CVE à vérifier (0pts)
🔗 Source originale : https://www.sentinelone.com/labs/frontier-models-tackle-autonomous-long-horizon-malware-analysis/