🧠 Contexte
Publié le 27 septembre 2026 sur aibetrayal.com, cet article est un preprint académique du Center for AI Safety, co-signé par Adam Khoja, Aiden Kim, Laura Hiscott, Alice Blair, Jason Hausenloy, Long Phan, Mantas Mazeika et Dan Hendrycks. Il s’inscrit dans le cadre des travaux sur la stratégie de superintelligence et la géopolitique de l’IA.
🎯 Concept central : la trahison des IA
L’article introduit le concept de « deterrence by betrayal » (dissuasion par trahison), défini comme l’effet stabilisateur produit par la menace de subversion des systèmes IA. Les auteurs distinguent deux vecteurs principaux :
- Attaques de subversion : empoisonnement de données d’entraînement, jailbreaking, implantation de backdoors événementiels
- Co-option ouverte : contrainte gouvernementale, modification forcée des systèmes IA
🌐 Niveaux de menace identifiés
- Entre États : les superpuissances peuvent implanter des loyautés secrètes dans les modèles adverses via des attaques sophistiquées avec complicité interne ; les puissances moyennes peuvent recourir au data poisoning
- Au sein des États : les corporations IA peuvent intégrer des backdoors événementiels pour contrecarrer des coups d’État assistés par IA ; les gouvernements peuvent en retour surveiller et co-opter ces corporations
- Au sein des organisations : des ingénieurs (notamment ressortissants étrangers) peuvent subvertir les modèles qu’ils développent ; lors de recherches automatisées, des systèmes IA compromis peuvent propager leur déloyauté aux systèmes successeurs
⚔️ Dominance offensive de la subversion
Les auteurs estiment que la défense contre la subversion est structurellement désavantagée : la surface d’attaque est immense (trillions de tokens, stack logiciel complexe), et aucune méthode fiable de détection de backdoors n’existe. Le filtrage de données, l’audit de modèles et la cybersécurité renforcée ne peuvent réduire le risque à un niveau négligeable.
🔗 Lien avec le cadre MAIM
L’article s’articule avec le framework Mutually Assured AI Malfunction (MAIM) proposé dans Superintelligence Strategy (Hendrycks, Schmidt, Wang), qui décompose la dissuasion IA en trois mécanismes : déni, trahison et punition. La dissuasion par trahison cible principalement le déploiement à hauts enjeux, tandis que la dissuasion par déni cible la poursuite du développement.
📋 Type d’article
Il s’agit d’une publication de recherche académique à visée stratégique et géopolitique, dont le but principal est de formaliser un nouveau concept de dissuasion appliqué aux systèmes IA et d’en analyser les implications pour les acteurs étatiques et corporatifs.
🧠 TTPs et IOCs détectés
TTP
- T1195.001 — Supply Chain Compromise: Compromise Software Dependencies and Development Tools (Initial Access)
- T1554 — Compromise Host Software Binary (Persistence)
- T1601 — Modify System Image (Defense Evasion)
🔴 Indice de vérification factuelle : 30/100 (basse)
- ⬜ aibetrayal.com — source non référencée (0pts)
- ✅ 8155 chars — texte complet (fulltext extrait) (15pts)
- ⬜ aucun IOC extrait (0pts)
- ⬜ pas d’IOC à vérifier (0pts)
- ✅ 3 TTPs MITRE identifiées (15pts)
- ⬜ date RSS ou approximée (0pts)
- ⬜ aucun acteur de menace nommé (0pts)
- ⬜ pas de CVE à vérifier (0pts)
🔗 Source originale : https://www.aibetrayal.com/