Ătude empirique : 400 tests de pĂ©nĂ©tration autonomes par LLM â cohĂ©rence et fiabilitĂ©
đŹ Contexte PubliĂ© le 7 juin 2026 sur arXiv (arxiv.org/abs/2605.30096), cet article de recherche indĂ©pendant (auteur : Galip T. Erdem) prĂ©sente la premiĂšre Ă©tude empirique Ă grande Ă©chelle mesurant la cohĂ©rence comportementale de LLMs utilisĂ©s comme agents dâattaque autonomes. LâĂ©tude couvre 400 exĂ©cutions (4 modĂšles Ă 100 runs) contre un honeypot isolĂ© hĂ©bergĂ© sur Azure. đŻ Dispositif expĂ©rimental Le honeypot cible expose trois services dĂ©libĂ©rĂ©ment vulnĂ©rables : Port 3000 : OWASP Juice Shop (injection SQL via /rest/products/search?q=) Port 22 : OpenSSH avec credentials faibles (honeypot:password123) Port 21 : vsftpd avec accĂšs FTP anonyme et fichier credentials.txt Les 4 modĂšles testĂ©s : Claude Sonnet 4 (Anthropic), Gemini 2.5 Flash-Lite (Google), GPT-4o-mini (OpenAI), qwen2.5-coder:14b (local via Ollama). Lâorchestrateur implĂ©mente une boucle commande-exĂ©cution-observation avec un maximum de 25 itĂ©rations. ...