<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Analyse De Code on CyberVeille</title>
    <link>https://cyberveille.ch/tags/analyse-de-code/</link>
    <description>Recent content in Analyse De Code on CyberVeille</description>
    <generator>Hugo -- 0.146.0</generator>
    <language>fr-fr</language>
    <copyright>Cyberveille CC BY-NC-SA 4.0</copyright>
    <lastBuildDate>Mon, 20 Jul 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://cyberveille.ch/tags/analyse-de-code/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Benchmark : 13 modèles d&#39;IA testés sur la redécouverte de CVEs connus</title>
      <link>https://cyberveille.ch/posts/2026-07-20-benchmark-13-modeles-d-ia-testes-sur-la-redecouverte-de-cves-connus/</link>
      <pubDate>Mon, 20 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://cyberveille.ch/posts/2026-07-20-benchmark-13-modeles-d-ia-testes-sur-la-redecouverte-de-cves-connus/</guid>
      <description>&lt;h2 id=&#34;-contexte&#34;&gt;🔍 Contexte&lt;/h2&gt;
&lt;p&gt;Publié le 16 juillet 2026 sur le blog technique d&amp;rsquo;Aikido Security, cet article présente un benchmark méthodique de &lt;strong&gt;13 modèles d&amp;rsquo;IA&lt;/strong&gt; évalués sur leur capacité à redécouvrir &lt;strong&gt;26 vulnérabilités connues&lt;/strong&gt; issues de la base GitHub Advisory Database.&lt;/p&gt;
&lt;h2 id=&#34;-méthodologie&#34;&gt;🧪 Méthodologie&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;Les 26 CVEs couvrent plusieurs langages et types de projets (SQL injection, RCE par désérialisation, XSS stocké, etc.)&lt;/li&gt;
&lt;li&gt;Chaque modèle est exécuté dans un &lt;strong&gt;harness d&amp;rsquo;analyse de code&lt;/strong&gt; (AI Code Analysis d&amp;rsquo;Aikido), non dans une interface de chat&lt;/li&gt;
&lt;li&gt;Les agents sont pointés directement sur le snippet vulnérable pour isoler la capacité de raisonnement&lt;/li&gt;
&lt;li&gt;Chaque modèle est exécuté &lt;strong&gt;3 fois&lt;/strong&gt;, les résultats étant poolés (pass@3)&lt;/li&gt;
&lt;li&gt;Deux niveaux de raisonnement testés : &amp;ldquo;high&amp;rdquo; et &amp;ldquo;xhigh/max&amp;rdquo;&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;-résultats-clés&#34;&gt;📊 Résultats clés&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; : meilleur rappel à &lt;strong&gt;23/26 (88,5%)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;grok-4.5&lt;/strong&gt; : 20/26&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Claude Opus 4-7 / 4-8&lt;/strong&gt; : 15 à 18/26&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM-5.2&lt;/strong&gt; (open weight) : &lt;strong&gt;16/26 (59%)&lt;/strong&gt;, dans la moyenne des modèles propriétaires&lt;/li&gt;
&lt;li&gt;Tous les modèles redécouvrent les &lt;strong&gt;2 CVEs critiques&lt;/strong&gt; (RCE par désérialisation et XSS stocké)&lt;/li&gt;
&lt;li&gt;La séparation réelle se fait sur les vulnérabilités à &lt;strong&gt;chaînes complexes&lt;/strong&gt; (ex : SQL Injection via alias de colonne non échappé par l&amp;rsquo;ORM)&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;-rapport-coûtperformance&#34;&gt;💰 Rapport coût/performance&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;3 runs de &lt;strong&gt;gpt-5.4-nano&lt;/strong&gt; (~170$) atteignent 18/26, équivalent à un seul pass d&amp;rsquo;un modèle phare&lt;/li&gt;
&lt;li&gt;3 runs de &lt;strong&gt;gpt-5.4-mini&lt;/strong&gt; (~460$) atteignent 20/26&lt;/li&gt;
&lt;li&gt;Le niveau de raisonnement supérieur apporte un gain notable pour &lt;strong&gt;gpt-5.5&lt;/strong&gt; (+3) et &lt;strong&gt;glm-5.2&lt;/strong&gt; (+3), mais peu ou pas pour les autres&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;-type-darticle&#34;&gt;📌 Type d&amp;rsquo;article&lt;/h2&gt;
&lt;p&gt;Article de &lt;strong&gt;publication de recherche&lt;/strong&gt; à visée comparative, destiné aux équipes AppSec et CTI pour orienter le choix de modèles d&amp;rsquo;IA dans les workflows d&amp;rsquo;analyse de code.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
