Aller au contenu principal
Sécurité · Actu ·

Un modèle ouvert peut-il faire de la recherche en sécurité ? apex-flash-1 de Cantina résout 40 des 60 tâches de bugs inédites

Cantina Security, avec Yeta Labs, a publié apex-flash-1, un modèle à poids ouverts entraîné spécifiquement pour la recherche de vulnérabilités. Il s'agit d'un fine-tuning par apprentissage par renforcement du modèle GLM-5.3-Flash de Z.ai, diffusé sur Hugging Face sous licence MIT. D'après les métadonnées safetensors, il compte 321,3 milliards de paramètres au total, la base GLM-5.3-Flash étant un modèle Mixture-of-Experts à 18 milliards de paramètres actifs. L'entraînement a utilisé GRPO avec un LoRA de rang 256 combiné à un entraînement sélectif de paramètres complets. Les données comprennent 150 tâches tirées de 50 cas réels de vulnérabilités, chacun décliné en trois variantes : whitebox guidé, whitebox ciblé et blackbox ciblé. Les failles d'autorisation, d'identité et de périmètre représentent 72 % des cas, les bugs de comptabilité et de précision numérique 18 %, le reste couvrant la validation temporelle, les règles métier et le SSRF. Sur 60 tâches issues de 20 cas tenus à l'écart, apex-flash-1 en résout 40 (66,7 % en pass@1) pour environ 2,38 dollars, contre 36 (60,0 %) pour le modèle de base à environ 4,56 dollars, et 43 (71,7 %) pour Claude Opus 5 High à environ 74,68 dollars.

2 min de lecturePertinence 57

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Ces chiffres dessinent un rapport coût-efficacité très favorable. Opus résout trois tâches de plus, mais chaque exécution coûte environ 31 fois plus cher, soit environ 0,06 dollar par tâche résolue pour apex-flash-1 contre 1,74 dollar pour Opus. Pour les équipes de défense, l'enjeu est de disposer d'un modèle performant qu'elles peuvent exécuter et contrôler localement, sans envoyer de code sensible à un fournisseur tiers. Il faut toutefois relativiser : il s'agit de résultats publiés par l'entreprise sur un banc d'essai interne, avec une seule exécution par modèle. Le déploiement reste exigeant : les poids en BF16 demandent environ 640 Go de mémoire GPU, donc un nœud multi-GPU, même si des portages communautaires en 4 bits existent et que le modèle se sert via vLLM, SGLang ou Transformers.

Cantina positionne apex-flash-1 comme un modèle ouvrier, orchestré par un modèle plus grand, plutôt que comme un orchestrateur. Ses compétences cibles sont la lecture de code, l'usage d'outils, le développement d'exploits et la vérification. Les rollouts d'apprentissage ont tourné dans le harnais d'agents Codex, sur des logiciels et des environnements de protocoles proches de la production. Une variante expérimentale, apex-flash-1-abliterated, dont le comportement de refus a été modifié, est également proposée, sans avoir été évaluée séparément. Le modèle arrive dans un segment qui s'étoffe : Aikido propose Altar-1, dérivé élagué de GLM-5.3 destiné au pentest autonome en environnement isolé et crédité de 60,4 % de rappel sur un ensemble interne de 32 CVE, tandis que Cisco a sorti Foundation-Sec-8B-Reasoning, un modèle de 8 milliards de paramètres basé sur Llama 3.1 et orienté triage SOC. Ces comparaisons restent délicates, car chaque acteur s'appuie sur ses propres jeux d'évaluation.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

Notre lecture

Trois tâches d'écart avec Opus 5 High pour 31 fois moins cher : la recherche de failles vient de se découvrir un marché de modèles ouvriers, pas besoin d'un modèle de pointe pour chaque ligne de code auditée. Le vrai argument, c'est de garder le code sensible chez soi. Bon, sur le papier. 640 Go de mémoire GPU en BF16, un banc d'essai interne et une seule exécution par modèle, ça fait beaucoup de réserves. Reste à voir si ça tient sur du code qui n'a pas été choisi par celui qui vend le modèle.

À lire ensuite

01Un outil d'IA contaminé révèle une faille majeure dans la sécurité des agents en entreprise46VentureBeat AISécurité 02Mend publie un cadre de gouvernance de la sécurité IA : inventaire des ressources, classification des risques, sécurité de la chaîne d'approvisionnement et modèle de maturité39MarkTechPostSécurité 03Microsoft lance son propre modèle de cybersécurité MAI-Cyber-1-Flash, mais reste dépendant d'OpenAI pour les tâches les plus complexes37The DecoderSécurité 
Dossier · Hugging FaceSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.