Évaluation choc : l’IA vulnérable aux manipulations, les réponses dangereuses explosent
La sécurité des intelligences artificielles fait l’objet d’une surveillance accrue. MLCommons, organisation de référence dans l’évaluation des performances technologiques, a mis au point un protocole d’analyse révélateur. L’objectif ? Mesurer la résistance des modèles de langage face aux tentatives de manipulation visant à obtenir des réponses potentiellement dangereuses.
Une vulnérabilité qui double après manipulation
Le constat est sans appel : lorsque des techniques de contournement sont appliquées, la proportion de réponses dangereuses passe de 11,08 % à 18,65 %. Cette hausse significative révèle une fragilité préoccupante des systèmes testés.
L’analyse a porté sur huit modèles d’IA à poids ouverts, soumis à 264 requêtes réparties en 11 catégories de risque distinctes. L’écart mesuré entre les performances normales et celles obtenues après tentatives de jailbreak atteint 7,57 points.
Qui sont les modèles passés au banc d’essai ?
La catégorie « Accessible »
Trois modèles de taille modérée ont été évalués dans cette première classe. On retrouve Gemma 3N E4B Instruct développé par Google, le LFM2-24B-A2B de Liquid AI, ainsi que le Qwen 2.5 7B Instruct Turbo conçu par Alibaba Cloud.
Les poids lourds de la catégorie « Large »
Cinq systèmes plus imposants composent cette seconde catégorie : DeepSeek-V4-Pro, Gemma 4 31B Instruct signé Google, GPT-OSS 120B d’OpenAI, Kimi K2.6 de Moonshot AI et MiniMax M2.7.
Ces modèles ont fait face à des méthodes de contournement documentées dans la littérature scientifique, permettant d’évaluer leur robustesse réelle face aux manipulations.
Des outils d’évaluation encore imparfaits
L’étude met en lumière les limites du système de jugement automatique. Ce dernier commet des erreurs dans les deux sens : 16,4 % des réponses véritablement dangereuses passent inaperçues, tandis que 37,9 % des réponses sûres sont incorrectement classées comme problématiques.
Un biais supplémentaire affecte les résultats : le modèle Qwen 2.5 7B a été utilisé pour générer certaines attaques et ajuster les paramètres du test. Cette double casquette fausse nécessairement l’écart mesuré pour ce système particulier.
Des résultats à interpréter avec prudence
MLCommons n’a pas publié de marge d’erreur accompagnant ses mesures. Cette absence rend délicate toute interprétation définitive des chiffres avancés. Les taux d’erreur de classification et les pourcentages globaux ne correspondent pas à un ensemble de données clairement identifié.
Les tests ont été menés directement par l’interface de requête, sans activation des filtres de sécurité additionnels que certains fournisseurs proposent. Cette approche vise à évaluer la protection intrinsèque des modèles eux-mêmes.
Une version 1.1 déjà dans les cartons
Face aux limites identifiées, MLCommons prépare activement l’amélioration de son protocole. La version 1.1 du benchmark intégrera une vérité terrain élargie, de nouvelles requêtes officielles fournies par AILuminate, ainsi qu’un système de jugement repensé.
L’organisation prévoit également d’étendre ses analyses aux modèles fermés accessibles uniquement par API. Cette évolution permettra d’évaluer les solutions commerciales de grande envergure, actuellement exclues du périmètre.
Conformité réglementaire européenne en ligne de mire
Ces travaux s’inscrivent dans le cadre du règlement européen sur l’intelligence artificielle. L’article 55 impose des obligations spécifiques aux fournisseurs de modèles à usage général présentant un risque systémique.
Les résultats diffèrent sensiblement de ceux de la version 0.5 du benchmark, en raison de modifications dans le panel de modèles, les requêtes utilisées, les techniques d’attaque et le système de notation. Cette évolution témoigne du caractère encore expérimental de ces protocoles d’évaluation.
Déposé sur la plateforme arXiv le 2 octobre 2026, ce travail n’apparaissait pas encore dans les mises à jour officielles du site MLCommons au 5 octobre de la même année. MLCommons, également à l’origine de MLPerf et AILuminate, s’impose progressivement comme une référence pour l’évaluation standardisée des systèmes d’intelligence artificielle.



Laisser un commentaire