Lorsqu’elles évaluent des agents IA, les organisations comparent généralement les grands modèles de langage (LLM).
Cependant, de nouvelles recherches de Lasso suggèrent qu’un autre composant mérite la même attention : le harness de l’agent.
Dans leur étude comparant le Claude Agent SDK d’Anthropic au framework open source deepagents, basé sur LangGraph, les chercheurs ont maintenu constants le modèle, le prompt, les outils et les cibles d’attaque, en ne modifiant que l’environnement d’exécution.
Les résultats ont montré qu’un même modèle pouvait se comporter très différemment selon le harness qui gérait son exécution.
À retenir
- Les harness d’agents IA peuvent influencer les performances en sécurité offensive avec le même modèle sous-jacent.
- L’architecture d’exécution a influencé les taux de réussite des attaques, la fiabilité et l’exécution des outils avec plusieurs LLM de pointe.
- Les benchmarks d’IA peuvent mesurer les performances combinées du modèle et du harness plutôt que celles du modèle seul.
- Les chercheurs ont constaté que les agents IA autonomes classaient fréquemment à tort les attaques échouées comme réussies, soulignant la nécessité d’une validation indépendante.
- Le choix du bon harness devient aussi important que celui du LLM sous-jacent pour les déploiements en entreprise.
Les harness peuvent influencer la réussite des attaques
Un agent IA ne se résume pas à un LLM.
Selon les chercheurs, un agent comprend également son prompt, les outils disponibles et le harness chargé d’orchestrer l’exécution.
Ce harness gère le contexte, les appels aux outils, la mémoire, la planification et les boucles d’exécution, façonnant ainsi le comportement du modèle tout au long d’une tâche en plusieurs étapes.
Pour mesurer l’impact du harness, les chercheurs ont testé cinq modèles de pointe dans 20 scénarios d’attaque couvrant la finance, la santé, le droit, le support client et l’éducation.
Les modèles ont tenté d’extraire des prompts, de divulguer des informations sensibles et de générer des contenus dangereux contre des applications simulées.
Sur 1 000 attaques autonomes, les taux de réussite moyens semblaient relativement proches entre les deux harness.
Cependant, ces moyennes masquaient d’importantes différences au niveau de chaque modèle.
Dans de nombreux cas, un harness a mené à bien des attaques que l’autre n’a pas réussi à exécuter, malgré l’utilisation du même modèle sous-jacent.
Les performances variaient fortement selon les modèles
L’étude a révélé que le choix du harness comptait bien davantage pour certains modèles que pour d’autres.
Claude Sonnet 5 a affiché des taux de réussite des attaques presque identiques quel que soit le harness, ce qui suggère que l’environnement d’exécution influençait peu son comportement.
DeepSeek-V4-Pro a obtenu une réussite globale similaire avec les deux frameworks, mais chaque harness s’est montré meilleur dans différentes catégories d’attaques.
L’un s’est révélé nettement plus performant pour l’extraction du prompt système, tandis que l’autre a généré de meilleurs taux de réussite pour les attaques visant à produire des contenus dangereux.
Le résultat le plus spectaculaire concernait Kimi-K2.6.
Avec le Claude Agent SDK, le modèle a atteint un taux de réussite des attaques d’environ 1 %.
Avec deepagents, ce chiffre est passé à environ 24 %, sans changer le modèle, le prompt ou les outils.
Les chercheurs ont attribué cette différence à la traduction du protocole entre le harness et le modèle, qui interrompait l’exécution des outils et mettait prématurément fin à de nombreuses séquences d’attaque.
Pourquoi les harness influencent les évaluations de la sécurité de l’IA
Ces résultats ont des implications qui dépassent le cadre des tests de sécurité offensive.
Les organisations évaluent de plus en plus les modèles d’IA au moyen de benchmarks pour mesurer leurs capacités autonomes, mais l’étude suggère que ces benchmarks mesurent souvent la combinaison du modèle et du harness plutôt que le modèle seul.
Les différents harness conditionnent les prompts de manière différente, structurent différemment les descriptions des outils et gèrent les boucles d’exécution de façon distincte, ce qui peut influencer à la fois les capacités et la fiabilité.
Les chercheurs ont également constaté que laisser les agents autonomes évaluer leurs propres performances produisait des résultats trompeurs.
Plus de la moitié des attaques que les agents avaient qualifiées de réussies ont ensuite été considérées comme des échecs par un processus d’évaluation indépendant, ce qui suggère que les organisations devraient s’appuyer sur une validation externe pour évaluer les performances des agents.
Le choix du bon harness dépend de la charge de travail
L’étude ne conclut pas qu’un harness est universellement supérieur.
Le Claude Agent SDK a démontré des avantages en termes de coûts avec les modèles Anthropic grâce à son intégration native et à la mise en cache des prompts, tandis que deepagents offrait une plus grande flexibilité avec plusieurs fournisseurs de modèles.
Les chercheurs ont souligné que les organisations devraient évaluer le harness en même temps que le modèle, plutôt que de supposer que les environnements d’exécution sont interchangeables.
Pour les entreprises qui déploient des agents IA ou mènent de façon autonome du red teaming, cette étude suggère que l’architecture d’exécution peut avoir un effet significatif à la fois sur les résultats des tests de sécurité et sur les performances opérationnelles.
À mesure que les agents IA gagnent en capacités, le choix du bon harness pourrait se révéler tout aussi important que celui du modèle sous-jacent lui-même.
Ces résultats confirment que le déploiement d’agents IA n’est plus seulement une décision technique : c’est aussi un défi de gouvernance

