Sous le capot
C'est quoi un harnais ?
Un modèle tout seul produit du texte, et rien d'autre. Ce qui enchaîne les étapes, se sert des outils, retient et empêche, c'est une couche qu'on ne voit jamais parce qu'elle est autour. Voilà ce qu'il y a dedans.
Le mot s'est imposé courant 2026, en anglais d'abord (agent harness), et il est arrivé en français sans traduction. Il désigne quelque chose que tout le monde utilisait déjà sans le nommer, et c'est justement pour ça qu'il valait la peine d'être nommé.
1. Un modèle seul ne fait rien
Prends un modèle brut, sans rien autour. Tu lui envoies du texte, il te renvoie du texte. C'est tout ce qu'il sait faire, et c'est tout ce qu'il fera jamais.
Il n'ouvre pas ton fichier. Il n'envoie pas ton mail. Il n'enchaîne pas deux étapes, parce qu'entre deux appels il ne se passe rien : il ne tourne pas en fond, il n'attend pas, il n'existe pas. Il ne retient rien non plus. Chaque appel repart de zéro, avec pour seule mémoire ce que tu as remis dans le message.
Donc quand ton IA va chercher un mail, écrit un fichier, revient te dire ce qu'elle a trouvé et enchaîne sur la suite, rien de tout ça ne vient d'elle. Ça vient du programme qui l'entoure, qui lit ce qu'elle demande, qui le fait à sa place, et qui lui remet le résultat pour qu'elle continue.
Ce programme, c'est le harnais.
La règle de langue que je tiens dans tout l'article, parce qu'elle évite un flou permanent sur le sujet : le harnais, c'est « il ». L'IA, c'est « elle ». Il la fait réfléchir, il la démultiplie, il l'empêche. Dès qu'on emploie le même pronom pour les deux, on ne sait plus qui fait quoi, et c'est la principale raison pour laquelle cette couche reste floue même chez les gens qui l'utilisent tous les jours.
2. Le cœur, c'est une boucle
Tout le reste s'accroche là-dessus. Le harnais fait tourner une boucle, et cette boucle a cinq temps.
- Il appelle le modèle avec l'état actuel : ta demande, les instructions, ce qui s'est déjà passé, la liste des actions disponibles.
- Il lit ce que le modèle répond. Soit c'est une réponse pour toi, soit c'est une action à déclencher.
- Si c'est une action, il l'exécute lui-même. Le modèle ne touche à rien, il demande.
- Il réinjecte le résultat et rappelle le modèle.
- Il décide quand ça s'arrête.
Le cinquième point est le moins spectaculaire et le plus important. Sans lui, une IA qui se trompe tourne en rond indéfiniment, à relancer la même action ratée. Détecter la boucle morte, compter les tours, savoir renoncer : ce n'est pas de l'intelligence, c'est du code ordinaire, et c'est ce qui fait la différence entre une démo et quelque chose que tu peux laisser tourner.
3. L'inventaire
Autour de la boucle, il y a une petite dizaine de pièces. Aucune n'est mystérieuse prise séparément. C'est leur assemblage qui est un métier.
- La boucle
- Appeler, lire, exécuter, réinjecter, et savoir s'arrêter. Le reste s'accroche dessus.
- Les outils
- La liste des actions autorisées, avec leur mode d'emploi. C'est ce que le modèle voit, et il ne voit rien d'autre.
- Le contexte
- Ce qui est chargé avant de répondre : instructions, fichiers, historique. Et surtout ce qui ne l'est pas.
- La compaction
- Une session longue déborde. Il faut résumer ce qui précède sans perdre ce qui compte. C'est le geste le plus délicat du lot.
- La mémoire
- Ce qui survit à la fin de la session, et où ça va. Sans elle, chaque matin repart à zéro.
- Le bac à sable
- L'espace isolé dans lequel les actions s'exécutent, pour qu'une erreur ne sorte pas de son périmètre.
- Les garde-fous
- Les permissions et les paliers de validation. Ce qui passe seul, ce qui demande un humain.
- La trace
- Le journal de ce qui a été fait. C'est ce qui permet de comprendre après coup, et sans ça tu ne débogues rien.
Regarde cette liste et remarque ce qui n'y est pas : l'intelligence. Aucune de ces pièces ne rend le modèle plus malin. Elles décident de ce qu'il voit, de ce qu'il peut, de ce qu'il garde et de ce qu'on lui refuse. Et c'est ce qui produit l'écart de résultat.
4. Le tien, ou le leur
C'est la distinction la plus utile du sujet, et on la doit à Birgitta Böckeler, de Thoughtworks. Il y a le harnais interne, celui que l'éditeur du modèle livre avec son produit. Et le harnais externe, celui que tu montes par-dessus.
Tu as déjà les deux, même si tu n'as jamais employé le mot. ChatGPT a un harnais. Claude a un harnais. C'est ce qui fait qu'ils enchaînent des étapes, se servent d'un connecteur et retiennent des choses sur toi entre deux conversations. La question n'a jamais été d'en avoir un.
La question, c'est à qui il appartient. Dans le harnais interne, tu ne choisis pas ce qu'il retient, ni ce qu'il range, ni ce qu'il s'autorise. Ces décisions sont prises pour toi, par quelqu'un qui construit un produit pour des millions de gens et pas un poste de travail pour ta boîte. Elles sont souvent bonnes en moyenne, et c'est bien le problème : ton activité n'est pas la moyenne.
Böckeler ajoute une seconde coupe, dans ce que le harnais fait au modèle : il y a ce qui l'oriente avant qu'elle agisse, et ce qui vérifie après. La deuxième moitié est celle que tout le monde oublie. Une IA qui produit puis contrôle son propre travail avant de te le rendre te fait gagner beaucoup plus qu'une IA qu'on a mieux briefée au départ.
5. Ce que ça pèse, en chiffres
Deux résultats publics de 2026, et ils vont dans le même sens.
LangChain a gardé le même modèle et n'a retravaillé que le harnais. Sur Terminal Bench 2.0, un classement public d'agents de code, leur agent passe de 52,8 % à 66,5 % de réussite, ce qui le fait sortir du top 30 pour entrer dans le top 5. Le modèle n'a pas bougé d'une ligne pendant toute l'expérience. Les trois leviers touchés sont les instructions, les outils, et le code intercalé dans la boucle.
Vercel a fait l'inverse de ce que le réflexe commande. Leur agent qui écrit des requêtes de base de données avait dix-huit outils spécialisés, des instructions travaillées, une gestion du contexte soignée, et plafonnait à 80 % de réussite. Ils ont supprimé 80 % des outils pour ne garder qu'un accès direct dans un espace isolé. Résultat : 100 % de réussite, 3,5 fois plus rapide, 37 % de jetons en moins et 42 % d'étapes en moins.
Le second résultat mérite qu'on s'y arrête, parce qu'il renverse une intuition solide. On croit qu'ajouter des capacités améliore un agent. En pratique, chaque outil disponible occupe de la place et brouille le choix : entre trois actions, elle vise juste, entre quarante dont huit qui se ressemblent, elle se trompe de porte. C'est la même mécanique que celle qui rend une IA moins bonne quand on lui branche tout, et la même que celle qui fait dérailler une conversation trop longue. Ce qui n'est pas trié se dégrade, à tous les étages.
6. Le contre-exemple qui confirme la règle
Si le harnais comptait par le nombre de fonctionnalités, le meilleur serait le plus fourni. C'est faux, et il existe un objet qui le démontre proprement.
Pi, de Mario Zechner, est un agent de code minimal construit sur une thèse d'une ligne : quatre outils suffisent, lire, écrire, modifier, exécuter, avec des instructions de moins de mille mots. Et il laisse volontairement de côté ce que les autres intègrent d'office, à commencer par les connecteurs, les sous-agents et le mode plan.
Ce n'est pas un renoncement, c'est un arbitrage. Ces pièces existent, elles se rajoutent quand on en a besoin, mais elles ne sont pas là par défaut à consommer de la place et de l'attention. C'est un outil de développeur, tu n'as aucune raison de t'en servir. Ce qu'il faut en retenir tient en une phrase : un bon harnais n'est pas celui qui a le plus de pièces, c'est celui dont chaque pièce sert à ce que tu fais.
7. Pourquoi l'autonomie ne viendra pas du modèle
L'attente la plus répandue, c'est qu'un modèle plus intelligent finisse par donner un assistant autonome. Ça n'arrivera pas, et pas parce que les modèles plafonnent : parce que ce n'est pas là que se joue l'autonomie.
Un modèle décide. Il ne se souvient pas, ne s'exécute pas, ne se surveille pas, ne se retient pas. Tout ce qui rend un système autonome vit dans la couche autour. Un meilleur modèle rend un bon harnais meilleur, et il ne répare aucun harnais absent.
C'est aussi ce qui explique la seule chose qui compte à long terme sur ce sujet. Un fil de discussion se dégrade parce que rien ne trie. Un système s'améliore parce que quelque chose trie. Ce quelque chose n'est jamais le modèle : c'est un bout de harnais qui, à la fin de chaque session, décide que la décision part dans le dossier des décisions, le fait nouveau dans le fichier du client, et le reste à la poubelle. Un système qui dépendrait de ta rigueur de rangement serait mort au bout de trois semaines. Tu donnes la méthode de tri une fois, il l'applique à chaque fois.
Ce qu'il faut retenir
- La formule
- Un agent, c'est un modèle plus un harnais. Le modèle décide, le harnais fait.
- La boucle
- Appeler, lire, exécuter, réinjecter, et savoir s'arrêter. Savoir s'arrêter est la partie difficile.
- La propriété
- Tu en as déjà un, c'est celui de ton éditeur. La question est de savoir qui décide de ce qu'il retient et de ce qu'il s'autorise.
- La preuve
- Même modèle, harnais retravaillé : du top 30 au top 5. Retirer 80 % des outils : de 80 % à 100 % de réussite.
- La règle
- Un bon harnais n'est pas le plus fourni. C'est celui dont chaque pièce sert à ce que tu fais.
- La conséquence
- L'autonomie ne vient pas du modèle. Elle se construit autour.
Reste une question que cet article ne traite pas, et qui est la seule qui coûte de l'argent : monter le sien. Ce n'est pas magique, c'est de la plomberie, mais c'est de la plomberie qui se conçoit à partir de ta façon de travailler. Ce qui passe seul chez moi ne passe pas seul chez toi, et c'est très bien.
Le premier geste, lui, ne coûte rien et tient sur une feuille. Deux colonnes. À gauche, ce que ton IA peut faire seule sans que ça t'inquiète : chercher, lire, résumer, préparer un brouillon. À droite, ce qui ne part jamais sans toi : envoyer, payer, supprimer, publier. Cette feuille, c'est déjà la première pièce de ton harnais.
Sources
- Agent harness, Wikipedia
- Harness engineering, first thoughts, Birgitta Böckeler et Martin Fowler
- Improving Deep Agents with harness engineering, LangChain
- We removed 80% of our agent's tools, Vercel
- Pi Coding Agent, Mario Zechner