./research / token-efficient-agents
Réduire le coût en tokens des agents de longue durée.
Les agents brûlent l'essentiel de leurs tokens à relire du contexte déjà vu : mêmes instructions, mêmes faits d'entreprise, même historique, à chaque appel. Nous étudions jusqu'où le cache, la compression de contexte et la connaissance précompilée peuvent réduire le coût marginal d'une étape d'agent sans dégrader ses décisions.
La question
Un agent qui travaille toute la journée renvoie des centaines de fois un contexte quasi identique, et le paie plein tarif à chaque appel. Jusqu'où peut-on faire baisser le coût marginal en tokens d'une étape d'agent, par la discipline du cache de prompts, une compression agressive du contexte et une connaissance précompilée sous forme exécutable compacte, avant que la qualité des décisions ne se dégrade de façon mesurable ?
Pourquoi c'est important
La dépense en tokens fait la différence entre un agent moins cher que le travail qu'il remplace et un agent qui ne l'est pas. La plupart des déploiements échouent sur l'économie unitaire, pas sur la capacité. Si une étape qui coûte une lecture complète de contexte n'en coûte plus qu'une fraction, des catégories entières d'automatisation permanente cessent d'être un luxe.
Ce que nous faisons
Nous profilons où les charges réelles d'agents dépensent vraiment leurs tokens, puis nous attaquons les gros postes : structurer les prompts pour que le cache continue de toucher d'un tour à l'autre, compresser l'historique en un état auquel le modèle peut se fier plutôt qu'en transcriptions brutes, et compiler une fois la connaissance stable de l'entreprise en fichiers de compétences pour ne pas la réexpliquer à chaque appel. Chaque technique est notée de la même façon : tokens économisés par étape contre réussite de la tâche, avec des modes d'échec documentés aussi soigneusement que les gains.