./research / token-efficient-agents
降低长时运行智能体的 Token 成本.
智能体把大部分 token 花在重复读取早已见过的上下文上:同样的指令、同样的公司事实、同样的历史,每次调用都要重来一遍。我们正在研究缓存、上下文压缩与预编译知识能把单步边际成本压到多低,而不损害其决策质量。
效率智能体active
问题
一个全天工作的智能体,会把几乎相同的上下文重复发送数百次,并且每次都按全价付费。通过提示缓存的纪律、激进的上下文压缩,以及把知识预编译成紧凑的可执行形态,智能体单步的边际 token 成本究竟能降到多低,而决策质量还不会出现可测量的退化?
为何重要
Token 支出决定了一个智能体究竟比它所替代的工作更便宜,还是更贵。多数部署失败于单位经济模型,而非能力。如果一个原本需要完整读取上下文的步骤只需付出其中一小部分成本,那么整类「常驻运行」的自动化就不再是奢侈品,而会成为理所当然的选择。
我们在做什么
我们先剖析真实智能体负载究竟把 token 花在哪里,然后针对最大的几项下手:重构提示结构,让缓存在多轮之间持续命中;把历史压缩成模型可以信任的状态,而非原始逐字记录;把稳定的公司知识一次性编译成技能文件,避免每次调用都重新解释一遍。每种技术都用同一把尺子衡量:单步节省的 token 对比任务成功率,并且把失败模式记录得和成果一样仔细。