./research / token-efficient-agents
長時間稼働エージェントのトークンコスト削減.
エージェントはトークンの大半を、すでに見たコンテキストの再読に費やします。同じ指示、同じ企業情報、同じ履歴を毎回送り直しているのです。キャッシュ、コンテキスト圧縮、事前コンパイルされた知識によって、判断品質を落とさずに1ステップあたりの限界コストをどこまで下げられるかを研究しています。
効率エージェントactive
問い
一日中働くエージェントは、ほぼ同一のコンテキストを何百回も送り直し、そのたびに満額を支払います。プロンプトキャッシュの規律、積極的なコンテキスト圧縮、コンパクトな実行形式に事前コンパイルされた知識によって、判断品質が測定可能なほど劣化する前に、エージェント1ステップの限界トークンコストをどこまで下げられるでしょうか。
なぜ重要か
トークン支出は、置き換える仕事より安いエージェントとそうでないエージェントの分かれ目です。多くの導入は能力ではなくユニットエコノミクスで失敗します。フルコンテキスト読み込み相当のコストをその何分の一かにできれば、常時稼働の自動化はぜいたく品ではなく当たり前の選択肢になります。
取り組んでいること
実際のエージェントワークロードがどこでトークンを消費しているかをプロファイリングし、大きな項目から攻めています。ターンをまたいでキャッシュが当たり続けるようプロンプトを構造化する、生のトランスクリプトではなくモデルが信頼できる状態へ履歴を圧縮する、安定した企業知識を一度だけスキルファイルにコンパイルして毎回説明し直さない。各手法は同じ基準で採点します:タスク成功率に対する1ステップあたりの節約トークン。失敗モードも成功と同じだけ丁寧に記録します。