AIエージェント
AI予算を「使いすぎ」ではなく「学びの有無」で管理する方法
高額なAI実験の可否を判断する基準は支出額の大小ではなく、「何を学べたか」を問う仕組みがあるかどうかにある。
原題
“Why You Should Burn More Tokens” (もっとトークンを使うべき理由)
原文からの引用
“A low token spend isn't necessarily a problem, but it should be a smoke signal, especially on the engineering team, to be like, "Maybe there's more we can be doing here.”
日本語訳 トークン消費量が少ないこと自体は問題ではないが、特にエンジニアリングチームにおいては「もっとできることがあるのではないか」と考えるきっかけとなる、一種の警告信号として捉えるべきだ。
要点
- Every CEO の Dan Shipper のトークン消費量は社内で突出しており、彼はこれを「もっと大胆な実験をすべきというシグナル」だと捉えている。
- Every は支出の上限を設けず、高額な実験を「コストは何か・何を得たか・何を学んだか」という3つの問いで事後評価する運用に切り替えた。
- 運用責任者の Arielle Shipper は、ChatGPT のクレジット自動補充額を500ドルに設定し、補充のたびに Slack 通知を受け取ることで異常な支出の急増を早期に検知している。
- 動画責任者の Randy Counsman は、上限のないオーケストレーター・実装担当・サブエージェントの3層構成で3Dモデル生成を試み、1日半で45億トークンを消費したが、結果は「かなり粗雑」だった。
- Randy はその後、実装担当層を廃止しサブエージェントを5体に制限、判定エージェントに参照画像を持たせる構成へ作り直し、少ないトークンでより良い結果を得られるようにした。
編集部の考察
(要点3)異常な支出を検知する仕組み(クレジット自動補充とSlack通知)そのものよりも重要なのは、支出が検知された「後」に何を問うかだ。Everyが定めた「コストは何か・何を得たか・何を学んだか」という3つの問いは、支出額の多寡ではなく、その実験が再現可能な知見を残したかどうかを判定基準に据えている。(要点4)のRandyの45億トークン事例は、この問いに答えられなかった典型例だ。オーケストレーターに「必要に応じてエージェントを増やしてよい」という無制限の権限を与えた結果、単純な進捗確認のためだけに層をまたいで文脈をやり取りするコストが積み上がり、1日半で消費が膨らんだ。(要点5)で示されたように、Randyが学びを得られたのは、失敗の原因(無制限な委譲層と進捗確認の重複)を突き止め、サブエージェント数の上限と判定エージェントによる客観的な合否基準を設計し直したからだ。自分の組織でAIエージェントの予算超過が起きた際、それを「無駄遣い」として次回から萎縮させるのか、それとも「コスト・成果・学び」の3点を記録させて構成の改善につなげるのかで、同じ失敗から得られる価値はまったく違う。経営として決めるべきは、AI支出の管理を単なる上限設定ではなく、実験ごとに学びを記録・継承させる仕組みとして設計するかどうかである。
本記事は海外記事の独自キュレーション・考察であり、原文の翻訳ではありません。引用部分の著作権は原著者に帰属します。