モデル動向
AI モデル選定はベンチマークスコアで決めていいのか ― 実業務で測るオフライン評価(offline evals)の作り方
公開ベンチマークのスコアは、自分の組織の業務で AI がどれだけ使えるかを教えてくれない。年間1億ドル規模の AI 支出でも評価基盤を持たない企業の実態と、実業務から評価を作る手順を見る。
原題
“Benchmarks Don't Know Your Job” (ベンチマークはあなたの仕事を知らない)
原文からの引用
“Public benchmarks can tell you that one model is generally more capable than another. They can't tell you whether it caught the clause your lawyers care about, preserved your house style, or spared an employee another round of checking.”
日本語訳 公開ベンチマークは、あるモデルが別のモデルより総じて高い能力を持つことは教えてくれる。しかし、弁護士が気にする条項を拾えたか、その組織のハウススタイルを守れたか、従業員をもう一巡のチェック作業から解放できたかまでは教えてくれない。
要点
- 年間1億ドル規模で AI に支出しながら、「オフライン評価(offline evals)」——実業務のタスク集で本番前にモデルを比較するテスト——を持たない企業が少なくないと Mercor CEO の Brendan Foody が指摘。Box CEO の Aaron Levie も「企業は雰囲気(vibes)だけでは進めない」と応じた
- 公開ベンチマークはモデルの一般的な能力差は示せても、「弁護士が気にする条項を拾えたか」「自分の組織のハウススタイルを守れたか」は測れない。有効な評価は自分の組織の実業務——代表的なケース、既知の失敗パターン、人間が直す残作業の量——から作る
- モデルの選択肢は急増中である。Vercel の Guillermo Rauch のデータではオープンソースモデルのトークンシェアが2カ月で28%から62%に拡大し、a16z によれば法務職の Codex 利用は2月比108倍。「最高スコアのモデルを選ぶ」だけでは購買戦略にならない
- Every は編集長 Kate Lee の過去約3万件の編集履歴で訓練した AI コピーエディタ「KateBench」を構築。提案の受諾率は85〜90%だが、提案数の上限による打ち切りや実行ごとのばらつきがあり、この数字だけでは改善を判断できない
- a16z の Olivia Moore の「知能の限界効用は逓減した」という見方に対し、Every は「測定が追いついていないだけかもしれない」と反論。人間に残る残作業(residual work)を捕捉する評価がない限り、進歩が鈍ったのか測定が漏れているのかは区別できない
編集部の考察
自分の組織の ROI 報告は、「AI 出力後に人間が直した量」を計測項目に含み、複数回の実行で再現するか——この検証に耐えない導入効果レポートは作り直しになる。KateBench の受諾率85〜90%という一見完成に近い数字が、提案上限40件での打ち切りと実行ごとのばらつきで信頼できなかった(要点4)——この具体例は、AI 全社導入済みの組織が経営会議で見ている「利用率」「満足度」ダッシュボードにそのまま跳ね返る。単発のスコアはプロンプト変更の当たり外れでも動くため、KateBench のオーナーは同一バージョンを複数回実行してから改善と呼ぶ運用に切り替えた。まず1つの定型業務(週次レポートや提案書作成など)について、現行モデルの失敗パターン5つとゴールドスタンダード例を書き出すことが、リーダーボード比較より先にやるべき投資判断の準備になる。
本記事は海外記事の独自キュレーション・考察であり、原文の翻訳ではありません。引用部分の著作権は原著者に帰属します。