Argus Wake Insights
Claude と GPT、業務での使い分けをどう決めるか
要旨
- 結論
- Claude と GPT は優劣を判定して一方を選ぶものではない。業務ごとのゴール定義・環境の複雑度・出力の受け手という3軸で役割を割り当て、同じハーネス内で組み合わせて使うのが実務上の到達点である。
- 根拠
- Every社はFableをCEO、Opus 5をシニアエンジニアと役割分担させ、GPT-5.6 Solも同じハーネス内で併用している。Arkadiumではゴールを定義し直した結果、最適解は460万パラメータの専用モデルで、コストは年間約60ドルとLLMなら数百万ドル規模との4〜5桁の差が出た。
- 決めること
- 全社のAI予算とモデル選定を「利用量ベース」から「業務ごとのゴール定義と受け手の可読性要件に基づく割り当てベース」へ見直すか。
なぜ「どちらが優秀か」を比べても決められないのか
Claude と GPT のどちらが優秀かを比較する記事は数多い。だが実務でモデルを日常的に使い分けているマネージャーが直面しているのは、優劣の判定ではなく「Claude GPT 使い分け 業務」という、もっと解像度の高い割り当て問題だ。ベンチマークスコアが上位の汎用モデルを全社契約すれば全ユースケースをカバーできる、という調達前提はすでに崩れている。AI の ROI はどう測るか——LLM より4桁安い専用モデルが最適解だった Arkadium の事例で紹介されているゲーム会社 Arkadium の事例が象徴的だ。数学で新発見をするフロンティアモデルが、カジュアルプレイヤー相手のジン・ラミーでは9割負けた。ゴールを定義し直した結果、最適解はLLMではなく460万パラメータ・18MBの専用モデルであり、コストは年間約60ドル(100万リクエスト/日)、LLMなら数百万ドル規模の差だったという。この4〜5桁のコスト差は、モデル選定を「どちらが賢いか」ではなく「この業務のゴールは何で、それを測るデータは何か」という設計問題に引き戻す。
海外の実務家はどんな基準で使い分けているか
複数AIモデルの使い分けをどう設計するか——「Fable=CEO」の組織図とエージェント出力が人間に読めなくなる問題によれば、Every のエンジニアはAnthropicのモデル群を組織図に見立てて運用している。Fableが CEO、Opus 5 がシニアエンジニア、Sonnet 5 がジュニア/アナリストという役割分担だ。高額な汎用モデル一本足ではなく、役割特化モデルが一つのハーネス内で協働する「混合モデル構造」への移行が進んでいる。社内の「今週使っているモデル」一覧では、Fable・Opus 5/4.8 に加えて GPT-5.6 Sol も併用されており、オーケストレーターには高負荷モデル、日常タスクには中負荷モデルという具合に、Claude と GPT を同じハーネス内でタスクの重さ別に混在させる運用が定着しているという。つまり Claude か GPT かという択一ではなく、両者を役割ごとに組み合わせるのが実務上の到達点になっている。
一方でモデル自体の特性も、単純な「新しい方が強い」では割り切れない。Claude Opus 5 は業務導入に値するか——プロンプト資産を積み上げた環境ほど性能が落ちる評価結果では、Opus 5 は複雑なシステムプロンプト・スキル・プラグインを積み上げた環境ほど性能が落ち、逆にシンプルな環境ではバグ対応に何時間も粘り、緻密な文章まで書き上げる水準まで能力が跳ね上がったと報告されている。同記事は、Fable や GPT-5.6 Sol と比べると Opus 5 の導入価値は限定的で、既存ワークフローの再構築コストに見合うかは不透明だとも評している。つまり同じ「高性能モデル」でも、周辺のワークフロー設計と比較対象次第で採用の是非が変わる。モデル選定は単体の性能比較ではなく、「そのモデルをどんな複雑度の環境に置き、どの代替モデルと比べるか」というセット設計の問題だということになる。
業務ごとの割り当てをどう決めるか ― 3つの判断軸
ここまでの事実を、自分の組織の業務に当てはめて整理する。判断軸は3つある。
第一に、ゴールが定量的に定義できるかどうか。Arkadium のように「勝率」のような明確な指標がある業務は、フロンティアモデルへの一括支出ではなく、専用・小型モデルへの置き換えを検討する価値が高い。逆にゴールが曖昧な探索的タスク(戦略立案、文章の推敲)は、汎用性の高いモデルに任せた方がコスト効率が良い。
第二に、環境の複雑度をどこまで許容できるか。既存のプロンプト・スキル・プラグインを大量に積み上げた運用では、次世代モデルへの切り替えで期待した恩恵を得にくい。モデルを更新するたびに、既存の環境構成を「今のモデルに最適な複雑度か」で棚卸しする工程が必要になる。
第三に、出力が誰向けかという受け手の設計。Every の事例では、サブエージェントの分析レポートが専門用語だらけの「gibberish(意味不明)」になり、人間向けに翻訳し直す専用スキルが別途必要になったという。オーケストレーター配下のモデルに調査や分析を任せている業務では、最終報告がそのまま経営層に読めるかを事前にチェックする担当と頻度を、業務設計の段階で決めておく必要がある。
この3軸で自分の組織の主要業務を棚卸しすると、「ゴール定義済み・低複雑度・人間が直接読む」業務と、「探索的・高複雑度・エージェント間でのみやり取りされる」業務とでは、割り当てるべきモデルも運用設計も別物になることが見えてくる。前者は専用モデルやコスト効率の良いモデルへの置き換え候補であり、後者は混合モデル構造でのオーケストレーション対象として設計すべき領域だ。
まとめ:使い分けは一度決めて終わりではない
経営として次に決めるべきことは一つに絞れる。全社のAI予算とモデル選定を「利用量ベース」ではなく「業務ごとのゴール定義と受け手の可読性要件に基づく割り当てベース」で見直すことだ。Arkadium の事例が示すように、ゴールを定義しないままフロンティアモデルに一括支出することは「測れないから最強を買う」という保険料になりがちで、専用モデルで数桁安く達成できる業務を見分けられなくなる。同時に、モデル更新のたびに既存のプロンプト・スキル構成の複雑度を棚卸しし、エージェント出力を人間が読める形に整える担保工程を業務フローに組み込む必要がある。Claude と GPT のどちらが優秀かという議論に時間を使うより、両者をどう組み合わせるかという割り当て基準を自分の組織の業務マトリクスに落とし込む方が、実務上のリターンは大きい。
この論考への質問
Claude と GPT はどちらを業務に使うべきか?
択一で選ぶ問題ではない。Every社はAnthropicのモデル群を組織図に見立てて役割分担させつつ、GPT-5.6 Solも同じハーネス内で併用しており、タスクの重さや役割ごとに両者を組み合わせるのが実務上の到達点になっている。
業務でのモデル選定は何を基準にすればよいか?
判断軸は3つある。ゴールが定量的に定義できるか、既存のプロンプト・スキル構成の複雑度をどこまで許容できるか、出力を誰が読むかという受け手の設計だ。この3軸で主要業務を棚卸しすると、割り当てるべきモデルと運用設計が業務ごとに別物になることが見えてくる。
最上位のフロンティアモデルを全社契約すれば十分ではないか?
その調達前提はすでに崩れている。Arkadiumの事例では、数学で新発見をするフロンティアモデルがカジュアルプレイヤー相手のジン・ラミーで9割負け、ゴールを定義し直すと460万パラメータ・18MBの専用モデルが最適解となり、コスト差は4〜5桁に及んだ。