海外AIニュースレターの定点観測と経営考察

2026年9月19日(土) 更新

AIエージェント

オープンソース LLM はクローズドモデルにいつ追いつくのか ― 追従期間が世代ごとに半減する SemiAnalysis の時代区分

GLM や Kimi などのオープンモデルがフロンティアモデルに追いつくまでの期間は、18ヶ月→8.5ヶ月→4.8-6ヶ月と世代ごとに半減している。モデル選定そのものより運用層への投資が競争優位を左右する理由を、SemiAnalysis の分析から読む。

元記事 SemiAnalysis ─ 2026-08-22

原題

“Are Open Models Catching Up?” (オープンモデルの追従スピード加速論)

原文からの引用

“with each generation, open-source models take half as long to catch up to the first closed-source model of the era." "Kimi K2.6 surpassed Opus 4.5 with a score of 56.3 in 4.8 months, and GLM-5.2 cleared GPT-5.2 with a score of 72.4 in 6 months.”

日本語訳 世代を追うごとに、オープンソースモデルがその時代最初のクローズドソースモデルに追いつくまでの期間は半分になっている。 Kimi K2.6 は 4.8 ヶ月でスコア 56.3 を記録して Opus 4.5 を上回り、GLM-5.2 は 6 ヶ月でスコア 72.4 を出して GPT-5.2 を超えた。

要点

  1. GLM 5.3やKimi K3といったオープンソースモデルが、コーディングやエージェント領域でClaudeと同等の実用能力を獲得。Fireworksは日次40Tトークン処理(3月時点のOpenAI API比で2倍)
  2. SemiAnalysisの分析によれば、LLM史には3つの時代(早期スケーリング→推論→エージェント)があり、各時代の開始時にクローズドソースのラボが一歩先に進む。しかしオープンモデルが追いつく時間は毎世代で半減している
  3. Era 1(2022-2024):Llama-2がGPT-3.5に追いつくまで約18ヶ月。Era 2(2024-2025):DeepSeek R1がo1に追いつくまで8.5ヶ月。Era 3(2025-今):Kimi K2.6/GLM-5.2がOpus 4.5/GPT-5.2に追いつくまで4.8-6ヶ月
  4. SemiAnalysisは、支配的なベンチマーク指標は時代ごとに入れ替わるため、モデルの進歩を単一の連続トレンドで測定することは誤りだと指摘する
  5. 実際の使用体験では、ベンチマークスコア最高のモデルが最良の選択肢とは限らない。Anthropicはベンチマーク競争を避け、代わりにClaude Codeのようなハーネス統合度を優先してARRを $65B+ に拡大

編集部の考察

問うべきは「どのモデル API を使うか」ではなく、「モデルを乗り換えても損なわれない資産を自分の組織の運用層にどれだけ積んでいるか」である。そう言い切れる根拠が、SemiAnalysis自身が「Kimi K3の方がベンチマークスコアは高いのに、日常業務ではFable 5(Claude)を使い続けている」と明言している一点だ。理由はモデル単体の賢さではなく、Claude CodeやClaude Tagといったハーネス(モデル+運用環境)の完成度にある(要点5)。加えてFireworksが日次40Tトークン(3月時点のOpenAI API比2倍)を処理し、オープンモデルへの追従は世代ごとに半減(18ヶ月→8.5ヶ月→4.8-6ヶ月)という事実は、モデル単体の性能差が数ヶ月で埋まる時代に入ったことを示す。

これを自分の組織に置き換えると、プロンプト設計・評価基盤・エージェントのワークフロー統合をベンダー固有のAPIに密結合させたまま構築していないか、契約更改や予算配分の前に棚卸しする必要がある。モデルのコモディティ化が進むほど、競争優位の源泉は調達判断そのものではなく、モデルを差し替え可能な形で活用し続けられる社内ハーネスへの投資に移る。

オープンソースモデルモデル収束スピードベンチマーク評価エージェントClaude CodeAnthropicフロンティアラボ時代論

本記事は海外記事の独自キュレーション・考察であり、原文の翻訳ではありません。引用部分の著作権は原著者に帰属します。