AI モデル選定はベンチマークスコアで決めていいのか ― 実業務で測るオフライン評価(offline evals)の作り方
年間1億ドル規模で AI に支出しながら、「オフライン評価(offline evals)」——実業務のタスク集で本番前にモデルを比較するテスト——を持たない企業が少なくないと [Mercor](https://mercor.com/) CEO の Brendan Foody が指…
海外AIニュースレターの定点観測と経営考察
2026年9月19日(土) 更新
年間1億ドル規模で AI に支出しながら、「オフライン評価(offline evals)」——実業務のタスク集で本番前にモデルを比較するテスト——を持たない企業が少なくないと [Mercor](https://mercor.com/) CEO の Brendan Foody が指…
GLM 5.3やKimi K3といったオープンソースモデルが、コーディングやエージェント領域でClaudeと同等の実用能力を獲得。[Fireworks](https://fireworks.ai/)は日次40Tトークン処理(3月時点の[OpenAI](https://openai…