AI の評価基準(eval)はどう作ればいいのか ― トップダウン評価とボトムアップ評価を組み合わせる5ステップ
AI モデルの進化に伴い、AI システムの正確な評価方法そのものが一変し、過去の評価アプローチが通用しなくなっている
海外AIニュースレターの定点観測と経営考察
2026年9月19日(土) 更新
AI モデルの進化に伴い、AI システムの正確な評価方法そのものが一変し、過去の評価アプローチが通用しなくなっている
GLM 5.3やKimi K3といったオープンソースモデルが、コーディングやエージェント領域でClaudeと同等の実用能力を獲得。[Fireworks](https://fireworks.ai/)は日次40Tトークン処理(3月時点の[OpenAI](https://openai…
Copilot Studio はマルチエージェント・ワークフロー構築で優れた設計(小さくスコープを絞った各エージェントが相互に呼び出せる)を実現し、ビジネスプロセスの自動化に高い信頼性をもたらす
元記事は、[Claude Code](https://www.anthropic.com/claude-code) に接続した [Slack](https://slack.com) ボット「Luo Ji」により、チャンネル=プロジェクト、スレッド=タスクという構造でエージェント作…
Dianne Pennは[Anthropic](https://www.anthropic.com)で製品責任者として、Claude 2からFableまで全モデルの企画・開発に貢献してきた
エージェントが一晩でコードを書き、朝には緑のPRが積まれている時代。残る人間の仕事は「これは本当に良いか」を判断し、さらに押し上げることだと著者は主張する
[Anthropic](https://www.anthropic.com/) は 2026年6月1日に IPO の機密申請を実施。SemiAnalysis の独自試算(Tokenomics Model)によれば、2026年Q3の利益は10億ドルを超えると見込まれる
Colin Matthewsは、PMとAIの関わり方を「個人生産性」「プロダクト開発」「システム化」の3つのはしご(ladder)に整理し、各はしごに3段階の習熟度を定義している
[Meta](https://about.meta.com/)や[Uber](https://www.uber.com/)の「トークン爆消費」報道は実態より誇張されており、悪いインセンティブ設計と管理の甘さが原因。大多数の企業では同様の事態は起きていない
[OpenAI](https://openai.com/)がGPT-5.6 Solを公開したが、米政府指令によりアクセスは約20社に限定。Dan Shipperは「野心ある個人や独立開発者が排除される世界は競争力の毀損だ」と批判した