複雑なアプリ開発で Fable 5.1 に劣る、GPT-6 Astra の意外な弱点
OpenAI が GPT-6 Astra をリリースした。数週間の事前告知で数学能力と高度なサイバーセキュリティ機能を強調していた。
海外AIニュースレターの定点観測と経営考察
2026年9月19日(土) 更新
フロンティアモデルの評価・選定・使い分け。ベンチマークの先にある実務性能。
OpenAI が GPT-6 Astra をリリースした。数週間の事前告知で数学能力と高度なサイバーセキュリティ機能を強調していた。
年間1億ドル規模で AI に支出しながら、「オフライン評価(offline evals)」——実業務のタスク集で本番前にモデルを比較するテスト——を持たない企業が少なくないと [Mercor](https://mercor.com/) CEO の Brendan Foody が指…
Deft は AI ライティングの「単調さ」を解決することを目指す新しいモデルで、句や文の繰り返しパターンをバッチ単位で制御する「配分ファインチューニング」という手法を採用
[SpaceX](https://www.spacex.com) は 2027 年に 6-8GW の追加容量、ポテンシャルで 10GW+ の AI コンピュート施設を建設予定。capex は $300-500B で、[AWS](https://aws.amazon.com)・[G…
木工の「ジグ」(複雑な作業を簡単・正確にする補助ツール)という概念が AI デザイン領域に拡大している
Llama 4の失敗を契機にZuckerbergが1年前にAI組織を刷新。$14.3Bで[Scale AI](https://scale.com/)(Alexandr Wang)を取り込み、研究者に数億ドル規模の報酬パッケージを提示して人材獲得競争を展開
Fable(Claude の最上位モデル)が週次利用枠から従量課金へ移行するタイミングで、Every 編集部が「Fable を使うべき場面」を再定義。タスクの大きさではなく「不確かさの量」で使い分けを判断せよという立場