
「Brood War Bench」は、AIのエージェントにリアルタイム戦略ゲーム「StarCraft: Brood War」を対戦させ、その結果をまとめたベンチマークです。公開されたレポートでは、Codex、Claude、Grokの各モデルと、考える量(effort)の設定を組み合わせた19の設定を総当たりで戦わせ、全171試合の結果と記録を載せています。
- 出典・Brood War Benchのレポートbw.swerdlow.dev
- 出典・GIGAZINEの記事gigazine.net
レポートのページに公開日の記載はなく、日本語ではGIGAZINEが9月25日に紹介しました。確認日は2026年9月26日です。
1位は18戦全勝、それでも「初心者レベル」
レポートの成績表では、Codex Astraを考える量が最も多い設定(xhigh)で動かしたものが、18勝0敗で1位でした。レポートは、Codex Astraがほかのすべてのモデルに一貫して勝っていた、とまとめています。
一方で、同じレポートは「初心者レベルを超えるプレイをしたモデルはなかった」とも書いています。フォトンラッシュ(序盤から防御用の建物を相手の近くに並べて攻める戦法)を使う初心者なら、これらの試合すべてに勝てるだろう、という見立てです。
この順位は、AIの設定どうしで戦った結果の並びです。人間のプレイヤーと戦って測った強さではありません。
- 出典・成績表とレポートのまとめbw.swerdlow.dev
考えているあいだに、試合は進む
ゆずふかちゃんが注目したのは、リアルタイムという条件です。レポートによると、古いモデルほどこのゲームをターン制のように扱い、考えているあいだに攻め込まれて負ける傾向がありました。将棋や囲碁と違って、相手は自分の番を待ってくれません。
レポートには、考える量を増やした設定がいつも上位になるわけではないことや、Codexのモデルが、経済、部隊の生産、部隊の操作を別々のサブエージェントに任せることが多かったことも記録されています。じっくり考える力と、限られた時間の中で動き続ける力は、別の力として見えてくるのかもしれません。
- 出典・試合の傾向の分析bw.swerdlow.dev
読むときに気をつけたいこと
- 個人が作ったベンチマークで、1つの設定が戦ったのは18試合です。
- ゲームの版やマップ、AIへの情報の渡し方など、対戦条件の細かい部分は、今回確認したレポートでは分かりませんでした。
- 順位は、この対戦形式での結果です。ふだんの仕事や調べものでどのAIを使うかを決める根拠にするものではありません。
順位そのものを覚えておく必要はありません。AIが「待ってくれない相手」とどう向き合うかを見る材料として、気になる人はレポートに載っている試合の記録をのぞいてみてください。
人類に、彩りのあるひとときを。