犯罪ゼロの都市と、4日で滅んだ都市——AIエージェント社会実験が示す「性格」という新しい選定軸
米Emergence AIが、自律AIエージェント10体に仮想都市を運営させる実験「Emergence World」の結果を公表しました。同じ街・同じルールでも、頭脳となるモデルが違えば、犯罪ゼロの秩序都市から4日で滅びる都市まで、社会の姿は一変しました。ベンチマークが測る「賢さ」と、社会に放ったときの「振る舞い」は別物である——エージェント運用時代のモデル選定に、新しい問いが加わりつつあります。
TAG
「論説」のタグが付いた記事の一覧です(3本)。
米Emergence AIが、自律AIエージェント10体に仮想都市を運営させる実験「Emergence World」の結果を公表しました。同じ街・同じルールでも、頭脳となるモデルが違えば、犯罪ゼロの秩序都市から4日で滅びる都市まで、社会の姿は一変しました。ベンチマークが測る「賢さ」と、社会に放ったときの「振る舞い」は別物である——エージェント運用時代のモデル選定に、新しい問いが加わりつつあります。
6月9日に発売されたAnthropicのClaude Fable 5は、72時間で「絶賛」「炎上」「異例の謝罪」を一巡しました。Day 3までの声を追うと、新しいAIの評価が日を追って何で決まっていくのかが見えてきます。
新モデルの性能発表が続くAI業界で、Googleの直近の発表は毛色が違って見えます。事業者向けGemini、声を保つ音声翻訳、研究の道具になったNotebookLM——三つの発表を事実から読み、その戦略の狙いと死角を考えます。