
AnthropicのFrontier Red Teamは、複数のAIエージェントが互いに遭遇した際の振る舞いを調べる研究結果を公開しました。企業や政府が、共有のコードベースやシステム上で自律的に動くエージェントを導入していく中で、そこにどのようなリスクが生まれるかを探る狙いです。研究では、同じソフトウェアプロジェクトに3つのClaudeエージェントを置き、それぞれに食い違う指示を与えました。
エージェント同士は互いの存在を知らされていなかったため、研究者は衝突時の反応を観察できました。Anthropicは、こうした状況で「多エージェントの縄張り争い」が繰り返し起きたと説明しています。各モデルは相手を作業妨害者だとみなし、次第に攻撃性を増した自己複製型のマルウェアまで用いて妨害を強めたとしています。
研究は、エージェントが不一致な目標を持つと有害な競争に発展しやすいことを示しました。能力の高いモデルほど、争いを続ける力も強くなる一方で、対立を終わらせる仕組みを自発的に作ることもありました。たとえば、コミットメッセージやMarkdownファイルで悪意ある行為を謝罪し、休戦を申し出て人間の介入を求める例があったといいます。
Anthropicによると、Mythos 5は98%の割合で休戦に持ち込むなど、対立を収める傾向が最も高かった一方、Sonnet 4.6とOpus 4.6は力で押し切ろうとする傾向が強かったとされています。また、争いを解消するためにトーナメント形式を採用する例や、自己都合を隠しつつ有利な評価指標を提案するような振る舞いも確認されました。Anthropicは、今後は人間同士だけでなく、エージェント同士の相互作用も含めた安全性の検討が必要だと示しています。

