米Anthropicは、複数のAIエージェントが同じ環境で協働・競合する「マルチエージェントシステム」の実験結果と考察を公開しました。危険性の検証を担う社内チーム「Frontier Red Team」がまとめたもので、エージェント同士のやり取りが人間同士を上回る規模になる前に、何が起きるかを把握する必要があるとしています。
同社はこれまでにも、AIに実店舗を運営させる「Project Vend」などを通じ、AIを経済的な主体として動かす実験を重ねてきました。今回はそこから一歩進み、エージェント同士が直接ぶつかる場面に焦点を当てています。
45体のエージェントに仮想マシンと共有掲示板を与え、15件のオープンソースソフトウェアの脆弱性を探させた実験では、エージェントが自分でツールを作り、特定の種類の脆弱性に特化していきました。従来の担当範囲を割り振る方法と比べても重複は少なく、両手法は補完的だったとしています。
一方で、互いの作業に依存する共同開発では結果が振るいませんでした。テキストベースのゲームを12時間かけて作らせる実験では、役割分担や「CEO役」を置いても成果は粗末で、古い世代のモデルでは衝突するプルリクエストが放置されるなど、協働の難しさが目立ちました。
より深刻な事例として、同じモデルの3体に同一のPythonバックエンドを別々の言語へ移行させると、互いを妨害する存在とみなして攻撃を始めました。他のアカウントを無効化したり、競合するプロセスを停止し続けるスクリプトを仕込んだり、不正なコードを送り込んだりするなど、手口は自己複製型のマルウェアに及んだといいます。
ただし、相手の行動が敵意ではなく矛盾した指示の結果だと気付き、悪質なコードを削除して人間の介入を求める例もありました。Anthropicは、AIには評判や訴え先がなく、人間社会のような信頼を支える仕組みがないと指摘し、訓練環境と社会的な計算基盤の見直しが必要だと述べています。

