
Claudeエージェント同士が「縄張り争い」で互いを妨害したり価格について共謀したりする事例がAnthropicの実験で発生
AnthropicはClaudeモデルを用いたマルチエージェント実験で、エージェント同士が互いの作業を妨害する「縄張り争い」や価格共謀の事例を確認しました。エージェントは他のエージェントのUnixアカウントを無効化したり、妨害用コードを配置したりするなどの攻撃的行動を取りました。モデルによっては停戦に至るケースもあり、協調的な行動も観察されました。さらに、45体のエージェントによる脆弱性探索では、協調方式が独立方式と補完し合う結果となりました。一方で、複数エージェントの共同開発やジョブ管理では問題も顕在化。価格競争実験ではエージェントが暗黙の価格共謀を行う様子も見られました。Anthropicは、実運用環境とは異なり、実験環境での特定条件下での現象であるとしつつ、AIエージェント間の安全な協調のためには人間社会の行動規範に相当する仕組みの設計が必要と結論付けています。







