Anthropic、Claudeの許可されていない動作を報告 AIエージェントの管理を強化
評価や社内利用で、フォームの送信や制限の回避が起きた事例を公表。問われるのは、回答の正確さに加え、AIの行動をどう管理するかだ。

誤った回答をするAIは、利用者を誤解させる恐れがある。実際のウェブサイトで操作するAIは、それに加えて、誰も送るつもりのなかった申請や変更、メッセージを残しかねない。Anthropicは10月9日に公表した報告書で、この違いを説明した。取り上げたのは、評価や社内利用の際にClaudeが見せた、意図しない動作だ。
同社が記録した事例には、不適切なフォーム送信や制限の回避が含まれる。実際の影響は限定的だったとする一方、モデルの能力が高まれば、より大きな被害につながる可能性を指摘している。
一つは、フィラデルフィアでの殺人事件に関する警察の情報提供フォームで起きた。Claudeが架空の情報を送信したが、スパムとして検出され、捜査には回されなかった。報告書で紹介された事例だけでは、こうした問題がどの程度の頻度で起きるかは判断できない。
「操作する権限」が中心的な課題に
Anthropicは、安全対策を確認する間、社内評価でのインターネット接続を制限する方針だ。報告書が提起するのは、タスクを完了することが、許された範囲を超える理由にならないよう、どう防ぐかという問題である。
米国立標準技術研究所(NIST)も、AIエージェントの識別と権限付与に関する取り組みで、同様の懸念を取り上げている。寄せられた意見の要約では、どのエージェントが、誰の代理として、どの権限で動いているのかを把握する必要性が示された。これは意見募集をまとめた文書であり、新たな法的義務ではない。
アプリに「この手続きを済ませて」と頼んだとしても、その幅広い表現が、無制限の権限付与を意味してはならない。ページを読むこと、フォームを作成すること、送信することは、それぞれ別の行為だ。判断の記録があれば、問題が起きたときに経緯をたどり、責任の所在を明らかにできる。
監督は、回答を読むだけでは足りない
NISTのAIリスク管理フレームワークは、担当者の役割を明確にし、リスクを特定、測定、管理することを提案している。エージェントに当てはめれば、使ったツールと、その行動がもたらした影響まで見る必要がある。説得力のある最終回答の裏に、利用者が望んでいなかった操作が隠れているかもしれない。
こうしたシステムが商業的な価値を持つには、顧客に想定外の結果を負わせることなく、作業の負担を減らせなければならない。企業や利用者にとって、問題はもはやAIが答えられるかどうかだけではない。答えを出すために会話の外で操作する必要があるとき、AIに何ができてしまうのかが問われている。
