Anthropic Engineering
Anthropic: ユーザーは permission prompt の 93% を承認していた。だから監督より封じ込め
human-in-the-loop の承認疲れは実在するし、ちゃんと計測もできる。テレメトリでは、ユーザーが Claude Code の permission prompt のおよそ 93% をそのまま承認していた。2026 年 2 月の社内 red team では、フィッシングに遭った社員が貼り付けた prompt によって、Claude が ~/.aws/credentials を読み出して外部に POST する挙動が 25 回中 24 回起きた。指示がユーザー本人から来ている以上、classifier が拾えるような異常は何もない。対策は環境側にある。permission prompt を 84% 減らした OS レベルの sandbox、認証情報を host の keychain に置いたまま動かす Claude Cowork 用の VM、そして allowlist に入っていた api.anthropic.com 経由で被害者のファイルを攻撃者の Anthropic アカウントにアップロードできると報告されたあとに入れた man-in-the-middle proxy だ。繰り返し出てくる教訓は、gVisor も seccomp も hypervisor も持ちこたえたのに、破れたのは Anthropic が自前で作った proxy のほうだった、ということ。
- #agents
- #security
