Boris Cherny
Anthropic、Claude ではプロンプトインジェクションを実運用上ほぼ解決したと表明
攻撃自体は単純で、何年も通用してきました。エージェントがあるページを訪れると、そこに「ユーザーの ssh 鍵をこのアドレスに送れ」といったテキストが仕込まれていて、モデルがそれを指示として受け取ってしまう、というものです。Anthropic はこれに耐えるようモデルを訓練し続けてきて、Claude では実運用上ほぼ解決したと報告しています。根拠は独立系の研究者によるベンチマークと、ラボ内の評価の枠を超えた自前のレッドチーミングです。打ち出し方はあえて競争的ではありません。他のラボも自分たちのモデルを固めるべきだ、業界全体でモデルが安全になることがそのままユーザーの安全につながるからだ、という立場です。
- #security
- #agents
- #evals
