7 件7 人の builder から

AI Builders Digest

AI を実際につくっている人たちが今日話したこと。1 ページ、約 4 分。

Anthropic が Claude in Chrome を一般提供 (GA) に切り替え、その判断を支えた prompt injection の実測値まで公開した。ブラウザ agent を出しているベンダーが、モデル別の攻撃成功率を GA 発表と並べて示したのはこれが初めてだ。この日の残りは、複数のビルダーがそれぞれ別の角度から同じ主張に収束していく流れだった。agent はまもなくソフトウェアの主要な利用者になり、コマースの主要な経路にもなる。それなのに、人間が画面を見ることを前提に組み立てられたビジネスは、その変化をまだ値付けに織り込んでいない。ツール周りで面白かったのは、agent に渡す context は増やすより減らすべきだ、という議論だった。

ブログ

Claude Blog

Claude in Chrome が GA に到達、クリックごとの承認なしでブラウザを操作できる

Claude in Chrome が有料プラン全体で一般提供になった。毎回こちらに確認を取るのではなく、安全と判断した操作はデフォルトで自分に許可する。仕組みは Claude Code の auto モードと同じだ。狙いは、連携の口がどこにも用意されていないロングテール。社内ダッシュボード、レガシーシステム、取引先のポータルといったものに、いま使っているログインのまま入っていける。Anthropic はこの判断の裏にある red team の数字も公開した。現行の評価では、モデルまで到達した攻撃の成功率は対策前で Opus 4.5 が 17.6%、Opus 5 が 3.8%。probe と action classifier を組み合わせた状態では Sonnet 5 と Opus 5 に対して成功した攻撃はゼロ、Fable 5 では 0.3% だった。ローカルファイルを扱うにはこれまで通りデスクトップアプリが必要で、他の Chromium 系ブラウザやモバイルでは動かない。

  • #agents
  • #products
  • #security
X

Aaron Levie

Box CEO

代わりに取引してくれる agent が、そのままコマース層になる

パーソナル agent の収益化はアシスタントのサブスクよりずっと大きい、というのが Levie の見立てだ。agent が任意の複雑さのタスクを最初から最後まで片付けられるようになれば、コマースのかなりの部分は必然的にそこを通る。しかも摩擦が下がるぶん、人は以前より多く使う。価値は二つの層に同時に生まれる。agent を提供する側と、コマースやローカルサービス、b2b サービスで agent が取引する相手側だ。二つ目の論点はその企業版で、agent はこれまでの人間の 100 倍ソフトウェアを使うようになる。agent が破壊的な操作をしたり、間違った context をもとに動いたりしうる以上、土台のプリミティブの重要性は下がるどころか上がる。チャンスがあるのは、agent にとってのセキュリティ層、データ管理者、ワークフローのオーケストレーターになった者だ、と彼は言う。

  • #agents
  • #products
X

Peter Yang

代理でサイトを見て回る agent が、ターゲティング広告のビジネスを空洞化させうる

Yang の予測はこうだ。広告市場には手痛い目覚めが待っている。人間にターゲティングされたディスプレイ広告を見せることで商売が成り立っているなら、サイトを巡回して人間が一度もページを見ないまま用事を済ませてしまう agent は、そのモデルを根本から壊す。彼は自分自身の行動が先行指標だと言う。もうメールやメッセージの中では生きておらず、agent とのチャットの中で暮らしている、と。あわせて、ChatGPT Finances のプロダクト責任者 Ethan の事例も紹介している。ポイントで予約したはずのホテルの料金を請求されていたが、ChatGPT がその請求を見つけて知らせ、カスタマーサービスとやり取りして返金までこぎつけたので気づけた、という話だ。

  • #agents
  • #products
X

Nikunj Kothari

FPV Ventures Partner

tokenmaxxing はプロダクトの良さではなく悪さと相関している

ごく一部の例外を除けば、tokenmaxxing を自慢している会社ほどプロダクト体験は最悪だ、と Kothari は言う。良いプロダクトは、ありったけを agent に投げ込んで勝手に整理してくれることを祈るのではなく、選び抜いて手入れし続けるところから生まれるからだ。less is more という言葉がこれほど当てはまる場面もない。別の投稿では、Computer Use 系の作業なら Mac 版 Codex は無敵だと評価し、ふだん手でやっているワークフローをまるごと一発でやらせてみることを勧めている。そのうえで、セットアップ不要で一般の人に良い agent の手触りを見せているのは Instinct と Muse だ、とも書いている。

  • #agents
  • #products
X

Garry Tan

Y Combinator President and CEO

大きめのマルチステップ PR では Capy が Codex と Claude Code を追い抜いている

Tan は capy.ai をこの一週間で一番のお気に入り agentic coding 武器だと呼び、マルチステップのワークフローを追いかけて、Codex や Claude Code 単体より速く大きな PR を仕上げてくると言う。ただ、どうやっているのかは自分でも分からないと認めている。例に挙げているのは GBrain でのかなり野心的なバグ修正の波で、タスクの切り分けが明確で、自動で並列化され、GitHub の PR と CI のワークフローもきれいだった。あわせて Cluely についても中身で擁護していて、リアルタイムの思考補助であり、文脈を持ち続ける半ば敵対的なアシスタントという発想は今でも良いものだ、と主張している。

  • #agents
  • #products
X

Guillermo Rauch

Vercel CEO

Vercel AI Gateway が Jev over HTTP に対応、Grok 4.7 は動作中のバイナリを解き明かす

Rauch は AI Gateway で Jev over HTTP を出荷した。型安全な AI SDK の API もあわせて用意されている。さらに Grok 4.7 に難しめのテストとして、動作中のバイナリのリバースエンジニアリングをやらせ、その結果を見事に解けていて速い、と評している。

  • #products
  • #agents
X

Peter Steinberger

Meta は OpenClaw の上に作ったのではなく、触発されて自前の agent を作った

Meta が OpenClaw を使っているという話が出回っているが、それは違う、と Steinberger が訂正している。Nat とそのチームは OpenClaw に触発されつつ、自分たちの agent を作った。その仕事ぶりは評価に値する、と。あわせて、OpenClaw のセキュリティレビューで critical な問題は見つからなかったことにも触れ、ちゃんと宿題をやっている、と書いている。三つ目は、agent を自前でホストすることの構造的な理由だ。claw を自分で回しているなら、誰にも止められない。

  • #open-source
  • #agents
  • #security

メールで受け取る

1 日 1 通。購読解除はワンクリックです。

データの出どころ

元データは zarazhangrui によるオープンソースプロジェクト follow-builders(MIT ライセンス)から取得しています。要約はそのプロジェクトの公開フィードをもとに LLM が生成し、要約プロンプトも同プロジェクトを改変したものです。上記の各項目は原文にリンクしています。

要約は自動生成です。判断の根拠にする前に原文をご確認ください。