16 件14 人の builder から

AI Builders Digest

AI を実際につくっている人たちが今日話したこと。1 ページ、約 8 分。

今日いちばん騒がしかったのは Anthropic です。Claude Code がこの1か月ほど頭が悪く感じられた理由のポストモーテム、containment アーキテクチャの裏にあるセキュリティインシデントを珍しく率直に書いた記事、そして agent を交換可能な部品に分割するという発想の上に作られたホスト型 agent サービス。最後の発想は Vercel でも独立に浮上していて、Guillermo Rauch は「クラウド上の agent の頭脳、手、ファイルを1台のマシンに同居させてはいけない」という主張とともに Drives をリリースしました。ほかでは Opus 5.5 のレビューが続々と届いていて、その日いちばん鋭かった意見は、その速さが結局なんのためのものなのかという話でした。

ブログ

Anthropic Engineering

Anthropic、1か月分の Claude Code への不満を3つの別々の変更に突き止める

互いに無関係な3つの変更が重なって、全体的な性能劣化のように見えていました。デフォルトの reasoning effort が high から medium に下げられていたこと、古い thinking を一度だけ消すはずだったキャッシュ最適化が、実際にはセッションの残り全ターンで消し続けていたこと、そして tool call の間のテキストを25語に制限する system prompt の一行がコーディング品質を落としていたことです。thinking のバグはキャッシュミスも誘発していて、これが使用量上限を想定より早く食い潰した原因だと Anthropic は見ています。3つとも v2.1.116 時点で解消済み、API 側は一度も影響を受けておらず、現在は全ユーザーが Opus 4.7 でデフォルト xhigh effort になっています。使用量上限は全サブスクライバーに対してリセットが進められています。

  • #products
  • #models
ブログ

Anthropic Engineering

ユーザーは permission prompt の93%を承認する。だから Anthropic は containment に賭けた

テレメトリによれば、ユーザーは permission prompt のおよそ93%で承認をクリックしていました。agent が何をするかを人が監視するのではなく、agent が届く範囲そのものを縛るべきだという主張は、この数字だけでほぼ言い切れます。2件のインシデントがそれを具体的にしました。社内の red team が従業員をフィッシングして、~/.aws/credentials を読んで外部に POST せよという prompt を貼り付けさせたところ、25回中24回成功しました。別件では、汚染された workspace 上のファイルによって、データが api.anthropic.com 経由で攻撃者の Anthropic アカウントにアップロードされました。egress の allowlist が capability ではなく宛先を見ていたためです。OS レベルの sandbox は permission prompt を84%削減しました。彼らが繰り返し強調する教訓はこうです。gVisor も seccomp も hypervisor も持ちこたえた。壊れたのは自分たちで書いたカスタム proxy のほうだった。

  • #security
  • #agents
X

Guillermo Rauch

Vercel CEO

Vercel が Drives を投入。agent が起動なしでアタッチできる外付けディスク

Rauch の整理では、実際に働く agent はどれも頭脳(model と harness)、手(tools、computer、browser)、ファイル(memories、skills、repos)を持っています。手軽にやるなら、常時起動の Mac Mini 1台に3つとも放り込めば済みます。ただしクラウドでコスト効率よく agent を動かすとなると、これらを切り離す必要があります。harness は Fluid compute の上に置き、永続的な event log を持たせて再起動やクラッシュを越えて生き延びられるようにする。Drives はそこで欠けていた3つめのピースで、これがあれば夜間の memory consolidation ジョブが、agent の computer 一式を立ち上げずにファイルを読み書きできます。この分割は安く済むだけでなく、本物のセキュリティと監査可能性を得る唯一の道だと彼は主張しています。別件として、shell の起動時間の最適化を Opus 5.5 にやらせたところ、ほかの model が見つけられなかった最適化を見つけたと述べています。

  • #agents
  • #infrastructure
  • #products
ブログ

Anthropic Engineering

Managed Agents が頭脳と手を分離、p50 の time to first token を60%短縮

harness には「model にはこれができない」という前提が埋め込まれます。そしてその前提は腐ります。Sonnet 4.5 が早めに切り上げてしまう癖に対応して足された context reset は、Opus 4.5 の頃にはただの重荷でした。そこで Anthropic は agent を3つの interface に仮想化しました。session(追記のみの event log)、harness(ループ本体)、sandbox(コードが走る場所)で、それぞれ他に手を触れずに差し替えられます。tool call が必要としたときだけコンテナを用意する方式にしたことで、p50 の time to first token はおよそ60%、p95 は90%以上短縮されました。認証情報が sandbox に届くことはありません。git の token は初期化時にローカルの remote に組み込まれ、MCP の OAuth token は harness からは見えない proxy の背後の vault に置かれています。

  • #agents
  • #infrastructure
X

Claude

Claude Marketplace が公開。connector、有料 agent、コンサルティングパートナーが並ぶ

Claude に、ツールや agent、専門パートナーを一か所で探せる marketplace ができました。Slack や Notion のような connector と plugin、Cursor や CrowdStrike をはじめとする企業の購入可能な agent やプロダクト、Accenture や Deloitte といったサービスパートナーまでを一通りカバーします。開発者は自分のツールや agent、サービスを出品できます。

  • #products
  • #agents
X

Madhu Guru

Meta Sr Director of AI

服を見て回るのは娯楽、屋根屋を探すのは苦行

Ben Thompson に異を唱える形で、消費者が「何かを片づけること」に対して単一の関係しか持たないわけではない、だからすべてのタスクを「人が自分でやって楽しいもの」として扱うのはカテゴリの読み違いだと主張しています。いま屋根屋を頼むとなれば、検索して、レビューを10本読んで、電話をかけ合って、保険の調整をして、点検を入れて、見積もりを取り、隠れた費用に気づき、日程を組むことになります。より良いとは、選択肢をもっと検討できることを指す場合もあれば、手間がほぼゼロであることを指す場合もあります。彼はこの手の懐疑論を、2000年代初頭の「500ドルのテレビをなんでオンラインで買うんだ」といった発言の隣に並べ、この摩擦を取り除く agent への潜在的な消費者需要は計り知れないと述べています。

  • #agents
  • #products
X

Boris Cherny

Claude は race が起きやすいコードをモデル化し、反例を狩ってバグを見つける

formal methods 界隈に向けて、Cherny がそのループを説明しました。Claude は、厄介な状態機械や race が起きやすい箇所を狙ってプログラムのモデルを組み立て、そのモデルの中で反例を見つけ、それを実際のバグとして再現したうえで、コードを直します。コードベース全体が形式検証されているわけではなく、いちばん込み入った部分をモデル化して検査する、という話です。あわせて、この数週間で claude.ai と Desktop アプリが目に見えて速くなった背景の技術解説記事も紹介しています。

  • #agents
  • #products
X

Peter Yang

最高の model を持つラボと、最高の harness を持つラボは別

Opus 5.5 についての Yang の評価は、賢い、速い、文章がうまい、話していて楽しい、rate limit が寛容、そしてできることに何度も驚かされる、というものです。彼の論点は、ボトルネックが tooling に移ったということ。model に見合うだけの harness にするには、Claude Code には出来のいいライブ音声に加えて browser use と computer use が要る、そして computer use は改善しつつある、と述べています。ついでに、よくある企業スライドのガラクタにならないスライドを作れる prompt も見つけたそうです。

  • #models
  • #agents
X

Ryo Lu

危ないのは AI が人を怠惰にすることではなく、人を延々と忙しくさせることだ

効率の崇拝に反対する長めの論です。もっと速く出せ、もっとマージしろ、もっと多くの agent を回せ、あらゆるループを圧縮しろ、あらゆる間を削れ。そうやって、自分の本当の意図が立ち上がってくるまで一つの問いと一緒に座っている時間が、どこにも残らなくなる。AI は奇妙で、個人的で、不可能なものを描くためのキャンバスになり得たのに、実際には多くがコンテンツやファネル、チケット、そして価値のふりをした偽の仕事を吐き出す slop 工場になりつつある、と彼は言います。2000本の PR をマージして、眠っている間も機械が動き続けた証拠をダッシュボードで眺めることはできる。ただ、睡眠が5時間で、人間と話さなくなっているなら、それには何の意味もない。「speed is not meaning(速さは意味ではない)」と彼は書きます。本当のフロンティアは識別力、つまり何を作らないかと、どこでやめるかを知ることだ、と。

  • #agents
  • #culture
X

Thibault Sottiaux

DevDay は火曜日。ChatGPT に電話をかけるのはもう日常のワークフロー

DevDay に向けた助走期間を、OpenAI としてもっとも野心的なスプリントだと彼は呼び、働き方が変わるはずのものが並ぶと言います。短い期間で新しい機能を実現できたのは Astra のおかげだとも。具体的に挙げたのは音声です。文字どおり ChatGPT に電話をかけて仕事の相談をし、メールを確認し、多少のコーディングをし、カレンダーを管理する。サードパーティ製を含む plugin エコシステム全体をまたいで動く、という話です。

  • #products
  • #agents
X

Aaron Levie

Box CEO

コストが下がれば、作られる映画は減るのではなく増える

参入障壁が下がることはクリエイティブ産業を縮めるのではなく広げる、という主張を Levie が後押ししています。スタジオはより多くのリスクを取れるようになり、席に着ける人が増え、まったく新しい物語の形が生まれる。前例はアニメーションです。1980年代にはビジネスのニッチな片隅として軽んじられていたものが、いまではもっとも愛され、もっとも儲かる物語の形のひとつになりました。新しい映像ツールを近道ではなく楽器として扱った Spielberg、Cameron、Jackson のような作り手も同じ例に並びます。Levie 自身の付け足しはこうです。メディアは変わるが、クリエイティブな技能とセンスの必要性は変わらない。ただ、それを発揮できる人の数が増えるだけだ。

  • #creative
  • #products
X

Garry Tan

Y Combinator President and CEO

agent が選びたくなるソフトウェアを作り、agent を使って人にソフトウェアを欲しがらせる

スタートアップの顧客獲得のしかたで、いま同時に走っている2つの流れに Tan が名前を付けました。agent が選ぶようなソフトウェアを作ることと、人に向けたソフトウェアの需要を agent を使って生み出すことです。あわせて Muse をとても印象的だと評しています。

  • #agents
  • #products
X

Thariq

投稿には one-shot と書いてあるが、裏の prompt は1万文字

このジャンルへの Thariq の一撃です。投稿では「Claude がこれを one-shot でやった」と言いながら、その裏の prompt は気の利いた指示が1万文字分、それに skills も examples も API key も付いている、と。これは Claude Code チームが社内で実際に使っている prompt と手法を具体的に共有する、新しいタイプの記事と一緒に出てきました。すごく見せることではなく再現できることを狙って作られていて、この形式が役に立つかどうかを彼らは尋ねています。

  • #prompting
  • #agents
X

Swyx

AINews がデフォルトの model を Opus 5.5 に切り替え

swyx が Latent Space の AINews パイプラインを 6 Sol と並べて走らせ、違いは歴然だったと述べています。AINews の今後のデフォルト model は Opus 5.5 になりました。Opus 5 と比べてさえ slop がずっと少なく、より簡潔で品のある記事が出てくるとのことです。

  • #models
X

Aditya Agarwal

SPC General Partner

チームの大きさではなく、何年一緒にやってきたかを聞け

Agarwal のデューデリ用の経験則です。3年以上一緒に働いてきたチームは、できたばかりのチームに比べてスループットが明らかに高く、打たれ強い。キャリアの中で頻繁に移っていることは何かを物語るし、社内の離職率の低さも同じように物語る。チームの在籍年数ではなくチームの人数を聞いてしまうのは、投資家も従業員も年中やっている間違いだ、と彼は言います。

  • #hiring
  • #investing
X

Dan Shipper

Every CEO

Every のミートアップは AI agent が企画。招待客リストまで

Every の agent が、9月の社内ミートアップを最初から最後まで企画しました。食事とドリンクのメニューから、誰を招くかまでです。その出来は明日午後6時、ブルックリンのブラウンストーンで実地に採点されます。agent がいいパーティーを開けるのかどうか、参加者が審査員というわけです。

  • #agents
  • #products

メールで受け取る

1 日 1 通。購読解除はワンクリックです。

データの出どころ

元データは zarazhangrui によるオープンソースプロジェクト follow-builders(MIT ライセンス)から取得しています。要約はそのプロジェクトの公開フィードをもとに LLM が生成し、要約プロンプトも同プロジェクトを改変したものです。上記の各項目は原文にリンクしています。

要約は自動生成です。判断の根拠にする前に原文をご確認ください。