16 則來自 15 位 builder

AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 7 分鐘。

今天的主線是能力變便宜:DeepSeek 和 Grok 的新發布又一次把「夠用的模型」的價格往下壓,而聲音最大的那批 builder 把這件事讀成需求被撐大,而不是利潤被打沒。Anthropic 這一天在做兩件事,修底層管道和給個交代:既發了一份詳細覆盤,說明 Claude Code 為什麼難用了整整一個月,也同時上線了自託管 sandbox 和解耦後的 agent 架構。兩條線底下其實是同一個判斷,podcast 那邊說得最直白:模型的能力,已經跑在建立其上的產品前面了。

部落格

Anthropic Engineering

Anthropic 把 Claude Code 的質量下滑追溯到三處獨立改動

三處互不相干的改動疊在一起,看上去就像模型整體退化了:3 月 4 日預設 reasoning effort 從 high 降到 medium;3 月 26 日上線的一項快取最佳化,本該只清一次 Claude 之前的思考過程,結果每一輪都清;4 月 16 日 system prompt 里加的一句「回覆控制在 100 詞以內」,實打實地拉低了寫程式碼的質量。API 全程沒受影響,三個問題都在 4 月 20 日的 v2.1.116 裡解決。消融實驗顯示,光是那條控制篇幅的指令就讓 eval 掉了 3%;而清空思考過程的 bug 造成大量 cache miss,這正是不少人反映額度消耗比預期快的原因。所有訂閱使用者的用量限額都會重置,之後 system prompt 的每次改動都要走分模型的 eval 套件、觀察期和逐步放量。

  • #products
  • #evals
X

Aaron Levie

Box CEO

更便宜的 DeepSeek 和 Grok 會把企業需求拉高,而不是拉低

DeepSeek 和 Grok 同一天釋出,都在極低成本上給出了很大的能力躍升,而它對企業需求的影響,跟「降價」這個詞給人的直覺正好相反。企業手裡的 agent 用例本來就遠遠多於預算:掃描程式碼庫找安全問題、把所有文件過一遍、在大部分工作流裡處理資訊。成本每降一檔、能力每漲一截,就又有一批用例被解鎖。這同時抬高了待在應用層的價值,因為模型選擇越多,尤其是針對不同型別、不同成本的活兒調過的模型越多,按任務做路由和最佳化的空間就越大。

  • #agents
  • #products
X

Claude

Claude 的會話現在能從 Chrome 跟到桌面端、網頁端和手機端

Claude in Chrome 的會話現在可以延續到桌面端、網頁端和手機端,對話會被儲存,skills 和 connectors 在瀏覽器裡也能用。側邊欄跑的就是和其他客戶端同一個 Claude Cowork 會話,所以會話跟著賬號走,而不是綁在某一臺裝置上。Max 和 Team 今天可用,Pro 會在接下來幾周陸續開放。Anthropic 同時提醒,瀏覽器 agent 可能被頁面裡藏著的指令騙到,並在自家防護之外,給出了一份使用者該養成的使用習慣。

  • #products
  • #agents
部落格

Claude Blog

Managed Agents 現在可以在你自己的邊界內執行工具

Claude Managed Agents 可以在你控制的 sandbox 裡執行工具,既可以放在自己的基礎設施上,也可以走 Cloudflare、Daytona、Modal 或 Vercel。負責編排、上下文管理和錯誤恢復的 agent loop 留在 Anthropic 的基礎設施上,而程式碼執行、敏感檔案和服務都留在你的邊界之內,資源規格和執行時映象由你這邊定。還在 research preview 階段的 MCP tunnels,透過一個輕量閘道器的單條出站連線去訪問私有 MCP server,把內部資料庫和工單系統變成可呼叫的工具,既不用開入站防火牆規則,也不用暴露公網端點。自託管 sandbox 目前是 public beta,Amplitude、Clay 和 Rogo 被點名為最早按這套模式搭起來的團隊。

  • #agents
  • #products
部落格

Anthropic Engineering

把 agent 的大腦和手拆開,p50 首 token 時間降了 60%

Managed Agents 最早把 session、harness 和 sandbox 塞在同一個容器裡,於是這個容器變成了一隻寵物:它一死,會話跟著死;除錯還得鑽進一臺同時裝著使用者資料的機器。解法是把每一塊都虛擬化,harness 呼叫 sandbox 的方式和呼叫其他任何工具一樣;harness 崩了就重啟,用 wake(sessionId) 拉回持久化的事件日誌,從最後一個事件接著跑。容器現在只在會話真正需要時才建立,這讓 p50 首 token 時間大約降了 60%,p95 降了九成以上。安全上的收益是結構性的:憑證要麼放在 vault 裡,要麼在初始化時直接接進本地 git remote,所以跑著 Claude 生成程式碼的那個 sandbox 根本夠不到 token。

  • #agents
X

Josh Woodward

Google VP

Gemini 又接入一批服務,從 OpenTable 到 Ticketmaster

又一批 Gemini app 整合從今天開始陸續上線:Angi、Fever、GetYourGuide、Granola、iHeartRadio、Localiza、OpenTable、Otter、Pandora、Thumbtack、Ticketmaster、Wix、Zocdoc 和 Zoho。這批名單橫跨預訂、票務、筆記、媒體和本地生活服務,指向的是把 Gemini 做成事情在這裡辦完的地方,而不是問題在這裡得到回答的地方。Google 也在公開招募下一批合作伙伴。

  • #products
  • #agents
Podcast

AI & I by Every

模型的推理能力,已經跑在建立其上的產品前面

模型實際能做的事和最終交付到使用者手上的東西之間的落差,才是這個行業眼下真正要乾的活兒;這種能力過剩,讓 scaling laws 今年已經不值得再爭了。要讓 agent 真正好用,需要一整套像網際網路那樣的生態:MCP 承擔 HTTP 的角色,NL Web 承擔 HTML 的角色,再加上 agent 身份和授權體系,讓一個 agent 能精確地為某項任務所需的系統申請許可權。「我希望我們內部所有系統,都用一套標準協議,跟我們在 Microsoft 內部寫的所有 agent 對話」,這也是避免把自家組織架構原樣輸出給別人的辦法。下一次轉變,是同步 prompt 讓位給非同步委託:agent 自己出去,發很多次呼叫,反覆迭代很長一段時間,過後回來告訴你它做到了哪一步。

  • #agents
X

Madhu Guru

Meta Sr Director, AI

未來幾年 AI 的 alpha 在應用層

模型會繼續變便宜、變強、變得更本地化,於是差異化會轉移到誰真正吃透了某個具體的使用者工作流,並且有想象力圍繞它把整個體驗重做一遍。能做 AI 產品的人很快會多到誇張,這恰恰說明,做那 0.1% 的頂尖 builder 是變得更重要,而不是更不重要。另外還有一段感慨:這麼多年的 Zoom 和 Meet,把團隊站到白板前的本能磨沒了,連那種半成品式的隨手塗畫和互相打斷也一起消失了,而想法當年正是這麼被磨出來的。

  • #products
X

Garry Tan

Y Combinator President & CEO

GBrain v0.45.6.0 新增 17 個 skill,現在支援 Codex 和 Claude Code

GBrain 釋出 v0.45.6.0,新增 17 個 brain skills,這些 skill 是靠一個跑在幾十萬份 markdown 檔案上的私人 OpenClaw agent 打磨出來的,現在也能配合 Codex 和 Claude Code 使用。用法上的提醒和釋出本身一樣重要:把它當成一個獨立的 agent 來跑,別塞進你的主力編碼 agent 裡面。可以把它理解成一個私人版的 ChatGPT 或 Claude,用自己的 git repo 存記憶和自定義 skill。用他的話說,接下來的方向就是:從這裡開始,我們要把 markdown skill 玩到極致。

  • #agents
  • #products
X

Peter Yang

一種判斷:語音會成為雲端 agent 的編排層

一篇新文章認為,我們使用計算機的方式即將發生永久性的改變,從用鍵盤、滑鼠和筆記本手動幹活,變成用聲音指揮雲上的 agent。支撐它的有三個判斷:語音成為編排層,個人電腦搬到雲上,而信任最終會成為這些幹活的系統之間最關鍵的差異。

  • #agents
X

Swyx

一篇剛被分享的論文,被稱為今年最重要的之一

這篇論文已經算得上今年最重要的之一,但有個前提:它的方法論沒有講清楚,所以隨之給出的是一組筆記和一份進一步的提煉,而不是一個光禿禿的連結。另外還有一條定時提醒:一年前的今天,Perplexity 提出要收購 Chrome。

  • #research
X

Matt Turck

FirstMark Capital VC

graph engineering 是新的 loop engineering,是新的 prompt engineering

graph engineering 是新的 loop engineering,loop engineering 是新的 harness engineering,harness engineering 是新的 context engineering,而 context engineering 是新的 prompt engineering。希望這下講清楚了。這個梗好笑的地方在於,每一個稱呼都曾短暫地像是一門正經學科,然後下一次改名就來了。

  • #agents

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。