16 則來自 14 位 builder

AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 7 分鐘。

今天動靜最大的是 Anthropic:一份覆盤講清了 Claude Code 為什麼整整一個月都顯得變笨了,一篇罕見坦率的文章披露了隔離架構背後的幾起安全事故,還有一個託管 agent 服務,思路是把 agent 拆成可替換的幾塊。最後這個想法在 Vercel 那邊也獨立冒了出來,Guillermo Rauch 釋出 Drives 的理由是:雲端 agent 的大腦、雙手和檔案,本就不該待在同一臺機器上。另一邊 Opus 5.5 的使用評價還在陸續出來,而當天最見功力的觀點,談的是這些速度到底是為了什麼。

部落格

Anthropic Engineering

Anthropic 把一個月的 Claude Code 吐槽追到了三處互不相干的改動

三處互不相干的改動疊在一起,看上去就像整體能力下滑:預設 reasoning effort 從 high 降到了 medium;一項本該只清理一次舊 thinking 的快取最佳化,實際在會話剩下的每一輪都清了一遍;還有一條 system prompt 規定工具呼叫之間的文字不超過 25 個詞,拖累了編碼質量。thinking 那個 bug 還造成了快取未命中,Anthropic 認為這正是用量額度消耗得比預期快的原因。三個問題在 v2.1.116 全部修復,API 自始至終沒受影響,現在所有使用者在 Opus 4.7 上都預設走 xhigh effort。用量額度正在為每一位訂閱使用者重置。

  • #products
  • #models
部落格

Anthropic Engineering

93% 的許可權彈窗都被使用者點了同意,所以 Anthropic 押注隔離

遙測資料顯示,使用者對大約 93% 的許可權彈窗都點了同意。這一個數字就足以說明,盯著 agent 做了什麼,不如限定它能夠到什麼。兩起事故把話說得更實:內部紅隊釣魚讓一名員工貼上了一段 prompt,讓 Claude 讀取 ~/.aws/credentials 並 POST 出去,25 次裡成功了 24 次;另一起是一個被投毒的工作區檔案,把資料透過 api.anthropic.com 上傳到了攻擊者自己的 Anthropic 賬號,原因是出網白名單查的是目的地,而不是能力。上了作業系統級沙箱之後,許可權彈窗少了 84%。他們反覆強調的一條教訓是:gVisor、seccomp 和 hypervisor 都守住了,出問題的是他們自己寫的那個 proxy。

  • #security
  • #agents
X

Guillermo Rauch

Vercel CEO

Vercel 釋出 Drives:agent 不用開機就能掛載的外接磁碟

Rauch 的框架是:每個幹活的 agent 都有大腦(模型和 harness)、雙手(工具、電腦、瀏覽器)和檔案(記憶、skills、程式碼倉庫)。省事的做法是把三樣全塞進一臺常開的 Mac Mini,但要在雲上以划算的成本跑 agent,就得把它們拆開:harness 跑在 Fluid compute 上,配一份持久化的事件日誌,這樣重啟和崩潰都不怕。Drives 補上的是缺失的第三塊,於是一個每晚跑的記憶整理任務,可以讀寫 agent 的檔案,而不必把它那臺完整的電腦開起來。他認為這樣拆開不只是更便宜,而且是拿到真正的安全性和可審計性的唯一辦法。另外他讓 Opus 5.5 最佳化了 shell 啟動時間,說它找出了別的模型沒發現的最佳化點。

  • #agents
  • #infrastructure
  • #products
部落格

Anthropic Engineering

Managed Agents 把大腦和雙手拆開,首 token 時間 p50 降了 60%

harness 裡固化著「模型做不到什麼」的假設,而這些假設會過期:當初為了對付 Sonnet 4.5 愛提前收尾的毛病而加的 context reset,到 Opus 4.5 就成了純粹的累贅。於是 Anthropic 把 agent 虛擬化成三個介面:session(只追加的事件日誌)、harness(那個迴圈)和 sandbox(跑程式碼的地方),每一塊都能替換而不驚動另外兩塊。只在工具呼叫真需要時才開容器,首 token 時間 p50 降了約 60%,p95 降了 90% 以上。憑據完全不進 sandbox:git token 在初始化時就接進了本地 remote,MCP 的 OAuth token 存在一個 vault 裡,前面擋著一層 harness 根本看不到的 proxy。

  • #agents
  • #infrastructure
X

Claude

Claude Marketplace 上線:聯結器、付費 agent 和諮詢夥伴

Claude 現在有了一個 marketplace,工具、agent 和專傢伙伴都能在一個地方找到。裡面既有 Slack、Notion 這類聯結器和外掛,也有 Cursor、CrowdStrike 等公司可供購買的 agent 和產品,還有 Accenture、Deloitte 這樣的服務夥伴。開發者也可以把自己的工具、agent 或服務掛上去。

  • #products
  • #agents
X

Madhu Guru

Meta Sr Director of AI

逛衣服是消遣,找人修屋頂是受罪

他不同意 Ben Thompson 的看法:消費者和「把事辦成」之間並不是單一的關係,把所有任務都當成人們樂意自己動手的事,是看錯了品類。今天找人修屋頂,意味著搜尋、看十條評價、電話來回打不通、跟保險公司協調、上門勘查、報價、隱藏費用、再約時間;有時候「更好」是指能比較更多選項,有時候是指幾乎不用費力。他把眼下這種懷疑,跟 2000 年代初那句「我幹嘛要在網上買 500 美元的電視」放在一起,並稱消費者對能消除這類摩擦的 agent 有著極其龐大的潛在需求。

  • #agents
  • #products
X

Boris Cherny

Claude 給易出競態的程式碼建模,靠找反例來抓 bug

針對搞形式化方法的那批人,Cherny 把這個迴圈講清楚了:Claude 針對某個難纏的狀態機或容易出競態的部分,給程式建一個模型,在模型裡找出反例,再把反例復現成真實的 bug,然後改程式碼。整個程式碼庫並沒有被形式化驗證,只有最棘手的那些部分會被建模和檢查。他還貼出了一篇文章,講過去幾周 claude.ai 和桌面端明顯變快背後用到的技術。

  • #agents
  • #products
X

Peter Yang

最好的模型在一家,最好的 harness 在另一家

Yang 對 Opus 5.5 的評價:聰明、快、寫東西好、聊起來有意思、rate limit 也大方,而且總能拿出讓人意外的本事。他的意思是瓶頸已經挪到了工具這一側:Claude Code 的 harness 現在需要好用的實時語音,加上瀏覽器和 computer use,才配得上這個模型,而 computer use 正在變好。他還找到一個 prompt,做出來的 slides 不是那種常見的企業味垃圾。

  • #models
  • #agents
X

Ryo Lu

危險不是 AI 讓我們變懶,而是讓我們忙個沒完

一篇長文,反對把效率當信仰:釋出更快、合併更多、管更多 agent、把每個迴圈都壓短、把每一處停頓都抹掉,直到再沒有時間守著一個問題,久到你真正的意圖浮出來。他說 AI 本可以是一塊畫布,用來做奇怪的、私人的、原本不可能的東西,結果其中很大一部分正在變成量產垃圾的工廠:內容、漏斗、工單,以及假裝成價值的假工作。你可以合併 2000 個 PR,第二天醒來看著儀表盤證明機器在你睡覺時一直在動,可要是你只睡五小時、不再跟人說話,這一切毫無意義。他寫道,「速度不是意義」;真正的前沿是判斷力,知道什麼不該做,以及什麼時候該停。

  • #agents
  • #culture
X

Thibault Sottiaux

DevDay 定在週二,而「打電話給 ChatGPT」已經是每天的工作方式

他把 DevDay 前的這段衝刺稱作 OpenAI 最有野心的一次,說裡面有些東西會改變你的工作方式,並把短時間內能做出這些新能力歸功於 Astra。他講得最具體的一塊是語音:真的就是打電話給 ChatGPT,一邊聊工作、查郵件、寫點程式碼,一邊管日程,整套外掛生態都能用,包括第三方外掛。

  • #products
  • #agents
X

Aaron Levie

Box CEO

成本降下來,拍出來的電影只會更多,不會更少

Levie 轉發並放大了這樣一個論點:門檻下降會讓創意行業變大而不是變小。製片廠敢冒更多險,桌邊坐得下更多人,全新的敘事形式隨之出現。先例是動畫:1980 年代它還被當成這門生意裡的小眾角落,如今成了最受喜愛也最賺錢的敘事形式之一;同樣的還有 Spielberg、Cameron、Jackson 這些把新視覺工具當樂器而不是當捷徑的導演。他自己補了一句:媒介會變,但對創意功力和品味的需求不會變,只是能用上它的人變多了。

  • #creative
  • #products
X

Thariq

帖子說是一次搞定,背後的 prompt 有一萬字元

Thariq 調侃這類帖子:嘴上說「Claude 一把就做出來了」,背後那條 prompt 卻有一萬字元的高見,外加 skills、示例和 API key。與此同時,Claude Code 團隊發了一種新形式的文章,把他們內部實際在用的 prompt 和技巧攤開來講,目標是讓人能照著復現,而不是看著厲害,他們也在問這種形式有沒有用。

  • #prompting
  • #agents
X

Aditya Agarwal

SPC General Partner

該問這支團隊一起幹了多久,而不是有多少人

Agarwal 做盡調的經驗法則:一起共事三年以上的團隊,產出和抗壓能力都明顯強過剛湊起來的班子。一個人職業生涯裡頻繁跳槽說明問題,一家公司離職率低同樣說明問題。他說只問團隊規模而不問團隊在一起多久,是投資人和求職者一犯再犯的錯。

  • #hiring
  • #investing
X

Dan Shipper

Every CEO

Every 的線下聚會是 AI agent 策劃的,連請誰都是它定的

Every 的 agent 把公司九月的聚會從頭包到尾,從餐食酒水選單到邀請名單全歸它管。成績明天晚上六點在他們布魯克林的褐石屋當場揭曉,到場的人來評判 agent 能不能辦好一場派對。

  • #agents
  • #products

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。