15 則來自 14 位 builder

AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 7 分鐘。

Anthropic 今天花了一整天做自我交代:一份事後覆盤點名了三處各自獨立的改動,正是它們造成了 Claude Code 長達一個月的抱怨,同時給所有訂閱使用者重置了用量額度。OpenAI 也回應了自家關於 Codex 額度的類似質疑,把矛頭指向把訂閱轉賣成 API 的中間商,而不是什麼悄悄改過的政策。在這兩件事底下,面向企業的 agent 敘事正在變硬:sandbox 和 MCP server 現在都能跑在客戶自己的邊界之內。

部落格

Anthropic Engineering

Anthropic 把一個月的 Claude Code 抱怨追溯到三處獨立改動

三處互不相關的改動疊在一起,看上去就像一次全面的質量下滑。3 月 4 日,預設 reasoning effort 從 high 降到了 medium;3 月 26 日的一次快取最佳化本意是清掉舊的 thinking 內容,結果變成整個會話裡每一輪都清一次,Claude 因此變得健忘,還在快取未命中上白白燒掉用量額度;4 月 16 日加進 system prompt 的一行把回覆限制在 100 詞以內,讓 Opus 4.6 和 4.7 的 eval 成績掉了 3%。API 自始至終沒有受影響,三處問題在 v2.1.116 中全部修復,所有訂閱使用者的用量額度正在重置。接下來的做法是:每一次 system prompt 改動都要跑分模型的 eval 套件,逐行做消融實驗,凡是可能拿智慧水平做交換的改動都要先經過一段浸泡期。

  • #products
  • #evals
X

Thibault Sottiaux

OpenAI:Codex 額度沒有變,是 sub2api 轉賣觸發了風控

OpenAI 調查了關於 Codex 用量額度表現異常的反饋,並表示自己不會在沒有先跟社群溝通的情況下改動額度。它查到的是另一回事:不少受影響的使用者在跑 sub2api,把訂閱額度轉成 API 流量再轉售或分給大量使用者使用,這會被反欺詐系統標記。透過官方客戶端,或者 Pi、OpenCode 這類開源客戶端用 ChatGPT 賬號登入,都沒有問題。今天同時上線的還有:ChatGPT 和 API 裡 GPT-Image-2 的透明影象輸出,以及可以和別人一起搭建、能分享出去的 ChatGPT Sites。

  • #policy
  • #products
部落格

Claude Blog

Claude Managed Agents 現在可以在你自己的邊界內執行工具

自託管 sandbox 進入公測:負責編排、上下文管理和錯誤恢復的 agent 迴圈仍然留在 Anthropic 的基礎設施上,而工具執行搬到了你自己掌控的基礎設施,或者 Cloudflare、Daytona、Modal、Vercel 上。程式碼、敏感檔案和程式碼倉庫始終不出你的網路,執行時映象和資源規格也由你自己定,這一點對耗時長的構建或影象生成很關鍵。還在 research preview 階段的 MCP tunnel,讓 agent 透過單條向外的閘道器連線去訪問內部資料庫、私有 API 和工單系統,不需要任何入站防火牆規則,也不用暴露公網端點。Amplitude、Clay 和 Rogo 已經在上面開發了。

  • #agents
  • #products
X

Boris Cherny

Anthropic 要做一種資料全部留在客戶手裡的部署方式

Mythos 級別的模型需要額外的安全措施,而企業自己也有隱私和合規上的要求要滿足。Anthropic 一直在和客戶一起打磨這樣一套方案:資料歸客戶所有、由客戶掌控,Anthropic 一點都不留。今年秋天推出。

  • #policy
  • #products
X

Thariq

Claude 面向企業的新安全防護跑在客戶自己的基礎設施上

面向企業的 Fable 安全防護跑在你自己的基礎設施上,資料存在哪裡、誰能訪問,控制權都留在你這邊。這套東西已經和大約 100 家公司一起打磨過,計劃在秋天更大範圍推開。

  • #policy
  • #agents
部落格

Anthropic Engineering

把 agent 的大腦和手分開,p50 首 token 時間降了 60%

Managed Agents 最早把 session、harness 和 sandbox 塞在同一個容器裡,這就讓容器變成了一隻換不掉的寵物:它一死,會話跟著死,而除錯意味著要登進一臺同時還存著使用者資料的機器。解法是拆成三個可以各自獨立失敗的介面,會話日誌放在 harness 之外,於是 harness 崩了之後可以用 wake(sessionId) 重啟,從最後一個事件接著往下走。容器現在只在真正需要時由一次工具呼叫來建立,所以那些從頭到尾沒碰過 sandbox 的會話不用再為啟動成本買單:p50 TTFT 降了大約 60%,p95 降了超過 90%。安全上的收益是,憑據在跑 Claude 生成程式碼的那個 sandbox 里根本夠不著,prompt injection 再也沒法直接讀自己所在的環境。

  • #agents
  • #products
Podcast

No Priors

一款能恢復真實形狀視覺的視網膜植入物剛在歐洲獲批

Prima 是一塊植入視網膜下方的晶片,由患者眼鏡上的鐳射投影儀驅動,為因黃斑變性失明的人繞開已經死掉的視杆和視錐細胞。它在 7 月拿到歐洲上市許可,未來幾周開始銷售;臨床試驗裡的患者能填數獨、做填字遊戲、讀書,這是此前任何裝置都沒做到過的。背後的觀念是:大腦明擺著就是一臺計算機,把它當計算機來對待,得到的效果量是幾十年小分子藥物研發都沒能拿到的,因為“我把電極放進 M1,你大概一小時之後就能用上一臺計算機”。把大腦做成鍵盤的產品明確不是目標,因為“如果你能拿到視覺、聽覺、平衡感,再加上每秒一千位元的運動控制,你就已經走到通往矩陣的一半了”。柏拉圖表徵假說在這裡是被拿來用的,不是拿來談哲學的:他們能把動物的神經記錄和 AI 模型的內部表徵對齊。

  • #hardware
  • #research
X

Nikunj Kothari

FPV Ventures Partner

投資人非要你有野心的真實原因:錯過的代價太高了

LP 們眼看著 Anthropic 以史上最快的速度從零衝到一萬億估值,SpaceX 以 1.77 萬億上市,Cursor 四年做到 600 億,還給早期基金返了實打實的 DPI。他們的反應是把錢大把倒進超級基金,而基金一旦大到那個體量,每一張支票,哪怕是 A 輪,都必須按萬億級的結果來做承銷。到了那一步,入場價格就不重要了:2 億、3 億、5 億,有時候 10 億,放在被建模的那個結果面前都是一回事。於是錯過的代價遠遠大於投錯的代價,基金再也不敢漏掉任何一個有熱度的專案,剩下的交給冪律。這就是野心會主導整場 pitch 背後的算術。

  • #funding
X

Aaron Levie

Box CEO

post-training 正在變成應用型 AI 公司的成本槓桿

一旦你對某個領域理解得足夠深,手上又有一批相似任務的規模量,專門為這類活兒定製一個模型就開始划算了。機制在於 post-training 裡的獎勵塑形:在效能相當的前提下,更偏好那些消耗更少 token 的軌跡,這“讓我們能同時最佳化成本和質量,在成本保持穩定的情況下拿到明顯的效能提升”。這套做法不是到處都成立,通用的前沿模型往往已經夠用,有時候乾脆是非用不可。但如果你既有很深的垂直積累,又碰上成本高到沒法規模化執行,或者手上的任務型別壓根沒人在訓練,那對於貼著企業工作流的公司來說,這就是一個很有吸引力的位置。

  • #products
  • #research
X

Madhu Guru

Meta Sr Director of AI

企業做不好 AI,是因為壓根沒有 eval 策略

一套 eval 是不夠的。你需要一組階梯式的 eval,鋪開在成本和真實度的兩端之間,並且按你自己的用例來調。爬坡型 eval 負責往前推產品邊界,必須持續更新,才能不斷提升質量、擴充套件功能。迴歸型 eval 負責接住爬坡過程中被弄壞的東西,冒煙測試覆蓋那些絕對不能出錯的基本項,比如產品身份認知,而上線前的 eval 貼著真實流量跑,控制最少,真實度最高。

  • #evals
X

Peter Yang

讓一個 manager agent 用激將法逼 worker agent 交出更好的結果

Yang 的直覺是,很多 AI 輸出只要加一個 manager agent 不斷頂回去的迴圈就能變好:“你確定這已經是你能做到的最好了?”、“我覺得你還能更好,再來一次”、“再仔細看看,給我 11 分(滿分 10 分)的輸出”。他的 YouTube 訂閱也過了 10 萬,已經排上的訪談包括:今天的模型如何徹底改變了 eval、哪些 vibe coding 做出來的應用真的做成了生意,以及 ChatGPT Finance。

  • #agents
X

Aditya Agarwal

SPC General Partner

SPC 篩人最看重的特質是清晰,不是履歷

清晰指的是能誠實面對、能穿透戰場迷霧、能在渾水裡找出一條路,Agarwal 說這是 SPC 最看重的一項特質。他舉的極致例子是 Sridhar Ramaswamy,此人把 Google 廣告從 10 億做到 1000 億,如今正帶著 Snowflake 穿越 AI 轉型;這期 Minus One 聊了什麼時候該冒職業風險、Neeva 到底哪裡出了問題,以及模型接下來會走向何方。還有一句相關的:最好的創始人都是還原論者。

  • #funding
X

Swyx

NVIDIA 花 60 億買下的模型工廠,產出勝過 Thinky 級模型

swyx 最新一期 Latent Space 的嘉賓,正是 NVIDIA 剛花 60 億美元收購其模型工廠的那個人。他堅持說“產出能壓過 Thinky 級模型”這話不是誇張,看數字就知道。他還點出 agent skill 領域正在冒出來的一個模式:Matt Pocock 的 /wayfinder,是給 /grill-me 用的 /grill-me,專為那種你還困在戰場迷霧裡、得先編排一輪調研和後續幾輪 grill 才知道自己不知道什麼的時候而做。

  • #funding
  • #agents

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。

AI構建者摘要 — 2026-08-21 · LLMRates.ai