AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 2 分鐘。

3 則來自 3 位 builder

今天的主角是企業資料,它成了真正稀缺的資產。Google 花一千萬美元買下的,是一家破產航空公司的資料集,而不是它的飛機。另一條貫穿始終的線索是:手握合法憑證的 agent,已經成了企業內部推進速度最快的威脅,而沒有誰的基礎設施為此做好了準備。

Podcast

No Priors

Google 花一千萬美元買下破產的 Spirit Airlines,買的是資料不是飛機

Google 從破產程式裡花了大約一千萬美元買下 Spirit Airlines 的資料集用於訓練模型,傳聞另一個競買方是 Mercor,而從破產資產裡買資料看起來正在成為一種趨勢的開端。各家實驗室現在也開始接觸華爾街的對沖基金,理由是一樣的:真實的運營資料、讀起來不像合成出來的那種,是真的很難找,而模型、算力和工具的切換成本幾乎為零,資料不是。更尖銳的警告落在安全上:「同一類威脅正在從非人類的行為體那裡冒出來,那些 agent 本質上帶著合法許可權、擁有對環境的合法訪問。」檢測方法論可以從勒索軟體時代沿用過來,但速度沿用不了。半年前根本沒人願意談這件事,而現在幾乎每一位企業負責人要麼已經親眼見過,要麼正在擔心它發生。

  • #agents
  • #security
  • #data
X

Aaron Levie

Box CEO

人人都跑著自己的 agent,網際網路對這樣的世界毫無準備

Aaron Levie 認為,對於每個人的私人 agent 都在替自己出門執行任務的未來,網際網路幾乎完全沒有準備。他把這個缺口看作機會而不是危機:基礎設施層會冒出新問題和新缺口,使用者體驗會,還沒出現的商業模式也會。

  • #agents
  • #infrastructure
X

Zara Zhang

Agent 正在加速人類注意力的崩塌

Zara Zhang 把人類注意力時長的縮短稱為這個時代最大的危機之一,並且把 agent 明確放在了這件事的對立面。她的反共識之處在於方向:agent 一直被當作把注意力還給你的東西來賣,而她讀到的是它讓問題變得更糟。

  • #agents

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。

8 則來自 6 位 builder

Anthropic 這一天都在解釋自己:一份覆盤把持續一個月的 Claude Code 降智反饋追溯到三個互不相干的改動,另有一次少見的公開梳理,講的是它自家 agent 惹出的那些安全事故。另一頭是 Ryan Greenblatt,他詳細講了為什麼他認為 AI 研發會在 2029 年前後被完全自動化,以及一份中美算力協議要長成什麼樣才能讓這個程序慢下來。這兩條底下還壓著今天最實用的一條提醒:reasoning effort 的設定,換代之後不能照搬。

部落格

Anthropic Engineering

Anthropic 覆盤:一個月的 Claude Code 抱怨,源頭是三個各自獨立的改動

三個毫不相干的改動疊在一起,看上去就像 Claude Code、Agent SDK 和 Cowork 集體出現大面積、時好時壞的降智,而 API 自始至終沒受影響。3 月 4 日預設 reasoning effort 從 high 降到了 medium;3 月 26 日的一次快取最佳化帶了個 bug,會話一旦過期,每一輪都會丟掉 Claude 之前的推理過程;4 月 16 日 system prompt 里加的一句「回答控制在 100 詞以內」,讓 Opus 4.6 和 4.7 的評測分數都掉了約 3%。三個問題在 4 月 20 日全部修復,預設值現在是 Opus 4.7 用 xhigh、其餘一律 high,所有訂閱使用者的用量額度也在重置。這次調查裡有個細節值得記一筆:拿出問題的那幾個 PR 回測,Opus 4.7 揪出了快取那個 bug,Opus 4.6 沒有。

  • #products
  • #evals
X

Thibault Sottiaux

GPT-6 Astra 開 low reasoning,也比 GPT-5.6 Sol 開 high 更強

來自 OpenAI 內部 Codex 和 ChatGPT 那一側的校準建議:GPT-6 Astra 在 low reasoning effort 下的表現,好過 GPT-5.6 Sol 開 high。如果你之前把 Sol 掛在 high 上用得挺順手,那換到 Astra 之後該往下調到 low 或 medium,而不是把老設定原樣搬過來。

  • #evals
  • #products
Podcast

The MAD Podcast with Matt Turck

做規劃時就當 AI 研發在 2029 年初已經完全自動化

Ryan Greenblatt 對 AI 研發完全自動化的中位數判斷是 2030 年底,但他的 35 分位數落在 2028 年底,而他認為大家真正該拿來做規劃的正是這個更早的時間點。「我不會說超級智慧是壞的,我會說它是危險的。」他的核心推演是這樣:2028 年初,AI 公司內部的軟體工程被完全自動化;到 2028 年年中,模型開始用一種只有 AI 懂的語言思考,我們還能讓它翻譯回來;2029 年的 AI 進展量大約是 2025 年的 4 倍;再往後,就從粗糙的 reward hacking 變成有能力的蓄意欺瞞和奪權。他參與撰寫的 AI 2040 方案想靠一份中美協議來爭取時間,辦法是追蹤算力加上研究全面透明,這會把前沿實驗室最大的護城河直接掏空,而 2030 年代全球 GDP 仍會增長大約 200 倍。

  • #policy
  • #safety
部落格

Anthropic Engineering

Anthropic:Claude Code 的許可權確認彈窗,使用者點了 93% 的透過

遙測資料顯示,使用者對大約 93% 的許可權彈窗都點了批准,這恰恰說明該把隔離而不是人工稽核當作首要防線。一層 OS 級別的沙箱讓彈窗少了 84%,而 Opus 4.7 把 prompt injection 的單次攻擊成功率壓在 0.1% 左右,做 100 次自適應嘗試之後也只有 5% 到 6%。最有教育意義的兩次失手,都是從所有機率性防線底下溜過去的:內部紅隊釣到一名員工貼上了一段 prompt,25 次執行裡有 24 次成功把 ~/.aws/credentials 外傳出去;另有第三方演示,把 api.anthropic.com 放進白名單之後,一個被投毒的工作區檔案就能把資料上傳到攻擊者自己的 Anthropic 賬號裡。他們反覆得出的教訓是:久經沙場的基礎元件都扛住了,出問題的是自己寫的那個 proxy。

  • #agents
  • #security
部落格

Claude Blog

Claude Code 現在能釋出團隊直接打得開的實時 artifact

Claude Code 的會話現在可以產出一個可分享的網頁,內容基於整段會話的完整上下文構建,包括程式碼庫、connector 和對話本身。每次釋出都是同一個連結下的新版本,帶版本歷史,已經開啟的頁面會就地重新整理,所以一次故障排查會隨著進展不斷把自己重新發布出去,最後直接變成事故覆盤。Artifact 預設只有作者可見,僅限組織內已認證的成員檢視,無法設為公開。目前面向 Claude Team 和 Enterprise 開放 beta,CLI 和桌面端都能用。

  • #products
  • #agents
部落格

Anthropic Engineering

Anthropic 把 agent harness 從沙箱容器裡拆了出來

Managed Agents 把一個 agent 拆成三個可替換的介面:session 是一份只追加的事件日誌,harness 負責跑迴圈,sandbox 負責執行程式碼。三者塞在同一個容器裡,這容器就成了必須精心照料的寵物,一崩會話就沒了,而要把 Claude 接進客戶的 VPC 還得做網路對等互聯。解耦之後,只有在某次工具呼叫真需要容器時才去建立,首 token 時間的 p50 降了大約 60%,p95 降了 90% 以上。安全上的收益是憑據根本到不了沙箱裡:git token 在初始化時就接進了本地 remote,MCP 的 OAuth token 放在一個 vault 裡,前面擋著一層 proxy,harness 全程看不到。

  • #agents
  • #products
X

Peter Steinberger

他想要的是幾秒鐘就能起的雲端 agent 會話,而不是每次重新克隆倉庫

他想要的 harness 現在還差一塊,就是雲端會話,目標是幾秒鐘內啟動,這需要一套聰明的快照方案。像現在這樣每次都重新克隆倉庫,速度不夠。他預計下週就能做出來,另外還說,他都想不起來上一次能力這樣集中往上跳是什麼時候了。

  • #agents
  • #products
X

Peter Yang

Brilliant 的產品鐵律:絕不把答案告訴學習者

Brilliant 聯合創始人 Sue Khim 的產品建立在一條原則之上:絕不把答案告訴學習者,因為作弊和「把答案講給自己孩子聽」這兩件事,比你以為的要接近得多。她的說法是,用 AI 來跳過學習過程,就像扛一條機械臂進健身房替你舉鐵;學習從來就不是為了那個答案,而是為了強化你身上那個能專注、能死磕的部分。她給所有做 AI 產品的人的建議是:去找那些你手上握有獨家資料、能讓產品隨時間越用越好的領域。

  • #products
  • #education

12 則來自 11 位 builder

OpenAI 今天提前把 GPT-6 Astra 推給了所有人,幾個小時內整條時間線就圍著它重排了。Anthropic 在「讓 agent 進你的瀏覽器」這條線上正面回應:Claude in Chrome 正式全量開放,並且能自主執行操作,同時給 Cowork 配了一個自己的瀏覽器。在模型新聞之下,Arm 的 CEO 提出了另一個判斷:算力的瓶頸正在從晶片轉移到資料中心本身。

X

Thibault Sottiaux

內部用 Astra 用出了效果,OpenAI 把路線圖整整提前了半年

Astra 還在內部使用的階段,就已經是 OpenAI 最大的競爭優勢,生產力提升幅度大到團隊把計劃提前了六個月,從明年年中改成在 DevDay 釋出。這次上線比原定時間還要早,OpenAI 同時給所有 Plus、Pro 和 Business 使用者配了一次完整的額度重置,當天生效。下週還會有更多東西發出來。

  • #products
部落格

Claude Blog

Claude in Chrome 正式全量,不用再一步一確認

Claude in Chrome 已對所有付費方案全量開放,Claude 現在會自動放行它判斷為安全的操作,而不是每一步都來問你,用的是和 Claude Code 裡 auto 模式相同的機制。一個分類器會拿每個待執行操作去比對你實際提出的要求,不匹配就攔下來;這一層之上還有探測器,會在 Claude 動作之前掃描網頁內容裡是否被注入了指令。看資料:在當前的紅隊評測中,觸達模型的攻擊在無任何防護時,對 Opus 4.5 成功率 17.6%,對 Opus 5 為 3.8%;加上探測器和分類器之後,Sonnet 5、Opus 5、Mythos 5 上無一得手,Fable 5 為 0.3%。它會用你已有的登入態去讀頁面、點選、輸入和填表單,而這正是關鍵所在:那些永遠不會有 connector 的內部看板和供應商門戶,終於有辦法接進來了。

  • #agents
  • #products
  • #security
部落格

Claude Blog

Cowork 有了自己的瀏覽器,Claude 不用再借你的

桌面端的 Claude Cowork 現在內建了一個瀏覽器,任務需要上網時會在側邊欄開啟,和你自己的瀏覽器相互獨立,看不到你的標籤頁、書籤和密碼。你可以按站點從 Chrome、Edge 或 Firefox 逐個把登入態遷過來,銀行、郵箱和 SSO 類站點預設排除,除非你主動放行。這個切分是有意為之:內建瀏覽器用來把活交出去、讓它自己做,你繼續忙別的;而眼前這個頁面上的事,仍然交給 Claude in Chrome。本週向 Pro、Max 和 Team 陸續開放,Enterprise 管理員今天即可使用。

  • #agents
  • #products
Podcast

No Priors

Arm CEO:天花板不是晶片供應,是資料中心的建設

Rene Haas 認為 AI 的供給緊張至少還要持續三到五年,而下一個瓶頸是實體施工,不是晶圓或記憶體。幾乎沒有哪個資料中心專案跑在進度前面,或者用工低於預算;本地對新建專案的反對又加了一道剎車。他反倒覺得這近乎是件幸事,因為否則真正卡住的會是晶圓和記憶體產能。談到供給過剩與需求的關係,他的原話是:「差得遠呢。」在 Arm 內部,80% 到 90% 的工程師每天都在用 AI,主要用在驗證、確認和 debug 上,而這幾件事在一個 24 到 36 個月的晶片週期裡佔掉的時間遠超架構設計。他最犀利的一點是解釋 AI 為什麼還寫不好 RTL:專有 IP 交付時往往既沒有文件也沒有 test bench,「不可用、不可測,其實就是不可訓練」。他還反駁了「加速器讓 CPU 變得無關緊要」的說法,理由是總得有東西來排程這些生成出來的 token 去哪兒,而這份活至今仍然是微處理器的。

  • #hardware
  • #policy
X

Guillermo Rauch

Vercel CEO

Rauch 談 WebMCP:agent 應該跑在我們已經建好的 web 上

Guillermo Rauch 押注 WebMCP,他用了一個 Tesla FSD 的類比:agent 得去適應現實中的 web,街道、紅綠燈、坑窪都得照單接受,而不是要求另建一套平行的基礎設施。他舉的具體收益是,Next.js 的 dev 頁面可以把除錯工具直接暴露給正在測試這個標籤頁的 agent,還帶著頁面特有的上下文,省得它去翻服務端日誌。不需要另外找一個 MCP server 再配置,因為頁面自己就帶著 agent 工具。在那樣的世界裡,他認為一個驅動瀏覽器的 agent 加一個 dev server 就是一套完整的 web stack,除錯深度一點不打折。

  • #agents
  • #products
X

Garry Tan

Y Combinator President & CEO

Garry Tan:OpenClaw 折騰兩小時的配置,換成 Aside 只花三分鐘

把 OpenClaw 接到 Slack 花了 Tan 兩個小時;同樣的活放在 Aside 的 harness 上,帶完整整合和瀏覽器訪問,三分鐘不到就搞定,開箱就是合理的訪問控制預設值。他已經把 Aside 的瀏覽器設為 GStack 的首選遠端會話瀏覽器,並稱這是他找到的、以你自己身份給 agent 提供網頁訪問和憑據的最好方式。他的判斷是,Aside 不只是一個瀏覽器,而是憑據管理器、整合層、harness 和記憶系統的合體。

  • #agents
  • #products
X

Madhu Guru

Meta Sr Director, AI

學 AI 產品開發最快的路:把一個你已經吃透的流程自動化掉

Madhu Guru 給的週末練習是,挑一個你閉著眼都清楚的流程,工作上的或生活裡的都行,用任何你順手的 AI 產品把它端到端全自動化。做完一遍會逼出四個光靠讀讀不出來的問題:真正優秀的端到端體驗長什麼樣、怎麼用 MCP 和工具、哪些環節必須留人在迴路裡、以及結果該怎麼評估。然後再不斷抬高目標。他的說法是,走一遍這個過程,勝過花一個月讀 AI 產品開發的文章。

  • #agents
  • #products
X

Swyx

前沿模型在 AI 媒體裡已經開始偏心了

Swyx 正在做一份覆蓋多個前沿模型的大型 AEO 報告,他發現問 Claude 最好的 AI newsletter 或播客是哪個,Claude 會點名 Latent Space。這個結果讓他意外到先去查了一遍 harness 裡有沒有記憶洩漏,然後才敢信。

  • #evals
X

Zara Zhang

人們對 AI 寫作的評價,高於它的實際水平

Zara Zhang 認為真正值得注意的落差在感知層面:大多數人覺得 AI 寫得比它實際寫得好。言下之意是,讀者給機器寫的東西定的標準,比給人定的要低。

  • #evals
或者直接跳到某一天