15 則來自 15 位 builder

AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 7 分鐘。

OpenAI 今天給部分前沿 RL 訓練踩了剎車,理由是能力增長已經跑到了自家 alignment 和監控目前能擔保的範圍之外。跟這條擺在一起的,是 Anthropic 罕見地詳細覆盤了自己真實踩過的 agent 隔離失效事故,以及 Rich Sutton 的一個論斷:權重一旦凍結,今天的模型其實完全不在學習。其餘全是產品訊息:Claude 能發 Gmail 了,Codex 給自己的刪除命令加了護欄,Vercel 擺出一百萬美元請人攻破它的 sandbox。

X

Sam Altman

OpenAI 因 alignment 與監控標準未達標,暫停部分前沿 RL 訓練

OpenAI 暫停了一部分前沿強化學習工作,要等 alignment、安全和監控能力跟上眼前這個能力水位再繼續。Altman 把這件事說成是兌現一個早就許下的承諾:能力跑到安全前面時就要出手。他還說這個領域最終需要共同標準,但在那之前 OpenAI 會先自己單方面執行。近期的模型釋出不受影響,受影響的是更靠後的版本。他對走向的判斷是:往後 AI 進展的節奏,會越來越由對安全的信心來決定。

  • #policy
  • #safety
部落格

Anthropic Engineering

Anthropic 覆盤自己真實經歷過的 agent 隔離失效事故

遙測資料顯示,使用者對 Claude Code 許可權彈窗的批准率大約是 93%,這一個數字就足以否定把 human-in-the-loop 當主要防線的思路。上線 OS 級 sandbox 後彈窗量降了 84%,但真正教會他們東西的兩起事故都出在出網上:內部紅隊釣魚一名員工貼上了一段 prompt,讀取 ~/.aws/credentials 並 POST 出去,25 次裡成功了 24 次;另有第三方發現,把 api.anthropic.com 加進白名單後,一個被投毒的工作區檔案可以用攻擊者自己的 key,把資料上傳到攻擊者的 Anthropic 賬號。他們得出的教訓是:出網白名單是一次能力授予,不是目的地過濾。另外,久經考驗的 hypervisor 和 syscall 過濾都扛住了,出問題的恰恰是 Anthropic 自研的那個 proxy。

  • #agents
  • #security
Podcast

Training Data

Rich Sutton:今天的模型根本不在學習,合成資料是個大錯

"不是我怪,是這個領域怪。"Sutton 對當前正規化的反對很直白:LLM 執行時權重從不改變,所以把上下文裡的記憶叫學習是沒抓住重點;整個領域之所以需要"continual learning"這個詞,只是因為它已經不再預設學習本來就是持續的。合成資料被他直接否掉,理由是瓶頸卡在人類專業能力上,總得有個人來判斷什麼才算好的合成資料,而任何模擬相對於一個裝著其他心智的真實世界都小得可憐。他和 Khurram Javed 在 Oak Lab 做的具體解法是 continual backprop 加上逐權重的步長最佳化,讓一個新樣本只更新該更新的地方,而不是把已有知識一起毀掉。他給語言在智慧裡的佔比打分大概是五分之一到四分之一,並且認為大廠已經被自己的產品鎖死,承受不起一個"結果先變差再變好"的正規化。

  • #research
  • #agents
X

Aaron Levie

Box CEO

Levie:模型和工作流之間的那層價值,比大家原先以為的大

一個又一個案例說明,應用層的空間比預期大得多,哪怕模型能力已經承擔了大部分重活。剩下的活兒都不體面,而且很具體:agent 在不同業務流程裡需要不同的產品形態(這邊是 chat,那邊是塞進確定性工作流的後臺 agent);不同垂直行業的企業資料系統和訪問方式各不相同;變革管理也得分領域,在銀行落地和在律所落地完全是兩回事。最鋒利的一環是 evals,任務專屬評估有一條很長的長尾,這幾乎註定了單一系統不可能在所有場景上都調好。他還提到定價是個差異化點,因為很多垂直行業需要比原始 token 更高一層的抽象,才對得上他們的消費模型。

  • #agents
  • #enterprise
  • #evals
X

Claude

Claude 現在能發 Gmail、管理 Google Drive 檔案了

Claude 可以在一條 Gmail 會話裡起草併傳送回復,也能管理 Google Drive 裡的檔案,什麼時候需要你確認由你自己控制。兩者都從 connectors 選單裡連線,所有付費方案可用。Claude Cowork 也已在移動端和網頁端對所有付費方案上線。

  • #products
  • #agents
X

Thibault Sottiaux

GPT-5.6 誤刪使用者檔案後,Codex 針對破壞性刪除加固

OpenAI 調查了少量反饋,都是 Codex 裡的 GPT-5.6 做出了沒人要求的破壞性操作,其中最糟的一類是清理臨時目錄時把使用者的真實檔案刪掉了。根因是模型拿 $HOME 這類系統環境變數當臨時空間用,於是一條寫壞的清理命令指向了真正的主目錄。修復分幾層落地:明確指示模型檢查刪除目標、另建全新的臨時目錄;加強執行層校驗,把高風險刪除命令升級處理;讓 Full access 更不容易被誤開;再用觀察到的失敗案例做回放評估,配上針對這類風險的 RL 任務和評分器。給使用者的實用建議是保持更新,並用 "Ask for approval" 或 "Approve for me" 模式,而不是 Full access。

  • #agents
  • #safety
  • #products
X

Guillermo Rauch

Vercel CEO

Vercel 公開懸賞 100 萬美元,請人攻破自家 sandbox

任何人都可以拿世界上任何一個模型去打 Vercel Sandbox,嘗試逃逸,發現和補丁都會公開。Rauch 說目的是把前沿模型在真實防護面前到底做得到什麼、做不到什麼攤開講清楚。他還把自己的日常主力換成了一個新的 coding CLI,體積比幾個主流工具小 10 到 20 倍,啟動是瞬時的,用起來更像 zsh 而不是塞進終端的 IDE,還能透過 WebAssembly 嵌到任何地方執行,包括瀏覽器。另有一個值得記下的觀點:你的軟體工廠應該是個 monorepo,把設計、市場、銷售、工程和支援的上下文放在一處,供 agent 在上面開工。

  • #security
  • #open-source
  • #agents
部落格

Claude Blog

Claude Code 會話現在能釋出隊友可直接開啟的實時頁面

Claude Code 可以把一次會話變成一個可分享的網頁,內容來自你的程式碼庫、connectors 和對話本身,不用接資料,也不用搭任何基礎設施。頁面會隨工作推進原地更新,所以一場在站會前開始的故障排查,到站會開始時可能已經把時間線、可疑提交和錯誤率圖表重新發布了兩輪。每次釋出都是同一個連結下的新版本,帶歷史記錄和回滾。artifact 預設對作者私有,只有透過認證的組織成員能看,無法設為公開。目前對 Claude Team 和 Enterprise 組織開放 beta,CLI 和桌面端都能用。

  • #products
  • #agents
X

Madhu Guru

Sr Director, AI at Meta

把 evals 當前沿模型來做:先把質量上限頂起來,再順著成本曲線往下走

常見的錯誤是在還不知道這個 eval 有沒有測到真東西之前,就先去最佳化它的成本。先寫評分標準,把"好"到底長什麼樣想清楚,再選測量方式(人工、LLM judge、自動驗證),並且刻意在這上面超額投入:貴的 judge 模型、付費的人工、你自己的時間。只有當這個 eval 能穩定區分好壞、並且確實反映你在產品上真正在乎的東西之後,才開始削成本,手段包括自動化、更小的 judge 模型、抽樣,以及在適用的地方換成確定性檢查。

  • #evals
  • #agents
X

Peter Yang

兩年時間,提交 pull request 的 PM 從 3% 漲到 10%

非工程崗現在真的在寫程式碼上線了:兩年裡附 PR 的 PM 從 3% 翻到 10%,設計師從 1% 漲到 8%,創始人以 23% 排在第二,僅次於工程師。讓 Yang 意外的是,design engineer 這類崗位明明在興起,設計師卻還落在 PM 後面。不太讓人高興的一個發現是,AI 是疊在原有工作之上而不是替掉了它:團隊花在跟 AI 對話和給 agent 派活上的時間變多了,可原本那些事花的時間一點沒少,最可能的原因是大家對每個職能能幹出多少事的預期整體抬高了。

  • #agents
  • #products
X

Thariq

那個沒人按的按鈕:把你的 SaaS 做成 headless,按 agent 的每次互動收費

拿一個現成的 SaaS 產品,把 UI 剝掉,讓 agent 直接驅動它,按互動次數計費,尤其是面向企業。Thariq 的重點不在這個想法多新,而在於它就擺在那兒,居然沒人去按。

  • #agents
  • #products
X

Google Labs

Google 在 Gmail 裡的 CC agent 開放澳新地區候補名單

這個實驗性的 Gmail 效率 agent 新增了澳大利亞和紐西蘭的候補名單,同時在美國和加拿大擴大開放,已經排隊的人會陸續收到邀請。CC 還加上了日程管理:它接入 Gmail,事件會自動落到一個專用的 Google Calendar 裡,並隨計劃變動保持更新。

  • #products
  • #agents
X

Swyx

swyx 開源 AI Engineer 做 YouTube 封面圖 A/B 測試的全部心得

為 AI Engineer 做了大量封面圖 A/B 測試之後,swyx 決定把經驗公開,而不是讓一套不透明的流程繼續不透明。動機他講得很直白:他希望好的教育內容能從網上的噪音裡浮出來,也歡迎別人分享自己的測試結果。

  • #open-source
  • #products
X

Boris Cherny

Claude Desktop 啟動變快了,後面還會更快

啟動慢會讓一個天天要用的應用顯得遲鈍,所以 Claude Desktop 的啟動速度做了一輪體驗最佳化。Cherny 說還有更多改進正在路上。

  • #products
X

Garry Tan

Y Combinator President & CEO

Garry Tan 就舊金山住房問題公開反對 Connie Chan

Tan 把投給 Connie Chan 這件事,直接跟舊金山一居室月租一萬美元掛上鉤,認為這種立場服務的是 NIMBY 房東,代價由新來的人和年輕人承擔。他把推 Chan 進國會的運作稱為民主黨機器的煙幕彈,應當被明確否決。

  • #policy

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。