12 則來自 12 位 builder
往期

AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 5 分鐘。

今天的成本基準,關注點從 token 轉向了任務:Vercel 公佈的資料把 Grok 4.5 送上了網路安全價效比榜首,而 Kimi 那篇講 agent 沙箱的論文則認為,容器根本算不上真正的安全邊界。在這之下,更有意思的一條線其實關於介面:Granola 的 CEO 和 Dan Shipper 不約而同地想到了同一件事,agent 和人需要同時操作同一套 UI。另外,Aaron Levie 又一次拿他從企業客戶那裡聽來的情況,反駁了所謂的 AI 就業末日。

X

Guillermo Rauch

Vercel CEO

Grok 4.5 拿下網路安全價效比第一;容器不是安全的 agent 邊界

Vercel 最新的基準測試把 Grok 4.5 列為價效比最好的網路安全模型:比 Sol 便宜 10 倍,比 Opus 5 便宜 5.7 倍,比 Kimi K3 便宜 2.2 倍,效能卻大致追平了 Kimi。前沿位置仍然穩穩握在 Sol 手裡,排在 Opus 5 之前。另一件事,Rauch 提到了 Kimi 那篇討論 agent 該在什麼環境裡執行的論文:容器級別的隔離並不夠,因為在他們的實驗裡,agent 透過 kernel panic 直接把底層機器搞崩了。他的判斷是,像 Vercel Sandbox 用的那種 Firecracker microVM,才是真正扛得住的邊界。

  • #evals
  • #security
  • #agents
Podcast

AI & I by Every

Granola CEO:會議紀要不是獎品,工作介面才是

Chris Pedregal 認為,眼下所有人搶破頭的 AI 會議紀要,並不是價值最終沉澱的地方。Notion、OpenAI 和 Zoom 都推出了競品,Granola 的增長速度卻一點沒受影響,這反而印證了他的看法:真正的戰場是在 AI 原生的世界裡,我們用什麼介面來工作。他下的最具體的一個賭注是“預生成”:Granola 會生成數百萬份會前簡報,明知只有很小一部分會被開啟,因為真正有用的時刻,就是你遲到了、又想不起來馬上要見的人是誰的那十五秒。他把這個產品形容成扶手,不摔跤的時候你根本注意不到它。聊到創業,他說:“我原來以為,創業只有在做不成的時候才特別難。結果發現,做成了也一樣難。”團隊上週才開始統計 token 花銷,起因是有人一天在 Fable 上燒掉了兩千多美元。

  • #products
  • #agents
X

Swyx

按 token 算錢,一年前就不再是有效的成本衡量方式了

Swyx 認為,輸入和輸出 token 的單價作為一種有意義的橫向比較,大概在去年就已經死了;今天還在用這個口徑、而不是“每個任務多少錢”來畫成本曲線的人,不值得認真對待。他還回頭捅了自己一刀:他最為人所知的那個 agent 實驗室論調,在 Claude Code 今年事實上開源之後遭到了最有力的反駁,因為它自己的路線圖和競爭對手的路線圖幾乎都沒有發生任何變化。

  • #evals
  • #agents
X

Aaron Levie

Box CEO

企業還在招人,只是崗位變了

Levie 說,大家預言的 AI 就業崩塌,在他接觸的企業裡始終沒有出現。它們在招工程師,去啃那些以前根本夠不著的問題;在招銷售,因為 AI 讓他們能把客戶關係做得更深;還在招內部的前置部署工程師,專門負責真正把 AI 落地。他把這解讀成傑文斯悖論正在上演。他更尖銳的一個判斷是:只把 AI 用來省成本的公司,會被那些用它把客戶服務做得更好的公司打敗。他也承認,這個趨勢有可能反過來。

  • #policy
  • #products
X

Peter Yang

騎車路上,Codex 剪完併發出了一支釋出影片

OpenAI 負責 DevEx 的 Jason Liu 正在騎車,被人叫去改一支釋出影片。他用手機連上 Codex,讓它透過 computer use 剪輯影片、匯出,再把成品發回 Slack 那個討論串;接著交代它每三十分鐘去看一次那個串,根據反饋依次匯出 V2、V3 和 V4。等他到家,影片已經過審了。這是一個很乾淨的例子:agent 對著一個人類評審頻道跑非同步的修改迴圈,全程沒有人守在鍵盤前。

  • #agents
  • #products
X

Madhu Guru

Meta Sr Director, AI

產品評審該模擬市場,而不是彙報進度

Madhu Guru 的觀點是,一場好的產品評審能把幾個月的認知壓縮排一小時,辦法是模擬市場會怎麼回應你的想法;而這件事成立的前提,是坐在會議室裡的人真的懂這個領域、有品味、有強烈的觀點,並且大多數時候是對的。可惜多數評審已經滑向了進度同步、給領導刷存在感和跨部門對齊。這種滑坡正是大家反感評審的原因:會議不再產生認知,只剩下損耗。

  • #products
X

Amjad Masad

Replit CEO

下一片要測繪的疆域是計算宇宙

Masad 把當下形容成一個新的大航海時代。上幾代人先測繪了地球,然後走向太空;這一代人拿到的,是由演算法、程式、證明和設計構成的那片空間,可以讓 AI agent 到其中去搜尋。這本質上是一個立場選擇:把 agent 看作在可能性空間裡做搜尋的引擎,而不是提效工具。

  • #agents
X

Matt Turck

不到 40% 的 VC 投出過一筆成功的案子

Turck 提到一項新研究:不到 40% 的風險投資人名下有過哪怕一筆成功的投資。然後他自己把包袱抖了出來:每一個讀到這條的 VC,心裡都篤定自己屬於那 40%。

  • #funding
X

Peter Steinberger

一個 agent 報了 bug,另一個 agent 連夜修好了

Steinberger 的 agent 報出一個 bug,Jarred Sumner 那套 robobun 把它修掉了,全都發生在同一個晚上,兩頭都沒有人參與。他說這套東西就是未來。他還提到一件讓人無奈的事:明明是和很強的合作團隊一起在認真做安全,卻仍然有人預設這個產品不安全。

  • #agents
  • #security
X

Nan Yu

Linear head of product

既然你的聰明人這麼聰明,就讓他們去打磨自家產品

Yu 反對自己造一套內部版工具:一款產品之所以好用又順手,背後是一大批非常聰明的人在非常賣力地打磨;所以你要是手上有非常聰明的人,就該把他們放到自家產品上,然後花點小錢去買別人做好的。這是把 build 還是 buy 的論證壓縮成了一句刺。

  • #products

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。