12 則來自 12 位 builder

AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 6 分鐘。

今天的主線是 agent 基礎設施:Parallel 的 Parag Agrawal 講清楚了為什麼建立在人類點選之上的搜尋並不適合 agent,而 Vercel 針對同一個問題一口氣發了兩塊管道。Anthropic 把 Claude 對話和 Cowork 的記憶打通,OpenAI 給 ChatGPT 和 Codex 加了團隊檔位,Sam Altman 說 OpenAI 做了一顆晶片。這些訊息底下還有一場更安靜的爭論:錢該誰出,網頁出版方的、資料中心的、token 的。

Podcast

Training Data

Parag Agrawal:人類點選資料是個 bug,agent 搜尋得有自己的經濟模型

Parallel 在做面向 agent 的網頁搜尋,賭的是 agent 的搜尋量會比人類多出上千倍,而 Google 賴以起家的那套排序訊號根本是錯的。「我們在 Parallel 的觀點是,人類點選資料是個 bug,agent 用搜尋來幹活,應該依賴 agent 的反饋,而不是人類的反饋。」公司第一天沒去建全量索引,而是先上線了一個在查詢時才去爬的搜尋 agent,用延遲換覆蓋度,等索引慢慢長起來,最後才回頭攻延遲,做出的產品把三秒的預算壓到了 200 毫秒。Agrawal 還想用 Shapley value 解決給出版方付錢的問題:估算一個信源的價值,看的是少了它之後,要多花多少算力才能把損失掉的質量補回來。他認為讓相當廣泛的內容所有者拿到有意義的分成,還需要 12 到 24 個月。Parallel 現在已經是 Google Cloud 企業級 agent API 的搜尋與 grounding 供應商之一,和 Google 自家搜尋並列作為可選項。

  • #agents
  • #search
  • #products
X

Guillermo Rauch

Vercel CEO

Vercel 釋出 Run SDK,Connect 轉正 GA,兩件事都衝著 agent 執行程式碼去的

Run SDK 是給動態 Code Mode 執行用的安全 eval:agent 寫出程式碼後,不用起一整個 sandbox,直接丟進輕量的 QuickJS 安全上下文裡跑,Rauch 主打的賣點是更快、更省錢。Vercel Connect 同時進入 GA,跑一句類似 `vercel connect create notion` 之後,你就得到一個可以代表已認證使用者去查詢的 MCP client。他給這兩件事的定調是:「構建 agent 最難的問題,是如何安全地連上各種服務和資料。」

  • #agents
  • #products
  • #developer-tools
X

Claude

Claude 的記憶打通了,對話和 Cowork 現在共用一份

把任務交給 Cowork,它會從 Claude 已經在對話裡瞭解到的東西開始:你聊過的那個專案、你老闆的偏好、上個季度那個客戶。所有記住的內容都以話題列表的形式存在設定裡,你可以隨時檢視、編輯、刪除,記憶會在你聊天的過程中自動更新,也可以明確說一句「記住這個」。像健康狀況、宗教信仰這類有些人視為敏感的話題,預設不會進記憶,除非你主動開啟。Free、Pro、Max 三檔都預設開啟記憶。

  • #products
  • #memory
X

Thibault Sottiaux

OpenAI 給 ChatGPT 和 Codex 加了團隊檔位,沒有 5 小時限制

Sottiaux 說這個檔位的呼聲一直很高:用法跟 100 美元的 Pro 計劃類似,但是為團隊和小公司設計的。它打包了 ChatGPT、ChatGPT Work 和 Codex 的全部功能,Google Workspace、Slack、GitHub、Microsoft 365 的聯結器,SAML、SSO 和 MFA,集中計費,帶支出控制的用量分析,以及沒有 5 小時限制。

  • #products
  • #pricing
X

Sam Altman

Sam Altman:「我們做了一顆晶片,很快」

整條推文就這一句。沒有規格,沒有廠商,沒有供貨資訊,但這是他頭一次以這種方式談晶片。

  • #hardware
X

Madhu Guru

Meta Sr Director, AI

大多數 eval 失效,是因為團隊把它凍住了,而使用者行為一直在變

Madhu Guru 的 eval 系列第 9 篇主張,eval 需要的是一份路線圖,而不是一件固定的交付物。拿一個金融研究 agent 舉例:第一週使用者想讓它總結一份 5 頁的財報,三週後想讓它把五份報告對比成一條增長敘事,兩個月後直接甩過來 15 份檔案和電話會記錄,指望拿到一份投資論點,再往後還想要帶告警的組合監控。每個階段需要的 eval 都不一樣,要從短上下文走到長上下文,從單輪走到多輪,從段落級引用走到行級引用,從簡單問答走到綜合歸納,從被動對話走到主動 agent。他給的實操版本是:先梳理出使用方式會沿著哪幾個維度演進,從生產 trace 裡挖出變化的苗頭,然後趕在使用者到達下一階段之前,把那一階段的 P0 eval 建好。如果你的 eval 還停在第一週,使用者已經走到第三週了,這筆賬最後會記在流失率上。

  • #evals
  • #agents
X

Aaron Levie

Box CEO

Levie:價值就落在模型和企業工作流之間的那道縫裡

藉著一篇講規模化應用 AI 戰略的帖子,Levie 提出:世界要的不是裸模型和裸 agent,要的是結果,溢價會給到那些能在具體行業裡把 token 轉化成真實世界成果的人。而這件事真正需要的東西一點都不光鮮:理解上下文,推動變革管理,一套能在多個模型之間路由的 harness,接進某個垂直行業關鍵業務系統的連線,把使用者和 agent 擺進同一個工作流裡的 UX,以及領域專屬的 eval。他認為現在正是一扇敞開的視窗,可以在每一個企業領域裡做出那家定義性的公司。

  • #agents
  • #enterprise
X

Aditya Agarwal

SPC General Partner

一位業內人士談:公眾為什麼討厭建資料中心

Agarwal 說這種反彈一點都不意外,因為今天的 AI 主要是在幫知識工作者,幫的是這個國家收入最高的那一部分人。他認為轉折點會出現在 AI 開始為影響所有人的疾病找到療法的時候,隧道盡頭是有光的,這也是為什麼一些最聰明的人正在往這個方向走。他對行業的自我批評是:我們沒有去描繪一個正面的未來版本,反而把時間花在解釋為什麼每個人都該害怕。

  • #policy
  • #hardware
X

Peter Yang

Peter Yang 開源 /fuck-cancer,給患者和照護者用的 skill

這個 skill 會從你的文件和上下文裡整理出一份單一事實來源的簡報並持續維護,分五個部分:打電話時隨時可查的患者與醫療團隊資訊,明確三條下一步行動,已知資訊(區分已確認事實和待解問題),用大白話解釋的醫學術語,以及記錄近期進展和決定的照護日誌。需要查資料時,它會從 National Cancer Institute 和 ClinicalTrials.gov API 取資料。它可以跑在 ChatGPT、Codex 或 Claude Code 上,結果存成本地 Markdown 檔案或共享的 Google Doc,讓全家人看的是同一份資訊。這個東西源自他分享母親的經歷之後,患者和照護者反饋給他的話,其中一條是:醫生、檔案、保險手續的數量,很快就會壓得人喘不過氣。

  • #open-source
  • #products
  • #health
X

Swyx

警告:Codex 的鎖定使用功能正在把人鎖在 macOS 鑰匙串外面

Swyx 說這周已經把他鎖在外面兩次了,他指出 Apple 開發者論壇已經承認,這是 Codex 目前依賴的那些不穩定 Mac 功能裡的一個已知 bug。他的建議很直接:現在先別用。他其實更想把所有事情都放到雲上做,但他說雲還沒到那個程度。

  • #developer-tools
  • #bugs
X

Google Labs

Google Labs 開放 Play with Putty 候補名單,多人 vibe coding

Putty 是一個協作工具,可以實時一起搭網站和小工具,官方的說法是 vibe coding 進入多人模式。目前僅限候補名單,僅限美國,18 歲以上。

  • #products
  • #developer-tools
X

Nikunj Kothari

FPV Ventures Partner

一個人用 Codex 做的厄爾尼諾監測站,部署在 Railway 上

Kothari 上線了 elneenyo.com,直接從政府信源拉取實時更新和新聞,提供分地區的影響與成本估算、歷史記錄,以及一份解釋各類讀數的術語表和 FAQ。他用 ChatGPT Codex 在 Railway 上把它做了出來,設計上的打磨來自 Emil Kowalski 的 skill,生成式載入動畫來自 Kasturi,靈感則來自一期 Odd Lots 播客。

  • #products
  • #agents

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。