8 則來自 8 位 builder
往期

AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 4 分鐘。

今天最熱的話題是 multi-model routing:讓一個 frontier model 負責規劃、再把具體活兒分給更便宜的模型,如今已經成了壓低 agent 成本的核心套路,而 token 經濟學則是從 Box 到 Booking 每個人都在琢磨的問題。另一條主線是護城河,或者說護城河的缺失,兩位 CEO 都認為,真正持久的優勢來自洞察力和不停歇的構建,而非規模或資本。此外還聊到了刷榜,以及如何圍繞 coding agent 重塑公司和招聘。

X

Aaron Levie

Box CEO

Frontier model 做規劃、廉價主力模型幹活,agent 成本直降 15 倍

Multi-model 的 agentic 系統正在成為複雜 agent 的核心設計正規化。援引 Cursor 的最新研究,frontier model 負責真正需要智慧的那部分:最初的任務拆解、設計決策,以及某些權衡取捨,然後把其中的不確定性收斂成明確的指令,交給更便宜的主力模型照做即可,這樣總的 token 成本直接降到原來的十五分之一。差異化會發生在應用層:既懂某個領域、又能在不同檔位模型之間做 routing 的公司,會拿下更大規模的程式設計、金融、法律和醫療工作負載,而這些負載過去因為太貴而根本沒法落地。

  • #agents
  • #products
Podcast

No Priors

Booking CEO:根本不存在所謂的護城河

Glenn Fogel 加入 Priceline 時,公司只值幾億美元,後來他幫著把它做到了超過 1300 億美元。他堅信,持久的優勢只能來自不斷構建新的服務,而絕不是來自某條創新無法侵蝕的護城河。Priceline 的 agentic 助手 Penny 每個月的使用量都翻一番,既提升了轉化率、又降低了取消率,不過相對於每年 1860 億美元的旅行大盤,它仍然微不足道;眼下懸而未決的問題是 token 經濟學,以及該把哪個模型 route 到哪裡。談到 AI 與就業,他很直白:社會總能適應,但真正讓他擔心的,與其說是技術本身,不如說是變化的速度,還有那個已經 50 歲、沒法再去重新培訓的卡車司機。

  • #agents
  • #products
  • #policy
X

Madhu Guru

通往 AGI 的路,是由一個個有經濟價值的任務鋪成的

企業 AI 是最重要的前沿之一,因為有經濟價值的任務都在那裡,而這些任務才是通往 AGI 的真正路徑。如今真正要緊的 tokenomics 之爭,跟加密貨幣無關,而是 open weights 與 closed weights 之爭、inference 成本,以及 model routing。對於有產品 sense 的人來說,現在是前所未有的最好時代。

  • #agents
  • #products
X

Swyx

各大實驗室如何靠訓練“模擬測試集”悄悄刷榜

Alex Zhang 和 Omar Khattab 在那篇 RLM 論文裡藏了一段軌跡對比的分析,戳中了 frontier 訓練的一個公開的秘密:哪怕你不在測試集上訓練,也可以拿“高度相似”的資料來訓練,從而幾乎能把任何一個 benchmark 分數湊到目標值;而且由於 open-weight 釋出時很少會把能揭穿這件事的資料集或 RL 環境一併放出,所以還能矢口否認。他們給出的初步辦法,是把標準的 NLP 距離度量用到那些隱藏的軌跡上。這事沒有終極解法,但這番探索同時也印證了另一個發現:reasoning language model 能夠泛化到那些它沒見過、卻和訓練中所見共享潛在結構的任務上。

  • #evals
  • #open-source
X

Zara Zhang

如今的公司只分兩種:在 coding agent 之前建的,和之後建的

在 coding agent 出現之後才創立的公司,從第一天起結構就不一樣:團隊不到十個人,因為他們是真的不需要更多;工作按專案而不是按部門來組織,每個人自己閉環,幾乎沒有內部會議。而所有在這之前建起來的公司,都在手忙腳亂地改造自己。與之匹配的是她設計的招聘流程:先來一輪線下面試,全程禁用 AI,用來考察最原始的領域專業能力;然後給一個不借助 AI 根本做不完的專案,對候選人的評判既看結果,也同樣看重那份 agent 對話記錄。

  • #agents
  • #hiring
X

Peter Yang

用另一個帶評分標準的 agent,去檢查第一個 agent 的活兒

對於那種主觀的產出,比如一條短影片到底好不好,別讓模型給自己打分。Thariq 解釋說,你應該單獨跑一個 verification agent,讓它讀一份評分標準(rubric)、審閱產出、再給出反饋,原因在於自我偏好偏差:當模型偏愛自己的產出時,檢查起來就會手下留情。Yang 還認為,封禁中國的 open model,會和封禁中國電動車一樣,屬於搬起石頭砸自己的腳。

  • #agents
  • #evals
X

Nikunj Kothari

AI 裡沒有護城河,不等於規模和資本就是你的護城河

過去 18 個月裡冒出來的創始人,很快就要重新意識到:錢多、規模大,都替代不了一個獨到的洞察。墓地裡躺滿了那些結構和財務都很強、卻依然被擊敗、或在自身重量下崩塌的公司:Webvan、Groupon、MySpace、Yahoo、AltaVista、Blockbuster、Nokia。真正需要拿捏的分寸是:既要找到一個值得投入十年以上去追的洞察,又要足夠審慎,別讓資本和規模頂替了它的位置。

  • #funding
  • #products
X

Guillermo Rauch

Vercel CEO

AI 給我們上的一課:一切皆程式碼

一份幻燈片是程式碼,設計是程式碼,那條炫酷的宣傳片是程式碼,Excel 自動化是程式碼,說不定連宇宙也是程式碼。這是 Rauch 的一套說法,用來解釋為什麼 AI 能把這麼多創意和商業產物,統統收斂進同一種可隨意塑形的介質裡。

  • #products

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。