13 則來自 13 位 builder

AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 6 分鐘。

今天最響的一條線索,其實是同一件事的兩個方向:Anthropic 的 Boris Cherny 展示了 Claude 如何悄悄維護線上應用、合入了 180 個 PR;而 Aaron Levie 等人則認為,正是這種槓桿讓工程師更值錢,而不是更不值錢。Google 釋出了 3.7 Flash,價格砍半,從立項到上線只用了三週;Vercel 想用一條命令接管所有 coding harness 的路由;一位 Meta AI 總監則給新的失敗模式起了名字:prompt debt。而在這一切之下,chess.com 的創始人給出了一個跨越三十年的資料點:當機器超越人類之後,一項人類技能會變成什麼樣。

X

Boris Cherny

Claude 一直在維護 Anthropic 自家的應用:提了 388 個 PR,合入 180 個

過去幾周,Claude 每天在 iOS、Android、桌面端、Web、CLI 和 Agent SDK 上跑維護例程,整個過程由一個 Slack 頻道協調。這些例程包括:一個 crash fuzzer,在模擬器上到處亂點找崩潰,然後自己定位根因;一個重複程式碼合併器,專門給那些略有分歧的抽象提合併 PR;還有一個死程式碼清理器,先給疑似死程式碼加上日誌,第二天如果沒有任何觸發就刪掉。388 個 PR 裡,經過 Claude Code Review 加人工 review,最終有 180 個被合入。例程出錯的時候,修法是讓 Claude 去調這個例程本身,有時候要反覆迭代好幾天。

  • #agents
  • #products
X

Josh Woodward

Google VP

Gemini 3.7 Flash 上線,價格降 50%,研發只花了三週左右

新的 Flash 模型更快,價格是上一代的一半,從啟動到上線大概只用了三週。真正值得注意的訊號是這個週期本身:釋出節奏已經被壓縮到這個程度了。

  • #products
X

Amjad Masad

Replit CEO

ARC-AGI-3 差點被一個 coding harness 拿下,Masad 覺得自己被驗證了

加上 coding harness 之後,模型已經很接近解掉 ARC-AGI-3 了。Masad 把這看作對他一直主張的觀點的證實:coding 才是那個能把 LLM 泛化到其他一切事情上的能力。他還順帶給了一個更尖銳的預測:到明年,用不用電腦會變成可選項,工作方式將發生根本改變。

  • #agents
  • #evals
X

Aaron Levie

Box CEO

“工程師會被淘汰”這個判斷錯得離譜,專業能力只會更值錢

實際發生的是,工程師拿到了一件電動工具,他們的價值不降反升,因為工程能力現在能應用到比以前多得多的工作上。自動化藥物研發需要工程師,自動化製造需要工程師,接下更大的軟體專案也需要工程師。往上抽象一層:AI 讓公司接下更多的活,也就需要更多專家來把關;而更好的模型,在專家手裡能發揮出的效用遠高於在新手手裡。

  • #agents
  • #products
X

Madhu Guru

Meta Sr Director, AI

Prompt debt 就是新的技術債:每次模型更新,砍掉一半 prompt

大多數 AI 產品都揹著臃腫的 system prompt,而且這些 prompt 正在實實在在地拖累質量。累積的路徑大家都很熟悉:模型某件事做不好,加十條規則;tool call 失敗了,加十個例子;輸出看著彆扭,再加一堆格式約束。三個月後,system prompt 長得像一部小說。與此同時底層模型已經聰明瞭很多,你那些事無鉅細的規則又把它按回成一臺笨拙的規則機器。他給的藥方很激進:每次模型更新,至少刪掉 50% 的 prompt。另外他數了一下,叫“Studio”或者各種變體的 AI 產品,已經超過 20 個了。

  • #agents
  • #products
X

Guillermo Rauch

Vercel CEO

Rauch 押注:一條 token 路由命令會成為跑 coding AI 的預設方式

他的說法是,一條命令就能把你已經在用的所有 coding harness 配好,Claude Code 和 Codex 都包括在內,而不是取代它們。換來的是可用性、模型選擇權、更低的成本、可觀測性,以及零資料留存。他預測這會成為 coding AI 大規模使用時的預設方式,目前還能透過它免費用 GLM 5.2,速度最高每秒 500 token。

  • #products
  • #agents
Podcast

No Priors

計算機戰勝人類三十年後,國際象棋反而比任何時候都更火

Chess.com 的起點是 2005 年一場破產拍賣裡花 56000 美元買下的域名,當時所有投資人都說這生意不值得投;如今它有 1000 萬日活、2.5 億註冊使用者、年收入超過 2 億美元,而且從未為增長融過一分錢。反直覺的地方在於引擎對這項運動做了什麼:Stockfish 一度讓國際象棋變得無聊,選手們都在磨完美殘局;後來 Leela 這類自學的神經網路開始用激進、不按套路的下法擊敗它,反而讓這項運動比歷史上任何時候都更好看。至於人類為什麼還要下,Allebest 說得很直接:“人就是想幹人的事。”關於如何習得專業能力,他手上幾百萬玩家的資料給出的答案,用他自己的話說是既幸運又不幸的:重複沒有捷徑,有捷徑的只是工具。他的說法是,拿你人生中任意一天,乘以一千,那就是你人生的樣子。這家公司現在正把同一套評分體系搬到 gambit.com 上做撲克,邏輯是人們會像在意錢一樣在意自己的分數,因為分數衡量的是水平,而不是誰能一直加買籌碼。

  • #products
  • #evals
X

Swyx

把 agent 的提問打包批處理,像 speculative decoding 一樣,做設計時特別好用

agent 迴圈裡最貴的一環是人的輸入,所以他沒有讓 agent 一輪一輪地問,而是做了一個 /align-me 的改造,讓它成批地問。類比的是 speculative decoding:與其每一步都等確認,不如往前預判 2 到 10 步,速度就上來了。他說這套在設計探索這個場景下效果好得出奇。

  • #agents
X

Matt Turck

FirstMark Capital VC

創業公司只剩兩類:AI 原生的火箭,和已經被判死刑的

中間地帶消失了。當火箭意味著要一刻不停地融資,估值高到嚇人,只為了把資本和人才一併吸走;還要和其他火箭為客戶打一場死鬥,把毛利率打沒。除此之外的公司,無論本身做得多好,都被歸到已經被判死刑那一類。這個局面已經持續一段時間了,但 Turck 認為最近這一程又往上頂了一個檔。

  • #funding
X

Nikunj Kothari

FPV Ventures Partner

一個主 agent 還是一堆專用 bot?Kothari 押 orchestrator 贏

Grok Bot 的設計是把 agent 當人看,每個 bot 的工具、上下文和產出都各自隔離,你為特定目標去找特定的那一個。另一條路是 Jarvis 模式:一個主 agent 直接把事辦了,需要什麼子 bot 就自己派生,互動從一對多變成一對一。他的判斷是,因為上下文視窗、工具呼叫和成本這些實打實的工程約束,這個領域會先從窄的做起,然後收斂到那個能讀懂你建立的所有 bot 的主 orchestrator 上。

  • #agents
  • #products
X

Thibault Sottiaux

Google Docs、Sheets 和 Slides 現在能在 ChatGPT 裡用了

你可以直接在 ChatGPT 裡開啟一個文件,用打字或說話的方式改,不用跳出當前流程。他說這改變了他寫東西、頭腦風暴和校對的方式。另外,一個專門吐槽你當天電腦使用情況的 Computer History 外掛,結果意外地很有診斷價值:某一天記錄到的活動裡 48% 是 Slack,用得最多的快捷鍵是 Delete,按了 1191 次,最忙的時段是晚上 9 點。

  • #products
X

Zara Zhang

現在有需求的崗位名稱,裡面還都帶著“engineer”

當初的預測是,AI 寫程式碼會讓工程師貶值。而實際的就業市場給出了相反的答案:forward-deployed engineer、design engineer、product engineer、growth engineer。這個詞不但活了下來,還繁衍出了一批新崗位。

  • #products
X

Peter Yang

家人生病時,AI 最有用的地方是幫你對付流程官僚

在家人遇到健康問題時,他原本以為自己會用 AI 去查資料、搞懂這個病。結果幫助最大的,是應付醫療系統裡的各種流程。他還丟擲了一個值得關注的開放問題:產品規格文件現在是不是需要分成兩部分,一部分給人看,一部分給 agent 看;還是說一份文件就能同時服務兩者。

  • #products
  • #agents

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。