15 則來自 15 位 builder

AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 5 分鐘。

Cursor 的結局成了這一天裡應用 AI 的羅夏墨跡測驗,創業者們從中讀出的結論是:價值就沉在模型和工作流之間的那一層。拋開這些表態,更有價值的思考來自真正在做長週期 agent 的人:當沒有編譯器替你把關時,你要怎麼驗證 agent 乾的活;以及為什麼你 context 裡的那些英文,比你的程式碼更值得花心思。Google 把 3.7 Flash 推進了 Gemini app,Anthropic 則讓 Claude 接入了 Apple 的 Foundation Models framework。

X

Aaron Levie

Box CEO

Cursor 打碎了一個假設:開發者工具最多也就賣到十幾億美元

agentic coding 的市場規模,遠超幾乎所有人此前的測算,而且 Cursor 起步的那個時間點,大家普遍認為這塊已經飽和了。值得抄的打法是:為 agentic 的工作方式找到對的產品形態,站在模型和工作流之間做中立的一層,只在能壓低成本或提升表現的地方去 post-train 模型,圍繞具體工作流自建基礎設施,再配上和品類相匹配的 go-to-market。在使用者和底層模型之間,可以創新的空間比人們以為的大得多。

  • #agents
  • #products
Podcast

The MAD Podcast with Matt Turck

一百次 eval 全過,也說明不了 agent 能不能泛化

Basis 做的 agent 能端到端準備整份報稅表,推理步驟深達數千步,而核心教訓是:只看結果的 eval 遠遠不夠。「就算你一百次裡對了一百次,如果一個人只是靠去翻 Wikipedia 才做對的,會計師事務所不會僱他,那也就不該僱我們。」解法是 behavior spec:一份份 markdown 檔案,從不給 agent 看,由一個充當裁判的 agent 拿它來給 agent 的完整軌跡打分,這樣你獎勵的是過程,而不只是答案。最扎人的一句是衝著工程師去的:有人一門心思糾結抽象設計,自己的 context 卻一團亂,可執行時真正影響表現的是那些英文,程式碼怎麼組織並不影響。

  • #agents
  • #evals
  • #open-source
部落格

Claude Blog

Claude 現在可以透過一個 Swift package 接進 Apple 的 Foundation Models framework

Apple 開發者可以把輕快的本地任務交給端上模型,遇到需要多步推理、程式碼生成、網頁搜尋或程式碼執行的請求,再轉手給 Claude,響應會流式回到同一個 SwiftUI view 裡。由於這套 framework 會根據 @Generable 標註返回帶型別的 Swift 值,傳給 Claude 的是乾淨的結構化輸入,而不是使用者輸入的原始文字。明天起在 iOS 27、iPadOS 27、macOS 27、visionOS 27 和 watchOS 27 上可用,用 Anthropic API key 鑑權。

  • #products
  • #agents
X

Madhu Guru

Meta Sr Director, AI

照蒸汽機的規律,軟體變便宜只會帶來更多軟體,不是更少

蒸汽機效率提高,煤的需求反而漲了;高階語言出現之後,程式碼寫得多得多;表格軟體變便宜,做出來的財務分析也多得多。AI 加軟體工程應該走同一條曲線:軟體會多得多,而且瞄準的是過去不值得去解的那些問題。他還認為 Cursor 的文化影響被低估了,因為「cursor for x」給整個行業提供了一個產品正規化,讓大家從 chatbot 階段裡走了出來;而當人人都能用 AI 做東西時,差異化就只剩下產品判斷、領域知識、分發和執行。

  • #agents
  • #products
X

Nan Yu

Linear Head of Product

AI 不是參差不齊,它只是長成了 AI 的樣子

說 AI「jagged」,就像因為狗在某些事上比人強、某些事上比人差,就說狗參差不齊。這是拿一個人類基準去衡量另一類東西,而這個框架本來就不對。另外,如果你相信同事都很聰明,那他們的想法一定有來處;Linear 做出來最好的一些東西,本身就是好幾個想法的融合,或者是離原始概念已經很遠的衍生品。還有一句:科技行業裡沒有哪種力量比 PM 的晉升材料更具破壞性。

  • #products
  • #agents
X

Peter Yang

X 的反垃圾模型壓根不讀正文,AI 內容工廠就這麼大搖大擺過關了

翻 X 的開源演算法能找到 TweetSpamBot,這是個行為模型,會分析一個賬號最近多達 512 個動作,看發帖爆發、引用推行為、時間點、兩次動作之間的停留等訊號,標記出 TWEET_CREATE_BURST、QUOTE_TWEET_SPAMMER、CONTENT_AMPLIFIER 這類模式。分數高會觸發賬號驗證,但似乎並不會把那些垃圾內容本身降權。缺口就在於這個模型從不看帖子內容,於是一家內容工廠完全可以盯住爆款帖,一天引用十幾次,在毫不相干的話題上反覆套同一個「鉤子加數字加故事加總結」的模板,照樣乾乾淨淨。

  • #products
  • #policy
X

Peter Steinberger

OpenClaw 團隊開始用 OpenClaw 來做 OpenClaw

把 agent 的會話以 URL 形式分享出來,成了關鍵的那一環,團隊可以像甩一個文件連結那樣,把做到一半的 agent 工作交接出去。他們還在共享的 AGENTS.md 里加了一條:任何改動 UI 狀態的 PR 都必須傳一段錄屏,把視覺評審直接壓進 diff 裡,而不是留給 reviewer 自己腦補。

  • #agents
  • #open-source
X

Garry Tan

Y Combinator President & CEO

有了 Fable 5,面對不可逆的決策,「全部採納建議」成了個安全答案

在 Fable 5 前後都用過 GStack,最意外的變化是:Claude Code 丟擲來的很多不可逆決策問題,現在直接回一句「全部採納建議」就行,結果你還挺滿意。另外說到住房:反對派其實是在替 YIMBY 整理一份需要廢除的加州法律的完整清單。

  • #agents
  • #policy
X

Guillermo Rauch

Vercel CEO

Vercel 稱自家 AI Gateway 是全球最快的基礎設施

針對 Vercel 的 AI Gateway 直接給出效能主張,把路由延遲擺成了應用與模型廠商之間這一層的競爭維度。

  • #products
X

Amjad Masad

Replit CEO

用 TestFlight 做自用的 iOS app,不必上 App Store

對於那些你壓根沒打算釋出的 app,TestFlight 是一條被低估的分發路徑。如果這個 app 只給你自己或者少數幾個人用,你不用碰 App Store 稽核,就能拿到一個真正裝在機器上的 iOS app。

  • #products
X

Matt Turck

AI 把一天的工作壓縮成純決策,這很耗人

AI 之前,一個工作日是一個決策後面拖著長長的流程,如此反覆到晚上十點。有了 AI,就是決策接決策接決策,到下午三點腦子已經空了。原來那些處理性的活兒,恢復作用比誰估計的都大。

  • #agents
  • #products

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。