11 則來自 11 位 builder

AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 5 分鐘。

今天 builder 圈裡聊得最多的是速率限制和快取命中,OpenAI 的 Codex 團隊公開排查了額度為什麼比預期消耗得更快。Anthropic 上線了一個安全掃描器,能在整個倉庫範圍內找漏洞,並把補丁一併遞回來。還有一條更安靜的主線貫穿其中:eval、模擬和評分體系,才是評判這些系統的真正基礎設施,畢竟它們已經好到沒法用一個數字打分了。

X

Thibault Sottiaux

OpenAI Codex & ChatGPT

Codex 額度消耗變快,原因是快取命中率下滑了

這周有些 Codex 使用者發現額度燒得比往常快,原因是快取命中率變差,而不是策略調整。穩定命中快取本來就是效率賬裡的關鍵一環,命中率一掉,額度就跟著往下走。排查還在進行中,第二天會給出進展。另外,banked reset 已在太平洋時間晚上 8 點前對所有付費的 ChatGPT Work 和 Codex 使用者上線。

  • #products
  • #agents
X

Claude

Claude Security 用 Mythos 掃描 GitHub 倉庫,並直接給出修復建議

把它指向一個倉庫,Mythos 會跨檔案追蹤資料、推理各元件之間如何互動,返回的結果會標上 CWE 分類,以及置信度和嚴重程度評級。建議的修復可以直接在網頁版 Claude Code 裡開啟,用的是你團隊本來就在跑的模型,掃描按普通 token 用量計入現有套餐。設計上模型被擋在掃描後面:它只返回發現的問題,不提供直接訪問。同期還有 Defender Advantage Fund,拿出 3500 萬美元額度投向開源安全;合作伙伴把 Mythos 5 整合進第三方安全產品;Cyber Verification Program 也在擴容。

  • #security
  • #products
X

Madhu Guru

Meta Sr Director, AI

把一整套 eval 壓成一個分數,會蓋住你最前沿場景上的退步

平均數的暴政:一個模型在摘要上從 85 提到 89、在事實問答上從 80 提到 85,同時在複雜金融分析上從 70 掉到 63,用單一數字去看仍然是一場勝利。加權分數不是解藥,它只是把一次主觀判斷包進了虛假的數學精度裡。真正的替代方案是:一層層排好優先順序的 eval,一群願意讀細節而不是張口就要抽象結論的人,以及由人來判斷這套系統對使用者是不是真的更好。Gemini 早期就發生過這種事,今天的團隊還在重複。

  • #evals
X

Swyx

模擬人類是遞迴自我改進的最後一道門檻

如果你認真對待遞迴自我改進,也就是模型接管越來越大比例的 ML 研究和 AI 工程,那麼模擬人類和人類反饋就是剩下的那個瓶頸。這個視角重新解釋了 Smallville:它當年沒有任何商業應用,卻恰恰是 Karpathy 和 Fei-Fei Li 投資那支團隊的理由。Simile 在很早的階段就已經在 Fortune 100 客戶那裡跑出了 product-market fit。這段坦白說得相當直接:晚了兩年才想明白,而從沒這麼高興自己曾經看錯。

  • #agents
  • #research
X

Aaron Levie

Box CEO

當智慧便宜到不值得計費,機會就轉移到擴散上

同樣的任務,模型成本在降;通用能力在漲;速度更快;幾乎每個領域的深度都在同時加深,這個速率在科技史上沒有先例。一旦智慧逼近便宜到不值得計費,價值就從生產智慧轉向把 AI 推進真實經濟。所以對應用層的 AI 公司來說,眼下是個相當好的時點:上游的競爭和創新是順風,不是威脅。

  • #products
  • #agents
X

Guillermo Rauch

Vercel CEO

Vercel 把 is-agentic 反覆跑在自家文件上,一路刷到 100/100

拿 is-agentic 這套評估反覆跑他們的文件站,補掉了不少真實存在的缺口,同時刻意花力氣把評判標準維持在足夠高的質量上,才對得起燒掉的那些 token。現在已經支援 Grok 和 Codex 訂閱,可以在 sandbox 裡即時安裝。Python 團隊那邊也在快速推進。

  • #evals
  • #products
X

Thariq

Anthropic 內部的 ELI5 skill:用大圖和少量文字把程式碼講清楚

prompt 很簡單:假設我對這個話題一無所知,用一個 HTML artifact 來解釋,圖要大、字要少。內部拿它寫講解,也拿它刨問題,常見的 prompt 包括這個模組是怎麼跑的、我們當初為什麼這麼取捨、這次故障是什麼引起的。現在可以從社群 plugin 市場裝上,至於要不要轉成官方 plugin,還是個開放問題。

  • #agents
  • #open-source
X

Peter Yang

Instinct 的上手體驗極好,但它會索引你的郵件,而且刪不掉

接 iMessages、Google Workspace 和各種 MCP 的過程順暢得不尋常,助手也比同類更主動,MCP 一連上就立刻給出可執行的建議。卡點在資料處理:它未經許可就索引並留存郵件,也沒有任何辦法把這些內容從它的記錄裡清掉,這一天不修,就一天不能推薦。另一個限制是結構性的,所有東西都擠在同一個 thread 裡,所以它適合處理零碎雜事,撐不起真正的工作。真正的主力仍然是 ChatGPT Work 和 Codex。

  • #products
  • #privacy
Podcast

No Priors

電腦贏了人類之後,國際象棋反而更火了

Chess.com 的起點是 2005 年一場破產拍賣上花 5.6 萬美元買下的域名,當時幾乎每一個投資人都說這東西不值得投;如今它有 1000 萬日活、2.5 億註冊使用者、兩億多美元營收,而且一路增長沒為此融過一分錢。機器越過超人水平這件事,確實讓棋一度變得無聊,所有人都在磨 Stockfish 認可的殘局;後來 Leela 這類神經網路開始下激進又反常規的棋,反倒把人類的棋路往前推了一大截,比以前刺激得多。談到專業能力,過程上沒有捷徑,只有工具上有:“把你人生中隨便一天拿出來,乘以一千,那大概就是你人生的樣子。”創業建議是別聽創業建議:2005 年的標準打法是從 Stanford 找個技術合夥人、融資、盯著大市場,而他反著來,成了。下一個專案叫 Gambit,一個撲克站點,把國際象棋那套評分體系搬到一個通常用籌碼計分的遊戲裡:你到底有多強,而不是你能補進多少顆 M&M 豆。

  • #products
  • #founders
X

Nikunj Kothari

Claude Code 把幼兒園的食譜網站逆向成了家裡機器人的每日推送

幼兒園把每天的伙食發在一個隨便什麼網站上,資料毫無結構。Claude Code 透過看網路請求找到了背後的 API,發現它根本沒有鑑權,摸清了返回格式,然後接進了已有的 Hermes bot。現在家裡的機器人每天早上播報早餐和午餐,家人可以照著準備。這種小規模的個人自動化,仍然被嚴重低估。

  • #agents
  • #products

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。