Thibault Sottiaux
OpenAI Codex & ChatGPTCodex 額度消耗變快,原因是快取命中率下滑了
這周有些 Codex 使用者發現額度燒得比往常快,原因是快取命中率變差,而不是策略調整。穩定命中快取本來就是效率賬裡的關鍵一環,命中率一掉,額度就跟著往下走。排查還在進行中,第二天會給出進展。另外,banked reset 已在太平洋時間晚上 8 點前對所有付費的 ChatGPT Work 和 Codex 使用者上線。
- #products
- #agents
真正在做 AI 的人今天說了什麼。一頁讀完,約 5 分鐘。
今天 builder 圈裡聊得最多的是速率限制和快取命中,OpenAI 的 Codex 團隊公開排查了額度為什麼比預期消耗得更快。Anthropic 上線了一個安全掃描器,能在整個倉庫範圍內找漏洞,並把補丁一併遞回來。還有一條更安靜的主線貫穿其中:eval、模擬和評分體系,才是評判這些系統的真正基礎設施,畢竟它們已經好到沒法用一個數字打分了。
Codex 額度消耗變快,原因是快取命中率下滑了
這周有些 Codex 使用者發現額度燒得比往常快,原因是快取命中率變差,而不是策略調整。穩定命中快取本來就是效率賬裡的關鍵一環,命中率一掉,額度就跟著往下走。排查還在進行中,第二天會給出進展。另外,banked reset 已在太平洋時間晚上 8 點前對所有付費的 ChatGPT Work 和 Codex 使用者上線。
Claude Security 用 Mythos 掃描 GitHub 倉庫,並直接給出修復建議
把它指向一個倉庫,Mythos 會跨檔案追蹤資料、推理各元件之間如何互動,返回的結果會標上 CWE 分類,以及置信度和嚴重程度評級。建議的修復可以直接在網頁版 Claude Code 裡開啟,用的是你團隊本來就在跑的模型,掃描按普通 token 用量計入現有套餐。設計上模型被擋在掃描後面:它只返回發現的問題,不提供直接訪問。同期還有 Defender Advantage Fund,拿出 3500 萬美元額度投向開源安全;合作伙伴把 Mythos 5 整合進第三方安全產品;Cyber Verification Program 也在擴容。
模擬人類是遞迴自我改進的最後一道門檻
如果你認真對待遞迴自我改進,也就是模型接管越來越大比例的 ML 研究和 AI 工程,那麼模擬人類和人類反饋就是剩下的那個瓶頸。這個視角重新解釋了 Smallville:它當年沒有任何商業應用,卻恰恰是 Karpathy 和 Fei-Fei Li 投資那支團隊的理由。Simile 在很早的階段就已經在 Fortune 100 客戶那裡跑出了 product-market fit。這段坦白說得相當直接:晚了兩年才想明白,而從沒這麼高興自己曾經看錯。
Vercel 把 is-agentic 反覆跑在自家文件上,一路刷到 100/100
拿 is-agentic 這套評估反覆跑他們的文件站,補掉了不少真實存在的缺口,同時刻意花力氣把評判標準維持在足夠高的質量上,才對得起燒掉的那些 token。現在已經支援 Grok 和 Codex 訂閱,可以在 sandbox 裡即時安裝。Python 團隊那邊也在快速推進。
Anthropic 內部的 ELI5 skill:用大圖和少量文字把程式碼講清楚
prompt 很簡單:假設我對這個話題一無所知,用一個 HTML artifact 來解釋,圖要大、字要少。內部拿它寫講解,也拿它刨問題,常見的 prompt 包括這個模組是怎麼跑的、我們當初為什麼這麼取捨、這次故障是什麼引起的。現在可以從社群 plugin 市場裝上,至於要不要轉成官方 plugin,還是個開放問題。
電腦贏了人類之後,國際象棋反而更火了
Chess.com 的起點是 2005 年一場破產拍賣上花 5.6 萬美元買下的域名,當時幾乎每一個投資人都說這東西不值得投;如今它有 1000 萬日活、2.5 億註冊使用者、兩億多美元營收,而且一路增長沒為此融過一分錢。機器越過超人水平這件事,確實讓棋一度變得無聊,所有人都在磨 Stockfish 認可的殘局;後來 Leela 這類神經網路開始下激進又反常規的棋,反倒把人類的棋路往前推了一大截,比以前刺激得多。談到專業能力,過程上沒有捷徑,只有工具上有:“把你人生中隨便一天拿出來,乘以一千,那大概就是你人生的樣子。”創業建議是別聽創業建議:2005 年的標準打法是從 Stanford 找個技術合夥人、融資、盯著大市場,而他反著來,成了。下一個專案叫 Gambit,一個撲克站點,把國際象棋那套評分體系搬到一個通常用籌碼計分的遊戲裡:你到底有多強,而不是你能補進多少顆 M&M 豆。
來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。
摘要由程式自動生成。據此判斷前請先看原文。