AI構建者摘要
真正在做 AI 的人今天說了什麼。一頁讀完,約 3 分鐘。
今天的主線是 eval:兩位 builder 各自從不同角度論證,真正卡住企業落地 AI 的不是模型能力上限,而是企業能測到什麼。OpenAI 的 Codex 團隊公開了限流投訴背後的幾個具體 bug,並承諾給所有付費使用者重置用量。另外一段被重新翻出來的對話裡,微軟 CTO 認為,如今模型能力和實際交付產品之間的差距,已經超過了模型與模型之間的差距。
AI & I by Every
Kevin Scott:瓶頸已經是能力過剩,不是 scaling
模型的推理能力跑在了產品實際交付的前面,把這段差距補上才是當下行業真正要乾的活。他給的解法是一個帶開放協議的 agentic web,做 HTTP 和 HTML 當年為網際網路做的事,MCP 和 NL web 是第一批看得見的苗頭,再加上 agent 身份和授權體系,讓 agent 能精確申請一項任務所需的許可權。互動方式也會隨之改變:從同步 prompting,轉向 agent 自己跑開、發一大堆呼叫、過很久再回來。至於 agentic coding 會毀掉手藝的說法,他回應說:"如果你看重過程勝過結果,那有時候你的選擇就會和那些看重結果勝過過程的人不一樣。"
- #agents
- #open-source
- #products
Madhu Guru
Meta Sr Director, AI在 eval 上爬坡:挑一個真正要緊的維度,往死裡磨
這個 eval 系列的第六篇認為,所有工作最終都歸結為兩件事:做更好的 harness,以及透過 prompt engineering、context engineering、memory、post training 和普通的確定性程式碼來做模型選型。失敗模式分類會告訴你該往哪兒使勁:如果 tool calling 是頭號失敗項,那多半是你往 context 裡塞了 20 個工具,而任務只需要 3 到 5 個。成本上的建議是先用最好的模型上線,把質量做上去,等確認使用者真的喜歡,再往更小更便宜的模型上爬坡,把同樣的質量磨出來。
- #evals
- #agents
Peter Yang
讓 coding agent 幫你查一遍還有哪些應用握著你的 Google 資料
在 Chrome 裡開啟 Google 的授權連線頁面,把 Codex 或 Claude Code 指向這個開啟的標籤頁,再讓它去撤銷那些你已經不想要的授權。這麼跑一遍,砍掉了大約一半仍持有訪問許可權的應用。另外,Instinct 團隊在輿論壓力之後上線了外部資料刪除功能,Data Privacy 那一欄裡的 36 條 Gmail 記錄總算能刪掉了。
- #products
- #policy
Nikunj Kothari
FPV Ventures Partner先激怒投資人再發 SAFE 檔案,這不叫融資策略
一條本來就不該發出去的陌生私信鬧成了公共事件,給年輕創始人的結論很直白:先挑釁投資人、再讓人家打錢,不是投資運作的方式。把發信人掛出來並不是恰當的回應,但真正要緊的是你選擇聽誰的建議。有真本事的聰明人,一次次栽在這類遊戲上。
- #funding
資料來源
來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。
摘要由程式自動生成。據此判斷前請先看原文。
