AI构建者摘要
真正在做 AI 的人今天说了什么。一页读完,约 3 分钟。
今天的主线是 eval:两位 builder 各自从不同角度论证,真正卡住企业落地 AI 的不是模型能力上限,而是企业能测到什么。OpenAI 的 Codex 团队公开了限流投诉背后的几个具体 bug,并承诺给所有付费用户重置用量。另外一段被重新翻出来的对话里,微软 CTO 认为,如今模型能力和实际交付产品之间的差距,已经超过了模型与模型之间的差距。
AI & I by Every
Kevin Scott:瓶颈已经是能力过剩,不是 scaling
模型的推理能力跑在了产品实际交付的前面,把这段差距补上才是当下行业真正要干的活。他给的解法是一个带开放协议的 agentic web,做 HTTP 和 HTML 当年为互联网做的事,MCP 和 NL web 是第一批看得见的苗头,再加上 agent 身份和授权体系,让 agent 能精确申请一项任务所需的权限。交互方式也会随之改变:从同步 prompting,转向 agent 自己跑开、发一大堆调用、过很久再回来。至于 agentic coding 会毁掉手艺的说法,他回应说:"如果你看重过程胜过结果,那有时候你的选择就会和那些看重结果胜过过程的人不一样。"
- #agents
- #open-source
- #products
Madhu Guru
Meta Sr Director, AI在 eval 上爬坡:挑一个真正要紧的维度,往死里磨
这个 eval 系列的第六篇认为,所有工作最终都归结为两件事:做更好的 harness,以及通过 prompt engineering、context engineering、memory、post training 和普通的确定性代码来做模型选型。失败模式分类会告诉你该往哪儿使劲:如果 tool calling 是头号失败项,那多半是你往 context 里塞了 20 个工具,而任务只需要 3 到 5 个。成本上的建议是先用最好的模型上线,把质量做上去,等确认用户真的喜欢,再往更小更便宜的模型上爬坡,把同样的质量磨出来。
- #evals
- #agents
Peter Yang
让 coding agent 帮你查一遍还有哪些应用握着你的 Google 数据
在 Chrome 里打开 Google 的授权连接页面,把 Codex 或 Claude Code 指向这个打开的标签页,再让它去撤销那些你已经不想要的授权。这么跑一遍,砍掉了大约一半仍持有访问权限的应用。另外,Instinct 团队在舆论压力之后上线了外部数据删除功能,Data Privacy 那一栏里的 36 条 Gmail 记录总算能删掉了。
- #products
- #policy
Nikunj Kothari
FPV Ventures Partner先激怒投资人再发 SAFE 文件,这不叫融资策略
一条本来就不该发出去的陌生私信闹成了公共事件,给年轻创始人的结论很直白:先挑衅投资人、再让人家打钱,不是投资运作的方式。把发信人挂出来并不是恰当的回应,但真正要紧的是你选择听谁的建议。有真本事的聪明人,一次次栽在这类游戏上。
- #funding
数据来源
源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。
摘要由程序自动生成。据此做判断前请先看原文。
