7 条来自 7 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 3 分钟。

今天的主线是 eval:两位 builder 各自从不同角度论证,真正卡住企业落地 AI 的不是模型能力上限,而是企业能测到什么。OpenAI 的 Codex 团队公开了限流投诉背后的几个具体 bug,并承诺给所有付费用户重置用量。另外一段被重新翻出来的对话里,微软 CTO 认为,如今模型能力和实际交付产品之间的差距,已经超过了模型与模型之间的差距。

X

Thibault Sottiaux

OpenAI 点名三个偷跑用量的 Codex bug,付费用量全部重置

Codex 在三个地方悄悄吃掉了用量:长会话里经过多次 compaction 的图片、Computer History 偏高的 p95 用量,还有一个开销超出预期的会话标题生成器。修复明天上线,同时给每个付费订阅做一次完整的用量重置。另有一项与此无关的效率优化排在下周。

  • #products
  • #agents
播客

AI & I by Every

Kevin Scott:瓶颈已经是能力过剩,不是 scaling

模型的推理能力跑在了产品实际交付的前面,把这段差距补上才是当下行业真正要干的活。他给的解法是一个带开放协议的 agentic web,做 HTTP 和 HTML 当年为互联网做的事,MCP 和 NL web 是第一批看得见的苗头,再加上 agent 身份和授权体系,让 agent 能精确申请一项任务所需的权限。交互方式也会随之改变:从同步 prompting,转向 agent 自己跑开、发一大堆调用、过很久再回来。至于 agentic coding 会毁掉手艺的说法,他回应说:"如果你看重过程胜过结果,那有时候你的选择就会和那些看重结果胜过过程的人不一样。"

  • #agents
  • #open-source
  • #products
X

Aaron Levie

Box CEO

真正的 eval 市场是一家公司的工作流,不是模型排行榜

公开的模型 eval 只能告诉你通用能力进展到哪一步、模型之间怎么排序。真正大得多的空间,是针对企业自己跑的那些具体工作流做 eval,细到单个公司的种种怪癖。你没法自动化一件无法衡量进展的事,企业也不会凭感觉就上生产。

  • #evals
  • #agents
X

Madhu Guru

Meta Sr Director, AI

在 eval 上爬坡:挑一个真正要紧的维度,往死里磨

这个 eval 系列的第六篇认为,所有工作最终都归结为两件事:做更好的 harness,以及通过 prompt engineering、context engineering、memory、post training 和普通的确定性代码来做模型选型。失败模式分类会告诉你该往哪儿使劲:如果 tool calling 是头号失败项,那多半是你往 context 里塞了 20 个工具,而任务只需要 3 到 5 个。成本上的建议是先用最好的模型上线,把质量做上去,等确认用户真的喜欢,再往更小更便宜的模型上爬坡,把同样的质量磨出来。

  • #evals
  • #agents
X

Zara Zhang

AI 给个人 10 倍,同一个人放进大公司只剩 20%

AI 赋予个体的杠杆,进了大组织基本就蒸发了:同样一个能力很强的人,在里面最多提升 20%,有时候还是负的。这种不对称正是越来越多强者离开大公司的原因,OpenAI、Anthropic 这类顶级实验室大概是少数例外。另有一句值得贴在墙上:所有真正跑在 AI 前面的人,都觉得自己落后了。

  • #agents
  • #products
X

Peter Yang

让 coding agent 帮你查一遍还有哪些应用握着你的 Google 数据

在 Chrome 里打开 Google 的授权连接页面,把 Codex 或 Claude Code 指向这个打开的标签页,再让它去撤销那些你已经不想要的授权。这么跑一遍,砍掉了大约一半仍持有访问权限的应用。另外,Instinct 团队在舆论压力之后上线了外部数据删除功能,Data Privacy 那一栏里的 36 条 Gmail 记录总算能删掉了。

  • #products
  • #policy
X

Nikunj Kothari

FPV Ventures Partner

先激怒投资人再发 SAFE 文件,这不叫融资策略

一条本来就不该发出去的陌生私信闹成了公共事件,给年轻创始人的结论很直白:先挑衅投资人、再让人家打钱,不是投资运作的方式。把发信人挂出来并不是恰当的回应,但真正要紧的是你选择听谁的建议。有真本事的聪明人,一次次栽在这类游戏上。

  • #funding

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。