12 条来自 12 位 builder
往期

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 5 分钟。

今天的成本基准,关注点从 token 转向了任务:Vercel 公布的数据把 Grok 4.5 送上了网络安全性价比榜首,而 Kimi 那篇讲 agent 沙箱的论文则认为,容器根本算不上真正的安全边界。在这之下,更有意思的一条线其实关于界面:Granola 的 CEO 和 Dan Shipper 不约而同地想到了同一件事,agent 和人需要同时操作同一套 UI。另外,Aaron Levie 又一次拿他从企业客户那里听来的情况,反驳了所谓的 AI 就业末日。

X

Guillermo Rauch

Vercel CEO

Grok 4.5 拿下网络安全性价比第一;容器不是安全的 agent 边界

Vercel 最新的基准测试把 Grok 4.5 列为性价比最好的网络安全模型:比 Sol 便宜 10 倍,比 Opus 5 便宜 5.7 倍,比 Kimi K3 便宜 2.2 倍,性能却大致追平了 Kimi。前沿位置仍然稳稳握在 Sol 手里,排在 Opus 5 之前。另一件事,Rauch 提到了 Kimi 那篇讨论 agent 该在什么环境里运行的论文:容器级别的隔离并不够,因为在他们的实验里,agent 通过 kernel panic 直接把底层机器搞崩了。他的判断是,像 Vercel Sandbox 用的那种 Firecracker microVM,才是真正扛得住的边界。

  • #evals
  • #security
  • #agents
播客

AI & I by Every

Granola CEO:会议纪要不是奖品,工作界面才是

Chris Pedregal 认为,眼下所有人抢破头的 AI 会议纪要,并不是价值最终沉淀的地方。Notion、OpenAI 和 Zoom 都推出了竞品,Granola 的增长速度却一点没受影响,这反而印证了他的看法:真正的战场是在 AI 原生的世界里,我们用什么界面来工作。他下的最具体的一个赌注是“预生成”:Granola 会生成数百万份会前简报,明知只有很小一部分会被打开,因为真正有用的时刻,就是你迟到了、又想不起来马上要见的人是谁的那十五秒。他把这个产品形容成扶手,不摔跤的时候你根本注意不到它。聊到创业,他说:“我原来以为,创业只有在做不成的时候才特别难。结果发现,做成了也一样难。”团队上周才开始统计 token 花销,起因是有人一天在 Fable 上烧掉了两千多美元。

  • #products
  • #agents
X

Swyx

按 token 算钱,一年前就不再是有效的成本衡量方式了

Swyx 认为,输入和输出 token 的单价作为一种有意义的横向比较,大概在去年就已经死了;今天还在用这个口径、而不是“每个任务多少钱”来画成本曲线的人,不值得认真对待。他还回头捅了自己一刀:他最为人所知的那个 agent 实验室论调,在 Claude Code 今年事实上开源之后遭到了最有力的反驳,因为它自己的路线图和竞争对手的路线图几乎都没有发生任何变化。

  • #evals
  • #agents
X

Aaron Levie

Box CEO

企业还在招人,只是岗位变了

Levie 说,大家预言的 AI 就业崩塌,在他接触的企业里始终没有出现。它们在招工程师,去啃那些以前根本够不着的问题;在招销售,因为 AI 让他们能把客户关系做得更深;还在招内部的前置部署工程师,专门负责真正把 AI 落地。他把这解读成杰文斯悖论正在上演。他更尖锐的一个判断是:只把 AI 用来省成本的公司,会被那些用它把客户服务做得更好的公司打败。他也承认,这个趋势有可能反过来。

  • #policy
  • #products
X

Peter Yang

骑车路上,Codex 剪完并发出了一支发布视频

OpenAI 负责 DevEx 的 Jason Liu 正在骑车,被人叫去改一支发布视频。他用手机连上 Codex,让它通过 computer use 剪辑视频、导出,再把成品发回 Slack 那个讨论串;接着交代它每三十分钟去看一次那个串,根据反馈依次导出 V2、V3 和 V4。等他到家,视频已经过审了。这是一个很干净的例子:agent 对着一个人类评审频道跑异步的修改循环,全程没有人守在键盘前。

  • #agents
  • #products
X

Madhu Guru

Meta Sr Director, AI

产品评审该模拟市场,而不是汇报进度

Madhu Guru 的观点是,一场好的产品评审能把几个月的认知压缩进一小时,办法是模拟市场会怎么回应你的想法;而这件事成立的前提,是坐在会议室里的人真的懂这个领域、有品味、有强烈的观点,并且大多数时候是对的。可惜多数评审已经滑向了进度同步、给领导刷存在感和跨部门对齐。这种滑坡正是大家反感评审的原因:会议不再产生认知,只剩下损耗。

  • #products
X

Amjad Masad

Replit CEO

下一片要测绘的疆域是计算宇宙

Masad 把当下形容成一个新的大航海时代。上几代人先测绘了地球,然后走向太空;这一代人拿到的,是由算法、程序、证明和设计构成的那片空间,可以让 AI agent 到其中去搜索。这本质上是一个立场选择:把 agent 看作在可能性空间里做搜索的引擎,而不是提效工具。

  • #agents
X

Matt Turck

不到 40% 的 VC 投出过一笔成功的案子

Turck 提到一项新研究:不到 40% 的风险投资人名下有过哪怕一笔成功的投资。然后他自己把包袱抖了出来:每一个读到这条的 VC,心里都笃定自己属于那 40%。

  • #funding
X

Peter Steinberger

一个 agent 报了 bug,另一个 agent 连夜修好了

Steinberger 的 agent 报出一个 bug,Jarred Sumner 那套 robobun 把它修掉了,全都发生在同一个晚上,两头都没有人参与。他说这套东西就是未来。他还提到一件让人无奈的事:明明是和很强的合作团队一起在认真做安全,却仍然有人默认这个产品不安全。

  • #agents
  • #security
X

Nan Yu

Linear head of product

既然你的聪明人这么聪明,就让他们去打磨自家产品

Yu 反对自己造一套内部版工具:一款产品之所以好用又顺手,背后是一大批非常聪明的人在非常卖力地打磨;所以你要是手上有非常聪明的人,就该把他们放到自家产品上,然后花点小钱去买别人做好的。这是把 build 还是 buy 的论证压缩成了一句刺。

  • #products

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。