12 条来自 11 位 builder
往期

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 7 分钟。

open weights 已经不再是一个需要争论的话题。Google 的加入,为过去一个月的公开实验画上了句号,也让美国 AI 圈达成了一个四周前几乎没人认同的共识。另一条主线是「工厂」:Rauch 和 Nan Yu 都认为,你真正要造的是那套维护你产品的 agent 系统;而 Anthropic 这边既发布了 Claude Code 一个月降智的复盘,也公开了把 agent 的大脑和双手解耦的架构设计。

博客

Anthropic Engineering

Anthropic 复盘:Claude Code 一个月的降智,源于三个互不相关的变更

三个彼此无关的变更叠加在一起,看上去就像模型整体变笨了。3 月 4 日,Claude Code 默认的 reasoning effort 悄悄从 high 降到了 medium,现在 Opus 4.7 已经调回 xhigh;3 月 26 日的一次缓存优化,本意是只清理一次旧的 thinking 内容,结果每一轮对话都清一遍,这既解释了「记性变差」,也解释了用量额度消耗得更快;4 月 16 日又在 system prompt 里加了一句,把回复限制在 100 词以内,evals 成绩因此掉了 3%。三个问题都已在 v2.1.116 修复,所有订阅用户的用量额度也已重置。

  • #products
  • #evals
X

Aaron Levie

Box CEO

Google 加入之后,open weights 拿到了整个行业的背书

随着 Google 也加入进来,Levie 认为眼下这波支持意味着 open weights AI 得到了完整的行业背书,而不再只是一小部分人的主张。他说这是行业的一个重要时刻。

  • #open-source
X

Madhu Guru

不到一个月,美国 AI 圈就在 open weights 上达成了共识

一个月前,支持 open weights 还很有争议,现在看起来却理所当然。Madhu Guru 把这归功于一连串公开发生的实验,每一个都从不同侧面暴露了激励机制、创新和地缘政治的问题:DeepSeek、Microsoft 与 OpenAI 的分手、GLM、Kimi、Fable,以及 OpenAI 和 Hugging Face 那场风波。他更想说的其实是方法论:在没有地图的领域里,难题的答案只能从与现实的反复碰撞中得来,而未来十年,AI 那些重大的社会性议题也会以同样的方式尘埃落定。

  • #open-source
  • #policy
播客

Unsupervised Learning

Benedict Evans:模型都长得差不多,价值于是往上层转移

现在有三到六家公司在做前沿模型,而它们的水平大体相当。Evans 认为这恰恰说明真正的进入门槛还不存在:一家实验室可以彻底掉队,然后又回到排行榜前列,这对实验室来说是坏信号,不是好信号。他拿移动网络作类比:流量涨了一千多倍,每年资本开支两千亿美元,而所有价值都往上层跑到了 Uber 和 YouTube 手里。谈到失业问题,他对那些声称模型能完成律所一年级律师 93% 工作量的图表毫不客气:你既没法衡量这位律师究竟在做什么,也没法衡量模型能不能做到,所以「这就是胡说八道」。真正的瓶颈不是能力,而是大多数人本来就不是做工具的人,看不到工具能解决什么问题,也没有条件去把它做出来。

  • #markets
  • #products
X

Guillermo Rauch

Vercel CEO

Rauch:产品是那座软件工厂,不是工厂造出来的 app

Rauch 的说法是,你的产品好不好,取决于你为它配置的那些能自主维护它的 agent,这和他所说的 Tesla 在制造环节学到的道理一样。有新想法出现时,该做的不是临时给 agent 写几句 prompt,而是把那座能启动它、维护它、让它成长的工厂搭起来。他自己的研究工作已经这么跑了:一个普通的 research/ 文件夹,一份 AGENTS.md 写清他喜欢的格式和最佳实践,再加一个能把过往 session 里的知识串起来的 agent CLI。没有知识图谱,没有 app,靠 iCloud 或 git 同步;想分享某个结论时,agent 可以直接生成并部署一份 HTML 报告。

  • #agents
  • #products
博客

Claude Blog

Claude Managed Agents 现在可以在你自己的边界内执行工具

Managed Agents 现在可以在你掌控的 sandbox 里执行工具,既可以是你自己的基础设施,也可以是 Cloudflare、Daytona、Modal、Vercel 这类托管服务商。agent loop 仍然跑在 Anthropic 一侧,而代码执行、文件和各类服务都留在你的网络策略和审计日志之后。目前处于 research preview 的 MCP tunnel 让 agent 能访问内部数据库、私有 API 和工单系统,方式是通过一个轻量网关建立一条向外的连接,不需要入站防火墙规则,也不需要公网端点。自托管 sandbox 已进入 public beta,Amplitude、Clay 和 Rogo 已经在这套组合上做东西了。

  • #agents
  • #products
博客

Anthropic Engineering

为了不再丢 session,Anthropic 把 agent 的大脑和双手拆开了

把 session、harness 和 sandbox 塞进同一个容器,会让这个容器变成一只「宠物」:容器一挂,session 也跟着没了,而排查问题意味着要登进一台同时存着用户数据的机器。现在 Managed Agents 把三者当作彼此独立的接口:harness 崩了可以用 wake(sessionId) 重启,重放持久化的事件日志;sandbox 挂了则表现为一次 tool call 报错,Claude 可以重试。容器只在某次 tool call 真的需要时才创建,这让 p50 的首 token 时间下降了约 60%,p95 下降超过 90%。安全上的收益同样实在:凭证不会放在跑 Claude 生成代码的那个 sandbox 里,git token 在初始化时就写进本地 remote,MCP 的 OAuth token 则由代理后面的 vault 保管。

  • #agents
X

Thibault Sottiaux

OpenAI, Codex and ChatGPT

ChatGPT Work 的活跃用户数已经超过 Codex

Sottiaux 说 ChatGPT Work 现在的活跃用户已经比 Codex 多了。他还在力推一项已经在 ChatGPT app 里上线的语音能力,按他的说法,这终于让「对着电脑说话」变得有意义:「你一直都可以跟你的电脑说话,只是它不会给你什么回应。这个 bug 我们修好了。」他觉得这在手机上是个改变游戏规则的东西。

  • #products
X

Peter Steinberger

让 Codex 整天跑着,12 个 subagent 去抓 200 个 bug

Steinberger 在 OpenClaw 发版前做了一轮大规模并行 QA,并把他用的 prompt 原文贴了出来:用真实 API key 跑完整的端到端测试,12 个 subagent 分工覆盖不同功能,在不同端口上开 dev gateway 做压力测试,用 worktree,自动提 PR,目标是找出 200 个 bug,每次都修根因、不许打补丁,同时持续维护一份 markdown 测试报告。变化在于稳定性:这套流程以前会在 compaction 的边界上崩掉,或者模型开始偷工减料,现在它能撑住,还能发现复杂的行为层面问题。另外他提到 OpenAI 签了那封信,而 Ant 一直沉默,并顺带说了两句他觉得值得明说的话:竞争对生态是好事;大规模提供模型服务这件事很难。

  • #agents
  • #evals
X

Nan Yu

Linear Head of Product

既然能造软件工厂,那就能造「造工厂的工厂」

Nan Yu 把工厂这个想法又往上推了一层:既然存在生产软件的系统,那也就存在生产这些系统的系统。他还认为这个抽象其实和软件本身关系不大。任何有「经过设计并被实现的意图」存在的地方,不论是公共卫生还是法律,同样的递归都成立。

  • #agents
X

Amjad Masad

Replit CEO

Masad 用一个 finetune 过的 LLM,把国际象棋引擎做到了 1200 Elo 左右

Masad 上线了一个新的国际象棋引擎,他估计水平在 1200 Elo 左右,目标是在两个硬约束下做到 2000 以上:只用一个小的 finetune 模型,不做自定义预训练、也不改架构;走棋完全由模型生成,不借助任何象棋引擎。他明确说了,只要放松其中任何一个约束,这个问题都会容易得多。

  • #evals
X

Nikunj Kothari

只有掌握绝对控制权的创始人,才会去收购一个占星 app

对于一家生成式媒体公司收购占星 app 这件事,Kothari 的解读是:这笔交易只有在两个条件同时成立时才可能发生,一是 CEO 拥有完全的控制权,也就是公司盈利、没有董事会、据他所知也没有 VC;二是这位 CEO 有 David Holz 那样的野心。换到一家普通公司,你试着把这笔收购向更大的团队解释一遍,它撑不过那场会。他对这件事的走向是好奇,而不是看不上。

  • #funding

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。