16 条来自 15 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 7 分钟。

今天的主线是能力变便宜:DeepSeek 和 Grok 的新发布又一次把「够用的模型」的价格往下压,而声音最大的那批 builder 把这件事读成需求被撑大,而不是利润被打没。Anthropic 这一天在做两件事,修底层管道和给个交代:既发了一份详细复盘,说明 Claude Code 为什么难用了整整一个月,也同时上线了自托管 sandbox 和解耦后的 agent 架构。两条线底下其实是同一个判断,podcast 那边说得最直白:模型的能力,已经跑在建立其上的产品前面了。

博客

Anthropic Engineering

Anthropic 把 Claude Code 的质量下滑追溯到三处独立改动

三处互不相干的改动叠在一起,看上去就像模型整体退化了:3 月 4 日默认 reasoning effort 从 high 降到 medium;3 月 26 日上线的一项缓存优化,本该只清一次 Claude 之前的思考过程,结果每一轮都清;4 月 16 日 system prompt 里加的一句「回复控制在 100 词以内」,实打实地拉低了写代码的质量。API 全程没受影响,三个问题都在 4 月 20 日的 v2.1.116 里解决。消融实验显示,光是那条控制篇幅的指令就让 eval 掉了 3%;而清空思考过程的 bug 造成大量 cache miss,这正是不少人反映额度消耗比预期快的原因。所有订阅用户的用量限额都会重置,之后 system prompt 的每次改动都要走分模型的 eval 套件、观察期和逐步放量。

  • #products
  • #evals
X

Aaron Levie

Box CEO

更便宜的 DeepSeek 和 Grok 会把企业需求拉高,而不是拉低

DeepSeek 和 Grok 同一天发布,都在极低成本上给出了很大的能力跃升,而它对企业需求的影响,跟「降价」这个词给人的直觉正好相反。企业手里的 agent 用例本来就远远多于预算:扫描代码库找安全问题、把所有文档过一遍、在大部分工作流里处理信息。成本每降一档、能力每涨一截,就又有一批用例被解锁。这同时抬高了待在应用层的价值,因为模型选择越多,尤其是针对不同类型、不同成本的活儿调过的模型越多,按任务做路由和优化的空间就越大。

  • #agents
  • #products
X

Claude

Claude 的会话现在能从 Chrome 跟到桌面端、网页端和手机端

Claude in Chrome 的会话现在可以延续到桌面端、网页端和手机端,对话会被保存,skills 和 connectors 在浏览器里也能用。侧边栏跑的就是和其他客户端同一个 Claude Cowork 会话,所以会话跟着账号走,而不是绑在某一台设备上。Max 和 Team 今天可用,Pro 会在接下来几周陆续开放。Anthropic 同时提醒,浏览器 agent 可能被页面里藏着的指令骗到,并在自家防护之外,给出了一份用户该养成的使用习惯。

  • #products
  • #agents
博客

Claude Blog

Managed Agents 现在可以在你自己的边界内运行工具

Claude Managed Agents 可以在你控制的 sandbox 里执行工具,既可以放在自己的基础设施上,也可以走 Cloudflare、Daytona、Modal 或 Vercel。负责编排、上下文管理和错误恢复的 agent loop 留在 Anthropic 的基础设施上,而代码执行、敏感文件和服务都留在你的边界之内,资源规格和运行时镜像由你这边定。还在 research preview 阶段的 MCP tunnels,通过一个轻量网关的单条出站连接去访问私有 MCP server,把内部数据库和工单系统变成可调用的工具,既不用开入站防火墙规则,也不用暴露公网端点。自托管 sandbox 目前是 public beta,Amplitude、Clay 和 Rogo 被点名为最早按这套模式搭起来的团队。

  • #agents
  • #products
博客

Anthropic Engineering

把 agent 的大脑和手拆开,p50 首 token 时间降了 60%

Managed Agents 最早把 session、harness 和 sandbox 塞在同一个容器里,于是这个容器变成了一只宠物:它一死,会话跟着死;调试还得钻进一台同时装着用户数据的机器。解法是把每一块都虚拟化,harness 调用 sandbox 的方式和调用其他任何工具一样;harness 崩了就重启,用 wake(sessionId) 拉回持久化的事件日志,从最后一个事件接着跑。容器现在只在会话真正需要时才创建,这让 p50 首 token 时间大约降了 60%,p95 降了九成以上。安全上的收益是结构性的:凭证要么放在 vault 里,要么在初始化时直接接进本地 git remote,所以跑着 Claude 生成代码的那个 sandbox 根本够不到 token。

  • #agents
X

Josh Woodward

Google VP

Gemini 又接入一批服务,从 OpenTable 到 Ticketmaster

又一批 Gemini app 集成从今天开始陆续上线:Angi、Fever、GetYourGuide、Granola、iHeartRadio、Localiza、OpenTable、Otter、Pandora、Thumbtack、Ticketmaster、Wix、Zocdoc 和 Zoho。这批名单横跨预订、票务、笔记、媒体和本地生活服务,指向的是把 Gemini 做成事情在这里办完的地方,而不是问题在这里得到回答的地方。Google 也在公开招募下一批合作伙伴。

  • #products
  • #agents
播客

AI & I by Every

模型的推理能力,已经跑在建立其上的产品前面

模型实际能做的事和最终交付到用户手上的东西之间的落差,才是这个行业眼下真正要干的活儿;这种能力过剩,让 scaling laws 今年已经不值得再争了。要让 agent 真正好用,需要一整套像互联网那样的生态:MCP 承担 HTTP 的角色,NL Web 承担 HTML 的角色,再加上 agent 身份和授权体系,让一个 agent 能精确地为某项任务所需的系统申请权限。「我希望我们内部所有系统,都用一套标准协议,跟我们在 Microsoft 内部写的所有 agent 对话」,这也是避免把自家组织架构原样输出给别人的办法。下一次转变,是同步 prompt 让位给异步委托:agent 自己出去,发很多次调用,反复迭代很长一段时间,过后回来告诉你它做到了哪一步。

  • #agents
X

Madhu Guru

Meta Sr Director, AI

未来几年 AI 的 alpha 在应用层

模型会继续变便宜、变强、变得更本地化,于是差异化会转移到谁真正吃透了某个具体的用户工作流,并且有想象力围绕它把整个体验重做一遍。能做 AI 产品的人很快会多到夸张,这恰恰说明,做那 0.1% 的顶尖 builder 是变得更重要,而不是更不重要。另外还有一段感慨:这么多年的 Zoom 和 Meet,把团队站到白板前的本能磨没了,连那种半成品式的随手涂画和互相打断也一起消失了,而想法当年正是这么被磨出来的。

  • #products
X

Garry Tan

Y Combinator President & CEO

GBrain v0.45.6.0 新增 17 个 skill,现在支持 Codex 和 Claude Code

GBrain 发布 v0.45.6.0,新增 17 个 brain skills,这些 skill 是靠一个跑在几十万份 markdown 文件上的私人 OpenClaw agent 打磨出来的,现在也能配合 Codex 和 Claude Code 使用。用法上的提醒和发布本身一样重要:把它当成一个独立的 agent 来跑,别塞进你的主力编码 agent 里面。可以把它理解成一个私人版的 ChatGPT 或 Claude,用自己的 git repo 存记忆和自定义 skill。用他的话说,接下来的方向就是:从这里开始,我们要把 markdown skill 玩到极致。

  • #agents
  • #products
X

Peter Yang

一种判断:语音会成为云端 agent 的编排层

一篇新文章认为,我们使用计算机的方式即将发生永久性的改变,从用键盘、鼠标和笔记本手动干活,变成用声音指挥云上的 agent。支撑它的有三个判断:语音成为编排层,个人电脑搬到云上,而信任最终会成为这些干活的系统之间最关键的差异。

  • #agents
X

Swyx

一篇刚被分享的论文,被称为今年最重要的之一

这篇论文已经算得上今年最重要的之一,但有个前提:它的方法论没有讲清楚,所以随之给出的是一组笔记和一份进一步的提炼,而不是一个光秃秃的链接。另外还有一条定时提醒:一年前的今天,Perplexity 提出要收购 Chrome。

  • #research
X

Matt Turck

FirstMark Capital VC

graph engineering 是新的 loop engineering,是新的 prompt engineering

graph engineering 是新的 loop engineering,loop engineering 是新的 harness engineering,harness engineering 是新的 context engineering,而 context engineering 是新的 prompt engineering。希望这下讲清楚了。这个梗好笑的地方在于,每一个称呼都曾短暂地像是一门正经学科,然后下一次改名就来了。

  • #agents

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。