16 条来自 14 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 7 分钟。

今天动静最大的是 Anthropic:一份复盘讲清了 Claude Code 为什么整整一个月都显得变笨了,一篇罕见坦率的文章披露了隔离架构背后的几起安全事故,还有一个托管 agent 服务,思路是把 agent 拆成可替换的几块。最后这个想法在 Vercel 那边也独立冒了出来,Guillermo Rauch 发布 Drives 的理由是:云端 agent 的大脑、双手和文件,本就不该待在同一台机器上。另一边 Opus 5.5 的使用评价还在陆续出来,而当天最见功力的观点,谈的是这些速度到底是为了什么。

博客

Anthropic Engineering

Anthropic 把一个月的 Claude Code 吐槽追到了三处互不相干的改动

三处互不相干的改动叠在一起,看上去就像整体能力下滑:默认 reasoning effort 从 high 降到了 medium;一项本该只清理一次旧 thinking 的缓存优化,实际在会话剩下的每一轮都清了一遍;还有一条 system prompt 规定工具调用之间的文本不超过 25 个词,拖累了编码质量。thinking 那个 bug 还造成了缓存未命中,Anthropic 认为这正是用量额度消耗得比预期快的原因。三个问题在 v2.1.116 全部修复,API 自始至终没受影响,现在所有用户在 Opus 4.7 上都默认走 xhigh effort。用量额度正在为每一位订阅用户重置。

  • #products
  • #models
博客

Anthropic Engineering

93% 的权限弹窗都被用户点了同意,所以 Anthropic 押注隔离

遥测数据显示,用户对大约 93% 的权限弹窗都点了同意。这一个数字就足以说明,盯着 agent 做了什么,不如限定它能够到什么。两起事故把话说得更实:内部红队钓鱼让一名员工粘贴了一段 prompt,让 Claude 读取 ~/.aws/credentials 并 POST 出去,25 次里成功了 24 次;另一起是一个被投毒的工作区文件,把数据通过 api.anthropic.com 上传到了攻击者自己的 Anthropic 账号,原因是出网白名单查的是目的地,而不是能力。上了操作系统级沙箱之后,权限弹窗少了 84%。他们反复强调的一条教训是:gVisor、seccomp 和 hypervisor 都守住了,出问题的是他们自己写的那个 proxy。

  • #security
  • #agents
X

Guillermo Rauch

Vercel CEO

Vercel 发布 Drives:agent 不用开机就能挂载的外置磁盘

Rauch 的框架是:每个干活的 agent 都有大脑(模型和 harness)、双手(工具、电脑、浏览器)和文件(记忆、skills、代码仓库)。省事的做法是把三样全塞进一台常开的 Mac Mini,但要在云上以划算的成本跑 agent,就得把它们拆开:harness 跑在 Fluid compute 上,配一份持久化的事件日志,这样重启和崩溃都不怕。Drives 补上的是缺失的第三块,于是一个每晚跑的记忆整理任务,可以读写 agent 的文件,而不必把它那台完整的电脑开起来。他认为这样拆开不只是更便宜,而且是拿到真正的安全性和可审计性的唯一办法。另外他让 Opus 5.5 优化了 shell 启动时间,说它找出了别的模型没发现的优化点。

  • #agents
  • #infrastructure
  • #products
博客

Anthropic Engineering

Managed Agents 把大脑和双手拆开,首 token 时间 p50 降了 60%

harness 里固化着「模型做不到什么」的假设,而这些假设会过期:当初为了对付 Sonnet 4.5 爱提前收尾的毛病而加的 context reset,到 Opus 4.5 就成了纯粹的累赘。于是 Anthropic 把 agent 虚拟化成三个接口:session(只追加的事件日志)、harness(那个循环)和 sandbox(跑代码的地方),每一块都能替换而不惊动另外两块。只在工具调用真需要时才开容器,首 token 时间 p50 降了约 60%,p95 降了 90% 以上。凭据完全不进 sandbox:git token 在初始化时就接进了本地 remote,MCP 的 OAuth token 存在一个 vault 里,前面挡着一层 harness 根本看不到的 proxy。

  • #agents
  • #infrastructure
X

Claude

Claude Marketplace 上线:连接器、付费 agent 和咨询伙伴

Claude 现在有了一个 marketplace,工具、agent 和专家伙伴都能在一个地方找到。里面既有 Slack、Notion 这类连接器和插件,也有 Cursor、CrowdStrike 等公司可供购买的 agent 和产品,还有 Accenture、Deloitte 这样的服务伙伴。开发者也可以把自己的工具、agent 或服务挂上去。

  • #products
  • #agents
X

Madhu Guru

Meta Sr Director of AI

逛衣服是消遣,找人修屋顶是受罪

他不同意 Ben Thompson 的看法:消费者和「把事办成」之间并不是单一的关系,把所有任务都当成人们乐意自己动手的事,是看错了品类。今天找人修屋顶,意味着搜索、看十条评价、电话来回打不通、跟保险公司协调、上门勘查、报价、隐藏费用、再约时间;有时候「更好」是指能比较更多选项,有时候是指几乎不用费力。他把眼下这种怀疑,跟 2000 年代初那句「我干嘛要在网上买 500 美元的电视」放在一起,并称消费者对能消除这类摩擦的 agent 有着极其庞大的潜在需求。

  • #agents
  • #products
X

Boris Cherny

Claude 给易出竞态的代码建模,靠找反例来抓 bug

针对搞形式化方法的那批人,Cherny 把这个循环讲清楚了:Claude 针对某个难缠的状态机或容易出竞态的部分,给程序建一个模型,在模型里找出反例,再把反例复现成真实的 bug,然后改代码。整个代码库并没有被形式化验证,只有最棘手的那些部分会被建模和检查。他还贴出了一篇文章,讲过去几周 claude.ai 和桌面端明显变快背后用到的技术。

  • #agents
  • #products
X

Peter Yang

最好的模型在一家,最好的 harness 在另一家

Yang 对 Opus 5.5 的评价:聪明、快、写东西好、聊起来有意思、rate limit 也大方,而且总能拿出让人意外的本事。他的意思是瓶颈已经挪到了工具这一侧:Claude Code 的 harness 现在需要好用的实时语音,加上浏览器和 computer use,才配得上这个模型,而 computer use 正在变好。他还找到一个 prompt,做出来的 slides 不是那种常见的企业味垃圾。

  • #models
  • #agents
X

Ryo Lu

危险不是 AI 让我们变懒,而是让我们忙个没完

一篇长文,反对把效率当信仰:发布更快、合并更多、管更多 agent、把每个循环都压短、把每一处停顿都抹掉,直到再没有时间守着一个问题,久到你真正的意图浮出来。他说 AI 本可以是一块画布,用来做奇怪的、私人的、原本不可能的东西,结果其中很大一部分正在变成量产垃圾的工厂:内容、漏斗、工单,以及假装成价值的假工作。你可以合并 2000 个 PR,第二天醒来看着仪表盘证明机器在你睡觉时一直在动,可要是你只睡五小时、不再跟人说话,这一切毫无意义。他写道,「速度不是意义」;真正的前沿是判断力,知道什么不该做,以及什么时候该停。

  • #agents
  • #culture
X

Thibault Sottiaux

DevDay 定在周二,而「打电话给 ChatGPT」已经是每天的工作方式

他把 DevDay 前的这段冲刺称作 OpenAI 最有野心的一次,说里面有些东西会改变你的工作方式,并把短时间内能做出这些新能力归功于 Astra。他讲得最具体的一块是语音:真的就是打电话给 ChatGPT,一边聊工作、查邮件、写点代码,一边管日程,整套插件生态都能用,包括第三方插件。

  • #products
  • #agents
X

Aaron Levie

Box CEO

成本降下来,拍出来的电影只会更多,不会更少

Levie 转发并放大了这样一个论点:门槛下降会让创意行业变大而不是变小。制片厂敢冒更多险,桌边坐得下更多人,全新的叙事形式随之出现。先例是动画:1980 年代它还被当成这门生意里的小众角落,如今成了最受喜爱也最赚钱的叙事形式之一;同样的还有 Spielberg、Cameron、Jackson 这些把新视觉工具当乐器而不是当捷径的导演。他自己补了一句:媒介会变,但对创意功力和品味的需求不会变,只是能用上它的人变多了。

  • #creative
  • #products
X

Thariq

帖子说是一次搞定,背后的 prompt 有一万字符

Thariq 调侃这类帖子:嘴上说「Claude 一把就做出来了」,背后那条 prompt 却有一万字符的高见,外加 skills、示例和 API key。与此同时,Claude Code 团队发了一种新形式的文章,把他们内部实际在用的 prompt 和技巧摊开来讲,目标是让人能照着复现,而不是看着厉害,他们也在问这种形式有没有用。

  • #prompting
  • #agents
X

Aditya Agarwal

SPC General Partner

该问这支团队一起干了多久,而不是有多少人

Agarwal 做尽调的经验法则:一起共事三年以上的团队,产出和抗压能力都明显强过刚凑起来的班子。一个人职业生涯里频繁跳槽说明问题,一家公司离职率低同样说明问题。他说只问团队规模而不问团队在一起多久,是投资人和求职者一犯再犯的错。

  • #hiring
  • #investing
X

Dan Shipper

Every CEO

Every 的线下聚会是 AI agent 策划的,连请谁都是它定的

Every 的 agent 把公司九月的聚会从头包到尾,从餐食酒水菜单到邀请名单全归它管。成绩明天晚上六点在他们布鲁克林的褐石屋当场揭晓,到场的人来评判 agent 能不能办好一场派对。

  • #agents
  • #products

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。