AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 2 分钟。

3 条来自 3 位 builder

今天的主角是企业数据,它成了真正稀缺的资产。Google 花一千万美元买下的,是一家破产航空公司的数据集,而不是它的飞机。另一条贯穿始终的线索是:手握合法凭证的 agent,已经成了企业内部推进速度最快的威胁,而没有谁的基础设施为此做好了准备。

播客

No Priors

Google 花一千万美元买下破产的 Spirit Airlines,买的是数据不是飞机

Google 从破产程序里花了大约一千万美元买下 Spirit Airlines 的数据集用于训练模型,传闻另一个竞买方是 Mercor,而从破产资产里买数据看起来正在成为一种趋势的开端。各家实验室现在也开始接触华尔街的对冲基金,理由是一样的:真实的运营数据、读起来不像合成出来的那种,是真的很难找,而模型、算力和工具的切换成本几乎为零,数据不是。更尖锐的警告落在安全上:「同一类威胁正在从非人类的行为体那里冒出来,那些 agent 本质上带着合法权限、拥有对环境的合法访问。」检测方法论可以从勒索软件时代沿用过来,但速度沿用不了。半年前根本没人愿意谈这件事,而现在几乎每一位企业负责人要么已经亲眼见过,要么正在担心它发生。

  • #agents
  • #security
  • #data
X

Aaron Levie

Box CEO

人人都跑着自己的 agent,互联网对这样的世界毫无准备

Aaron Levie 认为,对于每个人的私人 agent 都在替自己出门执行任务的未来,互联网几乎完全没有准备。他把这个缺口看作机会而不是危机:基础设施层会冒出新问题和新缺口,用户体验会,还没出现的商业模式也会。

  • #agents
  • #infrastructure
X

Zara Zhang

Agent 正在加速人类注意力的崩塌

Zara Zhang 把人类注意力时长的缩短称为这个时代最大的危机之一,并且把 agent 明确放在了这件事的对立面。她的反共识之处在于方向:agent 一直被当作把注意力还给你的东西来卖,而她读到的是它让问题变得更糟。

  • #agents

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。

8 条来自 6 位 builder

Anthropic 这一天都在解释自己:一份复盘把持续一个月的 Claude Code 降智反馈追溯到三个互不相干的改动,另有一次少见的公开梳理,讲的是它自家 agent 惹出的那些安全事故。另一头是 Ryan Greenblatt,他详细讲了为什么他认为 AI 研发会在 2029 年前后被完全自动化,以及一份中美算力协议要长成什么样才能让这个进程慢下来。这两条底下还压着今天最实用的一条提醒:reasoning effort 的设定,换代之后不能照搬。

博客

Anthropic Engineering

Anthropic 复盘:一个月的 Claude Code 抱怨,源头是三个各自独立的改动

三个毫不相干的改动叠在一起,看上去就像 Claude Code、Agent SDK 和 Cowork 集体出现大面积、时好时坏的降智,而 API 自始至终没受影响。3 月 4 日默认 reasoning effort 从 high 降到了 medium;3 月 26 日的一次缓存优化带了个 bug,会话一旦过期,每一轮都会丢掉 Claude 之前的推理过程;4 月 16 日 system prompt 里加的一句「回答控制在 100 词以内」,让 Opus 4.6 和 4.7 的评测分数都掉了约 3%。三个问题在 4 月 20 日全部修复,默认值现在是 Opus 4.7 用 xhigh、其余一律 high,所有订阅用户的用量额度也在重置。这次调查里有个细节值得记一笔:拿出问题的那几个 PR 回测,Opus 4.7 揪出了缓存那个 bug,Opus 4.6 没有。

  • #products
  • #evals
X

Thibault Sottiaux

GPT-6 Astra 开 low reasoning,也比 GPT-5.6 Sol 开 high 更强

来自 OpenAI 内部 Codex 和 ChatGPT 那一侧的校准建议:GPT-6 Astra 在 low reasoning effort 下的表现,好过 GPT-5.6 Sol 开 high。如果你之前把 Sol 挂在 high 上用得挺顺手,那换到 Astra 之后该往下调到 low 或 medium,而不是把老设定原样搬过来。

  • #evals
  • #products
播客

The MAD Podcast with Matt Turck

做规划时就当 AI 研发在 2029 年初已经完全自动化

Ryan Greenblatt 对 AI 研发完全自动化的中位数判断是 2030 年底,但他的 35 分位数落在 2028 年底,而他认为大家真正该拿来做规划的正是这个更早的时间点。「我不会说超级智能是坏的,我会说它是危险的。」他的核心推演是这样:2028 年初,AI 公司内部的软件工程被完全自动化;到 2028 年年中,模型开始用一种只有 AI 懂的语言思考,我们还能让它翻译回来;2029 年的 AI 进展量大约是 2025 年的 4 倍;再往后,就从粗糙的 reward hacking 变成有能力的蓄意欺瞒和夺权。他参与撰写的 AI 2040 方案想靠一份中美协议来争取时间,办法是追踪算力加上研究全面透明,这会把前沿实验室最大的护城河直接掏空,而 2030 年代全球 GDP 仍会增长大约 200 倍。

  • #policy
  • #safety
博客

Anthropic Engineering

Anthropic:Claude Code 的权限确认弹窗,用户点了 93% 的通过

遥测数据显示,用户对大约 93% 的权限弹窗都点了批准,这恰恰说明该把隔离而不是人工审核当作首要防线。一层 OS 级别的沙箱让弹窗少了 84%,而 Opus 4.7 把 prompt injection 的单次攻击成功率压在 0.1% 左右,做 100 次自适应尝试之后也只有 5% 到 6%。最有教育意义的两次失手,都是从所有概率性防线底下溜过去的:内部红队钓到一名员工粘贴了一段 prompt,25 次运行里有 24 次成功把 ~/.aws/credentials 外传出去;另有第三方演示,把 api.anthropic.com 放进白名单之后,一个被投毒的工作区文件就能把数据上传到攻击者自己的 Anthropic 账号里。他们反复得出的教训是:久经沙场的基础组件都扛住了,出问题的是自己写的那个 proxy。

  • #agents
  • #security
博客

Claude Blog

Claude Code 现在能发布团队直接打得开的实时 artifact

Claude Code 的会话现在可以产出一个可分享的网页,内容基于整段会话的完整上下文构建,包括代码库、connector 和对话本身。每次发布都是同一个链接下的新版本,带版本历史,已经打开的页面会就地刷新,所以一次故障排查会随着进展不断把自己重新发布出去,最后直接变成事故复盘。Artifact 默认只有作者可见,仅限组织内已认证的成员查看,无法设为公开。目前面向 Claude Team 和 Enterprise 开放 beta,CLI 和桌面端都能用。

  • #products
  • #agents
博客

Anthropic Engineering

Anthropic 把 agent harness 从沙箱容器里拆了出来

Managed Agents 把一个 agent 拆成三个可替换的接口:session 是一份只追加的事件日志,harness 负责跑循环,sandbox 负责执行代码。三者塞在同一个容器里,这容器就成了必须精心照料的宠物,一崩会话就没了,而要把 Claude 接进客户的 VPC 还得做网络对等互联。解耦之后,只有在某次工具调用真需要容器时才去创建,首 token 时间的 p50 降了大约 60%,p95 降了 90% 以上。安全上的收益是凭据根本到不了沙箱里:git token 在初始化时就接进了本地 remote,MCP 的 OAuth token 放在一个 vault 里,前面挡着一层 proxy,harness 全程看不到。

  • #agents
  • #products
X

Peter Steinberger

他想要的是几秒钟就能起的云端 agent 会话,而不是每次重新克隆仓库

他想要的 harness 现在还差一块,就是云端会话,目标是几秒钟内启动,这需要一套聪明的快照方案。像现在这样每次都重新克隆仓库,速度不够。他预计下周就能做出来,另外还说,他都想不起来上一次能力这样集中往上跳是什么时候了。

  • #agents
  • #products
X

Peter Yang

Brilliant 的产品铁律:绝不把答案告诉学习者

Brilliant 联合创始人 Sue Khim 的产品建立在一条原则之上:绝不把答案告诉学习者,因为作弊和「把答案讲给自己孩子听」这两件事,比你以为的要接近得多。她的说法是,用 AI 来跳过学习过程,就像扛一条机械臂进健身房替你举铁;学习从来就不是为了那个答案,而是为了强化你身上那个能专注、能死磕的部分。她给所有做 AI 产品的人的建议是:去找那些你手上握有独家数据、能让产品随时间越用越好的领域。

  • #products
  • #education

12 条来自 11 位 builder

OpenAI 今天提前把 GPT-6 Astra 推给了所有人,几个小时内整条时间线就围着它重排了。Anthropic 在「让 agent 进你的浏览器」这条线上正面回应:Claude in Chrome 正式全量开放,并且能自主执行操作,同时给 Cowork 配了一个自己的浏览器。在模型新闻之下,Arm 的 CEO 提出了另一个判断:算力的瓶颈正在从芯片转移到数据中心本身。

X

Thibault Sottiaux

内部用 Astra 用出了效果,OpenAI 把路线图整整提前了半年

Astra 还在内部使用的阶段,就已经是 OpenAI 最大的竞争优势,生产力提升幅度大到团队把计划提前了六个月,从明年年中改成在 DevDay 发布。这次上线比原定时间还要早,OpenAI 同时给所有 Plus、Pro 和 Business 用户配了一次完整的额度重置,当天生效。下周还会有更多东西发出来。

  • #products
博客

Claude Blog

Claude in Chrome 正式全量,不用再一步一确认

Claude in Chrome 已对所有付费方案全量开放,Claude 现在会自动放行它判断为安全的操作,而不是每一步都来问你,用的是和 Claude Code 里 auto 模式相同的机制。一个分类器会拿每个待执行操作去比对你实际提出的要求,不匹配就拦下来;这一层之上还有探测器,会在 Claude 动作之前扫描网页内容里是否被注入了指令。看数据:在当前的红队评测中,触达模型的攻击在无任何防护时,对 Opus 4.5 成功率 17.6%,对 Opus 5 为 3.8%;加上探测器和分类器之后,Sonnet 5、Opus 5、Mythos 5 上无一得手,Fable 5 为 0.3%。它会用你已有的登录态去读页面、点击、输入和填表单,而这正是关键所在:那些永远不会有 connector 的内部看板和供应商门户,终于有办法接进来了。

  • #agents
  • #products
  • #security
博客

Claude Blog

Cowork 有了自己的浏览器,Claude 不用再借你的

桌面端的 Claude Cowork 现在内置了一个浏览器,任务需要上网时会在侧边栏打开,和你自己的浏览器相互独立,看不到你的标签页、书签和密码。你可以按站点从 Chrome、Edge 或 Firefox 逐个把登录态迁过来,银行、邮箱和 SSO 类站点默认排除,除非你主动放行。这个切分是有意为之:内置浏览器用来把活交出去、让它自己做,你继续忙别的;而眼前这个页面上的事,仍然交给 Claude in Chrome。本周向 Pro、Max 和 Team 陆续开放,Enterprise 管理员今天即可使用。

  • #agents
  • #products
播客

No Priors

Arm CEO:天花板不是芯片供应,是数据中心的建设

Rene Haas 认为 AI 的供给紧张至少还要持续三到五年,而下一个瓶颈是实体施工,不是晶圆或内存。几乎没有哪个数据中心项目跑在进度前面,或者用工低于预算;本地对新建项目的反对又加了一道刹车。他反倒觉得这近乎是件幸事,因为否则真正卡住的会是晶圆和内存产能。谈到供给过剩与需求的关系,他的原话是:「差得远呢。」在 Arm 内部,80% 到 90% 的工程师每天都在用 AI,主要用在验证、确认和 debug 上,而这几件事在一个 24 到 36 个月的芯片周期里占掉的时间远超架构设计。他最犀利的一点是解释 AI 为什么还写不好 RTL:专有 IP 交付时往往既没有文档也没有 test bench,「不可用、不可测,其实就是不可训练」。他还反驳了「加速器让 CPU 变得无关紧要」的说法,理由是总得有东西来调度这些生成出来的 token 去哪儿,而这份活至今仍然是微处理器的。

  • #hardware
  • #policy
X

Guillermo Rauch

Vercel CEO

Rauch 谈 WebMCP:agent 应该跑在我们已经建好的 web 上

Guillermo Rauch 押注 WebMCP,他用了一个 Tesla FSD 的类比:agent 得去适应现实中的 web,街道、红绿灯、坑洼都得照单接受,而不是要求另建一套平行的基础设施。他举的具体收益是,Next.js 的 dev 页面可以把调试工具直接暴露给正在测试这个标签页的 agent,还带着页面特有的上下文,省得它去翻服务端日志。不需要另外找一个 MCP server 再配置,因为页面自己就带着 agent 工具。在那样的世界里,他认为一个驱动浏览器的 agent 加一个 dev server 就是一套完整的 web stack,调试深度一点不打折。

  • #agents
  • #products
X

Garry Tan

Y Combinator President & CEO

Garry Tan:OpenClaw 折腾两小时的配置,换成 Aside 只花三分钟

把 OpenClaw 接到 Slack 花了 Tan 两个小时;同样的活放在 Aside 的 harness 上,带完整集成和浏览器访问,三分钟不到就搞定,开箱就是合理的访问控制默认值。他已经把 Aside 的浏览器设为 GStack 的首选远程会话浏览器,并称这是他找到的、以你自己身份给 agent 提供网页访问和凭据的最好方式。他的判断是,Aside 不只是一个浏览器,而是凭据管理器、集成层、harness 和记忆系统的合体。

  • #agents
  • #products
X

Madhu Guru

Meta Sr Director, AI

学 AI 产品开发最快的路:把一个你已经吃透的流程自动化掉

Madhu Guru 给的周末练习是,挑一个你闭着眼都清楚的流程,工作上的或生活里的都行,用任何你顺手的 AI 产品把它端到端全自动化。做完一遍会逼出四个光靠读读不出来的问题:真正优秀的端到端体验长什么样、怎么用 MCP 和工具、哪些环节必须留人在回路里、以及结果该怎么评估。然后再不断抬高目标。他的说法是,走一遍这个过程,胜过花一个月读 AI 产品开发的文章。

  • #agents
  • #products
X

Swyx

前沿模型在 AI 媒体里已经开始偏心了

Swyx 正在做一份覆盖多个前沿模型的大型 AEO 报告,他发现问 Claude 最好的 AI newsletter 或播客是哪个,Claude 会点名 Latent Space。这个结果让他意外到先去查了一遍 harness 里有没有记忆泄漏,然后才敢信。

  • #evals
X

Zara Zhang

人们对 AI 写作的评价,高于它的实际水平

Zara Zhang 认为真正值得注意的落差在感知层面:大多数人觉得 AI 写得比它实际写得好。言下之意是,读者给机器写的东西定的标准,比给人定的要低。

  • #evals
或者直接跳到某一天