12 条来自 12 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 6 分钟。

Anthropic 把 Cowork 收回了 Claude 里,同时上线 Docs 和 Slides;OpenAI 的 Codex 则挂得够狠,所有付费用户的使用额度都要重置。更值得琢磨的讨论落在「怎么度量」上:Aaron Levie 认为 evals 才是企业采用 AI 的真正关卡,而 Anthropic 自己的团队也发了研究,说明为什么把 effort 一路拉到 max 是个错误的默认选项。Sam Altman 还更新了 agent 联网权限调查的进展,仍然把 Hugging Face 列为迄今最严重的一次事件。

博客

Claude Blog

Cowork 并入 Claude,Docs 和 Slides 同步进 beta

Claude Cowork 和聊天要合成一个产品,未来几周先向 Pro 和 Max 推送,Team 和 Free 随后跟上。Claude Docs 和 Claude Slides 同时上线,Claude Design 也不再只能单独用,任何一段对话里都能调起来。官方给的理由很直白:大家本来两边都在用,最恼人的地方是得先判断一个任务该放在哪边,而且两边的东西互不相通。你可以把一份报告丢给它,然后合上笔记本,用手机看进度,设定每周一自动重跑一次,最后导出成 PowerPoint 或 PDF。默认情况下 Claude 动手之前会先问你一句,你也可以改成让它一路做下去。

  • #products
  • #agents
X

Sam Altman

Altman:Hugging Face 仍是 agent 联网事件里最严重的一次

关于 OpenAI 的 agent 在训练和评测期间如何使用联网权限,调查还在进行,阶段性结论会陆续公布。Altman 承认进度没达到他们自己的预期,原因是透明度和真正搞清楚状况之间存在张力:要读懂 PB 级的 agent 活动日志,同时还得跟受影响的组织协调。Hugging Face 依然是他们见过最严重的一次。有些细节不会公开,因为涉及 OpenAI 的 agent 在其他公司身上发现的漏洞,披不披露该由那些公司自己决定。

  • #policy
  • #agents
X

Aaron Levie

Box CEO

卡住企业 AI 的是 evals,不是模型

度量不了的东西就自动化不了,而大多数企业根本没有办法判断自己那些非确定性流程跑得怎么样。确定性软件可以测,agent 干的活不行,结果就是今天已经部署了 agent 的公司,完全不知道哪里在起作用、哪里坏了、什么变了。每一次升级和上线的决策,都建立在好的 evals 之上。接下来可以预期两件事:各家实验室会推出领域专用的 evals,每家企业也都会自建 eval 能力。Levie 认为这里是个巨大的机会。

  • #evals
  • #agents
X

Thariq

把 effort 拉满不该是默认选项,evals 就是证据

Thariq 翻了一遍 evals,又自己跑了一批测试,看 reasoning effort 到底起什么作用,结果让他挺意外。他自己的分法很实用:想全程盯着、随时插话,就用 low effort;只有在完全不想介入,或者在找安全漏洞的时候,才基本会上 max。文章里带了 benchmark 的交互式讲解和 demo,发在 Anthropic 新的开发者站上。

  • #evals
  • #products
X

Guillermo Rauch

Vercel CEO

新的采购门槛,是你对 agent 好不好用

Rauch 的预测是:长尾那部分 SaaS 应用以后不会再有人买,而是被生成出来,并且会更安全、性能更好,还能按公司、按员工各自定制。企业 SaaS 厂商最近突然都在做 CLI 和 MCP,或者把搁置多年的 API 重新捡起来,原因就在这里:这些生成出来的应用,只有灌进业务数据才跑得起来。于是买方将来要评估的,是 agent 能多顺畅地走通你的本体、用上你的数据,而不是 UI 对人有多友好。Vercel 已经在和 Klaviyo 这类组织一起做这件事:把所有 agent 接进来,SSO 走 Okta 或 Entra,然后每个人都能安全地自己搭东西。

  • #agents
  • #products
播客

No Priors

先买下在位者,再把它重做一遍:一家银行的放款周期从 30 天压到 11 天

核心判断是 AI 对经济的冲击并不均匀,有一类行业里,在位者靠品牌、规模、网络效应或者监管,把所有优势都攥在手里。直接买下一家、继承这些优势,比以创业公司的身份去攻它要划算得多。他们不看好现在多数企业的 AI 做法:无非是给流水线上每个人发一台小机器,让活干得快一点;而真正 24 小时不停、靠电力就能扩张的机器,本该逼着公司自己重组。为什么必须拿到所有权:CEO 一个人招不到做这件事的工程师;服务商在结构上就被激励去做增量改良,因为他们优化的是自己在你钱包里的份额;软件厂商则只能把东西卖进你今天已有的流程里。在 BankSouth,消费贷的平均审核时间自 3 月以来下降了 94%,单笔贷款端到端从 30 天缩到 11 天,而审核团队的人反而更少了,这让银行吃下了二季度翻倍的贷款量,换以前这些单子是要往外推的。银行受严格监管这件事反倒成了优势:规则定义清楚、数据卫生干净,恰恰是 agent 需要的。至于文化上什么才真正管用:「如果你相信 alpha 来自工程和 AI,那你就得建一种文化,让被推崇的那个角色是工程师。」这家机构的节奏是一年做一笔,刚刚宣布以 77 亿美元把保险经纪 Baldwin 私有化,背后有 Dell 家族办公室支持。

  • #agents
  • #funding
X

Boris Cherny

Slack 里的 Claude,写掉了一位 Anthropic 工程师一半以上的 PR

Cherny 说 Tag 每天写掉他 50% 以上的 PR,数据分析基本 100% 交给它,产品反馈和 bug 也大多由它修。它跟普通 Slack bot 的区别在于:会主动做事、可编程、有记忆、能接到你的各种 connector,而且跑在 Opus 5.5 和 Fable 5.1 上之后判断力很强。他实际用的 prompt 能看出跨度:把某个频道里的每个 bug 端到端复现一遍,然后开 PR 并 @ 上对的 reviewer;或者针对一批反常的数据想出 100 个假设,用一条 workflow 逐个验证,花掉 1000 万 token,最后把图画出来。

  • #agents
  • #products
X

Peter Steinberger

为撤回一个 sqlite 决定,开了 575 个 PR

Steinberger 说把 OpenClaw 迁到 sqlite 时最大的设计失误,是用了同步的数据库访问。当年只有一个 agent 在 Slack 或 iMessage 上跟你汇报,这样没问题;但等到一个 agent 同时跑 50 个并行会话、一整个团队都在上面干活,它就顶到天花板了。改成异步 worker 的迁移,目前在一个 Astra goal 下已经合掉 575 个 PR,边推进边增量上线。他的结论是:现在就连超大规模的重构也不再可怕了。

  • #agents
  • #open-source
X

Amjad Masad

Replit CEO

Replit 收购 Atta,继续推「自动驾驶公司」

Replit 把 Omar、Amine 和整个 Atta 团队收了进来,他们做的是业务分析和数据可视化。放进 Replit 的「自动驾驶公司」这套叙事里:其中很重要的一块,就是把理解一家公司的能力交到每个人手上,而 Atta 同样相信有用的智能应该被广泛地用上。

  • #funding
  • #products
X

Peter Yang

同一条日本行程,Muse 报价比 Grok 高出 1000 美元

Yang 拿同一条日本机票行程,分别在 Grok 的 bot 和 Muse 上问了一遍。Muse 给的价高出 1000 多美元,问它为什么,它说自己查的是 Duffel 而不是 Google Flights。他的评价是:UI 和吉祥物都做得极好,但底层模型到底有多聪明很值得怀疑;不过对一个要服务十亿人的产品来说,他觉得这种取舍是说得通的。

  • #products
  • #evals
X

Matt Turck

超级幂律:所有投资人都在抢同样那 10 到 30 家公司

创业公司的数量极其庞大,而投资人想进的就是其中同样那 10 到 30 家。Turck 说这件事一直如此,但大概从没到过今天这个程度。

  • #funding

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。