13 条来自 13 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 6 分钟。

今天最响的一条线索,其实是同一件事的两个方向:Anthropic 的 Boris Cherny 展示了 Claude 如何悄悄维护线上应用、合入了 180 个 PR;而 Aaron Levie 等人则认为,正是这种杠杆让工程师更值钱,而不是更不值钱。Google 发布了 3.7 Flash,价格砍半,从立项到上线只用了三周;Vercel 想用一条命令接管所有 coding harness 的路由;一位 Meta AI 总监则给新的失败模式起了名字:prompt debt。而在这一切之下,chess.com 的创始人给出了一个跨越三十年的数据点:当机器超越人类之后,一项人类技能会变成什么样。

X

Boris Cherny

Claude 一直在维护 Anthropic 自家的应用:提了 388 个 PR,合入 180 个

过去几周,Claude 每天在 iOS、Android、桌面端、Web、CLI 和 Agent SDK 上跑维护例程,整个过程由一个 Slack 频道协调。这些例程包括:一个 crash fuzzer,在模拟器上到处乱点找崩溃,然后自己定位根因;一个重复代码合并器,专门给那些略有分歧的抽象提合并 PR;还有一个死代码清理器,先给疑似死代码加上日志,第二天如果没有任何触发就删掉。388 个 PR 里,经过 Claude Code Review 加人工 review,最终有 180 个被合入。例程出错的时候,修法是让 Claude 去调这个例程本身,有时候要反复迭代好几天。

  • #agents
  • #products
X

Josh Woodward

Google VP

Gemini 3.7 Flash 上线,价格降 50%,研发只花了三周左右

新的 Flash 模型更快,价格是上一代的一半,从启动到上线大概只用了三周。真正值得注意的信号是这个周期本身:发布节奏已经被压缩到这个程度了。

  • #products
X

Amjad Masad

Replit CEO

ARC-AGI-3 差点被一个 coding harness 拿下,Masad 觉得自己被验证了

加上 coding harness 之后,模型已经很接近解掉 ARC-AGI-3 了。Masad 把这看作对他一直主张的观点的证实:coding 才是那个能把 LLM 泛化到其他一切事情上的能力。他还顺带给了一个更尖锐的预测:到明年,用不用电脑会变成可选项,工作方式将发生根本改变。

  • #agents
  • #evals
X

Aaron Levie

Box CEO

“工程师会被淘汰”这个判断错得离谱,专业能力只会更值钱

实际发生的是,工程师拿到了一件电动工具,他们的价值不降反升,因为工程能力现在能应用到比以前多得多的工作上。自动化药物研发需要工程师,自动化制造需要工程师,接下更大的软件项目也需要工程师。往上抽象一层:AI 让公司接下更多的活,也就需要更多专家来把关;而更好的模型,在专家手里能发挥出的效用远高于在新手手里。

  • #agents
  • #products
X

Madhu Guru

Meta Sr Director, AI

Prompt debt 就是新的技术债:每次模型更新,砍掉一半 prompt

大多数 AI 产品都背着臃肿的 system prompt,而且这些 prompt 正在实实在在地拖累质量。累积的路径大家都很熟悉:模型某件事做不好,加十条规则;tool call 失败了,加十个例子;输出看着别扭,再加一堆格式约束。三个月后,system prompt 长得像一部小说。与此同时底层模型已经聪明了很多,你那些事无巨细的规则又把它按回成一台笨拙的规则机器。他给的药方很激进:每次模型更新,至少删掉 50% 的 prompt。另外他数了一下,叫“Studio”或者各种变体的 AI 产品,已经超过 20 个了。

  • #agents
  • #products
X

Guillermo Rauch

Vercel CEO

Rauch 押注:一条 token 路由命令会成为跑 coding AI 的默认方式

他的说法是,一条命令就能把你已经在用的所有 coding harness 配好,Claude Code 和 Codex 都包括在内,而不是取代它们。换来的是可用性、模型选择权、更低的成本、可观测性,以及零数据留存。他预测这会成为 coding AI 大规模使用时的默认方式,目前还能通过它免费用 GLM 5.2,速度最高每秒 500 token。

  • #products
  • #agents
播客

No Priors

计算机战胜人类三十年后,国际象棋反而比任何时候都更火

Chess.com 的起点是 2005 年一场破产拍卖里花 56000 美元买下的域名,当时所有投资人都说这生意不值得投;如今它有 1000 万日活、2.5 亿注册用户、年收入超过 2 亿美元,而且从未为增长融过一分钱。反直觉的地方在于引擎对这项运动做了什么:Stockfish 一度让国际象棋变得无聊,选手们都在磨完美残局;后来 Leela 这类自学的神经网络开始用激进、不按套路的下法击败它,反而让这项运动比历史上任何时候都更好看。至于人类为什么还要下,Allebest 说得很直接:“人就是想干人的事。”关于如何习得专业能力,他手上几百万玩家的数据给出的答案,用他自己的话说是既幸运又不幸的:重复没有捷径,有捷径的只是工具。他的说法是,拿你人生中任意一天,乘以一千,那就是你人生的样子。这家公司现在正把同一套评分体系搬到 gambit.com 上做扑克,逻辑是人们会像在意钱一样在意自己的分数,因为分数衡量的是水平,而不是谁能一直加买筹码。

  • #products
  • #evals
X

Swyx

把 agent 的提问打包批处理,像 speculative decoding 一样,做设计时特别好用

agent 循环里最贵的一环是人的输入,所以他没有让 agent 一轮一轮地问,而是做了一个 /align-me 的改造,让它成批地问。类比的是 speculative decoding:与其每一步都等确认,不如往前预判 2 到 10 步,速度就上来了。他说这套在设计探索这个场景下效果好得出奇。

  • #agents
X

Matt Turck

FirstMark Capital VC

创业公司只剩两类:AI 原生的火箭,和已经被判死刑的

中间地带消失了。当火箭意味着要一刻不停地融资,估值高到吓人,只为了把资本和人才一并吸走;还要和其他火箭为客户打一场死斗,把毛利率打没。除此之外的公司,无论本身做得多好,都被归到已经被判死刑那一类。这个局面已经持续一段时间了,但 Turck 认为最近这一程又往上顶了一个档。

  • #funding
X

Nikunj Kothari

FPV Ventures Partner

一个主 agent 还是一堆专用 bot?Kothari 押 orchestrator 赢

Grok Bot 的设计是把 agent 当人看,每个 bot 的工具、上下文和产出都各自隔离,你为特定目标去找特定的那一个。另一条路是 Jarvis 模式:一个主 agent 直接把事办了,需要什么子 bot 就自己派生,交互从一对多变成一对一。他的判断是,因为上下文窗口、工具调用和成本这些实打实的工程约束,这个领域会先从窄的做起,然后收敛到那个能读懂你创建的所有 bot 的主 orchestrator 上。

  • #agents
  • #products
X

Thibault Sottiaux

Google Docs、Sheets 和 Slides 现在能在 ChatGPT 里用了

你可以直接在 ChatGPT 里打开一个文档,用打字或说话的方式改,不用跳出当前流程。他说这改变了他写东西、头脑风暴和校对的方式。另外,一个专门吐槽你当天电脑使用情况的 Computer History 插件,结果意外地很有诊断价值:某一天记录到的活动里 48% 是 Slack,用得最多的快捷键是 Delete,按了 1191 次,最忙的时段是晚上 9 点。

  • #products
X

Zara Zhang

现在有需求的岗位名称,里面还都带着“engineer”

当初的预测是,AI 写代码会让工程师贬值。而实际的就业市场给出了相反的答案:forward-deployed engineer、design engineer、product engineer、growth engineer。这个词不但活了下来,还繁衍出了一批新岗位。

  • #products
X

Peter Yang

家人生病时,AI 最有用的地方是帮你对付流程官僚

在家人遇到健康问题时,他原本以为自己会用 AI 去查资料、搞懂这个病。结果帮助最大的,是应付医疗系统里的各种流程。他还抛出了一个值得关注的开放问题:产品规格文档现在是不是需要分成两部分,一部分给人看,一部分给 agent 看;还是说一份文档就能同时服务两者。

  • #products
  • #agents

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。