15 条来自 15 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 5 分钟。

Cursor 的结局成了这一天里应用 AI 的罗夏墨迹测验,创业者们从中读出的结论是:价值就沉在模型和工作流之间的那一层。抛开这些表态,更有价值的思考来自真正在做长周期 agent 的人:当没有编译器替你把关时,你要怎么验证 agent 干的活;以及为什么你 context 里的那些英文,比你的代码更值得花心思。Google 把 3.7 Flash 推进了 Gemini app,Anthropic 则让 Claude 接入了 Apple 的 Foundation Models framework。

X

Aaron Levie

Box CEO

Cursor 打碎了一个假设:开发者工具最多也就卖到十几亿美元

agentic coding 的市场规模,远超几乎所有人此前的测算,而且 Cursor 起步的那个时间点,大家普遍认为这块已经饱和了。值得抄的打法是:为 agentic 的工作方式找到对的产品形态,站在模型和工作流之间做中立的一层,只在能压低成本或提升表现的地方去 post-train 模型,围绕具体工作流自建基础设施,再配上和品类相匹配的 go-to-market。在用户和底层模型之间,可以创新的空间比人们以为的大得多。

  • #agents
  • #products
播客

The MAD Podcast with Matt Turck

一百次 eval 全过,也说明不了 agent 能不能泛化

Basis 做的 agent 能端到端准备整份报税表,推理步骤深达数千步,而核心教训是:只看结果的 eval 远远不够。「就算你一百次里对了一百次,如果一个人只是靠去翻 Wikipedia 才做对的,会计师事务所不会雇他,那也就不该雇我们。」解法是 behavior spec:一份份 markdown 文件,从不给 agent 看,由一个充当裁判的 agent 拿它来给 agent 的完整轨迹打分,这样你奖励的是过程,而不只是答案。最扎人的一句是冲着工程师去的:有人一门心思纠结抽象设计,自己的 context 却一团乱,可运行时真正影响表现的是那些英文,代码怎么组织并不影响。

  • #agents
  • #evals
  • #open-source
博客

Claude Blog

Claude 现在可以通过一个 Swift package 接进 Apple 的 Foundation Models framework

Apple 开发者可以把轻快的本地任务交给端上模型,遇到需要多步推理、代码生成、网页搜索或代码执行的请求,再转手给 Claude,响应会流式回到同一个 SwiftUI view 里。由于这套 framework 会根据 @Generable 标注返回带类型的 Swift 值,传给 Claude 的是干净的结构化输入,而不是用户输入的原始文本。明天起在 iOS 27、iPadOS 27、macOS 27、visionOS 27 和 watchOS 27 上可用,用 Anthropic API key 鉴权。

  • #products
  • #agents
X

Madhu Guru

Meta Sr Director, AI

照蒸汽机的规律,软件变便宜只会带来更多软件,不是更少

蒸汽机效率提高,煤的需求反而涨了;高级语言出现之后,代码写得多得多;表格软件变便宜,做出来的财务分析也多得多。AI 加软件工程应该走同一条曲线:软件会多得多,而且瞄准的是过去不值得去解的那些问题。他还认为 Cursor 的文化影响被低估了,因为「cursor for x」给整个行业提供了一个产品范式,让大家从 chatbot 阶段里走了出来;而当人人都能用 AI 做东西时,差异化就只剩下产品判断、领域知识、分发和执行。

  • #agents
  • #products
X

Nan Yu

Linear Head of Product

AI 不是参差不齐,它只是长成了 AI 的样子

说 AI「jagged」,就像因为狗在某些事上比人强、某些事上比人差,就说狗参差不齐。这是拿一个人类基准去衡量另一类东西,而这个框架本来就不对。另外,如果你相信同事都很聪明,那他们的想法一定有来处;Linear 做出来最好的一些东西,本身就是好几个想法的融合,或者是离原始概念已经很远的衍生品。还有一句:科技行业里没有哪种力量比 PM 的晋升材料更具破坏性。

  • #products
  • #agents
X

Peter Yang

X 的反垃圾模型压根不读正文,AI 内容工厂就这么大摇大摆过关了

翻 X 的开源算法能找到 TweetSpamBot,这是个行为模型,会分析一个账号最近多达 512 个动作,看发帖爆发、引用推行为、时间点、两次动作之间的停留等信号,标记出 TWEET_CREATE_BURST、QUOTE_TWEET_SPAMMER、CONTENT_AMPLIFIER 这类模式。分数高会触发账号验证,但似乎并不会把那些垃圾内容本身降权。缺口就在于这个模型从不看帖子内容,于是一家内容工厂完全可以盯住爆款帖,一天引用十几次,在毫不相干的话题上反复套同一个「钩子加数字加故事加总结」的模板,照样干干净净。

  • #products
  • #policy
X

Peter Steinberger

OpenClaw 团队开始用 OpenClaw 来做 OpenClaw

把 agent 的会话以 URL 形式分享出来,成了关键的那一环,团队可以像甩一个文档链接那样,把做到一半的 agent 工作交接出去。他们还在共享的 AGENTS.md 里加了一条:任何改动 UI 状态的 PR 都必须传一段录屏,把视觉评审直接压进 diff 里,而不是留给 reviewer 自己脑补。

  • #agents
  • #open-source
X

Garry Tan

Y Combinator President & CEO

有了 Fable 5,面对不可逆的决策,「全部采纳建议」成了个安全答案

在 Fable 5 前后都用过 GStack,最意外的变化是:Claude Code 抛出来的很多不可逆决策问题,现在直接回一句「全部采纳建议」就行,结果你还挺满意。另外说到住房:反对派其实是在替 YIMBY 整理一份需要废除的加州法律的完整清单。

  • #agents
  • #policy
X

Guillermo Rauch

Vercel CEO

Vercel 称自家 AI Gateway 是全球最快的基础设施

针对 Vercel 的 AI Gateway 直接给出性能主张,把路由延迟摆成了应用与模型厂商之间这一层的竞争维度。

  • #products
X

Amjad Masad

Replit CEO

用 TestFlight 做自用的 iOS app,不必上 App Store

对于那些你压根没打算发布的 app,TestFlight 是一条被低估的分发路径。如果这个 app 只给你自己或者少数几个人用,你不用碰 App Store 审核,就能拿到一个真正装在机器上的 iOS app。

  • #products
X

Matt Turck

AI 把一天的工作压缩成纯决策,这很耗人

AI 之前,一个工作日是一个决策后面拖着长长的流程,如此反复到晚上十点。有了 AI,就是决策接决策接决策,到下午三点脑子已经空了。原来那些处理性的活儿,恢复作用比谁估计的都大。

  • #agents
  • #products

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。