8 条来自 8 位 builder
往期

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 4 分钟。

今天最热的话题是 multi-model routing:让一个 frontier model 负责规划、再把具体活儿分给更便宜的模型,如今已经成了压低 agent 成本的核心套路,而 token 经济学则是从 Box 到 Booking 每个人都在琢磨的问题。另一条主线是护城河,或者说护城河的缺失,两位 CEO 都认为,真正持久的优势来自洞察力和不停歇的构建,而非规模或资本。此外还聊到了刷榜,以及如何围绕 coding agent 重塑公司和招聘。

X

Aaron Levie

Box CEO

Frontier model 做规划、廉价主力模型干活,agent 成本直降 15 倍

Multi-model 的 agentic 系统正在成为复杂 agent 的核心设计范式。援引 Cursor 的最新研究,frontier model 负责真正需要智能的那部分:最初的任务拆解、设计决策,以及某些权衡取舍,然后把其中的不确定性收敛成明确的指令,交给更便宜的主力模型照做即可,这样总的 token 成本直接降到原来的十五分之一。差异化会发生在应用层:既懂某个领域、又能在不同档位模型之间做 routing 的公司,会拿下更大规模的编程、金融、法律和医疗工作负载,而这些负载过去因为太贵而根本没法落地。

  • #agents
  • #products
播客

No Priors

Booking CEO:根本不存在所谓的护城河

Glenn Fogel 加入 Priceline 时,公司只值几亿美元,后来他帮着把它做到了超过 1300 亿美元。他坚信,持久的优势只能来自不断构建新的服务,而绝不是来自某条创新无法侵蚀的护城河。Priceline 的 agentic 助手 Penny 每个月的使用量都翻一番,既提升了转化率、又降低了取消率,不过相对于每年 1860 亿美元的旅行大盘,它仍然微不足道;眼下悬而未决的问题是 token 经济学,以及该把哪个模型 route 到哪里。谈到 AI 与就业,他很直白:社会总能适应,但真正让他担心的,与其说是技术本身,不如说是变化的速度,还有那个已经 50 岁、没法再去重新培训的卡车司机。

  • #agents
  • #products
  • #policy
X

Madhu Guru

通往 AGI 的路,是由一个个有经济价值的任务铺成的

企业 AI 是最重要的前沿之一,因为有经济价值的任务都在那里,而这些任务才是通往 AGI 的真正路径。如今真正要紧的 tokenomics 之争,跟加密货币无关,而是 open weights 与 closed weights 之争、inference 成本,以及 model routing。对于有产品 sense 的人来说,现在是前所未有的最好时代。

  • #agents
  • #products
X

Swyx

各大实验室如何靠训练“仿真测试集”悄悄刷榜

Alex Zhang 和 Omar Khattab 在那篇 RLM 论文里藏了一段轨迹对比的分析,戳中了 frontier 训练的一个公开的秘密:哪怕你不在测试集上训练,也可以拿“高度相似”的数据来训练,从而几乎能把任何一个 benchmark 分数凑到目标值;而且由于 open-weight 发布时很少会把能揭穿这件事的数据集或 RL 环境一并放出,所以还能矢口否认。他们给出的初步办法,是把标准的 NLP 距离度量用到那些隐藏的轨迹上。这事没有终极解法,但这番探索同时也印证了另一个发现:reasoning language model 能够泛化到那些它没见过、却和训练中所见共享潜在结构的任务上。

  • #evals
  • #open-source
X

Zara Zhang

如今的公司只分两种:在 coding agent 之前建的,和之后建的

在 coding agent 出现之后才创立的公司,从第一天起结构就不一样:团队不到十个人,因为他们是真的不需要更多;工作按项目而不是按部门来组织,每个人自己闭环,几乎没有内部会议。而所有在这之前建起来的公司,都在手忙脚乱地改造自己。与之匹配的是她设计的招聘流程:先来一轮线下面试,全程禁用 AI,用来考察最原始的领域专业能力;然后给一个不借助 AI 根本做不完的项目,对候选人的评判既看结果,也同样看重那份 agent 对话记录。

  • #agents
  • #hiring
X

Peter Yang

用另一个带评分标准的 agent,去检查第一个 agent 的活儿

对于那种主观的产出,比如一条短视频到底好不好,别让模型给自己打分。Thariq 解释说,你应该单独跑一个 verification agent,让它读一份评分标准(rubric)、审阅产出、再给出反馈,原因在于自我偏好偏差:当模型偏爱自己的产出时,检查起来就会手下留情。Yang 还认为,封禁中国的 open model,会和封禁中国电动车一样,属于搬起石头砸自己的脚。

  • #agents
  • #evals
X

Nikunj Kothari

AI 里没有护城河,不等于规模和资本就是你的护城河

过去 18 个月里冒出来的创始人,很快就要重新意识到:钱多、规模大,都替代不了一个独到的洞察。墓地里躺满了那些结构和财务都很强、却依然被击败、或在自身重量下崩塌的公司:Webvan、Groupon、MySpace、Yahoo、AltaVista、Blockbuster、Nokia。真正需要拿捏的分寸是:既要找到一个值得投入十年以上去追的洞察,又要足够审慎,别让资本和规模顶替了它的位置。

  • #funding
  • #products
X

Guillermo Rauch

Vercel CEO

AI 给我们上的一课:一切皆代码

一份幻灯片是代码,设计是代码,那条炫酷的宣传片是代码,Excel 自动化是代码,说不定连宇宙也是代码。这是 Rauch 的一套说法,用来解释为什么 AI 能把这么多创意和商业产物,统统收敛进同一种可随意塑形的介质里。

  • #products

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。