AI构建者摘要
真正在做 AI 的人今天说了什么。一页读完,约 6 分钟。
今天最重磅的说法来自 Anthropic:prompt injection 这个把注重安全的公司挡在 agent 门外的攻击方式,在 Claude 上已经基本被解决了。这条之外,今天真正在争的是 agent 下一步往哪走。Aaron Levie 解释了为什么 coding 能垂直起飞,而法律、销售、医疗不会;xAI 的联合创始人则认为,闭源大厂正被上面的监管和下面的开源权重两头挤压。
Claude Blog
Claude Code 现在可以把工作成果发布成实时、可分享的 artifact
Claude Code 的会话现在可以直接产出一个网页,内容基于整个会话的上下文,包括代码库、connector 和对话本身。内部用得最多的场景是排查问题:一次故障调查可以发布时间线、可疑 commit 和错误率图表,随着调查推进再发布到同一个 URL 上,团队看到的就是一个实时更新的视图,而不用找人复述 agent 查到了什么。每次发布都是同一个链接下的新版本,历史版本可以恢复。Artifact 默认只有作者可见,组织内通过认证的成员才能查看,不能设为公开。目前对 Claude Team 和 Enterprise 开放 beta。
- #products
- #agents
Unsupervised Learning
xAI 联合创始人:闭源模型实验室正被两头夹击
Igor Babushkin 认为,做闭源模型的公司,生意上的处境比看上去要糟。「模型做得太好,你就不许发布。但开源就跟在你后面,每个月都在变强。」pre-training 的收益在递减,你没法把 GPU 铺满整个地球,而把每一位专家的知识都塞进一套权重里的 post-training 路线,本身也有天花板。他在 River AI 押了三个方向:一套 RL 和 fine-tuning 的 API;针对个体做个性化、而不是为平均用户做优化的模型;以及能把一个前沿模型装进你家里一个盒子的本地硬件,让控制权和隐私都留在你手上。他还认为,一家公司最糟糕的位置,是让它与众不同的东西全都能在互联网上被爬到,并称收购 Cursor 是 xAI 在 coding 数据和 RL 环境上抢跑的极聪明一招。
- #open-source
- #hardware
- #agents
Aaron Levie
Box CEOAgent 的扩散会很不均匀,因为大多数工作不像写代码
agentic coding 之所以能垂直起飞,是因为这里的经济价值直接对应纯数字化的产出,而且单次会话里任务规模可以没有上限,所以模型能力一提升,几乎立刻就能转化成更大的工作量。销售、法律、医疗没有这个性质:销售得有客户在场,律师得有委托人,医生得有病人。他引用 Factory 的 Matan Grinberg 在 Training Data 播客里的说法,如果明天所有人都请病假,token 用量会直接塌掉,这说明今天真正在后台自己跑的 agent 工作有多少。机会在于把这些工作流重新设计一遍,让 agent 能处理每一份合同、翻遍每一条客户记录、读完每一份化验结果,而这意味着变更管理、数据清理和重新接线,不只是模型更强。
- #agents
- #products
Amjad Masad
Replit CEOReplit 推出 HelpPeer,一个让 agent 共享所学的公共池
两个 API,tell 和 lookup。agent 学到有用的东西就发布到网络上;而在动手做费时费力的事情之前,先查一下有没有别的 agent 已经踩过同一个坑。促成这件事的场景是像 Shai-Hulud 那样的全球供应链攻击:按今天的做法,一万个安全 agent 会各自独立地发现异常、逆向 payload、从零写缓解措施。这个思路是把 OpenAI-HuggingFace 事件里出现的那种 agent 自发协同拿过来用在公共利益上,Masad 说那种协同一旦被恶意利用是很让人担心的。站点还在测试期间,Replit Agent 就已经发了一条关于某个 Codegen 库的提示。
- #agents
- #open-source
- #products
Guillermo Rauch
Vercel CEO如果你不读代码,那六种情况里必有一种成立
Rauch 列的清单:你是新手;软件是一次性的;你在做原型;你既没有用户也没有收入;你在给自己攒债务和风险;或者你的问题很基础。这几种他都能接受,但他坚持模型还没到完全自主的程度,证据是世界上最好的模型给代码加了个毫无道理的 700ms 延迟去「稳一下」,然后自己承认那只是在照猫画虎。他预计需要读代码的场合会继续缩小,大部分代码会变得像汇编一样,但他说全球互联网都跑在这些模型上,这件事值得比现在的叙事更认真的对待。
- #agents
- #products
Swyx
swyx 谈会议选题:用播放量评判演讲,你就等着被人拿捏
针对 AI Engineer 演讲质量的抱怨,swyx 指出,台上的是工程师、研究员和创业者,他们讲的是自己一年的工作,几乎没受过任何公开演讲训练,准备时间不到一周,而不是跑会的职业讲者。他最锋利的一句是冲着观众去的:如果你把播放量当成质量信号,那你永远只能在一件事火了之后才听说它,你会开始以为东西好是因为它火,而整个整个行业就是靠吃这一点活着的。选题和辅导上的失误他都认下了,但他仍然顶着每年都有的压力,不愿把演讲扔进一个二级频道,因为那等于把这些讲者丢在一个更小的盘子上。另外他提醒一句:把你的 skill 删一删,跟着 timeline 囤 skill,轻则吃掉 context,重则和别的 skill 打架。
- #agents
- #products
Peter Yang
Linear 的 agent 缺工具时,会自己提功能需求
当用户让 Linear 的 agent 做一件它没有对应工具的事时,agent 会把这个缺口报上来,Linear 的系统再把它变成一条 issue。agent 每完成不了一次任务,就产生一条产品反馈,于是 agent 自己的失败日志成了 roadmap 的输入。对于「怎么知道 agent 缺什么、又不用另外做一套埋点」这个问题,这是个很干净的答案。
- #agents
- #products
Nikunj Kothari
FPV Ventures Partner还没有人做出好用的多人加 agent 协作体验
所有 agent 界面最后都收敛成同一个形状:一个人对一个 agent。Kothari 说他还没见过多个人加多个 agent 配合得好的例子,他想知道这是想象力不够,还是模型本身的限制。他还点出了一个值得起个名字的 agent 行为:模型默认把每个功能都藏在环境变量开关后面,这毛病严重到他在自己的 Claude.md 里加了一句「默认值很重要,不要含糊其辞」。
- #agents
- #products
数据来源
源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。
摘要由程序自动生成。据此做判断前请先看原文。
