Thibault Sottiaux
OpenAI 取消免费版 ChatGPT 文字对话限额,由 GPT-5.6 Luna 驱动
OpenAI 取消了免费版 ChatGPT 文字对话的次数上限,现在由 GPT-5.6 Luna 驱动。Sottiaux 还描述了 Codex 搭配 GPT-5.6 Sol 之后的新标准:花五分钟跟它聊一件看起来要几周才能干完的活,然后起身去翻翻冰箱、撸撸狗,回来发现活已经干完了。
- #products
- #models
真正在做 AI 的人今天说了什么。一页读完,约 5 分钟。
OpenAI 让免费版 ChatGPT 的文字对话基本不再限量,Anthropic 这边也没闲着:Fable 5 放宽了生物学方面的安全限制,Claude 则进入了 Apple 的 Foundation Models 框架。不过今天最犀利的思考都围绕 agent 展开。Basis 开源了他们给 agent 执行过程打分的方法,Aaron Levie 则认为与 agent 协作更像是管理一个人,而不是向聊天机器人提问。
OpenAI 取消免费版 ChatGPT 文字对话限额,由 GPT-5.6 Luna 驱动
OpenAI 取消了免费版 ChatGPT 文字对话的次数上限,现在由 GPT-5.6 Luna 驱动。Sottiaux 还描述了 Codex 搭配 GPT-5.6 Sol 之后的新标准:花五分钟跟它聊一件看起来要几周才能干完的活,然后起身去翻翻冰箱、撸撸狗,回来发现活已经干完了。
新 Swift package 让 Claude 接入 Apple 的 Foundation Models 框架
一个新的 Swift package 让 Apple 开发者可以通过 Apple 的 Foundation Models 框架调用 Claude:端侧模型负责摘要、信息抽取这类快速的本地任务,遇到多步推理、代码生成、网页搜索或数据分析就交给 Claude。由于框架会根据 @Generable 注解返回带类型的 Swift 值,Claude 拿到的是干净的结构化输入,而不是原始的用户文本。它明天就会在 iOS、iPadOS、macOS、visionOS 和 watchOS 27 上发布。
Basis 开源 behavior specs:给 agent 打分要看过程,不只看结果
通过 eval 不代表你的 agent 具备泛化能力:“就算一百次里你答对了一百次,如果一个人只是靠去查 Wikipedia 才答对,会计师事务所不会雇他,那也不该雇我们。”Basis 的会计 agent 会自主运行数小时到数天,处理完整报税这类工作,他们用 behavior specs 对 agent 的过程和结果一起打分:用纯 markdown 文件写明 agent 应该如何行事,再由一个本身也是 agent 的裁判来检查,现在已联合 Braintrust 将其作为开放标准发布。Troyanovsky 更大的一层观点是,context 就是运行时的训练数据,他认为大多数开发者把代码看得比 context 金贵,而实际恰恰相反,因为只有 context 会影响表现。
Levie:给 agent 写 prompt 是在写 spec,工作流本身也得跟着变
Levie 引用了一篇他推荐的文章,认为“给 agent 写 prompt 更像是在写 spec,而不是在问一个问题”,而且真正的红利要等到公司改造底层工作流时才会出现,而不是把 agent 硬套在现有流程上。他预测企业 token 消耗的绝大部分将来自部署在工作流里执行任务的 agent,而不是聊天。他还把 Atlassian 大超预期的季度财报解读为一个证据:agent 让代码产量多出 100 倍,反而让 system of record 变得更重要而不是更不重要,因为企业仍然需要治理、安全和对数据的安全访问。
Masad:no code 已死,因为正解从来都是解决代码本身
在 Masad 的叙述里,no code 的兴衰始于 Airtable,也终于 Airtable:他当年和投资人争论了无数次,说 UI 永远不可能让你构建任意软件,要让软件人人可及,就得解决代码本身,这话直到今天之前听起来都像痴人说梦。他还分享了一段往事:2021 和 2022 年他找过 Google、Meta 和硅谷几乎所有公司,希望和 Replit 一起训练专门的代码模型,没人觉得这事比 NLP 重要,于是 Replit 赶在整个行业意识到代码模型的价值之前,自己训练了 Replit-code-3b。
Yang:消费级 AI 市场的主动权在 ChatGPT 和 Google 手里
消费级 AI 市场的主动权握在 ChatGPT 和 Google 手里:两家都有大约十亿用户,真正的门槛在于主流用户还不放心让 AI 完全访问自己的应用和数据,也没意识到它现在能做什么,这让市场营销和信息传达变得和产品本身一样重要。他最尖锐的一个判断是,对普通人来说,模型是不是最强几乎无关紧要;他那些不搞 AI 的朋友根本不在乎 Sol 和 Fable 哪个好,只要价格公道、活儿能稳定干完就行。
Kothari:VC 不会告诉你的融资技巧,先从 10% 的底线说起
一份创始人很少听到的融资实操心得:要拿到能直达 GP 本人的熟人引荐,最好来自他们投过的创始人;要知道任何成熟的领投基金都不会接受低于 10% 的稀释;永远不要拿竞争对手的融资估值给自己锚定价格,他称这是搞砸交易的头号方式。也别在 term sheet 上撒谎,因为在这个人人互通消息、每份 deck 都会外流的市场里,发条短信就能核实。他说这是他近来见过共识最强的市场,所以热门赛道之外的创始人应该带着自己的逆共识论证和一份 default-alive 的活命计划再来。
源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。
摘要由程序自动生成。据此做判断前请先看原文。