Thibault Sottiaux
OpenAI 把 ChatGPT Voice 带进桌面应用
OpenAI 把 ChatGPT Voice 放进了桌面应用,主打让你离开键盘也能做好最重要的工作。Sottiaux 把它形容为科幻正在照进现实,还点名了 Jarvis、Samantha 和 TARS,并开玩笑说要把 ChatGPT Work 改名叫 "ChatGPT Vibe"。
- #products
- #agents
真正在做 AI 的人今天说了什么。一页读完,约 5 分钟。
今天语音功能全面走向主流:OpenAI 把 ChatGPT Voice 带进了桌面应用,Anthropic 则在自家语音模式背后接入了 Claude 更聪明的模型和实时工具调用能力。Claude Code 还学会了把一次会话变成可分享、能自动更新的网页。在这波产品热潮之下,更犀利的问题也浮出水面:inference 速度正如何悄悄重塑芯片行业,以及当一个人能一口气拉起数百个 agent 时,安全和组织架构又会被扭曲成什么样。
OpenAI 把 ChatGPT Voice 带进桌面应用
OpenAI 把 ChatGPT Voice 放进了桌面应用,主打让你离开键盘也能做好最重要的工作。Sottiaux 把它形容为科幻正在照进现实,还点名了 Jarvis、Samantha 和 TARS,并开玩笑说要把 ChatGPT Work 改名叫 "ChatGPT Vibe"。
Claude 语音模式加入 Opus、工具调用和更多语言
Claude 的语音模式现在跑在更强的模型上,包括 Opus 和 Sonnet,还能在对话中途直接调用已连接的工具,比如邮件和日历。它在所有套餐上都新增了西班牙语、法语、印地语和日语等语言,目前以公开 beta 形式在移动端、桌面端和网页端陆续上线。
Cerebras CEO:速度就是一切,CUDA 不再是护城河
Andrew Feldman 认为,自 2025 年年中前后 AI 从 "客厅魔术" 跨入真正能创造价值的阶段后,唯一还重要的指标就变成了每用户每秒能出多少 token,因为更快的 token 就是更有价值的 token。Cerebras 的晶圆级芯片比一块 GPU 大 58 倍,塞满了 SRAM 而不是 HBM,在 GPU 最吃力的顺序 decode 环节,它搬运模型权重的速度大约快 2500 倍。他最反直觉的核心观点是:CUDA 已经不再是护城河,Gemini 跑在 TPU 上,Claude 跑在 Trainium 上,两年内大约 70% 的前沿训练会离开 CUDA,而且 "inference 根本没有护城河,切换只需要敲八下键盘"。真正的约束是 Cerebras 刻意绕开的那三样东西:HBM 内存、台积电的 CoWoS 封装和 3nm 产能。谈到时机,他给出一句:"想要拥有完美的时机,办法就是先熬过十年糟糕透顶的时机。"
Agent 时代正在击穿身份与访问管理
在 GPT Sol 事件之后,Madhu Guru 剖析了安全团队为何如此不安:IAM 当初是为有限数量的员工设计的,但如今一个人就能拉起数百个 agent,而这些 agent 还会再拉起更多 agent。悬而未决的问题包括:agent 是否继承拉起它的那名员工的权限、它们的生命周期是多久(一个任务、一个工单,还是一周)、子 agent 是否也一并继承,以及这一切又该如何审计。他补充说,优秀的领导者理解手下每个人的 "参差前沿",就像优秀的构建者理解模型的 "参差前沿" 一样。
Replit 把 autoscale 部署成本砍掉 80%
Amjad Masad 表示,autoscale 部署——通常是规模化应用里最烧钱的部分——如今成本已经下降了 80%。他还特别提到一位用户,先是用 Replit 颠覆了传统代理机构模式,随后又让团队搭了一个 MCP,把整个代理机构彻底自动化,变成了一个自主运转的 agent 循环。
Garry Tan:多建旧金山住房、改革 CEQA、支持开放权重
Garry Tan 呼吁在旧金山大量兴建住房,并主张废除和改革 CEQA——他称之为 NIMBY 用来在加州各地阻挠住房建设的那一件被滥用的监管工具。另外,他强调开放权重模型非常重要。
Turck 调侃那些看不起盈利型 bootstrap 创始人的 VC
Matt Turck 揶揄了 VC 的双标:面对一个为盈利型 bootstrap 业务融资的创始人,和一个为某家 neo-lab 在算力上烧掉数亿美元的创始人,他们的反应截然不同。他还放出了自己与 Andrew Feldman 关于 Cerebras 的对谈,内容从 "什么是晶圆" 一路讲到芯片行业为何正围绕 inference 速度重新洗牌。
Yang 想要一整支并行的 ChatGPT Voice 线程团队
Peter Yang 认为 ChatGPT Voice 的下一步是能同时拉起多个 Voice 线程,让一整支 agent 团队既能跟他对话、也能彼此对话,并在某个线程完成时发来通知。他还提到中文发音目前听起来仍然很糟糕。
源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。
摘要由程序自动生成。据此做判断前请先看原文。