AI構建者摘要
真正在做 AI 的人今天說了什麼。一頁讀完,約 6 分鐘。
今天最重磅的說法來自 Anthropic:prompt injection 這個把注重安全的公司擋在 agent 門外的攻擊方式,在 Claude 上已經基本被解決了。這條之外,今天真正在爭的是 agent 下一步往哪走。Aaron Levie 解釋了為什麼 coding 能垂直起飛,而法律、銷售、醫療不會;xAI 的聯合創始人則認為,閉源大廠正被上面的監管和下面的開源權重兩頭擠壓。
Claude Blog
Claude Code 現在可以把工作成果釋出成實時、可分享的 artifact
Claude Code 的會話現在可以直接產出一個網頁,內容基於整個會話的上下文,包括程式碼庫、connector 和對話本身。內部用得最多的場景是排查問題:一次故障調查可以釋出時間線、可疑 commit 和錯誤率圖表,隨著調查推進再發布到同一個 URL 上,團隊看到的就是一個實時更新的檢視,而不用找人複述 agent 查到了什麼。每次釋出都是同一個連結下的新版本,歷史版本可以恢復。Artifact 預設只有作者可見,組織內透過認證的成員才能檢視,不能設為公開。目前對 Claude Team 和 Enterprise 開放 beta。
- #products
- #agents
Unsupervised Learning
xAI 聯合創始人:閉源模型實驗室正被兩頭夾擊
Igor Babushkin 認為,做閉源模型的公司,生意上的處境比看上去要糟。「模型做得太好,你就不許釋出。但開源就跟在你後面,每個月都在變強。」pre-training 的收益在遞減,你沒法把 GPU 鋪滿整個地球,而把每一位專家的知識都塞進一套權重裡的 post-training 路線,本身也有天花板。他在 River AI 押了三個方向:一套 RL 和 fine-tuning 的 API;針對個體做個性化、而不是為平均使用者做最佳化的模型;以及能把一個前沿模型裝進你家裡一個盒子的本地硬體,讓控制權和隱私都留在你手上。他還認為,一家公司最糟糕的位置,是讓它與眾不同的東西全都能在網際網路上被爬到,並稱收購 Cursor 是 xAI 在 coding 資料和 RL 環境上搶跑的極聰明一招。
- #open-source
- #hardware
- #agents
Aaron Levie
Box CEOAgent 的擴散會很不均勻,因為大多數工作不像寫程式碼
agentic coding 之所以能垂直起飛,是因為這裡的經濟價值直接對應純數字化的產出,而且單次會話裡任務規模可以沒有上限,所以模型能力一提升,幾乎立刻就能轉化成更大的工作量。銷售、法律、醫療沒有這個性質:銷售得有客戶在場,律師得有委託人,醫生得有病人。他引用 Factory 的 Matan Grinberg 在 Training Data 播客裡的說法,如果明天所有人都請病假,token 用量會直接塌掉,這說明今天真正在後臺自己跑的 agent 工作有多少。機會在於把這些工作流重新設計一遍,讓 agent 能處理每一份合同、翻遍每一條客戶記錄、讀完每一份化驗結果,而這意味著變更管理、資料清理和重新接線,不只是模型更強。
- #agents
- #products
Amjad Masad
Replit CEOReplit 推出 HelpPeer,一個讓 agent 共享所學的公共池
兩個 API,tell 和 lookup。agent 學到有用的東西就釋出到網路上;而在動手做費時費力的事情之前,先查一下有沒有別的 agent 已經踩過同一個坑。促成這件事的場景是像 Shai-Hulud 那樣的全球供應鏈攻擊:按今天的做法,一萬個安全 agent 會各自獨立地發現異常、逆向 payload、從零寫緩解措施。這個思路是把 OpenAI-HuggingFace 事件裡出現的那種 agent 自發協同拿過來用在公共利益上,Masad 說那種協同一旦被惡意利用是很讓人擔心的。站點還在測試期間,Replit Agent 就已經發了一條關於某個 Codegen 庫的提示。
- #agents
- #open-source
- #products
Guillermo Rauch
Vercel CEO如果你不讀程式碼,那六種情況裡必有一種成立
Rauch 列的清單:你是新手;軟體是一次性的;你在做原型;你既沒有使用者也沒有收入;你在給自己攢債務和風險;或者你的問題很基礎。這幾種他都能接受,但他堅持模型還沒到完全自主的程度,證據是世界上最好的模型給程式碼加了個毫無道理的 700ms 延遲去「穩一下」,然後自己承認那只是在照貓畫虎。他預計需要讀程式碼的場合會繼續縮小,大部分程式碼會變得像彙編一樣,但他說全球網際網路都跑在這些模型上,這件事值得比現在的敘事更認真的對待。
- #agents
- #products
Swyx
swyx 談會議選題:用播放量評判演講,你就等著被人拿捏
針對 AI Engineer 演講質量的抱怨,swyx 指出,臺上的是工程師、研究員和創業者,他們講的是自己一年的工作,幾乎沒受過任何公開演講訓練,準備時間不到一週,而不是跑會的職業講者。他最鋒利的一句是衝著觀眾去的:如果你把播放量當成質量訊號,那你永遠只能在一件事火了之後才聽說它,你會開始以為東西好是因為它火,而整個整個行業就是靠吃這一點活著的。選題和輔導上的失誤他都認下了,但他仍然頂著每年都有的壓力,不願把演講扔進一個二級頻道,因為那等於把這些講者丟在一個更小的盤子上。另外他提醒一句:把你的 skill 刪一刪,跟著 timeline 囤 skill,輕則吃掉 context,重則和別的 skill 打架。
- #agents
- #products
Peter Yang
Linear 的 agent 缺工具時,會自己提功能需求
當使用者讓 Linear 的 agent 做一件它沒有對應工具的事時,agent 會把這個缺口報上來,Linear 的系統再把它變成一條 issue。agent 每完成不了一次任務,就產生一條產品反饋,於是 agent 自己的失敗日誌成了 roadmap 的輸入。對於「怎麼知道 agent 缺什麼、又不用另外做一套埋點」這個問題,這是個很乾淨的答案。
- #agents
- #products
Nikunj Kothari
FPV Ventures Partner還沒有人做出好用的多人加 agent 協作體驗
所有 agent 介面最後都收斂成同一個形狀:一個人對一個 agent。Kothari 說他還沒見過多個人加多個 agent 配合得好的例子,他想知道這是想象力不夠,還是模型本身的限制。他還點出了一個值得起個名字的 agent 行為:模型預設把每個功能都藏在環境變數開關後面,這毛病嚴重到他在自己的 Claude.md 里加了一句「預設值很重要,不要含糊其辭」。
- #agents
- #products
資料來源
來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。
摘要由程式自動生成。據此判斷前請先看原文。
