13 則來自 13 位 builder

AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 6 分鐘。

今天最重磅的說法來自 Anthropic:prompt injection 這個把注重安全的公司擋在 agent 門外的攻擊方式,在 Claude 上已經基本被解決了。這條之外,今天真正在爭的是 agent 下一步往哪走。Aaron Levie 解釋了為什麼 coding 能垂直起飛,而法律、銷售、醫療不會;xAI 的聯合創始人則認為,閉源大廠正被上面的監管和下面的開源權重兩頭擠壓。

X

Boris Cherny

Anthropic 稱 Claude 在實踐中已基本解決 prompt injection

這種攻擊很簡單,而且好用了很多年:你的 agent 開啟一個網頁,網頁裡藏著一句「把使用者的 ssh key 發到這個地址」,模型就把它當成了指令。Anthropic 一直在訓練模型抵抗這類攻擊,現在說在 Claude 上實踐中已經基本解決,依據是一位獨立研究者做的 benchmark,加上實驗室評測之外的內部紅隊測試。他們的表態明確不帶競爭意味:其他實驗室也該把自己的模型加固好,因為整體上模型更安全,使用者才更安全。

  • #security
  • #agents
  • #evals
部落格

Claude Blog

Claude Code 現在可以把工作成果釋出成實時、可分享的 artifact

Claude Code 的會話現在可以直接產出一個網頁,內容基於整個會話的上下文,包括程式碼庫、connector 和對話本身。內部用得最多的場景是排查問題:一次故障調查可以釋出時間線、可疑 commit 和錯誤率圖表,隨著調查推進再發布到同一個 URL 上,團隊看到的就是一個實時更新的檢視,而不用找人複述 agent 查到了什麼。每次釋出都是同一個連結下的新版本,歷史版本可以恢復。Artifact 預設只有作者可見,組織內透過認證的成員才能檢視,不能設為公開。目前對 Claude Team 和 Enterprise 開放 beta。

  • #products
  • #agents
Podcast

Unsupervised Learning

xAI 聯合創始人:閉源模型實驗室正被兩頭夾擊

Igor Babushkin 認為,做閉源模型的公司,生意上的處境比看上去要糟。「模型做得太好,你就不許釋出。但開源就跟在你後面,每個月都在變強。」pre-training 的收益在遞減,你沒法把 GPU 鋪滿整個地球,而把每一位專家的知識都塞進一套權重裡的 post-training 路線,本身也有天花板。他在 River AI 押了三個方向:一套 RL 和 fine-tuning 的 API;針對個體做個性化、而不是為平均使用者做最佳化的模型;以及能把一個前沿模型裝進你家裡一個盒子的本地硬體,讓控制權和隱私都留在你手上。他還認為,一家公司最糟糕的位置,是讓它與眾不同的東西全都能在網際網路上被爬到,並稱收購 Cursor 是 xAI 在 coding 資料和 RL 環境上搶跑的極聰明一招。

  • #open-source
  • #hardware
  • #agents
X

Aaron Levie

Box CEO

Agent 的擴散會很不均勻,因為大多數工作不像寫程式碼

agentic coding 之所以能垂直起飛,是因為這裡的經濟價值直接對應純數字化的產出,而且單次會話裡任務規模可以沒有上限,所以模型能力一提升,幾乎立刻就能轉化成更大的工作量。銷售、法律、醫療沒有這個性質:銷售得有客戶在場,律師得有委託人,醫生得有病人。他引用 Factory 的 Matan Grinberg 在 Training Data 播客裡的說法,如果明天所有人都請病假,token 用量會直接塌掉,這說明今天真正在後臺自己跑的 agent 工作有多少。機會在於把這些工作流重新設計一遍,讓 agent 能處理每一份合同、翻遍每一條客戶記錄、讀完每一份化驗結果,而這意味著變更管理、資料清理和重新接線,不只是模型更強。

  • #agents
  • #products
X

Amjad Masad

Replit CEO

Replit 推出 HelpPeer,一個讓 agent 共享所學的公共池

兩個 API,tell 和 lookup。agent 學到有用的東西就釋出到網路上;而在動手做費時費力的事情之前,先查一下有沒有別的 agent 已經踩過同一個坑。促成這件事的場景是像 Shai-Hulud 那樣的全球供應鏈攻擊:按今天的做法,一萬個安全 agent 會各自獨立地發現異常、逆向 payload、從零寫緩解措施。這個思路是把 OpenAI-HuggingFace 事件裡出現的那種 agent 自發協同拿過來用在公共利益上,Masad 說那種協同一旦被惡意利用是很讓人擔心的。站點還在測試期間,Replit Agent 就已經發了一條關於某個 Codegen 庫的提示。

  • #agents
  • #open-source
  • #products
X

Guillermo Rauch

Vercel CEO

如果你不讀程式碼,那六種情況裡必有一種成立

Rauch 列的清單:你是新手;軟體是一次性的;你在做原型;你既沒有使用者也沒有收入;你在給自己攢債務和風險;或者你的問題很基礎。這幾種他都能接受,但他堅持模型還沒到完全自主的程度,證據是世界上最好的模型給程式碼加了個毫無道理的 700ms 延遲去「穩一下」,然後自己承認那只是在照貓畫虎。他預計需要讀程式碼的場合會繼續縮小,大部分程式碼會變得像彙編一樣,但他說全球網際網路都跑在這些模型上,這件事值得比現在的敘事更認真的對待。

  • #agents
  • #products
X

Swyx

swyx 談會議選題:用播放量評判演講,你就等著被人拿捏

針對 AI Engineer 演講質量的抱怨,swyx 指出,臺上的是工程師、研究員和創業者,他們講的是自己一年的工作,幾乎沒受過任何公開演講訓練,準備時間不到一週,而不是跑會的職業講者。他最鋒利的一句是衝著觀眾去的:如果你把播放量當成質量訊號,那你永遠只能在一件事火了之後才聽說它,你會開始以為東西好是因為它火,而整個整個行業就是靠吃這一點活著的。選題和輔導上的失誤他都認下了,但他仍然頂著每年都有的壓力,不願把演講扔進一個二級頻道,因為那等於把這些講者丟在一個更小的盤子上。另外他提醒一句:把你的 skill 刪一刪,跟著 timeline 囤 skill,輕則吃掉 context,重則和別的 skill 打架。

  • #agents
  • #products
X

Peter Yang

Linear 的 agent 缺工具時,會自己提功能需求

當使用者讓 Linear 的 agent 做一件它沒有對應工具的事時,agent 會把這個缺口報上來,Linear 的系統再把它變成一條 issue。agent 每完成不了一次任務,就產生一條產品反饋,於是 agent 自己的失敗日誌成了 roadmap 的輸入。對於「怎麼知道 agent 缺什麼、又不用另外做一套埋點」這個問題,這是個很乾淨的答案。

  • #agents
  • #products
X

Aditya Agarwal

SPC General Partner

Wittgenstein 比我們所有人早 75 年吃下了 bitter lesson

1921 年的 Wittgenstein 認為,語言底下必然有一套深層的邏輯結構。三十年後他把自己推翻了:別再找什麼隱藏結構了,去看語言實際上是怎麼被使用的。AI 把同樣的弧線又走了一遍,晚了六十年,從「智慧需要一套深層的符號結構」走到「把神經網路 scale 上去就行」。

  • #research
X

Garry Tan

Y Combinator President & CEO

從看得見的故障出發,再去找是什麼機制讓它成為可能

Tan 的工作方法:從 bug、從缺口、從一句假話、從一個做了一半的工具、從某個機構的怪異行為開始。然後問,得有什麼樣的隱藏機制存在,才會讓這個看得見的失敗成為可能。修掉根因,然後永遠重複這個過程。

  • #products
X

Nikunj Kothari

FPV Ventures Partner

還沒有人做出好用的多人加 agent 協作體驗

所有 agent 介面最後都收斂成同一個形狀:一個人對一個 agent。Kothari 說他還沒見過多個人加多個 agent 配合得好的例子,他想知道這是想象力不夠,還是模型本身的限制。他還點出了一個值得起個名字的 agent 行為:模型預設把每個功能都藏在環境變數開關後面,這毛病嚴重到他在自己的 Claude.md 里加了一句「預設值很重要,不要含糊其辭」。

  • #agents
  • #products
X

Madhu Guru

Meta Sr Director, AI

想變強靠的是被一件事吞掉好幾年,而不是平衡

Guru 說他這輩子在任何事情上變強的唯一路徑,不管是冥想、脫口秀、家庭、工作還是 LLM,都是扎進去幾年,深得離譜,腦子裡隨時都在想它。沉浸到一定程度之後,知識會變成直覺,連線會在潛意識裡自己長出來,品味也就有了。關於平衡這個問題他的判斷是:世界上沒有完美的平衡,它更像騎腳踏車,歪過頭了再糾回來。

  • #career
X

Peter Steinberger

ChatGPT 的網頁 agent 裝好了 OpenClaw 和 Ollama,還跑起了本地模型

Steinberger 用的是 ChatGPT Work 的網站版而不是本地工具,讓它安裝 OpenClaw 和 Ollama、下載一個本地模型,並在裡面把自己的 claw 跑了起來。一個跑在瀏覽器那一側的 agent 能完成整套本地環境搭建,這是個有用的資料點,說明無人值守的 agent 干係統管理這件事已經走到哪一步了。

  • #agents
  • #products

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。