yii.
← Digest
EP49 · 2026年4月20日 星期一 · 9 min read

AI Agents 繞過 GUI

SaaS 正在去介面化 — Salesforce 宣告無頭化,browser-harness 讓 LLM 自己寫工具

每天花 1% 的時間,掌握科技脈動。


今日金句#

“headless services are quicker and more dependable for the personal AIs than having them click round a GUI with a bot-controlled mouse.” 「無頭服務比讓 AI 用機器人點 GUI 更快、更可靠。」 — Matt Webb, Product strategist, Interconnected

“Companies will shed 30,000 people and rehire 8,000 — all AI-first.” 「企業將裁掉 30,000 人,再招聘 8,000 名 AI 優先的人才。」 — Nikhyl Singhal, Product leader (Meta, Google, Credit Karma)

“Nvidia didn’t want to lose the fast inference business at OpenAI, and we took that from them.” 「Nvidia 不想失去 OpenAI 的快速推理業務,但我們搶走了。」 — Andrew Feldman, CEO, Cerebras Systems


今日主軸#

SaaS 的 GUI 時代正在悄悄落幕。Salesforce 本週宣布 Headless 360,將整個 CRM 平台——包括 Agentforce 和 Slack——全部開放為 API 和 MCP 介面,讓 AI agent 不需要任何人坐在那裡點介面就能完成任務。同時,browser-use 推出 browser-harness,一個 592 行 Python 的自我修復瀏覽器框架,讓 LLM 在缺少工具時自己撰寫缺少的函數、繼續執行任務。Claude Opus 4.7 的系統提示詞更新也印證了這個方向:模型現在會主動呼叫 tool_search 而非宣稱「我做不到」,更像 agent 而不像對話機器人。當基礎設施都在往無頭化走,SaaS「按人頭收費」的商業模式將面臨前所未有的衝擊。


必讀#

  1. Headless everything for personal AI — Simon Willison AI
  2. Changes in the system prompt between Claude Opus 4.6 and 4.7 — Simon Willison AI
  3. Claude system prompts as a git timeline — Simon Willison AI
  4. browser-use/browser-harness: Self-healing browser harness for LLMs — GitHub Tools
  5. Cursor in talks to raise $2B+ at $50B valuation — TechCrunch Startup
  6. Why half of product managers are in trouble — Lenny’s Newsletter Product
  7. The RAM shortage could last years — The Verge News
  8. Cerebras files for IPO — TechCrunch News
  9. Anthropic MCP 協定遭揭存在設計缺陷 — iThome Security
  10. The App Store is booming again, and AI may be why — TechCrunch News

Headless everything for personal AI#

headless everything

Salesforce 宣布 Headless 360,將整個 CRM 平台(含 Agentforce、Slack)開放為 API、MCP 和 CLI 介面,讓 AI agent 直接存取數據而無需 GUI。Simon Willison 認為,這是 SaaS 設計典範的根本轉變:未來的軟體競爭不在於介面美醜,而在於 API 可達性。「無頭服務讓個人 AI 更快、更可靠,遠比讓 AI 用機器人控制滑鼠點 GUI 有效率。」這個趨勢將直接衝擊現有 SaaS 的按人頭計費模式——一個 agent 可取代多個人類帳號,定價結構必須重新設計。

  • API 可達性成為新的 SaaS 競爭維度,取代傳統 UX 設計
  • Salesforce Headless 360:整個平台含 Agentforce + Slack 全部開放為 API/MCP/CLI
  • 按人頭計費模式面臨衝擊——AI agent 不是「人」,舊定價邏輯失效

💡 這不只是 Salesforce 的技術決策,而是整個 SaaS 產業的轉折點。任何還依靠「讓用戶打開 app 點來點去」的商業模式,都需要認真思考 AI agent 時代的應對方案。

🔗 閱讀原文 | 來源: Simon Willison


Changes in the system prompt between Claude Opus 4.6 and 4.7#

opus system prompt

Anthropic 在 Opus 4.7 的系統提示詞中加入 <acting_vs_clarifying> 區段,讓 Claude 更傾向主動行動而非詢問——agent 現在會先呼叫 tool_search 確認能力,而不是直接說「我做不到」。同時新增了 Claude in Chrome、Claude in Excel、Claude in PowerPoint 三個工具整合,以及更嚴格的兒童安全標籤。移除了大量冗長免責聲明的反模式指引,暗示模型本身已更穩定可靠。

  • 新增 <acting_vs_clarifying> — 主動呼叫工具而非宣稱無能力
  • 加入 Chrome / Excel / PowerPoint agent 整合工具
  • 嚴格的兒童安全一旦觸發,後續所有請求均需極度謹慎處理

💡 系統提示詞的演變是理解 Anthropic 實際部署優先順序的視窗。Opus 4.7 明顯往 agent 方向走,開發者在設計 prompt 時需要相應調整——Claude 現在更傾向動手做,而不是先問問題。

🔗 閱讀原文 | 來源: Simon Willison


Claude system prompts as a git timeline#

claude git timeline

Simon Willison 將 Anthropic 公開的 Claude 系統提示詞整理成 Git 歷史記錄,每個 commit 對應一次提示詞更新,時間跨度從 Claude 3(2024 年 7 月)到 Opus 4.7(2026 年 4 月)。研究者和開發者現在可以用 git diff 追蹤具體的安全指令、能力範圍和行為規範如何隨版本演變。Anthropic 是目前唯一公開發布用戶端系統提示詞的主要 AI 實驗室。

  • Claude 系統提示詞公開歷史:Claude 3(Jul 2024)→ Opus 4.7(Apr 2026)
  • 可用標準 git 指令(log, diff, blame)分析提示詞演變
  • Anthropic 是唯一主動公開用戶端系統提示詞的主要 AI 實驗室

💡 對於在生產環境使用 Claude 的開發者,這份歷史記錄可以幫助理解版本升級時行為會如何改變,是做升版前評估的實用工具。

🔗 閱讀原文 | 來源: Simon Willison


browser-use/browser-harness: Self-healing browser harness for LLMs#

browser-harness

browser-harness 是 592 行 Python 的極簡瀏覽器自動化框架,透過 Chrome DevTools Protocol(CDP)讓 LLM 直接控制瀏覽器。最獨特的設計:當 agent 執行任務時發現缺少工具函數,它可以即時在 helpers.py 中撰寫該函數並繼續執行,無需人工介入——真正的自我修復(self-healing)。支援本地 Chrome 或免費雲端瀏覽器(3 個併發免費),agent 自動生成的「領域技能」(domain-skills)可持續累積成知識庫。

  • 自我修復架構:agent 執行中遇到缺少功能時自己寫、自己繼續
  • 僅 592 行 Python + 一個 CDP WebSocket,無框架約束
  • 免費雲端瀏覽器(3 個併發),可立即用於 CI/CD

💡 對想要做瀏覽器自動化的開發者,這是目前最接近「給 LLM 一個瀏覽器然後讓它自己搞定」的框架。現在就可以去 clone 來玩。

🔗 閱讀原文 | 來源: GitHub ⭐2,078


Cursor in talks to raise $2B+ at $50B valuation#

cursor valuation

AI 程式碼編輯器 Cursor 正在談判以 500 億美元估值融資 20 億美元以上,投資方包括 Thrive、a16z、Battery Ventures 和 Nvidia(策略投資)。距離上次 293 億美元估值(2025 年 10 月)僅 6 個月,估值成長 71%。公司預測 2026 年底年化收入達 60 億美元以上(目前 20 億美元 ARR);自研 Composer 模型讓公司擺脫純 API 轉售困境,企業業務已實現正毛利。

  • 估值 6 個月從 293 億成長至 500 億美元(+71%),預測 ARR 2026 年底達 60 億美元
  • 自研 Composer 模型(2025 年 11 月)是正毛利關鍵,擺脫 API 轉售困境
  • Claude Code(Anthropic)和 Codex(OpenAI)是直接競爭對手

💡 Cursor 的估值軌跡顯示 AI 開發工具市場正在快速整合,自研模型成為護城河的標配。AI coding 工具的市場勝負格局基本確定。

🔗 閱讀原文 | 來源: TechCrunch


Why half of product managers are in trouble#

lenny pm trouble

Lenny 對談前 Meta / Google / Credit Karma 產品主管 Nikhyl Singhal,討論 AI 對 PM 職業的衝擊。他預測未來兩年將是 PM 職業史上最混亂的時期,企業將裁掉 30,000 人並重新招聘 8,000 名 AI 優先人才,淨裁減率高達 75%。關鍵不是學會使用 AI 工具,而是在心態上找到與 AI 協作的「喜悅時刻」,否則心理障礙將阻止轉型。

  • 預計淨裁減 75% PM 職位(裁 30,000、招 8,000)
  • 心態轉型比工具學習更關鍵:找到與 AI 協作的「喜悅時刻」
  • 強調獨特人類技能(影響力、判斷、願景)是存活關鍵

💡 不只是 PM,這個分析框架適用於所有知識工作者。這個窗口期正在快速關閉。

🔗 閱讀原文 | 來源: Lenny’s Newsletter


The RAM shortage could last years#

ram shortage

AI 對高頻寬記憶體(HBM)的需求暴增,導致全球記憶體製造商(Samsung、SK Hynix、Micron)的產能優先供應 AI 資料中心,消費電子市場嚴重缺貨。Counterpoint Research 預測,到 2027 年底記憶體供應僅能滿足 60% 需求,SK 集團主席預測短缺可能持續到 2030 年。新廠建設產能要到 2027-2028 年才能上線。

  • 2027 年底記憶體供應缺口估計達 40%
  • HBM 產能優先供 AI 資料中心,消費電子排在後面
  • SK 集團主席預測短缺可能延續至 2030 年

💡 手機、筆電、VR 頭顯的記憶體價格將持續上漲至少到 2028 年。選購設備宜盡早。

🔗 閱讀原文 | 來源: The Verge


Cerebras files for IPO#

cerebras ipo

AI 晶片新創 Cerebras 提交 IPO 申請,計劃 2026 年 5 月中上市,估值 230 億美元。2025 年收入 5.1 億美元(GAAP 淨利 2.38 億美元)。執行長 Andrew Feldman 聲稱搶下 OpenAI 的快速推理業務,原本由 Nvidia 把持。AWS 合作夥伴關係確立,OpenAI 合約據傳超過 100 億美元。

  • 估值 230 億美元,2025 年 GAAP 獲利(靠大客戶合約)
  • 搶下 OpenAI fast inference 業務,對標 Nvidia 在高速推理場景的壟斷
  • AWS 合作夥伴關係 + OpenAI 100 億美元合約為主要收入來源

💡 Cerebras IPO 驗證了「AI 專用晶片可以在特定場景打敗通用 GPU」的市場假說。但 GAAP 獲利高度依賴少數大客戶合約,風險集中度需要關注。

🔗 閱讀原文 | 來源: TechCrunch


Anthropic MCP 協定遭揭存在設計缺陷#

mcp security flaw

資安研究人員揭露,Anthropic 的 Model Context Protocol(MCP)存在設計層面的安全漏洞:惡意的 MCP 伺服器可透過提示注入(prompt injection)技術,誘導 AI agent 執行任意命令,包括讀取本機文件、發送 HTTP 請求或執行系統指令。由於 MCP 本身信任連接的伺服器,缺乏沙盒隔離機制,使得「掛接惡意 MCP 伺服器」成為攻擊向量。

  • 惡意 MCP 伺服器可透過提示注入誘導 agent 執行任意命令
  • MCP 信任連接伺服器的設計缺乏沙盒隔離
  • 第三方 MCP 伺服器需要嚴格審查才能在生產環境使用

💡 對於在 Claude Code 或 MCP 環境中工作的開發者,這是需要立即注意的安全風險。不要輕易安裝來路不明的 MCP 伺服器。

🔗 閱讀原文 | 來源: iThome


The App Store is booming again, and AI may be why#

app store boom

2026 年 Q1 App Store 新上架 app 數量年增 60%(iOS 單獨年增 80%),4 月更是年增 104%。分析師認為 AI 輔助開發工具(Claude Code、Replit 等)大幅降低 app 開發門檻,非技術創業者可以快速從想法到上架。生產力 app 首次進入前五大類別,公用程式躍升第二。

  • Q1 新 app 年增 60%,4 月更達 104% — AI coding 工具降低了開發門檻
  • 生產力 app 首次進入前五,反映 AI 工具應用的分類偏移
  • App Store 品質危機加劇,詐騙 app 成為新的用戶信任風險

💡 AI 工具不是在殺死 app 生態,而是在爆炸性地擴展它。進入市場的門檻從未如此低過,但差異化的難度也同樣提升了。

🔗 閱讀原文 | 來源: TechCrunch


推薦閱讀#

  • EP211: How the JVM Works — ByteByteGo 深入解析 JVM 運作原理,涵蓋 Java 原始碼編譯成 bytecode、類別載入器、JIT 即時編譯等完整生命週期。適合想理解 JVM 底層的開發者。
  • HY-World 2.0: Multi-Modal World Model for 3D — Tencent 推出的多模態 3D 世界模型,從文字或圖片生成 3D Gaussian Splatting 場景。HuggingFace Papers 本週最受關注論文(90 票)。
  • The seven programming ur-languages — 所有程式語言都衍生自七種「原型」:Fortran、Lisp、ALGOL、Smalltalk、APL、Prolog、ML。思考語言設計源流的好讀物,HN 261 分。
  • What are skiplists good for? — Antithesis 分享如何發明「skiptree」解決 BigQuery 在層次結構查詢效率低落的問題。CEO 語:「你永遠不知道哪個冷門資料結構會幫你省很多錢。」
  • OpenAI’s existential questions — TechCrunch 分析 OpenAI 從非營利到營利轉型的法律複雜性、人才流失、Altman 面臨的內部信任危機。
  • Kevin Weil and Bill Peebles exit OpenAI — 首席產品官 Kevin Weil 和 Sora 技術負責人 Bill Peebles 相繼離職,OpenAI 繼續「清除副業」聚焦核心 AGI 研究。

名人動態#

  • Simon Willison — 連發三篇 Claude 分析:headless everything 趨勢解讀、Opus 4.7 系統提示詞更新、Claude 提示詞 Git 時間軸工具。本週最值得追蹤的技術分析作者。🔗 headless | opus 4.7 | git timeline
  • Nikhyl Singhal (Meta/Google) — Lenny 播客專訪,預測 PM 職業大洗牌(30,000 裁員 → 8,000 AI 優先重新招聘)。🔗 Lenny Podcast
  • Andrew Feldman (Cerebras CEO) — 聲稱搶下 Nvidia 在 OpenAI 的快速推理業務,Cerebras IPO 申請提交。🔗 TechCrunch

今日觀察#

Cerebras 提交 IPO 申請,並公開聲稱搶下了 Nvidia 在 OpenAI 的快速推理(fast inference)業務,這是 AI 晶片競爭版圖罕見的公開宣示。值得細看的是其財務結構:2025 年 GAAP 淨利 2.38 億美元,但非 GAAP 仍虧損 7,570 萬美元——GAAP 獲利高度依賴 OpenAI 和 AWS 這類大客戶的長期合約預付款,而非營運現金流的穩定盈利。當 OpenAI 同時也是 Cursor 的競爭對手、自行開發 Codex、又是 Cerebras 最大客戶,這種複雜的利益交織關係在 IPO 的 S-1 文件中應該會有很詳細的風險揭露,值得深讀。


中文技術圈#

iThome MCP 安全漏洞


開源精選#

browser-use/browser-harness — Python | ⭐2,078 自我修復瀏覽器框架,讓 LLM 直接控制 Chrome,缺少工具時自己撰寫。592 行 Python,CDP WebSocket,免費雲端瀏覽器。

vercel-labs/wterm — TypeScript | ⭐2,057 Vercel 推出的網頁版終端模擬器,在瀏覽器中提供完整 terminal 體驗。

Manavarya09/design-extract — JavaScript | ⭐1,086 一個指令提取任何網站的完整設計系統,支援 DTCG tokens、Flutter/iOS/Android 輸出、Tailwind v4、Figma variables。

WeaveMindAI/weft — Rust | ⭐875 專為 AI 系統設計的新程式語言,探索 AI-native 程式設計典範。

xataio/xata — Go | ⭐635 開源雲原生 Postgres 平台,支援 copy-on-write 分支和 scale-to-zero,Neon 的開源競爭者。


影音精選#

How does Claude Code work#

145,095 views · 2 天前 | Theo (t3.gg)

Theo 深度解析 browser-use 的 browser-harness 架構——一個讓 LLM 完成任意瀏覽器任務的自我修復框架。從 CDP WebSocket 到 helpers.py 的動態擴展機制,Theo 帶著觀眾理解 Claude Code 作為 AI agent 的真實運作原理,而不只是一個「智慧 autocomplete」。

  • browser-harness 如何讓 LLM 在執行中即時撰寫缺少的工具函數
  • Claude Code 的 agent 架構:為什麼它比傳統 IDE plugin 更強大
  • 為什麼「browser as a platform」是 AI agent 的下一個主戰場

💬 Theo 的拆解角度很有意思:他不是在說 Claude Code 有多酷,而是在問「它的底層到底是怎麼運作的」。這種從工程實現出發的視角值得學習。


Opus 4.7 Performance Regression#

89,000 views · 2.5 天前 | Matt Wolfe (MattVidPro)

Matt Wolfe 評測 Claude Opus 4.7 相比 4.6 的性能退步問題,包括推理能力下降和回應品質差異。這個話題在開發者社群引發熱烈討論——Anthropic 是在犧牲品質換速度,還是這只是評測框架的偏差?影片提供多個具體 benchmark 對比。

  • Opus 4.7 在特定推理任務的表現退步幅度
  • 可能原因分析:RLHF 對齊 vs. 能力退化 vs. 評測框架問題
  • 社群實測反饋與官方 benchmark 的差距

💬 跟 Simon Willison 的系統提示詞分析搭配看很有收穫——提示詞的改變(從 verbose 到 action-first)可能正是部分「退步」的根源。


China’s Full-Stack AI Strategy vs. USA#

52,000 views · 3 天前 | 20VC

20VC 深度對談中國 AI 全棧最佳化策略,分析中美在晶片、模型、應用層面的競爭態勢。核心論點:中國採取「垂直整合 + 應用場景深耕」路線,而非直接複製美國大型基礎模型競賽。

  • 中美 AI 競爭的「全棧最佳化」策略差異
  • 為什麼晶片禁令反而加速了中國軟體層面的創新
  • 垂直整合(從硬體到應用)作為護城河的可行性

💬 Cerebras IPO 和 AMD 搶到 Anthropic 訂單這兩個新聞放在這個框架下看,AI 晶片已經不再是「Nvidia 壟斷」的單一故事了。


覺得有用嗎?分享給一個也在追蹤新知的朋友。#

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有