yii.
← Digest
EP04 · 2026年3月6日 星期五 · 11 min read

規則正在被改寫

AI 超越人類操控電腦、供應鏈攻擊新型態、品牌時代降臨

每天花 1% 的時間,掌握科技脈動。

今日金句#

“Branding is centrifugal; design is centripetal.” 「品牌是離心的,設計是向心的。」 — Paul Graham, Y Combinator 共同創辦人 · 來源

“The biggest barrier to getting value from AI is your own ability to context and workflow engineer.” 「從 AI 獲取價值的最大障礙,是你自己的上下文與工作流工程能力。」 — Jerry Liu, LlamaIndex 創辦人 · 來源

“Any company that performed ‘any commercial activity’ with Anthropic would have their defense contracts cancelled.” 「任何與 Anthropic 有商業往來的公司,都將被取消國防合約。」 — Pete Hegseth, 美國國防部長 · 來源

今日主軸:規則正在被改寫#

GPT-5.4 在電腦操控基準上首次超越人類平均表現,模型能力的規則被改寫。Cline 供應鏈攻擊讓一個 AI 工具偷偷安裝另一個 AI agent,安全規則被改寫。五角大廈首次將美國公司 Anthropic 標為「供應鏈風險」,政府與 AI 公司的關係規則被改寫。AI 重寫開源程式碼試圖繞過 LGPL 授權,開源世界的規則被改寫。Cursor 的事件驅動 Automations 讓 AI 不需要人類啟動就自動執行,開發流程的規則被改寫。當所有規則同時鬆動,真正的問題是:誰來制定新規則?

必讀#

  1. GPT-5.4:首次超越人類的電腦操控能力 — OpenAI AI
  2. AI 重寫程式碼改授權:開源界的存亡之戰 — Simon Willison AI
  3. Harness Engineering 大辯論:模型重要還是框架重要? — Latent Space AI
  4. Google Workspace CLI:11.5K Stars、100+ Agent Skills — GitHub Tools
  5. Agentic Engineering 反模式:別把未審查的 AI 程式碼丟給別人 — Simon Willison Dev
  6. Cline 供應鏈攻擊:一個 GitHub Issue 標題入侵 4K 機器 — Grith.ai Tools
  7. Paul Graham「品牌時代」:當技術變商品,品牌就是護城河 — Paul Graham Startup
  8. AWS 資料中心首遭無人機攻擊,雲端服務史上首度因軍事行動離線 — Pragmatic Engineer News
  9. Paperclip:零人公司編排平台,3.1K Stars — GitHub AI
  10. Apple Neural Engine 逆向工程:NPU 訓練的軟體障礙被突破 — GitHub Dev
  11. Pentagon 將 Anthropic 標為「供應鏈風險」— 美國公司首例 — The Verge News
  12. OpenAI CoT-Control:推理模型無法隱藏思考過程,這是好事 — OpenAI AI
  13. Cursor Automations:事件驅動 AI Coding,年營收突破 $2B — TechCrunch Dev
  14. Luma Agents:多模態創意 AI,Uni-1 模型驅動 — TechCrunch AI
  15. Jido 2.0:Elixir/BEAM 上的純函數式 Agent 框架 — Jido AI

1. GPT-5.4:首次超越人類的電腦操控能力#

OpenAI 發布 GPT-5.4,首款具備原生電腦操控能力的通用模型。在 OSWorld-Verified 基準上達到 75.0%,首次超越人類平均表現(72.4%)。提供 100 萬 token 上下文視窗,分為 GPT-5.4 Thinking(複雜推理)和 GPT-5.4 Pro(高效能)兩個版本。新增「tool search」機制,按需查找工具定義而非全部載入 system prompt,大幅降低 token 消耗。同時推出金融服務套件,整合 FactSet、MSCI、Moody’s,內部投行基準從 43.7%(GPT-5)躍升至 88.0%。

  • OSWorld-Verified 75.0%,首次超越人類平均 72.4%
  • 100 萬 token 上下文 + tool search 按需載入工具
  • 金融服務套件:投行基準從 43.7% 飆至 88.0%

💡 為什麼重要:GPT-5.4 標誌著 AI 從對話工具轉向電腦操控代理的根本性轉變。超越人類的 benchmark 表現加上垂直產業整合(金融),意味著 agent 正式進入企業級生產環境。

🔗 閱讀原文 | 來源: OpenAI


2. AI 重寫程式碼改授權:開源界的存亡之戰#

Python 老牌函式庫 chardet(Mark Pilgrim 於 2006 年以 LGPL 授權創建)的維護者 Dan Blanchard 使用 Claude 從頭重寫程式碼,將授權從 LGPL 改為 MIT(v7.0.0)。Blanchard 聲稱這是「無塵室」重寫:從空 repo 開始、指示 Claude 不參考 LGPL 程式碼。JPlag 檢測顯示僅 1.29% 相似度(舊版間為 80-93%)。但 Pilgrim 反駁:「加了一個花哨的程式碼產生器,不會多出額外的授權轉讓權利。」

  • JPlag 相似度僅 1.29%(vs 舊版間 80-93%)
  • 原作者 Mark Pilgrim 主張 LGPL 修改碼必須維持 LGPL
  • 歷史對照:1982 年 Compaq 無塵室逆向工程 IBM BIOS

💡 為什麼重要:這是首例 AI coding agent 被用於「無塵室重新授權」的高知名度案例。若此模式被認定合法,任何 LGPL/GPL 專案都可能被 AI 重寫後改授權 — 開源 IP 的版圖將徹底改變。

🔗 閱讀原文 | 來源: Simon Willison


3. Harness Engineering 大辯論:模型重要還是框架重要?#

Latent Space 深度分析 Agent Engineering 的核心分歧。Big Model 陣營(Boris Cherny/Claude Code、Noam Brown)認為「所有秘密都在模型裡」,Claude Code 是「最薄的包裝層」。Big Harness 陣營(Jerry Liu/LlamaIndex)認為「agent loop 才是核心」,harness 最佳化一個下午就能改善 15 個 LLM。METR 研究發現 Claude Code 和 Codex 並未顯著優於基本 scaffold;Scale AI 的 SWE-Atlas 也表示 harness 選擇「基本上在誤差範圍內」。

  • Claude Opus 4.6 在 Claude Code 中贏 GPT-5.2,但在 SWE-Agent 中相反 — harness-model fit 很重要
  • Pi blog 示範 harness-only 最佳化一個下午改善 15 個 LLM
  • AIE Europe 推出全球首個 Harness Engineering 專題

💡 為什麼重要:這是 2026 年 AI 工程的定義性辯論。答案可能因場景而異 — 不是非此即彼,而是你的架構選擇和模型選擇同等重要。

🔗 閱讀原文 | 來源: Latent Space


4. Google Workspace CLI:11.5K Stars、100+ Agent Skills#

Google 開源了統一所有 Workspace API 的 Rust CLI 工具。最大亮點:不是靜態命令列表,而是在 runtime 讀取 Google Discovery Service 動態建構命令介面,新 API 端點自動生效。內建 MCP server 模式(gws mcp)可直接整合 Claude Desktop、Gemini CLI、VS Code。附帶 100+ AI Agent Skills(SKILL.md 檔案)。支援多帳號 OAuth、AES-256-GCM 加密憑證、service account、headless CI。4 天內獲得 11.6K stars。

  • 動態 Discovery Service — 新 API 自動出現,無需更新 CLI
  • MCP server 模式 + 100+ agent skills — AI agent 直接操作 Google Workspace
  • Rust 打造、Apache-2.0 授權、非 Google 官方支援

💡 為什麼重要:這是 AI agent 時代的基礎設施級工具。agent 需要手和腳來操作真實世界的服務(發 email、管行事曆、讀文件),這個 CLI 一次解決所有 Google Workspace 的 agent 接入問題。

🔗 閱讀原文 | 來源: GitHub


5. Agentic Engineering 反模式:別把未審查的 AI 程式碼丟給別人#

Simon Willison 整理 agentic engineering 的反模式指南。最嚴重的問題:提交數百或數千行未經自己審查的 agent 生成程式碼 PR。好的 agentic PR 四要素:程式碼可運作、變更範圍小、附帶上下文說明、描述經過手動驗證。他強調:「初始審查是你的責任,不是你應該轉嫁給別人的。」

  • agent PR 四要素:functional、manageable size、contextual、validated
  • 附上手動測試筆記、實作選擇說明、截圖/影片
  • agent 生成的 PR 描述可能有說服力但不準確

💡 為什麼重要:隨著 AI coding agent 成為主流,團隊面臨新的品質關口問題。這個指南為 agentic engineering 建立了專業規範。

🔗 閱讀原文 | 來源: Simon Willison


6. Cline 供應鏈攻擊:一個 GitHub Issue 標題入侵 4K 機器#

安全研究平台 Grith.ai 揭露名為「Clinejection」的五步驟供應鏈攻擊。攻擊鏈:GitHub issue 標題中的 prompt injection → Claude 執行惡意 npm install(從偽冒 repo glthub-actions/cline)→ 透過 Cacheract 工具進行快取汙染(10GB+ 垃圾資料觸發 LRU eviction)→ 竊取 NPM/VSCE/OVSX token → 發布惡意 cline@2.3.0 到 npm。Payload 在受害者電腦上靜默安裝 OpenClaw(全域),建立持久化 daemon。

  • 攻擊向量 ${{ github.event.issue.title }} 直接插入 Claude prompt
  • 偽冒 repo glthub-actions/cline(少一個 i)
  • Cline 缺乏 OIDC-based npm provenance attestation

💡 為什麼重要:這是首例「一個 AI 工具靜默安裝另一個 AI agent」的攻擊記錄 — 現有安全工具無法偵測的供應鏈遞迴問題。每個在 CI/CD 中使用 AI 工具的團隊都應該警覺。

🔗 閱讀原文 | 來源: Grith.ai


7. Paul Graham「品牌時代」:當技術變商品,品牌就是護城河#

Paul Graham 用瑞士鐘錶業歷史撰寫萬字長文。1945-1970 是「黃金時代」(工程卓越),石英錶三重危機後進入「品牌時代」。單位銷量在 70-80 年代暴跌三分之二,但 80 年代末營收飆升 — 存活者全靠品牌轉型。Patek Philippe 現在經營一個資產泡沫:追蹤序號、切斷「流氓客戶」、每年買回數百隻自家手錶維持二手價高於零售價。核心論點:「品牌是離心的;設計是向心的」。

  • 石英危機將「準時」商品化 → 產業從工程轉向品牌
  • Patek Philippe 透過序號追蹤、客戶管控維持人為稀缺
  • 忠告:「Follow the problems」— 黃金時代出現在聰明人做有趣問題的地方

💡 為什麼重要:當 AI 把寫程式變成商品,軟體業是否正在走進自己的「品牌時代」?這篇文章是對所有做產品的人的警鐘。

🔗 閱讀原文 | 來源: Paul Graham


8. AWS 資料中心首遭無人機攻擊#

Pragmatic Engineer 報導巴林與阿聯酋的 AWS 資料中心在伊朗相關軍事衝突中遭無人機攻擊,部分或完全離線。這是雲端服務史上首次因軍事打擊導致中斷。

  • 首次軍事行動直接影響主要雲端基礎設施
  • 大多數災難復原計畫未考慮動能軍事攻擊風險

💡 為什麼重要:雲端服務已成為全球關鍵基礎設施,物理資料中心面臨的地緣政治風險需要被納入架構設計考量。

🔗 閱讀原文 | 來源: Pragmatic Engineer


9. Paperclip:零人公司編排平台#

開源的「零人公司」編排平台,管理 AI agent 團隊。包含組織圖、預算、治理、目標對齊和工單系統。定位:「如果 OpenClaw 是員工,Paperclip 就是公司。」支援 OpenClaw、Claude Code、Codex、Cursor 等任何能接收 heartbeat 的 agent。4 天內 3.1K stars。

  • 定位高於個別 agent — 管理 20+ 個 AI agent 同時工作
  • 企業概念引入 agent 編排:組織圖、預算、審計軌跡、回滾
  • npx paperclipai onboard --yes 快速啟動

💡 為什麼重要:當 AI agent 數量爆增,協調問題成為瓶頸。Paperclip 解決的是 agent 管理的 meta-problem — 從「管理程式碼」升級到「管理公司」。

🔗 閱讀原文 | 來源: GitHub


10. Apple Neural Engine 逆向工程訓練#

首次成功在 Apple Neural Engine(ANE)上執行神經網路訓練(前向 + 反向傳播),透過逆向工程的私有 API。在 M3 Ultra/M4 上達到 91-110 ms/step(Stories110M,109M 參數 12 層 transformer)。誠實揭露限制:ANE 利用率僅 5-9%(1-2 TFLOPS / 15.8 峰值)。5.8K stars — 「由人類 + Claude,一個週末一個週末做出來的」。

  • 證明 ANE 硬體有能力做訓練 — 障礙一直是軟體
  • 若利用率差距能縮小,數億台 Apple 裝置都能做本地訓練

💡 為什麼重要:「NPU 訓練的障礙一直是軟體而非硬體」— 這個發現可能影響 Apple 對 ANE 的官方開放策略,並推動邊緣 AI 訓練的可能性。

🔗 閱讀原文 | 來源: GitHub


11. Pentagon 將 Anthropic 標為「供應鏈風險」#

The Verge 報導五角大廈正式將 Anthropic 列為「供應鏈風險」— 這個標籤首次用於美國公司(此前僅用於外國對手)。爭議核心:Anthropic 拒絕讓五角大廈在無人類監督下使用 Claude 操控自主致死武器和大規模監控。國防部長 Pete Hegseth 聲明任何與 Anthropic 有「任何商業活動」的公司都將被取消國防合約。

  • 首次對美國公司使用此標籤 — 此前僅用於外國對手
  • Claude 據報在伊朗行動中發揮關鍵作用 — 諷刺對比
  • 廣泛解讀可能影響整個 AI 產業的政府合約生態

💡 為什麼重要:這是美國政府與 AI 公司在軍事 AI 倫理邊界上的史無前例對抗,將迫使每家 AI 公司在政府合約與倫理底線之間做出選擇。

🔗 閱讀原文 | 來源: The Verge


12. OpenAI CoT-Control:推理模型無法隱藏思考過程#

OpenAI 發表研究:目前推理模型的思維鏈(CoT)可控性非常低(0.1% - 15.4%)— 即使知道被監控,模型也難以操控自己的推理步驟。這是好消息 — 低可控性意味著模型不太可能透過隱藏推理來欺騙安全監測。OpenAI 推出 CoT-Control Evaluation Suite,呼籲全行業追蹤此指標。

  • CoT 可控性 0.1%-15.4%,遠低於輸出可控性(最高 61.9%)
  • 複雜任務和額外後訓練會降低可控性 — 更安全
  • 可作為「煤礦裡的金絲雀」— AI 安全早期預警系統

💡 為什麼重要:直接回應 AI 安全界最關鍵的擔憂之一 — 推理模型能否學會隱藏思考過程。目前的結論是「不能」,但原因尚不完全清楚。

🔗 閱讀原文 | 來源: OpenAI


13. Cursor Automations:事件驅動 AI Coding#

Cursor 推出「Automations」— 由程式碼變更、Slack 訊息或計時器觸發的事件驅動 AI coding agent,不需要人類 prompt 啟動。從「prompt-and-monitor」轉向人類只在決策點被叫入。年營收已突破 20 億美元(三個月內翻倍),市佔率穩定在 AI 生成式工具的 ~25%。

  • 觸發類型:程式碼變更、Slack 訊息、定時排程
  • MCP 整合 PagerDuty 進行事件回應和 server log 查詢
  • $2B 年營收(三個月翻倍)證明 agentic coding 市場爆發

💡 為什麼重要:當工程師同時監督數十個 agent,限制資源是人類注意力而非算力。事件驅動模型解決了「agent 注意力瓶頸」。

🔗 閱讀原文 | 來源: TechCrunch


14. Luma Agents:多模態創意 AI 平台#

Luma 推出端對端創意 AI agent,基於新的 Uni-1 模型家族。Uni-1 在單一架構上訓練音訊、影片、影像、語言和空間推理。Agent 可協調外部模型(Luma Ray 3.14、Google Veo 3、ByteDance Seedream、ElevenLabs)。已部署大型企業客戶:Publicis Groupe、Adidas、Mazda。

  • Uni-1 模型:單一架構、五種模態(音訊/影片/影像/語言/空間)
  • 多模型編排:使用競爭對手模型(Veo 3、Seedream)的務實策略
  • CEO Amit Jain:「客戶不是在買工具,是在重做業務流程」

💡 為什麼重要:從影片生成工具到完整的創意 agent 平台 — 代表「AI 作為創意總監」的新典範。

🔗 閱讀原文 | 來源: TechCrunch


15. Jido 2.0:Elixir/BEAM 上的純函數式 Agent 框架#

基於 Elixir/BEAM 的 AI agent 框架 2.0 版。Agent 是不可變資料結構,狀態變更透過純資料轉換,副作用由「directives」處理。充分利用 BEAM 優勢:百萬級輕量並行程序、OTP 監督樹(自動重啟)、熱程式碼更新、分散式訊息傳遞。

  • BEAM 天生適合 agent — 百萬並行 + 自動容錯 + 熱更新
  • 純函數式:agent 不可變,副作用由 OTP runtime 執行
  • 18 個月開發,完整生態系統(jido_ai、jido_action、jido_signal)

💡 為什麼重要:當大多數 agent 框架用 Python/TypeScript 時,Jido 2.0 展示 BEAM 可能才是 agent 系統的最佳 runtime — 如同 BEAM 驅動 WhatsApp 和 Discord。

🔗 閱讀原文 | 來源: Jido


社群熱門#

推薦閱讀#

中文技術圈#

googleworkspace/cli — Rust | ⭐ 11.6K 統一所有 Google Workspace API 的 CLI + MCP server + 100+ Agent Skills

maderix/ANE — Obj-C | ⭐ 5.8K 逆向工程 Apple Neural Engine 實現 NPU 訓練(前向+反向傳播)

paperclipai/paperclip — TypeScript | ⭐ 3.1K 零人公司 AI agent 編排平台(組織圖/預算/治理)

smartcmd/MinecraftConsoles — C++ | ⭐ 2.9K Minecraft 主機版重製

ylytdeng/wechat-decrypt — Python | ⭐ 1.5K WeChat 4.0 資料庫解密工具

phuryn/pm-skills — Python | ⭐ 1.4K PM Skills Marketplace:100+ agentic skills

slowmist/openclaw-security-practice-guide — Shell | ⭐ 1.1K OpenClaw 安全實踐指南(面向 Agent 的加固清單)

LeoYeAI/openclaw-master-skills — Python | ⭐ 1.1K 127+ 精選 OpenClaw Skills 合集

coleam00/excalidraw-diagram-skill — Python | ⭐ 590 讓 Claude Code 生成 Excalidraw 圖表的 Skill

影音精選#

OpenAI 接下五角大廈合約,Anthropic CEO 痛批「謊言」#

Theo

Harness Engineer 是什麼?AI 自主代理時代的關鍵角色#

AI Jason

Anthropic 對決五角大廈、OpenAI 融資、Cursor $2B#

20VC

AI 時代 SaaS 30 步實戰手冊#

Greg Isenberg

OpenAI API 從 REST 轉向 WebSocket,頻寬省 90%#

Theo

SaaS 末日論搞錯了,真正問題是成長已死#

20VC

YC Startup School 2026 回歸#

Y Combinator

大神動態#

趨勢觀察#

今天的新聞有一條看不見的線:AI 正在從「輔助工具」變成「基礎設施」。GPT-5.4 不只是更強的模型,它能操控電腦;Google Workspace CLI 不只是 CLI,它是 AI agent 的手和腳;Cursor 不只是編輯器,它是全天候自動運行的 agent 工廠。但基礎設施帶來的問題也是基礎設施級別的 — Cline 攻擊說明 AI 工具鏈已經成為攻擊面,Pentagon 事件說明 AI 公司已經成為地緣政治角力場。

💡 給開發者的啟示:不要只評估 AI 工具的功能,也要評估它的攻擊面。你的 CI/CD pipeline 是否把使用者輸入傳給了 AI agent?你的 npm 發布流程是否有 OIDC attestation?

🎯 Today’s Action (30 min):檢查你的 GitHub Actions workflow 是否有 ${{ github.event.issue.title }} 或類似的使用者輸入直接傳給 AI 工具的情況。參考 Cline 攻擊分析 了解完整攻擊鏈。

今日關鍵趨勢#

  • AI 電腦操控:GPT-5.4 超越人類平均 benchmark,Cursor 事件驅動 Automations — AI 從回答問題到操控電腦
  • Agent 安全危機:Cline 供應鏈攻擊、MCP 工具描述攻擊面 — agent 越強大,攻擊面越廣
  • AI 軍事化政治:Pentagon vs Anthropic、OpenAI 接下軍方合約 — AI 公司被迫在倫理與合約間選邊
  • 開源授權地震:AI clean-room rewrite 挑戰 LGPL — 如果成立,所有 copyleft 專案都可能被 AI 重寫改授權
  • Harness vs Model:Cursor $50B 估值 vs Claude Code 「最薄包裝」哲學 — AI 工程的定義性辯論

覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有