yii.
← Digest
EP13 · 2026年3月15日 星期日 · 7 min read

Agent 工具爆發與 AI 的人類代價

AI Agent 基礎建設爆發,但代價正在浮現 — gstack 一週破萬星、Meta 裁員 20%、1M context 正式 GA

每天花 1% 的時間,掌握科技脈動。

今日金句#

“Tests are no longer even remotely optional. The reason not to write tests in the past has been that it’s extra work. They’re free now.” 「測試不再是可選項。以前不寫測試的理由是額外工作量。現在它們免費了。」 — Simon Willison, AI 工程研究者、Datasette 創辦人

“The modern battlefield is increasingly defined by software. To maintain our advantage, we must acquire and deploy software capabilities with speed and efficiency.” 「現代戰場越來越由軟體定義。要維持優勢,我們必須以最快速度取得和部署軟體能力。」 — Gabe Chiulli, 美國國防部資訊長辦公室技術長

今日主軸#

今天的科技圈呈現一個矛盾的畫面:Agent 工具生態正以史無前例的速度爆發,但 AI 帶來的代價也開始無法忽視。GitHub 上一週內湧現 gstack(10.7K 星)、GSD-2(1.1K 星)、MetaClaw(1.1K 星)等 Agent 框架,從角色分工到自主研究都有覆蓋。Simon Willison 在 Pragmatic Summit 直言「測試現在是免費的」,因為 Agent 替你寫。但另一邊,AI 垃圾 PR 逼死了 Jazzband 開源組織,Meta 傳出裁員 20%(約 1.58 萬人)來填 AI 基建的錢坑,Latent Space 更指出 context window 兩年幾乎沒成長——不是模型不夠強,是全球記憶體根本不夠用。Agent 的春天來了,但冬天的帳單也到了。

必讀#

  1. garrytan/gstack — GitHub Tools
  2. GSD-2:Spec-Driven 自主開發系統 — GitHub AI
  3. MetaClaw:自我學習進化的 AI Agent — GitHub AI
  4. chrome-cdp-skill:讓 Agent 操控你的 Chrome — GitHub Tools
  5. mcp2cli:MCP/OpenAPI/GraphQL 即時轉 CLI — GitHub Tools
  6. ARIS:Claude Code 自主 ML 研究 — GitHub AI
  7. Simon Willison 談 Agentic 工程 — Newsletter AI
  8. AI 垃圾 PR 逼死 Jazzband 開源組織 — Newsletter AI
  9. [AINews] Context Drought — Newsletter AI
  10. Anthropic 1M Token 上下文正式 GA — Newsletter AI

garrytan/gstack — Garry Tan 的 Claude Code 作業系統#

gstack

Y Combinator 現任總裁 Garry Tan 開源了他個人使用的 Claude Code 配置,一週內狂飆至 10.7K 星。gstack 把 Claude Code 變成一個角色分工明確的團隊——CEO 思維的產品規劃、工程主管級的架構審查、QA 工程師級的生產環境測試。最特別的是內建持久化瀏覽器自動化(透過 CDP),讓 Agent 能直接在真實瀏覽器中執行端對端測試。

  • 六個專業角色指令:/plan-ceo-review、/plan-eng-review、/review、/ship、/browse、/retro
  • 持久化 Chromium 進程搭配 CDP,Agent 可在登入狀態的瀏覽器中進行 QA
  • 不是新手提示集,而是產品級的工作流程作業系統

💡 為什麼重要:展示了 AI 輔助開發正從「問 AI 寫程式」進化到「AI 作為結構化團隊成員」的階段

🔗 閱讀原文 | 來源: GitHub


GSD-2:Meta-Prompting 自主開發系統#

gsd-2

GSD-2 用 specification 檔案(.gsd/)驅動 Agent 工作流程,而非讓 LLM 在迴圈中自我呼叫。它用狀態機讀取 spec 檔,每個任務在獨立 context window 中執行,支援自動模式讓 Agent 在無人看管下完成整個里程碑。

  • 層級架構 Milestones→Slices→Tasks,每個 task 設計為單一 context window
  • 狀態機替代 LLM 自呼叫迴圈,減少幻覺、提升可靠性
  • 內建成本追蹤、進度監控和卡住偵測

💡 為什麼重要:解決了長時間自主 AI 工作的根本問題——context overflow 和任務連貫性

🔗 閱讀原文 | 來源: GitHub


MetaClaw:跟你的 Agent 對話,它自己學習進化#

MetaClaw

MetaClaw 讓 AI Agent 透過與使用者互動來自我學習和進化,不需要手動微調或重新訓練。1.1K 星的 Python 專案,代表了 Agent 從「工具」到「學徒」的轉變。

💡 為什麼重要:Agent 的自我進化能力是通往真正個人化 AI 助手的關鍵一步

🔗 閱讀原文 | 來源: GitHub


chrome-cdp-skill:讓 Agent 接管你的 Chrome#

chrome-cdp-skill

透過 Chrome DevTools Protocol 讓 AI Agent 直接操控使用者正在使用的 Chrome,不需要開新的無頭瀏覽器。Agent 可以看到你登入的 tab、截圖、讀取 DOM、執行 JavaScript、填寫表單。

  • 連接即時 Chrome 工作階段,保留所有登入狀態
  • 核心能力:tab 列表、截圖、無障礙樹、HTML 擷取、JS 執行

💡 為什麼重要:大部分商業軟體都在瀏覽器裡,Agent 需要能操作它們——這是關鍵原語

🔗 閱讀原文 | 來源: GitHub


mcp2cli:任何 MCP/OpenAPI/GraphQL 即時變 CLI#

mcp2cli

零程式碼生成,在執行時把任何 MCP server、OpenAPI spec 或 GraphQL endpoint 轉換成可用的 CLI 工具。讓 Agent 能透過命令列操作任何 API。

💡 為什麼重要:大幅降低 Agent 與現有 API 生態整合的門檻

🔗 閱讀原文 | 來源: GitHub


ARIS:Claude Code 的自主 ML 研究技能#

ARIS(Auto-Research-In-Sleep)為 Claude Code 添加自主 ML 研究能力,包括跨模型審查迴圈、想法發現和實驗自動化。「睡覺時自動研究」的工作模式。

💡 為什麼重要:展示 AI 從「輔助研究」到「自主研究」的轉變

🔗 閱讀原文 | 來源: GitHub


Simon Willison 談 Agentic 工程的實務心法#

Simon Willison Pragmatic Summit

Simon Willison 在 Pragmatic Summit 的爐邊對談中分享了 Agent 開發的實務經驗。他指出 Opus 4.6 是第一個在已知問題類別中值得信任的模型,紅綠 TDD(只需 5 個 token 的指令)就能大幅提升 Agent 程式碼成功率。核心觀點:測試現在是免費的——過去不寫測試的唯一理由(額外工作量)已經消失。

  • 紅綠 TDD 是 Agent 可靠性的關鍵——5 token 指令改變成功率
  • 複合可靠性衰減:99% 準確的 Agent 做 10 步只有 90.4% 成功率
  • StrongDM 的軟體工廠模式:沒有人寫程式、沒有人讀程式,每天花 $1,000+ token
  • Prompt injection 的「致命三角」仍是最大安全風險

💡 為什麼重要:提供了從 Agent 新手到生產環境的實務路線圖,TDD + 沙箱是核心原則

🔗 閱讀原文 | 來源: Simon Willison


AI 垃圾 PR 泛濫,Jazzband 開源組織宣告終止#

Jazzband shutdown

GitHub 上 AI 生成的垃圾 PR 和 issue 大量湧現,使 Jazzband 開源組織的共享推送模式難以為繼。AI 生成的 PR 中僅一成符合專案標準,curl 的作者甚至因此關閉漏洞獎勵計畫。

  • AI PR 中只有 10% 符合標準,90% 製造維護負擔
  • curl 關閉漏洞獎勵計畫,因 AI 編造的「漏洞回報」泛濫
  • 開源維護者的人力是有限資源,AI 正在消耗這個資源

💡 為什麼重要:開源是整個軟體產業的基石,AI 對開源社群的衝擊可能引發連鎖效應

🔗 閱讀原文 | 來源: Simon Willison


[AINews] Context Drought — 上下文視窗成長停滯的真相#

Context Drought

Anthropic 1M context GA 看似里程碑,但 Latent Space 指出 context window 是 LLM 四大維度中成長最慢的。根本原因是全球 HBM/DRAM 短缺——這是硬體瓶頸,軟體無法突破。

  • Anthropic MRCR v2 準確度 78.3%(最新標竿)
  • OpenAI 超過 272K token 和 Gemini 超過 200K token 都要收溢價,Anthropic 不收
  • 未來方向可能是「context 配給制」而非「更大 context」

💡 為什麼重要:重新定義 AI 系統路線圖——從「更大的 context window」轉向「更聰明的 context 管理」

🔗 閱讀原文 | 來源: Latent Space


Anthropic 1M Token 上下文正式開放#

1M Context GA

Claude Opus 4.6 與 Sonnet 4.6 的 1M token 上下文窗口正式 GA,且不收取長上下文溢價費用。相比之下 OpenAI 和 Google 在超額 token 時都收溢價。

💡 為什麼重要:降低大型程式碼庫分析、長文件處理、Agent 記憶等使用案例的成本門檻

🔗 閱讀原文 | 來源: Simon Willison

社群熱門#

推薦閱讀#

中文技術圈#

開源精選#

garrytan/gstack — TypeScript | ⭐ 10.7K Garry Tan 的 Claude Code 工作流程系統,六個角色指令打造 AI 團隊

davebcn87/pi-autoresearch — TypeScript | ⭐ 1.6K 自主實驗循環擴展

TianyiDataScience/openclaw-control-center — TypeScript | ⭐ 1.4K OpenClaw 可視化控制中心

gsd-build/gsd-2 — TypeScript | ⭐ 1.2K Spec-driven 自主開發系統,狀態機替代 LLM 迴圈

aiming-lab/MetaClaw — Python | ⭐ 1.1K 自我學習進化的 AI Agent

pasky/chrome-cdp-skill — JavaScript | ⭐ 987 AI Agent 的 Chrome 即時操控

knowsuchagency/mcp2cli — Python | ⭐ 962 MCP/OpenAPI/GraphQL 轉 CLI

larksuite/openclaw-lark — TypeScript | ⭐ 919 飛書官方 OpenClaw 插件

wanshuiyin/ARIS — Python | ⭐ 908 Claude Code 自主 ML 研究

RightNow-AI/autokernel — Python | ⭐ 623 PyTorch 模型自動優化 Triton Kernels

影音精選#

Open source is dying#

Theo

AI 的崛起正在嚴重衝擊開源生態系。tldraw 宣布自動關閉外部貢獻者的 PR,Node.js 也因大量 AI 垃圾回報而提高漏洞通報門檻。

  • tldraw 和 Node.js 已開始限制外部貢獻
  • 有經驗的開發者需要站出來保護開源
  • 開源是軟體產業基石,崩壞影響深遠

💬 Theo 的觀點跟 Jazzband 的終止運營形成完美呼應——問題已從個案變成趨勢

Inside Lovable’s $400M ARR Growth Machine#

20VC

Lovable 在短短 18 個月內衝破 3.5 億美元 ARR,成為全球成長最快的公司之一。

  • AI 時代的成長關鍵已轉變為「信任問題」
  • Minimum Lovable Product 比功能完整性重要
  • 每位員工都被要求直接向生產環境部署程式碼

💬 AI-first 公司的成長速度已經超越傳統 SaaS 的想像空間

Is this the death of juniors?#

20VC

AI 正以超乎預期的速度淘汰初級職位,裁減初階員工所省下的預算正被用於投資 AI 基礎設施。

  • 企業不再願意花兩年培育應屆畢業生
  • 初級職位的削減跨越多個行業
  • 省下的人力成本直接轉向 AI 投資

💬 對 junior 開發者來說,差異化能力比以往任何時候都重要

大神動態#

今日觀察#

今天看到 gstack 一週破萬星,讓我想到一件事。大家都在瘋 Agent 工具,但 Simon Willison 那段「compound reliability decay」的數學才是真正該注意的:99% 準確的 Agent 做 10 步串連,整體只剩 90%。如果是 95% 做 20 步?35.8%。這就是為什麼 gstack 要把工作流程拆成角色分工,GSD-2 要用狀態機而不是讓 LLM 自我呼叫。Agent 時代的核心問題不是「AI 能不能做」,而是「串起來之後還可不可靠」。老實說,這跟我自己做 Flutter app 的經驗很像——單元測試全過,整合測試才是噩夢。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有