Agent 工具爆發與 AI 的人類代價
AI Agent 基礎建設爆發,但代價正在浮現 — gstack 一週破萬星、Meta 裁員 20%、1M context 正式 GA
每天花 1% 的時間,掌握科技脈動。
今日金句#
“Tests are no longer even remotely optional. The reason not to write tests in the past has been that it’s extra work. They’re free now.” 「測試不再是可選項。以前不寫測試的理由是額外工作量。現在它們免費了。」 — Simon Willison, AI 工程研究者、Datasette 創辦人
“The modern battlefield is increasingly defined by software. To maintain our advantage, we must acquire and deploy software capabilities with speed and efficiency.” 「現代戰場越來越由軟體定義。要維持優勢,我們必須以最快速度取得和部署軟體能力。」 — Gabe Chiulli, 美國國防部資訊長辦公室技術長
今日主軸#
今天的科技圈呈現一個矛盾的畫面:Agent 工具生態正以史無前例的速度爆發,但 AI 帶來的代價也開始無法忽視。GitHub 上一週內湧現 gstack(10.7K 星)、GSD-2(1.1K 星)、MetaClaw(1.1K 星)等 Agent 框架,從角色分工到自主研究都有覆蓋。Simon Willison 在 Pragmatic Summit 直言「測試現在是免費的」,因為 Agent 替你寫。但另一邊,AI 垃圾 PR 逼死了 Jazzband 開源組織,Meta 傳出裁員 20%(約 1.58 萬人)來填 AI 基建的錢坑,Latent Space 更指出 context window 兩年幾乎沒成長——不是模型不夠強,是全球記憶體根本不夠用。Agent 的春天來了,但冬天的帳單也到了。
必讀#
- garrytan/gstack — GitHub
Tools - GSD-2:Spec-Driven 自主開發系統 — GitHub
AI - MetaClaw:自我學習進化的 AI Agent — GitHub
AI - chrome-cdp-skill:讓 Agent 操控你的 Chrome — GitHub
Tools - mcp2cli:MCP/OpenAPI/GraphQL 即時轉 CLI — GitHub
Tools - ARIS:Claude Code 自主 ML 研究 — GitHub
AI - Simon Willison 談 Agentic 工程 — Newsletter
AI - AI 垃圾 PR 逼死 Jazzband 開源組織 — Newsletter
AI - [AINews] Context Drought — Newsletter
AI - Anthropic 1M Token 上下文正式 GA — Newsletter
AI
garrytan/gstack — Garry Tan 的 Claude Code 作業系統#
Y Combinator 現任總裁 Garry Tan 開源了他個人使用的 Claude Code 配置,一週內狂飆至 10.7K 星。gstack 把 Claude Code 變成一個角色分工明確的團隊——CEO 思維的產品規劃、工程主管級的架構審查、QA 工程師級的生產環境測試。最特別的是內建持久化瀏覽器自動化(透過 CDP),讓 Agent 能直接在真實瀏覽器中執行端對端測試。
- 六個專業角色指令:/plan-ceo-review、/plan-eng-review、/review、/ship、/browse、/retro
- 持久化 Chromium 進程搭配 CDP,Agent 可在登入狀態的瀏覽器中進行 QA
- 不是新手提示集,而是產品級的工作流程作業系統
💡 為什麼重要:展示了 AI 輔助開發正從「問 AI 寫程式」進化到「AI 作為結構化團隊成員」的階段
🔗 閱讀原文 | 來源: GitHub
GSD-2:Meta-Prompting 自主開發系統#
GSD-2 用 specification 檔案(.gsd/)驅動 Agent 工作流程,而非讓 LLM 在迴圈中自我呼叫。它用狀態機讀取 spec 檔,每個任務在獨立 context window 中執行,支援自動模式讓 Agent 在無人看管下完成整個里程碑。
- 層級架構 Milestones→Slices→Tasks,每個 task 設計為單一 context window
- 狀態機替代 LLM 自呼叫迴圈,減少幻覺、提升可靠性
- 內建成本追蹤、進度監控和卡住偵測
💡 為什麼重要:解決了長時間自主 AI 工作的根本問題——context overflow 和任務連貫性
🔗 閱讀原文 | 來源: GitHub
MetaClaw:跟你的 Agent 對話,它自己學習進化#
MetaClaw 讓 AI Agent 透過與使用者互動來自我學習和進化,不需要手動微調或重新訓練。1.1K 星的 Python 專案,代表了 Agent 從「工具」到「學徒」的轉變。
💡 為什麼重要:Agent 的自我進化能力是通往真正個人化 AI 助手的關鍵一步
🔗 閱讀原文 | 來源: GitHub
chrome-cdp-skill:讓 Agent 接管你的 Chrome#
透過 Chrome DevTools Protocol 讓 AI Agent 直接操控使用者正在使用的 Chrome,不需要開新的無頭瀏覽器。Agent 可以看到你登入的 tab、截圖、讀取 DOM、執行 JavaScript、填寫表單。
- 連接即時 Chrome 工作階段,保留所有登入狀態
- 核心能力:tab 列表、截圖、無障礙樹、HTML 擷取、JS 執行
💡 為什麼重要:大部分商業軟體都在瀏覽器裡,Agent 需要能操作它們——這是關鍵原語
🔗 閱讀原文 | 來源: GitHub
mcp2cli:任何 MCP/OpenAPI/GraphQL 即時變 CLI#
零程式碼生成,在執行時把任何 MCP server、OpenAPI spec 或 GraphQL endpoint 轉換成可用的 CLI 工具。讓 Agent 能透過命令列操作任何 API。
💡 為什麼重要:大幅降低 Agent 與現有 API 生態整合的門檻
🔗 閱讀原文 | 來源: GitHub
ARIS:Claude Code 的自主 ML 研究技能#
ARIS(Auto-Research-In-Sleep)為 Claude Code 添加自主 ML 研究能力,包括跨模型審查迴圈、想法發現和實驗自動化。「睡覺時自動研究」的工作模式。
💡 為什麼重要:展示 AI 從「輔助研究」到「自主研究」的轉變
🔗 閱讀原文 | 來源: GitHub
Simon Willison 談 Agentic 工程的實務心法#

Simon Willison 在 Pragmatic Summit 的爐邊對談中分享了 Agent 開發的實務經驗。他指出 Opus 4.6 是第一個在已知問題類別中值得信任的模型,紅綠 TDD(只需 5 個 token 的指令)就能大幅提升 Agent 程式碼成功率。核心觀點:測試現在是免費的——過去不寫測試的唯一理由(額外工作量)已經消失。
- 紅綠 TDD 是 Agent 可靠性的關鍵——5 token 指令改變成功率
- 複合可靠性衰減:99% 準確的 Agent 做 10 步只有 90.4% 成功率
- StrongDM 的軟體工廠模式:沒有人寫程式、沒有人讀程式,每天花 $1,000+ token
- Prompt injection 的「致命三角」仍是最大安全風險
💡 為什麼重要:提供了從 Agent 新手到生產環境的實務路線圖,TDD + 沙箱是核心原則
🔗 閱讀原文 | 來源: Simon Willison
AI 垃圾 PR 泛濫,Jazzband 開源組織宣告終止#

GitHub 上 AI 生成的垃圾 PR 和 issue 大量湧現,使 Jazzband 開源組織的共享推送模式難以為繼。AI 生成的 PR 中僅一成符合專案標準,curl 的作者甚至因此關閉漏洞獎勵計畫。
- AI PR 中只有 10% 符合標準,90% 製造維護負擔
- curl 關閉漏洞獎勵計畫,因 AI 編造的「漏洞回報」泛濫
- 開源維護者的人力是有限資源,AI 正在消耗這個資源
💡 為什麼重要:開源是整個軟體產業的基石,AI 對開源社群的衝擊可能引發連鎖效應
🔗 閱讀原文 | 來源: Simon Willison
[AINews] Context Drought — 上下文視窗成長停滯的真相#

Anthropic 1M context GA 看似里程碑,但 Latent Space 指出 context window 是 LLM 四大維度中成長最慢的。根本原因是全球 HBM/DRAM 短缺——這是硬體瓶頸,軟體無法突破。
- Anthropic MRCR v2 準確度 78.3%(最新標竿)
- OpenAI 超過 272K token 和 Gemini 超過 200K token 都要收溢價,Anthropic 不收
- 未來方向可能是「context 配給制」而非「更大 context」
💡 為什麼重要:重新定義 AI 系統路線圖——從「更大的 context window」轉向「更聰明的 context 管理」
🔗 閱讀原文 | 來源: Latent Space
Anthropic 1M Token 上下文正式開放#

Claude Opus 4.6 與 Sonnet 4.6 的 1M token 上下文窗口正式 GA,且不收取長上下文溢價費用。相比之下 OpenAI 和 Google 在超額 token 時都收溢價。
💡 為什麼重要:降低大型程式碼庫分析、長文件處理、Agent 記憶等使用案例的成本門檻
🔗 閱讀原文 | 來源: Simon Willison
社群熱門#
- 1M Context GA for Opus 4.6 & Sonnet 4.6 — Anthropic 宣布 100 萬 token 上下文正式開放,開發者社群激烈討論
- Claude Import Memory — Switch from ChatGPT — Anthropic 推出 ChatGPT 記憶匯入功能,切換 AI 助手的門檻大幅降低
- Qatar Helium Shutdown Threatens Chip Supply Chain — 卡達氦氣停供可能衝擊全球半導體製造,兩週倒數計時
- Anything API — API for Any Website — 不寫程式就能為任何網站生成 API
- Claude Marketplace — Anthropic 開放 Claude 工具市集,平台生態成形
推薦閱讀#
- Baochip-1x:自製晶片的緣起與現況 — 一位獨立開發者從零開始設計自製晶片的故事,在 Crowd Supply 上分享動機和技術歷程
- Montana Right to Compute Act — 蒙大拿州率先立法保障「運算權」,開創性的數位權利法案
- Lenny 社群智慧:說服懷疑 AI 的 CTO — 產品社群實戰經驗分享,如何讓保守的技術主管接受 AI 工具
- Ethan Mollick:The Shape of the Thing — AI 正從「共同智慧」階段轉向「Agent 管理」階段的深度分析
- The Multi-Agent Trap — Google DeepMind 研究發現多 Agent 網路放大錯誤 17 倍,40% 的 Agent 專案最終被取消
中文技術圈#
- Kotlin Tracy 強化 AI 應用可觀測性 — 新的 Kotlin 開源工具協助開發者除錯 AI 應用,追蹤 LLM 呼叫與工具執行流程
- Claude 加入即時視覺化功能 — Anthropic 為 Claude 新增互動式視覺化能力,可在聊天中生成圖表與流程圖
- VS Code 改採周更,新增 Autopilot 模式 — VS Code 加速釋放節奏,新增 AI Autopilot 預覽與代理權限控制
- 微軟推出 Copilot Health — 整合醫療紀錄與穿戴裝置,提供個人化健康建議
- GitLab:AI 能發現漏洞,但風險治理才是關鍵 — GitLab 分享 AI 在安全漏洞發現中的作用與限制
開源精選#
garrytan/gstack — TypeScript | ⭐ 10.7K Garry Tan 的 Claude Code 工作流程系統,六個角色指令打造 AI 團隊
davebcn87/pi-autoresearch — TypeScript | ⭐ 1.6K 自主實驗循環擴展
TianyiDataScience/openclaw-control-center — TypeScript | ⭐ 1.4K OpenClaw 可視化控制中心
gsd-build/gsd-2 — TypeScript | ⭐ 1.2K Spec-driven 自主開發系統,狀態機替代 LLM 迴圈
aiming-lab/MetaClaw — Python | ⭐ 1.1K 自我學習進化的 AI Agent
pasky/chrome-cdp-skill — JavaScript | ⭐ 987 AI Agent 的 Chrome 即時操控
knowsuchagency/mcp2cli — Python | ⭐ 962 MCP/OpenAPI/GraphQL 轉 CLI
larksuite/openclaw-lark — TypeScript | ⭐ 919 飛書官方 OpenClaw 插件
wanshuiyin/ARIS — Python | ⭐ 908 Claude Code 自主 ML 研究
RightNow-AI/autokernel — Python | ⭐ 623 PyTorch 模型自動優化 Triton Kernels
影音精選#
Open source is dying#
AI 的崛起正在嚴重衝擊開源生態系。tldraw 宣布自動關閉外部貢獻者的 PR,Node.js 也因大量 AI 垃圾回報而提高漏洞通報門檻。
- tldraw 和 Node.js 已開始限制外部貢獻
- 有經驗的開發者需要站出來保護開源
- 開源是軟體產業基石,崩壞影響深遠
💬 Theo 的觀點跟 Jazzband 的終止運營形成完美呼應——問題已從個案變成趨勢
Inside Lovable’s $400M ARR Growth Machine#
Lovable 在短短 18 個月內衝破 3.5 億美元 ARR,成為全球成長最快的公司之一。
- AI 時代的成長關鍵已轉變為「信任問題」
- Minimum Lovable Product 比功能完整性重要
- 每位員工都被要求直接向生產環境部署程式碼
💬 AI-first 公司的成長速度已經超越傳統 SaaS 的想像空間
Is this the death of juniors?#
AI 正以超乎預期的速度淘汰初級職位,裁減初階員工所省下的預算正被用於投資 AI 基礎設施。
- 企業不再願意花兩年培育應屆畢業生
- 初級職位的削減跨越多個行業
- 省下的人力成本直接轉向 AI 投資
💬 對 junior 開發者來說,差異化能力比以往任何時候都重要
大神動態#
- Simon Willison: Agentic Engineering 對談 — TDD 是 Agent 可靠性關鍵,測試「現在免費了」
- Simon Willison: Jazzband 終止運營 — AI 垃圾 PR 摧毀開源社群
- Simon Willison: 1M Context GA — Anthropic 無溢價策略
- Swyx: [AINews] Context Drought — Context window 硬體瓶頸分析
- Ethan Mollick: The Shape of the Thing — AI 從共同智慧到 Agent 管理
今日觀察#
今天看到 gstack 一週破萬星,讓我想到一件事。大家都在瘋 Agent 工具,但 Simon Willison 那段「compound reliability decay」的數學才是真正該注意的:99% 準確的 Agent 做 10 步串連,整體只剩 90%。如果是 95% 做 20 步?35.8%。這就是為什麼 gstack 要把工作流程拆成角色分工,GSD-2 要用狀態機而不是讓 LLM 自我呼叫。Agent 時代的核心問題不是「AI 能不能做」,而是「串起來之後還可不可靠」。老實說,這跟我自己做 Flutter app 的經驗很像——單元測試全過,整合測試才是噩夢。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit



