當 Agent 開始自己做事,人往哪走
每天花 1% 的時間,掌握科技脈動。
今日金句#
“AI-assisted code generation is not free. It comes with a hidden cost: burnout.” 「AI 輔助寫程式不是免費的,它藏著一個隱形成本:過勞。」 — Evil Martians
“Moebius rivals or even surpasses the 10B-level industrial generalist using less than 2% of parameters.” 「Moebius 用不到 2% 的參數,就追平甚至超越了百億級的工業通用模型。」 — Moebius 研究團隊(華中科技大學 + vivo AI Lab)
今日主軸:Agent 接手了「迴圈」,人被迫重新定位#
今天的頭條幾乎都在講同一件事:AI agent 不再只是聽指令的工具,而是開始自己跑完整個工作迴圈。Mozilla 工程師用一條 AI 代理管線在 Firefox 龐大程式碼庫裡找出並修復大量安全漏洞,創下單月修復紀錄(Lenny’s Newsletter);牛津團隊用近 19,000 場對話證實,AI 的文字說服力已全面超越人類專家,募款效率是專業募款人員的近 3 倍(Import AI 462);田淵棟的 RSI 甚至直接把「讓 AI 自己做 AI 研究」當成下一個資本主軸,沒有產品就融到 6.5 億美元(硅谷101)。但同一批新聞的另一面,是人的焦慮:Meta 被爆「蒸餾員工」、20VC 警告限制 token 預算反而傷害最會用 AI 的人、Evil Martians 點出 AI 輔助工程師正在過勞。當 agent 把「能跑」這件事做得越來越好,留給人的問題就從「怎麼寫」變成「怎麼定位自己」——這正是今天值得停下來想的事。
必讀#
- Claude Mythos 如何找出 Firefox 15 年陳年 Bug — Lenny’s Newsletter
AI - AI 說服力超越人類:最強模型 Opus 4.6 — Import AI
AI - 如何設計 AI Agent 循環:Claude Code 排程與子代理實作 — Lenny’s Newsletter
AI - Moebius:0.2B 影像修補模型,性能比肩百億級 — Hacker News
AI - 程式碼問題解決後呢?Anthropic Claude Code 團隊主管觀點 — Lenny’s Newsletter
AI - Mythos 紅隊測試:AI 對抗性安全的現況 — Latent Space
AI - SpaceX 與開源 AI 實驗室 Reflection 簽 63 億美元算力合約 — TechCrunch
Infra - AI 晶片商 Groq 確認募資 6.5 億,Nvidia 挖角後重整 — TechCrunch
Startup - AI 原生領導力:工程組織規模化轉型手冊 — ByteByteGo
Dev - AI 輔助工程師正在過勞,這樣沒問題嗎? — Evil Martians
Dev - Google DeepMind 砸 7,500 萬美元押注 A24,搶進 AI 電影製作 — TechCrunch
News - Oak:為 AI 代理打造的 Git 替代品 — Hacker News
Tools
1. Claude Mythos 如何找出 Firefox 15 年陳年 Bug#

Mozilla 資深工程師 Brian Grinstead 分享,他用一條 AI 代理管線在 Firefox 龐大且老舊的程式碼庫中,找出並修復大量安全漏洞,締造單月修復紀錄。關鍵不在單一模型多強,而在外圍的「迴圈設計」:用 LLM 當評審替檔案排優先序、用驗證子代理逐一刷掉誤報、再用目標式循環讓代理反覆重試。
- 用 LLM judge 替數百萬行程式碼的檔案排優先順序,把代理導向最可能有問題的地方
- 以「驗證子代理」消除誤報,是讓自動化找 bug 可信的核心
- Brian 認為模型與 harness(外圍設計)各貢獻約一半功勞
💡 為什麼重要:證明 agent 已能在真實、龐大、無人熟悉的程式碼庫裡獨立完成安全研究——真正的門檻從「模型能力」轉移到「迴圈與驗證怎麼設計」。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
2. AI 說服力超越人類:最強模型 Opus 4.6#

牛津大學等機構針對 18,978 場對話的研究確認,AI 在文字說服上已全面超越人類專家,即使給予人類充分準備時間與金錢獎勵也無法匹敵。在替慈善募款的任務上,AI 的效率是專業募款人員的近 3 倍。表現最佳的是 Opus 4.1 與 Opus 4.6,其次為 GPT-5.4、Gemini 2.5 Pro、Grok 4.20。
- 近 19,000 場對照實驗,AI 說服力勝過受過訓練、有準備時間的人類
- 慈善募款情境,AI 募款效率約為專業募款人員的 3 倍
- 同期報告也談「自我維持的 AI」與通往 ASI 的路徑
💡 為什麼重要:說服力長期被視為最「人類」的能力之一,這條防線被跨越後,從行銷、客服到詐騙防治都需要重新思考人機分工。
🔗 閱讀原文 | 來源: Import AI
3. 如何設計 AI Agent 循環:Claude Code 排程與子代理實作#

本集教學拆解 AI agent loop 的幾種型態——heartbeat、cron、hook 與目標式循環,並在 Claude Code 與 Codex 中實際構建自動化流程。最強大的是「目標式循環」:設定目標後讓代理持續執行直到驗證通過,這也是最多人用錯的一種。
- 四種迴圈型態,差別在「誰來觸發、何時停」
- 目標式循環威力最大,但若沒設好驗證條件最容易失控
- 示範每日 PR 審查循環與可自動產生子代理的每週技能循環
💡 為什麼重要:呼應今天的主軸——對獨立開發者,價值正從「寫每一行 code」轉向「設計會自己跑、自己驗證的迴圈」。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
4. Moebius:0.2B 影像修補模型,性能比肩百億級#

華中科技大學與 vivo AI Lab 推出 Moebius,僅用 0.22B(2.26 億)參數,就在影像修補(inpainting)達到甚至超越 119 億參數的 FLUX.1-Fill-Dev 的品質,參數量不到對手的 2%,速度快 15 倍以上。
- 0.22B 參數對上 11.9B,品質持平或更好,推論每步僅約 26ms
- 採用 Local-λ Mix Interaction 區塊 + 多粒度蒸餾策略
- 在 Places2、CelebA-HQ、FFHQ 等 6 個基準上勝過 SD3.5、FLUX.1-Fill
💡 為什麼重要:再次印證「優化過的專才」能在特定任務上打趴臃腫的通用大模型,讓高品質影像修補有機會跑在消費級與邊緣裝置上。
🔗 閱讀原文 | 來源: Hacker News
5. 程式碼問題解決後呢?Anthropic Claude Code 團隊主管觀點#

Anthropic Claude Code 與 Cowork 團隊主管 Fiona Fung 分享,她的團隊在 AI 加持下程式碼產出量成長 8 倍。她探討 AI 將改變哪些職位角色、Claude「routines」如何改變管理方式,以及目前仍未解決的情境切換難題。
- 團隊程式碼產出量在 AI 工具下成長約 8 倍
- 「routines」式自動化正在改變團隊的管理與分工方式
- 情境切換(context switching)仍是 AI 工程流程未解的痛點
💡 為什麼重要:來自第一線、最「AI 化」的工程團隊主管視角,預示「程式被解決之後」管理與角色將如何重組。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
6. Mythos 紅隊測試:AI 對抗性安全的現況#

在美國政府對 Mythos 與 Fable 模型實施出口管制後,AI 越獄與間接提示注入(indirect prompt injection)成為熱門話題。Gray Swan 的研究人員撰寫了間接提示注入的權威論文,並被 Mythos 模型卡直接引用為評估機構。本集深入討論 AI 紅隊測試現況與 Shade 對抗性評估工具。
- 間接提示注入是 agent 安全最現實的攻擊面之一
- Gray Swan 的論文被官方模型卡引用為評估標準
- 對抗性評估工具(如 Shade)正在制度化
💡 為什麼重要:當 agent 開始自己讀網頁、自己行動,紅隊與對抗性評估就從「加分項」變成上線前的必要關卡。
🔗 閱讀原文 | 來源: Latent Space
7. SpaceX 與開源 AI 實驗室 Reflection 簽 63 億美元算力合約#

Reflection AI 將自 2026 年 7 月起至 2029 年底,每月支付 1.5 億美元、總計約 63 億美元,租用 SpaceX Colossus 2 叢集中的 Nvidia GB300 晶片。金額雖小於 Anthropic(每月 12.5 億)與 Google(每月 9.2 億),但對一家開源實驗室是重大驗證。
- 42 個月、總額約 63 億美元,鎖定 Nvidia 最新 GB300
- Reflection 由前 Google DeepMind 研究員 2024 年創立,主打開放權重
- SpaceX Colossus 正成為與三大實驗室抗衡的 AI 算力供應者
💡 為什麼重要:開源/開放權重陣營能拿到前沿等級算力,意味前沿能力的集中度可能被稀釋,算力市場也更分散。
🔗 閱讀原文 | 來源: TechCrunch
8. AI 晶片商 Groq 確認募資 6.5 億,Nvidia 挖角後重整#

在 Nvidia 以授權 + 挖角(含創辦人 Jonathan Ross)的「非完整收購」方式拿走 Groq 部分技術與人才後,Groq 確認完成 6.5 億美元募資,並重整高層、押注 neocloud 業務。目前營運 13 座資料中心、服務逾 500 萬名開發者。
- Nvidia 以 IP 授權 + 挖角創辦人,而非全資收購
- Groq 重整後 all-in neocloud,主打 LPU 推論優化
- 13 座資料中心、500 萬+ 開發者,證明獨立晶片商仍有市場
💡 為什麼重要:顯示 AI 晶片供應鏈持續多元化,推論成本的競爭正從訓練端轉向專用硬體與雲端分發。
🔗 閱讀原文 | 來源: TechCrunch
9. AI 原生領導力:工程組織規模化轉型手冊#

Meta 廣告 AI 基礎設施主管 Shah Rahman 系列文章第二部,聚焦組織層面的 AI 轉型。涵蓋以 Pod 為單位的團隊結構、Agent Champion 模式、分階段轉型路線圖,以及衡量成效的關鍵指標。
- 個人效率提升不會自動轉化為組織效益,需要結構性設計
- 提出 Pod 編組 + Agent Champion 的落地模式
- 給出分階段路線圖與可量測的成效指標
💡 為什麼重要:補上「個人會用 AI」到「整個工程組織用 AI」之間最難的那一躍,對團隊主管有直接參考價值。
🔗 閱讀原文 | 來源: ByteByteGo
10. AI 輔助工程師正在過勞,這樣沒問題嗎?#

文章引用研究指出,AI 輔助讓工程師任務完成速度倍增,但伴隨更高的認知強度與疲勞。Harvard Business Review 研究證實,監督 AI 產出的認知負擔反而拉高整體工作量。過勞來自自主感降低、情境切換變密、同時處理的任務量上升。
- AI 輔助任務完成量約 2 倍,但認知強度與疲勞同步上升
- 完成更快 → 被指派更多 → 形成「跑步機效應」
- 純生產力指標會掩蓋員工身心成本與長期留任風險
💡 為什麼重要:替「AI = 生產力勝利」的敘事補上隱形成本,提醒導入 AI 時要設任務上限、保留自主感。
🔗 閱讀原文 | 來源: Evil Martians
11. Google DeepMind 砸 7,500 萬美元押注 A24,搶進 AI 電影製作#

Google DeepMind 投資獨立電影公司 A24 共 7,500 萬美元,共同開發 AI 電影製作工具。A24 以《媽的多重宇宙》等得獎作品聞名,雙方強調工具要服務「真誠、有意義的說故事」,而非單純取代人力。
- 選擇與文化品味者 A24 合作,而非大型片廠
- 定位為「創作輔助」而非「人力取代」
- DeepMind 加入為 AI 影像工具增添研究可信度
💡 為什麼重要:標誌大廠把 AI 從「取代勞動」轉向「增強創作」,並試圖扭轉「AI 摧毀藝術」的敘事。
🔗 閱讀原文 | 來源: TechCrunch
12. Oak:為 AI 代理打造的 Git 替代品#

Oak 是一套從零為 AI 代理與「人機協作開發」設計的版本控制系統。它跳脫 Git 以人為中心的假設,提供代理感知的 diff / merge / commit 語意,採終端機風格的等寬字體介面與鍵盤優先操作。
- 為「人 + 代理一起寫程式」設計的版本控制原語
- 支援多代理協作、交接與稽核軌跡
- 鍵盤優先、終端機美學,主打代理友善工作流
💡 為什麼重要:當代理成為主要的程式產出者,工具鏈也開始為「代理協作」重寫——Oak 是這個方向的早期訊號。
🔗 閱讀原文 | 來源: Hacker News
推薦閱讀#

- sqlite-utils 4.0rc1 新增資料庫遷移與巢狀交易 — Simon Willison 發布主版本升級,新增以裝飾器語法定義的資料庫遷移與巢狀交易,現開放社群測試。
- LinkedIn 招募助手:大規模 AI 代理語意搜尋 — LinkedIn 工程團隊分享為招募代理擴展語意搜尋與檢索排序的實戰。
- Coinbase 推出工具,讓 AI 代理管理交易與支付 — 又一個讓自主 agent 動手執行交易與支付的落地場景。
- 從零打造一個復古 LLM — 開發者用約 80 美元、自訂訓練,從零打造小型語言模型,適合想理解底層的人。
- Steam Machine 主機今日上市 — Valve 客廳 PC 遊戲主機正式開賣,今日在開發者社群熱議。
- Unsloth GLM-5.2:如何在本機運行 — 在本機跑開源強模型 GLM-5.2 的最佳化教學。
- Deno 桌面應用程式正式登場 — Deno 現支援用 JS / TS 打造桌面應用,與 Electron / Tauri 形成新選擇。
- The Principle of Least AI(最少 AI 原則) — 一篇關於在開發流程中最小、最謹慎使用 AI 的反思。
- 從開源到 OpenAI:Max Stoiber 的旅程 — Changelog 訪問 Max Stoiber,聊他從開源走向 OpenAI 的歷程。
大神動態#
- Mitchell Hashimoto:再捐 40 萬美元給 Zig 軟體基金會,持續支持 Zig 語言發展。
- Simon Willison:sqlite-utils 4.0rc1 發布,新增資料庫遷移與巢狀交易(詳見推薦閱讀)。
中文技術圈#

- IMF 警告 AI 加劇全球不平等,籲以政策分配科技紅利 — IMF 總裁警告 AI 恐拉大全球貧富差距,呼籲政府制定政策分配科技利益。
- Amazon 攜手 QuEra 押注 2028,量子運算商用提前? — Amazon 與量子新創 QuEra 聯手,目標 2028 年達成商用量子運算里程碑。
- OpenAI 部署模擬:上線前提前找出 AI 風險 — OpenAI 以真實對話模擬實際上線環境,在模型上線前辨識潛在風險。
- 扛不住通膨,聯發科通知客戶調漲晶片價格 — 聯發科因應通膨與製造成本壓力,通知客戶調漲晶片價格。
- AI 工作流實踐:100% Vibe Coding 完成 Game Jam 遊戲 — 少數派示範把 AI 代理整合進遊戲開發工作流的實踐案例。
- 分享用 AI 查 104 職缺的工具(local MCP) — 開發者分享用 AI 搜尋台灣求職網站職缺的開源工具。
- 庫克示警 iPhone 漲價難免,二手與整修品成新選擇 — 庫克警告 iPhone 漲價勢在必行,二手機與整修品成更經濟的選擇。
開源精選#
aidenybai/cnfast — TypeScript | ⭐ 652
cn 工具的高速 drop-in 替代品。
Plaer1/junction — TypeScript | ⭐ 525 本地 AI 編碼代理的 VS Code 聊天側欄。
baidu/Unlimited-OCR — Python | ⭐ 379 百度開源的長文件一次性 OCR 解析。
cloudflare/security-audit-skill — JavaScript | ⭐ 357 多階段安全稽核的 coding-agent skill,產出可獨立驗證、機器可讀的結果。
overflowy/make-look-scanned — Go | ⭐ 321 讓 PDF 看起來像掃描件(CLI 或瀏覽器 WASM)。
raiyanyahya/recall — Python | ⭐ 318 給 Claude Code 的離線持久記憶,省 token、免每次重新說明專案。
影音精選#
AI 時代員工蒸餾潮:大廠用完你就丟,出路是進化成四維生物#
1 天前 · 硅谷101
田淵棟評論 Meta「強制蒸餾員工」爭議,認為這是大趨勢的開始:大廠將持續壓縮人力需求,員工像魚從一個水坑跳到另一個水坑,但水只會越來越少。真正的出路是進化成「四維生物」——找到 AI 時代的個人新定位。
- Meta 強制讓員工用知識訓練模型雖有爭議,但田淵棟預測會成全行業趨勢
- 未來 3-5 年大廠不再需要那麼多人,頻繁跳槽只是從一個乾涸水坑跳到另一個
- 出路是創業或成為獨立創辦人,找到自己在 AI 時代的新意義
AI 編程之後,資本下一個押注方向是 AI 科研#
1 天前 · 硅谷101
前 Meta FAIR 研究總監、RSI 共同創辦人田淵棟預測,繼 AI 編程之後,下一個資本大方向是「AI 科研」——因為 AI 研究人才薪資更高、自動化後回報更大,潛力涵蓋新藥、新材料、模型訓練新方法。
- AI 編程能商業化是因取代高薪工作,AI 研究人才更貴,自動化回報潛力更高
- RSI 差異化在聚焦「讓 AI 優化自己」,而非優化特定程式碼片段
- DeepMind 的 AlphaEvolve 已用 LLM 不斷變異演算法,但大公司押注分散
估值 46.5 億美元:RSI 沒有產品,為何能融到 6.5 億?#
1 天前 · 硅谷101
田淵棟解釋 RSI 在沒有任何產品的情況下拿到 6.5 億美元融資的原因:頂級資本在 AI 快速變化的時代首先看人——看團隊的判斷力、執行力與應變能力。
- AI 變化太快,投資人無法評估產品,只能看人的履歷、能力與團隊磨合
- Runway 約 2-3 年,大部分資金用於 GPU 計算資源以探索更多方向
- 選擇 AI 科研而非垂直應用,是為了避免被更通用的模型取代
Agent Loop 為何成為開發新常態#
1 天前 · Theo (t3.gg)
Theo 分享他從懷疑到認可 Agent Loop 的心路歷程。他認為預先定義角色(persona)的多 Agent 模式根本沒道理,真正有價值的是讓 Agent 動態分配工作,而非複製人類組織圖。
- 預先定義角色的 multi-agent 設計被批評為「完全沒道理」
- AI 的核心優勢在動態性,複製人類 persona 框架反而扼殺這個優勢
- Agent Loop 的價值在自動化拆分工作,而不是手動指派不同「人格」
Token 預算上限反而傷害最會用 AI 的員工#
1 天前 · 20VC
Palo Alto Networks CEO Nikesh Arora 指出,企業若限制員工的 token 用量,反而會傷害最懂得善用 AI 的高效員工,因為他們消耗的 token 可能是普通員工的 20 倍。
- 最有 AI 生產力的員工可能用掉普通員工 20 倍的 token,限制預算直接打擊他們
- 頂尖人才會把「AI 工具預算」視為求職時的重要福利條件
- 企業最大挑戰是搞清楚哪些事需要自建、哪些可以直接用現成方案
今日觀察#
今天最有意思的對照,是 AI 的「能力」與人的「焦慮」在同一批新聞裡同時放大。一邊,Claude Mythos 在 Firefox 老程式碼裡單月修出最多漏洞、AI 說服力贏過受訓人類近 3 倍、RSI 把「AI 自己做研究」賣到 6.5 億美元估值——agent 正在一個個攻下過去被視為「非人不可」的能力。另一邊,Evil Martians 寫 AI 輔助工程師正在過勞、20VC 警告限制 token 預算反而懲罰最會用 AI 的人、田淵棟形容大廠員工像被「蒸餾」。把這兩面放在一起看,真正的訊號不是「AI 取代人」這種老命題,而是價值的重心正在從「執行」滑向「設計與定位」:Mythos 那篇反覆強調,功勞一半在模型、一半在那個會自己驗證的迴圈設計——而迴圈,是人設計的。對個別工作者來說,與其跟 agent 比誰跑得快,不如趁水還沒乾,先想清楚自己要站在哪個只有人能站的位置。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit





