yii.
← Digest
EP114 · 2026年6月23日 星期二 · 9 min read

當 Agent 開始自己做事,人往哪走

每天花 1% 的時間,掌握科技脈動。

今日金句#

“AI-assisted code generation is not free. It comes with a hidden cost: burnout.” 「AI 輔助寫程式不是免費的,它藏著一個隱形成本:過勞。」 — Evil Martians

“Moebius rivals or even surpasses the 10B-level industrial generalist using less than 2% of parameters.” 「Moebius 用不到 2% 的參數,就追平甚至超越了百億級的工業通用模型。」 — Moebius 研究團隊(華中科技大學 + vivo AI Lab)

今日主軸:Agent 接手了「迴圈」,人被迫重新定位#

今天的頭條幾乎都在講同一件事:AI agent 不再只是聽指令的工具,而是開始自己跑完整個工作迴圈。Mozilla 工程師用一條 AI 代理管線在 Firefox 龐大程式碼庫裡找出並修復大量安全漏洞,創下單月修復紀錄(Lenny’s Newsletter);牛津團隊用近 19,000 場對話證實,AI 的文字說服力已全面超越人類專家,募款效率是專業募款人員的近 3 倍(Import AI 462);田淵棟的 RSI 甚至直接把「讓 AI 自己做 AI 研究」當成下一個資本主軸,沒有產品就融到 6.5 億美元(硅谷101)。但同一批新聞的另一面,是人的焦慮:Meta 被爆「蒸餾員工」、20VC 警告限制 token 預算反而傷害最會用 AI 的人、Evil Martians 點出 AI 輔助工程師正在過勞。當 agent 把「能跑」這件事做得越來越好,留給人的問題就從「怎麼寫」變成「怎麼定位自己」——這正是今天值得停下來想的事。

必讀#

  1. Claude Mythos 如何找出 Firefox 15 年陳年 Bug — Lenny’s Newsletter AI
  2. AI 說服力超越人類:最強模型 Opus 4.6 — Import AI AI
  3. 如何設計 AI Agent 循環:Claude Code 排程與子代理實作 — Lenny’s Newsletter AI
  4. Moebius:0.2B 影像修補模型,性能比肩百億級 — Hacker News AI
  5. 程式碼問題解決後呢?Anthropic Claude Code 團隊主管觀點 — Lenny’s Newsletter AI
  6. Mythos 紅隊測試:AI 對抗性安全的現況 — Latent Space AI
  7. SpaceX 與開源 AI 實驗室 Reflection 簽 63 億美元算力合約 — TechCrunch Infra
  8. AI 晶片商 Groq 確認募資 6.5 億,Nvidia 挖角後重整 — TechCrunch Startup
  9. AI 原生領導力:工程組織規模化轉型手冊 — ByteByteGo Dev
  10. AI 輔助工程師正在過勞,這樣沒問題嗎? — Evil Martians Dev
  11. Google DeepMind 砸 7,500 萬美元押注 A24,搶進 AI 電影製作 — TechCrunch News
  12. Oak:為 AI 代理打造的 Git 替代品 — Hacker News Tools

1. Claude Mythos 如何找出 Firefox 15 年陳年 Bug#

Mozilla 資深工程師 Brian Grinstead 分享,他用一條 AI 代理管線在 Firefox 龐大且老舊的程式碼庫中,找出並修復大量安全漏洞,締造單月修復紀錄。關鍵不在單一模型多強,而在外圍的「迴圈設計」:用 LLM 當評審替檔案排優先序、用驗證子代理逐一刷掉誤報、再用目標式循環讓代理反覆重試。

  • 用 LLM judge 替數百萬行程式碼的檔案排優先順序,把代理導向最可能有問題的地方
  • 以「驗證子代理」消除誤報,是讓自動化找 bug 可信的核心
  • Brian 認為模型與 harness(外圍設計)各貢獻約一半功勞

💡 為什麼重要:證明 agent 已能在真實、龐大、無人熟悉的程式碼庫裡獨立完成安全研究——真正的門檻從「模型能力」轉移到「迴圈與驗證怎麼設計」。

🔗 閱讀原文 | 來源: Lenny’s Newsletter

2. AI 說服力超越人類:最強模型 Opus 4.6#

牛津大學等機構針對 18,978 場對話的研究確認,AI 在文字說服上已全面超越人類專家,即使給予人類充分準備時間與金錢獎勵也無法匹敵。在替慈善募款的任務上,AI 的效率是專業募款人員的近 3 倍。表現最佳的是 Opus 4.1 與 Opus 4.6,其次為 GPT-5.4、Gemini 2.5 Pro、Grok 4.20。

  • 近 19,000 場對照實驗,AI 說服力勝過受過訓練、有準備時間的人類
  • 慈善募款情境,AI 募款效率約為專業募款人員的 3 倍
  • 同期報告也談「自我維持的 AI」與通往 ASI 的路徑

💡 為什麼重要:說服力長期被視為最「人類」的能力之一,這條防線被跨越後,從行銷、客服到詐騙防治都需要重新思考人機分工。

🔗 閱讀原文 | 來源: Import AI

3. 如何設計 AI Agent 循環:Claude Code 排程與子代理實作#

本集教學拆解 AI agent loop 的幾種型態——heartbeat、cron、hook 與目標式循環,並在 Claude Code 與 Codex 中實際構建自動化流程。最強大的是「目標式循環」:設定目標後讓代理持續執行直到驗證通過,這也是最多人用錯的一種。

  • 四種迴圈型態,差別在「誰來觸發、何時停」
  • 目標式循環威力最大,但若沒設好驗證條件最容易失控
  • 示範每日 PR 審查循環與可自動產生子代理的每週技能循環

💡 為什麼重要:呼應今天的主軸——對獨立開發者,價值正從「寫每一行 code」轉向「設計會自己跑、自己驗證的迴圈」。

🔗 閱讀原文 | 來源: Lenny’s Newsletter

4. Moebius:0.2B 影像修補模型,性能比肩百億級#

華中科技大學與 vivo AI Lab 推出 Moebius,僅用 0.22B(2.26 億)參數,就在影像修補(inpainting)達到甚至超越 119 億參數的 FLUX.1-Fill-Dev 的品質,參數量不到對手的 2%,速度快 15 倍以上。

  • 0.22B 參數對上 11.9B,品質持平或更好,推論每步僅約 26ms
  • 採用 Local-λ Mix Interaction 區塊 + 多粒度蒸餾策略
  • 在 Places2、CelebA-HQ、FFHQ 等 6 個基準上勝過 SD3.5、FLUX.1-Fill

💡 為什麼重要:再次印證「優化過的專才」能在特定任務上打趴臃腫的通用大模型,讓高品質影像修補有機會跑在消費級與邊緣裝置上。

🔗 閱讀原文 | 來源: Hacker News

5. 程式碼問題解決後呢?Anthropic Claude Code 團隊主管觀點#

Anthropic Claude Code 與 Cowork 團隊主管 Fiona Fung 分享,她的團隊在 AI 加持下程式碼產出量成長 8 倍。她探討 AI 將改變哪些職位角色、Claude「routines」如何改變管理方式,以及目前仍未解決的情境切換難題。

  • 團隊程式碼產出量在 AI 工具下成長約 8 倍
  • 「routines」式自動化正在改變團隊的管理與分工方式
  • 情境切換(context switching)仍是 AI 工程流程未解的痛點

💡 為什麼重要:來自第一線、最「AI 化」的工程團隊主管視角,預示「程式被解決之後」管理與角色將如何重組。

🔗 閱讀原文 | 來源: Lenny’s Newsletter

6. Mythos 紅隊測試:AI 對抗性安全的現況#

在美國政府對 Mythos 與 Fable 模型實施出口管制後,AI 越獄與間接提示注入(indirect prompt injection)成為熱門話題。Gray Swan 的研究人員撰寫了間接提示注入的權威論文,並被 Mythos 模型卡直接引用為評估機構。本集深入討論 AI 紅隊測試現況與 Shade 對抗性評估工具。

  • 間接提示注入是 agent 安全最現實的攻擊面之一
  • Gray Swan 的論文被官方模型卡引用為評估標準
  • 對抗性評估工具(如 Shade)正在制度化

💡 為什麼重要:當 agent 開始自己讀網頁、自己行動,紅隊與對抗性評估就從「加分項」變成上線前的必要關卡。

🔗 閱讀原文 | 來源: Latent Space

7. SpaceX 與開源 AI 實驗室 Reflection 簽 63 億美元算力合約#

Reflection AI 將自 2026 年 7 月起至 2029 年底,每月支付 1.5 億美元、總計約 63 億美元,租用 SpaceX Colossus 2 叢集中的 Nvidia GB300 晶片。金額雖小於 Anthropic(每月 12.5 億)與 Google(每月 9.2 億),但對一家開源實驗室是重大驗證。

  • 42 個月、總額約 63 億美元,鎖定 Nvidia 最新 GB300
  • Reflection 由前 Google DeepMind 研究員 2024 年創立,主打開放權重
  • SpaceX Colossus 正成為與三大實驗室抗衡的 AI 算力供應者

💡 為什麼重要:開源/開放權重陣營能拿到前沿等級算力,意味前沿能力的集中度可能被稀釋,算力市場也更分散。

🔗 閱讀原文 | 來源: TechCrunch

8. AI 晶片商 Groq 確認募資 6.5 億,Nvidia 挖角後重整#

在 Nvidia 以授權 + 挖角(含創辦人 Jonathan Ross)的「非完整收購」方式拿走 Groq 部分技術與人才後,Groq 確認完成 6.5 億美元募資,並重整高層、押注 neocloud 業務。目前營運 13 座資料中心、服務逾 500 萬名開發者。

  • Nvidia 以 IP 授權 + 挖角創辦人,而非全資收購
  • Groq 重整後 all-in neocloud,主打 LPU 推論優化
  • 13 座資料中心、500 萬+ 開發者,證明獨立晶片商仍有市場

💡 為什麼重要:顯示 AI 晶片供應鏈持續多元化,推論成本的競爭正從訓練端轉向專用硬體與雲端分發。

🔗 閱讀原文 | 來源: TechCrunch

9. AI 原生領導力:工程組織規模化轉型手冊#

Meta 廣告 AI 基礎設施主管 Shah Rahman 系列文章第二部,聚焦組織層面的 AI 轉型。涵蓋以 Pod 為單位的團隊結構、Agent Champion 模式、分階段轉型路線圖,以及衡量成效的關鍵指標。

  • 個人效率提升不會自動轉化為組織效益,需要結構性設計
  • 提出 Pod 編組 + Agent Champion 的落地模式
  • 給出分階段路線圖與可量測的成效指標

💡 為什麼重要:補上「個人會用 AI」到「整個工程組織用 AI」之間最難的那一躍,對團隊主管有直接參考價值。

🔗 閱讀原文 | 來源: ByteByteGo

10. AI 輔助工程師正在過勞,這樣沒問題嗎?#

文章引用研究指出,AI 輔助讓工程師任務完成速度倍增,但伴隨更高的認知強度與疲勞。Harvard Business Review 研究證實,監督 AI 產出的認知負擔反而拉高整體工作量。過勞來自自主感降低、情境切換變密、同時處理的任務量上升。

  • AI 輔助任務完成量約 2 倍,但認知強度與疲勞同步上升
  • 完成更快 → 被指派更多 → 形成「跑步機效應」
  • 純生產力指標會掩蓋員工身心成本與長期留任風險

💡 為什麼重要:替「AI = 生產力勝利」的敘事補上隱形成本,提醒導入 AI 時要設任務上限、保留自主感。

🔗 閱讀原文 | 來源: Evil Martians

11. Google DeepMind 砸 7,500 萬美元押注 A24,搶進 AI 電影製作#

Google DeepMind 投資獨立電影公司 A24 共 7,500 萬美元,共同開發 AI 電影製作工具。A24 以《媽的多重宇宙》等得獎作品聞名,雙方強調工具要服務「真誠、有意義的說故事」,而非單純取代人力。

  • 選擇與文化品味者 A24 合作,而非大型片廠
  • 定位為「創作輔助」而非「人力取代」
  • DeepMind 加入為 AI 影像工具增添研究可信度

💡 為什麼重要:標誌大廠把 AI 從「取代勞動」轉向「增強創作」,並試圖扭轉「AI 摧毀藝術」的敘事。

🔗 閱讀原文 | 來源: TechCrunch

12. Oak:為 AI 代理打造的 Git 替代品#

Oak 是一套從零為 AI 代理與「人機協作開發」設計的版本控制系統。它跳脫 Git 以人為中心的假設,提供代理感知的 diff / merge / commit 語意,採終端機風格的等寬字體介面與鍵盤優先操作。

  • 為「人 + 代理一起寫程式」設計的版本控制原語
  • 支援多代理協作、交接與稽核軌跡
  • 鍵盤優先、終端機美學,主打代理友善工作流

💡 為什麼重要:當代理成為主要的程式產出者,工具鏈也開始為「代理協作」重寫——Oak 是這個方向的早期訊號。

🔗 閱讀原文 | 來源: Hacker News

推薦閱讀#

大神動態#

  • Mitchell Hashimoto:再捐 40 萬美元給 Zig 軟體基金會,持續支持 Zig 語言發展。
  • Simon Willison:sqlite-utils 4.0rc1 發布,新增資料庫遷移與巢狀交易(詳見推薦閱讀)。

中文技術圈#

開源精選#

aidenybai/cnfast — TypeScript | ⭐ 652 cn 工具的高速 drop-in 替代品。

Plaer1/junction — TypeScript | ⭐ 525 本地 AI 編碼代理的 VS Code 聊天側欄。

baidu/Unlimited-OCR — Python | ⭐ 379 百度開源的長文件一次性 OCR 解析。

cloudflare/security-audit-skill — JavaScript | ⭐ 357 多階段安全稽核的 coding-agent skill,產出可獨立驗證、機器可讀的結果。

overflowy/make-look-scanned — Go | ⭐ 321 讓 PDF 看起來像掃描件(CLI 或瀏覽器 WASM)。

raiyanyahya/recall — Python | ⭐ 318 給 Claude Code 的離線持久記憶,省 token、免每次重新說明專案。

影音精選#

AI 時代員工蒸餾潮:大廠用完你就丟,出路是進化成四維生物#

1 天前 · 硅谷101

硅谷101

田淵棟評論 Meta「強制蒸餾員工」爭議,認為這是大趨勢的開始:大廠將持續壓縮人力需求,員工像魚從一個水坑跳到另一個水坑,但水只會越來越少。真正的出路是進化成「四維生物」——找到 AI 時代的個人新定位。

  • Meta 強制讓員工用知識訓練模型雖有爭議,但田淵棟預測會成全行業趨勢
  • 未來 3-5 年大廠不再需要那麼多人,頻繁跳槽只是從一個乾涸水坑跳到另一個
  • 出路是創業或成為獨立創辦人,找到自己在 AI 時代的新意義

AI 編程之後,資本下一個押注方向是 AI 科研#

1 天前 · 硅谷101

硅谷101

前 Meta FAIR 研究總監、RSI 共同創辦人田淵棟預測,繼 AI 編程之後,下一個資本大方向是「AI 科研」——因為 AI 研究人才薪資更高、自動化後回報更大,潛力涵蓋新藥、新材料、模型訓練新方法。

  • AI 編程能商業化是因取代高薪工作,AI 研究人才更貴,自動化回報潛力更高
  • RSI 差異化在聚焦「讓 AI 優化自己」,而非優化特定程式碼片段
  • DeepMind 的 AlphaEvolve 已用 LLM 不斷變異演算法,但大公司押注分散

估值 46.5 億美元:RSI 沒有產品,為何能融到 6.5 億?#

1 天前 · 硅谷101

硅谷101

田淵棟解釋 RSI 在沒有任何產品的情況下拿到 6.5 億美元融資的原因:頂級資本在 AI 快速變化的時代首先看人——看團隊的判斷力、執行力與應變能力。

  • AI 變化太快,投資人無法評估產品,只能看人的履歷、能力與團隊磨合
  • Runway 約 2-3 年,大部分資金用於 GPU 計算資源以探索更多方向
  • 選擇 AI 科研而非垂直應用,是為了避免被更通用的模型取代

Agent Loop 為何成為開發新常態#

1 天前 · Theo (t3.gg)

Theo

Theo 分享他從懷疑到認可 Agent Loop 的心路歷程。他認為預先定義角色(persona)的多 Agent 模式根本沒道理,真正有價值的是讓 Agent 動態分配工作,而非複製人類組織圖。

  • 預先定義角色的 multi-agent 設計被批評為「完全沒道理」
  • AI 的核心優勢在動態性,複製人類 persona 框架反而扼殺這個優勢
  • Agent Loop 的價值在自動化拆分工作,而不是手動指派不同「人格」

Token 預算上限反而傷害最會用 AI 的員工#

1 天前 · 20VC

20VC

Palo Alto Networks CEO Nikesh Arora 指出,企業若限制員工的 token 用量,反而會傷害最懂得善用 AI 的高效員工,因為他們消耗的 token 可能是普通員工的 20 倍。

  • 最有 AI 生產力的員工可能用掉普通員工 20 倍的 token,限制預算直接打擊他們
  • 頂尖人才會把「AI 工具預算」視為求職時的重要福利條件
  • 企業最大挑戰是搞清楚哪些事需要自建、哪些可以直接用現成方案

今日觀察#

今天最有意思的對照,是 AI 的「能力」與人的「焦慮」在同一批新聞裡同時放大。一邊,Claude Mythos 在 Firefox 老程式碼裡單月修出最多漏洞、AI 說服力贏過受訓人類近 3 倍、RSI 把「AI 自己做研究」賣到 6.5 億美元估值——agent 正在一個個攻下過去被視為「非人不可」的能力。另一邊,Evil Martians 寫 AI 輔助工程師正在過勞、20VC 警告限制 token 預算反而懲罰最會用 AI 的人、田淵棟形容大廠員工像被「蒸餾」。把這兩面放在一起看,真正的訊號不是「AI 取代人」這種老命題,而是價值的重心正在從「執行」滑向「設計與定位」:Mythos 那篇反覆強調,功勞一半在模型、一半在那個會自己驗證的迴圈設計——而迴圈,是人設計的。對個別工作者來說,與其跟 agent 比誰跑得快,不如趁水還沒乾,先想清楚自己要站在哪個只有人能站的位置。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有