yii.
← Digest
EP74 · 2026年5月14日 星期四 · 9 min read

Agent 的邊界在哪裡

微調 API 關閉 + Agent 自訓練 + Anthropic 超越 OpenAI

每天花 1% 的時間,掌握科技脈動。


今日金句#

“If I said ‘I have 11 spreadsheets’ or ‘I have 11 browser tabs’ to do my work, it means about the same thing.” 「如果我說『我有 11 個試算表』或『我有 11 個瀏覽器分頁』在工作,意思差不多。」 — Boris Mann, 開發者社群(via Simon Willison)

“What Anthropic did worked really well — start with a very technical customer base, focus on their needs, really succeed in execution and then start broadening out.” 「Anthropic 做對的事,就是先從技術型客群入手,把執行做好,再逐漸拓展。」 — Ara Kharazian, Economist at Ramp

“The problem is when the ambition leads you to lose sight of what made you successful in the first place.” 「問題是當野心讓你忘了最初讓你成功的是什麼。」 — Charles Leifer, Redis / Valkey 分析


今日主軸#

今天有幾條消息從不同方向指向同一件事:AI agent 的能力邊界,正在往你以為是「人類工作」的地方快速推進。

OpenAI 關掉了微調 API,Latent Space 整理了這個信號:長提示 + RAG 已經能做到以前需要微調的事,更快更便宜。但更有意思的是下一步——AI Engineer 大會上,Merve Noyan 展示了 agent 在一個提示內完成模型微調和部署的 demo。不是人類在盯著 loss curve,是 agent 在做。

與此同時,Namespace 在同一場大會提出「CI/CD is dead」:傳統 CI/CD 假設人類在寫 PR,現在 agent 每分鐘在開幾千個,這套 workflow 跟不上了。

Boris Mann 的一句話戳穿了這個時代的語言病:說「我有 11 個 agents」跟說「我有 11 個試算表」一樣沒有意義。工具的數量從來不是問題,問題是用來解決什麼。

Agent 正在接管整條鏈路。但在我們定義清楚它們在做什麼之前,我們可能都在說不同的語言。


必讀#

  1. Boris Mann: 11 個 AI Agent 沒有意義 — Simon Willison AI
  2. 微調時代終結(The End of Fine-tuning) — Latent Space AI
  3. LLM 0.32a2: OpenAI 推理令牌可視化 — Simon Willison AI
  4. Leaving GitHub for Forgejo — Hacker News Dev
  5. Anthropic 企業客戶數首超 OpenAI(Ramp 數據) — TechCrunch AI
  6. 你的 Agent 現在可以訓練模型 — AI Engineer AI
  7. AI 時代重新審視「沒有銀彈」論述 — Pragmatic Engineer Dev
  8. Anders Hejlsberg 談 TypeScript、C# 和 Turbo Pascal — Pragmatic Engineer Dev
  9. Databricks 高效能限流架構設計 — ByteByteGo Dev
  10. Bun 一週內用 Rust 完全重寫 — Theo / YouTube Dev
  11. Twin brothers wipe 96 government databases minutes after being fired — Ars Technica Security
  12. CI/CD 已死,Agent 需要持續計算 — AI Engineer AI
  13. Bambu Lab is abusing the open source social contract — Jeff Geerling Open Source
  14. Redis and the Cost of Ambition — Lobste.rs Dev
  15. Notion just turned its workspace into a hub for AI agents — TechCrunch AI

1. Boris Mann: 11 個 AI Agent 沒有意義#

Boris Mann 透過 Simon Willison 說了一句讓人想一想的話:「說『我有 11 個 agents』跟說『我有 11 個試算表』或『我有 11 個瀏覽器分頁』在工作,意思差不多。」Agent 的數量從來不等於能力、價值或任務完成度。

  • 要點 1:Agent count 是最糟糕的進度指標,容易形成沒有意義的「agent 頭數軍備競賽」
  • 要點 2:評估 agent 系統應看:任務完成率、精準度、實際節省的時間
  • 要點 3:語言的模糊讓 AI agent 炒作難以被問責,也讓採購決策更容易被操弄

💡 為什麼重要:當所有人都在說「我部署了幾十個 agents」,這句比喻是一記清醒藥,把評估重點拉回到結果。

🔗 閱讀原文 | 來源: Simon Willison


2. 微調時代終結(The End of Fine-tuning)#

OpenAI 關閉微調 API,Latent Space 整理了這個信號的深意:超長 context window + RAG + system prompt 現在能做到以前需要微調的效果,成本更低,迭代更快。精英團隊(Cursor、Cognition)仍在做開源模型的 RLFT,但 80% 的 AI 工程師已往長提示工程轉向。

  • 要點 1:OpenAI 切換至 /v1/responses endpoint,支援跨工具呼叫的交叉推理
  • 要點 2:Stanford Shepherd 系統將 agent 執行視為 Git branch,CooperBench 分數 28.8% → 54.7%
  • 要點 3:市場出現分層——頂層公司仍在微調開源模型;大多數工程師改用長提示 + RAG

💡 為什麼重要:這標誌著 AI 工程方法論的根本轉變。2024 年奏效的微調策略,正在被更便宜、更靈活的長提示工程取代。

🔗 閱讀原文 | 來源: Latent Space


3. LLM 0.32a2: OpenAI 推理令牌可視化#

Simon Willison 發佈 LLM CLI 工具 0.32a2,支援 OpenAI /v1/responses endpoint。GPT-5 等級推理模型的思考過程(reasoning tokens)現在以不同顏色在命令列顯示,可用 -R 旗標隱藏。

  • 要點 1:新 endpoint 支援工具呼叫中途的交叉推理,agent 決策路徑首次可見
  • 要點 2:推理 tokens 已彙整、有色碼,方便 debug agent 行為
  • 要點 3:-R / --hide-reasoning 保持輸出乾淨,適合 pipe 到生產流程

💡 為什麼重要:開發者現在可以直接看到模型在決策中的推理路徑。這是 agentic 系統除錯能力的重大升級。

🔗 閱讀原文 | 來源: Simon Willison


4. Leaving GitHub for Forgejo#

一位 DevOps 顧問詳細記錄了從 GitHub 遷移到自架 Forgejo 的過程。觸發因素:過去 12 個月 GitHub 發生 48 次重大中斷(~112 小時停機);2026 年 4 月 24 日 Copilot 資料預設從 opt-out 改為 opt-in;CLOUD Act + FISA 702 讓 Microsoft 律師承認無法保證歐盟代碼主權。荷蘭政府同月也以相同理由啟動 code.overheid.nl(基於 Forgejo)。

  • 要點 1:48 次重大中斷 / 12 個月,CTO 承認需要 30x 容量增長應對 AI 負載
  • 要點 2:Copilot opt-in 翻轉是直接觸發點——代碼資料被用於訓練 AI 模型
  • 要點 3:Forgejo v15 LTS 在單台 Intel NUC(64GB RAM)可撐住中小型組織全部 Git 需求

💡 為什麼重要:荷蘭政府採用 Forgejo 是機構層面的信號。代碼主權從個人選擇變成合規要求的趨勢,已有具體落地案例。

🔗 閱讀原文 | 來源: Hacker News (505 pts)


5. Anthropic 企業客戶數首超 OpenAI#

Ramp AI Index(樣本 5 萬家公司)數據顯示:2026 年 5 月 Anthropic 企業客戶佔比達 34.4%,首超 OpenAI 的 32.3%。Anthropic 12 個月內成長 26 個百分點(9% → 34.4%),OpenAI 同期下滑 1%。此趨勢從 2025 年 12 月 OpenRouter 排名即已出現。

  • 要點 1:Anthropic 策略成功——先打技術型客群(金融、科技),再透過 Cowork 擴大普及
  • 要點 2:企業買家對「安全/可解釋性」定位反應更正面,Claude 3 系列在生產環境可靠性評價高
  • 要點 3:OpenAI 在消費者端仍有優勢,但核心 B2B 市場份額正在縮窄

💡 為什麼重要:這是首次有第三方數據(非 Anthropic 自報)證明企業採用率超越 OpenAI。選 API 廠商的開發者需要更新認知。

🔗 閱讀原文 | 來源: TechCrunch


6. 你的 Agent 現在可以訓練模型#

AI Engineer: Your Agent Can Now Train Models

Merve Noyan(Hugging Face)在 AI Engineer 大會展示:給 Claude Code agent 一個提示,agent 自動完成模型搜尋、微調、部署——全流程,無需人類監看 loss curve。開源模型(GLM 5.1)效能已逼近 GPT-5,agent 可直接呼叫 HuggingFace API。

  • 要點 1:Agent 成為 ML pipeline 一等公民,從 inference 工具延伸到訓練週期
  • 要點 2:門檻降至「描述你想要什麼」即可觸發完整微調流程
  • 要點 3:結合「微調 API 關閉」背景,agent 接手了以前需要 MLOps 工程師手動操作的工作

💡 為什麼重要:人類判斷沒有消失,只是往後移了一步——從「怎麼調模型」移到「讓 agent 調出什麼樣的模型」。

🔗 觀看影片 | 來源: AI Engineer (YouTube)


7. AI 時代重新審視「沒有銀彈」論述#

Pragmatic Engineer 重訪 Frederick Brooks 1986 年論文〈No Silver Bullets〉,追問 AI 是否是那顆等了 40 年的銀彈。同期 TechPays 被 Levels.fyi 收購。

  • 要點 1:Brooks 主張軟體工程無法實現革命性提升——AI 是否改變了這個命題?
  • 要點 2:AI 解決了 accidental complexity(工具問題),essential complexity(問題本身的複雜性)仍存在
  • 要點 3:「生產力提升」的定義正在被 AI 重塑,但分母(維護成本)不能忽視

💡 為什麼重要:與 EP73 James Shore 的「AI 編碼代理必須讓維護成本下降」形成呼應,構成本週最重要的開發者思考主線。

🔗 閱讀原文 | 來源: The Pragmatic Engineer


8. Anders Hejlsberg 談 TypeScript、C# 和 Turbo Pascal#

Pragmatic Engineer 播客專訪 TypeScript 和 C# 設計者 Anders Hejlsberg,深談三個語言的設計哲學與演進過程。涵蓋影片、音訊和逐字稿多種格式。

  • 要點 1:TypeScript 的「逐漸採用型別」設計初衷——讓 JavaScript 開發者能平滑遷移
  • 要點 2:C# 和 TypeScript 的型別系統哲學差異:structural typing vs nominal typing
  • 要點 3:Turbo Pascal 的設計決策如何奠定了 Hejlsberg 對語言設計速度感的直覺

💡 為什麼重要:第一手聽語言設計師談決策背後的思維,難得的深度內容。TypeScript 現在是最廣泛使用的語言之一,這段對話值得反覆回味。

🔗 閱讀原文 | 來源: The Pragmatic Engineer


9. Databricks 高效能限流架構設計#

Databricks 重新設計限流服務,應對 Real-time Model Serving 帶來的流量激增。核心工程取捨:捨棄嚴格精度,換取延遲降低和可擴展性。

  • 要點 1:分散式限流中「嚴格精度 vs 低延遲」是真實的工程取捨,不存在免費午餐
  • 要點 2:用近似計數器(approximate counter)在分散式環境維持效能
  • 要點 3:實時推論的流量模式與傳統 REST API 截然不同,需要專門設計

💡 為什麼重要:展示了 AI 基礎設施工程的務實設計思維,適用於任何需要高吞吐限流的系統。

🔗 閱讀原文 | 來源: ByteByteGo


10. Bun 一週內用 Rust 完全重寫#

Bun rewritten in Rust in one week (Theo)

Bun 核心開發者 Jarred Sumner 在一週內用 Rust 重寫了 Bun 的核心模組,Theo t3.gg 解析背後的意義和社群反應(73K views)。

  • 要點 1:Rust 重寫的主要動力:記憶體安全 + 可預測的效能,長期可靠性投資
  • 要點 2:JavaScript runtime 的 Rust 化趨勢加速(Deno、Biome 已先行)
  • 要點 3:開發者社群關注:效能提升令人興奮,破壞性變更風險需謹慎評估

💡 為什麼重要:Bun 是 Node.js 最有力的競爭者之一。核心 Rust 化是長期穩定的重要信號。

🔗 觀看影片 | 來源: Theo / YouTube


11. Twin brothers wipe 96 government databases minutes after being fired#

雙胞胎兄弟 Muneeb 和 Sohaib Akhter 在被解雇後 5-60 分鐘內對美國政府資料庫執行 DROP DATABASE,刪除 96 個資料庫並下載 1,805 份 EEOC 檔案。兩人均有 2015 年電信詐騙和電腦犯罪前科,被解雇後仍利用未關閉帳號執行攻擊。Muneeb 甚至向 AI 詢問「如何清除 SQL 伺服器日誌」。根本問題:解雇時只停用了 Sohaib 的帳號,Muneeb 的未被及時關閉。

🔗 閱讀原文 | 來源: Ars Technica / Hacker News


12. CI/CD 已死,Agent 需要持續計算#

CI/CD is dead (AI Engineer)

Namespace 在 AI Engineer 大會論述:傳統 CI/CD 假設人類在寫 PR,現在自主 agent 每分鐘開幾千個,這套架構無法應對。新架構提議:無 PR、基於意圖的驗證,人類審視意圖而非差異(diff)。

🔗 觀看影片 | 來源: AI Engineer (YouTube)


13. Bambu Lab is abusing the open source social contract#

Jeff Geerling 記錄 Bambu Lab 以「模仿/DDoS 風險」為由,對 OrcaSlicer-bambulabs 分支(允許離線列印)發出法律威脅。該分支完全符合 Bambu 自己以 AGPLv3 發佈的代碼。社群反應:相關分支本週在 GitHub Trending 出現 2,878 ⭐,越打壓越有名。

🔗 閱讀原文 | 來源: Jeff Geerling


14. Redis and the Cost of Ambition#

Charles Leifer 深度分析 Redis 從簡單 cache 演變為試圖取代 Postgres、Elasticsearch、Kafka 的代價:身份迷失、功能臃腫、授權亂局(BSD→AGPL 2024),Valkey 分支以「回到原點」的精簡策略吸引 80% 的原始用例。

🔗 閱讀原文 | 來源: Lobste.rs (123 pts)


15. Notion just turned its workspace into a hub for AI agents#

Notion 發佈 Developer Platform:Workers(雲端自訂程式沙盒,免費至 8 月)+ External Agent API。自 2 月以來 Custom Agents 已超過 100 萬個,Claude Code、Cursor、Codex、Decagon 為首批支援的外部 agent。

🔗 閱讀原文 | 來源: TechCrunch


推薦閱讀#


名人動態#

  • Andrej Karpathy — 談 LLM 令牌效率:看 GPT-4 把一段長文摘要得如此精準時的那種妒忌感,反映 LLM summarization 能力的快速進步(Bluesky,222 likes)
  • Simon Willison — 今日多篇重要帖:Boris Mann agent quote(見 必讀 #1)、LLM 0.32a2(見 必讀 #3)、CSP tool(見 推薦閱讀)
  • Paul Graham — 斯德哥爾摩演講:談矽谷為何適合創業,偶然相遇的力量(Y Combinator,13.9K views)

今日觀察#

這週有兩條消息都在說同一件事,只是用不同的物件說。荷蘭政府把官方代碼倉庫搬到了自架 Forgejo,理由是 CLOUD Act 和 FISA 702 讓他們無法保證代碼的主權;Bambu Lab 則以法律手段壓制了一個允許離線列印的開源分支——而那個分支完全符合 AGPLv3 授權。一個是政府選擇自己主控基礎設施,一個是廠商主動收回用戶本來就有的控制權。工具的所有權問題,從代碼到硬體,都在重新成為一個真實的問題。

有意思的是,被 Bambu Lab 施壓的 OrcaSlicer-bambulabs 分支,本週在 GitHub Trending 出現 2,878 ⭐。被打壓的結果,是更多人知道了它的存在。


中文技術圈#


開源精選 — GitHub Trending(本週)#

vercel-labs/zero-native — Zig | ⭐ 3,268 用 Zig 和 web UI 技術構建桌面和手機應用的框架。Vercel 踏入原生應用開發領域的重要嘗試。

FULU-Foundation/OrcaSlicer-bambulab — C++ | ⭐ 2,878 Bambu Lab 的離線友好 OrcaSlicer 分支。本週受 Bambu Lab 法律施壓後爆炸性增長,直接呼應今日頭條。

Nightmare-Eclipse/YellowKey — ⭐ 955 BitLocker 繞過漏洞 PoC,安全研究人員關注。

HermannBjorgvin/Clawdmeter — C | ⭐ 660 ESP32 桌面儀表板,顯示 Claude Code 使用量。對 Claude Code 用戶有趣的硬體 side project。

alchaincyf/huashu-md-html — CSS | ⭐ 512 Markdown ↔ HTML 雙向流水線,附 4 套反 AI slop 主題,內建 Claude Code skill 整合。

TencentARC/Pixal3D — Python | ⭐ 509 SIGGRAPH 2026 論文:騰訊 Pixel-Aligned 圖像 3D 生成模型。


影音精選#

Anthropic 最終的回應#

Theo - Anthropic response 132K views · 1 天前 | 頻道: Theo (t3.gg)

Theo 解析 Anthropic 對開發者社群最新動向的回應,結合今日 Ramp 數據(Anthropic 超越 OpenAI 企業客戶數),提供完整的市場定位分析。132K 觀看是本週 AI 社群最高互動之一。

  • 與今日 Ramp 數據交叉閱讀效果最佳
  • Anthropic API 策略和使用限制是關注焦點

💬 Yii:Theo 的 Anthropic 解讀一向直接不廢話,這支高觀看數背後是開發者對 Claude 定位的真實好奇。


Anthropic 發生了什麼?#

Matthew Berman - Anthropic 62.6K views · 1 天前 | 頻道: Matthew Berman

分析 Anthropic 股票詐騙警告、公司內部動向和估值。與今日 Ramp 數據配套,構成 Anthropic 市場地位的完整背景圖。

  • 詐騙警告:有人在非授權管道售賣 Anthropic 股份
  • 估值和 OpenAI 競爭分析

💬 Yii:官方數字 + YouTuber 解析一起看,拼圖更完整。但要注意 Matthew 有時候會誇大戲劇性,資訊要交叉驗證。


停止讓 AI Agent 寫 Markdown#

Theo - Stop writing Markdown 54.3K views · 1 天前 | 頻道: Theo (t3.gg)

呼籲開發者讓 AI Agent 輸出 HTML 而非 Markdown,有更好的語義、可訪問性和瀏覽器互操作性。當天 Matthew Berman 也發了呼應視頻(「原來 HTML 才是王道」)。

  • Karpathy 推文引發的討論
  • HTML 的 semantic markup 優勢

💬 Yii:這個討論和 Boris Mann 的 agent 定義問題有點像——我們一直用舊工具做新事情,然後才問「為什麼這樣比較好」。


百萬級獨立 AI Agent 商業課程#

Greg Isenberg - AI Agent Business 49.5K views · 1 天前 | 頻道: Greg Isenberg

Nick Vasilescu 分享一人 AI Agent 商業的完整路線圖:報價設計、目標產業、客戶獲取、軟體棧(Hermes、Orgo、Composio)、模型選擇,以及如何讓 Agent 管理其他 Agent。

  • 不是 hype,是可複製的方法論
  • 具體工具棧和收費模式

💬 Yii:2026 年的觀眾要的不是 agent 概念介紹,是「我怎麼用這個賺錢」。這支影片定位在對的地方。



覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有