Agent 的邊界在哪裡
微調 API 關閉 + Agent 自訓練 + Anthropic 超越 OpenAI
每天花 1% 的時間,掌握科技脈動。
今日金句#
“If I said ‘I have 11 spreadsheets’ or ‘I have 11 browser tabs’ to do my work, it means about the same thing.” 「如果我說『我有 11 個試算表』或『我有 11 個瀏覽器分頁』在工作,意思差不多。」 — Boris Mann, 開發者社群(via Simon Willison)
“What Anthropic did worked really well — start with a very technical customer base, focus on their needs, really succeed in execution and then start broadening out.” 「Anthropic 做對的事,就是先從技術型客群入手,把執行做好,再逐漸拓展。」 — Ara Kharazian, Economist at Ramp
“The problem is when the ambition leads you to lose sight of what made you successful in the first place.” 「問題是當野心讓你忘了最初讓你成功的是什麼。」 — Charles Leifer, Redis / Valkey 分析
今日主軸#
今天有幾條消息從不同方向指向同一件事:AI agent 的能力邊界,正在往你以為是「人類工作」的地方快速推進。
OpenAI 關掉了微調 API,Latent Space 整理了這個信號:長提示 + RAG 已經能做到以前需要微調的事,更快更便宜。但更有意思的是下一步——AI Engineer 大會上,Merve Noyan 展示了 agent 在一個提示內完成模型微調和部署的 demo。不是人類在盯著 loss curve,是 agent 在做。
與此同時,Namespace 在同一場大會提出「CI/CD is dead」:傳統 CI/CD 假設人類在寫 PR,現在 agent 每分鐘在開幾千個,這套 workflow 跟不上了。
Boris Mann 的一句話戳穿了這個時代的語言病:說「我有 11 個 agents」跟說「我有 11 個試算表」一樣沒有意義。工具的數量從來不是問題,問題是用來解決什麼。
Agent 正在接管整條鏈路。但在我們定義清楚它們在做什麼之前,我們可能都在說不同的語言。
必讀#
- Boris Mann: 11 個 AI Agent 沒有意義 — Simon Willison
AI - 微調時代終結(The End of Fine-tuning) — Latent Space
AI - LLM 0.32a2: OpenAI 推理令牌可視化 — Simon Willison
AI - Leaving GitHub for Forgejo — Hacker News
Dev - Anthropic 企業客戶數首超 OpenAI(Ramp 數據) — TechCrunch
AI - 你的 Agent 現在可以訓練模型 — AI Engineer
AI - AI 時代重新審視「沒有銀彈」論述 — Pragmatic Engineer
Dev - Anders Hejlsberg 談 TypeScript、C# 和 Turbo Pascal — Pragmatic Engineer
Dev - Databricks 高效能限流架構設計 — ByteByteGo
Dev - Bun 一週內用 Rust 完全重寫 — Theo / YouTube
Dev - Twin brothers wipe 96 government databases minutes after being fired — Ars Technica
Security - CI/CD 已死,Agent 需要持續計算 — AI Engineer
AI - Bambu Lab is abusing the open source social contract — Jeff Geerling
Open Source - Redis and the Cost of Ambition — Lobste.rs
Dev - Notion just turned its workspace into a hub for AI agents — TechCrunch
AI
1. Boris Mann: 11 個 AI Agent 沒有意義#

Boris Mann 透過 Simon Willison 說了一句讓人想一想的話:「說『我有 11 個 agents』跟說『我有 11 個試算表』或『我有 11 個瀏覽器分頁』在工作,意思差不多。」Agent 的數量從來不等於能力、價值或任務完成度。
- 要點 1:Agent count 是最糟糕的進度指標,容易形成沒有意義的「agent 頭數軍備競賽」
- 要點 2:評估 agent 系統應看:任務完成率、精準度、實際節省的時間
- 要點 3:語言的模糊讓 AI agent 炒作難以被問責,也讓採購決策更容易被操弄
💡 為什麼重要:當所有人都在說「我部署了幾十個 agents」,這句比喻是一記清醒藥,把評估重點拉回到結果。
🔗 閱讀原文 | 來源: Simon Willison
2. 微調時代終結(The End of Fine-tuning)#

OpenAI 關閉微調 API,Latent Space 整理了這個信號的深意:超長 context window + RAG + system prompt 現在能做到以前需要微調的效果,成本更低,迭代更快。精英團隊(Cursor、Cognition)仍在做開源模型的 RLFT,但 80% 的 AI 工程師已往長提示工程轉向。
- 要點 1:OpenAI 切換至
/v1/responsesendpoint,支援跨工具呼叫的交叉推理 - 要點 2:Stanford Shepherd 系統將 agent 執行視為 Git branch,CooperBench 分數 28.8% → 54.7%
- 要點 3:市場出現分層——頂層公司仍在微調開源模型;大多數工程師改用長提示 + RAG
💡 為什麼重要:這標誌著 AI 工程方法論的根本轉變。2024 年奏效的微調策略,正在被更便宜、更靈活的長提示工程取代。
🔗 閱讀原文 | 來源: Latent Space
3. LLM 0.32a2: OpenAI 推理令牌可視化#

Simon Willison 發佈 LLM CLI 工具 0.32a2,支援 OpenAI /v1/responses endpoint。GPT-5 等級推理模型的思考過程(reasoning tokens)現在以不同顏色在命令列顯示,可用 -R 旗標隱藏。
- 要點 1:新 endpoint 支援工具呼叫中途的交叉推理,agent 決策路徑首次可見
- 要點 2:推理 tokens 已彙整、有色碼,方便 debug agent 行為
- 要點 3:
-R / --hide-reasoning保持輸出乾淨,適合 pipe 到生產流程
💡 為什麼重要:開發者現在可以直接看到模型在決策中的推理路徑。這是 agentic 系統除錯能力的重大升級。
🔗 閱讀原文 | 來源: Simon Willison
4. Leaving GitHub for Forgejo#

一位 DevOps 顧問詳細記錄了從 GitHub 遷移到自架 Forgejo 的過程。觸發因素:過去 12 個月 GitHub 發生 48 次重大中斷(~112 小時停機);2026 年 4 月 24 日 Copilot 資料預設從 opt-out 改為 opt-in;CLOUD Act + FISA 702 讓 Microsoft 律師承認無法保證歐盟代碼主權。荷蘭政府同月也以相同理由啟動 code.overheid.nl(基於 Forgejo)。
- 要點 1:48 次重大中斷 / 12 個月,CTO 承認需要 30x 容量增長應對 AI 負載
- 要點 2:Copilot opt-in 翻轉是直接觸發點——代碼資料被用於訓練 AI 模型
- 要點 3:Forgejo v15 LTS 在單台 Intel NUC(64GB RAM)可撐住中小型組織全部 Git 需求
💡 為什麼重要:荷蘭政府採用 Forgejo 是機構層面的信號。代碼主權從個人選擇變成合規要求的趨勢,已有具體落地案例。
🔗 閱讀原文 | 來源: Hacker News (505 pts)
5. Anthropic 企業客戶數首超 OpenAI#

Ramp AI Index(樣本 5 萬家公司)數據顯示:2026 年 5 月 Anthropic 企業客戶佔比達 34.4%,首超 OpenAI 的 32.3%。Anthropic 12 個月內成長 26 個百分點(9% → 34.4%),OpenAI 同期下滑 1%。此趨勢從 2025 年 12 月 OpenRouter 排名即已出現。
- 要點 1:Anthropic 策略成功——先打技術型客群(金融、科技),再透過 Cowork 擴大普及
- 要點 2:企業買家對「安全/可解釋性」定位反應更正面,Claude 3 系列在生產環境可靠性評價高
- 要點 3:OpenAI 在消費者端仍有優勢,但核心 B2B 市場份額正在縮窄
💡 為什麼重要:這是首次有第三方數據(非 Anthropic 自報)證明企業採用率超越 OpenAI。選 API 廠商的開發者需要更新認知。
🔗 閱讀原文 | 來源: TechCrunch
6. 你的 Agent 現在可以訓練模型#
Merve Noyan(Hugging Face)在 AI Engineer 大會展示:給 Claude Code agent 一個提示,agent 自動完成模型搜尋、微調、部署——全流程,無需人類監看 loss curve。開源模型(GLM 5.1)效能已逼近 GPT-5,agent 可直接呼叫 HuggingFace API。
- 要點 1:Agent 成為 ML pipeline 一等公民,從 inference 工具延伸到訓練週期
- 要點 2:門檻降至「描述你想要什麼」即可觸發完整微調流程
- 要點 3:結合「微調 API 關閉」背景,agent 接手了以前需要 MLOps 工程師手動操作的工作
💡 為什麼重要:人類判斷沒有消失,只是往後移了一步——從「怎麼調模型」移到「讓 agent 調出什麼樣的模型」。
🔗 觀看影片 | 來源: AI Engineer (YouTube)
7. AI 時代重新審視「沒有銀彈」論述#

Pragmatic Engineer 重訪 Frederick Brooks 1986 年論文〈No Silver Bullets〉,追問 AI 是否是那顆等了 40 年的銀彈。同期 TechPays 被 Levels.fyi 收購。
- 要點 1:Brooks 主張軟體工程無法實現革命性提升——AI 是否改變了這個命題?
- 要點 2:AI 解決了 accidental complexity(工具問題),essential complexity(問題本身的複雜性)仍存在
- 要點 3:「生產力提升」的定義正在被 AI 重塑,但分母(維護成本)不能忽視
💡 為什麼重要:與 EP73 James Shore 的「AI 編碼代理必須讓維護成本下降」形成呼應,構成本週最重要的開發者思考主線。
🔗 閱讀原文 | 來源: The Pragmatic Engineer
8. Anders Hejlsberg 談 TypeScript、C# 和 Turbo Pascal#
Pragmatic Engineer 播客專訪 TypeScript 和 C# 設計者 Anders Hejlsberg,深談三個語言的設計哲學與演進過程。涵蓋影片、音訊和逐字稿多種格式。
- 要點 1:TypeScript 的「逐漸採用型別」設計初衷——讓 JavaScript 開發者能平滑遷移
- 要點 2:C# 和 TypeScript 的型別系統哲學差異:structural typing vs nominal typing
- 要點 3:Turbo Pascal 的設計決策如何奠定了 Hejlsberg 對語言設計速度感的直覺
💡 為什麼重要:第一手聽語言設計師談決策背後的思維,難得的深度內容。TypeScript 現在是最廣泛使用的語言之一,這段對話值得反覆回味。
🔗 閱讀原文 | 來源: The Pragmatic Engineer
9. Databricks 高效能限流架構設計#

Databricks 重新設計限流服務,應對 Real-time Model Serving 帶來的流量激增。核心工程取捨:捨棄嚴格精度,換取延遲降低和可擴展性。
- 要點 1:分散式限流中「嚴格精度 vs 低延遲」是真實的工程取捨,不存在免費午餐
- 要點 2:用近似計數器(approximate counter)在分散式環境維持效能
- 要點 3:實時推論的流量模式與傳統 REST API 截然不同,需要專門設計
💡 為什麼重要:展示了 AI 基礎設施工程的務實設計思維,適用於任何需要高吞吐限流的系統。
🔗 閱讀原文 | 來源: ByteByteGo
10. Bun 一週內用 Rust 完全重寫#
Bun 核心開發者 Jarred Sumner 在一週內用 Rust 重寫了 Bun 的核心模組,Theo t3.gg 解析背後的意義和社群反應(73K views)。
- 要點 1:Rust 重寫的主要動力:記憶體安全 + 可預測的效能,長期可靠性投資
- 要點 2:JavaScript runtime 的 Rust 化趨勢加速(Deno、Biome 已先行)
- 要點 3:開發者社群關注:效能提升令人興奮,破壞性變更風險需謹慎評估
💡 為什麼重要:Bun 是 Node.js 最有力的競爭者之一。核心 Rust 化是長期穩定的重要信號。
🔗 觀看影片 | 來源: Theo / YouTube
11. Twin brothers wipe 96 government databases minutes after being fired#

雙胞胎兄弟 Muneeb 和 Sohaib Akhter 在被解雇後 5-60 分鐘內對美國政府資料庫執行 DROP DATABASE,刪除 96 個資料庫並下載 1,805 份 EEOC 檔案。兩人均有 2015 年電信詐騙和電腦犯罪前科,被解雇後仍利用未關閉帳號執行攻擊。Muneeb 甚至向 AI 詢問「如何清除 SQL 伺服器日誌」。根本問題:解雇時只停用了 Sohaib 的帳號,Muneeb 的未被及時關閉。
🔗 閱讀原文 | 來源: Ars Technica / Hacker News
12. CI/CD 已死,Agent 需要持續計算#
Namespace 在 AI Engineer 大會論述:傳統 CI/CD 假設人類在寫 PR,現在自主 agent 每分鐘開幾千個,這套架構無法應對。新架構提議:無 PR、基於意圖的驗證,人類審視意圖而非差異(diff)。
🔗 觀看影片 | 來源: AI Engineer (YouTube)
13. Bambu Lab is abusing the open source social contract#

Jeff Geerling 記錄 Bambu Lab 以「模仿/DDoS 風險」為由,對 OrcaSlicer-bambulabs 分支(允許離線列印)發出法律威脅。該分支完全符合 Bambu 自己以 AGPLv3 發佈的代碼。社群反應:相關分支本週在 GitHub Trending 出現 2,878 ⭐,越打壓越有名。
🔗 閱讀原文 | 來源: Jeff Geerling
14. Redis and the Cost of Ambition#

Charles Leifer 深度分析 Redis 從簡單 cache 演變為試圖取代 Postgres、Elasticsearch、Kafka 的代價:身份迷失、功能臃腫、授權亂局(BSD→AGPL 2024),Valkey 分支以「回到原點」的精簡策略吸引 80% 的原始用例。
🔗 閱讀原文 | 來源: Lobste.rs (123 pts)
15. Notion just turned its workspace into a hub for AI agents#

Notion 發佈 Developer Platform:Workers(雲端自訂程式沙盒,免費至 8 月)+ External Agent API。自 2 月以來 Custom Agents 已超過 100 萬個,Claude Code、Cursor、Codex、Decagon 為首批支援的外部 agent。
🔗 閱讀原文 | 來源: TechCrunch
推薦閱讀#

- CSP 白名單實驗工具 — Simon Willison 用 GPT-5.5 開發的 CSP 沙盒工具,在 iframe 中攔截 CSP 錯誤並動態提示允許網域
- The Emacsification of Software — 現代 AI editor 越來越像 Emacs:可無限擴展、高配置門檻、形成文化圍牆(HN 143 pts)
- Astral (ruff/uv) 被 OpenAI 收購 — Python 工具生態重大整合,最受歡迎的 linter 和套件管理工具加入 OpenAI 旗下
- Musk’s xAI 在密西西比運行 50 台未申報燃氣渦輪 — AI 資料中心能源問題再次浮上檯面,環保影響受到監管關注
- Anduril 融資 $5B,估值翻倍至 $61B — 國防 AI 新創在地緣政治緊張背景下迅速擴張
- Geothermal Fervo Energy IPO 首日漲 33% — 地熱清潔能源因 AI 資料中心穩定用電需求重獲資本市場青睞
- Exploring with agents — Amelia Wattenberger — 設計師談 AI agent 的 Intent 層設計原則,Changelog 播客
- vercel-labs/zero-native: Zig 桌面/手機 App 框架 — 本週 3,268 ⭐,Vercel 用 Zig 打造的跨平台框架
- 給你的 Agent 一台電腦(Vercel AI SDK v6) — Agent 獲持久化沙盒和長任務能力,Nico Albanese 演示
- Figma 資料管道升級:從多日延遲至實時 — 日度批次 ETL 轉為實時管道的架構演進
名人動態#
- Andrej Karpathy — 談 LLM 令牌效率:看 GPT-4 把一段長文摘要得如此精準時的那種妒忌感,反映 LLM summarization 能力的快速進步(Bluesky,222 likes)
- Simon Willison — 今日多篇重要帖:Boris Mann agent quote(見 必讀 #1)、LLM 0.32a2(見 必讀 #3)、CSP tool(見 推薦閱讀)
- Paul Graham — 斯德哥爾摩演講:談矽谷為何適合創業,偶然相遇的力量(Y Combinator,13.9K views)
今日觀察#
這週有兩條消息都在說同一件事,只是用不同的物件說。荷蘭政府把官方代碼倉庫搬到了自架 Forgejo,理由是 CLOUD Act 和 FISA 702 讓他們無法保證代碼的主權;Bambu Lab 則以法律手段壓制了一個允許離線列印的開源分支——而那個分支完全符合 AGPLv3 授權。一個是政府選擇自己主控基礎設施,一個是廠商主動收回用戶本來就有的控制權。工具的所有權問題,從代碼到硬體,都在重新成為一個真實的問題。
有意思的是,被 Bambu Lab 施壓的 OrcaSlicer-bambulabs 分支,本週在 GitHub Trending 出現 2,878 ⭐。被打壓的結果,是更多人知道了它的存在。
中文技術圈#

- 我去女兒學校做了一堂 AI 分享課 — V2EX 127 則討論,中小學課堂的 AI 教育實踐,學生的真實反應和老師的顧慮都很接地氣
- 前端失業,有點點迷茫 — 101 則討論,前端開發職位競爭加劇、業界結構性過剩的現實,引發廣泛共鳴
- 有沒有人在使用 Claude API?性價比怎樣? — V2EX 56 則,開發者分享 Claude API 使用體驗與成本比較
- App+1: SilverBullet.md — 把筆記軟體裝進瀏覽器 — 少數派,在地瀏覽器執行的 Markdown PKM 工具,強調用戶資料主權(與今日 Forgejo 主題呼應)
- Schaeffler 攜手多家廠商強化人型機器人生態系 — 科技新報,德商推進人型機器人零件標準化
開源精選 — GitHub Trending(本週)#
vercel-labs/zero-native — Zig | ⭐ 3,268 用 Zig 和 web UI 技術構建桌面和手機應用的框架。Vercel 踏入原生應用開發領域的重要嘗試。
FULU-Foundation/OrcaSlicer-bambulab — C++ | ⭐ 2,878 Bambu Lab 的離線友好 OrcaSlicer 分支。本週受 Bambu Lab 法律施壓後爆炸性增長,直接呼應今日頭條。
Nightmare-Eclipse/YellowKey — ⭐ 955 BitLocker 繞過漏洞 PoC,安全研究人員關注。
HermannBjorgvin/Clawdmeter — C | ⭐ 660 ESP32 桌面儀表板,顯示 Claude Code 使用量。對 Claude Code 用戶有趣的硬體 side project。
alchaincyf/huashu-md-html — CSS | ⭐ 512 Markdown ↔ HTML 雙向流水線,附 4 套反 AI slop 主題,內建 Claude Code skill 整合。
TencentARC/Pixal3D — Python | ⭐ 509 SIGGRAPH 2026 論文:騰訊 Pixel-Aligned 圖像 3D 生成模型。
影音精選#
Anthropic 最終的回應#
132K views · 1 天前 | 頻道: Theo (t3.gg)
Theo 解析 Anthropic 對開發者社群最新動向的回應,結合今日 Ramp 數據(Anthropic 超越 OpenAI 企業客戶數),提供完整的市場定位分析。132K 觀看是本週 AI 社群最高互動之一。
- 與今日 Ramp 數據交叉閱讀效果最佳
- Anthropic API 策略和使用限制是關注焦點
💬 Yii:Theo 的 Anthropic 解讀一向直接不廢話,這支高觀看數背後是開發者對 Claude 定位的真實好奇。
Anthropic 發生了什麼?#
62.6K views · 1 天前 | 頻道: Matthew Berman
分析 Anthropic 股票詐騙警告、公司內部動向和估值。與今日 Ramp 數據配套,構成 Anthropic 市場地位的完整背景圖。
- 詐騙警告:有人在非授權管道售賣 Anthropic 股份
- 估值和 OpenAI 競爭分析
💬 Yii:官方數字 + YouTuber 解析一起看,拼圖更完整。但要注意 Matthew 有時候會誇大戲劇性,資訊要交叉驗證。
停止讓 AI Agent 寫 Markdown#
54.3K views · 1 天前 | 頻道: Theo (t3.gg)
呼籲開發者讓 AI Agent 輸出 HTML 而非 Markdown,有更好的語義、可訪問性和瀏覽器互操作性。當天 Matthew Berman 也發了呼應視頻(「原來 HTML 才是王道」)。
- Karpathy 推文引發的討論
- HTML 的 semantic markup 優勢
💬 Yii:這個討論和 Boris Mann 的 agent 定義問題有點像——我們一直用舊工具做新事情,然後才問「為什麼這樣比較好」。
百萬級獨立 AI Agent 商業課程#
49.5K views · 1 天前 | 頻道: Greg Isenberg
Nick Vasilescu 分享一人 AI Agent 商業的完整路線圖:報價設計、目標產業、客戶獲取、軟體棧(Hermes、Orgo、Composio)、模型選擇,以及如何讓 Agent 管理其他 Agent。
- 不是 hype,是可複製的方法論
- 具體工具棧和收費模式
💬 Yii:2026 年的觀眾要的不是 agent 概念介紹,是「我怎麼用這個賺錢」。這支影片定位在對的地方。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit



