yii.
← Digest
EP07 · 2026年3月9日 星期一 · 10 min read

人不寫 Code 的時代,工程師做什麼?

Karpathy 讓 AI 一夜跑 100 個實驗、Martin Fowler 定義「Humans on the Loop」新框架、Code Review 被宣判死刑

每天花 1% 的時間,掌握科技脈動。

今日金句#

“Frontier AI research used to be done by meat computers in between eating, sleeping, and synchronizing using sound wave interconnect.” 「前沿 AI 研究以前是肉做的電腦在吃飯睡覺之間做的,偶爾用聲波互連同步一下。」 — Andrej Karpathy, 前 OpenAI/Tesla AI 負責人 · 來源

“The future is ship fast, observe everything, revert faster. Not: review slowly, miss bugs anyway, debug in production.” 「未來是快速發布、觀察一切、更快回滾。不是:慢慢 review、還是漏 bug、在 production debug。」 — Ankit Jain, Aviator CEO · 來源

“By engineering the harness we won’t just get one-off, good enough solutions, we’ll get anti-fragile systems that continuously improve themselves.” 「設計好 harness,我們得到的不只是一次性夠用的方案,而是持續自我進化的反脆弱系統。」 — Kief Morris, Thoughtworks 全球雲端技術專家 · 來源

今日主軸#

今天的科技圈有一個清晰的主軸:人類在 AI 開發流程中的角色正在根本性地改變。不是「AI 取代人」這種老掉牙的敘事,而是一個更精確的轉變——從「人在迴圈中」(in the loop) 到「人在迴圈上」(on the loop)。

Karpathy 的 autoresearch 讓 AI agent 在一台 GPU 上自主跑實驗,人只需要寫 program.md 定義搜索空間,一夜跑完 100 個實驗,短短幾天衝到 8,200 顆星。Martin Fowler 團隊提出了完整的 Why Loop / How Loop 框架,主張工程師應該設計「harness」——測試、spec、品質閘門——而非一行一行 review code。Latent Space 的數據更是驚人:AI 輔助團隊 PR 量翻倍,但 review 時間增加 91%,code review 作為瓶頸已不可持續。

一天之內,三個不同方向的頂級聲音都指向同一個結論:未來的工程師不寫 code,設計規則讓 AI 寫 code。

必讀#

  1. Karpathy autoresearch:AI 自主跑實驗 — GitHub AI
  2. AGI 的終點線一直在移動 — HN AI
  3. LLM 寫作的 35 個壞習慣 — HN AI
  4. Martin Fowler:人與 Agent 的軟體工程迴圈 — TLDR AI
  5. Agent Safehouse:macOS 原生 AI agent 沙箱 — HN AI
  6. 在 Agent 時代重新看待 Literate Programming — HN AI
  7. AI 工程師將是最後一個被取代的職業 — Newsletter AI
  8. LibreOffice Writer 支援 Markdown — HN Tools
  9. Simon Willison:Agentic Engineering 實戰模式 — Bluesky Dev
  10. human.json:用 JSON 證明你是人類 — Lobsters AI
  11. FastMCP 3.1 Code Mode:別再一個一個呼叫工具了 — TLDR AI
  12. OpenAI Codex Security 進入研究預覽 — OpenAI Blog AI
  13. OpenAI vs Anthropic 搶開源開發者 — Simon Willison AI
  14. Code Review 已死:五層信任模型取而代之 — TLDR AI
  15. Cursor Automations:從編輯器進化成 AI 營運平台 — TLDR AI
  16. Cloudflare AI Firewall:LLM 專用防火牆 — TLDR AI

1. Karpathy autoresearch:AI 自主跑實驗#

Karpathy 發布 autoresearch,讓 AI agent 在單一 GPU 上自主修改訓練程式碼、跑 5 分鐘實驗、評估結果、迭代改進,一夜可完成約 100 個實驗。極簡 3 檔架構:prepare.py(固定數據準備)、train.py(agent 唯一可修改的檔案)、program.md(人類寫的實驗指導方針)。

  • 使用 val_bpb(validation bits per byte)作為唯一評估指標,與 vocab size 無關,可公平比較不同架構
  • 8,200+ stars,1,100+ forks,已有社群 fork 支援 macOS/MLX
  • 人的角色是設計搜索空間(寫 program.md),不是跑實驗

💡 為什麼重要:Karpathy 把「AI 做研究」從概念變成任何人都能複製的模板。限制一台 GPU、一個檔案、一個指標、5 分鐘一回合——這個設計模式適用於任何有快速反饋迴圈的領域。

🔗 閱讀原文 | 來源: GitHub

2. AGI 的終點線一直在移動#

深度分析 OpenAI 2018 年章程中的「自我犧牲條款」——承諾若有安全導向的計畫接近 AGI,OpenAI 將停止競爭並協助該計畫。但 Altman 的 AGI 時間線從 2023 年的「~10 年」壓縮到 2026 年的「我們基本上已經造出 AGI 了」,章程條款形同虛設。

  • Arena.ai 排行榜顯示 GPT-5.4 落後 Claude Opus 和 Gemini 3.1 Pro
  • 章程觸發條件(「未來兩年內成功的機率超過一半」)可能已經滿足
  • 三個系統性觀察:天真理想主義 vs 經濟誘因、行銷與行動的落差、AGI 標準滑向 ASI

💡 為什麼重要:這是一個關於 AI 治理可信度的案例研究——安全承諾能否在商業壓力下存活?OpenAI 自己寫的章程提供了具體可測試的基準。

🔗 閱讀原文 | 來源: HN

3. LLM 寫作的 35 個壞習慣#

系統性整理了 6 大類 35 個 LLM 常見寫作模式——用詞、句型、段落結構、語氣、格式、整體構成。設計為可直接加入 system prompt 的 markdown 檔案,告訴 AI「不要這樣寫」。

  • 「Negative Parallelism」(「不是 X — 是 Y」句型)是最容易辨識的 AI 寫作特徵
  • Em-Dash 成癮(AI 每篇用 20+ 個,人類 2-3 個)
  • 單一模式用一次沒問題,問題是多個模式聚集或單一模式重複出現

💡 為什麼重要:AI 生成文字無處不在的時代,識別和避免機械化寫作模式已成關鍵技能。這份清單既幫人類偵測 AI 寫作,也幫 AI 避免自己的預設模式。

🔗 閱讀原文 | 來源: HN

4. Martin Fowler:人與 Agent 的軟體工程迴圈#

提出 Why Loop(想法 ↔ 可運行軟體,人類驅動)和 How Loop(中間產物,agent 可執行)的框架。定義三種互動模式:Humans Outside the Loop(vibe coding)、In the Loop(瓶頸式 review)、On the Loop(推薦——設計引導 agent 的 harness)。

  • 內部程式碼品質仍然重要,因為「LLM 能更快理解和修改乾淨的 code,工作更快、更少打轉」
  • Agentic Flywheel 概念:agent 根據結構化效能信號自動改善 harness,接近反脆弱自我進化系統
  • 來自 Thoughtworks,可能成為企業工程組織的參考模型

💡 為什麼重要:這是迄今最嚴謹的框架,定義軟體團隊如何與 AI agent 協作。核心洞見——人應該設計 harness 而非 review output——解決了 AI 輔助開發的生產力悖論。

🔗 閱讀原文 | 來源: TLDR

5. Agent Safehouse:macOS 原生 AI agent 沙箱#

macOS 原生沙箱工具,使用 kernel 層級 sandbox-exec 搭配 deny-first 存取模型。支援 12+ AI coding agent(Claude Code、Codex、Gemini CLI、Cursor Agent 等)。一個 Bash 腳本安裝,零依賴。

  • 在 kernel 層級阻擋對 SSH 金鑰、AWS 憑證、其他 repo 和個人檔案的存取
  • 可組合規則允許按目錄設定權限(讀寫、唯讀、拒絕)
  • Shell wrapper 函式讓沙箱化自動且透明

💡 為什麼重要:LLM 是概率性的——1% 的災難機率只是時間問題。Agent Safehouse 以零開銷的 kernel 級隔離解決信任問題,讓你安全地給 agent 完全權限。

🔗 閱讀原文 | 來源: HN

6. 在 Agent 時代重新看待 Literate Programming#

Literate programming(程式碼穿插散文敘述)過去因維護負擔過重而不實用,但 AI agent 消除了保持雙重敘述同步的根本勞動。AI 能自動處理 tangling(從散文檔中提取程式碼),把 Org 檔當作 single source of truth。

  • Claude 和 Kimi 等 agent 理解 Org Mode 語法(來自訓練資料)
  • 隨著工程重心從「寫」轉向「讀」,自我文件化的程式碼庫變得更有價值

💡 為什麼重要:當 AI 接管更多程式碼生成,瓶頸轉向人類理解和審查。程式碼庫能像敘事一樣閱讀,因為 agent 能維護以前對人類太繁瑣的散文-程式碼同步。

🔗 閱讀原文 | 來源: HN

7. AI 工程師將是最後一個被取代的職業#

Latent Space 深度分析 AI 工程師的 Jevons Paradox——更好的 AI coding 工具增加對工程師的需求,因為每個其他職業都透過工程師構建的 agent 被自動化。技術趨勢趨同:Code Mode、CLI 取代 MCP、檔案系統取代 RAG、沙箱取代 vision。

  • Citadel 數據顯示軟體工程師職缺隨模型進步回升,其他職業則下降
  • 軟體工程已佔 Claude 使用場景 50% 以上
  • GPT-5.4 在 Artificial Analysis 與 Gemini 3.1 Pro 並列 #1

💡 為什麼重要:捕捉到 AI 工程正在結晶為元職業——自動化所有其他職業的那個職業。2026 年是「知識工作 Agent 年」。

🔗 閱讀原文 | 來源: Latent Space Newsletter

8. LibreOffice Writer 支援 Markdown#

LibreOffice 26.2 新增 Markdown 匯入匯出功能,橋接開發者工作流程(README、docs-as-code)和傳統辦公室文書。效能提升、大型文件處理更快、跨平台相容性增強。

  • 支援超過 120 種語言,數百個 bug 修復
  • 強調用戶控制、開放標準 (ODF)、無訂閱制、無供應商鎖定

💡 為什麼重要:Markdown 支援讓 LibreOffice 成為開發者和非技術利害關係人之間的橋樑,減少格式轉換摩擦。

🔗 閱讀原文 | 來源: HN

9. Simon Willison:Agentic Engineering 實戰模式#

Simon Willison 積極推動「Agentic Engineering」作為描述專業軟體工程師負責任使用 coding agent 的學科名稱。新章節涵蓋 Red/Green TDD for agents 和 agentic manual testing——讓 agent 手動嘗試程式碼以發現自動測試之外的問題。

  • Red/Green TDD 模式強制 agent 實際執行他們寫的程式碼
  • 「Agentic Engineering」正在成為正式學科名稱

💡 為什麼重要:來自最活躍的 AI 工具實踐者之一,這些模式為團隊採用 AI coding agent 提供了實戰指南。

🔗 閱讀原文 | 來源: Bluesky

10. human.json:用 JSON 證明你是人類#

一個輕量級協議(v0.1.1 草案),網站擁有者發布 JSON 檔案宣告人類作者身分,並可為其他人擔保,建立可爬取的信任網路。0-1 跳 = 綠色(直接信任)、2 跳 = 黃色、3+ 跳 = 橘色。

  • 去中心化、無需生物辨識或第三方驗證——只需網站擁有者互相擔保
  • 透過 HTML <link rel='human-json'> 標籤發現,計畫推出瀏覽器擴充功能
  • 1MB 檔案大小限制,URL 使用前綴匹配範圍

💡 為什麼重要:AI 生成內容泛濫時代,human.json 提供了一個去中心化的草根替代方案來驗證人類作者身分——不像 Worldcoin 需要掃虹膜。

🔗 閱讀原文 | 來源: Lobsters

11. FastMCP 3.1 Code Mode:別再一個一個呼叫工具了#

FastMCP 3.1 實現 Code Mode 作為伺服器端轉換——LLM 不再逐一呼叫工具(每次都需要一個來回),而是寫一段 Python 腳本組合多個工具呼叫,中間結果留在沙箱內不進入 context window。

  • Cloudflare 的 Code Mode 用約 1,000 token 的 2 個工具覆蓋 2,500 個 API endpoint
  • 可配置探索(BM25 搜尋、GetSchemas、ListTools、GetTags)搭配四種詳細等級
  • 一行程式碼啟用:transforms=[CodeMode()]

💡 為什麼重要:MCP 擴展性問題的最實際解決方案。當工具從 10 個增長到數百個,把所有 schema 倒入 context 不可行。Code Mode 從根本上改變了架構。

🔗 閱讀原文 | 來源: TLDR

12. OpenAI Codex Security 進入研究預覽#

OpenAI 推出 Codex Security——應用程式安全 agent,可分析上下文以偵測、驗證和修補漏洞,減少誤報。已向 ChatGPT Enterprise、Business 和 Education 用戶開放,首月免費。

  • 與 Anthropic 的 Claude + Mozilla 合作形成安全領域競爭格局
  • AI 找漏洞的成本目前約為攻擊成本的 1/10,但這個優勢不會永遠存在

💡 為什麼重要:AI 安全掃描成為 OpenAI 和 Anthropic 的新競爭戰場。找漏洞比利用漏洞便宜 10 倍——暫時對防守方有利。

🔗 閱讀原文 | 來源: OpenAI Blog

13. OpenAI vs Anthropic 搶開源開發者#

OpenAI 為開源維護者提供 6 個月免費 ChatGPT Pro(月費 $200)+ Codex 存取權,直接回應 Anthropic 2 月 27 日為 5,000+ stars 專案提供免費 Claude Max 的方案。OpenAI 在 Anthropic 宣布後 8 天內就推出對等方案。

  • 開源維護者是生態系統中最有影響力的開發者——他們的工具選擇會影響百萬下游使用者
  • OpenAI 的資格標準較不透明,接受「生態系統重要性」論述

💡 為什麼重要:開發者心佔率的戰略爭奪。類似雲端供應商的免費額度策略(AWS Activate、GCP for Startups),但對象是開源社群。

🔗 閱讀原文 | 來源: Simon Willison

14. Code Review 已死:五層信任模型取而代之#

Aviator CEO Ankit Jain 基於 10,000+ 開發者、1,255 個團隊的數據指出,高 AI 採用率團隊合併 98% 更多 PR,但 review 時間增加 91%。提出五層信任模型取代傳統 code review。

  • 五層模型——競爭生成、確定性護欄、人類定義驗收標準、權限架構、對抗性驗證
  • 核心轉變:從審查 code(下游)到審查 spec(上游)
  • Code review 大約在 2012-2014 年才變得普遍;團隊過去幾十年沒有逐行 review 也能成功交付

💡 為什麼重要:PR review 時間增加 91% 是真正的生產力危機。這篇文章提供了具體的架構框架,讓工程團隊在不手動逐行 review 的情況下維持品質和安全。

🔗 閱讀原文 | 來源: Latent Space

15. Cursor Automations:從編輯器進化成 AI 營運平台#

Cursor 推出 Automations——always-on agent 在雲端沙箱中運行,由事件觸發(Slack、Linear、GitHub PR、PagerDuty、webhooks)或排程(cron)。六個內部用例:安全審查、Agentic Codeowners、事件回應、每週摘要、測試覆蓋率、Bug 分類。

  • Agentic Codeowners 按爆炸半徑、複雜度和基礎設施影響分類 PR 風險,低風險自動批准
  • Rippling 用它每 2 小時整合會議記錄、從 Slack 建立 Jira issue
  • Bugbot 每天觸發數千次,自推出以來已捕獲數百萬個 bug

💡 為什麼重要:Cursor 從 AI code editor 進化成 AI 軟體營運平台,直接解決 AI 生成 code 量超過人類 review 能力的矛盾。

🔗 閱讀原文 | 來源: TLDR

16. Cloudflare AI Firewall:LLM 專用防火牆#

Cloudflare 推出 Firewall for AI——部署在 LLM 應用前方的專用 WAF,掃描每個包含 prompt 的 API 請求。三大核心:速率限制(防止 Model DoS)、敏感資料偵測(掃描回應中的 PII/機密)、Prompt 驗證(對注入可能性評分 1-99)。

  • 解決 OWASP LLM Top 10:Prompt Injection、Model DoS、敏感資訊洩露
  • LLM 獨特地合併了控制面和資料面——傳統安全方法不足以應對

💡 為什麼重要:Cloudflare 定位自己為 AI 應用的預設安全層,如同它成為傳統 Web 應用的預設 WAF/CDN。

🔗 閱讀原文 | 來源: TLDR

社群熱門#

推薦閱讀#

中文技術圈#

開源精選#

elder-plinius/OBLITERATUS — Python | ⭐ 2.4K LLM 越獄 / 安全研究框架

twostraws/SwiftUI-Agent-Skill — ⭐ 1.4K Claude Code / Codex 的 SwiftUI agent 技能

duoan/TorchCode — Jupyter | ⭐ 1.1K LeetCode for PyTorch — 從零實作 softmax、attention、GPT-2

cyxzdev/Uncodixfy — ⭐ 1.1K 讓 GPT 生成非 Codex 風格的 UI

viperrcrypto/Siftly — TypeScript | ⭐ 948 本地 X/Twitter 書籤整理器 + AI 分類 + 心智圖

tanishqkumar/ssd — Python | ⭐ 710 輕量推論引擎,支援 Speculative Speculative Decoding

op7418/Claude-to-IM-skill — TypeScript | ⭐ 640 把 Claude Code / Codex 接到 Telegram、Discord、飛書

TinyAGI/fractals — TypeScript | ⭐ 482 遞迴任務協調器,用於 agent swarm

AlpinDale/parsync — Rust | ⭐ 489 平行 rsync + SSH + 斷點續傳

影音精選#

Mitchell Green:50% 的 VC 不該存在 & 中國會贏 AI 戰爭#

20VC

ByteDance 是最先進的 AI 公司(精華版)#

20VC

給年輕基金經理人的最佳建議#

20VC

大神動態#

今日觀察#

今天看到 tropes.fyi 那份 35 個 LLM 寫作壞習慣的清單,我自己讀了一遍還真的中了好幾個。最明顯的就是 em-dash 成癮——我現在寫東西會下意識地用破折號,因為用太多 AI 生成的文字當底稿了。這份清單最聰明的地方是它設計成可以直接丟進 system prompt 的格式,等於是「反 AI 味」的標準化解決方案。

另一個有意思的是 human.json。在大家都在講 AI 偵測、數位浮水印這些高科技方案的時候,有人提出了最低技術門檻的做法——網站互相擔保,建立信任鏈。很 Web 1.0 的精神,但也許最簡單的方案才是最容易推廣的。

💡 給開發者的啟示:停止把 AI 當作「更快的打字員」。開始思考你的「harness」——定義 agent 行為的測試、spec 和品質閘門。寫好 program.md / CLAUDE.md / spec 檔案比寫好 code 更重要。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有