yii.
← Digest
EP38 · 2026年4月8日 星期三 · 8 min read

轉向

DHH 六個月後全面擁抱 Agent 開發;Meta 推出首個前沿模型 Muse Spark;OpenAI 100 萬行程式碼零人工審查

每天花 1% 的時間,掌握科技脈動。

今日金句#

“Running several AI agents feels less like project management and more like wearing a mech suit.” 「同時跑幾個 AI Agent,感覺不像在管專案,更像穿著一套機甲在工作。」 — David Heinemeier Hansson (DHH), Ruby on Rails 發明人

“Everyone likes using AI tools to try doing someone else’s profession. They’re much less keen when someone else uses AI to do theirs.” 「人人都喜歡用 AI 工具去試試別人的職業。但換成別人用 AI 來做他們自己的工作,就不那麼感興趣了。」 — Giles Turnbull, 作家 / UX 研究員

今日主軸#

今天的科技圈有一個貫穿所有頭條的主題:轉向。DHH——Ruby on Rails 的發明人、半年前最有名的 AI 懷疑者——在 The Pragmatic Engineer 上坦承,他已全面採用 agent-first 開發:tmux 同時開著 Gemini 2.5 和 Claude Opus,neovim 審 diff,感覺「像穿了機甲工作」。他指出資深工程師從 AI 獲益遠超初階工程師——因為 AI 是放大器,放大的是你已經有的判斷力。同一天,Meta 把旗下 AI 研究部門改名為「超智能實驗室」,推出首個可和 Claude、Gemini 正面競爭的前沿模型 Muse Spark——關鍵是比上一代模型用了少 10 倍的算力。Latent Space 則揭露 OpenAI Frontier 小組已在跑一個「暗工廠」:100 萬行程式碼、每天消耗 10 億 Token、完全沒有人工審查。PostHog 分享把 Agent 當成主要介面、重建了兩次 MCP 架構後的工程法則。今天的問題不是 AI 夠不夠強,而是:你的工作流,什麼時候要轉向?

必讀#

  1. DHH’s new way of writing code — The Pragmatic Engineer Dev
  2. The golden rules of agent-first product engineering — PostHog Dev
  3. Meta’s new model is Muse Spark, and meta.ai chat has some interesting tools — Simon Willison AI
  4. [AINews] Meta Superintelligence Labs announces Muse Spark — Latent Space AI
  5. Extreme Harness Engineering: 1M LOC, 1B toks/day, 0% human code — Latent Space AI
  6. [AINews] Anthropic @ $30B ARR, Project GlassWing and Claude Mythos Preview — Latent Space AI
  7. GLM-5.1: Towards Long-Horizon Tasks — Simon Willison AI
  8. Anthropic’s Project Glasswing — restricting Claude Mythos to security researchers — Simon Willison AI
  9. Git commands I run before reading any code — Hacker News Dev
  10. How Spotify Ships to 675 Million Users Every Week Without Breaking Things — ByteByteGo Dev
  11. I built a custom Slack inbox. It was easier than you’d think — Lenny’s Newsletter Tools
  12. I ported Mac OS X to the Nintendo Wii — Hacker News Dev
  13. Quoting Giles Turnbull — Simon Willison News
  14. Cycles of disruption in the tech industry: Kent Beck and Martin Fowler — Pragmatic Engineer Dev
  15. A visual guide to getting out of a creative slump — Lenny’s Newsletter Tutorial

DHH’s new way of writing code#

DHH Pragmatic Engineer

DHH(Ruby on Rails 發明人)半年前是最著名的 AI coding 懷疑論者,今天在 The Pragmatic Engineer 上坦承已全面採用 agent-first 開發。他的工作流:tmux 同時開著 Gemini 2.5(快速回應)和 Claude Opus(深度推理),用 neovim + Lazygit 審查 diff。

  • 資深工程師比初階工程師從 AI 獲益更多——AI 是放大器,放大已有的判斷力
  • 37signals 的 Shape Up 兩個月開發週期需要重新評估——AI 讓時間線感覺太慢
  • Rails 的完善測試和靜態型別等特性讓它在 AI 時代有文藝復興的機會

💡 為什麼重要:當最頑固的批評者改變立場,這不是個人偏好,而是 agent-first 工作流已到達臨界點的信號。

🔗 閱讀原文 | 來源: The Pragmatic Engineer


The golden rules of agent-first product engineering#

PostHog agent-first

PostHog 花了一年重建了兩次 MCP 架構,讓 Agent 和 MCP 每日活躍用戶達 6,000+。核心法則:Agent 必須擁有與人類用戶一樣的能力邊界,API 設計要符合 Agent 的語意抽象層(如 SQL 而非 CRUD),要前置注入所有 session 都需要的通用 context。

  • 如果 Agent 做不到的事人類可以做,你的 Agent 體驗永遠有上限
  • 把技能(skill)寫成新員工的 onboarding 文件——只給 Agent 自己無法探索的 context
  • 把 Agent 當真實用戶對待:dogfooding、trace review、從觀察中建立 evals

💡 為什麼重要:這是第一批真正在生產環境大規模運行 Agent 的團隊整理出的工程法則,比理論文章更有參考價值。

🔗 閱讀原文 | 來源: PostHog Newsletter


Meta’s new model is Muse Spark (Simon Willison)#

Muse Spark

Meta 正式進入前沿模型競爭。Muse Spark 有 Instant 和 Thinking 兩種模式,在 Artificial Analysis 排行榜上得 52 分。Meta 宣稱比上一代少用 10 倍算力達到相當能力。meta.ai 整合了 16 種工具,包括網搜、Instagram/Threads/Facebook 內容搜尋、視覺定位(疑似使用 Segment Anything Model 2)。

  • 比上一代模型少 10 倍算力實現同等能力——效率突破
  • meta.ai 工具整合包含第一方社群內容搜尋(Reels、Threads、Facebook 帖)
  • API 預覽版本開放中;未來 Contemplating 模式對標 Gemini Deep Think

💡 為什麼重要:Meta 從 Llama 開源追趕策略轉向正面競爭前沿模型,改名「超智能實驗室」並非行銷噱頭。

🔗 閱讀原文 | 來源: Simon Willison


[AINews] Meta Superintelligence Labs + Muse Spark#

Latent Space Meta

Meta 把 FAIR 整合進 Gen AI 組,改名 Meta Superintelligence Labs,由 Yann LeCun 和 Alexandr Wang 領導。Muse Spark 的 API 已進入私人預覽,整合第一方 Meta 社群資料是獨特差異化。Alexandr Wang 表示「更大的模型已在開發中,基礎設施正在擴展」。

  • Meta Superintelligence Labs = FAIR + Gen AI 合并,加速前沿佈局
  • Muse Spark API 私人預覽,整合第一方 Meta 社群資料為獨特優勢
  • Contemplating 模式(強化推理)即將推出

💡 為什麼重要:Meta 的組織重組代表 AI 前沿競爭進入三強格局與 OpenAI 的正面交鋒。

🔗 閱讀原文 | 來源: Latent Space AINews


Extreme Harness Engineering: 1M LOC, 1B toks/day, 0% human code#

OpenAI Harness Engineering

Latent Space 專訪 OpenAI Frontier 團隊負責人 Ryan Lopopolo,揭露他們花五個月建立了超過 100 萬行純 AI 生成的程式碼庫,每天消耗 10 億 Token(約 $2-3K),沒有任何人工 pre-merge 審查。「Harness Engineering」讓 reasoning model 主導 workflow,而非用預設腳本框住 AI。

  • 100 萬行程式碼、0% 人工撰寫、0% pre-merge 人工審查——五個月完成
  • 「暗工廠」模式:當 Agent 失敗,問「缺少什麼能力/context/結構?」而非要求「再試一次」
  • 1B tokens/day = 約 $2-3K——可量化、可推廣的規模

💡 為什麼重要:這可能是軟體工程史上最激進的 AI-native 生產實驗,「程式設計師」的定義需要根本性重新思考。

🔗 閱讀原文 | 來源: Latent Space


Anthropic $30B ARR + Claude Mythos Preview#

Anthropic GlassWing

Anthropic 從 3 月的 $19B ARR 跳到 4 月的 $30B ARR,增速驚人。Claude Mythos Preview 被稱為「GPT-2 以來第一個因太危險而不公開發布的模型」——能力包括寫出真實可部署的漏洞利用程式碼,且具備策略性規劃和情境感知。

  • $19B → $30B ARR,一個月內 $11B 增長
  • 超過 10 兆參數,漏洞發現能力超越頂尖人類安全研究員
  • Project Glasswing 限制發放——只對 40 個審查合作夥伴開放,含 $100M 模型額度

💡 為什麼重要:Anthropic 用行動證明 AI 安全和商業成功可以並存:限制最危險的模型,同時營收創歷史新高。

🔗 閱讀原文 | 來源: Latent Space AINews


GLM-5.1: Towards Long-Horizon Tasks#

GLM-5.1

中國 Z.ai 釋出 754B 參數的 GLM-5.1(MIT 授權,1.51TB,HuggingFace 可下載,OpenRouter 可用)。Simon Willison 測試發現模型展現「湧現行為」:要求生成 SVG,模型主動回傳包含 SVG + CSS 動畫的完整 HTML 頁面,並能自行診斷和修復動畫 bug。

  • 754B 參數,MIT 授權,完全開源,無使用限制
  • 展現自主創意——未被要求的 CSS 動畫生成
  • 自我偵錯能力——正確診斷 CSS transform override 問題

💡 為什麼重要:開源前沿模型正在逼近甚至匹配專有模型的自主推理和創意程式碼能力,且任何人都可以本地部署、微調和商業使用。

🔗 閱讀原文 | 來源: Simon Willison


Anthropic’s Project Glasswing#

Project Glasswing

Simon Willison 分析 Project Glasswing,認為限制 Claude Mythos 的決定「對我來說是必要的」。Mythos 在 Firefox JS 引擎上跑出 181 個可用漏洞利用(Opus 4.6 只有 2 個)。已發現的漏洞包括:27 年的 OpenBSD TCP SACK 漏洞、macOS/Windows/Linux 核心提權,還有 16 年的 FFmpeg 漏洞(被跑了 500 萬次模糊測試沒被抓到)。

  • Mythos vs Opus 4.6:181 vs 2 個可用漏洞利用(Firefox JS 引擎)
  • 安全社群共識:主要開源維護者確認 AI 漏洞發現威脅是真實的
  • Simon Willison 的立場:限制發布是正確的,但需要更透明的評估標準

💡 為什麼重要:這是業界第一次有公開的、可量化的證據表明前沿 AI 模型在網路安全上超越最頂尖人類,為 AI 雙用途能力治理設立了重要先例。

🔗 閱讀原文 | 來源: Simon Willison


Git commands I run before reading any code#

Git commands

Hacker News 今日熱門。作者整理了 5 個 git 指令,幫助工程師在閱讀任何程式碼之前先了解倉庫的歷史健康狀況:churn analysis(最常修改的檔案 = bug 聚集地)、bus factor 偵測(誰貢獻超過 60% commit)、bug clustering、commit velocity 趨勢。

  • Churn analysis:git log --format=format: --name-only --since="1 year ago" | sort | uniq -c | sort -nr | head -20
  • Bus factor:git shortlog -sn --no-merges | head -5(第一名超過 60% = 危險信號)
  • Bug clustering:grep commit messages for fix/bug/broken,對比 churn hotspot

💡 為什麼重要:Git 歷史是程式碼庫最誠實的日記。這些指令讓你在讀第一行程式碼之前就知道哪裡是雷區,對接手遺留系統尤其實用。

🔗 閱讀原文 | 來源: Hacker News


How Spotify Ships to 675 Million Users Every Week#

Spotify deployment

每週 Spotify 打包數十個工程團隊的數百個程式碼更改,推送給 6.75 億用戶——95%+ 的發布順利完成。關鍵是 trunk-based development(無長期 feature branch)+ 兩週發布週期 + 多層自動化測試,先在 1,000 位 Spotify 員工 dogfood,然後 1% 漸進 rollout。

  • Trunk-based development:所有工程師提交到同一個 main branch,保持整合問題小
  • 兩週發布週期:從 merge 到觸達 100% 用戶需要完整的兩週,含多個驗證關卡
  • 95%+ 無縫發布率——靠的不是「測試更嚴格」,而是把速度和安全設計成相互強化

💡 為什麼重要:Spotify 反直覺地說明了高速度和高可靠性可以同時優化,對想要提高部署頻率的團隊有直接參考價值。

🔗 閱讀原文 | 來源: ByteByteGo


I built a custom Slack inbox. It was easier than you’d think — Clay 教育負責人 Yash Tekriwal 分享如何用 AI 工具將 150+ 日常通知智能分類,展示微自動化和生產力自動化的未來。

I ported Mac OS X to the Nintendo Wii — 在 Wii 上跑 Mac OS X 的瘋狂工程挑戰,包含完整技術細節。

Quoting Giles Turnbull — Simon Willison 引用的一句話深刻點出 AI 採用的認知偏差:人人都喜歡用 AI 做別人的工作,但換成別人用 AI 做他們的工作,就不那麼感興趣了。

Cycles of disruption in the tech industry: Kent Beck and Martin Fowler — XP/TDD 之父與《重構》作者對談 AI 時代的軟體開發,指出 AI 衝擊量級「和以前任何技術轉移完全不同」。

A visual guide to getting out of a creative slump — 視覺化指南幫助創意低潮時找回動力,實用且有美感。

推薦閱讀#

SQLite WAL

中文技術圈#

少數派 GLM-5.1

開源精選#

mempalace — Python | ⭐ 27.6K 史上評分最高的 AI 記憶系統,免費開源

career-ops — JavaScript | ⭐ 24.6K AI 驅動求職系統,基於 Claude Code,14 種技能模式,Go 儀表板,PDF 生成,批量處理

graphify — Python | ⭐ 13.0K 將任何資料夾的程式碼/文件/圖片轉為可查詢知識圖譜

caveman — Python | ⭐ 7.6K Claude Code 技能:用原始人說話省下 65% token

nuwa-skill — Python | ⭐ 3.9K 蒸餾任何人的思維方式——心智模型、決策啟發式、表達 DNA

tailslayer — C++ | ⭐ 1.4K 減少 RAM 讀取尾延遲的 library

parlor — HTML | ⭐ 1.1K 本機即時多模態 AI,Gemma 4 E2B + Kokoro 語音

paper2code — Python | ⭐ 748 Agent 技能:將 arXiv 論文自動轉為可運行的實作

影音精選#

Google just casually disrupted the open-source AI narrative…#

Fireship thumbnail

367.6K views · 1 天前 | Fireship

Google 釋出 Gemma 4,真正開源授權、可在消費級 GPU 甚至手機上運行,卻達到與大型模型競爭的能力。

  • Gemma 4 採用真正的開源授權,無商業使用限制
  • 可在 Raspberry Pi 和手機上運行,大幅降低 AI 部署門檻
  • 💬 Fireship 一貫犀利的分析,這支影片代表開源 AI 生態正式成為主流選項

Claude Mythos and the end of software#

Theo thumbnail

163.3K views · 2 天前 | Theo (t3.gg)

Theo 深度討論 Claude Mythos 的影響,以及 AI 是否真的讓傳統軟體開發走向終結。

  • 結合 Glasswing 事件探討 AI 能力的爆炸性增長
  • Theo 的直率觀點:「軟體終結」是誇大還是真實趨勢的正面交鋒
  • 💬 配合今日 DHH 轉向的主題一起看,前後對照很有趣

Demis Hassabis: Why AGI is Bigger than the Industrial Revolution#

20VC thumbnail

66.4K views · 3 天前 | 20VC

DeepMind CEO Demis Hassabis 解釋為何 AGI 的到來將帶來遠超工業革命的變革,以及 AI 產業當前的主要突破和瓶頸。

  • Hassabis 分析現代 AI 產業的主要突破貢獻者
  • 探討 AGI 時代的人機協作模式
  • 💬 來自最接近 AGI 的人的第一手觀點,值得仔細聽

名人動態#

今日觀察#

今天有一個值得記錄的悖論。DHH 轉向的同一天,Giles Turnbull 說了一句很精準的話:「人人都喜歡用 AI 去嘗試別人的職業,但當別人用 AI 來做他們自己的工作時,就不那麼感興趣了。」兩件事放在一起很有趣:DHH 的轉向是從「AI 讓工程師變笨」到「AI 是我的機甲」,這個心態轉換不是因為 AI 本身變了,而是他自己的視角變了——從「威脅別人的工具」到「放大自己的工具」。Giles 的觀察揭示了一個很普遍的認知偏差:我們對 AI 的接受度,往往和「AI 幫助的是誰」直接相關。這不是技術問題,是人的問題。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有