yii.
← Digest
EP53 · 2026年4月23日 星期四 · 7 min read

感知 vs 量化

AI 讓你覺得快了 20%,量出來慢了 19%

每天花 1% 的時間,掌握科技脈動。


今日金句#

“The real bottleneck in AI coding is no longer generation, but review, CI/CD, and deployment stability.” 「AI 程式生成已經不是瓶頸了,瓶頸是 code review、CI/CD 和部署穩定性。」 — Mikhail Parakhin, Shopify CTO

“Developers predicted AI would make them 24% faster, and still believed AI had made them about 20% faster afterward. The stopwatch said they were 19% slower.” 「工程師事前預測 AI 讓他們快 24%,事後覺得快了 20%。計時器說,慢了 19%。」 — METR Task Complexity Research, Randomized Controlled Trial (2026)


今日主軸#

今天最有趣的不是新技術發布,而是關於 AI 的「感知落差」現象。

METR 研究用隨機對照試驗(不是問卷)戳破了一個普遍共識:有經驗的工程師在自己的 repo 上使用 AI 工具,覺得快了 20%,但計時器量出來慢了 19%。39% 的感知落差,比任何技術錯誤都難以承認。

同時,Shopify CTO Mikhail Parakhin 說了一件重要的事:現在 AI 程式生成已不再是瓶頸,瓶頸轉移到 code review、CI/CD 和部署穩定性。這和 METR 研究吻合——AI 讓你感覺在動,但大量時間實際上消耗在確認、修正、審查 AI 產出的地方。

另一邊,Qwen3.6-27B 發布了一個真實、可量化的進步:27B 的密集模型超越了前代 397B 的 MoE 模型。55.6GB,可以在本地跑。這是一個感知和實際一致的技術突破。

今天這兩條線指向同一個問題:AI 的邊界,比我們以為的更複雜。


必讀#

  1. Shopify AI 全面落地:無限 Opus Token 預算、Tangle、SimGym — Latent Space AI
  2. Qwen3.6-27B:27B 密集模型打趴 397B MoE — Simon Willison AI
  3. AI 讓工程師感覺快了 20%,量出來慢了 19% — METR Study AI
  4. Claude Design 真正擅長的是什麼(Figma 還沒死) — Lenny’s Newsletter Product
  5. Martin Kleppmann 談資料密集型應用設計 — Pragmatic Engineer Dev
  6. Claude Code 定價混亂:$100/月?Anthropic 快速撤回 — Simon Willison News
  7. AI 程式碼過度編輯:模型改了不該改的地方 — Research Blog AI
  8. Google 第八代 TPU:為 Agent 時代設計的兩種晶片 — Google AI

Shopify AI 全面落地:無限 Opus Token 預算、Tangle、SimGym#

Shopify Latent Space

Shopify CTO Mikhail Parakhin 在 Latent Space 播客深度揭露一個 $200B 公司全面押注 AI 的真實現況。幾乎所有工程師都在使用 AI 工具,並且設置了無限 Opus-4.6 Token 預算——不限量,讓工程師沉浸式體驗。

關鍵洞察:AI 程式生成已不再是瓶頸,瓶頸轉移至 code review、CI/CD 和部署穩定性。Shopify 同時展示了三個內部工具:Tangle(ML 試驗管理)、Tangent(AI 代理框架)、SimGym(客戶行為模擬系統)。

  • 無限 Token 策略:讓工程師沉浸式體驗 AI,而非節省成本
  • 真正的瓶頸已從「生成」轉移到「review 和部署」
  • SimGym 讓 AI 模擬真實客戶行為,大幅降低 A/B 測試成本

💡 少見的大型企業真實 AI 落地數據分享——不是 case study,而是 CTO 親自講述轉型中遇到的真實瓶頸與解法。

🔗 閱讀原文 | 來源: Latent Space


Qwen3.6-27B:27B 密集模型打趴 397B MoE#

Qwen3.6-27B

Qwen 發布 Qwen3.6-27B,27B 參數的密集模型在 coding 智能體任務上超越前代 397B MoE 模型。模型大小 55.6GB,可以用 Ollama 或 llama.cpp 在本地運行,達到旗艦級智能體編碼能力。

Simon Willison 特別點出:這打破了「強大 AI 必須大模型」的假設,本地 AI 的門檻正在快速降低。

  • 27B 密集 > 397B MoE(在 coding agent 任務上)——效率的大突破
  • 55.6GB,今天可去 HuggingFace 下載,Ollama 一鍵跑起來
  • 旗艦級 agentic coding 不再需要 cloud API,隱私和成本問題一次解決

💡 「本地跑旗艦模型」不再是假設,今天就可以試。對於在意隱私、API 成本、或離線使用的開發者,這是具體可行動的突破。

🔗 閱讀原文 | 來源: Simon Willison


AI 讓工程師感覺快了 20%,量出來慢了 19%#

METR Study

METR 進行了一個隨機對照試驗(RCT)——不是問卷,不是供應商贊助的 benchmark。有經驗的開源貢獻者在自己的 repo 上工作,一半任務開 AI coding 工具,一半不開。

結果:工程師事前預測快 24%,事後覺得快了 20%,停錶測量值是慢了 19%。感知與現實的 39% 落差,揭示一個產業規模的自我欺騙問題。

  • RCT 設計(不是問卷)使結果可信度遠高於一般報告
  • Review AI 程式碼、重新 prompt、debug AI bug 的時間——這些都算,但不「感覺」像在慢
  • 業界投資 AI 工具的決策大量基於開發者情感問卷,而非實測數據

💡 在 AI 生產力敘事充斥整個業界的當下,一個反直覺的 RCT 數據是極罕見的反例。這不是說 AI 無用,而是說自我報告的生產力數據不可靠。

🔗 閱讀原文 | 來源: Dev.to / METR Study


Claude Design 真正擅長的是什麼(Figma 還沒死)#

Lenny Claude Design

Claire Vo(Lenny’s Newsletter)深度評測 Claude Design(Opus 4.7 驅動)、GPT Image 2.0 和 Google DESIGN.md。結論:Claude Design 在行銷 Landing Page、投影片設計、創意重新設計上表現最佳;Figma 未死——Claude Design 解決的是「從草圖到互動原型」,而非取代整個設計工作流。

  • Claude Design = 最強的「快速原型生成器」,不是 Figma 替代品
  • GPT Image 2.0 quality=high 設定下 4K 圖的細節躍進明顯
  • 目前最大限制:Token quota 容易在複雜設計中耗盡

💡 第一個真正客觀評測三款 AI 設計工具的從業者報告,對 PM 和設計師有直接參考價值。

🔗 閱讀原文 | 來源: Lenny’s Newsletter


Martin Kleppmann 談資料密集型應用設計#

Pragmatic Engineer DDIA

Pragmatic Engineer 播客與《Designing Data-Intensive Applications》作者 Martin Kleppmann 深談現代資料系統設計。討論 DDIA 出版後資料工程的演變、分散式系統的真實權衡、以及 AI 時代對資料基礎設施的新挑戰。

  • DDIA 出版 8 年後,書中描述的分散式問題仍然是業界主要挑戰
  • AI 時代的新議題:向量儲存、串流處理和一致性保證的交叉點
  • Kleppmann 目前研究:CRDTs 和去中心化協作系統

💡 DDIA 是後端工程師公認必讀書籍,Kleppmann 的播客是直接從作者口中了解 2026 年資料工程現狀的難得機會。

🔗 閱讀原文 | 來源: The Pragmatic Engineer


Claude Code 定價混亂:$100/月?Anthropic 快速撤回#

Claude Code Pricing

Anthropic 靜悄悄更新定價頁面,將 Claude Code 限定於 $100/月 Max 方案(原本 $20/月 Pro 就可用)。社群爆炸,HN 和 Reddit 大量討論。幾小時內一位 Head of Growth 發推說「只是 2% 新用戶的小測試」,頁面隨後恢復。

Simon Willison 深度分析:即使是「小測試」,宣傳方式也極不當,且他懷疑「2%」這個說法的準確性。

  • Claude Code 暫時從 $20/月 被改為 $100/月 起,幾小時後撤回
  • “A tweet from an employee is not the way to make an announcement” — Simon Willison
  • Claude Cowork(Claude Code 的「溫和版」)在 $20 方案仍保留,更顯矛盾

💡 這次混亂暴露了 Anthropic 在定價溝通上的問題。「Claude Code 可能變貴」的不確定感已在社群中播種,即使測試已撤回。

🔗 閱讀原文 | 來源: Simon Willison


AI 程式碼過度編輯:模型改了不該改的地方#

Over-editing AI

你請 AI 修一個 off-by-one 錯誤,它修好了——但同時重寫了整個函數、加了 None check、改了變數名、新增輸入驗證。diff 巨大。這在維護現有程式碼庫(brown-field)中特別有害:測試可能全過,但 code review 工作量暴增,程式碼品質悄悄下降。

研究提出用 RL 訓練讓模型成為更「忠實的編輯者」。

  • 過度編輯是「測試看不見的 brown-field 問題」——功能正確,但結構面目全非
  • GPT-5.4 和 Claude 3.5 都有明顯過度編輯傾向,Claude 3.5 較少
  • RL 訓練可顯著降低過度編輯,同時維持 bug 修復準確率

💡 這解釋了為什麼 AI 輔助程式碼的 code review 如此耗時——不是因為 AI 錯了,而是因為它改了太多不相關的地方。

🔗 閱讀原文 | 來源: Research Blog


Google 第八代 TPU:為 Agent 時代設計#

Google TPU 8th gen

Google 發布第八代 TPU,針對 Agentic AI 工作負載優化。Gemini Ultra 訓練效率提升 4 倍,推理吞吐量提升 3 倍。設計理念從「最大化單次查詢效能」轉為「最大化 Agent 長時間任務的持久性和效率」。

  • TPU v8 推理吞吐量 3x vs v7,訓練效率 4x
  • 「Agent 時代」設計意味著優化長時間執行、多步驟推理任務
  • 主要競爭對手是 AWS Trainium 3 和 NVIDIA B300

💡 AI 硬體競爭直接影響 API 成本走勢,也預示 Agent 工作負載將成為主流。

🔗 閱讀原文 | 來源: Google Blog


推薦閱讀#

Firefox Claude Mythos


今日觀察#

METR 的 AI 生產力研究是今天最值得認真看待的一篇。不是因為它告訴我們 AI 沒用,而是因為它揭示了一個系統性的問題:整個業界對 AI coding 工具的投資決策,大量建立在開發者情感問卷上,而非真實量測數據。

在 Shopify 無限 Token 預算、大型企業全面押注 AI 的同時,一個隨機對照試驗告訴我們:感知生產力和實際生產力之間,可能存在系統性的落差。

有趣的是,Shopify CTO 無意間給出了一個方向:用遙測數據量測,讓工程師看到自己的 AI 使用效果,而不是依賴感覺。這比「感覺上快了」要誠實得多。如果你今天要做一件事,可以試著計時——真正計時——你下一次使用 AI coding 工具完成一個任務需要多久。


中文技術圈#

Cursor Ban


開源精選 — GitHub Trending(本週)#

kyegomez/OpenMythos — Python | ⭐ 8,904 Claude Mythos 架構的開源理論重建,從第一原理出發重新構建

browser-use/browser-harness — Python | ⭐ 5,071 能讓 LLM 完成任何任務的自修復瀏覽器框架

alchaincyf/huashu-design — HTML | ⭐ 4,509 Claude Code 的 HTML 原生設計 skill,高保真原型 + 動畫 + 20 設計哲學

tw93/Kami — HTML | ⭐ 2,569 好的內容值得好的排版工具

EvoLinkAI/awesome-gpt-image-2-prompts — Python | ⭐ 1,793 GPT-Image-2 提示詞精選集,含人像、海報、UI mockup、角色設定

OpenCoworkAI/open-codesign — TypeScript | ⭐ 1,278 開源 Claude Design 替代品,一鍵匯入 API key,支援 Claude/GPT/Gemini


影音精選#

Claude just got another superpower…#

Fireship 645,761 views · 38 小時前 | Fireship

Anthropic 推出 Claude Design,以 Opus 4.7 驅動的設計平台能將 Figma 草圖自動轉換為可互動的生產級 UI、動畫和影片。Fireship 風格的高密度解析,覆蓋 Claude Design 的核心功能和局限性。

  • Claude Design 最強:行銷頁、投影片、互動原型
  • 目前限制:Token 消耗快、複雜設計一致性問題
  • 💬 Claude Design 定位更像是「快速原型」工具,而非完整設計工作流替代品

The future of job roles#

20VC future jobs 15,206 views · 45 小時前 | 20VC

未來五年將誕生百萬計的「代理操作員」職位,精通 MCP、CLI、skills 編寫與代理框架,能跨職能賦予組織 AI 槓桿。軟體工程師角色正在轉型。

  • AI agent 時代的新職業:不是寫程式,是「指揮代理」
  • 需要技能:MCP 配置、CLI 操作、agent 框架、跨職能協調
  • 💬 「代理操作員」聽起來很新,但本質上是把 AI 工具用到極致的工程師

Okay, this unleashed my agent#

AI Jason 6,793 views · 39 小時前 | AI Jason

分析自進化 AI 智能體的實現機制,對比 AutoAgent 與 Hermes/OpenClaw 的差異——後者透過記憶機制讓代理不斷學習進步,每次執行後都更聰明。

  • 關鍵差異:靜態 agent vs 有記憶的自我進化 agent
  • OpenClaw 讓 agent 從每次任務中提取教訓存入記憶
  • 💬 「自我進化的 agent」是當前 agent 框架最有趣的方向

How Stripe Built Their New Website#

YC Stripe 6,738 views · 41 小時前 | Y Combinator

Stripe 推翻六年舊網站重新改版,探討何時該進行完整重設計與如何講述品牌故事。透過 Bento Box 設計、AI 生成圖像和互動動畫,打造更現代的用戶體驗。

  • 六年舊網站的重建決策過程:什麼時候該砍掉重練
  • AI 生成圖像在品牌網站的實際應用方式
  • 💬 Stripe 的設計標準一向是業界參考,這次改版值得仔細研究

名人動態#

  • Simon Willison — 今日三篇深度文章:Qwen3.6-27B 分析、Claude Code 定價混亂、Firefox Mythos 安全合作。是今天開發者最值得追蹤的技術評論員。
  • Fireship — Claude Design 深度評測影片 645K 觀看,是這週 AI 設計工具討論的主要入口。

覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有