感知 vs 量化
AI 讓你覺得快了 20%,量出來慢了 19%
每天花 1% 的時間,掌握科技脈動。
今日金句#
“The real bottleneck in AI coding is no longer generation, but review, CI/CD, and deployment stability.” 「AI 程式生成已經不是瓶頸了,瓶頸是 code review、CI/CD 和部署穩定性。」 — Mikhail Parakhin, Shopify CTO
“Developers predicted AI would make them 24% faster, and still believed AI had made them about 20% faster afterward. The stopwatch said they were 19% slower.” 「工程師事前預測 AI 讓他們快 24%,事後覺得快了 20%。計時器說,慢了 19%。」 — METR Task Complexity Research, Randomized Controlled Trial (2026)
今日主軸#
今天最有趣的不是新技術發布,而是關於 AI 的「感知落差」現象。
METR 研究用隨機對照試驗(不是問卷)戳破了一個普遍共識:有經驗的工程師在自己的 repo 上使用 AI 工具,覺得快了 20%,但計時器量出來慢了 19%。39% 的感知落差,比任何技術錯誤都難以承認。
同時,Shopify CTO Mikhail Parakhin 說了一件重要的事:現在 AI 程式生成已不再是瓶頸,瓶頸轉移到 code review、CI/CD 和部署穩定性。這和 METR 研究吻合——AI 讓你感覺在動,但大量時間實際上消耗在確認、修正、審查 AI 產出的地方。
另一邊,Qwen3.6-27B 發布了一個真實、可量化的進步:27B 的密集模型超越了前代 397B 的 MoE 模型。55.6GB,可以在本地跑。這是一個感知和實際一致的技術突破。
今天這兩條線指向同一個問題:AI 的邊界,比我們以為的更複雜。
必讀#
- Shopify AI 全面落地:無限 Opus Token 預算、Tangle、SimGym — Latent Space
AI - Qwen3.6-27B:27B 密集模型打趴 397B MoE — Simon Willison
AI - AI 讓工程師感覺快了 20%,量出來慢了 19% — METR Study
AI - Claude Design 真正擅長的是什麼(Figma 還沒死) — Lenny’s Newsletter
Product - Martin Kleppmann 談資料密集型應用設計 — Pragmatic Engineer
Dev - Claude Code 定價混亂:$100/月?Anthropic 快速撤回 — Simon Willison
News - AI 程式碼過度編輯:模型改了不該改的地方 — Research Blog
AI - Google 第八代 TPU:為 Agent 時代設計的兩種晶片 — Google
AI
Shopify AI 全面落地:無限 Opus Token 預算、Tangle、SimGym#

Shopify CTO Mikhail Parakhin 在 Latent Space 播客深度揭露一個 $200B 公司全面押注 AI 的真實現況。幾乎所有工程師都在使用 AI 工具,並且設置了無限 Opus-4.6 Token 預算——不限量,讓工程師沉浸式體驗。
關鍵洞察:AI 程式生成已不再是瓶頸,瓶頸轉移至 code review、CI/CD 和部署穩定性。Shopify 同時展示了三個內部工具:Tangle(ML 試驗管理)、Tangent(AI 代理框架)、SimGym(客戶行為模擬系統)。
- 無限 Token 策略:讓工程師沉浸式體驗 AI,而非節省成本
- 真正的瓶頸已從「生成」轉移到「review 和部署」
- SimGym 讓 AI 模擬真實客戶行為,大幅降低 A/B 測試成本
💡 少見的大型企業真實 AI 落地數據分享——不是 case study,而是 CTO 親自講述轉型中遇到的真實瓶頸與解法。
🔗 閱讀原文 | 來源: Latent Space
Qwen3.6-27B:27B 密集模型打趴 397B MoE#

Qwen 發布 Qwen3.6-27B,27B 參數的密集模型在 coding 智能體任務上超越前代 397B MoE 模型。模型大小 55.6GB,可以用 Ollama 或 llama.cpp 在本地運行,達到旗艦級智能體編碼能力。
Simon Willison 特別點出:這打破了「強大 AI 必須大模型」的假設,本地 AI 的門檻正在快速降低。
- 27B 密集 > 397B MoE(在 coding agent 任務上)——效率的大突破
- 55.6GB,今天可去 HuggingFace 下載,Ollama 一鍵跑起來
- 旗艦級 agentic coding 不再需要 cloud API,隱私和成本問題一次解決
💡 「本地跑旗艦模型」不再是假設,今天就可以試。對於在意隱私、API 成本、或離線使用的開發者,這是具體可行動的突破。
🔗 閱讀原文 | 來源: Simon Willison
AI 讓工程師感覺快了 20%,量出來慢了 19%#

METR 進行了一個隨機對照試驗(RCT)——不是問卷,不是供應商贊助的 benchmark。有經驗的開源貢獻者在自己的 repo 上工作,一半任務開 AI coding 工具,一半不開。
結果:工程師事前預測快 24%,事後覺得快了 20%,停錶測量值是慢了 19%。感知與現實的 39% 落差,揭示一個產業規模的自我欺騙問題。
- RCT 設計(不是問卷)使結果可信度遠高於一般報告
- Review AI 程式碼、重新 prompt、debug AI bug 的時間——這些都算,但不「感覺」像在慢
- 業界投資 AI 工具的決策大量基於開發者情感問卷,而非實測數據
💡 在 AI 生產力敘事充斥整個業界的當下,一個反直覺的 RCT 數據是極罕見的反例。這不是說 AI 無用,而是說自我報告的生產力數據不可靠。
🔗 閱讀原文 | 來源: Dev.to / METR Study
Claude Design 真正擅長的是什麼(Figma 還沒死)#

Claire Vo(Lenny’s Newsletter)深度評測 Claude Design(Opus 4.7 驅動)、GPT Image 2.0 和 Google DESIGN.md。結論:Claude Design 在行銷 Landing Page、投影片設計、創意重新設計上表現最佳;Figma 未死——Claude Design 解決的是「從草圖到互動原型」,而非取代整個設計工作流。
- Claude Design = 最強的「快速原型生成器」,不是 Figma 替代品
- GPT Image 2.0 quality=high 設定下 4K 圖的細節躍進明顯
- 目前最大限制:Token quota 容易在複雜設計中耗盡
💡 第一個真正客觀評測三款 AI 設計工具的從業者報告,對 PM 和設計師有直接參考價值。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
Martin Kleppmann 談資料密集型應用設計#

Pragmatic Engineer 播客與《Designing Data-Intensive Applications》作者 Martin Kleppmann 深談現代資料系統設計。討論 DDIA 出版後資料工程的演變、分散式系統的真實權衡、以及 AI 時代對資料基礎設施的新挑戰。
- DDIA 出版 8 年後,書中描述的分散式問題仍然是業界主要挑戰
- AI 時代的新議題:向量儲存、串流處理和一致性保證的交叉點
- Kleppmann 目前研究:CRDTs 和去中心化協作系統
💡 DDIA 是後端工程師公認必讀書籍,Kleppmann 的播客是直接從作者口中了解 2026 年資料工程現狀的難得機會。
🔗 閱讀原文 | 來源: The Pragmatic Engineer
Claude Code 定價混亂:$100/月?Anthropic 快速撤回#

Anthropic 靜悄悄更新定價頁面,將 Claude Code 限定於 $100/月 Max 方案(原本 $20/月 Pro 就可用)。社群爆炸,HN 和 Reddit 大量討論。幾小時內一位 Head of Growth 發推說「只是 2% 新用戶的小測試」,頁面隨後恢復。
Simon Willison 深度分析:即使是「小測試」,宣傳方式也極不當,且他懷疑「2%」這個說法的準確性。
- Claude Code 暫時從 $20/月 被改為 $100/月 起,幾小時後撤回
- “A tweet from an employee is not the way to make an announcement” — Simon Willison
- Claude Cowork(Claude Code 的「溫和版」)在 $20 方案仍保留,更顯矛盾
💡 這次混亂暴露了 Anthropic 在定價溝通上的問題。「Claude Code 可能變貴」的不確定感已在社群中播種,即使測試已撤回。
🔗 閱讀原文 | 來源: Simon Willison
AI 程式碼過度編輯:模型改了不該改的地方#

你請 AI 修一個 off-by-one 錯誤,它修好了——但同時重寫了整個函數、加了 None check、改了變數名、新增輸入驗證。diff 巨大。這在維護現有程式碼庫(brown-field)中特別有害:測試可能全過,但 code review 工作量暴增,程式碼品質悄悄下降。
研究提出用 RL 訓練讓模型成為更「忠實的編輯者」。
- 過度編輯是「測試看不見的 brown-field 問題」——功能正確,但結構面目全非
- GPT-5.4 和 Claude 3.5 都有明顯過度編輯傾向,Claude 3.5 較少
- RL 訓練可顯著降低過度編輯,同時維持 bug 修復準確率
💡 這解釋了為什麼 AI 輔助程式碼的 code review 如此耗時——不是因為 AI 錯了,而是因為它改了太多不相關的地方。
🔗 閱讀原文 | 來源: Research Blog
Google 第八代 TPU:為 Agent 時代設計#

Google 發布第八代 TPU,針對 Agentic AI 工作負載優化。Gemini Ultra 訓練效率提升 4 倍,推理吞吐量提升 3 倍。設計理念從「最大化單次查詢效能」轉為「最大化 Agent 長時間任務的持久性和效率」。
- TPU v8 推理吞吐量 3x vs v7,訓練效率 4x
- 「Agent 時代」設計意味著優化長時間執行、多步驟推理任務
- 主要競爭對手是 AWS Trainium 3 和 NVIDIA B300
💡 AI 硬體競爭直接影響 API 成本走勢,也預示 Agent 工作負載將成為主流。
🔗 閱讀原文 | 來源: Google Blog
推薦閱讀#

- Firefox 150 + Claude Mythos:AI 輔助修復 271 個安全漏洞 — Mozilla CTO 分享 Firefox 150 與 Claude Mythos Preview 的安全合作,AI 識別並修復了 271 個漏洞。“防守方終於有機會獲勝了。”
- 我不再想要你的 PR 了(開源維護者的告白) — 知名開源維護者說明為何不再接受 PR,以及維護開源專案的現實困境。
- DoorDash 一週上線新國家的模組化架構 — 將國家特定邏輯解耦為獨立模組,讓新國家上線不到一個月,澳洲→紐西蘭幾乎零成本。
- wsl9x: Windows 9x subsystem for Linux — 在 Linux 上重現 Windows 9x 子系統的開源專案,開發者社群 103 個讚。
今日觀察#
METR 的 AI 生產力研究是今天最值得認真看待的一篇。不是因為它告訴我們 AI 沒用,而是因為它揭示了一個系統性的問題:整個業界對 AI coding 工具的投資決策,大量建立在開發者情感問卷上,而非真實量測數據。
在 Shopify 無限 Token 預算、大型企業全面押注 AI 的同時,一個隨機對照試驗告訴我們:感知生產力和實際生產力之間,可能存在系統性的落差。
有趣的是,Shopify CTO 無意間給出了一個方向:用遙測數據量測,讓工程師看到自己的 AI 使用效果,而不是依賴感覺。這比「感覺上快了」要誠實得多。如果你今天要做一件事,可以試著計時——真正計時——你下一次使用 AI coding 工具完成一個任務需要多久。
中文技術圈#

- 全面封禁 Cursor!又一家大廠出手了 — 繼三星和其他企業後,又一家大型科技公司在內部封禁 Cursor AI 編碼工具,理由是資安和智慧財產權疑慮。
- codex 的風評似乎在超過 Claude Code? — V2EX 88 回覆討論串,開發者對比兩款 AI coding 工具在日常使用中的感受。
- iOS 照片備份 App「西瓜備份」上線,直接免費 — 免費 iOS 照片備份工具,V2EX 社群 104 回覆熱議。
- 國內金融大語言模型專案啟動,16家金融業者聯手 — 台灣金融業聯合打造熟悉在地金融法規的 LLM。
- 英特爾 14A 製程首獲重大客戶,特斯拉 Terafab 將採用 — Intel 14A 製程獲特斯拉採用,Intel 代工廠復甦的重要里程碑。
- 電力需求大爆發,GE Vernova 訂單年增 71% — AI 數據中心帶動電力需求暴增,電網與燃氣設備最受益。
開源精選 — GitHub Trending(本週)#
kyegomez/OpenMythos — Python | ⭐ 8,904 Claude Mythos 架構的開源理論重建,從第一原理出發重新構建
browser-use/browser-harness — Python | ⭐ 5,071 能讓 LLM 完成任何任務的自修復瀏覽器框架
alchaincyf/huashu-design — HTML | ⭐ 4,509 Claude Code 的 HTML 原生設計 skill,高保真原型 + 動畫 + 20 設計哲學
tw93/Kami — HTML | ⭐ 2,569 好的內容值得好的排版工具
EvoLinkAI/awesome-gpt-image-2-prompts — Python | ⭐ 1,793 GPT-Image-2 提示詞精選集,含人像、海報、UI mockup、角色設定
OpenCoworkAI/open-codesign — TypeScript | ⭐ 1,278 開源 Claude Design 替代品,一鍵匯入 API key,支援 Claude/GPT/Gemini
影音精選#
Claude just got another superpower…#
645,761 views · 38 小時前 | Fireship
Anthropic 推出 Claude Design,以 Opus 4.7 驅動的設計平台能將 Figma 草圖自動轉換為可互動的生產級 UI、動畫和影片。Fireship 風格的高密度解析,覆蓋 Claude Design 的核心功能和局限性。
- Claude Design 最強:行銷頁、投影片、互動原型
- 目前限制:Token 消耗快、複雜設計一致性問題
- 💬 Claude Design 定位更像是「快速原型」工具,而非完整設計工作流替代品
The future of job roles#
未來五年將誕生百萬計的「代理操作員」職位,精通 MCP、CLI、skills 編寫與代理框架,能跨職能賦予組織 AI 槓桿。軟體工程師角色正在轉型。
- AI agent 時代的新職業:不是寫程式,是「指揮代理」
- 需要技能:MCP 配置、CLI 操作、agent 框架、跨職能協調
- 💬 「代理操作員」聽起來很新,但本質上是把 AI 工具用到極致的工程師
Okay, this unleashed my agent#
6,793 views · 39 小時前 | AI Jason
分析自進化 AI 智能體的實現機制,對比 AutoAgent 與 Hermes/OpenClaw 的差異——後者透過記憶機制讓代理不斷學習進步,每次執行後都更聰明。
- 關鍵差異:靜態 agent vs 有記憶的自我進化 agent
- OpenClaw 讓 agent 從每次任務中提取教訓存入記憶
- 💬 「自我進化的 agent」是當前 agent 框架最有趣的方向
How Stripe Built Their New Website#
6,738 views · 41 小時前 | Y Combinator
Stripe 推翻六年舊網站重新改版,探討何時該進行完整重設計與如何講述品牌故事。透過 Bento Box 設計、AI 生成圖像和互動動畫,打造更現代的用戶體驗。
- 六年舊網站的重建決策過程:什麼時候該砍掉重練
- AI 生成圖像在品牌網站的實際應用方式
- 💬 Stripe 的設計標準一向是業界參考,這次改版值得仔細研究
名人動態#
- Simon Willison — 今日三篇深度文章:Qwen3.6-27B 分析、Claude Code 定價混亂、Firefox Mythos 安全合作。是今天開發者最值得追蹤的技術評論員。
- Fireship — Claude Design 深度評測影片 645K 觀看,是這週 AI 設計工具討論的主要入口。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit

