模型大戰與工具反思
今天三大模型同日登場,AI 工具的消化問題才是真正的戰場
每天花 1% 的時間,掌握科技脈動。
今日金句#
“devs are purposefully burning tokens (and money!) to inflate their AI usage and hit AI usage metrics which they treat as targets” 「工程師們正在故意燒 token(和錢!),讓他們的 AI 使用量數字好看,只因為那些數字被當成目標。」 — Gergely Orosz, Editor, The Pragmatic Engineer
“basically 4.7-low is strictly better than 4.6-medium, 4.7-medium is strictly better than 4.6-high, 4.7-high is now better than 4.6-max” 「4.7-low 嚴格優於 4.6-medium,4.7-medium 嚴格優於 4.6-high,4.7-high 現在優於 4.6-max」 — Latent Space AINews, 技術分析
今日主軸#
今天是一個少見的「三路大戰」日:Anthropic 發布 Claude Opus 4.7,OpenAI 同天升級 Codex 桌面 Agent,Alibaba 釋出 Qwen3.6-35B-A3B 開源模型,並在部分任務上打敗了前兩者。這場軍備競賽的速度,已經跑得比企業組織的消化速度快太多——The Pragmatic Engineer 揭露的 Tokenmaxxing 現象正好說明了這件事:當公司把 AI 使用量當成 KPI,工程師就開始想辦法讓數字好看,而不是讓工作更有效。Opus 4.7 的核心突破不只是功能提升,而是效率重構——更低的 token 使用量換來更高的推理能力。但更耐人尋味的問題是:當每個 token 都要花真錢,我們是否準備好了用 AI 解決真正的問題,而不只是跑指標?
必讀#
- Claude Opus 4.7 — Anthropic
AI - Tokenmaxxing:AI 使用量指標正在被刷數字 — Pragmatic Engineer
Dev - Qwen3.6-35B-A3B 正式發布:Agentic Coding 開放所有人 — Alibaba Qwen
AI - 本地 Qwen3.6 在 MacBook Pro 上打敗 Claude Opus 4.7 — Simon Willison
AI - Apple 開發者生態正在向平均值回歸 — John Gruber
Mobile - RIP Pull Requests (2005-2026) — Latent Space
Dev - 未來一切都是謊言?Kyle Kingsbury 的 AI 反思 — Kyle Kingsbury
AI - Android CLI:用任何 Agent 構建 Android App 快 3 倍 — Google Android
Mobile
Claude Opus 4.7#

Anthropic 發布 Claude Opus 4.7,在所有能力維度上嚴格優於 4.6:4.7-low 的表現直接超越 4.6-medium,整個能力階梯向上提升一級。新增 xhigh 思考模式,SWE-Bench Pro 提升 11 分至 64.3%,SWE-Bench Verified 提升 7 分至 87.6%。視覺能力大幅升級,支援最高 2,576 像素(3.75MP)圖片,是前代 3 倍以上。儘管新分詞器增加 1.0–1.35 倍 token 數量,整體推理效率提升使等效任務的 token 使用量下降最多 50%,實際成本持平甚至更低。
- 能力階梯全面升級:4.7-low > 4.6-medium,4.7-medium > 4.6-high,4.7-high > 4.6-max
- 視覺升級:支援 3.75MP 圖片(前代 1MP),適合 computer-use agent 和高解析度截圖分析
- 成本效率:等效任務 token 成本下降最多 50%;定價維持 $5/$25 per 1M tokens
- 注意:新分詞器讓模型更字面執行指令,需重新調整提示詞
💡 為什麼重要:效率與能力同步提升,對大量使用 Claude Code 或 API 的開發者而言,這是一個明顯的升級信號。企業可以在不增加預算的情況下獲得更好的推理品質。
🔗 閱讀原文 | 來源: Anthropic
Tokenmaxxing:AI 使用量指標正在被刷數字#

The Pragmatic Engineer 揭露了「Tokenmaxxing」趨勢:Meta、Microsoft、Salesforce 等大公司的工程師,正在故意燒 token 和金錢,以達成管理層設定的 AI 使用量 KPI 目標。Uber 在今年三個月內燒完了全年的 AI token 預算。與此同時,Anthropic 正在結束對企業計畫的補貼,將實際成本轉移給各部門。
- Tokenmaxxing = 工程師為達 AI 使用量 KPI 而故意浪費 token,是典型的 Goodhart’s Law
- Uber 案例:三個月燒完全年 AI token 預算,說明成本規模問題開始顯現
- 補貼結束:Anthropic 縮減企業補貼,企業必須用實際 ROI 評估 AI 投入
- Vercel 開源 agent factories 工具;Cal.com 閉源(原因存疑,可能是商業決策)
💡 為什麼重要:當補貼消失,每個 token 都要付出真實費用,組織的 AI 採用策略將被迫從「有沒有用 AI」轉向「AI 創造了什麼價值」。現在建立 ROI 框架的團隊將在下一輪預算討論中佔優勢。
🔗 閱讀原文 | 來源: The Pragmatic Engineer
Qwen3.6-35B-A3B 正式發布:Agentic Coding 開放所有人#

Alibaba Qwen 團隊發布 Qwen3.6-35B-A3B,MoE 架構:35B 總參數但只有 3B active,在 SWE-Bench Verified 達到 73.4%,Terminal-Bench 2.0 達到 51.5%。儘管 active 參數只有 3B,仍然超越許多更大的 dense 模型(Gemma4-31B 只有 52%)。支援多模態視覺語言、256K context window,完全開放原始碼。
- MoE 架構:35B 參數但只有 3B active,MacBook Pro M5 可本地運行
- SWE-Bench Verified 73.4%,超越 Gemma4-31B(52%),SWE-Bench Pro 49.5%
- 立即可用:從 HuggingFace Unsloth 下載量化 GGUF(約 21GB),LM Studio 直接使用
- 支援思考/非思考模式切換,適合不同精度需求
💡 為什麼重要:企業級 agentic coding 能力不再需要依賴商業 API。敏感程式碼庫的開發者可以在本地跑競爭力相當的模型,同時完全控制資料隱私。
🔗 閱讀原文 | 來源: Alibaba Qwen
本地 Qwen3.6 在 MacBook Pro M5 上打敗 Claude Opus 4.7#

Simon Willison 在 Claude Opus 4.7 發布當天進行了即時比較:使用 Unsloth 的 20.9GB 量化版 Qwen3.6-35B-A3B(Q4_K_S.gguf),透過 LM Studio 在 MacBook Pro M5 上運行,對決 Anthropic 新旗艦 Opus 4.7 進行 SVG 生成比較。Qwen 贏得「騎腳踏車的鵜鶘」和「騎獨輪車的火烈鳥」兩項創意測試,Opus 4.7 在腳踏車車架的空間推理上出現明顯錯誤,即使啟用 thinking_level: max 也沒有改善。
- 量化模型(20.9GB)在 M5 Mac 本地運行,對決旗艦商業 API
- 創意 SVG 生成:Qwen 明顯勝出,Opus 4.7 有空間推理失誤
- 不代表所有任務表現,但說明特定工作負載上開源已與商業模型齊平
💡 為什麼重要:這是一個「前哨信號」:當本地量化模型在具體任務上勝過最新旗艦,企業 AI 策略需要開始認真評估混合部署方案。
🔗 閱讀原文 | 來源: Simon Willison
Apple 開發者生態正在向平均值回歸#

John Gruber 在 Daring Fireball 深入分析:Apple 平台優勢正在消退,根本原因不是 Android 軟體變好,而是越來越少的開發者有動力為 Apple 平台打造精良的原生 app。財務誘因減少加上 AI 工具讓跨平台開發門檻降低,導致 iOS/macOS 獨特的軟體優勢正在「向平均值回歸」。
- Apple 優勢的侵蝕不來自競爭,而來自生態系統的自我萎縮
- AI 工具降低了打造高品質原生 app 的財務和藝術激勵
- 對 Flutter/跨平台開發者是長期利多:平台壁壘在下降
💡 為什麼重要:如果 iOS 的原生品質優勢縮小,跨平台開發(Flutter、React Native)的長期競爭力將進一步增強。
🔗 閱讀原文 | 來源: John Gruber / Daring Fireball
RIP Pull Requests (2005-2026)#

GitHub 首次允許 repo 完全停用 Pull Request 功能(之前只能停用 Issues)。Latent Space AINews 深度分析 PR 消亡趨勢:生成式 AI 讓傳統 PR 工作流不再適合——merge conflicts、難以 review AI 程式碼、安全疑慮。Pete Steinberger 和 Theo 主張改用「Prompt Requests」;Mitchell Hashimoto 開發了基於信譽的貢獻系統。
- GitHub 歷史性突破:首次讓 repo 完全停用 PR
- Prompt Requests(描述目標而非程式碼)和信譽制是兩種主要替代方向
- Cloudflare Project Think = 持久化 agent + 子 agent + 沙箱 TypeScript 執行
- OpenAI Agents SDK 開源,分離 orchestration 和 compute
💡 為什麼重要:軟體開發的基本工作流正在被重寫。現在評估 Prompt Requests、agent-native CI/CD 的團隊將在 2026-2027 的開發工具選型中更有準備。
🔗 閱讀原文 | 來源: Latent Space AINews
未來一切都是謊言?Kyle Kingsbury 的 AI 反思#

Jepsen 作者 Kyle Kingsbury 深度長文,類比汽車對城市的影響分析 AI:LLM 輔助降低了人類獨立解決困難問題的能力(metis/具身知識)。「AI slop」洪水——LLM 生成的垃圾內容、AI 代答的客服——正在侵蝕公共信息可信度。引入「Meat shields」概念:公司將雇用人類作為 AI 系統的問責替代品。
- AI 的第二階效應 = 技能侵蝕(依賴 AI → 無法獨立解決複雜問題)
- AI slop 正在污染搜索、客服、公共信息生態系統
- Meat shields = 公司雇用人類作為 AI 系統出錯時的合法責任轉移目標
- 結論:2026 年的可能未來比 2022 年寬廣得多,但大多數都不樂觀
💡 為什麼重要:這是今年最值得閱讀的 AI 反思文章之一,來自業界最嚴格的分散式系統分析師。文中的 metis(具身知識)概念值得每個依賴 AI 工具的開發者深思。
🔗 閱讀原文 | 來源: Kyle Kingsbury (aphyr)
Android CLI:用任何 Agent 構建 Android App 快 3 倍#

Google 發布 Android CLI,專為 AI Agent 優化的 Android 開發介面。實測:相比標準工具集,LLM token 使用量減少超過 70%,任務完成速度提升 3 倍。核心功能:Android Skills(SKILL.md 格式的最佳實踐指令集,自動觸發適配 Navigation 3、AGP 9 遷移等)、Android Knowledge Base(即時更新的官方文件,解決 LLM 訓練截止日期問題)。
- token 使用量減少 70% + 任務速度提升 3 倍 vs 標準工具集
- Android Skills 將 tribal knowledge 編碼成可自動觸發的最佳實踐
- Knowledge Base 讓 agent 使用最新 API 文件,不受訓練截止日期限制
💡 為什麼重要:對 Android 或 Flutter 開發者而言,這是一個立即可用的生產力工具。SDK 設計的未來受眾是 AI agent,而不只是人類開發者。
🔗 閱讀原文 | 來源: Google Android
推薦閱讀#

- OpenAI Codex for almost everything — OpenAI 升級 Codex,擴展桌面 agent 能力直接與 Claude Code 競爭。開發者社群激烈討論這場 coding agent 大戰。
- Physical Intelligence π0.7:能自學新任務的機器人腦 — π0.7 機器人基礎模型可以自學從未被明確教導的任務,Sequoia 新 70 億美元 AI 基金投資。
- Cloudflare AI Platform:為 Agent 設計的推理層 — 統一 70+ 模型、12+ 提供商的單一 API,支援自動故障轉移。Replicate 團隊合併帶來 Cog 容器化,企業可封裝自己的微調模型。
- AI 輔助降低堅持度,損害獨立表現 — arXiv 研究:AI 輔助雖然提高短期產出,但顯著降低用戶在困難問題上的堅持度,與 Kyle Kingsbury 的 metis 侵蝕論高度呼應。
- Factory 以 15 億美元估值打造企業 AI coding — 獲 Khosla Ventures 領投 1.5 億美元,估值 15 億美元。企業 AI agent 市場資本化速度加快。
- AI cybersecurity 不是工作量證明 — Redis 創始人 antirez 分析:發現真實漏洞是「智力門檻」而非「算力門檻」。安全 AI 軍備競賽是模型品質競賽,不是算力競賽。
- 阮一峰科技週刊 393:腦腐狀態 — 「腦腐」現象分析:短視頻損害深度思考能力。同期討論:大模型「權重」是否有版權?
今日觀察#
今天最值得深思的並列:Anthropic 和 OpenAI 同天發布了競爭中的旗艦 coding agent 工具,而 Alibaba 的開源模型在同一天用一台 MacBook Pro 打敗了前者。這三件事同時發生,說明模型的「護城河」在快速縮短。更有趣的是 Tokenmaxxing 現象所揭示的悖論:AI 工具的能力在增強,但組織使用 AI 的方式卻在退化——不是因為技術不夠,而是因為激勵結構出了問題。Goodhart’s Law 在 AI 時代似乎更加有效:當「AI 使用量」成為目標,它就不再是衡量 AI 價值的有效指標了。補貼結束的那天,才是各公司真正面對 AI ROI 問題的開始。
社群熱門#
- codeburn — Claude Code token 費用視覺化儀表板 — 本週 GitHub 上增速最快的 Claude Code 相關工具,TUI 介面顯示 Claude Code、Codex、Cursor 的 AI coding token 費用
- darwin-skill — Claude Code 技能自主進化系統 — 自主評估 → 改進 → 測試 → 保留或回滾,受 Autoresearch 啟發的 Claude Code skill 優化
中文技術圈#

- Google Pixel 10 採用 Rust 改寫 DNS 解析器 — Google 在 Pixel 10 系列導入 Rust 改寫的 DNS 解析器,降低基頻高風險攻擊面,展示 Android 安全性持續提升的策略方向。
- Google IPv6 流量首達 50% — Google 官方統計顯示 IPv6 流量首次達到 50%,網路協議迎來歷史性黃金交叉。
- 數發部釋出公部門開源軟體應用參考手冊 — 台灣數位部彌補公部門對開源軟體的授權、管理資訊不足缺口。
開源精選 — GitHub Trending#
AgentSeal/codeburn — TypeScript | ⭐ 2.3K Claude Code、Codex、Cursor 的 AI coding token 費用視覺化 TUI 儀表板,解決 AI coding token 成本透明度問題
vercel-labs/wterm — TypeScript | ⭐ 1.1K Vercel 出品的 Web 終端模擬器
alchaincyf/darwin-skill — HTML | ⭐ 986 Claude Code 技能自主進化系統:評估 → 改進 → 測試 → 保留或回滾
sogonov/anubis — Kotlin | ⭐ 788 Android app 管理器,依 VPN 連接狀態自動凍結/解凍 app 群組
Manavarya09/design-extract — JavaScript | ⭐ 692 從任何網站提取完整設計語言(顏色、字體、間距),附 npx CLI + Claude Code 外掛
影音精選#
WordPress 供應鏈攻擊:駭客購買 31 個外掛植入後門#
256K views · 19 小時前 | Fireship
駭客購買了 31 個 WordPress 外掛並植入後門,造成大規模供應鏈攻擊。問題根源在於 WordPress 外掛架構缺乏沙箱隔離,任何外掛都能以完整權限存取資料庫和檔案。Cloudflare 推出 EmDash 作為安全替代方案。
- WordPress 外掛市場的安全架構設計缺陷根本性問題
- 供應鏈攻擊成本極低:直接購買現有外掛植入惡意程式碼
- Cloudflare EmDash 展示了更安全的外掛隔離架構設計方向
💬 這個案例讓我想到軟體供應鏈安全的老問題:我們信任第三方程式碼,但卻沒有機制驗證「上傳者還是原本那個人」。WordPress 的問題在許多開源生態系統中都存在。
Anthropic 首輪融資遭 21 次拒絕的故事#
9.9K views · 40 小時前 | 20VC
Anthropic 首輪融資遭遇 21 次拒絕,因投資人對 AI 技術缺乏理解。最終通過 Amazon 等科技巨頭的支持完成融資,成為關鍵突破。
- Anthropic 早期融資被拒 21 次,反映投資人在 AI 早期的認知盲點
- 最終由科技公司(Amazon)而非傳統 VC 領投,策略資本的重要性
- 今天 Claude Opus 4.7 發布,與創業初期的故事形成強烈對比
💬 21 次拒絕然後做出今天的 Claude 4.7——這個故事在今天特別有意義。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit


