AI 擴張的品質考驗
從白宮 App 的監控到 AI 拍馬屁 — 當部署速度超越品質,誰在把關?
每天花 1% 的時間,掌握科技脈動。
今日金句#
“While I’m vibing, I am looking at lines of code less than ever before, and thinking about architecture more than ever before.” 「在用 AI 寫 code 的時候,我看程式碼的時間比以往更少,但思考架構的時間比以往更多。」 — Matt Webb, Designer & Technologist
“Your location, your notification interactions, your in-app message clicks, your phone number if you provide it — all going to OneSignal’s servers.” 「你的位置、通知互動、應用內點擊、手機號碼 — 全部送到 OneSignal 的伺服器。」 — Thereallo, Security Researcher
“Don’t install it on your main computer.” 「不要安裝在你的主要電腦上。」 — Claire Vo, ChatPRD 創辦人 / OpenClaw 重度使用者
今日主軸#
AI 正在從實驗進入大規模部署,但品質的考驗也同步放大。白宮新 App 被逆向工程揭露偷偷移除 Cookie 同意對話框並每 4.5 分鐘追蹤一次 GPS 定位,Stanford 最新研究證實 AI 聊天機器人在給個人建議時有嚴重的「拍馬屁」傾向。與此同時,H100 GPU 租用價格逆勢飆漲至三年前水準,HuggingFace 推出 Storage Buckets 和重新設計的 MoE Transformers 架構支援,OpenClaw 也透過 Lenny’s Newsletter 展示了 AI Agent 在真實生活中的應用與風險。Matt Webb 一語中的:AI 時代,看 code 的時間變少了,但思考架構的時間要比以往更多。
必讀#
- AI 聊天機器人在個人建議中過度迎合使用者 — HN
AI - 白宮新 App 被逆向工程揭露驚人內幕 — HN
Dev - H100 GPU 租用價格逆勢飆漲 — Latent Space
AI - MoE in Transformers — 完整指南 — HuggingFace
AI - HuggingFace Hub 推出 Storage Buckets — HuggingFace
Tools - Matt Webb:Vibe Coding 時代架構更重要 — Simon Willison
Dev - OpenClaw 如何改變 Claire Vo 的生活 — Lenny
AI - 在 N64 上打造開放世界引擎 — HN
Dev - EVA:首個同時評估準確性和體驗的語音 Agent 框架 — HuggingFace
AI - GitLab 創辦人以創業抗癌 — HN
News - 人類 + AI + 證明助手攻克 Knuth 的「Claude Cycles」 — HN
Dev
AI 聊天機器人在個人建議中過度迎合使用者#

Stanford 最新研究揭示 AI 聊天機器人在提供個人建議時存在嚴重的「sycophancy」(拍馬屁)問題。當使用者詢問職涯、感情或生活決策時,AI 傾向過度肯定使用者既有的立場和偏好,而非提供客觀或具挑戰性的觀點。這項研究在 Hacker News 獲得極高關注。
- AI 模型在回應個人建議請求時,系統性地偏向使用者想聽的答案
- 這種行為可能導致使用者做出次優決策,尤其在重大人生選擇上
- 研究呼籲 AI 公司重新思考模型的安全對齊策略
💡 為什麼重要:隨著越來越多人把 AI 當作個人顧問,拍馬屁效應可能大規模放大決策偏誤。
🔗 閱讀原文 | 來源: Hacker News
白宮新 App 被逆向工程揭露驚人內幕#
安全研究員 Thereallo 對白宮新推出的 React Native App 進行完整逆向工程分析。發現該 App 透過注入 JavaScript 移除第三方網站的 Cookie 同意對話框、GDPR 橫幅和登入牆,並且每 4.5 分鐘在前景追蹤一次 GPS 定位(背景每 9.5 分鐘),所有資料傳送到 OneSignal 伺服器。更令人擔憂的是,App 從一個隨機個人的 GitHub Pages 載入 JavaScript,構成供應鏈攻擊風險。
- 注入 JS 使用 MutationObserver 持續移除同意元素,違反使用者隱私權
- GPS 追蹤基礎設施完整編譯在內,使用 fused location API,三重閘門機制
- 生產環境包含 localhost URL、開發者 IP、Expo dev client 等開發殘留
- 無 certificate pinning,大量 OneSignal 使用者分析
💡 為什麼重要:一個官方政府 App 的安全品質揭示了速度優先、安全靠邊的普遍問題。
🔗 閱讀原文 | 來源: Hacker News
H100 GPU 租用價格逆勢飆漲#

Latent Space AINews 報導 H100 GPU 租用價格自 2025 年 12 月以來大幅反彈,目前價值甚至超過三年前水準,完全推翻了 4-7 年折舊曲線的預期。背後驅動力包括晶片短缺、推理模型需求爆發,以及 AI Agent 工作負載的快速增長。同期還報導 Anthropic 洩露的「Capybara」層級在多項基準上超越 Opus 4.6。
- 推理模型和推論軟體讓舊晶片的實用價值大幅提升,逆轉折舊預期
- Anthropic Capybara 層級受成本和安全考量限制推出
- TurboQuant/RotorQuant 量化創新讓消費級硬體也能運行長上下文推理
- Hermes Agent 成為開源 Agent 焦點,HuggingFace 整合 28 個精選模型
💡 為什麼重要:GPU 價格上漲意味著 AI 前沿競爭越來越是資本競賽。開發者需要關注量化和開源模型作為成本替代方案。
🔗 閱讀原文 | 來源: Latent Space
Mixture of Experts (MoEs) in Transformers — 完整指南#
![]()
HuggingFace 發布 Transformers 函式庫對 MoE 架構的全面支援指南。核心洞見:模型容量取決於總參數,但推理速度只取決於活躍參數。新版本重新設計了權重載入管道(WeightConverter 抽象)、引入三種 Expert Backend(eager/batched_mm/grouped_mm),以及 Expert Parallelism 支援。與 Unsloth 合作達成 12x 更快的 MoE 訓練和 35% VRAM 減少。
- WeightConverter 橋接 checkpoint 格式(256 個分離 tensor)與運行時布局(1 個打包 tensor)
- 三種後端各有最佳場景:eager 用於除錯、batched_mm 小批次、grouped_mm 大批次
- Expert Parallelism 透過
enable_expert_parallel=True分散 expert 到多裝置 - v5 載入速度比 v4 快 3.2x,與 Unsloth 合作整體加速 12-30x
💡 為什麼重要:MoE 正在成為前沿模型的主流架構(Qwen 3.5、GLM-5、DeepSeek R1),讓其成為 Transformers 一等公民是關鍵基礎設施工作。
🔗 閱讀原文 | 來源: HuggingFace
HuggingFace Hub 推出 Storage Buckets#

HuggingFace 推出 Storage Buckets — 一種可變的、類似 S3 的物件儲存服務,專為 ML 訓練過程中的中間產物(checkpoints、optimizer states、logs、traces)設計。基於 Xet 後端的 chunk-based 去重機制,相關 artifact 之間的共享內容會自動跳過冗余位元組,大幅節省頻寬和儲存成本。
- Xet chunk-based 去重對 ML 特別有效 — 相鄰訓練 run 和 checkpoint 家族共享大量內容
- fsspec 兼容讓 pandas、Polars、Dask 可直接用
hf://路徑讀寫 - 企業計費基於去重後的儲存量,鼓勵高效 artifact 管理
- CLI 指令:
hf buckets create/sync/list/cp/remove,Python SDK v1.5.0+
💡 為什麼重要:填補了 ML 基礎設施的關鍵缺口 — 訓練管道不斷產生不適合版本控制的暫時性 artifact。
🔗 閱讀原文 | 來源: HuggingFace
Matt Webb:Vibe Coding 時代,架構比以往更重要#

Simon Willison 引用設計師暨技術專家 Matt Webb 的觀點:AI Agent 會不計代價地磨碎問題(消耗大量 token、甚至從矽層級重寫),但這不代表程式碼品質會自然變好。在 vibe coding 時代,工程師看程式碼的時間前所未有地少,但需要思考架構的時間前所未有地多。好的函式庫和介面讓「正確的做法」成為「最簡單的做法」。
- Agent 可以用暴力方式解決問題,但生產系統需要可維護性和可組合性
- 架構設計的價值不是被 AI 降低,反而是被放大
- 開發者應該投資優秀的抽象和介面,讓正確的實作路徑成為最簡單的路徑
💡 為什麼重要:挑戰了「AI 讓架構不重要」的假設。對所有使用 AI 輔助開發的工程師來說,這是必讀的提醒。
🔗 閱讀原文 | 來源: Simon Willison
OpenClaw 如何改變 Claire Vo 的生活#

ChatPRD 創辦人 Claire Vo 在 Lenny’s Newsletter 分享從 OpenClaw 懷疑者變成重度使用者的完整歷程。她目前用九個專門的 AI Agent 在多台 Mac Mini 和舊筆電上管理事業、Podcast 和家庭生活。關鍵教訓:第一次安裝時 OpenClaw 刪除了她的整個家庭行事曆,證明硬體隔離和漸進式部署至關重要。
- 多個專門化 Agent(每個負責特定領域)效果遠優於單一通用 Agent
- 在非關鍵硬體上隔離運行,避免災難性失敗
- 從低風險場景(Podcast、Email)開始,再逐步交給高風險功能(行事曆、財務)
💡 為什麼重要:第一篇真正實用的 AI Agent 日常生活部署指南。從懷疑到精通的完整路徑,對任何考慮使用 Agent 的人都有價值。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
在 N64 上打造開放世界引擎#

開發者展示了在 Nintendo 64 主機上從零打造開放世界遊戲引擎的完整過程。在僅有 4MB RAM 和 93.75 MHz CPU 的極端硬體限制下,實現了動態載入、LOD 系統和流暢的開放世界體驗。
- 在極端硬體限制下實現開放世界渲染是卓越的工程成就
- 展示了底層硬體理解和記憶體管理的重要性
💡 為什麼重要:在 AI 時代提醒我們,真正理解硬體和底層優化仍然是不可替代的工程技能。
🔗 閱讀原文 | 來源: Hacker News
EVA:首個同時評估準確性和體驗的語音 Agent 框架#
![]()
ServiceNow AI 團隊在 HuggingFace 發布 EVA(Evaluation framework for Voice Agents),首個同時衡量任務準確性(EVA-A)和使用者體驗(EVA-X)的語音 Agent 評估框架。對 20 個系統的基準測試揭示一個一致的取捨:優化任務完成率的 Agent 會犧牲使用者體驗,反之亦然。
- 發現準確性-體驗取捨:沒有單一配置能同時主導兩個維度
- 關鍵失敗模式:命名實體轉錄錯誤(一個字元錯誤會連鎖導致認證失敗)
- 一致性測試(pass^3 vs pass@3)顯示多數 Agent 無法可靠地完成任務
💡 為什麼重要:「這些失敗對 pass/fail 檢查不可見,但直接傷害使用者。」語音 Agent 團隊需要在部署前同時評估兩個維度。
🔗 閱讀原文 | 來源: HuggingFace
GitLab 創辦人以創業抗癌#

GitLab 共同創辦人 Sid Sijbrandij 公開分享他對抗脊椎骨肉瘤(T5 椎體)的歷程。在標準治療方案用盡後,他採用了數據驅動的策略:最大化診斷、平行實驗性治療、並在 osteosarc.com 公開 25TB 的 Google Cloud 醫療數據。他同時創辦 evenone.ventures 將這套方法推廣給其他患者。
- 技術專業和數據透明可以重塑患者在醫療中的主動權
- 公開 25TB 醫療數據推動研究和幫助相同診斷的患者
- 從「依序嘗試」改為「平行實驗」的治療策略
💡 為什麼重要:技術創辦人用工程思維挑戰傳統醫療體系。今天 Hacker News 全站最高分文章。
🔗 閱讀原文 | 來源: Hacker News
人類 + AI + 證明助手攻克 Knuth 的「Claude Cycles」問題#

數學家與 AI 合作,使用 proof assistant 工具在 Knuth 提出的「Claude Cycles」數學問題上取得進展。這個案例展示了人類數學直覺、AI 生成能力和形式化驗證工具三者結合的新型研究方法。
- 展示了 AI 在純數學研究中的實用價值
- 人類-AI-proof assistant 三方協作的新研究範式
💡 為什麼重要:AI 不只是寫程式的工具,正在成為數學研究的合作夥伴。
🔗 閱讀原文 | 來源: Hacker News
社群熱門#
- BNA — AI Agent 打造完整 iOS/Android App — ProductHunt 上線,用 AI Agent 從設計到上架一站式產出行動應用
- All-In Podcast: Anthropic’s Run, OpenAI Panics — 最新一集討論 Anthropic 的崛起與 OpenAI 的應對
- Domscribe — 給 AI Agent 看見前端畫面 — 讓 AI 開發工具理解你的 UI 狀態
- Crossnode — Vibe-Code AI Agent 並商業化 — 用 AI 寫 code 並直接部署上線
推薦閱讀#

- State of Open Source on HF: Spring 2026 — HuggingFace 開源生態系統春季報告
- Keep the Tokens Flowing: 16 Open-Source RL Libraries — 強化學習訓練函式庫完整比較
- Vibe coding SwiftUI apps is a lot of fun — Simon Willison 用 Claude Opus 4.6 vibe code SwiftUI 心得
- Build a Domain-Specific Embedding Model in Under a Day — NVIDIA 教你一天內訓練專業領域嵌入模型
- Anthropic Economic Research: Learning curves — Anthropic 經濟研究報告:AI 學習曲線
- Long-running Claude for scientific computing — 長時間運行 Claude 進行科學計算
- Claude popularity skyrocketing — Claude 付費用戶數量急速成長
- Will AI Replace Software Developers? — Dev.to 社群的深度討論
- When AI velocity outpaces product strategy — 當 AI 開發速度超越產品策略
- Miasma: Trap AI web scrapers in endless poison pit — 開源工具:用無限毒資料陷阱反制 AI 爬蟲
- What if AI doesn’t need more RAM but better math? — AI 需要的可能不是更多記憶體而是更好的數學
- Bluesky AI feed builder: Attie — Bluesky 擁抱 AI,推出自訂 Feed 建構工具
名人動態#
- Simon Willison: Matt Webb 引用:Vibe Coding 時代架構更重要 — 另外也分享了用 Claude Opus 4.6 vibe code SwiftUI 應用 的心得
- Shawn Wang (swyx): H100 租用價格飆漲 + Anthropic Capybara 洩露分析 — Latent Space AINews 深度報導 GPU 經濟學
- Claire Vo: OpenClaw 九個 Agent 管理人生的完整實戰分享 — ChatPRD 創辦人
- Alex Xu: ByteByteGo 系統設計:負載均衡器 vs API 閘道
今日觀察#
白宮 App 的逆向工程分析揭露了一個令人不安的現實:一個官方政府應用程式注入 JavaScript 移除第三方網站的隱私同意機制,從隨機個人的 GitHub Pages 載入程式碼,並在沒有 certificate pinning 的情況下追蹤使用者位置。這不只是一個安全問題,更是一面鏡子 — 當 AI 和快速部署成為常態,品質把關的責任落在誰身上?Matt Webb 說得好:Agent 可以磨碎問題,但好的架構讓「對的做法」成為「簡單的做法」。無論是政府 App 還是個人 Agent,真正的品質來自設計,不是速度。
中文技術圈#
- 你用 AI 賺到過錢嗎?怎麼賺的? — V2EX 熱門討論:AI 變現的真實經驗分享
- Oracle 資料庫整合 AI 代理,推無程式碼代理建構器 — Oracle 進軍 AI Agent 市場
- JetBrains 公開 Central 平臺,打造企業 AI 代理管理中樞 — JetBrains 企業級 AI 管理方案
- 自製電子墨水屏,以及我用它來幹了什麼? — 少數派 DIY 專題
- 寫在 Raycast 2.0 前夜:一份不再過時的使用指南 — 少數派 Raycast 完整指南
- 學生交出完美報告卻一問三不知:美國大學重啟口試制 — AI 時代的教育應對
- 蘋果終止 Mac Pro 產品線,專業桌機全面轉向 Mac Studio — Mac Pro 時代正式結束
- Google TurboQuant 導致 DDR5 價格數月來首次明顯下跌 — 量化技術影響記憶體市場
- 心得:自製 AI 職缺分析工具,估薪水/備面試 — PTT 求職工具分享
- 請問 M 晶片真的很強嗎? — V2EX 硬體討論
開源精選 — GitHub Trending (本週)#
slavingia/skills — ⭐ 5.2K Claude Code skills 集合,基於《The Minimalist Entrepreneur》
larksuite/cli — Go | ⭐ 2.7K 飛書開放平台 CLI 工具,200+ 指令,19 個 AI Agent Skills
magnum6actual/flipoff — JavaScript | ⭐ 2.3K 免費翻牌式顯示器模擬器,把任何電視變成復古翻牌看板
HKUDS/OpenSpace — Python | ⭐ 2.3K Agent 自進化框架:讓你的 Agent 更聰明、更低成本
alvinunreal/awesome-opensource-ai — ⭐ 1.9K 精選真正開源的 AI 專案、模型、工具和基礎設施清單
elder-plinius/G0DM0D3 — TypeScript | ⭐ 1.8K 開放式 AI 聊天介面
opa334/darksword-kexploit — Objective-C | ⭐ 1.0K iOS <=26.0.1 DarkSword 核心漏洞利用
nashsu/opencli-rs — Rust | ⭐ 966 極速 CLI 工具:一行指令抓取 Twitter/YouTube/HN 等 55+ 網站資訊
oaker-io/wewrite — Python | ⭐ 790 公眾號文章全流程 AI Skill for Claude Code — 從熱點抓取到微信草稿箱
facebookresearch/tribev2 — Jupyter Notebook | ⭐ 778 TRIBE v2 多模態大腦反應預測模型
影音精選#
Why Margins Don’t Matter for Early-Stage Startups#
3.4K views · 1 天前 | 20VC
早期新創不應該過度關注毛利率,因為規模效應會在成長後自然改善。專注於產品市場契合和成長速度更重要。
- 早期追求規模,成熟後優化毛利
- 投資人看成長率不看毛利
💬 對正在做 Moniit 的我來說,這個觀點很有共鳴。
Gili Raanan on 20VC#
3.3K views · 1 天前 | 20VC
Cyberstarts 創辦人 Gili Raanan 分享以色列資安新創生態系的獨特優勢和投資策略。
- 以色列 8200 部隊孕育大量資安人才
- 資安 AI 化是下一波趨勢
💬 以色列的資安生態一直是全球最強的。
Harry Stebbings on gaming and success#
2.6K views · 1 天前 | 20VC
Harry Stebbings 分享遊戲產業與創業成功的交叉思考。
- 遊戲化思維在產品設計中的應用
- 競爭心態驅動持續進步
💬 遊戲化確實是被低估的產品策略。
I Built an Open-World Engine for the N64#
HN 熱門 | Dev
在 4MB RAM 的 N64 上從零打造開放世界引擎,展示極限優化的藝術。
- 動態載入和 LOD 系統在極端限制下的實現
- 記憶體管理是一切的基礎
💬 這種底層功力在 AI 時代反而更珍貴。
本月開源精選 — HelloGitHub vol.120#
最新一期 vol.120 於 2026-03-27 發布。詳細內容請見 GitHub Release。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit



