yii.
← Digest
EP70 · 2026年5月10日 星期日 · 9 min read

AI 抬高的門檻

當費爾茲獎數學家說 ChatGPT 解掉了 PhD 難題,Anthropic 估值衝破 1.2 兆

每天花 1% 的時間,掌握科技脈動。


今日金句#

“The bar has just been raised. It is no longer enough that somebody asks a problem: it needs to be hard enough for an LLM not to be able to solve it.” 「門檻提高了。問題不只要讓人解不了,還要讓 AI 也解不了,才算難題。」 — Tim Gowers, Fields Medal mathematician, Cambridge University

“I would much rather wait an extra 200ms for my slow/expensive prompt to be accurate… But I’m not allowed to wait.” 「我寧願多等 200ms 讓 AI 語音更準確……但協議不讓我等。」 — Luke Curley, OpenAI engineer


今日主軸#

這週有幾件事撞在一起,讓我覺得指向同一個方向:AI 正在悄悄移動衡量事物的標準。

第一件:費爾茲獎得主、劍橋數學家 Tim Gowers 公布了一個令人不安的發現。他把一批研究等級的數學難題丟給 ChatGPT 5.5 Pro,AI 一題一題解掉了。他說,以前一個無人解開的難題是研究生的機會;現在出題的條件變了——得先確認 AI 做不了,才算真正的難題。「什麼叫夠難」這個問題,被悄悄重新定義了。

第二件:Latent Space 的 AI 估值追蹤顯示,Anthropic Q1 年化增長達 80 倍,估值衝上 1.2 兆美元,躍升全球第 11~15 名最有價值的公司。同期 Cloudflare 裁員 20%、Block 裁員 40%、Coinbase 裁員 14%,理由都是「AI 整備」。但工程師專案管理工具 Linear 反而因 AI 而擴張。「什麼叫強」的標準,也在移動。

第三件:antirez(Redis 創造者)徒手用 C 寫了一個 DeepSeek V4 Flash 的 Metal 推論引擎,讓 M3 Mac 可以本機跑 270 億參數模型,每秒 26~37 個 token,還有 1M context 的磁碟 KV cache。本機推論的門檻,又低了一截。還有 NousResearch 的 hermes-agent,141K GitHub stars,一個設計為隨互動自我成長的 AI 代理框架。

這一週的 AI 新聞不是「AI 很強」或「AI 很弱」。是「標準在移」。


必讀#

  1. 費爾茲獎數學家:ChatGPT 5.5 Pro 解掉了我的研究難題 — Hacker News AI
  2. antirez/ds4:Redis 創造者為 Apple Metal 打造 DeepSeek 推論引擎 — GitHub AI
  3. NousResearch/hermes-agent:141K stars,The agent that grows with you — GitHub AI
  4. Anthropic 年增長 10 倍,估值衝破 1.2 兆美元 — Latent Space AI
  5. 前沿 LLM 在長文件委派中有 25% 內容損毀率 — arXiv/HN AI
  6. WebRTC 設計缺陷:AI 語音精準度卡在協議層 — Simon Willison Dev
  7. Just Fucking Use Go — Lobste.rs Dev
  8. Nvidia 今年已承諾 400 億美元 AI 股權投資 — TechCrunch News
  9. Claude Code vs OpenClaw:5 個核心架構差異 — ByteByteGo Dev

費爾茲獎數學家:ChatGPT 5.5 Pro 解掉了我的研究難題#

Tim Gowers 將 Nathanson 2026 年論文中的加法組合學難題(sumset 問題)交給 ChatGPT 5.5 Pro,AI 在一小時內逐一解出。Gowers 強調,這不只是「AI 很強」的問題——而是衡量「什麼叫研究難題」的標準被重新設定了。以往一個無人解開的問題就是博士生的機會;現在出題的前提條件,得先確認 AI 解不了,才算真正的難題。

  • AI 解出的問題難度屬研究生等級加法數論,來自 arxiv 2603.15556
  • Gowers 認為「組合既有知識」與「原創洞察」的邊界正在模糊化
  • 這是 AI 能力從「輔助研究」進入「競爭研究問題」的標誌性時刻

💡 學術界對 AI 能力的評估,必須從「能做人類的事」升級為「能做人類最難的事」。這個框架轉換,影響的不只是數學,而是所有知識密集型領域的研究策略。

🔗 閱讀原文 | 來源: Tim Gowers Blog / Hacker News


antirez/ds4:Redis 創造者為 Apple Metal 打造 DeepSeek 推論引擎#

Salvatore Sanfilippo(antirez,Redis 創造者)用純 C 從零打造了一個 DeepSeek V4 Flash 的 Metal 推論引擎。M3 Max/Ultra(128GB RAM)可在 2-bit 量化下達到每秒 26~37 個 token。最特別的設計是「磁碟優先 KV cache」:將 attention 狀態壓縮後持久化到磁碟,實現本機 1M context window,無需雲端 API。

  • 非通用 GGUF runner,專為 DeepSeek V4 Flash 和 Apple Metal 優化,Metal-only(CPU path 因 macOS VM bug 暫時停用)
  • 非對稱 2-bit 量化:只對 MoE routing experts 量化,shared components 保留精度
  • 支援 OpenAI / Anthropic 相容 server API,可直接替換現有 endpoint
  • 磁碟 KV cache 讓本機 1M context 成真:13 個 session 狀態欄位 + checkpoint tokens + logits + 壓縮 KV rows

💡 資深工程師不選框架而選從頭寫 C,本身就是訊號——在推論最佳化這條賽道上,框架層的抽象已成瓶頸。擁有高階 Apple Silicon 的開發者,今日即可下載試用。

🔗 閱讀原文 | 來源: GitHub / antirez


NousResearch/hermes-agent:141K Stars,The agent that grows with you#

NousResearch 是知名開源 AI 研究組織,hermes-agent 是他們最新的代理框架,141K GitHub stars 讓它成為目前 GitHub 上星數最高的 AI agent 項目之一。「The agent that grows with you」——設計理念是代理能從互動中學習、累積記憶,隨使用者使用習慣持續進化。

  • Python 實作,強調自我成長的代理記憶機制
  • 141K stars 是近期 AI 代理項目中最快速的社群反應之一
  • NousResearch 在開源 LLM 微調(Hermes 系列)上有長期積累,社群可信度高

💡 代理框架從「執行任務」到「隨互動成長」是一個關鍵能力跳躍。hermes-agent 的社群規模顯示開發者對持久化代理記憶的強烈需求。

🔗 閱讀原文 | 來源: GitHub / NousResearch


Anthropic 年增長 10 倍,估值衝破 1.2 兆美元#

Latent Space 追蹤二級市場與傳統媒體數據:Anthropic Q1 2026 達成 80 倍年化增長,估值升至 1-1.2 兆美元,成為全球第 11~15 大最有價值公司。同期 Block 裁員 40%、Coinbase 裁員 14%、Cloudflare 裁員 20%,但做工程師工具的 Linear 因 AI 而擴張。

  • $1.2T 估值使 Anthropic 成為歷史上最快達到此規模的 AI 公司
  • 裁員/擴張的分水嶺:AI 讓你變強還是讓你縮小,而不是「有沒有用 AI」
  • 「Stronger companies, like Linear, are the ones that grow, not shrink, due to AI.」— Latent Space

💡 Anthropic 的估值不只是商業數字——它重新定義了 AI 基礎設施的競爭格局,也揭示了哪些企業在這輪洗牌中屬於受益方。

🔗 閱讀原文 | 來源: Latent Space


前沿 LLM 在長文件委派中有 25% 內容損毀率#

論文 DELEGATE-52 建立了一個 52 個專業領域的長工作流基準測試,結果顯示 Claude 4.6、Gemini 3.1 Pro、GPT 5.4 等頂尖模型,在複雜文件委派任務中平均有 25% 的內容損毀率。錯誤是稀疏但嚴重的——靜默地引入、持續累積,且不會觸發例外。

  • 使用 agentic tool use 不能緩解問題,文件越長、互動越多,錯誤越嚴重
  • 干擾文件的存在顯著增加損毀率
  • 法律文書、醫療記錄、財務代碼等高保真需求場景,當前模型不可信賴

💡 對「讓 AI 代理幫我整理文件/代碼」的廣泛使用方式發出警告。LLM 能解題,但不等於能可靠地維護文件完整性。必須加入人類審查流程。

🔗 閱讀原文 | 來源: arXiv / Hacker News


WebRTC 設計缺陷:AI 語音精準度卡在協議層#

OpenAI 工程師 Luke Curley(via Simon Willison)揭示,WebRTC 內建了主動丟棄音訊封包的機制,以維持低延遲的通話體驗。但這個設計讓 AI 語音應用無法選擇「多等 200ms 換取更高準確度」。Discord 和 OpenAI 都已碰到這個牆——這是協議層的限制,不是實作問題。

  • 瀏覽器 API 沒有機制可以重新傳送已丟棄的音訊封包
  • 改變此行為需要新的瀏覽器標準,無法靠應用層解決
  • OpenAI 能做出高品質語音,暗示使用了 WebRTC 以外的自有方案

💡 所有用瀏覽器 WebRTC 做 AI 語音的開發者,都面對這個天花板。短期解法:server-side 音訊增強或自有協議。

🔗 閱讀原文 | 來源: Simon Willison


Just Fucking Use Go#

一篇直白的技術論述:對於大多數後端服務(CRUD、JSON API、HTML rendering),直接用 Go 標準庫就夠——net/http + embed + html/template = 可上線的 production app,不需要 npm、Webpack、Docker、Kubernetes。Goroutine 每個 2KB,一台筆電可以跑 10 萬個;單一 binary 部署,12MB。

  • 標準庫覆蓋 80% 的 web 應用需求,框架是「選擇性複雜度」
  • goroutine + channel 是類型安全的並發原語,比 Node event loop 更直白
  • context.Context 負責取消傳播,DB query 在 request 結束時自動取消

💡 每隔幾年就有一篇文章說「用無聊的技術」,但這篇提供了夠具體的 API 範例,適合剛在考慮技術選型的人。Lobste.rs 171 分,技術社群共鳴強烈。

🔗 閱讀原文 | 來源: Lobste.rs


Nvidia 今年已承諾 400 億美元 AI 股權投資#

2026 年截至目前,Nvidia 已通過股權投資方式承諾向 AI 公司注入 400 億美元,遠超過去任何一年。這些投資橫跨 AI 基礎設施、模型訓練、推論硬體,顯示 Nvidia 從「賣鏟子」進化為「持股礦場」。Nvidia 的生態系戰略從硬體銷售擴展到股權布局,鞏固其在 AI 供應鏈的核心地位。

🔗 閱讀原文 | 來源: TechCrunch


Claude Code vs OpenClaw:5 個核心架構差異#

ByteByteGo 比較兩大 AI 編程工具的架構設計:Claude Code 採短期程序模型(任務結束即終止),OpenClaw 為長期背景守護程序(persistent daemon)。差異觸及 process lifecycle、state management、memory patterns、tool access scope、execution model 五個維度。

  • Claude Code:無狀態,每 session 獨立,安全但 context 不延續
  • OpenClaw:有狀態,跨 session 累積記憶,但複雜度更高
  • 選擇取決於任務特性——短期精準 vs. 長期學習

💡 工具選型影響整個開發工作流。了解架構差異,幫助開發者做有根據的選擇。

🔗 閱讀原文 | 來源: ByteByteGo Newsletter


推薦閱讀#


中文技術圈#


antirez/ds4 — C | ⭐ 4.5K DeepSeek V4 Flash Apple Metal 本機推論引擎,M3 Ultra 可達 37 tokens/s,1M context 磁碟 KV cache

vercel-labs/zero-native — Zig | ⭐ 1.7K Vercel 實驗框架:用 Zig + Web UI 打造桌面+行動原生應用,讓 Web 開發者橋接原生平台

strukto-ai/mirage — TypeScript | ⭐ 1.6K AI Agent 統一虛擬文件系統,讓代理透過單一抽象層操作不同儲存後端

graykode/abtop — Rust | ⭐ 2K 像 htop 一樣即時監控 Claude Code & Codex CLI session 的 token 用量、context window、rate limit

WenyuChiou/awesome-agentic-ai-zh — Python | ⭐ 537 AI Agent 中文學習地圖,繁中/简中/English 三語對照,結構化學習路徑含必做練習


本月開源精選 — HelloGitHub vol.121#

每月精選有趣的入門級開源項目,2026-04-28 更新。

NousResearch/hermes-agent — Python | ⭐ 141K 「The agent that grows with you」— NousResearch 出品的自我成長型 AI 代理框架,社群反應極強烈

forrestchang/andrej-karpathy-skills — | ⭐ 122K 源自 Karpathy 對 LLM 編程陷阱觀察的單一 CLAUDE.md 技巧檔案,大幅改善 Claude Code 行為模式

JuliusBrussee/caveman — Python | ⭐ 57K 石器時代語法讓 Claude Code 少說廢話,token 用量省 65%

charmbracelet/glow — Go | ⭐ 25K 終端機 Markdown 渲染器,帶語法高亮和配色,本地 + GitHub 文件都能讀

OrcaSlicer/OrcaSlicer — C++ | ⭐ 13.7K Bambu、Prusa、Voron 等主流 3D 印表機的 G-code 生成器,社群最活躍的切片軟體之一

pdm-project/pdm — Python | ⭐ 8.6K 現代 Python 套件管理器,支援最新 PEP 標準(PEP 517/582),快速取代 pip + venv 工作流

graykode/abtop — Rust | ⭐ 2K htop 風格的 AI coding agent 監控工具:即時追蹤 Claude Code/Codex 的 token 消耗和 rate limit


影音精選#

AI 新聞週報:GPT-5.5 Instant、Claude 辦公整合、Grok 4.3#

Matt Wolfe

65,158 views · 1 天前 | Matt Wolfe

本週 AI 產業大盤點:GPT-5.5 Instant 推出、Claude 辦公軟體整合更新、Grok 4.3 發布、Anthropic Google 合作深化、Spotify AI Podcast 擴展。

  • 本週最重要發布:GPT-5.5 Instant(更快、更便宜的 GPT-5.5 版本)
  • Claude 辦公整合:可直接在主流辦公應用中調用 Claude
  • Spotify AI Podcast:AI 生成個人化 podcast 摘要開始擴展

💬 每週 AI 新聞的最佳入門,Matt Wolfe 的盤點讓你 15 分鐘掌握主要動態。


GPT-5.5 深度評析:好、壞與醜陋#

Two Minute Papers

46,472 views · 1 天前 | Two Minute Papers

GPT-5.5 Instant 的優點:更快速的推理和更自然的語言互動。局限:某些複雜推理任務相比 GPT-5.5 仍有差距,適合中等複雜度任務。

  • 速度大幅提升,適合需要快速回應的互動場景
  • 個性化回應更自然,語言品質改善明顯
  • 複雜推理任務建議仍使用完整版 GPT-5.5

💬 如果你需要選模型,看完這部視頻能幫你做出更有根據的決策。


語言模型最大化:頂級開發者用 AI 做 400 人工作#

Y Combinator

32,056 views · 1 天前 | Y Combinator

YC Lightcone 對談:單個開發者搭配 AI 代理,可以開發出過去需要整個工程團隊才能完成的產品。討論涵蓋 Claude Code、OpenClaw 工作流,以及如何用語言模型最大化個人開發效率。

  • AI 代理讓一人當 400 人用的工作流程實踐分享
  • Claude Code + OpenClaw 的協作使用模式
  • YC 創辦人對軟體開發未來形態的判斷

💬 如果你在思考如何讓自己成為「一人公司」,這部視頻值得看。


代理式搜尋與上下文工程#

AI Engineer

10,195 views · 1 天前 | AI Engineer

工作坊深講:代理如何決定「檢索哪些資訊」比「如何進行 RAG」更重要。上下文管理的被忽視面向直接決定 LLM 輸出品質。

  • 上下文工程 ≠ RAG,前者是更上層的決策問題
  • 代理搜尋策略的設計框架與實踐案例
  • 影響 LLM 輸出品質的關鍵變數分析

💬 如果你在建 AI agent,這部是本週最有工程密度的技術分享之一。


文字轉語音架構為何趨向 LLM#

AI Engineer

3,031 views · 1 天前 | AI Engineer / Mistral

Mistral 研究科學家解析 2026 年文字轉語音架構為何趨同於 LLM 模型。神經音訊編碼器如何解決資訊密度問題,以及串流技術實現低延遲語音代理的關鍵。

  • TTS 和 LLM 架構趨同的深層原因
  • 神經音訊編碼器解決頻譜密度問題的方式
  • 串流 TTS 實現低延遲語音代理的工程細節

💬 想在 app 裡加 AI 語音的開發者,這是本週最值得看的技術分享。


名人動態#


今日觀察#

Tim Gowers 的分析觸及一個深層矛盾:AI 模型的進步並非線性地降低所有任務的難度,而是以不可預測的方式衝擊特定領域。數學研究中這種「門檻移位」現象,可能很快在法律文書分析、醫學診斷輔助等知識密集型領域重演。同時,DELEGATE-52 的研究提醒我們:即便模型能「解題」,在長工作流中保持文件完整性的可靠性仍是另一回事。這兩組數據放在一起,描繪出 AI 作為「問題解決者」與「文件處理代理」之間存在的根本能力落差——解題能力和保真能力,目前是兩條尚未交匯的曲線。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有