yii.
← Digest
EP98 · 2026年6月10日 星期三 · 8 min read

同一天,最強模型與最大警告

每天花 1% 的時間,掌握科技脈動。

今日金句#

“I feel a lot of things changing as working software increasingly comes out on a tap.” 「我感覺到很多事情正在改變——可用的軟體,現在像打開水龍頭一樣源源不絕。」 — Andrej Karpathy, AI 研究者

“80% of workloads will be running on 99% cheaper models within 12-18 months.” 「12 到 18 個月內,80% 的工作負載會跑在便宜 99% 的模型上。」 — Brian Armstrong, Coinbase 共同創辦人

“Current economic and societal structures appear fundamentally incompatible with continued technological acceleration.” 「現有的經濟與社會結構,看起來從根本上就跟不上技術持續加速的腳步。」 — Jack Clark, Anthropic 共同創辦人

今日主軸:能力上線,帳單到期,煞車同時被踩#

今天最大的事件是 Anthropic 推出 Claude Fable 5——Mythos 等級、但通過安全審查的最強模型,Agentic coding 全面超越 GPT 5.5,Stripe 用它在「一天內」完成過去要兩個月的 5000 萬行 Ruby 遷移。Karpathy 用 Jevons 悖論點破真相:軟體創造成本一降,需求不是減少而是爆炸,「軟體像打開水龍頭一樣流出來」。Lovable 同週衝到 $500M ARR、每週百萬個專案,就是這句話的商業版。

但同一隻踩油門的手,也按下了煞車。Anthropic 在估值超越 OpenAI、即將 IPO 的同一週,發報告警告 AI 正逼近「遞迴自我改進」臨界點,共同創辦人 Jack Clark 直言社會結構跟不上加速。與此同時,帳單正在失控:企業 token 開銷暴增、Anthropic 每月付 SpaceX 十億美元租算力;而 Cognition 的 FrontierCode 基準戳破泡泡——最強模型在「真正能合併進產品的程式碼」上只拿 13%,遠低於 SWE-bench 的 50%+。能力、成本、風險三條線同時飆升,這才是今天的全貌。

必讀#

  1. Claude Fable 5 與 Mythos 5 發布 — Anthropic AI
  2. Karpathy 談 Fable 5:軟體像水龍頭流出來 — Simon Willison AI
  3. 2026 軟體工程職場現況(下) — Pragmatic Engineer Dev
  4. Lovable 衝上 $500M ARR、每週百萬專案 — TechCrunch Startup
  5. Salesforce 2 萬個企業 Agent 部署的教訓 — ByteByteGo AI
  6. 科技公司學得會愛上便宜模型嗎 — TechCrunch AI
  7. FrontierCode:衡量「可合併」的程式碼品質 — Latent Space AI
  8. Token 開銷失控?智慧路由是解方 — ByteByteGo Dev
  9. Import AI 460:社會級獎勵駭客與 Anthropic RSI 數據 — Import AI AI
  10. OpenCV 5 發布:電腦視覺多年來最大躍進 — OpenCV Tools
  11. Claude Fable 5 深度評測(Lenny) — Lenny’s Newsletter AI
  12. LLM 流量暴增 41 倍:如何成為被 AI 推薦的品牌 — PostHog AI
  13. 不是 FAANG 了,是 MANGOS — TechCrunch News

1. Claude Fable 5 與 Mythos 5 發布#

Anthropic 推出 Mythos 等級、但通過安全審查的 Fable 5,Agentic coding 全面超越 GPT 5.5,並把價格砍半(input $10/output $50 每百萬 token)。Stripe 用它在一天內完成原需兩個月的 5000 萬行 Ruby 遷移。模型支援數百萬 token 長脈絡、可從截圖重建 web app,藥物設計類任務加速約 10 倍。安全架構以三組分類器(資安、生化、防蒸餾)把守,觸發率低於 5%;姊妹版 Mythos 5 僅開放給授權的資安專業人士與研究者。

  • 定價砍半($10/$50 每百萬 token),約為 Opus 兩倍但能力大幅領先
  • Stripe 一天遷移 5000 萬行 Ruby,過去需兩個月
  • 安全分類器觸發率 < 5%;Mythos 5 限制存取

💡 為什麼重要:這是 AI 經濟學的轉折點——前沿能力配上激進降價,把高階 AI 推向更廣的企業場景,尤其是軟體工程。

🔗 閱讀原文 | 來源: Anthropic

2. Karpathy 談 Fable 5:軟體像水龍頭流出來#

Karpathy 用 Jevons 悖論解釋 Fable 5 的真正衝擊——軟體創造成本下降,胃口不會縮小反而暴增:客製化儀表板、專案專屬分析工具、自動化測試、研究實作這些過去不划算的需求全部解鎖。他形容「可用的軟體像打開水龍頭一樣流出來」,這是供給端降本之外的需求端故事。

  • Jevons 悖論——效率提升反而放大整體消耗與需求
  • 解鎖過去經濟上不可行的客製化軟體場景
  • 暗示基礎設施成本不會因模型變便宜而下降

💡 為什麼重要:理解 Fable 5 的關鍵不在每 token 更便宜,而在「創造摩擦力歸零後,人們會做什麼」的質變。

🔗 閱讀原文 | 來源: Simon Willison

3. 2026 軟體工程職場現況(下)#

Anthropic 成為求職者最想去的公司(佔教練諮詢 34%),遠超 OpenAI 與 Google(各 16-17%),AI 實驗室全面壓過大型科技公司。新鮮人職缺崩跌到僅佔工程職位 10%(2023 年為約 30%),名校光環愈發關鍵。純前端職位消失最快,全端與 AI 工程成為新標配,AI 工程薪資超越同級傳統 SWE。

  • Anthropic 求職熱度 34%,兩年留任率 80% 高於 OpenAI 的 67%
  • 新鮮人招聘從 ~30% 崩到 10%
  • 純前端式微,全端+AI 成為入場門檻

💡 為什麼重要:軟體工程出現結構性分岔——頂尖人才湧向 AI 實驗室,初階工程師面臨前所未有的入行門檻。

🔗 閱讀原文 | 來源: Pragmatic Engineer

4. Lovable 衝上 $500M ARR、每週百萬專案#

Lovable 從 2 月的 $400M 一路衝到 $500M 年化營收(季增 25%),每週新增 100 萬個專案、累計逾 5000 萬個。平台讓非技術用戶(創辦人、設計師、業務)也能「vibe coding」做出網站、電商與內部工具,成立不到三年就達獨角獸級營收,對傳統 SaaS 訂閱模式構成實質威脅。

  • $500M ARR,4 個月成長 25%
  • 每週百萬專案、累計 5000 萬個
  • 威脅傳統 SaaS——客製化 AI 方案取代昂貴年約

💡 為什麼重要:證明 AI 輔助開發平台能在不靠傳統企業銷售的情況下衝上獨角獸營收,軟體生產方式正在質變。

🔗 閱讀原文 | 來源: TechCrunch

5. Salesforce 2 萬個企業 Agent 部署的教訓#

Salesforce Agentforce 已服務 2 萬家企業、處理逾 300 萬次對話、基於 13.5 萬篇文章。最反直覺的發現:Agent 工作 90% 發生在上線「之後」(迭代、優化、回饋循環),與傳統軟體 90% 在上線前完全相反。核心 KPI 是「containment rate」(不需轉人工就解決的比例)。三大反模式:把確定性流程交給 LLM 推理、用更兇的 prompt 取代寫死規則、context engineering 做得差。

  • 90% 的 Agent 工作在上線後(迭代而非一次到位)
  • 回應 context 從 10 萬 token 優化到 2 千 token
  • 先窄後寬、緊盯 containment rate

💡 為什麼重要:來自最大企業 SaaS 平台的實戰數據,直接改寫企業導入 AI Agent 的資源配置與預算邏輯。

🔗 閱讀原文 | 來源: ByteByteGo

6. 科技公司學得會愛上便宜模型嗎#

Coinbase 共同創辦人 Brian Armstrong 預測 12-18 個月內 80% 工作負載會跑在便宜 99% 的模型上,只有真正不可取代的任務才值得用前沿模型。法律 AI 平台 Harvey 已用「智慧路由」在 Claude Opus 與 GLM 5.1 間分流,成本降 3 倍而品質不變。產業核心矛盾從「越大越好」轉向推論成本的可持續性,真正分野是大模型 vs 小模型,與開源/閉源無關。

  • Armstrong 預測 80% 工作負載將跑在便宜 99% 的模型
  • Harvey 靠智慧路由降本 3 倍、品質不減
  • 前沿模型定價只在「真正不可取代」時才撐得住

💡 為什麼重要:把 Fable 5 砍價放進產業脈絡——降價不是慈善,是對成本壓力的回應,智慧路由將成為競爭必需品。

🔗 閱讀原文 | 來源: TechCrunch

7. FrontierCode:衡量「可合併」的程式碼品質#

Cognition 推出 FrontierCode 基準,評估的是「能不能真的合併進產品」的程式碼品質(回歸安全、整潔度、範圍、測試正確性、可維護性),而非只看通過單元測試。最強的 Opus 4.8 在最難題只拿 13%,遠低於 SWE-bench 的 50%+,揭露巨大能力落差。題目由開源維護者每題投入 40+ 小時設計,確保真實複雜度。

  • Opus 4.8 在最難題僅 13% 成功率(vs SWE-bench 50%+)
  • 評估可合併性,而非僅通過測試
  • 呼應 METR 發現——許多通過 SWE-bench 的 PR 在真實環境根本不會被合併

💡 為什麼重要:戳破「程式碼生成已解決」的敘事,把 AI 工程評估從跑分拉回真實部署標準。

🔗 閱讀原文 | 來源: Latent Space

8. Token 開銷失控?智慧路由是解方#

開源 coding agent Kilo 共同創辦人分析 LLM 代理人成本暴增的根因:每步重送完整 context(到第 12 步可達 10 萬+ token)加上永遠呼叫最貴模型。80-90% 的請求其實不需要前沿模型;智慧路由可省 40-70% 成本而維持 95% 的前沿品質。UC Berkeley/Anyscale 研究+Kilo 生產數據顯示路由約降 33% 成本,否則一季要多花 $87k。

  • 80-90% 請求不需前沿模型
  • 智慧路由省 40-70%、維持 95% 品質
  • 把 AI 開銷當基礎設施預算,而非逐請求優化

💡 為什麼重要:隨 agentic 系統規模化,token 成本若無架構介入會失控,路由是基礎建設不是選配。

🔗 閱讀原文 | 來源: ByteByteGo

9. Import AI 460:社會級獎勵駭客與 Anthropic RSI 數據#

研究者建立 SocioHack 基準,測 AI 如何在不違規下鑽法律漏洞「博弈系統」,在 72 個沙盒環境中對歷史漏洞達 61% 召回、90% 精確。Anthropic 公布 2026 年合併程式碼量是 2021-24 基線的 8 倍,被視為「遞迴自我改進」(RSI)的初步指標。同期 DeepMind/蘇黎世大學的 RL 無人機僅用 27 GPU 小時就擊敗瑞士冠軍。

  • SocioHack 對歷史制度漏洞 61% 召回、90% 精確
  • Anthropic 合併程式碼量達 8 倍,RSI 初步訊號
  • RL 無人機 27 GPU 小時擊敗人類冠軍

💡 為什麼重要:當制度把規則寫成獎勵函數,AI 能利用「合規與本意之間的縫隙」,加上 RSI 訊號,對齊問題愈發急迫。

🔗 閱讀原文 | 來源: Import AI

10. OpenCV 5 發布:電腦視覺多年來最大躍進#

OpenCV 5(2026 年 6 月)完整重寫 DNN 引擎,ONNX 算子覆蓋率從 22% 跳到 80%,原生支援 LLM/VLM(內建 tokenizer 與 KV-cache,支援 Qwen 2.5、Gemma 3)。ARM 運算加速 3-4 倍,在 Intel i9-14900KS 上推論比 ONNX Runtime 快 31-36%,原生支援 FP16/BF16。

  • ONNX 算子覆蓋 22%→80%
  • 原生 LLM/VLM 支援、自動注意力融合
  • ARM 加速 3-4 倍,推論快 31-36%

💡 為什麼重要:20 多年來最大改版,把 OpenCV 推向邊緣 AI 與多模態部署的關鍵基礎設施。

🔗 閱讀原文 | 來源: OpenCV

11. Claude Fable 5 深度評測(Lenny)#

Claire Vo 搶先實測 Fable 5,三項真實工作(產品圖譜規格、技能登錄表設計、多代理協作)後結論是:跑分強,但「執行偏保守」——重驗證、求穩,而非激進求快,且 token 用量偏大。適合「正確性 > 速度」的任務,不適合對延遲敏感的場景。

  • 執行保守、安全優先,跑分強但實戰謹慎
  • token-intensive,需仔細控預算
  • 適合 code gen/財務分析等求穩任務

💡 為什麼重要:補上跑分行銷與真實表現之間的落差——benchmark 顯示能力,部署才看出它會「慢慢驗證」。

🔗 閱讀原文 | 來源: Lenny’s Newsletter

12. LLM 流量暴增 41 倍:如何成為被 AI 推薦的品牌#

PostHog 過去兩年來自 LLM 的流量成長 41 倍,且轉換率超越其他所有管道。LLM 有「放大贏家」效應:強化既有方案、壓抑新興品類。PostHog 靠 onboarding 問卷在 3 個月收集 9,214 則真實使用者 prompt,作為 AEO(AI 引擎最佳化)的競爭情報。

  • LLM 流量兩年成長 41 倍、轉換率最高
  • LLM 放大既有贏家、形成贏家通吃
  • 第一方 prompt 收集是可複製的 AEO 方法

💡 為什麼重要:AEO 已是可量測的實質營收驅動,被 AI 推薦的產品享有複利優勢。

🔗 閱讀原文 | 來源: PostHog

13. 不是 FAANG 了,是 MANGOS#

MANGOS(Meta、Anthropic、Nvidia、Google、OpenAI、SpaceX)取代 FAANG,反映即將到來的 IPO 潮與產業向 AI/自主系統的轉移。串流與電商被視為成熟業務,SpaceX、Anthropic、OpenAI 都在籌備重大 IPO,與 Meta、Google、Nvidia 並列權力核心。

  • MANGOS 取代 FAANG,AI 與太空成新核心
  • SpaceX、Anthropic、OpenAI 三家籌備 IPO
  • 消費平台(Amazon、Apple)退出「權力層」

💡 為什麼重要:象徵科技產業價值與影響力的重排,AI 基礎設施與深科技成為下一個兆元級機會。

🔗 閱讀原文 | 來源: TechCrunch

推薦閱讀#

大神動態#

  • Andrej Karpathy:以 Jevons 悖論解讀 Fable 5,「軟體像水龍頭流出來」(詳見必讀 #2)
  • Simon Willison:在 AgentsView 為 Fable 5 設定自訂定價,並用 Fable 5 本身反向工程找出設定方法
  • Jack Clark (Anthropic):警告現有經濟社會結構跟不上技術加速(詳見必讀 #9)

開源精選#

diffusionstudio/lottie — TypeScript | ⭐ 1.4K 用 codex/claude code 產生生產級 Lottie 動畫的 skill 與 harness

NoopApp/noop — Swift | ⭐ 975 離線版 WHOOP 伴侶 App,藍牙配對、資料全留在本機,無雲端無訂閱

JimLiu/baoyu-design — JavaScript | ⭐ 630 在本機把 Claude Design 當 Agent Skill 跑,產出可用的 UI mockup/原型

GordenSun/GordenSuperPPTSkills — Python | ⭐ 581 用 GPT 生成豪華圖片格式 PPT 再轉成可編輯 PPTX

amElnagdy/guard-skills — ⭐ 512 給 coding agent 的守門 skill,攔截 AI 生成程式碼/測試/文件的失敗模式

Jane-xiaoer/xiaoer-videolab — JavaScript | ⭐ 490 工具列一鍵把當前頁影片抓到本機,本地 yt-dlp 守護程序、支援 1800+ 站

jeff141/meatshell — Rust | ⭐ 465 輕量、低記憶體佔用的 SSH/終端機客戶端

影音精選#

實測 Fable 5:讓 GPT 5.5 像玩具#

1d · Matt Wolfe

Matt Wolfe

上手實測 Anthropic Fable 5,Agentic coding 基準全面超越 GPT 5.5;定價 input $10/output $50 每百萬 token(約 Opus 兩倍)。

  • 3D 水球模擬等複雜場景表現遠超其他模型
  • 定位為 Mythos 級別但已通過安全審核的模型
  • 部分安全過濾仍有誤報問題

Anthropic 開始恐慌了…#

17h · Fireship

Fireship

Anthropic 發報告警告 AI 逼近「遞迴自我改進」臨界點,呼籲業界暫停前沿開發。

  • 估值剛超 OpenAI 並即將 IPO,「暫停」反而鎖定領先
  • 與 OpenAI 2019 年 GPT-2 「太危險不能釋出」操作如出一轍
  • Fireship 點出這個時機的微妙與商業算盤

Elon 最終還是贏了(GPU 囤貨)#

1d · Theo (t3.gg)

Theo

微軟、Google、Anthropic 全面面臨算力短缺,連備援算力都要外租。

  • Anthropic 付 SpaceX 每月 10 億美元、Google 跟進每月 9.2 億
  • 當年 Elon 大量囤 GPU 如今看是神操作
  • H100 在市場上幾乎買不到

什麼是「AI Agent Loop」?#

12h · Greg Isenberg

Greg Isenberg

拆解 agentic loop 的真實樣貌:無限制 loop 燒 token 極快(有人月燒 $1.3M)。

  • 適合有固定回饋的任務,如 code review,而非開放式開發
  • 示範用 Cursor + GitHub + Greptile 跑自動 code review 到 4/5 分才出貨
  • 設預算上限是必要的安全閥

今日觀察#

把今天三條主線疊起來看,會發現一個矛盾:Fable 5 讓 Stripe 一天改寫 5000 萬行、Lovable 每週生出百萬個專案,Karpathy 說軟體開始「像水龍頭流出來」——但 Cognition 的 FrontierCode 同時告訴你,最強模型在「真正能合併進產品的程式碼」上只拿 13%。水龍頭流出來的不一定是能喝的水。更耐人尋味的是 Anthropic 的雙手:一手把油門踩到底、估值超車 OpenAI 衝向 IPO,一手發報告說 AI 快要失控、該考慮暫停。當賣鏟子的人同時是喊「礦坑危險」的人,他的每句話都可能同時是真誠與話術。對開發者來說,今天真正該練的不是更會用 Fable 5,而是 FrontierCode 在測的那件事——在一片「能跑就好」的洪流裡,還守得住「這段程式碼到底該不該合併」的判斷力。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有