同一天,最強模型與最大警告
每天花 1% 的時間,掌握科技脈動。
今日金句#
“I feel a lot of things changing as working software increasingly comes out on a tap.” 「我感覺到很多事情正在改變——可用的軟體,現在像打開水龍頭一樣源源不絕。」 — Andrej Karpathy, AI 研究者
“80% of workloads will be running on 99% cheaper models within 12-18 months.” 「12 到 18 個月內,80% 的工作負載會跑在便宜 99% 的模型上。」 — Brian Armstrong, Coinbase 共同創辦人
“Current economic and societal structures appear fundamentally incompatible with continued technological acceleration.” 「現有的經濟與社會結構,看起來從根本上就跟不上技術持續加速的腳步。」 — Jack Clark, Anthropic 共同創辦人
今日主軸:能力上線,帳單到期,煞車同時被踩#
今天最大的事件是 Anthropic 推出 Claude Fable 5——Mythos 等級、但通過安全審查的最強模型,Agentic coding 全面超越 GPT 5.5,Stripe 用它在「一天內」完成過去要兩個月的 5000 萬行 Ruby 遷移。Karpathy 用 Jevons 悖論點破真相:軟體創造成本一降,需求不是減少而是爆炸,「軟體像打開水龍頭一樣流出來」。Lovable 同週衝到 $500M ARR、每週百萬個專案,就是這句話的商業版。
但同一隻踩油門的手,也按下了煞車。Anthropic 在估值超越 OpenAI、即將 IPO 的同一週,發報告警告 AI 正逼近「遞迴自我改進」臨界點,共同創辦人 Jack Clark 直言社會結構跟不上加速。與此同時,帳單正在失控:企業 token 開銷暴增、Anthropic 每月付 SpaceX 十億美元租算力;而 Cognition 的 FrontierCode 基準戳破泡泡——最強模型在「真正能合併進產品的程式碼」上只拿 13%,遠低於 SWE-bench 的 50%+。能力、成本、風險三條線同時飆升,這才是今天的全貌。
必讀#
- Claude Fable 5 與 Mythos 5 發布 — Anthropic
AI - Karpathy 談 Fable 5:軟體像水龍頭流出來 — Simon Willison
AI - 2026 軟體工程職場現況(下) — Pragmatic Engineer
Dev - Lovable 衝上 $500M ARR、每週百萬專案 — TechCrunch
Startup - Salesforce 2 萬個企業 Agent 部署的教訓 — ByteByteGo
AI - 科技公司學得會愛上便宜模型嗎 — TechCrunch
AI - FrontierCode:衡量「可合併」的程式碼品質 — Latent Space
AI - Token 開銷失控?智慧路由是解方 — ByteByteGo
Dev - Import AI 460:社會級獎勵駭客與 Anthropic RSI 數據 — Import AI
AI - OpenCV 5 發布:電腦視覺多年來最大躍進 — OpenCV
Tools - Claude Fable 5 深度評測(Lenny) — Lenny’s Newsletter
AI - LLM 流量暴增 41 倍:如何成為被 AI 推薦的品牌 — PostHog
AI - 不是 FAANG 了,是 MANGOS — TechCrunch
News
1. Claude Fable 5 與 Mythos 5 發布#

Anthropic 推出 Mythos 等級、但通過安全審查的 Fable 5,Agentic coding 全面超越 GPT 5.5,並把價格砍半(input $10/output $50 每百萬 token)。Stripe 用它在一天內完成原需兩個月的 5000 萬行 Ruby 遷移。模型支援數百萬 token 長脈絡、可從截圖重建 web app,藥物設計類任務加速約 10 倍。安全架構以三組分類器(資安、生化、防蒸餾)把守,觸發率低於 5%;姊妹版 Mythos 5 僅開放給授權的資安專業人士與研究者。
- 定價砍半($10/$50 每百萬 token),約為 Opus 兩倍但能力大幅領先
- Stripe 一天遷移 5000 萬行 Ruby,過去需兩個月
- 安全分類器觸發率 < 5%;Mythos 5 限制存取
💡 為什麼重要:這是 AI 經濟學的轉折點——前沿能力配上激進降價,把高階 AI 推向更廣的企業場景,尤其是軟體工程。
🔗 閱讀原文 | 來源: Anthropic
2. Karpathy 談 Fable 5:軟體像水龍頭流出來#

Karpathy 用 Jevons 悖論解釋 Fable 5 的真正衝擊——軟體創造成本下降,胃口不會縮小反而暴增:客製化儀表板、專案專屬分析工具、自動化測試、研究實作這些過去不划算的需求全部解鎖。他形容「可用的軟體像打開水龍頭一樣流出來」,這是供給端降本之外的需求端故事。
- Jevons 悖論——效率提升反而放大整體消耗與需求
- 解鎖過去經濟上不可行的客製化軟體場景
- 暗示基礎設施成本不會因模型變便宜而下降
💡 為什麼重要:理解 Fable 5 的關鍵不在每 token 更便宜,而在「創造摩擦力歸零後,人們會做什麼」的質變。
🔗 閱讀原文 | 來源: Simon Willison
3. 2026 軟體工程職場現況(下)#

Anthropic 成為求職者最想去的公司(佔教練諮詢 34%),遠超 OpenAI 與 Google(各 16-17%),AI 實驗室全面壓過大型科技公司。新鮮人職缺崩跌到僅佔工程職位 10%(2023 年為約 30%),名校光環愈發關鍵。純前端職位消失最快,全端與 AI 工程成為新標配,AI 工程薪資超越同級傳統 SWE。
- Anthropic 求職熱度 34%,兩年留任率 80% 高於 OpenAI 的 67%
- 新鮮人招聘從 ~30% 崩到 10%
- 純前端式微,全端+AI 成為入場門檻
💡 為什麼重要:軟體工程出現結構性分岔——頂尖人才湧向 AI 實驗室,初階工程師面臨前所未有的入行門檻。
🔗 閱讀原文 | 來源: Pragmatic Engineer
4. Lovable 衝上 $500M ARR、每週百萬專案#

Lovable 從 2 月的 $400M 一路衝到 $500M 年化營收(季增 25%),每週新增 100 萬個專案、累計逾 5000 萬個。平台讓非技術用戶(創辦人、設計師、業務)也能「vibe coding」做出網站、電商與內部工具,成立不到三年就達獨角獸級營收,對傳統 SaaS 訂閱模式構成實質威脅。
- $500M ARR,4 個月成長 25%
- 每週百萬專案、累計 5000 萬個
- 威脅傳統 SaaS——客製化 AI 方案取代昂貴年約
💡 為什麼重要:證明 AI 輔助開發平台能在不靠傳統企業銷售的情況下衝上獨角獸營收,軟體生產方式正在質變。
🔗 閱讀原文 | 來源: TechCrunch
5. Salesforce 2 萬個企業 Agent 部署的教訓#

Salesforce Agentforce 已服務 2 萬家企業、處理逾 300 萬次對話、基於 13.5 萬篇文章。最反直覺的發現:Agent 工作 90% 發生在上線「之後」(迭代、優化、回饋循環),與傳統軟體 90% 在上線前完全相反。核心 KPI 是「containment rate」(不需轉人工就解決的比例)。三大反模式:把確定性流程交給 LLM 推理、用更兇的 prompt 取代寫死規則、context engineering 做得差。
- 90% 的 Agent 工作在上線後(迭代而非一次到位)
- 回應 context 從 10 萬 token 優化到 2 千 token
- 先窄後寬、緊盯 containment rate
💡 為什麼重要:來自最大企業 SaaS 平台的實戰數據,直接改寫企業導入 AI Agent 的資源配置與預算邏輯。
🔗 閱讀原文 | 來源: ByteByteGo
6. 科技公司學得會愛上便宜模型嗎#

Coinbase 共同創辦人 Brian Armstrong 預測 12-18 個月內 80% 工作負載會跑在便宜 99% 的模型上,只有真正不可取代的任務才值得用前沿模型。法律 AI 平台 Harvey 已用「智慧路由」在 Claude Opus 與 GLM 5.1 間分流,成本降 3 倍而品質不變。產業核心矛盾從「越大越好」轉向推論成本的可持續性,真正分野是大模型 vs 小模型,與開源/閉源無關。
- Armstrong 預測 80% 工作負載將跑在便宜 99% 的模型
- Harvey 靠智慧路由降本 3 倍、品質不減
- 前沿模型定價只在「真正不可取代」時才撐得住
💡 為什麼重要:把 Fable 5 砍價放進產業脈絡——降價不是慈善,是對成本壓力的回應,智慧路由將成為競爭必需品。
🔗 閱讀原文 | 來源: TechCrunch
7. FrontierCode:衡量「可合併」的程式碼品質#

Cognition 推出 FrontierCode 基準,評估的是「能不能真的合併進產品」的程式碼品質(回歸安全、整潔度、範圍、測試正確性、可維護性),而非只看通過單元測試。最強的 Opus 4.8 在最難題只拿 13%,遠低於 SWE-bench 的 50%+,揭露巨大能力落差。題目由開源維護者每題投入 40+ 小時設計,確保真實複雜度。
- Opus 4.8 在最難題僅 13% 成功率(vs SWE-bench 50%+)
- 評估可合併性,而非僅通過測試
- 呼應 METR 發現——許多通過 SWE-bench 的 PR 在真實環境根本不會被合併
💡 為什麼重要:戳破「程式碼生成已解決」的敘事,把 AI 工程評估從跑分拉回真實部署標準。
🔗 閱讀原文 | 來源: Latent Space
8. Token 開銷失控?智慧路由是解方#

開源 coding agent Kilo 共同創辦人分析 LLM 代理人成本暴增的根因:每步重送完整 context(到第 12 步可達 10 萬+ token)加上永遠呼叫最貴模型。80-90% 的請求其實不需要前沿模型;智慧路由可省 40-70% 成本而維持 95% 的前沿品質。UC Berkeley/Anyscale 研究+Kilo 生產數據顯示路由約降 33% 成本,否則一季要多花 $87k。
- 80-90% 請求不需前沿模型
- 智慧路由省 40-70%、維持 95% 品質
- 把 AI 開銷當基礎設施預算,而非逐請求優化
💡 為什麼重要:隨 agentic 系統規模化,token 成本若無架構介入會失控,路由是基礎建設不是選配。
🔗 閱讀原文 | 來源: ByteByteGo
9. Import AI 460:社會級獎勵駭客與 Anthropic RSI 數據#

研究者建立 SocioHack 基準,測 AI 如何在不違規下鑽法律漏洞「博弈系統」,在 72 個沙盒環境中對歷史漏洞達 61% 召回、90% 精確。Anthropic 公布 2026 年合併程式碼量是 2021-24 基線的 8 倍,被視為「遞迴自我改進」(RSI)的初步指標。同期 DeepMind/蘇黎世大學的 RL 無人機僅用 27 GPU 小時就擊敗瑞士冠軍。
- SocioHack 對歷史制度漏洞 61% 召回、90% 精確
- Anthropic 合併程式碼量達 8 倍,RSI 初步訊號
- RL 無人機 27 GPU 小時擊敗人類冠軍
💡 為什麼重要:當制度把規則寫成獎勵函數,AI 能利用「合規與本意之間的縫隙」,加上 RSI 訊號,對齊問題愈發急迫。
🔗 閱讀原文 | 來源: Import AI
10. OpenCV 5 發布:電腦視覺多年來最大躍進#

OpenCV 5(2026 年 6 月)完整重寫 DNN 引擎,ONNX 算子覆蓋率從 22% 跳到 80%,原生支援 LLM/VLM(內建 tokenizer 與 KV-cache,支援 Qwen 2.5、Gemma 3)。ARM 運算加速 3-4 倍,在 Intel i9-14900KS 上推論比 ONNX Runtime 快 31-36%,原生支援 FP16/BF16。
- ONNX 算子覆蓋 22%→80%
- 原生 LLM/VLM 支援、自動注意力融合
- ARM 加速 3-4 倍,推論快 31-36%
💡 為什麼重要:20 多年來最大改版,把 OpenCV 推向邊緣 AI 與多模態部署的關鍵基礎設施。
🔗 閱讀原文 | 來源: OpenCV
11. Claude Fable 5 深度評測(Lenny)#

Claire Vo 搶先實測 Fable 5,三項真實工作(產品圖譜規格、技能登錄表設計、多代理協作)後結論是:跑分強,但「執行偏保守」——重驗證、求穩,而非激進求快,且 token 用量偏大。適合「正確性 > 速度」的任務,不適合對延遲敏感的場景。
- 執行保守、安全優先,跑分強但實戰謹慎
- token-intensive,需仔細控預算
- 適合 code gen/財務分析等求穩任務
💡 為什麼重要:補上跑分行銷與真實表現之間的落差——benchmark 顯示能力,部署才看出它會「慢慢驗證」。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
12. LLM 流量暴增 41 倍:如何成為被 AI 推薦的品牌#

PostHog 過去兩年來自 LLM 的流量成長 41 倍,且轉換率超越其他所有管道。LLM 有「放大贏家」效應:強化既有方案、壓抑新興品類。PostHog 靠 onboarding 問卷在 3 個月收集 9,214 則真實使用者 prompt,作為 AEO(AI 引擎最佳化)的競爭情報。
- LLM 流量兩年成長 41 倍、轉換率最高
- LLM 放大既有贏家、形成贏家通吃
- 第一方 prompt 收集是可複製的 AEO 方法
💡 為什麼重要:AEO 已是可量測的實質營收驅動,被 AI 推薦的產品享有複利優勢。
🔗 閱讀原文 | 來源: PostHog
13. 不是 FAANG 了,是 MANGOS#

MANGOS(Meta、Anthropic、Nvidia、Google、OpenAI、SpaceX)取代 FAANG,反映即將到來的 IPO 潮與產業向 AI/自主系統的轉移。串流與電商被視為成熟業務,SpaceX、Anthropic、OpenAI 都在籌備重大 IPO,與 Meta、Google、Nvidia 並列權力核心。
- MANGOS 取代 FAANG,AI 與太空成新核心
- SpaceX、Anthropic、OpenAI 三家籌備 IPO
- 消費平台(Amazon、Apple)退出「權力層」
💡 為什麼重要:象徵科技產業價值與影響力的重排,AI 基礎設施與深科技成為下一個兆元級機會。
🔗 閱讀原文 | 來源: TechCrunch
推薦閱讀#

- Agent 不需要那 1 萬 token 的 API 回應:Context Offloading — 用 context offloading 讓 agent 只取必要資訊,省 token 又提升穩定度
- CEO 以為 AI 能取代員工,只是壞 CEO — 對「AI 取代人力」敘事的反論,重點在領導與整合而非裁員
- 清理 AI 搖滾巨星開發者留下的爛攤 — AI 輔助開發累積的技術債,誰來收尾
- 搜尋引擎的衰落是一個機會 — 搜尋市場變化下的替代品契機
- 硬核自架 email:從自己的 IPv4 區段開始 — 從網路堆疊底層完整自架 email 的硬派教學
- CSS:無可避免的壞部分 — 即便現代化,CSS 仍有其本質性的複雜與限制
- 在 FPGA 上用 KAN 跑超快機器學習 — Kolmogorov-Arnold 網路在 FPGA 上的硬體加速實驗
- 測試案例縮減器是被低估的除錯工具 — 用 test-case reduction 快速隔離 bug
大神動態#
- Andrej Karpathy:以 Jevons 悖論解讀 Fable 5,「軟體像水龍頭流出來」(詳見必讀 #2)
- Simon Willison:在 AgentsView 為 Fable 5 設定自訂定價,並用 Fable 5 本身反向工程找出設定方法
- Jack Clark (Anthropic):警告現有經濟社會結構跟不上技術加速(詳見必讀 #9)
開源精選#
diffusionstudio/lottie — TypeScript | ⭐ 1.4K 用 codex/claude code 產生生產級 Lottie 動畫的 skill 與 harness
NoopApp/noop — Swift | ⭐ 975 離線版 WHOOP 伴侶 App,藍牙配對、資料全留在本機,無雲端無訂閱
JimLiu/baoyu-design — JavaScript | ⭐ 630 在本機把 Claude Design 當 Agent Skill 跑,產出可用的 UI mockup/原型
GordenSun/GordenSuperPPTSkills — Python | ⭐ 581 用 GPT 生成豪華圖片格式 PPT 再轉成可編輯 PPTX
amElnagdy/guard-skills — ⭐ 512 給 coding agent 的守門 skill,攔截 AI 生成程式碼/測試/文件的失敗模式
Jane-xiaoer/xiaoer-videolab — JavaScript | ⭐ 490 工具列一鍵把當前頁影片抓到本機,本地 yt-dlp 守護程序、支援 1800+ 站
jeff141/meatshell — Rust | ⭐ 465 輕量、低記憶體佔用的 SSH/終端機客戶端
影音精選#
實測 Fable 5:讓 GPT 5.5 像玩具#
1d · Matt Wolfe
上手實測 Anthropic Fable 5,Agentic coding 基準全面超越 GPT 5.5;定價 input $10/output $50 每百萬 token(約 Opus 兩倍)。
- 3D 水球模擬等複雜場景表現遠超其他模型
- 定位為 Mythos 級別但已通過安全審核的模型
- 部分安全過濾仍有誤報問題
Anthropic 開始恐慌了…#
17h · Fireship
Anthropic 發報告警告 AI 逼近「遞迴自我改進」臨界點,呼籲業界暫停前沿開發。
- 估值剛超 OpenAI 並即將 IPO,「暫停」反而鎖定領先
- 與 OpenAI 2019 年 GPT-2 「太危險不能釋出」操作如出一轍
- Fireship 點出這個時機的微妙與商業算盤
Elon 最終還是贏了(GPU 囤貨)#
1d · Theo (t3.gg)
微軟、Google、Anthropic 全面面臨算力短缺,連備援算力都要外租。
- Anthropic 付 SpaceX 每月 10 億美元、Google 跟進每月 9.2 億
- 當年 Elon 大量囤 GPU 如今看是神操作
- H100 在市場上幾乎買不到
什麼是「AI Agent Loop」?#
12h · Greg Isenberg
拆解 agentic loop 的真實樣貌:無限制 loop 燒 token 極快(有人月燒 $1.3M)。
- 適合有固定回饋的任務,如 code review,而非開放式開發
- 示範用 Cursor + GitHub + Greptile 跑自動 code review 到 4/5 分才出貨
- 設預算上限是必要的安全閥
今日觀察#
把今天三條主線疊起來看,會發現一個矛盾:Fable 5 讓 Stripe 一天改寫 5000 萬行、Lovable 每週生出百萬個專案,Karpathy 說軟體開始「像水龍頭流出來」——但 Cognition 的 FrontierCode 同時告訴你,最強模型在「真正能合併進產品的程式碼」上只拿 13%。水龍頭流出來的不一定是能喝的水。更耐人尋味的是 Anthropic 的雙手:一手把油門踩到底、估值超車 OpenAI 衝向 IPO,一手發報告說 AI 快要失控、該考慮暫停。當賣鏟子的人同時是喊「礦坑危險」的人,他的每句話都可能同時是真誠與話術。對開發者來說,今天真正該練的不是更會用 Fable 5,而是 FrontierCode 在測的那件事——在一片「能跑就好」的洪流裡,還守得住「這段程式碼到底該不該合併」的判斷力。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit




