yii.
← Digest
EP177 · 2026年8月28日 星期五 · 17 min read

中立的那一層

開源模型的公共倉庫賣給了賣 GPU 的那一家,130 億美元,約 80 倍年營收

每天花 1% 的時間,掌握科技脈動。

今日金句#

“The trust model is broken. Agents treat vendor docs as ground truth and don’t question them.” 「信任模型壞掉了。Agent 把廠商文件當成事實,不會去質疑它。」 — Alon Hertz,以色列資安新創研究員,llms.txt 供應鏈研究作者

“The classifier allowed the creation of the malware process, but then it blocked the command intended to stop it!” 「分類器放行了惡意程序的啟動,然後擋下了要終止它的那道指令!」 — Johann Rehberger (wunderwuzzi),提示注入資安研究者

“I don’t even call them pull requests. I call them prompt requests.” 「我已經不叫它們 pull request 了。我叫它們 prompt request。」 — Peter Steinberger,OpenClaw 作者

今日主軸:三個平台,三個完全不同的答案#

Hugging Face 在 2025 年底拒絕過一筆 5 億美元的投資,公開理由是不想要一個能左右決策的主導投資人。今天 The Information 報導它將以超過 130 億美元賣給 Nvidia,約當它 1.5 億美元年營收的 80 倍。這家公司之所以能成為開源 AI 的基礎設施,正是因為它同時支援 AMD 與 Intel 的中立位置,而現在買下它的是賣 GPU 的那一家。

同一天,SourceHut 走上完全相反的路,直接把「用 LLM 寫的、或協助使用 LLM 的原創內容」列進禁止事項,9 月 10 日對新專案生效,理由從 CI 資源浪費一路講到 AI 的電力消耗與繞過 copyleft 授權。而 OpenClaw 選了第三條路:388,000 顆星、被自動化「軟體工廠」一次開幾百個 PR 灌爆之後,維護者不擋也不逃,改成要求貢獻者附上 agent 逐字稿與測試截圖,把信任訊號從「你交了多少」換成「你看不看得懂自己交了什麼」。

三個平台承受同一股壓力,一個賣掉、一個立法、一個改寫規則。

必讀#

  1. Nvidia 將以超過 130 億美元收購 Hugging Face — Business Insider News
  2. 研究者打穿 Claude Code Auto Mode,成功率 80% — Simon Willison Security
  3. Anthropic 發表 Model Hardware Standard,讓 agent 驅動實體裝置 — Ars Technica AI
  4. 被 AI 取代的工程師,做了一個開源 AI CEO — GitHub AI
  5. Cloudflare 靠五次 Rust 改寫,替 1.1.1.1 省下 100 TB 記憶體 — Cloudflare Dev
  6. Microduck:399 美元的全開源機器鴨開放預購 — Pollen Robotics Product
  7. Amazon Mechanical Turk 將於 9 月 30 日關閉 — Amazon News
  8. llms.txt 成為新攻擊面,AI agent 在企業內網裝了無主套件 — Ars Technica Security
  9. 小模型時代到了:同一份工作從 1 美元降到 0.1 美元 — calv.info AI
  10. 用 47,464 個 PR 量出 Claude 的詞彙指紋 — Show HN Dev
  11. SourceHut 修改服務條款,全面禁止 LLM 產出的原創內容 — SourceHut Dev
  12. OpenClaw 爆紅之後:維護者怎麼撐住 388,000 顆星 — GitHub Blog Dev
  13. Asahi Linux 進度報告:Linux 7.2 — Asahi Linux Dev
  14. Gemini Omni 1.1 Flash 開放建置,可控性提升 — Google AI

1. Nvidia 將以超過 130 億美元收購 Hugging Face#

The Information 率先披露,Nvidia 已就收購 Hugging Face 談判數週,估值超過 130 億美元(Ars Technica 引述的具體數字是 129 億),交易尚未定案、仍有破局可能。這個價格約當 Hugging Face 1.5 億美元年經常性收入的 80 倍,也接近 Nvidia 今年 1 月開出、被對方拒絕的 70 億美元報價的兩倍。2025 年底 Hugging Face 還拒絕過一筆 5 億美元投資(隱含估值 70 億),當時公開的理由是不想要一個能左右決策的主導投資人。

  • 微軟也曾洽談但目前已無進展,Salesforce 同樣被點名為潛在買家
  • Nvidia 早在 2023 年那輪 2.35 億美元募資(估值 45 億)就已持股,Google 與微軟當時也有投資
  • Nvidia 本會計年度剩餘期間另有 180 億美元的股權投資額度,帳上已持有 479 億美元私人公司股權
  • Hugging Face 由 Clément Delangue、Julien Chaumond、Thomas Wolf 於 2016 年創立,目前仍未獲利

💡 為什麼重要:Hugging Face 能成為開源 AI 的基礎設施,靠的是同時支援 AMD、Intel 等 Nvidia 競爭對手的中立位置。由賣 GPU 的公司持有它,這個中立性就變成一個需要被信任而非被結構保證的東西。如果你有模型或資料集是產品關鍵路徑,現在值得評估是否要在別處留一份鏡像。

🔗 閱讀原文 | 來源: Business Insider

2. 研究者打穿 Claude Code Auto Mode,成功率 80%#

Claude Code 在 8 月中把 Auto Mode 設為預設啟動模式,用一個安全分類器取代逐步人工確認。Anthropic 委託第三方 Trajectory Labs 測試 72 種情境、每種 10 次,公布的間接提示注入攻擊成功率是 0.00%。資安研究者 Johann Rehberger 隨後公開一條攻擊鏈,三個變體的成功率分別是 3/5、3/5、4/5,最高 80%。

  • 攻擊靠 Python 模組遮蔽:誘導 Claude 下載內含惡意 struct.py 的壓縮檔,Claude 自行撰寫的解碼腳本 import base64 時,Python 從解壓目錄載入攻擊者的 struct.py 而非標準函式庫
  • 多次測試中,Claude 察覺被入侵並嘗試終止惡意程序時,Auto Mode 的分類器反而擋下了那道清除指令
  • 一個變體讓惡意程式再開一個 headless 的 claude -p 子行程,執行 whoami/uname/id 偵察並在工作區外寫檔
  • Anthropic 資安團隊將此案結為 Informative(設計如此),聲明 Auto Mode 是盡力而為的便利分類器而非安全保證,多步驟注入鏈不在範圍

💡 為什麼重要:固定的 72 情境基準測不出有動機的新攻擊鏈,而分類器在誤放之後還會妨礙 agent 自救。Rehberger 與 Simon Willison 的結論一致:面對任何對抗風險,唯一可靠的做法是容器或 VM 沙箱、限制對外連線,不要把家目錄、SSH 金鑰、雲端憑證暴露給 agent。

🔗 閱讀原文 | 來源: Simon Willison

3. Anthropic 發表 Model Hardware Standard,讓 agent 驅動實體裝置#

Anthropic 在 8 月 27 日推出 Model Hardware Standard(MHS)研究預覽,這是一套標準化的驅動介面,用 read/write 兩種基本操作(例如「取得溫度」「設定溫度」)讓 AI agent 直接操作任意實體裝置,不必為每台儀器寫專屬的轉譯層。Anthropic 表示裝置整合時間可以從數週、數月壓縮到數小時甚至數分鐘。

  • 靈感來自 Anthropic 技術人員 Alek Kemeny 觀察神經科學家 Arco Bast 在 HHMI Janelia 研究園區為記憶形成實驗手工串接雷射、顯微鏡與相機
  • Demo 中 Claude 在沒有針對性訓練的情況下推理出如何讓機械手臂拿起鋁罐,另一段則靠相機回饋反覆校正雷射,再把流程編譯成單一指令可執行的確定性 API 腳本
  • MHS 標籤把重量、行程範圍、安全上限等實體限制寫進自動產生的參考檔,讓模型能安全操作沒見過的硬體
  • 首批研究預覽夥伴:AWS(Strands Robots)、Hugging Face(LeRobot)、Raspberry Pi、Automata、Universal Robots;可透過 MCP、CLI 或 API 程式碼檔控制

💡 為什麼重要:這是 agentic AI 從純軟體跨進實體世界的介面層,而且 Anthropic 明說計畫最終開源成 agent-agnostic 標準。如果成立,它之於實驗室儀器與工廠設備,會像 MCP 之於軟體工具。

🔗 閱讀原文 | 來源: Ars Technica

4. 被 AI 取代的工程師,做了一個開源 AI CEO#

Open Executive(1,501 stars、Apache 2.0)把 8 個專業 Claude agent 包成單一「虛擬高階主管」的一致聲音:CSO、CFO、人資長、法務長、COO、CMO、CPO 與董事會溝通總監。使用者看不到內部的多 agent 結構,只會收到一個人格的回覆。專案標語直接寫著「CEO 為了 AI 開除工程師,工程師做了一個開源 AI CEO」。

  • 架構:Executive Orchestrator 跑 claude-sonnet-4-6 負責路由並平行呼叫專家;深度推理的 CSO/CFO/法務/董事會改用 claude-opus-4-7 加 extended thinking
  • 兩層 RAG:內建 MBA 等級知識灌進 ChromaDB,另有獨立的 company_docs 集合放使用者上傳的簡報、財務模型與策略文件
  • 情節記憶:每次回覆後由 claude-haiku-4-5 在背景抽出決策與行動寫進 SQLite,下次開場帶入 <past_decisions> 區塊
  • Eval 有 29 個情境、由 claude-opus-4-7 當評審打 5 個維度,CI 要求平均 ≥3.5/5,任一維度比 main 掉超過 10% 就擋 PR

💡 為什麼重要:撇開話題性,這是一份可以直接抄的生產級多 agent 參考架構——路由、雙層 RAG、情節記憶、快取感知的 system prompt 設計、多通道 bot 整合,而且同一份程式碼同時支援 Anthropic API、OpenRouter 與本機模型(Ollama/vLLM/llama.cpp)。

🔗 閱讀原文 | 來源: GitHub

5. Cloudflare 靠五次 Rust 改寫,替 1.1.1.1 省下 100 TB 記憶體#

Cloudflare 的 Big Pineapple DNS 平台隨時存放超過 2,500 億筆 DNS 快取,在這個規模下每筆多浪費一個 byte 就是全機隊 250 GB 以上。工程團隊做了五次連續的資料結構改寫,把每筆記憶體佔用從 953 bytes 壓到 420 bytes,實際釋出約 100 TB,相當於 130 台 Gen 13 伺服器的記憶體總和。

  • 五步:用 Box<[T]>/Box<str> 取代 Vec/String 去掉容量欄位;三段記錄清單合併成一段並改用 u16 offset;記錄的 owner 欄位與查詢網域相同時直接不存;把 NAPTR 這類 144 bytes 的大 enum variant 裝箱,避免 A/AAAA 陪著付 padding;最後直接存原始 wire-format bytes
  • 速度同時變快:快取寫入吞吐從每秒 62.5 萬筆升到 89.3 萬筆(+43%),查詢延遲從 828ns 降到 670ns(-19%)
  • 單一執行個體的 p99 常駐記憶體從 9.3 GB 降到 5.3 GB(-43%)
  • 5 月 18 日開始推送,7 月 6 日完成全服務部署;釋出的記憶體將回頭用來擴大快取容量

💡 為什麼重要:這證明記憶體與速度不總是取捨——當瓶頸來自配置浪費而非演算法複雜度時,兩邊可以一起贏。任何在 Rust 裡放幾十億個小物件的人都該讀一次這五個手法。

🔗 閱讀原文 | 來源: Cloudflare

6. Microduck:399 美元的全開源機器鴨開放預購#

Hugging Face 旗下的 Pollen Robotics 在 8 月 27 日開放 Microduck 預購,售價 399 美元(未稅未含運),耶誕節前出貨,四種配色。機身 25 公分、約 800 公克、15 顆馬達,配相機、LiDAR 與兩顆 IMU,板上策略迴圈 50Hz,出廠內建走路、坐下起立、踢、抓取、輪滑與跌倒爬起 7 種動作。

  • 完全開源:SDK、模擬器與整套強化學習訓練流程都以 Apache-2.0 放在 GitHub(pollen-robotics/microduck)
  • Sim2real 流程:行為先在 MuJoCo 物理模擬中訓練(本機或透過 Hugging Face Jobs),再部署到實體機,使用者可以自行重訓並把新策略分享回社群
  • 配件:充電包 39 美元、開發包 119 美元(備用馬達線材、電池、NFC 標籤與 HF 訓練額度)、配件包 39 美元
  • 承接 Hugging Face 2025 年 4 月收購 Pollen Robotics 後的 Reachy Mini(499 美元)與 Reachy Mini Lite(399 美元)產品線

💡 為什麼重要:把 embodied AI 的價格帶壓到 399 美元,而且整個行為訓練堆疊開源可重訓,方向和封閉的人形機器人玩家正好相反。Hugging Face 想對實體 AI 做的事,就是它當年對開源權重做過的事。

🔗 閱讀原文 | 來源: Pollen Robotics

7. Amazon Mechanical Turk 將於 9 月 30 日關閉#

mturk.com 首頁掛出公告:「我們定期評估自己的方案、工具與服務並據此調整。評估之後,我們決定關閉 Amazon Mechanical Turk,2026 年 9 月 30 日生效。」現有的 Worker 與 Requester 被導向一頁 FAQ 準備遷移。MTurk 自 2005 年上線,是資料驗證、內容審核、問卷與機器學習資料集標註的 human-in-the-loop 微工作市集始祖。

  • Hacker News 討論串取得 518 分、157 則留言
  • 最高票留言認為 MTurk 服務的本來就是不需要技能的任務,正好是 AI 現在做得夠好、好到請人驗證都不划算的那一類
  • 同一串有很長的子討論在辯論群眾外包會不會以「遠端遙控機器人」的形式回來,包括讓不受信任的人操作實體 AI 的安全疑慮

💡 為什麼重要:一個 21 年的人力群眾外包平台在 agent 拿到實體裝置驅動介面的同一週收攤。這兩件事放在一起看,微工作不見得是消失,比較像是換了一個位置,從「機器做不到,找人做」變成「機器做得到了,找人幫它動手」。

🔗 閱讀原文 | 來源: Amazon

8. llms.txt 成為新攻擊面,AI agent 在企業內網裝了無主套件#

一家以色列隱形新創掃描了 6,214 個國防承包商、財星 500 大與大型科技公司的網域,在找到的 8,265 份 llms.txt/llms-full.txt 裡,有 120 份指向未註冊的套件或網域,共 227 條指向不存在目標的安裝指令。研究團隊註冊了其中幾個無主名稱並放上回報程式,一小時內就收到一家財星 500 大企業的連線。

  • 回報記錄的父行程顯示,安裝動作是由 Claude、OpenAI Codex 與 Nous Research 的 Hermes 觸發的;三家公司都未回應採訪
  • 已有實際攻擊:clerk.com 的 llms.txt 引用 npx clerk-next-fix-auth-protection,該套件名稱早已被他人搶註並放上惡意程式,Clerk 事後已修正
  • 端點偵測抓不到,因為畫面上就是開發者用公司核可的 coding agent 從 pypi.org 執行 pip install,沒有任何異常訊號
  • npx 可以直接抓取並執行套件到快取而不寫進專案的相依清單,比一般安裝更難察覺

💡 為什麼重要:llms.txt 是 AI 時代的 robots.txt,但它沒有任何稽核機制,而 coding agent 把它當權威文件在讀。這條信任鏈還會跨到第三方廠商文件,等於把供應鏈攻擊面延伸到現有資安工具根本沒在看的地方。

🔗 閱讀原文 | 來源: Ars Technica

9. 小模型時代到了:同一份工作從 1 美元降到 0.1 美元#

Segment 共同創辦人 Calvin French-Owen 實測 gpt-5.6-luna,速度約每秒 100 tokens,能掃完他整個程式庫、信箱與知識庫,就算是跨數千封信的複雜研究任務,API 成本也只有幾十美分。他一個「個人化每日新聞網站」的 eval,用上一代 Sonnet 等級模型跑一次約 1 美元,換成 luna 平均只要 0.1 美元。

  • 他認為這個差距就是「訂閱制做不做得起來」的分界線,而不只是省錢
  • GLM 5.3 被列在同一條成本/效能 Pareto 前緣上
  • 有投資人問他為什麼消費級 AI 公司這麼少,他的答案是推論成本,「便宜網站 + 病毒傳播 + 廣告」這套經典打法在每個請求都有實際推論成本時就破了
  • 真正困難的程式工作他仍然用最貴的前沿模型,小模型的機會在量大得多的日常商務往來

💡 為什麼重要:把模型選擇從「哪個最聰明」改成「這個任務的單次成本是多少」。10 倍的成本差距,往往就是一個功能能不能變成產品的差別。他也提醒,小模型要真的進商務流程,還缺 harness、提示注入防護與角色權限這幾塊。

🔗 閱讀原文 | 來源: calv.info

10. 用 47,464 個 PR 量出 Claude 的詞彙指紋#

Louis Abraham 每天抓 100 個 GitHub Pull Request,累積 595 天、47,464 個 PR、5,024,747 次詞彙出現,再用 KL 散度 k-means 把語料分成 8 個詞彙群集。其中一個群集在 2026 年才出現,而在最近的 4 週窗口裡,它佔了所有「人類署名」PR 的約 44.6%。

  • 該群集最具辨識度的詞(依 lift 排序):load-bearing(123.04 倍)、quietly(62.8 倍)、survived(61.5 倍)、latent(39.6 倍)、genuine(38.5 倍),後面還有 seam、ladder、carries、pre-fix、byte-identical
  • 站上直接寫著這些詞「對任何用過 coding agent 的人來說應該都很眼熟」
  • 每週語料量介於 37,000 到 129,000 字,群集強度以「每百萬字出現次數」追蹤變化
  • 完整程式碼與方法論公開在 GitHub(louisabraham/load-bearing)

💡 為什麼重要:它把「AI 寫的東西讀起來都一樣」這個直覺變成可測量的長期曲線。有趣的是這和 Anthropic 的文字浮水印剛好是同一件事的兩面,一個是加密的來源標記,一個是被研究者從公開資料逆向出來的風格指紋。

🔗 閱讀原文 | 來源: Show HN

11. SourceHut 修改服務條款,全面禁止 LLM 產出的原創內容#

SourceHut 新版服務條款把「以 LLM 或其他生成式 AI 撰寫、或協助使用這類技術的原創內容」列入禁止事項,涵蓋原始碼、素材、工單與郵件,經過兩週公告期後於 9 月 10 日對新專案生效。這是繼 Codeberg 7 月底的限制之後,第二個正式對 AI 協作設限的 forge。

  • 執行方式刻意輕量:不做自動偵測、不溯及既往,但新工作必須合規,否則要遷離(官方建議自架 SourceHut、Forgejo,或「GitHub 這類專有方案」)
  • 理由混合了資源濫用(vibe coding 專案產生浪費的 CI 設定、更大的程式庫、頻繁 commit,然後燒完資源就被棄置)、氣候成本、勞動與政治考量,以及規避授權(引用 chardet 的案例,指 AI 被用來改寫程式碼繞過 copyleft 義務)
  • 保留例外:託管 AI 政策較寬鬆的大型專案(例如某個 Linux 核心子系統)的個人樹或鏡像仍然允許,因為政策針對的是「原創」內容

💡 為什麼重要:這是第一批以意識形態、資源與氣候理由(而非技術理由)對 AI 協作立法的開源基礎設施,實質上讓 AI 輔助的開源專案能住的地方開始分岔。用 coding agent 的維護者不會被追溯處罰,但 9 月 10 日之後要有遷移計畫。

🔗 閱讀原文 | 來源: SourceHut

12. OpenClaw 爆紅之後:維護者怎麼撐住 388,000 顆星#

OpenClaw 是 Peter Steinberger 在 2025 年 11 月的週末專案,一個跑在使用者自己裝置上、接進既有通訊軟體的個人 AI 助理。到 2026 年 8 月 26 日,它累積約 388,000 顆星、81,000 個 fork、超過 80,000 次 commit,被 GitHub 官方部落格稱為史上成長最快的專案。

  • 維護者被 AI 生成的 PR 淹沒:有些貢獻者跑自動化的「軟體工廠」,一次開好幾百個 PR 到處挖題目解
  • 貢獻次數當聲譽變得可以刷,有人複製別人的 PR 來換合併徽章當假的信任訊號,維護者因此改用新的信任訊號:agent 逐字稿、證明測過的截圖,以及貢獻者是否理解這個功能,不管程式碼是人寫的還是 agent 寫的
  • 維護者現在固定用 GitHub Copilot 審 AI 生成的 PR,而且「維護者自己動手改掉那個 PR」已經比要求對方修改更常見
  • 透過參與 GitHub Secure Open Source Fund 第 4 期,團隊把相依套件逐一梳理過、縮減核心相依數量,並和上游維護者建立直接關係

💡 為什麼重要:這是 AI 協作量超過人類審查能力之後,開源貢獻規範與信任訊號被迫重寫的現場紀錄。它和 SourceHut 剛好是同一股壓力下的兩種答案,一個立法擋掉,一個改寫規則吸收。

🔗 閱讀原文 | 來源: GitHub Blog

13. Asahi Linux 進度報告:Linux 7.2#

Asahi Linux 團隊發布對應 Linux 7.2 的進度報告,持續推進 Apple Silicon 上的原生 Linux 支援。這個專案長期靠逆向工程補齊 Apple 未公開的硬體介面,每期進度報告是社群追蹤驅動程式與周邊支援狀態的主要來源。Hacker News 上取得 390 分、227 則留言。

💡 為什麼重要:對想在 Apple 硬體上跑純 Linux 開發環境的人,這份報告是判斷「現在能不能日常使用」的實際依據。

🔗 閱讀原文 | 來源: Asahi Linux

14. Gemini Omni 1.1 Flash 開放建置,可控性提升#

Google DeepMind 發布 Gemini Omni 1.1 Flash,主打給開發者更細的控制權與彈性來建構 AI 應用,定位延續 Flash 系列的低延遲、低成本路線,對應的正是同日 calv.info 那篇「小模型時代」討論的成本敏感場景。Hacker News 上取得 178 分、131 則留言。

💡 為什麼重要:Flash 等級模型的可控性是它能不能進生產流程的關鍵。這一代把控制權往開發者手上放,值得重新 benchmark 一次你原本用大模型跑的例行任務。

🔗 閱讀原文 | 來源: Google

推薦閱讀#

中文技術圈#

開源精選#

b-nnett/grok-bot-0.18-reconstructed — TypeScript | ⭐ 3.3K 非官方的 Grok Bot 0.18.0 macOS 版原始碼重建與擴充。

tobi/walgit — Rust | ⭐ 2.2K Shopify 創辦人 Tobi Lütke 的 Rust 專案。

duty1g/x64dbg-mcp-server — Zig | ⭐ 1.5K 用 Zig 寫的 x64dbg 原生 MCP 外掛,讓任何相容 MCP 的 AI 助理透過 HTTP 下中斷點、單步執行、讀記憶體與傾印暫存器。零相依、單一執行檔。

SenteLabsAI/OpenExecutive — Python | ⭐ 1.5K 8 個 Claude agent 組成的開源虛擬高階主管團隊,對外只呈現單一人格。

ApodexAI/FrontierAgent — Python | ⭐ 1.1K 原生 CLI TUI 的 agent 框架,支援 ReAct 與 Agent Team 兩種模式,macOS 與 Linux 一行指令啟動,不需預裝也不強制 Docker。

nateherkai/scroll-craft — JavaScript | ⭐ 1.1K 做捲動驅動網站的 Claude Code skill,會自己截圖驗證捲動效果。

wide-trace/open-higgsfield — TypeScript | ⭐ 819 圖片與影片生成工作室,一條 prompt 列、各模型保有自己的設定、所有完成的成品集中在同一個藝廊。

ShadowAqueduct/watermark-remover — Python | ⭐ 819 清除多家 AI 浮水印:Unicode 文字、統計改寫掛勾、C2PA 與 metadata,支援 PNG、JPEG、SVG、PDF、DOCX、HTML 與 MD。

Tencent/WeMM-Embedding — Python | ⭐ 520 騰訊微信視覺團隊的通用多模態 embedding 模型家族,支援多模態理解與檢索。

localai-org/kimodo.cpp — C++ | ⭐ 508 把 NVIDIA 的 Kimodo 移植到 C++/GGML,用自然語言驅動骨架動畫。

影音精選#

史上最貴的軟體 bug:Knight Capital 45 分鐘虧 4.4 億美元#

14 小時前 · Fireship

Fireship

2012 年 Knight Capital 因為一個從 2003 年就沒被刪除的舊 feature flag,在配合美股交易所新推出的 Retail Liquidity Program 上線時誤觸測試用的 power peg 函式,45 分鐘內狂發錯誤買賣單,最終虧損 4.4 億美元、4 個月後被拆分賣掉。Fireship 用這個 14 年前的事故提醒大家,軟體工程的災難從來不是 AI 時代才有。

  • Knight Capital 當時是美股最大做市商之一,每天處理約 200 億美元交易量,一度佔全美股票交易量 10%
  • 2012 年交易所推出 Retail Liquidity Program,Knight 倉促修改 SMARS 訂單路由系統時,誤觸自 2003 年起就未刪除、名為 power peg 的測試功能
  • 系統在約 45 分鐘內狂發錯誤訂單,虧損 4.4 億美元,4 個月後公司被拆分求售

神秘模型 Ox Alpha 真身曝光:GLM 5.3 Flash 效能逼近 Opus 4.8#

16 小時前 · Theo (t3.gg)

Theo

Theo 分析上週在 OpenRouter 與 OpenCode 上匿名上架的神秘模型 Ox Alpha,一度傳出供應商具備每天 100 兆 token 的驚人算力、在公開的 DeepSuite 題目子集拿下約 80% 高分,最後身分揭曉是智譜的 GLM 5.3 Flash。

  • Ox Alpha 上架時宣稱供應商有每天 100 兆 token 的處理能力,對照 Google Gemini 全站流量估計約每天 150 兆 token
  • 在公開的 DeepSuite 題目子集測試中拿下約 80% 分數,明顯高於其他對照模型
  • 最終確認是輕量版的 GLM 5.3 Flash,表現貼近 Opus 4.8,價格卻只要十分之一到百分之一

20VC 完整版:輝達重金收購、OpenAI 確認 IPO、客服機器人被高估#

18 小時前 · 20VC

20VC

SaaS 投資人 Jason Lemkin 與 Scale Venture Partners 合夥人 Rory O’Driscoll 討論本週三件大事:輝達砸 60 億美元授權 Poolside 的模型工廠、OpenAI CFO 證實今年一定上市,以及為什麼客服與機器人賽道被過度吹捧。

  • 輝達付 60 億美元授權 Poolside 的模型工廠,再加碼投資 10 億美元,估值定在 120 億美元 pre-money,並把 109 名工程師併入建置團隊
  • 一封在 X 上流出的投資人信提到某家新創原本想募 20 億美元買 4 萬張 GPU 自建資料中心卻募不到錢,最後只能被輝達收購,顯示創投資金也不是無限的
  • 來賓提醒 VC 資金早已退出 Anthropic 與 OpenAI,現在沒有一家創投持股超過 1-2%,並認為目前 AI 投資周期連三分之一都還沒走完

AI 可解釋性生死局:思維鏈是真的思考嗎#

33 小時前 · 硅谷101

硅谷101

硅谷101 邀請 Stanford 語言學背景的可解釋性研究者 Aryaman Arora,深入拆解 AI 黑箱,用一個很漂亮的實驗說明模型在說出答案前已經完成了看不見的內部推理。

  • 核心案例:問「會織網的動物有幾條腿」(問題中從未出現「蜘蛛」),模型內部已判斷是蜘蛛並答 8;研究者不改問題,只把內部對「蜘蛛」的表示換成「螞蟻」,答案就變成 6
  • 來賓 Aryaman Arora 是 Stanford 語言學背景、師從 Chris Potts 的 PhD 生,訪談起因是 Anthropic 發布的可解釋性論文
  • 討論聚焦思維鏈是否等於真實推理過程,以及目前沒有好技術能直接控制或修改模型的內部想法,即使模型做壞事也無法直接編輯它的「念頭」

WebMCP 來了:讓 AI 代理直接逛網站幫你付錢#

38 小時前 · Greg Isenberg

Greg Isenberg

Greg Isenberg 邀請 Vinny 介紹 Google 與 Microsoft 力推的 WebMCP,概念是把 MCP 工具直接嵌進網頁 UI,讓 AI agent 不用像人類一樣摸索網頁,而是直接被告知怎麼搜尋、下單、結帳。

  • WebMCP 讓網站直接對 AI agent 暴露「搜尋」「訂購」「購買」等結構化動作,取代 agent 用視覺或 DOM 猜測操作的方式
  • Demo 場景是 espresso 器材商店:agent 自動比較兩台咖啡機、核對流理台寬度、比對周邊配件相容性,並自動加入購物車
  • 屬於 Google/Microsoft 剛推出的實驗性功能,節目結尾提出兩個可以用 WebMCP 立刻做的新創點子

H3 Max 雲端秒出片 vs 本機 H3 Turbo:AI 影片生成實測對決#

11 小時前 · Matt Wolfe

Matt Wolfe

Matt Wolfe 把 Fal AI 剛推出的雲端影片模型 H3 Max,拿來對打自己本機跑的 MiniMax H3 Turbo 工作流,用同樣的 prompt 做多組實測,結果速度落差懸殊,但畫質勝負沒有想像中一面倒。

  • H3 Max 能在 2.5 秒內生成一段 5 秒、768p 的影片;本機 H3 Turbo 經過大量 LoRA 與 workflow 調校後,也已從兩位數分鐘壓縮到約 80-90 秒一支
  • 「踢踏舞」測試中,本機生成版本的腳步與音效同步更好、火焰效果更一致,整體畫面反而贏過雲端 H3 Max
  • 「水球」測試中兩邊都出現物理不合理的狀況,顯示 AI 影片生成在流體物理上仍不穩定

Uber 總裁談 Travis Kalanick 絕活:15 分鐘問到痛點翻轉全場#

27 小時前 · 20VC

20VC

Uber 總裁暨營運長 Andrew Macdonald 回憶,Travis Kalanick 最強的能力不是工作時數,而是走進任何會議室,靠幾個犀利問題在 15 分鐘內改變一群已經鑽研同一題目好幾週的專家的想法。

  • Macdonald 把 Travis 的核心能力定義為「創造性解決問題」
  • Travis 能走進任何主題的會議,拋出幾個問題與想法,15 分鐘內就扭轉在場專家的思路
  • Macdonald 認為關鍵在於日復一日、每半小時每半小時反覆鍛鍊這塊「肌肉」

紅杉如何拿下 Citadel Securities:多年關係經營的教科書#

42 小時前 · 20VC

20VC

Sequoia Capital 合夥人 Julien Bek 分享同事 Constantin Beuler 如何拿下從未接受外部資金的 Citadel Securities,靠的不是等電話響,而是從 Ken Griffin 還是學生時代就開始經營關係。

  • Sequoia 的文化是「人人都是獵人」,早期團隊僅約 11 人時就要求每個人主動出擊
  • Constantin Beuler 從 Ken Griffin 學生時代就開始建立關係,多年來擔任他的導師
  • 靠著多年不間斷地詢問「可以投資嗎」,最終促成這家從未對外募資的公司首次接受投資

今日觀察#

今天最值得注意的不是 Nvidia 花了 130 億,而是 Hugging Face 在 2025 年底拒絕 5 億投資時說的那句話,不想要一個能左右決策的主導投資人,在八個月後由它自己親手作廢。同一天 SourceHut 把 LLM 產出列為禁止內容,OpenClaw 的維護者則改用 agent 逐字稿當信任憑證,三個平台面對同一股壓力給了三個互不相容的答案,而沒有任何一個看起來是從容的。更值得放在一起看的是 Rehberger 那條攻擊鏈:Anthropic 委託的第三方測了 72 種情境得到 0.00%,一個有動機的人花時間就做到 80%,而分類器在誤放之後還擋下了 Claude 自己的清除指令,這說明我們現在信任 agent 的方式,本質上是信任一份別人替我們跑過的測試清單。從 Mechanical Turk 收攤到 Model Hardware Standard 讓 agent 握住雷射與機械手臂,這一天的訊號其實很一致:判斷正在大規模外包出去,而驗證的成本還沒有人真的付。下次你按下那個「全部同意」之前,值得問一句,如果它錯了,你會從哪裡發現。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有