模型衝規格,工具在補債
每天花 1% 的時間,掌握科技脈動。
今日金句#
“Of the 629 benchmark measurements, 555 of them improved and only 74 regressed. A number of benchmarks saw double-digit percentage reductions.” 「629 個基準測試裡,555 個變快、只有 74 個變慢,甚至有幾項測試的降幅是兩位數百分比」 — Nicholas Nethercote, Rust 編譯器效能貢獻者
“foldl and foldr are not folds ‘from the left’ and ‘from the right’ — the difference is the fold’s associativity.” 「foldl 跟 foldr 的差異不是『從左邊摺』還是『從右邊摺』,而是摺疊運算的結合方向」 — Alexis King, Haskell 開發者
今日主軸#
Google 這週發表 Gemini 4 Argon,把輸出 token 上限從 6.4 萬一口氣衝到 100 萬,同時在 CWE-bench 漏洞修補測試上並列第一,定位直接卡進企業法務、金融與資安防禦這幾個高單價場景。同一週,Rust 編譯器團隊靠兩個月內 629 個基準測試的逐項優化,擠出平均 4.57% 的整體加速,沒有單一突破,是幾十個小 PR 疊出來的效果。工具鏈這一層也在補課:Earendil 的 Pi 一年前才驕傲宣布「不支援 MCP」,這次反悔把 MCP 整合進核心,還加了 Codemode 解決長期存在的組合性問題;HuggingFace 一篇論文則示範用外掛方式讓既有通用 agent(不重新訓練)就能原生支援多模態。這週的進步不是哪個模型突然變聰明,是規格上限、編譯效率、工具組合性這些「地基」被同時往前推了一步。
必讀#
- Rust 編譯器兩個月內平均加速 4.57% — Lobste.rs
Dev - Gemini 4 Argon:輸出上限衝到 100 萬 token — Hacker News
AI - Pi 反悔了:從「不支援 MCP」到整合進核心 — Hacker News
AI - Omni-IO Skills:不重新訓練就讓 agent 原生多模態 — HuggingFace Papers
AI - The Cuckoo’s Egg:從 75 美分帳目差異抓出蘇聯駭客 — Lobste.rs
News - Jev 實戰:最快最便宜模型的 8 個真實應用案例 — Lenny’s Newsletter
AI - dots:專治反機器人偵測的開源網頁 agent 框架 — GitHub
AI - Tcl/Tk 9.1 發布:無障礙支援與效能改進 — Lobste.rs
Product - foldl 與 foldr 的差異:不是方向,是結合性 — Lobste.rs
News - DeepSeek 開源昇騰平台基礎設施組件 — InfoQ 中文
Dev - Cloudflare Impact 捐贈累計達 1 億美元 — Cloudflare Blog
Dev
1. Rust 編譯器兩個月內平均加速 4.57%#

摘要:Rust 編譯器團隊在 629 項基準測試中,靠兩個月密集優化讓 555 項變快、只有 74 項變慢,平均牆上時間減少 4.57%。單一 PR 級別最大的貢獻來自 cranelift-codegen 的 CFG 走訪演算法重寫,編譯時間直接省了約 30%;serde 因為改成懶加載 liveness 計算再省 3-5%。同一批更新裡,新借用檢查器 Polonius Alpha 和新特性求解器也在 Nightly 上啟用,雖然帶來部分效能回歸,但被其他改進抵消。
- 629 個基準測試中 555 個改善,僅 74 個退步,多項測試降幅達兩位數百分比
- Clippy 靠 PGO 最高提速 18%,LLVM 23 升級則平均拖慢 1.2%
- 新借用檢查器 Polonius Alpha 與新特性求解器已在 Nightly 開放測試
💡 為什麼重要:對每天要等編譯的 Rust 開發者,這不是一次性的爆發式進步,是幾十個小 PR 疊出來的複利效果,說明編譯效能優化的常態是持續的小幅打磨,不是等一次大重寫。
🔗 閱讀原文 | 來源: Lobste.rs
2. Gemini 4 Argon:輸出上限衝到 100 萬 token#

摘要:Google 發表新前沿模型 Gemini 4 Argon,鎖定軟體工程、企業知識工作與網路防禦三個場景。DeepSWE v1.1 編程能力達 77.9%,CWE-bench v1 漏洞修補能力並列第一(68%),Vals Index(衡量金融、編程、法律、稅務工作影響力的綜合指標)排名第一。最大的規格跳躍是輸出 token 上限,從前代的 6.4 萬直接擴大到業界領先的 100 萬。定價維持期間輸入 $2/百萬 token、輸出 $10/百萬 token,快取輸入再打 95 折。
- DeepSWE v1.1 達 77.9%、CWE-bench v1 達 68%,並列業界第一
- 輸出 token 上限從 6.4 萬擴大到 100 萬,是前代的 16 倍
- Google 稱內部已有上千名工程師在用它做程式審查、深度研究與寫作
💡 為什麼重要:企業法務、金融與資安防禦團隊能一次處理完整的大型文件或漏洞掃描,不用再靠人工把長任務切成小段餵給模型。
🔗 閱讀原文 | 來源: Hacker News
3. Pi 反悔了:從「不支援 MCP」到整合進核心#

摘要:Agent 平台 Pi 過去一年在官網驕傲宣示「我們不支援 MCP」,這次卻整個立場逆轉,把 MCP 正式整合進核心架構,原因是過去一年 MCP 標準本身有了實質改進。同時引入 Codemode 機制,一個在 agent 執行環境層運作的 JavaScript 沙箱,讓 agent 能在單一呼叫裡組合多個 MCP 工具,不必為了協調不同工具浪費上下文。團隊坦言 MCP 最大的問題一直是難以組合,Codemode 是縫合這個缺口的手段,而不是取代 MCP 標準本身。
- Codemode 運作在代理進程層,作用是編排與協調工具呼叫,而非另立新標準
- 設計目標是讓多個 MCP 工具能在同一次調用中組合,不浪費上下文
- 團隊承認即使有 Codemode,MCP 組合困難的核心問題仍未完全解決,只是被大幅緩解
💡 為什麼重要:接工具鏈的開發者最常卡在「規格對、組合方式爛」,Pi 選擇留住標準、自己修補組合層,這比另起爐灶更務實,也是對 MCP 生態的一次公開背書。
🔗 閱讀原文 | 來源: Hacker News
4. Omni-IO Skills:不重新訓練就讓 agent 原生多模態#
![]()
摘要:這篇論文提出用「外掛技能包」而非重訓模型的方式,讓 Claude、GPT 這類通用 agent 原生支援音訊、影片、3D 與跨媒體協調工作流。研究團隊建立 UniM 基準測試,發現裝上 Omni-IO Skills 後,兩個測試代理(GPT-5.6 Sol 與 Claude Sonnet 5)的多模態任務支援率從不到 40% 提升到 100%,另一項語意品質指標 SQCS 也從約 27% 拉高到 75-78%。團隊隨論文開源程式碼與 20 個示例工作流,設計上刻意保留既有代理原本的推理與規劃能力,只是外掛而非替換。
- UniM 基準測試中,支援率從不到 40% 提升到 100%
- SQCS(語意品質綜合指標)從約 27% 提升到 75-78%
- 開源釋出 20 個示例工作流,採隨插即用架構,不改動基礎模型
💡 為什麼重要:企業要為既有的 Claude/GPT 部署加上影音與 3D 能力,不需要等基礎模型廠商重新訓練,直接外掛這層技能包就能上線,大幅降低多模態整合的門檻。
🔗 閱讀原文 | 來源: HuggingFace Papers
5. The Cuckoo’s Egg:從 75 美分帳目差異抓出蘇聯駭客#

摘要:Clifford Stoll 1989 年出版的經典資安著作,記錄史上最早有完整文件的電腦入侵案件之一:他在勞倫斯伯克利國家實驗室發現一筆 75 美分的帳務差異,追查下去牽出一場橫跨多年、把美國軍方與研究機構情報賣給蘇聯 KGB 的入侵行動,幕後正是西德駭客 Markus Hess。斯托爾採用土法煉鋼的追蹤手段,包括架設 50 台終端機監看電話線路、設置蜜罐誘餌讓入侵者自曝行蹤,最終揭露許多軍事系統當年連預設密碼都沒改的基礎資安漏洞。
- 起點是一筆 75 美分的會計異常,最終追出跨國、跨年的間諜行動
- 斯托爾用物理電話線追蹤加蜜罐誘餌,在沒有現代工具的年代完成偵測
- 揭露軍事系統預設密碼未更改,是入侵成功的關鍵破口
💡 為什麼重要:這本書在 Lobsters 重新被討論,提醒的是現代資安事件的核心破口:弱密碼、預設帳密、缺乏稽核日誌,37 年後依然是最常見的入侵向量,技術在變,人為疏失沒有變。
🔗 閱讀原文 | 來源: Lobste.rs
6. Jev 實戰:最快最便宜模型的 8 個真實應用案例#

摘要:egghead.io 創辦人 John Lindquist 在 Lenny’s Newsletter 分享如何把決策模型 Jev 當成「決策引擎」而非聊天機器人使用,示範即時語音指令分類、函式路由推斷、信心分數驅動的毫秒級資料去重、多層應用程式路由等 8 個實戰場景。他用西洋棋對弈當基準測試展示速度優勢,也點出哪些情境仍該交給完整的生成式模型處理,而不是硬塞給決策模型。
- Jev 的定位是「決策引擎」,處理路由、分類、去重這類高頻低延遲任務
- 透過棋局基準測試展示速度與傳統低推理 LLM 的落差
- 作者強調速度帶來的成本結構改變,讓過去因為太貴而放棄的想法重新可行
💡 為什麼重要:需要即時語音、App 內路由、大量資料清理的開發團隊,能從這篇看到具體可複製的落地模式,而不是抽象的「決策模型很有用」。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
7. dots:專治反機器人偵測的開源網頁 agent 框架#
摘要:開源專案 dots 主張網頁 agent 失敗的問題通常不在模型,而在瀏覽器層:頁面載入失敗、驗證關卡跳出來、點擊落空。專案用修補過的 C++ Firefox 引擎打造真實瀏覽器指紋,不留下 WebDriver 旗標或 DevTools 協議這類自動化訊號,同時支援代理伺服器、時區與語言同步、登入狀態與 Cookie 保留,相容任何 OpenRouter 上的模型並透過隱形 Playwright MCP 整合。專案一天內衝上近 2000 星、320 次 Fork。
- 用修補過的 C++ Firefox 引擎打造真實瀏覽器指紋,無自動化訊號可偵測
- 支援代理同步、登入持久化,相容任何 OpenRouter 模型
- 定位是把「反偵測」這件工程難題交出來,讓開發者專注在任務邏輯上
💡 為什麼重要:做爬蟲或網頁自動化 agent 的開發者常把力氣花在改善模型邏輯,這個專案指出瓶頸多半在瀏覽器層,提供現成的反偵測基礎設施可以省下大量自建成本。
🔗 閱讀原文 | 來源: GitHub
8. Tcl/Tk 9.1 發布:無障礙支援與效能改進#

摘要:Tcl/Tk 9.1.0 於 9 月 29 日發布,新增 unicode、timer、lfilter 等命令,C API 支援 Unicode 正規化與微秒級單調時鐘。Tk 這邊導入螢幕閱讀器無障礙支援、雙向文字與 RTL 語言初步支援,以及新的 ttk::toggleswitch 元件。macOS 上支援大小寫不敏感的檔案系統路徑,Windows 的 exec/auto_execok 搜尋邏輯也做了調整。
- 新增無障礙支援(螢幕閱讀器)與雙向文字/RTL 初步支援
- C API 擴充 Unicode 正規化、微秒級單調時鐘、大型列表記憶體效率改善
- 應用程式需呼叫初始化例程 Tcl_FindExecutable 或 TclZipfs_AppHook,屬破壞性變更
💡 為什麼重要:長期維護 Tcl/Tk 應用的開發者能拿到期待已久的無障礙功能,但初始化 API 的變動意味著升級前得先檢查相容性,不是無痛更新。
🔗 閱讀原文 | 來源: Lobste.rs
9. foldl 與 foldr 的差異:不是方向,是結合性#

摘要:這篇 Haskell 官方 blog 文章釐清一個常被誤解的觀念:foldl 和 foldr 都是從左到右走訪列表,差異不在走訪方向,而在建立的運算樹往哪個方向結合。在嚴格語言中 foldl 可以尾遞迴、用常數空間執行,foldr 則需要線性空間;但在像 Haskell 這種惰性語言裡,情況反過來:純 foldl 會堆出過大的 thunk 鏈,得改用 foldl’ 強制逐步求值,而 foldr 若化簡函式對第二個參數是惰性的,反而能邊算邊輸出,甚至作用在無限列表上。
- foldl 展開成
((((v⊗e₀)⊗e₁)⊗e₂)...⊗eₙ),foldr 展開成e₀⊗(e₁⊗(e₂⊗...⊗(eₙ⊗v))) - 嚴格語言用 foldl 省空間,惰性語言反而該用 foldl’ 或 foldr,視情況而定
- foldr 能對無限列表運作,foldl 不行
💡 為什麼重要:寫 Haskell 或任何函數式程式碼的工程師,能藉此避免「foldl 比較快」這種以偏概全的直覺,改用「這裡需不需要惰性求值」來決定該用哪一種摺疊。
🔗 閱讀原文 | 來源: Lobste.rs
10. DeepSeek 開源昇騰平台基礎設施組件#

摘要:DeepSeek 開源了一批面向昇騰平台的基礎設施組件,涵蓋張量編譯器語言 TileLang、計算最佳化庫與分散式通信庫,目標是補齊昇騰生態在訓練與推理管線上的工具鏈缺口。
- 開源範圍包含 TileLang 張量編譯器、計算最佳化庫、分散式通信庫
- 定位是補強昇騰平台的訓練與推理基礎設施
💡 為什麼重要:使用昇騰平台做訓練的團隊多一套開源工具鏈可用,降低自建張量編譯與通信層的成本,也是中國 AI 硬體生態自主化的又一塊拼圖。
🔗 閱讀原文 | 來源: InfoQ 中文
11. Cloudflare Impact 捐贈累計達 1 億美元#

摘要:Cloudflare 的公益計畫 Cloudflare Impact 累計捐贈額度達到 1 億美元里程碑,透過提供免費或折扣的 CDN、DDoS 防護、API 安全等企業級服務,支援全球非營利組織與公益專案的基礎設施需求。
- 累計捐贈額度達 1 億美元
- 服務涵蓋 CDN、DDoS 防護、API 安全等核心產品線
💡 為什麼重要:資源有限的非營利組織能取得企業級網路安全與效能工具,這是科技公司用自身專長而非單純捐現金做公益的具體範例。
🔗 閱讀原文 | 來源: Cloudflare Blog
推薦閱讀#

- Computer Use 半年大躍進,OpenAI 一週複製出 Jev 競品 — Latent Space 訪談 Sky 共同創辦人 Ari Weinstein,談 Computer Use 技術幾個月內出現 180 度轉變:agent 學會自我除錯、混合截圖與無障礙資料加速操作;下半場訪問 OpenAI 的 Nikunj Handa,解析 DevDay 新開發者堆疊:非同步工具呼叫、Decisions API、Agents API。
- 同家族模型間的蒸餾縮放規律 — 研究團隊系統性測試弱教強、同基座、強教弱三種 on-policy distillation 設定,發現早期訓練動態就能預測最終的能力轉移量與速度。
- OpenAI 揭露一場協同模型蒸餾攻擊 — OpenAI 說明如何偵測並瓦解一起企圖竊取受保護模型推理能力的協同行動,同步強化對抗性蒸餾的防禦機制。
- OpenAI 幫小型企業導入 AI — 與美國中小企業發展中心(America’s SBDC)合作擴大實作型 AI 訓練與在地輔導,同步發布小型團隊實際使用 AI 的調查報告。
- 紐約博物館:21 年打造的巴沙木曼哈頓模型 — Simon Willison 推薦紐約市博物館展出的巨型巴沙木城市模型,作者 Joe Macken 耗時 21 年完成,展覽 10 月 12 日撤展前值得排進行程。
- 專訪 CockroachDB 共同創辦人 Peter Mattis — Peter Mattis 曾經每年手寫近 10 萬行資料庫等級程式碼,談 AI 輔助下如何維持生產力與品質,延伸到分散式資料庫的設計取捨。
- Cloudflare Workers 錯誤直送 coding agent — 內建錯誤監控能把堆疊追蹤、日誌與上下文直接送進 coding agent 調查並開 PR,把排錯這一步接進開發流程。
- Cloudflare Containers 重build,啟動快 6 倍 — 啟動速度快 6 倍,agent 可在執行期自選映像與實例類型,支援檔案系統快照公開測試版。
- SynthID Bio:為 AI 生成蛋白質加浮水印 — 針對 AI 生成蛋白質的浮水印概念驗證,在標記生成內容的同時盡量保留其生物功能。
- OpenAI DevDay 2026:哪些發布最值得關注 — Claire Vo 現場實測 Dot、Spaces、Sites 與 GPT-6.1 Sol,整理出哪些功能已成熟、哪些還粗糙。
- Monetization Gateway:用 HTTP 402 向 AI agent 收費 — 用 HTTP 402 向 AI agent 收費存取 token、API 與 MCP 工具,Ceramic.ai、Stocktwits 等已在使用,美國賣家可申請封測。
- AINews 彙整 OpenAI DevDay 2026 全發布 — 語音助理 Dots、辦公協作 ChatGPT Spaces、GPT-6.1 Sol 與 Ultrafast,並提到 ChatGPT 週活躍用戶已達 12 億。
- Meta 否認 Muse 偷看使用者私訊 — Meta 回應記者報導稱,Muse agent 在未開啟必要權限的情況下不可能讀取用戶 Messages,正面反駁該篇報導。
- DoorDash 推出可傳訊點餐的 AI agent — DoorDash 想靠這個功能在對抗 Uber Eats 與 Grubhub 的競爭中取得優勢。
中文技術圈#

- 別再把攻略全甩給 AI:國慶七天河南自駕的 Agent 實戰 — 少數派
- 谷歌開源面向自主 AI 代理的 Kubernetes 風格編排器 AX — InfoQ 中文
- 像改文字一樣改語音:火山引擎全新語音內容編輯模型 — InfoQ 中文
- JadePuffer 借助 AI 代理攻擊 Azure,微軟揭露兩起雲端資料破壞事件 — iThome
- 川普簽署行政命令,要美國政府機構把 AI 改成 SI — iThome
- Salesforce Agentforce 傳 SalesBleed 安全問題 — iThome
- 狂燒逾 1 萬美元 Token,神人打造網頁版「台北 GTA」 — 科技新報
- AI 攻擊 12 分鐘就能展開,企業平均修補時間仍需 3 天 — 科技新報
開源精選#
tobi/disktree — Rust | ⭐ 1,998 找出佔用磁碟空間的檔案用的 treemap 工具,針對 Omarchy 打造,Rust + GPUI。
shihabal3amri/DiPlay — Kotlin | ⭐ 1,467 相容 Android 車機的獨立 CarPlay 接收器,支援有線與無線公開預覽。
Louis-CFM/coucou — Swift | ⭐ 1,139 住在 macOS 通知欄或 Windows 螢幕頂端的小夥伴,盯著你的 Claude Code session。
kaankiziltug/logo-design-skill — HTML | ⭐ 1,088 給 Claude、Gemini CLI、Codex 等 agent 用的 logo 設計技能包,含 1,400+ 參考庫。
rehan-remade/universal-modder — Python | ⭐ 774 讓 Claude 對準任何一款 PC 遊戲進行改裝:逆向工程、生成美術/3D/音效、遊戲內測試。
glanderness/BeefTV — TypeScript | ⭐ 632 本機優先、輕量的 AI 原生影片工作站。
影音精選#
50 年前的軍事機密分級概念,能解決 AI Agent 提示注入嗎?#
發布 14 小時前 · Fireship
從澳洲政府 Medicare 資料庫疑遭 OpenAI agent 入侵的新聞切入,介紹開源專案借用冷戰時代機密分級邏輯:agent 一旦讀取私有資料,整個 session 就被降級隔離、無法再對外傳送內容。作者實際安裝測試,成功攔截洩漏私有程式碼的攻擊嘗試。
- 借用軍事機密分級邏輯:讀到私有資料後 session 立即標記為 private
- MIT 授權,作者親自安裝測試並成功攔截外洩攻擊
OpenAI DevDay 直擊:一句話用 GPT-6.1 Sol 做出復古 VHS 動畫#
發布 31 小時前 · Matt Wolfe
Matt Wolfe 直播 DevDay 2026,一次看過常駐 agent 平台 Dots、ChatGPT Space、GPT-6.1 Sol/Ultrafast、Decisions API 與雲端版 Codex,實測用一句提示詞生成 60 秒復古 VHS 短片。
- Ultrafast 模式輸出速度達每秒 300 token,比一般模式快 8 倍
- Pro 訂閱方案的 API 額度同步縮減,同一天 Anthropic 也推出 Sonnet 5.5
OpenAI DevDay 20 多項發表,這四項藏著上百億商機#
發布 34 小時前 · Greg Isenberg
Greg Isenberg 從近 60 分鐘的發表會裡挑出最具商業潛力的四項:常駐個人 agent 平台 Dots、對標自家 Jev 的 Decisions API、支援電腦操作的 Agents API,以及「用 ChatGPT 帳號登入」的新登入生態。
- Decisions API 讓開發者用預先定義的選項做即時分類與路由
- Sign in with ChatGPT 被類比為當年催生龐大商機的 Facebook 登入
OpenAI 推出 GPT-6.1 Sol 反擊 Anthropic Opus 5.5#
發布 37 小時前 · Theo (t3.gg)
Theo 分析 OpenAI 在 Opus 5.5 大獲好評後緊急推出的 GPT-6.1 Sol,指出智能雖略遜一籌,但速度快上數倍、價格更貼近 Opus 等級,在 Terminal Bench 拿下最佳成績。
- 定價貼近 Opus,推理速度快非常多,適合大量調查型工作
- Theo 打算讓 Opus 5.5 當總指揮,呼叫 Sol 分工執行審查與根因分析
AI 實驗室在操弄自家 benchmark 嗎?Higgsfield CEO 直言不諱#
發布 41 小時前 · 20VC
Higgsfield 共同創辦人 Alex Mashrabov 直言,大型 AI 實驗室的頂尖研究員會把測試資料混進訓練集、用 LLM 當裁判自我評分,藉此衝高分數換取季度獎金。
- 直指業界普遍存在把 test data 偷渡進訓練資料的操作
- 認為 benchmark 分數上升不必然代表模型真的進步
Anthropic 無預警推出 Sonnet 5.5,卻叫你先別急著用#
發布 48 小時前 · Theo (t3.gg)
Theo 實測發現 Sonnet 5.5 雖然單價只有 Opus 一半,但 token 消耗量異常高,甚至是 Astra 的五倍以上,拖慢速度也墊高實際帳單。
- Token 效率差抵銷了低單價優勢,每秒輸出速度偏慢
- Theo 目前排名仍是 Astra 最強、Opus 次之,建議先觀望 Sonnet 5.5
今日觀察#
今天 GitHub 趨勢榜前段擠滿的不是新創公司,是個人開發者靠 agent 生出來的小工具:一個住在 macOS 通知欄的小夥伴、一整套 logo 設計技能包、一個讓 Claude 改裝任何 PC 遊戲的框架,接續昨天衝上三千星的 AIHOT,這已經是本週第二次看到「一個人加 agent」的產出量逼近小型團隊。同一天,Gemini 4 Argon 把輸出上限衝到 100 萬 token、DeepSeek 開源昇騰平台的張量編譯器,這些都是給專業團隊用的重裝備;但把門檻實際往下砍的,反而是 Codemode 這種讓 agent 自己組合工具的機制,和 Omni-IO Skills 這種不用重新訓練就能外掛多模態能力的做法。模型端在拼規格,工具鏈端在拼好不好組裝,站在最外圍的個人開發者,拿到的是兩邊進步疊加的效果。我自己每天在跑的這套日報系統,也是同一批工具堆出來的,能感覺到接下來限制你能做多大專案的,不再是會不會寫程式,是有沒有把這些零件正確組裝起來的判斷力。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit






