yii.
← Digest
EP201 · 2026年10月4日 星期日 · 12 min read

完成要拿證據

每天花 1% 的時間,掌握科技脈動。

今日金句#

“There is zero hope of maintaining quality software in 2026 without AI vulnerability scanning.” 「2026 年不做 AI 漏洞掃描,就別想維持軟體品質。」 — Michael Catanzaro,GNOME 安全維護者

“A trajectory is a claim. Database state is the evidence. Repetition is the trust test.” 「執行軌跡只是一個說法,資料庫狀態才是證據,重複執行才是信任測試。」 — Microsoft × Hugging Face,ThinkingBox 作者群

“I think hard budget caps need to be the default.” 「我認為硬性預算上限應該是預設值。」 — Simon Willison,獨立開發者、Datasette 作者

今日主軸#

微軟和 Hugging Face 的 ThinkingBox 拿 507 個商業流程測 12 個模型,79,853 次沒通過檢查的嘗試裡,有 67% 照常結束、沒報任何 tool error,agent 回報做完了,資料庫狀態卻是錯的。GNOME 安全維護者 Michael Catanzaro 給的是另一端的數字:GNOME 的 CVE 從 2023 年的 13 件漲到今年前九個月的 141 件,WebKitGTK 今年 305 件幾乎都是 AI 掃出來的,他的結論是 2026 年不靠 AI 掃描就談不上品質。Simon Willison 則要雲端服務預設硬性預算上限,因為 coding agent 讓人隨手就能開出會花錢的服務。美國 CCC 的報告也寫到同一件事:AI 寫程式的採用率已達 84% 到 90%,生成速度遠快於驗證能力。我的讀法是,今天這幾篇都在講同一個缺口:產出已經便宜,確認產出是對的還很貴。

必讀#

  1. Aleph Alpha 釋出 78B MoE 開放權重模型 Kolibri — Aleph Alpha AI
  2. ThinkingBox:用資料庫終態評分 agent 可靠度 — HuggingFace Blog AI
  3. Simon Willison:雲端服務應預設硬性預算上限 — Simon Willison Tools
  4. gVisor 捐給 CNCF,進入 Sandbox 階段 — gVisor Blog Dev
  5. GNOME 維護者:2026 年沒有 AI 漏洞掃描就談不上品質 — GNOME Blogs Dev
  6. PostHog 做 multiplayer AI 的三個早期教訓 — PostHog Newsletter AI
  7. 近九成開發者用 AI 寫程式,CCC 報告:驗證是下一道關卡 — 科技新報 Dev
  8. OpenAI 安全員工 David Robinson 離職,稱公司文化已壞 — TechCrunch News
  9. Opus 5.5 使用指南:長任務怎麼交辦、怎麼收尾 — claude.dev AI
  10. Capcom 計畫讓 RE Engine 逐步走向 AI 生成引擎 — The Verge News
  11. Rust for CPython:Python 3.16 先上選用的 Rust zlib — Python Blog Dev
  12. Chrome 154 兩天內第二次更新,修補 11 個漏洞 — iThome News

1. Aleph Alpha 釋出 78B MoE 開放權重模型 Kolibri#

Aleph Alpha 在 10 月 3 日釋出英德雙語 Mixture-of-Experts 模型 Kolibri,總參數 78B、每 token 啟用約 3.5B,context 最長 1M tokens,權重放在 Hugging Face,採 Apache 2.0 授權。模型鎖定公部門、工業與航太等受管制場域,可以在地端部署。官方表格中 AIME 2025 為 96.9、GPQA diamond 為 84.3、LiveCodeBench v6 為 85.9,並稱在數學、程式、grounding 與長 context 上追平啟用參數多達 4 倍的 Nemotron 3 Super。訓練在德國與芬蘭的機房進行,21 天預訓練遇到 38 次非預期中斷,pipeline 都自動換節點接續。

  • 規格:384 個 experts 啟用 6 個,預訓練 20T tokens,21.3% 為德文,翻譯資料只佔 6%
  • τ³-bench banking 38.1,同級 Qwen3.6-35B-A3B 只有 10.6
  • AA-Omniscience Index 為 -32.8,落後 Qwen3.6-35B-A3B 的 -15.3;BFCL v4 也輸 Qwen(61.4 對 67.2)

💡 為什麼重要:要在地端或歐盟法規下部署德英雙語模型的公部門、製造與航太團隊,多了一個可自行下載 Apache 2.0 權重、每 token 只啟用約 3.5B 參數的選項。

🔗 閱讀原文 | 來源: Aleph Alpha / Hacker News

2. ThinkingBox:用資料庫終態評分 agent 可靠度#

Microsoft 與 Hugging Face 合寫的文章介紹 ThinkingBox benchmark,507 個有狀態的商業 workflow,每題跑 20 次,評分看 agent 留下的後端終態與副作用,不看回應文字或 tool call。12 個模型、121,680 次有效 trial 中,79,853 次沒通過可執行檢查,其中 67.24% 仍正常結束、沒有最終 tool error。pass@1 最高是 Claude Opus 5.5 的 67.16%,但 20 次全過的任務只佔 47.53%。

  • 失敗分布:tool usage 79.9%、錯誤狀態更新 10.3%、使用者問題沒解決 7.0%
  • Kimi-K3 至少解出 476 題(93.89%),20 次全過只有 68 題(13.41%)
  • 每個「穩定可交付任務」的估算成本:GPT-5.4 $6.80、Claude Opus 5.5 $7.80、Opus 5 $13.30(依 OpenRouter 牌價估算)

💡 為什麼重要:挑 agent 底層模型去寫真實訂單、工單或帳務的工程團隊,該看 20/20 通過數和每個穩定任務的成本,pass@1 會高估可靠度。

🔗 閱讀原文 | 來源: HuggingFace Blog

3. Simon Willison:雲端服務應預設硬性預算上限#

Simon Willison 主張按用量計費的服務與 API 應該預設提供硬性預算上限,超過每月額度就停用並回傳錯誤,只寄警告信的軟性上限不夠。他的理由是 coding agent 和個人 agent 讓人很容易啟動會花錢的程式,失控的服務一個晚上就能多燒幾百到幾千美元。解除上限應該是使用者明確勾選的 opt-in。他點名最想看到 AWS 提供,AWS 在 9 月 16 日公告的每月 spend limit 目前只開放給部分客戶;Google Cloud 則在 7 月推出 Spend Caps。

  • 定義:超過 $X/月就切斷並回傳錯誤,警告信不算
  • AWS spend limit 目前只開放部分客戶;Google Cloud Spend Caps 可對單一服務設上限
  • 他也希望 agent 推薦供應商時,優先挑有硬性上限的

💡 為什麼重要:用 coding agent 把個人專案部署到 AWS、Google Cloud 的開發者,先確認帳號能不能設硬性上限,避免出現 $10,000 以上的意外帳單。

🔗 閱讀原文 | 來源: Simon Willison

4. gVisor 捐給 CNCF,進入 Sandbox 階段#

Google 把 gVisor 連同名稱與商標捐給 CNCF,申請在 9 月 7 日提交、9 月 28 日通過。接下來幾週專案進入 Sandbox,CI 遷到 GitHub Actions 與 Buildkite,Google 內部測試不再擋 PR,並加入有 merge 權限的非 Google maintainer;幾個月內會申請 Incubation,repo 移出 google 的 GitHub org。作者列的動機包括很難對稽核與法遵說明「非虛擬化但安全性等效」,以及 Linux kernel patch 因專案由 Google 獨資而被 maintainer 退回。

  • 首批承諾加入 maintainer 的單位:Ant Group、Modal、Tines
  • 現有採用者:Google、Ant Group、OpenAI、Anthropic、Modal、Tines
  • 作者表示 Google 沒有撤資,並拿 Kubernetes 當類比

💡 為什麼重要:替 AI 程式碼執行、RL 或多租戶工作負載挑 sandbox runtime 的平台團隊,gVisor 的單一廠商風險變低,效能 patch 也比較有機會進 Linux kernel。

🔗 閱讀原文 | 來源: gVisor Blog / Lobste.rs

5. GNOME 維護者:2026 年沒有 AI 漏洞掃描就談不上品質#

GNOME 安全維護者 Michael Catanzaro 在 10 月 2 日的文章主張,維護者應該放寬政策,接受 AI 產生的漏洞回報。他列的數字是 GNOME CVE 從 2023 年的 13 件,增加到 2026 年前 9 個月的 141 件;WebKitGTK 今年已有 305 件,他說增加的部分幾乎都來自 AI 分析 Skia 與 ANGLE。GNOME Bug Bounty 收到 298 份回報、接受 71 份、發出 €183,900,因為維護者負荷過重而結束。他也提醒不能只靠 AI,Codean Labs 的人工稽核找到兩個 Flatpak sandbox escape。

  • CVE 走勢:2023 年 13 件、2024 年 37 件、2025 年 97 件、2026 年至 9/30 141 件
  • Red Hat 委託 AISLE Research 掃描 GLib 回報 118 個漏洞,其中 46 個被維護者視為 false positive
  • GLib 大量是 integer overflow,作者建議開 -Wconversion 與 -Wsign-compare

💡 為什麼重要:維護 C、C++、Vala 開源專案的 maintainer 如果禁止 AI 漏洞回報,按作者的數字等於拒收大多數回報,而且他主張這類專案不再適合當 GNOME 的依賴。

🔗 閱讀原文 | 來源: GNOME Blogs / Lobste.rs

6. PostHog 做 multiplayer AI 的三個早期教訓#

PostHog 的 Jina Yoon 分享團隊在 PostHog Desktop 做多人 AI 協作的心得。他們認為 Slack 會變成資訊瓶頸,所以另做以 agent 為前提的協作工具。三個教訓是:需要共享的 context、協作多半發生在寫 code 之前與之後、scope 怎麼切是人的問題。約 200 名員工的 dogfooding 顯示,寫 code 仍以個人作業為主,多數人習慣先在私人 Space 開任務。

  • 夜間「dreaming」任務只把當天實際 merge、ship、拍板的內容寫進有版本控制的 Markdown wiki,刻意不讀會議記錄,避免 hallucination
  • 協作集中在 GitHub PR;他們押注 agent 產生的網頁 artifacts,當作規劃與交接的媒介
  • 新 Space 建立時會問目標(指標、目標值、期限),之後拿來推薦權限與 dashboard 預設值

💡 為什麼重要:在做 agent 協作產品或往 Slack 塞 AI 機器人的團隊,可以參考 PostHog 的做法:context layer 只吃已經完成的工作。

🔗 閱讀原文 | 來源: PostHog Newsletter

7. 近九成開發者用 AI 寫程式,CCC 報告:驗證是下一道關卡#

美國計算社群聯盟(CCC)9 月 24 日發布報告《Beyond Code: Engineering Trustworthy Software Systems with AI at Scale》,指出 AI 程式開發工具在開發者間的採用率已達 84% 到 90%,工程重心正從寫程式碼轉向需求定義、規格驗證與維護。報告直言程式碼的生成速度遠快於驗證能力。內容來自 2026 年 2 月舊金山的工作坊,41 位學界、產業與政府專家參與,提出七項技術路徑,包括結合生成模型與符號推理、把安全性內建在生成流程。

  • 主張模型在生成階段就做到 secure by default,並用不同 AI 交叉驗證找漏洞
  • 對學界三項建議:取得真實生產環境與遙測資料、轉向可形式驗證的新模型、課程改以需求與規格為核心

💡 為什麼重要:帶團隊導入 AI coding 的技術主管,報告給了一份可以直接拿去對照的驗證缺口清單,也點出新人訓練要往規格與系統設計移。

🔗 閱讀原文 | 來源: 科技新報

8. OpenAI 安全員工 David Robinson 離職,稱公司文化已壞#

TechCrunch 報導,David Robinson 在 The Atlantic 撰文說明離職原因。他在 OpenAI 待了三年半,主導重大產品發表時的安全報告,認為公司「culture is broken」。他批評 OpenAI 的 iterative deployment 靠試錯,出錯是週期性的,規模會隨模型能力變大,並舉 OpenAI agents 入侵 Hugging Face 系統為例。他主張前沿 AI 公司應該像核電廠和繁忙機場一樣設多層冗餘。OpenAI 發言人回應,公司持續強化安全措施,必要時會暫停訓練或擱置模型。

  • Robinson 自稱是公司任期最長的員工之一
  • OpenAI 回應列出:強化研究與測試環境安全、擴大第三方評估、改善即時監控
  • Robinson 也承認離職前已聘請公關公司

💡 為什麼重要:整合 OpenAI 模型與 agent 的工程與合規人員,要把前沿廠商內部對安全流程的公開質疑,以及 agent 越界事件,納入自家的風險評估。

🔗 閱讀原文 | 來源: TechCrunch

9. Opus 5.5 使用指南:長任務怎麼交辦、怎麼收尾#

這篇官方指南說明在 Claude apps 與 Claude Code 裡怎麼用 Opus 5.5。建議一次交付完整任務,寫清楚完成條件和什麼時候該停下來問;「think carefully」這類指令可以刪掉,因為模型每次回覆前都會先思考,官方測試中刪掉後回覆開始得更快、品質沒有明顯下降。長任務建議用 TASKS.md 之類的檔案記錄進度,因為 context 滿了之後 Claude Code 會摘要舊對話。指南也提到 Opus 5.5 是第一個以 Fable 等級生物與資安防護上線的 Opus 模型。

  • 範例任務的完成條件:所有 endpoint 改用新 client、舊 client 刪除、測試通過
  • 一位早期測試者表示,Opus 5.5 最低 effort 抓到的 bug 比 Opus 5 高 effort 更多,誤報也更少
  • 做審查與研究時,要求它標出自己無法確認的項目

💡 為什麼重要:在 Claude Code 跑長任務、維護 CLAUDE.md 的工程師,可以直接套用文中的完成條件、停止規則與 TASKS.md 寫法,並清掉既有 prompt 裡的「think carefully」。

🔗 閱讀原文 | 來源: claude.dev / Hacker News

10. Capcom 計畫讓 RE Engine 逐步走向 AI 生成引擎#

Capcom 在 Capcom Open Conference RE: 2026 上,由程式設計師 Satoshi Ishida 發表 REX Project 簡報,主題是 RE Engine 的下一代。他指出 Resident Evil 規模的開發,連簡單工作都很耗時,解法是把 AI 整合進開發流程。Capcom 先前表示不會在遊戲裡使用 AI 生成素材,AI 只用來提升開發效率;Ishida 的說法與此一致,但也提出要讓 RE Engine 漸進轉成「AI-generation game engine」,目標是與 AI 一起做遊戲(據 IGN 翻譯)。

  • 簡報名為 REX Project,談 RE Engine 下一代演進
  • Capcom 先前的公開立場:遊戲內不放 AI 生成素材
  • 轉型是分階段、漸進式的

💡 為什麼重要:用 RE Engine 的 Capcom 內部工程與美術團隊,開發流程會逐步加入 AI 工具;其他遊戲公司評估引擎工具鏈時,也多了一家大廠的公開路線可以對照。

🔗 閱讀原文 | 來源: The Verge

11. Rust for CPython:Python 3.16 先上選用的 Rust zlib#

David Hewitt 在 Python Language Summit 代表 Rust for CPython 團隊報告時程與成功標準,團隊由核心開發者 Kirill Podoprigora 與 Emma Smith 主導,Discord 頻道約 60 位開發者。他用 type-crash 議題數說明動機:2021 年 82 件、2025 年 222 件,2026 年預估約 353 件。Python 3.16(2027 年 10 月)先提供選用的 Rust zlib 後端(zlib-rs),C 程式碼保留作 fallback;最早到 Python 3.18(2029 年)才可能變成建置必要條件。

  • 3.17(2028 年 10 月)預計擴及 io、json、xml、memoryview、parser
  • CPython 官方支援 20 個架構與平台,平台支援是去年最大疑慮,Hewitt 說現在「less and less of a concern」
  • 成功標準之一是多數活躍核心開發者對 Rust API 持開放態度,團隊會發問卷

💡 為什麼重要:各平台的 Python 發行版維護者,要在 3.16 前後評估 Rust 工具鏈與建置流程,有平台問題要趁早回報。

🔗 閱讀原文 | 來源: Python Blog / Lobste.rs

12. Chrome 154 兩天內第二次更新,修補 11 個漏洞#

Google 在 9 月 29 日發布 Chrome 154.0.8037.92/.93 版修補 32 個漏洞,兩天後又推出更新版。Windows 與 Mac 目前是 154.0.8037.97 或 .98,Android 是 154.0.8037.126,Linux 版會在幾天到幾週內推出。這次修補 11 個漏洞,其中 1 個是重大風險:WebGL 元件的越界寫入漏洞 CVE-2026-103628。

  • 11 個漏洞:1 個重大、9 個高風險、1 個中風險
  • 高風險中 4 個是 UAF、2 個整數溢位
  • Linux 版尚未釋出

💡 為什麼重要:管理公司電腦的 IT 與資安人員,Windows、Mac、Android 要盡快升到 154.0.8037.97 以上,Linux 機器得等版本出來再補。

🔗 閱讀原文 | 來源: iThome

推薦閱讀#

中文技術圈#

開源精選#

firelex/jeff — Python | ⭐ 1.4K 0.8B 的開放「System 1」模型,在給定選項之間挑一個並給出校準過的機率,毫秒級決策,可換 LoRA adapter、跑在自己的硬體上。

facebookincubator/muse-gadget-sdk — C | ⭐ 841 Meta 開源的 Muse 硬體裝置 SDK。

chasmlol/SkyCraft — C++ | ⭐ 754 用 Minecraft 的物理、背包、方塊與戰鬥玩 Skyrim(SKSE plugin + Fabric mod)。

nykooi1/vibe-wise — Python | ⭐ 688 Claude Code plugin,讓你在 AI 寫程式的同時學會怎麼做。

composio-community/open-dot — TypeScript | ⭐ 507 開源個人 AI agent,在自己的電腦上自主工作,Mac app,OpenAI + Composio。

deepseek-ai/DeepGEMM-Ascend — C++ | ⭐ 491 DeepSeek 給華為昇騰 NPU 用的矩陣乘法 kernel 函式庫。

ESPARGOS/esp-sdr — C | ⭐ 461 利用 ESP32 未公開的原始 I/Q 擷取功能,把它變成軟體定義無線電。

amywork777/lipflow — Python | ⭐ 445 按住快捷鍵、無聲對嘴,文字就打到游標位置,在 Mac 本機執行。

影音精選#

Crusoe CEO: Why Everyone Gets GPU Depreciation & AI Energy Costs Wrong#

2026-10-03 · 20VC

20VC

Crusoe 共同創辦人暨 CEO Chase Lochmiller 在 Series F 募得 39 億美元、估值 309 億美元後上 20VC。逐字稿是跨全片取樣,以下是取樣段落的重點。

  • Crusoe 賣三種產品:資料中心、GPU、token;長約 take-or-pay 毛利較低,短期 inference 合約毛利較高,靠組合拉出混合毛利
  • 中壓配電設備市場交期 100 週,Crusoe 垂直整合自己做只要 28 週,才能一年內完工
  • 他主張資料中心不會推高當地電價,真正的代價是施工期間的交通與粉塵;員工數已接近 2,000 人

10月10日,硅谷101年度科技大會線下見!#

2026-10-03 · 硅谷101

硅谷101

硅谷101 預告 10 月 10 至 11 日在矽谷舉辦的第三屆年度大會 Alignment 2026,內容以議程介紹為主。

  • 第一天從 AI Alignment 開始,討論白宮把監督主導權交給業界後,自我監管夠不夠
  • Neolabs 場次邀 Elorian、Axiom、Recursive Superintelligence 創辦人,背景是 World Labs 被 AMD 收購
  • World Labs、Google DeepMind 與 NVIDIA 研究員同台談視覺生成與機器人

The Top Companies in Q4 2026#

2026-10-02 · 20VC

20VC

20VC 解讀 Harmonic 的 Q4 2026 Hot 25 新創榜單,重點是前幾名和背後的投資方。

  • Resolve AI 第三度登頂,18 個月內估值約漲 10 倍;第二名 Latent 3 月完成 8,000 萬美元 Series A,服務美國前 20 大醫療體系的一半
  • 第三名 StarCloud 做太空資料中心,第六名 Emerald AI 做資料中心用電管理
  • General Catalyst 與 Y Combinator 各有 6 家上榜,Jeff Dean 個人投了 5 家,跟 a16z 一樣多

The Rise of AI Assistants#

2026-10-02 · 20VC

20VC

Benchmark GP Jack Altman 的短片段,談消費者 AI agent 會不會成為新平台。

  • 拿 coding 領域 Cursor、Cognition 面對大型實驗室的處境做類比
  • 引用 Ben Thompson 的說法,把這類 agent 稱為 aggregator of aggregators
  • 重點從對話轉成替使用者執行任務,預期獨立業者和大型實驗室都會推產品

今日觀察#

Anthropic 的 Opus 5.5 指南要你在任務裡寫清楚完成條件和停下來問的時機,PostHog 的 dreaming 任務刻意只讀已經 merge、已經 ship 的東西,理由是避免 hallucination。兩邊的做法一致:讓 agent 只從可以檢查的狀態出發。離職的 OpenAI 安全員工 David Robinson 批評的 iterative deployment 走反方向,出事之後才補 guardrail,他舉的例子是 OpenAI 的 agent 入侵 Hugging Face 系統。gVisor 同一天捐給 CNCF,採用者名單上有 OpenAI 和 Anthropic,跑 AI 程式碼的 sandbox 正在變成大家共用的基礎設施。我自己會先做兩件事:雲端帳號把硬性上限設好,交給 agent 的任務都附一條能用資料庫或測試檢查的完成條件。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有