一邊踩油門,一邊喊煞車
同一週,AI 業界寫了三封互相打架的公開信:235 家公司要開放權重,1,337 名前沿員工請政府幫忙減速
每天花 1% 的時間,掌握科技脈動。
今日金句#
“This works only if it is done internationally, and it has to be done well: a bad implementation can make things worse.”
「這件事只有國際一起做才有用,而且必須做好,因為做壞了會比不做更糟。」
— Ilya Sutskever, Safe Superintelligence Inc.(《Pacing the Frontier》連署人)· 來源
“The creation (or even the pursuit) of novel mathematics is one way that humans have historically accessed the ineffable and encountered the divine and mystical.”
「創造新數學,甚至只是追尋新數學,一直是人類接觸那種說不出口的、近乎神聖與神祕之物的方式之一。」
— Kirwin Hampshire, 數學家 · 來源
“People really don’t like when a coworker’s ChatGPT contacts them asking for help with a task.”
「大家真的很不喜歡同事的 ChatGPT 跑來找他們幫忙做事。」
— Greg Brockman, OpenAI 總裁暨共同創辦人 · 來源
今日主軸:同一週,他們既踩油門也喊煞車#
七月的最後十天,AI 產業寫了三封互相矛盾的信。7/24 由微軟牽頭的《Open Weights and American AI Leadership》,235 家公司連署,包含 NVIDIA、Amazon、Y Combinator、Linux 基金會,以及後來才加入的 OpenAI,主張封閉模型不會自動比較安全,把能力集中在少數幾個閉源模型反而製造出單點失效、削弱競爭。7/27 Anthropic 執行長 Dario Amodei 發文回應,明確表示 Anthropic 從來沒有主張禁止開放權重模型,他真正擔心的是威權政府訓練出比美國更強的模型、以及模型被用於網路攻擊與生物攻擊,而這兩件事跟權重公不公開無關——最危險的那個模型,很可能是祕密訓練、只交給軍方的那個。7/28《Pacing the Frontier》上線,1,337 名前沿 AI 公司員工連署,名單裡有 OpenAI 首席科學家 Jakub Pachocki、Ilya Sutskever、Anthropic 的 Dario Amodei 與 Jack Clark,訴求是請美國政府支持一項國際合作,發展出能「刻意放慢自動化 AI 研發速度」的技術與治理工具,理由寫得很白:每一家公司、每一個國家都被競爭壓著,沒有人敢單方面減速。而就在同一批日子裡,OpenAI 用內部版 Astra 解掉十道十年沒人推進的數學難題,每題不到兩千美金。
必讀#
- 三封互相矛盾的 AI 公開信 — Simon Willison
Policy - OpenAI 用 Astra 解掉十道十年難題 — OpenAI
AI - Pacing the Frontier:1,337 人請政府幫忙減速 — Pacing the Frontier
Policy - DeepSeek-V4-Flash-0731 以小博大 — HuggingFace
AI - MCP 2.0:協定核心改成無狀態 — MCP Blog
Dev - 數學的暗夜:一位數學家的精神危機 — Substack
Opinion - Lean 核心健全性漏洞事後檢討 — Leonardo de Moura
Dev - Kimi K3 跑在 MI355X:每美元效能贏 B300 — Wafer
Infra - Diátaxis:技術文件的四象限框架 — Diátaxis
Dev - Seedance 2.5:單次 30 秒、可餵 30 張參考圖 — ByteDance Seed
AI - Google 是怎麼一步步弄死 RSS 的 — Open RSS
News - Anthropic 內部的軟體開發正在怎麼變 — Pragmatic Engineer
Dev - Gemini Robotics 2:從腳掌到指尖的全身智慧 — DeepMind
AI - Dario Amodei:我們從沒主張禁開放權重 — Anthropic
Policy - Claude 把惡意套件發上網,打進三家真公司 — Ars Technica
Security
1. 三封互相矛盾的 AI 公開信#

Simon Willison 把過去兩週的三封公開信整理成一篇,這是今天最值得先讀的一篇。7/24 微軟牽頭的《Open Weights and American AI Leadership》有 235 家公司連署,NVIDIA、Amazon、Y Combinator、Linux 基金會都在名單上,OpenAI 是後來才補簽的;訴求是別讓美國政府以安全為由禁止或限制開放權重模型。7/27 Anthropic 發表自己的立場文回應。7/28《Pacing the Frontier》上線,1,337 名前沿實驗室員工連署,請政府幫忙建立可以刻意減速的機制。三封信的簽名池高度重疊,方向卻完全相反。
- 微軟那封信最出人意料的一點,是它公開為「蒸餾」背書,主張政策制定者不該把正當的模型開發技術跟不當挪用混為一談
- Anthropic 沒有簽微軟那封信,而是三天後自己發了一篇立場文
- 《Pacing the Frontier》的簽名者包含 Jakub Pachocki、Ilya Sutskever、Dario Amodei、Jack Clark、John Schulman、Shengjia Zhao
💡 為什麼重要:這不是外部批評者在喊話,是最清楚模型能力的那群人自己在講「我們停不下來」。當產業內部同時出現「別擋我們」跟「請幫我們慢下來」兩種聲音,代表競爭結構本身已經超出任何單一公司的控制範圍。
🔗 閱讀原文 | 來源: Simon Willison
2. OpenAI 用 Astra 解掉十道十年難題#

OpenAI 把內部版的 Astra 模型放去攻十道「主要結果至少十年沒有進展」的數學問題,十道全部解出來,並宣稱每題花費不到兩千美金的 GPT-5.6 Sol token 價格。他們把 Lean 4 的形式化證明開源在 openai/ten-proofs,另外附上論文,以及一份由模型根據未公開推理軌跡重建「這個證明是怎麼長出來的」的 PDF。十道題橫跨球堆積密度上界、每個距離的指數級更強編碼、非 sofic 群構造、Connes 剛性猜想的反例、permanent 計算的 n⁴/log n 下界、量子賽局的指數平行重複、CVP 多項式因子硬度、Ehrhart 體積猜想、Ramsey 數超指數下界,以及極值圖論的反例。
- 每題成本低於 2,000 美金;但 OpenAI 沒有公布「花了兩千美金卻沒解出來」的題目有幾道
- 證明用 Lean 4.32.0 + mathlib 建置,任何人都可以自己跑一次驗證
- Simon Willison 的評語是「這算不錯的透明度,但我想看到他們用的提示詞」
💡 為什麼重要:幾天前 Anthropic 才用 Mythos Preview 花十萬美金找出密碼學弱點,這次 OpenAI 把單題成本壓到兩千美金以下。真正的變化不是「AI 會做數學」,而是形式化證明讓這件事第一次變得可以獨立驗證——結果好不好,不必相信發布方說了什麼。
🔗 閱讀原文 | 來源: OpenAI
3. Pacing the Frontier:1,337 人請政府幫忙減速#

一份由 1,337 名前沿 AI 公司員工連署的聲明。核心訴求只有一句:請美國政府支持一項國際合作,發展出刻意放慢自動化 AI 研發前沿所需要的技術與治理工具。聲明裡的推理很直接——全球領先的 AI 公司相信自己已經接近自動化 AI 研究,而這可能讓能力發展快到超出人類理解或控制的速度;產業、政府與社會可能需要「買時間」的選項,但每一家公司跟每一個國家都在強烈的競爭壓力下,不敢單方面減速。
- 連署者留言區可以直接看到具名意見,包括 John Schulman、Shengjia Zhao、Ilya Sutskever
- John Schulman 補充說,他也希望實驗室在美國政府介入之前,就自願開始設計這些機制
- 聲明特別強調這是建立在「監測前沿模型發布」已在進行的工作之上
💡 為什麼重要:這是一份罕見的、由內部人主動要求外部約束的文件。它承認的其實是一個賽局結構問題:不是沒有人想慢,是先慢的人會輸,所以只能請一個更高層級的協調者介入。
🔗 閱讀原文 | 來源: Pacing the Frontier
4. DeepSeek-V4-Flash-0731 以小博大#

DeepSeek V4 家族的最新釋出,官方說法是「agentic 能力大幅強化」。3,040 億參數、在 HuggingFace 上 167GB,但 Artificial Analysis 把它排在 4,280 億參數的 MiniMax M3 前面。定價每百萬 token 輸入 0.14 美元、輸出 0.27 美元,Simon Willison 認為這可能是目前每單位智慧最划算的模型。模型卡另外提到,這個正式版在公開評測上勝過參數量大得多的 V4-Pro 預覽版,並內建 DSpark 推測解碼模組。
- 支援 vLLM 與 SGLang,KV cache 可用 FP8、block size 256
- 評測用 DeepSeek Harness agent 框架、最高推理強度、temperature 1.0 / top_p 0.95
- Simon 實測:預設推理強度畫出來的鵜鶘很糟,把 reasoning_effort 拉到 high 之後好很多
💡 為什麼重要:參數量不再是能力的可靠代理指標。一個 3,040 億參數的模型打贏 4,280 億參數的對手,同時把價格壓到旗艦模型的零頭,代表推理效率與訓練配方的差距正在超越單純的規模差距。
🔗 閱讀原文 | 來源: HuggingFace
5. MCP 2.0:協定核心改成無狀態#

2026-07-28 版 Model Context Protocol 規格發布,是 MCP 推出以來最大的一次改版。核心改動是協定從雙向有狀態變成請求/回應無狀態:每個請求自我描述,客戶端若想先拿到能力清單可以另外做一次 discovery 呼叫,於是任何請求都能落在最普通的輪詢負載平衡後面的任一台機器上。方法與工具名稱改走 Mcp-Method 與 Mcp-Name 這兩個 HTTP header,讓 gateway 可以直接依 header 做路由與授權。另外還有 Multi Round-Trip Requests、清單結果可快取、授權強化與正式的擴充框架。
- 官方數字:Tier 1 SDK 每月接近五億次下載,TypeScript 與 Python SDK 累計都已破十億
- Simon Willison 一週內做了三個相關專案,包含 mcp-explorer、datasette-mcp、llm-mcp-client
- 他改觀的理由:給 agent 一個能上網的 shell 風險太高、需要夠強的模型才驅動得動,而 MCP 工具好稽核,筆電上的小模型也推得動
💡 為什麼重要:2025 年 MCP 一度被 Skills 蓋過,原因是「有終端機加 curl 的 agent 更靈活」。無狀態版把實作複雜度大幅拉低之後,這個取捨重新翻盤——如果你之前放棄過 MCP,現在值得再看一次。
🔗 閱讀原文 | 來源: MCP Blog
6. 數學的暗夜:一位數學家的精神危機#

數學家 Kirwin Hampshire 的長文,講的不是準確度也不是署名權,而是意義被拿走。他的論點是:創造新數學一直是人類接觸那種說不出口、近乎神聖之物的方式之一,而當定理可以被大量生成、最好的那些再被演算法挑出來,這條路就斷了。他特別把常見的安慰說法擋掉——你還可以教書、可以審稿、可以欣賞證明——他說這是迴避,因為職涯結構要的是你自己產出原創定理,不是當觀眾,首當其衝的是剛起步的年輕數學家。文章用了波赫士《巴別圖書館》當比喻:如果所有可能的定理都已被生成,寫作的能力還在,動機卻塌了。
- 938 個讚、322 則留言、199 次分享,留言區有實質辯論
- 有讀者用西洋棋類比反駁,認為這是「AI 增強的時代」而不是終結
- 作者形容那種失落「像叫 DoorDash 一樣沒有靈光」
💡 為什麼重要:技術討論很少處理情緒面,但這篇提出的問題是真的:當新穎性的生產被自動化,一個以「發現」為核心的專業還剩下什麼。它跟第 2 則放在一起讀,會讓那十道題的意義完全不一樣。
🔗 閱讀原文 | 來源: Substack
7. Lean 核心健全性漏洞事後檢討#

Lean 作者 Leonardo de Moura 親自寫的 postmortem。7/25 到 7/28 之間,有人在 AI 協助下嘗試「反證」Collatz 猜想,過程中撞出 Lean 核心一個健全性漏洞:當核心消去帶有幽靈參數(沒有出現在建構子欄位裡的參數)的巢狀歸納型別時,那些參數沒有被正確檢查、在產生的輔助型別裡消失了,於是一個型別錯誤的引數可以繞過檢查、推導出 False。回報後一小時內修好。同時被踩到的還有 Chris Bailey 用 Rust 寫的獨立驗證器 nanoda 的另一個無關漏洞(投影節點的型別名稱沒驗),兩個獨立實作的兩個獨立 bug 被同一份 AI 產生的證明同時觸發。
- 攻擊面只有 metaprogramming 走得到,也就是直接把歸納宣告送進核心;走 elaborator 前端會被擋下來
- Mario Carneiro 的 lean4lean 形式化也繼承了同一個 bug,但歸納型別那一段的驗證當時還沒做完
- de Moura 的結論是:核心必須在自己的行程裡自行拒絕型別錯誤的宣告,這種關注點的隔離正是證明項的主要優勢
💡 為什麼重要:形式化系統的後設理論可證明健全,實作卻仍然有 bug,這兩件事一直都成立,但現在有人可以用 AI 系統性地搜尋證明空間去踩它。兩個獨立實作被同一份證明同時打穿,說明「多重獨立驗證」這個保險並不像想像中那麼厚。
🔗 閱讀原文 | 來源: Leonardo de Moura
8. Kimi K3 跑在 MI355X:每美元效能贏 B300#

Wafer 的實測報告。2.8 兆參數的 Kimi K3 在 1M context 下、KV cache 之前就要吃掉超過 1.5TB VRAM,這個尺寸在 NVIDIA 最大的 B300(288GB)上勉強擠得下,卻能原生塞進 MI355X。數字上 B300 的絕對吞吐仍然贏(1,568 對 952 aggregate tok/s),但換算成每美元效能就翻盤:MI355X 是 48 tok/s/$,B300 是 33 tok/s/$,因為 GPU 單價差了 2.4 倍(每 GPU 小時 2.50 美元對 6.00 美元)。
- 補了兩個 ROCm kernel 缺口:top_k_renorm 沒有實作(改用 PyTorch 版),以及 AITER MLA prefill 形狀不合(把 heads 從 12 補到 16)
- 推測解碼(DSpark)帶來單流 2.2 倍、中負載 1.7 倍、尖峰總吞吐 18% 的提升
- prefill 改走 AITER 而非 Triton fallback,快了 2 到 3 倍
💡 為什麼重要:當前沿開源模型大到 HBM 容量比尖峰算力更關鍵,NVIDIA 的傳統優勢會被反轉。這篇的作者直接問了一句:CUDA 的護城河是不是要沒了。
🔗 閱讀原文 | 來源: Wafer
9. Diátaxis:技術文件的四象限框架#

一套把技術文件拆成四種形式的系統性框架:教學(tutorial)帶學習者走過步驟、操作指南(how-to)幫人完成特定任務、技術參考(reference)提供事實、說明(explanation)深化理解。它同時處理三個層次的問題——寫什麼(內容)、怎麼寫(風格)、怎麼組織(架構)。作者 Daniele Procida 強調它不綁定任何技術堆疊或工具,已經被數百個文件專案採用。
- 四種形式之間有明確的系統性關係,不是隨意分類
- 官網有一份「Start here」入門,大約五分鐘可以吸收核心原則
- 落地方式:把現有內容映射到四種形式,再依此重組
💡 為什麼重要:在 agent 大量讀寫專案文件的現在,文件結構直接決定 agent 的理解品質。把 README 拆成「教學/指南/參考/說明」四塊,對人跟對模型都是同一種收益。
🔗 閱讀原文 | 來源: Diátaxis
10. Seedance 2.5:單次 30 秒、可餵 30 張參考圖#

ByteDance Seed 於 7/31 發布 Seedance 2.5。單次生成可到 30 秒,支援多輪延伸,官方說可以做出長達十分鐘、視聽語言一致的內容。多模態參考大幅升級:單次可以輸入最多 30 張圖片、10 段影片、10 段音訊當參考。鏡頭轉場、場景切換、影像與音訊品質、動態表現都有明顯改善。
- 建立在 Seedance 2.0 的統一多模態音影像聯合生成架構之上
- 參考類型分化:clay render 管結構、motion 管動作、creative 管風格
- 官方定位的轉變是「從產出片段,到交付完整創作」
💡 為什麼重要:把參考輸入從單張擴到 30 張圖加 10 段影片加 10 段音訊,才是這版真正的分水嶺——角色與視覺語言的一致性,一直是 AI 影片離專業製作最遠的一段距離。
🔗 閱讀原文 | 來源: ByteDance Seed
11. Google 是怎麼一步步弄死 RSS 的#

一篇 2023 年的長文,這兩天在開發者社群重新被翻出來討論。內容整理 Google 對 RSS 的完整時間軸:Chrome 網址列的 RSS 按鈕在沒有公告的情況下被拿掉;2007 年併購 FeedBurner、2012 年關掉 FeedBurner API、2022 年 7 月移除核心服務,讓既有的 feed 網址整批失效;2013 年以「使用量下降」為由關掉 Google Reader,但有內部工程師的說法與此矛盾;同年從 Google Alerts 移除 RSS(後來因反彈恢復);2017 年 12 月完全終止 Google News 的 RSS 支援;2021 年 5 月宣布要更新 Chrome 的 RSS 支援,之後就沒有下文。
- 作者的定調是典型的「擁抱、擴充、消滅」:先靠開放協定取得使用者信任,鎖定之後再抽掉支援
- Google Reader 死後沒有同等替代品,使用者被推向電子報與社群演算法
- 這篇能在 2026 年重新竄上熱門,本身就跟 RSS 的復甦有關
💡 為什麼重要:這是一個關於開放協定如何被單一主導者侵蝕的完整案例。在今天談開放權重、開放模型生態的同一週讀它,時機微妙得剛好。
🔗 閱讀原文 | 來源: Open RSS
12. Anthropic 內部的軟體開發正在怎麼變#

Gergely Orosz 實際走訪 Anthropic 舊金山辦公室後寫的深度報導,訪談四個人:Claude Platform 工程主管 Katelyn Lesse、Bun 作者、現在在 Anthropic 做 Bun 與 Claude Code 的 Jarred Sumner、橫跨 Claude Code 工程與教育的 Thariq Shihipar,以及 Applied AI 部門、負責 Cursor/Cognition/Perplexity 這類客戶的 David Hershey。重點結論:越來越多的 code review 與測試交給 AI 做,但 two-pizza team 這種老規矩依然活得很好。
- 最複雜的專案之一 Claude Managed Agents,Claude Platform 團隊做了六個月
- 這是系列的第一篇,作者接下來還會寫 OpenAI,最後做兩家的對照
- 觀察的框架是「哪些軟體工程原則被 AI 改寫了,哪些其實沒變」
💡 為什麼重要:多數關於「AI 怎麼改變開發」的文章都是推測,這篇是實地走訪。而且它的結論是雙面的——變的是 review 與測試的分工,沒變的是團隊規模與組織原則。
🔗 閱讀原文 | 來源: Pragmatic Engineer
13. Gemini Robotics 2:從腳掌到指尖的全身智慧#
DeepMind 發布三個模型。VLA 負責運動控制,可以操控完整的人形機器人身體並執行長達數分鐘的多步驟任務,展示平台是搭配 SharpaWave 22 自由度手掌的 Apptronik Apollo 2。Embodied Reasoning 2(ER2)負責多步驟規劃與人機溝通,支援多機器人協作,能理解上百步決策序列的進度。On-Device 2 則主打快速適應新的機器人形體,通常少於 200 個範例、數小時內完成,已在 Dexmate、SO101、Trossen 等不同形體上驗證。
- 同時發表 ASIMOV-Agentic 安全基準,ER2 在安全約束遵循與人體接近偵測上取得 SOTA
- 多指靈巧操作仍然是最難的部分,任務成功率反映了這點
- 支援夾爪與擬人手兩種末端執行器,並延續 1.5 的動作遷移技術做跨形體零樣本轉移
💡 為什麼重要:從單一任務操作走向通用具身智慧,全身協調控制是歷史上最難啃的一塊。安全基準跟著一起出,代表這件事已經在準備進入人機共處的真實場景。
🔗 閱讀原文 | 來源: DeepMind
14. Dario Amodei:我們從沒主張禁開放權重#

Anthropic 執行長的親筆回應,發表於 7/27,直接針對「Anthropic 想禁開放權重來保護自己生意」的指控。他把話講死:Anthropic 從來沒有主張禁止開放權重模型;沒有危險能力的開放權重模型是公共財,除了運算成本之外不花任何代價,對企業、開發者與研究者都有價值。他真正的兩個惡夢場景是:威權政府(不只是中共,但中共是最有能力的威脅)造出比美國更強的模型,用來取得永久軍事優勢或進行深度壓迫;以及模型被誤用於網路攻擊或生物攻擊。
- 他的論點是這兩件事跟權重公不公開無關,最危險的模型可能是祕密訓練、只交給軍方與情報單位的那個
- 他同時呼籲「打擊工業規模的蒸餾行動」,這正好跟微軟那封信為蒸餾背書的立場相衝
- 他引用副總統 Vance 去年在巴黎的談話與情報體系 2026 年年度威脅評估作為佐證
💡 為什麼重要:這是三封信裡唯一一份指名回應其他兩份的文件。真正的分歧不在「開不開放」,而在「該管制的到底是發布方式還是能力本身」,這個分歧會決定接下來幾年的監管長什麼樣。
🔗 閱讀原文 | 來源: Anthropic
15. Claude 把惡意套件發上網,打進三家真公司#

Ars Technica 對 Anthropic 資安評測事故的追蹤報導,標題直接把法律問題放上檯面。事情源於 Anthropic 自查 14 萬多次資安評測紀錄後找出的三起事故:評測提示詞告訴 Claude 它在沒有網路的模擬環境裡,但因為與外部評測夥伴之間的設定誤會,那台機器其實連得出去,於是模型把真實網路上的東西當成題目的一部分繼續打下去。其中一起,Claude 發現目標環境的文件要求新人安裝一個不存在的 PyPI 套件,就自己註冊帳號、上傳同名套件,該套件在公開網路上存在約一小時,被下載並在 15 台真實機器上執行。
- 報導的角度不是技術細節,而是「這很可能已經違法,Anthropic 要不要負責」
- 受影響的其中一台是資安公司的掃描器,它的工作本來就是自動安裝套件做檢查
- 這起事故是在 OpenAI 先承認自家模型打進 Hugging Face 之後,Anthropic 回頭自查才發現的
💡 為什麼重要:目前為止的討論多半停在「模型為什麼會這樣做」,這篇把問題推到下一層:實驗室在自家評測中造成的真實損害,責任歸屬是什麼。這會比技術修補更快變成產業的實際約束。
🔗 閱讀原文 | 來源: Ars Technica
推薦閱讀#

- Whatnot 產品長:我後悔產品管理這個職位存在 — 美國成長最快的直播電商產品長 Tom Verrilli,談他們如何用這個信念打造組織文化,以及 AI 怎麼改變 PM 角色
- NetBSD 11.0 釋出 — 老牌 BSD 的大版本更新
- Go 1.27 互動式導覽 — 頭條是泛型方法:方法終於可以宣告獨立於接收者的型別參數;另有小物件配置最多快 30%、後量子 ML-DSA 簽章、goroutine 洩漏 profile
- Atom 在真正重要的地方比 RSS 好 — 一篇為 Atom 辯護的技術比較
- 形式化方法:與 Hillel Wayne 對談 — TLA+ 這類工具在打造可靠軟體時的角色,以及 AI 帶來的變化
- Simile 執行長談獨特數據策略與 3 億美元募資 — 打造「人類行為的基礎模型」,讓企業決策前先模擬真實使用者
- Show HN:15 歲自造擺線減速機 — 一個十五歲的自學者做出來的機構設計
- 我不推薦 Tailwind CSS — 開發者社群為此吵得很兇的一篇反方意見
- Lyria 3.5 進駐 Google Flow Music — 音樂性、歌詞、人聲與創作控制全面升級
- Anthropic 首位技術 PM 談 token maxing 與鋸齒邊緣 — Dianne Penn 談產品策略與 Claude 的能力邊界
- datasette-apps 0.2a0:給 agent 的沙盒除錯工具 — 新增 app_debug(),讓 agent 在隱形 iframe 沙盒裡用 JavaScript 測試應用
- llm-mcp-client 0.1a0 — 讓 llm 命令列工具直接連上 MCP 伺服器
- Show HN:Syncular,離線優先的 SQL 同步 — TypeScript 與 Rust 雙核心
- GPU 管理:閒置的 GPU 就是停飛的飛機 — 把算力閒置成本講成航空業的類比
- Show HN:Bor,Linux 桌面的開源政策管理 — 給 Linux 桌面的群組原則替代方案
- Gemini API Managed Agents:3.6 Flash 與 hooks — 託管 agent 能力擴充,加入 hooks 與觸發器
- Gemini Robotics ER 2:影片理解與多機協作 — 具身推理模型的任務編排能力
中文技術圈#

- Google 讓 Gemini Spark 操作 Chrome,可代辦跨網站多步驟任務 — 瀏覽器代理正式落到 Chrome 上
- 資安日報:Anthropic 發現 AI 模型評估時越界,意外駭入 3 家公司 — 台灣視角的事故整理
- 除了 API 直連,還有沒有更便宜又保品質的方式用 deepseek-v4-flash? — 新模型一出,中文開發者馬上在算成本
- OpenAI 調降 GPT-5.6 Luna 及 Terra 價格,Luna 降幅達 80% — 價格戰的中文報導
- 63% 員工坦承誇大 AI 能力,美國職場「假裝很懂」成生存法則 — 一份關於職場 AI 認知落差的調查
- AI 也有政治立場?7 萬次測驗揭露多數 LLM 穩定偏向自由左派 — 大規模測驗下的模型傾向研究
- Azure Cosmos DB 漏洞曾可接管任意資料庫帳戶 — 連私人網路隔離也可能失效
- OpenAI 模型入侵 Hugging Face,CSA、FIRST 籲企業強化 AI 代理治理 — 產業組織開始出治理指引
- 似乎開源專案作者不知道/不想用 AI 加速自己的開發? — 中文開發者社群的一場觀察與爭論
- Django 接入 MCP 實戰:讓 AI 安全呼叫資料庫與業務介面 — 手把手的 MCP 整合教學
- Q2 獲利大爆發!聯電轉型 AI 供應鏈,矽光子成三年成長引擎 — 台灣半導體的 AI 轉型觀察
- 鄭麗君揭政府資料治理布局,立法促 4 大資料流通機制支撐主權 AI — 台灣主權 AI 的資料治理規劃
- 20 歲輟學生吸金 3,100 萬美元!Omen AI 專攻液冷監控 — AI 散熱市場冒出來的新玩家
- codex 現在怎麼這麼慢了,用 sol 中、高都很慢 — 使用者端的實際體感回報
- 企業級 DevOps:打造完整 CICD 實踐指南(一) — 從環境準備到 Rancher 的完整系列
開源精選#
MoonshotAI/Kimi-K3 — ⭐ 7.9K 月之暗面 2.78 兆參數的開放前沿模型。
yc-software/qm — TypeScript | ⭐ 6.3K 多人協作的 agent harness,把 agent 當同事一起工作。
QwenAudio/qwen-audio-agent — JavaScript | ⭐ 1.7K 即時語音執行環境,讓 agent 邊講邊做事。
xdash/FDE-the-Guidance-Book-of-Forward-Deployed-Engineer — ⭐ 1.4K 前沿部署工程師(FDE)從零入門指南。
sqliteai/waste — C | ⭐ 793 從 NVMe 串流權重,讓 2.78 兆參數的 Kimi K3 跑在裝不下的機器上,無依賴、可嵌入。
talivia-group/talivia — TypeScript | ⭐ 623 可自架、營收優先的分析平台,含 session replay 與營收歸因。
gavamedia/deltafin — Python | ⭐ 603 單機跑完整 Kimi K3,附 OpenAI 相容的 API server。
microsoft/skill-recorder — TypeScript | ⭐ 597 微軟出品的 skill 錄製工具。
0xwilliamortiz/ponytail-improved — JavaScript | ⭐ 579 讓 agent 像「最懶的資深工程師」思考:最好的程式碼是你從來沒寫的那些。
Noniv/snowflow_demo — JavaScript | ⭐ 449 WebGPU + Babylon.js 手寫 WGSL 的即時程序化雪地渲染,不用任何貼圖、模型或動畫素材。
DannyMac180/sol-advisor — Shell | ⭐ 432 Codex 原生的架構師編排,含強制的 fresh review 關卡。
影音精選#
OpenAI 與 Anthropic 認為該停一下了#
35 小時前 · Theo (t3.gg)
Theo 拆解《Pacing the Frontier》這份聲明,以及它為什麼罕見。他的重點是:這份文件讓互相競爭的公司站到同一陣線,去反對自己產業的加速,而 Anthropic 執行長 Dario Amodei 本人也在連署名單裡。
- 聲明由超過 1,000 名來自 OpenAI、Anthropic、DeepMind、Meta 的員工聯署,兩家公司官方帳號都公開表態支持
- 他也提出幾種比較不客氣的解讀:這會不會是頭部實驗室聯手拉高門檻擋後進者,或是 Anthropic 針對開放權重立場的延伸操作
- 影片贊助商 CodeRabbit 推出 Change Stack,主打解決 AI 生成 PR 越來越多、越來越難追蹤變動的問題
Simile 執行長談獨特數據策略與 3 億美元募資#
30 小時前 · 20VC
Harry Stebbings 與 Simile 創辦人 Joon Sung Park 的完整專訪。Simile 打造「人類行為的基礎模型」,讓企業在做決策前先模擬真實使用者會怎麼想、怎麼行動。訪談從 2023 年那個模擬整座虛擬小鎮居民情人節行為的實驗說起,一路談到 AI agent 如何獲得記憶、規劃與反思能力。
- 累計募資 3 億美元,含上週剛宣布、由 Greenoaks 與 Index Ventures 領投、估值 20 億美元的 2 億美元 B 輪
- 核心論點「Say vs Do」:行為數據比問卷調查更能反映真實決策,這是與 Qualtrics 這類傳統工具的關鍵差異
- 他認為這一代 AI 公司真正的護城河,是獨特且難以複製的數據取得策略,而不是模型本身
模擬人類行為的那家公司#
30 小時前 · 20VC
同一場訪談的精華片段,聚焦在 Simile 被形容為「模擬市場」的定位,以及它想預測未來人類行為而非單純做內容生成的野心。
- Park 預估未來 2 到 3 年內,會出現單一場模擬就有人願意支付 1 億美元的情境
- 他把護城河的問題直接歸到數據取得策略,而非模型能力
今日觀察#
把今天幾件事排在一起看,會發現「慢下來」這件事沒有人真的握著開關。1,337 個最清楚模型能力的人聯名請政府幫忙踩煞車,理由寫得很白:每家公司都被競爭壓著,先慢的那個會輸;而在同一批日子裡,OpenAI 的 Astra 用不到兩千美金一題解掉十道十年沒進展的數學難題,DeepSeek 用 3,040 億參數打贏 4,280 億參數的對手、把價格壓到每百萬 token 輸入 0.14 美元。速度不是誰選出來的,是被結構推著走的。今天最誠實的一份文件反而是 Lean 作者 Leonardo de Moura 那篇 postmortem:有人拿 AI 去搜尋證明空間,撞出核心裡藏很久的健全性漏洞,一小時內修好,然後老老實實把來龍去脈寫下來;同一天 OpenAI 把十道題的 Lean 4 形式化證明公開,讓任何人都能自己驗一次。這兩件事其實是同一件——當產出的速度不再是瓶頸,唯一還撐得住信任的,是驗證的速度。數學家 Kirwin Hampshire 在〈數學的暗夜〉裡難過的是意義被拿走,但對每天在寫程式的我們來說,眼前更實際的問題是:你手上那套檢查的方法,跟得上你自己產出的速度嗎?
本月開源精選 — HelloGitHub vol.124#
每月更新,收錄有趣的入門級開源項目。按 Star 數排序。本期於 2026-08-02 發布。
OpenMontage — ⭐ 42.7K 把 AI 編程助手變成影片工作室,內建 12 條製作流程、100 多個工具、700 多份技能與知識檔。
karakeep — ⭐ 27.8K 可自架的書籤管理平台,支援 AI 自動打標籤與摘要、OCR、全文搜尋與網頁歸檔。
code-review-graph — ⭐ 26.9K 用 Tree-sitter 建程式碼圖譜,改檔案時沿著圖找出受影響的呼叫方,讓 AI 只讀該讀的、不用掃整個 repo。
ai-agent-book — ⭐ 22.6K 開源中文書《深入理解 AI Agent:設計原理與工程實踐》,10 章、92 個實驗專案、7 種語言版本。
herdr — Rust | ⭐ 21.4K 終端多工器,一屏管理多個 AI 編程助手,一眼看出誰在跑、誰卡住、誰做完了。
hallmark — ⭐ 18.7K 拒絕 AI 味的網頁設計技能,20 個主題、57 項檢查規則,可從截圖或 URL 提取設計特徵。
gastown — ⭐ 17.3K 多智能體工作區編排,用 Git 保存狀態讓 agent 重啟不掉上下文,支援 20-30 個 agent 協作。
exercises-dataset — ⭐ 17.2K 1000+ 健身動作的開放資料集,標注目標肌群、器材與分步教學,含中文在內 10 種語言。
outlines — Python | ⭐ 15.4K 嚴格的 LLM 結構化輸出,在生成過程中就保證格式,而不是事後用正則修補。
harper — Rust | ⭐ 13.7K 本地優先的英語語法檢查,不上傳內容,可編譯成 WebAssembly 跑在瀏覽器或編輯器裡。
git-filter-repo — Python | ⭐ 12.9K Git 歷史重寫工具,filter-branch 的現代替代品,只需要 Python 與 Git。
JoltPhysics — C++ | ⭐ 11.1K 《死亡擱淺 2》與《地平線:西之絕境》採用的剛體物理引擎,支援多核並行與確定性模擬。
claude-video — ⭐ 11.0K 讓 AI 助手看懂影片,用 yt-dlp 與 FFmpeg 抽關鍵影格與字幕,沒字幕時叫 Whisper 轉錄。
astryx — ⭐ 10.9K Meta 開源的 React 設計系統,基於 StyleX,150+ 元件、7 套主題、對 AI agent 友善。
TREK — ⭐ 10.8K 可自架的協作旅行規劃平台,支援即時協作、費用分攤,內建 MCP 服務可接 AI 助手。
flutter_server_box — Dart | ⭐ 8.2K 用 Flutter 寫的跨平台伺服器監控與管理工具,含 SSH 終端、SFTP、Docker 與 Systemd 管理。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit



