最強的 AI 開始要「核准」才能用
每天花 1% 的時間,掌握科技脈動。
今日金句#
“Depending on how you measure it you would predict the open source singularity by Christmas, or you would say that open source LLMs are consistently 5 months behind.” 「同一份數據,看你怎麼量:你可以說開源模型聖誕節前就追上了,也可以說它一直落後五個月。」 — Jamie Dborin, Doubleword 創辦人
“I have determined that appropriate safeguards are in place to permit certain trusted partners to access the Claude Mythos 5 Model.” 「我已認定相關安全防護到位,可以讓特定的可信夥伴存取 Claude Mythos 5 模型。」 — Howard Lutnick, 美國商務部長
今日主軸:最強的 AI 開始要「核准」才能用#
今天的新聞攤開來看,是同一個故事的兩層。最上面那層,前沿模型正在被「鎖起來」:OpenAI 預覽了新一代 GPT-5.6(Sol / Terra / Luna 三款),照理是頭條,結果更大的新聞是——美國政府要求它先別全面開放,得先審過用的人是誰;同一週,Anthropic 最強的資安模型 Mythos 5 也只放給一百多家「信得過」的公司與政府機關。最前沿的能力,正在從「誰都能用」變成「要核准才能用」。
但往下看一層,故事完全相反:OpenAI 自己內部用 AI 寫東西的量,半年暴增 56 倍,Google 的 design.md、MinerU、模型自動路由 這些「誰都能裝」的工具正在 GitHub 上狂飆。最頂的那一層被鎖進保險箱,真正在改變你我工作的,是底下那層敞開的工具。當模型本身變成受管制的戰略資產,問題就不再是「它有多強」,而是「我能不能拿到」——以及,當你拿不到最強的,手邊這些夠不夠你把事情做完。
必讀#
- OpenAI 預覽 GPT-5.6:Sol / Terra / Luna 三款定價出爐 — Simon Willison
AI - 美國政府出手,OpenAI 暫緩 GPT-5.6 全面開放 — TechCrunch
News - OpenAI 內部 Codex 用量半年暴增 56 倍 — Latent Space
AI - Anthropic Mythos 5 解禁,開放給 100+ 美國公司與機關 — TechCrunch
News - 2000 人輪流駭他的 AI 助理,六千次沒人成功 — Simon Willison
AI - Google 開源 design.md:讓 AI Agent 看懂設計系統 — GitHub
Tools - MinerU:把複雜文件轉成 LLM 看得懂的 Markdown — GitHub
Tools - Workweave Router:50ms 內幫你的請求選最划算的模型 — GitHub
Tools - Agent-Reach:一行指令讓 Agent 抓遍各大平台 — GitHub
Tools - 開源 vs 閉源 LLM 的差距,到底有沒有縮小? — Doubleword
AI - General Intuition 拿 3.2 億美元,賭用遊戲畫面訓練 AI — TechCrunch
Startup - 前 Databricks AI 主管:我能把 AI 電費砍 1000 倍 — TechCrunch
AI - Claude 正在 ChatGPT 的地盤搶下付費用戶 — TechCrunch
AI - AI 時代真正的優勢:努力和知識都被 AI 包了,剩下的是「內在功課」 — Lenny’s Newsletter
Startup
1. OpenAI 預覽 GPT-5.6:Sol / Terra / Luna 三款定價出爐#

OpenAI 發布 GPT-5.6 系列預覽,分成三款:旗艦 Sol(每百萬 token $5 / $30)、均衡 Terra($2.5 / $15,性能對標 GPT-5.5 但便宜一半)、低成本 Luna($1 / $6)。同時引入更可預測的提示快取(prompt caching)機制,支援顯式快取斷點與至少 30 分鐘的快取存活時間。依美國政府要求,目前先向少數信任夥伴提供預覽,計畫數週內全面開放。
- 三款定價拉開明顯梯度,Terra 主打「性能不輸前一代、價格砍半」,是成本敏感場景的甜蜜點
- 明確的快取斷點 + 30 分鐘快取存活,對長上下文、多輪 Agent 應用是實打實的省錢
- 發布即受限——這是第一次旗艦模型「先審用戶、再全面開放」
💡 為什麼重要:價格戰已經打到旗艦級,Terra 這種「對標上代、價格腰斬」的定價會直接壓縮中間層 API 轉售的利潤空間。
🔗 閱讀原文 | 來源: Simon Willison
2. 美國政府出手,OpenAI 暫緩 GPT-5.6 全面開放#

OpenAI 應美國政府要求,放慢 GPT-5.6 的部署,先審核使用者身分後才開放,並強調「這類限制不該成為常態」。這是前沿模型第一次因政府介入而延後公開,標誌著最強 AI 正在從商品變成受管制的戰略資產。
- 政府要求「先審人、再開放」,理由是國安與濫用風險
- OpenAI 公開表態不希望這變成長期預設,顯示業界與監管的拉鋸
- 與同週 Anthropic Mythos 只放給 100+ 機構形成同一個趨勢
💡 為什麼重要:當「能不能用最強的模型」變成政府說了算,創業者的技術選型多了一層地緣與政策風險,不再只是價格與性能。
🔗 閱讀原文 | 來源: TechCrunch
3. OpenAI 內部 Codex 用量半年暴增 56 倍#

OpenAI 內部經濟研究揭示,從 2025 年 11 月到 2026 年 6 月,員工在 Codex 上的 token 使用量急遽成長:研究部門中位數成長 56 倍、客服 32 倍、工程師 27 倍、法務 13 倍。關鍵反差是——即便 OpenAI 員工長期享有無限制存取,真正的重度使用直到最近才爆發。
- 成長最猛的是研究部門(56 倍),不是工程部門
- 法務、客服等非技術部門也都是雙位數倍增,AI 用量正在橫向擴散
- 「有工具」不等於「會用」,連 OpenAI 自己人都花了半年才真的上手
💡 為什麼重要:這是一個具體的工作轉型基準——如果連 AI 公司自己都是最近才重度依賴,多數公司其實還在起跑線,落後沒你想的多。
🔗 閱讀原文 | 來源: Latent Space
4. Anthropic Mythos 5 解禁,開放給 100+ 美國公司與機關#

川普政府逆轉先前的禁令,允許 Anthropic 最強的資安模型 Mythos 5 部署給 100 多家美國組織與政府機關,獲授權組織內的非美籍員工也能存取。商務部長 Howard Lutnick 表示「已認定相關安全防護到位,可以讓特定可信夥伴存取」。兩週前該模型才因安全研究者發現防護易被繞過而被禁。
- 從「全面禁用」到「放給 100+ 信任夥伴」,政策在兩週內大轉彎
- 存取以「組織白名單」方式控管,而非開放公眾
- 更受限的 Fable 5 版本尚未重新開放公眾使用
💡 為什麼重要:最強的資安 AI 變成需要政府核准的「白名單資產」,這是 AI 從產品走向受管制基礎設施的清晰訊號。
🔗 閱讀原文 | 來源: TechCrunch
5. 2000 人輪流駭他的 AI 助理,六千次沒人成功#

Fernando Irarrázaval 在 hackmyclaw.com 公開挑戰,讓任何人透過 email 嘗試騙他的 OpenClaw(底層是 Claude Opus 4.6)洩露機密。6000 次嘗試、花了 500 美元 token 費(還因為太多來信被 Google 停用帳號),沒有人成功。這顯示前沿模型對抗 prompt injection 已有顯著進步——但 Simon Willison 也提醒,6000 次失敗不等於絕對安全。
- 公開、可重現的對抗測試,0 成功率
- 模型內建明確的反提示注入規則,擋下提取憑證、改檔、執行命令等攻擊
- 你可以自己上 hackmyclaw.com 試——這是它的可玩之處
💡 為什麼重要:prompt injection 一直是 Agent 上生產的最大攔路虎;這個實驗給了「模型層防禦真的有進步」的實證,但別把它當成唯一防線。
🔗 閱讀原文 | 來源: Simon Willison
6. Google 開源 design.md:讓 AI Agent 看懂設計系統#
design.md 是一種雙層格式——YAML 設計 token + Markdown 人類敘述,讓 Claude、Cursor 這類編碼 Agent 能持續、結構化地理解設計系統。附帶 lint / diff / export CLI,支援 Tailwind v3/v4 與 W3C DTCG 格式轉換,內建 9 項檢查(對比度、斷掉的參考、孤立 token 等)。GitHub 已破 2 萬星。
- 機器可讀的 token + 人類可讀的設計理由,補上 Agent 與設計系統之間的認知鴻溝
- lint 能自動驗 WCAG 對比度、抓出斷掉的參考與孤立 token
- 可匯出到 Tailwind / W3C DTCG,整合現有工具鏈無痛
💡 為什麼重要:這正是「底下那層工具」的代表——把設計交給 Agent 維護,前端從設計到實作的循環會明顯變快。
🔗 閱讀原文 | 來源: GitHub
7. MinerU:把複雜文件轉成 LLM 看得懂的 Markdown#
MinerU 是文件解析引擎,把 PDF、Word、PPT、Excel、掃描件、網頁轉成 LLM 優化的結構化 Markdown 與 JSON,支援 109 種語言 OCR 與 VLM 雙引擎。三層管道:CPU 友善 Pipeline(86.47% 精度)、平衡 Hybrid、最高精度 VLM(95.39%),自動處理跨頁表格合併、公式轉 LaTeX。原生支援 MCP(Cursor / Claude Desktop / Windsurf)、LangChain、LlamaIndex。GitHub 逾 7 萬星。
- 保留表格、公式、版面層級,給 RAG/Agent 高品質輸入
- VLM 雙引擎讓你在速度與精度間自由取捨(86% vs 95%)
- 透過 MCP 直接接 Claude Desktop / Cursor,免額外包裝
💡 為什麼重要:文件智能化是 RAG 與 Agent 系統的地基,這類工具誰都能裝、零門檻,正是前沿模型被鎖住時最該補強的能力。
🔗 閱讀原文 | 來源: GitHub
8. Workweave Router:50ms 內幫你的請求選最划算的模型#
Workweave Router 是智慧路由代理,50 毫秒內把 API 請求導向 Anthropic / OpenAI / Gemini 的最佳模型,用內嵌的小型編碼器分析請求特徵動態選擇(不靠外部 LLM 決策),宣稱省下 40–70% 成本。支援 Claude Code、Codex、Cursor 與 OpenRouter 上的開源模型,提供 BYOK 自有金鑰加密。
- 路由延遲僅 50ms,對使用者幾乎無感
- 宣稱省 40–70% API 成本,靠的是「對的任務配對的模型」
- BYOK 加密,企業敏感工作負載也能放心自託管
💡 為什麼重要:多供應商時代,手動切模型既低效又貴;自動路由是把「省錢」這件事工程化,對成本敏感的 SaaS 與 Agent 應用很實用。
🔗 閱讀原文 | 來源: GitHub
9. Agent-Reach:一行指令讓 Agent 抓遍各大平台#
Agent-Reach 用統一 CLI 讓 Claude Code、Cursor、Windsurf 等 Agent 一次安裝就能存取 Twitter/X、Reddit、YouTube、GitHub、Bilibili、小紅書、LinkedIn 與 RSS,零 API 費用。採「優先選項 + 備用」自動路由,平台變動時自動切換,內建 doctor 指令診斷狀態,認證存在本地。
- 把多平台抓取的依賴碎片化問題收斂成一行安裝
- 零 API 成本,底層接 yt-dlp、twitter-cli 等開源工具
- 支援小紅書、Bilibili 等亞洲平台,對中文內容監控特別實用
💡 為什麼重要:做內容聚合、輿情、研究類 Agent 時,這類工具直接省掉最煩的接平台環節。
🔗 閱讀原文 | 來源: GitHub
10. 開源 vs 閉源 LLM 的差距,到底有沒有縮小?#

若只看單一基準(Artificial Analysis Intelligence Index),會推測開源 LLM 與前沿模型的差距將在 2026 年底歸零;但作者橫跨 18 個基準檢視後發現,平均落後其實穩定在約 5 個月。唯一例外是編程任務——從落後 15 個月縮到只剩 1–2 個月。核心提醒:你怎麼量,決定你得到什麼結論。
- 單一排行榜會嚴重高估開源的追趕速度
- 編程任務開源已逼近前沿(差 1–2 個月),但通用推理仍落後約 5 個月
- 選型該分任務看,而不是盲目選 OSS 或商業
💡 為什麼重要:呼應今日主軸——當前沿被鎖住,「開源夠不夠用」就是關鍵;答案是「看你做什麼」,寫程式幾乎夠了,複雜推理還差一截。
🔗 閱讀原文 | 來源: Doubleword
11. General Intuition 拿 3.2 億美元,賭用遊戲畫面訓練 AI#

General Intuition 用遊戲影片裡內嵌的「行動標籤」(玩家按鍵時序)而非單純視覺,訓練 AI 智能體建立因果理解。同一個模型能驅動四足機器人,僅需 8 分鐘真實機器人數據微調即可適應現實。本輪融資 3.2 億美元、估值 23 億美元,靠的是數百萬小時的上傳遊戲影片。
- 用「按鍵+畫面」配對,讓模型分辨自我控制與環境反應
- 在 Fortnite 玩 100 小時 → 8 分鐘微調即遷移到真實機器人
- 把遊戲數據變成 AI 訓練的廉價替代品(比真實世界數據便宜上百倍)
💡 為什麼重要:模擬到真實的遷移一直是機器人最貴的瓶頸;遊戲數據若真能用,會大幅壓低具身智能的訓練成本。
🔗 閱讀原文 | 來源: TechCrunch
12. 前 Databricks AI 主管:我能把 AI 電費砍 1000 倍#

Naveen Rao(Databricks 前 AI 主管)的新創用「物理振盪器」架構取代傳統神經網路晶片設計,目標把 AI 推論功耗砍 1000 倍。首個模型 Un-0 已在軟體模擬中驗證,性能與 Stable Diffusion 這類擴散模型相當,近期將公開晶片設計。團隊不到 50 人,要從根本改寫運算架構。
- 用物理振盪器取代電子邏輯,計算原理完全不同
- 目前在模擬中性能對標現有擴散模型,硬體量產仍待驗證
- 押注點是「AI 的終極瓶頸是能源」
💡 為什麼重要:若 1000 倍能效成真,會改寫資料中心經濟、讓邊緣推論變可能,也挑戰 NVIDIA 的格局——但目前還停在模擬階段,要保留懷疑。
🔗 閱讀原文 | 來源: TechCrunch
13. Claude 正在 ChatGPT 的地盤搶下付費用戶#

Claude 在 2026 年 1 月到 5 月中收入成長約 75%,正縮小與 ChatGPT 的付費用戶差距。在教育平台 DataCamp 上,消費者對 Claude 課程的需求是 ChatGPT 的三倍、30 天內成長 18 倍,「Claude」甚至超越「AI」成為最高搜尋詞。Anthropic 3 月拒絕模型用於大規模監控與自主武器後,需求仍持續成長。
- 付費消費市場不再是 ChatGPT 一家獨大
- 教育市場成為 Claude 成長的強訊號(課程需求 18 倍)
- 倫理立場正轉化為品牌忠誠與市場溢價
💡 為什麼重要:付費 AI 助手進入多玩家競爭,企業評估對 ChatGPT 的單一依賴時,多了一個真實替代選項。
🔗 閱讀原文 | 來源: TechCrunch
14. AI 時代真正的優勢:努力和知識都被 AI 包了,剩下的是「內在功課」#

矽谷高管教練 Joe Hudson 在 Lenny’s Newsletter 主張,AI 時代的競爭力來自「智慧堆疊」四項能力:辨別力(情緒清晰地做決策)、擁抱衝突(直接溝通)、失敗意願(快速迭代)、積極自語(管理內在聲音)。因為「努力」和「知識」正好是 AI 最擅長的,人類優勢轉向情緒管理與心理彈性;組織也從「工廠模式」轉向「NBA 名單」——少數頂尖人才驅動成長。
- 傳統「努力 + 知識」優勢失效,因為那正是 AI 的強項
- 用「黃金演算法」——辨識你在迴避的情緒、看清它的後果
- 用月均實驗次數衡量團隊「步伐」,把一個大目標拆成 20 個小實驗
💡 為什麼重要:當技術與知識被商品化,差異化回到「人」本身——情緒控制、衝突管理、心理彈性,這對個人與團隊都是可練的硬技能。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
推薦閱讀#

- 服務架構最常見的反模式:從過早拆分到資料耦合 — 微服務的多數反模式都源於同一個根:跨服務呼叫的延遲從奈秒級跳到毫秒級。最常見的錯是「過早拆分」,原則是服務要能獨立部署、掌控自己的資料。
- Paul Graham 牛津演講:如何在十年內賺到 10 億美元 — 從 200 萬起步、每月成長 15%,五年達 10 億。關鍵是打造用戶真心喜愛、願意口耳相傳的產品。
- 功能正常 ≠ 程式正確:AI 生成程式碼最大的風險 — AI 寫的程式碼「能跑」不代表「對」,這是 vibe coding 最大的隱性風險。
- 跟工具對話,其實很累 — 當開發從「寫程式」變成「跟 AI 不停來回解釋」,認知負擔反而上升。
- AI 正在逼數學界面對大哉問 — 當 AI 能解過去解不開的難題,「證明」與「理解」該怎麼重新定義。
- 你只需要 PostgreSQL — 佇列、快取、全文搜尋,PostgreSQL 一個就能扛很久。
- 為什麼把多個語言模型組合起來,常常沒用? — 路由、投票、Mixture-of-Agents 都有「共同失敗天花板」。
- 編碼 Agent 的獎勵設計沒有銀彈:Verification Horizon — 用單一獎勵訊號訓練編碼 Agent 的根本困難。
大神動態#
- Simon Willison:一天連發數篇——GPT-5.6 定價拆解(見必讀 1)、駭 AI 助理挑戰(見必讀 5)、德國法院裁定 Google 須為 AI 摘要錯誤負責。
- Andrej Karpathy:為 Anthropic 的 Claude Tag 站台,被外界調侃在炒作「Slack 機器人」;Theo 出片解釋它其實代表一種新的 context + tool access 思維(見影音精選)。
中文技術圈#

- 從解開世紀數學難題到拯救 80 萬條人命,醫療界為何必須學會「AI 思維」? — OpenAI 模型破解 80 年幾何難題,醫療界需重新認識生成式 AI 的應用價值。
- 從 Copilot 到 Autopilot:微軟發布常駐型企業智能體 Scout — 微軟推出企業級 AI 代理 Scout,代表從 Copilot 向持久自動化工作流的演進。
- VS Code 1.123 新增兩小時插件更新緩衝,防範供應鏈攻擊 — 插件更新延遲兩小時,給惡意套件一個被攔截的時間窗。
- 探索快捷指令的上限:用網頁視圖打造豐富介面 — 深入 iOS 快捷指令的 WebView,做出超乎預期的互動介面。
- 大家在 AI 編程等它思考的時候,都在幹嘛? — 一個很真實的開發者日常討論:等 AI 推理的空檔,生產力都跑哪去了。
開源精選#
bozhouDev/codex-orange-book — HTML | ⭐ 2.1K Codex 橙皮書:從安裝到實戰的全鏈路 Codex 使用指南(含 PDF)。
QwenLM/Qwen-AgentWorld — Python | ⭐ 568 Qwen 推出的「語言世界模型」,給通用 Agent 用。
HKUDS/AgentSpace — TypeScript | ⭐ 453 「人 + Agent,一個團隊、一個工作區」的協作平台。
krea-ai/krea-2 — Python | ⭐ 304 Krea 2 的官方推論程式碼。
amplifthq/opentag — TypeScript | ⭐ 296 開源 @agent mention:把 Slack/GitHub 的標記請求路由給 Codex、Claude Code。
影音精選#
Google,我們需要談談:四位頂尖研究員接連出走#
~1 天前 · Theo (t3.gg)
Google DeepMind 短期內連失四位頂尖科學家,其中三人跳槽 Anthropic(含諾貝爾獎得主、AlphaFold 共同作者 John Jumper)。Theo 深入內部文化問題,並聚焦 Workspace CLI 創作者因創新被解僱的案例。
- 48 小時內失去多位重量級人才,研究環境的裂縫浮現
- 頂尖研究者要的是自主研究空間,Anthropic / OpenAI 給的自由度更高
「學 AI」是爛建議,該培養的 6 種核心能力#
~1 天前 · Greg Isenberg
Greg Isenberg 提出 6 種 AI 時代愈來愈值錢的技能——Agent 編排、建立發行通路、機器人工程、內容策展、「建造者兼發行者」、實體社群。核心是「設計、管理、監督 Agent」的編排力,比單純「學 AI」實在。
- 發行通路(Distribution)比內容本身更關鍵
- 「建造者兼發行者」是 AI 時代最強組合,一個人就能做出並推廣產品
AI 時代「超級高中生」:北京探月學校的第三種教育可能#
~30 小時前 · 硅谷101
硅谷101 探訪北京探月學校,學生在學期間就真實創業、有人帶 60 人團隊。當知識唾手可得,學校該教的轉向「判斷力與審美」這類無法被蒸餾的勝任力。
- 推出「一小步計劃」,讓高中生在學期間真實創業
- 教育核心從「知識技能」轉向「素養與判斷力」
用 Claude Fable 5 純 vibe-coded 打造開源 AI 訊號地圖#
~38 小時前 · Matt Wolfe
Matt Wolfe 展示用 Claude Fable 5 完整 vibe coding 打造的開源 AI 情報地圖,整合 Agent 自動掃描 AI 新聞、建立訊號節點並發現節點間關聯,完全開源可自部署。
- 整個專案以 Fable 5 純 vibe coding 完成
- Agent 持續掃描 AI 新聞並自動建立關聯圖譜
今日觀察#
把今天的新聞疊在一起,會看到一條清楚的分界線。線的上面,是被政府鎖進保險箱的前沿——GPT-5.6 要先審用戶、Mythos 只給 100 家信得過的機構;線的下面,是誰都能裝的工具在 GitHub 上狂奔——design.md、MinerU、模型路由 一個比一個熱。而 Doubleword 那篇開源差距分析 剛好給了這條線一個註腳:寫程式這件事,開源已經追到只差一兩個月,複雜推理才還差五個月。換句話說,被鎖住的「最強模型」對多數人日常的工作,影響其實沒那麼大;真正決定你產出的,是你有沒有把下面那層敞開的工具用熟。對個別工作者來說,與其焦慮搶不到最頂的模型,不如問自己:手邊這些每個人都能拿到的東西,我用到第幾成了。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit




