yii.
← Digest
EP118 · 2026年6月27日 星期六 · 10 min read

最強的 AI 開始要「核准」才能用

每天花 1% 的時間,掌握科技脈動。

今日金句#

“Depending on how you measure it you would predict the open source singularity by Christmas, or you would say that open source LLMs are consistently 5 months behind.” 「同一份數據,看你怎麼量:你可以說開源模型聖誕節前就追上了,也可以說它一直落後五個月。」 — Jamie Dborin, Doubleword 創辦人

“I have determined that appropriate safeguards are in place to permit certain trusted partners to access the Claude Mythos 5 Model.” 「我已認定相關安全防護到位,可以讓特定的可信夥伴存取 Claude Mythos 5 模型。」 — Howard Lutnick, 美國商務部長

今日主軸:最強的 AI 開始要「核准」才能用#

今天的新聞攤開來看,是同一個故事的兩層。最上面那層,前沿模型正在被「鎖起來」:OpenAI 預覽了新一代 GPT-5.6(Sol / Terra / Luna 三款),照理是頭條,結果更大的新聞是——美國政府要求它先別全面開放,得先審過用的人是誰;同一週,Anthropic 最強的資安模型 Mythos 5 也只放給一百多家「信得過」的公司與政府機關。最前沿的能力,正在從「誰都能用」變成「要核准才能用」。

但往下看一層,故事完全相反:OpenAI 自己內部用 AI 寫東西的量,半年暴增 56 倍,Google 的 design.md、MinerU、模型自動路由 這些「誰都能裝」的工具正在 GitHub 上狂飆。最頂的那一層被鎖進保險箱,真正在改變你我工作的,是底下那層敞開的工具。當模型本身變成受管制的戰略資產,問題就不再是「它有多強」,而是「我能不能拿到」——以及,當你拿不到最強的,手邊這些夠不夠你把事情做完。

必讀#

  1. OpenAI 預覽 GPT-5.6:Sol / Terra / Luna 三款定價出爐 — Simon Willison AI
  2. 美國政府出手,OpenAI 暫緩 GPT-5.6 全面開放 — TechCrunch News
  3. OpenAI 內部 Codex 用量半年暴增 56 倍 — Latent Space AI
  4. Anthropic Mythos 5 解禁,開放給 100+ 美國公司與機關 — TechCrunch News
  5. 2000 人輪流駭他的 AI 助理,六千次沒人成功 — Simon Willison AI
  6. Google 開源 design.md:讓 AI Agent 看懂設計系統 — GitHub Tools
  7. MinerU:把複雜文件轉成 LLM 看得懂的 Markdown — GitHub Tools
  8. Workweave Router:50ms 內幫你的請求選最划算的模型 — GitHub Tools
  9. Agent-Reach:一行指令讓 Agent 抓遍各大平台 — GitHub Tools
  10. 開源 vs 閉源 LLM 的差距,到底有沒有縮小? — Doubleword AI
  11. General Intuition 拿 3.2 億美元,賭用遊戲畫面訓練 AI — TechCrunch Startup
  12. 前 Databricks AI 主管:我能把 AI 電費砍 1000 倍 — TechCrunch AI
  13. Claude 正在 ChatGPT 的地盤搶下付費用戶 — TechCrunch AI
  14. AI 時代真正的優勢:努力和知識都被 AI 包了,剩下的是「內在功課」 — Lenny’s Newsletter Startup

1. OpenAI 預覽 GPT-5.6:Sol / Terra / Luna 三款定價出爐#

OpenAI 發布 GPT-5.6 系列預覽,分成三款:旗艦 Sol(每百萬 token $5 / $30)、均衡 Terra($2.5 / $15,性能對標 GPT-5.5 但便宜一半)、低成本 Luna($1 / $6)。同時引入更可預測的提示快取(prompt caching)機制,支援顯式快取斷點與至少 30 分鐘的快取存活時間。依美國政府要求,目前先向少數信任夥伴提供預覽,計畫數週內全面開放。

  • 三款定價拉開明顯梯度,Terra 主打「性能不輸前一代、價格砍半」,是成本敏感場景的甜蜜點
  • 明確的快取斷點 + 30 分鐘快取存活,對長上下文、多輪 Agent 應用是實打實的省錢
  • 發布即受限——這是第一次旗艦模型「先審用戶、再全面開放」

💡 為什麼重要:價格戰已經打到旗艦級,Terra 這種「對標上代、價格腰斬」的定價會直接壓縮中間層 API 轉售的利潤空間。

🔗 閱讀原文 | 來源: Simon Willison

2. 美國政府出手,OpenAI 暫緩 GPT-5.6 全面開放#

OpenAI 應美國政府要求,放慢 GPT-5.6 的部署,先審核使用者身分後才開放,並強調「這類限制不該成為常態」。這是前沿模型第一次因政府介入而延後公開,標誌著最強 AI 正在從商品變成受管制的戰略資產。

  • 政府要求「先審人、再開放」,理由是國安與濫用風險
  • OpenAI 公開表態不希望這變成長期預設,顯示業界與監管的拉鋸
  • 與同週 Anthropic Mythos 只放給 100+ 機構形成同一個趨勢

💡 為什麼重要:當「能不能用最強的模型」變成政府說了算,創業者的技術選型多了一層地緣與政策風險,不再只是價格與性能。

🔗 閱讀原文 | 來源: TechCrunch

3. OpenAI 內部 Codex 用量半年暴增 56 倍#

OpenAI 內部經濟研究揭示,從 2025 年 11 月到 2026 年 6 月,員工在 Codex 上的 token 使用量急遽成長:研究部門中位數成長 56 倍、客服 32 倍、工程師 27 倍、法務 13 倍。關鍵反差是——即便 OpenAI 員工長期享有無限制存取,真正的重度使用直到最近才爆發。

  • 成長最猛的是研究部門(56 倍),不是工程部門
  • 法務、客服等非技術部門也都是雙位數倍增,AI 用量正在橫向擴散
  • 「有工具」不等於「會用」,連 OpenAI 自己人都花了半年才真的上手

💡 為什麼重要:這是一個具體的工作轉型基準——如果連 AI 公司自己都是最近才重度依賴,多數公司其實還在起跑線,落後沒你想的多。

🔗 閱讀原文 | 來源: Latent Space

4. Anthropic Mythos 5 解禁,開放給 100+ 美國公司與機關#

川普政府逆轉先前的禁令,允許 Anthropic 最強的資安模型 Mythos 5 部署給 100 多家美國組織與政府機關,獲授權組織內的非美籍員工也能存取。商務部長 Howard Lutnick 表示「已認定相關安全防護到位,可以讓特定可信夥伴存取」。兩週前該模型才因安全研究者發現防護易被繞過而被禁。

  • 從「全面禁用」到「放給 100+ 信任夥伴」,政策在兩週內大轉彎
  • 存取以「組織白名單」方式控管,而非開放公眾
  • 更受限的 Fable 5 版本尚未重新開放公眾使用

💡 為什麼重要:最強的資安 AI 變成需要政府核准的「白名單資產」,這是 AI 從產品走向受管制基礎設施的清晰訊號。

🔗 閱讀原文 | 來源: TechCrunch

5. 2000 人輪流駭他的 AI 助理,六千次沒人成功#

Fernando Irarrázaval 在 hackmyclaw.com 公開挑戰,讓任何人透過 email 嘗試騙他的 OpenClaw(底層是 Claude Opus 4.6)洩露機密。6000 次嘗試、花了 500 美元 token 費(還因為太多來信被 Google 停用帳號),沒有人成功。這顯示前沿模型對抗 prompt injection 已有顯著進步——但 Simon Willison 也提醒,6000 次失敗不等於絕對安全。

  • 公開、可重現的對抗測試,0 成功率
  • 模型內建明確的反提示注入規則,擋下提取憑證、改檔、執行命令等攻擊
  • 你可以自己上 hackmyclaw.com 試——這是它的可玩之處

💡 為什麼重要:prompt injection 一直是 Agent 上生產的最大攔路虎;這個實驗給了「模型層防禦真的有進步」的實證,但別把它當成唯一防線。

🔗 閱讀原文 | 來源: Simon Willison

6. Google 開源 design.md:讓 AI Agent 看懂設計系統#

design.md 是一種雙層格式——YAML 設計 token + Markdown 人類敘述,讓 Claude、Cursor 這類編碼 Agent 能持續、結構化地理解設計系統。附帶 lint / diff / export CLI,支援 Tailwind v3/v4 與 W3C DTCG 格式轉換,內建 9 項檢查(對比度、斷掉的參考、孤立 token 等)。GitHub 已破 2 萬星。

  • 機器可讀的 token + 人類可讀的設計理由,補上 Agent 與設計系統之間的認知鴻溝
  • lint 能自動驗 WCAG 對比度、抓出斷掉的參考與孤立 token
  • 可匯出到 Tailwind / W3C DTCG,整合現有工具鏈無痛

💡 為什麼重要:這正是「底下那層工具」的代表——把設計交給 Agent 維護,前端從設計到實作的循環會明顯變快。

🔗 閱讀原文 | 來源: GitHub

7. MinerU:把複雜文件轉成 LLM 看得懂的 Markdown#

MinerU 是文件解析引擎,把 PDF、Word、PPT、Excel、掃描件、網頁轉成 LLM 優化的結構化 Markdown 與 JSON,支援 109 種語言 OCR 與 VLM 雙引擎。三層管道:CPU 友善 Pipeline(86.47% 精度)、平衡 Hybrid、最高精度 VLM(95.39%),自動處理跨頁表格合併、公式轉 LaTeX。原生支援 MCP(Cursor / Claude Desktop / Windsurf)、LangChain、LlamaIndex。GitHub 逾 7 萬星。

  • 保留表格、公式、版面層級,給 RAG/Agent 高品質輸入
  • VLM 雙引擎讓你在速度與精度間自由取捨(86% vs 95%)
  • 透過 MCP 直接接 Claude Desktop / Cursor,免額外包裝

💡 為什麼重要:文件智能化是 RAG 與 Agent 系統的地基,這類工具誰都能裝、零門檻,正是前沿模型被鎖住時最該補強的能力。

🔗 閱讀原文 | 來源: GitHub

8. Workweave Router:50ms 內幫你的請求選最划算的模型#

Workweave Router 是智慧路由代理,50 毫秒內把 API 請求導向 Anthropic / OpenAI / Gemini 的最佳模型,用內嵌的小型編碼器分析請求特徵動態選擇(不靠外部 LLM 決策),宣稱省下 40–70% 成本。支援 Claude Code、Codex、Cursor 與 OpenRouter 上的開源模型,提供 BYOK 自有金鑰加密。

  • 路由延遲僅 50ms,對使用者幾乎無感
  • 宣稱省 40–70% API 成本,靠的是「對的任務配對的模型」
  • BYOK 加密,企業敏感工作負載也能放心自託管

💡 為什麼重要:多供應商時代,手動切模型既低效又貴;自動路由是把「省錢」這件事工程化,對成本敏感的 SaaS 與 Agent 應用很實用。

🔗 閱讀原文 | 來源: GitHub

9. Agent-Reach:一行指令讓 Agent 抓遍各大平台#

Agent-Reach 用統一 CLI 讓 Claude Code、Cursor、Windsurf 等 Agent 一次安裝就能存取 Twitter/X、Reddit、YouTube、GitHub、Bilibili、小紅書、LinkedIn 與 RSS,零 API 費用。採「優先選項 + 備用」自動路由,平台變動時自動切換,內建 doctor 指令診斷狀態,認證存在本地。

  • 把多平台抓取的依賴碎片化問題收斂成一行安裝
  • 零 API 成本,底層接 yt-dlp、twitter-cli 等開源工具
  • 支援小紅書、Bilibili 等亞洲平台,對中文內容監控特別實用

💡 為什麼重要:做內容聚合、輿情、研究類 Agent 時,這類工具直接省掉最煩的接平台環節。

🔗 閱讀原文 | 來源: GitHub

10. 開源 vs 閉源 LLM 的差距,到底有沒有縮小?#

若只看單一基準(Artificial Analysis Intelligence Index),會推測開源 LLM 與前沿模型的差距將在 2026 年底歸零;但作者橫跨 18 個基準檢視後發現,平均落後其實穩定在約 5 個月。唯一例外是編程任務——從落後 15 個月縮到只剩 1–2 個月。核心提醒:你怎麼量,決定你得到什麼結論。

  • 單一排行榜會嚴重高估開源的追趕速度
  • 編程任務開源已逼近前沿(差 1–2 個月),但通用推理仍落後約 5 個月
  • 選型該分任務看,而不是盲目選 OSS 或商業

💡 為什麼重要:呼應今日主軸——當前沿被鎖住,「開源夠不夠用」就是關鍵;答案是「看你做什麼」,寫程式幾乎夠了,複雜推理還差一截。

🔗 閱讀原文 | 來源: Doubleword

11. General Intuition 拿 3.2 億美元,賭用遊戲畫面訓練 AI#

General Intuition 用遊戲影片裡內嵌的「行動標籤」(玩家按鍵時序)而非單純視覺,訓練 AI 智能體建立因果理解。同一個模型能驅動四足機器人,僅需 8 分鐘真實機器人數據微調即可適應現實。本輪融資 3.2 億美元、估值 23 億美元,靠的是數百萬小時的上傳遊戲影片。

  • 用「按鍵+畫面」配對,讓模型分辨自我控制與環境反應
  • 在 Fortnite 玩 100 小時 → 8 分鐘微調即遷移到真實機器人
  • 把遊戲數據變成 AI 訓練的廉價替代品(比真實世界數據便宜上百倍)

💡 為什麼重要:模擬到真實的遷移一直是機器人最貴的瓶頸;遊戲數據若真能用,會大幅壓低具身智能的訓練成本。

🔗 閱讀原文 | 來源: TechCrunch

12. 前 Databricks AI 主管:我能把 AI 電費砍 1000 倍#

Naveen Rao(Databricks 前 AI 主管)的新創用「物理振盪器」架構取代傳統神經網路晶片設計,目標把 AI 推論功耗砍 1000 倍。首個模型 Un-0 已在軟體模擬中驗證,性能與 Stable Diffusion 這類擴散模型相當,近期將公開晶片設計。團隊不到 50 人,要從根本改寫運算架構。

  • 用物理振盪器取代電子邏輯,計算原理完全不同
  • 目前在模擬中性能對標現有擴散模型,硬體量產仍待驗證
  • 押注點是「AI 的終極瓶頸是能源」

💡 為什麼重要:若 1000 倍能效成真,會改寫資料中心經濟、讓邊緣推論變可能,也挑戰 NVIDIA 的格局——但目前還停在模擬階段,要保留懷疑。

🔗 閱讀原文 | 來源: TechCrunch

13. Claude 正在 ChatGPT 的地盤搶下付費用戶#

Claude 在 2026 年 1 月到 5 月中收入成長約 75%,正縮小與 ChatGPT 的付費用戶差距。在教育平台 DataCamp 上,消費者對 Claude 課程的需求是 ChatGPT 的三倍、30 天內成長 18 倍,「Claude」甚至超越「AI」成為最高搜尋詞。Anthropic 3 月拒絕模型用於大規模監控與自主武器後,需求仍持續成長。

  • 付費消費市場不再是 ChatGPT 一家獨大
  • 教育市場成為 Claude 成長的強訊號(課程需求 18 倍)
  • 倫理立場正轉化為品牌忠誠與市場溢價

💡 為什麼重要:付費 AI 助手進入多玩家競爭,企業評估對 ChatGPT 的單一依賴時,多了一個真實替代選項。

🔗 閱讀原文 | 來源: TechCrunch

14. AI 時代真正的優勢:努力和知識都被 AI 包了,剩下的是「內在功課」#

矽谷高管教練 Joe Hudson 在 Lenny’s Newsletter 主張,AI 時代的競爭力來自「智慧堆疊」四項能力:辨別力(情緒清晰地做決策)、擁抱衝突(直接溝通)、失敗意願(快速迭代)、積極自語(管理內在聲音)。因為「努力」和「知識」正好是 AI 最擅長的,人類優勢轉向情緒管理與心理彈性;組織也從「工廠模式」轉向「NBA 名單」——少數頂尖人才驅動成長。

  • 傳統「努力 + 知識」優勢失效,因為那正是 AI 的強項
  • 用「黃金演算法」——辨識你在迴避的情緒、看清它的後果
  • 用月均實驗次數衡量團隊「步伐」,把一個大目標拆成 20 個小實驗

💡 為什麼重要:當技術與知識被商品化,差異化回到「人」本身——情緒控制、衝突管理、心理彈性,這對個人與團隊都是可練的硬技能。

🔗 閱讀原文 | 來源: Lenny’s Newsletter

推薦閱讀#

大神動態#

  • Simon Willison:一天連發數篇——GPT-5.6 定價拆解(見必讀 1)、駭 AI 助理挑戰(見必讀 5)、德國法院裁定 Google 須為 AI 摘要錯誤負責。
  • Andrej Karpathy:為 Anthropic 的 Claude Tag 站台,被外界調侃在炒作「Slack 機器人」;Theo 出片解釋它其實代表一種新的 context + tool access 思維(見影音精選)。

中文技術圈#

開源精選#

bozhouDev/codex-orange-book — HTML | ⭐ 2.1K Codex 橙皮書:從安裝到實戰的全鏈路 Codex 使用指南(含 PDF)。

QwenLM/Qwen-AgentWorld — Python | ⭐ 568 Qwen 推出的「語言世界模型」,給通用 Agent 用。

HKUDS/AgentSpace — TypeScript | ⭐ 453 「人 + Agent,一個團隊、一個工作區」的協作平台。

krea-ai/krea-2 — Python | ⭐ 304 Krea 2 的官方推論程式碼。

amplifthq/opentag — TypeScript | ⭐ 296 開源 @agent mention:把 Slack/GitHub 的標記請求路由給 Codex、Claude Code。

影音精選#

Google,我們需要談談:四位頂尖研究員接連出走#

~1 天前 · Theo (t3.gg)

Theo (t3.gg)

Google DeepMind 短期內連失四位頂尖科學家,其中三人跳槽 Anthropic(含諾貝爾獎得主、AlphaFold 共同作者 John Jumper)。Theo 深入內部文化問題,並聚焦 Workspace CLI 創作者因創新被解僱的案例。

  • 48 小時內失去多位重量級人才,研究環境的裂縫浮現
  • 頂尖研究者要的是自主研究空間,Anthropic / OpenAI 給的自由度更高

「學 AI」是爛建議,該培養的 6 種核心能力#

~1 天前 · Greg Isenberg

Greg Isenberg

Greg Isenberg 提出 6 種 AI 時代愈來愈值錢的技能——Agent 編排、建立發行通路、機器人工程、內容策展、「建造者兼發行者」、實體社群。核心是「設計、管理、監督 Agent」的編排力,比單純「學 AI」實在。

  • 發行通路(Distribution)比內容本身更關鍵
  • 「建造者兼發行者」是 AI 時代最強組合,一個人就能做出並推廣產品

AI 時代「超級高中生」:北京探月學校的第三種教育可能#

~30 小時前 · 硅谷101

硅谷101

硅谷101 探訪北京探月學校,學生在學期間就真實創業、有人帶 60 人團隊。當知識唾手可得,學校該教的轉向「判斷力與審美」這類無法被蒸餾的勝任力。

  • 推出「一小步計劃」,讓高中生在學期間真實創業
  • 教育核心從「知識技能」轉向「素養與判斷力」

用 Claude Fable 5 純 vibe-coded 打造開源 AI 訊號地圖#

~38 小時前 · Matt Wolfe

Matt Wolfe

Matt Wolfe 展示用 Claude Fable 5 完整 vibe coding 打造的開源 AI 情報地圖,整合 Agent 自動掃描 AI 新聞、建立訊號節點並發現節點間關聯,完全開源可自部署。

  • 整個專案以 Fable 5 純 vibe coding 完成
  • Agent 持續掃描 AI 新聞並自動建立關聯圖譜

今日觀察#

把今天的新聞疊在一起,會看到一條清楚的分界線。線的上面,是被政府鎖進保險箱的前沿——GPT-5.6 要先審用戶、Mythos 只給 100 家信得過的機構;線的下面,是誰都能裝的工具在 GitHub 上狂奔——design.md、MinerU、模型路由 一個比一個熱。而 Doubleword 那篇開源差距分析 剛好給了這條線一個註腳:寫程式這件事,開源已經追到只差一兩個月,複雜推理才還差五個月。換句話說,被鎖住的「最強模型」對多數人日常的工作,影響其實沒那麼大;真正決定你產出的,是你有沒有把下面那層敞開的工具用熟。對個別工作者來說,與其焦慮搶不到最頂的模型,不如問自己:手邊這些每個人都能拿到的東西,我用到第幾成了。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有