yii.
← Digest
EP131 · 2026年7月12日 星期日 · 11 min read

OpenAI 大洗牌,戰場移到應用層

每天花 1% 的時間,掌握科技脈動。

今日金句#

“The question is one that already survived the model.” 「那個問題,早就活過模型這一關了。」 — Yael, 部落格作者(〈別再叫我問 AI〉)

“90% of Cursor’s token usage is input tokens focused on reading existing codebases rather than generating new code.” 「Cursor 有九成的 token 花在讀既有程式碼,而不是生成新程式碼。」 — Gergely Orosz, The Pragmatic Engineer

“Code becomes a universal language for defining programs and systems, allowing LLMs to access substantially larger design spaces than manual prompting alone.” 「程式碼成為定義系統的通用語言,讓 LLM 觸及遠比手寫提示詞更大的設計空間。」 — Lilian Weng, Anthropic 研究員

今日主軸:OpenAI 大洗牌,戰場移到應用層#

這一週 OpenAI 幾乎把整條產品線翻了一遍:GPT-5.6 家族(Luna/Terra/旗艦 Sol)上線、獨立瀏覽器 Atlas 上線不到一年就收攤、原本獨立的 Codex App 被併進全新的「ChatGPT Work」,連語音模型 GPT-Live 都換上雙向對話架構。表面看是一家公司在整理房間,但同一時間 Apple 一紙訴訟告上門,指控 OpenAI 挖角前員工偷走未發表的硬體機密——人才與智財的爭奪已經打到法院。

真正的暗流藏在兩份很不一樣的材料裡。企業 AI 公司 Glean 創辦人(估值 72 億美元)在 20VC 直說:超過九成的企業場景現在多種模型都能做,前沿模型正在快速商品化,「非模型公司該把大模型當可替換的水電,而不是護城河」。另一邊 Pragmatic Engineer 的 Cursor 數據顯示,頂尖開發者一週產出 4 萬行程式碼、是中位數的近 60 倍,而九成 token 其實花在「讀懂既有程式碼」而非生成。當模型變便宜、變可替換,勝負就從「模型多強」移到了應用層、判斷力,以及 Lilian Weng 這週那篇論文講的 harness 架構——誰的系統設計把模型用得更好。

必讀#

  1. Apple 告 OpenAI,指控前員工竊取未發表硬體機密 — 9to5Mac AI
  2. OpenAI 發表 GPT-5.6 家族,旗艦 Sol 主打 agentic coding — TechCrunch AI
  3. OpenAI 收掉 Atlas 瀏覽器,Codex 併進「ChatGPT Work」 — TechCrunch AI
  4. Glean 創辦人:前沿模型正在商品化,巨頭贏不了應用層 — 20VC Startup
  5. Cursor 內部數據:頂尖用戶週產 4 萬行、九成 token 在讀程式碼 — Pragmatic Engineer AI
  6. Bun 用 11 天把自己從 Zig 重寫成 Rust — Bun Blog Dev
  7. 〈別再叫我問 AI〉:一篇爆紅的反射式建議反思 — Yael Blog AI
  8. AI 裁員潮大翻車,企業紛紛「請回」人類員工 — 科技新報 AI
  9. Nvidia、CoreWeave、Nebius:撐起 GPU 熱潮的循環融資 — io-fund AI
  10. OpenAI 推語音模型 GPT-Live,能聽、能回、還會適時插話 — 科技新報 AI
  11. Lilian Weng:Harness Engineering,遞迴自我改進的現實路徑 — Lilian Weng AI
  12. SQLite 該優先用 STRICT 資料表:型別安全零效能代價 — Evan Hahn Dev

1. Apple 告 OpenAI,指控前員工竊取未發表硬體機密#

Apple 向加州北區聯邦法院提告,指控兩名跳槽 OpenAI 的前員工——前產品設計副總 Tang Tan 與資深系統工程師 Chang Liu——盜取未發表的硬體機密。訴狀稱 Tan 在面試時使用 Apple 內部代號、要求應徵者帶實體零件與 CAD 設計,Liu 則利用安全漏洞下載逾千頁製造文件並指導同事準備 OpenAI 面試。目前已有超過 400 名前 Apple 員工在 OpenAI,加上 OpenAI 以 65 億美元收購 Jony Ive 的 io Products,硬體戰意圖明顯。

  • 兩名被告涉及的機密包括未發表技術、內部流程、產品原型與「Need to Know」安全文件
  • Tan 2024/2 離職、Liu 2026/1 加入,Apple 2026/2 首度向 OpenAI 提出關切
  • 反映 AI 大廠與硬體巨頭的人才、智財爭奪打進法院,恐成未來競業先例

💡 為什麼重要:這不只是一樁竊密案,而是「AI 公司急著補硬體與設計人才」與「傳統巨頭死守產品方法論」正面碰撞的第一槍,可能改寫科技業競業條款的執行標準。

🔗 閱讀原文 | 來源:9to5Mac

2. OpenAI 發表 GPT-5.6 家族,旗艦 Sol 主打 agentic coding#

OpenAI 推出 GPT-5.6 家族三款模型 Luna、Terra 與旗艦 Sol,Sol 號稱在 agentic coding 排行榜登頂,並新增類似深度思考的 Max Reasoning,以及可同時派出多個子 agent 平行作業的「Ultra Mode」。發布時機正逢美國政府要求前沿模型上市前先送審 30 天的新規範,格外耐人尋味。不過路由機制雖主打簡化模型選擇,API 端仍多達 36 種變體讓開發者眼花。

  • 三款模型 Luna/Terra/Sol,Sol 主打 agentic coding 第一
  • 新增 Max Reasoning(深度思考)與 Ultra Mode(多子 agent 平行)
  • 碰上政府「送審 30 天」新規,凸顯 AI 監管走向

💡 為什麼重要:模型迭代的重點已從「單次對話多聰明」轉向「能不能穩定編排多個 agent 做完長任務」,這正是 agentic coding 這條主線的核心。

🔗 閱讀原文 | 來源:TechCrunch

3. OpenAI 收掉 Atlas 瀏覽器,Codex 併進「ChatGPT Work」#

上線不到一年(2025/10–2026/07)的獨立瀏覽器 Atlas 被 OpenAI 停止,功能重新分配到 Chrome 擴充功能、桌面應用強化版與雲端瀏覽器三個平台;新的 Chrome 擴充功能直接對打 Google Gemini 側邊欄。同一波整理裡,原本獨立的 Codex App 被併進全新的「ChatGPT Work」統一應用,圖示還掛著 Codex、名字卻變成 ChatGPT,讓不少老用戶在不知情下被強制升級,引發品牌溝通爭議。

  • Atlas 存活僅 10 個月,OpenAI 認定「瀏覽器是功能,不是終點」
  • Codex App 併入 ChatGPT Work,部分用戶被無預警換版
  • 反映「AI 應嵌入既有工作流,而非另建孤立產品」的策略轉向

💡 為什麼重要:連 OpenAI 都在收掉獨立 App、把能力塞回既有入口,等於替所有做 AI 產品的人示範:形態不是護城河,嵌進使用者既有流程才是。

🔗 閱讀原文 | 來源:TechCrunch

4. Glean 創辦人:前沿模型正在商品化,巨頭贏不了應用層#

估值 72 億美元的企業 AI 公司 Glean 創辦人 Arvind Jain(曾創辦 Rubrik、Google 傑出工程師)在 20VC 指出,超過九成的企業 AI 場景現在已可由多種模型(含開源)處理,前沿模型正快速商品化,非模型公司應把大模型視為可替換資產而非護城河。他也談到企業從封閉走向開源模型的趨勢,以及一個月花 100 萬美元的 AI agent 取代 15 名工程師的真實案例。

  • 90%+ 企業 AI 場景可由多種模型(含開源)滿足,前沿模型正商品化
  • 真正威脅來自掌握企業入口的巨頭(如微軟),而非模型供應商本身
  • 案例——月花 100 萬美元的 AI agent 取代 15 名工程師工作量

💡 為什麼重要:如果模型真的商品化,創業者的護城河就只剩應用層的判斷、資料與信任——這對每個做 AI 產品的人都是策略級的提醒。

🔗 閱讀原文 | 來源:20VC

5. Cursor 內部數據:頂尖用戶週產 4 萬行、九成 token 在讀程式碼#

Pragmatic Engineer 揭露 Cursor 使用數據:每週產出程式碼中位數 700 行、90 分位 9,000 行、99 分位高達 3–4 萬行(約等於 45 個中位開發者)。更關鍵的是九成 token 是輸入(讀既有程式碼),僅 0.6% 是輸出——反映開發真正耗時的是「讀懂與整合」而非「生成新碼」。同時自動提交接受率一個月內從 10% 跳到 40%,對應 Opus 4.7、GPT-5.5 等更強模型發布。

  • 99 分位週產 3–4 萬行,約中位數的 45–60 倍
  • 輸入/輸出 token 約 150:1,九成用量花在讀程式碼
  • 自動提交接受率一個月 4 倍成長,對應模型能力躍升

💡 為什麼重要:AI 編碼的真正價值正從「生成」移到「理解與整合」——會用的人把它當讀得比你快的資深同事,這才是拉開 60 倍差距的關鍵。

🔗 閱讀原文 | 來源:The Pragmatic Engineer

6. Bun 用 11 天把自己從 Zig 重寫成 Rust#

Bun 團隊公布把 JavaScript 執行環境從 Zig 完整重寫為 Rust 的過程:一名工程師監督 50+ 並列 Claude 工作流、11 天內完成、投入約 16.5 萬美元 API 成本、修掉 16,000 個編譯錯誤與 6,502 個 commit。動機是 Zig 手動記憶體管理與 JS 垃圾回收混用導致 use-after-free 等穩定性問題,Rust 的 borrow checker 從編譯時根除整類記憶體漏洞。效能全面小幅提升(HTTP +4.8%、Next.js build +4.5%),二進位縮小約 20%。

  • 11 天、64 個並列 Claude 執行個體、兩層對抗式審查
  • Rust borrow checker 編譯時根除記憶體安全漏洞(Zig 版根本痛點)
  • 效能小幅全面提升、二進位縮小約 20%,19 個迴歸全數修復

💡 為什麼重要:這是「AI 輔助大規模語言遷移」達到生產規模的示範——傳統要三人一年的工作被壓到 11 天,但人類審查仍是關鍵,機械重寫會引入語義差異。

🔗 閱讀原文 | 來源:Bun Blog

7. 〈別再叫我問 AI〉:一篇爆紅的反射式建議反思#

作者 Yael 反駁「你去問 AI 啊」這種反射式回答:會來問你的人通常早就問過 LLM,這個問題是「活過模型那一關」才來找你的。把問題推回 AI,表面禮貌,實際等於說「我沒空」或「我想不出你沒試過的招」。她主張更誠實的回應是承認自己的限制,而非虛偽地指向 AI。文章一小時內衝上 HN 第一,引發開發者圈熱議。

  • 核心金句「這個問題早就活過模型了」點破反射式甩鍋
  • AI 越普及,人願不願真的動腦幫你反而變稀缺
  • 一小時登 HN 第一,社群對「AI 時代的協作禮貌」高度共鳴

💡 為什麼重要:當「問 AI」變成萬用推託句,人類的判斷與願意動腦,反而成了 AI 時代最被低估的稀缺資源。

🔗 閱讀原文 | 來源:Yael Blog

8. AI 裁員潮大翻車,企業紛紛「請回」人類員工#

多家企業發現用 AI 取代人力後服務崩潰,正回頭重招。澳洲聯邦銀行(CBA)因語音機器人效能不足,一個月內撤回裁員、經理被迫加班補客服;IBM 發現 94% 程序化任務可自動化,但剩下 6% 涉及倫理與複雜判斷無法機械化,計畫大幅招聘初級人員。共識逐漸浮現:人機協作產生的價值高於完全替代,缺乏員工監督與訓練會讓 AI 系統無法有效運作。

  • CBA 一個月內撤回 AI 裁員,客服排隊失控
  • IBM 的 94% vs 6%——最後那段倫理/複雜判斷無法自動化
  • 策略從「砍頭數」轉向「重新配置人力 + 轉訓」

💡 為什麼重要:這是對「AI 全面取代人」最務實的一盆冷水——真正的價值來自把人放到 AI 監督與判斷的位置,而不是把人整段拿掉。

🔗 閱讀原文 | 來源:科技新報

9. Nvidia、CoreWeave、Nebius:撐起 GPU 熱潮的循環融資#

io-fund 拆解一個「循環融資」結構:Nvidia 分別投資 CoreWeave 與 Nebius 各約 20 億美元,這些公司再拿錢回頭買 Nvidia 數十億美元的 GPU;Nvidia 還承諾收購 CoreWeave 至 2032 年的未售容量(約 63 億美元擔保)。CoreWeave Q1 2026 自由現金流 -47 億美元、2026 年估需 310–350 億資本支出,卻只有約 87 億營運現金流,缺口靠不斷融資補。升息環境下,這種 2:1 資本支出對收入的模式脆弱性浮現。

  • Nvidia 投資客戶、客戶回頭買 GPU,形成需求端自我融資
  • CoreWeave 利息支出已占收入約 26%,現金燒率高
  • 實際 GPU 利用率遠低於財務承諾,暗示需求可能被高估

💡 為什麼重要:這讓人想起網路泡沫時期思科/Nortel 的賣方融資——當硬體巨頭在替自己的需求融資,整條 GPU 熱潮的地基就沒有帳面上那麼硬。

🔗 閱讀原文 | 來源:io-fund

10. OpenAI 推語音模型 GPT-Live,能聽、能回、還會適時插話#

OpenAI 發表 GPT-Live,採雙向音訊架構,能同時聽與說,自然插入「對」「了解」等肯定詞;使用者可中斷回應、要求調速或暫停。相較舊的級聯系統,單一模型內部處理音訊消除了階段間資訊損失並降低延遲,複雜任務還能自動委派給 GPT-5.5 再整合結果。提供 GPT-Live-1 與 mini 兩版、各九種聲音,直接對打 Gemini Live。

  • 雙向音訊、可被打斷、會自然插話,接近真人對話
  • 單一模型內處理音訊,消除級聯系統的延遲與資訊損失
  • 每週 1.5 億次 ChatGPT 語音互動,API 即將開放

💡 為什麼重要:語音介面從「機械級聯」跨到「真正雙向對話」,會重新定義客服、教育與無障礙的可用性門檻。

🔗 閱讀原文 | 來源:科技新報

11. Lilian Weng:Harness Engineering,遞迴自我改進的現實路徑#

Anthropic 研究員 Lilian Weng 把「harness」定義為圍繞基底模型、協調執行並決定模型如何思考/規劃/調用工具的系統。核心模式包括工作流自動化、以檔案系統當持久記憶、子 agent 與後端並行化;內容工程應建構會演進的 playbook 而非一味加長提示詞。她主張遞迴自我改進的現實路徑不在改寫模型權重,而在迭代優化 harness,並點出弱評估器、長期記憶、獎勵駭客與人類監督平衡等關鍵挑戰。

  • harness = 模型外的協調系統,決定模型怎麼思考與行動
  • 檔案系統當記憶、子 agent 並行、演進式 playbook 是核心模式
  • 自我改進的現實路徑在 harness 迭代,而非改權重

💡 為什麼重要:這正好呼應 Bun-in-Rust 與 Cursor 數據——決勝點正從模型本身移到「怎麼把模型架起來用」,harness 就是那層架構。

🔗 閱讀原文 | 來源:Lilian Weng

12. SQLite 該優先用 STRICT 資料表:型別安全零效能代價#

Evan Hahn 主張新建 SQLite 表應優先用 STRICT 模式,在資料庫層強制型別檢查,只允許 INT/INTEGER/REAL/TEXT/BLOB/ANY。實測百萬列插入無明顯效能負荷、檔案也不變大;需要彈性的欄位可用 ANY 保留無損轉換。需 SQLite 3.37.0(2021/11)以上。

  • STRICT 在 DB 層擋掉型別不匹配,根本降低資料品質風險
  • 百萬列測試無效能差異、檔案不變大
  • ANY 型別保留彈性,支援無損型別轉換

💡 為什麼重要:這是資料庫界的「TypeScript 化」——用一點前期嚴格換長期維護的資料一致性,對長壽命應用特別划算。

🔗 閱讀原文 | 來源:Evan Hahn

推薦閱讀#

大神動態#

  • Lilian Weng:發表 Harness Engineering for Self-Improvement 長文,主張自我改進的現實路徑在 harness 迭代而非改權重(詳見必讀 #11)
  • Simon Willison:發布 sqlite-utils 4.1,新增 --code 與 --type 參數(詳見推薦閱讀)
  • Cory Doctorow:〈反向半人馬〉舊文重新在 HN 引爆討論,呼應今天的 AI 裁員翻車主題(詳見推薦閱讀)

社群熱門#

中文技術圈#

開源精選#

withmarbleapp/os-taxonomy — JavaScript | ⭐ 2.5K 開源作業系統/軟體分類體系。

Shpigford/knockoff — JavaScript | ⭐ 1.8K Chrome 擴充:過濾 Amazon 山寨品牌,只留真實老牌。

oso95/scroll-world — JavaScript | ⭐ 915 把任何品牌變成可捲動 3D 世界的 skill。

Robbyant/lingbot-world-v2 — Python | ⭐ 809 具身智能:無限世界 + 多樣互動。

op7418/guizang-material-illustration — ⭐ 566 歸藏的材質插畫 skill:帶字解釋圖與圖表美化。

xiaotianfotos/homerail — TypeScript | ⭐ 453 語音優先的本地 agent 編排 runtime(可稽核 DAG)。

nexu-io/motion-anything — JavaScript | ⭐ 395 對話式動效引擎:描述感覺,AI 產出動畫。

Nanako0129/pilotfish — ⭐ 359 Claude Code 多模型編排:前沿模型規劃、便宜模型執行。

影音精選#

YC 設計主管教你用 AI 做設計#

2 天前 · Y Combinator

Y Combinator

YC 設計主管 Eve Bouffard 分享她幾乎完全用語音操控 coding agent 完成設計工作。以 Paxel、SOTA Zine、YC Startup School 品牌視覺三個真實專案,說明 AI 如何從快速原型一路貫穿到設計系統,並強調現在最大的瓶頸不再是工具,而是想像力。

  • 設計流程幾乎全靠語音輸入搭配 coding agent,不再手動打字
  • Paxel:像「Coding 版的 Spotify Wrapped」,理解自己與他人的 AI coding 習慣
  • SOTA Zine 示範「Soul.md」當品牌一致性的唯一真實來源,一次生成 16 種網站變體

The Eras of AI Agents(AI Agent 的時代演進史)#

1 天前 · Theo

Theo

Theo 用 Anthropic 幾代模型勾勒 agentic coding 三個時代:Sonnet 3.5 是第一個能穩定執行 tool call 的「工具呼叫時代」;Opus 4.5 帶來長時間任務不迷失的能力;最新的 Mythos 進入「編排時代」——模型不只懂程式碼庫,還懂自己,會拆解任務並派生其他模型完成與驗證。

  • Sonnet 3.5:第一個可日常 coding、穩定執行 tool call 的模型
  • Opus 4.5:能執行更長任務而不迷失脈絡的躍進
  • Mythos:進入編排時代,模型能理解自身並派生其他模型分工驗證

Grok 4.5 比 Fable 5 更重磅:讓 AI 當你的共同創辦人#

1 天前 · Greg Isenberg

Greg Isenberg

Greg Isenberg 邀 Orgo 共同創辦人 Nick Vasilescu,主張 Grok 4.5 搭配 Hermes、OpenClaw 等 agent 框架,能以遠低於 Opus 的成本、10–15 倍速度達到接近 Opus 4.8 的智慧。現場示範 Grok 4.5 約 40 秒做出登陸頁,並帶出從發想、建站、行銷素材到冷開發信的一鍵式 AI 創業流程。

  • Grok 4.5 以接近 Opus 4.8 智慧、更低成本、快 10–15 倍,適合當「AI 共同創辦人」
  • 現場實測約 40 秒生成登陸頁,設計與文案優於 GPT-5.6 Sol
  • 示範 Orgo 雲端電腦 + Hermes + 多工具串出完整創業流程

今日觀察#

今天最值得放在一起看的,是 Cursor 那組 60 倍的產出差距、Glean 創辦人「前沿模型正在商品化」的斷言,還有那篇爆紅的〈別再叫我問 AI〉。三件事指向同一個位移:當模型變便宜、變可替換,勝負就不在「你接了哪家模型」,而在你怎麼用它。Cursor 數據裡最反直覺的一點是九成 token 花在「讀懂舊程式碼」而非生成——會用的人把 AI 當讀得比你快的資深同事,才拉開那 60 倍;而 Yael 那句「這個問題早就活過模型了」則從反面補上同一件事:當「問 AI」變成萬用推託句,人類願不願意真的動腦、能不能給出模型給不出的判斷,反而成了最稀缺的資源。連 OpenAI 自己都在收掉 Atlas、把 Codex 塞回既有入口,等於承認產品形態不是護城河。對每個做東西的人來說,這一天的訊號很一致:模型會越來越像水電,值錢的東西正在往上層——判斷、工作流、與信任——搬家。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有