yii.
← Digest
EP130 · 2026年7月11日 星期六 · 8 min read

戰線從跑分移到法庭與晶圓廠

每天花 1% 的時間,掌握科技脈動。

今日金句#

“The problem is repetition. LLMs write in the same style, and they make the same kinds of mistakes.” 「問題出在重複。這些模型用同一種風格寫字,也犯同一種錯。」 — Alec Scollon, 軟體工程師(〈我好像得了 LLM 倦怠〉)

今日主軸:戰線從跑分移到法庭與晶圓廠#

GPT-5.6 的煙硝還沒散,戰場已經悄悄換了地方。今天最大的新聞不是誰又刷高了 benchmark,而是 Apple 一狀告上 OpenAI,指控前員工帶走硬體機密去幫它布局自家 AI 裝置——兩家在 Siri 上還是夥伴,轉頭就在法庭見。同一天,Hugging Face 執行長 Clem Delangue 說企業已經受夠了「租 AI」,開始想自己養模型;Meta 的 Iris 自研晶片九月投產、DeepSeek 也在做自己的晶片、連 Sam Altman 都提議讓美國政府拿 OpenAI 5% 股權。把這些串起來看,訊號很一致:當模型本身快速變成水電(GPT-5.6 Sol 用大約四分之一的成本就打到前沿),真正值錢、真正被搶的,已經是模型底下的硬體、資料與控制權。前沿模型還在比誰聰明,錢和權力已經往下沉到晶圓廠、往上飄到董事會。

必讀#

  1. 蘋果控告 OpenAI 竊取硬體商業機密 — The Verge News
  2. GPT-5.6 Sol/Terra/Luna 登場,Codex 併入 ChatGPT Work 成「工作作業系統」 — Latent Space AI
  3. Gemini 3.5 Flash 內建 computer use,一個模型全端操作電腦 — Google DeepMind AI
  4. Hugging Face CEO:企業受夠了「租 AI」,開始想自己養 — TechCrunch AI
  5. GPT-5.6 Sol vs Claude Fable:Lenny 用自製指數實測誰更強 — Lenny’s Newsletter AI
  6. 我好像得了 LLM 倦怠:一位天天用 AI 的工程師自白 — alecscollon Debate
  7. 別再當 Code Review 瓶頸:PostHog 工程師的 AI 審查心法 — PostHog Dev

1. 蘋果控告 OpenAI 竊取硬體商業機密

Apple 對 OpenAI 提起訴訟,指控數名前 Apple 員工跳槽後帶走硬體開發的商業機密,協助 OpenAI 布局自家 AI 硬體裝置。格外敏感的是,Apple 的 Siri 目前正靠 OpenAI 模型撐場,兩家在消費端是夥伴、硬體端卻對簿公堂。

  • 爭議核心是「硬體」而非模型——AI 裝置的工程細節正成為新的護城河
  • 夥伴與對手界線模糊,Apple 一邊用 OpenAI 模型、一邊告它偷硬體
  • 呼應 Apple 近年加速自研 AI 硬體、想擺脫外部模型依賴的長線布局

💡 為什麼重要:當模型本身快速商品化,競爭焦點正從「誰模型強」下沉到「誰能把 AI 做進一台裝置」。硬體整合能力,可能是下一輪真正的分水嶺。

🔗 閱讀原文 | 來源: The Verge


2. GPT-5.6 Sol/Terra/Luna 登場,Codex 併入 ChatGPT Work 成「工作作業系統」

OpenAI 推出 GPT-5.6 三檔尺寸 Sol、Terra、Luna,主打「每美元完成的任務量」,號稱 Sol 以約四分之一成本達到前沿能力,並新增最多可協調四個 agent 的 ultra 推理層級。同步把 Codex 併入 ChatGPT Work,整合桌面存取、多 agent 協作與 Sites 託管,想成為白領的「工作作業系統」。

  • 定價 Sol $5/$30、Terra $2.5/$15、Luna $1/$6(每百萬 token 輸入/輸出),cache 讀取再打一折
  • Sol 在 Agents’ Last Exam 拿 53.6,官方稱領先 Fable 5 逾 13 分;但基準之爭仍在(Fable 5 在 SWE-Bench Pro 仍領先)
  • 瓶頸從「模型能力」移向「編排與 token 效率」——每任務約 15k 輸出 token,主打成本效率

💡 為什麼重要:這是 OpenAI 把戰場從「跑分」轉向「每美元價值」與「工作流整合」的一步。前沿級能力的邊際成本正在崩,真正的差異化回到「你在上面做出什麼」。

🔗 閱讀原文 | 來源: Latent Space


3. Gemini 3.5 Flash 內建 computer use,一個模型全端操作電腦

Google DeepMind 把「操作電腦」能力原生做進 Gemini 3.5 Flash,agent 可跨瀏覽器、行動與桌面環境自主操作,不需另掛專用模型。同一顆模型同時支援 function calling 與 computer use,並在 OSWorld 基準上有明顯進步。安全面加了對抗訓練、關鍵動作需使用者明確確認、偵測到 prompt injection 會自動中止任務。

  • 單一模型同時做 function calling + computer use,簡化 agent 開發鏈路
  • 面向長流程企業自動化(軟體測試、知識工作),走 Gemini API 與 Enterprise Agent Platform
  • 內建 prompt injection 偵測與自動停止,是把「agent 操作電腦」商用化的必要護欄

💡 為什麼重要:如果 AI 真要接手白領工作,第一步就是「它自己會用電腦」。把 computer use 收進主力快模型,等於把這個未來從研究 demo 推到可部署。

🔗 閱讀原文 | 來源: Google DeepMind


4. Hugging Face CEO:企業受夠了「租 AI」,開始想自己養

Hugging Face 執行長 Clem Delangue 認為,開源 AI 的採用正在加速,企業逐漸從「只透過 API 租用封閉模型」轉向自建、自控的 AI 堆疊。搭配同期 Meta 自研 Iris 晶片、DeepSeek 自製晶片等動態,「擁有」而非「租用」正成為新的產業張力。

  • 開源模型品質追上前沿後,自建的性價比與可控性大增
  • 資料主權、成本可預測性、避免供應商鎖定,是企業轉向自養的三大動機
  • 與 Apple 告 OpenAI、Meta Iris 晶片同屬「往下爭奪底層控制權」的大趨勢

💡 為什麼重要:模型商品化之後,價值鏈往上下兩端移動——上是工作流與產品,下是硬體與資料主權。中間那層「純租模型」正被兩頭擠壓。

🔗 閱讀原文 | 來源: TechCrunch


5. GPT-5.6 Sol vs Claude Fable:Lenny 用自製指數實測誰更強

Claire Vo 在 Lenny’s Newsletter 用自製的「Claire 加權指數」,橫跨 PRD、原型設計、除錯與 agent 語音等五大類別,實測 GPT-5.6 Sol、Terra、Luna 與 Claude Fable 5、Sonnet 5,結果 Sol 明顯勝出。她也示範用 Codex 一次做出兒童作業追蹤 App、用瀏覽器自動化狂發 500 則 LinkedIn 回覆的實戰心得。

  • 非官方 benchmark,而是產品人視角的實務任務評測
  • Sol 在多數類別領先,但評測方法本身是主觀加權,供參考不宜當定論
  • 亮點在「用 Codex + 瀏覽器自動化」把個人工作流全自動化的實作 demo

💡 為什麼重要:跑分之外,產品人怎麼「用」模型才是落地訊號。價值不在誰贏,而在示範一個人能靠 agent 把多少雜事外包出去。

🔗 閱讀原文 | 來源: Lenny’s Newsletter


6. 我好像得了 LLM 倦怠:一位天天用 AI 的工程師自白

工程師 Alec Scollon 寫下他用 AI 一整年後的真實心境。他強調 AI 確實讓生產力與學習速度大增,但長期高頻互動帶來一種累積型的認知疲勞:模型永遠用同一種語氣、犯同一種錯、給同一類假設,人得一次次去接住並修正。文章點出「工具採用不只影響產出品質,也影響開發者的心理可持續性」。

  • 核心痛點是「重複」——同一種風格、同一種錯誤模式帶來磨損
  • 作者每天用數小時操作 Claude Code、Codex、ChatGPT、Gemini、Qwen
  • 不是反 AI,而是提醒「開發者福祉」在 AI 常態化後值得被認真看待

💡 為什麼重要:在一面倒的「生產力暴增」敘事裡,這是難得談「人」的一篇。工具越強,人越要當那個清醒的把關者,這份隱形勞動與疲勞值得被說出來。

🔗 閱讀原文 | 來源: alecscollon


7. 別再當 Code Review 瓶頸:PostHog 工程師的 AI 審查心法

PostHog 指出 AI agent 寫程式的速度已遠超人類審查能力,建議工程師退出「逐行審查」的迴圈,改建立委派給 agent 的審查管線。文章給出四個實際工作流調整,包含用不同模型的多個 agent 互相審查、避免讓寫程式的 agent 審查自己的程式碼。

  • 人類審查正成為新瓶頸,解法是「用 agent 審 agent」
  • 關鍵原則——寫 code 的 agent 不該審自己的 code,需異質模型交叉把關
  • 人類角色從「逐行檢查」上移到「設計審查管線與定義意圖」

💡 為什麼重要:這是「AI 寫得比人審得快」矛盾的正面應對。能被測試與 agent 驗證的交出去,需要人類意圖判斷的守住——審查流程本身正在被重新設計。

🔗 閱讀原文 | 來源: PostHog

推薦閱讀#

社群熱門#

大神動態#

  • Simon Willison:連發 GPT-5.6 家族解析、Muse Spark 1.1 與 llm-meta-ai 外掛(詳見推薦閱讀)
  • Mitchell Hashimoto:Lobsters 專訪 談 Ghostty、Zig 與開源哲學,社群熱議
  • Jarred Sumner:主導 Bun 用 AI 11 天重寫 Rust,示範「有測試就敢動地基」(詳見推薦閱讀)

中文技術圈#

開源精選 — GitHub Trending(本週)#

Shpigford/knockoff — JavaScript | ⭐ 1.7K Chrome 擴充,把 Amazon 上的假品牌垃圾濾掉,只買真正的老牌。

MaximeRivest/riddle — Rust | ⭐ 1.3K reMarkable Paper Pro 的「湯姆瑞斗日記」,你手寫、頁面吸墨,再用流暢字跡回你。

514-labs/dnsglobe — Rust | ⭐ 795 在終端機世界地圖上,看 DNS 紀錄跨 34 個公共解析器全球傳播。

simonlin1212/Vibe-Research — TypeScript | ⭐ 676 A股/美股/港股的個人投研 Agent:每日復盤、資訊雷達、個股數據。

oso95/scroll-world — JavaScript | ⭐ 628 把任何品牌變成一個可捲動的 3D 世界的 skill。

nagisanzenin/engram — Python | ⭐ 493 Claude Code 的循證學習引擎:第一性原理課綱 + 自由回想驗證。

op7418/guizang-material-illustration — ⭐ 527 歸藏的材質插畫 skill:生成帶字解釋圖、圖表美化與參考配圖。

影音精選#

用了 GPT-5.6 好幾週後的真實心得#

1d · Theo (t3.gg)

Theo

Theo 提前拿到 GPT-5.6 搶先權限,六週內燒了約 18-24 萬美元推論費用、跑了 67 個專案,包括把 TypeScript 版 Go compiler 完整改寫成 Rust、把 T3 Code 原生移植到 SwiftUI 等高難度任務。

  • 六週燒掉 18-24 萬美元推論成本測試 67 個專案
  • 挑戰包含把 TypeScript Go compiler 全面改寫成 Rust
  • 兩個原生 mobile app 用 SwiftUI 重寫

OpenAI 王者歸來?GPT-5.6 Sol 首發評測#

23h · Fireship

Fireship

Fireship 一貫短平快風格快速上手 Sol,測它是否真的在能力上超越 Claude,並探討 OpenAI 選在此時推出新模型背後的時機與跑分表現。

  • Sol 號稱在多項指標上超越 Claude
  • 聚焦跑分數據與實際能力落差

Grok 4.5 比 Fable 5 更重要的一次發布#

18h · Greg Isenberg

Greg Isenberg

Greg Isenberg 與 Orgo 共同創辦人主張把 Grok 4.5 當成真正的「AI 共同創辦人」,現場用 Orgo 雲端電腦架設常駐 agent、串接工具,從零打造一間新創到落地頁。

  • Grok 4.5 智慧接近頂級模型,但速度快 10-15 倍、成本大幅降低
  • 現場示範用雲端電腦架設常駐 agent,串接 email、電話等工具
  • 與 GPT-5.6 Sol 現場對比,約 40 秒生成落地頁

YC 設計主管教你如何用 AI 設計#

1d · Y Combinator

Y Combinator

YC 設計主管 Eve Bouffard 分享如何用 AI coding agent 打造產品、網站與活動,說明快速原型、品牌設計與設計系統如何被 AI 改變。

  • 用 AI coding agent 取代傳統設計軟體做快速原型與品牌設計
  • soul.md 作為設計系統單一真實來源,一次生成 16 種網站變體
  • AI 時代設計瓶頸已從軟體轉移到想像力

Sam Altman 提議讓政府持股 OpenAI 5%#

2d · 20VC

20VC

20VC 邀請 Jason Lemkin 與 Rory O’Driscoll,討論 OpenAI 提議讓美國政府持股 5%、DeepSeek 自研晶片、Anthropic 傳與三星洽談等多起 AI 產業重大動態。

  • OpenAI 向美國政府提議 5% 股權,引發後續政府控制權疑慮
  • DeepSeek 自研晶片、Anthropic 傳與三星洽談合作
  • Kling 估值 180 億美元募資 28 億美元

AI Agent 的時代演進史#

1d · Theo (t3.gg)

Theo

Theo 透過 Anthropic 幾次關鍵模型發布,梳理出 agentic coding 發展至今的幾個「時代」,說明每個階段的技術轉折點與 agent 能力的躍進軌跡。

  • 以 Anthropic 模型發布節點劃分 agentic coding 的演進階段
  • 分析每個時代 agent 能力與使用模式的關鍵轉變

今日觀察#

把今天的幾條線擺在一起,會發現一個很清楚的位移:戰場正在離開 benchmark。Apple 告 OpenAI 爭的是硬體機密、Hugging Face CEO 喊企業要自己養模型、Meta 的 Iris 晶片九月投產——當 GPT-5.6 Sol 用四分之一成本就打到前沿,模型這一層正快速塌縮成水電,於是資本與訴訟一起往下沉到晶圓廠、往上飄到董事會。而 Alec Scollon 那篇〈LLM 倦怠〉像是這齣大戲旁邊一句安靜的註腳:當所有人都在搶「更快、更便宜、更自主」,天天坐在這些工具前面的人,累的不是工作量,是得一直當那個修正機器、保持清醒的角色。技術往下爭硬體、往上爭工作流的同時,中間那個「人」的處境,可能才是最少被算進去、卻最該被看見的一格。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有