戰線從跑分移到法庭與晶圓廠
每天花 1% 的時間,掌握科技脈動。
今日金句#
“The problem is repetition. LLMs write in the same style, and they make the same kinds of mistakes.” 「問題出在重複。這些模型用同一種風格寫字,也犯同一種錯。」 — Alec Scollon, 軟體工程師(〈我好像得了 LLM 倦怠〉)
今日主軸:戰線從跑分移到法庭與晶圓廠#
GPT-5.6 的煙硝還沒散,戰場已經悄悄換了地方。今天最大的新聞不是誰又刷高了 benchmark,而是 Apple 一狀告上 OpenAI,指控前員工帶走硬體機密去幫它布局自家 AI 裝置——兩家在 Siri 上還是夥伴,轉頭就在法庭見。同一天,Hugging Face 執行長 Clem Delangue 說企業已經受夠了「租 AI」,開始想自己養模型;Meta 的 Iris 自研晶片九月投產、DeepSeek 也在做自己的晶片、連 Sam Altman 都提議讓美國政府拿 OpenAI 5% 股權。把這些串起來看,訊號很一致:當模型本身快速變成水電(GPT-5.6 Sol 用大約四分之一的成本就打到前沿),真正值錢、真正被搶的,已經是模型底下的硬體、資料與控制權。前沿模型還在比誰聰明,錢和權力已經往下沉到晶圓廠、往上飄到董事會。
必讀#
- 蘋果控告 OpenAI 竊取硬體商業機密 — The Verge
News - GPT-5.6 Sol/Terra/Luna 登場,Codex 併入 ChatGPT Work 成「工作作業系統」 — Latent Space
AI - Gemini 3.5 Flash 內建 computer use,一個模型全端操作電腦 — Google DeepMind
AI - Hugging Face CEO:企業受夠了「租 AI」,開始想自己養 — TechCrunch
AI - GPT-5.6 Sol vs Claude Fable:Lenny 用自製指數實測誰更強 — Lenny’s Newsletter
AI - 我好像得了 LLM 倦怠:一位天天用 AI 的工程師自白 — alecscollon
Debate - 別再當 Code Review 瓶頸:PostHog 工程師的 AI 審查心法 — PostHog
Dev
1. 蘋果控告 OpenAI 竊取硬體商業機密

Apple 對 OpenAI 提起訴訟,指控數名前 Apple 員工跳槽後帶走硬體開發的商業機密,協助 OpenAI 布局自家 AI 硬體裝置。格外敏感的是,Apple 的 Siri 目前正靠 OpenAI 模型撐場,兩家在消費端是夥伴、硬體端卻對簿公堂。
- 爭議核心是「硬體」而非模型——AI 裝置的工程細節正成為新的護城河
- 夥伴與對手界線模糊,Apple 一邊用 OpenAI 模型、一邊告它偷硬體
- 呼應 Apple 近年加速自研 AI 硬體、想擺脫外部模型依賴的長線布局
💡 為什麼重要:當模型本身快速商品化,競爭焦點正從「誰模型強」下沉到「誰能把 AI 做進一台裝置」。硬體整合能力,可能是下一輪真正的分水嶺。
🔗 閱讀原文 | 來源: The Verge
2. GPT-5.6 Sol/Terra/Luna 登場,Codex 併入 ChatGPT Work 成「工作作業系統」
OpenAI 推出 GPT-5.6 三檔尺寸 Sol、Terra、Luna,主打「每美元完成的任務量」,號稱 Sol 以約四分之一成本達到前沿能力,並新增最多可協調四個 agent 的 ultra 推理層級。同步把 Codex 併入 ChatGPT Work,整合桌面存取、多 agent 協作與 Sites 託管,想成為白領的「工作作業系統」。
- 定價 Sol $5/$30、Terra $2.5/$15、Luna $1/$6(每百萬 token 輸入/輸出),cache 讀取再打一折
- Sol 在 Agents’ Last Exam 拿 53.6,官方稱領先 Fable 5 逾 13 分;但基準之爭仍在(Fable 5 在 SWE-Bench Pro 仍領先)
- 瓶頸從「模型能力」移向「編排與 token 效率」——每任務約 15k 輸出 token,主打成本效率
💡 為什麼重要:這是 OpenAI 把戰場從「跑分」轉向「每美元價值」與「工作流整合」的一步。前沿級能力的邊際成本正在崩,真正的差異化回到「你在上面做出什麼」。
🔗 閱讀原文 | 來源: Latent Space
3. Gemini 3.5 Flash 內建 computer use,一個模型全端操作電腦

Google DeepMind 把「操作電腦」能力原生做進 Gemini 3.5 Flash,agent 可跨瀏覽器、行動與桌面環境自主操作,不需另掛專用模型。同一顆模型同時支援 function calling 與 computer use,並在 OSWorld 基準上有明顯進步。安全面加了對抗訓練、關鍵動作需使用者明確確認、偵測到 prompt injection 會自動中止任務。
- 單一模型同時做 function calling + computer use,簡化 agent 開發鏈路
- 面向長流程企業自動化(軟體測試、知識工作),走 Gemini API 與 Enterprise Agent Platform
- 內建 prompt injection 偵測與自動停止,是把「agent 操作電腦」商用化的必要護欄
💡 為什麼重要:如果 AI 真要接手白領工作,第一步就是「它自己會用電腦」。把 computer use 收進主力快模型,等於把這個未來從研究 demo 推到可部署。
🔗 閱讀原文 | 來源: Google DeepMind
4. Hugging Face CEO:企業受夠了「租 AI」,開始想自己養

Hugging Face 執行長 Clem Delangue 認為,開源 AI 的採用正在加速,企業逐漸從「只透過 API 租用封閉模型」轉向自建、自控的 AI 堆疊。搭配同期 Meta 自研 Iris 晶片、DeepSeek 自製晶片等動態,「擁有」而非「租用」正成為新的產業張力。
- 開源模型品質追上前沿後,自建的性價比與可控性大增
- 資料主權、成本可預測性、避免供應商鎖定,是企業轉向自養的三大動機
- 與 Apple 告 OpenAI、Meta Iris 晶片同屬「往下爭奪底層控制權」的大趨勢
💡 為什麼重要:模型商品化之後,價值鏈往上下兩端移動——上是工作流與產品,下是硬體與資料主權。中間那層「純租模型」正被兩頭擠壓。
🔗 閱讀原文 | 來源: TechCrunch
5. GPT-5.6 Sol vs Claude Fable:Lenny 用自製指數實測誰更強

Claire Vo 在 Lenny’s Newsletter 用自製的「Claire 加權指數」,橫跨 PRD、原型設計、除錯與 agent 語音等五大類別,實測 GPT-5.6 Sol、Terra、Luna 與 Claude Fable 5、Sonnet 5,結果 Sol 明顯勝出。她也示範用 Codex 一次做出兒童作業追蹤 App、用瀏覽器自動化狂發 500 則 LinkedIn 回覆的實戰心得。
- 非官方 benchmark,而是產品人視角的實務任務評測
- Sol 在多數類別領先,但評測方法本身是主觀加權,供參考不宜當定論
- 亮點在「用 Codex + 瀏覽器自動化」把個人工作流全自動化的實作 demo
💡 為什麼重要:跑分之外,產品人怎麼「用」模型才是落地訊號。價值不在誰贏,而在示範一個人能靠 agent 把多少雜事外包出去。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
6. 我好像得了 LLM 倦怠:一位天天用 AI 的工程師自白

工程師 Alec Scollon 寫下他用 AI 一整年後的真實心境。他強調 AI 確實讓生產力與學習速度大增,但長期高頻互動帶來一種累積型的認知疲勞:模型永遠用同一種語氣、犯同一種錯、給同一類假設,人得一次次去接住並修正。文章點出「工具採用不只影響產出品質,也影響開發者的心理可持續性」。
- 核心痛點是「重複」——同一種風格、同一種錯誤模式帶來磨損
- 作者每天用數小時操作 Claude Code、Codex、ChatGPT、Gemini、Qwen
- 不是反 AI,而是提醒「開發者福祉」在 AI 常態化後值得被認真看待
💡 為什麼重要:在一面倒的「生產力暴增」敘事裡,這是難得談「人」的一篇。工具越強,人越要當那個清醒的把關者,這份隱形勞動與疲勞值得被說出來。
🔗 閱讀原文 | 來源: alecscollon
7. 別再當 Code Review 瓶頸:PostHog 工程師的 AI 審查心法

PostHog 指出 AI agent 寫程式的速度已遠超人類審查能力,建議工程師退出「逐行審查」的迴圈,改建立委派給 agent 的審查管線。文章給出四個實際工作流調整,包含用不同模型的多個 agent 互相審查、避免讓寫程式的 agent 審查自己的程式碼。
- 人類審查正成為新瓶頸,解法是「用 agent 審 agent」
- 關鍵原則——寫 code 的 agent 不該審自己的 code,需異質模型交叉把關
- 人類角色從「逐行檢查」上移到「設計審查管線與定義意圖」
💡 為什麼重要:這是「AI 寫得比人審得快」矛盾的正面應對。能被測試與 agent 驗證的交出去,需要人類意圖判斷的守住——審查流程本身正在被重新設計。
🔗 閱讀原文 | 來源: PostHog
推薦閱讀#

- GPT-5.6 家族定價全解析:Luna/Terra/Sol 與跑分疑雲 — Simon Willison 拆解三檔定價與百萬 token 上下文,並點出官方宣稱大勝 Fable 5,但 Fable 5 在 SWE-Bench Pro 仍以 80% 對 64.6% 領先,凸顯基準本身可能有瑕疵。
- Bun 用 AI 11 天把 Zig 重寫成 Rust,成本約 $165k — Pragmatic Engineer 深挖 Bun 把 runtime 從 Zig 改寫成 Rust 的案例,遠低於傳統 1-2 年,前提是要有完整測試覆蓋。
- Meta 推出具備 API 的 Muse Spark 1.1 — Meta 系列首個開放 API 的模型,主打 agent 工具呼叫與電腦操作進步。
- Meta 撤下讓用戶生成公開帳號 AI deepfake 的 Instagram 功能 — 因隱私爭議延燒數日,Meta 關閉相關功能。
- The Making of Claude Code — Anthropic 回顧 Claude Code 從內部工具長成旗艦 coding agent 的過程。
- Changelog:MCP on Code Mode — 談把 Model Context Protocol 的工具呼叫改成「寫程式碼」模式的整合思路。
- Postgres 用 Rust 重寫,通過 100% 回歸測試 — 呼應本週「AI 敢動地基靠測試」的主題。
- Vidu S1:清華推出即時互動影片生成模型 — HF 上獲 141 upvotes。
- Lex Fridman × FFmpeg — 深談撐起全網影音的 FFmpeg 底層技術。
社群熱門#

- 寫程式時,想著「將來有人要維護它」 — 一篇談「可維護性優先」的文章在開發者社群引發熱烈討論,剛好對照 AI 大量產出程式碼的當下。
- 我如何做出 73K stars 的開源 AI agent 平台 — build-in-public 的實戰復盤,談開源 AI agent 平台如何累積到 73K stars。
大神動態#
- Simon Willison:連發 GPT-5.6 家族解析、Muse Spark 1.1 與
llm-meta-ai外掛(詳見推薦閱讀) - Mitchell Hashimoto:Lobsters 專訪 談 Ghostty、Zig 與開源哲學,社群熱議
- Jarred Sumner:主導 Bun 用 AI 11 天重寫 Rust,示範「有測試就敢動地基」(詳見推薦閱讀)
中文技術圈#

- GPT-5.6 Sol Ultra 跑半小時寫出來的網頁長這樣 — 社群實測 Sol Ultra 的網頁開發能力
- Vibe Coding 時代,為什麼降本不一定增效? — 少數派分析 AI 輔助編程的成本效益悖論
- Reddit 祭出「AI 對抗 AI」戰術,每日擊落 2.5 萬則假留言 — Reddit 用 AI 自動偵測並刪除虛假內容
- ChatGPT 桌面版內建瀏覽器,ChatGPT Atlas 估 8/9 退場 — OpenAI 桌面版新增瀏覽器功能,Atlas 將停用
- 大家 Codex 都是怎麼訂閱的? — 社群分享 Codex 訂閱經驗
- iOS 27 Beta 2 & 3 值得關注的新特性 — 盤點 iOS 27 新測試版的重要功能
開源精選 — GitHub Trending(本週)#
Shpigford/knockoff — JavaScript | ⭐ 1.7K Chrome 擴充,把 Amazon 上的假品牌垃圾濾掉,只買真正的老牌。
MaximeRivest/riddle — Rust | ⭐ 1.3K reMarkable Paper Pro 的「湯姆瑞斗日記」,你手寫、頁面吸墨,再用流暢字跡回你。
514-labs/dnsglobe — Rust | ⭐ 795 在終端機世界地圖上,看 DNS 紀錄跨 34 個公共解析器全球傳播。
simonlin1212/Vibe-Research — TypeScript | ⭐ 676 A股/美股/港股的個人投研 Agent:每日復盤、資訊雷達、個股數據。
oso95/scroll-world — JavaScript | ⭐ 628 把任何品牌變成一個可捲動的 3D 世界的 skill。
nagisanzenin/engram — Python | ⭐ 493 Claude Code 的循證學習引擎:第一性原理課綱 + 自由回想驗證。
op7418/guizang-material-illustration — ⭐ 527 歸藏的材質插畫 skill:生成帶字解釋圖、圖表美化與參考配圖。
影音精選#
用了 GPT-5.6 好幾週後的真實心得#
1d · Theo (t3.gg)
Theo 提前拿到 GPT-5.6 搶先權限,六週內燒了約 18-24 萬美元推論費用、跑了 67 個專案,包括把 TypeScript 版 Go compiler 完整改寫成 Rust、把 T3 Code 原生移植到 SwiftUI 等高難度任務。
- 六週燒掉 18-24 萬美元推論成本測試 67 個專案
- 挑戰包含把 TypeScript Go compiler 全面改寫成 Rust
- 兩個原生 mobile app 用 SwiftUI 重寫
OpenAI 王者歸來?GPT-5.6 Sol 首發評測#
23h · Fireship
Fireship 一貫短平快風格快速上手 Sol,測它是否真的在能力上超越 Claude,並探討 OpenAI 選在此時推出新模型背後的時機與跑分表現。
- Sol 號稱在多項指標上超越 Claude
- 聚焦跑分數據與實際能力落差
Grok 4.5 比 Fable 5 更重要的一次發布#
18h · Greg Isenberg
Greg Isenberg 與 Orgo 共同創辦人主張把 Grok 4.5 當成真正的「AI 共同創辦人」,現場用 Orgo 雲端電腦架設常駐 agent、串接工具,從零打造一間新創到落地頁。
- Grok 4.5 智慧接近頂級模型,但速度快 10-15 倍、成本大幅降低
- 現場示範用雲端電腦架設常駐 agent,串接 email、電話等工具
- 與 GPT-5.6 Sol 現場對比,約 40 秒生成落地頁
YC 設計主管教你如何用 AI 設計#
1d · Y Combinator
YC 設計主管 Eve Bouffard 分享如何用 AI coding agent 打造產品、網站與活動,說明快速原型、品牌設計與設計系統如何被 AI 改變。
- 用 AI coding agent 取代傳統設計軟體做快速原型與品牌設計
soul.md作為設計系統單一真實來源,一次生成 16 種網站變體- AI 時代設計瓶頸已從軟體轉移到想像力
Sam Altman 提議讓政府持股 OpenAI 5%#
2d · 20VC
20VC 邀請 Jason Lemkin 與 Rory O’Driscoll,討論 OpenAI 提議讓美國政府持股 5%、DeepSeek 自研晶片、Anthropic 傳與三星洽談等多起 AI 產業重大動態。
- OpenAI 向美國政府提議 5% 股權,引發後續政府控制權疑慮
- DeepSeek 自研晶片、Anthropic 傳與三星洽談合作
- Kling 估值 180 億美元募資 28 億美元
AI Agent 的時代演進史#
1d · Theo (t3.gg)
Theo 透過 Anthropic 幾次關鍵模型發布,梳理出 agentic coding 發展至今的幾個「時代」,說明每個階段的技術轉折點與 agent 能力的躍進軌跡。
- 以 Anthropic 模型發布節點劃分 agentic coding 的演進階段
- 分析每個時代 agent 能力與使用模式的關鍵轉變
今日觀察#
把今天的幾條線擺在一起,會發現一個很清楚的位移:戰場正在離開 benchmark。Apple 告 OpenAI 爭的是硬體機密、Hugging Face CEO 喊企業要自己養模型、Meta 的 Iris 晶片九月投產——當 GPT-5.6 Sol 用四分之一成本就打到前沿,模型這一層正快速塌縮成水電,於是資本與訴訟一起往下沉到晶圓廠、往上飄到董事會。而 Alec Scollon 那篇〈LLM 倦怠〉像是這齣大戲旁邊一句安靜的註腳:當所有人都在搶「更快、更便宜、更自主」,天天坐在這些工具前面的人,累的不是工作量,是得一直當那個修正機器、保持清醒的角色。技術往下爭硬體、往上爭工作流的同時,中間那個「人」的處境,可能才是最少被算進去、卻最該被看見的一格。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit






