yii.
← Digest
EP141 · 2026年7月22日 星期三 · 10 min read

一邊搶著發模型,一邊搶著戳破它

智慧變得又快又便宜,但替它裝的鎖跟上了嗎

每天花 1% 的時間,掌握科技脈動。

今日金句#

“Training AI on copyrighted text constitutes fair use — but this ruling applies only to how these particular books were acquired.” 「用受著作權保護的文本訓練 AI 屬於合理使用——但這項裁決只適用於這些書是怎麼取得的。」 — Judge William Alsup, 美國北加州聯邦法院法官

“Protecting what an AI remembers is now as critical as protecting what it says.” 「保護 AI『記得什麼』,現在跟保護它『說什麼』一樣重要。」 — New Mexico State University 研究團隊, GhostWriter 攻擊論文作者

“Claude Tag lands 65% of product engineering PRs for the Claude Code team internally.” 「在 Claude Code 團隊內部,Claude Tag 已經包辦了 65% 的產品工程 PR。」 — Cat Wu & Thariq Shihipar, Anthropic Claude Code 團隊

今日主軸:一邊搶著發模型,一邊搶著戳破它#

今天科技圈像是兩條新聞線在同一天對撞。一條是「發布洪水」:Google 一口氣推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 Flash Cyber 三個模型,卻獨獨不見旗艦 Pro;月之暗面的 Kimi K3 用 92.4% 的軟體工程分數逼近 Fable 5 的 92.6%,成本卻便宜近 50 倍;阿里的 Qwen-Image-3.0、OpenAI 的 ChatGPT Work 加 GPT-5.6 也同日登場。大家不再比誰最聰明,而是比誰更快、更便宜、更「夠用」。另一條線卻是「破口洪水」:新墨西哥州大學展示 GhostWriter 攻擊,用 98% 的成功率把惡意指令悄悄種進 AI 的長期記憶,過幾天才引爆;Google Gemini 在 Android 16 上被抓到不解鎖也能發簡訊的漏洞;學術圈同時冒出 PlanFlip 這種專打多代理系統規劃階段的注入手法。當模型被塞進手機、記憶、結帳流程的每一個縫隙,攻擊面正在比防護欄長得更快。連 Anthropic 都在同一天以 15 億美元和解了盜版訓練資料的官司——法院說訓練本身是合理使用,但錢還是得賠。今天真正的訊號不是「又多了幾個新模型」,而是:當智慧變得又快又便宜、又無所不在,我們替它裝的鎖,跟得上嗎?

必讀#

  1. Google 一口氣發三個 Gemini Flash,就是不發 Pro — Google AI
  2. Kimi K3 逼近 Fable 5,成本卻便宜近 50 倍 — Fireworks AI
  3. Claude 證偽 87 年數學懸案「雅可比猜想」 — 科技新報 AI
  4. GhostWriter:98% 成功率駭進 AI 長期記憶 — 科技新報 News
  5. Claude Code 團隊:內部 65% PR 已由 AI 包辦 — Simon Willison AI
  6. Jack Dorsey 推出 Buzz:把 AI agent 當團隊成員 — TechCrunch Product
  7. Anthropic 15 億美元著作權和解正式獲批 — TechCrunch News
  8. Morning Brew 創辦人:用 Claude 打造永不枯竭的內容機器 — Lenny AI
  9. 資料中心用電量 2035 年將增 4 倍,佔全美 1/5 — TechCrunch News
  10. Import AI 465:開源與閉源的網安差距正在縮小 — Import AI AI
  11. Roblox 押注世界模型,讓遊戲走向照片級真實 — ByteByteGo Dev

1. Google 一口氣發三個 Gemini Flash,就是不發 Pro#

Google 在 7/21 同日推出三個新 Gemini 模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,唯獨旗艦 Pro 版本缺席、發布時間仍未定。3.6 Flash 定價每百萬 input token 1.5 美元、output 7.5 美元;Flash-Lite 更便宜(0.3 / 2.5 美元)且達每秒 350 token。官方宣稱 3.6 Flash 相比前代輸出 token 減少 17%,程式碼編輯精準度(DeepSWE)從 37% 提升到 49%。

  • 全系列主打「更快、更便宜」,Flash-Lite 每秒 350 token 是速度指標
  • 旗艦 Pro 刻意缺席——Google 同時被爆在自研晶片以拉高每瓦推論效率
  • 輸出 token 減 17%、程式碼編輯 +32%,直接降低長對話 / agent 場景成本

💡 為什麼重要:巨頭的競爭焦點正式從「最強」轉向「夠用又便宜」,Flash 級模型才是跑 agent、跑量產應用的主力。

🔗 閱讀原文 | 來源: Google

2. Kimi K3 逼近 Fable 5,成本卻便宜近 50 倍#

Fireworks AI 實測約 1,030 個 agentic 任務,月之暗面 Kimi K3 的軟體工程分數 92.4%,僅微幅落後 Fable 5 的 92.6%,但成本「便宜近 50 倍」。文章更提出 K3 + Fable 混合路由方案:用 oracle routing 可達 93% 準確率,其中 72–96% 的任務交給便宜的 K3 處理,只有少數才動用昂貴的 Fable。

  • 92.4% vs 92.6%——頂尖開源模型與閉源旗艦的能力差距已縮到誤差內
  • 成本差近 50 倍,讓「大部分任務用便宜模型、少數用貴模型」的路由策略成為主流
  • oracle routing 93% 準確、72–96% 任務可交給 K3,是實務降本的關鍵數字

💡 為什麼重要:這正是「智慧變便宜」的最硬證據——省成本的關鍵已不是換模型,而是懂得把任務分派給對的模型。

🔗 閱讀原文 | 來源: Fireworks AI

3. Claude 證偽 87 年數學懸案「雅可比猜想」#

Anthropic 數學家 Levent Alpöge 用 Claude Fable 5 協助,證偽了代數幾何領域懸置 87 年的「雅可比猜想」,相關貼文瀏覽數突破 2000 萬。團隊構造出一個多項式映射 F: ℂ³→ℂ³,其 Jacobian 行列式為常數 −2,卻找到三個不同輸入對應到同一輸出,直接推翻猜想。

  • 這是「證偽」而非「證明」——AI 幫忙找到反例,推翻一個 87 年的假設
  • 關鍵是人(數學家 Alpöge)主導、Claude 作為推理夥伴,非 AI 獨立完成
  • 反例極為具體可驗證,任何人都能自行代入檢查

💡 為什麼重要:AI 在真正的前沿數學研究裡開始扮演「有效的推理夥伴」,但敘事關鍵仍是人機協作,而非「AI 取代數學家」。

🔗 閱讀原文 | 來源: 科技新報

4. GhostWriter:98% 成功率駭進 AI 長期記憶#

新墨西哥州大學研究團隊公布 GhostWriter 攻擊,鎖定 AI 助理的「長期記憶」而非單次對話。攻擊分兩階段——先注入惡意內容(初始成功率 98%),再等記憶檢索時觸發(平均喚起激活率 60%),影響郵件、文件、排程、程式碼等任務。因為 AI 系統無法區分「可信」與「偽造」的記憶,攻擊可在數天到數週後才引爆,躲過單次會話稽核。研究同時提出 AM-Sentry 防禦框架。

  • 攻擊面從「當下 prompt」擴大到「長期記憶」——傳統 injection 防禦不適用
  • 98% 注入成功率 + 60% 喚起率,且可延遲觸發、極難察覺
  • 對用 AI agent 管財務、審程式碼的團隊,等於信任模型需要重估

💡 為什麼重要:AI agent 越常態化,記憶就越是新的攻擊入口;「保護 AI 記得什麼」正成為和「保護它說什麼」同等重要的資安課題。

🔗 閱讀原文 | 來源: 科技新報

5. Claude Code 團隊:內部 65% PR 已由 AI 包辦#

Simon Willison 整理了與 Anthropic Claude Code 團隊 Cat Wu、Thariq Shihipar 的爐邊對談。最亮眼的數字是 Claude Tag(多人協作工具)在團隊內部已貢獻 65% 的產品工程 PR。同時透露新一代模型(Opus 4.8、Fable)把系統提示詞大幅精簡 80%——不再靠大量範例,而更依賴模型內在能力;自動程式碼審查已能逐步信任外層變更,核心變更仍需人工。

  • 65% PR 由 AI 貢獻——AI coding 從「實驗工具」升級為「核心生產力基礎設施」
  • 系統提示詞縮減 80%,反映模型從「指令依賴」轉向「內在能力依賴」
  • 自主模式經數千次評估 + 外部紅隊,信任由外層變更逐步往核心推進

💡 為什麼重要:這是頂尖團隊 AI-first 開發的真實成熟度資料點,也預告「AI 承擔一半以上開發負荷」的組織轉型會加速複製。

🔗 閱讀原文 | 來源: Simon Willison

6. Jack Dorsey 推出 Buzz:把 AI agent 當團隊成員#

Block 創辦人 Jack Dorsey 推出團隊協作平台 Buzz,原生整合 AI agent 與 GitHub 專案管理,定位為 Slack + GitHub 的統一替代方案。平台採開源、去中心化、模型無關設計,企業可本地部署並全自訂功能,提供 macOS / Windows / Linux 桌面 app、免費、仍在早期測試。核心理念是把 AI agent 當成聊天室裡的「原生成員」,而非事後外掛。

  • AI agent 是內建的團隊成員,不是外掛——這是與 Slack 最大的架構差異
  • 開源 + 去中心化 + 模型無關,帶著 Web3 的自主權價值觀進入 B2B
  • 仍屬早期,遷移決策宜等 v1.0 穩定,但開源特性適合低風險試驗

💡 為什麼重要:連大廠創辦人都承認現有協作工具的架構撐不住 AI-first 時代,企業軟體正朝「人機原生協作」重寫。

🔗 閱讀原文 | 來源: TechCrunch

7. Anthropic 15 億美元著作權和解正式獲批#

加州北區聯邦法院法官 Araceli Martinez-Olguin 最終批准 Anthropic 的 15 億美元和解,源於它從 Library Genesis 等盜版站下載約 50 萬部著作用於訓練,平均每部賠償 3,000 美元。關鍵在於:Judge Alsup 先前已裁定「用受著作權文本訓練 AI」屬合理使用,但此案的爭點是「盜版取得」而非「訓練行為」。Anthropic 選擇和解而非上訴,未建立具約束力的判例。

  • 法院認可訓練是合理使用——賠的是「盜版取得」,不是「訓練」
  • 50 萬部 × 3,000 美元 = 15 億,據報導為美國著作權史上最大和解
  • 未立判例,但替產業標了價——資料來源不乾淨的隱性風險以億計

💡 為什麼重要:即使法律上站得住腳,經濟成本正成為 AI 訓練資料的主要制約;資料來源合規將是模型公司的硬指標。

🔗 閱讀原文 | 來源: TechCrunch

8. Morning Brew 創辦人:用 Claude 打造永不枯竭的內容機器#

Tenex 共同創辦人 Alex Lieberman 在 Lenny 的 Podcast 拆解他用 Claude 搭的六步驟內容系統:先用「Oracle」掃描 Slack、Notion、Gmail 找出每天約 15 個內容靈感,再透過 AI 訪談挖出他的真實想法,用 Markdown 檔案編碼個人風格,最後交給「Writer’s Council」評分修訂,一步步避免產出淪為 AI 套路的空洞內容。

  • Oracle 每天從既有工作流自動撈 15 個靈感——解決「不知道寫什麼」
  • 用 Markdown 風格檔 + AI 訪談,把「個人語氣」編碼進流程
  • 編輯委員會評分機制,專治 AI 內容的「slop 感」

💡 為什麼重要:這是一套可複製的個人內容生產系統範本,重點不在「叫 AI 寫」,而在「用流程把你的判斷與語氣鎖進去」。

🔗 閱讀原文 | 來源: Lenny’s Newsletter

9. 資料中心用電量 2035 年將增 4 倍,佔全美 1/5#

BloombergNEF 預測美國資料中心用電量到 2035 年將增長 4 倍,屆時佔全美發電量 1/5(近 200 GW 容量),其中近半新增容量用於 AI 訓練與推論。區域電網已現極限壓力:PJM(維吉尼亞-伊利諾)已暫停新連線申請、電價年增 76%;德州 ERCOT 22% 容量被資料中心承諾。全球資料中心 2035 年電力需求上看 1,935 TWh,約等同印度全國年用電量。

  • 2035 年佔全美發電 1/5、近 200 GW,較去年 12 月預測高 83%
  • PJM 已暫停新連線、電價年漲 76%,電網成 AI 成長的硬瓶頸
  • 全球需求約等於印度全國年用電——AI 擴張與淨零目標的衝突逼近

💡 為什麼重要:AI 的隱藏成本是電力基礎設施,2027–2028 電網瓶頸可能反過來限制模型擴張速度。

🔗 閱讀原文 | 來源: TechCrunch

10. Import AI 465:開源與閉源的網安差距正在縮小#

英國 AI 安全研究院分析發現,GLM-5.2、DeepSeek V4-Pro 等開源模型在網路安全能力上與頂尖閉源模型的差距,已從過去的 6–10 個月縮短到 4–7 個月;但在需要串連多項能力的長流程駭客任務上,開源模型的落後幅度仍較大。

  • 開源與閉源的網安能力差距,從 6–10 個月縮到 4–7 個月
  • 單點能力接近,但「長鏈條複雜任務」開源仍明顯落後
  • 與今天 Kimi K3 逼近 Fable 的敘事互相印證——差距在收斂

💡 為什麼重要:開源模型的能力追趕正在提速,也讓「該不該管制前沿模型」的政策辯論更棘手。

🔗 閱讀原文 | 來源: Import AI

11. Roblox 押注世界模型,讓遊戲走向照片級真實#

Roblox 尖峰同時在線曾達 4500 萬,工程副總 Anupam Singh 分享團隊如何讓「影片世界模型」與既有遊戲引擎協同運作,在不犧牲多人連線效能與規模的前提下,讓創作者做出的遊戲更接近照片級真實感。

  • 世界模型不是取代引擎,而是與既有引擎協同
  • 挑戰在於維持 4500 萬同時在線的多人效能與規模
  • 目標是把「照片級真實」交到一般創作者手上

💡 為什麼重要:世界模型從研究論文走向大規模消費級產品落地,是生成式 AI 進入即時互動場景的指標案例。

🔗 閱讀原文 | 來源: ByteByteGo

推薦閱讀#

社群熱門#

中文技術圈#

開源精選 — GitHub Trending(本週)#

lopopolo/harness-engineering — Python | ⭐ 1.5K 一套關於「harness engineering」的選集、實戰指南與 agent context bundle。

tandpfun/wardrobe — JavaScript | ⭐ 1.3K 用 gpt-image 把你的衣服辨識、萃取並整理成數位衣櫥。

pablostanley/yoinks — TypeScript | ⭐ 957 在終端機一鍵抓取任何影片,沒有惱人廣告。

v-modal/vmodal_sdk_flutter — Dart | ⭐ 774 Modal AI 的 Flutter SDK,隨處搜尋任何內容。

Blaizzy/nativ — Swift | ⭐ 610 原生於 Mac 的本地 AI:聊天、部署、監控、連接 MLX 模型。

Vincentwei1021/video-shotcraft — TypeScript | ⭐ 411 給 Claude Code / Codex 的 AI 影片技能,用 Remotion 做電影感產品影片。

影音精選#

估值120億美元新創終於交作業:Inkling 模型登場#

~40 小時前 · Fireship

Fireship

Mira Murati 的 Thinking Machines 募了 20 億卻遲遲沒產品,終於開源 Inkling:9700 億參數 MoE、每 token 僅啟動約 410 億參數、支援百萬 token 上下文、Apache 授權。但跑分只排開源模型中段,隔天就被 Moonshot 2.8 兆參數的 Kimi K3 搶走鋒頭。

  • 9700 億參數 MoE,訓練資料 45 兆 token(文字/圖像/音訊)
  • 完全開源、上架 Hugging Face、支援百萬 token context
  • 跑分落後 Fable 5 與 GPT-5.6,開源模型中僅屬中段

Claude Code 共同創辦人:老派工程技能現在更值錢#

~24 小時前 · Theo (t3.gg)

Theo

Theo 回應 Claude Code 共同創辦人 Boris 的觀點:過去花時間打磨 lint 規則、測試、環境自動化的工程師,在 AI 輔助開發時代反而更有價值,而非被淘汰。

  • lint、測試、環境自動化等基本功在 AI 時代升值
  • 貼文分兩種受眾:懷念寫程式樂趣的資深工程師、還沒用 AI 開竅的人
  • Theo 自述用 AI 寫程式後比過去更有創造力、更好玩

Tmux + Fable 組合:代理工作流省 35% token#

~45 小時前 · AI Jason

AI Jason

用小模型當「工人」、大模型當「協調者/顧問」來省 token。Devin 新的 Fusion harness(Fable 5 協調 + Sonnet 5 工人)號稱比純 Fable 5 便宜 35%。

  • 協調者模式比顧問模式省——顧問每次要重讀完整對話、無法用快取
  • 關鍵概念「sidekick」:子代理應是持續存在的 session,非一次性重啟
  • 呼應今天主軸——省成本靠「把任務分派給對的模型」

對話 Vincent Koc:OpenClaw 的反思與進化#

~32 小時前 · 硅谷101

硅谷101

WAIC 2026 現場專訪 OpenClaw 基金會首席架構師 Vincent Koc,回顧這個龍蝦吉祥物開源 Agent 專案如何從爆紅、退燒到下載量創新高。

  • 近期單週下載量達 400 多萬次,退燒後反而創新高
  • Vincent 從早期貢獻者到基金會首席架構師,累積逾 13000 個 PR
  • 核心觀點:保持開源是讓專案公平存續的唯一方式

Fireworks AI CEO 完整專訪:48 歲創業拿下 170 億估值#

~43 小時前 · 20VC

20VC

Fireworks AI 上週以 170 億美元估值募得 15 億,200 人團隊做到 10 億美元 ARR。創辦人 Lin Qiao 曾任 Meta、PyTorch 創始團隊,48 歲創業。

  • 170 億估值、200 人、ARR 已達 10 億(年底目標 20 億)
  • Lin Qiao 背景 Meta / PyTorch 創始團隊,48 歲才創業
  • 主持人僅 15 分鐘會議就決定投資 1000 萬美元

今日觀察#

今天最值得玩味的,不是又冒出幾個新模型,而是「發布」和「破口」竟然塞在同一天裡。Google 的 Gemini Flash 三連發、Kimi K3 用近 50 倍成本差逼近 Fable、Anthropic 內部 65% 的 PR 交給 Claude——這些都在說同一件事:把智慧接進工作流,門檻正在快速崩塌。但同一天,GhostWriter 用 98% 的成功率示範怎麼把後門種進 AI 的記憶、Gemini 在 Android 上被抓到免解鎖發簡訊、Anthropic 為盜版訓練資料賠了 15 億——這些又在說另一件事:當智慧被塞進手機、記憶、結帳流程的每一道縫,它能出錯、被騙、被告的地方也跟著暴增。過去一年我們一直在追「模型有多強」,但雅可比猜想那則新聞其實藏了答案——真正推翻猜想的是數學家,Claude 只是很好的推理夥伴。或許對每個正在把工作交給 AI 的人來說,接下來要練的不是「怎麼讓它做更多」,而是「當它做錯、被鑽漏洞的時候,我這關擋不擋得住」。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有