yii.
← Digest
EP138 · 2026年7月19日 星期日 · 13 min read

頭條在證數學,工地在鋪水電

大家都在轉「AI 解開三十年數學難題」,但翻開論文,人做的事比標題多得多

每天花 1% 的時間,掌握科技脈動。

今日金句#

“The proof in this note is entirely due to GPT 5.6 Sol Ultra and the writeup with Codex (with GPT 5.6 Sol).”

「這份筆記中的證明完全出自 GPT-5.6 Sol Ultra,撰寫過程則由 Codex 協助完成。」

— OpenAI,官方論文〈A Proof of the Cycle Double Cover Conjecture〉的「AI 使用聲明」

“When the headline model on your plan can be switched off because the economics don’t work, the plan was never really selling you the headline model.”

「當你方案裡的旗艦模型可以因為帳算不過來就被關掉,那這個方案從來就不是在賣你那個旗艦模型。」

— Stephen Bochinski,開發者、〈The Kimi K3 Moment〉作者

“They might not have protected the utility or integrity of their knowledge base, but they sure protected the integrity of a bunch of people’s egos.”

「他們或許沒保住知識庫的實用性跟完整性,但他們確實保住了一群人的自尊心。」

— DrewADesign,Hacker News 留言,談 Stack Overflow 的審核文化

今日主軸:頭條在證數學,工地在鋪水電#

今天最大聲的新聞是 AI 證出了三十年沒人解開的數學問題,但把 arXiv 2607.13335 點開會發現,作者 Phillip Kerger 押了一年的研究筆記、跟模型合寫了一份十頁的前置提示、最後自己用 Lean 驗過一遍——這跟「丟一句話給 AI 就有答案」是兩件完全不同的事。而在這條頭條的音量之下,今天真正在動工的是另一層:ByteByteGo 拆解 MCP、A2A、ACP 三種 agent 通訊協定的差別,1Password 推出讓 Claude 能登入網站、但全程看不到密碼的機制,arXiv 一口氣冒出 MemoHarness、ToolAnchor、sandbox-native RL 這排講 agent 記憶與工具的論文,ProductHunt 當日前三名清一色是 agent 的資料層、沙箱與協作編輯器。同一天,Stack Overflow 的活躍度被人算出剩不到巔峰的百分之一——舊的知識管線正在關掉,新的還在挖溝埋管。模型有多聰明已經是去年的題目,今年的題目是:它的認證、記憶、沙箱、權限邊界,誰來鋪。

必讀#

  1. AI 補上收斂最佳化卡了 30 年的缺口,但人先押了一年 — arXiv AI
  2. Anthropic 讓 Fable 5 回歸訂閱方案,取消退場計畫 — Simon Willison AI
  3. The Kimi K3 Moment:當旗艦模型可以被關掉 — 個人部落格 AI
  4. MCP vs A2A vs ACP:AI Agent 之間到底怎麼溝通 — ByteByteGo Dev
  5. 一張圖看 AI 對 Stack Overflow 做了什麼 — Hacker News AI
  6. 把一台備用 Mac 交給 Claude Code 全權操控 — 技術教學 AI
  7. 1Password 替 Claude 加上受控登入,AI 登得進去卻看不到密碼 — iThome Dev
  8. Fable 5 對決 GPT-5.6 Sol 解 NP-hard,/goal 幫倒忙 — 個人部落格 AI
  9. NPM 套件 Jscrambler 被入侵,3 小時內連發 4 個惡意版本 — iThome Dev
  10. Regressive JPEG:把 90 張畫面藏進一個 JPG — 個人部落格 Tools

1. AI 補上收斂最佳化卡了 30 年的缺口,但人先押了一年#

這則新聞在社群上被轉成「GPT-5.6 用一句 prompt 解開三十年數學難題」,但實際情況更細緻,而且更值得看。數學家 Phillip Kerger 處理的是無導數收斂最佳化的 oracle 複雜度問題:已知下界是 Ω(d),而 Protasov 在 1996 年給出的上界是 O(d²log²d),中間的空隙從此沒人補上。Kerger 用 GPT-5.6 Sol 證出新的 Ω(d²/log(d+1)) 下界,在多對數因子的誤差內把這個缺口關掉,論文 36 頁掛在 arXiv。要注意的是,這跟 OpenAI 自己在 7/10 宣布的「循環雙覆蓋猜想」證明是兩件不同的事,標題把它們混在一起了。

  • 模型的角色:Kerger 說整個推理是模型在一次約 2.5 小時的自主工作階段完成的,他中途沒有介入,事後自己用 Lean 驗證
  • 人的角色:他投入了一年的既有研究筆記,並與 GPT-5.6 Sol 共同起草一份十頁的前置提示,才餵進去
  • 社群質疑:兩份證明在發表當下都尚未通過同儕審查;有人指出沒人揭露試了幾次才成功,存在倖存者偏差
  • 另一條線:OpenAI 的循環雙覆蓋猜想證明只有 3 頁,被質疑對一個數十年的老問題來說短得可疑,Lean 形式化像是事後補的

💡 為什麼重要:這件事真正的訊號不是「人類不需要了」,而是門檻位移了——模型能把一個專家一年的累積壓縮成一次兩個半小時的衝刺,但那一年還是得有人先押進去。對開發者來說,值得練的是怎麼把自己的領域知識整理成模型能吃的前置脈絡,那才是新的槓桿點。

🔗 閱讀原文 | 來源: arXiv

2. Anthropic 讓 Fable 5 回歸訂閱方案,取消退場計畫#

Anthropic 宣布自 7 月 20 日起,Fable 5 重新納入所有 Max 與 Team Premium 方案(額度打五折),Pro 與 Team Standard 用戶可用點數使用並獲得一次性 100 美元額度。原本 Anthropic 打算把 Fable 5 收回、改走純 API 計價,這次等於直接推翻自己的規劃。Simon Willison 認為這是被 GPT-5.6 Sol 與 Kimi K3 的競爭壓力逼出來的決定。值得注意的是,20 美元的入門月費方案仍然不含 Fable 5。

  • 政策反轉幅度大:從「旗艦模型要退出訂閱」變成「重新納入且補發 100 美元額度」,中間只隔了很短的時間
  • Simon Willison 的質問點在訂閱制的基本邏輯:付 100 到 200 美元的方案,結果不含這家公司最好的模型
  • 入門方案(20 美元)依然被排除在外,分層策略沒有改變

💡 為什麼重要:當各家模型能力逐漸拉平,訂閱方案就不能再靠「獨佔旗艦模型」來撐溢價。對重度使用者的實際意義是:選方案前先確認旗艦模型在不在裡面,以及那個「在」能維持多久。

🔗 閱讀原文 | 來源: Simon Willison

3. The Kimi K3 Moment:當旗艦模型可以被關掉#

這篇跟上一則是同一天的一體兩面。作者實測後認為 Kimi K3 在同樣的寫程式任務上輸出品質與 Claude 相當,但 API 定價是每百萬 token 3/15 美元,對比 Claude 的 10/50 美元,差距相當大。加上它是可下載的開源權重模型,能在本地部署,且沒有那些會讓資安類請求被拒答的限制類別。作者由此推出一個更尖銳的論點:當你方案裡的旗艦模型可以因為經濟不划算就被關掉,那個方案本來就不是在賣你旗艦模型。

  • 成本差距:3/15 對 10/50 美元每百萬 token,用量大的工作流差異會被放大
  • 開源權重可下載、可本地部署,不受單一供應商的政策變動影響
  • 作者指出限制較少的模型在資安類任務上反而更好用,這是閉源模型的結構性劣勢

💡 為什麼重要:這篇文章跟 Anthropic 的政策反轉放在一起看才完整——一邊是供應商發現旗艦模型收不回去了,一邊是使用者發現自己其實有得選。訂閱制的議價權正在轉移。

🔗 閱讀原文 | 來源: 個人部落格

4. MCP vs A2A vs ACP:AI Agent 之間到底怎麼溝通#

ByteByteGo 這期把三個容易混淆的 agent 通訊協定拆開講清楚。MCP 處理的是 agent 與工具之間的溝通:host 應用透過 MCP client 把請求路由給 MCP server 執行,拿回結構化結果,方向是單向的(agent → 工具)。A2A 處理的則是 agent 與 agent 之間的溝通,透過 Agent Card 做服務發現,支援雙向、可在任務中途暫停的協調流程。ACP 是較早的 REST-based 前身,已經併入 A2A。

  • MCP 單向、A2A 雙向,這個差別直接決定你能不能做「任務中途暫停等另一個 agent 回覆」這種流程
  • ACP 已經被 A2A 吸收,新專案不用再考慮
  • 生產環境的正解通常是兩個都用:MCP 接工具與資料庫,A2A 接多個專職 agent 之間的協調

💡 為什麼重要:多 agent 系統開始進生產環境之後,協定選擇會直接影響吞吐、延遲跟故障模式。這篇適合在架構還沒定案前先看,比事後重構便宜太多。

🔗 閱讀原文 | 來源: ByteByteGo

5. 一張圖看 AI 對 Stack Overflow 做了什麼#

有人把 Stack Overflow 歷年的每月提問量拉成一張圖丟上 Hacker News,引發四百多則留言的爭論。按討論串中的計算,高峰期約每月 20.7 萬題,近期只剩約 1,226 題,等於掉了 99.4%。但留言區的重點不在數字,而在歸因:曲線早在 2014 年就開始下滑,遠早於 ChatGPT,2022 年 11 月之後才變成斷崖。所以到底是 AI 殺的,還是它自己先病了。

  • 反 AI 歸因的一方指出:問題被隨手標為重複而關閉、聲望機制鼓勵挑錯字、新手被勸退,社群文化早就在流血
  • 支持 AI 歸因的一方指出:2022 年 11 月後的下墜斜率跟之前完全不同量級
  • 較持平的看法是雙重死因:先被審核文化削弱,再被 AI 直接回答補上最後一刀
  • 商業層面:Stack Overflow 轉向 SEO 導流的商業模式,遇上 AI 直接給答案、不導流,正好打在要害

💡 為什麼重要:這是一個社群治理的案例研究,而不只是 AI 新聞。對任何靠使用者貢獻內容的產品來說,這張圖的教訓是:技術衝擊來的時候,你的社群健康度決定你撐不撐得住。

🔗 閱讀原文 | 來源: Hacker News

6. 把一台備用 Mac 交給 Claude Code 全權操控#

一份相當實際的教學,處理的是「想讓 AI agent 有完整系統權限,又不想它碰到我的個人資料」這個矛盾。作法是拿一台備用 Mac 重灌,開一個純本機帳號(不登 Apple ID、沒有任何個人資料),設定 SSH 金鑰登入與剪貼簿同步,用常駐 tmux 承接 computer use,把 Claude Code 裝在這台隔離機器上。搭配 Tailscale 之後,可以從手機或其他機器透過單一 SSH 通道下指令。

  • 隔離的核心是資料面而非權限面:權限給滿,但機器上根本沒有值得損失的東西
  • 需要開 Full Disk Access、螢幕錄製、輔助使用三項權限,並關閉睡眠以維持常駐
  • 作者自己也直說,開著跳過權限確認的旗標跑 Claude Code 本身就帶有風險,隔離環境是為了讓這個風險可承受

💡 為什麼重要:這其實是 agent 時代的一個安全設計模式雛形——與其在權限上綁手綁腳,不如把 agent 放進一個「爆炸了也不痛」的環境。想認真讓 agent 跑長任務的人,這套隔離思路值得先建起來。

🔗 閱讀原文 | 來源: 技術教學

7. 1Password 替 Claude 加上受控登入,AI 登得進去卻看不到密碼#

1Password for Claude 讓 Claude 在使用者授權下登入網站,但密碼與一次性驗證碼不會進入模型上下文或 Anthropic 系統。憑證由 1Password 保管,登入時由瀏覽器擴充功能直接填入網站;Claude 只拿得到項目標題、使用者名稱或電子郵件、以及操作成功或失敗的狀態。每次憑證請求都需要使用者核准,核准範圍只限該次代理工作階段,新工作階段必須重新授權,且憑證只能填入與記錄網址相符的頁面。

  • 自動填寫與送出期間,Claude 會被暫停讀取頁面,避免從畫面上把密碼看走
  • 送出失敗時 1Password 會先清除已填入的資料再回傳結果
  • 目前僅在 Mac 推出,支援帳密與一次性驗證碼,尚不支援通行密鑰
  • 責任分界講得很清楚:1Password 只負責憑證的儲存、授權、傳送與填入,登入之後 agent 在網站上做了什麼,是 Claude 那邊的事

💡 為什麼重要:這是第一個認真為 AI agent 設計的受控登入機制,解掉了「agent 要幫你操作網站,但你不能把密碼交給模型」這個死結。想在企業環境部署 agent 的人,這種「憑證與模型分離」的架構會是接下來的標配。

🔗 閱讀原文 | 來源: iThome

8. Fable 5 對決 GPT-5.6 Sol 解 NP-hard,/goal 幫倒忙#

作者拿 2018 年一場黑客松的 KIRO 題目(光纖網路佈線最佳化,NP-hard)來實測兩個模型,順便測 /goal 這種持久化功能到底有沒有用。結果 Fable 5 平均 32,386、全距只有 319,明顯優於 GPT-5.6 Sol 的平均 34,261、全距 1,958(此題分數越低越好)。更有意思的是 /goal 的弔詭之處:它在六次個別測試裡贏了四次,卻讓兩個模型的平均表現都變差。

  • Fable 5 不只平均更好,變異數也小得多,作者形容為「異常的一致性」
  • /goal 贏了多數單次測試卻拉低平均,因為持久化會同時放大好決策與壞決策
  • 兩家的 /goal 名字一樣但架構完全不同:Claude 用獨立評估器審查歷程,Codex 則是給生命週期工具搭配持久狀態

💡 為什麼重要:這是少見會去看「平均」而非「最佳單次」的模型評測。實務上的提醒很直接:用這類持久化功能跑最佳化任務時,要看整體平均有沒有變差,別被最好的那次騙了。

🔗 閱讀原文 | 來源: 個人部落格

9. NPM 套件 Jscrambler 被入侵,3 小時內連發 4 個惡意版本#

JavaScript 程式碼保護工具 Jscrambler 的 NPM 套件在 7 月 11 日遭供應鏈攻擊,攻擊者在 3 小時內連續發布 4 個惡意版本(8.16.0、8.17.0、8.18.0、8.20.0)。開發者安裝後,注入的掛鉤會依作業系統平臺,透過混淆處理的容器載入 Windows/macOS/Linux 專屬的二進位檔,最終植入以 Rust 撰寫的竊資軟體。資安公司 Socket 在首個惡意版本上傳後 6 分鐘就偵測到,Jscrambler 團隊隨後上傳未受感染的版本。

  • 短時間內連發多個版本是刻意的規避手法,讓單一版本下架來不及止血
  • 竊資軟體用 Rust 寫成,跨三大平臺都有對應的二進位檔
  • 修復方式:更新至 8.22.0 以上並固定版本;曾誤裝受影響版本的機器需重新驗證並輪換 API key
  • 時間點很諷刺:事件發生在 GitHub 7 月 8 日發布 NPM 安全改版(預設關閉高風險自動執行行為)僅 3 天後

💡 為什麼重要:安全改版剛上路就被繞過,說明防禦紅利的窗口很短。實務上該做的還是老三樣:鎖定版本、開啟發布端 2FA、把 CI 當成會被投毒的環境來設計。

🔗 閱讀原文 | 來源: iThome

10. Regressive JPEG:把 90 張畫面藏進一個 JPG#

這篇玩的是漸進式 JPEG 的規格特性。漸進式 JPEG 會把影像拆成多個掃描段(scan),每段包含不同的頻率成分,讓瀏覽器先顯示低解析預覽再逐步補細節。作者發現只要把多張圖串接起來、在十六進位編輯器裡濾掉各自的起訖標記,就能讓「逐步載入」的過程實際上放出不同的畫面。用只含 DC 成分的掃描段(本身是合規影像)可以塞進約 90 張畫面,才會撞到瀏覽器放棄解析的上限。

  • DC-only 掃描段解析度只有原圖的十六分之一,但每張畫面只需一段,密度最高
  • 用 jpegtran -scans 搭配掃描參數檔就能產生,不需要特製工具
  • 瀏覽器普遍在約 9 段後停止解析以防「zip bomb」式攻擊,Chrome 約可撐到 90 段

💡 為什麼重要:沒有什麼實際用途,作者自己也這樣說。但它是很好的提醒:只要格式規格裡有「漸進」這種狀態機,就會有人拿它做出規格作者沒想過的事。做圖片處理管線的人可以順手想一下,自己的服務對這種輸入是怎麼反應的。

🔗 閱讀原文 | 來源: 個人部落格

推薦閱讀#

中文技術圈#

開源精選#

xai-org/grok-build — Rust | ⭐ 18,687 xAI 開源的 coding agent 框架與 TUI,全螢幕、支援滑鼠互動、可擴充。

Fei-Away/Codex-Dream-Skin — JavaScript | ⭐ 9,726 Codex 的介面主題套件。

CluvexStudio/Aether — Rust | ⭐ 1,253 網路審查規避通道。

pixel-point/aval — TypeScript | ⭐ 1,208 網頁互動影片的開源格式,內建狀態機、影格精準轉場與 alpha 透明通道。

littledivy/mimic — Python | ⭐ 1,167 攔截任何應用程式,然後像呼叫函式庫一樣從 Python 呼叫它。

tandpfun/wardrobe — JavaScript | ⭐ 1,047 用 gpt-image 把你的衣服萃取出來並分類整理。

oil-oil/beautify-github-readme — Python | ⭐ 810 用 SVG 標題與可維護的 Markdown 設計 GitHub README 首頁。

nethical6/conversation-steganography — Go | ⭐ 688 用 LLM 把訊息藏在看起來正常的對話裡。

Blueturboguy07/cue — JavaScript | ⭐ 543 開源 macOS AI 助手,浮在畫面上、能看能聽你的會議,且不會被螢幕分享錄到。

vshulcz/deja-vu — Go | ⭐ 364 coding agent 的記憶層:搜尋、MCP 回想、自動脈絡、機密遮蔽,單一零依賴執行檔。

影音精選#

Fable 5 對決 GPT-5.6:兩大前沿模型深度比較#

Theo (t3.gg)

Theo

Theo 終於公開比較 Fable 與 GPT-5.6 Sol 這兩個當紅前沿模型,指出社群對誰更強出現罕見的兩極分化。他每天在兩個模型上都花費數百美元的 token 用量,並分享自己與多位開發者朋友的實際使用心得。

  • 他每天在兩個模型上都燒掉數百美元 token,稱這幾週的建構產出量是有史以來最高
  • Solid.js 作者 Ryan Carniato 力挺 Fable:能在未被提示的情況下主動指出潛在問題,其他模型則會過度自信地給出錯誤答案
  • Theo 最終結論偏向 Fable,但強調兩者互有優劣,會依任務類型持續同時使用

Kimi K3 評測:開源模型首次追上前沿水準#

Theo (t3.gg)

Theo

Theo 實測新發布的開源權重模型 Kimi K3,認為這是開源陣營首次真正逼近、甚至部分超越 GPT-5.6 Sol 與 Fable 的水準。他花了一整天用它進行實際編碼工作,也點出開源、無限制高能力模型帶來的資安隱憂。

  • Kimi K3 在多項 benchmark 上打平甚至超越 GPT-5.6 Sol 與 Fable,是開源權重模型首次逼近前沿
  • 實測一整天寫程式,肯定其真實編碼能力,但仍有一些「粗糙邊角」需要繞過
  • 高能力且無限制的開源權重模型,在長任務中 orchestrate 大量 sub-agent 時帶來新的資安疑慮

蘋果控告 OpenAI 竊取商業機密#

Fireship

Fireship

Apple 對 OpenAI 提起 41 頁訴訟,指控其硬體業務涉及商業機密竊取,訴狀點名 OpenAI 收購的 io 新創與兩名前 Apple 員工。Fireship 用一貫的快節奏梳理這場訴訟的關鍵指控,以及 OpenAI 神秘家用裝置的傳聞細節。

  • Apple 指控 OpenAI 硬體業務「從骨子裡腐敗」,訴狀點名前 Apple 副總裁、現任 OpenAI 硬體長 Tang Tan
  • OpenAI 以 65 億美元收購 Jony Ive 的新創 io,據傳正打造一款無螢幕、可自主移動的家用智慧喇叭
  • 訴狀稱 Tang Tan 曾要求應徵面試者攜帶 Apple 原型零件展示,並提供招募用的「作弊表」教導挖角話術

SK 海力士崛起史:財閥爭鬥與 HBM 如何卡住全球 AI 命脈#

硅谷101

硅谷101

硅谷101 梳理 SK 海力士從紡織廠一路變身韓國第二大財閥、又靠 HBM 技術卡住全球 AI 算力命脈的崛起史,中間穿插政府強推合併、瀕臨被美光收購等情節,最後探討 AI 熱潮能否真正打破存儲行業的周期魔咒。

  • SK 海力士 7/10 以 ADR 形式在納斯達克掛牌,融資 265 億美元,刷新阿里巴巴保持十餘年的海外 IPO 紀錄
  • 前身現代電子 1998 年在政府施壓下強行合併 LG 半導體,2002 年一度瀕臨被美光以換股方式收購
  • 靠 HBM 卡住 AI 算力的「內存牆」瓶頸,目前全線產品漲價、產能售罄,黃仁勳半年內四度會見 SK 集團掌門人崔泰源求貨

World Models、JEPA 與樣本效率強化學習之路#

Y Combinator

Y Combinator

YC Decoded 深入討論「樣本效率」為何是 AI 尚未解決的最大問題之一,並解析世界模型與 JEPA 架構為何被視為通往 AGI 的關鍵路徑。從西洋棋、圍棋到自駕車,節目層層拆解動作空間爆炸如何讓機器人問題遠比棋類遊戲困難。

  • 定義兩大待解問題:「每瓦智慧」與「每樣本智慧」,AI 在後者遠不如人類,人類常只需數次嘗試就能學會新技能
  • 以西洋棋/圍棋(有限動作空間,蒙地卡羅樹搜尋可行)對比自駕車(動作空間近乎無限),說明為何機器人問題遠比棋類棘手
  • JEPA 與潛在空間技巧被視為打造可用世界模型、邁向樣本高效學習的關鍵路徑

從 7 到 7,000 名員工:Curative 創辦人完整專訪#

20VC

20VC

20VC 專訪 Curative 創辦人 Fred Turner:從英國赴矽谷創業,靠疫情把 COVID 檢測業務衝上 50 億美元營收,如今轉型為估值 13 億美元的健康保險新創,並大談用 AI agent 取代整個後勤部門的心得。

  • 疫情期間從 7 人衝到 7,000 人只花 9 個月,單日檢測量達 20.6 萬人次,營收一度衝上 50 億美元
  • 疫情退燒後轉型健康保險,今年砍掉約 80% 的 SaaS 支出、以 AI agent 取代部分後勤部門
  • 19 歲從英國赴矽谷創業,直言英國缺乏願意投資年輕創業者的創投生態

社群熱門#

Tech With Tim

今日觀察#

今天最值得玩味的不是那條「AI 解開三十年數學難題」的頭條,而是它跟另一件事同時發生:Stack Overflow 的提問量被算出剩不到巔峰的百分之一。一邊是 AI 在生產人類還沒有的新知識,一邊是人類累積了十五年的公共知識庫在關燈,而後者的死因,留言區吵到最後其實指向了自己——早在 ChatGPT 出現前八年就開始的下滑,是被那套動輒關閉問題的審核文化趕跑的。更安靜的是第三件事:ByteByteGo 在拆 agent 協定、1Password 在做讓模型看不到密碼的登入、arXiv 冒出一整排 agent 記憶與沙箱的論文、ProductHunt 前三名全是 agent 的水電。知識的生產端跟消費端都在換管線,而換管線的工程沒有人會下標題。如果你今天只想記住一件事:模型再聰明,最後決定它能不能真的替你做事的,是你願意給它多少權限、以及你有沒有能力在它闖禍時止血——而那件事,還是得你自己蓋。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有