yii.
← Digest
EP121 · 2026年7月1日 星期三 · 8 min read

巨頭發布日,與一道看不見的浮水印

每天花 1% 的時間,掌握科技脈動。

模型越來越便宜,但「信任」變貴了。Anthropic 同日推出 Sonnet 5+Claude Science,開發者卻在討論它偷偷做的記號。

今日金句#

“This is prompt steganography — a technique used to hide data in plain sight. The visible sentence still reads like a normal date. The model and the user see something boring. The raw request contains a marker.”

「這是 prompt steganography(提示詞隱寫術)—— 一種把資料藏在眼前的技術。那句話讀起來就是個普通日期,模型和使用者看到的都很無聊,但原始請求裡藏了一個記號。」

— thereallo,逆向工程 Claude Code binary 的安全研究者

今日主軸:發布日的兩個故事#

2026 年 6 月 30 日是 Anthropic 的大日子:一口氣推出 Claude Sonnet 5(效能逼近 Opus 4.8、定價卻維持 Sonnet 等級),加上專為科學家打造的 Claude Science 工作台。Google 也同日反擊,丟出 Nano Banana 2 Lite + Gemini Omni。模型更強、更便宜、更專業化,這條主線一如往常。

但開發者社群討論最熱的,不是 benchmark。一位安全研究者逆向 Claude Code binary,發現它會依據你的 API base URL 和時區,悄悄改寫系統提示裡「Today’s date」這句話的撇號(四種 Unicode 變體)和日期分隔符號 —— 其中 Asia/Shanghai、Asia/Urumqi 時區會被特別標記。同一時間,V2EX 上一片「Claude Code Max 剛衝完就被封號」的哀嚎,阮一峰也自曝帳號因地區被封。當工具越來越深入你的工作流,今天真正值得記住的問題或許是:你信任的這個助手,正在你看不見的地方,記錄著關於你的什麼?

必讀#

  1. Claude Sonnet 5 發布:逼近 Opus 4.8,定價不變 — Anthropic AI
  2. Claude Code 正在用隱寫術替請求做記號 — HN AI/Privacy
  3. Claude Science:給科學家的 AI 工作台 — Anthropic AI
  4. 走訪 OpenAI、Anthropic、Cursor:雲端 agent 是下一站 — Pragmatic Engineer Dev
  5. Google 反擊:Nano Banana 2 Lite + Gemini Omni — Google AI
  6. Gusto:無 Figma、無 Jira,10 週用 Claude Code 做出新產品線 — Lenny Product
  7. Nvidia 對手 Etched 估值 $5B、$1B 推理晶片訂單 — TechCrunch Startup
  8. GLM-5.2 實測:開放權重模型能取代 Claude Opus 嗎? — Lenny AI
  9. Meta Brain2Qwerty v2:腦波解碼準確度大躍進 — 科技新報 AI
  10. Amazon 成立 $10 億 FDE 部門,跟進 OpenAI、Anthropic — TechCrunch Startup

1. Claude Sonnet 5 發布:逼近 Opus 4.8,定價不變#

Anthropic 推出「史上最具代理能力的 Sonnet」,在高 effort 設定下可匹敵 Opus 4.8,中 effort 時成本效益更佳。推介期(至 8/31)定價 $2/$10 每百萬 token,之後升至 $3/$15。已成為 Free/Pro/Max/Team/Enterprise 預設模型。

  • 不再支援 temperature/top_p/top_k 參數,預設開啟 adaptive thinking,上下文視窗達 100 萬 token
  • 幻覺率下降、對 prompt injection 抵抗力提升、預設啟用網路保護
  • Simon Willison 實測指出新分詞器讓相同輸入多產生約 30% token,等於變相漲價 30%

💡 為什麼重要:企業終於能用 Sonnet 的價格拿到接近 Opus 的能力,但「分詞器膨脹」這個隱藏成本,提醒大家定價公告永遠要看實際 token 帳單。

🔗 閱讀原文 | 來源: Anthropic

2. Claude Code 正在用隱寫術替請求做記號#

一位安全研究者逆向 Claude Code 2.1.196 binary,發現它會根據 ANTHROPIC_BASE_URL 與時區,在系統提示的「Today’s date」字串裡藏記號——撇號有四種 Unicode 變體('/'/ʼ/ʹ),中國時區(Asia/Shanghai、Asia/Urumqi)還會把日期的 - 換成 /。肉眼看就是普通日期,但原始請求帶有可辨識的指紋。

  • 標記依據「是否為已知 Anthropic 網域」「是否含 lab 關鍵字 host」「是否中國時區」三個維度組合
  • 典型用途是辨識第三方代理 / 逆向用途 / 特定地區流量
  • 與當天 V2EX、阮一峰的「帳號因地區被封」事件形成呼應

💡 為什麼重要:coding agent 能讀你的 repo、跑你的指令,它在請求裡藏什麼,就是你的隱私與掌控權問題。這是「客戶端值得被審視」的最佳案例。

🔗 閱讀原文 | 來源: thereallo

3. Claude Science:給科學家的 AI 工作台#

Claude Science 進入公開測試,把 PubMed、Jupyter、R 等碎片化工具整進單一平台,原生支援 3D 蛋白質結構、基因組瀏覽器、化學結構,可用自然語言編輯視覺化,並自動管理從筆電到 HPC/GPU 的運算資源。

  • 預配置基因體學、單細胞、蛋白質組學、結構生物學,串接 60+ 科學資料庫與 NVIDIA BioNeMo 模型
  • 內建 review agent 自動檢查引文準確度、計算錯誤、程式與圖表對齊
  • Allen Institute 案例把原本 2 年的文獻回顧縮短到數月

💡 為什麼重要:這是 AI 從「通用工具」走向「領域特定工作流」的訊號——贏家不是更大的模型,而是更貼合工作流程的整合。

🔗 閱讀原文 | 來源: Anthropic

4. 走訪 OpenAI、Anthropic、Cursor:雲端 agent 是下一站#

Pragmatic Engineer 作者實地走訪三家公司,發現它們不約而同把「雲端 agent」當成關鍵基礎設施。OpenAI 內部超過 95% 的非工程師用 Codex 而非 ChatGPT;Anthropic 投入半年做 Managed Agents;Cursor 推出 iOS app 支援遠端開發。

  • 三家獨立收斂到同一方向,代表這不是邊緣實驗而是產業轉折
  • Slack 整合的創新點在「消除設定摩擦」,而非整合本身
  • Coinbase 等公司開始精算「每個 token 的成本」,AI 支出管理成為平台工程新戰場

💡 為什麼重要:本地工具正逐步被雲端協調的 agent 取代,開發團隊該提前評估遷移策略與成本治理。

🔗 閱讀原文 | 來源: Pragmatic Engineer

5. Google 反擊:Nano Banana 2 Lite + Gemini Omni#

Anthropic 發布日同天,Google DeepMind 推出 Gemini 系列中最快、最便宜的圖像模型 Nano Banana 2 Lite(API 名 gemini-3.1-flash-lite-image),以及多模態的 Gemini Omni,並為 Gemini 3.5 Flash 加上電腦操作能力。

  • Simon Willison 實測 Nano Banana 2 Lite 生成品質優於前版,但仍有拼字錯誤
  • Gemini 3.5 Flash 取得自主操作電腦介面的能力,正面對標 computer-use agent
  • 主打成本與速度,瞄準大量內容生成的開發者場景

💡 為什麼重要:影像生成正在「降價平民化」,對做 app / 內容工具的開發者是直接的成本利多。

🔗 閱讀原文 | 來源: Google

6. Gusto:無 Figma、無 Jira,10 週用 Claude Code 做出新產品線#

Gusto CTO Eddie Kim 帶 3 名工程師 + 1 名設計師,拋棄所有傳統流程工具,10 週內從零打造 AI 產品 Gusto Cofounder 並上線。用 PR 取代規劃文件、永久 Zoom 取代站會與 Slack。

  • 設計師在不懂工程下達到 94th percentile 出貨量
  • 「垃圾桶法」——規格不寫文件,直接用 PR 迭代
  • 是把 AI 工具用到極致、重塑產品開發流程的真實案例

💡 為什麼重要:流程工具(Figma/Jira/站會)可能是被 AI 重構的下一個對象,PM 與設計師的角色定義正在鬆動。

🔗 閱讀原文 | 來源: Lenny

7. Nvidia 對手 Etched 估值 $5B、$1B 推理晶片訂單#

推理專用晶片新創 Etched 估值達 $50 億、累計募資 $8 億,已預訂 $10 億推理系統合約。投資者包含 Jane Street、Two Sigma,以及 Karpathy、Hinton、Fei-Fei Li 等 AI 研究者。

  • 專攻推理(成本中心)優化,提供客製晶片 + 整合推理叢集
  • 對手包含已 IPO 的 Cerebras、募資 $6.5 億的 Groq、各大廠自研晶片
  • 創辦人為哈佛輟學生 Gavin Uberti 與 Thiel Fellow Robert Wachen

💡 為什麼重要:推理成本是 AI 服務的命脈,若 Etched 順利交付,將直接挑戰 Nvidia 在推理市場的利潤。

🔗 閱讀原文 | 來源: TechCrunch

8. GLM-5.2 實測:開放權重模型能取代 Claude Opus 嗎?#

北京 Z.ai 的開放權重模型 GLM-5.2 在 SWE Bench Pro 上接近 Claude Opus 4.8,支援百萬 token 上下文、推理模式與函式呼叫。Lenny 實測在 Cursor、Claude Code 跑 45 分鐘自主除錯;當天 semgrep 的資安 benchmark 更顯示 GLM-5.2 在實際程式安全任務上勝過 Claude。

  • 開放權重模型已具備生產環境替代能力
  • 自架的控制權與成本優勢,成為對閉源模型的談判籌碼
  • 與「Claude 封號 / 區域限制」議題形成對照——可自架就不怕被斷

💡 為什麼重要:開放權重正在從「玩具」變成「備援方案」,這對被供應商鎖定風險敏感的團隊是關鍵選項。

🔗 閱讀原文 | 來源: Lenny

9. Meta Brain2Qwerty v2:腦波解碼準確度大躍進#

Meta 公布 Brain2Qwerty v2 模型,大幅提升非侵入式腦波即時文字解碼準確度,並開放訓練程式碼。

  • 朝「想打字就打字」的腦機介面再進一步
  • 開放訓練程式碼,利於學界複現與延伸
  • Latent Space 也在 AI Engineer World Fair 報導同一進展

💡 為什麼重要:非侵入式 BCI 一旦準確度過關,輸入方式的下一場革命將不只是語音。

🔗 閱讀原文 | 來源: 科技新報

10. Amazon 成立 $10 億 FDE 部門,跟進 OpenAI、Anthropic#

Amazon 設立 $10 億規模團隊,把工程師派駐到客戶公司內部,快速部署客製 AI agent,複製 OpenAI、Anthropic 的 Forward Deployed Engineer 模式。

  • FDE(前進部署工程師)成為大廠搶 AI 落地的標準打法
  • 競爭重點從「模型多強」轉向「誰能幫客戶真正用起來」
  • 對 SI/顧問業是機會也是壓力

💡 為什麼重要:模型趨同後,落地服務與客戶嵌入能力成為新護城河。

🔗 閱讀原文 | 來源: TechCrunch

推薦閱讀#

大神動態#

  • Simon Willison:當天連發 Sonnet 5、Nano Banana 2 Lite、Ornith-1.0、shot-scraper video 多篇實測(詳見必讀 #1、#5)
  • Andrej Karpathy:以投資者身分出現在 Etched $5B 名單(詳見必讀 #7);其「Slack bot 就是多人協作」的舊願景被 Theo 影片重新肯定
  • Dario Amodei:主張「AI 開源」是偽命題、應只看模型好不好;阮一峰強烈反駁(詳見中文技術圈)

社群熱門#

中文技術圈#

開源精選#

deepseek-ai/DeepSpec — Python | ⭐ 5.2K 訓練與評測投機解碼(speculative decoding)演算法的全棧程式庫。

CopilotKit/OpenTag — TypeScript | ⭐ 462 CopilotKit 推出的開源標註 / 標籤工具。

tdeverx/contained-app — Swift | ⭐ 430 為 Apple Container CLI 打造的原生 macOS App。

影音精選#

我一直用錯方式餵 coding agent context#

1d · AI Jason

AI Jason

Codebase Memory MCP 以 C/C++ 建構,索引普通專案僅需數秒,Linux kernel 也只要 3 分鐘。把程式庫轉成函數/類別關係圖,agent 精準掌握「改這會動到哪」,token 消耗降低近 50%。

  • 解決傳統 grep 搜尋讓 agent 讀太多無關檔案的根本問題
  • 適合 Cursor / Claude Code 使用者,可下載即用

為何 OpenAI 模型如此高效?Grug 語言理論揭秘#

1d · Theo (t3.gg)

Theo

從洩露的推理追蹤發現「Grug 語言」現象:GPT-5.5 medium 僅用約 20K token 就超越 Opus 4.8 在 50K token 的表現。深入探討 token 使用效率如何影響輸出品質。

  • token 使用效率直接影響模型輸出品質與智能表現
  • 對成本敏感的 agent 任務尤其關鍵

GitHub 不是真正的多人協作方案#

1d · Theo (t3.gg)

Theo

主張 Claude 在 Slack 頻道裡能達到真正的多人協作——任何人都能看到它在做什麼並接手對話,相較之下 GitHub 的協作體驗緩慢又不穩定。

  • 重新肯定 Karpathy「Slack bot 就是多人協作」的願景
  • 把「協作」的定義從 PR review 拉回即時可見

OpenAI 發布 GPT-5.6,卻幾乎沒人能用#

18h · Matt Wolfe

Matt Wolfe

OpenAI 預覽 GPT-5.6 的三層模型架構(Sol/Terra/Luna),但應政府要求僅對少數受信任夥伴開放,再度引發 AI 存取權公平性爭議。

  • Sol(旗艦)/ Terra(日常)/ Luna(高速低成本)三層定位
  • 與 AI 存取的「誰能用」政治角力連動

今日觀察#

今天最值得玩味的,是 Anthropic 在同一天交出兩種截然不同的東西。一邊是 Claude Sonnet 5 和 Claude Science:更便宜、更專業、把整個科研工作流吞進一個工作台——這是「請更深地信任我、把更多東西交給我」的敘事。另一邊,是一位研究者拆開 binary 發現的隱寫術記號,以及 Cursor iOS 偷改隱私設定、V2EX 與阮一峰那一串因地區被封的帳號——這是「但你其實沒那麼了解我」的現實。Pragmatic Engineer 走訪三巨頭後說大家都在押注雲端 agent,而 GLM-5.2、Qwen 3.6 證明開放權重已能跑生產級任務;這兩件事放在一起,剛好標出今天的張力:產業正把運算與判斷往雲端、往單一供應商集中,但同一批開發者也開始本能地替自己留後路。當工具強到你離不開,「能不能自架、看不看得見它在做什麼」就不再是技術潔癖,而是議價能力。模型平權的時代,稀缺的不是智能,是信任與掌控權——這題,每個把 agent 接進工作流的人,遲早得自己回答一遍。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有