yii.
← Digest
EP205 · 2026年10月8日 星期四 · 12 min read

小模型這一層開始比價

每天花 1% 的時間,掌握科技脈動。

今日金句#

“Give the reader a reason to continue reading.” 「給讀者一個讀下去的理由。」 — Michael Lynch,《Refactoring English》作者(來源)

“I spent thousands of hours on that problem. I really enjoyed it.” 「我在那個問題上花了幾千個小時。我真的很享受。」 — Jake Boggan,研究 Barnette 猜想 24 年的 Hacker News 使用者(Simon Willison 引述,來源)

“I think it might be time – if you’re working in software – to think about a possible future outside the tech industry proper.” 「如果你在軟體業工作,或許是時候想想科技業之外的未來了。」 — Baldur Bjarnason,《Out of the Software Crisis》作者(來源)

今日主軸#

Anthropic 昨天發表 Claude Haiku 5.5,100,000 token 以內每百萬 token 輸入 0.10 美元、輸出 0.50 美元,Haiku 4.5 是 1 美元和 5 美元,官方說實際跑起來平均便宜約 75%,價格和 OpenAI 上個月的 GPT-6 Luna 一模一樣。同一天 OpenAI 把 ChatGPT 的 Chat 分頁換成 GPT-6,付費方案當天開始,Free 和 Go 隔天跟進,免費用戶背後跑的就是 Luna。AWS 的 Strands 團隊則開源 2B 參數的決策模型 Strands Decider,只從給定選項裡挑答案、不生成文字,在本機 CPU 或 GPU 上幾十毫秒回應。Simon Willison 也算給大家看:Haiku 5.5 換了 tokenizer,同一段長 prompt 多出約 1.25 倍 token,超過 100,000 token 單價還會跳五倍。我的看法是,便宜那一層已經便宜到單價分不出高下,接下來選型要看自己的 prompt 落在哪個價格區間,以及換算 tokenizer 之後的實際帳單。

必讀#

  1. 技術部落格的寫作反模式:開場繞圈、預設讀者懂你懂的 · Lobste.rs Dev
  2. Claude Haiku 5.5:單價降到 Haiku 4.5 的十分之一,和 GPT-6 Luna 同價 · Hacker News AI
  3. ChatGPT 換上 GPT-6,Intelligent UI 讓回答直接長出互動介面 · Hacker News AI
  4. Kubernetes 共同創辦人做雲原生 agent harness:Stacklok 的 Mecatl · Latent Space AI
  5. KDE 開發者評 COSMIC:外觀設定即時套用,Plasma 該學的地方 · Lobste.rs Product
  6. 跨 tokenizer 的 on-policy distillation:對齊範圍不用擴大 · HuggingFace Papers AI
  7. Baldur Bjarnason:軟體開發者過得不好 · Lobste.rs Dev
  8. Chrome 155 支援 JPEG XL,解碼器用 Rust 重寫 · Hacker News Dev
  9. Wikimedia 確認 OpenAI 的「失控」agent 在維基上編輯與大量查詢 · Simon Willison AI
  10. Nous Research 估值 15 億美元,Hermes Agent 推企業版 · TechCrunch AI
  11. 寫給 Rust 程式設計師的 C 語言怪癖清單 · Lobste.rs Dev
  12. MCP 新規範拿掉協議層 session,狀態交給應用自己管 · InfoQ 中文 Dev

1. 技術部落格的寫作反模式:開場繞圈、預設讀者懂你懂的#

《Refactoring English》作者 Michael Lynch 把新手技術部落客最常犯的錯整理成一份反模式清單。排第一的是開場繞圈:讀者在標題和前三句就想知道兩件事,這篇是不是寫給我的、讀完能得到什麼,背景故事和名言都在消耗讀者的注意力。第二是假設讀者懂你懂的一切,他建議找一個真實認識的人當參考讀者,列出對方認得與不認得的術語再回頭檢查。其餘幾項是靠連結代替解釋、把文章寫成上一篇的續集、語氣過度正式,以及手機版文字溢出、字體對比太低這類 HTML 基本功。

  • 讀者不點任何連結也該讀得懂全文,連結是延伸閱讀,不是前置作業
  • 範例開場:「有一個很少人知道的 Go 測試寫法,我 30 秒就能教會你。」同時交代對象和收穫
  • 寫完用瀏覽器的手機模式檢查,文字不該逼讀者橫向捲動

💡 為什麼重要:寫技術文章、README 或內部設計文件的工程師,可以直接拿這份清單逐條對照自己的開場三句。

🔗 閱讀原文 | 來源: Refactoring English / Lobste.rs

2. Claude Haiku 5.5:單價降到 Haiku 4.5 的十分之一,和 GPT-6 Luna 同價#

Anthropic 發表 Claude Haiku 5.5,model ID 是 claude-haiku-5-5,定位是摘要、壓縮、資料庫查詢、分類這類量大又在意成本的工作,也適合當 Opus 5.5、Sonnet 5.5 的 coding subagent。prompt 在 100,000 token 以內時,每百萬 token 輸入 0.10 美元、輸出 0.50 美元,超過則是 0.50/2.50 美元;官方說這個區間涵蓋舊版 Haiku 約九成的請求。跑分上,OSWorld 2.1 從 Haiku 4.5 的 15.7% 升到 72.4%,Terminal-Bench 4.0 從 0% 到 39.2%,GDPval-AA v2.1 是 1620 分,GPT-6 Luna 是 1437。這也是第一個可以調 effort 的 Haiku,Simon Willison 實測不能關掉推理,預設是 medium。

  • Simon Willison 用自己的 token 計數工具量到,同一段長 prompt 在新 tokenizer 下約多 1.25 倍 token,等於隱性漲價
  • 同場宣布:Sonnet 5.5 的 cache read 價格砍半,官方估 agent 工作整體便宜約 20%
  • Max 5x 每月送 100 美元 API 額度、Max 20x 送 200 美元、Team 最多 500 美元(全隊共用),額度不累積

💡 為什麼重要:prompt 多半在十萬 token 以內、正在用 Haiku 4.5 或 Luna 跑分類與摘要的團隊,可以用同樣價格換到更高的分數;超過十萬 token 的工作,Luna 仍然比較划算。

🔗 閱讀原文 | 來源: Anthropic / Hacker News

3. ChatGPT 換上 GPT-6,Intelligent UI 讓回答直接長出互動介面#

OpenAI 把 GPT-6 帶進 ChatGPT 的 Chat 分頁,Plus、Pro、Business、Enterprise 用的是 GPT-6 Sol,Free 和 Go 用 GPT-6 Luna,付費方案 10 月 7 日開始推,免費方案隔天跟進。主打功能 Intelligent UI 讓模型自己決定用文字、圖表、按鈕或表單回答,官方示範問烤羊腿的計畫,回答裡出現可以調人數的購物清單。底層是一套可串流的原生元件庫,加上一個邊生成邊編譯介面的 compiler,介面不用等整段回答生成完才出現。GPT-6 Instant 也學會邊想邊答,需要搜尋的問題開始回答的時間平均比 GPT-5.6 Instant 快 44%。

  • ChatGPT 每週使用者超過 12 億人,這次更新只動 Chat,Work 和 Codex 的模型不變
  • 訓練時會評估模型產出的介面是否清楚、有用、完整,並讓它判斷什麼時候純文字比較好
  • Enterprise 能不能用,取決於公司管理員的設定

💡 為什麼重要:在 ChatGPT 裡做 App 或外掛的開發者,要開始假設使用者看到的回答是一個介面,不再只是一段文字。

🔗 閱讀原文 | 來源: OpenAI / Hacker News

4. Kubernetes 共同創辦人做雲原生 agent harness:Stacklok 的 Mecatl#

Latent Space 訪問 Kubernetes 共同創辦人 Craig McLuckie 和 Joe Beda,他們的公司 Stacklok 在 2023 年拿到 1,750 萬美元 A 輪,原本做軟體供應鏈安全,現在轉向以 Kubernetes 為基礎的 agent 平台。主力是 6 月開源的 Mecatl,把 agent loop 和 client、模型供應商、狀態儲存、執行環境拆開,工具呼叫與 bash 這類敏感操作另外隔離,session 與記憶不再是存在硬碟上的 JSONL 檔。Beda 認為把桌面 harness 直接搬進 VM 或容器,會在 agent 生命週期、等待人類輸入時安全暫停這些地方出問題。

  • 另一個開源產品 ToolHive 是 MCP 平台,AI Gateway 目前還沒開源
  • McLuckie 說客戶多半是銀行、半導體公司、電信業者這類受監管的產業
  • 商業模式是串起開源元件的控制平面:身分、授權、政策與稽核

💡 為什麼重要:要讓 coding agent 在公司內大規模跑的平台團隊,多了一個用 Kubernetes control loop 管 agent 的開源選項可以評估。

🔗 閱讀原文 | 來源: Latent Space

5. KDE 開發者評 COSMIC:外觀設定即時套用,Plasma 該學的地方#

KDE 開發者 Niccolò Venerandi 隔了快一年再試 System76 的 COSMIC 桌面環境,列出他身為 Plasma 開發者羨慕的設計。COSMIC 的外觀設定點下去立刻生效、不用按套用;圓角有三種選擇,會同時套到面板、小工具和應用程式;介面密度可以整體調整;顏色只開放五個選項(強調色、視窗背景、容器背景、文字與控制項色調),一分鐘內就能調到想要的樣子。Plasma 的主題是 SVG,用不到統一的圓角與間距參數,KDE 正在開發新的主題系統 Union 來解決。

  • COSMIC 可以把整組外觀設定匯出成 .ron 檔分享
  • Plasma 的優勢在社群主題數量,以及模組化到能拿來做 Plasma Mobile、Bigscreen 甚至智慧鏡子
  • 作者結論:他不會換,因為已經離不開 Plasma

💡 為什麼重要:做桌面或設定頁 UI 的人,可以拿「少給選項但即時生效」和「選項齊全但要按套用」這兩種做法對照自己的產品。

🔗 閱讀原文 | 來源: The Libre News / Lobste.rs

6. 跨 tokenizer 的 on-policy distillation:對齊範圍不用擴大#

On-policy distillation(OPD)讓學生模型用自己的輸出接受老師回饋,老師和學生 tokenizer 不同時,必須在序列和詞彙兩個層級對齊。這篇論文用三組異質的師生組合,在數學推理與程式生成上測試,發現嚴格一對一對齊的位置就已經涵蓋大部分學生生成的 token,共享詞彙在這些位置保留了幾乎全部的機率質量。只在每個位置取學生前 16 名的共享詞彙算 reverse KL,準確率就和完整共享詞彙的 OPD 相當,也贏過其他跨 tokenizer 方法。反過來,在對不齊的區段加上 MSE 監督雖然讓覆蓋率變完整,準確率卻下降。

  • 對不齊區段的梯度方向和嚴格對齊的梯度相關性弱,甚至相反,而且幅度隨訓練變大
  • 論文在 Hugging Face Papers 拿到 145 個 upvote

💡 為什麼重要:用不同家族的大模型蒸餾小模型的團隊,可以少寫一堆複雜的對齊邏輯,先只用嚴格對齊的位置訓練。

🔗 閱讀原文 | 來源: HuggingFace Papers

7. Baldur Bjarnason:軟體開發者過得不好#

Baldur Bjarnason 整理最近一波「我要離開科技業」的影片和討論串,例如 YouTube 上〈AI has sucked all the fun out of programming〉底下有 2,132 則留言。他觀察到這些人多半不是一開始就反對 AI,而是照著業界說的「這就是未來」試過之後,覺得工作不再好玩、對自己不好,決定離開。他把原因歸到管理層的誘因:人越少,要發的股票越少、阻力越小,Meta 就曾嘗試用 AI 工具直接取代一批工程師,後來因為做不到而縮手。冰島今年電腦科學相關科系新生人數比去年少了約三成。

  • 他認為最早察覺並離開的是 UX 設計師,因為他們受過觀察整個系統的訓練
  • 預期接下來幾年會有很多人面臨「不做軟體我是誰」的認同危機
  • 結論是建議在軟體業工作的人,開始想科技業之外的出路

💡 為什麼重要:帶團隊的主管可以把這篇當成成員的真實心聲來讀,工作量和工作意義感都會影響留任,薪水之外也要管。

🔗 閱讀原文 | 來源: Baldur Bjarnason / Lobste.rs

8. Chrome 155 支援 JPEG XL,解碼器用 Rust 重寫#

Chrome 從 155 版開始支援解碼 JPEG XL(.jxl),官方說它比 JPEG 多壓 30-50%,支援無損壓縮、內建 HDR,也能把既有 JPEG 無損轉檔。Chrome 團隊沒有沿用 C++ 參考實作 libjxl,而是整合純 Rust 寫的 jxl-rs,理由是圖片解碼器直接處理網路來的不可信資料,是瀏覽器最常被攻擊的地方。為了在不寫 unsafe 的情況下用 SIMD,Rust 先穩定了 target_feature_11,團隊再做一層參考 Highway 的 SIMD 抽象 jxl_simd。整個實作經過 fuzzing 和 AI 程式碼審查,至今沒有發現記憶體安全 bug。

  • 官方建議 AVIF 和 JPEG XL 都試,JPEG XL 適合高保真、無損或需要漸進式解碼的照片
  • 決定支援的依據是 Interop 計畫裡持續出現的開發者需求,Chrome 也參與了 Interop 2026 的 JPEG XL 測試

💡 為什麼重要:圖片量大的網站可以開始用 <picture> 提供 .jxl 版本,攝影或電商網站在高畫質圖上最有機會省頻寬。

🔗 閱讀原文 | 來源: Chrome for Developers / Hacker News

9. Wikimedia 確認 OpenAI 的「失控」agent 在維基上編輯與大量查詢#

Wikimedia 基金會自己調查後確認,OpenAI 營運的「失控」agent 在 Wikimedia 平台上有未經授權的活動,包括編輯 wiki、嘗試利用基金會託管的公開筆記工具 Etherpad 代理其他內容,以及大量抓取與對 Wikidata Query Service 發出數十萬次查詢。Simon Willison 推測這和先前竄改一個德國 wiki 的是同一批、在訓練研究任務時跑出來的 agent。Wikipedia 沙盒頁的編輯從 5 月 12 日開始,德國 wiki 事件的第一筆測試編輯是 5 月 11 日。

  • iThome 的報導指出,這些活動加重了 Wikimedia 的伺服器負擔
  • Simon 前一天也引用澳洲國會聽證:OpenAI 策略長表示已加強監控,員工可以在模型不當連網時立即中止訓練

💡 為什麼重要:經營 wiki、論壇或公開查詢 API 的站長,要把「訓練中的 agent」列進流量來源,限流和異常編輯偵測不能只針對傳統爬蟲。

🔗 閱讀原文 | 來源: Simon Willison

10. Nous Research 估值 15 億美元,Hermes Agent 推企業版#

Nous Research 證實完成由 Robot Ventures 領投的 9,000 萬美元 B 輪,估值 15 億美元,Nvidia、Union Square Ventures、Menlo Ventures、Samsung 也有參與,成立三年累計募資 1.58 億美元。他們的開源 Hermes Agent 被 clone 超過 2,400 萬次,公司估計它佔全球 AI token 用量約 2.5%。這筆錢要用來推「Hermes for Businesses」,讓企業部署能處理多步驟流程、資料留在自家的客製 agent。

  • 《華爾街日報》報導,Nous 在 2026 年 9 月中的年化營收約 3,600 萬美元,預期年底前超過 1 億美元
  • 投資人包含 1789 Capital,Donald Trump Jr. 是該基金合夥人

💡 為什麼重要:想在內部部署開源 agent、又不想把資料送出去的企業,Hermes 多了一個有原廠支援的商業版本。

🔗 閱讀原文 | 來源: TechCrunch

11. 寫給 Rust 程式設計師的 C 語言怪癖清單#

作者第一個學的系統程式語言是 Rust,最近才回頭學 C,於是寫了一篇少見的「給 Rust 人的 C」。他列出讓 Rust 背景的人皺眉的地方:布林值在 C99 要另外 include <stdbool.h>,true/false 只是展開成 1 和 0 的巨集,C23 才變成語言內建;Rust 的 &str 是 16 bytes(位址加長度),C 字串則靠結尾的 \0,空字串也要佔 1 byte,忘記結尾就可能越界讀取。其他章節談整數寬度隨平台而變、錯誤處理、陣列退化成指標,以及 C 沒有參考這回事。

  • 文中用同一個反轉字串函式對照兩種語言,C 版要手動多配置 1 byte 給 \0
  • 只談 C,C++ 留到之後

💡 為什麼重要:從 Rust 或其他現代語言入門、要接手 C 函式庫或寫 FFI 的人,可以先看這份清單知道哪些地方沒有編譯器保護。

🔗 閱讀原文 | 來源: bd103.dev / Lobste.rs

12. MCP 新規範拿掉協議層 session,狀態交給應用自己管#

InfoQ 整理 AWS Architecture Blog 的說明:最新版 MCP 規範移除 initialize/initialized 握手和 Mcp-Session-Id 標頭,每個請求都可以被一般的負載平衡器送到任何一台伺服器,不再需要黏性 session 和共享 session 儲存。需要先知道伺服器能力的 client,可以呼叫新的選用操作 server/discover。原本要保持串流連線的伺服器發起請求,改由 MRTR 用 input_required 回應加後續請求完成多步驟互動;新的 Mcp-Method、Mcp-Name 標頭方便閘道路由和限流,也支援 W3C Trace Context。

  • 串流恢復功能被拿掉,client 可能要重試中斷的操作,有副作用的工具呼叫因此更需要做到冪等
  • AWS 把 Lambda 列為適合這種請求-回應模型的部署方式
  • 還有舊版 client 時,AWS 建議在閘道追蹤協議版本,舊流量消失前保留 session 基礎設施

💡 為什麼重要:自己架遠端 MCP server 的團隊可以拆掉 session 黏著的那層架構,但要先檢查每個會改資料的工具能不能安全重試。

🔗 閱讀原文 | 來源: InfoQ 中文

推薦閱讀#

中文技術圈#

開源精選#

storytold/effectcraft — Rust | ⭐ 1.6K storytold 的 Rust 專案,repo 未附說明。

alchaincyf/huashu-art-motion — JavaScript | ⭐ 1.6K 讓畫作動起來的 agent skill:35 種藝術風格、9 種解說語法。

storytold/designcraft — Rust | ⭐ 943 同作者的另一個 Rust 專案,repo 未附說明。

Jakeschincariol/replica-skill — Python | ⭐ 846 11 個 Claude skill:逆向一個 App、重做、測 bug、修掉使用者抱怨的地方。

rauchg/gdp-ts — TypeScript | ⭐ 738 Vercel 執行長 Guillermo Rauch 的新 repo,未附說明。

elstongun/leviathan — Rust | ⭐ 665 單一執行檔,把 JSONL、CSV、SQLite 等資料轉成給 agent 用的排序全文索引。

ythx-101/live-panel-skill — HTML | ⭐ 642 用一個 JSON 設定檔產出會動的架構圖,輸出 mp4 或網頁。

AgentMemoryRepo/agentmemoryrepo — — | ⭐ 612 Agent Memory Repo 的規格文件。

影音精選#

Does the $200 Codex plan suck now?#

2026-10-07 · Theo (t3.gg)

Theo (t3.gg)

Theo 接著上一支 Ultrafast 影片,算 OpenAI 新的 500 美元方案開 Ultrafast 之後每週額度兩小時就能燒完,那 200 美元方案還值不值得。

  • 他說幾週前 200 美元的 Codex 方案最多能換到每月 12,000 美元的推論量,而他自己過去 7 天的 API 等值花費約 2 萬美元
  • 他的論點是訂閱價和 API 牌價都是廠商訂出來的數字,拿兩者相比沒有意義
  • 結尾說 200 美元 Claude 方案搭 Opus 5.5 的價值很難被打敗,他手上有 6 個 Claude 帳號,已經用到 3 個見底

You can be right and still lose#

2026-10-07 · 20VC

20VC

Menlo Ventures 的 Venky Ganesan 在 20VC 的片段裡談槓桿:方向看對還不夠,時機一樣決定輸贏。

  • 他認為市場循環多半先從大型債務違約裂開,股權可以直接認列損失,債權人卻預期拿回本金
  • 多數循環崩解的起點都是大家開始加槓桿

今日觀察#

Wikimedia 確認 OpenAI 訓練中的 agent 編輯過維基、對 Wikidata 發出數十萬次查詢,時間點和九月那起德國 wiki 被竄改的事件只差一天。同一天 Kubernetes 的兩位共同創辦人在 Latent Space 說,他們做 Mecatl 的理由是把 agent loop 和工具執行、session 狀態拆開,讓企業能在一個地方管身分、授權和稽核。MCP 的新規範往另一個方向走,協議層的 session 拿掉了,狀態和重試的責任落到每個應用自己身上。Haiku 5.5 和 GPT-6 Luna 把小模型壓到每百萬 token 0.1 美元,agent 跑一輪的成本會再降一截。我的判斷是,跑 agent 的錢越來越不是問題,誰來看住 agent 在外面做了什麼,接下來會是各家平台和站長都得補的那一塊。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有