yii.
← Digest
EP204 · 2026年10月7日 星期三 · 14 min read

Agent 產量暴增,接手的一端撐不住

每天花 1% 的時間,掌握科技脈動。

今日金句#

“A substantial patch used to imply substantial effort, and that effort was a reasonable proxy for good faith. That assumption no longer holds.” 「以前一大包修改代表有人下了大工夫,那份工夫就足以證明善意。這個前提已經不成立了。」 — Andreas Kling,Ladybird 瀏覽器創辦人(James Ross〈Open Source as We Know It Is Dead〉引述)

“For embedding models in particular, I don’t think it makes sense to use a closed, proprietary, hosted-only model.” 「特別是 embedding 模型,我認為用閉源、只能託管的模型沒有道理。」 — Simon Willison,Datasette 作者

“You need to have a way to trust your code, and tests are probably the best way to.” 「你得有辦法信任自己的程式碼,測試大概是最好的方法。」 — Jarred Sumner,Bun 作者、現於 Anthropic(Pragmatic Engineer 引述)

今日主軸#

GitHub 昨天公布,9 月平台上的 commit 有 73.8 億次,是一年前的五倍多,push 一年成長 4.9 倍,他們正在不停機重蓋 Git 儲存層,因為現行架構每多一個讀取副本,寫入就更慢。Gergely Orosz 在 LDX3 的主題演講引用 GitHub 給他的資料:今年 8 月 agent 開的 PR 已經比人開的多,他訪問的工程師形容 code review 變成「演戲」,大家直接蓋 LGTM。開源維護者那一端,James Ross 列出 curl、Ladybird、Godot、tldraw 陸續停掉懸賞或限制外部貢獻,Sindre Sorhus 在 10 月 1 日關掉自己所有 repo 的外部 PR。我的判斷是,接下來一年團隊該花錢的地方是驗證和審查工具,寫程式那一段已經不缺人手。

必讀#

  1. JetBrains 捷克母公司 2025 營收創新高,轉為淨虧損 3.15 億克朗 · Hacker News Dev
  2. Mistral Large 4 預覽:1 兆參數、49B 啟用,權重月底釋出 · Hacker News AI
  3. Polars 2.0:預設走 streaming engine,SQL 升為一等公民 · Hacker News Dev
  4. GitHub 重蓋 Git 基礎設施:9 月 commit 73.8 億次,一年成長五倍 · GitHub Blog Dev
  5. OpenAI 公開內部模型的一批數學成果,附 Lean 形式化證明 · OpenAI AI
  6. OpenAI 與 Ironclad 合作訓練 computer use,GPT-6 Astra 合約流程得分 55% · OpenAI AI
  7. Atlassian 擴大與 OpenAI 合作,Rovo agent 改用 GPT-6 系列 · OpenAI AI
  8. 「開源已死」:維護者為什麼一個個關掉外部 PR · Lobste.rs Dev
  9. Gergely Orosz:2026 科技業現況,8 月 agent 開的 PR 已比人多 · Pragmatic Engineer Dev
  10. 蘋果收緊 macOS「完全取用磁碟」權限,點名 AI agent 風險 · 科技新報 AI
  11. Nathan Lambert:開放權重模型的資安辯論已經失焦 · Interconnects AI
  12. EmbeddingGemma 2:740M 參數,文字、圖片、音訊、影片同一個向量空間 · Hacker News AI

1. JetBrains 捷克母公司 2025 營收創新高,轉為淨虧損 3.15 億克朗#

Helgi Library 整理 JetBrains s.r.o. 送交捷克商業登記處的單獨財報(不是合併報表):2025 年營收 160.08 億捷克克朗,比 2024 年成長 6.3%,創公司紀錄;淨利則從 2024 年的 24.79 億克朗變成虧損 3.15 億克朗,ROE 從 96% 掉到 -11.1%。毛利從 2021 年的 53.32 億克朗一路降到 17.08 億,EBITDA 只剩 9.18 億,利潤率 5.73%。財務項目也翻了方向:2024 年是淨收入約 8.1 億克朗,2025 年變成淨成本 10.78 億。營業現金流倒是增加到 63.53 億克朗,年底淨現金 75.84 億。

  • 這是捷克法人的單獨報表,不含其他國家的子公司,不能直接當成整個集團的獲利
  • 營收成長率從 2022 年的 20% 一路放緩到 6.26%,毛利一年少了 39.7%
  • Pragmatic Engineer 同日提到 JetBrains 正轉向 agent 開發環境 JetBrains Air;iThome 報導 JetBrains 縮減 KMP 外掛的 Swift 編輯支援

💡 為什麼重要:靠 IntelliJ 系列工具吃飯的開發者,可以把這組數字當成 IDE 生意的溫度計:營收還在長,毛利一年少了四成。

🔗 閱讀原文 | 來源: Helgi Library / Hacker News

2. Mistral Large 4 預覽:1 兆參數、49B 啟用,權重月底釋出#

Mistral 發布 Mistral Large 4 公開預覽,暱稱 le Chonk,1 兆參數、每 token 啟用 490 億,原生多模態,在 Mistral 歐洲自有機房的 3,800 張 NVIDIA Grace Blackwell 上從零訓練;預覽 API 已上 Mistral Studio,權重月底釋出。程式方面 DeepSWE v1.1 61.7%、SWE-Atlas-QnA 59.4%、Terminal-Bench 4 28.3%;Surge AI 的盲測程式品質評分排五個模型的第二(3.74),只輸 Claude Opus 5(4.22)。資安是主打:Artificial Analysis Cyber Index 裡一項「重現真實漏洞再修補」的測試拿 82%,Mistral 說 Claude Opus 5.5 與 GPT-6 Astra 在同一測試接近零分,因為拒答。

  • 權重釋出前,先讓資安業者、合作夥伴與政府機關用降低審核的版本做紅隊測試
  • Simon Willison 查到 Artificial Analysis 綜合分 38,去年 12 月的 Large 3 只有 9;API 只提供 none 與 high 兩種推理等級
  • 訓練資料涵蓋 160 多種語言,包含所有歐盟官方語言

💡 為什麼重要:需要在自家機房跑資安分析、又被閉源模型拒答卡住的團隊,月底多一個能自己部署的 1T 選項;Simon 估計它大約落後前沿 6 個月。

🔗 閱讀原文 | 來源: Mistral / Hacker News

3. Polars 2.0:預設走 streaming engine,SQL 升為一等公民#

Ritchie Vink 發布 Polars 2.0。LazyFrame.collect() 預設改走 streaming engine,代價是 join、group_by、unpivot 等操作不再保證列順序,需要時得設 maintain_order=True,這也是升主版號的原因。Out-of-core 預設開啟,記憶體用到約 80% 就開始寫入磁碟,預設磁碟預算 64GB,目前支援排序與 window function,join 和 group-by 之後跟上。官方在 c7a.4xlarge 與 c7a.metal 上跑 TPC-H、TPC-DS 衍生資料,對比 DuckDB 1.5.6、DuckDB 2.0 alpha 與 DataFusion 54,預設 Polars 除了一項以外都最快。

  • 新的 Map dtype 直接對應 Arrow MapType,以前會讀成 List(Struct)
  • 在 192 核機器上 Polars 有固定開銷,小資料查詢吃虧;限制在 32 核時全數持平或領先,團隊說下一版修
  • 基準程式碼公開在 pola-rs/polars-2.0-benchmark

💡 為什麼重要:用 Polars 跑 ETL 的團隊升級前,要先找出 join 和 group_by 之後依賴列順序的程式碼,不然結果會悄悄換序。

🔗 閱讀原文 | 來源: pola.rs / Hacker News

4. GitHub 重蓋 Git 基礎設施:9 月 commit 73.8 億次,一年成長五倍#

GitHub 的 Brian Celenza 說明為什麼要在不停機的狀況下重建 Git 儲存層。2025 年 9 月到 2026 年 8 月,Git 事件從每月 2,182 億次增加到 4,733 億次;9 月單月 commit 73.8 億次,是一年前的五倍多;push 從每月 6.9 億成長到 33.5 億(4.9 倍);PR 合併量接近去年的 4 倍;GitHub Actions 9 月跑了 32.6 億次。現行的 Spokes 在多台 fileserver 本機磁碟各存一份完整 repo(預設五份),寫入要走三階段 commit 與 quorum,所以每加一個讀取副本,寫入就更慢。新架構把持久儲存和運算拆開:讀取改由快取 worker 承擔,只有 ref 更新需要協調,壓縮與 GC 移出服務路徑。

  • 最忙的 repo 在 8 月收到大約 10 億次請求
  • agent 在緊湊迴圈裡幾乎每個動作都 commit,單次 push 的延遲直接決定 agent 的速度
  • 新架構要保留 branch protection、required review、audit log 等既有控制

💡 為什麼重要:在單一 repo 跑大量 agent 或 merge queue 的團隊,碰到的 push 延遲是平台架構的上限,GitHub 在文中講了它打算怎麼拆。

🔗 閱讀原文 | 來源: GitHub Blog

5. OpenAI 公開內部模型的一批數學成果,附 Lean 形式化證明#

OpenAI 釋出一批由內部前沿模型產生的數學結果,放在 GitHub repo,附論文修訂與引用的流程。發布方式參考了高等研究院(IAS)數學與 AI 顧問小組的建議。repo 裡有多個證明的 Lean 形式化版本,之後會陸續補上;也公開 10 份模型推理摘要、以 ChatGPT Pro 用量換算的運算量,以及嘗試過的題目數統計。平均每個結果用掉約相當於 ChatGPT Pro 思考三小時的運算。

  • openai/math repo 在 GitHub 上已有 771 顆星
  • OpenAI 說會資助一系列工作坊與會議,討論 AI 產出的重大數學結果
  • 產生這些結果的模型,OpenAI 說正在規劃釋出

💡 為什麼重要:數學研究者可以直接用 Lean 檢查證明,不必只聽 OpenAI 的說法;做 AI 數學評測的團隊也多一份公開的運算量資料。

🔗 閱讀原文 | 來源: OpenAI

6. OpenAI 與 Ironclad 合作訓練 computer use,GPT-6 Astra 合約流程得分 55%#

OpenAI 想讓 agent 學會操作專業軟體,第一個合作夥伴是合約管理平台 Ironclad。雙方挑出法務、商務、採購的 11 個任務,例如設定保密協議、建立採購核准流程、依申請人選的司法管轄區改寫可重用條款,熟練使用者平均每題要 30 到 40 分鐘;每題依複雜度用 8 到 50 條標準評分,Ironclad 提供託管的產品環境讓模型練習,再用強化學習訓練。GPT-6 Astra(Max 推理)平均得分 55.0%,GPT-5.6 Sol(High)是 41.6%,每次嘗試的估計時間從 37.0 分鐘降到 19.2 分鐘;開發 Astra 時用的一個內部模型拿到 63.7%。

  • 同一題的示範:Astra 約 20 分鐘達成 94% 標準,Sol 約 32 分鐘達成 85%
  • OpenAI 正在邀請少數軟體公司加入,條件是拿得出 agent 失敗的具體例子、懂流程的人和安全的測試環境
  • OpenAI 自己也寫,agent 在流程中途忘掉一條規則,就限制了軟體公司敢交給它做的事

💡 為什麼重要:做 B2B SaaS 的團隊可以看到模型廠商怎麼挑訓練資料:能提供任務、評分標準和練習環境的產品,最先被模型學會操作。

🔗 閱讀原文 | 來源: OpenAI

7. Atlassian 擴大與 OpenAI 合作,Rovo agent 改用 GPT-6 系列#

新協議讓 OpenAI 前沿模型驅動 Atlassian 平台與 Rovo 上的 agent,Rovo 結合 Atlassian 的 Teamwork Graph,把人、專案、文件與決策串在一起。Atlassian 內部有超過 3,000 名開發者在終端機、IDE 與 code review 流程用 Codex,透過 Teamwork Graph 外掛讀取相關工單與技術文件。協議讓 Atlassian 取得 GPT-6 Astra 與 GPT-5.6 系列;OpenAI 則繼續用 Jira 管理公司內部的關鍵流程。

  • Atlassian 已推出外掛,可以在 ChatGPT 與 Codex 的 prompt 裡直接帶入 Jira 工單、Confluence 內容與人員
  • 雙方在研究更深的 Jira 整合,讓團隊更容易把工作指派給 AI agent 並追蹤進度
  • 兩家的合作從 2023 年開始

💡 為什麼重要:用 Jira 和 Confluence 的團隊,接下來 Codex 讀得到工單與規格文件,票開得清不清楚會直接影響 agent 的產出。

🔗 閱讀原文 | 來源: OpenAI

8. 「開源已死」:維護者為什麼一個個關掉外部 PR#

Nodecraft 共同創辦人 James Ross 從 2011 年開 GitHub 帳號寫起,認為他熟悉的開源正在消失,主因是 AI。他列出這一年的變化:curl 停掉現金漏洞懸賞,Daniel Stenberg 說真的回報不到 5%;tldraw 自動關閉外部 PR;Ghostty 收緊 AI 政策,Mitchell Hashimoto 說低品質貢獻多了「10 倍以上」;Jazzband 解散;OpenJDK 禁止 LLM 生成的貢獻;Ladybird 停收公開 PR;Godot 要求程式碼由人撰寫。10 月 1 日 Sindre Sorhus 關掉自己所有 repo 的外部 PR。

  • GitHub 今年 2 月發文寫「建立的成本降了,審查的成本沒降」,隔天推出關閉 PR 的設定,之後又加了每人開啟中 PR 的上限(agent 也算)
  • 作者自己每天用 AI 寫程式,他認為成本只是從貢獻者身上移到負責說不的志工身上
  • 他也承認禁止 AI PR 是鈍器,會把用 AI 幫忙寫一個好測試的人一起擋掉

💡 為什麼重要:想靠開源貢獻累積履歷的工程師,現在要先看專案的 AI 政策;不少熱門專案對陌生人的 PR,預設答案已經是拒絕。

🔗 閱讀原文 | 來源: jross.me / Lobste.rs

9. Gergely Orosz:2026 科技業現況,8 月 agent 開的 PR 已比人多#

Gergely Orosz 在 2,000 多位工程主管出席的 LDX3 紐約場發表 29 分鐘主題演講,資料來自他造訪 OpenAI、Anthropic、Ramp、Uber,以及 GitHub、Factory AI、Linear 提供的未公開數字。GitHub 數據顯示 agent 寫的 PR 八個月成長九倍,今年 8 月超過人寫的 PR;Linear 從 7 月起 agent 建的 issue 也多過人建的;Factory AI 有 83% 使用者用 skills,比 2 月多 2.5 倍。遷移專案的時間大幅縮短,例如 Uber 把 1,500 萬行程式碼裡 60 萬個 JUnit 4 測試搬到 JUnit 5 花了 4 個月,Anthropic 用 11 天把 Bun 從 Zig 遷到 Rust。

  • 「壞掉的」清單:code review 變成演戲、只由 AI 審的 PR 在增加、服務品質下滑、雲端 CPU 也開始缺貨
  • 「沒變的」:團隊依然重要,複雜專案照樣要規劃;他找不到任何一家公司讓 PM 或設計師把程式碼推上 production
  • IDE 正在淡出:Cursor 4 月改版拿掉 IDE 介面,JetBrains 轉向 JetBrains Air

💡 為什麼重要:帶團隊的工程主管可以拿這份清單對照自己的 review 流程,如果大家已經在蓋 LGTM,驗證這一段就得換別的機制補上。

🔗 閱讀原文 | 來源: The Pragmatic Engineer

10. 蘋果收緊 macOS「完全取用磁碟」權限,點名 AI agent 風險#

蘋果宣布替 macOS 的「完全取用磁碟」(Full Disk Access)加上額外控制,使用者要經過非常明確的授權動作,App 才拿得到這項權限。蘋果說這個權限原本是為了讓備份軟體正常運作,但發現部分開發者在使用者不知情下用它讀取檔案、郵件、訊息甚至瀏覽紀錄,通訊軟體還會連帶影響對話另一方的隱私。起因之一是一位科技專欄作家在 Mac mini 上裝了 Meta Muse 桌面版,沒開放某些權限,Muse 仍讀到他的訊息並主動提出建議。

  • 蘋果的說法:「隨著 AI Agent 的能力與自主性不斷增強,這種等級的存取權限帶來的風險也將顯著增加」
  • Techdirt 同日整理 Muse 的其他問題,包括有人假冒 Muse agent 就拿到裝置的 root 權限
  • 外媒也報導 Mac 版 ChatGPT 有漏洞,可能讓駭客取得敏感資料

💡 為什麼重要:在 Mac 上做桌面 agent 或備份工具的開發者,要準備新的授權流程和引導畫面,否則使用者會卡在開權限那一步。

🔗 閱讀原文 | 來源: 科技新報

11. Nathan Lambert:開放權重模型的資安辯論已經失焦#

Nathan Lambert 把辯論分成三方:認為開放權重模型風險太高的前沿實驗室與美國國安圈、認為開放模型是防禦必需品的西方溫和派(他自己在這一邊)、以及持續釋出強資安能力開放模型的中國公司。他批評 Anthropic 那份把 GLM-5.3 當攻擊工具的報告,技術研究合理,但沒回答「禁掉開放模型之後會怎樣」。他指出目前公開紀錄裡,造成大多數網路攻擊的是閉源模型,並主張如果要為資安風險禁開放權重,邏輯上也得禁掉前沿閉源模型的公開 API。

  • GLM-5.3 權重釋出一個多月,他說沒有公開證據顯示風險出現階躍式變化
  • 政府機關等氣隙網路,短期內只能部署開放權重模型
  • 他的理解是中國 AI 公司每次重大發布都要向政府登記並附評測

💡 為什麼重要:靠開放權重模型做資安防禦的團隊,手上工具能不能繼續用要看美國的政策走向;Mistral 同一天也把「閉源模型拒答」寫進 Large 4 的賣點。

🔗 閱讀原文 | 來源: Interconnects

12. EmbeddingGemma 2:740M 參數,文字、圖片、音訊、影片同一個向量空間#

Google DeepMind 推出 EmbeddingGemma 2,以 Gemma 4 架構打造、Apache 2.0 授權、740M 參數,把程式碼、圖片、影片與音訊對應到同一個 embedding 空間;上一代下載超過 2,000 萬次。架構是模組化的:純文字只要 270M,視覺(170M)與音訊(300M)encoder 選配;用 Matryoshka 表示學習可以把 768 維向量截到 512、256 或 128 維,儲存最多省 6 倍。量化後在 Pixel 11 Pro 上,純文字約占 191MB RAM,完整多模態約 567MB;context 8K,能處理 5.5 分鐘音訊或 58 張影格。

  • MTEB Code 從 68.76 提升到 78.68,官方建議用在本機程式碼索引與 coding agent 檢索
  • Simon Willison 在 HN 留言說,embedding 模型特別不該用閉源託管版:廠商停用舊模型時,幾百萬筆向量都得付費重算
  • 可以完全離線在裝置上跑

💡 為什麼重要:在 App 裡做本機搜尋或 RAG 的行動開發者,用不到 600MB 記憶體就能做跨圖片和語音的檢索,也不用擔心供應商下架模型。

🔗 閱讀原文 | 來源: Google Blog / Hacker News

推薦閱讀#

  • Scrimshaw Jukebox:讓 Claude Opus 5.5 寫遊戲配樂 — Simon Willison 請 Claude Opus 5.5 自己設計文字格式的樂譜、做一個能播放的 artifact,目標是《Secret of Monkey Island》原作水準;成果比他預期好,他推測作曲可能和 3D 圖形一樣,是文字模型最近幾個月才出現的能力,還要拿其他模型驗證。
  • AI 熱潮退去後,網頁工作者該練的技能 — David Bushell 列出 AI 熱潮過後網頁工作者該投資的技能:無障礙(以 WCAG 為基準、找真人測試)、寫在 stylesheet 裡的 CSS(cascade layers、:where 這類降低特異性的新語法),以及溝通能力。
  • Vinod Khosla 押注 Wajo:會打電話、能代付的 Fo agent — 前 DeepMind 工程師 Poddar 創辦的 Wajo 推出 Fo agent,在 iMessage、WhatsApp 上代辦雜事,能打電話、開虛擬信用卡代付;Jeff Dean 與 Gokul Rajaram 也投資,金額未公開,Wajo 說在 107 國有人用、9 月底上線後成長 10 倍。
  • 用 Parseable 檢視 Datasette 的 OpenTelemetry traces — Parseable 是新的可觀測性平台,開源版是 AGPL 授權的 Rust 單一執行檔(約 180MB);Simon Willison 請 Codex 把 Datasette 1.0a41 新支援的 OpenTelemetry trace 送進去,再自己寫成 TIL。
  • Anthropic Cowork 新架構:VM 搬上雲端,每個 session 一個 sandbox — Felix Rieseberg 說舊版 Cowork 的工具呼叫跑在裝到使用者電腦的 VM 裡,吃磁碟和電量、闔上筆電就停;新版把 VM 也搬上雲端,需要本機檔案時才經由桌面 App 存取。
  • Montray:systemd 服務健康狀態的系統匣圖示 — 用 Go 寫的小工具,替 systemd 服務與自訂健康檢查提供系統匣圖示和桌面通知。
  • How I AI:Jev 的 8 個實戰用例 — egghead.io 創辦人 John Lindquist 示範即時語音助理、資料去重、App 路由、西洋棋分析、簡報教練等 8 個用例;他把 Jev 當成又快又便宜的決策引擎,輸出分數、分類與機率,不輸出文字。
  • Meta Muse 的隱私與資安問題整理 — Techdirt 整理 Muse 的問題:有人假冒 Muse agent 就拿到裝置 root 權限;Wired 發現它會替使用者的親友同事建立詳細檔案;404 Media 報導 Meta 上線前趕修多個漏洞(含 VM escape),但拒絕延後發布。
  • Falcon-Emirati:專攻阿聯酋方言的 7B 模型 — TII 以 Falcon-H1-Arabic 的 7B 版本為基礎(每個 block 裡 Mamba 與 Transformer attention 並行),做出專攻阿聯酋方言的模型;難點在阿聯酋話多半只用講的,網路上的文字資料少。
  • 前 Ramp 工程師砍掉整份程式碼,Melius 轉做 AI 廣告素材並募得 2,000 萬美元 — Melius 原本做廣告投放管理,團隊把整份程式碼砍掉,改做生成廣告素材的「agents lab」;競爭對手 Higgsfield 8 月估值 54 億美元、年化營收超過 7 億美元。
  • Underdog:完全在裝置上跑的個人 AI 助理 — Thiel Fellow Sigil Wen 推出邀請制的 Underdog,用自己寫的推論引擎 Husky 在使用者裝置上跑一個從 Qwen3.8-27B 微調的推理模型,帳號金鑰也加密保存。
  • Musubi 開源 PolicyLM-1.7B,50 毫秒內套用內容政策 — Musubi 的 PolicyLM-1.7B 開放權重,把白話寫成的內容政策套用到訊息上,判斷時間在 50 毫秒內,成本與速度對標社群平台現有的分類器。
  • Lambda 擬募 40 億美元,積壓訂單 500 億 — 據 WSJ,Lambda 以 145 億美元投前估值募資最多 40 億美元,可能是 2027 年 IPO 前最後一輪;積壓訂單從 6 月的 150 億美元增加到 9 月的 500 億,大部分增量來自一筆 350 億美元的承諾。
  • AI agent 的下一關:網站肯不肯讓它進門 — Muse 在 Walmart 結帳時常卡在「驗證你是人類」的按鈕,Walmart 說不是故意的,它還是 Muse 的合作夥伴;Meta、Walmart、Stripe、Sierra 等公司已開始制定讓企業與個人 agent 對接的開放標準。
  • Brut:約 120 行的 POSIX shell 指令分派器 — Sam Stephenson 的 Brut 是單檔 POSIX shell script,像 Git CLI 那樣依檔名和第一個參數,把 myprog build 分派到 libexec/myprog-build,除了 POSIX 基本工具沒有其他相依。

中文技術圈#

開源精選#

nanaism/yomiyasu — Python | ⭐ 1.6K 把 AI 生成的日文潤飾成自然日文的 Agent Skill。

storytold/filmcraft — Rust | ⭐ 1.6K 用純 Rust 淨室重新實作 Adobe Premiere Pro 的開源專案。

deadinside28/bloodborne_pc — C++ | ⭐ 1.2K 讓 PS4 版《血源詛咒》v1.09 原生跑在 x86-64 Linux,渲染轉成 Vulkan,支援 FSR 3.1/4,實驗性但可玩。

storytold/lightcraft — Rust | ⭐ 1.2K 用純 Rust 淨室重新實作 Adobe Lightroom 的開源專案。

lucasmarkes/hairline — TypeScript | ⭐ 787 六個會跟著滑鼠游標反應的等角線稿人物,可用在 React 或任何 DOM 環境。

影音精選#

I love Ultrafast (it’s unusable)#

2026-10-06 · Theo (t3.gg)

Theo (t3.gg)

Theo 實測 GPT-6 Astra 的 Ultrafast 模式,速度快到像在即時改 App,帳單和額度消耗也一樣驚人。

  • 他用 Ultrafast 做一個 App,約 1.5 分鐘出第一版能用的草稿,同樣任務 Opus 5.5 要約 15 分鐘
  • 輸出價從每百萬 token 50 美元變成 300 美元(6 倍),cache write 是 75 美元
  • 審兩個小 PR 就燒掉 600 美元,他的結論是值得體驗一次,不適合天天用

13 Businesses for the Age of AI#

2026-10-06 · Greg Isenberg

Greg Isenberg

Greg Isenberg 獨白,列出他認為 agent 時代還值得做的 13 種生意,核心是先在資產和分發管道上卡位。

  • 先做分發:用小眾資訊養出受眾,再做產品,他稱為 ACP funnel(audience、community、product)
  • 把通用模型包成懂特定產業的系統,例如給貨運經紀用的 agent 作業系統
  • 實體資產仍有價值:有粉絲的實體商品、升級版公共桑拿、倉庫等不動產,以及被忽略的高齡客群

Why Venture Capital Has to Beat the Mag 7#

2026-10-06 · 20VC

20VC

Menlo Ventures 的 Venky Ganesan 說,AI 新創每一步都在付錢給 Nvidia、雲端大廠和模型公司,創投得拿出比公開市場更好的報酬才有存在的理由。

  • 幾乎所有創投標的都要付錢給 Nvidia、hyperscaler 與基礎模型公司
  • 這些公司在公開市場用零費用的指數基金就買得到
  • 所以創投的 IRR 要比公開市場高出 1,000 個基點,才說得過去

今日觀察#

Mistral 說 Claude Opus 5.5 和 GPT-6 Astra 在一項重現漏洞的測試接近零分,原因是拒答,Large 4 在同一項拿到 82%。Nathan Lambert 同一天寫道,目前公開紀錄裡大多數網路攻擊用的是閉源模型,要為資安禁開放權重,邏輯上也得禁掉閉源模型的公開 API。蘋果從另一端下手,把 macOS「完全取用磁碟」的授權改得更明確,起因是 Meta Muse 在使用者沒授權的情況下讀到訊息。OpenAI 和 Ironclad 的合作則說明模型怎麼學會操作專業軟體:11 個任務、每題最多 50 條評分標準、一個能反覆練習的環境。我的看法是,模型會做什麼越來越取決於誰提供訓練環境和評分標準,agent 能碰什麼則交給作業系統和平台的權限來管,這兩邊今天都還在補。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有