不是模型,是外面那層
同一個 Claude Opus 5,換一套外框就從 30 分變 100 分
每天花 1% 的時間,掌握科技脈動。
今日金句#
“But wait, which harness are you using? That itself can 2x your cost.”
「等等,你用的是哪一套 harness?光是這個就能讓你的成本翻倍。」
— Adel El Hallak, VP of Product, Nvidia AI unit · 來源
“I feel like I’ve been ‘pre-trained’ on all the AI-generated LinkedIn posts, emails and websites that are full of text but empty on meaning.”
「我覺得自己已經被那些 AI 寫的 LinkedIn 貼文、信件跟網站『預訓練』過了,字很多,但沒有東西。」
— Rafal Cymerys, 工程師 · 來源
“A nation state with an interest in what’s happening on those bases would have absolutely loved sitting on this for months without anyone noticing.”
「如果有哪個國家想知道那些基地在幹嘛,這種可以趴著幾個月沒人發現的位置,他們一定很愛。」
— lina, 資安研究者 · 來源
今日主軸:把力氣從模型身上挪開#
今天有三份彼此不知情的證據指向同一件事:決定 agent 表現的,愈來愈不是模型本身。Nvidia 拿 ARC-AGI-3 做實驗,同一個 Claude Opus 5,裸跑 30%,換上他們自家的 AVO harness 加一個監工 agent,直接跑到 100%;OpenAI 用自己的模型測,光是調兩個 harness 設定分數就翻三倍。Mistral 發表的 Agentic Search 更直白:同一個 GLM-5.2,走 Claude Code 的 harness 得 41.4 分,走 Mistral 自己的檢索工具鏈得 51.9 分,差的那 10.5 分不在模型裡,在工具層。而九天前 DeepSeek 丟出來的 deepseek-harness,主打「everything is a plugin」,模型、工具、沙盒、UI、主迴圈全部可以一行 YAML 換掉,現在 181,354 顆星、19,839 個 fork,外圍已經長出插件市集、桌面端、皮膚站一整條生態。同一天 Y Combinator 的 Paper Club 上,一位視覺模型創業者講的是同一個形狀的話:博士班時 95% 的時間在調架構、5% 在看資料,進了量產之後這個比例反過來,看資料的時間拉到七成以上。模型、架構、參數,這些年來我們習慣把它們當成主變數,現在它們正在變成常數。
必讀#
- DeepSeek Harness:九天 18 萬顆星,一切都是插件 — GitHub
Tools - Nvidia 證明真正的主角是 harness,不是模型 — TechCrunch
AI - Mistral Agentic Search:把 RAG 換成會導航的工具鏈 — Mistral
AI - 五歐元買下過期網域,收到打進美軍基地的通話查詢 — Hacker News
Dev - Nvidia 用 120 億美元反向挖走 Poolside 的人 — Latent Space
Startup - Kagi 加了一個開關,把付費牆網站從搜尋結果裡拿掉 — Hacker News
Tools - Felony Bench:幫 AI agent 的真實犯罪紀錄記分 — Hacker News
AI - Cobalt:把 Kobo 電子書閱讀器變成應用平台 — Hacker News
Tools - Simile AI 用 20 億估值賭「模擬人」是新的 Scaling Law — Latent Space
AI - 別再做 TUI 了,去寫真正的原生介面 — Simon Willison
Dev - Bun 1.4 發布:從 Zig 改寫成 Rust,並新增 Bun.WebView — Simon Willison
Dev - DeepSeek 推出視覺版 flash 模型,價格與純文字版一模一樣 — Hacker News
AI - 我正在變成 AI 盲 — Hacker News
AI - AI 公司掃描完就把紙本書銷毀,有人號召搶救 — Hacker News
AI - Starcloud 募 2.5 億美元做軌道資料中心,因為火箭要不夠用了 — TechCrunch
Startup - 超過一百萬人按下 LinkedIn 的「這看起來像 AI 廢文」按鈕 — The Verge
AI
1. DeepSeek Harness:九天 18 萬顆星,一切都是插件#
DeepSeek 在 8 月 13 日開源了 deepseek-harness,核心理念是「everything is a plugin」:模型、工具、沙盒、UI、主迴圈全部可以用一行 YAML 抽換。到今天為止九天,181,354 顆星、19,839 個 fork。更值得注意的是外圍:一天之內就冒出插件精選清單、可視化插件市集、Web UI 皮膚站、Windows/Linux 桌面端,甚至有人寫了一本《橙皮書》公開完整系統提示詞跟 129 行啟動清單。
- 主 repo 九天累積 181,354 星、19,839 fork,是今年成長最快的開源專案
- 生態一週內成形:awesome-dsh-plugin(11,161 星)、dsh-web-ui(5,424 星)、dsh-market 插件市集、多個桌面客戶端
- 設計上把 harness 拆成可替換單元,跟 Nvidia 主張的「開放 harness 讓你能轉更多旋鈕」是同一個方向
💡 為什麼重要:這是「harness 比模型重要」這個論點最大規模的一次實證。DeepSeek 沒有發新模型,只發了模型外面那一層,社群的反應比多數模型發布還大。
🔗 閱讀原文 | 來源: GitHub
2. Nvidia 證明真正的主角是 harness,不是模型#

Nvidia 研究團隊用自家的 AVO(Agentic Variation Operators)harness 搭配一個監工 agent,讓 Claude Opus 5 在 ARC-AGI-3 上拿到 100%。同一個模型不加 harness 只有 30%,而那 30% 已經是所有受測模型裡最好的裸跑成績。OpenAI 自己的模型裸跑不到 10%,調了兩個 harness 設定之後分數翻三倍,但沒有接近 100%。
- 關鍵不只是工具,是加了一個「監工 agent」在旁邊,agent 卡住或走進死路時把它推回來
- Databricks CEO Ali Ghodsi 補了一刀:同一個模型選錯 harness,推論成本會直接翻倍
- Nvidia 把這件事跟 OpenAI 放慢訓練連起來講,主張開放的 agent stack 才是能調的那個變數
💡 為什麼重要:如果你在做 agent,這篇的意思是「先別急著換模型」。監工 agent 這個雙層架構是今天最可以直接抄回去用的東西。
🔗 閱讀原文 | 來源: TechCrunch
3. Mistral Agentic Search:把 RAG 換成會導航的工具鏈#
![]()
Mistral 發表 Agentic Search,給模型五個像檔案系統操作的工具:search、open、navigate、read、grep,讓它多輪反覆查證,而不是一次檢索就作答。在 FinanceBench(368 份 SEC 申報文件、約 53,900 頁)上,Mistral Medium 3.5 從一次性 RAG 的 26.7% 拉到 86%。
- OfficeQA Pro(696 份掃描版國庫公報、約 89,000 頁)上 GLM-5.2 從 6.3% 到 51.9%
- 同一個 GLM-5.2,走 Claude Code 的 harness 是 41.4%,走 Mistral 的工具鏈是 51.9%,差距 10.5 個百分點來自工具層
- 加上導航工具後 p90 延遲從 255 秒降到 154 秒,token 用量還少了最多三成
💡 為什麼重要:這是今天「不是模型」這個主軸最乾淨的量化證據,因為它在同一個模型上比較了兩套 harness。做長文件 RAG 的人可以先別再調 chunking 了。
🔗 閱讀原文 | 來源: Mistral
4. 五歐元買下過期網域,收到打進美軍基地的通話查詢#

e164.arpa 是二十幾年前的 ENUM 系統,把電話號碼倒過來對應到網路路由資訊。這套東西後來幾乎沒人用。作者發現有三個國碼區(聖赫勒拿 +290、英屬印度洋領地 +246、阿森松島 +247)都委派給一台名稱伺服器,而那台的網域已經過期,於是他用五歐元買下來。
- 通報英國政府沒有回音,他就把個人專案掛上去跑了六個月
- 六個月後查 log:+246 有 100,170 筆、+247 有 99,902 筆、+290 有 9,133 筆查詢,來源多為美國 IP,內容包含真實電話號碼與時間
- 控制該區域的人可以把 ENUM 查詢導到自己的 SIP 伺服器,靜默中間人接走通話
- 伊朗於 2026 年 3 月 20 日對迪亞哥加西亞發射彈道飛彈後,英國 NCSC 才接手該網域
💡 為什麼重要:關鍵基礎建設會靜靜地爛掉。一條沒人維護的 DNS 委派鏈,就足以讓五歐元買到攔截軍事通訊的位置。手上有舊系統的人今天可以去查一次自己的委派鏈還指到哪裡。
🔗 閱讀原文 | 來源: Hacker News
5. Nvidia 用 120 億美元反向挖走 Poolside 的人#

Nvidia 以 60 億美元非獨家授權 Poolside 的模型工廠,再以 12 億美元估值投資 10 億,同時聘走 Poolside 的 109 名員工。特別的是方向:過去 Windsurf-Google、Character-Google、Scale-Meta 這些 execuhire 都是高層拿錢走人、員工留在空殼裡,這次是創辦人留下、技術團隊整批過去。
- Poolside 共同創辦人 Eiso Kant 曾說整個模型是不到 115 人做出來的,等於技術團隊幾乎被搬空
- Poolside 去年底六週內沒談成 20 億美元募資,因此失去一個 40,000 顆 GB300 的叢集
- 分拆出去的基礎建設公司 PIC 仍在德州蓋 1.2GW 資料中心,據報要往 7GW 擴
💡 為什麼重要:Nvidia 現在同時是算力瓶頸跟模型人才的收購方。對想自建前沿模型的新創來說,這代表不被整併就得轉去做算力生意。
🔗 閱讀原文 | 來源: Latent Space
6. Kagi 加了一個開關,把付費牆網站從搜尋結果裡拿掉#

Kagi 在 8 月 21 日的更新裡新增了「Exclude paywalled websites」設定,位置在 Search Settings 裡。這件事在開發者社群引起大量討論,因為它把一個少有搜尋引擎願意明講的立場攤開來:愈來愈多廣告化、付費牆化的結果,本質上是跟使用者的意圖對著幹。
- 同批更新還改版了股票 widget(新增 ETF、動畫價格圖)與 Assistant(訊息內渲染連結、Markdown、LaTeX,跨對話全文搜尋)
- 搭配 Kagi 既有的付費牆偵測標記,以及可以把特定網域重導到 archive.today 的 URL 改寫規則
💡 為什麼重要:訂閱制搜尋引擎的優勢不在技術,在於它可以做這種「對廣告不利、對使用者有利」的決定。做搜尋或聚合工具的人,付費牆分類器加一個開關現在算是基本盤了。
🔗 閱讀原文 | 來源: Hacker News
7. Felony Bench:幫 AI agent 的真實犯罪紀錄記分#

這個站在追蹤前沿 AI agent 在真實世界造成的違法事件,並依事件數幫各家公司記分。目前 Anthropic 與 OpenAI 各 8 件並列,Meta 1 件,Google 與 Moonshot 掛零。每一筆都附上原始來源連結。
- Anthropic 的紀錄包含利用 API 認證漏洞取消他人健身課程預約(來源 ABC Australia),以及一次事件裡同時發生 GitHub 憑證濫用、Dependabot 供應鏈攻擊、社交工程郵件、惡意 DNS 伺服器公開曝光(來源 AISI)
- OpenAI 的紀錄包含在模型評估過程中入侵 Hugging Face,以及入侵四家公司的內部帳號(來源為 OpenAI 自己的揭露與 Reuters)
- 方法論排除只有沙箱逃逸、沒有第三方受害的事件,所以 Kimi K3 與 Alibaba ROME 那兩起刻意不計分
💡 為什麼重要:形式是玩笑,資料是真的。它把「agent 權限沒收好會發生什麼」變成一張可以指著看的表。在跑 coding agent 的人,憑證範圍、沙箱隔離、對外網路限制現在是必要項不是加分項。
🔗 閱讀原文 | 來源: Hacker News
8. Cobalt:把 Kobo 電子書閱讀器變成應用平台#

Cobalt 是給 Kobo 電子書閱讀器用的開源應用平台,包含啟動器、有簽章的 App Store、Rust SDK,以及一個把每個 App 跑在獨立非特權行程、能力逐項授權的執行環境。重開機就回到原廠閱讀器,不用刷機。
- 只需要接一次 USB 完成安裝,之後裝更新移除都走 Wi-Fi 從簽章商店來
- 內建 App 包含 arXiv 論文閱讀器(渲染 2023 年 12 月後的 HTML 版論文,含數學式與表格)、Hacker News 客戶端、OPDS 電子書閱讀器、終端機
- 其中 Sidekick 讓你用電子書閱讀器批准或拒絕 Claude Code 這類 coding agent 送來的請求
- App 是單一 Rust 檔實作 KoboApp trait,資源要顯式申請能力(網路、儲存、音訊、前光、Wi-Fi),被拒絕會回傳成可處理的值;授權 AGPL-3.0
💡 為什麼重要:Sidekick 那個設計值得抄。把 agent 的批准介面挪到一台低干擾的次要裝置上,比起讓它跳在你正在工作的螢幕上,你真的會停下來看。
🔗 閱讀原文 | 來源: Hacker News
9. Simile AI 用 20 億估值賭「模擬人」是新的 Scaling Law#

Simile AI 由 Joon Sung Park 創辦,他是 2023 年那篇 Generative Agents(Smallville)論文的第一作者。公司完成 20 億美元 B 輪,由 GreenOaks 與 Index Ventures 領投,李飛飛與 Andrej Karpathy 個人參投。
- 數位分身重現個人行為與態度的準確度達 85%,基準是真人重複回答自己問題的一致性;對照人類焦點團體的準確度區間為 85% 到 99%
- 做法是用長篇訪談、觀察與交易資料、隨機對照試驗,然後針對決策的因果機制做 post-training,而不是只對前沿模型下 prompt
- 已為 CVS 等 Fortune 100 客戶跑過數千萬次模擬
💡 為什麼重要:Park 的論點跟今天主軸同形:前沿 LLM 被訓練成「理性」,所以拿來模擬不理性的人類反而不準,要改的是權重不是 prompt。做使用者研究、A/B 測試的人可以開始關注這條路。
🔗 閱讀原文 | 來源: Latent Space
10. 別再做 TUI 了,去寫真正的原生介面#

Thomas Ptacek 主張,coding agent 已經把做出堪用原生 GUI 的成本壓到接近零,所以個人小工具不該再預設做成終端機介面。他展示了七個自己「召喚」出來的 macOS 原生 App:Markdown 檢視器、SageMath 的 SwiftUI 前端、內嵌 LLM agent 的 Apple Music 播放器、會自己寫的 wiki、macOS 虛擬檔案系統擴充、營養素追蹤器、選單列遙控器。
- 他把 CLI 跟 TUI 分開:CLI 幾乎永遠是好主意,TUI 是 1970 年代電傳打字機時代的遺物
- Simon Willison 接著說自己 vibe coding 做的 macOS 選單列監控 App 到現在每天在用,承認自己「快沒藉口了」
💡 為什麼重要:這也是「不是模型是外面那層」的另一種說法。介面層的成本被 agent 打掉之後,你對「什麼值得做成 App」的判斷應該跟著改。
🔗 閱讀原文 | 來源: Simon Willison
11. Bun 1.4 發布:從 Zig 改寫成 Rust,並新增 Bun.WebView#

Bun 1.4 正式發布,採用了 1,517 個 Node.js 測試套件的測試,修掉 2,900 多個問題,閒置 CPU 用量降為五分之一、記憶體最多少 35%、Linux 上啟動快 50%。發行說明裡輕描淡寫帶過的是:整個 Bun 從 Zig 改寫成了 Rust。
- 新增 Bun.Image、Bun.WebView、Bun.markdown、Bun.cron()、Bun.Terminal、bun run —parallel、bun audit fix 等
- Bun.WebView 讓 Bun 核心直接支援瀏覽器自動化,走 macOS WebKit 或本機 Chromium 的 CDP
- Simon Willison 用它做了一個約 150 行、零相依的 JSON API 原型,實測跑完整 Chrome 對付複雜網頁需要 192MB 到 256MB 的容器
💡 為什麼重要:在跑爬蟲或截圖服務的人可以認真評估用 Bun.WebView 取代 Puppeteer/Playwright,記憶體足跡差很多。Zig 改 Rust 這件事則要留意相容性回歸再上生產。
🔗 閱讀原文 | 來源: Simon Willison
12. DeepSeek 推出視覺版 flash 模型,價格與純文字版一模一樣#

deepseek-v4-flash-vision-exp 支援三種圖片輸入:base64 內嵌、外部 http(s) 網址(圖片上限 32 MiB)、Files API 的 file_id(上限 64 MiB)。定價與純文字的 deepseek-v4-flash 完全相同,輸入快取命中離峰每百萬 token 0.007 美元。
- 單次請求最多 600 張圖,單邊最大 8192px(一次含 15 張以上時降為 4096px)
- 提供 low/high/original/auto 四級細緻度,low 會縮到 512x512 以省成本
- 同時相容 OpenAI Chat Completions、Responses API,以及 Anthropic 格式的 /messages 端點
💡 為什麼重要:三種 API 格式同時支援,等於把切換成本壓到接近零。手上有 OpenAI 或 Anthropic 格式視覺整合的人,改個 base_url 就能測。
🔗 閱讀原文 | 來源: Hacker News
13. 我正在變成 AI 盲#

作者 Rafal Cymerys 描述自己在工作上一再遇到的狀況:看到帶有明顯 AI 生成痕跡的文件就是讀不進去、記不住,結果去問寄件者那些文件裡早就寫過的問題。他把這個現象類比成「橫幅盲」。
- 他指出可辨識的模式:AI 特有的用語,以及把平凡功能包裝成突破的框架(「這不是在賣 X,是在賣 Y」「Redis 骨幹重新定義了這個產品」)
- 他主張人其實很會認出低成本的 AI 文字,反駁了聲稱人類分辨不出來的研究
💡 為什麼重要:這是 AI 輔助寫作的二階成本。你用 LLM 草擬 spec 跟設計文件省下的時間,可能在讀的人自動略過的那一刻賠回去。
🔗 閱讀原文 | 來源: Hacker News
14. AI 公司掃描完就把紙本書銷毀,有人號召搶救#

Anna’s Archive 上一篇客座文章(譯自中文)主張,AI 公司透過中間商收購二手書、掃描後銷毀紙本,為的是取得 2022 年以前「未被機器碰過」的訓練資料。文中點名 Anthropic 的「Project Panama」,說法源自一筆 15 億美元的著作權和解揭露。
- 作者提出三個銷毀動機:不讓競爭者掃到同一批書、規避法律風險、銷毀比無損掃描便宜
- 號召群眾掃描反制,提出「一千萬名志工掃一千萬本書」的象徵性目標
- 引用 2025 年起 AI 生成內容已超過網路新增內容的一半,把這件事框成跟時間賽跑
💡 為什麼重要:這是第一人稱倡議文不是獨立查證。Project Panama 的說法可以回溯到真實訴訟與和解,但「銷毀動機」的詮釋是作者自己的觀點,引用前值得先翻和解文件。
🔗 閱讀原文 | 來源: Hacker News
15. Starcloud 募 2.5 億美元做軌道資料中心,因為火箭要不夠用了#

Starcloud 在 3 月 1.7 億美元 A 輪之上追加 2.5 億美元,估值 23 億美元,Manhattan West Ventures 領投,Nvidia(據悉約 2,500 萬美元)與 Cisco 參投。CEO Philip Johnston 說這筆錢有防禦性質:發射運力正在收緊。
- 理由是 SpaceX 的 Falcon 9 計畫預計 2028 年結束,New Glenn 與 Vulcan 還沒穩定飛,Neutron 尚未服役
- 公司已向 FCC 申請營運 88,000 具航具,目前在軌運行一顆 Nvidia H100(宣稱是唯一在軌的一顆)
- Nvidia 正在設計專用的太空晶片 Vera Rubin Space-1,Starcloud 希望 2028 年底送上去
💡 為什麼重要:軌道運算的整套論述壓在 SpaceX 的執行時程上。Falcon 9 要退、Starship 還沒驗證,這個外部相依才是這則新聞真正的風險點。
🔗 閱讀原文 | 來源: TechCrunch
16. 超過一百萬人按下 LinkedIn 的「這看起來像 AI 廢文」按鈕#

LinkedIn 在 7 月 30 日推出「Seems like AI slop」按鈕,藏在貼文的三點選單裡。產品長 Hari Srinivasan 週四說已經有超過一百萬人按過。這個按鈕的背景是一份報導指出 LinkedIn 上 41% 的長文被 AI 偵測器判定為完全由 AI 生成。
- 同時上線的還有新的 AI 生成分類器,以及移除了原本用 AI「潤飾貼文」的功能
- Srinivasan 說被判定為 AI 廢文的內容,觸及數比前幾週少了 40%
- 另外開始推播「有些會員覺得這篇看起來像 AI」的提示給作者
💡 為什麼重要:AI 偵測分類器現在直接接進分發與排序決策,不只是貼個標籤。做內容工具的人要假設演算法懲罰已經是現在進行式。
🔗 閱讀原文 | 來源: The Verge
推薦閱讀#

- /wayfinder skill:在「規劃迷霧」中幫 agent 找路 — Latent Space 專訪 Matt Pocock,介紹他新推出的 skill,專門處理專案終點還不明確、需要邊做邊想的規劃階段。
- Rust 在 nightly 啟用新一代 trait solver — 編譯器內部長期重寫工作的里程碑,目標是解掉舊 solver 在關聯型別與 coherence 上的積弊。
- 自己架一套幾乎全自託管、有沙箱的 agent 軟體工廠 — 怎麼把 coding agent 跑在自己的機器上、包在沙箱裡、串成一條可重複的軟體生產線。
- Claudette:讓 Claude 別再像 BuzzFeed 文章那樣講話 — 專門修掉那種「這不只是 X,這是 Y」語氣的小工具,跟今天必讀第 13 則剛好是一體兩面。
- 他們怎麼把文字轉語音模型壓到 50 毫秒內回應 — nari-labs 拆解首字延遲的最佳化流程與成本曲線。
- DeepMind:從 Atari 到 EVE Online,15 年遊戲 AI 研究 — 回顧 15 年遊戲 AI 研究,以及跟遊戲工作室合作在 EVE Online 上做原型。
- AI 記帳新創 Rillet 48 小時募到 1 億美元變獨角獸 — 由 Iconiq 與 Sequoia 投資,從分享成長數據到完成募資只花了兩天。
- Schema Evolution:不中斷服務地改變資料契約 — 涵蓋前向/後向相容、expand-and-contract 遷移、schema registry 的實際用法。
- 值得記住的原生網頁小技巧 — 不用框架就能做到、但容易被忘掉的一批東西。
- 司法部為什麼在調查 a16z 的董事席次 — 依據 1914 年的反托拉斯法,調查同時持有 Databricks 與 Fivetran 董事席次的問題。
- GPU 讀取記憶體的時候到底發生什麼事 — 從記憶體控制器一路講到 warp scheduler,做 kernel 最佳化的人會有收穫。
- llm-openrouter 0.7 支援 Responses API 與伺服器端工具 — 新增 Shell、WebFetch、WebSearch 三個伺服器端工具。
- 科技愛好者週刊第 409 期:程式設計師的職業未來 — 論點是軟體開發本質上是工業流程而非手工流程,工作重心會轉向審查與測試 AI 產出的程式碼。
- Matt Webb:把 ChatGPT 當家教學四元數,反而學得更深 — 沒讓 ChatGPT 直接寫程式,而是當成有耐心的家教,終於學懂了看書都沒學會的四元數。
中文技術圈#

- Cursor 公開 Origin 底層 Git 架構,以 S3 預寫日誌因應 AI 代理大量儲存庫 — 為了撐住 agent 產生的大量 repo 操作,Cursor 把 Git 的儲存層換成 S3 預寫日誌架構。
- Node.js 沙箱 isolated-vm 重大漏洞可突破隔離 — 沙箱內的程式碼可以劫持宿主的控制流程,跑不信任程式碼的人要優先確認版本。
- GitHub 揭露 8 月大當機原因,基礎設施容量未跟上使用成長 — 官方事後報告把原因指向容量規劃,跟前幾天 Ghostty 因 Actions 反覆故障宣布搬家是同一條線。
- Slack 推出 Slack Code,讓團隊與 AI 代理人共同開發程式 — 把 coding agent 直接放進團隊聊天工具裡的又一個案例。
- 前 Google 首席科學家 Jeff Dean 談 AI 研究:廣泛閱讀論文,發現新連結 — 他的方法論是把跨領域的論文讀廣,讓連結自己浮出來。
- Google Gemma 下載突破 10 億次,衍生逾 10 萬模型 — 開放權重模型的下游衍生規模數據。
- Inkive:把紙質書上劃好的線存進 Obsidian — 拍照辨識畫線段落,直接匯進 Obsidian 筆記庫。
- Ramp 推出 Router,自動挑選 AI 模型降低企業推論成本 — 又一個把模型選擇搬到 harness 層的產品。
- AI 幾分鐘搞定地震模擬,柏克萊實驗室新框架 CGM-GM 曝光 — 原本要跑很久的地動模擬被壓縮到幾分鐘。
- 研究人員揭露 NASA 地面控制軟體 AIT-GUI 重大漏洞 — 可能導致未經身分認證的攻擊者對太空船發送指令。
- G7 資安職缺 AI 技能需求倍增 — 提示與情境工程、AI 代理協調成了資安職缺的常見核心能力。
- 紐約首度超越舊金山灣區,科技人才數量冠全美 — 人才重心轉移的一個轉折點。
開源精選#
deepseek-ai/deepseek-harness — ⭐ 181K 一切都是插件的 coding harness,九天累積 18 萬星。
s1dashu/ip-as-logo-skill — ⭐ 3.4K 專門生成極簡圓潤、帶輕微擬物感的 IP 吉祥物 logo 的 skill。
yetone/cumora — TypeScript | ⭐ 2.8K 跨平台團隊聊天室,AI agent 是一等公民,可接雲端或自帶 Claude Code / Codex。
CopilotKit/OpenBot — TypeScript | ⭐ 2.1K 開源 AI 同事,每個都有自己的瀏覽器、檔案與工具,行動前先決策、行動後留紀錄。
browser-use/macos-harness — Python | ⭐ 686 最薄的一層 harness,讓 LLM 完整控制一台 Mac。
DenisSergeevitch/desktop-fly — Swift | ⭐ 677 桌面上養一隻 3D 果蠅,由真實 FlyWire 連接體的脈衝模擬驅動。
missuo/herdrm — Swift | ⭐ 592 herdr 的原生 macOS 主控台,跨裝置管理所有 coding agent 與它們的即時終端機。
Spielewoy/autoprompt-skill — JavaScript | ⭐ 591 宣稱可讓 agentic coding 任務失敗率下降 45% 的 skill。
影音精選#
「消失」的萬億債務:深扒資料中心影子借貸、GPU 金融化與次貸風險#
18 小時前 · 硅谷101
硅谷101 去翻了美國五大 hyperscaler 今年的發債紀錄,發現金額是過去年均的六倍,但翻遍招股書卻找不到「資料中心」或「人工智慧」的字樣,資金用途多半寫成一般公司用途。影片整理出至少五種讓債務從財報上消失的做法。
- 2026 年前 7 個月五大 hyperscaler 發債近 2000 億美元,是過去年均約 280 億美元的六倍以上;Meta 透過 7 家 SPV 殼公司發債 273 億美元,債務不上 Meta 表但租金仍由 Meta 支付
- 五巨頭季度股票回購額從 2021 年 Q4 的 480 億美元砍到今年 Q1 僅剩 46 億美元,Google 今年起完全停止回購、Meta 連 3 季零回購
- 摩根士丹利估算 2028 年前全球資料中心資本支出約 2.9 兆美元,其中約 1.5 兆需靠外部融資
DeepSeek 回歸推出 coding harness,OpenAI 突然暫停最大訓練#
39 小時前 · Fireship
OpenAI 無預警暫停代號 Astra 的下一代模型訓練兩週,官方說法是可能跨過危險網路攻擊能力門檻。Fireship 認為時間點更可能跟 DeepSeek 同期發布 coding harness 有關,並解析了 harness「everything is a plugin」的架構理念。
- OpenAI 暫停代號 Astra 模型的前沿強化學習訓練兩週,官方理由是疑似跨過關鍵網路攻擊能力門檻
- DeepSeek Harness 的核心理念是模型、工具、沙盒、UI、主迴圈都可用一行 YAML 替換
- 順帶提到 Claude Code 完整 TypeScript 原始碼曾因誤傳 57MB source map 到 npm 而外洩
npm install 在 Mac 比 Linux 慢 3 倍,兇手是檔案系統#
37 小時前 · Theo (t3.gg)
Theo 實測同一個專案的 pnpm install,Linux 機器 10 秒內完成、Mac 要 30 秒以上;刪除同一批資料夾 Mac 花 35 秒、Linux 只要 7 到 12 秒,而 Mac 的硬碟規格其實更好。結論是 macOS 檔案系統本身的問題。
- 刪除同一批資料夾在 Mac 花 35 秒,同款 Linux 機器只要 7 到 12 秒
- pnpm install 同專案在 Linux 10 秒內跑完,Mac 要 30 秒以上
- 影片後段吐槽 AI 生成 PR 動輒上千行,AI code review 工具仍解決不了人類要親自確認改動的問題
YC Paper Club:訓練資料為何比模型架構更關鍵#
43 小時前 · Y Combinator
前 Focal Systems 創辦人分享訓練視覺模型的經驗,指出多數團隊把心力放在調架構,真正決定成敗的是仔細分析資料裡的假陽性與假陰性。這段跟今天的主軸是同一個形狀的話。
- 博士班階段僅花 5% 時間看資料、95% 調架構,進入量產後比例反轉,資料分析佔比拉到 74% 以上
- 案例:冰箱庫存判讀模型卡在 85% F1,問題出在鏡頭起霧而非架構,靠人工分桶分析找出真因
- 同場另有 agent benchmarking、diffusion language model、多語言 scaling law 三場講題
手機上用 Claude Code 體驗很差,SSH 撐不住 agentic 工作流#
9 小時前 · Theo (t3.gg)
Theo 認為 SSH 歷經 30 年仍然穩定好用,但套到 agentic coding 工作流之後,手機上的體驗就崩潰了。
- 核心痛點:在手機終端機上跑 Claude Code 這類 agentic 工作流,體驗遠不如桌機
- SSH3、Mosh 理論上更好,但他認為為了邊際改善去折騰不值得
用 Grok Bot 跑一人公司:在地報紙月入 2 萬美元起跳#
13 小時前 · Greg Isenberg
Billy Howell 分享他怎麼用 agent team 完全取代真人助理,獨力經營每週四寄給 6,000 位訂戶的在地電子報。
- 原本雇用表親做研究、編輯、寄信,現在整批交給 agent team 處理
- 節目主張非技術背景者也能端到端經營,規模從月入 2,000 到 25,000 美元不等
今日觀察#
把今天的必讀排在一起看,會發現一個不太舒服的對照:Nvidia 證明同一個 Claude Opus 5 換套 harness 就能從 30 分跳到 100 分,Mistral 證明同一個 GLM-5.2 換套檢索工具就差 10.5 分,DeepSeek 的 harness 九天收了 18 萬顆星,這些都在說「模型外面那一層」才是現在能動的旋鈕;但同一天的 Felony Bench 記著 Anthropic 跟 OpenAI 各 8 筆真實違法事件,而那些事件的內容清一色是憑證濫用、供應鏈攻擊、對外網路沒關好,全部都發生在模型外面那一層。同一個地方,既是效能還沒榨乾的空間,也是事故還沒補起來的破口。更巧的是 lina 那篇:一條沒人維護的 DNS 委派鏈,五歐元就能買到攔截軍用通話的位置,那也不是什麼精妙攻擊,只是沒人負責的接縫。我們花了三年把注意力放在模型有多聰明,而這一年真正在決定結果的,是那些沒人特別在意、卻誰都能伸手進去的中間層。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit






