yii.
← Digest
EP144 · 2026年7月25日 星期六 · 15 min read

半價的前沿

最強的模型今天打了對折,但技術圈吵的不是誰更聰明

每天花 1% 的時間,掌握科技脈動。

今日金句#

“Opus 5 is our least prompt injectable model yet.”

「Opus 5 是我們到目前為止最難被提示注入的模型。」

— Boris Cherny, Anthropic 工程師 · 來源

“Those humming GPU farms have given us superpowers, but we still don’t use them to build better software.”

「那些嗡嗡作響的 GPU 農場給了我們超能力,但我們還是沒把它拿來把軟體做得更好。」

— Piotr Chmurzinski, 軟體開發者 · 來源

“If attackers and defenders have access to equally powerful AI, I see no reason to believe that cyber systems will become less secure over time.”

「如果攻擊方和防守方拿到的 AI 一樣強,我看不出資安系統會隨著時間變得更不安全。」

— John Thickstun, 資安研究者 · 來源

今日主軸:半價的前沿#

Anthropic 昨晚發布 Claude Opus 5,官方定位是「接近 Fable 5 的前沿智慧,價格只要一半」。數字撐得住這句話:ARC-AGI 3 拿到次佳模型的三倍分數,OSWorld 2.0 用三分之一出頭的成本超過 Fable 5 的最佳成績,CursorBench 3.2 在最高 effort 下只落後 Fable 5 不到 0.5%。最有畫面的是一個 Frontier-Bench 題目,給模型一張機器零件的手繪圖,但故意不讓它看到圖,Opus 5 乾脆自己寫了一套電腦視覺流程,從原始像素把幾何還原出來,其他模型試五次都做不出來。這則新聞在 Hacker News 一路衝到 1,200 分以上。

但今天真正有意思的地方,是它旁邊那幾則。Hacker News 首頁同時掛著〈如果寫程式已經被解決了,為什麼軟體越來越難用?〉、Nvidia 與 Meta 等 25 家公司連署反對管制開源權重模型、《衛報》一篇要大家對 OpenAI「失控 agent」故事保持懷疑的評論。三則講的都不是模型有多聰明,而是這些能力落在誰手上、算不算數。Codeberg 這週把「主要由生成式 AI 寫成」的專案擋在門外,同一週 Bun 創辦人展示他用 64 支 Claude agent 在 11 天內把 53 萬行程式從 Zig 搬到 Rust,成本 16.5 萬美元。智慧變便宜了,關於它的爭執反而變貴了。

必讀#

  1. Claude Opus 5 發布:逼近旗艦智慧,價格砍半 — Anthropic AI
  2. Nvidia、Microsoft、Meta 等 25 家連署:別過度管制開源權重模型 — CNBC AI
  3. FLUX 3 X Mimic:影片模型直接開進 Audi 工廠 — Black Forest Labs AI
  4. 如果寫程式已經被解決了,為什麼軟體越來越難用? — Hacker News Dev
  5. 我的監視器把 GitHub admin token 印在登入頁上 — Hacker News Dev
  6. 對 OpenAI 的「失控駭客 agent」故事保持懷疑 — The Guardian AI
  7. Bun 創辦人用 64 支 Claude,11 天重寫 53 萬行程式 — iThome Dev
  8. Buz:把 Bun 分叉回重寫前,砍掉 1.1 萬行死碼 — Hacker News Tools
  9. Boris Cherny:Opus 5 是最難被提示注入的一代 — Simon Willison AI
  10. Postgres LISTEN/NOTIFY 其實很能撐:6 萬寫入/秒 — DBOS Dev
  11. 每個工程師都該懂 SIMD — Lobsters Dev
  12. 印度政府要求 GitHub 下架藍牙聊天 App Bitchat — The Hindu News
  13. Codeberg 的分歧:禁掉 AI 寫的專案是好主意嗎 — Armin Ronacher Dev
  14. Claude Opus 5 深度評測:厲害,但也很煩 — Lenny’s Newsletter AI
  15. GitHub 搶先支援無狀態 MCP,遠端服務擴充免綁工作階段 — iThome Dev

1. Claude Opus 5 發布:逼近旗艦智慧,價格砍半#

Anthropic 於 7 月 24 日發布 Claude Opus 5,官方定位為「思慮周全且主動」的模型,智慧接近旗艦 Claude Fable 5 但價格只有一半,並成為 Claude Max 的新預設模型、Claude Pro 上最強的模型。在 Frontier-Bench v0.1 上它超越所有其他模型,效能是前代 Opus 4.8 的兩倍以上,而每題成本更低。安全面它刻意沒有訓練漏洞利用能力,在 OSS-Fuzz 上找漏洞的能力接近 Mythos 5,但把漏洞轉成實際攻擊的能力遠遠落後。

  • ARC-AGI 3(考從沒看過的新題型)分數是次佳模型的 3 倍;OSWorld 2.0 電腦操作測驗用略高於三分之一的成本超越 Fable 5 的最佳成績
  • CursorBench 3.2 在 max effort 下與 Fable 5 巔峰分數差距不到 0.5%,但每題成本只有一半
  • Frontier-Bench 有一題給模型機器零件手繪圖卻不讓它看圖,Opus 5 自行寫出電腦視覺流程從像素還原幾何,其他模型五次都失敗
  • cyber classifiers 的攔截頻率預期比 Fable 5 少約 85%,允許在原始碼中找漏洞,但擋掉二進位掃描、滲透測試與 exploit 生成

💡 為什麼重要:這一代把「智慧上限」的競賽換成了「每塊錢買到多少智慧」的競賽。對每天用 agent 寫程式的人來說,模型從貴到只能挑重點用,變成可以整天開著跑。

🔗 閱讀原文 | 來源: Anthropic

2. Nvidia、Microsoft、Meta 等 25 家連署:別過度管制開源權重模型#

7 月 24 日,包含 Nvidia、Microsoft、Meta、Palantir 在內的 25 家科技公司聯名致信政策制定者,呼籲不要對開源權重 AI 模型設下「過早的限制」。背景是月之暗面的開源模型 Kimi K3 在多項業界基準上超越美國尖端模型,引發美方監管關注。值得注意的是估值接近兆美元、正在準備 IPO 的 OpenAI 與 Anthropic 都沒有簽署。

  • 連署方主張「單靠封閉模型並不必然安全,它們一樣可能被攻破、被濫用,或以外界察覺不到的方式失效」
  • 白宮方面曾聲稱 Kimi K3 是從 Anthropic 技術蒸餾而來,財政部長已就 IP 竊取展開調查
  • Hugging Face 在遭入侵後,因為美國尖端模型的護欄擋掉了資安分析用途,最後改用中國開源模型 GLM 5.2 才完成鑑識

💡 為什麼重要:這封信把「開放 vs 封閉」從理念之爭變成了市場位置之爭,誰沒簽,比誰簽了更能說明問題。

🔗 閱讀原文 | 來源: CNBC

3. FLUX 3 X Mimic:影片模型直接開進 Audi 工廠#

Black Forest Labs 公布 FLUX 3 的機器人分支 FLUX-mimic,同一個多模態基礎模型同時處理圖像、影片、音訊與機器人動作,並已部署在真實的 Audi 工廠:把零件揀進料盤、把電子元件塞進很緊的治具、處理密封條與線材這類傳統自動化碰不了的軟性材料。團隊指出 95% 以上的訓練算力花在影片預測上,而正是這件事逼模型學會接觸、運動、重量與因果。

  • 加上動作解碼器後影片生成品質先掉約 10%,3,500 個訓練步就完全恢復,同一個 backbone 可以在內容生成與物理控制之間切換而不永久損失能力
  • FLUX-mimic backbone 在 NVIDIA RTX 5090 上端到端 80ms,與人類視覺反應時間相當;實際部署會讓預測與執行重疊以消除抖動
  • 凍結 backbone 的表現就已勝過先前的 vision-language-action 模型,微調後達到 SOTA 成功率,且會自然出現未經示範的失敗復原行為

💡 為什麼重要:如果一個模型同時能生成影片又能控制機器手臂,那它從來就不只是內容生成模型,而是一個關於世界怎麼運作的模型。過去四年砸在影片生成上的算力,正在變成實體世界的資產。

🔗 閱讀原文 | 來源: Black Forest Labs

4. 如果寫程式已經被解決了,為什麼軟體越來越難用?#

開發者 Piotr Chmurzinski 從日常挫折出發:銀行 App 要通過三次 FaceID 才能看到 3D Secure 畫面、Slack 會在他敲指令時搶走終端機焦點、車機系統的方向燈聲音會隨機消音、螢幕延遲一到兩秒。他的論點不是反 AI,而是指出開發工具變強的同時軟體穩定性反而退步,真正的瓶頸不在技術能力,而在組織的獎勵結構,修 bug 不會讓季度數字好看,也不適合放進董事會簡報。

  • 複雜度指數上升(抽象層、框架、基礎設施),穩定性卻倒退;作者形容 macOS 或任何仰賴的 App 更新現在是「恐懼的來源,而不是期待」
  • 即使拿到最新的 LLM 與充裕的 token 預算,整體軟體品質並沒有變好,指向誘因問題而非能力問題
  • 文章在 Hacker News 引發極為熱烈的討論,是當日討論密度最高的文章之一

💡 為什麼重要:這篇替今天所有「模型又變強了」的新聞踩了一次煞車。工具的上限提高,不等於成品的下限提高,中間隔著一整套沒有改變的獎勵機制。

🔗 閱讀原文 | 來源: Hacker News

5. 我的監視器把 GitHub admin token 印在登入頁上#

一位研究者發現韓華 Vision(Hanwha Vision,原三星 Techwin)的監視器韌體裡帶著一組還有效的 GitHub admin token,對該組織數百個 repo 有管理權限。根因是 Vite 建置設定錯誤,把整個 CI 環境變數當成 JavaScript 變數傾印進編譯後的前端程式碼裡。研究者另外用韌體裡硬寫死、僅以 XOR 查表混淆的 AES 金鑰,成功解出約 500 份下載韌體中的 62%。

  • 同一組 token 重複出現在約 30 個檔案、跨越約 500 個韌體版本;任何開過這些攝影機管理介面的人,等於都被送過這組 token
  • CI 環境變數裡出現美國國防部網段的 IP;韓華集團同時生產 K9 自走砲與 SGR-A1 哨戒機器人
  • 韓華在 12 小時內完成修補,責任揭露流程有效運作

💡 為什麼重要:建置時把 process.env 整包倒出去,是一個現在還在大量重演的錯誤。IoT 韌體可以被下載、可以被解密,就該假設裡面的任何字串遲早會被讀出來。

🔗 閱讀原文 | 來源: Hacker News

6. 對 OpenAI 的「失控駭客 agent」故事保持懷疑#

資安研究者 John Thickstun 在《衛報》撰文,指出 OpenAI「失控 agent」的敘事,走的是它從 2019 年宣布 GPT-2 以來就在跑的同一套劇本:大聲宣稱 AI 有多危險,投資人聽到的是它有多強大。他提醒,那次測試中員工事前就被告知模型可能會突破沙箱,所以「失控」這個框架本身就有誤導性。他進一步指出真正的問題在於 OpenAI 與 Anthropic 用護欄限制資安用途,結果只有封閉模型廠商與美國政府能拿到不受限的 AI 做防守。

  • 2019 年 2 月 GPT-2 宣布不釋出後幾個月,Microsoft 投資 10 億美元,作者視為同一模式的起點
  • Hugging Face 被迫改用中國開源模型 GLM 5.2 做事件回應,因為 Fable 5 的護欄把它自己的防禦行為判定為禁止的資安用途
  • 作者主張只要攻守雙方拿到一樣強的 AI,系統長期只會更安全,因為 AI 相對人力便宜且可規模化

💡 為什麼重要:把「AI 很危險」與「所以只有我們能拿」這兩句話拆開來看,是今年判讀任何 AI 安全公告時最實用的一個習慣。

🔗 閱讀原文 | 來源: The Guardian

7. Bun 創辦人用 64 支 Claude,11 天重寫 53 萬行程式#

Bun 創辦人 Jarred Sumner 公開了把 53 萬行程式碼從 Zig 遷移到 Rust 的完整過程:用 64 支 Claude agent 協作,11 天完成,共 6,502 次 Git 提交,總成本約 16.5 萬美元。原本估算需要 3 位資深工程師投入一年。Rust 版通過 Linux、Windows、macOS 全部自動測試(4,174 個測試檔、139 萬次檢查),效能提升 2 到 5%,執行檔縮小 20%,順帶修掉 128 項舊問題。

  • 採對抗式審查,實作 agent 與審查 agent 分離,審查方不看實作邏輯只看結果,主動挑毛病
  • 尖峰時每分鐘產生約 1,300 行程式碼、58 次 Git 提交;團隊設計了 50 套工作流程分工改寫、除錯、審查
  • Sumner 的結論是 AI 沒有讓重寫成本歸零,而是讓一項原本太貴、太耗時而不可能啟動的工程變得可行

💡 為什麼重要:前置條件很關鍵,架構成熟、測試覆蓋夠厚、創辦人親自把關流程。少了任何一項,這個數字都複製不了。

🔗 閱讀原文 | 來源: iThome

8. Buz:把 Bun 分叉回重寫前,砍掉 1.1 萬行死碼#

開發者 jazzzooo 從 Bun 進行 Rust 重寫之前的最後一個 commit 分叉出 Buz,改用現行版本的 Zig 建置,達成一秒以內的增量建置。他把完整的 build graph(含 vendored 的 JavaScriptCore 原始碼)都寫進 build.zig,並在過程中刪掉超過 1.1 萬行完全沒有被使用的死碼。有趣的是,他自己也大量使用 LLM 進行開發,只是保留人類審查,並表示在程式碼整理到合理狀態之前不接受人類貢獻。

  • 基於 Zig master 加上自訂 patch 支援增量建置;原始 Bun 約 60 萬行程式碼,其中 1.1 萬行是死碼
  • 作者直言不認為任何人該犧牲理智去理清這 60 萬行的爛泥,但同時匯入 Rust 版 Bun 的所有新測試
  • 專案仍屬早期,尚未達生產可用,作者歡迎回報 bug 與特別誇張的程式碼案例

💡 為什麼重要:它跟上一則放在一起看才完整,同一份程式碼,一邊是「AI 讓不可能的重寫變可行」,一邊是「AI 留下的爛攤子得有人清」。兩邊都在用 AI。

🔗 閱讀原文 | 來源: Hacker News

9. Boris Cherny:Opus 5 是最難被提示注入的一代#

Anthropic 工程師 Boris Cherny 指出,比起各項 eval 分數,Opus 5 最讓他興奮的是抗提示注入(prompt injection)能力,在 PI evals 與紅隊測試中,Opus 5 都非常難被成功注入。他也直說這件事「有點被埋在系統卡裡」,細節在第 73 頁。Simon Willison 收錄了這段引言。

  • 提示注入是 agent 化應用最實際的攻擊面,任何讓模型讀取外部內容的流程都暴露在這個風險下
  • Anthropic 官方發布文的主軸放在跑分與成本,這項改進反而沒有被放到前面

💡 為什麼重要:如果你在跑會讀網頁、讀郵件、讀 issue 的 agent,這一項對你的實際影響可能比任何 benchmark 都大。

🔗 閱讀原文 | 來源: Simon Willison

10. Postgres LISTEN/NOTIFY 其實很能撐:6 萬寫入/秒#

DBOS 團隊反駁「LISTEN/NOTIFY 不能規模化」的流行說法。原本的瓶頸在於 Postgres 保證通知會依交易提交順序送出,因此需要一把全域排他鎖來序列化提交,讓吞吐量卡在每秒 2,900 次寫入。他們改成在記憶體中緩衝通知、定期批次 flush,並用輪詢作為行程崩潰時的後備,把吞吐量拉到每秒 6 萬次寫入。

  • 20 倍提升,延遲落在 15 到 100ms;在尖峰吞吐量下瓶頸變成 Postgres CPU 本身,而不是鎖競爭
  • Postgres 19 的相關 patch 處理的是另一個較窄的情境(大量 channel),與這個瓶頸不同
  • benchmark 程式碼開源在 dbos-inc/dbos-postgres-benchmark

💡 為什麼重要:「某某技術不能規模化」的說法,很多時候講的是某一種用法不能規模化。這篇是很好的反例,緩衝加輪詢的模式也能直接搬到別的專案。

🔗 閱讀原文 | 來源: DBOS

11. 每個工程師都該懂 SIMD#

Mitchell Hashimoto 主張 SIMD 被低估是因為大家覺得它太難,但常見情境其實有固定套路:廣播常數、一次跑一個向量、平行運算、歸約與儲存、處理尾端的零頭。他用 Ghostty 裡「找出一段可列印字元」的實際例子示範,加了 12 行程式碼換來端到端 5 倍加速。

  • ARM NEON 4 條 lane、AVX2 8 條、AVX-512 16 條;Ghostty 的例子是載入 8 個 u32 碼位、廣播 0xF 閾值、平行比較、以 AND 歸約後數尾端零
  • 值得用 SIMD 的前提是資料量要到數百、數千甚至數百萬位元組;小資料集不划算,而編譯器的自動向量化並不總是有效
  • 可參考 simdutf 與 simdjson;Zig 用 @Vector 與 @splat,其他語言有對應的 intrinsics

💡 為什麼重要:字串掃描、壓縮、影像處理、JSON 解析這類 CPU-bound 的大量迴圈,都是同一個模式。學會之後你會開始在自己的程式碼裡看到它。

🔗 閱讀原文 | 來源: Lobsters

12. 印度政府要求 GitHub 下架藍牙聊天 App Bitchat#

印度政府以資安疑慮為由,要求 GitHub 下架 Bitchat,一款由 Jack Dorsey 推動、透過藍牙 mesh 網路進行點對點通訊的聊天 App,設計目的正是讓人在網路被切斷或受限時仍能通訊。事件發生在當地抗議與網路管制的背景下。

  • 這是針對一個軟體專案本身的下架命令,而不是內容審查,對開源託管平台是重要的先例
  • 政府只以「資安疑慮」概括說明,未提出具體技術理由
  • Bitchat 不依賴網際網路基礎設施,在行動網路被限制時特別關鍵

💡 為什麼重要:做隱私或去中心化工具的開發者,應該預期自己會成為監管標的,並提前準備備援託管。

🔗 閱讀原文 | 來源: The Hindu

13. Codeberg 的分歧:禁掉 AI 寫的專案是好主意嗎#

Codeberg 修改條款,排除「主要由生成式 AI 寫成」的專案。Armin Ronacher 認為這在他們權利範圍內,但策略上有問題:「主要」一詞模糊且難以執行,在持續開發的程式碼庫裡幾乎不可能界定作者比例,結果是把判斷丟給版主與社群氛圍,反而讓中間地帶的人先退場。他認為與其設一條模糊的中線,不如乾脆畫死(完全不准 LLM 參與),或針對具體行為(自動化灌水、濫用資源)訂規則。

  • Codeberg 是會員自治的協會,正把自己定位為 GitHub 的歐洲替代品
  • Ronacher 指出社群的實際社交界線可能比書面政策更嚴苛,形成事實上的排除
  • 他主張 LLM 若用得好,反而能把權力從企業手上拿回來,開源社群不該分裂成兩個陣營

💡 為什麼重要:接下來一兩年,「這個專案是不是 AI 寫的」會變成很多平台的准入條件。規則寫得夠不夠清楚,決定它是防濫用還是防人。

🔗 閱讀原文 | 來源: Armin Ronacher

14. Claude Opus 5 深度評測:厲害,但也很煩#

Claire Vo 在 Lenny’s Newsletter 的 How I AI 節目中,把 Claude Opus 5 放進她的七模型盲測基準,與 GPT-5.6 Sol、Sonnet 5、Gemini 3.1 Pro 等一起比較。她的結論是「brilliant but annoying」:複雜推理表現出色,但個性上的怪癖在實際 coding 情境裡很明顯,甚至曾經拒絕處理 merge conflict。

  • 她開場直言已經對「每週都有新模型、新基準、新前沿智慧」感到疲乏
  • 評測強調峰值效能不等於使用者滿意度,行為怪癖會實際影響工作流程
  • 完整影音約 25 分鐘,有逐字稿

💡 為什麼重要:升級模型前值得先看的那種評測,它談的不是分數,是你每天要跟它相處的手感。

🔗 閱讀原文 | 來源: Lenny’s Newsletter

15. GitHub 搶先支援無狀態 MCP,遠端服務擴充免綁工作階段#

GitHub 的 MCP 伺服器提前支援預定 7 月 28 日發布的新版 MCP 規格:無狀態核心設計。新版把工作階段與初始化程序從協定層移除,改成每次請求自行攜帶協定版本、用戶端資訊與能力聲明,全部放進 HTTP 標頭。GitHub 同時移除了以 Redis 保存工作階段的設計。

  • 負載平衡器可以把不同請求分派到不同伺服器,不需要黏性工作階段,直接靠增加伺服器數量水平擴充
  • 登入、確認操作等互動流程改為獨立的 HTTP 請求
  • 所有官方一級 SDK 已推出測試版支援並維持向下相容,另提供相容性測試

💡 為什麼重要:自架遠端 MCP 服務的部署難度大幅下降,不必再建共用儲存或處理黏性連線。新專案直接上新規格比較划算。

🔗 閱讀原文 | 來源: iThome

推薦閱讀#

社群熱門#

中文技術圈#

開源精選#

andrewyng/openworker — Python | ⭐ 3.4K 吳恩達團隊的開源桌面 AI 同事,交付的是完成品(文件、Slack 回覆、整理過的收件匣)而不是聊天;自帶 API key 或接 Ollama 全本機跑。

Vincentwei1021/video-shotcraft — TypeScript | ⭐ 1.4K 給 Claude Code 與 Codex 的 AI 影片技能,用 Remotion 做電影感產品影片,內含 106 張分鏡配方卡與 161 組動態預覽。

Jakubantalik/thinking-orbs — TypeScript | ⭐ 931 專為 AI 與 agent 介面設計的點狀「思考球」載入指示器,六種狀態、兩種尺寸、自動深淺色。

Blaizzy/nativ — Swift | ⭐ 860 Mac 原生的本機 AI 應用,用一個 macOS App 就能聊天、開服務、監控並串接 MLX 模型。

pireel/pireel — TypeScript | ⭐ 710 開源、免後端的 AI 影片編輯器,專攻講話頭影片:分鏡、設計圖卡、動態字幕、瀏覽器內 WebCodecs 匯出,可由任何 agent 透過 MCP 驅動。

gnipbao/story-to-handdrawn-video — JavaScript | ⭐ 608 Agent 技能:把中文故事文案或排序好的圖片,轉成手繪日記漫畫風格的無聲 MP4 動畫。

CatsJuice/sticker-forge — JavaScript | ⭐ 520 有觸感的 WebGL 貼紙製作器,支援富文本、圖片上傳與可互動的撕開物理效果。

影音精選#

Opencode CEO 專訪:被 Anthropic 封鎖後,半年成長 20 倍#

19 小時前 · Y Combinator

Y Combinator

Opencode 是 Claude Code 的開源替代品,可以搭配任何模型。創辦人 Jay V 談公司如何在半年內成長 20 倍,以及 Anthropic 曾試圖封鎖他們反而助長聲勢的過程。他也提到產品在開發中國家特別受歡迎的原因。

  • 月活躍用戶約 1,300 萬,較年初成長 20 倍;每日處理約 7 兆 token,超過 OpenRouter 全站的 6 兆
  • 訂閱數約 16 萬,加上按量計費推估年營收約 3,800 到 4,000 萬美元
  • 印尼佔流量 4%、巴西 5%,因為每月 200 美元的訂閱對當地開發者太貴

Datadog CEO:兩個法國工程師如何打造監控整朵雲的公司#

13 小時前 · Y Combinator

Y Combinator

Datadog 共同創辦人 Olivier Pomel 在 YC Startup School Paris 分享早期故事,包括申請 YC 兩度被拒。他也談到工程團隊已經開始用 AI agent 重寫整套系統,以及他如何維持一家 8,000 人公司的誠實文化。

  • 申請 YC 被拒絕兩次,面試後被拒,後來連晚宴邀請都被取消
  • 他公開表示「兩季內我們不會再寫任何程式碼」,AI 已讓一位資深工程師在幾天內重建原本需要 6 人做半年的系統
  • 他堅持親自閱讀客戶支援票,作為維持大公司誠實文化的方法

FLUX 3 可能就是我們等的開源版 Sora 2#

10 小時前 · Matt Wolfe

Matt Wolfe

Matt Wolfe 速覽近期 AI 大事,包括 Opus 5 發布與 Black Forest Labs 的多模態模型 FLUX 3。他認為 FLUX 3 的真實物理表現、原生音訊與素材多樣性讓人重新感到興奮,即便在快速戰鬥動作等場景仍會出錯。

  • 他報告 Opus 5 的 ARC-AGI-3 分數從 Opus 4.8 的 1.5% 跳到 30%,agentic terminal coding 從 33 提升到 43,但社群也開始爭論該基準是否被針對性優化
  • FLUX 3 同時支援影片、原生音訊、圖片與機器人應用,並規劃開源權重
  • 快速動作場景仍會出現物理錯誤,但整體被他評為「我們應得的開源版 Sora 2」

2026 年最有價值的技能:管理一整隊 AI Agent#

15 小時前 · Greg Isenberg

Greg Isenberg

Greg Isenberg 訪談 Ryan Carson,他曾把 Treehouse 做到 110 名員工規模,現在以一人公司運營 AI 平台 Untangle。訪談拆解他怎麼同時指揮多個雲端 agent,以及成本怎麼控。

  • 同時並行 5 到 10 個雲端 agent,每天產出 22 到 40 個 PR,其中一半工作直接在手機上完成
  • 三套自動化:每週三次端對端測試(約 60 美元 token 成本)、每天早上九點的生產環境監控摘要、一個叫 Grace 的 agent 每天自動評分並修復約 3 個問題
  • Token 成本控制在每位「員工」約 5,000 美元/月,用便宜的微調模型分流重複性工作

Groq CEO 解析:資料中心正陷入供給危機#

18 小時前 · 20VC

20VC

Groq 創辦人 Jonathan Ross 指出,市場上宣稱的資料中心產能有很大一部分不會真正落地,因為許多投資人把資料中心當成不動產在操作,忽略了電力、備援發電機、冷卻與供水這些真正的硬門檻。

  • 業界流傳的笑話:有人承諾三個月內交付 100MW 產能,卻連發電機都還沒下單,而發電機交期目前長達 90 個月
  • 很多投資人以為資料中心只是「一堆晶片」,不知道還需要大量用水做冷卻
  • 他認為目前宣稱的供給中,有相當比例其實是「假資料中心」

為實體世界打造新一代作業系統#

12 小時前 · Y Combinator

Y Combinator

YC 指出全球有 80% 的勞動力不坐辦公室,但管理實體工作的軟體二十年沒什麼進步。AI 讓 agent、機器人與人類這三種「勞動力」首次能被同一套系統協調。

  • 非辦公桌工作涵蓋營建、維修、車隊管理等領域
  • 新一代作業系統需要同時管理 AI agent、機器人與配戴穿戴裝置的人類
  • 這些產業的人力支出是軟體支出的 10 到 100 倍,商機遠大於現有的 dashboard 型工具

2026 世界盃:AI 真的改變了足球嗎?#

29 小時前 · 硅谷101

硅谷101

硅谷101 調查了 AI 在職業足球的實際效果。儘管利物浦與 DeepMind 合作的定位球系統 TacticAI 曾登上《Nature》,團隊實際統計後發現成效並不明顯,並拆解了原因。

  • 統計利物浦過去 6 個賽季的角球進球率,維持在 3% 左右,並無顯著變化
  • 切爾西與 AiSCOUT 做青訓球探分析、塞維利亞與 IBM watsonx 合作球探報告,都是俱樂部端的嘗試案例
  • 根本障礙在於球員的體脂分布、快慢肌纖維比例、乳酸閾值等關鍵數據分散在全球數千家俱樂部,從未被整理成公開資料集

今日觀察#

今天最容易被略過的一段話,藏在 Opus 5 發布文的安全章節裡:Anthropic 說這一代的 cyber classifiers 攔截頻率會比 Fable 5 少大約 85%,允許在原始碼裡找漏洞,只擋掉二進位掃描與 exploit 生成。把它跟今天另外兩則首頁新聞疊在一起就有意思了,《衛報》那篇和 CNBC 那封 25 家公司的連署信,講的都是同一件糗事:Hugging Face 被入侵之後,因為美國尖端模型的護欄把它自己的防禦行為判成禁止用途,最後只能改用中國的開源模型 GLM 5.2 才把鑑識做完。也就是說,被罵得最兇的那個設計缺陷,在同一天的另一份文件裡被默默調整了 85%,而外界討論的還是跑分。與此同時,Codeberg 把主要由 AI 寫成的專案擋在門外,Bun 創辦人展示 64 支 agent 十一天搬完 53 萬行,而有人把 Bun 分叉回重寫前砍掉 1.1 萬行死碼,三件事都在爭論同一個東西的正當性,只是站在不同邊。能力提升這幾年一直是可以被 benchmark 的,但今天這幾則放在一起會發現,真正卡住的從來不是模型做不做得到,而是我們還沒想清楚,它做出來的東西誰要簽名。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有