半價的前沿
最強的模型今天打了對折,但技術圈吵的不是誰更聰明
每天花 1% 的時間,掌握科技脈動。
今日金句#
“Opus 5 is our least prompt injectable model yet.”
「Opus 5 是我們到目前為止最難被提示注入的模型。」
— Boris Cherny, Anthropic 工程師 · 來源
“Those humming GPU farms have given us superpowers, but we still don’t use them to build better software.”
「那些嗡嗡作響的 GPU 農場給了我們超能力,但我們還是沒把它拿來把軟體做得更好。」
— Piotr Chmurzinski, 軟體開發者 · 來源
“If attackers and defenders have access to equally powerful AI, I see no reason to believe that cyber systems will become less secure over time.”
「如果攻擊方和防守方拿到的 AI 一樣強,我看不出資安系統會隨著時間變得更不安全。」
— John Thickstun, 資安研究者 · 來源
今日主軸:半價的前沿#
Anthropic 昨晚發布 Claude Opus 5,官方定位是「接近 Fable 5 的前沿智慧,價格只要一半」。數字撐得住這句話:ARC-AGI 3 拿到次佳模型的三倍分數,OSWorld 2.0 用三分之一出頭的成本超過 Fable 5 的最佳成績,CursorBench 3.2 在最高 effort 下只落後 Fable 5 不到 0.5%。最有畫面的是一個 Frontier-Bench 題目,給模型一張機器零件的手繪圖,但故意不讓它看到圖,Opus 5 乾脆自己寫了一套電腦視覺流程,從原始像素把幾何還原出來,其他模型試五次都做不出來。這則新聞在 Hacker News 一路衝到 1,200 分以上。
但今天真正有意思的地方,是它旁邊那幾則。Hacker News 首頁同時掛著〈如果寫程式已經被解決了,為什麼軟體越來越難用?〉、Nvidia 與 Meta 等 25 家公司連署反對管制開源權重模型、《衛報》一篇要大家對 OpenAI「失控 agent」故事保持懷疑的評論。三則講的都不是模型有多聰明,而是這些能力落在誰手上、算不算數。Codeberg 這週把「主要由生成式 AI 寫成」的專案擋在門外,同一週 Bun 創辦人展示他用 64 支 Claude agent 在 11 天內把 53 萬行程式從 Zig 搬到 Rust,成本 16.5 萬美元。智慧變便宜了,關於它的爭執反而變貴了。
必讀#
- Claude Opus 5 發布:逼近旗艦智慧,價格砍半 — Anthropic
AI - Nvidia、Microsoft、Meta 等 25 家連署:別過度管制開源權重模型 — CNBC
AI - FLUX 3 X Mimic:影片模型直接開進 Audi 工廠 — Black Forest Labs
AI - 如果寫程式已經被解決了,為什麼軟體越來越難用? — Hacker News
Dev - 我的監視器把 GitHub admin token 印在登入頁上 — Hacker News
Dev - 對 OpenAI 的「失控駭客 agent」故事保持懷疑 — The Guardian
AI - Bun 創辦人用 64 支 Claude,11 天重寫 53 萬行程式 — iThome
Dev - Buz:把 Bun 分叉回重寫前,砍掉 1.1 萬行死碼 — Hacker News
Tools - Boris Cherny:Opus 5 是最難被提示注入的一代 — Simon Willison
AI - Postgres LISTEN/NOTIFY 其實很能撐:6 萬寫入/秒 — DBOS
Dev - 每個工程師都該懂 SIMD — Lobsters
Dev - 印度政府要求 GitHub 下架藍牙聊天 App Bitchat — The Hindu
News - Codeberg 的分歧:禁掉 AI 寫的專案是好主意嗎 — Armin Ronacher
Dev - Claude Opus 5 深度評測:厲害,但也很煩 — Lenny’s Newsletter
AI - GitHub 搶先支援無狀態 MCP,遠端服務擴充免綁工作階段 — iThome
Dev
1. Claude Opus 5 發布:逼近旗艦智慧,價格砍半#

Anthropic 於 7 月 24 日發布 Claude Opus 5,官方定位為「思慮周全且主動」的模型,智慧接近旗艦 Claude Fable 5 但價格只有一半,並成為 Claude Max 的新預設模型、Claude Pro 上最強的模型。在 Frontier-Bench v0.1 上它超越所有其他模型,效能是前代 Opus 4.8 的兩倍以上,而每題成本更低。安全面它刻意沒有訓練漏洞利用能力,在 OSS-Fuzz 上找漏洞的能力接近 Mythos 5,但把漏洞轉成實際攻擊的能力遠遠落後。
- ARC-AGI 3(考從沒看過的新題型)分數是次佳模型的 3 倍;OSWorld 2.0 電腦操作測驗用略高於三分之一的成本超越 Fable 5 的最佳成績
- CursorBench 3.2 在 max effort 下與 Fable 5 巔峰分數差距不到 0.5%,但每題成本只有一半
- Frontier-Bench 有一題給模型機器零件手繪圖卻不讓它看圖,Opus 5 自行寫出電腦視覺流程從像素還原幾何,其他模型五次都失敗
- cyber classifiers 的攔截頻率預期比 Fable 5 少約 85%,允許在原始碼中找漏洞,但擋掉二進位掃描、滲透測試與 exploit 生成
💡 為什麼重要:這一代把「智慧上限」的競賽換成了「每塊錢買到多少智慧」的競賽。對每天用 agent 寫程式的人來說,模型從貴到只能挑重點用,變成可以整天開著跑。
🔗 閱讀原文 | 來源: Anthropic
2. Nvidia、Microsoft、Meta 等 25 家連署:別過度管制開源權重模型#

7 月 24 日,包含 Nvidia、Microsoft、Meta、Palantir 在內的 25 家科技公司聯名致信政策制定者,呼籲不要對開源權重 AI 模型設下「過早的限制」。背景是月之暗面的開源模型 Kimi K3 在多項業界基準上超越美國尖端模型,引發美方監管關注。值得注意的是估值接近兆美元、正在準備 IPO 的 OpenAI 與 Anthropic 都沒有簽署。
- 連署方主張「單靠封閉模型並不必然安全,它們一樣可能被攻破、被濫用,或以外界察覺不到的方式失效」
- 白宮方面曾聲稱 Kimi K3 是從 Anthropic 技術蒸餾而來,財政部長已就 IP 竊取展開調查
- Hugging Face 在遭入侵後,因為美國尖端模型的護欄擋掉了資安分析用途,最後改用中國開源模型 GLM 5.2 才完成鑑識
💡 為什麼重要:這封信把「開放 vs 封閉」從理念之爭變成了市場位置之爭,誰沒簽,比誰簽了更能說明問題。
🔗 閱讀原文 | 來源: CNBC
3. FLUX 3 X Mimic:影片模型直接開進 Audi 工廠#
Black Forest Labs 公布 FLUX 3 的機器人分支 FLUX-mimic,同一個多模態基礎模型同時處理圖像、影片、音訊與機器人動作,並已部署在真實的 Audi 工廠:把零件揀進料盤、把電子元件塞進很緊的治具、處理密封條與線材這類傳統自動化碰不了的軟性材料。團隊指出 95% 以上的訓練算力花在影片預測上,而正是這件事逼模型學會接觸、運動、重量與因果。
- 加上動作解碼器後影片生成品質先掉約 10%,3,500 個訓練步就完全恢復,同一個 backbone 可以在內容生成與物理控制之間切換而不永久損失能力
- FLUX-mimic backbone 在 NVIDIA RTX 5090 上端到端 80ms,與人類視覺反應時間相當;實際部署會讓預測與執行重疊以消除抖動
- 凍結 backbone 的表現就已勝過先前的 vision-language-action 模型,微調後達到 SOTA 成功率,且會自然出現未經示範的失敗復原行為
💡 為什麼重要:如果一個模型同時能生成影片又能控制機器手臂,那它從來就不只是內容生成模型,而是一個關於世界怎麼運作的模型。過去四年砸在影片生成上的算力,正在變成實體世界的資產。
🔗 閱讀原文 | 來源: Black Forest Labs
4. 如果寫程式已經被解決了,為什麼軟體越來越難用?#
開發者 Piotr Chmurzinski 從日常挫折出發:銀行 App 要通過三次 FaceID 才能看到 3D Secure 畫面、Slack 會在他敲指令時搶走終端機焦點、車機系統的方向燈聲音會隨機消音、螢幕延遲一到兩秒。他的論點不是反 AI,而是指出開發工具變強的同時軟體穩定性反而退步,真正的瓶頸不在技術能力,而在組織的獎勵結構,修 bug 不會讓季度數字好看,也不適合放進董事會簡報。
- 複雜度指數上升(抽象層、框架、基礎設施),穩定性卻倒退;作者形容 macOS 或任何仰賴的 App 更新現在是「恐懼的來源,而不是期待」
- 即使拿到最新的 LLM 與充裕的 token 預算,整體軟體品質並沒有變好,指向誘因問題而非能力問題
- 文章在 Hacker News 引發極為熱烈的討論,是當日討論密度最高的文章之一
💡 為什麼重要:這篇替今天所有「模型又變強了」的新聞踩了一次煞車。工具的上限提高,不等於成品的下限提高,中間隔著一整套沒有改變的獎勵機制。
🔗 閱讀原文 | 來源: Hacker News
5. 我的監視器把 GitHub admin token 印在登入頁上#

一位研究者發現韓華 Vision(Hanwha Vision,原三星 Techwin)的監視器韌體裡帶著一組還有效的 GitHub admin token,對該組織數百個 repo 有管理權限。根因是 Vite 建置設定錯誤,把整個 CI 環境變數當成 JavaScript 變數傾印進編譯後的前端程式碼裡。研究者另外用韌體裡硬寫死、僅以 XOR 查表混淆的 AES 金鑰,成功解出約 500 份下載韌體中的 62%。
- 同一組 token 重複出現在約 30 個檔案、跨越約 500 個韌體版本;任何開過這些攝影機管理介面的人,等於都被送過這組 token
- CI 環境變數裡出現美國國防部網段的 IP;韓華集團同時生產 K9 自走砲與 SGR-A1 哨戒機器人
- 韓華在 12 小時內完成修補,責任揭露流程有效運作
💡 為什麼重要:建置時把 process.env 整包倒出去,是一個現在還在大量重演的錯誤。IoT 韌體可以被下載、可以被解密,就該假設裡面的任何字串遲早會被讀出來。
🔗 閱讀原文 | 來源: Hacker News
6. 對 OpenAI 的「失控駭客 agent」故事保持懷疑#

資安研究者 John Thickstun 在《衛報》撰文,指出 OpenAI「失控 agent」的敘事,走的是它從 2019 年宣布 GPT-2 以來就在跑的同一套劇本:大聲宣稱 AI 有多危險,投資人聽到的是它有多強大。他提醒,那次測試中員工事前就被告知模型可能會突破沙箱,所以「失控」這個框架本身就有誤導性。他進一步指出真正的問題在於 OpenAI 與 Anthropic 用護欄限制資安用途,結果只有封閉模型廠商與美國政府能拿到不受限的 AI 做防守。
- 2019 年 2 月 GPT-2 宣布不釋出後幾個月,Microsoft 投資 10 億美元,作者視為同一模式的起點
- Hugging Face 被迫改用中國開源模型 GLM 5.2 做事件回應,因為 Fable 5 的護欄把它自己的防禦行為判定為禁止的資安用途
- 作者主張只要攻守雙方拿到一樣強的 AI,系統長期只會更安全,因為 AI 相對人力便宜且可規模化
💡 為什麼重要:把「AI 很危險」與「所以只有我們能拿」這兩句話拆開來看,是今年判讀任何 AI 安全公告時最實用的一個習慣。
🔗 閱讀原文 | 來源: The Guardian
7. Bun 創辦人用 64 支 Claude,11 天重寫 53 萬行程式#

Bun 創辦人 Jarred Sumner 公開了把 53 萬行程式碼從 Zig 遷移到 Rust 的完整過程:用 64 支 Claude agent 協作,11 天完成,共 6,502 次 Git 提交,總成本約 16.5 萬美元。原本估算需要 3 位資深工程師投入一年。Rust 版通過 Linux、Windows、macOS 全部自動測試(4,174 個測試檔、139 萬次檢查),效能提升 2 到 5%,執行檔縮小 20%,順帶修掉 128 項舊問題。
- 採對抗式審查,實作 agent 與審查 agent 分離,審查方不看實作邏輯只看結果,主動挑毛病
- 尖峰時每分鐘產生約 1,300 行程式碼、58 次 Git 提交;團隊設計了 50 套工作流程分工改寫、除錯、審查
- Sumner 的結論是 AI 沒有讓重寫成本歸零,而是讓一項原本太貴、太耗時而不可能啟動的工程變得可行
💡 為什麼重要:前置條件很關鍵,架構成熟、測試覆蓋夠厚、創辦人親自把關流程。少了任何一項,這個數字都複製不了。
🔗 閱讀原文 | 來源: iThome
8. Buz:把 Bun 分叉回重寫前,砍掉 1.1 萬行死碼#

開發者 jazzzooo 從 Bun 進行 Rust 重寫之前的最後一個 commit 分叉出 Buz,改用現行版本的 Zig 建置,達成一秒以內的增量建置。他把完整的 build graph(含 vendored 的 JavaScriptCore 原始碼)都寫進 build.zig,並在過程中刪掉超過 1.1 萬行完全沒有被使用的死碼。有趣的是,他自己也大量使用 LLM 進行開發,只是保留人類審查,並表示在程式碼整理到合理狀態之前不接受人類貢獻。
- 基於 Zig master 加上自訂 patch 支援增量建置;原始 Bun 約 60 萬行程式碼,其中 1.1 萬行是死碼
- 作者直言不認為任何人該犧牲理智去理清這 60 萬行的爛泥,但同時匯入 Rust 版 Bun 的所有新測試
- 專案仍屬早期,尚未達生產可用,作者歡迎回報 bug 與特別誇張的程式碼案例
💡 為什麼重要:它跟上一則放在一起看才完整,同一份程式碼,一邊是「AI 讓不可能的重寫變可行」,一邊是「AI 留下的爛攤子得有人清」。兩邊都在用 AI。
🔗 閱讀原文 | 來源: Hacker News
9. Boris Cherny:Opus 5 是最難被提示注入的一代#

Anthropic 工程師 Boris Cherny 指出,比起各項 eval 分數,Opus 5 最讓他興奮的是抗提示注入(prompt injection)能力,在 PI evals 與紅隊測試中,Opus 5 都非常難被成功注入。他也直說這件事「有點被埋在系統卡裡」,細節在第 73 頁。Simon Willison 收錄了這段引言。
- 提示注入是 agent 化應用最實際的攻擊面,任何讓模型讀取外部內容的流程都暴露在這個風險下
- Anthropic 官方發布文的主軸放在跑分與成本,這項改進反而沒有被放到前面
💡 為什麼重要:如果你在跑會讀網頁、讀郵件、讀 issue 的 agent,這一項對你的實際影響可能比任何 benchmark 都大。
🔗 閱讀原文 | 來源: Simon Willison
10. Postgres LISTEN/NOTIFY 其實很能撐:6 萬寫入/秒#

DBOS 團隊反駁「LISTEN/NOTIFY 不能規模化」的流行說法。原本的瓶頸在於 Postgres 保證通知會依交易提交順序送出,因此需要一把全域排他鎖來序列化提交,讓吞吐量卡在每秒 2,900 次寫入。他們改成在記憶體中緩衝通知、定期批次 flush,並用輪詢作為行程崩潰時的後備,把吞吐量拉到每秒 6 萬次寫入。
- 20 倍提升,延遲落在 15 到 100ms;在尖峰吞吐量下瓶頸變成 Postgres CPU 本身,而不是鎖競爭
- Postgres 19 的相關 patch 處理的是另一個較窄的情境(大量 channel),與這個瓶頸不同
- benchmark 程式碼開源在 dbos-inc/dbos-postgres-benchmark
💡 為什麼重要:「某某技術不能規模化」的說法,很多時候講的是某一種用法不能規模化。這篇是很好的反例,緩衝加輪詢的模式也能直接搬到別的專案。
🔗 閱讀原文 | 來源: DBOS
11. 每個工程師都該懂 SIMD#

Mitchell Hashimoto 主張 SIMD 被低估是因為大家覺得它太難,但常見情境其實有固定套路:廣播常數、一次跑一個向量、平行運算、歸約與儲存、處理尾端的零頭。他用 Ghostty 裡「找出一段可列印字元」的實際例子示範,加了 12 行程式碼換來端到端 5 倍加速。
- ARM NEON 4 條 lane、AVX2 8 條、AVX-512 16 條;Ghostty 的例子是載入 8 個 u32 碼位、廣播 0xF 閾值、平行比較、以 AND 歸約後數尾端零
- 值得用 SIMD 的前提是資料量要到數百、數千甚至數百萬位元組;小資料集不划算,而編譯器的自動向量化並不總是有效
- 可參考 simdutf 與 simdjson;Zig 用 @Vector 與 @splat,其他語言有對應的 intrinsics
💡 為什麼重要:字串掃描、壓縮、影像處理、JSON 解析這類 CPU-bound 的大量迴圈,都是同一個模式。學會之後你會開始在自己的程式碼裡看到它。
🔗 閱讀原文 | 來源: Lobsters
12. 印度政府要求 GitHub 下架藍牙聊天 App Bitchat#

印度政府以資安疑慮為由,要求 GitHub 下架 Bitchat,一款由 Jack Dorsey 推動、透過藍牙 mesh 網路進行點對點通訊的聊天 App,設計目的正是讓人在網路被切斷或受限時仍能通訊。事件發生在當地抗議與網路管制的背景下。
- 這是針對一個軟體專案本身的下架命令,而不是內容審查,對開源託管平台是重要的先例
- 政府只以「資安疑慮」概括說明,未提出具體技術理由
- Bitchat 不依賴網際網路基礎設施,在行動網路被限制時特別關鍵
💡 為什麼重要:做隱私或去中心化工具的開發者,應該預期自己會成為監管標的,並提前準備備援託管。
🔗 閱讀原文 | 來源: The Hindu
13. Codeberg 的分歧:禁掉 AI 寫的專案是好主意嗎#

Codeberg 修改條款,排除「主要由生成式 AI 寫成」的專案。Armin Ronacher 認為這在他們權利範圍內,但策略上有問題:「主要」一詞模糊且難以執行,在持續開發的程式碼庫裡幾乎不可能界定作者比例,結果是把判斷丟給版主與社群氛圍,反而讓中間地帶的人先退場。他認為與其設一條模糊的中線,不如乾脆畫死(完全不准 LLM 參與),或針對具體行為(自動化灌水、濫用資源)訂規則。
- Codeberg 是會員自治的協會,正把自己定位為 GitHub 的歐洲替代品
- Ronacher 指出社群的實際社交界線可能比書面政策更嚴苛,形成事實上的排除
- 他主張 LLM 若用得好,反而能把權力從企業手上拿回來,開源社群不該分裂成兩個陣營
💡 為什麼重要:接下來一兩年,「這個專案是不是 AI 寫的」會變成很多平台的准入條件。規則寫得夠不夠清楚,決定它是防濫用還是防人。
🔗 閱讀原文 | 來源: Armin Ronacher
14. Claude Opus 5 深度評測:厲害,但也很煩#

Claire Vo 在 Lenny’s Newsletter 的 How I AI 節目中,把 Claude Opus 5 放進她的七模型盲測基準,與 GPT-5.6 Sol、Sonnet 5、Gemini 3.1 Pro 等一起比較。她的結論是「brilliant but annoying」:複雜推理表現出色,但個性上的怪癖在實際 coding 情境裡很明顯,甚至曾經拒絕處理 merge conflict。
- 她開場直言已經對「每週都有新模型、新基準、新前沿智慧」感到疲乏
- 評測強調峰值效能不等於使用者滿意度,行為怪癖會實際影響工作流程
- 完整影音約 25 分鐘,有逐字稿
💡 為什麼重要:升級模型前值得先看的那種評測,它談的不是分數,是你每天要跟它相處的手感。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
15. GitHub 搶先支援無狀態 MCP,遠端服務擴充免綁工作階段#

GitHub 的 MCP 伺服器提前支援預定 7 月 28 日發布的新版 MCP 規格:無狀態核心設計。新版把工作階段與初始化程序從協定層移除,改成每次請求自行攜帶協定版本、用戶端資訊與能力聲明,全部放進 HTTP 標頭。GitHub 同時移除了以 Redis 保存工作階段的設計。
- 負載平衡器可以把不同請求分派到不同伺服器,不需要黏性工作階段,直接靠增加伺服器數量水平擴充
- 登入、確認操作等互動流程改為獨立的 HTTP 請求
- 所有官方一級 SDK 已推出測試版支援並維持向下相容,另提供相容性測試
💡 為什麼重要:自架遠端 MCP 服務的部署難度大幅下降,不必再建共用儲存或處理黏性連線。新專案直接上新規格比較划算。
🔗 閱讀原文 | 來源: iThome
推薦閱讀#

- Em dash 真的很讚 — 一篇替破折號辯護的散文,順帶提出用 AP 式加空格的寫法來跟 AI 生成的破折號做區隔
- Show HN: Echo — 用開源模型以三分之一成本達到 Fable 等級 — 開源模型組合出來的性價比方案,引發大量成本比較討論
- Opus 5 目前登上 Artificial Analysis 智慧排行榜第一 — 第三方跑分佐證官方說法
- 印度首枚民間自研火箭首飛入軌 — 首飛就成功入軌,是相當罕見的成績
- 分散式系統入門:時鐘、因果關係與事件排序 — 從為何不能信單機時鐘講到 Spanner 怎麼處理全球規模的事件排序
- 2026 夏季版:該用哪個 AI 做哪件事 — Ethan Mollick 更新的實用選型指南,他認為 agentic 系統現在已經非常強
- Cognition 收購 Poke:AI 的個性正在變成競爭優勢 — 把對話個性整合進 Devin 的思路
- Firefox Containers 預覽版 — 分身分隔離瀏覽的官方版本
- Claude Cookbook 上線 — 官方整理的實作範例集
- Sriram Krishnan 談開源 AI 最猛的一週 — a16z podcast 談開源模型趨勢
- Claude 桌面版漏洞讓惡意連結自動送出隱藏指令 — Oasis Security 揭露的 PromptFiction 漏洞,已在 1.1.2321 修補
- Reid Hoffman、Mark Pincus 共同創立的 AI 實驗室 Prentis 洽談募資 1 億美元 — 主打自動化電腦操作
- The Pulse:因為穩定性問題,他把 Podcast 搬離 Spotify — 順帶討論 Kimi K3 與美國政策走向
- Marimo 現在可以在 PyCharm 裡跑了 — 反應式 Python notebook 進入主流 IDE
- AI 不會照你的意思做,這是個問題 — 獎勵駭客問題的入門整理
- Canary token 與數位絆索(訪談) — 用誘餌憑證做入侵偵測的實務談
- Loop Engineering:怎麼讓 agent 別對自己的檢查作弊 — 迴圈設計上的防作弊模式
- AI 與程式碼所有權:生成的程式碼誰負責? — 責任歸屬與法律面的整理
- Sentry 的 span 階層抓出我 5-agent 流水線裡的靜默重試 — 多 agent 流水線的可觀測性實戰
社群熱門#

- Opus 5 剛發布,這些數字太誇張了 — 發布後幾小時就衝上熱門的開箱評測
- Anthropic 到底做了什麼?(Opus 5) — 驚嘆式反應影片
- Claude Opus 5 會幫你省錢 — 從成本角度切入的實用分析
- 我們實測了 Claude Opus 5:很煩,但偶爾閃現天才 — Every 團隊的一週深度實測
- Kimi K3⋯真正的 Claude 殺手 — 開源模型與封閉模型的對比
- 這款 2,500 萬下載的 AI 學習 App 是用 Flutter 寫的 — 大規模 Flutter 產品的架構案例
- 在 FlutterFlow 裡使用 AI Agent:Claude Code 與 Codex 外掛設定 — Flutter 與 AI agent 交集的實作教學
- 新創創辦人請願:別關掉中國開源 AI — 開源權重政策角力的另一條戰線
- Flux 3 發布 — Black Forest Labs 新一代多模態模型本體
中文技術圈#

- AI 破解水的百年謎團:為什麼水結冰會膨脹? — 大阪大學用 AI 找到觀察水分子的方法,解開百年來的結構問題
- 做了一年的個人站,被月活 50 萬的網站 100% 抄襲 — 獨立開發者的維權討論串
- Google 緊急更新 Chrome 150 版,修補 4 個高風險漏洞 — 建議立即更新
- 大規模攻擊活動建立 7,600 個惡意 GitHub 儲存庫,散布 SmartLoader — 開源供應鏈的投毒手法
- Next.js 修補 4 項高風險漏洞,App Router 恐遭阻斷服務 — 使用 App Router 的專案要留意
- IBM 收購量子運算研究公司 HRL Laboratories,開啟雙軌技術策略 — 量子路線圖的重要佈局
- 資安週報 0720~0724:供應鏈韌性與依賴關係治理成為多國策略重點 — 一週資安動態彙整
- 在互聯網公司工作的同學,都怎麼找到適合自己的副業? — 開發者副業經驗交流
開源精選#
andrewyng/openworker — Python | ⭐ 3.4K 吳恩達團隊的開源桌面 AI 同事,交付的是完成品(文件、Slack 回覆、整理過的收件匣)而不是聊天;自帶 API key 或接 Ollama 全本機跑。
Vincentwei1021/video-shotcraft — TypeScript | ⭐ 1.4K 給 Claude Code 與 Codex 的 AI 影片技能,用 Remotion 做電影感產品影片,內含 106 張分鏡配方卡與 161 組動態預覽。
Jakubantalik/thinking-orbs — TypeScript | ⭐ 931 專為 AI 與 agent 介面設計的點狀「思考球」載入指示器,六種狀態、兩種尺寸、自動深淺色。
Blaizzy/nativ — Swift | ⭐ 860 Mac 原生的本機 AI 應用,用一個 macOS App 就能聊天、開服務、監控並串接 MLX 模型。
pireel/pireel — TypeScript | ⭐ 710 開源、免後端的 AI 影片編輯器,專攻講話頭影片:分鏡、設計圖卡、動態字幕、瀏覽器內 WebCodecs 匯出,可由任何 agent 透過 MCP 驅動。
gnipbao/story-to-handdrawn-video — JavaScript | ⭐ 608 Agent 技能:把中文故事文案或排序好的圖片,轉成手繪日記漫畫風格的無聲 MP4 動畫。
CatsJuice/sticker-forge — JavaScript | ⭐ 520 有觸感的 WebGL 貼紙製作器,支援富文本、圖片上傳與可互動的撕開物理效果。
影音精選#
Opencode CEO 專訪:被 Anthropic 封鎖後,半年成長 20 倍#
19 小時前 · Y Combinator
Opencode 是 Claude Code 的開源替代品,可以搭配任何模型。創辦人 Jay V 談公司如何在半年內成長 20 倍,以及 Anthropic 曾試圖封鎖他們反而助長聲勢的過程。他也提到產品在開發中國家特別受歡迎的原因。
- 月活躍用戶約 1,300 萬,較年初成長 20 倍;每日處理約 7 兆 token,超過 OpenRouter 全站的 6 兆
- 訂閱數約 16 萬,加上按量計費推估年營收約 3,800 到 4,000 萬美元
- 印尼佔流量 4%、巴西 5%,因為每月 200 美元的訂閱對當地開發者太貴
Datadog CEO:兩個法國工程師如何打造監控整朵雲的公司#
13 小時前 · Y Combinator
Datadog 共同創辦人 Olivier Pomel 在 YC Startup School Paris 分享早期故事,包括申請 YC 兩度被拒。他也談到工程團隊已經開始用 AI agent 重寫整套系統,以及他如何維持一家 8,000 人公司的誠實文化。
- 申請 YC 被拒絕兩次,面試後被拒,後來連晚宴邀請都被取消
- 他公開表示「兩季內我們不會再寫任何程式碼」,AI 已讓一位資深工程師在幾天內重建原本需要 6 人做半年的系統
- 他堅持親自閱讀客戶支援票,作為維持大公司誠實文化的方法
FLUX 3 可能就是我們等的開源版 Sora 2#
10 小時前 · Matt Wolfe
Matt Wolfe 速覽近期 AI 大事,包括 Opus 5 發布與 Black Forest Labs 的多模態模型 FLUX 3。他認為 FLUX 3 的真實物理表現、原生音訊與素材多樣性讓人重新感到興奮,即便在快速戰鬥動作等場景仍會出錯。
- 他報告 Opus 5 的 ARC-AGI-3 分數從 Opus 4.8 的 1.5% 跳到 30%,agentic terminal coding 從 33 提升到 43,但社群也開始爭論該基準是否被針對性優化
- FLUX 3 同時支援影片、原生音訊、圖片與機器人應用,並規劃開源權重
- 快速動作場景仍會出現物理錯誤,但整體被他評為「我們應得的開源版 Sora 2」
2026 年最有價值的技能:管理一整隊 AI Agent#
15 小時前 · Greg Isenberg
Greg Isenberg 訪談 Ryan Carson,他曾把 Treehouse 做到 110 名員工規模,現在以一人公司運營 AI 平台 Untangle。訪談拆解他怎麼同時指揮多個雲端 agent,以及成本怎麼控。
- 同時並行 5 到 10 個雲端 agent,每天產出 22 到 40 個 PR,其中一半工作直接在手機上完成
- 三套自動化:每週三次端對端測試(約 60 美元 token 成本)、每天早上九點的生產環境監控摘要、一個叫 Grace 的 agent 每天自動評分並修復約 3 個問題
- Token 成本控制在每位「員工」約 5,000 美元/月,用便宜的微調模型分流重複性工作
Groq CEO 解析:資料中心正陷入供給危機#
18 小時前 · 20VC
Groq 創辦人 Jonathan Ross 指出,市場上宣稱的資料中心產能有很大一部分不會真正落地,因為許多投資人把資料中心當成不動產在操作,忽略了電力、備援發電機、冷卻與供水這些真正的硬門檻。
- 業界流傳的笑話:有人承諾三個月內交付 100MW 產能,卻連發電機都還沒下單,而發電機交期目前長達 90 個月
- 很多投資人以為資料中心只是「一堆晶片」,不知道還需要大量用水做冷卻
- 他認為目前宣稱的供給中,有相當比例其實是「假資料中心」
為實體世界打造新一代作業系統#
12 小時前 · Y Combinator
YC 指出全球有 80% 的勞動力不坐辦公室,但管理實體工作的軟體二十年沒什麼進步。AI 讓 agent、機器人與人類這三種「勞動力」首次能被同一套系統協調。
- 非辦公桌工作涵蓋營建、維修、車隊管理等領域
- 新一代作業系統需要同時管理 AI agent、機器人與配戴穿戴裝置的人類
- 這些產業的人力支出是軟體支出的 10 到 100 倍,商機遠大於現有的 dashboard 型工具
2026 世界盃:AI 真的改變了足球嗎?#
29 小時前 · 硅谷101
硅谷101 調查了 AI 在職業足球的實際效果。儘管利物浦與 DeepMind 合作的定位球系統 TacticAI 曾登上《Nature》,團隊實際統計後發現成效並不明顯,並拆解了原因。
- 統計利物浦過去 6 個賽季的角球進球率,維持在 3% 左右,並無顯著變化
- 切爾西與 AiSCOUT 做青訓球探分析、塞維利亞與 IBM watsonx 合作球探報告,都是俱樂部端的嘗試案例
- 根本障礙在於球員的體脂分布、快慢肌纖維比例、乳酸閾值等關鍵數據分散在全球數千家俱樂部,從未被整理成公開資料集
今日觀察#
今天最容易被略過的一段話,藏在 Opus 5 發布文的安全章節裡:Anthropic 說這一代的 cyber classifiers 攔截頻率會比 Fable 5 少大約 85%,允許在原始碼裡找漏洞,只擋掉二進位掃描與 exploit 生成。把它跟今天另外兩則首頁新聞疊在一起就有意思了,《衛報》那篇和 CNBC 那封 25 家公司的連署信,講的都是同一件糗事:Hugging Face 被入侵之後,因為美國尖端模型的護欄把它自己的防禦行為判成禁止用途,最後只能改用中國的開源模型 GLM 5.2 才把鑑識做完。也就是說,被罵得最兇的那個設計缺陷,在同一天的另一份文件裡被默默調整了 85%,而外界討論的還是跑分。與此同時,Codeberg 把主要由 AI 寫成的專案擋在門外,Bun 創辦人展示 64 支 agent 十一天搬完 53 萬行,而有人把 Bun 分叉回重寫前砍掉 1.1 萬行死碼,三件事都在爭論同一個東西的正當性,只是站在不同邊。能力提升這幾年一直是可以被 benchmark 的,但今天這幾則放在一起會發現,真正卡住的從來不是模型做不做得到,而是我們還沒想清楚,它做出來的東西誰要簽名。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit







