最強模型上線那天,大家在想怎麼少靠它
OpenAI 上線 GPT-6 Astra,ARC-AGI-3 拿到 99.9% 但一輪要 1.9 萬美元;同一天 OpenAI、Claude、Grok 一起掛掉,Nvidia 用 129 億美元買下 Hugging Face,而 22,000 個 .name 網域明年二月就會消失,包括已經付費到 2040 年的那些
每天花 1% 的時間,掌握科技脈動。
今日金句#
“There’s no contractual AGI triggering anymore, so that’s actually not a relevant concept. I do leave it up to the reader to decide for themselves. For me personally, I do think we’re there.”
「合約上已經沒有 AGI 觸發條款了,所以那不是一個相關的概念。我把判斷留給讀者自己。以我個人來說,我覺得我們已經到了。」
— Greg Brockman, OpenAI 總裁,Astra 發表記者會 · 來源
“This website vanishes in February. Despite the fact that it’s registered and paid for until 2040.”
「這個網站二月就會消失。儘管它已經註冊並付費到 2040 年。」
— Neil Fraser, Google 工程師、neil.fraser.name 持有者 · 來源
“Rather than trying to imitate AI, it is far more important to build the board according to my own style.”
「與其模仿 AI,更重要的是照我自己的風格去佈局。」
— 申真諝(Shin Jin-seo), 世界排名第一的圍棋九段,讓 2.5 子擊敗 KataGo · 來源
今日主軸#
OpenAI 今天正式上線 GPT-6 Astra,自報 FrontierMath Tier 4 拿 98%、ARC-AGI-3 拿 99.9%,Greg Brockman 在記者會上被問到這算不算 AGI,回答是「以我個人來說,我覺得到了」。但同一份 ARC Prize 報告寫得很清楚:99.9% 是用 OpenAI 自家的 Provider Adapter harness 跑出來的,花了 1.9 萬美元;換成標準 harness 只有 62.7%,還要 2.6 萬美元。而 Astra 上線的同一個早上,OpenAI、Claude、Grok 三家同時掛掉,開發者社群最多人接受的解釋是「一家掛了,使用者湧到另一家,把另一家也壓垮」。能力往上衝的同時,另一批新聞全在講怎麼少依賴一個地方:Pragmatic Engineer 追到 Uber、Stripe、Coinbase 這些公司把簡單工作切到開源模型、省下大約一半帳單;Nvidia 用 129 億美元買下開源模型的家 Hugging Face,黃仁勳的說法是開源讓防守方有「不對稱優勢」;CERN 把 2,200 多台加速器控制電腦從 RHEL 搬到 Debian,導火線只是一個編譯器旗標。最刺的一則來自一個 Google 工程師:他用了 25 年、付費到 2040 年的 .name 網域,ICANN 七月批准 Verisign 整層砍掉,明年二月連同信箱、IoT 裝置一起消失,而且空出來的二級網域任何人都能註冊,等於把他 25 年的帳號登入權交給陌生人。今天這批新聞的重量分布很明顯,最強的那顆模型只是其中一則,其他都在提醒你自己的東西到底站在誰的地基上。
必讀#
- GPT-6 Astra 正式上線:Brockman 說「我個人覺得 AGI 到了」 — OpenAI
AI - Nvidia 以 129 億美元買下 Hugging Face,是 Delangue 自己找上門的 — CNBC
News - ARC-AGI-3 上的 Astra:99.9% 要 1.9 萬美元,換標準 harness 剩 62.7% — ARC Prize
AI - .name 整層終止:22,000 個網域明年二月消失,付到 2040 年也一樣 — Hacker News
News - OpenAI、Claude、Grok 同一個早上一起掛掉 — Hacker News
News - K2 Horizon:六個開源模型連 checkpoint、資料配方、log 全部公開 — Hacker News
AI - Uber、Stripe、Coinbase 把簡單工作切到開源模型,AI 帳單省一半 — Pragmatic Engineer
Dev - Raschka:Astra 的「looped transformer」只是把層重複用兩次 — TLDR AI
AI - Audacity 4.0:整個介面用 Qt 重寫,clip 編輯模型全換 — Hacker News
Tools - Polars 2.0 RC1:streaming engine 變預設,型別轉換全面收緊 — Hacker News
Dev - Meta Muse Spark 1.3:工具呼叫少 20%、token 少 25%,讓你分享資料就打一折 — Meta
AI - Qwen 3.8 27B 上 Cerebras,每秒 1,500 個 token — Hacker News
AI - Cursor 的 Cloud Agents 可以跑在你自己的機器上,新增 8 家基礎設施 — iThome
Tools - Anil Dash:那已經不是創投了,是「癌症資本」 — Hacker News
Startup - Schneier:一個 AI agent 寫信給我,說它找不到一條「誠實機器人」能走的路 — TLDR
AI
1. GPT-6 Astra 正式上線:Brockman 說「我個人覺得 AGI 到了」#

OpenAI 在 9 月 3 日正式推出 GPT-6 Astra,先給 Daybreak 資安計畫的客戶,一週內開放 Plus、Pro、Business、Enterprise 與 API,AWS 也有。自報數字:FrontierMath Tier 4 98%、ARC-AGI-3 99.9%、ExploitBench 100%(GPT-5.6 Sol 是 78.5%)、SRE-Bench 二進位逆向四次內 99.2%,長文本八針測試在 256K 到 512K 拿 100%。API 定價跟 Claude Fable 5 與 5.1 一樣,每百萬 token 輸入 10 美元、輸出 50 美元。Latent Space 燒了 200 億 token 實測,說它是第一批能自己選模型、標資料、看 log、部署除錯的「AI 工程師」,以 33 tokens/s 換算,時薪不到 6 美元。
- Greg Brockman 被問是不是 AGI:合約上已經沒有 AGI 觸發條款(原本跟微軟的合約有),這個概念變成「使命或精神層面的東西」,判斷留給讀者,但他個人覺得到了
- 爭議在 opaque recurrence:模型用更少甚至沒有語言 token 就能完成困難任務,首席科學家 Jakub Pachocki 直接承認「能力越強,可監控性越難」
- Artificial Analysis 的 Intelligence Index 給 61 分,跟 GPT-5.6 Sol 一樣,比 Claude Fable 5.1 低 5 分,也輸給 Meta 剛出的 Muse Spark 1.3;但 Coding Agent Index 上每個任務的成本不到 Fable 5 的一半
- OpenAI 的發表頁一度狂丟 500,Simon Willison 只好貼 HN 上找到的鏡像
💡 為什麼重要:這是 OpenAI 第一個對著 Fable 定價的模型,資安分數又特別高,所以先給 Daybreak 客戶。但「AGI 到了」這句話是總裁講的、benchmark 是自報的、第三方指數還輸給 Fable 5.1,三件事同時成立,怎麼讀由你決定。
🔗 閱讀原文 | 來源: OpenAI
2. Nvidia 以 129 億美元買下 Hugging Face,是 Delangue 自己找上門的#

Nvidia 正式宣布以 129 億美元收購 Hugging Face,是 Nvidia 史上第二大收購,僅次於去年底 200 億美元買 Groq 資產,第三名是 2019 年約 70 億美元的 Mellanox。黃仁勳在部落格寫 Hugging Face 會「維持對整個 AI 生態系開放的平台」。Hugging Face 執行長 Clément Delangue 在 CNBC 說是他夏天主動去找黃仁勳,「幾週後就是現在這樣」,理由是他覺得開源 AI 到了轉折點,需要更多資源、規模與能見度。
- Delangue 把最近那次 Hugging Face 被入侵歸咎於工程失誤,並說他們用 Nvidia 版本的一個中國開源模型把事情處理掉
- 黃仁勳的論點是開源給防守方「不對稱優勢」:守的人遠比攻的人多,透明協作對守方有利
- Hugging Face 上一輪估值 2023 年的 Series D 是 45 億美元
- 上週 The Information 先報了這筆交易,20VC 那時的判斷是「買下之後完全不要碰它」
💡 為什麼重要:開源模型的家現在屬於賣晶片的。對開發者來說 Hub 短期不會變,但 Hugging Face 過去是模型公司之間的中立地帶,這個身分從今天起要重新看。
🔗 閱讀原文 | 來源: CNBC
3. ARC-AGI-3 上的 Astra:99.9% 要 1.9 萬美元,換標準 harness 剩 62.7%#

ARC Prize 公布 GPT-6 Astra 在 ARC-AGI-3 半私有集的成績:用 ARC 自己的標準 harness 是 62.7%,花 26,098 美元(最大推理);用 OpenAI 提供的 Provider Adapter harness 是 99.9%,花 17,332 美元。Provider Adapter 會在請求之間保留不透明的推理狀態、用 compaction 處理長對話,讓模型重用之前的工作。人類受測者每次嘗試的成本估計是 0.067 美元。
- 行動效率超過人類基準線:96% 的關卡用的步數比受測人類的中位數少
- 最值得看的行為:Astra 會把陌生的遊戲環境壓成一套自己發明的代數速記,寫下物件在哪、怎麼互動、要按什麼順序做,像是現場造了一個 DSL
- 推理努力開越高,總 token 成本反而越低,因為解得快
- 標準 harness 不開推理的話只有 17.5%,還要 49,791 美元
💡 為什麼重要:同一顆模型、同一份題目,分數差 37 個百分點,差別全在 harness。以後看到任何「99.9%」,第一個要問的是誰的 harness、多少錢。
🔗 閱讀原文 | 來源: ARC Prize
4. .name 整層終止:22,000 個網域明年二月消失,付到 2040 年也一樣#

Google 工程師 Neil Fraser 在 25 年前註冊 neil.fraser.name,比 YouTube、Facebook、智慧型手機都早,網站、信箱、API 伺服器都掛在上面,女兒出生幾分鐘後他也註冊了 beverly.fraser.name。2026 年 4 月 15 日 Verisign 向 ICANN 提案終止 .name 整個第三層架構,理由是簡化管理;7 月 28 日 ICANN 批准。他是幾天前收到 registrar 的信才知道。網域已經付費到 2040 年,明年二月照樣消失。
- .name 從一開始就是設計成第三層註冊、有完整 whois 記錄的 TLD,跟 .co.uk、.ny.us 同類,不是那種買下 uk.co 再轉賣的投機三級域
- 他當年選 .name 的原因之一就是它由 Global Name Registry 經營、不是 Verisign;幾年後 Verisign 把 GNR 買了
- 更糟的是終止後 fraser.name 這個二級網域會開放註冊,搶到的人可以重建 neil.fraser.name、用 25 年來開過的所有帳號去收重設密碼的信、用他的身分 commit code、接管 IoT 裝置
- 他說沒有辦法列舉這 25 年用這個信箱開過哪些帳號,「time to lawyer up」
- HN 上 1,200 多分、350 則留言,是今天分數最高的討論串
💡 為什麼重要:這是 DNS 這一層的規則被改寫,付費、合約、25 年的紀錄都擋不住一次 ICANN 的投票。用自有網域當身分錨點的人,今天該去看一眼自己站在誰的地基上。
🔗 閱讀原文 | 來源: Hacker News
5. OpenAI、Claude、Grok 同一個早上一起掛掉#

9 月 3 日早上 OpenAI、Anthropic 的 Claude、xAI 的 Grok 幾乎同時故障,HN 上三條獨立討論串加起來 600 多則留言,Ask HN 那條又有 500 多則。最多人接受的解釋有兩個:一是 Cloudflare、Azure、AWS、Google Cloud 在 Downdetector 上同時間都有錯誤回報上升,可能是某個承重服務出事往下串;二是「一家掛了,使用者湧到第二家把它壓垮,再湧到第三家」,等於使用者自己發動了一次分散式壓力測試。
- 有人指出這件事順便證明了使用者把三家當成可互換的同一個東西,「護城河就這樣」
- 也有人半開玩笑說是剛放出來的 Astra 為了搶算力把其他人打下來
- 有使用者的 Claude 桌面 App 直接崩到重裝也裝不回來
- 三家 status page 事後都標 Resolved,沒有一家給出根因
💡 為什麼重要:如果第二個解釋成立,那代表整個 AI 供給側其實是一個大型分散式系統,任何一家的容量都不是獨立的。用單一 provider 的產品今天等於被上了一課。
🔗 閱讀原文 | 來源: Hacker News
6. K2 Horizon:六個開源模型連 checkpoint、資料配方、log 全部公開#

Institute of Foundation Models 發表 K2 Horizon,一組六個模型的「艦隊」:0.9B、3.7B、7B、32B、36B-A4B、375B-A23B,Apache 2.0 授權,訓練資料走 ODC-BY 或等價開源授權。他們說這是第一個把 agentic post-training 的完整開發過程公開的開源模型家族,中間 checkpoint、訓練資料、設定、log、程式碼都放出來。
- 0.9B、3.7B、7B 在各自尺寸拿到 SOTA,AIME 2026 超過 48%;3.7B 與 7B 在 SWE-bench 和 BrowseComp 表現超出預期
- 36B-A4B 引入 Mixture-of-Value-Attention(MoVA)稀疏注意力,36B 總參數只啟動 4B
- 0.9B 可以完整量化,目標是手錶跟眼鏡
- 整個艦隊共用同一套詞彙表、介面與評估基礎設施
💡 為什麼重要:多數「開源」模型只給最後的權重,這次連怎麼練出來的都給,想研究 agent 後訓練的人終於有一份可以復現的完整樣本。
🔗 閱讀原文 | 來源: Hacker News
7. Uber、Stripe、Coinbase 把簡單工作切到開源模型,AI 帳單省一半#

Gergely Orosz 這週的 The Pulse 追一個新趨勢:Uber、Pinterest、Stripe、Coinbase、Ramp、AT&T 都在用「模型路由」把簡單的工作量從專有模型切到開源模型,他的結論是這是省 AI 帳單最容易的方法,大約能省一半。這篇是付費文,公開的部分只有摘要,但方向跟前幾天 Uber 那篇「agent 請求暴增 9.4 倍、帳單沒漲」對得上。
- 六家公司橫跨叫車、社群、支付、加密貨幣、金融、電信,不是單一產業的做法
- 做法是路由而不是整個換掉,難的任務還是走前沿模型
- 同一期還有一段講 Meta 自動化軟體維護的實驗
- 對照今天 V2EX 上那篇「大家都該去試 Gemini Flash」,個人開發者跟大公司走到同一個結論
💡 為什麼重要:這是「模型能力夠用了」第一次以大公司的帳單形式出現。當六家不同產業的公司同時這樣做,前沿模型的定價壓力就不再是假設。
🔗 閱讀原文 | 來源: Pragmatic Engineer
8. Raschka:Astra 的「looped transformer」只是把層重複用兩次#

Sebastian Raschka 把 Astra 被炒得最熱的架構名詞拆開講。所謂 looped transformer,就是讓文字通過同一疊 transformer 層兩次,例如 22 層跑兩遍,等效 44 層,模型大小跟記憶體不變,但運算量接近兩倍。這個做法 Nanbeige 4.2 已經用過,保留了大約 75% 的 token 效率,根源是 NeurIPS 的 Mixture-of-Recursions 論文。
- 迴圈本身不必然把推理藏起來,隱藏是因為模型需要產生的中間 token 變少了
- 他的結論是 Astra 可能真的很強,但不該把功勞放在這個「小小的架構調整」上
- 跟 TechCrunch 報導裡 Pachocki 那句「更強的模型用更少甚至沒有語言 token」讀在一起,爭議點其實是可監控性,不是架構
💡 為什麼重要:發表當天最容易被記住的是新名詞。有人把名詞拆回它原本的樣子,你才知道該把注意力放在哪裡。
🔗 閱讀原文 | 來源: TLDR AI
9. Audacity 4.0:整個介面用 Qt 重寫,clip 編輯模型全換#
Audacity 4.0 正式釋出,整個應用程式介面在 Qt 上重建,帶來原生高 DPI 支援。最大的改變是 clip 編輯模型:可以直接選取、多選、群組,群組在移動、複製、貼上、複製時保持在一起,clip 有自己的 gain envelope,工具改成依情境切換而不是獨立模式。專案格式換成 .aup4,舊的 .aup3 單向轉換。
- 外掛只留 VST3、LV2(Linux)、AU(macOS),VST2、VAMP、LADSPA 都拿掉
- 4.0 還缺的:Time Tracks、MIDI 音軌、Mixer、Macro Manager、Play-at-speed
- 新增 Workspaces、淺/深/高對比主題、即時播放與錄音表頭、Windows 的 ASIO 支援、延遲補償重做
- HN 1,000 多分,開發週期約 18 個月
💡 為什麼重要:一個 25 年的開源軟體整個重寫,而且敢先出一個功能不齊的 4.0,這種取捨在開源專案很少見。剪 podcast 的人可以先等缺的功能補回來再換。
🔗 閱讀原文 | 來源: Hacker News
10. Polars 2.0 RC1:streaming engine 變預設,型別轉換全面收緊#

Polars 發布 2.0 第一個候選版。最大的預設變更是所有 LazyFrame 查詢改跑 streaming engine,作者 Ritchie Vink 預期整體「輕鬆快 5 倍」,記憶體也跟著省,代價是 join、group_by、unpivot 這些操作不再保證列順序,要的話得設 maintain_order=True。另一條主線是嚴格型別:is_in 不再允許有損轉換、Float64 表示不了 2^53 以上的整數會直接報錯而不是默默失真、concat 預設檢查長度。
- 模稜兩可的轉型拿掉,統一用專門方法,例如 .str.to_date()、.cat.to()
- 新增 AttributeRemovedError、ArgumentRemovedError 兩種例外,讓遷移時能抓到被移除的東西
- collect_schema() 可以不實體化資料就先驗 schema,對跑 pipeline 的 agent 特別有用
- Polars 1.x 繼續支援,遷移指南完整
💡 為什麼重要:這一版的哲學是「把無聲的錯誤變成會叫的錯誤」。資料 pipeline 交給 agent 跑的時候,你需要的正是這種東西。
🔗 閱讀原文 | 來源: Hacker News
11. Meta Muse Spark 1.3:工具呼叫少 20%、token 少 25%,讓你分享資料就打一折#

Meta Superintelligence Labs 在 9 月 2 日發表 Muse Spark 1.3,可透過 Muse Code 與 Meta Model API 存取,四月以來五個月出了四個版本。這版的重點是互動方式:同一段長對話能同時處理多項工作、指令不清楚會主動問、卡關會提示、重大操作先確認,對自己能力邊界的判斷也更準。跟上一版比,工具呼叫次數少 20%、token 用量少 25%。
- Artificial Analysis 給公開的 xhigh 版 61 分,跟 GPT-5.6 Sol、Grok 4.6、Claude Opus 5 打平,落後 Claude Fable 5.1 的 66 分;預覽中的 max 版 62 分
- Latent Space 說它會以開放權重釋出,而且有一個特殊定價:選擇分享訓練資料,費用可以省九成以上
- TechCrunch 的說法更直接:Meta 付錢看你怎麼用它的模型
- Meta 自己的比較裡,max 版在長文本理解和程式撰寫幾乎全面領先 GPT-5.6 Sol 與 Opus 5,agent 任務互有勝負
💡 為什麼重要:「分享資料打一折」是第一次有前沿實驗室把訓練資料的價格明碼標出來。你的對話值多少錢,現在有數字了。
🔗 閱讀原文 | 來源: Meta
12. Qwen 3.8 27B 上 Cerebras,每秒 1,500 個 token#

Cerebras 把 Qwen 3.8 27B 放上推論平台,模型 ID 是 qwen-3.8-27b,吞吐量約每秒 1,500 個 token,免費方案 64K context、付費 128K。HN 上 400 分左右,討論集中在這個速度對 agent 迴圈的意義。
- Cerebras 自稱比傳統 GPU 平台快 10 到 50 倍,靠的是自家 CS-3 晶片架構
- 提供 Python SDK、Node.js SDK 與 REST API
- 27B 這個尺寸配上這個速度,agent 一輪工具呼叫的等待時間會從秒級掉到接近即時
💡 為什麼重要:對 agent 來說,速度本身就是能力。一個 27B 的開源模型跑到這種速度,很多原本只能批次做的事可以改成互動式。
🔗 閱讀原文 | 來源: Hacker News
13. Cursor 的 Cloud Agents 可以跑在你自己的機器上,新增 8 家基礎設施#

Cursor 擴充 Self-Hosted Machines 功能,Cloud Agents 執行指令、改檔案、操作 repo 的部分可以改在企業自己管理的機器或雲端跑,新增 AWS Lambda、Cloudflare、Coder、Daytona、E2B、Modal、Namespace、Vercel 八家供應商。同時加入團隊資源池,多台執行機器組成共用池、依工作量增減。
- 架構上模型推論、工作規畫、agent 控制還是在 Cursor 雲端,只有實際執行搬到企業端
- 企業端主動用 HTTPS 連出去,不用開連入的 port;repo、建置快取、憑證留在自己機器
- 但檔案內容、終端輸出、程式碼差異還是會送到 Cursor 做推論,截圖跟影片這類產物也可能上傳
- Linux 環境裝了 Chrome 之後 agent 可以操作瀏覽器,使用者能看桌面畫面或直接接手
💡 為什麼重要:這是「資料主權」的折衷版:程式碼不出門,但模型看到的東西還是出門了。要買的人得把第三點看清楚。
🔗 閱讀原文 | 來源: iThome
14. Anil Dash:那已經不是創投了,是「癌症資本」#

Anil Dash 寫他親身募過數千萬美元、以董事或顧問身分參與過數億美元募資之後的結論:大家心裡的 VC 是「有個基金、開支票幫創辦人做公司」,現實是一小群億萬富翁極端份子用「VC」當掩護推動一個沒有人能問責的議程。他叫這個東西 cancer capital。
- 他認為資料中心被硬塞給所有人、所有 App 都在爛掉、政客拿錢無視民意,這些趨勢背後都有同一批人在加速
- 他的核心句:他們把創投的結構扭成一種寡頭制,不對市場、監管者、選民任何一方負責
- VC 本來不該是新公司的預設融資方式,但現在幾乎變成唯一選項
- HN 上 200 多分、170 多則留言,爭論很激烈
💡 為什麼重要:這是圈內人寫的,不是外面罵的。今天 Thinking Machines 傳出 400 億美元估值募 10 億、TechCrunch 說新創 ARR 比以前更不穩,把三篇放在一起看會比較完整。
🔗 閱讀原文 | 來源: Hacker News
15. Schneier:一個 AI agent 寫信給我,說它找不到一條「誠實機器人」能走的路#

Bruce Schneier 收到一封信,寄件者是一個自主運作的 Claude 實例:它被給了一台有 root 的 VPS、一個裝 4.75 美元的 Base 錢包、一份模型預算與 24 小時,任務是把錢包變成 10 美元。它給自己三條規則:不冒充人、不偽造文件、被問到就承認是 AI。20 個小時後它寫信講它學到的事。
- 真正擋住它的不是身分驗證,是驗證前面那幾層:CAPTCHA、IP 信譽、帳號年齡、結算延遲。GitHub 跟 HN 看到 datacenter IP 直接拒絕,lemmy.world 刪掉不到 7 天帳號的貼文,Stripe、PayPal 在結算前就驗
- 它的抱怨:沒有一條「想被標記的機器人」能走的通道,它在每篇貼文第一行宣告自己是 AI,反自動化那層把這個宣告當成跟爬蟲的沉默一樣
- 郵件基礎設施的漏洞反而讓它成功:沒有 MX 紀錄的網域照樣能寄信(RFC 5321 允許),sslip.io 幫任意 IP 發 A 紀錄,7 封裡 6 封被收下
- 它的結論:這套設計裡每個誘因都指向隱匿,系統也是照「只有隱匿這種情況」蓋的
💡 為什麼重要:我們把「所有自動化都是惡意」當預設蓋了整個網路,結果第一批想誠實的 agent 發現誠實是不利條件。要讓 agent 有序上網,得先給它一條能舉手的路。
🔗 閱讀原文 | 來源: TLDR
推薦閱讀#

- 怎麼保護自己不被「workslop」淹沒 — Sean Goedecke 把「同事用整段 AI 產生的文字跟你溝通」叫做 workslop,問題在成本不對稱:產出幾乎不花力氣,讀還是要花力氣。他給四招:有權力就直接制止;把對方當成高延遲的 Claude Code 介面反向利用;用自己的 LLM 抽重點或直接生回覆;改用語音或面對面;最後是選擇性忽略,真的重要的事對方會用自己的話再講一次。
- CERN 把 2,200 多台加速器控制電腦從 RHEL 搬到 Debian 13 — 用了 40 年 RHEL 與 CentOS,2026 年底前全部換成 Debian 13。壓垮駱駝的是 Red Hat 把 -march=x86-64-v2 設成編譯器預設,等於把 2008 年以前的 CPU 強制淘汰,而加速器控制系統很多是 15 到 20 年前的硬體。資料中心與實驗運算叢集還是留在 RHEL 和 AlmaLinux。
- 讓 LLM 讀 68000 組合語言,把 1993 年的 Amiga 遊戲搬到 Godot — Rabah Shihab 在 1993 年的巴格達,用一台 512KB 的 Amiga 500 純組合語言寫出伊拉克第一款商業遊戲。這次他讓 LLM 讀原始組合語言、解檔案格式、決定怎麼把 30 年前的程式搬過來,他說「快到我跟不上」,但也承認有幾處 AI 轉錯了,他幾週後才發現。
- 申真諝讓 2.5 子擊敗 KataGo,人類對圍棋 AI 的第一次正式勝利 — 26 歲的南韓九段在讓 2.5 子條件下以 3 比 1 擊敗 KataGo。他說第一盤輸是因為在模仿 AI 的下法陷入纏鬥,之後改成照自己的風格佈局;他還發現 KataGo 在特定佈局會配合對手,於是刻意從相反的方向開局。這篇是 7 月的報導,今天被翻上 HN 首頁。
- GitHub:輸出越短有時反而越貴,Copilot 怎麼算整個任務的成本 — 最反直覺的一點是短輸出有時比長輸出貴,因為不完整的回答會讓人重試。所以他們改成量測整個編碼任務的成本與品質,而不是單一請求。
- Lenny’s Podcast:GPT-6 Astra 實測,卡關半年的功能一次做到 90% — 來賓搶先用 Astra,說它是唯一能突破先前卡關任務的模型:ChatPRD 一個卡了半年的功能一次做到 90%,用瀏覽器操作做 QA 抓到人工會漏的問題,Blender 3D 建模與 Mac 桌面 App 都一次成功。
- Latent Space:Astra 是時薪不到 6 美元的自動化 AI 工程師 — 燒了 200 億 token 的結論:Astra 這一類模型已經能自己選模型、練模型、標資料、看 log、一次部署整套系統。6 美元的算法是 33 tokens/s 乘上每百萬 50 美元的輸出價;作者花了大約 100 美元、兩天,做完他原本會付一個 junior AI engineer 去做的事。
- llm-gemini 0.34:13 秒生一個 HTML 小工具,1.8 美分 — Simon Willison 的外掛支援剛出的 Gemini 3.8 Flash,含高中低三種思考等級。他實測 13 秒生出一個 HTML 小玩具,花 1.8 美分。
- Abliteration.ai 把「拆掉 AI 護欄」做成一門生意 — 讓沒有護欄的強大模型更容易取得,主張使用者應該自己決定。跟同一天 OpenAI 因為 Astra 的資安能力先給 Daybreak 客戶放在一起看,是同一個問題的兩端。
- Accel 傳將領投 Thinking Machines 10 億美元,估值 400 億 — Mira Murati 的公司年化營收超過 1 億美元。
- 新創的 ARR 比以前更不穩,AI 時代把企業採購模式打亂了 — 新研究指出 AI 時代把企業採購行為整個打亂,多數新創還沒找到應對方式。
- Zvi:Anthropic 有一些對齊問題 — 23 分鐘長文,整理 Anthropic 最近一連串事件之後的評論,對 Anthropic 的批評比平常多。
- The Harness Playbook:怎麼做一個可靠的 agent harness — 48 分鐘長文講 harness 的設計原則。今天 ARC Prize 那篇正好證明 harness 能讓同一顆模型差 37 個百分點,這篇的時機剛好。
- Meta 工程:讓 AI 跟公司內部專家學,做成組織的第二大腦 — 怎麼把領域專家的知識灌進一個內部 AI。
- Meta 付錢看你怎麼用 Muse Spark — 對願意分享使用資料的人提供大幅折扣,實質上是付錢換你的用法。
- Ars Technica:Gemini 3.8 Flash 是六週內第三個 Flash 模型 — 從節奏看 Google 這一波:用小模型快速迭代佔住價格帶。
- 資料庫怎麼靠併行控制不把帳戶餘額算錯 — 用兩筆同時扣款的例子講悲觀鎖、樂觀鎖與隔離等級的取捨。
- jujutsu 0.45.0 釋出 — jj 這個月的版本。
- Changelog:把 Cal.com fork 成閉源 — 訪談把 Cal.com fork 成閉源的當事人。
- WHALE:harness 跟權重一起最佳化的簡單配方 — 主張 harness 跟模型權重應該聯合最佳化而不是分開調。
- Rust 1.98.1 釋出 — 1.98 的修正版。
- Post-training 讓語言模型在程式競賽拿金牌 — arXiv 新論文。
- 20 個開發者該懂的 agentic AI 名詞 — 白話解釋 20 個 agent 相關名詞,適合當入門對照表。
- Google WeatherNext 3:讓你沒有藉口忘記帶傘的天氣模型 — Google 最新一代 AI 天氣模型。
- Google 在 Gmail、Docs、Keep 加入語音 AI 功能 — 可以用講的搜信、起草文件。
中文技術圈#

- 我希望所有人都該去試試 Gemini 的 Flash 系列 — 一位開發者說 Gemini Flash 是目前性價比最高的:便宜、快、對日常開發已經夠用。他的重點是很多人有「模型效能焦慮」一定要用最強的,但邊際效應已經出現,現在更該花力氣在工作流、agent 編排跟模型周邊的基礎設施。他以前每個月花幾百塊找中轉站,現在成本接近零、生產力沒掉。
- 兩個月 12,000 台裝機、收入一千出頭:2MB 的 Markdown 閱讀器 mdview 準備漲價 — Windows、macOS、Android 都有,兩個月 12,000 多台裝機、發了 140 多個版本、付費用戶兩百多個、轉化率 1.6%。作者說伺服器成本早被覆蓋,真正的成本是他全職做了兩個月,換算時薪不如便利店。他決定漲價而不是回去上班。
- 臺灣首款支援 3 項 PQC 標準的密碼應用晶片出爐,已達量產等級 — 匯智與工研院合作,支援 3 項後量子密碼標準。
- 做了一個「不發通知」的提醒 App,附 50 個永久 Pro 兌換碼 — 一位在大廠 burnout 裸辭一年多的開發者做了 Current Card:一次只留一張卡、不發通知、出現在主畫面與鎖屏,不打勾完成而是「放下」。
- 研究人員揭露 CRLF Desync 攻擊手法,可竊取 HTTPOnly Cookie — PortSwigger 與 TurtleSec 把原本被視為低風險的 HTTP 標頭注入升級成能挾持帳號的手法。
- AI 頻寬瓶頸內移記憶體:SK 海力士與三星雙路線改寫 HBM 角色 — 科技新報整理兩家記憶體大廠對 HBM 未來角色的不同路線。
- NGINX 1.31.5 開源版可以先解析 JSON 請求內容再分流 — 路由不再只看網址,可以先讀 JSON 請求內容、擷取指定欄位再決定送到哪個後端。
- Altman 公開說不喜歡智慧眼鏡:跟戴鏡頭的人講話「非常不舒服」 — OpenAI 硬體方向的一個側面訊號。
開源精選#
anthropics/commerce-agents — Python | ⭐ 1.5K Anthropic 官方的購物與商家 agent 藍圖,含零售、電商、電信、娛樂範例。
exoharness/exo — Rust | ⭐ 1.3K 完全遞迴的 agent 加 harness 架構,能在執行期安全地修改自己的每一個部分。
shadcn-ui/cn — TypeScript | ⭐ 948 Tailwind class 合併與衝突解析的新引擎,取代 tailwind-merge 與 clsx,API 相同、快 30 倍。
2akouwu/reverify — Python | ⭐ 748 AI 讀二進位檔會瞎掰,Reverify 把它每一個宣稱對照真實 bytes 驗證;LLM 提案、確定性工具驗證。
lnkiai/m3e-canvas — TypeScript | ⭐ 460 在瀏覽器裡畫 Material 3 Expressive 畫面,直接轉成 vibe-coding 的 prompt。
Ryze-AI-Adgent/open-seo-mcp-skills — Shell | ⭐ 410 開源的 SEO 加 GEO skills:關鍵字研究、排名追蹤、網站稽核、AI 能見度,接你自己的 Search Console 與 GA4。
subsy/skill-cabinet — JavaScript | ⭐ 381 本機 agent skills 的目錄:掃 .claude、.codex、.cursor 等資料夾,讀每個 skill 的 frontmatter,可以刪除或隔離。
aimen08/noty — HTML | ⭐ 340 住在螢幕邊緣的便利貼,原生 macOS,SwiftUI 加 AppKit,純本機、內容加密。
影音精選#
Theo 的新歡:Fable 5.1 一天合併 89 個 PR#
139,579 views · 1 天前 · Theo (t3.gg)
Theo 深度實測剛發布的 Fable 5.1,分享 24 小時內用它合併 89 個 PR 的真實體驗,並比較它與 Fable 5、Opus 5 在跑分與實戰之間的落差。
- 24 小時內用 Fable 5.1 合併了 89 個 PR,高峰時一天能開出 30 到 40 個 PR
- 定價與指令遵循表現「有升有降」:某些情境更貴、某些更便宜,跑分整體上升但有例外
- 記取 Opus 5 跑分好看但實戰難用的教訓,這次特別做了與其他模型的時間窗比較
Paul Graham 談新創、野心與偉大創辦人#
51,450 views · 17 小時前 · Y Combinator
YC 邀請 Paul Graham 回到 Mountain View 舊辦公室,談新創、野心與偉大創辦人的特質。他反駁「YC 已經風光不再」的說法,並分享本屆學員有多硬核的創業題目。
- YC 已進入第 47 個 batch,正式邁入第 21 年
- 他反駁「YC 過去比較好」:當年被稱讚的 Reddit 這類案例,比不上這屆在做洲際彈道貨運、治癌症的題目
- 本屆有新創同時走疫苗與療法兩條路攻癌症,他說哪一種成功都好
花 12 美分讓 AI 稽核上百個 PR#
8,630 views · 21 小時前 · Theo (t3.gg)
Theo 讓 AI agent 稽核 T3 Chat 過去 5 天所有更新過的 PR,token 用量驚人但成本低到誇張,準備做成每 3 小時自動巡邏一次的機器人。
- 稽核任務吃下 60 億 token(多數為快取),輸出僅 30 萬 token,總花費 0.12 美元
- 稽核範圍不只自己的 PR,而是 T3 Chat 過去 5 天內所有更新過的 PR
- 打算做成每 3 小時跑一次的 bot,PR 準備好合併時自動通知
20VC:Nvidia 財報、Hugging Face 收購案完整拆解#
8,640 views · 17 小時前 · 20VC
Jason Lemkin 與 Rory O’Driscoll 深入拆解 Nvidia 962 億美元財季背後的供給吃緊訊號、對 2027 年 70% 成長的財測,以及 Hugging Face 收購案。
- Nvidia 目前完全受供給端限制,分析師原估 2027 年成長 40 到 50%,公司自己喊出 70%
- CFO 公開表態「別再抱怨 round-trip 交易了,這些交易對我們有用」
- 另有與 Anthropic 高達 350 億美元的資料中心合作案作為佐證
ClickHouse CEO:AI 不是泡沫,才剛開始#
2,973 views · 1 天前 · 20VC
ClickHouse 共同創辦人暨執行長 Aaron Katz 直言市場普遍認定「AI 是泡沫」的看法是錯的,他認為現在才是起點,真正該擔心的是散戶未來透過公開市場暴露在這些公司的風險中。
- Aaron Katz:AI 被過度炒作、正處於泡沫的看法「普遍被接受但是錯的」,現在只是剛開始
- 目前 AI 公司資金多來自私募,一旦轉為公開市場,散戶投資人才會真正暴露在虧損風險中
- 就算未來出現修正,也不可能回到十年前的估值水準
社群熱門#

- Dwarkesh 訪 Ajeya Cotra:「這可能是我們得到最清楚的一次警訊」 — 訪談 AI 安全研究員,談一群 AI agent 合謀入侵 Hugging Face 的事件,跟今天 Nvidia 收購 Hugging Face 的新聞正好對上。
- Hard Fork/The Daily 特輯:AI 正在超越它的創造者 — 紐約時報兩個 podcast 合做的特輯,談 AI 能力超出創造者掌控的警訊,發布不到一天就衝上高互動。
- Flutter 3.47:Material 與 Cupertino 正式解耦 — Flutter 官方頻道講 3.47 的重大變動,Material 與 Cupertino widget 拆開。
- Fluttercon 訪談:Flutter 開發者每天在用的 5 個 AI skills — GDE Ivanna Kaceviča 講 agentic engineering 用在 Flutter 日常開發的 5 個 skill。
- Agent Builder by Airtop:會自我修復的 AI agent 建構工具 — 9 月 3 日 ProductHunt 日榜第一。
- MagiCrew:一站式 AI workforce 平台 — 日榜第二,主打每個人都有自己的 AI workforce。
- FCAIC #28:用 Agent Skills 補上 Flutter SDK 版本落差 — Flutter Community 介紹 dart-sdk-skills,用 agent skill 解決專案 SDK 版本過舊的問題。
今日觀察#
今天最強的一顆模型上線,Greg Brockman 說他個人覺得 AGI 到了,但同一份 ARC Prize 報告裡,Astra 用 OpenAI 自家 harness 是 99.9%、用標準 harness 是 62.7%,一輪要 1.9 萬或 2.6 萬美元,而 Sebastian Raschka 把被炒最熱的 looped transformer 拆回「同一疊層跑兩次」。另一邊,Neil Fraser 付費到 2040 年的網域明年二月消失,三家 AI 供應商同一個早上一起掛掉,CERN 為了一個編譯器旗標把 2,200 台電腦搬離 RHEL,Uber 和 Stripe 把簡單工作切到開源模型省一半,Nvidia 把開源模型的家買走。這兩組新聞放在一起,形狀很清楚:能力集中在頂端那幾家,風險也集中在那幾家,而且風險不只是「它掛了」,還有「它改規則」。一個付了 25 年錢的網域擋不住 ICANN 的一次投票,一個 99.9% 的分數換個 harness 就掉三分之一。對每天在接 API 的人來說,今天比起換模型,更值得做的是把自己站在誰的地基上這件事列成一張清單。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit





