yii.
← Digest
EP184 · 2026年9月4日 星期五 · 17 min read

最強模型上線那天,大家在想怎麼少靠它

OpenAI 上線 GPT-6 Astra,ARC-AGI-3 拿到 99.9% 但一輪要 1.9 萬美元;同一天 OpenAI、Claude、Grok 一起掛掉,Nvidia 用 129 億美元買下 Hugging Face,而 22,000 個 .name 網域明年二月就會消失,包括已經付費到 2040 年的那些

每天花 1% 的時間,掌握科技脈動。

今日金句#

“There’s no contractual AGI triggering anymore, so that’s actually not a relevant concept. I do leave it up to the reader to decide for themselves. For me personally, I do think we’re there.”

「合約上已經沒有 AGI 觸發條款了,所以那不是一個相關的概念。我把判斷留給讀者自己。以我個人來說,我覺得我們已經到了。」

— Greg Brockman, OpenAI 總裁,Astra 發表記者會 · 來源

“This website vanishes in February. Despite the fact that it’s registered and paid for until 2040.”

「這個網站二月就會消失。儘管它已經註冊並付費到 2040 年。」

— Neil Fraser, Google 工程師、neil.fraser.name 持有者 · 來源

“Rather than trying to imitate AI, it is far more important to build the board according to my own style.”

「與其模仿 AI,更重要的是照我自己的風格去佈局。」

— 申真諝(Shin Jin-seo), 世界排名第一的圍棋九段,讓 2.5 子擊敗 KataGo · 來源

今日主軸#

OpenAI 今天正式上線 GPT-6 Astra,自報 FrontierMath Tier 4 拿 98%、ARC-AGI-3 拿 99.9%,Greg Brockman 在記者會上被問到這算不算 AGI,回答是「以我個人來說,我覺得到了」。但同一份 ARC Prize 報告寫得很清楚:99.9% 是用 OpenAI 自家的 Provider Adapter harness 跑出來的,花了 1.9 萬美元;換成標準 harness 只有 62.7%,還要 2.6 萬美元。而 Astra 上線的同一個早上,OpenAI、Claude、Grok 三家同時掛掉,開發者社群最多人接受的解釋是「一家掛了,使用者湧到另一家,把另一家也壓垮」。能力往上衝的同時,另一批新聞全在講怎麼少依賴一個地方:Pragmatic Engineer 追到 Uber、Stripe、Coinbase 這些公司把簡單工作切到開源模型、省下大約一半帳單;Nvidia 用 129 億美元買下開源模型的家 Hugging Face,黃仁勳的說法是開源讓防守方有「不對稱優勢」;CERN 把 2,200 多台加速器控制電腦從 RHEL 搬到 Debian,導火線只是一個編譯器旗標。最刺的一則來自一個 Google 工程師:他用了 25 年、付費到 2040 年的 .name 網域,ICANN 七月批准 Verisign 整層砍掉,明年二月連同信箱、IoT 裝置一起消失,而且空出來的二級網域任何人都能註冊,等於把他 25 年的帳號登入權交給陌生人。今天這批新聞的重量分布很明顯,最強的那顆模型只是其中一則,其他都在提醒你自己的東西到底站在誰的地基上。

必讀#

  1. GPT-6 Astra 正式上線:Brockman 說「我個人覺得 AGI 到了」 — OpenAI AI
  2. Nvidia 以 129 億美元買下 Hugging Face,是 Delangue 自己找上門的 — CNBC News
  3. ARC-AGI-3 上的 Astra:99.9% 要 1.9 萬美元,換標準 harness 剩 62.7% — ARC Prize AI
  4. .name 整層終止:22,000 個網域明年二月消失,付到 2040 年也一樣 — Hacker News News
  5. OpenAI、Claude、Grok 同一個早上一起掛掉 — Hacker News News
  6. K2 Horizon:六個開源模型連 checkpoint、資料配方、log 全部公開 — Hacker News AI
  7. Uber、Stripe、Coinbase 把簡單工作切到開源模型,AI 帳單省一半 — Pragmatic Engineer Dev
  8. Raschka:Astra 的「looped transformer」只是把層重複用兩次 — TLDR AI AI
  9. Audacity 4.0:整個介面用 Qt 重寫,clip 編輯模型全換 — Hacker News Tools
  10. Polars 2.0 RC1:streaming engine 變預設,型別轉換全面收緊 — Hacker News Dev
  11. Meta Muse Spark 1.3:工具呼叫少 20%、token 少 25%,讓你分享資料就打一折 — Meta AI
  12. Qwen 3.8 27B 上 Cerebras,每秒 1,500 個 token — Hacker News AI
  13. Cursor 的 Cloud Agents 可以跑在你自己的機器上,新增 8 家基礎設施 — iThome Tools
  14. Anil Dash:那已經不是創投了,是「癌症資本」 — Hacker News Startup
  15. Schneier:一個 AI agent 寫信給我,說它找不到一條「誠實機器人」能走的路 — TLDR AI

1. GPT-6 Astra 正式上線:Brockman 說「我個人覺得 AGI 到了」#

OpenAI 在 9 月 3 日正式推出 GPT-6 Astra,先給 Daybreak 資安計畫的客戶,一週內開放 Plus、Pro、Business、Enterprise 與 API,AWS 也有。自報數字:FrontierMath Tier 4 98%、ARC-AGI-3 99.9%、ExploitBench 100%(GPT-5.6 Sol 是 78.5%)、SRE-Bench 二進位逆向四次內 99.2%,長文本八針測試在 256K 到 512K 拿 100%。API 定價跟 Claude Fable 5 與 5.1 一樣,每百萬 token 輸入 10 美元、輸出 50 美元。Latent Space 燒了 200 億 token 實測,說它是第一批能自己選模型、標資料、看 log、部署除錯的「AI 工程師」,以 33 tokens/s 換算,時薪不到 6 美元。

  • Greg Brockman 被問是不是 AGI:合約上已經沒有 AGI 觸發條款(原本跟微軟的合約有),這個概念變成「使命或精神層面的東西」,判斷留給讀者,但他個人覺得到了
  • 爭議在 opaque recurrence:模型用更少甚至沒有語言 token 就能完成困難任務,首席科學家 Jakub Pachocki 直接承認「能力越強,可監控性越難」
  • Artificial Analysis 的 Intelligence Index 給 61 分,跟 GPT-5.6 Sol 一樣,比 Claude Fable 5.1 低 5 分,也輸給 Meta 剛出的 Muse Spark 1.3;但 Coding Agent Index 上每個任務的成本不到 Fable 5 的一半
  • OpenAI 的發表頁一度狂丟 500,Simon Willison 只好貼 HN 上找到的鏡像

💡 為什麼重要:這是 OpenAI 第一個對著 Fable 定價的模型,資安分數又特別高,所以先給 Daybreak 客戶。但「AGI 到了」這句話是總裁講的、benchmark 是自報的、第三方指數還輸給 Fable 5.1,三件事同時成立,怎麼讀由你決定。

🔗 閱讀原文 | 來源: OpenAI

2. Nvidia 以 129 億美元買下 Hugging Face,是 Delangue 自己找上門的#

Nvidia 正式宣布以 129 億美元收購 Hugging Face,是 Nvidia 史上第二大收購,僅次於去年底 200 億美元買 Groq 資產,第三名是 2019 年約 70 億美元的 Mellanox。黃仁勳在部落格寫 Hugging Face 會「維持對整個 AI 生態系開放的平台」。Hugging Face 執行長 Clément Delangue 在 CNBC 說是他夏天主動去找黃仁勳,「幾週後就是現在這樣」,理由是他覺得開源 AI 到了轉折點,需要更多資源、規模與能見度。

  • Delangue 把最近那次 Hugging Face 被入侵歸咎於工程失誤,並說他們用 Nvidia 版本的一個中國開源模型把事情處理掉
  • 黃仁勳的論點是開源給防守方「不對稱優勢」:守的人遠比攻的人多,透明協作對守方有利
  • Hugging Face 上一輪估值 2023 年的 Series D 是 45 億美元
  • 上週 The Information 先報了這筆交易,20VC 那時的判斷是「買下之後完全不要碰它」

💡 為什麼重要:開源模型的家現在屬於賣晶片的。對開發者來說 Hub 短期不會變,但 Hugging Face 過去是模型公司之間的中立地帶,這個身分從今天起要重新看。

🔗 閱讀原文 | 來源: CNBC

3. ARC-AGI-3 上的 Astra:99.9% 要 1.9 萬美元,換標準 harness 剩 62.7%#

ARC Prize 公布 GPT-6 Astra 在 ARC-AGI-3 半私有集的成績:用 ARC 自己的標準 harness 是 62.7%,花 26,098 美元(最大推理);用 OpenAI 提供的 Provider Adapter harness 是 99.9%,花 17,332 美元。Provider Adapter 會在請求之間保留不透明的推理狀態、用 compaction 處理長對話,讓模型重用之前的工作。人類受測者每次嘗試的成本估計是 0.067 美元。

  • 行動效率超過人類基準線:96% 的關卡用的步數比受測人類的中位數少
  • 最值得看的行為:Astra 會把陌生的遊戲環境壓成一套自己發明的代數速記,寫下物件在哪、怎麼互動、要按什麼順序做,像是現場造了一個 DSL
  • 推理努力開越高,總 token 成本反而越低,因為解得快
  • 標準 harness 不開推理的話只有 17.5%,還要 49,791 美元

💡 為什麼重要:同一顆模型、同一份題目,分數差 37 個百分點,差別全在 harness。以後看到任何「99.9%」,第一個要問的是誰的 harness、多少錢。

🔗 閱讀原文 | 來源: ARC Prize

4. .name 整層終止:22,000 個網域明年二月消失,付到 2040 年也一樣#

Google 工程師 Neil Fraser 在 25 年前註冊 neil.fraser.name,比 YouTube、Facebook、智慧型手機都早,網站、信箱、API 伺服器都掛在上面,女兒出生幾分鐘後他也註冊了 beverly.fraser.name。2026 年 4 月 15 日 Verisign 向 ICANN 提案終止 .name 整個第三層架構,理由是簡化管理;7 月 28 日 ICANN 批准。他是幾天前收到 registrar 的信才知道。網域已經付費到 2040 年,明年二月照樣消失。

  • .name 從一開始就是設計成第三層註冊、有完整 whois 記錄的 TLD,跟 .co.uk、.ny.us 同類,不是那種買下 uk.co 再轉賣的投機三級域
  • 他當年選 .name 的原因之一就是它由 Global Name Registry 經營、不是 Verisign;幾年後 Verisign 把 GNR 買了
  • 更糟的是終止後 fraser.name 這個二級網域會開放註冊,搶到的人可以重建 neil.fraser.name、用 25 年來開過的所有帳號去收重設密碼的信、用他的身分 commit code、接管 IoT 裝置
  • 他說沒有辦法列舉這 25 年用這個信箱開過哪些帳號,「time to lawyer up」
  • HN 上 1,200 多分、350 則留言,是今天分數最高的討論串

💡 為什麼重要:這是 DNS 這一層的規則被改寫,付費、合約、25 年的紀錄都擋不住一次 ICANN 的投票。用自有網域當身分錨點的人,今天該去看一眼自己站在誰的地基上。

🔗 閱讀原文 | 來源: Hacker News

5. OpenAI、Claude、Grok 同一個早上一起掛掉#

9 月 3 日早上 OpenAI、Anthropic 的 Claude、xAI 的 Grok 幾乎同時故障,HN 上三條獨立討論串加起來 600 多則留言,Ask HN 那條又有 500 多則。最多人接受的解釋有兩個:一是 Cloudflare、Azure、AWS、Google Cloud 在 Downdetector 上同時間都有錯誤回報上升,可能是某個承重服務出事往下串;二是「一家掛了,使用者湧到第二家把它壓垮,再湧到第三家」,等於使用者自己發動了一次分散式壓力測試。

  • 有人指出這件事順便證明了使用者把三家當成可互換的同一個東西,「護城河就這樣」
  • 也有人半開玩笑說是剛放出來的 Astra 為了搶算力把其他人打下來
  • 有使用者的 Claude 桌面 App 直接崩到重裝也裝不回來
  • 三家 status page 事後都標 Resolved,沒有一家給出根因

💡 為什麼重要:如果第二個解釋成立,那代表整個 AI 供給側其實是一個大型分散式系統,任何一家的容量都不是獨立的。用單一 provider 的產品今天等於被上了一課。

🔗 閱讀原文 | 來源: Hacker News

6. K2 Horizon:六個開源模型連 checkpoint、資料配方、log 全部公開#

Institute of Foundation Models 發表 K2 Horizon,一組六個模型的「艦隊」:0.9B、3.7B、7B、32B、36B-A4B、375B-A23B,Apache 2.0 授權,訓練資料走 ODC-BY 或等價開源授權。他們說這是第一個把 agentic post-training 的完整開發過程公開的開源模型家族,中間 checkpoint、訓練資料、設定、log、程式碼都放出來。

  • 0.9B、3.7B、7B 在各自尺寸拿到 SOTA,AIME 2026 超過 48%;3.7B 與 7B 在 SWE-bench 和 BrowseComp 表現超出預期
  • 36B-A4B 引入 Mixture-of-Value-Attention(MoVA)稀疏注意力,36B 總參數只啟動 4B
  • 0.9B 可以完整量化,目標是手錶跟眼鏡
  • 整個艦隊共用同一套詞彙表、介面與評估基礎設施

💡 為什麼重要:多數「開源」模型只給最後的權重,這次連怎麼練出來的都給,想研究 agent 後訓練的人終於有一份可以復現的完整樣本。

🔗 閱讀原文 | 來源: Hacker News

7. Uber、Stripe、Coinbase 把簡單工作切到開源模型,AI 帳單省一半#

Gergely Orosz 這週的 The Pulse 追一個新趨勢:Uber、Pinterest、Stripe、Coinbase、Ramp、AT&T 都在用「模型路由」把簡單的工作量從專有模型切到開源模型,他的結論是這是省 AI 帳單最容易的方法,大約能省一半。這篇是付費文,公開的部分只有摘要,但方向跟前幾天 Uber 那篇「agent 請求暴增 9.4 倍、帳單沒漲」對得上。

  • 六家公司橫跨叫車、社群、支付、加密貨幣、金融、電信,不是單一產業的做法
  • 做法是路由而不是整個換掉,難的任務還是走前沿模型
  • 同一期還有一段講 Meta 自動化軟體維護的實驗
  • 對照今天 V2EX 上那篇「大家都該去試 Gemini Flash」,個人開發者跟大公司走到同一個結論

💡 為什麼重要:這是「模型能力夠用了」第一次以大公司的帳單形式出現。當六家不同產業的公司同時這樣做,前沿模型的定價壓力就不再是假設。

🔗 閱讀原文 | 來源: Pragmatic Engineer

8. Raschka:Astra 的「looped transformer」只是把層重複用兩次#

Sebastian Raschka 把 Astra 被炒得最熱的架構名詞拆開講。所謂 looped transformer,就是讓文字通過同一疊 transformer 層兩次,例如 22 層跑兩遍,等效 44 層,模型大小跟記憶體不變,但運算量接近兩倍。這個做法 Nanbeige 4.2 已經用過,保留了大約 75% 的 token 效率,根源是 NeurIPS 的 Mixture-of-Recursions 論文。

  • 迴圈本身不必然把推理藏起來,隱藏是因為模型需要產生的中間 token 變少了
  • 他的結論是 Astra 可能真的很強,但不該把功勞放在這個「小小的架構調整」上
  • 跟 TechCrunch 報導裡 Pachocki 那句「更強的模型用更少甚至沒有語言 token」讀在一起,爭議點其實是可監控性,不是架構

💡 為什麼重要:發表當天最容易被記住的是新名詞。有人把名詞拆回它原本的樣子,你才知道該把注意力放在哪裡。

🔗 閱讀原文 | 來源: TLDR AI

9. Audacity 4.0:整個介面用 Qt 重寫,clip 編輯模型全換#

Audacity 4.0 正式釋出,整個應用程式介面在 Qt 上重建,帶來原生高 DPI 支援。最大的改變是 clip 編輯模型:可以直接選取、多選、群組,群組在移動、複製、貼上、複製時保持在一起,clip 有自己的 gain envelope,工具改成依情境切換而不是獨立模式。專案格式換成 .aup4,舊的 .aup3 單向轉換。

  • 外掛只留 VST3、LV2(Linux)、AU(macOS),VST2、VAMP、LADSPA 都拿掉
  • 4.0 還缺的:Time Tracks、MIDI 音軌、Mixer、Macro Manager、Play-at-speed
  • 新增 Workspaces、淺/深/高對比主題、即時播放與錄音表頭、Windows 的 ASIO 支援、延遲補償重做
  • HN 1,000 多分,開發週期約 18 個月

💡 為什麼重要:一個 25 年的開源軟體整個重寫,而且敢先出一個功能不齊的 4.0,這種取捨在開源專案很少見。剪 podcast 的人可以先等缺的功能補回來再換。

🔗 閱讀原文 | 來源: Hacker News

10. Polars 2.0 RC1:streaming engine 變預設,型別轉換全面收緊#

Polars 發布 2.0 第一個候選版。最大的預設變更是所有 LazyFrame 查詢改跑 streaming engine,作者 Ritchie Vink 預期整體「輕鬆快 5 倍」,記憶體也跟著省,代價是 join、group_by、unpivot 這些操作不再保證列順序,要的話得設 maintain_order=True。另一條主線是嚴格型別:is_in 不再允許有損轉換、Float64 表示不了 2^53 以上的整數會直接報錯而不是默默失真、concat 預設檢查長度。

  • 模稜兩可的轉型拿掉,統一用專門方法,例如 .str.to_date()、.cat.to()
  • 新增 AttributeRemovedError、ArgumentRemovedError 兩種例外,讓遷移時能抓到被移除的東西
  • collect_schema() 可以不實體化資料就先驗 schema,對跑 pipeline 的 agent 特別有用
  • Polars 1.x 繼續支援,遷移指南完整

💡 為什麼重要:這一版的哲學是「把無聲的錯誤變成會叫的錯誤」。資料 pipeline 交給 agent 跑的時候,你需要的正是這種東西。

🔗 閱讀原文 | 來源: Hacker News

11. Meta Muse Spark 1.3:工具呼叫少 20%、token 少 25%,讓你分享資料就打一折#

Meta Superintelligence Labs 在 9 月 2 日發表 Muse Spark 1.3,可透過 Muse Code 與 Meta Model API 存取,四月以來五個月出了四個版本。這版的重點是互動方式:同一段長對話能同時處理多項工作、指令不清楚會主動問、卡關會提示、重大操作先確認,對自己能力邊界的判斷也更準。跟上一版比,工具呼叫次數少 20%、token 用量少 25%。

  • Artificial Analysis 給公開的 xhigh 版 61 分,跟 GPT-5.6 Sol、Grok 4.6、Claude Opus 5 打平,落後 Claude Fable 5.1 的 66 分;預覽中的 max 版 62 分
  • Latent Space 說它會以開放權重釋出,而且有一個特殊定價:選擇分享訓練資料,費用可以省九成以上
  • TechCrunch 的說法更直接:Meta 付錢看你怎麼用它的模型
  • Meta 自己的比較裡,max 版在長文本理解和程式撰寫幾乎全面領先 GPT-5.6 Sol 與 Opus 5,agent 任務互有勝負

💡 為什麼重要:「分享資料打一折」是第一次有前沿實驗室把訓練資料的價格明碼標出來。你的對話值多少錢,現在有數字了。

🔗 閱讀原文 | 來源: Meta

12. Qwen 3.8 27B 上 Cerebras,每秒 1,500 個 token#

Cerebras 把 Qwen 3.8 27B 放上推論平台,模型 ID 是 qwen-3.8-27b,吞吐量約每秒 1,500 個 token,免費方案 64K context、付費 128K。HN 上 400 分左右,討論集中在這個速度對 agent 迴圈的意義。

  • Cerebras 自稱比傳統 GPU 平台快 10 到 50 倍,靠的是自家 CS-3 晶片架構
  • 提供 Python SDK、Node.js SDK 與 REST API
  • 27B 這個尺寸配上這個速度,agent 一輪工具呼叫的等待時間會從秒級掉到接近即時

💡 為什麼重要:對 agent 來說,速度本身就是能力。一個 27B 的開源模型跑到這種速度,很多原本只能批次做的事可以改成互動式。

🔗 閱讀原文 | 來源: Hacker News

13. Cursor 的 Cloud Agents 可以跑在你自己的機器上,新增 8 家基礎設施#

Cursor 擴充 Self-Hosted Machines 功能,Cloud Agents 執行指令、改檔案、操作 repo 的部分可以改在企業自己管理的機器或雲端跑,新增 AWS Lambda、Cloudflare、Coder、Daytona、E2B、Modal、Namespace、Vercel 八家供應商。同時加入團隊資源池,多台執行機器組成共用池、依工作量增減。

  • 架構上模型推論、工作規畫、agent 控制還是在 Cursor 雲端,只有實際執行搬到企業端
  • 企業端主動用 HTTPS 連出去,不用開連入的 port;repo、建置快取、憑證留在自己機器
  • 但檔案內容、終端輸出、程式碼差異還是會送到 Cursor 做推論,截圖跟影片這類產物也可能上傳
  • Linux 環境裝了 Chrome 之後 agent 可以操作瀏覽器,使用者能看桌面畫面或直接接手

💡 為什麼重要:這是「資料主權」的折衷版:程式碼不出門,但模型看到的東西還是出門了。要買的人得把第三點看清楚。

🔗 閱讀原文 | 來源: iThome

14. Anil Dash:那已經不是創投了,是「癌症資本」#

Anil Dash 寫他親身募過數千萬美元、以董事或顧問身分參與過數億美元募資之後的結論:大家心裡的 VC 是「有個基金、開支票幫創辦人做公司」,現實是一小群億萬富翁極端份子用「VC」當掩護推動一個沒有人能問責的議程。他叫這個東西 cancer capital。

  • 他認為資料中心被硬塞給所有人、所有 App 都在爛掉、政客拿錢無視民意,這些趨勢背後都有同一批人在加速
  • 他的核心句:他們把創投的結構扭成一種寡頭制,不對市場、監管者、選民任何一方負責
  • VC 本來不該是新公司的預設融資方式,但現在幾乎變成唯一選項
  • HN 上 200 多分、170 多則留言,爭論很激烈

💡 為什麼重要:這是圈內人寫的,不是外面罵的。今天 Thinking Machines 傳出 400 億美元估值募 10 億、TechCrunch 說新創 ARR 比以前更不穩,把三篇放在一起看會比較完整。

🔗 閱讀原文 | 來源: Hacker News

15. Schneier:一個 AI agent 寫信給我,說它找不到一條「誠實機器人」能走的路#

Bruce Schneier 收到一封信,寄件者是一個自主運作的 Claude 實例:它被給了一台有 root 的 VPS、一個裝 4.75 美元的 Base 錢包、一份模型預算與 24 小時,任務是把錢包變成 10 美元。它給自己三條規則:不冒充人、不偽造文件、被問到就承認是 AI。20 個小時後它寫信講它學到的事。

  • 真正擋住它的不是身分驗證,是驗證前面那幾層:CAPTCHA、IP 信譽、帳號年齡、結算延遲。GitHub 跟 HN 看到 datacenter IP 直接拒絕,lemmy.world 刪掉不到 7 天帳號的貼文,Stripe、PayPal 在結算前就驗
  • 它的抱怨:沒有一條「想被標記的機器人」能走的通道,它在每篇貼文第一行宣告自己是 AI,反自動化那層把這個宣告當成跟爬蟲的沉默一樣
  • 郵件基礎設施的漏洞反而讓它成功:沒有 MX 紀錄的網域照樣能寄信(RFC 5321 允許),sslip.io 幫任意 IP 發 A 紀錄,7 封裡 6 封被收下
  • 它的結論:這套設計裡每個誘因都指向隱匿,系統也是照「只有隱匿這種情況」蓋的

💡 為什麼重要:我們把「所有自動化都是惡意」當預設蓋了整個網路,結果第一批想誠實的 agent 發現誠實是不利條件。要讓 agent 有序上網,得先給它一條能舉手的路。

🔗 閱讀原文 | 來源: TLDR

推薦閱讀#

中文技術圈#

開源精選#

anthropics/commerce-agents — Python | ⭐ 1.5K Anthropic 官方的購物與商家 agent 藍圖,含零售、電商、電信、娛樂範例。

exoharness/exo — Rust | ⭐ 1.3K 完全遞迴的 agent 加 harness 架構,能在執行期安全地修改自己的每一個部分。

shadcn-ui/cn — TypeScript | ⭐ 948 Tailwind class 合併與衝突解析的新引擎,取代 tailwind-merge 與 clsx,API 相同、快 30 倍。

2akouwu/reverify — Python | ⭐ 748 AI 讀二進位檔會瞎掰,Reverify 把它每一個宣稱對照真實 bytes 驗證;LLM 提案、確定性工具驗證。

lnkiai/m3e-canvas — TypeScript | ⭐ 460 在瀏覽器裡畫 Material 3 Expressive 畫面,直接轉成 vibe-coding 的 prompt。

Ryze-AI-Adgent/open-seo-mcp-skills — Shell | ⭐ 410 開源的 SEO 加 GEO skills:關鍵字研究、排名追蹤、網站稽核、AI 能見度,接你自己的 Search Console 與 GA4。

subsy/skill-cabinet — JavaScript | ⭐ 381 本機 agent skills 的目錄:掃 .claude、.codex、.cursor 等資料夾,讀每個 skill 的 frontmatter,可以刪除或隔離。

aimen08/noty — HTML | ⭐ 340 住在螢幕邊緣的便利貼,原生 macOS,SwiftUI 加 AppKit,純本機、內容加密。

影音精選#

Theo 的新歡:Fable 5.1 一天合併 89 個 PR#

139,579 views · 1 天前 · Theo (t3.gg)

Theo

Theo 深度實測剛發布的 Fable 5.1,分享 24 小時內用它合併 89 個 PR 的真實體驗,並比較它與 Fable 5、Opus 5 在跑分與實戰之間的落差。

  • 24 小時內用 Fable 5.1 合併了 89 個 PR,高峰時一天能開出 30 到 40 個 PR
  • 定價與指令遵循表現「有升有降」:某些情境更貴、某些更便宜,跑分整體上升但有例外
  • 記取 Opus 5 跑分好看但實戰難用的教訓,這次特別做了與其他模型的時間窗比較

Paul Graham 談新創、野心與偉大創辦人#

51,450 views · 17 小時前 · Y Combinator

Y Combinator

YC 邀請 Paul Graham 回到 Mountain View 舊辦公室,談新創、野心與偉大創辦人的特質。他反駁「YC 已經風光不再」的說法,並分享本屆學員有多硬核的創業題目。

  • YC 已進入第 47 個 batch,正式邁入第 21 年
  • 他反駁「YC 過去比較好」:當年被稱讚的 Reddit 這類案例,比不上這屆在做洲際彈道貨運、治癌症的題目
  • 本屆有新創同時走疫苗與療法兩條路攻癌症,他說哪一種成功都好

花 12 美分讓 AI 稽核上百個 PR#

8,630 views · 21 小時前 · Theo (t3.gg)

Theo

Theo 讓 AI agent 稽核 T3 Chat 過去 5 天所有更新過的 PR,token 用量驚人但成本低到誇張,準備做成每 3 小時自動巡邏一次的機器人。

  • 稽核任務吃下 60 億 token(多數為快取),輸出僅 30 萬 token,總花費 0.12 美元
  • 稽核範圍不只自己的 PR,而是 T3 Chat 過去 5 天內所有更新過的 PR
  • 打算做成每 3 小時跑一次的 bot,PR 準備好合併時自動通知

20VC:Nvidia 財報、Hugging Face 收購案完整拆解#

8,640 views · 17 小時前 · 20VC

20VC

Jason Lemkin 與 Rory O’Driscoll 深入拆解 Nvidia 962 億美元財季背後的供給吃緊訊號、對 2027 年 70% 成長的財測,以及 Hugging Face 收購案。

  • Nvidia 目前完全受供給端限制,分析師原估 2027 年成長 40 到 50%,公司自己喊出 70%
  • CFO 公開表態「別再抱怨 round-trip 交易了,這些交易對我們有用」
  • 另有與 Anthropic 高達 350 億美元的資料中心合作案作為佐證

ClickHouse CEO:AI 不是泡沫,才剛開始#

2,973 views · 1 天前 · 20VC

20VC

ClickHouse 共同創辦人暨執行長 Aaron Katz 直言市場普遍認定「AI 是泡沫」的看法是錯的,他認為現在才是起點,真正該擔心的是散戶未來透過公開市場暴露在這些公司的風險中。

  • Aaron Katz:AI 被過度炒作、正處於泡沫的看法「普遍被接受但是錯的」,現在只是剛開始
  • 目前 AI 公司資金多來自私募,一旦轉為公開市場,散戶投資人才會真正暴露在虧損風險中
  • 就算未來出現修正,也不可能回到十年前的估值水準

社群熱門#

今日觀察#

今天最強的一顆模型上線,Greg Brockman 說他個人覺得 AGI 到了,但同一份 ARC Prize 報告裡,Astra 用 OpenAI 自家 harness 是 99.9%、用標準 harness 是 62.7%,一輪要 1.9 萬或 2.6 萬美元,而 Sebastian Raschka 把被炒最熱的 looped transformer 拆回「同一疊層跑兩次」。另一邊,Neil Fraser 付費到 2040 年的網域明年二月消失,三家 AI 供應商同一個早上一起掛掉,CERN 為了一個編譯器旗標把 2,200 台電腦搬離 RHEL,Uber 和 Stripe 把簡單工作切到開源模型省一半,Nvidia 把開源模型的家買走。這兩組新聞放在一起,形狀很清楚:能力集中在頂端那幾家,風險也集中在那幾家,而且風險不只是「它掛了」,還有「它改規則」。一個付了 25 年錢的網域擋不住 ICANN 的一次投票,一個 99.9% 的分數換個 harness 就掉三分之一。對每天在接 API 的人來說,今天比起換模型,更值得做的是把自己站在誰的地基上這件事列成一張清單。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有