更有把握,也更常出錯
三份互不相干的研究同一天指向同一件事:AI 讓人的信心從 30% 漲到 76%,正確率卻從 27% 掉到 9%
每天花 1% 的時間,掌握科技脈動。
今日金句#
“Maybe it’s just nice to do something physical that an AI can’t.” 「也許只是因為,動手做一件 AI 做不到的實體東西,感覺特別好。」 — 技術社群留言,於保齡球記分系統改造討論串
“If they co-operate, they keep their jobs. If they defect, they will possibly be fired.” 「配合演下去,工作保得住;戳破它,你可能就被開除。」 — Nik Suresh,企業 AI 顧問(來源)
“Hardware is as hard as you make it.” 「硬體有多難,是你自己決定的。」 — Chip Weinberger,Jamcorder 創辦人(來源)
今日主軸#
今天有三件事各自從完全不同的方向走進來,最後撞在同一個點上。一份由 Capraro 等人做的研究發現,人在有 AI 可問的時候,答題正確率從 27% 掉到 9%,但自信心從 30% 一路漲到 76%,而最關鍵的是「願意承認我不知道」的比例,從 44% 崩到 3%,研究者給它取了個名字叫「認知投降」。同一天,〈Reviewing AI Code Is Not A Viable Argument〉整理出另一組數字:人審 AI 寫的程式碼時,抓到缺陷的能力比審人寫的更差,但主觀信心反而更高。而顧問 Nik Suresh 那篇〈AI Mania Is Eviscerating Global Decision-Making〉補上組織層面的最後一塊:他觀察十八個月,幾乎沒看過一個成功的企業 AI 導入案,但沒人敢講,因為員工被用「花了多少 token」考核,於是有人乾脆寫迴圈去假裝消耗額度。三件事說的是同一句話——AI 沒有讓我們更常對,它讓我們更少懷疑自己。
而今天分數最高的兩則,剛好都是反例。一位兼職經營保齡球館的 SRE,把廠商開價八到十二萬美元的記分系統,用一千六百美元的 ESP32 做了出來;Curative 執行長 Fred Turner 則砍掉一年六十萬美元的 Salesforce 合約,換成自己團隊兩個月寫的 CRM。這兩個人做對的事情不是更相信技術,是他們真的坐下來算了一遍。
必讀#
- 用 1,600 美元的 ESP32 取代 12 萬美元的保齡球記分系統 — HN
Hardware - Transcribe.cpp:本地語音辨識引擎 — HN
Tools - AI 狂熱正在掏空企業決策品質 — HN
AI - 賣了 2,500 台 MIDI 錄音機學到的事 — HN
Hardware - 研究:AI 建議讓人準確率降 3 倍、自信升 2 倍 — HN
AI - OpenAI 把 Codex context 從 372k 砍到 272k — HN
AI - Qwen 3.8 Max Preview 悄悄上線 — HN
AI - 「審查 AI 程式碼」不是一個站得住腳的論點 — Lobsters
AI - Codex Resets:追蹤額度重置的小工具 — HN
Tools - Curative 砍掉 60 萬美元 Salesforce 合約 — 20VC
Startup - 馬斯克:X 將全面開源推薦演算法 — 科技新報
News - MPEG-4 最後一項專利到期 — HN
Standards - Claude Code 已悄悄換成 Rust 版 Bun — HN
Dev - Netflix 技術長:系統思考是 AI 時代最重要的能力 — Lenny’s
Startup
1. 用 1,600 美元的 ESP32 取代 12 萬美元的保齡球記分系統#

今天分數最高的一則,作者自稱「可能是地球上唯一擁有自家保齡球館的 SRE」。他和家人在中西部鄉下買下一間廢棄的八球道保齡球館,整間十萬五千美元。館內那套 2008 年裝的記分系統要價六位數,功能包含球速計算、彈道分析、攝影機判斷倒瓶(在 IC 上做物件偵測與三角運算)、犯規判定、動畫、以及控制排瓶機與回球道。廠商換新報價八萬到十二萬美元,零件更是每兩個球道就要四千美元。他最後用約 1,600 美元的 ESP32 自己做了一套。
- 整間球館購入成本十萬五千美元,記分系統換新報價卻要八到十二萬,幾乎等於再買一間
- 討論串中提到使用 ESP-NOW——以 WiFi 封包傳短訊息、免連線登入,適合這類場館內的裝置網路
- 作者後續計畫加入 LED 與 DMX 燈光控制,讓燈條隨球滾動「追光」,並支援感應支付自助開打
💡 為什麼重要:在今天滿是「AI 讓人更自信也更少查證」的材料裡,這是最有力的反例——一個人真的坐下來把成本算清楚、再動手做,就打掉了一個 75 倍的價差。
🔗 閱讀原文 | 來源: Hacker News
2. Transcribe.cpp:本地語音辨識引擎#

建立在 GGML 之上的語音轉文字推論引擎,支援 16 個 ASR 家族、超過 60 個模型,並提供 Vulkan、Metal、CUDA、TinyBLAS 多種 GPU 後端。作者強調每個模型都經過數千條語句的 WER(字錯率)測試驗證,不是隨手包一包就發布。
- 可在數瓦功耗下達成「快於即時」的轉錄速度
- 提供 Python、JavaScript/TypeScript、Rust、ObjC/Swift 綁定
- 相容 whisper.cpp 的 .bin 模型檔,可直接替換
💡 為什麼重要:對於在意隱私、不想把音訊送上雲端的應用,這是目前少數同時兼顧跨平台與長期維護承諾的選項。
🔗 閱讀原文 | 來源: Hacker News
3. AI 狂熱正在掏空企業決策品質#

顧問 Nik Suresh 寫下他觀察十八個月的結論:幾乎所有他看過的企業 AI 導入案都失敗了,但沒有人有辦法說出口。原因是一組扭曲的誘因——主管承認失敗等於承認自己決策錯誤,員工則被用「消耗多少 token」而非「產出什麼結果」考核。於是出現了他形容的「假 token 消耗迴圈」:寫程式去空跑額度,免得因為使用量不足被檢討。
- 失敗的根因多半是老掉牙的軟體專案管理問題,被 LLM 的限制再放大一層
- 他形容這是一個賽局困境——配合的人保住工作,戳破的人可能被開除
- 他看過客戶在看完一場漂亮的 demo 後,明知解決不了問題仍然下單
💡 為什麼重要:這篇提供了一個組織層面的解釋,說明為什麼「AI 生產力暴增」的說法和第一線的實際體感差距這麼大——不是資料造假,是沒有人被允許說實話。
🔗 閱讀原文 | 來源: Hacker News
4. 賣了 2,500 台 MIDI 錄音機學到的事#

Jamcorder 創辦人 Chip Weinberger 分享硬體創業的實戰心得,結論反直覺:硬體沒有想像中難,難的是軟體。他前 500 台是手工組裝的,四天做完,設計沒有任何修改;整台裝置只用一顆螺絲、一片 PCB、25 種零件。相對地,韌體加上 App 的 20 萬行程式碼才是真正吃掉工程資源的地方。
- 全程沒有報廢任何一批生產、也沒踩到重大供應鏈問題
- 他建議毛利要抓 70% 以上,才有緩衝空間吸收關稅與供應波動
- 實務建議包含自建 QA、要求試產樣品、製作圖解生產指引
💡 為什麼重要:和保齡球館那則呼應——硬體的難度常常是被設計出來的,不是天生的。對想做硬體但沒有創投資金的人,這是相當實用的除魅。
🔗 閱讀原文 | 來源: Hacker News
5. 研究:AI 建議讓人準確率降 3 倍、自信升 2 倍#

Capraro、Marcoccia 與 Quattrociocchi 的研究讓受試者回答視覺常識題,一組可以問 AI、一組不行。結果可以問 AI 那組的正確率從 27% 掉到 9%,但信心從 30% 升到 76%。最值得注意的是「願意說我不知道」的比例從 44% 崩到 3%,研究者稱之為「認知投降」。
- 即使加入金錢誘因(答對有獎、亂答扣分),願意說「不知道」也只回升到 8%
- 加了誘因後正確率回到 16%,仍遠低於完全不用 AI 的 27%
- 研究者認為關鍵損失是「判斷暫停」的能力,也就是自我懷疑的機制
💡 為什麼重要:這解釋了一個很多人有感但講不清楚的現象——AI 不只是偶爾給錯答案,它會同時拿走你檢查它的動機。
🔗 閱讀原文 | 來源: The Next Web
6. OpenAI 把 Codex context 從 372k 砍到 272k#

一個 PR 顯示 OpenAI 把 Codex 的 context window 從 372,000 縮減到 272,000 tokens,減少約 27%,context_window 與 max_context_window 兩個欄位都調整了。這個變動被夾在一次模型 metadata 更新裡一起送出,同批還加上了 GPT-5.6 Sol 的能力描述與推理摘要功能。
- 改動位置在
codex-rs/models-manager/models.json,backport 到 0.144 發布線 - 官方沒有針對縮減提出說明,社群推測與成本或延遲最佳化有關
- 對需要一次讀入大型 codebase 的工作流影響最直接
💡 為什麼重要:context window 一直被當成只會往上加的規格,這次反向調整值得留意——如果你的流程建立在「塞得進去」的假設上,可能要重新確認。
🔗 閱讀原文 | 來源: GitHub
7. Qwen 3.8 Max Preview 悄悄上線#

阿里巴巴的新一代旗艦模型 Qwen3.8-Max-Preview 上線,但它沒有發表文章、沒有技術報告、也沒有模型卡,唯一的公告是官網頂端一條橫幅,點進去是訂閱方案頁面。目前可確認的是:這是預覽版、只開放給付費 Token Plan、且沒有釋出權重。社群引述的「2.4T 參數、僅次於 Fable 5」說法流傳很廣,但在阿里巴巴官方頁面查無此數據,暫時只能當作未證實的傳聞。
- 確認上線,但走的是付費訂閱制預覽,與 Kimi K3 的開源權重路線完全相反
- 官方零說明——無 blog、無 model card、無 benchmark,只有一條 pricing 橫幅
- 社群普遍認為這是對 Moonshot Kimi K3(7/27 開源)與 GLM 5.2 的即時回應
💡 為什麼重要:中國幾家實驗室正在往「巨大且慢」的方向集體轉向,但開源與否的分歧越來越明顯。一個前沿級模型連規格都不公布就開賣,本身就是一個值得注意的訊號。
🔗 閱讀原文 | 來源: Qwen Cloud
8. 「審查 AI 程式碼」不是一個站得住腳的論點#

這篇針對「AI 寫得快、人審一下就好」的說法提出反駁,並整理出實證數字:code review 超過一小時後效果明顯下降,有效速度大約每小時 400 行,換算下來一天能實際審完的量約一千行左右。作者的核心論點是,人在審 AI 生成的程式碼時,抓到缺陷的比例比審人寫的更低,但主觀信心反而更高。
- 寫得再快,瓶頸會整個移到 review,總產出未必提升
- 信心與偵測率呈反向關係,形成「虛假保證」偏誤
- 建議把 AI 生成程式碼的缺陷逃逸率單獨追蹤,才看得出真實品質
💡 為什麼重要:這篇和今天那份認知投降研究是同一個故事的兩個版本——一個發生在答題,一個發生在 code review,結論一致。
🔗 閱讀原文 | 來源: Lobste.rs
9. Codex Resets:追蹤額度重置的小工具#

一個第三方的小工具,專門追蹤 OpenAI Codex/ChatGPT Work 用量額度何時重置。作者監控公告訊息並建立歷史紀錄,目前累積 35 次重置,平均間隔 8.9 天,最長曾經 67.7 天沒有重置。與 OpenAI 無關聯。
- 提供 26 週的時間軸視覺化與歷史封存
- 平均 8.9 天的節奏可用來安排開發排程
- 最長 67.7 天的空窗提醒不要把工作流完全押在免費額度上
💡 為什麼重要:這類工具的存在本身就說明了問題——當官方的額度政策不透明時,社群會自己長出監控基礎設施。
🔗 閱讀原文 | 來源: Hacker News
10. Curative 砍掉 60 萬美元 Salesforce 合約#

Curative 創辦人兼執行長 Fred Turner 在 20VC 上談到,公司取消了每年 60 萬美元的 Salesforce 合約,改用內部團隊兩個月做出來的 CRM。新系統更貼合實際流程,公司內部的 AI agent 也直接跑在這套自建系統上。他今年的目標是再砍掉 80% 的 SaaS 支出。
- 自建 CRM 開發約兩個月,直接歸零原本每年 60 萬美元的支出
- Turner 坦言長期維護是最大挑戰,但認為對一定規模的公司仍然划算
- 同一集也提到疫情期間公司 9 個月從 7 人擴張到 7,000 人的經歷
💡 為什麼重要:和保齡球館那則是同一個故事的企業版——真正省下錢的不是更相信工具,是有人願意先把帳算清楚。
🔗 閱讀原文 | 來源: 20VC
11. 馬斯克:X 將全面開源推薦演算法#

馬斯克宣布,在完成安全弱點審查後,X 將無例外地開源整個程式碼庫。X 的推薦演算法 2023 年 3 月發布過初版,2026 年 1 月的更新版改用 transformer 架構(與 xAI Grok 同源),涵蓋一般貼文與廣告的排序邏輯。這次宣布的背景是 Grok Build 的隱私爭議。
- 新版演算法同時處理內容排序與廣告投放
- 完整開源後,第三方可驗證公開程式碼是否與線上實際運行的一致
- 具體時程、以及專有基礎設施與安全系統如何處理,都尚未說明
💡 為什麼重要:社群平台演算法長期是黑盒,若真的完整開源會是產業標竿;但在時程與範圍講清楚之前,仍應保留觀望。
🔗 閱讀原文 | 來源: 科技新報
12. MPEG-4 最後一項專利到期#

MPEG-4 Visual 的最後一項專利(巴西 BRPI0109962B1)於 2026 年 7 月 19 日到期,美國與歐盟的相關專利此前已陸續失效。VIA Licensing Alliance 確認這是全球最後一項阻擋性專利,意味著 MPEG-4 Part 2 的實作自此完全不受專利授權限制。
- 從 1999 年標準化算起,這是一段超過 25 年的專利週期落幕
- FFmpeg、VLC 等開源專案自此可無授權顧慮地整合
- 商業平台可以把相關授權費用從成本模型中移除
💡 為什麼重要:延續 MP3 在 2017 年解禁的軌跡。雖然市場重心早已轉向 AV1、H.265,但一個被廣泛使用的編碼格式完全免除專利,仍是難得的節點。
🔗 閱讀原文 | 來源: Phoronix
13. Claude Code 已悄悄換成 Rust 版 Bun#

Simon Willison 發現 Claude Code v2.1.181 之後的版本,底層執行環境已經換成用 Rust 重寫的 Bun,Linux 上啟動速度快約 10%,但幾乎沒有公告。他用 strings 從二進位檔裡挖出 563 個 .rs 原始檔引用來佐證。更有意思的是內嵌的 Bun 版本是 1.4.0,而當時 Bun 公開發布的最新版還停在 1.3.14。
- 等於 Bun 的 Rust 重寫版已經在數百萬台裝置上跑正式流量,比公開發布還早
- 563 個 Rust 原始檔引用顯示重寫幅度相當完整,不是局部替換
- Bun 作者 Jarred Sumner 對此的評語是「Boring is good」
💡 為什麼重要:這是一個典型的「拿正式使用者當金絲雀」案例。對評估 Bun 的團隊來說,這種規模的實戰驗證比任何 benchmark 都有說服力。
🔗 閱讀原文 | 來源: Simon Willison
14. Netflix 技術長:系統思考是 AI 時代最重要的能力#

Netflix 產品技術長 Elizabeth Stone 在 Lenny 的訪談中表示,現在團隊最看重的能力是「系統思考」——理解各部分之間的連動與二階效應,而不是單純的 AI 技能。Netflix 把 AI 熟練度當成全體員工的基本要求,而不是設立專門的 AI 職位階梯。
- Netflix 已有約 300 部作品在製作流程中使用 AI 工具
- 她認為當 AI 產出的量暴增時,維持品質與訊號不失真是核心挑戰
- Stone 同時掌管 Engineering、Product 與 Design 三個部門
💡 為什麼重要:這代表成熟的科技組織正在把 AI 從「專門技能」下放成「基本識讀」,對招募與訓練的設計方式影響很大。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
推薦閱讀#

- 阿里開源 T-Head SAIL,挑戰 NVIDIA CUDA — 五層架構的 SAIL 軟體棧作為旋天 AI 晶片的 CUDA 替代方案,宣稱開發者可在 7 天內適配主流框架。
- Netflix 以 5.87 億美元收購 Ben Affleck 的 AI 電影新創 — InterPositive 專攻後期製作,處理缺失鏡頭、背景調整、打光修正與畫質提升。
- 數學家仍不知道最快的乘法是什麼 — 深入介紹乘法演算法最佳複雜度這個仍未解決的老問題。
- 蘋果 Face ID 發明者轉戰醫療 AI — 目標是讓大腦健康檢測變得像抽血一樣普及簡單。
- 我加入了 IndieWeb,學到這些事 — 個人網站自主化的實作心得與踩坑紀錄。
- 我家伺服器的死亡與重生 — 家用伺服器重建的完整技術過程。
- wp2shell:WordPress 核心免認證 RCE — WordPress 核心的免認證遠端執行漏洞,使用 WordPress 的站台應盡快確認版本。
- 硬派 IndieWeb:一天一美分自架網站 — 用極低成本 100% 自主運行個人網站的作法。
- 運河底部的那台電腦 — 一台沉在運河底的電腦引出的技術故事。
- Meta 平台當機,FB 與 IG 同步受影響 — 全球數百萬用戶受影響的服務中斷事件。
社群熱門#
- bojieli/ai-agent-book:深入理解 AI Agent — 開源的 AI Agent 設計原理與工程實踐書籍,一天內衝上 GitHub 趨勢榜。
- jamiepine/voicebox:開源 AI 語音工作室 — 主打「複製、口述、創作」的開源語音工具。
- KnockOutEZ/wigolo — 讓 AI coding agent 免金鑰、免雲端就能搜尋與爬取網頁資料。
- tirth8205/code-review-graph — local-first 的程式碼智慧圖,讓 AI 工具只讀真正需要的部分,減少大型專案的 context 負擔。
- Is Flutter Really Everywhere? — Flutter’s Angels Podcast 探討 Flutter 的跨平台野心到底走到哪裡。
中文技術圈#

今天中文圈最集中的話題是 Vibe Coding 的成本效益——同時出現「平民化之後我還迭代什麼」與「做了四個月成本超過收益」兩串討論,和今天英文圈的主軸意外地對上了。
- 靈魂拷問:未來 Vibe Coding 平民化了,那我現在還迭代個錘子 — 開發者討論 Vibe Coding 普及後,傳統迭代開發的意義還剩多少。
- Vibe Coding 副業四個月:成本超出收益,要放棄嗎? — 一份誠實的副業成本效益覆盤。
- 開源版 Surge:把 Mac 變成全屋透明代理閘道 — 可導入規則、可按裝置分流的自製網路閘道。
- 把 app 每個頁面 copy 給 AI,能複刻出這個 app 嗎? — 討論 AI 從截圖還原應用程式的實際極限。
- Kimi K3 這波真的爆了,你們用起來感覺怎麼樣? — 開發者的第一手使用心得交流。
- DeepSeek 之後又來 Kimi K3!中國 AI 距美國多遠 — 台灣科技圈對中國模型進展的討論。
- 劍指台積電!日本大廠放話不能輸 — 日本晶片代工對台積電的競爭宣示。
- 小米 NAS 拆解與初步上手 — 小米新款 NAS 的硬體拆解與初步評測。
開源精選#
pablostanley/yoinks — TypeScript | ⭐ 724 從終端機下載任何影片,沒有惱人廣告。
MatinSenPai/Aether-GUI — TypeScript | ⭐ 625 Aether 通道的一鍵桌面 GUI,Tauri v2 + React 19 + Rust。
v-modal/vmodal_sdk_flutter — Dart | ⭐ 578 V-Modal AI 的 Flutter SDK,跨來源搜尋整合。
lopopolo/harness-engineering — Python | ⭐ 566 harness engineering 的文集、實務指南與 agent context 套件。
PengZhang64/circuit-framework — Python | ⭐ 485 多 agent LLM 交易研究系統。
hoainho/img2threejs — Python | ⭐ 449 把參考圖重建成純程式碼的 Three.js 模型,token 效率高。
stackblitz/bolt-slides — TypeScript | ⭐ 443 用任意 agent 產生可互動簡報。
pyang5166/gbro-collage-broll — Python | ⭐ 405 半調紙拼貼 B-roll 生成 skill,三閘門審批 + 首尾幀組裝動畫。
影音精選#
我們自己 vibe code 出一套 Salesforce#
20VC · 14 小時前
Curative 創辦人 Fred Turner 談公司如何取消每年 60 萬美元的 Salesforce 合約,改用內部團隊自建的 CRM。這段訪談點出一個正在發生的趨勢:AI 輔助開發讓中大型企業自建核心系統的門檻大幅降低。
- 內部 CRM 約兩個月開發完成,直接歸零原本每年 60 萬美元的合約支出
- 新系統更貼合實際流程,公司內部的 AI agent 直接跑在這套自建 CRM 上
- Turner 坦言維護是最大挑戰,但認為對有一定規模的企業仍然值得投入
9 個月從 7 人到 7,000 人#
20VC · 41 小時前
同一位受訪者回顧疫情期間 Curative 如何從 7 人小團隊在 9 個月內暴衝到 7,000 人,把 COVID 檢測服務做到 50 億美元營收規模,以及疫情退燒後的財務調整。
- 團隊 9 個月內從 7 人成長到 7,000 人,單日最高檢測量達 206,000 人次
- 除檢測外還執行 250 萬劑疫苗接種,但 Turner 直言那是賠錢生意
- 疫情退燒後大砍成本,今年計畫削減公司 80% 的 SaaS 支出
Is Flutter Really Everywhere?#
Daria Orlova · 近 36 小時
Flutter’s Angels Podcast 這集直接拿 Flutter 的行銷口號開刀,討論「無所不在」的承諾在桌面、Web、嵌入式各平台上實際兌現到什麼程度。
- 從實際專案角度檢視 Flutter 各平台支援的成熟度落差
- 適合正在評估要不要把 Flutter 用到行動裝置以外場景的團隊
今日觀察#
今天最值得玩味的,是三份彼此毫無關聯的材料同時指向同一個結論。Capraro 團隊的實驗說人有 AI 可問時正確率從 27% 掉到 9%、自信卻從 30% 升到 76%;〈Reviewing AI Code Is Not A Viable Argument〉說審查者面對 AI 程式碼時抓錯能力更低、把握卻更高;Nik Suresh 那篇則說整個組織都知道導入失敗了,但因為考核看的是 token 消耗量,於是有人寫迴圈假裝在燒額度。三個尺度——個人、團隊、組織——講的是同一件事:AI 真正拿走的不是我們的正確率,是我們停下來懷疑自己的那個習慣。而今天分數最高的兩則剛好都是反例:一個 SRE 用一千六百美元的 ESP32 打掉廠商十二萬美元的保齡球記分系統,Curative 執行長砍掉六十萬美元的 Salesforce 換成自己寫的 CRM。他們贏的方式一點都不神奇,就是真的坐下來把帳算了一遍、再動手做。工具越順手,「等一下,這個我不確定」這句話就越少被說出口,也就越值錢。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit


