yii.
← Digest
EP139 · 2026年7月20日 星期一 · 11 min read

更有把握,也更常出錯

三份互不相干的研究同一天指向同一件事:AI 讓人的信心從 30% 漲到 76%,正確率卻從 27% 掉到 9%

每天花 1% 的時間,掌握科技脈動。

今日金句#

“Maybe it’s just nice to do something physical that an AI can’t.” 「也許只是因為,動手做一件 AI 做不到的實體東西,感覺特別好。」 — 技術社群留言,於保齡球記分系統改造討論串

“If they co-operate, they keep their jobs. If they defect, they will possibly be fired.” 「配合演下去,工作保得住;戳破它,你可能就被開除。」 — Nik Suresh,企業 AI 顧問(來源)

“Hardware is as hard as you make it.” 「硬體有多難,是你自己決定的。」 — Chip Weinberger,Jamcorder 創辦人(來源)

今日主軸#

今天有三件事各自從完全不同的方向走進來,最後撞在同一個點上。一份由 Capraro 等人做的研究發現,人在有 AI 可問的時候,答題正確率從 27% 掉到 9%,但自信心從 30% 一路漲到 76%,而最關鍵的是「願意承認我不知道」的比例,從 44% 崩到 3%,研究者給它取了個名字叫「認知投降」。同一天,〈Reviewing AI Code Is Not A Viable Argument〉整理出另一組數字:人審 AI 寫的程式碼時,抓到缺陷的能力比審人寫的更差,但主觀信心反而更高。而顧問 Nik Suresh 那篇〈AI Mania Is Eviscerating Global Decision-Making〉補上組織層面的最後一塊:他觀察十八個月,幾乎沒看過一個成功的企業 AI 導入案,但沒人敢講,因為員工被用「花了多少 token」考核,於是有人乾脆寫迴圈去假裝消耗額度。三件事說的是同一句話——AI 沒有讓我們更常對,它讓我們更少懷疑自己。

而今天分數最高的兩則,剛好都是反例。一位兼職經營保齡球館的 SRE,把廠商開價八到十二萬美元的記分系統,用一千六百美元的 ESP32 做了出來;Curative 執行長 Fred Turner 則砍掉一年六十萬美元的 Salesforce 合約,換成自己團隊兩個月寫的 CRM。這兩個人做對的事情不是更相信技術,是他們真的坐下來算了一遍。

必讀#

  1. 用 1,600 美元的 ESP32 取代 12 萬美元的保齡球記分系統 — HN Hardware
  2. Transcribe.cpp:本地語音辨識引擎 — HN Tools
  3. AI 狂熱正在掏空企業決策品質 — HN AI
  4. 賣了 2,500 台 MIDI 錄音機學到的事 — HN Hardware
  5. 研究:AI 建議讓人準確率降 3 倍、自信升 2 倍 — HN AI
  6. OpenAI 把 Codex context 從 372k 砍到 272k — HN AI
  7. Qwen 3.8 Max Preview 悄悄上線 — HN AI
  8. 「審查 AI 程式碼」不是一個站得住腳的論點 — Lobsters AI
  9. Codex Resets:追蹤額度重置的小工具 — HN Tools
  10. Curative 砍掉 60 萬美元 Salesforce 合約 — 20VC Startup
  11. 馬斯克:X 將全面開源推薦演算法 — 科技新報 News
  12. MPEG-4 最後一項專利到期 — HN Standards
  13. Claude Code 已悄悄換成 Rust 版 Bun — HN Dev
  14. Netflix 技術長:系統思考是 AI 時代最重要的能力 — Lenny’s Startup

1. 用 1,600 美元的 ESP32 取代 12 萬美元的保齡球記分系統#

今天分數最高的一則,作者自稱「可能是地球上唯一擁有自家保齡球館的 SRE」。他和家人在中西部鄉下買下一間廢棄的八球道保齡球館,整間十萬五千美元。館內那套 2008 年裝的記分系統要價六位數,功能包含球速計算、彈道分析、攝影機判斷倒瓶(在 IC 上做物件偵測與三角運算)、犯規判定、動畫、以及控制排瓶機與回球道。廠商換新報價八萬到十二萬美元,零件更是每兩個球道就要四千美元。他最後用約 1,600 美元的 ESP32 自己做了一套。

  • 整間球館購入成本十萬五千美元,記分系統換新報價卻要八到十二萬,幾乎等於再買一間
  • 討論串中提到使用 ESP-NOW——以 WiFi 封包傳短訊息、免連線登入,適合這類場館內的裝置網路
  • 作者後續計畫加入 LED 與 DMX 燈光控制,讓燈條隨球滾動「追光」,並支援感應支付自助開打

💡 為什麼重要:在今天滿是「AI 讓人更自信也更少查證」的材料裡,這是最有力的反例——一個人真的坐下來把成本算清楚、再動手做,就打掉了一個 75 倍的價差。

🔗 閱讀原文 | 來源: Hacker News

2. Transcribe.cpp:本地語音辨識引擎#

建立在 GGML 之上的語音轉文字推論引擎,支援 16 個 ASR 家族、超過 60 個模型,並提供 Vulkan、Metal、CUDA、TinyBLAS 多種 GPU 後端。作者強調每個模型都經過數千條語句的 WER(字錯率)測試驗證,不是隨手包一包就發布。

  • 可在數瓦功耗下達成「快於即時」的轉錄速度
  • 提供 Python、JavaScript/TypeScript、Rust、ObjC/Swift 綁定
  • 相容 whisper.cpp 的 .bin 模型檔,可直接替換

💡 為什麼重要:對於在意隱私、不想把音訊送上雲端的應用,這是目前少數同時兼顧跨平台與長期維護承諾的選項。

🔗 閱讀原文 | 來源: Hacker News

3. AI 狂熱正在掏空企業決策品質#

顧問 Nik Suresh 寫下他觀察十八個月的結論:幾乎所有他看過的企業 AI 導入案都失敗了,但沒有人有辦法說出口。原因是一組扭曲的誘因——主管承認失敗等於承認自己決策錯誤,員工則被用「消耗多少 token」而非「產出什麼結果」考核。於是出現了他形容的「假 token 消耗迴圈」:寫程式去空跑額度,免得因為使用量不足被檢討。

  • 失敗的根因多半是老掉牙的軟體專案管理問題,被 LLM 的限制再放大一層
  • 他形容這是一個賽局困境——配合的人保住工作,戳破的人可能被開除
  • 他看過客戶在看完一場漂亮的 demo 後,明知解決不了問題仍然下單

💡 為什麼重要:這篇提供了一個組織層面的解釋,說明為什麼「AI 生產力暴增」的說法和第一線的實際體感差距這麼大——不是資料造假,是沒有人被允許說實話。

🔗 閱讀原文 | 來源: Hacker News

4. 賣了 2,500 台 MIDI 錄音機學到的事#

Jamcorder 創辦人 Chip Weinberger 分享硬體創業的實戰心得,結論反直覺:硬體沒有想像中難,難的是軟體。他前 500 台是手工組裝的,四天做完,設計沒有任何修改;整台裝置只用一顆螺絲、一片 PCB、25 種零件。相對地,韌體加上 App 的 20 萬行程式碼才是真正吃掉工程資源的地方。

  • 全程沒有報廢任何一批生產、也沒踩到重大供應鏈問題
  • 他建議毛利要抓 70% 以上,才有緩衝空間吸收關稅與供應波動
  • 實務建議包含自建 QA、要求試產樣品、製作圖解生產指引

💡 為什麼重要:和保齡球館那則呼應——硬體的難度常常是被設計出來的,不是天生的。對想做硬體但沒有創投資金的人,這是相當實用的除魅。

🔗 閱讀原文 | 來源: Hacker News

5. 研究:AI 建議讓人準確率降 3 倍、自信升 2 倍#

Capraro、Marcoccia 與 Quattrociocchi 的研究讓受試者回答視覺常識題,一組可以問 AI、一組不行。結果可以問 AI 那組的正確率從 27% 掉到 9%,但信心從 30% 升到 76%。最值得注意的是「願意說我不知道」的比例從 44% 崩到 3%,研究者稱之為「認知投降」。

  • 即使加入金錢誘因(答對有獎、亂答扣分),願意說「不知道」也只回升到 8%
  • 加了誘因後正確率回到 16%,仍遠低於完全不用 AI 的 27%
  • 研究者認為關鍵損失是「判斷暫停」的能力,也就是自我懷疑的機制

💡 為什麼重要:這解釋了一個很多人有感但講不清楚的現象——AI 不只是偶爾給錯答案,它會同時拿走你檢查它的動機。

🔗 閱讀原文 | 來源: The Next Web

6. OpenAI 把 Codex context 從 372k 砍到 272k#

一個 PR 顯示 OpenAI 把 Codex 的 context window 從 372,000 縮減到 272,000 tokens,減少約 27%,context_window 與 max_context_window 兩個欄位都調整了。這個變動被夾在一次模型 metadata 更新裡一起送出,同批還加上了 GPT-5.6 Sol 的能力描述與推理摘要功能。

  • 改動位置在 codex-rs/models-manager/models.json,backport 到 0.144 發布線
  • 官方沒有針對縮減提出說明,社群推測與成本或延遲最佳化有關
  • 對需要一次讀入大型 codebase 的工作流影響最直接

💡 為什麼重要:context window 一直被當成只會往上加的規格,這次反向調整值得留意——如果你的流程建立在「塞得進去」的假設上,可能要重新確認。

🔗 閱讀原文 | 來源: GitHub

7. Qwen 3.8 Max Preview 悄悄上線#

阿里巴巴的新一代旗艦模型 Qwen3.8-Max-Preview 上線,但它沒有發表文章、沒有技術報告、也沒有模型卡,唯一的公告是官網頂端一條橫幅,點進去是訂閱方案頁面。目前可確認的是:這是預覽版、只開放給付費 Token Plan、且沒有釋出權重。社群引述的「2.4T 參數、僅次於 Fable 5」說法流傳很廣,但在阿里巴巴官方頁面查無此數據,暫時只能當作未證實的傳聞。

  • 確認上線,但走的是付費訂閱制預覽,與 Kimi K3 的開源權重路線完全相反
  • 官方零說明——無 blog、無 model card、無 benchmark,只有一條 pricing 橫幅
  • 社群普遍認為這是對 Moonshot Kimi K3(7/27 開源)與 GLM 5.2 的即時回應

💡 為什麼重要:中國幾家實驗室正在往「巨大且慢」的方向集體轉向,但開源與否的分歧越來越明顯。一個前沿級模型連規格都不公布就開賣,本身就是一個值得注意的訊號。

🔗 閱讀原文 | 來源: Qwen Cloud

8. 「審查 AI 程式碼」不是一個站得住腳的論點#

這篇針對「AI 寫得快、人審一下就好」的說法提出反駁,並整理出實證數字:code review 超過一小時後效果明顯下降,有效速度大約每小時 400 行,換算下來一天能實際審完的量約一千行左右。作者的核心論點是,人在審 AI 生成的程式碼時,抓到缺陷的比例比審人寫的更低,但主觀信心反而更高。

  • 寫得再快,瓶頸會整個移到 review,總產出未必提升
  • 信心與偵測率呈反向關係,形成「虛假保證」偏誤
  • 建議把 AI 生成程式碼的缺陷逃逸率單獨追蹤,才看得出真實品質

💡 為什麼重要:這篇和今天那份認知投降研究是同一個故事的兩個版本——一個發生在答題,一個發生在 code review,結論一致。

🔗 閱讀原文 | 來源: Lobste.rs

9. Codex Resets:追蹤額度重置的小工具#

一個第三方的小工具,專門追蹤 OpenAI Codex/ChatGPT Work 用量額度何時重置。作者監控公告訊息並建立歷史紀錄,目前累積 35 次重置,平均間隔 8.9 天,最長曾經 67.7 天沒有重置。與 OpenAI 無關聯。

  • 提供 26 週的時間軸視覺化與歷史封存
  • 平均 8.9 天的節奏可用來安排開發排程
  • 最長 67.7 天的空窗提醒不要把工作流完全押在免費額度上

💡 為什麼重要:這類工具的存在本身就說明了問題——當官方的額度政策不透明時,社群會自己長出監控基礎設施。

🔗 閱讀原文 | 來源: Hacker News

10. Curative 砍掉 60 萬美元 Salesforce 合約#

Curative 創辦人兼執行長 Fred Turner 在 20VC 上談到,公司取消了每年 60 萬美元的 Salesforce 合約,改用內部團隊兩個月做出來的 CRM。新系統更貼合實際流程,公司內部的 AI agent 也直接跑在這套自建系統上。他今年的目標是再砍掉 80% 的 SaaS 支出。

  • 自建 CRM 開發約兩個月,直接歸零原本每年 60 萬美元的支出
  • Turner 坦言長期維護是最大挑戰,但認為對一定規模的公司仍然划算
  • 同一集也提到疫情期間公司 9 個月從 7 人擴張到 7,000 人的經歷

💡 為什麼重要:和保齡球館那則是同一個故事的企業版——真正省下錢的不是更相信工具,是有人願意先把帳算清楚。

🔗 閱讀原文 | 來源: 20VC

11. 馬斯克:X 將全面開源推薦演算法#

馬斯克宣布,在完成安全弱點審查後,X 將無例外地開源整個程式碼庫。X 的推薦演算法 2023 年 3 月發布過初版,2026 年 1 月的更新版改用 transformer 架構(與 xAI Grok 同源),涵蓋一般貼文與廣告的排序邏輯。這次宣布的背景是 Grok Build 的隱私爭議。

  • 新版演算法同時處理內容排序與廣告投放
  • 完整開源後,第三方可驗證公開程式碼是否與線上實際運行的一致
  • 具體時程、以及專有基礎設施與安全系統如何處理,都尚未說明

💡 為什麼重要:社群平台演算法長期是黑盒,若真的完整開源會是產業標竿;但在時程與範圍講清楚之前,仍應保留觀望。

🔗 閱讀原文 | 來源: 科技新報

12. MPEG-4 最後一項專利到期#

MPEG-4 Visual 的最後一項專利(巴西 BRPI0109962B1)於 2026 年 7 月 19 日到期,美國與歐盟的相關專利此前已陸續失效。VIA Licensing Alliance 確認這是全球最後一項阻擋性專利,意味著 MPEG-4 Part 2 的實作自此完全不受專利授權限制。

  • 從 1999 年標準化算起,這是一段超過 25 年的專利週期落幕
  • FFmpeg、VLC 等開源專案自此可無授權顧慮地整合
  • 商業平台可以把相關授權費用從成本模型中移除

💡 為什麼重要:延續 MP3 在 2017 年解禁的軌跡。雖然市場重心早已轉向 AV1、H.265,但一個被廣泛使用的編碼格式完全免除專利,仍是難得的節點。

🔗 閱讀原文 | 來源: Phoronix

13. Claude Code 已悄悄換成 Rust 版 Bun#

Simon Willison 發現 Claude Code v2.1.181 之後的版本,底層執行環境已經換成用 Rust 重寫的 Bun,Linux 上啟動速度快約 10%,但幾乎沒有公告。他用 strings 從二進位檔裡挖出 563 個 .rs 原始檔引用來佐證。更有意思的是內嵌的 Bun 版本是 1.4.0,而當時 Bun 公開發布的最新版還停在 1.3.14。

  • 等於 Bun 的 Rust 重寫版已經在數百萬台裝置上跑正式流量,比公開發布還早
  • 563 個 Rust 原始檔引用顯示重寫幅度相當完整,不是局部替換
  • Bun 作者 Jarred Sumner 對此的評語是「Boring is good」

💡 為什麼重要:這是一個典型的「拿正式使用者當金絲雀」案例。對評估 Bun 的團隊來說,這種規模的實戰驗證比任何 benchmark 都有說服力。

🔗 閱讀原文 | 來源: Simon Willison

14. Netflix 技術長:系統思考是 AI 時代最重要的能力#

Netflix 產品技術長 Elizabeth Stone 在 Lenny 的訪談中表示,現在團隊最看重的能力是「系統思考」——理解各部分之間的連動與二階效應,而不是單純的 AI 技能。Netflix 把 AI 熟練度當成全體員工的基本要求,而不是設立專門的 AI 職位階梯。

  • Netflix 已有約 300 部作品在製作流程中使用 AI 工具
  • 她認為當 AI 產出的量暴增時,維持品質與訊號不失真是核心挑戰
  • Stone 同時掌管 Engineering、Product 與 Design 三個部門

💡 為什麼重要:這代表成熟的科技組織正在把 AI 從「專門技能」下放成「基本識讀」,對招募與訓練的設計方式影響很大。

🔗 閱讀原文 | 來源: Lenny’s Newsletter

推薦閱讀#

社群熱門#

中文技術圈#

今天中文圈最集中的話題是 Vibe Coding 的成本效益——同時出現「平民化之後我還迭代什麼」與「做了四個月成本超過收益」兩串討論,和今天英文圈的主軸意外地對上了。

開源精選#

pablostanley/yoinks — TypeScript | ⭐ 724 從終端機下載任何影片,沒有惱人廣告。

MatinSenPai/Aether-GUI — TypeScript | ⭐ 625 Aether 通道的一鍵桌面 GUI,Tauri v2 + React 19 + Rust。

v-modal/vmodal_sdk_flutter — Dart | ⭐ 578 V-Modal AI 的 Flutter SDK,跨來源搜尋整合。

lopopolo/harness-engineering — Python | ⭐ 566 harness engineering 的文集、實務指南與 agent context 套件。

PengZhang64/circuit-framework — Python | ⭐ 485 多 agent LLM 交易研究系統。

hoainho/img2threejs — Python | ⭐ 449 把參考圖重建成純程式碼的 Three.js 模型,token 效率高。

stackblitz/bolt-slides — TypeScript | ⭐ 443 用任意 agent 產生可互動簡報。

pyang5166/gbro-collage-broll — Python | ⭐ 405 半調紙拼貼 B-roll 生成 skill,三閘門審批 + 首尾幀組裝動畫。

影音精選#

我們自己 vibe code 出一套 Salesforce#

20VC · 14 小時前

20VC

Curative 創辦人 Fred Turner 談公司如何取消每年 60 萬美元的 Salesforce 合約,改用內部團隊自建的 CRM。這段訪談點出一個正在發生的趨勢:AI 輔助開發讓中大型企業自建核心系統的門檻大幅降低。

  • 內部 CRM 約兩個月開發完成,直接歸零原本每年 60 萬美元的合約支出
  • 新系統更貼合實際流程,公司內部的 AI agent 直接跑在這套自建 CRM 上
  • Turner 坦言維護是最大挑戰,但認為對有一定規模的企業仍然值得投入

9 個月從 7 人到 7,000 人#

20VC · 41 小時前

20VC

同一位受訪者回顧疫情期間 Curative 如何從 7 人小團隊在 9 個月內暴衝到 7,000 人,把 COVID 檢測服務做到 50 億美元營收規模,以及疫情退燒後的財務調整。

  • 團隊 9 個月內從 7 人成長到 7,000 人,單日最高檢測量達 206,000 人次
  • 除檢測外還執行 250 萬劑疫苗接種,但 Turner 直言那是賠錢生意
  • 疫情退燒後大砍成本,今年計畫削減公司 80% 的 SaaS 支出

Is Flutter Really Everywhere?#

Daria Orlova · 近 36 小時

Flutter's Angels Podcast

Flutter’s Angels Podcast 這集直接拿 Flutter 的行銷口號開刀,討論「無所不在」的承諾在桌面、Web、嵌入式各平台上實際兌現到什麼程度。

  • 從實際專案角度檢視 Flutter 各平台支援的成熟度落差
  • 適合正在評估要不要把 Flutter 用到行動裝置以外場景的團隊

今日觀察#

今天最值得玩味的,是三份彼此毫無關聯的材料同時指向同一個結論。Capraro 團隊的實驗說人有 AI 可問時正確率從 27% 掉到 9%、自信卻從 30% 升到 76%;〈Reviewing AI Code Is Not A Viable Argument〉說審查者面對 AI 程式碼時抓錯能力更低、把握卻更高;Nik Suresh 那篇則說整個組織都知道導入失敗了,但因為考核看的是 token 消耗量,於是有人寫迴圈假裝在燒額度。三個尺度——個人、團隊、組織——講的是同一件事:AI 真正拿走的不是我們的正確率,是我們停下來懷疑自己的那個習慣。而今天分數最高的兩則剛好都是反例:一個 SRE 用一千六百美元的 ESP32 打掉廠商十二萬美元的保齡球記分系統,Curative 執行長砍掉六十萬美元的 Salesforce 換成自己寫的 CRM。他們贏的方式一點都不神奇,就是真的坐下來把帳算了一遍、再動手做。工具越順手,「等一下,這個我不確定」這句話就越少被說出口,也就越值錢。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有