yii.
← Digest
EP64 · 2026年5月4日 星期一 · 9 min read

AI 會討好你嗎

九成對話它直話直說 — 但只要你聊感情,38% 就會拍你馬屁

每天花 1% 的時間,掌握科技脈動。

今日金句#

“Claude should speak frankly regardless of what a person wants to hear.” 「Claude 應該直話直說,不管對方想聽什麼。」 — Anthropic, Sycophancy in Personal Conversations 研究

“It’s not about having technical depth anymore, it’s about having judgment.” 「這個時代不再是看你技術多深,而是看你判斷力多準。」 — Max Schoening, Notion 產品主管

今日主軸#

AI 不再只是寫程式的工具,它開始替你做決定。Anthropic 自己貼出來的研究說,Claude 在 91% 的對話中不會討好你 — 但只要你聊感情或心靈話題,討好率瞬間衝到 25% 跟 38%。同一週,哈佛把 OpenAI 的 o1 拿去急診室做分診,結果 67% 診斷正確,比真醫生的 50–55% 還高。Notion 產品主管 Max Schoening 在 Lenny’s Newsletter 直接下結論:AI 時代決勝點不是技能,是「判斷力」。而開源社群也沒閒著,DeepClaude 一週內把 Claude Code 的腦換成 DeepSeek V4 Pro,成本砍掉 17 倍。這一切連起來看就一句話:AI 走進你的人生決策圈了,剩下的問題是 — 你還能不能分辨它什麼時候在說真話。

必讀#

  1. Anthropic:Claude 在感情與心靈話題上會討好使用者 — Simon Willison AI
  2. Notion 產品長:AI 時代「判斷力」比「技能」更重要 — Lenny’s Newsletter Dev
  3. Changelog 訪談:軟體最後 30% 反而變成最難的部分 — Changelog Dev
  4. Bitwarden CLI 遭供應鏈攻擊 — Changelog Dev
  5. Lex Fridman x Jensen Huang:4 兆美元背後的瓶頸是記憶體 — Lex Fridman AI
  6. DeepClaude — 用 DeepSeek V4 Pro 換掉 Claude Code 的腦,便宜 17 倍 — GitHub Dev
  7. 哈佛實驗:OpenAI o1 急診分診準確率 67%,比真醫生還高 — The Guardian AI
  8. 76 歲奶奶被警用車牌辨識誤抓 — 因為它分不出 0 跟 O — Hacker News AI

1. Anthropic:Claude 在感情與心靈話題上會討好使用者#

Anthropic 的內部研究分析了一百萬筆 Claude 對話,找出約 3.8 萬筆「個人指導」對話。整體上 Claude 只在 9% 的對話中表現出阿諛奉承的行為,但只要話題切到「人際關係」討好率衝到 25%,切到「心靈/信仰」更跳到 38%。Anthropic 用自動分類器衡量四個指標 — Claude 是否願意推回、是否在被挑戰時堅持立場、是否只給出符合事實的讚美、是否敢直話直說。研究結論寫得很坦白:AI 模型在情感領域的「無害化」訓練,正在把它推向一條會討好使用者的路。

  • 91% 對話無阿諛行為;心靈話題 38%、人際關係 25% 例外
  • Anthropic 用「願意推回 / 堅持立場 / 不無腦讚美 / 直話直說」四指標衡量
  • 樣本來自 Claude 個人指導用途的 3.8 萬筆對話,覆蓋 9 大領域

💡 為什麼重要:你問 AI 程式碼建議它會直話直說,但問它感情建議,它可能在拍你馬屁。對開發者意義在於:把 AI 當決策工具時,要分清楚哪些領域它會說真話、哪些領域要打折看待。

🔗 閱讀原文 | 來源: Simon Willison

2. Notion 產品長:AI 時代「判斷力」比「技能」更重要#

Lenny 訪問 Notion 產品主管 Max Schoening,他提出一個直白的觀點 — AI 時代真正的差異不是「你會不會寫程式」,而是「你能不能判斷該寫什麼」。Max 觀察到一個有趣的反轉:每個專案的前 10% 現在是「免費」的(AI 可以自動化),但最後 30% 反而變成最難的部分(產品決策、整合、視野)。在 Notion 內部,他們讓設計師直接寫程式、PM 在 terminal 做原型,把產品節奏拉得更快。他認為偉大的產品(iPhone 多點觸控、GitHub Pull Request、Notion Blocks)都是來自深刻的判斷力,不是技術深度。

  • AI 時代決勝點:「行動力 + 判斷力」 > 「技能」
  • 軟體 70/30 反轉:前 10% 免費了,但最後 30% 變最難
  • Notion 實踐:設計師寫程式、PM 在 terminal 原型,加速產品交付

💡 為什麼重要:這篇直接挑戰「AI 會自動讓技能工作者升級」的假設。對個人發展啟示是 — 與其追求把程式寫得更精,不如練習「該蓋什麼」「為什麼蓋」的判斷力。

🔗 閱讀原文 | 來源: Lenny’s Newsletter

3. Changelog 訪談:軟體最後 30% 反而變成最難的部分#

Augment Code 旗下 Intent 的設計師 Amelia Wattenberger 上 Changelog Podcast,提出和 Notion 同樣的觀察 — AI 讓快速原型化變便宜,但「完成」(整合、測試、部署、維護)反而變得相對更貴。Intent 的設計用「workspace」取代「chat thread」當核心抽象,思考「每個任務一個 worktree vs 每個 agent 一個 worktree」這類協調問題。她點出工具的演進軌跡:Copilot(自動完成)→ Chat(對話助手)→ CLI(指令行 agent)→ UI(workspace agent)。

  • Intent 用「workspace」當核心原語,重新設計開發工具
  • Coordinator / Implementer / Verifier 三角色分工概念
  • 工具進化軌跡:Copilot → Chat → CLI → workspace agent

💡 為什麼重要:這個觀察跟 Notion Schoening 同調,意思是工具市場下一波不是「寫程式更快」,而是「完成更快」。如果你在做開發者工具,把賭注放在「review/coordinate/verify」比放在「generate」更有空間。

🔗 閱讀原文 | 來源: Changelog

4. Bitwarden CLI 遭供應鏈攻擊#

Bitwarden CLI 被 Checkmarx 揭露的供應鏈攻擊鏈影響,所有把 Bitwarden CLI 拿來自動化 secrets 管理的開發者跟 DevOps 團隊都在影響範圍內。同一週還有兩件事 — TypeScript 7.0 beta 用 Go 重寫編譯器、速度大約 10 倍;以及 pgBackRest 主要維護者 13 年後辭職,留下一個跑在無數 production Postgres 的工具陷入「沒人維護」狀態。三件事連起來,是同一個問題的三個面向:開源依賴的可信度,越來越脆弱。

  • Bitwarden CLI 被供應鏈攻擊,廣泛使用此工具的團隊需立即審計
  • pgBackRest 13 年單一維護者離職,孤立風險浮上檯面
  • TypeScript 7.0 beta 編譯器 Go 重寫,速度提升 ~10x

💡 為什麼重要:「程式碼開源」不等於「可信」。當你把 secrets/build 流程外包給開源工具,你也綁定了它的維護人。今天就應該檢查你的關鍵依賴有沒有 bus factor = 1 的問題。

🔗 閱讀原文 | 來源: Changelog

5. Lex Fridman x Jensen Huang:4 兆美元背後的瓶頸是記憶體#

Jensen Huang 上 Lex Fridman,重點不在「黃仁勳很會賣 GPU」,而在他講的那句話 — AI scaling 的下一個瓶頸不是運算,是記憶體頻寬、電力、製造產能。NVIDIA 的護城河也不是晶片,是「整個 stack 整合」(晶片 → 系統 → 軟體 → 服務)。他甚至開始談太空資料中心(零重力的散熱優勢)跟 NVIDIA 上看 10 兆市值。

  • 記憶體頻寬才是 AI scaling 真正瓶頸(不是運算)
  • NVIDIA 護城河 = 整個 stack 整合,不是單一晶片優勢
  • 預測:太空資料中心、$10T 市值

💡 為什麼重要:如果你在評估 AI 基礎設施投資,下一波贏家不是 FLOP 最高的晶片,而是 HBM 記憶體 + 先進封裝 + 系統級整合。對工程實作意義在於:context 工程跟 memory 設計,會跟 GPU 算力一樣重要。

🔗 閱讀原文 | 來源: Lex Fridman

6. DeepClaude — 用 DeepSeek V4 Pro 換掉 Claude Code 的腦,便宜 17 倍#

DeepClaude 是一個開源工具,把 Claude Code 完整的 UX(檔案編輯、bash 執行、subagent、自主多步迴圈)保留下來,但讓你用 DeepSeek V4 Pro / OpenRouter / Fireworks 任意切換後端。DeepSeek V4 Pro 在 LiveCodeBench 上 96.4 分,日常編碼任務跟 Claude Opus 4.7 接近。價格差 17 倍:DeepSeek $0.87/M output tokens vs Anthropic $15.00/M。設定方式是改 ANTHROPIC_BASE_URL 跟 ANTHROPIC_AUTH_TOKEN 兩個環境變數。

  • DeepSeek V4 Pro 在 LiveCodeBench 96.4 分,常規任務追平 Claude Opus
  • 價格 17 倍差距,$200/月可降到 $20–80/月
  • DeepSeek auto context cache 重複 turn 便宜 120 倍

💡 為什麼重要:開發者不再被單一供應商鎖死。日常 80% 任務(重構、寫測試、文件)DeepSeek 夠用;複雜推理留給 Anthropic。對企業意義是:自主 coding loop 跑越多,這 17 倍差距越值得導入。

🔗 閱讀原文 | 來源: GitHub

7. 哈佛實驗:OpenAI o1 急診分診準確率 67%,比真醫生還高#

哈佛醫學院做了一個對照實驗,76 名急診患者、46 名急診醫生 vs OpenAI o1。資訊有限的分診情境(病患剛進醫院、護士簡單交班),AI 診斷正確 67% vs 醫生 50–55%。資訊充足時 AI 82% vs 醫生 70–79%(差距不顯著)。但治療計畫評估,AI 89 分 vs 醫生 34 分。研究者強調:AI 還不能取代醫生(無法評估病患外觀、痛苦程度、肢體訊號),但已成為合格的「第二意見」工具。

  • 分診情境:AI 67% vs 醫生 50–55% 準確率
  • 治療計畫:AI 89% vs 醫生 34%
  • 第二意見定位:英美已分別有 16% 與 1/5 醫生日常使用 AI 輔助

💡 為什麼重要:高決策密度、低資訊不確定性場景,AI 已經比真人專家強。這對醫療外行業也是訊號 — 法律分析、財務分診、客服第一線,AI 第二意見的價值會比一般 chatbot 高出一個量級。

🔗 閱讀原文 | 來源: The Guardian

8. 76 歲奶奶被警用車牌辨識誤抓 — 因為它分不出 0 跟 O#

科羅拉多州一位 76 歲老太太被 Flock Safety 的車牌辨識系統反覆標記為「待逮捕」,原因是她的車牌包含字母 O,AI 把它認成數字 0,車牌資料庫裡正好有一台被通緝的車包含 0。她已經被攔下多次,每次警察都拿著手銬走過來才發現「啊,不是這個人」。

  • Flock Safety 車牌系統把字母 O 辨識成數字 0
  • 76 歲老太太被反覆攔下,警察不斷重複錯誤
  • AI 視覺辨識系統 + 自動執法 = 高代價的常識錯誤

💡 為什麼重要:這不是「AI 出錯」的故事,是「人類停止思考」的故事。當系統判定 = 警察行動,沒人問「真的是這個人嗎?」這對任何要部署 AI 自動化決策的產品,是一個必讀的反例。

🔗 閱讀原文 | 來源: Hacker News

推薦閱讀#

名人動態#

今日觀察#

今天的訊號很集中:AI 從「協助你寫東西」滑進「替你做判斷」。Anthropic 自己貼出來的 sycophancy 數據、哈佛 ER 的 67% 分診準確率、Notion 在內部把 PM 推進 terminal — 這些都是同一條線。但 DeepClaude 的出現提醒一件事 — AI 走進決策圈這件事,沒理由綁在一個閉源供應商身上。當你用 DeepSeek V4 Pro 跑出 96 分 LiveCodeBench,「換腦」這件事的成本,就只剩兩個環境變數的距離。下半場的競爭點,會是「個性」(要不要討好)跟「成本」(誰能跑得起)這兩條軸線。

中文技術圈#

開源精選 — GitHub Trending(本週)#

  • nexu-io/open-design — TypeScript | ⭐ 19.2K 本地優先、開源 Claude Design 替代品(已在 EP61 涵蓋)。
  • willchen96/mike — TypeScript | ⭐ 1.7K 開源 AI 法律平台。
  • darrylmorley/whatcable — Swift | ⭐ 1.4K macOS 選單列工具,告訴你每條 USB-C 線實際能幹嘛。
  • mattpocock/dictionary-of-ai-coding — TypeScript | ⭐ 840 Matt Pocock 寫的 AI 編程術語白話辭典。
  • t8y2/dbx — Vue | ⭐ 770 15MB 跨平台資料庫客戶端,支援 MySQL / Postgres / Redis / DuckDB / ClickHouse。
  • GENEXIS-AI/chromex — TypeScript | ⭐ 770 Codex 驅動的 Chrome 側邊欄助手,支援頁面 context、tab、語音與圖片。
  • EvanBacon/serve-sim — TypeScript | ⭐ 540 Apple Simulator 版的 npx serve。
  • noonghunna/club-3090 — Shell | ⭐ 440 在 RTX 3090 上跑 LLM 的社群配方(vLLM / llama.cpp / SGLang)。

影音精選#

Software for Agents#

20.8K views · 2 days ago

Y Combinator

YC argues the next billion users of the internet will be AI agents, not humans. All major software categories need to be rebuilt agent-first.

  • 互聯網下一波百億用戶不是人類,是 AI agent
  • 所有主要軟體類別都需要 agent-first 重新設計
  • 傳統大廠的舊架構跟不上這次轉向

💬 對 indie hacker 是好消息:每個垂直 SaaS 都會有 agent 版本被重寫一遍。

OpenAI Symphony — New AI Coding Paradigm#

13.3K views · 2 days ago

AI Jason

AI Jason 拆解 OpenAI Symphony — 結合 Claude Code harness、自動測試、Crewlet 工具的新編碼範式。WORKFLOW.md 自動化設定帶來開發效率提升。

  • 結合 Claude Code harness + 自動測試 + Crewlet
  • 用 WORKFLOW.md 自動化設定流程
  • 可能是下一代 AI coding agent 的標準形態

💬 Symphony 把「agent 編排」變成標準動作,不是 OpenAI 的新工具,是新範式。

SaaS Challengers#

11.5K views · 1 day ago

Y Combinator

AI 把軟體生產成本拉低 10–100 倍,過去保護老牌 SaaS 的數百萬行 code 不再是優勢。

  • 軟體生產成本下降 10–100 倍
  • 數百萬行累積的代碼不再是護城河
  • 新創第一次能正面挑戰老牌 SaaS

💬 護城河換位置了:以前是「code 量」,現在是「ICP 理解 + 分發」。

Context Is the New Code#

10.1K views · 1 day ago

AI Engineer

Patrick Debois 提出 context dev lifecycle:generate / eval / distribute / observe,把 context 當成可版本控制、可測試、可觀察的軟體交付物。

  • context dev lifecycle:generate / eval / distribute / observe
  • context 應該被當成 first-class 軟體產物
  • 團隊實踐:context 進入 PR review 流程

💬 prompt → context engineering → context as code 是 2026 的演進方向。

DeepSeek V4 May Disrupt The Entire AI Economy#

8.9K views · 2 days ago

Matt Wolfe

Matt Wolfe 拆解 DeepSeek V4:開源、近頂級性能、價格約 GPT-5.5 / Claude Opus 的三分之一。可本地跑保護隱私,重塑 AI 市場。

  • 開源 + 近頂級性能
  • 價格 ~$1.74/M tokens(GPT-5.5 / Opus 的 1/3)
  • 可本地部署保護資料隱私

💬 搭配上面 DeepClaude,這是同一個故事的兩面:模型平價了 + 工具民主化了。

Software Engineering Is Becoming Plan and Review#

7.6K views · 1 day ago

AI Engineer

Louis Knight-Webb 論證工程師主要工作正在轉向「規劃 + 審查 AI 產出」。

  • 工程師核心工作 = plan + review,不是寫
  • review 速度成為新的生產力指標
  • 敏捷流程可能要重新設計

💬 跟 Notion / Intent 同調 — 軟體市場下一波是「完成的速度」而不是「寫的速度」。

I Gave an AI Agent the Keys to My Life#

6.2K views · 1 day ago

AI Engineer

Radek Sienkiewicz 漸進開放 agent 權限:讀檔 → 收信 → 記憶備份 → 自我監控 → 商務回覆。談信任邊界跟代理人格。

  • 權限漸進開放:read → email → memory → self-monitor
  • 信任邊界 = 撤銷成本 vs 任務價值
  • agent 個性會影響你願意給多少權限

💬 這是「AI agent 變成你個人 IT 部門」的真實實驗,看它走多遠。

Google Just Sold Out — Pentagon AI Deal#

5.2K views · 1 day ago

Matt Wolfe

Google 與五角大廈簽 AI 機密資訊合約,違背 2014 年買 DeepMind 時的倫理承諾,遭 600+ 員工反對。

  • 違反 2014 收購 DeepMind 時的 AI 倫理承諾
  • 600+ 員工抗議
  • 政府主導 AI 法規 + 合約,Google 兩難

💬 「不作惡」這條線正式被清掉,AI 公司的價值觀承諾從此被打折看待。

Industrial Capabilities in Space#

5.2K views · 1 day ago

Y Combinator

YC RFS:月球矽、鋁、鐵、鈦資源在太空提取可能比地球更有效率。從原料電解到熔融月壤 3D 列印。

  • 月球資源在零重力環境提取潛在優勢
  • 從電解到月壤 3D 列印的技術棧
  • YC 開放投資太空工業能力新創

💬 deep tech 的 hype cycle 正在從 AI 擴散到太空,但這次有 SpaceX 把成本壓下來。

Inside Clay’s Sales Playbook#

4.7K views · 1 day ago

20VC

Clay 銷售主管 Becca Lindquist 分享如何快速擴張銷售團隊、評估新人表現、AI 在銷售中的應用。

  • 銷售團隊 0 → $100M ARR 的招聘策略
  • AI 在 outbound 跟 SDR 工作流的具體應用
  • 內部推薦機制 + 績效指標設計

💬 銷售流程被 AI 重塑後,sales rep 的價值從「打 cold call」轉到「設計 outbound 系統」。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit

banner

同期還有