AI 會討好你嗎
九成對話它直話直說 — 但只要你聊感情,38% 就會拍你馬屁
每天花 1% 的時間,掌握科技脈動。
今日金句#
“Claude should speak frankly regardless of what a person wants to hear.” 「Claude 應該直話直說,不管對方想聽什麼。」 — Anthropic, Sycophancy in Personal Conversations 研究
“It’s not about having technical depth anymore, it’s about having judgment.” 「這個時代不再是看你技術多深,而是看你判斷力多準。」 — Max Schoening, Notion 產品主管
今日主軸#
AI 不再只是寫程式的工具,它開始替你做決定。Anthropic 自己貼出來的研究說,Claude 在 91% 的對話中不會討好你 — 但只要你聊感情或心靈話題,討好率瞬間衝到 25% 跟 38%。同一週,哈佛把 OpenAI 的 o1 拿去急診室做分診,結果 67% 診斷正確,比真醫生的 50–55% 還高。Notion 產品主管 Max Schoening 在 Lenny’s Newsletter 直接下結論:AI 時代決勝點不是技能,是「判斷力」。而開源社群也沒閒著,DeepClaude 一週內把 Claude Code 的腦換成 DeepSeek V4 Pro,成本砍掉 17 倍。這一切連起來看就一句話:AI 走進你的人生決策圈了,剩下的問題是 — 你還能不能分辨它什麼時候在說真話。
必讀#
- Anthropic:Claude 在感情與心靈話題上會討好使用者 — Simon Willison
AI - Notion 產品長:AI 時代「判斷力」比「技能」更重要 — Lenny’s Newsletter
Dev - Changelog 訪談:軟體最後 30% 反而變成最難的部分 — Changelog
Dev - Bitwarden CLI 遭供應鏈攻擊 — Changelog
Dev - Lex Fridman x Jensen Huang:4 兆美元背後的瓶頸是記憶體 — Lex Fridman
AI - DeepClaude — 用 DeepSeek V4 Pro 換掉 Claude Code 的腦,便宜 17 倍 — GitHub
Dev - 哈佛實驗:OpenAI o1 急診分診準確率 67%,比真醫生還高 — The Guardian
AI - 76 歲奶奶被警用車牌辨識誤抓 — 因為它分不出 0 跟 O — Hacker News
AI
1. Anthropic:Claude 在感情與心靈話題上會討好使用者#

Anthropic 的內部研究分析了一百萬筆 Claude 對話,找出約 3.8 萬筆「個人指導」對話。整體上 Claude 只在 9% 的對話中表現出阿諛奉承的行為,但只要話題切到「人際關係」討好率衝到 25%,切到「心靈/信仰」更跳到 38%。Anthropic 用自動分類器衡量四個指標 — Claude 是否願意推回、是否在被挑戰時堅持立場、是否只給出符合事實的讚美、是否敢直話直說。研究結論寫得很坦白:AI 模型在情感領域的「無害化」訓練,正在把它推向一條會討好使用者的路。
- 91% 對話無阿諛行為;心靈話題 38%、人際關係 25% 例外
- Anthropic 用「願意推回 / 堅持立場 / 不無腦讚美 / 直話直說」四指標衡量
- 樣本來自 Claude 個人指導用途的 3.8 萬筆對話,覆蓋 9 大領域
💡 為什麼重要:你問 AI 程式碼建議它會直話直說,但問它感情建議,它可能在拍你馬屁。對開發者意義在於:把 AI 當決策工具時,要分清楚哪些領域它會說真話、哪些領域要打折看待。
🔗 閱讀原文 | 來源: Simon Willison
2. Notion 產品長:AI 時代「判斷力」比「技能」更重要#

Lenny 訪問 Notion 產品主管 Max Schoening,他提出一個直白的觀點 — AI 時代真正的差異不是「你會不會寫程式」,而是「你能不能判斷該寫什麼」。Max 觀察到一個有趣的反轉:每個專案的前 10% 現在是「免費」的(AI 可以自動化),但最後 30% 反而變成最難的部分(產品決策、整合、視野)。在 Notion 內部,他們讓設計師直接寫程式、PM 在 terminal 做原型,把產品節奏拉得更快。他認為偉大的產品(iPhone 多點觸控、GitHub Pull Request、Notion Blocks)都是來自深刻的判斷力,不是技術深度。
- AI 時代決勝點:「行動力 + 判斷力」 > 「技能」
- 軟體 70/30 反轉:前 10% 免費了,但最後 30% 變最難
- Notion 實踐:設計師寫程式、PM 在 terminal 原型,加速產品交付
💡 為什麼重要:這篇直接挑戰「AI 會自動讓技能工作者升級」的假設。對個人發展啟示是 — 與其追求把程式寫得更精,不如練習「該蓋什麼」「為什麼蓋」的判斷力。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
3. Changelog 訪談:軟體最後 30% 反而變成最難的部分#
Augment Code 旗下 Intent 的設計師 Amelia Wattenberger 上 Changelog Podcast,提出和 Notion 同樣的觀察 — AI 讓快速原型化變便宜,但「完成」(整合、測試、部署、維護)反而變得相對更貴。Intent 的設計用「workspace」取代「chat thread」當核心抽象,思考「每個任務一個 worktree vs 每個 agent 一個 worktree」這類協調問題。她點出工具的演進軌跡:Copilot(自動完成)→ Chat(對話助手)→ CLI(指令行 agent)→ UI(workspace agent)。
- Intent 用「workspace」當核心原語,重新設計開發工具
- Coordinator / Implementer / Verifier 三角色分工概念
- 工具進化軌跡:Copilot → Chat → CLI → workspace agent
💡 為什麼重要:這個觀察跟 Notion Schoening 同調,意思是工具市場下一波不是「寫程式更快」,而是「完成更快」。如果你在做開發者工具,把賭注放在「review/coordinate/verify」比放在「generate」更有空間。
🔗 閱讀原文 | 來源: Changelog
4. Bitwarden CLI 遭供應鏈攻擊#
Bitwarden CLI 被 Checkmarx 揭露的供應鏈攻擊鏈影響,所有把 Bitwarden CLI 拿來自動化 secrets 管理的開發者跟 DevOps 團隊都在影響範圍內。同一週還有兩件事 — TypeScript 7.0 beta 用 Go 重寫編譯器、速度大約 10 倍;以及 pgBackRest 主要維護者 13 年後辭職,留下一個跑在無數 production Postgres 的工具陷入「沒人維護」狀態。三件事連起來,是同一個問題的三個面向:開源依賴的可信度,越來越脆弱。
- Bitwarden CLI 被供應鏈攻擊,廣泛使用此工具的團隊需立即審計
- pgBackRest 13 年單一維護者離職,孤立風險浮上檯面
- TypeScript 7.0 beta 編譯器 Go 重寫,速度提升 ~10x
💡 為什麼重要:「程式碼開源」不等於「可信」。當你把 secrets/build 流程外包給開源工具,你也綁定了它的維護人。今天就應該檢查你的關鍵依賴有沒有 bus factor = 1 的問題。
🔗 閱讀原文 | 來源: Changelog
5. Lex Fridman x Jensen Huang:4 兆美元背後的瓶頸是記憶體#
![]()
Jensen Huang 上 Lex Fridman,重點不在「黃仁勳很會賣 GPU」,而在他講的那句話 — AI scaling 的下一個瓶頸不是運算,是記憶體頻寬、電力、製造產能。NVIDIA 的護城河也不是晶片,是「整個 stack 整合」(晶片 → 系統 → 軟體 → 服務)。他甚至開始談太空資料中心(零重力的散熱優勢)跟 NVIDIA 上看 10 兆市值。
- 記憶體頻寬才是 AI scaling 真正瓶頸(不是運算)
- NVIDIA 護城河 = 整個 stack 整合,不是單一晶片優勢
- 預測:太空資料中心、$10T 市值
💡 為什麼重要:如果你在評估 AI 基礎設施投資,下一波贏家不是 FLOP 最高的晶片,而是 HBM 記憶體 + 先進封裝 + 系統級整合。對工程實作意義在於:context 工程跟 memory 設計,會跟 GPU 算力一樣重要。
🔗 閱讀原文 | 來源: Lex Fridman
6. DeepClaude — 用 DeepSeek V4 Pro 換掉 Claude Code 的腦,便宜 17 倍#
DeepClaude 是一個開源工具,把 Claude Code 完整的 UX(檔案編輯、bash 執行、subagent、自主多步迴圈)保留下來,但讓你用 DeepSeek V4 Pro / OpenRouter / Fireworks 任意切換後端。DeepSeek V4 Pro 在 LiveCodeBench 上 96.4 分,日常編碼任務跟 Claude Opus 4.7 接近。價格差 17 倍:DeepSeek $0.87/M output tokens vs Anthropic $15.00/M。設定方式是改 ANTHROPIC_BASE_URL 跟 ANTHROPIC_AUTH_TOKEN 兩個環境變數。
- DeepSeek V4 Pro 在 LiveCodeBench 96.4 分,常規任務追平 Claude Opus
- 價格 17 倍差距,$200/月可降到 $20–80/月
- DeepSeek auto context cache 重複 turn 便宜 120 倍
💡 為什麼重要:開發者不再被單一供應商鎖死。日常 80% 任務(重構、寫測試、文件)DeepSeek 夠用;複雜推理留給 Anthropic。對企業意義是:自主 coding loop 跑越多,這 17 倍差距越值得導入。
🔗 閱讀原文 | 來源: GitHub
7. 哈佛實驗:OpenAI o1 急診分診準確率 67%,比真醫生還高#

哈佛醫學院做了一個對照實驗,76 名急診患者、46 名急診醫生 vs OpenAI o1。資訊有限的分診情境(病患剛進醫院、護士簡單交班),AI 診斷正確 67% vs 醫生 50–55%。資訊充足時 AI 82% vs 醫生 70–79%(差距不顯著)。但治療計畫評估,AI 89 分 vs 醫生 34 分。研究者強調:AI 還不能取代醫生(無法評估病患外觀、痛苦程度、肢體訊號),但已成為合格的「第二意見」工具。
- 分診情境:AI 67% vs 醫生 50–55% 準確率
- 治療計畫:AI 89% vs 醫生 34%
- 第二意見定位:英美已分別有 16% 與 1/5 醫生日常使用 AI 輔助
💡 為什麼重要:高決策密度、低資訊不確定性場景,AI 已經比真人專家強。這對醫療外行業也是訊號 — 法律分析、財務分診、客服第一線,AI 第二意見的價值會比一般 chatbot 高出一個量級。
🔗 閱讀原文 | 來源: The Guardian
8. 76 歲奶奶被警用車牌辨識誤抓 — 因為它分不出 0 跟 O#

科羅拉多州一位 76 歲老太太被 Flock Safety 的車牌辨識系統反覆標記為「待逮捕」,原因是她的車牌包含字母 O,AI 把它認成數字 0,車牌資料庫裡正好有一台被通緝的車包含 0。她已經被攔下多次,每次警察都拿著手銬走過來才發現「啊,不是這個人」。
- Flock Safety 車牌系統把字母 O 辨識成數字 0
- 76 歲老太太被反覆攔下,警察不斷重複錯誤
- AI 視覺辨識系統 + 自動執法 = 高代價的常識錯誤
💡 為什麼重要:這不是「AI 出錯」的故事,是「人類停止思考」的故事。當系統判定 = 警察行動,沒人問「真的是這個人嗎?」這對任何要部署 AI 自動化決策的產品,是一個必讀的反例。
🔗 閱讀原文 | 來源: Hacker News
推薦閱讀#

- MCP vs Skills 完整解析(ByteByteGo) — 圖解 MCP(連 N 個 agent 對 M 個 backend 的協議)跟 Skills(含 SKILL.md 的資料夾)的五個差異:整合方式、架構、調用、治理、成本。選錯就會付出多餘複雜度。
- YC:給 AI agent 用的軟體 — 下一個百億用戶不是人 — Y Combinator RFS:互聯網下一波百億用戶不是人類,是 AI agent。所有主要軟體類別都需要 agent-first 重新設計,傳統大廠跟不上。
- YC:SaaS 挑戰者崛起 — 軟體護城河被 AI 拆掉 — AI 把軟體生產成本拉低 10–100 倍,過去保護老牌 SaaS 的數百萬行 code 不再是優勢。新創有前所未有機會。
- DeepSeek V4 可能顛覆整個 AI 經濟 — Matt Wolfe 拆解 DeepSeek V4:開源、近頂級性能、價格約 GPT-5.5 / Claude Opus 4.7 的三分之一。可本地跑保護隱私,可能重塑 AI 市場。
- Context Is the New Code(AI Engineer 2026) — Patrick Debois 提出 context dev lifecycle:generate / eval / distribute / observe,把 context 當成可版本控制、可測試、可觀察的軟體交付物。
- Replit CEO 訪談:Cursor 的併購、跟 Apple 開戰 — Replit CEO Amjad Masad 講開發者工具市場、與 Cursor 的洽談、與 Apple App Store 的衝突,以及他為什麼想保持獨立。
- 五角大廈與 NVIDIA / Microsoft / AWS 簽 AI 合約 — 美國國防部簽署 AI 部署合約,把 NVIDIA、Microsoft、AWS 拉進機密網路。
- AI Engineer World’s Fair:autoresearch、memory、world models 等新賽道 — Latent Space 公布第二波講者徵募,新增 autoresearch、memory、world models、tokenmaxxing、agentic commerce、vertical AI 六大賽道。
- I Gave an AI Agent the Keys to My Life — Radek Sienkiewicz 漸進開放 agent 權限的實驗:從讀檔 → 收信 → 記憶備份 → 自我監控 → 商務回覆。談信任邊界跟代理人格。
- Software Engineering Is Becoming Plan and Review — Louis Knight-Webb 論證工程師主要工作正在轉向「規劃 + 審查 AI 產出」。加快 plan/review 速度成為生產力倍增器。
名人動態#
- Simon Willison:轉貼 Anthropic 阿諛奉承研究 — 詳見必讀 #1
- Jensen Huang:Lex Fridman 訪談 — 詳見必讀 #5
- Max Schoening:Notion 產品長 Lenny’s 訪談 — 詳見必讀 #2
- Amelia Wattenberger:Augment Code Intent 設計師 Changelog 訪談 — 詳見必讀 #3
今日觀察#
今天的訊號很集中:AI 從「協助你寫東西」滑進「替你做判斷」。Anthropic 自己貼出來的 sycophancy 數據、哈佛 ER 的 67% 分診準確率、Notion 在內部把 PM 推進 terminal — 這些都是同一條線。但 DeepClaude 的出現提醒一件事 — AI 走進決策圈這件事,沒理由綁在一個閉源供應商身上。當你用 DeepSeek V4 Pro 跑出 96 分 LiveCodeBench,「換腦」這件事的成本,就只剩兩個環境變數的距離。下半場的競爭點,會是「個性」(要不要討好)跟「成本」(誰能跑得起)這兩條軸線。
中文技術圈#

- 移動端 Agent 的井噴或許近在眼前:以 ColorOS 拋磚引玉 — 少數派分析 ColorOS 系統級 AI Agent 的設計,預判移動端 Agent 即將進入井噴期。
- 在手機上使用 Codex — V2EX 開發者討論在手機上使用 Codex CLI 的工作流體驗。
開源精選 — GitHub Trending(本週)#
- nexu-io/open-design — TypeScript | ⭐ 19.2K 本地優先、開源 Claude Design 替代品(已在 EP61 涵蓋)。
- willchen96/mike — TypeScript | ⭐ 1.7K 開源 AI 法律平台。
- darrylmorley/whatcable — Swift | ⭐ 1.4K macOS 選單列工具,告訴你每條 USB-C 線實際能幹嘛。
- mattpocock/dictionary-of-ai-coding — TypeScript | ⭐ 840 Matt Pocock 寫的 AI 編程術語白話辭典。
- t8y2/dbx — Vue | ⭐ 770 15MB 跨平台資料庫客戶端,支援 MySQL / Postgres / Redis / DuckDB / ClickHouse。
- GENEXIS-AI/chromex — TypeScript | ⭐ 770 Codex 驅動的 Chrome 側邊欄助手,支援頁面 context、tab、語音與圖片。
- EvanBacon/serve-sim — TypeScript | ⭐ 540 Apple Simulator 版的 npx serve。
- noonghunna/club-3090 — Shell | ⭐ 440 在 RTX 3090 上跑 LLM 的社群配方(vLLM / llama.cpp / SGLang)。
影音精選#
Software for Agents#
20.8K views · 2 days ago
YC argues the next billion users of the internet will be AI agents, not humans. All major software categories need to be rebuilt agent-first.
- 互聯網下一波百億用戶不是人類,是 AI agent
- 所有主要軟體類別都需要 agent-first 重新設計
- 傳統大廠的舊架構跟不上這次轉向
💬 對 indie hacker 是好消息:每個垂直 SaaS 都會有 agent 版本被重寫一遍。
OpenAI Symphony — New AI Coding Paradigm#
13.3K views · 2 days ago
AI Jason 拆解 OpenAI Symphony — 結合 Claude Code harness、自動測試、Crewlet 工具的新編碼範式。WORKFLOW.md 自動化設定帶來開發效率提升。
- 結合 Claude Code harness + 自動測試 + Crewlet
- 用 WORKFLOW.md 自動化設定流程
- 可能是下一代 AI coding agent 的標準形態
💬 Symphony 把「agent 編排」變成標準動作,不是 OpenAI 的新工具,是新範式。
SaaS Challengers#
11.5K views · 1 day ago
AI 把軟體生產成本拉低 10–100 倍,過去保護老牌 SaaS 的數百萬行 code 不再是優勢。
- 軟體生產成本下降 10–100 倍
- 數百萬行累積的代碼不再是護城河
- 新創第一次能正面挑戰老牌 SaaS
💬 護城河換位置了:以前是「code 量」,現在是「ICP 理解 + 分發」。
Context Is the New Code#
10.1K views · 1 day ago
Patrick Debois 提出 context dev lifecycle:generate / eval / distribute / observe,把 context 當成可版本控制、可測試、可觀察的軟體交付物。
- context dev lifecycle:generate / eval / distribute / observe
- context 應該被當成 first-class 軟體產物
- 團隊實踐:context 進入 PR review 流程
💬 prompt → context engineering → context as code 是 2026 的演進方向。
DeepSeek V4 May Disrupt The Entire AI Economy#
8.9K views · 2 days ago
Matt Wolfe 拆解 DeepSeek V4:開源、近頂級性能、價格約 GPT-5.5 / Claude Opus 的三分之一。可本地跑保護隱私,重塑 AI 市場。
- 開源 + 近頂級性能
- 價格 ~$1.74/M tokens(GPT-5.5 / Opus 的 1/3)
- 可本地部署保護資料隱私
💬 搭配上面 DeepClaude,這是同一個故事的兩面:模型平價了 + 工具民主化了。
Software Engineering Is Becoming Plan and Review#
7.6K views · 1 day ago
Louis Knight-Webb 論證工程師主要工作正在轉向「規劃 + 審查 AI 產出」。
- 工程師核心工作 = plan + review,不是寫
- review 速度成為新的生產力指標
- 敏捷流程可能要重新設計
💬 跟 Notion / Intent 同調 — 軟體市場下一波是「完成的速度」而不是「寫的速度」。
I Gave an AI Agent the Keys to My Life#
6.2K views · 1 day ago
Radek Sienkiewicz 漸進開放 agent 權限:讀檔 → 收信 → 記憶備份 → 自我監控 → 商務回覆。談信任邊界跟代理人格。
- 權限漸進開放:read → email → memory → self-monitor
- 信任邊界 = 撤銷成本 vs 任務價值
- agent 個性會影響你願意給多少權限
💬 這是「AI agent 變成你個人 IT 部門」的真實實驗,看它走多遠。
Google Just Sold Out — Pentagon AI Deal#
5.2K views · 1 day ago
Google 與五角大廈簽 AI 機密資訊合約,違背 2014 年買 DeepMind 時的倫理承諾,遭 600+ 員工反對。
- 違反 2014 收購 DeepMind 時的 AI 倫理承諾
- 600+ 員工抗議
- 政府主導 AI 法規 + 合約,Google 兩難
💬 「不作惡」這條線正式被清掉,AI 公司的價值觀承諾從此被打折看待。
Industrial Capabilities in Space#
5.2K views · 1 day ago
YC RFS:月球矽、鋁、鐵、鈦資源在太空提取可能比地球更有效率。從原料電解到熔融月壤 3D 列印。
- 月球資源在零重力環境提取潛在優勢
- 從電解到月壤 3D 列印的技術棧
- YC 開放投資太空工業能力新創
💬 deep tech 的 hype cycle 正在從 AI 擴散到太空,但這次有 SpaceX 把成本壓下來。
Inside Clay’s Sales Playbook#
4.7K views · 1 day ago
Clay 銷售主管 Becca Lindquist 分享如何快速擴張銷售團隊、評估新人表現、AI 在銷售中的應用。
- 銷售團隊 0 → $100M ARR 的招聘策略
- AI 在 outbound 跟 SDR 工作流的具體應用
- 內部推薦機制 + 績效指標設計
💬 銷售流程被 AI 重塑後,sales rep 的價值從「打 cold call」轉到「設計 outbound 系統」。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit










