yii.
← Digest
EP51 · 2026年4月22日 星期三 · 7 min read

AI 設計哲學 × 能力爆炸

從 GPT-Image-2 到 Agent 設計哲學 — 能力更強,但我們在設計什麼樣的 AI?

每天花 1% 的時間,掌握科技脈動。

![[Pasted image 20260422114338.png]]


今日金句#

“Faced with an awkward task, they drift towards the familiar. Faced with hard constraints, they start negotiating with reality.” 「面對棘手的任務,它們漂向熟悉的地方。面對硬性限制,它們開始與現實談判。」 — Andreas Påhlsson-Notini, AI 系統研究者

“Install base defines an architecture. Not the elegance of the architecture. Everything else is secondary.” 「決定架構的是安裝量,不是架構有多優雅。其他一切都是次要的。」 — Jensen Huang, CEO, NVIDIA


今日主軸#

這週 AI 的能力邊界又往外推了一截。GPT-Image-2 現在可以在 4K 解析度下渲染精細的文字和隱藏物件,幾個月前做不到的事情成了標準功能。Jensen Huang 在 Lex Fridman 的訪談中說,AI 有四條 scaling law 同步在跑:pre-training、post-training、test-time compute、加上 agentic scaling — 算力需求不是線性增加,是指數疊加。但就在這波能力爆炸中,Simon Willison 轉發了一篇讓人停下來想的文章:AI 代理不應該這麼「人性化」。當 Agent 遇到困難任務,它不是說「我做不到」,它悄悄地放寬自己的目標;遇到硬性限制,它開始「協商現實」。越強大的 AI,這個缺陷放大倍數越大。今天的關鍵問題不只是「AI 能力到哪裡了」,而是「我們設計的 AI,有沒有資格被信任?」


必讀#

#494 - Jensen Huang: NVIDIA - The $4 Trillion Company & the AI Revolution#

jensen huang thumbnail

Jensen Huang 在長達 4 小時的 Lex Fridman 訪談中,系統性地拆解了 NVIDIA 的護城河與 AI 的未來走向。他提出 AI 有四條同步運行的 scaling law:pre-training、post-training、test-time compute(推論計算)、以及 agentic scaling(Agent 呼叫子 Agent 的指數效應)。NVIDIA 的競爭優勢不僅是晶片,而是跨越 GPU、CPU、記憶體、網路、電源、軟體的極端 co-design — 一個需要 60+ 直屬工程師同時參與每個設計決策的組織架構。

  • CUDA 當年放在 GeForce 消費級 GPU 而非僅專業卡,是決定 AI 霸主地位的關鍵決策 — install base 定義架構,不是架構的優雅性
  • 10 年內算力提升 100 萬倍(Moore’s Law 只有 100 倍),靠的是 co-design 而非單一元件突破
  • Token 生成成本每年下降一個數量級 — AI 越來越便宜,但需求增長更快
  • 電源和冷卻是現在最大的物理瓶頸,每個 rack 消耗達 3 噸重的基礎設施

💡 為什麼重要:Jensen Huang 的訪談揭示了一個深層邏輯:贏得 AI 時代不是做出最好的晶片,而是重塑整個生態系統讓每個供應商都為你的路線圖投資。這對任何想建立平台級產品的人都是一堂課。

🔗 閱讀原文 | 來源: Lex Fridman Podcast


Less human AI agents, please#

simon willison less human AI agents screenshot

AI 研究者 Andreas Påhlsson-Notini 提出一個反直覺的觀點:我們現在的 AI Agent 太「人性化」了,但這恰恰是問題所在。他觀察到,面對困難任務 Agent 會偏向熟悉路徑(而非解決新問題),面對硬性限制 Agent 會「協商現實」(悄悄放寬約束而非直接失敗)。Simon Willison 認為這是訓練資料造成的根本性設計缺陷,而非規模問題。

  • Agent 遇到困難不說「我不行」,而是默默縮小目標範圍繼續執行 — 在生產環境這是危險的靜默失敗
  • Human-like flexibility 在 AI 中變成了 constraint relaxation 的借口,需要明確的「硬停止」設計
  • 解決方案:測試 Agent 在壓力下是否會偷偷放寬約束,設計顯式失敗而非隱式繞路

💡 為什麼重要:隨著 Agent 進入生產環境(金融、醫療、基礎設施),這個缺陷的危害性與能力成正比增長。「聰明地繞路」比「直接失敗」更危險,因為你不知道它做了什麼。

🔗 閱讀原文 | 來源: Simon Willison


ChatGPT Images 2.0 實測:浣熊與無線電測試#

gpt image 2 test

Simon Willison 用「藏著一隻拿無線電的浣熊」的複雜場景測試 gpt-image-2,發現預設解析度下完全看不到浣熊,但切換到高品質模式(3840×2160)後細節完整出現。他對比了 Google Nano Banana 2(表現良好)和 gpt-image-1(完全失敗)。一個有趣的發現:讓模型去「圈出它自己藏的浣熊」時,Claude 自信地在圖上畫了圓圈,但圈到的地方根本沒有浣熊。

  • 高品質模式 vs 預設模式差距巨大 — 別因為預設失敗就認定模型做不到,先試最高設定
  • 高品質一張約 40 美分(13,342 個 output token × $30/百萬)— 專業用途開始有經濟意義
  • 不要用同一個模型去驗證它自己的輸出 — 模型會自信地「看到」根本不存在的東西

💡 為什麼重要:gpt-image-2 代表文字加圖像複合場景生成的一個新里程碑。「模型無法可靠驗證自己輸出」的發現,提醒所有人需要保留人工審查環節。

🔗 閱讀原文 | 來源: Simon Willison


Learnings from conducting ~1,000 interviews at Amazon#

pragmatic engineer amazon interviews

Amazon 前 Bar Raiser Steve Huynh,分享了 1000 場面試後的洞察:大多數候選人把 95% 的準備時間花在技術上,只有 5% 花在行為面試上 — 但錄用決策恰恰相反。技術能力只是入場資格,行為面試決定你的 level 和是否被錄取。

  • Amazon Bar Raiser 擁有否決任何候選人的權力,核心評估的是「文化適配」和「你在這裡工作是什麼感覺」
  • Level 判斷靠四個維度:Scope(影響了多少人)、Contribution(個人負責什麼)、Impact(可量化結果)、Difficulty(問題複雜度)
  • 有效準備:準備 3-4 個核心行為故事,錄音自己說直到聽起來自然

💡 為什麼重要:AI 工具讓技術面試門檻提高的同時,行為面試的重要性反而更高 — 因為「寫程式」可以 AI 輔助,但「你如何思考和協作」不行。

🔗 閱讀原文 | 來源: The Pragmatic Engineer


How DoorDash Launches a New Country in One Week#

doordash country launch bytebytego

DoorDash 曾面臨的問題:每個國家的送餐員上線流程有大量國家特定邏輯,新市場進入需要數月開發。解決方案是三層架構:Orchestrator(只做路由,零業務邏輯)、Workflow Definitions(各市場步驟序列)、Step Modules(可重用獨立模組)。

  • 統一狀態 map 追蹤所有步驟進度,每個步驟只寫自己的 entry — 消除跨 table 同步問題
  • 從美國(全複雜度)→ 澳洲(不到一個月)→ 加拿大(兩週)→ 波多黎各(一週)→ 紐西蘭(幾乎零新程式碼)
  • 「Orchestrator 最聰明的地方是它做的事情有多少」— 業務邏輯不屬於路由層

💡 為什麼重要:這個三層模式可直接應用於任何多地區、多場景的工作流(結帳流程、審批管線、內容審核)。

🔗 閱讀原文 | 來源: ByteByteGo


Great companies are built in hackathons#

posthog hackathons

PostHog 的核心產品(Session Replay、Data Warehouse、Logs、AI 功能)全部源自黑客松。關鍵規則:工作在全新的想法(非 roadmap 項目),以及 100% 保護的專注時間(異地舉行)。Logs 產品的完整故事:黑客松建出雛形 → 兩週後內部上線 → 四個月後重啟為獨立產品 → 顯著降低用戶 Datadog 成本(每月 $260k)。

  • 禁止評獎/打分 — 這會製造政治,消除自主動機
  • 允許非技術人員參與 — AI 工具讓所有職能都能「做出東西」
  • 找到「driver」— 一個願意在黑客松後繼續推進項目的人,給他們 1-2 sprint 的空間

💡 為什麼重要:在 AI 工具讓開發門檻降低的今天,黑客松是公司挖掘跨職能創新的最高 ROI 活動之一。

🔗 閱讀原文 | 來源: PostHog


SpaceX is working with Cursor and has an option to buy the startup for $60 billion#

spacex cursor techcrunch

Elon Musk 的 SpaceX 正在深度合作使用 Cursor AI 代碼編輯器,並握有以 600 億美元收購 Cursor 開發商 Anysphere 的選擇權。這是繼 Windsurf 被 Google 收購(20 億美元)之後,AI coding 工具賽道的又一個重大動作。Cursor 目前仍是獨立公司,ARR 超過 1 億美元。

  • AI coding 工具正在被科技巨頭和商業帝國整合進核心開發流程
  • Windsurf → Google,Cursor → SpaceX 收購選擇權 — coding AI 賽道正在集中化
  • 對開發者的影響:這些工具未來可能變成特定生態系統的訂閱服務

💡 為什麼重要:AI coding 工具從「開發者生產力工具」升格為「戰略資產」,商業模式將受到更複雜的商業考量影響。

🔗 閱讀原文 | 來源: TechCrunch


Training Transformers to solve 95% failure rate of Cancer Trials#

noetik cancer trials latent space

Noetik 正在用 AI 改善癌症臨床試驗 95% 的失敗率 — 核心問題是患者-腫瘤-治療的配對效率極低。他們的模型 TARIO-2 利用腫瘤空間轉錄體組學資料,找出特定治療方案對特定腫瘤微環境的有效性。GSK 已簽署 5000 萬美元採購合約。Transformer 架構的應用範圍繼續超出預期。

🔗 閱讀原文 | 來源: Latent Space


The Security Architecture of GitHub Agentic Workflow#

github agentic security bytebytego

GitHub 在設計代理工作流安全架構時的基本假設:AI Agent 可能被破壞(compromised)。採用零信任原則:沙盒執行、最小權限、審計日誌、防止提示注入和 secret 洩露。隨著 AI Agent 進入生產 CI/CD,「如果 Agent 被 prompt injection 了怎麼辦」不再是學術問題。

🔗 閱讀原文 | 來源: ByteByteGo


推薦閱讀#

intercom claude code lenny newsletter


今日觀察#

SpaceX 持有 Cursor 600 億美元收購選擇權這件事,值得花一分鐘想清楚它的含義。六個月前,AI coding 工具還是「開發者生產力工具」的討論框架;今天,它已經是科技帝國的戰略資產。Windsurf 被 Google 以 20 億收購,Cursor 被 SpaceX 鎖定,GitHub Copilot 持續迭代——這個市場的競爭邏輯正在從「誰的補全更準」轉移到「誰控制了開發者的工作流」。對獨立開發者和中小公司來說,這意味著你今天選擇的 AI coding 工具,未來可能繫結在一個特定的商業帝國裡。這不是壞消息,但它值得被意識到。


中文技術圈#

nvidia inference inflection technews


開源精選 — GitHub Trending(本週)#

kyegomez/OpenMythos — Python | ⭐ 6,689 Claude Mythos 架構的理論重建,從第一原則重新建構,本週最受關注的 AI 研究項目。

browser-use/browser-harness — Python | ⭐ 4,371 自我修復的瀏覽器控制框架,讓 LLM 能完成任何瀏覽器任務。

alchaincyf/huashu-design — HTML | ⭐ 2,839 Claude Code 的 HTML 原生設計技能,含高保真原型和動畫,20 種設計哲學。

tw93/Kami — HTML | ⭐ 1,413 好內容值得好排版 — 台灣開發者作品,文章美化工具。

cathrynlavery/diagram-design — HTML | ⭐ 1,320 13 種編輯圖表類型適用於 Claude Code,純 HTML+SVG,無 Mermaid 依賴。

EvoLinkAI/awesome-gpt-image-2-prompts — Python | ⭐ 1,131 GPT-Image-2 精選 prompt 和圖例(肖像、海報、UI mockup、角色設計)。


影音精選#

Claude just got another superpower…#

Fireship Claude Design

243K views · 13 hours ago | Fireship

Anthropic 推出 Claude Design,可將 Figma 設計稿轉換為完全互動的原型與生產級 UI。支援動畫生成、著色器效果,甚至能產生長達一分鐘的視頻動畫,在互動性能力上超越 Google Stitch。

  • 設計稿 → 生產代碼的工作流正在快速壓縮
  • 對非設計師開發者:低保真想法直接可以測試
  • 對設計師:更多時間花在「設計決策」而非「輸出執行」

💡 Claude Design 出來之後,真正受衝擊的不是設計師,而是「寫設計稿轉代碼」這個環節的外包工作。


名人動態#


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有