Google 把 AI 賭在 agent
Google I/O 一天推出 4 個 agent 級產品,Karpathy 進 Anthropic 引擎室 —— 大廠端上桌的速度,遠快過開發者消化的速度
每天花 1% 的時間,掌握科技脈動。
今日金句#
“The next few years at the frontier of LLMs will be especially formative.” 「接下來幾年,LLM 的最前沿會特別關鍵。」 — Andrej Karpathy, OpenAI 共同創辦人,剛加入 Anthropic pre-training 團隊
“Projects become like ‘Weekend at Bernie’s’ — appearing animated long after becoming genuinely unmaintained.” 「專案會變得像電影《老闆渡假去》—— 早已無人維護,卻還被擺弄得像活著。」 — Andrew Nesbitt, 開源生態分析師
今日主軸:Google 把下一波 AI 賭在 agent#
今天的科技圈被兩條線拉著走,而它們指向同一個方向。第一條是 Google I/O 2026:Google 一口氣發表 Gemini 3.5 Flash、改寫用了二十五年的搜尋框、讓 AI Studio 幾分鐘生出原生 Android app、再推出能 24 小時待命的 Gemini Spark。官方說法毫不含糊 —— 這一波 AI,賭的是 agent,不是 chatbot。第二條線是人才:共同創辦 OpenAI 的 Andrej Karpathy 加入 Anthropic 的 pre-training 團隊,直接進最燒算力的引擎室。一邊是產品全面 agent 化,一邊是頂尖人才往模型最底層集中。而 The Pragmatic Engineer 用九百多份工程師回覆,補上了這個故事的另一面:當 agent 成為預設,真正在寫程式的人感受到的是程式碼品質下滑、資深工程師更累、以及一種停不下來的「再一個 prompt」。今天的主軸,就是這個落差 —— 大廠把 agent 的未來端上桌的速度,遠快過開發者把它消化進工作流的速度。
必讀#
- Karpathy 加入 Anthropic pre-training 團隊 — TechCrunch
AI - Gemini 3.5 Flash:Google 把下一波 AI 賭在 agent — TechCrunch
AI - Google AI Studio 幾分鐘生一個原生 Android app — TechCrunch
Dev - The Pragmatic Engineer:AI 對工程師的真實影響(下) — Pragmatic Engineer
Dev - Apple 發表 Apple Intelligence 驅動的全新無障礙功能 — Apple
News - Forge:護欄讓 8B 小模型在 agentic 任務衝到 99% — GitHub
Tools - HTML is the new Markdown:Anthropic 工程師怎麼用 Claude Code — Lenny’s Newsletter
Dev - Google 搜尋 25 年來最大改版,AI Mode 成主角 — Google
News - Simon Willison:五分鐘回顧近半年 LLM 發展 — Simon Willison
AI - Gemini Spark:24 小時待命的 agent 助理 — TechCrunch
AI - Import AI 457:AI Stuxnet 與一個 20 年前的病毒 — Import AI
AI - ByteByteGo:Snapchat 如何每秒處理十億次推薦預測 — ByteByteGo
Dev
1. Karpathy 加入 Anthropic pre-training 團隊#

OpenAI 共同創辦人、前 Tesla AI 總監 Andrej Karpathy 宣布加入 Anthropic 的 pre-training 團隊,在團隊負責人 Nick Joseph 之下工作,目標是用 Claude 加速 pre-training 研究。pre-training 是打造前沿模型裡最吃算力、最昂貴的階段。Karpathy 自己只留一句話:「接下來幾年,LLM 的最前沿會特別關鍵,我很興奮能回到 R&D。」同期 Anthropic 也找來資安老將 Chris Rohlf 領導 frontier red team。
- Karpathy 沒選產品或應用層,直接進模型最核心的 pre-training
- 此舉暗示 Anthropic 押注「研究效率」而非單純堆算力,與 OpenAI、Google 競爭
- 當日開發者社群討論度居首,是 2026 年 AI 人才戰最受矚目的一次轉會
💡 為什麼重要:頂尖人才往哪走,往往比模型 benchmark 更早預示產業走向。Karpathy 選 Anthropic 的最底層,是一個強訊號。
🔗 閱讀原文 | 來源: TechCrunch
2. Gemini 3.5 Flash:Google 把下一波 AI 賭在 agent#

Google 在 I/O 2026 發表 Gemini 3.5 Flash,並明確把它定位為「agent 優先」而非 chatbot。Flash 速度比其他前沿模型快約 4 倍(最佳化版本可達 12 倍),能自主連續運作數小時、完成多步驟工作流。Google 設計的協作模式是 3.5 Pro 當「協調者/規劃者」、Flash 跑 sub-agent 任務;Flash 同時成為 Google Search AI Mode 的全球預設模型。
- Flash 在 coding 與 agentic benchmark 上超越 Gemini 3.1 Pro
- 與 Antigravity 共同開發,原生支援 agentic IDE 環境
- 定價較前代 Flash 貴 3–6 倍(Simon Willison 觀察),Google 用速度換取全產品線整合
💡 為什麼重要:Google 不再把 AI 當聊天介面,而是當「能自己把事做完」的執行體。這是整個產業從 chatbot 轉向 agent 的最大規模宣示。
🔗 閱讀原文 | 來源: TechCrunch
3. Google AI Studio 幾分鐘生一個原生 Android app#
![]()
Google 在 I/O 2026 推出網頁版 AI Studio,讓沒有寫程式經驗的人也能在幾分鐘內生成原生 Android app。生成的 app 用 Kotlin + Jetpack Compose,完整支援 GPS、藍牙、NFC 等硬體感測器,瀏覽器內建 Android 模擬器即時預覽,可透過 USB/ADB 安裝、或匯出成 zip 進 Android Studio。Google 同步推出「Ask Play」AI 圖層,讓使用者用自然語言在 Play 商店找 app。
- app 可匯出到 Android Studio,並支援 Firebase(Firestore、Auth、App Check)整合
- 直接挑戰 Cursor、Replit 等低程式碼平台
- Gemini 會在對話中直接推薦相關 app,給開發者新的曝光管道
💡 為什麼重要:行動 app 開發的門檻被大幅壓低。對 Flutter/原生開發者來說,這既是工具,也是「要重新思考如何在 Play 商店和 AI 生成 app 競爭」的訊號。
🔗 閱讀原文 | 來源: TechCrunch
4. The Pragmatic Engineer:AI 對工程師的真實影響(下)#

Pragmatic Engineer 分析超過九百份訂閱者回覆,揭露 AI 工具在企業規模化採用時的實況:程式碼品質普遍下降,但管理層不在乎,因為「看起來」有產出;資深工程師負擔反而更重,要收拾 AI 生成的程式碼。文章也點出 AI 工具的「成癮性」—— 開發者陷入「再一個 prompt」的循環;而經驗較少的工程師從 AI 中受益反而最少。
- 程式碼品質下滑,與管理層的「產出感」之間出現落差
- 資深工程師成為 AI 程式碼的「除錯緩衝層」,工作量增加
- 「再一個 prompt」的成癮體驗會吞掉時間,卻不一定有進展
💡 為什麼重要:在所有人談 agent 未來時,這篇補上了現實的另一面 —— 工具給你速度,不會自動給你判斷力。
🔗 閱讀原文 | 來源: The Pragmatic Engineer
5. Apple 發表 Apple Intelligence 驅動的全新無障礙功能#

Apple 發表由 Apple Intelligence 驅動的整套無障礙功能。VoiceOver 新增「Image Explorer」可詳細描述照片、帳單等視覺內容;Voice Control 加入自然語言處理,使用者可以用描述的方式操作按鈕而不必背標籤;「Generated Subtitles」為未加字幕的影片自動生成字幕,全程裝置端語音辨識。Apple Vision Pro 新增以眼動控制輪椅的功能,相容 Tolt 與 LUCI 系統。
- 所有功能採裝置端處理,維持 Apple「隱私優先」原則
- Vision Pro 輪椅控制把高價裝置轉成輔助科技平台
- FaceTime 新增手語翻譯 API、姓名辨識擴充至 50+ 語言
💡 為什麼重要:示範了前沿 AI 能力如何用於包容性設計 —— 對行動開發者,新的 API(手語翻譯、Sony Access 控制器)也代表新的整合機會。
🔗 閱讀原文 | 來源: Apple Newsroom
6. Forge:護欄讓 8B 小模型在 agentic 任務衝到 99%#
Forge 是一個自架的 Python 框架,專門提升本地 LLM 在多步驟 agentic 工作流的可靠度。透過 guardrails(救援解析、重試提示、步驟強制、VRAM 感知預算)讓一個 8B 本地模型在評測中達到 86.5% 準確率,「把 8B 模型抬到同級之冠」。提供三種模式:WorkflowRunner、Guardrails Middleware、OpenAI 相容代理伺服器,支援 Llama-server、Ollama、Llamafile、Anthropic 多種後端。
- 含 865 個確定性單元測試與 26 情境評測 harness
- SlotWorker 優先佇列支援多 agent 共用 GPU
- 讓便宜、低延遲的本地模型也能達到接近前沿模型的工具呼叫可靠度
💡 為什麼重要:本地模型最大的痛點是「不夠可靠」。Forge 證明,護欄工程比換更大的模型更能解決問題。
🔗 閱讀原文 | 來源: GitHub
7. HTML is the new Markdown:Anthropic 工程師怎麼用 Claude Code#

Anthropic Claude Code 團隊工程師 Thariq Shihipar 分享:他們開始用 HTML 取代 Markdown 作為 AI 協作的規劃格式,因為 HTML 能提供更豐富的互動元素與視覺呈現。他也提出一個觀點 —— 工程師正在變成「算力的調度者」,而 AI 生成的 token 裡,應該有 99% 用於規劃與溝通,而不是直接進入生產程式碼。
- HTML 作為規劃文件,比 Markdown 能承載更多結構與互動
- 「99% 的 token 用於規劃,不是直接寫 code」的工作流主張
- 工程師角色從「寫程式」轉向「調度算力與定義意圖」
💡 為什麼重要:來自 Claude Code 團隊內部的實戰方法,對任何在用 AI agent 寫程式的人都是可直接借鏡的工作流調整。
🔗 閱讀原文 | 來源: Lenny’s Newsletter
8. Google 搜尋 25 年來最大改版,AI Mode 成主角#

Google 在 I/O 2026 宣布 25 年來最大的搜尋改版:Gemini 3.5 Flash 成為全球 AI Mode 的預設模型,AI Mode 上線一年已突破十億月活躍使用者、查詢量每季翻倍。新版支援文字、圖片、檔案、影片、Chrome 分頁等多模態輸入;新的「搜尋 agent」會 24 小時監看網路更新,2026 夏季對 Pro/Ultra 訂閱者推出。
- agentic 預訂功能擴展到在地服務與多個品類
- 個人化情報擴展到 200+ 國家、98 種語言
- 搜尋從「給你連結」轉為「派 agent 幫你完成任務」
💡 為什麼重要:搜尋是 Google 的根,把它改成 agent 介面,等於宣告 agent 不是實驗功能,而是主流基礎設施。
🔗 閱讀原文 | 來源: Google
9. Simon Willison:五分鐘回顧近半年 LLM 發展#

Simon Willison 把他在 PyCon US 2026 的五分鐘閃電演講整理成圖文版,回顧 2025 年 11 月以來的 LLM 關鍵轉折:最強模型的主導權在三大廠商間換手達五次。他用招牌的「鵜鶘騎腳踏車」SVG 測試,直觀展示各家模型能力的差異與進步。
- 半年內前沿模型王座五度易主,競爭節奏空前
- 用同一個 SVG 生成測試橫向對比模型能力,方法簡單有效
- 是快速補上近期 AI 發展脈絡的精煉摘要
💡 為什麼重要:在資訊爆炸的 AI 圈,一份可信、濃縮的時間軸本身就很有價值。
🔗 閱讀原文 | 來源: Simon Willison
10. Gemini Spark:24 小時待命的 agent 助理#

Google 在 I/O 2026 發表 Gemini Spark:一個跑在 Google Cloud 專屬 VM 上、不需要使用者裝置就能 24 小時運作的 agentic 助理。它深度整合 Google Workspace —— Gmail(Spark 有自己的 email 地址可接收任務)、Docs、Sheets、Slides、Chrome。可處理長時程任務,例如彙整多份來源草擬郵件、幫小型企業管理客戶詢問,並可透過 MCP 連接第三方服務。
- 用 Gmail 當「指派任務」的介面,降低使用門檻
- 運算成本由 Google 承擔(雲端 VM),非使用者裝置
- 補齊 Google 在 agent 市場與 Anthropic、OpenAI 的競爭版圖
💡 為什麼重要:把 email 變成指派 AI 任務的標準介面,是很聰明的減摩擦設計 —— 你不必學新介面,寫信就好。
🔗 閱讀原文 | 來源: TechCrunch
11. Import AI 457:AI Stuxnet 與一個 20 年前的病毒#

本期 Import AI 深挖一個 20 多年前的電腦病毒 fast16.sys,它專門鎖定精密計算軟體、篡改浮點數運算結果,疑似曾用於武器相關程式 —— 一種針對「計算正確性」本身的攻擊。文章也涵蓋 Muon 優化器的最新研究與 AI 正向對齊的進展。
- fast16.sys 不竊取資料,而是悄悄讓計算結果出錯
- 呼應當代對 AI 系統「計算可信度」的擔憂
- 把歷史上的精密攻擊與今日 AI 安全議題串在一起
💡 為什麼重要:當 AI 接手愈來愈多關鍵計算,「結果到底對不對」會變成比「系統有沒有被入侵」更難察覺的風險。
🔗 閱讀原文 | 來源: Import AI
12. ByteByteGo:Snapchat 如何每秒處理十億次推薦預測#

ByteByteGo 解析 Snapchat 如何在 100 毫秒內為 4.77 億日活用戶完成影片推薦:從數百萬候選影片召回、特徵擷取,到深度學習排名,全部在極短時間內完成。文章說明這種規模下系統架構「必須長成的形狀」。
- 召回 → 特徵擷取 → 深度學習排名的三段式管線
- 100 毫秒延遲預算下的工程取捨
- 大規模即時推薦系統的實戰架構參考
💡 為什麼重要:推薦系統是許多產品的核心,這篇給出一個可參照、經得起規模考驗的架構藍圖。
🔗 閱讀原文 | 來源: ByteByteGo
推薦閱讀#

- ByteByteGo:Grab 用多代理 AI 系統解放資料工程師 — Grab 資料倉儲團隊每週花兩整天回答同事的資料問題,於是建了多代理 AI 系統自動處理目錄查詢、血緣追蹤與 SQL 驗證,管理超過 15,000 張資料表。
- Latent Space:AI 引導無人機與西方的準備落差 — The Fourth Law 創辦人 Yaroslav Azhnyuk 解析 AI 引導無人機在烏克蘭戰場的技術棧與自主等級,以及中國製造優勢如何拉大與西方的差距。
- OpenAI 採用 SynthID 浮水印,AI 圖片來源可驗證 — OpenAI 採用 Google 的 SynthID 隱形浮水印搭配 C2PA Content Credentials,為 Sora 2 影片與 DALL·E 圖片建立雙層來源標記,呼應 EU AI Act 第 50 條的標註要求。
- Google Genie 世界模型:用 Street View 模擬真實街道 — Google DeepMind 把 Street View 接進 Project Genie,結合 110 國街景影像生成可互動的模擬環境,可調天氣與時間,用於機器人與自駕訓練。
- Latent Space:如何進入前沿 AI 實驗室 — Vlad Feinberg 分享 kernel 層級的效能優化是 LLM 工作最核心的瓶頸,也是進入前沿實驗室最直接的入場路徑。
- Mistral AI 收購奧地利物理 AI 新創 Emmi — Mistral 收購 Emmi(30+ 名研究員),進軍航太、汽車、半導體的工業模擬與數位孿生,是三個月內第二起收購。
- Gemini Omni:把真實影片 remix 成 AI 短片 — Gemini Omni 可把真實影片 remix 成 AI 超現實短片,直接整合 YouTube Shorts,是比 Veo 3 更進一步的多模態模型。
- zerolang:Vercel Labs 的「agent 程式語言」 — Vercel Labs 實驗一個從一開始就以 agent 為主要使用者的程式語言,語法精簡一致,仍是 pre-1.0 實驗階段。
- native-feel-skill:寫出原生感的跨平台桌面 app — yetone 從 Raycast 2.0 拆解出的 Agent Skill,提出四層架構與 75 項出貨檢查清單,讓跨平台開發同時保有原生質感。
- Dumb Ways for an Open Source Project to Die — Andrew Nesbitt 整理開源專案的 30 多種死法:最常見的是維護者無預警消失,而 package registry 讓死掉的套件可以無限期繼續被安裝。
- Lenny & Friends Summit 九月舊金山回歸 — Lenny Rachitsky 宣布產品領袖聚會將於 2026 年 9 月在舊金山回歸,刻意維持小規模、出席者經審核。
其他值得關注#
- OpenBSD 7.9 正式發布 — 安全導向作業系統的最新版本。
- Discord 為所有使用者啟用端對端加密語音與視訊 — E2EE 從特定族群擴展到全體使用者。
- The Quiet Renovation at Bitwarden — 對 Bitwarden 近期低調改版的觀察。
大神動態#
- Andrej Karpathy:加入 Anthropic 的 pre-training 團隊,回到第一線 R&D(詳見必讀 #1)
- Simon Willison:把 PyCon US 2026 的五分鐘閃電演講整理成近半年 LLM 發展回顧(詳見必讀 #9),另發表對 Gemini 3.5 Flash 漲價與全產品整合的觀察
趨勢觀察#
把今天的幾篇放在一起看:Google 的 Gemini Spark、Anthropic 的 agent 路線、Forge 讓 8B 小模型在 agentic task 衝到 99%、Vercel 的 zerolang 乾脆設計一個「給 agent 看」的程式語言 —— 整個產業的預設使用者,正在從「人」悄悄換成「agent」。但 The Pragmatic Engineer 的九百份回覆提醒我們,這個轉換在企業內部其實很卡:工具好用到會上癮,產出看起來變多,品質卻在下滑。
💡 給開發者的啟示:agent 化不可逆,但你的價值不在於「能不能 prompt 出東西」,而在於 prompt 完之後,你還看不看得出哪裡錯了。把 review 跟判斷力當成核心技能練,不要外包給模型。
🎯 Today’s Action (30 min):去讀 Pragmatic Engineer 的 AI 影響報告(下篇),對照你自己過去一週用 AI 的方式 —— 有幾次是真的在解問題,有幾次只是在「再按一個 prompt」?
今日關鍵趨勢#
- Google 全面 agent 化:Gemini 3.5 Flash、AI Mode 搜尋、Gemini Spark、AI Studio —— Google I/O 2026 的主線是用「指派軟體做事」取代「使用軟體」。
- AI 人才往引擎室集中:Karpathy 加入 Anthropic pre-training,頂尖研究者選擇模型最底層而非應用層。
- 小模型 + 護欄逼近大模型:Forge 讓 8B 模型在 agentic 任務從 53% 衝到 99%,本地、低成本部署的可行性提升。
- agent 原生工具鏈成形:zerolang(給 agent 的程式語言)、native-feel-skill、LobeHub —— 工具的預設使用者正從人換成 agent。
- AI 對工程師的真實成本浮現:程式碼品質下滑、資深工程師負擔加重、「再一個 prompt」的成癮循環。
社群熱門#

- Google I/O 2026 開發者 keynote:Compose-First Android — Google 正式宣告 Compose First,Jetpack Compose 成 Android 主流,AI Studio 可從 prompt 生成完整 Kotlin + Compose 應用。
- LobeHub:多 agent 協作平台 — 整合 273K+ Skills、51K+ MCP servers 的多 agent 協作平台,ProductHunt 日榜冠軍。
- PollyReach:給 AI 真實電話號碼的語音 agent — 給 AI 真實電話號碼撥打電話、支援 50+ 語言。
- Drizz:用 Vision AI 自動寫 mobile 測試 — 用 Vision AI 自動撰寫與維護 mobile 測試案例,不需寫腳本。
- Composer 2.5:Cursor 新編碼模型 — Cursor 新編碼模型發布,與 Gemini 3.5 Flash 同期,開發者社群高度關注。
- Shadow:能看螢幕、執行技能的 Mac AI 介面 — 能看螢幕、聽聲音、執行自訂自動化技能的 Mac AI 介面。
中文技術圈#

- arXiv 嚴查 AI 論文,未經核實作者將被封禁一年 — arXiv 開始嚴查 AI 生成論文,提交未經核實內容的作者將被封禁一年。
- YoooClaw C·ONE 體驗:為 AI Agent 而生的硬件 — 少數派實測一款專為 AI Agent 設計的硬體裝置。
- 免費 AI 公益站重新開放註冊,送 50 刀額度 — V2EX 開發者社群熱議的免費 AI API 額度公益站。
- 一個一目瞭然的自建 Codex 中轉站開放註冊 — 開發者自建的 Codex API 中轉服務開放註冊。
- 派評:近期值得關注的 App — 少數派編輯精選近期值得下載的 App。
開源精選 — GitHub Trending#
- vercel-labs/zerolang — C | ⭐ 3.1K 為 agent 設計的程式語言,語法精簡、為可學習性最佳化。
- yetone/native-feel-skill — ⭐ 1.3K 從 Raycast 2.0 拆解出的原生感跨平台桌面 app 設計 skill。
- facebookresearch/vggt-omega — Python | ⭐ 1.2K CVPR 2026 Oral,VGGT Omega 3D 視覺模型。
- DenisSergeevitch/agents-best-practices — ⭐ 853 跨 Codex/Claude Code 的 agent harness 設計最佳實踐。
- Kappaemme-git/codex-complexity-optimizer — Python | ⭐ 786 Codex skill:安全的程式碼複雜度分析與效能最佳化報告。
- Doorman11991/smallcode — JavaScript | ⭐ 715 為小模型最佳化的 AI coding agent,4B 模型達 87% benchmark。
- boona13/mykonos-island-voxels — JavaScript | ⭐ 658 瀏覽器版等距島嶼建造器,純 ES module、行動裝置友善。
影音精選#
花 40 美元「消費」掉數萬美元的 GitHub Copilot#
Theo 揭露 GitHub Copilot 計費系統的嚴重漏洞,示範如何只花 40 美元就「消費」掉價值數萬美元的算力 —— 一堂關於 AI SaaS 計費複雜度的警示課。
谷歌 AI 的 14 年與 Gemini 翻身之戰(專訪 DeepMind 前科學家)#
硅谷101 深度專訪 Google DeepMind 前研究總監 Andrew Dai,回顧他在 Google 14 年參與 MoE、PaLM、Gemini 的歷程,以及 Google 如何錯過「GPT 時刻」又如何反擊。
2026 年九大創業方向:AI、B2C 與行動端機會#
Greg Isenberg 與 Jonathan Courtney 對談 2026 年最具潛力的 9 個創業方向,特別強調讓 AI Agent 直接執行任務的「Action Apps」將是下一波行動端革命。
Zepto 創辦人放棄史丹佛,用 10 分鐘外送改變印度#
Zepto 共同創辦人 Aadit Palicha 分享如何從 COVID 期間的 WhatsApp 外送群組,成長為印度最大的 10 分鐘快速電商平台。
Josh Browder:我把所有收入都拿去買土地#
DoNotPay 創辦人 Josh Browder 解釋為何在 AI 時代他選擇將收益全部投入土地,認為實體資產在 AI 引發財富重分配的時代更具保值意義。
覺得有用嗎?分享給一個也在追蹤新知的朋友。
也歡迎中長期投資者體驗新工具 → Moniit





