yii.
← Digest
EP163 · 2026年8月13日 星期四 · 15 min read

蓋章的人和洗章的人

今天科技圈同時在做兩件相反的事:把來源標記蓋上去,再想辦法洗掉

每天花 1% 的時間,掌握科技脈動。

今日金句#

“Today, implementation is cheap. You are paid to make good decisions.” 「今天實作很便宜。你領的薪水,是拿來做好決定的。」 — Florian Herrengt,〈AI is removing the middle class of software engineering〉 作者

“Running boring technology in a non-standard way is a risk.” 「用非標準的方式跑無聊的技術,本身就是風險。」 — Tailscale 工程團隊,追出 SQLite 潛伏 16 年的資料損毀 bug 之後

“No tool can certify that vendor detectors will fail.” 「沒有任何工具能保證廠商的偵測器一定會失效。」 — Guillaume Meyer,watermarks-remover 作者,寫在自己專案的說明檔裡

今日主軸#

今天最值得放在一起看的,是 Anthropic 開始為 Claude 的產出加隱形浮水印,以及 GitHub 本週漲最快的新專案 watermarks-remover,一個專門洗掉這類記號的工具,已經 2,284 顆星。Anthropic 做這件事的動機不是突然想管人,是歐盟 AI Act 的透明度要求;而那個移除工具分三層處理:清掉藏在文字裡看不見的 Unicode 字元、用改寫與來回翻譯打散統計層的取樣痕跡、再把圖檔裡的 C2PA 與 EXIF 拔光。

同一週還有第三個角色進場:兩位設計師發表了字型 ShieldFont,用連字機制讓網頁原始碼放的是錯的字、螢幕上畫出來才是對的,人讀正常、爬蟲抓到垃圾,上線沒幾天 GitHub 上就出現了專門破解它的 shieldbreaker。

三件事拼起來是同一個問題:網路上「這段內容從哪來、是誰做的」正在同時被加固和被拆解,而且拆解的速度看起來更快。Agentic Web Index 掃了 5,000 多個網站,發現 35% 的流量是 bot,ClaudeBot 佔 AI 爬蟲的 27.1%,同時有人正冒充 ClaudeBot 的身分去掃 .env、.aws/credentials 這些路徑。標記、洗標記、偽造標記,今天全部出現在同一天。

必讀#

  1. Tailscale 追出 SQLite 潛伏 16 年的 WAL-Reset bug — Hacker News Dev
  2. DeepSeek V4 Pro 0813 悄悄上線 OpenRouter — Hacker News AI
  3. Zed 推出 Delta:人跟 agent 在同一個 thread 裡平起平坐 — Hacker News Dev
  4. Qwen3.8-2.4T-A95B 開源:2.4 兆參數、只啟用 950 億 — Hacker News AI
  5. GitHub Agent Plugins 1.0:五家大廠一起訂的外掛標準 — GitHub Tools
  6. Anthropic 為 Claude 產出加隱形浮水印,使用者炸鍋 — TechCrunch AI
  7. watermarks-remover 登上 GitHub 本週新專案第一 — GitHub Tools
  8. ChatGPT 廣告擴張到英國、墨西哥、巴西、日本、南韓 — OpenAI AI
  9. AI 正在移除軟體工程的中產階級 — Hacker News AI
  10. ShieldFont:一款讓爬蟲讀到亂碼的字型 — Ars Technica Tools
  11. Gowers:LLM 到底擅長哪一種數學 — Hacker News AI
  12. 35% 的網路流量是 bot,而且有人在冒充 ClaudeBot — Hacker News Security
  13. Vercel 幫 AI SDK 蓋了一座軟體工廠 — Vercel Dev
  14. Grok 4.6 追平 GPT-5.6 Sol 的綜合智力指數 — Hacker News AI
  15. Twitch 預設拿實況內容訓練 Amazon AI,要自己去關 — The Verge AI

1. Tailscale 追出 SQLite 潛伏 16 年的 WAL-Reset bug#

Tailscale 的資料管線在讀 S3 備份時跑 PRAGMA integrity_check,發現資料庫壞掉。往回追,半年內累積了 19 起損毀事件,散在多個 shard 上。根因是寫入交易與 WAL checkpoint 之間的一個競態:在某個特定時間點寫入,系統會誤以為某些 page 已經從 WAL 複製回主檔,實際上沒有,結果是永久資料遺失加索引損毀。這個 bug 在 SQLite 裡至少躺了 16 年。

  • SQLite 核心開發者做了一個叫 tmstmpvfs 的除錯 shim 才把競態隔離出來,最後在 checkpoint 函式裡加了一道檢查,抓「不該發生的 WAL reset」
  • 修正落在 SQLite 3.51.3(3.52.0 曾發布後撤回)
  • Tailscale 那邊補的是流程:更積極的自動備份、可決定性重放的交易日誌管線、以及在偵測到疑似損毀時就先打警告

💡 為什麼重要:SQLite 是全世界部署最廣的資料庫,「無聊、穩定、不會出事」是它的招牌。這件事說明的不是 SQLite 不可靠,而是當你用非標準的方式去跑它(Tailscale 的用法是高併發控制平面),那些十幾年沒人踩到的角落就會變成你的。

🔗 閱讀原文 | 來源: Tailscale

2. DeepSeek V4 Pro 0813 悄悄上線 OpenRouter#

DeepSeek 又出了一版,但這次沒有公告頁、沒有部落格文章,只是模型直接出現在 OpenRouter 上。開發者社群當天就炸開。規格是 MoE 架構,104 萬 token 的 context window、最多 38.4 萬 token 輸出,價格 0.435 美元/百萬輸入 token、0.87 美元/百萬輸出 token。

  • 是否會照慣例釋出開源權重,目前沒有任何官方說法
  • Simon Willison 用他招牌的「騎腳踏車的鵜鶘」測了一輪,發現這個模型在低/中/高三種推理強度下畫出來的差異特別大,是他測過的模型裡少見的
  • Vercel 的 AI Gateway 同日把 deepseek-v4-pro-0813 接上更新後的權重

💡 為什麼重要:百萬級 context 加上這個價格帶,等於把「長文件整批丟進去」這件事的成本再往下壓一階。對做 RAG 或長對話產品的人來說,這直接改變架構選擇:以前要花力氣切 chunk 的東西,現在可能直接塞。

🔗 閱讀原文 | 來源: OpenRouter

3. Zed 推出 Delta:人跟 agent 在同一個 thread 裡平起平坐#

Zed 的 Nathan Sobo 發表了 Delta,而且刻意說清楚:這是一個全新的獨立應用程式,不是 Zed 的新功能。理由是「要在數十萬每日使用者底下重建 Zed 的地基,等於打斷他們每天賴以工作的流程」。Delta 想解決的是以 commit 為單位的協作會流失脈絡:註解過期、意圖埋進 diff 裡。

  • 核心是 DeltaDB,一個把對話與 worktree 即時同步給所有參與者的複寫式資料庫,跟既有 git repo 相容,抓的是 commit 與 commit 之間的編輯
  • 人可以在程式碼行、對話步驟、甚至 agent 的思考區塊上留言,agent 看得到意見具體指向哪裡
  • 原生支援 macOS/Windows/Linux,另外編成 WebAssembly + WebGL,瀏覽器不用安裝就能開共享 thread;可接第三方 agent,包含 Claude Code。目前私測,滾動發邀請

💡 為什麼重要:多數「AI 協作」工具是把 agent 塞進既有的 PR 流程;Delta 反過來,先問「如果 agent 從第一天就是團隊成員,這個工具長什麼樣」。DeltaDB 之後要併回 Zed,所以這其實是 Zed 下一代地基的公開測試場。

🔗 閱讀原文 | 來源: Zed

4. Qwen3.8-2.4T-A95B 開源:2.4 兆參數、只啟用 950 億#

阿里的 Qwen 團隊在 Hugging Face 上放出 Qwen3.8-2.4T-A95B。命名已經把重點講完:2.4 兆總參數,但每次推論只啟用約 950 億,稀疏比大約 25 比 1。

  • MoE 架構,靠稀疏啟用把「總量很大」跟「推論成本可控」拆開
  • 權重公開可下載,可自行微調與部署,不用綁供應商
  • 跟 DeepSeek V4 Pro 同一天上榜,開發者社群當天的討論幾乎都在比較兩者

💡 為什麼重要:這一年中國開源模型的路線很一致:把總參數推高、把啟用參數壓低,用架構換成本。搭配科技新報今天引的那份數據(中國開源模型在每項任務成本上已經領先),這不只是「追上」,是在改變成本曲線的形狀。

🔗 閱讀原文 | 來源: Hugging Face

5. GitHub Agent Plugins 1.0:五家大廠一起訂的外掛標準#

GitHub 宣布 Agent Plugins 1.0 正式發布(規格 8 月 6 日公開),核心維護者名單包含 AWS、Anysphere、微軟、OpenAI、Vercel 與 Google。做法是把 agent skill 跟 MCP server 包成可安裝的 plugin,一次寫好,在所有相容的 agent client 上都能用。

  • 首波支援 VS Code、Copilot CLI 與 Copilot app
  • 用 plugin.json manifest 描述能力,與 MCP server 整合
  • 官方那句話講得很直白:「你現在可以做一次 plugin,然後在所有相容的 agent client 上使用。」

💡 為什麼重要:MCP 解決的是「agent 怎麼接工具」,Agent Plugins 解決的是「這一包東西怎麼發布和安裝」。競爭對手願意共同掛名維護,通常代表大家都認為分裂的成本比失去控制權更高。對寫 skill 的人來說,這是第一次有機會不用為每個客戶端重寫一次。

🔗 閱讀原文 | 來源: GitHub

6. Anthropic 為 Claude 產出加隱形浮水印,使用者炸鍋#

Anthropic 開始在 Claude 的文字輸出裡嵌入隱形記號,動機是符合歐盟 AI Act 的透明度要求。TechCrunch 的報導重點不在技術,在反應:Reddit 上的討論明顯分成兩派。

  • 反對方的說法很具體:「那個只是用 Claude 幫自己重排一段文字的學生,做完之後額頭上就多了一個數位刺青。」
  • 另一種反對意見帶著諷刺:「我不用 Claude 寫東西,但一個會幫你的作品蓋浮水印的 AI,考慮到這些前沿模型的訓練資料是怎麼來的,這件事諷刺得可怕。」
  • 但報導也指出多數留言其實支持,其中一句是:「你會不想要這個,唯一的理由就是你想騙人。」
  • Anthropic 沒有在報導中被引述任何實作細節、時程或退出機制

💡 為什麼重要:這是「AI 內容偵測」從對抗式(事後猜)轉向來源式(產生當下就標)的分水嶺。一旦記號來自源頭而不是猜測,公司跟學校就必須明確講出「哪些用法可以、哪些不行」,因為模糊地帶不再存在。

🔗 閱讀原文 | 來源: TechCrunch

7. watermarks-remover 登上 GitHub 本週新專案第一#

這是本週新建 repo 裡星數漲最快的一個,2,284 顆星,Python 寫的。它把移除工作分成三層:Layer A 清掉隱形 Unicode 字元、雙向文字控制碼、tag 字元與奇怪空白;Layer B 用改寫、來回翻譯、子句重排去打散統計層的取樣痕跡;Layer C 拔掉檔案裡的 C2PA manifest、EXIF、XMP。

  • 支援 PNG、JPEG、SVG、PDF、DOCX、ODT、HTML、Markdown;相依性以標準函式庫為主,選配 c2patool 與 exiftool
  • 明確標示的目標包含 Claude 的 SynthID-Text、Gemini、OpenAI 與開源模型的來源標記;SynthID 的像素浮水印不在範圍內
  • 作者自己講得很白:Layer B 的改寫會傷害文字品質,而且「沒有任何工具能保證廠商的偵測器一定會失效」

💡 為什麼重要:這個專案存在本身就是對浮水印穩健度的公開壓力測試。如果你要靠浮水印做內容認證,Layer B 這種改寫攻擊必須被當成預設威脅模型,而不是邊角案例。靜態的 Unicode 標記,基本上一行指令就沒了。

🔗 閱讀原文 | 來源: GitHub

8. ChatGPT 廣告擴張到英國、墨西哥、巴西、日本、南韓#

這件事要把時間軸講清楚才不會誤讀:ChatGPT 的廣告測試是 2026 年 2 月 9 日在美國開始的,8 月 11 日這次更新是宣布正式在英國、墨西哥、巴西、日本與南韓上線,是第一次進入非英語的主要市場。

  • 適用對象是已登入的成年使用者,免費版與 Go 方案;Plus、Pro、Business、Enterprise、Education 不顯示廣告
  • OpenAI 明說廣告不影響回答,廣告主拿不到對話內容、記憶或個人資料,只拿到曝光與點擊的彙總數據
  • 未滿 18 歲的帳戶不投放;身心健康、政治等敏感或受規範主題不投放
  • 免費版可以選擇關掉廣告,代價是每日免費訊息數會變少

💡 為什麼重要:最後那一條才是重點。「關掉廣告就少用一點」等於把注意力明碼標價成用量額度,這是 ChatGPT 第一次公開把免費使用者的價值換算給你看。台灣目前不在名單上,但按這個節奏應該不會太久。

🔗 閱讀原文 | 來源: OpenAI

9. AI 正在移除軟體工程的中產階級#

Florian Herrengt 這篇在開發者社群引爆了今天最長的討論串。他的開場是一個很具體的畫面:2020 年你休假回來看到程式碼一團亂,你還修得回來;2026 年是一個普通的星期一早上,七個 PR 等你審,第一個打開來是加了 24,506 行、刪了 3,938 行。

  • 他的論點不是初階工程師被取代,是「速度限制」被拿掉了。以前一週能推的量有上限,慢本身就是一種紀律,爛決定擴散不了那麼快
  • 他點名的具體症狀:為了方便而反正規化資料庫、沒有證據就加 Kafka 或 serverless、agent 迴圈沒人看著就一直跑
  • 最悲哀的部分是,這樣做出來的東西「在外行眼裡是會動的」,於是就一直做下去,直到沒有人知道任何東西是怎麼運作的

💡 為什麼重要:這篇的結論不是「AI 讓寫程式民主化」,而是相反:AI 把能力差距放大了。實作變便宜之後,瓶頸整個往上移到架構判斷跟技術溝通。他那句「你領的薪水是拿來做好決定的」,其實是在說一件很不舒服的事:如果你的價值主要來自把票寫成程式碼,那個價值正在快速貶值。

🔗 閱讀原文 | 來源: Hacker News

10. ShieldFont:一款讓爬蟲讀到亂碼的字型#

設計師 Isaque Seneda 與 Gabriel Abrucio 發表了 ShieldFont,機制是把「連字」這個排版功能拿來做別的事。一般字型用連字把相鄰字母合成更好看的形狀;ShieldFont 拿它整個換掉單字。網頁原始碼裡放的是一組被改過的、無意義的文字,只有在字型引擎把頁面畫到螢幕上的那一刻,才會替換成正確的內容。

  • 結果是:人看到的是完全正常的文章,直接下載原始碼的爬蟲拿到的是一份改過的版本
  • 兩人在白皮書裡把定位寫成「給網頁發布者一個實際可行的 AI 訓練退出機制,並在這個選擇被忽視時破壞被收集到的內容」
  • GitHub 上 isaqueseneda/shieldfont 目前 367 顆星;同時已經出現 Sekinal/shieldbreaker(專門偵測與還原被 ShieldFont 汙染的文字)與 Firsak/shieldfont-measured(實測代價與破口,副標直接說「為什麼私有替換字典救不了它」)

💡 為什麼重要:這是 robots.txt 失效之後的下一步:從「請不要抓」變成「抓了也沒用」。但破解專案在幾天內就出現,也說明這類防禦的半衰期非常短。真正要注意的是副作用:螢幕閱讀器、複製貼上、搜尋引擎索引拿到的都是原始碼那份,也就是壞掉的那份。

🔗 閱讀原文 | 來源: Ars Technica

11. Gowers:LLM 到底擅長哪一種數學#

Fields 獎得主 Timothy Gowers 在 OpenAI 宣稱「解決了十個重大數學問題」的幾天後寫了這篇。他的切法不是「LLM 行不行」,而是「哪一類問題的結構對它有利」。

  • 他的答案是:當證明過程帶有機率性、最好的方法就是「試很多不見得多新穎的想法,試到某個點運氣好中了」,LLM 就有優勢
  • 它們弱的地方是需要狠狠剪枝的搜尋樹,也就是數學家那種說不清楚的「聞得出哪個方向有進展」的能力
  • 對 OpenAI 那批結果,他的評價很克制:非 sofic 群那個對他來說比較像「第一個例子」而不是反例,因為專家本來就沒那麼相信所有群都是 sofic;Ramsey 那個超指數界限對某些人是驚喜,但他自己本來就預期是超指數
  • 他給的判準很漂亮:「LLM 真的達到人類水準的好徵兆,會是它們開始用那種新穎、令人驚訝、但事後回頭看又美麗自然的方法證明定理。」

💡 為什麼重要:這是一個具備完整判斷力的內行人,對 AI 能力做出的細緻切分,而不是站隊。這個框架可以直接搬到任何領域用:問「這是把已知方法加速了,還是產生了新的洞見」。前者很有價值,但兩者不是同一件事。

🔗 閱讀原文 | 來源: Hacker News

12. 35% 的網路流量是 bot,而且有人在冒充 ClaudeBot#

Agentic Web Index 掃了 5,000 多個網站,公布了一組數字:整體 35% 的流量是 bot,其中 ClaudeBot 佔所有 AI 爬蟲流量的 27.1%,是量體最大的。但真正的重點在後半段。

  • 有一個大規模的活動正在偽造 user-agent 冒充 AI bot(Googlebot 佔偽造流量 0.5%、ChatGPT-User 0.1%),目的是掃描漏洞
  • 掃描目標很明確地針對 AI 開發工具會留下的路徑:.aws/credentials、Firebase 金鑰、Anthropic/Claude/OpenAI 的設定檔、.env、secrets.json、Terraform state、Docker 設定、.npmrc
  • 防禦方法是不要相信 user-agent 自稱的身分,改用 IP 驗證或 Web Bot Auth 標準比對

💡 為什麼重要:很多站點對「知名 AI 爬蟲」是放行的,這個信任現在被拿來當成攻擊面。而攻擊者挑的路徑清單本身就是一份提醒:這幾年我們把一堆憑證放進了專案目錄,因為 agent 需要讀得到。

🔗 閱讀原文 | 來源: Agentic Web Index

13. Vercel 幫 AI SDK 蓋了一座軟體工廠#

到 2026 年 6 月,Vercel 維護的 AI SDK 累積了一千多個未處理 issue。他們的解法不是丟一個萬能 agent 進去,而是拆成一條專職流水線:分類、分析、實作、審查、backport、寫文件各自獨立。

  • 四週內未處理 issue 從 1,022 降到 844,bug 類約減少 25%
  • 目前每週合併的 PR 裡有 25% 到 35% 是這條流水線產出的,issue 關閉率 70% 到 80%,v6 發布線超過一半的合併是它做的 backport
  • 基礎建設是 GitHub webhook 進處理佇列、跑在 Vercel Sandbox 裡、加上防資料外洩的網路防護;審查資源按風險分配,文件與小 bug 走快線,新 API 與安全相關的留給人深看
  • 他們寫的那句話是整篇的重點:人類的當責,仍然是 agentic 工程裡信任的核心

💡 為什麼重要:這是目前少數把「agent 開發流水線」講到有數字、有失敗模式、有邊界的公開案例。跟同一天 PostHog 那篇談「軟體工廠可不可行」放在一起看特別有意思:一邊在辯論可行性,一邊已經在報四週的數字了。

🔗 閱讀原文 | 來源: Vercel

14. Grok 4.6 追平 GPT-5.6 Sol 的綜合智力指數#

xAI 在 8 月 12 日發布 Grok 4.6,在 Artificial Analysis 的綜合智力指數上拿到 61 分,與 GPT-5.6 Sol 打平。訓練重點放在長時間運行的 agent 與視覺/互動工作。

  • 分項:CursorBench 3.2 拿 69.9%、DeepSWE 1.1 拿 65.9%、FrontierCode 1.1 拿 61.3%、APEX-Agents 拿 57.5%
  • 價格 2 美元/百萬輸入 token、6 美元/百萬輸出 token,fast 版本雙倍;首週免費用量加倍
  • 上架通路很廣:Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflare

💡 為什麼重要:分項落差說明了它的形狀,編碼類(CursorBench 69.9%)明顯強過多步驟 agent 任務(APEX-Agents 57.5%)。如果你的工作流偏「一次寫一段程式碼」,值得拿首週免費額度實測;如果偏長鏈條的自主任務,先別急著換。

🔗 閱讀原文 | 來源: xAI

15. Twitch 預設拿實況內容訓練 Amazon AI,要自己去關#

Twitch 開放了退出機制,讓實況主可以選擇不讓自己的內容被拿去訓練 Amazon 的 AI。重點是「開放退出」這四個字:預設是開啟的,而且這件事已經進行了兩年以上。

  • 涵蓋範圍包含 VOD、精華片段、聊天室內容、頻道圖片與文字
  • 設定位置在帳號設定裡,要自己去找、自己去關
  • 同一天 TechCrunch 與 Ars Technica 都報了,切角一致:不是「新增了用途」,是「終於讓你能拒絕」

💡 為什麼重要:跟今天的浮水印主題是同一枚硬幣的另一面。平台在你的產出上蓋章這件事會被討論很久,但平台把你的產出拿走這件事,多數人是在退出選項出現的那天才知道。預設值就是政策。

🔗 閱讀原文 | 來源: The Verge

推薦閱讀#

中文技術圈#

開源精選#

本週新建 repo,依 Star 排序。

ShawnPana/phone-harness — Python | ⭐ 1,635 讓你的 agent 直接操控手機。

oil-oil/oil-motion — Python | ⭐ 1,611 做流暢、有回饋感的網頁互動動畫。

antirez/h3.c — C | ⭐ 1,588 Redis 作者 antirez 手寫的 MiniMax H3 Mac 推論引擎。

SMNETSTUDIO/WeChat-AI — TypeScript | ⭐ 1,519 微信 AI 整合。

Flaminis/Dalaran — Rust | ⭐ 887 機器人優先的多模態時序資料視覺化,ROS 2 原生,可讀既有 .rrd 錄檔,Rerun 的硬分支。

MengTo/kage — HTML | ⭐ 859 用 Three.js 即時渲染的京都山寺夜行,五個章節。

sohaibdevv/youtube-music — TypeScript | ⭐ 850 輕量、無廣告的 YouTube Music 串流客戶端,支援背景播放與自訂播放清單。

SaladDay/pi-from-scratch — TypeScript | ⭐ 752 600 行 TypeScript 寫出的迷你 pi-agent,從零理解 agent 怎麼運作。

gvzdv/claudish-to-english — Shell | ⭐ 619 把「Claude 腔」的英文改寫成人話。

sv-number/mcp-server — JavaScript | ⭐ 594 讓 agent 在 200 多國申辦私人門號並讀取簡訊驗證碼的 MCP server。

影音精選#

MIT 蹲點 3 天:機器人炒作比你想的更誇張#

2 天前 · Fireship

Fireship

主持人在 MIT CSAIL 待了三天訪談機器人研究者。結論跟矽谷的 demo 影片有落差:不需要靠 demo 募資的學者認為,能取代家事幫傭的機器人至少還要十年以上。

  • Gemini Robotics 2 用單一 VLA(視覺-語言-動作)模型控制人形機器人全身,包含腿、軀幹、手臂與手指
  • 行走與翻跟斗已算解決,手部靈巧操作仍是未解難題
  • 多數展示「多指靈巧操作」的 demo,細看說明都藏有限制或誇大

Chelsea Finn 談機器人技術最前沿現況#

1 天前 · Y Combinator

Y Combinator

Physical Intelligence 共同創辦人 Chelsea Finn 在 YC Startup School 的分享。過去一年機器人已經能洗油膩的鍋子、削紅蘿蔔、做起司三明治,她認為機器人正在進入自己的「GPT 時代」。

  • 強化學習讓任務吞吐量提升 2 倍,而且能從失敗中自我改進
  • 可自主連續運作長達 13 小時
  • 通用模型的表現已經能打敗針對特定任務微調的專用模型

Meta 新模型想深入取得你的個人生活資料#

1 天前 · Fireship

Fireship

Meta 發布 Muse Glimmer,300 億參數、Apache 2.0 完全開源、小到能在一般消費級 PC 上跑的代理型模型。影片的切角是隱私:官方強調 agent 需要「深度存取」個人情境,這句話本身值得停下來想。

  • 從先前閉源的 Muse Spark 蒸餾而來,是 Llama 4 基準爭議之後的開源復出之作
  • 量化後約 17GB,Ollama、LM Studio、llama.cpp 都能直接接
  • 強調 agent 需要深度存取信箱、行事曆等個人資料

Skill 描述其實是觸發關鍵字,不是說明文件#

2 天前 · Theo (t3.gg)

Theo (t3.gg)

一個很實際的提醒:寫 AI skill 的 description 時,應該把它當成「觸發用的關鍵字」而不是「完整功能說明」。

  • description 不論 skill 有沒有被呼叫都會被載入 context,塞太多細節就是在浪費它
  • 反面案例是 description 寫得太完整,導致模型根本不需要真的呼叫該 skill 就能拿到資訊
  • 這個設計意圖被浪費掉的情況,在社群裡比想像中常見

用 3 個字的 Prompt 指揮 34 個 AI 代理人#

1 天前 · Greg Isenberg

Greg Isenberg

訪談 Allie K. Miller(曾任職 IBM、AWS,管理過數十億美元 AI 業務)。她目前用一個 34 個代理人的團隊經營業務,核心 prompt 只有三個字:do smart things。

  • 這三個字能用,前提是建立在完整的商業情境之上,而不是逐一下指令
  • 團隊架構是一位 AI 幕僚長加上 6 位以《六人行》角色命名的 AI 總監
  • 靠每日口述日記把散落在會議外的情境餵進去,已累積超過 80 則;子代理人多用小模型,重活才交給大模型

大企業為何不信任前沿 AI 模型#

1 天前 · 20VC

20VC

OpenRouter 執行長 Alex Atallah 提出一個反直覺的觀察:美國企業對閉源前沿模型的疑慮,往往比對中國開源模型還大。

  • 原因是資料政策不透明,企業搞不清楚 prompt 被送到哪裡、誰能存取、怎麼儲存
  • 關鍵痛點是無法自架在自己機器或指定供應商上執行
  • 這種不確定性會被企業直接當成風險訊號

Seedance 2.5 實測:神級效果與一個致命缺陷#

2 天前 · Matt Wolfe

Matt Wolfe

實測全球上線的 Seedance 2.5,測了首尾幀、多重參考圖、聲音複製與完整影片編輯。有些成果很驚人,但老問題還在,而且最大的問題是價格。

  • 720p 五秒影片實測約 1.15 美元,比 Seedance 2.0 貴約 52%
  • 傳送瞬移、物件消失、語言錯誤、物理失真等舊問題仍未解決
  • 開源的 MiniMax H3 每秒成本僅 8 美分,遠低於 Seedance 2.5 的 17 美分

多數 AI Router 為何注定會落後#

2 天前 · 20VC

20VC

同一位受訪者談做 router 這件事。他認為很多公司做 AI router 只是因為「這很時髦」,而這種心態一開始就把公司放在模仿而不是求勝的位置。

  • 跟風做的團隊,進度會落後全職投入者好幾個月
  • 半調子的路由服務反而削弱使用者的槓桿
  • 核心價值是讓用戶存取更多模型、降低對單一模型的依賴

Circleback CEO:公司該多錄會議的理由#

2 天前 · Y Combinator

Y Combinator

YC W24 校友、Circleback 共同創辦人 Ali Haghani 分享 AI 會議筆記的非典型用法。

  • 不只記錄與指派待辦,還能串接 CRM、Slack 自動更新資訊
  • 團隊可以像查詢公司大腦一樣,查詢所有歷史對話紀錄
  • 他也談到哪些事情不會授權給代理人自主執行

AI 為何可能成為史上最大的市場#

2 天前 · 20VC

20VC

Alex Atallah 的市場觀點:不會有單一公司獨佔 AI 市場,因為即使企業訓練自己的專屬模型,生態系裡其他人也在用新資料訓練新模型。

  • 企業自訓模型仍須持續嘗試、合併其他模型才能維持水準並降低成本
  • 他認為 AI 會是科技史上、甚至人類史上最大的單一市場
  • 建議企業專精某個對自己最重要的細分領域,而不是追求全面通用

今日觀察#

今天最能說明我們處境的,不是任何一則新聞本身,而是它們出現的時間差有多短。Anthropic 為了符合歐盟 AI Act 開始在 Claude 的產出裡蓋章,同一週 GitHub 上漲最快的新專案就是把章洗掉的工具;ShieldFont 發表沒幾天,專門破解它的 shieldbreaker 就出現在 GitHub 上;Agentic Web Index 一邊統計 ClaudeBot 佔了 AI 爬蟲流量的 27.1%,一邊發現有人正冒用這個身分去掃別人的 .env。防禦與繞過現在幾乎是同步發生的,沒有誰能靠一個技術措施撐超過一季。有意思的是,Vercel 那篇談 agent 流水線的文章,反而在最技術的地方給出了最不技術的結論:人類的當責,仍然是 agentic 工程裡信任的核心。這大概是今天所有事情共同指向的地方——當每一種機器可讀的記號都能被機器洗掉,最後真正還撐得住的,是有一個具體的人願意在後面簽名。


覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有