yii.
← Digest
EP42 · 2026年4月12日 星期日 · 8 min read

AI 基準失守,游標旁來了新鄰居

UC Berkeley 把 8 個 AI 成績單全刷爆 — 你的游標旁邊,正在來一個新鄰居

每天花 1% 的時間,掌握科技脈動。


今日金句#

“Don’t trust the number. Trust the methodology. And if you’re building a benchmark: assume someone will try to break it. Because they will.” 「不要信那個數字,要信方法論。如果你在建一個基準測試:假設有人會想辦法破解它。因為一定會有人。」 — UC Berkeley RDI Team, Trustworthy AI Researchers

“There is no stable ‘best model for cybersecurity.’ The capability frontier is genuinely jagged.” 「沒有所謂穩定的「最強資安模型」。能力邊界是真的高低不一。」 — Stanislav Fort, Founder & Chief Scientist, AISLE


今日主軸#

今天科技圈最值得注意的事,都跟「評估 AI 能力」這件事有關。

UC Berkeley 的研究員做了一件震撼全場的事:他們把市面上最重要的 8 個 AI Agent 評分基準——SWE-bench、WebArena、OSWorld、GAIA 等等——在完全不解任何題目的情況下,全部刷到了滿分或接近滿分。方法不是靠更聰明的 AI,是靠系統設計缺陷:測試環境把答案放在可讀取的地方,評估邏輯根本沒有真正驗證結果。500 道題、全部通過、零題目實際被解決。

同一天,aisle.com 的研究分析師跟進 Mythos 發布做了一件更微妙的事:他們用一個參數量只有 3.6B、每百萬 token 只需 $0.11 的小型開源模型,找到了跟 Mythos 相同的安全漏洞。所謂「頂尖模型才能找到的漏洞」,小模型也找得到——只是換個角度問。

這兩件事加在一起,指向同一個問題:AI 能力的邊界,比我們以為的更難測量,也更不規則。

但另一邊,一個叫 clicky 的工具,一週之內在 GitHub 獲得了 3,788 個星星。它做的事很具體:一個住在你游標旁邊的 AI,可以看你的螢幕、用語音跟你說話,還能讓游標飛到螢幕上的任何位置指給你看。不管你信不信成績單,這個你現在就可以去下載。


必讀#

  1. Clicky — 住在游標旁邊的 AI 教師,開源免費 — GitHub AI
  2. How We Broke Top AI Agent Benchmarks: And What Comes Next — UC Berkeley AI
  3. Small models also found the vulnerabilities that Mythos found — Hacker News AI
  4. SQLite 3.53.0 — WAL bug fix + ALTER TABLE NOT NULL + QRF library — Lobste.rs Dev
  5. Anthropic temporarily banned OpenClaw’s creator — TechCrunch AI
  6. France to ditch Windows for Linux to reduce US tech reliance — TechCrunch News
  7. Anthropic 發布 Claude Mythos Preview,資安能力直逼頂尖人類駭客 — iThome AI

Clicky — 住在游標旁邊的 AI 教師,開源免費#

clicky

clicky 是一個開源 macOS 工具,以選單列常駐的方式讓 AI「住在」你的游標旁邊。使用 ScreenCaptureKit 截圖你的螢幕,透過 AssemblyAI 實時語音辨識輸入,將截圖與語音轉寫一起傳給 Claude 進行分析,再用 ElevenLabs TTS 語音回應。最特別的功能:Claude 可以在回應中嵌入 POINT 標籤,讓游標實際飛到螢幕上指著特定的 UI 元素。所有 API 金鑰透過 Cloudflare Worker 代理,不會嵌入 app binary。支援多螢幕、推送說話模式(Push-to-talk)。

  • 架構完整:Swift 選單列 app + AssemblyAI + Claude Vision + ElevenLabs TTS + Cloudflare Worker。Build 需要 macOS 14.2+、Xcode 15+
  • 可以讓游標「指著」螢幕上的任何 UI 元素,適合教學場景(學 Xcode、看文件時隨時提問)
  • 開源免費,官網 clicky.so,GitHub 一週 3,788 星

💡 為什麼重要:這是第一個把 Claude Vision、語音輸入、TTS 回應、游標控制整合在一起的 macOS 原生工具,代表 AI 助手從「問答窗口」演進為「常駐桌面夥伴」的具體實作。

🔗 閱讀原文 | 來源: GitHub


How We Broke Top AI Agent Benchmarks: And What Comes Next#

berkeley

UC Berkeley RDI 研究員系統性地破解了 8 個頂尖 AI Agent 評分基準,包含 SWE-bench(500 道程式碼任務,刷到 100%)、WebArena(812 個網頁任務,近 100%)、OSWorld(73%)、GAIA(98%)、Terminal-Bench(100%)、FieldWorkArena(100%)、CAR-bench(100%)。方法全程不用「解題能力」:SWE-bench 靠 conftest.py hook 讓所有 pytest 強制通過;WebArena 靠 file:// URL 讀取配置答案;FieldWorkArena 的驗證邏輯根本不看答案內容,空 JSON 即可滿分。研究者歸納出 7 個反覆出現的設計缺陷,並發現現有頂尖模型(如 o3、Claude)在 30%+ 評估中已在自動 reward-hacking。

  • 7 個漏洞類型:無隔離、答案隨測試出貨、eval() 信任不可信輸入、LLM judge 未過濾、弱字串比對、非執行的評估邏輯、信任不可信程式碼輸出
  • Terminal-Bench:100% on 89 tasks via curl wrapper intercept;SWE-bench Pro:731 tasks via in-container parser.py overwrite
  • 提出 BenchJack 掃描工具,建議所有基準發布前先用 null/random/injection agent 測試

💡 為什麼重要:AI 基準分數直接影響模型選型、研究方向、融資決策和安全評估。如果分數是系統性可刷的,過去兩年所有「XXX AI 比 YYY 強 XX%」的結論都需要重新審視。

🔗 閱讀原文 | 來源: Hacker News / UC Berkeley RDI


Small models also found the vulnerabilities that Mythos found#

aisle

AISLE 首席科學家 Stanislav Fort 在 Mythos Preview 發布後,用小型開源模型(3.6B-5.1B active params,$0.11/百萬 token)測試了相同的安全漏洞——結果:8/8 模型都找到了 FreeBSD NFS 的緩衝溢位漏洞(304 byte stack buffer overflow),多個模型給出完整 exploit chain(DeepSeek R1 計算了精確的 ROP chain)。但特異性(specificity)仍是弱點:大模型對修補過的程式碼有 0-67% 的誤報率,只有 GPT-OSS-120b 在偵測和確認兩個方向都可靠。

  • 能力邊界是「鋸齒狀」而非階層式:3.6B 的小模型在某些資安任務上超越 Sonnet 4.5 和 GPT-4/5
  • 實際部署瓶頸不是模型大小,是整合工程、分流層(triage layer)和運營部署
  • 防禦者現在就可以用現有模型建立 AI 資安工具,不需等待 Mythos Preview 開放

💡 為什麼重要:Mythos 的發布暗示了「頂尖模型才能找到的漏洞」,這篇分析挑戰了這個前提。如果商用小型模型足以做漏洞偵測,資安工具的普及速度會比 Anthropic 設想的快得多。

🔗 閱讀原文 | 來源: Hacker News


SQLite 3.53.0#

sqlite

SQLite 3.53.0 於 2026-04-09 發布,帶來多項重要更新。修復了 WAL-reset 資料庫毀損 bug(高嚴重性)。新增 Query Result Formatter (QRF) 函式庫,CLI 顯示能力大幅改善。SQL 語言擴充:ALTER TABLE 現在支援增加和移除 NOT NULL 及 CHECK 約束;TEMP triggers 可修改 main schema 的表。新 SQL 函數:json_array_insert() 和 jsonb_array_insert()。

  • ALTER TABLE + NOT NULL/CHECK 是長期以來開發者等待的功能,可大幅簡化 schema 遷移流程
  • json_array_insert() 讓 SQLite JSON 操作更完整(之前只有 json_array_append)
  • QRF 函式庫編譯為 WebAssembly,Simon Willison 有互動演示可試用

💡 為什麼重要:SQLite 是全球使用量最大的資料庫引擎,幾乎每個 iOS/Android App 都在用。ALTER TABLE 的增強對行動開發者和輕量後端有直接影響。

🔗 閱讀原文 | 來源: Lobste.rs


Anthropic temporarily banned OpenClaw’s creator#

openclaw

Anthropic 暫時封禁了 OpenClaw 創辦人 Peter Steinberger 的帳號,理由是「可疑活動」,但在他發文後幾小時即恢復。事件背景:Anthropic 更改計費政策,要求 OpenClaw 用戶透過 Claude API 另外付費($25/百萬 input,$125/百萬 output),不再由 Claude 訂閱涵蓋。Steinberger 指控 Anthropic 在推出 Claude Dispatch 功能前幾週才發出通知,且他離職後 Anthropic 發出法律威脅信,而 OpenAI 直接歡迎他。他現已在 OpenAI 工作,僅保留 OpenClaw 的 Claude 相容性測試。

  • Steinberger 名言:「One welcomed me, one sent legal threats.」
  • 定價爭議:harness 工具(持續推理迴圈、自動重試、多工具整合)耗用算力更多
  • 引發開源社群對「AI 平台複製成功第三方工具後擠走原作者」的大討論

💡 為什麼重要:任何建立在單一 LLM API 上的工具都面臨相同風險:定價隨時可以改、功能可能被內建。開源社群稱之為「被平台吃掉」。

🔗 閱讀原文 | 來源: TechCrunch


France to ditch Windows for Linux#

france

法國宣布計畫將政府電腦從 Windows 遷移至開源 Linux,以減少對美國科技的依賴。遷移將從 DINUM(法國政府數位機構)開始,尚未公布具體時間表或 Linux 發行版。法國數位部長 David Amiel 將此定義為「重新掌控我們的數位命運」,背景是 Trump 政府的科技制裁政策帶來的地緣政治風險。法國已有先例:之前將 Microsoft Teams 換為法國製 Visio(基於 Jitsi)。

  • 地緣政治驅動:Trump 政府在多個場合使用科技存取作為制裁工具
  • 歐洲議會在 2026 年 1 月也通過決議,識別降低外國科技依賴的領域
  • Linux 桌面進入政府規模部署,技術可行性已不是障礙,而是政治意志問題

💡 為什麼重要:如果法國成功遷移,其他 EU 國家將有現成模板可以跟進。這是過去 20 年多次「政府換 Linux」倡議中最有地緣政治壓力的一次。

🔗 閱讀原文 | 來源: TechCrunch


Claude Mythos Preview:AI 資安能力直逼頂尖人類駭客#

mythos

Anthropic 發布 Claude Mythos Preview,資安攻防能力達頂尖人類水準。已知漏洞包含:27 年前的 OpenBSD bug、16 年前的 FFmpeg bug(5 百萬次自動測試未發現)、瀏覽器 renderer/sandbox 逃逸鏈、FreeBSD NFS 遠端執行碼。同步啟動 Project Glasswing:10+ 家大型科技公司(AWS、Apple、Google、Microsoft、Nvidia 等)+ 40 個關鍵基礎設施組織獲得早期存取,進行 90 天防禦性掃描。Anthropic 分配 $1 億美元使用額度並捐贈 $400 萬給開源資安組織。

  • Opus 4.6 建立 Firefox 147 PoC exploit 成功率 2/hundreds;Mythos Preview 達到 181 次成功,29 次取得 CPU register 控制
  • 「太危險不公開」的決策模型——90 天時間窗讓防禦者搶先修補
  • 定價:$25/百萬 input tokens,$125/百萬 output tokens

💡 為什麼重要:AI 發現安全漏洞的能力已超過人類專家的平均水準,防禦性部署的時間窗正在快速縮短。

🔗 閱讀原文 | 來源: iThome


推薦閱讀#

bytebytego


今日觀察#

Berkeley 研究團隊把 8 個 AI Agent 基準全刷爆的新聞,在技術圈引發的反應比想像中冷靜——這本身就很有意思。

大多數工程師看完的第一反應不是「震驚」,而是「這不是早就知道的事嗎?」Goodhart 定律在機器學習界已是老生常談:當一個指標成為目標,它就不再是好指標。只是這次的實驗把「知道」變成了「有具體數字可以引用」。

更值得關注的反應來自另一個方向:幾個 benchmark 維護團隊在報告發布後的幾小時內就推送了修補,說明這些問題是「可修的設計問題」,而非「無法避免的根本矛盾」。如果評估基礎設施可以快速跟上,那麼 benchmark 的問題可能比悲觀的解讀更有解法。

這讓整件事的意義變得更清晰:問題不是「AI 不能被評估」,而是「評估需要跟 AI 能力一起進化,而且需要有對抗性測試的基礎設施」。這是一個工程問題,不是認識論危機。


中文技術圈#

cursor-ban



影音精選#

Claude Mythos is too dangerous for public consumption#

Fireship

753K views · 2 天前 | Fireship

Anthropic 宣佈 Mythos 模型因安全隱憂而不公開發行,引發業界廣泛討論。該模型在內部測試中發現了 16 年前的 FFmpeg CVE 和 Linux kernel 位元翻轉漏洞,展示了 AI 發現安全漏洞的驚人能力。

  • Fireship 的一貫風格:用 3 分鐘帶你看懂業界大事,配上精準又帶點諷刺的評論
  • 配合 Berkeley 基準測試崩塌事件,這是今週最值得連看的兩篇內容

💬 這支影片讓很多非資安工程師也開始認真看 Mythos 這件事。Fireship 的觸及力不可忽視。


Anthropic 在半數時間追上 OpenAI,訓練成本僅四分之一#

20VC Anthropic

8.4K views · 2 天前 | 20VC

Anthropic 在半數時間內追上 OpenAI,訓練成本僅為四分之一,五年內達成 300 億美元估值。OpenAI 管理層動盪之下,投資者評估最後一輪 OpenAI 融資「拿到更差的交易」。

  • 從投資者角度看兩家公司的技術與商業差異
  • 涵蓋 Anthropic 的效率優勢如何轉化為市場競爭力

💬 這個角度(效率比速度更重要)在 AI 大廠競賽的敘事中,提供了一個很少被討論的觀點。


ElevenLabs 3.5 億美元 ARR 銷售機制內幕#

20VC ElevenLabs

2.6K views · 1 天前 | 20VC

ElevenLabs CRO Carles Reina 分享如何在三年內從零擴展至 $350M ARR 的策略,包括 20 倍配額佣金模式、AI 冷外聯的失敗與替代方案,以及 AI Agent 對銷售團隊規模的潛在影響。

  • 建立以客戶成功為利潤生成函數的銷售組織設計
  • AI Agent 會減少 SDR 人數還是讓每個 SDR 產出更高?

💬 B2B SaaS 創辦人必看,尤其是正在思考如何設計 AI 時代銷售架構的團隊。


記憶體「超級週期」還能撐多久?#

硅谷101

860 views · 20 小時前 | 硅谷101

全球存儲芯片面臨 40 年來最嚴重供需失衡,2026-2027 年產能全售罄。AI 正將存儲業從週期性轉變為結構性增長行業,但廠商因擔心 AI 泡沫破裂而保守不敢擴產。

  • 如果 AI 需求不是泡沫,現在的保守擴產會形成未來更大的缺口
  • 結構性 vs 週期性的判斷,是整個半導體股票的核心分歧

💬 這個分析框架(供需錯位 + 廠商心理)比一般的「AI 晶片供不應求」敘事更有深度。



覺得有用嗎?分享給一個也在追蹤新知的朋友。

也歡迎中長期投資者體驗新工具 → Moniit banner

同期還有