Anthropic 發表前沿 AI 開發節奏量測工具:三項指標與意義
2026年09月29日
Anthropic 發表三項 AI 開發量測指標,揭示 26% 研發由 AI 主導、30,000 個代理同時運作等內部數據。本文拆解指標意義、量測結果與外界疑問。
Anthropic 在 9 月 17 日公開了三項量測工具,用來回答一個過去只有業界內部看得到的問題:前沿 AI 實驗室到底用多快的速度在開發下一代模型。這不是產品發布,而是一種把「實驗室內部在發生什麼」攤到檯面上的嘗試。
對一般使用者來說,它不會改變你今天手機上的 AI 應用長什麼樣。但它決定了一件事:未來關於 AI 該不該放慢的討論,究竟有沒有資料可以依據。以下是這三項 Anthropic 指標在量什麼、量出什麼結果,以及它們離「可被外界檢驗」還有多遠。
Anthropic 開發節奏量測工具想解決什麼問題
先講背景。現在外界幾乎看不到 AI 實驗室內部在做什麼:模型怎麼訓練、用了多少算力、有多少工作已經交給 AI 自己完成,這些資訊長期留在公司裡。Anthropic 執行長 Dario Amodei 近來公開呼籲同業協調放慢前沿開發的節奏,而這套量測工具正是那個呼籲的配套:如果沒有人能從外部看到開發速度,所謂「放慢」就無從驗證。
這套 AI 開發量測框架聚焦在「模型是怎麼被造出來的」,而不是「模型能做到什麼」。後者由 Anthropic 既有的風險報告處理,前者才是這次新增的部分。兩者互補:把投入(算力、自動化程度)和產出(能力)放在一起對照,才有機會看出趨勢。
Anthropic 的說法是,當世界考慮為前沿開發定節奏時,應該盡可能縮小「實驗室知道什麼」與「公眾知道什麼」之間的落差。量測、公開、讓社會有機會決定怎麼使用這些資訊,是它列出的三步。
第一項 Anthropic 指標:AI 主導的研發比例
第一項量的是「多少前沿 AI 研究工作其實是 AI 自己做的」。Anthropic 建了一個原型指數,先把公司內部的 AI 研發工作逐項分類,再評估每一項目前的自動化程度,最後彙總成分數。
評估用的是一套由 Epoch AI 開發的自動化等級量表,從 AL0(完全沒有 AI 參與)到 AL5(AI 完全自主、沒有人在中間)。中間的 AL3 叫「AI 協作」,指 AI 能在人類密切指導下完成大塊工作;AL4 叫「AI 主導」,指 AI 能依一句高階提示把任務幾乎做完,人類只負責監督。
截至 2026 年 8 月,量測結果是這樣:Claude 在任何一個被量測的 AI 研發子領域都還沒有達到完全自主;Claude 在 26% 的 Anthropic AI 研發工作中處於「主導」狀態;達到或超過「AI 協作」的工作比例超過九成。
這組數字的意義在於它把抽象的說法變具體。超過九成的研發工作已經有 AI 大量參與,而四分之一左右的工作人類只是下指令和監督。這也是為什麼 Anthropic 會把「遞迴式自我改進」列為關注對象:當 AI 幾乎包辦造出下一代 AI 的工作,人類要理解或控制這些系統就更難。
第二項 Anthropic 指標:AI 智慧代理的監督機制
第二項量的是「人類對 AI 智慧代理的監督跟不跟得上」。Anthropic 內部已經有大量工作交給半自主的智慧代理,這些代理還會把任務再分包給彼此。截至 2026 年 8 月,在其中一個最常用的內部系統上,任何時刻大約有 30,000 個代理在做研究與工程工作,而這組量測只涵蓋這個系統。
監督分三種指標。覆蓋率指一個代理的動作有多少比例會經過監控器:線上監控器在動作執行前就檢查,100% 的動作都會先過這一關;離線監控器則在動作發生後讀取紀錄,同樣是 100% 收錄。
審查延遲量的是從動作發生到被審查的時間。自動審查在動作前完成,被人類擋下的動作會在一週內完成覆核。監控器每週標記大約 10 萬筆對話紀錄,交由多個分類器過濾誤報並做初步審查,其中最高優先的大約每週 50 筆會升級到人工審查。
封鎖與升級率則量代理活動被擋下或標記的比例。Anthropic 分析了 2026 年 8 月超過十億筆來自研究與工程代理的決策,其中 0.002%(約每 47,000 筆有 1 筆)被監控器封鎖,而被標記待審的約為每一千筆中的一到兩筆。
Anthropic 指標為什麼值得關注:代理監督的規模問題
把第二項單獨拉出來看,會發現它回答了一個很實際的問題:當代理數量從幾十個變成幾萬個,罕見的失誤就不再罕見。
Anthropic 自己也提到,就目前的監控資料來看,個別代理很少出現不當行為。但當經濟裡有數百萬甚至數十億個代理在運作,即使機率極低的事件也會規律發生。這正是為什麼監督要同時處理兩件事:擋住單一代理的立即危害(例如把模型權重複製出去),以及偵測只有在大量代理之間才會浮現的慢速問題(例如失準的早期跡象)。
對正在考慮把手上的工作交給 AI 代理的使用者,這組數字的用途是提供一個參照:監督不是「有或沒有」,而是覆蓋率、反應速度與攔截率三件事的組合。
第三項 Anthropic 指標:算力分配與安全性投入
第三項量的是「開發能力的燃料用在哪裡」。Anthropic 把一段時間內的所有工作量分類,再看流向 AI 研發的算力裡有多少是安全性工作。
在受檢視的那一週(7 月 13 日至 7 月 20 日),流向 AI 研發的算力裡約 6% 用於安全性工作;流向 AI 驅動的 AI 研發的算力裡,約 12% 用於安全性工作。
Anthropic 強調這是刻意保守的估計。例如一筆詞元如果同時推進能力與安全性,就不會計入;這組數字也不包含安全防護用的分類器,那部分另外佔了相當的算力。之所以說算力只是粗略指標,是因為安全研究本質上耗的是研究人員設計實驗的時間,而不是實驗本身的算力。
這一項對「AI 發展速度」的意義在於:算力是最容易驗證的投入之一,因此未來若要協調放慢開發,算力分配很可能是政策槓桿。若業界同意提高安全性工作的算力比例,這個指標就能拿來對照各家是否真的照做。
Anthropic 開發節奏量測工具的限制與外界的疑問
把三項放在一起看,這套工具的長處是具體:每一項都給了數字、方法和量測期間,而不是含糊的說法。短處也同樣明顯。
第一,跨實驗室比較還做不到。目前沒有通用方法,各家量測的口徑不同;更關鍵的是,Anthropic 是用自家模型去評估自家系統,扮演「評審」的模型可能和被檢查的模型犯同一類錯誤。
第二,自願申報的可信度取決於公司。安全研究和能力研究本來就難以區分,每家開發者都會傾向把界線畫得寬一點。Anthropic 指出,舉證責任應該落在開發者身上,去證明某項工作確實與安全相關。
第三,驗證機制還在建。Anthropic 研究所表示計畫引入多個獨立的外部評估機構進駐,讓他們接觸內部流程、系統與資料,並由外部機構驗證安全實務、回報事件、監控這類關鍵指標。過去 METR 曾獨立對其離線監控系統做紅隊測試,但把這種驗證常態化,仍需要時間。
結語:把 Anthropic 量測工具當成 AI 發展速度的起點,而不是答案
Anthropic 這套前沿 AI 開發節奏量測工具的價值,是讓「AI 發展速度」從一句口號變成可以被討論的數字。26% 的研發工作已由 AI 主導、30,000 個代理同時運作、約 6% 的研發算力投入安全,這些是它願意公開的內部切片。這些數字目前還不能跨實驗室比較,也還沒有獨立稽核,把它當成趨勢的起點合理,當成定論則太早。
對關心這個議題的讀者,實際可做的是追蹤這些指標後續怎麼更新、外部驗證有沒有真的落地。想了解 AI 應用最新發展、掌握相關工具與資訊的讀者,可以下載 APKPure 應用程式,隨時查閱最新的 AI 相關報導與應用更新。真正值得觀察的是 10 月之後有沒有更多實驗室跟進公開同類數據,那才是這套量測能不能成為業界標準的關鍵。
補充說明: 本文數據來自 Anthropic 於 2026 年 9 月 17 日發布的量測說明,量測期間與結果以官方原始文件為準。