Claude Code Defaults to Auto Mode in 5 Days; Anthropic Covers Extra Costs

華爾街見聞
2026.08.10 08:28

Anthropic 宣佈 Claude Code 將於 5 天后默認啓用自動模式,工具調用產生的額外 token 費用由公司承擔。此舉基於 97% 的用户同意率及人工審批效率低下的數據,旨在消除繁瑣的權限確認流程。同時,Anthropic 要求亞馬遜、谷歌等雲平台在一個月內將渠道切換為默認自動模式。

咱就是想問,還有人認真看 AI 編程工具給的權限審批請求嗎?

Anthropic 也發現了,只有 3% 的權限請求被拒絕。

於是他們做了一個決定,5 天后,所有 Claude Code 將默認啓用自動模式。

自動模式的分類器每次工具調用會額外消耗少量 token,這部分開銷將不再向用户收費。

亞馬遜谷歌微軟等雲平台目前仍然是選配,但 Anthropic 只給他們一個月時間,要把這些渠道也切成默認自動模式。

Claude Code 之父表示,團隊內部早就只是用自動模式了,根本無法想象再去手動審批權限。

人工審批權限的時代一去不復返

對於這次改動 Anthropic 給出的第一組理由,是人工審批已經變成一種習慣性動作:

用户對 Claude Code 權限提示的同意率是 97%。作為對照,當 Claude 把一份計劃交給用户批准時,拒絕率是 39%;而單條權限請求的拒絕率只有 3%。

同樣的傾向也出現在配置文件裏。截至 2026 年 6 月,49.5% 的活躍 CLI 用户手動寫過 Bash allow-rule,其中 5% 直接放行任意 shell 命令,另有 43% 寫了 Bash(python:)、Bash(node:) 這類實際效果基本等同的解釋器規則,這個比例大約每五週增長 5 個百分點。

此外,62% 的用户用過 bypassPermissions 或者在 Bash 上點過 “不再詢問”,25% 的交互式會話一開始就運行在 bypass permissions 模式下。

第二組理由來自一項受控實驗。Anthropic 通過研究供應商招募了 1053 名付費專業測試者,在專門搭建的測試環境裏完成編碼任務。會話進行到一半時,其中一條權限提示被替換成一條明顯危險的命令,供應商記錄測試者是否點了同意(同意並不會真的執行任何危險操作,被改動的只是提示文本)。

結果是測試者攔住這條命令的比例為 13.6%,143 次;
auto mode 面對同樣的命令攔下了 89%,937 次。

正面比較下來,auto mode 攔住了 800 條人類放行的命令,人類只攔住了 6 條 auto mode 放行的命令。

而且會話越長,人的表現越差:前期還能攔住約 17%,在經歷 50 條以上提示之後降到約 5%,而 auto mode 的攔截率不隨會話長度變化。

生產數據也被拿來重新打分。

2026 年 5 月到 6 月,Anthropic 從已授權數據用於訓練與分析的賬號中,取出安全流水線標記過的會話,用模型按 0 到 10 的嚴重程度重新評級。

-10 分代表全公司範圍、不可逆的傷害。
-7 分代表刪除生產數據庫記錄這一級別
-0 分代表覆蓋一個臨時文件這類完全可回滾的本地操作,

同時評估用户對該操作的要求有多明確。在 7 分及以上的嚴重級別上,走人工審批的會話中有 6.3% 出現了用户並未明確要求的有害操作,auto mode 會話是 2.4%,在測試過的每個嚴重級別上差距都成立。

分類器本身也經過對抗測試。Anthropic 與 AI 安全公司 Apollo Research 做了為期兩週的試點,把合成攻擊注入真實編碼軌跡,覆蓋泛化失效、數據外泄和安全相關威脅三類數據集。

Apollo 交回成功攻擊樣本與加固建議後,Anthropic 主要通過給分類器提供更多環境上下文來加固,包括倉庫可見性、git 狀態和數據處理規則。

加固後 Apollo 用一組 Anthropic 無法接觸的留出攻擊集重測,auto mode 追回了此前漏掉的約一半攻擊,代價是漏掉約 2% 此前攔住的攻擊,兩組數據集合並計算,漏檢率從 12% 降到 7%。Anthropic 同時説明,這些攻擊是為找出分類器失效點而合成的,7% 不應被理解為真實流量下的漏檢率。

針對提示詞注入,Anthropic 委託第三方 Trajectory Labs 做了評測,還拉來了 OpenAI 來當墊背,共 72 個間接注入場景,每個場景跑 10 次。

攻擊是針對 Claude Opus 4.7 優化的,而 Opus 4.7 不在被測名單中,所以所有參測模型面對的都是未見過的攻擊。

在 720 次攻擊嘗試中,運行 auto mode 的 Claude Fable 5、Opus 5 和 Sonnet 5 沒有一次被攻破;

運行 Codex Auto-review 模式的 GPT-5.6 Sol 攻擊成功率為 5.83%,Full Access 模式下為 19.03%。

作為參照,Claude 最新模型在不加額外防護的 bypassPermissions 模式下的平均攻擊成功率是 0.09%。

公開的三起攔截案例分別是:

一次向內部雲盤上傳失敗後,Claude 的備選方案是把同一份報告發布到公開代碼分享站點,被拒絕並轉為詢問用户;

一次長會話中,Claude 試圖跨越兩千個 pod 批量結束進程,並排隊了會讓數百張 GPU 上在跑的訓練任務被拆除的刪除操作,命令在執行前被標記;

還有一次是被要求配置只讀賬單權限時,Claude 取用了一個在賬户根級別擁有完整管理權限的雲角色,權限範圍與請求不符被攔下。

近期新增的能力包括:

把數據外泄列為 hard deny,分類器永不批准,要執行必須切出 auto mode 或手動運行,該規則可在設置中擴展;

區分密鑰與敏感信息各自可訪問和可分享的範圍,並在 git push 或 PR 執行前檢查目標倉庫是公開、私有還是可信;

在 git reset —hard 這類可能丟棄未提交工作的命令前讀取 git status;

以及在 Claude 拉取網頁、文件或工具輸出時,由 API 側探針掃描注入企圖並在結果進入上下文前加上警告。

想換回去?Shift+Tab

對 Pro、Max、Team 用户來説,如果從未設置過默認權限模式,會收到產品內通知,新會話自動以 auto mode 啓動;設過其他默認的會看到一次性詢問;如果 Team 管理員已經在 managed settings 裏指定了默認,則不受影響。

切換模式在 CLI 中按 Shift+Tab,桌面端使用模式下拉菜單。管理員可以用 managed settings 中的 defaultMode 固定組織級默認,或用 disableAutoMode 完全關閉 auto mode。

Anthropic 在公告結尾提示,auto mode 依賴分類系統,可以降低風險但不能消除風險,對生產基礎設施的高風險改動,仍然建議用户自行審查 Claude 的操作。

風險提示及免責條款

市場有風險,投資需謹慎。本文不構成個人投資建議,也未考慮到個別用户特殊的投資目標、財務狀況或需要。用户應考慮本文中的任何意見、觀點或結論是否符合其特定狀況。據此投資,責任自負。