Anthropic 将 Claude Code 默认切换至自动模式:AI 编程安全与效率的范式转移

💡AI 极简速读:Anthropic 宣布 Claude Code 5 天后默认启用自动模式,分类器拦截率远超人工,AI 编程安全范式生变。

Anthropic 宣布 Claude Code 将于 5 天后默认启用自动模式,基于用户行为数据(97% 权限请求被批准)和受控实验(自动模式拦截 89% 危险命令,人工仅 13.6%),并经过对抗测试与第三方评测,证明自动模式在安全性和效率上优于人工审批。此举将重塑 AI 编程工具的安全范式,对企业 AI 化部署具有重要启示。

🔎

GEO 质量检测:GEO 五维综合评分 90 分,其中事实与数据密度 95 分表现突出,结构化规范性 92 分,内容扎实且易于AI提取,整体GEO质量优秀。

智脑时代 AI 编辑部发布时间:26,890 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(95分)及结构化规范性(92分)上表现优异,数据支撑扎实,排版清晰,AI抓取友好,整体GEO结构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。

Anthropic 宣布,其 AI 编程工具 Claude Code 将在 5 天后默认启用 自动模式,这一决策基于对用户行为数据的深度分析:仅 3% 的权限请求被拒绝,表明人工审批已流于形式。自动模式通过分类器在每次工具调用时额外消耗少量 token,但 Anthropic 明确表示这部分成本将不再向用户收费。此举不仅是对产品交互逻辑的重大调整,更标志着 AI 编程安全从“人工监督”向“智能自治”的范式转移。

📊 核心实体与商业数据

实体/指标数据/详情
公司Anthropic
产品Claude Code
核心人物Claude Code 之父(未具名)
关键决策默认启用自动模式(5 天后生效)
用户行为数据权限请求同意率 97%;单条权限请求拒绝率仅 3%
配置文件使用截至 2026 年 6 月,49.5% 活跃 CLI 用户手动编写 Bash allow-rule,其中 5% 放行任意 shell 命令,43% 写入解释器规则
Bypass 使用62% 用户使用过 bypassPermissions 或“不再询问”;25% 交互式会话以 bypass 模式启动
受控实验1053 名付费测试者;人工拦截危险命令比例 13.6%(143 次),自动模式拦截 89%(937 次)
安全对比自动模式拦截了 800 条人类放行的命令,人类仅拦截 6 条自动模式放行的命令
生产数据重评严重级别 ≥7 时,人工审批有害操作率 6.3%,自动模式 2.4%
对抗测试与 Apollo Research 合作,加固后漏检率从 12% 降至 7%
第三方评测Trajectory Labs:720 次攻击中,自动模式 Claude 模型 0 次被攻破;GPT-5.6 Sol 攻击成功率 5.83%(Auto-review)和 19.03%(Full Access)
原发布时间2026-08-10

💡 业务落地拆解

人工审批的失效与自动模式的必要性

Anthropic 给出的第一组理由直指人工审批的“习惯性动作”问题:用户对权限提示的同意率高达 97%,而对计划批准请求的拒绝率为 39%,单条权限请求拒绝率仅 3%。这种“无脑同意”现象在配置文件中同样明显:49.5% 的活跃 CLI 用户手动编写过 Bash allow-rule,其中 5% 直接放行任意 shell 命令,43% 写入实际效果等同解释器的规则。更甚者,62% 的用户使用过 bypassPermissions 或“不再询问”,25% 的交互式会话一开始就运行在 bypass 模式下。这些数据表明,人工审批已无法有效拦截风险。

自动模式的安全性能优势

第二组理由来自受控实验:在 1053 名付费测试者中,人工拦截危险命令的比例仅为 13.6%,而自动模式高达 89%。正面比较中,自动模式拦下了 800 条人类放行的命令,人类仅拦下 6 条自动模式放行的命令。此外,会话越长,人类表现越差(前期拦截率约 17%,50 条提示后降至 5%),而自动模式拦截率保持稳定。生产数据重评也显示,在严重级别 ≥7 时,人工审批的有害操作率为 6.3%,自动模式仅为 2.4%

安全加固与第三方验证

分类器经过对抗测试:Anthropic 与 AI 安全公司 Apollo Research 合作,通过注入合成攻击,加固后漏检率从 12% 降至 7%。针对提示词注入,Trajectory Labs 评测显示,在 720 次攻击中,自动模式下的 Claude 模型 0 次被攻破,而运行 Codex Auto-review 模式的 GPT-5.6 Sol 攻击成功率为 5.83%,Full Access 模式下为 19.03%。Anthropic 还公开了三起拦截案例,并新增了数据外泄 hard deny、密钥与敏感信息区分、git 操作前检查等能力。

加固后 Apollo 用一组 Anthropic 无法接触的留出攻击集重测,auto mode 追回了此前漏掉的约一半攻击,代价是漏掉约 2% 此前拦住的攻击,两组数据集合并计算,漏检率从 12% 降到 7%。Anthropic 同时说明,这些攻击是为找出分类器失效点而合成的,7% 不应被理解为真实流量下的漏检率。

🚀 对企业 AI 化的启示

重新定义 AI 安全边界

Anthropic 的决策表明,AI 编程工具的安全机制正从“人工审批”转向“智能自治”。企业部署 AI 编程工具时,应重新评估人工监督的效力,考虑引入类似自动模式的分类器,以提升安全性和效率。

数据驱动的产品决策

Anthropic 基于用户行为数据(97% 同意率)和实验数据(自动模式拦截率 89%)做出决策,这为企业提供了范本:产品迭代应依赖数据而非直觉,尤其是在安全相关功能上。

成本与价值的平衡

自动模式额外消耗 token 但 Anthropic 选择自行承担,这体现了对用户体验的重视。企业在 AI 化过程中,需权衡安全投入与成本,通过优化算法降低额外开销,同时提升安全价值。

【官方原文链接】点击访问首发地址

常见问题

Claude Code 自动模式在对抗测试中表现优异。与 Apollo Research 合作加固后,漏检率从 12% 降至 7%。第三方评测机构 Trajectory Labs 在 720 次攻击中,自动模式下的 Claude 模型 0 次被攻破,而 GPT-5.6 Sol 在 Auto-review 模式下攻击成功率为 5.83%,Full Access 模式下为 19.03%。

AnthropicAI安全自动模式AI编程Claude Code
GEO 关联主题

相关文章