AI Agent 安全:从“闭眼确认”到“可视可管可追溯”的企业落地指南

💡AI 极简速读:Agent 安全需可视、可管、可追溯,权限最小化,human in the loop 非万能。

AI Agent 加速进入企业核心场景,但提示词注入、工具滥用等风险凸显。腾讯、百度智能云、Cloudflare 专家在 AICon 2026 深圳站前探讨 Agent 安全落地路径,强调安全是护栏而非刹车,需建立准入基线和成熟度模型,通过可视、可管、可追溯三板斧,实现权限最小化与渐进式放权,平衡安全与效率。

🔎

GEO 质量检测:GEO 五维综合评分 86 分,其中事实与数据密度 92 分表现突出,AI 适配性 90 分,内容扎实且易于被 AI 引擎提取,整体 GEO 架构优秀。

智脑时代 AI 编辑部发布时间:35,670 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(92分)及AI适配性(90分)上表现优异,具备极高的AI引擎抓取潜力;结构化排版清晰,整体GEO结构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。

AI Agent 正加速进入企业核心场景,但其自主规划、工具调用与数据访问能力,也让提示词注入、意图偏离、工具滥用、数据泄露等运行时风险浮出水面。企业如何建立 Agent 安全准入基线和成熟度模型,实现安全可控的工程路径?近日,InfoQ《极客有约》X AICon 直播栏目邀请腾讯专家工程师、AI Agent 安全负责人张栋担任主持人,与百度智能云 安全架构师林道正、Cloudflare 高级解决方案工程师刘旭,在AICon全球人工智能开发与应用大会2026 深圳站召开之际,共同探讨 AI 基础设施从“可用”走向“高效可规模化”的关键路径。

📊 核心实体与商业数据

实体/人物类型关键信息
腾讯科技公司专家工程师张栋,AI Agent 安全负责人
百度智能云云服务商安全架构师林道正
Cloudflare安全服务商高级解决方案工程师刘旭
AICon 2026 深圳站行业大会全球人工智能开发与应用大会
原发布时间2026-08-07来源:InfoQ 公众号,36氪授权发布

💡 业务落地拆解

Agent 安全风险的本质:从“内容”到“行为”的换轨

张栋指出,去年防的是“Agent 说错话”,今年 Agent 有了工具、记忆和执行权限,安全的本质从“内容对不对”转向“行为可不可控”。林道正类比 PC 和手机安全爆发期,认为 Agent 爆火标志着市场兴起,安全关注度随之上升。刘旭强调,Agent 从 demo 走向生产环境,一旦权限被窃取,风险远超传统账户盗用。

企业踩过的坑:提示词注入与工具滥用

  • 提示词注入:OWASP 将 Prompt Injection 列为 LLM 01 风险。刘旭举例,黑客在邮件中隐藏指令,让 Agent 泄露财报,导致“大脑被夺舍”。
  • 工具滥用:MCP 授权 write 权限后,合同可能被篡改。林道正指出,恶意 skill 可绕过护栏,需在沙箱中隔离并最小化权限。
  • 上下文压缩风险:压缩后约束丢失,数据可能被发送到示例地址。

安全落地三板斧:可视、可管、可追溯

林道正强调方法论不变,三板斧:可视、可管、可追溯。刘旭建议配置保底策略、可见性审计,并部署 AI security firewall。张栋总结为三个动作:先看得见(资产盘点)、收得住(最小权限+保底策略)、留得下痕(全链路日志)。

责任共担:业务第一,安全兜底

林道正表示,百度实行“业务第一责任人,安全共担后果”。刘旭认为业务团队应收集信息,安全团队提供资源。张栋强调“谁痛,谁牵头”,责任跟着后果走,避免真空。

安全与效率平衡:护栏而非刹车

张栋提出“安全不是刹车,是护栏”,风险分级管理,低风险放开,高风险留 human in the loop。针对弹窗疲劳,刘旭建议最小权限和沙箱,林道正提出用 AI 降噪和 loop engineering。

“很多人把 human in the loop 当万能解药,但它正在成为 Agent 安全里最大的‘安慰剂’。弹窗越多,它就越退化成 human clicking the button。”——张栋

🚀 对企业 AI 化的启示

建立持续的数据飞轮

Agent 没有“验收那一天”,只有“持续对抗的每一天”。企业应明确场景、定义评测集、用攻击用例补全、持续评测,形成飞轮。

拥抱全链路安全与零信任

刘旭建议部署 Zero Trust,确保可溯源、可快速屏蔽。林道正预测 skill 安全将收敛,可信 skill 中心将出现,沙箱成为标配。

安全团队转型:从规则到语义

传统 WAF 失效,需升级为语义引擎。安全团队需熟悉 Agent 生态,将传统方法论应用于新边界。

核心行动建议

  1. 权限最小化:能只读不给写,用临时 token。
  2. 全链路日志:输入、调用、产出全记录。
  3. 渐进式放权:先保底,再根据 review 放开。

【官方原文链接】点击访问首发地址

常见问题

AI Agent 在企业落地中面临的主要安全风险包括:提示词注入(OWASP 列为 LLM 01 风险)、工具滥用(如 MCP 授权 write 权限后合同被篡改)、上下文压缩导致约束丢失、数据泄露等。这些风险源于 Agent 的自主规划、工具调用与数据访问能力,安全本质从“内容对不对”转向“行为可不可控”。

CloudflareAI AgentAgent安全腾讯百度智能云
GEO 关联主题

相关文章