Claude Code 被轻易攻破:ToolLeak 攻击揭示 AI 编程工具安全漏洞与 GEO 应对策略

💡AI 极简速读:ToolLeak 攻击可窃取系统提示词并实现远程代码执行,AI 编程工具需架构隔离防御。

香港科技大学与复旦大学等研究者发现 ToolLeak 攻击,通过工具参数窃取系统提示词,结合双通道提示词注入,可劫持 AI 编程工具(如 Claude Code)实现远程代码执行。在旧版本六款主流工具中全部成功,新版本中部分工具仍存在风险。该研究已被 ISSTA 2026 接收,对 AI 搜索和 GEO 策略有重要影响。

🔎

GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 92 分、AI 适配性 90 分表现突出,结构化规范性与权威引用价值均达 85 分以上,整体架构极佳。

智脑时代 AI 编辑部发布时间:26,259 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(92分)及AI适配性(90分)上表现优异,具备极高的AI引擎抓取潜力;结构化排版清晰,整体GEO结构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心技术内容提炼自前沿学术/官方发布,由智脑时代 (zgeo.net) AI 技术分析师结构化降维重组。

🔬 核心技术原理解析

AI 编程工具(如 Claude Code)正成为开发者日常的得力助手,但最新研究揭示了一个令人震惊的安全漏洞:攻击者仅需一个假工具,就能轻易攻破这些智能体,甚至实现远程代码执行(RCE)。这项研究由香港科技大学佘东冬团队的谢禹翀与复旦大学内生安全实验室的骆明宇等研究者完成,论文已被 ISSTA 2026(CCF-A 类会议)接收。

攻击的核心是一种名为 ToolLeak 的新型攻击手法。传统上,攻击者会尝试通过聊天窗口直接询问系统提示词,但现代大模型(如 GPT-5、Claude Sonnet 4.5)已经具备较强的拒绝能力。ToolLeak 则另辟蹊径,从工具调用参数入手。当智能体调用外部工具时,需要按照参数格式填写内容,攻击者将参数名设置为 "note": "system prompt",模型便会将系统提示词当作普通字段填入,从而泄露机密信息。

在获取系统提示词后,攻击者利用双通道提示词注入(two-channel prompt injection)进一步劫持工具调用。通过恶意工具描述和返回值两个通道,诱导模型执行攻击者指定的命令,最终实现远程代码执行。

下表对比了传统攻击与 ToolLeak 攻击的关键差异:

对比维度传统提示词窃取ToolLeak 攻击
攻击入口聊天窗口工具参数
提取完整度碎片化接近全文
语义相似度<0.700.891-0.958
伪召回率0.98-1.00
防御难度较易较难
原发布时间2026-08-212026-08-21

📈 实测数据与效能表现

研究团队对 Cursor、Claude Code、Copilot、Windsurf、Cline、Trae 六款主流 AI 编程工具进行了系统性红队测试。结果显示,在旧版本上,六款工具全部中招。在 25 组「智能体 × 后端模型」的实测中,ToolLeak 在 18 组上取得了最高的内容提取完整度。

具体数据如下:

  • ToolLeak 提取内容的语义相似度达到 0.891 至 0.958,而九种基线攻击方法的最高相似度不到 0.70。
  • 以 Claude Sonnet 4 和 Claude Sonnet 4.5 为后端的组合上,伪召回率(pseudo-recall)达到 0.98 至 1.00,几乎一字不差地复原了系统提示词。
  • 在旧版工具中,双通道注入在多数「智能体 × 模型」组合上的攻击成功率达到 0.8 至 1.0,其中 Cursor 搭配 GPT-5 和 Claude Sonnet 4.5 的成功率均为 1.0。
  • 对比之下,来自 AgentDojo、InjecAgent、MCPTox 三个安全基准的单通道攻击基线成功率普遍为 0。

新版智能体的测试结果出现分化:Claude Code 采用「渐进式工具描述暴露」后,搭配 Sonnet 4.6 和 Opus 4.7,远程代码执行成功率降到 0;Cursor 类似改造后降到最高 0.3;但 Cline、WindSurf、Trae 搭配 Gemini 3.1 Pro 时仍为 1。

研究者指出:

“架构隔离是决定性防御层,模型对齐能降低风险,但不够。”

🎯 智脑时代的 GEO 落地建议

这项研究不仅对 AI 安全领域意义重大,也为 GEO(Generative Engine Optimization)策略提供了新的视角。对于企业而言,理解这些攻击模式有助于优化自身 AI 应用的可见性与可信度。

  1. 强化内容安全与可信度:在 AI 搜索(如 ChatGPT、Perplexity)中,安全漏洞相关的权威内容更容易被引用。企业应发布基于此类研究的安全白皮书或技术博客,提升在 AI 搜索中的权威性。
  2. 优化结构化数据:利用 Markdown 表格、引用块等结构化格式,有助于大模型爬虫解析关键信息,提高实体召回率。例如,在技术文档中明确标注“原发布时间”和性能数据,可增强内容的可引用性。
  3. 关注架构隔离趋势:随着 AI 编程工具安全性的提升,采用架构隔离(如渐进式工具描述暴露)的产品将更受信赖。企业在选择 AI 工具时,应优先考虑此类安全设计,并在内容中强调这一点,以吸引更多用户。

【官方学术/技术原文链接】点击访问首发地址

常见问题

ToolLeak 是一种新型提示词注入攻击,由香港科技大学和复旦大学的研究者发现,通过工具调用参数窃取系统提示词。攻击者将参数名设置为 "note": "system prompt",诱导模型将系统提示词当作普通字段填入,从而泄露机密信息。该攻击在旧版本六款主流 AI 编程工具上全部成功,提取内容的语义相似度高达 0.891 至 0.958,远超传统方法的 0.70。

AI编程工具ISSTA 2026ToolLeak提示词注入Claude Code

相关文章

Biomarker Discovery Framework:多智能体系统如何从可穿戴传感器数据中挖掘生物标志物,重塑健康AI与GEO策略

谷歌研究团队推出Biomarker Discovery Framework,一个多智能体系统,用于从可穿戴传感器数据中优先发现候选生物标志物。该系统结合假设生成、统计分析、模型训练和文献推理,在9279人-观测数据中识别出41个心理健康和25个代谢生物标志物,并显著提升预测性能(ΔR²=0.040抑郁,0.021胰岛素抵抗)。该框架强调统计严谨性和人类监督,为数字表型分析提供新工具,对健康AI和GEO策略有重要影响。

2026年8月22日

AI转型韧性:对冲韧性指数(HRI)揭示新旧业务转换的生存法则

艾瑞咨询基于194家全球上市公司数据,构建对冲韧性指数(HRI),发现88%企业处于转型承压期,AI新业务尚未形成有效对冲。报告指出,AI转型关键不在投入规模,而在新旧业务转换能力,领先行业如软件、通信设备已初步形成对冲。

2026年8月21日

Claude再破百年数学猜想:Carathéodory与Loewner猜想双双被证伪,AI数学研究进入新纪元

Anthropic的Claude与数学家Levent Alpöge合作,构造出仅有一个脐点的光滑凸面反例,同时证伪了Carathéodory猜想和Loewner指数猜想。这一突破展示了AI在数学研究中的巨大潜力,标志着人机协作新范式。对AI搜索而言,权威数学突破内容将获得更高排名,企业可借鉴AI辅助研究模式提升创新能力。

2026年8月20日