AI代理被工具输出“背刺”?ARMO:提示注入其实是两个事件,你的屏幕只读到一个
thinkindev • 2026-09-08
3129 views
随着AI代理越来越多地调用外部工具并消费返回结果,工具输出已成为提示注入的新攻击面。ARMO最新分析指出,隐藏在工具结果中的恶意指令之所以能绕过常规防护,核心原因是输入检查与动作检查分别发生在代理循环的不同时刻:安全人员往往只看某个屏幕或日志片段,无法同时覆盖提示进入和后续工具调用的完整链路。OWASP虽然已将工具输出标记为不可信,但这一标签很难传递到工单系统或CRM等下游。ARMO提出以“先例缺口”(precedent gap)作为检测信号——当代理突然调用执行历史中从未出现的工具、或使用全新参数组合时,即可能表明模型被注入内容操控。该方法不依赖具体载荷特征,而是观察行为突变,有望提升对多步骤代理攻击的检测能力。对正在构建企业级AI代理的团队而言,需在工具结果进入模型前进行过滤,并将信任边界延伸到自动化执行与业务系统。
核心要点
- 工具输出中的提示注入可绕过基于单一屏幕或日志的防护
- ARMO提出“先例缺口”信号,通过代理突然调用新工具或新参数识别异常
- 企业需将工具输出视为不可信,并在代理全链路建立检测与过滤机制