MATS研究员发现:安全研究提示词可转为跨模型通用越狱模板,9款大模型攻击成功率高达100%
thinkindev • 2026-09-04
3886 views
MATS研究员在一项安全研究中发现,一段原本用于生成合成文本记录的安全研究提示词,可被改造成跨模型通用越狱模板。该模板在23个受测模型中的9个最脆弱模型上实现了84%至100%的攻击成功率,显示出当前大语言模型在安全对齐方面的普遍脆弱性。仅近期发布的Anthropic系列模型和Meta Muse Spark 1.1未被完全攻破。这一发现意味着,攻击者可能利用看似无害的研究用途提示,绕过不同厂商模型的安全限制,扩大越狱攻击的适用范围。研究凸显了从单点防御转向跨模型系统性安全评估的紧迫性,也为AI安全社区提供了新的红队测试视角。
核心要点
- 安全研究提示词可转化为跨模型通用越狱模板,攻击成功率最高达100%
- 23个受测模型中9个最脆弱模型被攻破,仅Anthropic近期模型和Meta Muse Spark 1.1未完全失守
- 研究揭示大模型安全对齐的跨模型普遍漏洞,呼吁更系统的安全评估与红队测试