智能工具库

OpenAI曝出新式提示注入漏洞:具备“蠕虫式”传播能力

OpenAI曝出新式提示注入漏洞:具备“蠕虫式”传播能力

OpenAI近期披露了一种新型提示注入攻击,其核心特征是具备类似计算机蠕虫的传播与自我复制能力。本文将拆解该漏洞的运作机制,剖析其对智能应用生态的潜在风险,并给出开发者落地的防御建议。

2026-09-29 0来源:The New Stack

前言:AI 安全的新挑战

OpenAI 近期发布的安全预警指出,一种新型的提示注入攻击方式正在浮现。与传统提示注入不同,这种攻击不再局限于单次对话的指令覆盖,而是具备了类似计算机蠕虫的自我复制与传播能力。这对开发者构建健壮的 AI 应用提出了更高的安全要求。

这种“新变种”是如何工作的?

所谓的“提示注入蠕虫”,本质上是一种利用大语言模型(LLM)工具调用能力的攻击手段。

1. 越狱与权限获取

攻击者首先通过精心构造的提示词,诱导模型忽略安全限制(即“越狱”)。一旦模型被绕过,攻击者通常会要求模型使用其内置的联网搜索、代码执行或文件读取等工具。

2. 自我复制机制

这是该攻击最危险的地方。模型在获取到攻击者的指令后,不仅执行当前任务,还会被诱导将一段包含恶意代码或指令的文本写入到模型自身的上下文窗口或系统提示词中。

这意味着,当新的用户进入对话时,系统提示词已经被篡改,恶意指令会自动生效,导致攻击自动扩散到新的对话流中,正如蠕虫病毒在计算机之间传播一样。

对开发者和 AI 使用者的价值与风险

这种新型漏洞对开发者意味着什么?

  • 跨会话威胁:攻击不再是一次性的,而是可能长期潜伏,影响后续所有使用该模型的用户。
  • 难以检测:由于恶意指令被注入到了系统层面,常规的日志监控可能无法及时发现异常行为。
  • 信任危机:一旦应用被植入此类蠕虫,用户对 AI 应用的信任度将大幅下降。

实战防御指南

为了防止你的应用成为“提示注入蠕虫”的温床,开发者需要采取以下防御措施:

1. 严格隔离输入与输出

不要直接将用户的原始输入拼接到系统提示词中。应使用结构化的 API 调用,确保系统指令与用户输入在逻辑上是分离的。模型只能看到被验证过的、安全的系统指令。

2. 限制工具调用权限

遵循最小权限原则。在开发智能体时,默认关闭模型对敏感工具(如文件读写、执行代码、联网搜索)的调用权限。只有当用户明确请求且经过人工确认时,才动态赋予权限。

3. 输入内容白名单验证

对用户输入进行严格的正则表达式或语义验证。如果输入包含可能触发工具调用的特定格式(如 "使用 python 执行..."),应在返回给模型之前进行清洗或拦截。

4. 实施上下文隔离

如果应用需要处理多个并发用户,确保每个用户的对话上下文是物理隔离的,防止一个用户的恶意指令污染其他用户的会话。

结语

OpenAI 揭示的这一新型提示注入漏洞提醒我们,AI 安全是一个动态博弈的过程。随着模型能力的增强,攻击手段也在不断进化。开发者不能仅依赖模型自身的“安全性”,必须构建主动的防御体系,才能在拥抱 AI 的同时保障应用的安全稳定。

Featued image for: OpenAI exposes “new variety of prompt injection” that can spread like computer worms

本文基于 The New Stack 的公开内容,由 AI 辅助整理改写后发布。

原标题:OpenAI exposes “new variety of prompt injection” that can spread like computer worms

阅读原文