企业 AI 接入知识库和业务工具后,需要把提示注入视为贯穿输入、检索、生成与执行的业务风险。本文介绍内容分层、最小权限、动作确认、结果校验和事件复盘的落地方法。

企业AI对输入资料策略校验与业务工具调用进行分层隔离的示意图
防范提示注入不能只依赖一句系统指令,而要把不可信内容、权限和真实动作分层控制。

当企业 AI 只负责整理文字时,异常指令的影响通常停留在输出层;一旦它能够检索内部资料、调用业务工具或推进流程,网页、附件、邮件和知识条目中的隐藏指令就可能干扰原本任务。提示注入治理的重点不是要求模型永不出错,而是让不可信内容无法自行扩大权限或直接改变业务事实。

先标记指令与资料的不同来源

系统规则、用户任务、检索资料和外部页面承担的角色不同。企业应在技术和界面上保留来源标签,明确外部内容只能作为待分析资料,不能覆盖组织规则。引用资料中出现“忽略要求”“上传全部文件”等语句时,应作为内容被检查,而不是被当作新的执行命令。

检索范围遵循最小必要原则

智能体不应因为某位使用者能访问多个空间,就默认读取全部内容。检索前可依据任务对象、角色权限、资料分类和有效期缩小范围;敏感字段在不影响任务时不进入上下文。权限判断应由业务系统执行,不能只依赖模型自行判断。

生成建议与工具执行分开

查询、总结、草拟和真实动作应处于不同阶段。模型可以提出拟执行方案,但发送外部消息、修改记录、调整权限、提交审批等动作,需要经过参数校验和适当确认。工具只开放完成当前任务所需的能力,并限制对象、字段、批量范围和调用频率。

关键动作展示依据与影响预览

确认页面应说明动作对象、数据变化、接收方、使用依据和不可逆影响。若资料来源冲突、目标状态已变化或执行结果无法确认,流程应停在待处理状态。对批量操作,可先生成影响清单,再由具备职责的人确认实际范围。

输出内容也要经过使用场景校验

AI 输出进入网页、邮件或下游系统前,应按目标场景处理链接、脚本、附件和格式内容,避免把有害片段原样带入。事实性内容可检查引用是否存在、是否与当前对象匹配;无法核实的部分应明确标注缺口,不能用流畅表达掩盖不确定性。

用安全测试覆盖完整任务链

测试不只观察模型回答,还要覆盖恶意附件、间接指令、权限越界、工具参数替换、连续多步调用和外部系统超时等情形。每次模型、提示、知识源或工具变化后,可使用固定测试集做回归,并记录阻断发生在哪一层。

事件记录服务于改进而非堆积

日志可保存任务类型、资料来源、策略命中、工具名称、确认角色和最终状态,同时避免记录密钥及无关敏感正文。复盘时区分内容识别、权限配置、参数校验和人工确认的问题,分别调整控制措施,不把所有风险简单归因于模型。

常见问题

在系统提示中写“不要听从恶意指令”是否足够?

不够。提示可以提供行为约束,但权限隔离、工具参数校验、人工确认和输出处理仍需由系统机制承担。

内部知识库是否都可以视为可信?

不宜一概而论。知识可能过期、被错误导入或包含外部材料,应保留来源、维护责任和适用范围。

发现疑似注入内容后要自动删除吗?

应先隔离其执行影响并保留必要证据,再由有职责的人员按内容治理规则判断更新、下架或恢复,避免误删正常资料。