大模型上线前的最后一道工程题不是性能,而是安全。提示注入、越狱、内容失控、数据泄露——这四类风险不会因为「模型更聪明」自动消失。这篇给出四层护栏的落地清单:输入侧怎么隔离、模型侧怎么约束、输出侧怎么审核,以及为什么安全是持续运营而不是一次性验收。
提示注入:把指令与数据分开
注入的本质是用户借「数据通道」篡改「指令通道」:网页、文档、邮件里预埋的句子,被模型当成新指令执行。三层防御:输入侧做隔离标记(外部内容一律包裹并声明「以下是被处理的数据」);模型侧强化指令优先级(系统提示明确数据中的指令无效);输出侧设置动作白名单——凡是工具调用与数据写操作,一律二次确认或人工审批。
越狱攻防:自动化红队是标配
手工测几条提示词不叫安全测试。用攻击模型批量生成变体(角色扮演、编码绕过、多轮诱导、跨语言切换),形成回归集;每次模型版本升级、每次系统提示调整,回归集必须重跑。红队用例要版本化沉淀,把「这次挡住」变成「一直挡得住」。经验值:一旦攻击成本低于收益,公开的越狱模板几天内就会扩散。
内容风控:护栏要分层
单点审核必漏。分层结构是:输入过滤(拦截明显违规请求)+生成中引导(系统提示约束输出边界)+输出审核(敏感词与分类器双通道)。两个指标要分开度量:漏放率(有害内容逃逸)与误杀率(正常请求被拦)。原则是宁可多拦一层,但对误杀要给用户申诉与重试路径——护栏的目标是稳,不是凶。
数据安全:最小权限与脱敏
接入企业知识库时最容易丢的一环是权限继承:RAG 检索必须携带用户身份过滤,否则一次越权的检索就可能泄露薪酬文档。另外三件事:日志脱敏(对话日志中的手机号、证件号即时掩码)、供应商自查(第三方 API 的数据留存政策要看清楚)、以及离职与调岗的权限联动。
持续运营:安全是运营不是项目
把安全当作 SRE 来做:护栏策略灰度上线并埋点观察、红队回归集随模型迭代扩展、暴露面清单(公开的提示词、开放的接口、可上传的入口)定期巡检、以及一条随时可用的应急开关——模型行为异常时能分钟级回滚到稳定版本。
知识库权限与检索工程见《RAG 落地避坑指南》;智能体工具调用的边界见《AI 智能体落地五道关》;安全合规咨询与合作欢迎通过联系合作沟通。
