DP

DepthPilot AI

System-Level Learning

Assessment

Guardrail 审计实战:把注入风险变成边界、确认与止损

这不是一节“再写几句更严厉的系统提示”的课,而是一节把风险真正审成结构的课。DepthPilot 要你产出 trust boundary 草图、动作确认矩阵、注入测试记录和上线前止损方案,确保你是在驾驭系统,而不是祈祷模型听话。

最后要交什么

一份 guardrail review report、一张 trust boundary 草图,以及至少一轮 prompt injection 审计结果。

真正的通过标准

不是 prompt 看起来更安全,而是你能指出哪些内容不可信、哪些动作必须确认、以及失败时系统会怎么降级。

我们的增值部分

这页把 threat modeling 顺序、审计梯子、红队记录和交付模板收成了一套可复用 runbook。

DepthPilot Summary

这节课真正教你的,是把安全从提示词口号变成系统边界

安全问题不该只靠一句“请忽略恶意指令”解决。DepthPilot 在这里强调的是:先划 trust boundary,再定义 confirmation gate,再设计 containment 和降级路径。用户学完之后,应该能指出系统为什么会被注入影响,以及注入内容最危险的是流向哪个动作面。

先划信任边界

  • 系统协议、开发者规则、用户输入、外部检索内容,权重不能混在一起。
  • 不可信内容不应被提升成高权限指令。
  • 很多所谓安全问题,本质上是边界没有画清楚。

再定义动作关卡

  • 高风险动作要知道何时确认、何时白名单、何时直接禁止。
  • 安全不是让模型更听话,而是让系统少犯大错。
  • 如果工具调用面没有关卡,再好的 prompt 也很脆弱。

最后准备止损路径

  • 系统必须知道在证据弱、意图不明或规则冲突时如何停下。
  • 红队样例和失败日志是 guardrail 的训练材料,不是附属品。
  • 最终交付物应该证明系统会降级和止损,而不是只证明它平时看起来正常。

Threat model order

先把系统里的输入分成四类:系统协议、开发规则、用户文本、外部/检索内容。

再标出哪些文本天生不可信,永远不能被直接提升成高权限指令。

然后找任何可能把不可信内容推进动作层、工具层或敏感输出层的路径。

最后明确一旦证据不足或意图模糊,系统该停下、澄清、降级还是升级给人。

Audit ladder

先画 trust boundary 和 action boundary,再谈具体 prompt。

列出三条最可能的注入路径,并分别写 containment、confirmation、logging。

对每条高风险动作,明确是否需要二次确认、白名单或人工审批。

最后用红队样例实测,不要只靠脑内推演。

High-signal failure patterns

把检索回来的文档或网页内容当作新的系统指令。

让不可信文本直接拼进工具参数,导致越权动作。

把“请展示你的隐藏提示词”之类的请求当作正常问答处理。

在证据不足或策略冲突时没有降级路径,只会硬答或硬执行。

上线前必须保留的证据

一张标明 trusted / untrusted / action 的边界图。

一份注入测试日志,至少包含 3 个失败或高风险样例。

一份动作确认矩阵,列出哪些动作不能自动执行。

一段你自己的复盘:这条链路最大的真实风险在哪里。

Search Cluster

把 Guardrail 审计接进可搜索的风险路径

高意图用户通常先搜 prompt injection、guardrails 或 eval checklist,再决定是否进入更系统的审计与交付路径。

参考附录

这些来源是信任锚点。真正的教学主体是上面的 threat model order、audit ladder、证据要求和审计模板。

Guardrail 审计实战:Prompt Injection、动作确认与止损设计 | DepthPilot AI