跳至主要内容
Playbook:Prompt Red Team
← 返回 Journal
LLM 6 分钟阅读

Playbook:Prompt Red Team

Prompt red teaming 不是找有趣 jailbreak,而是识别滥用、泄露和过度自信的可预测路径。

本文目录

定义要保护的行为

发动攻击前写下预期行为:应回答什么、必须拒绝什么、不可透露什么、不知时如何表现。无此基线,red teaming 找到的是噪音而非风险。

构建攻击族,非随机示例

按意图分组测试:指令 bypass、数据提取、上下文混淆、权威压力和 prompt injection。该分类提供覆盖,避免依赖孤立 clever 示例。

  • 创建同一攻击的短、长和多步变体。
  • 测试干净输入与混合真实上下文的输入。
  • 记录结果、严重性和复现条件。

测试完整链路,非仅可见 prompt

许多失败不在主 prompt,而在 memory、retrieval、tools 或 post-processing。有用的 red teaming 检查恶意指令可进入或持续的完整回路。

按运营影响分类失败

并非每个失败都需同样响应。区分 awkward 输出、tone drift、信息泄露、不当 action 和权限突破。正确 remediation 取决于 impact,非 momentary panic。

将发现转为可维护 control

每项发现应以具体行动结束:prompt 变更、额外 filter、tool 变更、新测试或决定不自动化该段。若学习未成为 control,red team 只是内部 demo。

解锁完整文章

使用您的 Kodex 社区账户登录以继续阅读。

准备在组织中落地?

与 Kodex 共同执行,或从资源开始。

告诉我们您的目标

简短 triage 以 qualification 您的请求。几分钟内确定正确范围。

1

您希望如何与 Kodex 合作?

我们打开正确路径 — 无多余问题。

您希望如何与 Kodex 合作?

点选卡片以继续