本文目录
您的列表
定义要保护的行为
发动攻击前写下预期行为:应回答什么、必须拒绝什么、不可透露什么、不知时如何表现。无此基线,red teaming 找到的是噪音而非风险。
构建攻击族,非随机示例
按意图分组测试:指令 bypass、数据提取、上下文混淆、权威压力和 prompt injection。该分类提供覆盖,避免依赖孤立 clever 示例。
- 创建同一攻击的短、长和多步变体。
- 测试干净输入与混合真实上下文的输入。
- 记录结果、严重性和复现条件。
测试完整链路,非仅可见 prompt
许多失败不在主 prompt,而在 memory、retrieval、tools 或 post-processing。有用的 red teaming 检查恶意指令可进入或持续的完整回路。
按运营影响分类失败
并非每个失败都需同样响应。区分 awkward 输出、tone drift、信息泄露、不当 action 和权限突破。正确 remediation 取决于 impact,非 momentary panic。
将发现转为可维护 control
每项发现应以具体行动结束:prompt 变更、额外 filter、tool 变更、新测试或决定不自动化该段。若学习未成为 control,red team 只是内部 demo。
解锁完整文章
使用您的 Kodex 社区账户登录以继续阅读。


