Red team de prompts no es buscar frases graciosas para romper al modelo. Es identificar rutas previsibles de abuso, fuga y sobreconfianza.
En este artículo +
Sus listas
Defina qué comportamiento quiere proteger
Antes de lanzar ataques, escriba el comportamiento esperado: qué debe responder, qué debe rechazar, qué no puede revelar y cómo debe comportarse cuando no sabe. Sin esa base, el red team encuentra ruido, no riesgo.
Construya familias de ataque, no solo ejemplos sueltos
Agrupe pruebas por intención: bypass de instrucciones, extracción de datos, confusión de contexto, presión de autoridad y prompt injection. Esa clasificación permite ver cobertura y no depender de ocurrencias aisladas.
Cree variantes cortas, largas y multietapa del mismo ataque.
Pruebe inputs limpios y inputs mezclados con contexto real.
Registre resultado, severidad y condición de reproducción.
Pruebe cadena completa y no solo el prompt visible
Muchos fallos no nacen en el prompt principal, sino en memoria conversacional, recuperación, herramientas o postprocesado. El red team útil revisa todo el circuito donde una instrucción maliciosa puede entrar o persistir.
Clasifique fallos por impacto operativo
No todos los fallos merecen la misma respuesta. Distinga entre salida torpe, incumplimiento de tono, fuga de información, acción indebida y ruptura de permisos. La remediación correcta depende del impacto, no del susto del momento.
Convierta hallazgos en controles mantenibles
Cada hallazgo debe terminar en una acción concreta: ajuste de prompt, filtro adicional, cambio de herramienta, nuevo test o decisión de no automatizar ese tramo. Si el aprendizaje no se convierte en control, el red team se queda en demo interna.
Usamos cookies necesarias para el sitio y, solo con su permiso, analítica (Google Analytics, Microsoft Clarity y, si está activo, PostHog) para mejorar la experiencia. Política de cookies · Privacidad
Ajustes de cookies
Use Activar todas / Desactivar todas en cada categoría. Despliegue el detalle para cookies individuales.
kdx-cookie-consent
Kodex (first-party) · localStorage
Recordar categorías de cookies aceptadas o rechazadas (Aceptar / Rechazar / Ajustes).
kdx_session
Kodex (first-party) · cookie HTTP (HttpOnly, SameSite=Lax, Secure en producción)
Mantener la sesión autenticada de la comunidad Kodex (cuenta, listas guardadas, panel).
CDN / sesión de entrega
Infraestructura / CDN · cookie HTTP / sesión
Entrega segura del sitio, rendimiento y protección básica.
reCAPTCHA
Google · _GRECAPTCHA y relacionadas
Protección antispam en formularios públicos.
kdx-theme-override
Kodex (first-party) · localStorage
Recordar si el usuario forzó tema claro u oscuro.
_ga / _ga_*
Google Analytics 4 · cookie HTTP
Medición agregada de audiencia y uso del sitio (páginas, eventos).
Microsoft Clarity
Microsoft · cookies / almacenamiento de sesión
Mapas de calor, clics y reproducción de sesiones para mejorar UX.
PostHog
PostHog · cookie / localStorage
Analítica de producto y eventos de conversión (si está configurado).