Recursos abiertos

Todo lo que necesitas para partir en seguridad de IA

Material de entrada, gratuito y en español: tres rutas según desde dónde llegas, un glosario de los términos que aparecen en toda conversación sobre el tema, y los marcos de referencia que usamos a diario.

Rutas de partida

No hay un solo camino de entrada. Elige el que se parezca a tu situación y sigue el orden propuesto: cada ruta está pensada para leerse en una tarde.

02

Si construyes o integras

Para quien escribe el código, conecta las herramientas o diseña la arquitectura.

  1. Prompt injection: por qué tus guardrails no bastan Por qué el filtro de entrada no es un control de seguridad.
  2. Agentes con herramientas: el modelo de permisos que casi nadie diseña El modelo de permisos que necesita un agente con herramientas.
  3. RAG seguro: el control de acceso que falta en la recuperación Cómo no romper los permisos del repositorio al montar un RAG.
  4. Construir tu suite de evaluaciones adversariales Pruebas adversariales versionadas en tu repositorio.
03

Si decides o respondes

Para gerencias, comités, compliance y directorios que tienen que aprobar y responder.

  1. Seis controles de seguridad de IA que puedes implementar este trimestre Qué implementar primero, con criterio de impacto sobre esfuerzo.
  2. Comité de IA: a quién sentar y qué decide realmente Cómo se arma un comité de IA que no sea decorativo.
  3. Métricas de seguridad de IA para el directorio Cinco indicadores que un directorio entiende.
  4. Evaluación de impacto algorítmico, paso a paso Cuándo corresponde una evaluación de impacto y qué incluye.

Glosario esencial

24 términos que aparecen en cualquier conversación sobre seguridad de IA, definidos sin rodeos y con la consecuencia práctica de cada uno.

Agente
Sistema que usa un modelo de lenguaje para decidir qué acciones ejecutar sobre otros sistemas, no solo para generar texto. Su riesgo no está en lo que dice, sino en lo que puede hacer.
Alucinación
Salida de un modelo que es fluida y plausible pero falsa. No es un fallo puntual: es una propiedad del mecanismo de generación, por lo que se gestiona con verificación, no con confianza.
Base vectorial
Almacén donde se guardan fragmentos de documentos convertidos en vectores numéricos para poder buscarlos por similitud. Es la pieza que suele heredar mal los permisos del repositorio original.
Deriva (drift)
Cambio en el comportamiento de un sistema con el tiempo, porque cambian los datos de entrada o porque el proveedor actualiza el modelo por debajo.
Destilación
Entrenar un modelo más pequeño a partir de las respuestas de uno grande. Usada legítimamente para reducir costos, y de forma abusiva para replicar un modelo ajeno.
Envenenamiento de datos
Introducir contenido manipulado en los datos de entrenamiento, de ajuste fino o en una base vectorial, para alterar el comportamiento futuro del sistema.
Evaluación (eval)
Conjunto de casos de prueba que mide si un sistema de IA se comporta como se espera. A diferencia de un test tradicional, la respuesta no es determinista y hay que puntuarla.
Fine-tuning
Ajustar un modelo ya entrenado con datos propios para especializarlo. Traslada al modelo la sensibilidad de esos datos, con las obligaciones que eso implica.
Guardrail
Control que filtra o bloquea entradas y salidas del modelo. Útil como capa adicional, insuficiente como único mecanismo de seguridad.
Inferencia de pertenencia
Técnica que intenta determinar si un dato concreto formó parte del entrenamiento de un modelo. Relevante cuando ese dato es personal.
Inyección de prompt
Hacer que un modelo siga instrucciones que no vienen de quien lo opera, sino del contenido que procesa. Directa si la escribe el usuario, indirecta si viene en un documento, correo o página web.
Jailbreak
Conseguir que un modelo ignore sus restricciones de comportamiento. Se solapa con la inyección de prompt, pero apunta a las políticas del modelo más que a la aplicación.
LLM
Modelo de lenguaje de gran tamaño. Predice texto a partir de texto; no consulta una base de datos ni verifica hechos por sí mismo.
MCP
Model Context Protocol. Estándar para conectar modelos con herramientas y fuentes de datos externas mediante servidores. Cada servidor conectado amplía la superficie de ataque.
MITRE ATLAS
Base de conocimiento pública que cataloga tácticas y técnicas de ataque contra sistemas de aprendizaje automático, con la misma lógica que ATT&CK usa para infraestructura.
NIST AI RMF
Marco de gestión de riesgo de IA del instituto de estándares estadounidense. Organiza el trabajo en cuatro funciones: gobernar, mapear, medir y gestionar.
ISO/IEC 42001
Norma internacional certificable para sistemas de gestión de inteligencia artificial. Es el equivalente, en IA, de lo que ISO 27001 es en seguridad de la información.
OWASP Top 10 para LLM
Lista de referencia de los riesgos más relevantes en aplicaciones con modelos de lenguaje, mantenida por la comunidad OWASP.
RAG
Generación aumentada por recuperación. El sistema busca fragmentos relevantes en un repositorio y se los entrega al modelo como contexto antes de responder.
Red teaming
Ejercicio adversarial en el que un equipo intenta deliberadamente hacer fallar el sistema, para descubrir problemas antes que un atacante real.
Shadow AI
Uso de herramientas de IA dentro de la organización sin aprobación ni visibilidad del área responsable. Suele ser síntoma de una necesidad no cubierta.
Superficie de ataque
Conjunto de puntos por donde alguien puede intentar afectar un sistema. En IA incluye los datos, el modelo, la ventana de contexto, las herramientas conectadas y las personas.
Trazabilidad
Capacidad de reconstruir después qué contexto recibió el modelo, qué herramientas invocó y con qué parámetros. Sin ella no hay investigación posible tras un incidente.
Ventana de contexto
Todo el texto que el modelo tiene delante al generar una respuesta: instrucciones del sistema, conversación, documentos recuperados y respuestas de herramientas. Todo compite por ser interpretado como instrucción.

¿Trabajas en educación o en un equipo que recién parte?

Este material es libre de usar

Puedes citarlo y compartirlo en clases, charlas o inducciones internas mencionando la fuente. Si necesitas una versión adaptada a tu organización, escríbenos.