24 términos que aparecen en cualquier conversación sobre seguridad de IA,
definidos sin rodeos y con la consecuencia práctica de cada uno.
- Agente
- Sistema que usa un modelo de lenguaje para decidir qué acciones ejecutar sobre otros sistemas, no solo para generar texto. Su riesgo no está en lo que dice, sino en lo que puede hacer.
- Alucinación
- Salida de un modelo que es fluida y plausible pero falsa. No es un fallo puntual: es una propiedad del mecanismo de generación, por lo que se gestiona con verificación, no con confianza.
- Base vectorial
- Almacén donde se guardan fragmentos de documentos convertidos en vectores numéricos para poder buscarlos por similitud. Es la pieza que suele heredar mal los permisos del repositorio original.
- Deriva (drift)
- Cambio en el comportamiento de un sistema con el tiempo, porque cambian los datos de entrada o porque el proveedor actualiza el modelo por debajo.
- Destilación
- Entrenar un modelo más pequeño a partir de las respuestas de uno grande. Usada legítimamente para reducir costos, y de forma abusiva para replicar un modelo ajeno.
- Envenenamiento de datos
- Introducir contenido manipulado en los datos de entrenamiento, de ajuste fino o en una base vectorial, para alterar el comportamiento futuro del sistema.
- Evaluación (eval)
- Conjunto de casos de prueba que mide si un sistema de IA se comporta como se espera. A diferencia de un test tradicional, la respuesta no es determinista y hay que puntuarla.
- Fine-tuning
- Ajustar un modelo ya entrenado con datos propios para especializarlo. Traslada al modelo la sensibilidad de esos datos, con las obligaciones que eso implica.
- Guardrail
- Control que filtra o bloquea entradas y salidas del modelo. Útil como capa adicional, insuficiente como único mecanismo de seguridad.
- Inferencia de pertenencia
- Técnica que intenta determinar si un dato concreto formó parte del entrenamiento de un modelo. Relevante cuando ese dato es personal.
- Inyección de prompt
- Hacer que un modelo siga instrucciones que no vienen de quien lo opera, sino del contenido que procesa. Directa si la escribe el usuario, indirecta si viene en un documento, correo o página web.
- Jailbreak
- Conseguir que un modelo ignore sus restricciones de comportamiento. Se solapa con la inyección de prompt, pero apunta a las políticas del modelo más que a la aplicación.
- LLM
- Modelo de lenguaje de gran tamaño. Predice texto a partir de texto; no consulta una base de datos ni verifica hechos por sí mismo.
- MCP
- Model Context Protocol. Estándar para conectar modelos con herramientas y fuentes de datos externas mediante servidores. Cada servidor conectado amplía la superficie de ataque.
- MITRE ATLAS
- Base de conocimiento pública que cataloga tácticas y técnicas de ataque contra sistemas de aprendizaje automático, con la misma lógica que ATT&CK usa para infraestructura.
- NIST AI RMF
- Marco de gestión de riesgo de IA del instituto de estándares estadounidense. Organiza el trabajo en cuatro funciones: gobernar, mapear, medir y gestionar.
- ISO/IEC 42001
- Norma internacional certificable para sistemas de gestión de inteligencia artificial. Es el equivalente, en IA, de lo que ISO 27001 es en seguridad de la información.
- OWASP Top 10 para LLM
- Lista de referencia de los riesgos más relevantes en aplicaciones con modelos de lenguaje, mantenida por la comunidad OWASP.
- RAG
- Generación aumentada por recuperación. El sistema busca fragmentos relevantes en un repositorio y se los entrega al modelo como contexto antes de responder.
- Red teaming
- Ejercicio adversarial en el que un equipo intenta deliberadamente hacer fallar el sistema, para descubrir problemas antes que un atacante real.
- Shadow AI
- Uso de herramientas de IA dentro de la organización sin aprobación ni visibilidad del área responsable. Suele ser síntoma de una necesidad no cubierta.
- Superficie de ataque
- Conjunto de puntos por donde alguien puede intentar afectar un sistema. En IA incluye los datos, el modelo, la ventana de contexto, las herramientas conectadas y las personas.
- Trazabilidad
- Capacidad de reconstruir después qué contexto recibió el modelo, qué herramientas invocó y con qué parámetros. Sin ella no hay investigación posible tras un incidente.
- Ventana de contexto
- Todo el texto que el modelo tiene delante al generar una respuesta: instrucciones del sistema, conversación, documentos recuperados y respuestas de herramientas. Todo compite por ser interpretado como instrucción.