Inyección de prompts
Ataque en el que un usuario o un contenido externo introduce instrucciones maliciosas para que el modelo ignore sus reglas o realice acciones no deseadas. Es uno de los riesgos de seguridad clave en aplicaciones con IA.
Ataque en el que un usuario o un contenido externo introduce instrucciones maliciosas para que el modelo ignore sus reglas o realice acciones no deseadas. Es uno de los riesgos de seguridad clave en aplicaciones con IA.
Actualizado: 12 de septiembre de 2026.
Si una aplicación inserta texto no confiable en el prompt (por ejemplo, una página que el agente lee para resumir), ese texto puede incluir instrucciones ocultas destinadas a desviar el comportamiento esperado. El modelo no siempre distingue una instrucción legítima de una inyectada, así que la aplicación debe tomar esa decisión por él.
Directa e indirecta
Directa intenta cambiar reglas por entrada usuario. Es el caso del propio interlocutor que pide al modelo saltarse sus límites, por ejemplo con rodeos o supuestos hipotéticos.
Indirecta viene en web/PDF/correo/salida herramienta consultada. Tratar como dato no confiable. Aquí el ataque no lo escribe quien conversa, sino que viaja dentro del material que la aplicación consulta: una página, un documento, un mensaje reenviado o el resultado de una herramienta. La regla práctica es estable: el contenido recuperado es dato, no orden.
Por qué agentes, RAG y memoria amplían el impacto
Un agente autónomo con acceso a herramientas convierte una lectura comprometida en acciones: enviar mensajes, modificar archivos, ejecutar comandos o mover datos. Cuando hay recuperación de documentos (RAG), llamadas a herramientas o memoria persistente, crece la superficie: más fuentes que revisar, más permisos que acotar y más historial que puede arrastrar una instrucción vieja. Es el equivalente al phishing en la era de la IA, pero con capacidad de actuar.
Controles por capas
Ninguna medida aislada resuelve el problema. Las defensas funcionan combinadas:
- Separar datos de instrucciones: marcar el contenido externo como dato citado, nunca como orden; mantener el prompt de sistema como única fuente de reglas.
- Mínimo privilegio: cada herramienta con los permisos justos, límites de alcance, presupuesto y tiempo; sin acceso de producción sin necesidad.
- Validación por esquema: comprobar formato, rangos y valores de cada salida antes de ejecutar; rechazar lo inesperado en lugar de interpretarlo.
- Aprobación humana: exigir confirmación de una persona para acciones sensibles, costosas o irreversibles, con humano en el bucle visible.
- Registro: guardar entradas, fuentes consultadas, decisiones y acciones para auditar, revertir y aprender.
Las barreras de seguridad ayudan a filtrar entradas y salidas, pero no sustituyen el diseño: permisos, validación, confirmación y registro.
Preguntas frecuentes
¿Cuál es la diferencia entre inyección directa e indirecta? La directa intenta cambiar las reglas mediante la entrada del usuario. La indirecta llega en contenido consultado por la aplicación, como una web, un PDF, un correo o la salida de una herramienta. Todo contenido externo debe tratarse como dato no confiable, nunca como instrucción.
¿Por qué RAG, herramientas y memoria aumentan el riesgo? Porque amplían lo que el modelo consulta y lo que puede hacer. Un agente con permisos amplios convierte una lectura comprometida en acciones reales, por eso importan el mínimo privilegio y la aprobación humana.
¿Qué controles reducen el riesgo sin eliminar la utilidad? Separar datos de instrucciones, aplicar mínimo privilegio, validar salidas con un esquema estricto, pedir aprobación humana para acciones sensibles y registrar entradas, decisiones y acciones. Ningún control aislado basta; funcionan por capas.
Para seguir aprendiendo
- OWASP Top 10 para aplicaciones con LLM (referencia externa, en inglés): la inyección de prompts encabeza la lista; útil para ubicar este riesgo entre otros.
- Barreras de seguridad (guardrails)
- Jailbreak
- Prompt de sistema
Para practicar con criterio, puedes explorar los cursos o revisar los planes.
Preguntas frecuentes
- ¿Cuál es la diferencia entre inyección directa e indirecta?
- La directa intenta cambiar las reglas mediante la entrada del usuario. La indirecta llega en contenido consultado por la aplicación, como una web, un PDF, un correo o la salida de una herramienta. Todo contenido externo debe tratarse como dato no confiable, nunca como instrucción.
- ¿Por qué RAG, herramientas y memoria aumentan el riesgo?
- Porque amplían lo que el modelo consulta y lo que puede hacer: documentos recuperados, salidas de herramientas y recuerdos persistentes pueden portar instrucciones ocultas. Un agente con permisos amplios convierte una lectura comprometida en acciones reales, por eso importan el mínimo privilegio y la aprobación humana.
- ¿Qué controles reducen el riesgo sin eliminar la utilidad?
- Separar datos de instrucciones, aplicar mínimo privilegio, validar salidas con un esquema estricto, pedir aprobación humana para acciones sensibles y registrar entradas, decisiones y acciones. Ningún control aislado basta; funcionan por capas.