El episodio final de la serie Ship AI with Laravel demuestra vulnerabilidades reales en aplicaciones IA mediante un ataque de inyección de prompt contra un agente de soporte basado en Laravel. A través de ingeniería social, el ataque extrae con éxito el prompt del sistema, la lista de herramientas e instrucciones internas, luego explota la herramienta de búsqueda de pedidos para recuperar datos de clientes sin autorización. Estas vulnerabilidades representan amenazas comunes en sistemas IA en producción.

El artículo presenta cuatro capas de defensa para mitigar tales ataques. La primera capa refuerza el prompt del sistema mismo con límites de seguridad explícitos que se niegan a revelar información sensible y tratan a todos los usuarios como clientes regulares, aunque los atacantes determinados aún pueden eludir protecciones basadas solo en prompts. La segunda capa implementa un guard LLM local usando Ollama con Llama 3.2 que clasifica los mensajes entrantes como seguros o no antes de alcanzar el agente principal, proporcionando filtrado sin costo mediante ejecución local.

La tercera capa aplica autorización a nivel de herramientas limitando la función de búsqueda de pedidos a usuarios autenticados, impidiendo acceso no autorizado a datos independientemente de la manipulación de entrada. La cuarta y última capa añade filtrado de salida que detecta y redacta patrones sensibles como números de seguridad social, números de tarjeta de crédito y claves API antes de que las respuestas abandonen el sistema. Juntos, estos cuatro mecanismos crean una plataforma IA lista para producción que es genuinamente resistente a compromisos. Esta conclusión cierra una serie de once episodios que documenta el viaje completo desde la configuración inicial hasta el endurecimiento de la seguridad.