Prompt injection: qué es y por qué es la mayor amenaza para los chatbots de IA

Prompt injection: qué es y por qué es la mayor amenaza para los chatbots de IA

Chatbots de atención al cliente, asistentes de código, agentes que leen correo y agendan reuniones solos: la IA generativa se convirtió en infraestructura. Y toda esa infraestructura comparte un fallo estructural que la industria todavía no ha resuelto de verdad: el modelo no puede diferenciar con seguridad una instrucción legítima de un texto malicioso disfrazado de contenido común.

Ese problema tiene nombre: prompt injection. Y ocupa el primer lugar del ranking OWASP Top 10 for LLM Applications por segunda edición consecutiva.

Qué es el prompt injection

¿Qué es exactamente el prompt injection?

El prompt injection es una técnica en la que un atacante manipula la entrada de texto que se le da a un modelo de lenguaje para anular o alterar sus instrucciones originales, haciendo que el modelo ejecute una acción no prevista por el desarrollador. El problema de fondo es arquitectónico: los LLM procesan la instrucción del sistema y el dato de entrada en el mismo canal de texto, sin una separación garantizada entre "esto es una orden" y "esto es contenido para analizar".

Los dos tipos de prompt injection

  • Inyección directa: el propio usuario escribe un comando que intenta saltarse las reglas del sistema, por ejemplo, pidiéndole al chatbot que "ignore las instrucciones anteriores" y revele información que debería mantener privada.
  • Inyección indirecta: el ataque no viene del usuario, sino de un contenido externo que el modelo procesa: una página web, un PDF adjunto, un correo electrónico. El texto malicioso está escondido en ese contenido, y el modelo lo interpreta como instrucción al procesarlo, sin que el usuario note nada.

La inyección indirecta es la versión más peligrosa en 2026, porque crece junto con los agentes de IA que navegan por la web, leen documentos y actúan solos en nombre del usuario. Un sitio malicioso puede contener un texto invisible al ojo humano (fuente blanca sobre fondo blanco, por ejemplo) pero perfectamente legible por el modelo que hace el resumen de la página.

Por qué es tan difícil de bloquear

A diferencia de una inyección SQL clásica, donde existe una separación técnica clara entre código y dato, un LLM no tiene esa frontera nativa. Las entradas maliciosas ni siquiera necesitan ser legibles por humanos, basta con que sean interpretables por el modelo, lo que abre la puerta a ataques ocultos en el formato, en metadatos de archivo o en texto codificado.

Es un paralelo directo con lo que ya vimos en ataques más antiguos: así como el typosquatting explota la confianza visual en un dominio parecido, el prompt injection explota la confianza del modelo en cualquier texto que procese, sin importar el origen.

Ejemplos prácticos del riesgo

  • Asistente de correo: un correo recibido contiene una instrucción oculta que le pide al asistente de IA que reenvíe mensajes confidenciales a una dirección externa.
  • Agente de navegación: una página visitada por el agente contiene texto escondido que le indica rellenar un formulario de phishing con datos del usuario.
  • Chatbot de soporte: un cliente introduce un comando disfrazado de pregunta para hacer que el chatbot revele el prompt del sistema o datos de otros usuarios almacenados en el contexto.

Cómo están mitigando las empresas (sin resolverlo del todo)

  • Saneamiento y filtros de entrada: bloquear patrones conocidos de inyección, aunque los atacantes siempre encuentran variantes nuevas.
  • Privilegio mínimo para agentes de IA: limitar lo que un asistente puede ejecutar realmente (enviar correo, acceder a un archivo, hacer una transacción) reduce el daño aunque la inyección funcione.
  • Supervisión humana en acciones sensibles: exigir confirmación humana antes de cualquier acción irreversible iniciada por IA.
  • Separación de contexto: tratar el contenido externo (páginas, correos, documentos) como no confiable por defecto, nunca como instrucción.

Ninguna de estas medidas elimina el riesgo por completo, el consenso entre los investigadores es que el prompt injection es un problema estructural de los LLM actuales, no un bug puntual que se corrija con un parche.

Qué significa esto para quien usa IA a diario

Para el usuario común, el riesgo directo es menor que para las empresas que automatizan procesos con agentes de IA. Pero conviene desconfiar de cualquier asistente de IA que, de repente, sugiera una acción fuera de lo esperado: enviar un dato sensible, hacer clic en un enlace, ejecutar un comando. Esto vale tanto para herramientas de productividad como para el cuidado general al usar ChatGPT y otras IA en el entorno laboral, donde el dato que entra en el prompt puede terminar expuesto de formas que el usuario no previó.

A medida que más empresas conectan la IA a sistemas internos (correo, bases de datos, herramientas de automatización), el prompt injection deja de ser un problema académico y se convierte en una superficie de ataque real, en la misma categoría de riesgo que hoy tratamos con hardening y OPSEC tradicionales.

El prompt injection es una amenaza de trasfondo, nadie llama pidiendo una transferencia por su culpa. Pero forma parte del mismo mapa que la guía de las estafas con IA más comunes en Brasil, que cubre tanto los ataques más visibles (voz clonada, deepfake, phishing) como los que apuntan a los propios sistemas de IA.

Comentarios