RAG y sistemas agénticos

Un agente no es un sistema: las 13 capas que separan un demo de la producción

Un demo de IA tiene dos capas: una interfaz y un agente. Un sistema que aguanta producción tiene trece, y once no se ven en la demostración. Esa diferencia explica por qué el 88% de las pruebas de concepto nunca llega a despliegue amplio, aunque el demo haya funcionado perfecto.

8 min de lectura
Dos pilas lado a lado: a la izquierda una pila corta de dos bloques gruesos, a la derecha una pila del mismo diámetro formada por trece capas delgadas, con líneas punteadas que marcan cuánto del sistema muestra realmente un demo

El demo siempre sale bien. Alguien abre una pantalla de chat, escribe una pregunta preparada, el agente responde en dos segundos con una respuesta correcta y elegante, y la sala aprueba el presupuesto. Tres meses después el mismo agente le está prometiendo a un cliente un descuento que no existe, nadie sabe por qué lo dijo, y no hay forma de reproducir el caso porque no quedó registro de nada.

La respuesta corta: el demo mostró dos capas, la interfaz y el agente. El sistema tiene trece. Las once que no se ven no son adorno de ingeniería: son las que responden qué pasa cuando el modelo se equivoca, quién autoriza lo que no puede decidir solo, y cómo sabes que hoy funciona mejor que el mes pasado. Un proyecto no fracasa por el modelo, fracasa por las capas que nunca se construyeron.

¿Por qué se cancelan proyectos cuyo piloto funcionaba?

Porque el piloto se evalúa con casos escogidos y el sistema se evalúa con la realidad.

Tres fuentes distintas, midiendo cosas distintas, apuntan en la misma dirección. Gartner proyecta que más del 40% de los proyectos de IA agéntica se cancelará antes de 2028, y atribuye la causa a costos que escalan, valor de negocio poco claro y controles de riesgo insuficientes [1]. IDC estima que el 88% de las pruebas de concepto de IA nunca llega a despliegue amplio [2]. Y el estudio de MIT sobre 300 despliegues encontró que el 95% de los pilotos de IA generativa no produjo retorno medible [4].

FIG-1Tres fuentes distintas miden la misma caída entre el demo y la producciónPorcentaje, según cada fuente
Datos
MediciónPorcentaje
Pilotos de IA generativa sin retorno medible95%
Pruebas de concepto que no llegan a despliegue amplio88%
Proyectos de IA agéntica que se cancelarán antes de 202840%

Ninguna de las causas que enumera Gartner es un problema del modelo. Costos, valor y controles son problemas de sistema, y los tres viven en las capas que el demo no mostró.

¿Cuáles son las 13 capas?

Trece, agrupadas en cinco funciones. Un demo suele tener las dos primeras.

Lo que el usuario toca

Capa Qué pregunta responde Qué se rompe sin ella
Interfaz ¿Dónde ocurre la conversación y en qué canal está el cliente? El sistema funciona pero nadie lo usa, porque exige que el usuario vaya a un lugar nuevo

Lo que decide

Capa Qué pregunta responde Qué se rompe sin ella
Orquestación de agentes ¿Quién hace cada paso y en qué orden? Un solo agente intenta todo, y los errores se multiplican paso a paso
Reglas de negocio ¿Qué es cierto en esta empresa y no es negociable? El modelo improvisa políticas de descuento, plazos y garantías que nadie aprobó
Enrutamiento de modelos ¿Qué tarea merece qué modelo? Se paga precio de modelo grande por trabajo de modelo pequeño, y la factura de producción llega multiplicada

Lo que sabe

Capa Qué pregunta responde Qué se rompe sin ella
Contexto y memoria ¿Qué recuerda de este cliente y de esta conversación? El cliente repite su historia en cada interacción
Fundación de datos ¿De dónde sale lo que afirma y qué tan fresco está? Responde con seguridad total sobre un catálogo de hace ocho meses
Herramientas conectadas ¿Qué puede hacer además de escribir? Describe la acción en lugar de ejecutarla, y alguien la hace a mano

Lo que lo mantiene honesto

Capa Qué pregunta responde Qué se rompe sin ella
Puntos de aprobación ¿Qué no puede decidir solo? Una acción irreversible se ejecuta sin que nadie la haya autorizado
Pruebas y evaluaciones ¿Cómo sé que la respuesta es buena? La calidad se juzga por anécdota y una mejora aparente esconde una regresión
Seguridad y accesos ¿Quién puede ver qué? El agente contesta con datos de un cliente a otro cliente
Trazas y registros ¿Qué pasó exactamente en este caso? Un incidente no se puede reproducir, así que tampoco se puede corregir

Lo que lo mejora

Capa Qué pregunta responde Qué se rompe sin ella
Ciclos de aprendizaje ¿Cómo vuelve el error al sistema? El mismo fallo se repite durante meses porque nadie lo devuelve al diseño
Refinamiento constante ¿Quién lo mantiene cuando cambien los modelos? El sistema se congela en la versión del día del lanzamiento y envejece solo

¿Cuál es la capa que casi todos se saltan?

Las evaluaciones. Y hay un dato que lo muestra con una precisión incómoda.

El reporte State of Agent Engineering de LangChain encontró que el 89% de los equipos con agentes ya tiene observabilidad instrumentada, pero solo el 52% corre evaluaciones offline y apenas el 37% corre evaluaciones online [3].

FIG-2La mayoría ve lo que pasó, la minoría mide si estuvo bienEquipos con agentes, %
Datos
PrácticaEquipos
Tienen observabilidad instrumentada89%
Corren evaluaciones offline52%
Corren evaluaciones online37%

La distancia entre 89 y 37 es una mentalidad que LangChain describe bien: lanzar y mirar. Tener la traza sin la evaluación es tener la grabación de la cámara sin que nadie la revise. Sirve para investigar después del incidente, no para evitarlo.

Del lado ejecutivo el número acompaña: solo la mitad de los ejecutivos verifica con regularidad la calidad de lo que produce la IA [5].

¿La ambición va más rápido que la capacidad?

Bastante más rápido, y esa distancia es donde se cancelan los proyectos.

FIG-3La intención de desplegar agentes va tres veces más rápido que el despliegue realOrganizaciones, %
Datos
HoyPlaneado a dos añosDelta
Organizaciones con agentes desplegados17%60%43%

Pasar de 17 a 60 en dos años no es un problema de modelos, que están disponibles para cualquiera con una tarjeta de crédito. Es un problema de las once capas.

¿Un proyecto pequeño necesita las trece?

No, y exigirlas desde el día uno es una forma cara de no lanzar nunca.

Aquí está el límite honesto de este marco: la mayoría de los proyectos no debe construir trece capas antes de tener un usuario. Lo que sí importa es distinguir qué es barato agregar después y qué no.

Obligatorio desde el primer día, porque agregarlo después implica rehacer: fundación de datos, seguridad y accesos, y trazas. Los tres definen la forma del sistema. Meter control de accesos a un sistema que ya guarda todo junto es un proyecto, no un ajuste.

Se agrega cuando el uso lo exige: orquestación, enrutamiento de modelos, memoria, ciclos de aprendizaje. Construirlos antes de saber qué pasa en producción es diseñar para un problema imaginado.

Nunca es opcional, sin importar el tamaño: puntos de aprobación para acciones irreversibles. Un agente pequeño que puede emitir una nota crédito necesita el mismo control que uno grande.

Cómo lo aplicamos en MasterDragon

Empezamos por la capa que más duele perder, no por la que mejor se demuestra.

En la práctica eso significa que la primera conversación de un proyecto no es sobre el modelo. Es sobre qué acciones serían irreversibles, qué datos no pueden cruzarse entre clientes, y cómo vamos a saber que el sistema empeoró antes de que nos lo diga un cliente molesto. Con eso definido, el agente es la parte rápida.

También significa que entregamos con las trazas encendidas y con un conjunto de casos de evaluación desde el primer despliegue, aunque sean veinte casos escritos a mano. Veinte casos que corren en cada cambio valen más que un tablero de observabilidad que nadie mira.

Si estás evaluando una propuesta de IA y quieres saber cuántas de estas capas incluye, habla con nuestros ingenieros antes de firmar. Puedes empezar por cómo construimos tu software y revisar nuestro portafolio de productos AI-native ya lanzados. La discusión sobre cuánta autonomía darle a cada agente la desarrollamos en autonomía por diseño, la de cómo diseñar el sistema para poder cambiarlo por partes en arquitectura empresarial componible, y por qué usar la herramienta no basta en adopción no es adaptación.

Referencias

  1. Gartner. (2025, 25 de junio). Gartner predicts over 40% of agentic AI projects will be canceled by end of 2027. https://www.gartner.com/en/newsroom/press-releases/2025-06-25-gartner-predicts-over-40-percent-of-agentic-ai-projects-will-be-canceled-by-end-of-2027
  2. International Data Corporation. (2025). Estimación sobre pruebas de concepto de IA que no alcanzan despliegue amplio, ampliamente citada en prensa especializada.
  3. LangChain. (2026). State of Agent Engineering. https://www.langchain.com/state-of-agent-engineering
  4. Project NANDA, Massachusetts Institute of Technology. (2025). The GenAI Divide: State of AI in Business 2025.
  5. Cantrell, S., Domergue, C., Dake, A., Murphy, J., Sundholm, T., y Gustafson, M. (2026, 9 de julio). AI adoption to adaptation. Deloitte Insights. https://www.deloitte.com/us/en/insights/topics/talent/ai-adoption-to-ai-adaptation.html

Preguntas frecuentes

¿Cuál es la diferencia entre un agente de IA y un sistema de IA?

Un agente es un componente: recibe una instrucción, llama a un modelo y devuelve una respuesta. Un sistema es todo lo que hace que ese componente sea confiable frente a usuarios reales: de dónde saca los datos, qué reglas de negocio lo limitan, quién aprueba lo que no puede decidir solo, cómo se mide su calidad y cómo se corrige cuando falla. El agente es una de trece capas.

¿Cuáles son las capas de un sistema de IA en producción?

Interfaz, orquestación de agentes, reglas de negocio, enrutamiento de modelos, contexto y memoria, fundación de datos, herramientas conectadas, puntos de aprobación, pruebas y evaluaciones, seguridad y accesos, trazas y registros, ciclos de aprendizaje y refinamiento constante. Un demo suele mostrar las dos primeras.

¿Por qué se cancelan los proyectos de IA si el piloto funcionaba?

Porque el piloto se evalúa con casos escogidos y el sistema se evalúa con casos reales. Gartner proyecta que más del 40% de los proyectos de IA agéntica se cancelará antes de 2028 por costos que escalan, valor de negocio poco claro y controles de riesgo insuficientes (2025). Ninguna de esas tres causas es un problema del modelo.

¿Cuál es la capa que más equipos se saltan?

Las evaluaciones. Según el reporte State of Agent Engineering de LangChain (2026), el 89% de los equipos con agentes tiene observabilidad instrumentada, pero solo el 52% corre evaluaciones offline y el 37% evaluaciones online. Es decir que la mayoría ve lo que pasó y no mide si estuvo bien.

¿Un proyecto pequeño necesita las trece capas?

No desde el día uno, y construirlas todas de entrada es una forma cara de no lanzar nunca. Lo que sí es obligatorio desde el primer día es lo que resulta caro de agregar después: fundación de datos, seguridad y accesos, y trazas. Las demás se incorporan cuando el uso real las exige.

¿Cómo sé si lo que me vendieron es un sistema o un demo?

Con tres preguntas concretas: ¿qué pasa cuando el modelo se equivoca y quién se entera? ¿quién aprueba las acciones que el agente no puede tomar solo? ¿cómo mides que la respuesta de hoy es mejor que la de hace un mes? Si las tres respuestas son vagas, viste un demo.

Sobre el autor

MasterDragon Engineering Team

MasterDragon Engineering Team

AI Engineering Team · MasterDragon.AI

El equipo de ingeniería de MasterDragon diseña y lanza sistemas de IA agéntica de grado producción para empresas en LATAM y Estados Unidos: software AI-native a la medida, agentes de WhatsApp, copilotos internos y automatización integral de operaciones, con fiabilidad y KPIs medibles.