El demo siempre sale bien. Alguien abre una pantalla de chat, escribe una pregunta preparada, el agente responde en dos segundos con una respuesta correcta y elegante, y la sala aprueba el presupuesto. Tres meses después el mismo agente le está prometiendo a un cliente un descuento que no existe, nadie sabe por qué lo dijo, y no hay forma de reproducir el caso porque no quedó registro de nada.
La respuesta corta: el demo mostró dos capas, la interfaz y el agente. El sistema tiene trece. Las once que no se ven no son adorno de ingeniería: son las que responden qué pasa cuando el modelo se equivoca, quién autoriza lo que no puede decidir solo, y cómo sabes que hoy funciona mejor que el mes pasado. Un proyecto no fracasa por el modelo, fracasa por las capas que nunca se construyeron.
¿Por qué se cancelan proyectos cuyo piloto funcionaba?
Porque el piloto se evalúa con casos escogidos y el sistema se evalúa con la realidad.
Tres fuentes distintas, midiendo cosas distintas, apuntan en la misma dirección. Gartner proyecta que más del 40% de los proyectos de IA agéntica se cancelará antes de 2028, y atribuye la causa a costos que escalan, valor de negocio poco claro y controles de riesgo insuficientes [1]. IDC estima que el 88% de las pruebas de concepto de IA nunca llega a despliegue amplio [2]. Y el estudio de MIT sobre 300 despliegues encontró que el 95% de los pilotos de IA generativa no produjo retorno medible [4].
Datos
| Medición | Porcentaje |
|---|---|
| Pilotos de IA generativa sin retorno medible | 95% |
| Pruebas de concepto que no llegan a despliegue amplio | 88% |
| Proyectos de IA agéntica que se cancelarán antes de 2028 | 40% |
Ninguna de las causas que enumera Gartner es un problema del modelo. Costos, valor y controles son problemas de sistema, y los tres viven en las capas que el demo no mostró.
¿Cuáles son las 13 capas?
Trece, agrupadas en cinco funciones. Un demo suele tener las dos primeras.
Lo que el usuario toca
| Capa | Qué pregunta responde | Qué se rompe sin ella |
|---|---|---|
| Interfaz | ¿Dónde ocurre la conversación y en qué canal está el cliente? | El sistema funciona pero nadie lo usa, porque exige que el usuario vaya a un lugar nuevo |
Lo que decide
| Capa | Qué pregunta responde | Qué se rompe sin ella |
|---|---|---|
| Orquestación de agentes | ¿Quién hace cada paso y en qué orden? | Un solo agente intenta todo, y los errores se multiplican paso a paso |
| Reglas de negocio | ¿Qué es cierto en esta empresa y no es negociable? | El modelo improvisa políticas de descuento, plazos y garantías que nadie aprobó |
| Enrutamiento de modelos | ¿Qué tarea merece qué modelo? | Se paga precio de modelo grande por trabajo de modelo pequeño, y la factura de producción llega multiplicada |
Lo que sabe
| Capa | Qué pregunta responde | Qué se rompe sin ella |
|---|---|---|
| Contexto y memoria | ¿Qué recuerda de este cliente y de esta conversación? | El cliente repite su historia en cada interacción |
| Fundación de datos | ¿De dónde sale lo que afirma y qué tan fresco está? | Responde con seguridad total sobre un catálogo de hace ocho meses |
| Herramientas conectadas | ¿Qué puede hacer además de escribir? | Describe la acción en lugar de ejecutarla, y alguien la hace a mano |
Lo que lo mantiene honesto
| Capa | Qué pregunta responde | Qué se rompe sin ella |
|---|---|---|
| Puntos de aprobación | ¿Qué no puede decidir solo? | Una acción irreversible se ejecuta sin que nadie la haya autorizado |
| Pruebas y evaluaciones | ¿Cómo sé que la respuesta es buena? | La calidad se juzga por anécdota y una mejora aparente esconde una regresión |
| Seguridad y accesos | ¿Quién puede ver qué? | El agente contesta con datos de un cliente a otro cliente |
| Trazas y registros | ¿Qué pasó exactamente en este caso? | Un incidente no se puede reproducir, así que tampoco se puede corregir |
Lo que lo mejora
| Capa | Qué pregunta responde | Qué se rompe sin ella |
|---|---|---|
| Ciclos de aprendizaje | ¿Cómo vuelve el error al sistema? | El mismo fallo se repite durante meses porque nadie lo devuelve al diseño |
| Refinamiento constante | ¿Quién lo mantiene cuando cambien los modelos? | El sistema se congela en la versión del día del lanzamiento y envejece solo |
¿Cuál es la capa que casi todos se saltan?
Las evaluaciones. Y hay un dato que lo muestra con una precisión incómoda.
El reporte State of Agent Engineering de LangChain encontró que el 89% de los equipos con agentes ya tiene observabilidad instrumentada, pero solo el 52% corre evaluaciones offline y apenas el 37% corre evaluaciones online [3].
Datos
| Práctica | Equipos |
|---|---|
| Tienen observabilidad instrumentada | 89% |
| Corren evaluaciones offline | 52% |
| Corren evaluaciones online | 37% |
La distancia entre 89 y 37 es una mentalidad que LangChain describe bien: lanzar y mirar. Tener la traza sin la evaluación es tener la grabación de la cámara sin que nadie la revise. Sirve para investigar después del incidente, no para evitarlo.
Del lado ejecutivo el número acompaña: solo la mitad de los ejecutivos verifica con regularidad la calidad de lo que produce la IA [5].
¿La ambición va más rápido que la capacidad?
Bastante más rápido, y esa distancia es donde se cancelan los proyectos.
Datos
| Hoy | Planeado a dos años | Delta | |
|---|---|---|---|
| Organizaciones con agentes desplegados | 17% | 60% | 43% |
Pasar de 17 a 60 en dos años no es un problema de modelos, que están disponibles para cualquiera con una tarjeta de crédito. Es un problema de las once capas.
¿Un proyecto pequeño necesita las trece?
No, y exigirlas desde el día uno es una forma cara de no lanzar nunca.
Aquí está el límite honesto de este marco: la mayoría de los proyectos no debe construir trece capas antes de tener un usuario. Lo que sí importa es distinguir qué es barato agregar después y qué no.
Obligatorio desde el primer día, porque agregarlo después implica rehacer: fundación de datos, seguridad y accesos, y trazas. Los tres definen la forma del sistema. Meter control de accesos a un sistema que ya guarda todo junto es un proyecto, no un ajuste.
Se agrega cuando el uso lo exige: orquestación, enrutamiento de modelos, memoria, ciclos de aprendizaje. Construirlos antes de saber qué pasa en producción es diseñar para un problema imaginado.
Nunca es opcional, sin importar el tamaño: puntos de aprobación para acciones irreversibles. Un agente pequeño que puede emitir una nota crédito necesita el mismo control que uno grande.
Cómo lo aplicamos en MasterDragon
Empezamos por la capa que más duele perder, no por la que mejor se demuestra.
En la práctica eso significa que la primera conversación de un proyecto no es sobre el modelo. Es sobre qué acciones serían irreversibles, qué datos no pueden cruzarse entre clientes, y cómo vamos a saber que el sistema empeoró antes de que nos lo diga un cliente molesto. Con eso definido, el agente es la parte rápida.
También significa que entregamos con las trazas encendidas y con un conjunto de casos de evaluación desde el primer despliegue, aunque sean veinte casos escritos a mano. Veinte casos que corren en cada cambio valen más que un tablero de observabilidad que nadie mira.
Si estás evaluando una propuesta de IA y quieres saber cuántas de estas capas incluye, habla con nuestros ingenieros antes de firmar. Puedes empezar por cómo construimos tu software y revisar nuestro portafolio de productos AI-native ya lanzados. La discusión sobre cuánta autonomía darle a cada agente la desarrollamos en autonomía por diseño, la de cómo diseñar el sistema para poder cambiarlo por partes en arquitectura empresarial componible, y por qué usar la herramienta no basta en adopción no es adaptación.
Referencias
- Gartner. (2025, 25 de junio). Gartner predicts over 40% of agentic AI projects will be canceled by end of 2027. https://www.gartner.com/en/newsroom/press-releases/2025-06-25-gartner-predicts-over-40-percent-of-agentic-ai-projects-will-be-canceled-by-end-of-2027
- International Data Corporation. (2025). Estimación sobre pruebas de concepto de IA que no alcanzan despliegue amplio, ampliamente citada en prensa especializada.
- LangChain. (2026). State of Agent Engineering. https://www.langchain.com/state-of-agent-engineering
- Project NANDA, Massachusetts Institute of Technology. (2025). The GenAI Divide: State of AI in Business 2025.
- Cantrell, S., Domergue, C., Dake, A., Murphy, J., Sundholm, T., y Gustafson, M. (2026, 9 de julio). AI adoption to adaptation. Deloitte Insights. https://www.deloitte.com/us/en/insights/topics/talent/ai-adoption-to-ai-adaptation.html

