Medellín, Colombia · UTC−5 · Operación remota en Latinoamérica y Estados Unidos contacto@quarl.co ES EN
Ingeniería de IA · Consultoría y operación

IA que llega a producción, no a la demo

El 73% de los proyectos de IA empresarial no alcanza producción, y el MIT mide una mortalidad del 95% en pilotos. Diseñamos, medimos y operamos los que sí lo logran: tres años de operación continua de una arquitectura RAG para dos millones de usuarios activos en diez países.

Capacidades técnicas
RAGLangGraphModel Context Protocolpgvectorrecall@kRAGASAnthropic ClaudeAzure OpenAILangSmith
2.000.000usuarios activos atendidos
10países en operación
3 añosde operación continua
99%+de disponibilidad sostenida

En resumen

  • El 73% de los proyectos de IA empresarial no llega a producción y el MIT mide una mortalidad del 95% en pilotos: el problema del sector no es adoptar IA, es sostenerla.
  • Quarl diseña, mide y opera sistemas de IA en producción — agentes, RAG y aplicaciones sobre modelos de lenguaje — más software a la medida, aplicaciones móviles e integraciones.
  • El antecedente es una arquitectura RAG operada durante tres años para dos millones de usuarios activos en diez países, con 99%+ de disponibilidad sostenida.
  • Once servicios en dos grupos, con alcance, precio y fecha cerrados en una propuesta que llega 48 horas después de una llamada de 15 minutos sin costo.

Antecedente de operación

Plataforma de lealtad de FEMSA

Tres años de operación del sistema en producción, no una entrega y una salida.

Contaminación entre entidades

El fallo más frecuente de las arquitecturas RAG, resuelto con metadata estructurada en la ingesta.

Alcance y fecha cerrados

La propuesta llega en 48 horas con alcance, precio y fecha fijos. Si el alcance cambia, se cotiza aparte y se aprueba antes.

El problema

Se compra mucha IA y llega poca a producción

Estos números no son nuestros: son del mercado. Y explican por qué la mayoría de las implementaciones decepcionan.

73%de los proyectos de IA empresarial no llega a producción
95%de los pilotos se queda en el camino, según el MIT
21%de las empresas se considera preparada para adoptar IA generativa
1 de 3empresas dañará su servicio al cliente en 2026 por IA mal implementada
Por qué pasa

Montar la demo es un fin de semana. Sostenerla es otro oficio.

Un prototipo que responde bien a cinco preguntas preparadas se arma en dos días. El problema aparece en el mes tres, con preguntas que nadie previó y con información que cambió: el asistente contesta sobre la entidad equivocada, se inventa lo que no sabe, la factura del modelo se dispara y nadie tiene un número que diga si mejoró o empeoró.

Esa distancia —entre el cuaderno de Jupyter y el sistema que aguanta ocho meses— es donde muere el 73%. No se cruza leyendo documentación. Se cruza habiendo estado del otro lado cuando la base de conocimiento creció cuatro veces y aparecieron los fallos que ningún tutorial menciona.

Cómo trabajamos distinto

Medimos lo que los demás prometen

  • Conjunto de evaluación desde el primer día. Preguntas reales de tus usuarios con la respuesta correcta validada por tu equipo. Sin esto no hay forma de saber si un cambio mejoró o empeoró el sistema.
  • Métricas separadas de recuperación y generación. recall@k, MRR y NDCG por un lado; fundamento, fidelidad y relevancia por el otro. Son dos enfermedades distintas con dos tratamientos distintos.
  • Negativa explícita. Cuando la búsqueda vuelve vacía, el sistema lo dice y escala a una persona. Un asistente que admite que no sabe vale diez veces más que uno que improvisa.
  • Costo por consulta bajo control. Enrutamiento por tarea y recorte de contexto, para que la factura no haga inviable escalar.
  • Observabilidad desde el despliegue. Trazas por paso, detección de alucinación y alertas. Un sistema que falla en silencio es peor que no tenerlo.
El caso que respalda esto

Un RAG en producción, tres años, dos millones de usuarios

Construimos y operamos el asistente de una plataforma de lealtad de FEMSA —la empresa número uno de México por ingresos— con más de dos millones de usuarios activos en diez países.

El pipeline completo fue nuestro: ingesta y normalización de documentos, fragmentación, generación de embeddings, almacén vectorial sobre Azure AI Search y Pinecone, recuperación y generación con fundamento sobre LangChain.

El fallo que más costó resolver: el sistema devolvía el fragmento correcto sobre el producto equivocado, porque «precio del plan Premium» se parece muchísimo a «precio del plan Básico» en el espacio vectorial. Se arregló extrayendo metadata estructurada en el momento de la ingesta y filtrando por entidad antes de rankear, en lugar de confiar en la similitud semántica. Es el fallo número uno de los sistemas RAG y casi nadie lo menciona.

Se sostuvo con más del 99% de uptime durante tres años.

Proceso

Alcance cerrado, precio cerrado, fecha cerrada

  1. Llamada de 15 minutos, sin costoNos contás qué querés construir o qué dejó de funcionar. Si no tiene sentido hacerlo con IA, te lo decimos en esa misma llamada. Se agenda en línea, sin intercambio de mensajes.
  2. Propuesta en 48 horasCon alcance, precio y fecha fijos. Si el alcance cambia después, se cotiza aparte y se aprueba antes — nunca aparece como sorpresa en la factura.
  3. Construcción con avances semanalesVes algo funcionando desde la primera semana. Nada de desaparecer un mes para volver con una sorpresa.
  4. Entrega, documentación y un mes de soporteEl código, la documentación y el conjunto de evaluación quedan en tus manos, para que tu equipo pueda mantener y verificar el sistema sin depender de nosotros.
Stack

Con qué construimos

LangChainLangGraphLlamaIndexModel Context ProtocolOpenAIAnthropic ClaudeGoogle GeminiAzure OpenAIAmazon BedrockPineconepgvectorAzure AI SearchQdrantRAGASLangSmithDatadogSentryn8nTypeScriptNode.jsNestJSReactNext.jsAstroReact NativeExpoPythonFastAPI.NET CoreC#PostgreSQLGraphQLWebSocketsDockerAzureAWSGoogle CloudGitHub Actions

Preguntas frecuentes

¿En qué se diferencian de una agencia que cobra suscripción mensual?

Ellas venden acceso a una herramienta; nosotros entregamos un sistema que es tuyo, con su código y su documentación. Las plataformas de suscripción funcionan bien para un bot de preguntas frecuentes sencillo — si eso necesitás, contratalas, salen más baratas. La diferencia aparece cuando tu información es grande, cambia seguido, o cuando una respuesta equivocada te cuesta un cliente: ahí hace falta medir la calidad de las respuestas, y eso es ingeniería, no configuración.

¿Cómo se cotiza un proyecto de IA?

Con alcance cerrado, precio cerrado y fecha cerrada, en una propuesta que llega 48 horas después de la primera llamada. El precio lo determinan tres cosas: el volumen de información, cuántos sistemas hay que integrar y qué nivel de precisión exige el caso. Si el alcance cambia durante el proyecto se cotiza aparte y se aprueba antes — nunca aparece como sorpresa en la factura. La llamada de diagnóstico no tiene costo y de ahí sale el rango.

¿Trabajan con empresas fuera de Colombia?

Sí. Estamos en Medellín (UTC−5), con solapamiento completo con el horario del este y centro de Estados Unidos y con toda América Latina. Buena parte de nuestro trabajo de los últimos años fue remoto con equipos en México, Estados Unidos y Colombia.

¿Nuestra información se usa para entrenar modelos?

No. Usamos planes empresariales donde los datos enviados por API no se emplean para entrenamiento. Cuando el caso lo exige desplegamos sobre Azure OpenAI o Amazon Bedrock dentro de tu propia suscripción, sin que la información salga de tu infraestructura, y aplicamos filtrado de datos personales antes de enviar nada al modelo.

¿Qué pasa si ya tenemos algo construido y no funciona?

Es el caso más frecuente que nos llega. Empezá por el diagnóstico en vez de reconstruir: el modelo de lenguaje casi nunca es el problema, lo es cómo se preparó y se recupera la información, y esa parte se puede rehacer sin botar el resto. En una semana sabés si se rescata o conviene rehacerlo, con números que sustenten la decisión.

¿Trabajan con agencias y equipos de producto?

Sí, en dos formatos: proyecto cerrado con entregable definido, o retainer integrado a tu equipo, tus procesos y tu repositorio. Para agencias trabajamos en blanco, sin marca propia, y hablamos con tu cliente solo si ustedes quieren.

¿Cuánto tarda ver algo funcionando?

Una automatización, dos a tres semanas. Un asistente sobre tu información, tres a seis. Un sistema con integraciones a tus sistemas de negocio, seis a ocho. En todos los casos ves algo corriendo desde la primera semana, no al final.

¿Qué pasa cuando el proyecto termina?

Queda todo tuyo: código, documentación, infraestructura y el conjunto de preguntas de evaluación para que puedas verificar la calidad sin nosotros. Incluimos un mes de soporte para ajustar lo que salga en el uso real, y a partir de ahí el mantenimiento es opcional y se cotiza aparte.

Agendá 15 minutos

Contanos qué estás construyendo o qué dejó de funcionar. Salís de la llamada con una respuesta concreta: se arregla, se construye, o no vale la pena.