Medellín, Colombia · UTC−5 · Operación remota en Latinoamérica y Estados Unidos hello@quarl.co ES EN
Ingeniería de IA · Consultoría y operación

IA que llega a producción

Diseñamos, medimos y operamos sistemas de IA: agentes, RAG y aplicaciones sobre modelos de lenguaje. También software a la medida, apps móviles e integraciones. Llevamos tres años operando un RAG para dos millones de usuarios activos en diez países.

Capacidades técnicas
RAGLangGraphModel Context Protocolpgvectorrecall@kRAGASAnthropic ClaudeAzure OpenAILangSmith
2.000.000usuarios activos atendidos
10países en operación
99%+de disponibilidad sostenida
3hallazgos accionables o el diagnóstico no se cobra

En resumen

El 95% de los pilotos de IA no da retorno medible, y el 28% se termina de construir sin entregar el valor esperado. El problema del sector no es adoptar IA: es sostenerla.

MIT · The GenAI Divide · 2025RAND · 2024

Quarl diseña, mide y opera sistemas de IA en producción, más software a la medida, apps móviles e integraciones.

Tres años operando un RAG para dos millones de usuarios en diez países, con 99%+ de disponibilidad.

Propuesta con alcance, precio y fecha cerrados 48 horas después de una llamada de quince minutos.

Si el diagnóstico no llega a tres hallazgos accionables, no se cobra.

Se compra mucha IA y llega poca a producción

Estos números no son nuestros: son del mercado, y cada uno dice de dónde sale.

95%de los pilotos de IA no da retorno medible — MIT, 2025
34%de los proyectos se abandona antes de producción — RAND, 2024
28%se termina de construir y no entrega el valor esperado — RAND, 2024
la tasa de fallo de un proyecto de software normal — RAND, 2024

Montar la demo es un fin de semana. Sostenerla es otro oficio.

Un prototipo que responde bien a cinco preguntas preparadas se arma en dos días. El problema aparece en el mes tres, con preguntas que nadie previó y con información que cambió: el asistente contesta sobre la entidad equivocada, se inventa lo que no sabe, la factura del modelo se dispara y nadie tiene un número que diga si mejoró o empeoró.

Esa distancia —entre el cuaderno de Jupyter y el sistema que aguanta ocho meses— es donde se pierde el 28% que sí llega a construirse. No se cruza leyendo documentación: se cruza habiendo estado del otro lado cuando la base de conocimiento creció cuatro veces y aparecieron los fallos que ningún tutorial menciona.

Medimos si la IA responde bien, y mostramos el número

  • Preguntas reales de los usuarios, con la respuesta correcta validada por el equipo interno. Es lo que permite saber si un cambio mejoró o empeoró el sistema, en lugar de opinarlo.
  • Por un lado, si el sistema encuentra el documento correcto: recall@k, MRR, NDCG. Por el otro, si la respuesta se sostiene en ese documento: fundamento, fidelidad y relevancia. El sistema puede fallar en cualquiera de las dos, y el arreglo es distinto en cada caso.
  • Cuando la búsqueda vuelve vacía, el sistema lo dice y escala a una persona, en lugar de improvisar una respuesta.
  • Enrutamiento por tarea y recorte de contexto, para que la factura no crezca al mismo ritmo que el uso.
  • Trazas por paso, detección de alucinación y alertas, para ver los fallos antes de que los reporte un usuario.

Un RAG en producción, tres años, dos millones de usuarios

Construimos y operamos el asistente de una plataforma de lealtad con más de dos millones de usuarios activos en diez países.

Hicimos el pipeline completo: ingesta y normalización de documentos, fragmentación, generación de embeddings, almacén vectorial sobre Azure AI Search y Pinecone, y recuperación con generación fundamentada sobre LangChain.

El fallo que más costó resolver: el sistema devolvía el fragmento correcto sobre el producto equivocado, porque «precio del plan Premium» y «precio del plan Básico» quedan casi encima en el espacio vectorial. Lo arreglamos extrayendo metadata estructurada en el momento de la ingesta y filtrando por entidad antes de rankear, en lugar de confiar en la similitud semántica.

Lo sostuvimos con más del 99% de disponibilidad durante tres años.

Alcance cerrado, precio cerrado, fecha cerrada

  1. Llamada de 15 minutos, sin costoLa llamada sirve para poner sobre la mesa qué hay que construir o qué dejó de funcionar. Si no tiene sentido hacerlo con IA, lo decimos ahí mismo. Se agenda en línea, sin intercambio de mensajes.
  2. Propuesta en 48 horasCon alcance, precio y fecha fijos. Si el alcance cambia después, se cotiza aparte y se aprueba antes — nunca aparece como sorpresa en la factura.
  3. Construcción con avances semanalesHay algo funcionando desde la primera semana. Nada de desaparecer un mes para volver con una sorpresa.
  4. Entrega, documentación y un mes de soporteEl código, la documentación y el conjunto de evaluación quedan en manos del cliente, para que su equipo pueda mantener y verificar el sistema sin depender de nosotros.

Con qué construimos

Seis capas. La cuarta es la que casi nadie entrega, y es la que dice si el sistema sirve.

Modelos

Anthropic Claude · OpenAI · Google Gemini · Azure OpenAI · Amazon Bedrock

Se elige por tarea y por costo, no por marca

Orquestación

LangGraph · LangChain · LlamaIndex · Model Context Protocol

Un grafo con estado, no una cadena de prompts

Recuperación y datos

pgvector · Pinecone · Azure AI Search · Qdrant · PostgreSQL

Acá se decide si encuentra el documento correcto

Evaluación y observabilidad

RAGAS · LangSmith · recall@k · MRR · NDCG · groundedness · Datadog · Sentry

La capa que convierte una impresión en un número

Producto

TypeScript · Node.js · NestJS · React · Next.js · Astro · React Native · Expo · Python · FastAPI · .NET Core · C# · GraphQL · WebSockets

Lo que termina usando la gente

Infraestructura

Docker · Azure · AWS · Google Cloud · GitHub Actions · n8n

Dentro de la nube del cliente cuando el caso lo exige

Desde

2.500.000 COP

El proyecto más pequeño que tomamos. Por debajo de esa cifra casi siempre te sirve una plataforma de suscripción, y te lo decimos.

  • A cuántos de tus sistemas se conecta
  • Si escribe en ellos o solo lee
  • Si hay que medir el resultado

Cada página de servicio dice desde cuánto arranca. El número cerrado llega por escrito 48 horas después de la llamada de 15 minutos.

Preguntas frecuentes

¿En qué se diferencian de una agencia que cobra suscripción mensual?

Ellas venden acceso a una herramienta; nosotros entregamos un sistema que es del cliente, con su código y su documentación. Las plataformas de suscripción funcionan bien para un bot de preguntas frecuentes sencillo — para ese caso salen más baratas y son la opción correcta. La diferencia aparece cuando la información es grande, cambia seguido, o cuando una respuesta equivocada cuesta un cliente: ahí hace falta medir la calidad de las respuestas, y eso es ingeniería, no configuración.

¿Cómo se cotiza un proyecto de IA?

Con alcance cerrado, precio cerrado y fecha cerrada, en una propuesta que llega 48 horas después de la primera llamada. El precio lo determinan tres cosas: el volumen de información, cuántos sistemas hay que integrar y qué nivel de precisión exige el caso. Si el alcance cambia durante el proyecto se cotiza aparte y se aprueba antes — nunca aparece como sorpresa en la factura. La llamada de diagnóstico no tiene costo y de ahí sale el rango.

¿Trabajan con empresas fuera de Colombia?

Sí. Estamos en Medellín (UTC−5), con solapamiento completo con el horario del este y centro de Estados Unidos y con toda América Latina. Buena parte de nuestro trabajo de los últimos años fue remoto con equipos en México, Estados Unidos y Colombia.

¿Nuestra información se usa para entrenar modelos?

No. Usamos planes empresariales donde los datos enviados por API no se emplean para entrenamiento. Cuando el caso lo exige desplegamos sobre Azure OpenAI o Amazon Bedrock dentro de la suscripción del cliente, sin que la información salga de su infraestructura, y aplicamos filtrado de datos personales antes de enviar nada al modelo.

¿Qué pasa si ya tenemos algo construido y no funciona?

Es el caso más frecuente que nos llega. Conviene empezar por el diagnóstico en vez de reconstruir: el modelo de lenguaje casi nunca es el problema, lo es cómo se preparó y se recupera la información, y esa parte se puede rehacer sin botar el resto. En una semana queda claro si se rescata o conviene rehacerlo, con números que sustenten la decisión.

¿Trabajan con agencias y equipos de producto?

Sí, en dos formatos: proyecto cerrado con entregable definido, o retainer integrado al equipo, los procesos y el repositorio de la agencia. Para agencias trabajamos en blanco, sin marca propia, y hablamos con el cliente final solo si la agencia lo pide.

¿Cuánto tarda ver algo funcionando?

Una automatización, dos a tres semanas. Un asistente sobre la información de la empresa, tres a seis. Un sistema con integraciones a los sistemas de negocio, seis a ocho. En todos los casos hay algo corriendo desde la primera semana, no al final.

¿Qué pasa cuando el proyecto termina?

Queda todo del lado del cliente: código, documentación, infraestructura y el conjunto de preguntas de evaluación para verificar la calidad sin nosotros. Incluimos un mes de soporte para ajustar lo que salga en el uso real, y a partir de ahí el mantenimiento es opcional y se cotiza aparte.

Agendar 15 minutos

Una llamada para poner sobre la mesa qué se está construyendo o qué dejó de funcionar. Termina con una respuesta concreta: se arregla, se construye, o no vale la pena.