Medellín, Colombia · UTC−5 · Operación remota en Latinoamérica y Estados Unidos hello@quarl.co ES · EN
quarl EN

La IA responde mal. Casi nunca es culpa del modelo.

Se inventa datos, contesta sobre la entidad equivocada, cuesta más de lo previsto, o el equipo simplemente dejó de confiar. Lo medimos, encontramos por qué falla y lo llevamos a calidad de producción.

28% se construye y no entrega el valor esperado — RAND · 95% de los pilotos no da retorno medible — MIT · 1 semana para saber si se rescata o conviene rehacerlo

  • Diagnóstico medible
  • Conjunto de referencia
  • RAGAS
  • Análisis de costo
  • Informe accionable
Contáctanos Cómo trabajamos Gratis, sin venta · la propuesta llega en 48 horas

Construido sobre

  • Anthropic
  • Claude
  • Google Gemini
  • Google Cloud
  • LangChain
  • LangGraph
  • PostgreSQL
  • Qdrant
  • Datadog

Un equipo de ingeniería que ya estuvo del otro lado

Noventa segundos: quiénes somos, cómo trabajamos y qué recibís al final.

Medir antes de arreglar, y volver a medir después

Un conjunto de preguntas reales con su respuesta correcta, el sistema tal como está, y los fallos ordenados por impacto. Así se sabe qué arreglar primero y si el arreglo sirvió.

Ejemplo: primero se mide qué tan bien responde el sistema hoy, se arregla lo que más pesa, y se vuelve a medir con las mismas preguntas.

01Conjunto de referencia

Preguntas_reales.xlsx100 filas
Respuestas_esperadas100
Logs_produccion30 días
Quejas_soporte214

100 preguntas · 100 respuestas correctas

02Sistema actual

encuentra el fragmento61
responde con fundamento68
sin inventar74

03Fallos por impacto

  • Responde sobre la entidad equivocada19
  • Inventa cuando no encuentra11
  • Fragmento cortado a la mitad6
  • La fuente vieja gana a la nueva3

04Arreglo

Etiqueta por entidad en la ingesta
Negativa explícita sin respaldo
Fragmentar por sección, no por tamaño
Priorizar por fecha del documento

05Remedición

6191encuentra el fragmento
6894responde con fundamento

mismo conjunto, misma métrica

Deslizar para ver el recorrido

Una semana. El resultado son números, no opiniones.

01

Construimos el conjunto de referencia

100 preguntas reales de los usuarios, con la respuesta correcta validada por el equipo interno. Es la parte que casi ningún proveedor hace, porque son días de trabajo con la gente de la operación y no se luce en una demo.

02

Medimos recuperación y generación por separado

Distinguimos si el problema es que no encuentra la información o que la encuentra y la usa mal. Confundir las dos es la razón por la que muchos arreglos no arreglan nada.

03

Revisamos el pipeline completo

Ingesta, fragmentación, embeddings, almacén vectorial, recuperación, prompt de sistema, enrutamiento de modelos y costo por consulta. Cada etapa con su hallazgo.

04

Entregamos el informe

Los fallos ordenados por impacto, el arreglo de cada uno con su esfuerzo estimado, y una recomendación clara: se rescata o se reconstruye, con los números que la sustentan.

01

Los cinco fallos

Cinco síntomas conocidos

01

Un cliente encontró un error que nadie había visto

El asistente respondió bien, pero sobre el producto equivocado. Sonaba correcto, y nadie audita lo que suena correcto. Lo arreglamos con metadata estructurada en la ingesta y filtrado por entidad antes de rankear.

02

Contesta cualquier cosa antes que decir «no sé»

Se comprueba en diez minutos: basta preguntarle algo que no esté en la documentación. Si responde con la misma seguridad que cuando sí sabe, el sistema no tiene cómo reconocer su propio límite.

03

Nadie en la empresa puede mostrar un número

Hay opiniones sobre si mejoró o empeoró con el último cambio, y ninguna se puede contrastar contra otra. Por eso el diagnóstico arranca construyendo la medición que nunca existió.

04

El costo se volvió tema de reunión

Arrancó como una prueba barata y ahora alguien pregunta cada mes cuánto va. Casi siempre es la misma causa: una sola configuración, la más cara, para todas las preguntas.

05

El equipo dejó de usarlo

Es el síntoma final y el más caro, porque nadie levanta un ticket: vuelven a preguntarle a la persona de siempre. Detrás suele haber información que se cargó a mano una vez y quedó vieja sin que nadie lo notara.

Formatos y garantía

Qué se contrata, y con qué se queda el cliente

  • Diagnóstico

    Conjunto de referencia, medición completa e informe con fallos priorizados y su arreglo.

    1 semana

  • Remediación

    Ejecución de los arreglos priorizados, con medición del antes y el después.

    3–5 semanas

  • Reconstrucción

    Cuando rescatar cuesta más que rehacer. El diagnóstico se descuenta.

    4–8 semanas

  • La garantía

    Si el diagnóstico no llega a al menos tres hallazgos accionables —cada uno con su arreglo y su esfuerzo estimado—, no se cobra. Existe para no tener que confiar en nosotros antes de habernos visto trabajar, que es exactamente lo que pasó la vez anterior.

    Sin costo si no se cumple

  • Lo que queda

    El conjunto de referencia y el informe quedan en manos del cliente, en formato abierto: si el arreglo lo ejecuta el proveedor actual o el equipo interno, hay con qué exigirles y con qué verificar que lo hicieron.

    Del cliente, para siempre

Un RAG en producción, tres años, dos millones de usuarios

Construimos y operamos el asistente de una plataforma de lealtad con más de dos millones de usuarios activos en diez países.

Hicimos el pipeline completo: ingesta y normalización de documentos, fragmentación, generación de embeddings, almacén vectorial sobre Azure AI Search y Pinecone, y recuperación con generación fundamentada sobre LangChain.

Lo sostuvimos con más del 99% de disponibilidad durante tres años.

Sistemas RAG →

Preguntas frecuentes

01 ¿Vale la pena rescatarlo o es mejor empezar de cero?

En la mayoría de los casos se rescata, porque el modelo de lenguaje casi nunca es el problema: lo es cómo se preparó y se recupera la información, y esa parte se puede reconstruir sin botar el resto. El diagnóstico existe justamente para responder esa pregunta con datos en vez de intuición. Si la recomendación honesta es rehacerlo, lo decimos y el diagnóstico se descuenta del proyecto nuevo.

02 ¿Necesitan acceso a nuestros sistemas?

Para el diagnóstico necesitamos ver la información con la que se alimentó el sistema y una muestra de conversaciones o ejecuciones reales. Acceso a producción no hace falta. Se firma acuerdo de confidencialidad antes de recibir cualquier archivo, y si la información tiene datos personales trabajamos sobre una muestra anonimizada.

03 ¿Funciona si lo construyó otro proveedor o una herramienta no-code?

Sí, y es el caso más frecuente. Hemos trabajado sobre implementaciones hechas en n8n, Make, plataformas de chatbot con suscripción y desarrollos a la medida. El diagnóstico es el mismo porque los fallos son los mismos: la tecnología cambia, los errores de diseño no.

04 ¿Qué pasa si el problema es que nuestra información está desordenada?

Pasa seguido: cerca del 60% de las empresas que quieren implementar IA tiene procesos sin documentar e información dispersa. La IA no arregla el desorden, lo automatiza más rápido. Cuando ese es el caso queda dicho en el informe, con qué habría que ordenar primero y cuánto trabajo representa. Preferimos decirlo antes que cobrar un rescate que iba a fallar.

05 ¿Cuánto tarda en verse la mejora?

El diagnóstico toma una semana. La remediación, de tres a cinco semanas según alcance. Pero desde la primera semana de remediación ya hay medición corriendo, así que la mejora se ve como número y no como sensación. Ese es el punto de todo el proceso.

06 ¿Pueden trabajar junto a nuestro proveedor actual?

Sí. En varios casos el rol es diagnosticar y entregar los hallazgos para que el equipo que lo construyó los ejecute, y después verificar que se implementaron correctamente. No hace falta cambiar de proveedor para arreglar el sistema.

07 ¿Y si el problema es el costo, no la calidad?

Es un motivo de consulta cada vez más común. Se aborda con enrutamiento por tarea, recorte de contexto y caché de prompts, midiendo el costo por consulta antes y después. En sistemas que hemos optimizado, la reducción suele ser sustancial sin tocar la calidad percibida por el usuario.

08 ¿Qué pasa si el diagnóstico no encuentra nada?

No se cobra. La garantía es concreta: si el informe no llega a al menos tres hallazgos accionables —cada uno con su arreglo y su esfuerzo estimado—, no hay factura. En la práctica corremos poco riesgo, porque los cinco síntomas típicos aparecen casi siempre.

09 ¿Cómo empezamos?

Con una llamada de quince minutos para describir los síntomas. Con eso solo ya podemos decir si suena a alguno de los cinco síntomas típicos y qué tan grave parece. No tiene costo y no hay insistencia después.

Quince minutos. Una respuesta concreta.

Se arregla, se construye, o no vale la pena. Y si el diagnóstico no llega a tres hallazgos accionables, no se cobra.

Sin logos prestados y sin testimonios escritos por nosotros.

Contáctanos