Medellín, Colombia · UTC−5 · Operación remota en Latinoamérica y Estados Unidos hello@quarl.co ES · EN
quarl EN

RAG que responde bien, y sabe cuándo callarse

Retrieval-Augmented Generation conecta un modelo de lenguaje con la información real de la empresa. Bien hecho, responde con fuentes verificables. Mal hecho, responde con seguridad sobre lo que no sabe.

2M+ usuarios atendidos por el RAG que operamos en producción · 3 años sosteniéndolo, que es donde aparecen los fallos reales · 10 países con catálogos e idiomas distintos

  • Ingesta
  • Chunking
  • Embeddings
  • Búsqueda híbrida
  • Reranking
  • Filtrado por metadata
  • RAGAS
  • Citación
Contáctanos Cómo trabajamos Gratis, sin venta · la propuesta llega en 48 horas

Construido sobre

  • Anthropic
  • Claude
  • Google Gemini
  • Google Cloud
  • LangChain
  • LangGraph
  • PostgreSQL
  • Qdrant
  • Datadog

Un equipo de ingeniería que ya estuvo del otro lado

Noventa segundos: quiénes somos, cómo trabajamos y qué recibís al final.

De los documentos de tu empresa a un sistema que responde y ejecuta

Contratos, tarifarios, correos, el CRM: lo que ya tenés se convierte en respuestas con fuente y en agentes que hacen el trabajo. Elegí un caso y mirá el recorrido.

Ejemplo: un cliente pregunta qué cubre su seguro. El sistema le responde con la página exacta del contrato y abre el caso.

01Tus documentos

Condicionado_2026.pdf84 pág
Exclusiones_auto.pdf12 pág
Correos_siniestros1.240
ERP · pólizas38.400

Se conectan por API o se cargan. Nada sale de tu infraestructura si el caso lo exige.

02Preparación

Normalizar
Fragmentar
Etiquetarproducto = auto_premium
Hacer buscable

84 págs → 612 fragmentos

03Búsqueda

94 de 100encuentra el fragmento correcto
142 mstarda

Busca por significado y por palabra exacta, y filtra por la etiqueta antes de elegir.

04Respuesta con fuente

¿Cubre el robo del carro en un parqueadero público?
Sí, con deducible del 10 %. Fuente: Condicionado 2026, cláusula 4.3.

responde con fuente · 91 de 100

05Agente que ejecuta

  1. Consultó · póliza 88213
  2. Leyó · cláusula 4.3
  3. Decidió · abrir siniestro
  4. Pidió confirmación · humano
  5. Ejecutó · creó el caso en el ERP

Deslizar para ver el recorrido

Qué es RAG

Buscar primero, responder después

Un modelo de lenguaje sabe de todo menos de la empresa: no conoce sus precios, su inventario, sus políticas ni el estado de un pedido. RAG resuelve eso invirtiendo el orden: primero busca en esa información, después redacta la respuesta usando únicamente lo que encontró, y cita de dónde lo sacó.

La idea es simple; la ejecución es donde se decide todo. Un RAG mediocre y uno bueno se ven idénticos en la demo, y se separan en el mes tres, cuando llegan las preguntas que nadie ensayó.

Lo que encontramos casi siempre en un RAG que no funciona

01

Responde bien, sobre la entidad equivocada

El fallo más común y el más peligroso, porque la respuesta suena correcta y nadie la audita. Pasa porque «precio del plan Premium» y «precio del plan Básico» son casi idénticos en el espacio vectorial. Lo arreglamos extrayendo metadata estructurada en la ingesta y filtrando por entidad antes de rankear.

02

Se inventa cuando no sabe

Un modelo prefiere una respuesta plausible antes que admitir ignorancia. Lo corregimos con restricciones de fundamento, citación obligatoria del fragmento de origen y negativa explícita cuando la recuperación vuelve vacía.

03

Nadie sabe si responde bien

Si el proveedor no puede mostrar un número de calidad, no es que el número esté malo: nunca se midió. Empezamos por ahí: conjunto de referencia y medición corriendo en cada cambio.

04

La factura crece más rápido que el uso

Porque a cada pregunta se le manda el modelo más caro con todo el contexto disponible «por si acaso».

05

La información está vieja y nadie lo notó

La carga fue manual, se hizo una vez, y nadie definió cómo se actualiza.

01

Servicios

Qué hacemos con RAG

01 4–8 semanas

Sistema RAG desde cero

Pipeline completo: ingesta y normalización, estrategia de fragmentación según la estructura real del corpus, embeddings, almacén vectorial, búsqueda híbrida con reranking, generación con fundamento y evaluación.

02 1 semana

Diagnóstico de un RAG existente

Conjunto de referencia con preguntas reales, medición separada de recuperación y generación, y los fallos ordenados por impacto con su arreglo.

03 3–5 semanas

Optimización de recuperación

Cuando el sistema existe pero encuentra mal: reescritura de consultas, filtrado por metadata, reranking, ajuste de la estrategia de fragmentación.

04 2–3 semanas

Capa de evaluación

Conjunto de referencia, métricas de recuperación y de generación, pruebas A/B entre configuraciones y trazabilidad. Para que el equipo pueda cambiar sin romper.

Cómo se mide

Los números que exigimos antes de decir que funciona

Trabajamos con RAGAS y con modelo como juez, además de las métricas clásicas de recuperación.

  • Recuperación

    recall@k · MRR · NDCG

  • Generación

    Fundamento · Fidelidad · Relevancia

  • Operación

    Costo por consulta · Latencia p95

De dónde sale esto

No es teoría. Operamos un RAG durante tres años sobre una base de conocimiento de producto, puntos, promociones y políticas, con alta similitud entre entidades, para más de dos millones de usuarios en diez países.

El fallo de contaminación entre entidades —el número uno de la lista de arriba— lo resolvimos ahí, con metadata estructurada en ingesta y filtrado previo al ranking. Es la clase de problema que solo aparece cuando el sistema lleva meses en producción y el catálogo creció.

Servicios relacionados

IA para seguros

IA para seguros

Recuperación sobre condicionados y pólizas, medida cláusula por cláusula.

IA para salud

IA para salud

Documentación clínica y administrativa, con negativa explícita antes que suposición.

IA para el sector legal

IA para el sector legal

Cada respuesta con el artículo o la cláusula exacta de la que sale.

Rescate de proyectos

La IA responde mal. Casi nunca es culpa del modelo.

El sistema ya está en producción y responde mal. Lo medimos y determinamos qué corregir.

En resumen

Cuatro cosas antes de la llamada

  1. 01

    RAG —generación aumentada por recuperación— invierte el orden: busca primero en la información de la empresa y solo después redacta, citando la fuente de cada afirmación.

  2. 02

    El fallo más frecuente de un RAG es responder correctamente sobre la entidad equivocada, porque entidades parecidas quedan casi superpuestas en el espacio vectorial. Se corrige con metadata estructurada en la ingesta y filtrado previo al ranking.

  3. 03

    Quarl mide recuperación y generación por separado: recall@k, MRR y NDCG por un lado; fundamento, fidelidad y relevancia por el otro, con RAGAS y modelo como juez.

  4. 04

    El antecedente es un RAG operado tres años sobre un catálogo con alta similitud entre entidades, para dos millones de usuarios en diez países.

Por acá entran los datos

Un sistema de IA vale lo que valen las fuentes que tiene detrás. Estos son los conectores estándar; cualquier cosa con API o base de datos se conecta igual, y lo que no tiene API se resuelve por archivo.

SAP

ERP corporativo

ERP

Oracle

ERP y base de datos

ERP

NetSuite

ERP en la nube

ERP

Salesforce

CRM y servicio

CRM

HubSpot

CRM y marketing

CRM

PostgreSQL

Base de datos y pgvector

Bases de datos

Un RAG en producción, tres años, dos millones de usuarios

Construimos y operamos el asistente de una plataforma de lealtad con más de dos millones de usuarios activos en diez países.

Hicimos el pipeline completo: ingesta y normalización de documentos, fragmentación, generación de embeddings, almacén vectorial sobre Azure AI Search y Pinecone, y recuperación con generación fundamentada sobre LangChain.

Lo sostuvimos con más del 99% de disponibilidad durante tres años.

Sistemas RAG →

Preguntas frecuentes

01 ¿Qué es exactamente RAG y por qué no basta con ChatGPT?

RAG significa Retrieval-Augmented Generation: generación aumentada por recuperación. En vez de pedirle al modelo que responda de memoria, el sistema busca primero en la información de la empresa, selecciona los fragmentos relevantes y le pide al modelo que redacte usando solo eso. ChatGPT por su cuenta no conoce esos precios ni esas políticas: ante la pregunta responde genérico o directamente inventa. Con RAG la respuesta viene de la documentación propia y se puede verificar porque cita la fuente.

02 ¿Es mejor RAG o afinar el modelo con nuestros datos?

Casi siempre RAG, y la razón es práctica: la información cambia. Afinar un modelo lo enseña a hablar de cierta forma, no a memorizar datos actualizables — cuando cambian los precios habría que reentrenar. RAG separa el conocimiento del modelo, así que actualizar es reindexar. El afinado tiene sentido para tono, formato o dominios muy específicos, y a veces se combinan. Cuál corresponde queda definido en la primera llamada.

03 ¿Cuánta información necesitamos para que valga la pena?

No hay un mínimo estricto, pero por debajo de unas veinte preguntas frecuentes con información que casi no cambia, un RAG es sobreingeniería: una plataforma de suscripción resuelve eso más barato. RAG empieza a rendir cuando el corpus es grande, cambia seguido, tiene muchas entidades parecidas entre sí, o cuando una respuesta equivocada tiene costo real.

04 ¿Qué formatos de documento soportan?

PDF, Word, Excel, HTML, Markdown, texto plano, páginas web y bases de datos. También documentos escaneados mediante reconocimiento óptico. Lo que más trabajo da no es el formato sino la estructura: tablas, documentos con muchas secciones y catálogos con variantes requieren estrategias de fragmentación distintas, y eso se define mirando el corpus real, no por defecto.

05 ¿Cómo evitan que se invente respuestas?

Con cuatro cosas combinadas: restricciones de fundamento en el prompt de sistema, citación obligatoria del fragmento que respalda cada afirmación, negativa explícita cuando la búsqueda no devuelve nada relevante, y medición de fundamento sobre un conjunto de referencia para detectar cuándo el sistema empieza a alejarse de las fuentes. Ninguna de las cuatro sola alcanza.

06 ¿Cada cuánto hay que actualizar el índice?

Depende de qué tan rápido cambie la información. Para catálogos y precios solemos programar reindexación diaria o por evento; para políticas y documentación, semanal. Lo importante es que la ingesta sea reproducible y tenga alertas cuando una fuente lleva demasiado sin refrescarse, porque el modo de fallo más común no es que se rompa: es que quede vieja sin que nadie lo note.

07 ¿Nuestra información sale de nuestra infraestructura?

Solo si el cliente lo decide. Podemos desplegar sobre Azure OpenAI o Amazon Bedrock dentro de su propia suscripción, con el almacén vectorial en su nube, de forma que la información nunca sale de ese perímetro. En cualquier configuración usamos planes empresariales donde los datos enviados por API no se usan para entrenar, y filtramos datos personales antes del envío.

08 ¿Cuánto cuesta operar un RAG al mes?

El consumo del modelo más el almacén vectorial. Para una empresa mediana suele ubicarse entre 300.000 y 2.000.000 COP mensuales según volumen de consultas y tamaño del corpus. El enrutamiento de modelos —uno barato para clasificar y resumir, uno capaz para la respuesta final— y el recorte de contexto existen precisamente para mantener esa cifra predecible cuando el uso crece.

Quince minutos. Una respuesta concreta.

Se arregla, se construye, o no vale la pena. Y si el diagnóstico no llega a tres hallazgos accionables, no se cobra.

Sin logos prestados y sin testimonios escritos por nosotros.

Contáctanos