Medellín, Colombia · UTC−5 · Operación remota en Latinoamérica y Estados Unidos hello@quarl.co ES EN
Sistemas RAG

RAG que responde bien, y sabe cuándo callarse

Retrieval-Augmented Generation conecta un modelo de lenguaje con la información real de tu empresa. Bien hecho, responde con fuentes verificables. Mal hecho, responde con seguridad sobre lo que no sabe.

Capacidades técnicas
IngestaChunkingEmbeddingsBúsqueda híbridaRerankingFiltrado por metadataRAGASCitación
2M+usuarios atendidos por el RAG que operamos en producción
3 añossosteniéndolo, que es donde aparecen los fallos reales
10países con catálogos e idiomas distintos

En resumen

  • RAG —generación aumentada por recuperación— invierte el orden: busca primero en la información de la empresa y solo después redacta, citando la fuente de cada afirmación.
  • El fallo más frecuente de un RAG es responder correctamente sobre la entidad equivocada, porque entidades parecidas quedan casi superpuestas en el espacio vectorial. Se corrige con metadata estructurada en la ingesta y filtrado previo al ranking.
  • Quarl mide recuperación y generación por separado: recall@k, MRR y NDCG por un lado; fundamento, fidelidad y relevancia por el otro, con RAGAS y modelo como juez.
  • El antecedente es un RAG operado tres años sobre un catálogo con alta similitud entre entidades, para dos millones de usuarios en diez países.

Antecedente de operación

Plataforma de lealtad de FEMSA

Tres años de operación del sistema en producción, no una entrega y una salida.

Contaminación entre entidades

El fallo más frecuente de las arquitecturas RAG, resuelto con metadata estructurada en la ingesta.

Alcance y fecha cerrados

La propuesta llega en 48 horas con alcance, precio y fecha fijos. Si el alcance cambia, se cotiza aparte y se aprueba antes.

Qué es RAG

Buscar primero, responder después

Un modelo de lenguaje sabe de todo menos de tu empresa: no conoce tus precios, tu inventario, tus políticas ni el estado de un pedido. RAG resuelve eso invirtiendo el orden: primero busca en tu información, después redacta la respuesta usando únicamente lo que encontró, y cita de dónde lo sacó.

La idea es simple. La ejecución es donde está todo. Un RAG mediocre y uno bueno se ven idénticos en la demo y se separan brutalmente en el mes tres.

Los cinco fallos

Lo que encontramos casi siempre en un RAG que no funciona

Si alguno te suena, tu problema tiene arreglo y probablemente es más barato de lo que temés.

  • Responde bien, sobre la entidad equivocada. El fallo más común y el más peligroso, porque la respuesta suena correcta y nadie la audita. Pasa porque «precio del plan Premium» y «precio del plan Básico» son casi idénticos en el espacio vectorial. Se arregla extrayendo metadata estructurada en la ingesta y filtrando por entidad antes de rankear.
  • Se inventa cuando no sabe. Un modelo prefiere una respuesta plausible antes que admitir ignorancia. Se corrige con restricciones de fundamento, citación obligatoria del fragmento de origen y negativa explícita cuando la recuperación vuelve vacía.
  • Nadie sabe si responde bien. Si tu proveedor no puede mostrar un número de calidad, no es que el número esté malo: nunca se midió. Se resuelve con un conjunto de referencia y medición sistemática.
  • La factura crece más rápido que el uso. Porque a cada pregunta se le manda el modelo más caro con todo el contexto disponible «por si acaso».
  • La información está vieja y nadie lo notó. La carga fue manual, se hizo una vez, y nadie definió cómo se actualiza.
Servicios

Qué hacemos con RAG

01

Sistema RAG desde cero

Pipeline completo: ingesta y normalización, estrategia de fragmentación según la estructura real del corpus, embeddings, almacén vectorial, búsqueda híbrida con reranking, generación con fundamento y evaluación.

4–8 semanas
02

Diagnóstico de un RAG existente

Conjunto de referencia con preguntas reales, medición separada de recuperación y generación, y los fallos ordenados por impacto con su arreglo.

1 semana
03

Optimización de recuperación

Cuando el sistema existe pero encuentra mal: reescritura de consultas, filtrado por metadata, reranking, ajuste de la estrategia de fragmentación.

3–5 semanas
04

Capa de evaluación

Conjunto de referencia, métricas de recuperación y de generación, pruebas A/B entre configuraciones y trazabilidad. Para que tu equipo pueda cambiar sin romper.

2–3 semanas
Cómo se mide

Los números que exigimos antes de decir que funciona

DimensiónMétrica
Recuperaciónrecall@k
RecuperaciónMRR
RecuperaciónNDCG
GeneraciónFundamento
GeneraciónFidelidad
GeneraciónRelevancia
OperaciónCosto por consulta
OperaciónLatencia p95

Trabajamos con RAGAS y con modelo como juez, además de las métricas clásicas de recuperación.

De dónde sale esto

No es teoría. Operamos un RAG durante tres años sobre una base de conocimiento de producto, puntos, promociones y políticas, con alta similitud entre entidades, para más de dos millones de usuarios en diez países.

El fallo de contaminación entre entidades —el número uno de la lista de arriba— lo resolvimos ahí, con metadata estructurada en ingesta y filtrado previo al ranking. Es la clase de problema que solo aparece cuando el sistema lleva meses en producción y el catálogo creció.

Stack

Con qué construimos RAG

LangChainLlamaIndexAzure AI SearchPineconepgvectorQdrantOpenAIAnthropic ClaudeCohere RerankBM25RAGASLangSmithPostgreSQLPythonTypeScript

Preguntas frecuentes

¿Qué es exactamente RAG y por qué no basta con ChatGPT?

RAG significa Retrieval-Augmented Generation: generación aumentada por recuperación. En vez de pedirle al modelo que responda de memoria, el sistema busca primero en tu información, selecciona los fragmentos relevantes y le pide al modelo que redacte usando solo eso. ChatGPT por su cuenta no conoce tus precios ni tus políticas: si le preguntás, responde genérico o directamente inventa. Con RAG la respuesta viene de tu documentación y se puede verificar porque cita la fuente.

¿Es mejor RAG o afinar el modelo con nuestros datos?

Casi siempre RAG, y la razón es práctica: tu información cambia. Afinar un modelo lo enseña a hablar de cierta forma, no a memorizar datos actualizables — cuando cambian los precios habría que reentrenar. RAG separa el conocimiento del modelo, así que actualizar es reindexar. El afinado tiene sentido para tono, formato o dominios muy específicos, y a veces se combinan. Te decimos cuál corresponde en la primera llamada.

¿Cuánta información necesitamos para que valga la pena?

No hay un mínimo estricto, pero por debajo de unas veinte preguntas frecuentes con información que casi no cambia, un RAG es sobreingeniería: una plataforma de suscripción te resuelve eso más barato. RAG empieza a rendir cuando el corpus es grande, cambia seguido, tiene muchas entidades parecidas entre sí, o cuando una respuesta equivocada tiene costo real.

¿Qué formatos de documento soportan?

PDF, Word, Excel, HTML, Markdown, texto plano, páginas web y bases de datos. También documentos escaneados mediante reconocimiento óptico. Lo que más trabajo da no es el formato sino la estructura: tablas, documentos con muchas secciones y catálogos con variantes requieren estrategias de fragmentación distintas, y eso se define mirando tu corpus real, no por defecto.

¿Cómo evitan que se invente respuestas?

Con cuatro cosas combinadas: restricciones de fundamento en el prompt de sistema, citación obligatoria del fragmento que respalda cada afirmación, negativa explícita cuando la búsqueda no devuelve nada relevante, y medición de fundamento sobre un conjunto de referencia para detectar cuándo el sistema empieza a alejarse de las fuentes. Ninguna de las cuatro sola alcanza.

¿Cada cuánto hay que actualizar el índice?

Depende de qué tan rápido cambie tu información. Para catálogos y precios solemos programar reindexación diaria o por evento; para políticas y documentación, semanal. Lo importante es que la ingesta sea reproducible y tenga alertas cuando una fuente lleva demasiado sin refrescarse, porque el modo de fallo más común no es que se rompa: es que quede vieja sin que nadie lo note.

¿Nuestra información sale de nuestra infraestructura?

Solo si vos querés. Podemos desplegar sobre Azure OpenAI o Amazon Bedrock dentro de tu propia suscripción, con el almacén vectorial en tu nube, de forma que la información nunca sale de tu perímetro. En cualquier configuración usamos planes empresariales donde los datos enviados por API no se usan para entrenar, y filtramos datos personales antes del envío.

¿Cuánto cuesta operar un RAG al mes?

El consumo del modelo más el almacén vectorial. Para una empresa mediana suele ubicarse entre 300.000 y 2.000.000 COP mensuales según volumen de consultas y tamaño del corpus. El enrutamiento de modelos —uno barato para clasificar y resumir, uno capaz para la respuesta final— y el recorte de contexto existen precisamente para mantener esa cifra predecible cuando el uso crece.

Agendá 15 minutos

Contanos qué estás construyendo o qué dejó de funcionar. Salís de la llamada con una respuesta concreta: se arregla, se construye, o no vale la pena.