Sistema RAG desde cero
Pipeline completo: ingesta y normalización, estrategia de fragmentación según la estructura real del corpus, embeddings, almacén vectorial, búsqueda híbrida con reranking, generación con fundamento y evaluación.
Retrieval-Augmented Generation conecta un modelo de lenguaje con la información real de la empresa. Bien hecho, responde con fuentes verificables. Mal hecho, responde con seguridad sobre lo que no sabe.
2M+ usuarios atendidos por el RAG que operamos en producción · 3 años sosteniéndolo, que es donde aparecen los fallos reales · 10 países con catálogos e idiomas distintos
Construido sobre
Noventa segundos: quiénes somos, cómo trabajamos y qué recibís al final.
Contratos, tarifarios, correos, el CRM: lo que ya tenés se convierte en respuestas con fuente y en agentes que hacen el trabajo. Elegí un caso y mirá el recorrido.
Ejemplo: un cliente pregunta qué cubre su seguro. El sistema le responde con la página exacta del contrato y abre el caso.
Se conectan por API o se cargan. Nada sale de tu infraestructura si el caso lo exige.
84 págs → 612 fragmentos
Busca por significado y por palabra exacta, y filtra por la etiqueta antes de elegir.
responde con fuente · 91 de 100
Deslizar para ver el recorrido →
Qué es RAG
Un modelo de lenguaje sabe de todo menos de la empresa: no conoce sus precios, su inventario, sus políticas ni el estado de un pedido. RAG resuelve eso invirtiendo el orden: primero busca en esa información, después redacta la respuesta usando únicamente lo que encontró, y cita de dónde lo sacó.
La idea es simple; la ejecución es donde se decide todo. Un RAG mediocre y uno bueno se ven idénticos en la demo, y se separan en el mes tres, cuando llegan las preguntas que nadie ensayó.
01
El fallo más común y el más peligroso, porque la respuesta suena correcta y nadie la audita. Pasa porque «precio del plan Premium» y «precio del plan Básico» son casi idénticos en el espacio vectorial. Lo arreglamos extrayendo metadata estructurada en la ingesta y filtrando por entidad antes de rankear.
02
Un modelo prefiere una respuesta plausible antes que admitir ignorancia. Lo corregimos con restricciones de fundamento, citación obligatoria del fragmento de origen y negativa explícita cuando la recuperación vuelve vacía.
03
Si el proveedor no puede mostrar un número de calidad, no es que el número esté malo: nunca se midió. Empezamos por ahí: conjunto de referencia y medición corriendo en cada cambio.
04
Porque a cada pregunta se le manda el modelo más caro con todo el contexto disponible «por si acaso».
05
La carga fue manual, se hizo una vez, y nadie definió cómo se actualiza.
01
Pipeline completo: ingesta y normalización, estrategia de fragmentación según la estructura real del corpus, embeddings, almacén vectorial, búsqueda híbrida con reranking, generación con fundamento y evaluación.
Conjunto de referencia con preguntas reales, medición separada de recuperación y generación, y los fallos ordenados por impacto con su arreglo.
Cuando el sistema existe pero encuentra mal: reescritura de consultas, filtrado por metadata, reranking, ajuste de la estrategia de fragmentación.
Conjunto de referencia, métricas de recuperación y de generación, pruebas A/B entre configuraciones y trazabilidad. Para que el equipo pueda cambiar sin romper.
Cómo se mide
Trabajamos con RAGAS y con modelo como juez, además de las métricas clásicas de recuperación.
recall@k · MRR · NDCG
Fundamento · Fidelidad · Relevancia
Costo por consulta · Latencia p95
No es teoría. Operamos un RAG durante tres años sobre una base de conocimiento de producto, puntos, promociones y políticas, con alta similitud entre entidades, para más de dos millones de usuarios en diez países.
El fallo de contaminación entre entidades —el número uno de la lista de arriba— lo resolvimos ahí, con metadata estructurada en ingesta y filtrado previo al ranking. Es la clase de problema que solo aparece cuando el sistema lleva meses en producción y el catálogo creció.
Recuperación sobre condicionados y pólizas, medida cláusula por cláusula.
Documentación clínica y administrativa, con negativa explícita antes que suposición.
Cada respuesta con el artículo o la cláusula exacta de la que sale.
El sistema ya está en producción y responde mal. Lo medimos y determinamos qué corregir.
En resumen
RAG —generación aumentada por recuperación— invierte el orden: busca primero en la información de la empresa y solo después redacta, citando la fuente de cada afirmación.
El fallo más frecuente de un RAG es responder correctamente sobre la entidad equivocada, porque entidades parecidas quedan casi superpuestas en el espacio vectorial. Se corrige con metadata estructurada en la ingesta y filtrado previo al ranking.
Quarl mide recuperación y generación por separado: recall@k, MRR y NDCG por un lado; fundamento, fidelidad y relevancia por el otro, con RAGAS y modelo como juez.
El antecedente es un RAG operado tres años sobre un catálogo con alta similitud entre entidades, para dos millones de usuarios en diez países.
Un sistema de IA vale lo que valen las fuentes que tiene detrás. Estos son los conectores estándar; cualquier cosa con API o base de datos se conecta igual, y lo que no tiene API se resuelve por archivo.
SAP
ERP corporativo
Oracle
ERP y base de datos
NetSuite
ERP en la nube
Salesforce
CRM y servicio
HubSpot
CRM y marketing
PostgreSQL
Base de datos y pgvector
Microsoft SQL
Base de datos
Snowflake
Almacén de datos
BigQuery
Almacén de datos de Google
Databricks
Plataforma de datos
Redshift
Almacén de datos de AWS
Synapse
Almacén de datos de Azure
Supabase
Postgres administrado
Workday
Nómina y talento
QuickBooks
Contabilidad
Sage
Contabilidad y ERP
Xero
Contabilidad en la nube
Shopify
Catálogo y pedidos
WooCommerce
Catálogo y pedidos
Magento
Catálogo y pedidos
Stripe
Cobros y suscripciones
Google Drive
Documentos y carpetas
CSV y Excel
Archivos planos
Nada en esta categoría
Construimos y operamos el asistente de una plataforma de lealtad con más de dos millones de usuarios activos en diez países.
Hicimos el pipeline completo: ingesta y normalización de documentos, fragmentación, generación de embeddings, almacén vectorial sobre Azure AI Search y Pinecone, y recuperación con generación fundamentada sobre LangChain.
Lo sostuvimos con más del 99% de disponibilidad durante tres años.
Sistemas RAG →RAG significa Retrieval-Augmented Generation: generación aumentada por recuperación. En vez de pedirle al modelo que responda de memoria, el sistema busca primero en la información de la empresa, selecciona los fragmentos relevantes y le pide al modelo que redacte usando solo eso. ChatGPT por su cuenta no conoce esos precios ni esas políticas: ante la pregunta responde genérico o directamente inventa. Con RAG la respuesta viene de la documentación propia y se puede verificar porque cita la fuente.
Casi siempre RAG, y la razón es práctica: la información cambia. Afinar un modelo lo enseña a hablar de cierta forma, no a memorizar datos actualizables — cuando cambian los precios habría que reentrenar. RAG separa el conocimiento del modelo, así que actualizar es reindexar. El afinado tiene sentido para tono, formato o dominios muy específicos, y a veces se combinan. Cuál corresponde queda definido en la primera llamada.
No hay un mínimo estricto, pero por debajo de unas veinte preguntas frecuentes con información que casi no cambia, un RAG es sobreingeniería: una plataforma de suscripción resuelve eso más barato. RAG empieza a rendir cuando el corpus es grande, cambia seguido, tiene muchas entidades parecidas entre sí, o cuando una respuesta equivocada tiene costo real.
PDF, Word, Excel, HTML, Markdown, texto plano, páginas web y bases de datos. También documentos escaneados mediante reconocimiento óptico. Lo que más trabajo da no es el formato sino la estructura: tablas, documentos con muchas secciones y catálogos con variantes requieren estrategias de fragmentación distintas, y eso se define mirando el corpus real, no por defecto.
Con cuatro cosas combinadas: restricciones de fundamento en el prompt de sistema, citación obligatoria del fragmento que respalda cada afirmación, negativa explícita cuando la búsqueda no devuelve nada relevante, y medición de fundamento sobre un conjunto de referencia para detectar cuándo el sistema empieza a alejarse de las fuentes. Ninguna de las cuatro sola alcanza.
Depende de qué tan rápido cambie la información. Para catálogos y precios solemos programar reindexación diaria o por evento; para políticas y documentación, semanal. Lo importante es que la ingesta sea reproducible y tenga alertas cuando una fuente lleva demasiado sin refrescarse, porque el modo de fallo más común no es que se rompa: es que quede vieja sin que nadie lo note.
Solo si el cliente lo decide. Podemos desplegar sobre Azure OpenAI o Amazon Bedrock dentro de su propia suscripción, con el almacén vectorial en su nube, de forma que la información nunca sale de ese perímetro. En cualquier configuración usamos planes empresariales donde los datos enviados por API no se usan para entrenar, y filtramos datos personales antes del envío.
El consumo del modelo más el almacén vectorial. Para una empresa mediana suele ubicarse entre 300.000 y 2.000.000 COP mensuales según volumen de consultas y tamaño del corpus. El enrutamiento de modelos —uno barato para clasificar y resumir, uno capaz para la respuesta final— y el recorte de contexto existen precisamente para mantener esa cifra predecible cuando el uso crece.
Se arregla, se construye, o no vale la pena. Y si el diagnóstico no llega a tres hallazgos accionables, no se cobra.
Sin logos prestados y sin testimonios escritos por nosotros.
Usamos cookies para mejorar la experiencia de usuario. Privacidad