Sistema RAG desde cero
Pipeline completo: ingesta y normalización, estrategia de fragmentación según la estructura real del corpus, embeddings, almacén vectorial, búsqueda híbrida con reranking, generación con fundamento y evaluación.
Retrieval-Augmented Generation conecta un modelo de lenguaje con la información real de tu empresa. Bien hecho, responde con fuentes verificables. Mal hecho, responde con seguridad sobre lo que no sabe.
En resumen
Antecedente de operación
Tres años de operación del sistema en producción, no una entrega y una salida.
El fallo más frecuente de las arquitecturas RAG, resuelto con metadata estructurada en la ingesta.
La propuesta llega en 48 horas con alcance, precio y fecha fijos. Si el alcance cambia, se cotiza aparte y se aprueba antes.
Un modelo de lenguaje sabe de todo menos de tu empresa: no conoce tus precios, tu inventario, tus políticas ni el estado de un pedido. RAG resuelve eso invirtiendo el orden: primero busca en tu información, después redacta la respuesta usando únicamente lo que encontró, y cita de dónde lo sacó.
La idea es simple. La ejecución es donde está todo. Un RAG mediocre y uno bueno se ven idénticos en la demo y se separan brutalmente en el mes tres.
Si alguno te suena, tu problema tiene arreglo y probablemente es más barato de lo que temés.
Pipeline completo: ingesta y normalización, estrategia de fragmentación según la estructura real del corpus, embeddings, almacén vectorial, búsqueda híbrida con reranking, generación con fundamento y evaluación.
Conjunto de referencia con preguntas reales, medición separada de recuperación y generación, y los fallos ordenados por impacto con su arreglo.
Cuando el sistema existe pero encuentra mal: reescritura de consultas, filtrado por metadata, reranking, ajuste de la estrategia de fragmentación.
Conjunto de referencia, métricas de recuperación y de generación, pruebas A/B entre configuraciones y trazabilidad. Para que tu equipo pueda cambiar sin romper.
| Dimensión | Métrica |
|---|---|
| Recuperación | recall@k |
| Recuperación | MRR |
| Recuperación | NDCG |
| Generación | Fundamento |
| Generación | Fidelidad |
| Generación | Relevancia |
| Operación | Costo por consulta |
| Operación | Latencia p95 |
Trabajamos con RAGAS y con modelo como juez, además de las métricas clásicas de recuperación.
No es teoría. Operamos un RAG durante tres años sobre una base de conocimiento de producto, puntos, promociones y políticas, con alta similitud entre entidades, para más de dos millones de usuarios en diez países.
El fallo de contaminación entre entidades —el número uno de la lista de arriba— lo resolvimos ahí, con metadata estructurada en ingesta y filtrado previo al ranking. Es la clase de problema que solo aparece cuando el sistema lleva meses en producción y el catálogo creció.
Aplicaciones LLM con salida estructurada y llamada a herramientas.
Ver servicioOrquestación con LangGraph, estado durable y supervisión humana en los pasos con consecuencia.
Ver servicioCon el conjunto de evaluación ejecutado antes de la salida a producción.
Ver servicioEl sistema ya está en producción y responde mal. Lo medimos y determinamos qué corregir.
Ver servicioRAG significa Retrieval-Augmented Generation: generación aumentada por recuperación. En vez de pedirle al modelo que responda de memoria, el sistema busca primero en tu información, selecciona los fragmentos relevantes y le pide al modelo que redacte usando solo eso. ChatGPT por su cuenta no conoce tus precios ni tus políticas: si le preguntás, responde genérico o directamente inventa. Con RAG la respuesta viene de tu documentación y se puede verificar porque cita la fuente.
Casi siempre RAG, y la razón es práctica: tu información cambia. Afinar un modelo lo enseña a hablar de cierta forma, no a memorizar datos actualizables — cuando cambian los precios habría que reentrenar. RAG separa el conocimiento del modelo, así que actualizar es reindexar. El afinado tiene sentido para tono, formato o dominios muy específicos, y a veces se combinan. Te decimos cuál corresponde en la primera llamada.
No hay un mínimo estricto, pero por debajo de unas veinte preguntas frecuentes con información que casi no cambia, un RAG es sobreingeniería: una plataforma de suscripción te resuelve eso más barato. RAG empieza a rendir cuando el corpus es grande, cambia seguido, tiene muchas entidades parecidas entre sí, o cuando una respuesta equivocada tiene costo real.
PDF, Word, Excel, HTML, Markdown, texto plano, páginas web y bases de datos. También documentos escaneados mediante reconocimiento óptico. Lo que más trabajo da no es el formato sino la estructura: tablas, documentos con muchas secciones y catálogos con variantes requieren estrategias de fragmentación distintas, y eso se define mirando tu corpus real, no por defecto.
Con cuatro cosas combinadas: restricciones de fundamento en el prompt de sistema, citación obligatoria del fragmento que respalda cada afirmación, negativa explícita cuando la búsqueda no devuelve nada relevante, y medición de fundamento sobre un conjunto de referencia para detectar cuándo el sistema empieza a alejarse de las fuentes. Ninguna de las cuatro sola alcanza.
Depende de qué tan rápido cambie tu información. Para catálogos y precios solemos programar reindexación diaria o por evento; para políticas y documentación, semanal. Lo importante es que la ingesta sea reproducible y tenga alertas cuando una fuente lleva demasiado sin refrescarse, porque el modo de fallo más común no es que se rompa: es que quede vieja sin que nadie lo note.
Solo si vos querés. Podemos desplegar sobre Azure OpenAI o Amazon Bedrock dentro de tu propia suscripción, con el almacén vectorial en tu nube, de forma que la información nunca sale de tu perímetro. En cualquier configuración usamos planes empresariales donde los datos enviados por API no se usan para entrenar, y filtramos datos personales antes del envío.
El consumo del modelo más el almacén vectorial. Para una empresa mediana suele ubicarse entre 300.000 y 2.000.000 COP mensuales según volumen de consultas y tamaño del corpus. El enrutamiento de modelos —uno barato para clasificar y resumir, uno capaz para la respuesta final— y el recorte de contexto existen precisamente para mantener esa cifra predecible cuando el uso crece.
Contanos qué estás construyendo o qué dejó de funcionar. Salís de la llamada con una respuesta concreta: se arregla, se construye, o no vale la pena.