RAG vs fine-tuning: cuál necesitás
La pregunta llega casi siempre mal planteada, como si fueran dos caminos hacia el mismo lugar. Resuelven problemas distintos: uno le da al modelo información que no tenía, el otro le enseña una forma de responder.
En resumen
RAG le da al modelo información que no tenía en el momento de responder. El fine-tuning le enseña un comportamiento: formato, tono, vocabulario de un dominio, estructura de salida.
Si el problema es que el modelo no conoce tus documentos, el fine-tuning no lo arregla. Entrenar sobre datos que cambian cada semana obliga a reentrenar cada semana.
RAG se puede auditar: cada respuesta puede citar de dónde salió. Un modelo ajustado no puede mostrar la fuente, y en sectores regulados eso suele cerrar la discusión.
Los dos se combinan. El orden que funciona es RAG primero, fine-tuning después y solo si queda un problema de comportamiento que el prompt no resuelve.
Qué hace cada uno
| Dimensión | RAG | Fine-tuning |
|---|---|---|
| Qué cambia | Lo que el modelo ve al responder | Cómo responde el modelo |
| Cuándo sirve | Información propia, cambiante o extensa | Formato, tono o vocabulario estables |
| Actualizar | Reindexar el documento nuevo, minutos | Reentrenar el modelo, horas o días |
| Costo de arranque | Bajo a medio | Medio a alto, más la curaduría del conjunto |
| Costo por consulta | Sube: el contexto recuperado se paga como entrada | Baja: el prompt es más corto |
| Citar la fuente | Sí, con el fragmento exacto | No |
| Riesgo principal | Recupera mal y el modelo responde con basura | Aprende un sesgo del conjunto y lo repite |
| Cómo se mide | recall@k, MRR, NDCG, groundedness | Contra el modelo base en un conjunto de prueba retenido |
Entrenar para resolver un problema de conocimiento
El caso típico llega así: «el modelo no sabe nada de nuestros productos, hay que entrenarlo con nuestro catálogo». Suena razonable y casi nunca funciona. El fine-tuning ajusta pesos hacia una distribución de respuestas; no guarda hechos de forma consultable. El modelo entrenado sobre el catálogo va a sonar como el catálogo, y va a inventar referencias con la misma seguridad con la que decía otras cosas antes.
La prueba está en el ciclo de actualización. Si un producto cambia de precio el martes, con RAG se reindexa el documento y la respuesta cambia esa misma tarde. Con un modelo ajustado hay que volver a curar el conjunto, reentrenar, evaluar y desplegar. Nadie sostiene eso semana a semana.
Donde el fine-tuning sí gana es en comportamiento. Un modelo que tiene que devolver siempre la misma estructura, usar el vocabulario específico de una industria o adoptar un tono muy particular aprende eso mucho mejor con ejemplos que con un prompt de dos mil palabras. Y como el prompt se acorta, cada consulta baja de precio.
Cómo decidir sin gastar de más
- Empezá por el promptUn prompt de sistema bien escrito con tres ejemplos resuelve más problemas de formato de los que la gente espera, y cuesta una tarde.
- Si falta información, RAGDocumentos propios, políticas, catálogo, historial. Con búsqueda híbrida y reordenamiento antes de pensar en nada más.
- Medí antes de seguirSin conjunto de evaluación no vas a saber si el siguiente paso mejoró algo. recall@k para la recuperación, groundedness para la fidelidad de la respuesta.
- Solo entonces, fine-tuningY solo si lo que queda mal es el comportamiento, no el conocimiento. Con el conjunto de evaluación ya listo para comparar contra el modelo base.
Tres situaciones y qué corresponde
Aseguradora con pólizas que cambian
Cientos de documentos que se actualizan por normativa y respuestas que tienen que citar la cláusula exacta. El fine-tuning acá es inviable: no puede mostrar la fuente y quedaría viejo en cada actualización.
Clasificar mensajes con una taxonomía propia
Miles de ejemplos etiquetados, categorías estables y una salida de una sola palabra. Un modelo pequeño ajustado sale más barato por consulta y más rápido que uno grande con un prompt largo.
Soporte técnico con voz propia
RAG para la documentación del producto, que cambia con cada versión, y fine-tuning para el estilo de respuesta y la estructura fija que exige el equipo de calidad.
Cualquiera de los dos caminos sin medición es una apuesta. Antes de elegir hace falta un conjunto de preguntas reales con su respuesta correcta y una línea base: qué tan seguido el sistema recupera el fragmento que servía, y qué tan seguido la respuesta se sostiene en lo recuperado.
Es la parte que ningún proveedor colombiano vende, verificado en un barrido de más de ochenta empresas en agosto de 2026. Y es la única forma de saber si el cambio que se hizo mejoró algo.
Preguntas frecuentes
¿Qué es RAG en pocas palabras?
Generación aumentada por recuperación. Antes de responder, el sistema busca en tus documentos los fragmentos relevantes para la pregunta y se los entrega al modelo dentro del prompt. El modelo responde sobre eso, y puede citar de dónde salió cada afirmación. No cambia el modelo: cambia lo que el modelo ve.
¿Cuándo conviene fine-tuning en lugar de RAG?
Cuando el problema es de comportamiento y no de conocimiento: una estructura de salida fija, un vocabulario de dominio muy específico, un tono que el prompt no logra sostener, o una tarea repetitiva de clasificación donde bajar el costo por consulta importa. Si la información que falta cambia con el tiempo, fine-tuning es la herramienta equivocada.
¿Se pueden usar los dos a la vez?
Sí, y es lo habitual en sistemas maduros. El orden importa: RAG primero, medición después, y fine-tuning solo si queda un problema de comportamiento que el prompt no resuelve. Al revés se paga un entrenamiento para descubrir que el problema era la recuperación.
¿Cuál sale más barato?
RAG cuesta menos arrancar y más por consulta, porque el contexto recuperado se paga como texto de entrada. El fine-tuning cuesta más arrancar —curaduría del conjunto, entrenamiento, evaluación— y menos por consulta, porque el prompt queda corto. A volúmenes bajos gana RAG; a volúmenes muy altos con una tarea estable, el ajuste se amortiza.
¿Cómo sé si mi RAG está funcionando bien?
Con dos números. recall@k mide qué tan seguido el fragmento que servía aparece entre los k recuperados: si es bajo, el problema es la búsqueda y ningún cambio de modelo lo va a arreglar. Groundedness mide qué tan seguido la respuesta se sostiene en lo recuperado: si es bajo, el modelo está inventando por encima de la evidencia. Sin esos dos números, cualquier discusión sobre calidad es de opiniones.