Integración en un producto existente
Una funcionalidad con LLM dentro de una aplicación existente, con evaluación y control de costo.
Integrar un modelo es una tarde. Lo que toma trabajo es que la salida sea confiable, que el costo sea predecible y que la latencia aguante cuando hay volumen real.
5 proveedores en producción: OpenAI, Anthropic, Google, Azure y Bedrock · 3 años operando aplicaciones LLM a escala de millones de usuarios · 2 modelos por petición: uno barato clasifica, uno capaz responde
Construido sobre
Noventa segundos: quiénes somos, cómo trabajamos y qué recibís al final.
Un conjunto de preguntas reales con su respuesta correcta, el sistema tal como está, y los fallos ordenados por impacto. Así se sabe qué arreglar primero y si el arreglo sirvió.
Ejemplo: primero se mide qué tan bien responde el sistema hoy, se arregla lo que más pesa, y se vuelve a medir con las mismas preguntas.
100 preguntas · 100 respuestas correctas
mismo conjunto, misma métrica
Deslizar para ver el recorrido →
El problema real
Cualquiera conecta un modelo a un formulario en una tarde. Lo que decide si el producto sobrevive es todo lo demás: que la salida tenga siempre la forma que el sistema espera, que el costo por petición no se dispare cuando el uso crece, que la latencia sea tolerable.
Y que cambiar de proveedor no obligue a reescribir la aplicación, y que se pueda medir si un ajuste mejoró o empeoró las respuestas. Nada de eso se nota en la demo, y todo se nota el día que hay usuarios reales.
01
El modelo devuelve JSON que valida contra un esquema, con reintentos y corrección cuando no cumple. El sistema nunca recibe algo que no puede procesar.
02
El modelo consulta las APIs y bases de datos de la empresa en vez de responder de memoria, con límites y validación en cada llamada.
03
Un modelo económico clasifica, resume y filtra; uno capaz genera la respuesta final. Es la palanca que más baja el costo sin tocar la calidad percibida.
04
Reduce costo y latencia en aplicaciones con instrucciones largas y repetidas.
05
La respuesta empieza a aparecer de inmediato. No baja la latencia real pero cambia por completo la percepción del usuario.
06
Cambiar de OpenAI a Claude o a un modelo autoalojado no debería costar un trimestre de trabajo.
07
Jerarquía de instrucciones, separación entre contenido del sistema y del usuario, y filtrado de entrada y salida.
01
Decisiones
La pregunta más frecuente y la que más plata hace perder cuando se responde mal.
RAG
Salida estructurada
Prompting, y después fine-tuning
Fine-tuning
Enrutamiento y caché
Capa de evaluación
Una funcionalidad con LLM dentro de una aplicación existente, con evaluación y control de costo.
Aplicación completa: backend, orquestación, interfaz, evaluación y observabilidad.
Enrutamiento, caché, recorte de contexto y medición del antes y el después.
Preparación del conjunto de datos, entrenamiento, evaluación contra la línea base.
Segmentación, reordenamiento y búsqueda híbrida, evaluados con recall@k y NDCG.
Orquestación con LangGraph, estado durable y supervisión humana en los pasos con consecuencia.
Implementación y observabilidad instrumentada con LangSmith.
Arquitectura, criterios de evaluación y costo por consulta antes de escribir código.
En resumen
Integrar un modelo de lenguaje toma una tarde; lo que decide si el producto sobrevive es la salida estructurada, el control de costo y la latencia con volumen real.
El enrutamiento por tarea —un modelo económico clasifica y resume, uno capaz genera la respuesta final— es la palanca que más baja el costo sin tocar la calidad percibida.
La elección entre prompting, RAG y fine-tuning mueve el presupuesto en un orden de magnitud: RAG cuando el modelo no conoce la información, fine-tuning solo para tono o vocabulario propio.
Quarl trabaja con OpenAI, Anthropic, Google, Azure OpenAI y Amazon Bedrock detrás de una capa de abstracción, de forma que cambiar de proveedor sea configuración y no un trimestre de trabajo.
Un sistema de IA vale lo que valen las fuentes que tiene detrás. Estos son los conectores estándar; cualquier cosa con API o base de datos se conecta igual, y lo que no tiene API se resuelve por archivo.
SAP
ERP corporativo
Oracle
ERP y base de datos
NetSuite
ERP en la nube
Salesforce
CRM y servicio
HubSpot
CRM y marketing
PostgreSQL
Base de datos y pgvector
Microsoft SQL
Base de datos
Snowflake
Almacén de datos
BigQuery
Almacén de datos de Google
Databricks
Plataforma de datos
Redshift
Almacén de datos de AWS
Synapse
Almacén de datos de Azure
Supabase
Postgres administrado
Workday
Nómina y talento
QuickBooks
Contabilidad
Sage
Contabilidad y ERP
Xero
Contabilidad en la nube
Shopify
Catálogo y pedidos
WooCommerce
Catálogo y pedidos
Magento
Catálogo y pedidos
Stripe
Cobros y suscripciones
Google Drive
Documentos y carpetas
CSV y Excel
Archivos planos
Nada en esta categoría
Construimos y operamos el asistente de una plataforma de lealtad con más de dos millones de usuarios activos en diez países.
Hicimos el pipeline completo: ingesta y normalización de documentos, fragmentación, generación de embeddings, almacén vectorial sobre Azure AI Search y Pinecone, y recuperación con generación fundamentada sobre LangChain.
Lo sostuvimos con más del 99% de disponibilidad durante tres años.
Sistemas RAG →Depende de la tarea, y casi siempre son varios en el mismo sistema. Para clasificar, extraer y resumir, un modelo económico basta y cuesta una fracción. Para razonamiento complejo o la respuesta final al usuario, uno capaz. Trabajamos con OpenAI, Anthropic, Google, Azure OpenAI y Amazon Bedrock, y la elección se justifica con números en la propuesta, no por moda.
Con cuatro palancas: enrutamiento por tarea, recorte de contexto para no mandar todo «por si acaso», caché de prompts en instrucciones largas y repetidas, y límites duros por petición y por usuario. En los sistemas que hemos operado, esas cuatro palancas son lo que mantiene la factura previsible cuando el uso se multiplica. Además dejamos el gasto instrumentado, a la vista y sin tener que pedirlo.
Sí, y lo diseñamos para eso desde el principio. La aplicación habla con una capa de abstracción, no directamente con la API de un proveedor, así que cambiar de modelo es configuración más una corrida de evaluación para confirmar que la calidad se mantiene. Sin esa capa, migrar cuesta un trimestre.
Es forzar al modelo a devolver datos con una forma exacta —JSON que cumple un esquema— en vez de texto libre. Importa porque el sistema necesita procesar la respuesta: si a veces devuelve un campo con otro nombre o un número como texto, la integración se rompe en producción de formas difíciles de reproducir. Validamos contra esquema y reintentamos con corrección cuando no cumple.
Es cuando alguien mete instrucciones dentro del contenido que el modelo procesa —un documento, un correo, un mensaje— para hacerle ignorar sus reglas. Se mitiga con jerarquía de instrucciones en el prompt de sistema, separación estricta entre contenido de sistema y de usuario, filtrado de entrada y salida, y limitando qué herramientas puede invocar el modelo. En sistemas con agentes esto deja de ser opcional.
Cuando hace falta un tono, un formato o un vocabulario muy específico que el prompting no logra de forma consistente, y existen al menos unos cientos de ejemplos de buena calidad. No sirve para meter conocimiento actualizable: para eso está RAG. En la práctica, nueve de cada diez casos que llegan pidiendo fine-tuning se resuelven mejor con RAG y mejor prompting.
Con un conjunto de casos reales y su resultado esperado, corriendo antes y después de cada cambio. Medimos calidad de la respuesta, costo por petición y latencia. Sin eso, «mejoramos el prompt» es una opinión, y es exactamente así como los sistemas empeoran sin que nadie se entere.
Sí, y es uno de los usos con retorno más claro: extraer datos de facturas, contratos o formularios en formatos variables, donde las plantillas rígidas fallan. Se combina con validación por esquema y con revisión humana en los casos de baja confianza. Lo vemos también desde automatización de procesos.
Se arregla, se construye, o no vale la pena. Y si el diagnóstico no llega a tres hallazgos accionables, no se cobra.
Sin logos prestados y sin testimonios escritos por nosotros.
Usamos cookies para mejorar la experiencia de usuario. Privacidad