LangGraph vs CrewAI vs AutoGen
Los tres construyen sistemas de varios agentes y los tres tienen una demo que funciona en veinte minutos. La diferencia aparece el día que un paso falla a mitad de camino y hay que retomar sin repetir lo que ya se hizo.
En resumen
LangGraph modela el flujo como un grafo explícito con estado durable: si el proceso se cae en el paso siete, retoma en el siete. Es el que aguanta procesos con consecuencia.
CrewAI arma equipos de agentes con roles y tareas. Llega antes al primer resultado y controla menos el camino que tomó.
AutoGen organiza el trabajo como conversación entre agentes. Es el más flexible para explorar y el más difícil de acotar cuando el costo importa.
La decisión rara vez es de marco. Es de cuánto cuesta un error: si un paso mueve dinero, cambia un registro o escribe a un cliente, hace falta estado durable y aprobación humana, y eso descarta las opciones que no lo traen.
Los tres, en las dimensiones que importan en producción
| Dimensión | LangGraph | CrewAI | AutoGen |
|---|---|---|---|
| Modelo mental | Grafo de nodos y aristas | Equipo con roles y tareas | Conversación entre agentes |
| Control del flujo | Explícito, se dibuja | Semiautomático por tarea | Emergente de la conversación |
| Estado durable | Sí, con puntos de control | Limitado | Limitado |
| Retomar tras un fallo | Desde el nodo que falló | Reintento de la tarea | Suele rehacer el hilo |
| Aprobación humana | Interrupción en el nodo | Por herramienta | Por agente de usuario |
| Curva de entrada | Alta | Baja | Media |
| Dónde brilla | Procesos con consecuencia y auditoría | Prototipos y flujos de contenido | Investigación y exploración |
No es cuál es mejor. Es cuánto cuesta un error.
Un agente que resume noticias puede equivocarse cien veces sin que pase nada grave. Un agente que negocia una fecha de pago con un cliente y registra el acuerdo no puede equivocarse ninguna. Esa distinción decide el marco mucho más que cualquier comparación de rendimiento.
Cuando un paso tiene consecuencia hacen falta tres cosas: estado durable, para que el proceso se pueda retomar donde quedó; aprobación humana antes del paso irreversible; y una traza de auditoría que permita reconstruir qué hizo el agente y por qué. LangGraph trae las tres como primitivas del marco. En los otros dos se pueden construir, pero se construyen.
Del otro lado, montar un grafo explícito para un flujo de tres pasos sin consecuencia es trabajo desperdiciado. CrewAI llega antes al primer resultado y para muchos casos eso es exactamente lo que hace falta.
Cuándo el marco liviano deja de alcanzar
- El proceso toca dinero, inventario, agenda o un registro que otro sistema va a leer después.
- Alguien va a preguntar por qué el agente hizo lo que hizo, y la respuesta tiene que ser reconstruible.
- Una ejecución tarda minutos y el reintento completo cuesta lo mismo que el intento original.
- Hace falta que una persona apruebe antes de un paso concreto, no del proceso entero.
- Los costos por ejecución empezaron a variar diez veces entre una corrida y otra sin explicación.
El marco no arregla el problema de fondo
Los tres tienen el mismo punto ciego: ninguno mide si el agente hizo bien su trabajo. Traen trazas, no evaluación. Se puede ver exactamente qué herramienta llamó el agente y con qué argumentos, y seguir sin saber si la respuesta final servía.
Eso se resuelve fuera del marco, con un conjunto de casos de prueba con su resultado esperado que se corre en cada cambio. Es aburrido y es la diferencia entre un agente que se puede tocar y uno que nadie se atreve a modificar.
La observabilidad ayuda pero no reemplaza. LangSmith, Langfuse o trazas propias muestran qué pasó; el conjunto de evaluación dice si lo que pasó estuvo bien.
Preguntas frecuentes
¿Cuál conviene para un primer proyecto de agentes?
Si el agente solo lee y responde, CrewAI llega antes a algo funcionando y con eso alcanza para aprender qué necesita el caso. Si desde el principio el agente va a escribir en un sistema real, empezar con LangGraph ahorra la migración: el estado durable y la aprobación humana son difíciles de agregar después.
¿Se pueden combinar?
Técnicamente sí, y casi nunca conviene. Dos marcos de orquestación en el mismo sistema duplican el modelo mental, la observabilidad y los puntos de fallo. Si un flujo necesita algo que el marco elegido no da, suele ser más barato escribir ese pedazo a mano que sumar un segundo marco.
¿Qué es el estado durable y por qué importa?
Es la capacidad de guardar el avance del proceso en cada paso, de forma que si algo falla se pueda retomar desde ahí. Sin estado durable, un proceso de doce pasos que falla en el once vuelve a empezar en el uno: se paga otra vez todo el consumo del modelo y se repiten acciones que ya se ejecutaron, que es el problema serio cuando esas acciones escriben en sistemas reales.
¿Cuánto cuesta operar un sistema multiagente?
El costo dominante casi nunca es el marco: es el consumo del modelo, que crece con la cantidad de pasos y con el tamaño del contexto que se arrastra. Un sistema de tres agentes que se pasan el hilo completo entre ellos puede costar diez veces más que el mismo sistema pasándose solo el resultado. Medir costo por ejecución desde el primer día evita esa sorpresa.
¿Hace falta un marco de agentes?
Para muchos casos, no. Si el flujo son tres llamadas al modelo en orden fijo, un script con manejo de errores es más fácil de entender y de mantener. El marco empieza a pagar cuando hay ramificación, reintentos con criterio, paralelismo o pasos que requieren aprobación.