
Langfuse vs LangSmith vs MLflow: Dos Son Herramientas de Observabilidad, Una Es una Plataforma de ML (2026)
Solo dos de las tres herramientas en langfuse vs langsmith vs mlflow se construyeron para vigilar LLMs. MLflow salió en 2018 desde Databricks como seguimiento de experimentos para scikit-learn y XGBoost; el trazado GenAI llegó sobre esa base años después. Langfuse tiene licencia MIT y es nativo de LLM, LangSmith es propietario y nativo de LangChain, MLflow es Apache-2.0 y más antiguo que ambos. El linaje, no la lista de funcionalidades, decide esta comparación. Veredicto: Langfuse para ser dueño de tus datos, LangSmith para equipos de LangGraph, MLflow si modelos clásicos comparten tu plataforma.
Conclusiones clave
- Langfuse si quieres un núcleo MIT que puedas autoalojar y poseer los datos de trazas por completo. Ten en cuenta que sus carpetas
ee/tienen términos comerciales aparte, por lo que GitHub reporta el repositorio comoNOASSERTIONen vez de MIT. - LangSmith si tu app está hecha con LangChain o LangGraph y pagarás por asiento para tener la integración más ajustada.
- MLflow si además despliegas modelos de ML clásico y quieres experimentos, registro de modelos y trazas en un solo lugar.
- Los tres ya hablan OpenTelemetry, así que correr dos de ellos a la vez es una opción real.
Langfuse vs LangSmith vs MLflow de un vistazo
Langfuse es la elección open source, LangSmith es la elección nativa de LangChain, y MLflow es la elección cuando tu equipo despliega ML clásico junto a sus funcionalidades de LLM. Dos de estas son herramientas de observabilidad LLM. La tercera es una plataforma de ML que aprendió a trazar LLMs, y esa diferencia decide la mayoría de estas evaluaciones.
¿Nuevo aquí? Lee primero nuestra guía de observabilidad de IA.
| Dimensión | Langfuse | LangSmith | MLflow |
|---|---|---|---|
| Licencia | MIT (núcleo), ee/ bajo términos comerciales | Propietario | Apache 2.0, open source |
| Autoalojamiento | Sí, gratis | Solo plan Enterprise | Sí, gratis |
| Trazado LLM | @observe, nativo de OTel | @traceable, automático en LangChain | autolog, @mlflow.trace |
| Evaluación / LLM-as-a-judge | Gestionado + evaluadores propios | Motor de evaluación integrado | Jueces + optimización de prompts |
| Gestión de prompts | Versionado, etiquetas, playground | Prompt hub | Registro de prompts |
| Ciclo de vida de ML clásico | No | No | Experimentos + registro de modelos |
| Soporte de OpenTelemetry | Nativo | Ingesta compatible con OTel | Nativo, convenciones GenAI |
| Plan gratuito | 50k unidades/mes, 30 días | 5k trazas/mes, 1 asiento | Ilimitado, tu infraestructura |
| Precio de entrada | $29/mes (Core) | $39/asiento/mes (Plus) | $0, solo infraestructura |
| Retención de datos | 30 d / 90 d / 3 años según plan | 14 d base, 400 d extendida | Ilimitada, tu almacenamiento |
| Ideal para | Ser dueño de los datos de trazas | Equipos nativos de LangGraph | Plataformas mixtas de ML + LLM |
Las cifras de retención vienen de los vendors: los niveles de 30/90 días/3 años de Langfuse según su página de precios, los 14 días base y las trazas extendidas de 400 días de LangSmith según los precios de LangChain (la extendida es un tipo de traza distinto que cobra una tarifa adicional, no un interruptor de retención), y MLflow conserva los datos tanto tiempo como tu almacenamiento lo permita.
Tres elecciones con nombre:
- Elige Langfuse si quieres código con licencia MIT, autoalojamiento desde el día uno y datos de trazas en tu propio Postgres y ClickHouse.
- Elige LangSmith si tu stack es LangChain o LangGraph y el precio por asiento gana al precio por traza.
- Elige MLflow si modelos de sklearn y XGBoost corren junto a tus funcionalidades de LLM. Para el detalle de las dos herramientas, mira nuestro cara a cara completo de Langfuse vs LangSmith.
¿Necesitas una Herramienta Nativa de LLM o una Plataforma de ML?
La mitad de langfuse vs mlflow en esta consulta es en realidad una pregunta de linaje. MLflow empezó como seguimiento de experimentos y registro de modelos para ML clásico, y luego añadió trazado LLM. Langfuse empezó con trazado LLM y no añadió nada más. Si no despliegas modelos clásicos, la maquinaria de ciclo de vida de MLflow es superficie que mantienes para nada, y una herramienta dedicada de observabilidad de IA es el camino más corto.
MLflow es el más antiguo de los tres por un margen amplio: licencia Apache-2.0, gobernado por la Linux Foundation, más de 27,000 estrellas en GitHub a fecha de 5 de agosto de 2026, construido para responder «¿qué hiperparámetros produjeron qué artefacto?». Su trazado GenAI llegó sobre esa base. Para un equipo que despliega a la vez un modelo de churn con XGBoost y un agente de soporte con GPT-4o, eso compra un único sistema de registro: experimentos, entradas de registro y trazas LLM en la misma base de datos.
El contrapeso: si no despliegas modelos clásicos, nada de eso paga alquiler. La UX nativa de LLM de MLflow es más joven que la de Langfuse, con menos atajos y vistas de trazas más toscas.
Una aclaración, porque el autocompletar muestra gente buscando kubeflow vs mlflow vs airflow: MLflow no es un orquestador de flujos de trabajo. No programa DAGs; registra lo que hicieron tus ejecuciones. Airflow y Kubeflow ejecutan trabajos, MLflow rastrea su salida. Sobre la pregunta de capas (mlflow vs tensorflow): TensorFlow es un framework de modelado, MLflow se sienta encima de cualquier framework con el que entrenes. La comparación de Leanware, el único resultado editorial no vendor en esta SERP, hace la misma división.
| Herramienta | Origen | Construido primero para | Añadido después | A quién le sirve |
|---|---|---|---|---|
| Langfuse | 2023, startup nativa de LLM | Trazado y evaluación de LLM | Gestión de prompts, exportación OTel | Equipos de producto solo LLM |
| LangSmith | 2023, de LangChain Inc. | Depuración de LangChain | Motor de evaluación, prompt hub | Equipos de LangChain/LangGraph |
| MLflow | 2018, Databricks, ahora Linux Foundation | Seguimiento de experimentos, registro de modelos | Trazado GenAI, jueces, registro de prompts | Equipos con ML clásico y LLMs |
Si tu equipo nunca abre un notebook de Jupyter, la mayor ventaja de MLflow es peso muerto. Esa única prueba lo elimina para la mayoría de los lectores de esta página.
¿Cuánto Código Cuesta Realmente Tu Primera Traza?
Unas dos líneas de Python para los tres, pero la fricción vive en lugares distintos. Langfuse y LangSmith piden claves de cuenta antes de que aterrice tu primera traza; MLflow pide un servidor de tracking corriendo. Menos líneas de código y menos trabajo no son lo mismo.
Tomamos la misma tarea, una llamada de chat de OpenAI más un ayudante, y la instrumentamos de tres formas desde el quickstart de cada vendor, releído el 5 de agosto de 2026.
Langfuse, mediante el decorador @observe:
# pip install langfuse
import os
from langfuse import observe
from langfuse.openai import openai # wrapper directo
os.environ["LANGFUSE_PUBLIC_KEY"] = "pk-lf-..."
os.environ["LANGFUSE_SECRET_KEY"] = "sk-lf-..."
os.environ["LANGFUSE_BASE_URL"] = "https://cloud.langfuse.com"
@observe()
def answer(question: str, context: str) -> str:
r = openai.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentLangSmith, mediante @traceable:
# pip install langsmith
import os
from langsmith import traceable
from openai import OpenAI
os.environ["LANGSMITH_TRACING"] = "true"
os.environ["LANGSMITH_API_KEY"] = "lsv2-..."
client = OpenAI()
@traceable
def answer(question: str, context: str) -> str:
r = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentMLflow, mediante mlflow.openai.autolog():
# pip install mlflow
import mlflow
from openai import OpenAI
mlflow.set_tracking_uri("http://localhost:5000") # el servidor debe estar corriendo
mlflow.openai.autolog()
def answer(question: str, context: str) -> str:
r = OpenAI().chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentLos conteos que derivamos de esos tres quickstarts:
| Herramienta | Paquetes de pip | Variables de entorno antes de la primera traza | Líneas de Python añadidas | Dónde aterriza la traza |
|---|---|---|---|---|
| Langfuse | 1 (langfuse) | 3 (clave pública, secreta, base URL) | 2 (cambio de import, @observe) | Langfuse Cloud o tu stack |
| LangSmith | 1 (langsmith) | 2 (clave API, flag de trazado) | 2 (import, @traceable) | Proyecto cloud de LangSmith |
| MLflow | 1 (mlflow) | 0 (no hace falta cuenta) | 2 (URI de tracking, autolog) | La base de datos de tu servidor de tracking |
Contado desde el quickstart de cada vendor, releído el 5 de agosto de 2026: docs del SDK de Langfuse, quickstart de observabilidad de LangSmith, quickstart de trazado de MLflow. openai es dependencia de la propia app, no cuenta. Recuéntalos tú mismo.
Nuestra interpretación, etiquetada como tal: el código es casi idéntico en los tres, así que ahí no vive la decisión. Langfuse y LangSmith concentran la fricción en cinco minutos de creación de cuenta. MLflow la concentra en la infraestructura: esa única línea asume un servidor de tracking, una base de datos detrás y alguien que mantenga ambos vivos. Su SDK ligero mlflow-tracing, que según MLflow es un 95% más pequeño que el paquete completo, recorta la instalación, no el servidor.
LLM-as-a-Judge: Mismo Método, Tres Sitios Distintos
Los tres ejecutan evaluadores LLM-as-a-judge sobre datasets, pero el motor de evaluación de LangSmith es el más productizado, Langfuse empareja jueces gestionados con colas de anotación y una GitHub Action para gating en CI, y MLflow ata los jueces a su herramienta de experimentos y optimización de prompts. La metodología es idéntica; la diferencia es dónde viven los resultados.
| Capacidad | Langfuse | LangSmith | MLflow |
|---|---|---|---|
| LLM-as-a-judge gestionado | Sí | Sí, la biblioteca más grande | Sí, jueces integrados |
| Evaluadores propios | SDK de Python/TS | Código propio + heurísticas | Evaluadores de código |
| Datasets y experimentos | Sí | Sí, función central | Sí, vía experimentos |
| Cola de anotación humana | Sí | Sí | Limitada |
| Gating en CI | GitHub Action | Motor de evaluación + API | Vía API |
| Optimización de prompts | No | No | Sí, basada en GEPA |
Según la documentación de evaluación de MLflow, sus jueces corren dentro del mismo sistema de seguimiento de experimentos que tus métricas de ML clásico, el beneficio del argumento de linaje de arriba: un solo panel para un modelo de churn y un agente de soporte. Según la documentación de Langfuse, los evaluadores se adjuntan a las trazas y alimentan colas de anotación que tu equipo trabaja en la UI.
Para el método, lee cómo evaluar salidas de LLM correctamente; para una visión más amplia del sector, las herramientas de evaluación que clasificamos. Los pipelines de agentes necesitan más cuidado que puntuar salidas, cubierto en cómo evaluar agentes en producción.
Gestión de Prompts: Solo Uno Versiona Prompts Junto a los Modelos
Corto a propósito, porque el detalle de las dos herramientas pertenece a nuestro artículo hermano. La forma de cada uno: Langfuse ofrece gestión de prompts con versionado, etiquetas y playground; LangSmith ofrece un prompt hub con versionado estilo commit; MLflow ofrece un registro de prompts que almacena prompts como entidades de primera clase junto a tus modelos.
La única diferencia relevante para la decisión: MLflow versiona prompts junto a las entradas del registro de modelos, de modo que un prompt y el modelo contra el que se ajustó comparten un mismo sistema de registro. Langfuse y LangSmith mantienen los prompts separados de lo que sirva tus modelos. Si promocionas modelo y prompt juntos y quieres una pista de auditoría que demuestre qué emparejamiento se desplegó, ese acoplamiento gana a cualquier playground. Para el detalle profundo de las dos herramientas, mira nuestro cara a cara completo de Langfuse vs LangSmith.
Autoalojamiento, Propiedad de los Datos y Cuánto Cuesta Irse
Langfuse se autoaloja como un stack multiservicio que controlas por completo, MLflow como un servidor de tracking más una base de datos que puedes consultar por SQL directamente, LangSmith solo bajo condiciones Enterprise. La pregunta de salida importa más que la de entrada: elijas la herramienta que elijas, el historial de trazas es la parte que no puedes recrear.
Realidad de despliegue por herramienta. Langfuse corre como web, worker, Postgres, ClickHouse y una capa de caché/blob desde su rediseño de la era ClickHouse, según el post de ingeniería de escala de Langfuse. Contexto que debes tener claro: ClickHouse adquirió Langfuse el 2026-01-16 junto a una Serie D de $400M, y ambos se comprometieron a que la licencia MIT, el autoalojamiento de primera clase y el roadmap no cambien (el comunicado de Langfuse). El autoalojamiento de LangSmith es asunto del plan Enterprise, según su documentación. MLflow es un servidor de tracking, una base de datos compatible con Postgres y almacenamiento de objetos.
Vías de salida, la sección que nadie más escribe. Langfuse exporta a almacenamiento de blobs como JSONL o Parquet mediante una exportación S3 documentada, más una API completa. El backend de MLflow es una base de datos abierta que puedes consultar directamente. La exportación masiva de LangSmith está detrás de los planes de pago. El veredicto: el lock-in de MLflow es el más recuperable, Langfuse cerca detrás, y LangSmith por debajo de Enterprise es donde una mala elección te cuesta tu historial.
SSO y RBAC condicionan el nivel Enterprise de Langfuse ($2,499/mes) y el plan Enterprise de LangSmith; con MLflow conectas tu propia autenticación, libertad y trabajo a partes iguales.
| Herramienta | Licencia de autoalojamiento | Servicios que operas | Retención por defecto | Vía de exportación | ¿Recuperable? |
|---|---|---|---|---|---|
| Langfuse | MIT | Web, worker, Postgres, ClickHouse, caché/blob | 30 d a 3 años según plan | Exportación a blob S3, JSONL/Parquet | Sí |
| LangSmith | Propietario | Solo despliegue Enterprise | 14 d base, 400 d extendida | Exportación masiva, planes de pago | Parcialmente |
| MLflow | Apache 2.0 | Servidor de tracking, BD, almacenamiento de objetos | Ilimitada | Consulta SQL a la BD del backend | Sí, del todo |
¿Cuánto Cuesta Cada Uno con 100K, 1M y 10M de Trazas?
Langfuse mide unidades, MLflow no mide nada, y LangSmith ya no publica un precio comparable por unidad. Unidades y trazas no son el mismo objeto; una petición de usuario puede ser una sola traza que contiene muchos eventos facturables. Solo dos de las tres columnas de abajo se pueden construir con precios de lista.
Ese último punto es un hallazgo, no un hueco en nuestra investigación. A fecha de 5 de agosto de 2026, la página de precios de LangChain pone Plus en $39 por asiento con 10K trazas base incluidas, y luego mide el uso a $1.50 por LCU (cómputo) y $1.00 por LSU (almacenamiento). Ya no hay una tarifa por cada 1K trazas en la página, ni una segunda página que la lleve. Por tanto, una factura de LangSmith a un volumen de trazas declarado no se puede derivar de los precios de lista, y no vamos a inventar una conversión.
| Volumen mensual | Langfuse Cloud | LangSmith | MLflow (autoalojado, estimación nuestra) |
|---|---|---|---|
| 100K | $29 (Core, incluido) | $39 asiento + 90K medidas, sin tarifa de lista | $30-50 |
| 1M | $101 (Core + 900K de exceso) | $39 asiento + 990K medidas, sin tarifa de lista | $60-120 |
| 10M | $731 (Core + 9.9M de exceso) | $39 asiento + 9.99M medidas, sin tarifa de lista | $150-400 |
Las cifras de Langfuse son precios de lista de su página de precios, leída el 5 de agosto de 2026, por el volumen mostrado. El precio por asiento y los niveles de retención de LangSmith vienen de la misma lectura, ese mismo día, de los precios de LangChain: trazas base con retención de 14 días, trazas extendidas a 400 días por una tarifa adicional que la página no cuantifica. La columna de MLflow es estimación nuestra, no un presupuesto del vendor: Postgres gestionado ($15-25/mes), almacenamiento de objetos y un contenedor siempre encendido ($10-20/mes), que crece con el historial almacenado.
Revisa nuestras cuentas donde hay cuentas que revisar. Langfuse publica un esquema de exceso escalonado: $8.00 por cada 100K unidades de 100K a 1M, $7.00 de 1M a 10M, $6.50 de 10M a 50M, $6.00 por encima de eso. A 1M: $29 más 900K unidades a $8 por 100K = $101. A 10M: $29, más 900K a $8 ($72), más 9,000K a $7 ($630) = $731.
Observa la diferencia de forma: LangSmith factura personas más consumo medido, los otros dos no. Si tu problema real es el gasto en tokens, un proxy de LiteLLM delante de tus modelos recorta la factura antes de que cualquiera de estas herramientas lo mida.
¿Puedes Correr Dos de Ellos a la Vez?
Sí. Langfuse y MLflow se construyen ambos sobre OpenTelemetry, así que un colector puede repartir los mismos spans GenAI entre dos backends. El emparejamiento realista: MLflow como sistema de registro del ciclo de vida de modelos, Langfuse como UX de trazas nativa de LLM. Técnicamente fácil; organizativamente, alguien tiene que ser dueño del colector.
El mecanismo: un colector OTel con dos exportadores OTLP, usando las convenciones semánticas GenAI para que ambos lados parseen los spans igual.
# Boceto ilustrativo, no una config de colector lista para copiar y pegar
exporters:
otlp/langfuse:
endpoint: https://cloud.langfuse.com/api/public/otel:443
headers:
Authorization: "Basic <base64 public_key:secret_key>"
otlp/mlflow:
endpoint: http://localhost:5000/otel # tu servidor de tracking de MLflow
service:
pipelines:
traces:
receivers: [otlp]
processors: [batch]
exporters: [otlp/langfuse, otlp/mlflow] # mismos spans, dos backendsEtiqueta esto con claridad: la disposición de arriba es nuestra interpretación arquitectónica, no una configuración soportada por los vendors. Leanware es la única otra página en esta SERP que menciona correr dos herramientas a la vez, en un párrafo. Desplegar en doble significa dos sistemas, dos facturas, almacenamiento duplicado y un colector que despierta a alguien a las 3 de la mañana.
Enviar trazas en doble es técnicamente fácil y organizativamente caro. El segundo backend es gratis hasta que alguien tiene que mantenerlo vivo.
Langfuse vs LangSmith vs MLflow: ¿Quién Debería Elegir Cuál?
Los pros y contras de langfuse vs langsmith vs mlflow se condensan en seis perfiles. Cada fila nombra una herramienta, porque «depende» sin elección es inútil.
| Tu situación | Elección | Por qué | A qué renuncias |
|---|---|---|---|
| Desarrollador en solitario o equipo pequeño, una app LLM | Langfuse | 50K unidades gratis, MIT, autoalojamiento cuando quieras | El pulido del autotrazado de LangChain |
| Equipo nativo de LangChain o LangGraph | LangSmith | Trazado sin configuración, la mejor UX de LangGraph | Coste por asiento, lock-in |
| Equipo de plataforma que despliega ML clásico y funcionalidades LLM | MLflow | Experimentos, registro y trazas en uno | UX nativa de LLM más joven |
| Empresa con mucha compliance (residencia, SSO) | Langfuse autoalojado | Los datos nunca salen de tu VPC | Operas cinco servicios |
| Tienda de Databricks o MLflow existente | MLflow | Ya desplegado, sin vendor nuevo | Las funcionalidades LLM maduran más lento |
| Equipo que quiere cero infraestructura | LangSmith | Alojado desde el minuto uno | Retención base de 14 días, asiento más tarifas medidas |
Si tu respuesta honesta es «ninguno de estos tres», las otras siete herramientas de las diez plataformas que clasificamos incluyen opciones alojadas y solo Enterprise que dejamos fuera de esta página.
Preguntas Frecuentes
¿Por qué usar MLflow para trazado LLM?
Usa MLflow para trazado LLM cuando tu equipo ya despliega modelos de ML clásico y quiere un único sistema de registro: seguimiento de experimentos, registro de modelos y trazado GenAI en una sola plataforma Apache-2.0, sin tarifa por traza. Si solo despliegas funcionalidades LLM, Langfuse o LangSmith te dan una experiencia más joven y pensada para LLM primero.
¿Se pueden usar LangSmith y MLflow juntos?
Sí. Ambos aceptan datos de trazas compatibles con OpenTelemetry, así que un colector OTel puede exportar los mismos spans a LangSmith y a un servidor de tracking de MLflow a la vez. El coste es operativo: dos backends, dos facturas, almacenamiento duplicado. La mayoría de los equipos con los que hablamos eligen un sistema de registro y se saltan el segundo.
¿LangSmith es open source?
No. LangSmith es software propietario de código cerrado de LangChain Inc. El SDK cliente de LangSmith es abierto, pero la plataforma, la UI y el backend no. Si te importa una licencia open source, Langfuse (MIT) y MLflow (Apache 2.0) son las dos opciones de esta comparación que puedes autoalojar libremente.
¿MLflow es solo para machine learning clásico?
No. MLflow añadió soporte GenAI de primera clase: mlflow.openai.autolog() traza llamadas de OpenAI automáticamente, @mlflow.trace cubre funciones propias y los jueces integrados evalúan salidas de LLM. La herencia del ML clásico se nota en la UX, menos nativa de LLM que la de Langfuse, pero el trazado en sí es de nivel producción.
¿MLflow es un orquestador de flujos como Airflow o Kubeflow?
No. MLflow no programa DAGs ni ejecuta pipelines; registra lo que hicieron tus ejecuciones: parámetros, métricas, artefactos y trazas. Airflow y Kubeflow orquestan trabajos, MLflow rastrea sus resultados. La gente confunde los tres porque coinciden en stacks de MLOps, pero están en capas distintas y a menudo corren juntos.
¿Cuáles son las alternativas open source a LangSmith y MLflow?
Langfuse (MIT) es la alternativa open source más cercana a LangSmith, con autoalojamiento y trazado nativo de OTel, y el propio MLflow es open source bajo Apache 2.0. Más allá de esta comparación, Lunary, Arize Phoenix y OpenLIT son opciones de observabilidad LLM open source que conviene mirar antes de comprometerte con una plataforma propietaria.
¿Cuál de los tres es el más barato con 10 millones de trazas al mes?
MLflow, contando solo infraestructura: nuestra estimación es de $150-400 al mes por Postgres, almacenamiento de objetos y un contenedor. Langfuse Cloud aterriza en $731 por 10M de unidades en Core más su exceso escalonado. LangSmith no se puede tarifar desde su página: desde mediados de 2026 LangChain publica tarifas por asiento y LCU/LSU, no un precio de lista por traza.
¿Langfuse reemplaza a MLflow, o al revés?
Ninguno reemplaza al otro limpiamente. Langfuse reemplaza las capas de trazado y evaluación de MLflow para equipos solo LLM y descarta la maquinaria de seguimiento de experimentos y registro de modelos. MLflow reemplaza a Langfuse cuando modelos de ML clásico comparten tu plataforma y un sistema de registro gana a dos. Se solapan en el trazado; divergen en todo lo que lo rodea.
¿Langfuse sigue siendo open source ahora que ClickHouse lo ha adquirido?
Sí, a fecha del anuncio del 2026-01-16. ClickHouse adquirió Langfuse junto a una Serie D de $400M, y ambas compañías se comprometieron públicamente a mantener la licencia MIT, el autoalojamiento de primera clase y un roadmap sin cambios. Eso es un compromiso público, no una garantía legal permanente, pero hoy nada de la historia del autoalojamiento ha cambiado.
Fuentes
Todas las fuentes de abajo son editoriales y dofollow; ninguna es pagada ni intercambiada.
| Fuente | Qué respalda |
|---|---|
| Docs de trazado de MLflow | Trazado OTel, autolog, @mlflow.trace, SDK ligero |
| Quickstart de trazado de MLflow | Pasos contados en la tabla de configuración |
| Docs de evaluación y monitoreo de MLflow | Jueces y el flujo de evaluación |
| Docs del registro de prompts de MLflow | Versionado de prompts |
| Docs del SDK de Python de Langfuse | @observe y variables de entorno requeridas |
| Docs de exportación a blob de Langfuse | Exportación S3, JSONL/Parquet |
| Precios de Langfuse | Unidades gratis, suelos de plan, precio por 100K |
| Precios de LangChain | Trazas base incluidas, precio de asiento Plus, medición LCU/LSU |
| Docs de LangSmith | @traceable, variables de entorno, nivel de autoalojamiento |
| OpenTelemetry y convenciones semánticas GenAI | El estándar detrás de la doble exportación |
| Blog de ingeniería de escala de Langfuse | Rediseño del modelo de datos de ClickHouse |
| ClickHouse adquiere Langfuse | Adquisición, 2026-01-16 |
| Langfuse: uniéndose a ClickHouse | Compromisos de MIT y autoalojamiento |
| Leanware: LangSmith vs MLflow | Único resultado editorial no vendor en la SERP |
| GitHub de MLflow, GitHub de Langfuse | Licencias Apache 2.0 / MIT, estrellas |
| MLflow: Top 5 herramientas de observabilidad | Página del vendor, citada como afirmaciones de MLflow |
Si Solo Recuerdas Tres Cosas
- Dos de las tres se construyeron para LLMs. MLflow se construyó en 2018 para ML clásico y aprendió trazado más tarde.
- Langfuse si quieres datos de trazas con licencia MIT y autoalojados que poseas por completo. LangSmith si tu app es LangChain o LangGraph. MLflow si modelos de ML clásico comparten tu plataforma.
- Haz primero la pregunta de salida: Langfuse exporta a S3, la base de datos de MLflow es tuya para consultarla, la exportación masiva de LangSmith está detrás de planes de pago.
- Con 10M de eventos al mes: $731 de precio de lista en Langfuse Cloud y $150-400 de infraestructura en MLflow (estimación nuestra). LangSmith no tiene una cifra comparable desde que dejó de publicar una tarifa por traza.
El veredicto, repetido: elige por linaje, no por funcionalidades. ¿Quieres una segunda opinión sobre cuál encaja en tu stack, o ayuda para conectarlo? Habla con Techsy. Elegimos estas herramientas para despliegues de agentes de clientes, encantados de decirte cuál y por qué.