
Langfuse vs LangSmith vs MLflow: Duas São Observabilidade, Uma É Plataforma de ML (2026)
Só duas das três ferramentas em langfuse vs langsmith vs mlflow foram feitas para observar LLMs. O MLflow nasceu em 2018 dentro da Databricks como rastreamento de experimentos para scikit-learn e XGBoost; o tracing de GenAI chegou em cima dessa base anos depois. Langfuse tem licença MIT e é LLM-native, LangSmith é proprietário e nativo da LangChain, MLflow é Apache-2.0 e mais velho que os dois. Quem decide aqui é a linhagem, não a lista de recursos. Veredito: Langfuse para ser dono dos seus dados, LangSmith para times LangGraph, MLflow se modelos clássicos compartilham a sua plataforma.
Principais Conclusões
- Langfuse se você quer um core MIT que dá para hospedar por conta própria, com propriedade total dos dados de trace. Repare que as pastas
ee/carregam termos comerciais separados, motivo pelo qual o GitHub reporta o repositório comoNOASSERTION, não como MIT. - LangSmith se o seu app é LangChain ou LangGraph e você aceita pagar por seat para ter a integração mais justa.
- MLflow se você também sobe modelos clássicos de ML e quer experiments, model registry e tracing num lugar só.
- Os três falam OpenTelemetry hoje, então rodar dois ao mesmo tempo é uma opção real.
Langfuse vs LangSmith vs MLflow em Resumo
Langfuse é a escolha open source, LangSmith é a escolha nativa da LangChain, e MLflow é a escolha quando o seu time roda ML clássico ao lado dos recursos de LLM. Duas delas são ferramentas de observabilidade de LLM. A terceira é uma plataforma de ML que aprendeu a fazer trace de LLMs, e essa diferença decide a maior parte dessas avaliações.
Chegou agora? Leia antes o nosso guia de observabilidade de IA.
| Dimensão | Langfuse | LangSmith | MLflow |
|---|---|---|---|
| Licença | Core MIT, ee/ sob termos comerciais | Proprietário | Apache 2.0, código aberto |
| Self-hosting | Sim, grátis | Só no plano Enterprise | Sim, grátis |
| Tracing de LLM | @observe, OTel nativo | @traceable, LangChain automático | autolog, @mlflow.trace |
| Avaliação / LLM-as-a-judge | Gerenciada + avaliadores custom | Motor de eval integrado | Judges + otimização de prompts |
| Gestão de prompts | Versionamento, labels, playground | Prompt hub | Prompt registry |
| Ciclo de vida de ML clássico | Não | Não | Experiments + model registry |
| Suporte a OpenTelemetry | Nativo | Ingestão compatível com OTel | Nativo, convenções GenAI |
| Plano gratuito | 50k unidades/mês, 30 dias | 5k traces/mês, 1 seat | Ilimitado, sua infra |
| Preço de entrada | $29/mês (Core) | $39/seat/mês (Plus) | $0, só infra |
| Retenção de dados | 30 d / 90 d / 3 anos por plano | 14 d base, 400 d estendida | Ilimitada, seu storage |
| Melhor para | Ser dono dos dados de trace | Times LangGraph-native | Plataformas mistas de ML + LLM |
Os números de retenção vêm dos vendors: as camadas de 30/90 dias/3 anos do Langfuse na página de preços dele, os 14 dias base e 400 dias estendidos do LangSmith nos preços da LangChain (estendido é um tipo de trace separado, com uma taxa adicional, não um botão de retenção), e o MLflow guarda os dados pelo tempo que o seu storage durar.
Três escolhas nomeadas:
- Escolha Langfuse se você quer código com licença MIT, self-hosting desde o dia um e dados de trace no seu próprio Postgres e ClickHouse.
- Escolha LangSmith se a sua stack é LangChain ou LangGraph e o preço por seat ganha do preço por trace.
- Escolha MLflow se modelos sklearn e XGBoost rodam ao lado dos seus recursos de LLM. Para o detalhe das duas ferramentas, veja nosso confronto completo Langfuse vs LangSmith.
Você Precisa de uma Ferramenta LLM-Native ou de uma Plataforma de ML?
A metade langfuse vs mlflow dessa query é, no fundo, uma pergunta de linhagem. MLflow começou como rastreamento de experimentos e model registry para ML clássico, depois adicionou tracing de LLM. Langfuse começou com tracing de LLM e não adicionou mais nada. Se você não sobe modelos clássicos, a maquinaria de ciclo de vida do MLflow é superfície que você mantém de graça, e uma ferramenta dedicada de observabilidade de IA é o caminho mais curto.
MLflow é o mais velho dos três de longe: licença Apache-2.0, governado pela Linux Foundation, mais de 27.000 estrelas no GitHub em 5 de agosto de 2026, feito para responder "quais hiperparâmetros produziram qual artefato?". O tracing GenAI dele chegou em cima dessa base. Para um time que roda tanto um modelo de churn XGBoost quanto um agente de suporte GPT-4o, isso compra um sistema de registro único: experiments, entradas de registry e traces de LLM no mesmo banco de dados.
O contrapeso: se você não sobe modelos clássicos, nada disso paga o aluguel. A UX LLM-native do MLflow é mais jovem que a do Langfuse, com menos atalhos e visualizações de trace mais brutas.
Um esclarecimento, porque o autocomplete mostra gente buscando kubeflow vs mlflow vs airflow: MLflow não é um orquestrador de workflows. Ele não agenda DAGs; ele registra o que as suas execuções fizeram. Airflow e Kubeflow rodam jobs, MLflow rastreia a saída deles. Sobre a questão de camada (mlflow vs tensorflow): TensorFlow é um framework de modelagem, MLflow fica acima de qualquer framework com que você treine. O comparativo da Leanware, o único resultado editorial não-vendor nessa SERP, faz a mesma divisão.
| Ferramenta | Origem | Feito primeiro para | Adicionado depois | Para quem serve |
|---|---|---|---|---|
| Langfuse | 2023, startup LLM-native | Tracing e evals de LLM | Gestão de prompts, export OTel | Times de produto só com LLM |
| LangSmith | 2023, da LangChain Inc. | Debug de LangChain | Motor de eval, prompt hub | Times de LangChain/LangGraph |
| MLflow | 2018, Databricks, hoje Linux Foundation | Rastreamento de experimentos, model registry | Tracing GenAI, judges, prompt registry | Times com ML clássico e LLMs |
Se o seu time nunca abre um Jupyter notebook, a maior vantagem do MLflow é peso morto. Esse único teste elimina a ferramenta para a maioria dos leitores desta página.
Quanto Código o Seu Primeiro Trace Realmente Exige?
Cerca de duas linhas de Python para os três, mas o atrito mora em lugares diferentes. Langfuse e LangSmith pedem chaves de conta antes do seu primeiro trace chegar; MLflow pede um servidor de tracking rodando. Menos linhas de código e menos trabalho não são a mesma coisa.
Pegamos a mesma tarefa, uma chamada de chat OpenAI mais um helper, e instrumentamos de três formas a partir do quickstart de cada vendor, relido em 5 de agosto de 2026.
Langfuse, via decorador @observe:
# pip install langfuse
import os
from langfuse import observe
from langfuse.openai import openai # drop-in wrapper
os.environ["LANGFUSE_PUBLIC_KEY"] = "pk-lf-..."
os.environ["LANGFUSE_SECRET_KEY"] = "sk-lf-..."
os.environ["LANGFUSE_BASE_URL"] = "https://cloud.langfuse.com"
@observe()
def answer(question: str, context: str) -> str:
r = openai.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentLangSmith, via @traceable:
# pip install langsmith
import os
from langsmith import traceable
from openai import OpenAI
os.environ["LANGSMITH_TRACING"] = "true"
os.environ["LANGSMITH_API_KEY"] = "lsv2-..."
client = OpenAI()
@traceable
def answer(question: str, context: str) -> str:
r = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentMLflow, via mlflow.openai.autolog():
# pip install mlflow
import mlflow
from openai import OpenAI
mlflow.set_tracking_uri("http://localhost:5000") # server must be running
mlflow.openai.autolog()
def answer(question: str, context: str) -> str:
r = OpenAI().chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentOs números que derivamos desses três quickstarts:
| Ferramenta | Pacotes pip | Variáveis de ambiente antes do primeiro trace | Linhas de Python adicionadas | Onde o trace vai parar |
|---|---|---|---|---|
| Langfuse | 1 (langfuse) | 3 (chave pública, secret, base URL) | 2 (troca de import, @observe) | Langfuse Cloud ou sua stack |
| LangSmith | 1 (langsmith) | 2 (chave de API, flag de tracing) | 2 (import, @traceable) | Projeto cloud do LangSmith |
| MLflow | 1 (mlflow) | 0 (sem conta) | 2 (URI de tracking, autolog) | Banco de dados do seu servidor de tracking |
Contados do quickstart de cada vendor, relidos em 5 de agosto de 2026: docs do SDK do Langfuse, quickstart de observabilidade do LangSmith, quickstart de tracing do MLflow. openai é dependência do próprio app, não entra na conta. Reconte você mesmo.
Nossa interpretação, etiquetada como tal: o código é quase idêntico nos três, então não é aí que mora a decisão. Langfuse e LangSmith concentram o atrito em cinco minutos de criação de conta. MLflow concentra na infraestrutura: aquele one-liner pressupõe um servidor de tracking, um banco de dados atrás dele e alguém para manter os dois vivos. O SDK enxuto mlflow-tracing dele, que segundo o MLflow é cerca de 95% menor que o pacote completo, reduz a instalação, não o servidor.
LLM-as-a-Judge: Mesmo Método, Três Moradas Diferentes
Os três rodam avaliadores LLM-as-a-judge sobre datasets, mas o motor de eval do LangSmith é o mais produtoizado, o Langfuse pareia judges gerenciados com filas de anotação e uma GitHub Action para gate de CI, e o MLflow amarra judges ao ferramental de experiments e otimização de prompts. A metodologia é idêntica; a diferença é onde os resultados moram.
| Capacidade | Langfuse | LangSmith | MLflow |
|---|---|---|---|
| LLM-as-a-judge gerenciado | Sim | Sim, maior biblioteca | Sim, judges integrados |
| Avaliadores próprios | SDK Python/TS | Código custom + heurísticas | Avaliadores em código |
| Datasets e experiments | Sim | Sim, recurso central | Sim, via experiments |
| Fila de anotação humana | Sim | Sim | Limitada |
| Gate de CI | GitHub Action | Motor de eval + API | Via API |
| Otimização de prompts | Não | Não | Sim, baseada em GEPA |
Segundo os docs de avaliação do MLflow, os judges dele rodam dentro do mesmo sistema de rastreamento de experimentos que as suas métricas de ML clássico, o payoff do argumento de linhagem acima: um dashboard para um modelo de churn e um agente de suporte. Segundo os docs do Langfuse, os avaliadores se anexam aos traces e alimentam filas de anotação que o seu time trabalha na UI.
Para o método, leia como avaliar saídas de LLM do jeito certo; para o panorama mais amplo, as ferramentas de avaliação que ranqueamos. Pipelines de agentes pedem cuidado além da nota da saída, coberto em avaliar agentes depois que estão em produção.
Gestão de Prompts: Só Um Versiona Prompts Junto com os Modelos
Curto de propósito, porque o detalhe das duas ferramentas pertence ao nosso post irmão. O formato de cada um: Langfuse oferece gestão de prompts com versionamento, labels e playground; LangSmith oferece um prompt hub com versionamento estilo commit; MLflow oferece um prompt registry que guarda prompts como entidades de primeira classe ao lado dos seus modelos.
A única diferença relevante para a decisão: o MLflow versiona prompts junto com as entradas do model registry, então um prompt e o modelo contra o qual ele foi ajustado compartilham um sistema de registro. Langfuse e LangSmith mantêm prompts separados do que quer que sirva os seus modelos. Se você promove modelo e prompt juntos e quer uma trilha de auditoria provando qual par foi ao ar, esse acoplamento ganha de qualquer playground. Para o detalhe profundo das duas ferramentas, veja nosso confronto completo Langfuse vs LangSmith.
Self-Hosting, Propriedade dos Dados e o Custo de Sair
Langfuse faz self-host como uma stack multi-serviço que você controla por completo, MLflow como um servidor de tracking mais um banco que você consulta direto por SQL, LangSmith só em termos Enterprise. A pergunta de saída importa mais que a de entrada: seja qual ferramenta você escolher, o histórico de traces é a parte que você não consegue recriar.
Realidade de deployment por ferramenta. Langfuse roda como web, worker, Postgres, ClickHouse e uma camada de cache/blob desde o redesign da era ClickHouse, segundo o post de engenharia de escala do Langfuse. Contexto que você deve ter claro: a ClickHouse adquiriu o Langfuse em 16/01/2026 junto com uma Série D de $400M, e as duas se comprometeram que a licença MIT, o self-hosting de primeira classe e o roadmap ficam iguais (comunicado do Langfuse). LangSmith self-hosted é assunto do plano Enterprise, segundo os docs dele. MLflow é um servidor de tracking, um banco compatível com Postgres e object storage.
Caminhos de saída, a seção que ninguém mais escreve. Langfuse exporta para blob storage como JSONL ou Parquet via um export S3 documentado, mais uma API completa. O backend do MLflow é um banco aberto que você consulta direto. O export em massa do LangSmith fica atrás dos planos pagos. O veredito: o lock-in do MLflow é o mais recuperável, Langfuse logo atrás, LangSmith abaixo do Enterprise é onde uma escolha errada custa o seu histórico.
SSO e RBAC fecham o tier Enterprise do Langfuse ($2.499/mês) e o plano Enterprise do LangSmith; com MLflow você mesmo monta a sua autenticação, liberdade e trabalho em partes iguais.
| Ferramenta | Licença de self-host | Serviços que você opera | Retenção padrão | Caminho de export | Recuperável? |
|---|---|---|---|---|---|
| Langfuse | MIT | Web, worker, Postgres, ClickHouse, cache/blob | 30 d a 3 anos por plano | Export S3 blob, JSONL/Parquet | Sim |
| LangSmith | Proprietário | Só deployment Enterprise | 14 d base, 400 d estendida | Export em massa, planos pagos | Parcialmente |
| MLflow | Apache 2.0 | Servidor de tracking, DB, object storage | Ilimitada | Query SQL direto no banco | Sim, totalmente |
Quanto Custa Cada Um com 100K, 1M e 10M de Traces?
Langfuse mede units, MLflow não mede nada, e LangSmith não publica mais um preço por unidade comparável. Units e traces não são o mesmo objeto; uma requisição de usuário pode ser um único trace contendo muitos eventos faturáveis. Só duas das três colunas abaixo podem ser montadas a partir de preços de tabela.
Esse último ponto é um achado, não uma lacuna da nossa pesquisa. Em 5 de agosto de 2026, a página de preços da LangChain coloca o Plus em $39 por seat com 10K traces base incluídos, e a partir daí mede o uso a $1.50 por LCU (compute) e $1.00 por LSU (storage). Não existe mais taxa por 1K traces na página, nem uma segunda página com uma. Uma fatura do LangSmith num volume de traces declarado, portanto, não dá para derivar de preços de tabela, e não vamos inventar uma conversão.
| Volume mensal | Langfuse Cloud | LangSmith | MLflow (self-hosted, nossa estimativa) |
|---|---|---|---|
| 100K | $29 (Core, incluso) | $39 de seat + 90K medidos, sem taxa de tabela | $30-50 |
| 1M | $101 (Core + 900K de excedente) | $39 de seat + 990K medidos, sem taxa de tabela | $60-120 |
| 10M | $731 (Core + 9,9M de excedente) | $39 de seat + 9,99M medidos, sem taxa de tabela | $150-400 |
Os números de Langfuse são preços de tabela da página de preços dele, lida em 5 de agosto de 2026, vezes o volume mostrado. O preço de seat e as camadas de retenção do LangSmith vêm da mesma leitura de preços da LangChain: traces base com retenção de 14 dias, traces estendidos a 400 dias por uma taxa adicional que a página não quantifica. A coluna do MLflow é estimativa nossa, não orçamento de vendor: Postgres gerenciado ($15-25/mês), object storage e um container sempre ligado ($10-20/mês), crescendo com o histórico armazenado.
Confira a nossa conta onde há conta para conferir. O Langfuse publica uma tabela de excedente graduada: $8.00 por 100K units de 100K a 1M, $7.00 de 1M a 10M, $6.50 de 10M a 50M, $6.00 acima disso. Em 1M: $29 mais 900K units a $8 por 100K = $101. Em 10M: $29, mais 900K a $8 ($72), mais 9.000K a $7 ($630) = $731.
Note a diferença de formato: LangSmith cobra por pessoas mais consumo medido, os outros dois não. Se o seu problema real é gasto com tokens, um proxy LiteLLM na frente dos seus modelos corta a conta antes de qualquer uma dessas ferramentas medir.
Dá para Rodar Dois Deles Juntos?
Sim. Langfuse e MLflow são ambos construídos sobre OpenTelemetry, então um collector pode mandar os mesmos spans GenAI para dois backends. O par realista: MLflow como sistema de registro do ciclo de vida de modelos, Langfuse como UX de trace LLM-native. Tecnicamente fácil; organizacionalmente, alguém precisa ser dono do collector.
O mecanismo: um collector OTel com dois exporters OTLP, usando as convenções semânticas GenAI para os dois lados parsearem spans do mesmo jeito.
# Illustrative sketch, not a copy-paste-complete collector config
exporters:
otlp/langfuse:
endpoint: https://cloud.langfuse.com/api/public/otel:443
headers:
Authorization: "Basic <base64 public_key:secret_key>"
otlp/mlflow:
endpoint: http://localhost:5000/otel # your MLflow tracking server
service:
pipelines:
traces:
receivers: [otlp]
processors: [batch]
exporters: [otlp/langfuse, otlp/mlflow] # same spans, two backendsEtiquete isso com clareza: o arranjo acima é a nossa interpretação arquitetural, não uma configuração suportada por vendor. Leanware é a única outra página nessa SERP que menciona rodar duas ferramentas, em um parágrafo. Duplo envio significa dois sistemas, duas contas, storage duplicado e um collector que acorda alguém às 3 da manhã.
Enviar traces em duplicidade é tecnicamente fácil e organizacionalmente caro. O segundo backend é grátis até alguém ter que mantê-lo vivo.
Langfuse vs LangSmith vs MLflow: Quem Deve Escolher Qual?
Os prós e contras de langfuse vs langsmith vs mlflow colapsam em seis perfis. Cada linha nomeia uma ferramenta, porque "depende" sem uma escolha é inútil.
| Sua situação | Escolha | Por quê | O que você perde |
|---|---|---|---|
| Dev solo ou time pequeno, um app LLM | Langfuse | 50K unidades grátis, MIT, self-host quando quiser | Polimento do auto-tracing de LangChain |
| Time LangChain ou LangGraph-native | LangSmith | Tracing sem configuração, melhor UX de LangGraph | Custo por seat, lock-in |
| Time de plataforma com ML clássico e LLM | MLflow | Experiments, registry e tracing num lugar só | UX LLM-native mais jovem |
| Enterprise com compliance pesada (residência, SSO) | Langfuse self-hosted | Dados nunca saem da sua VPC | Você opera cinco serviços |
| Casa que já usa Databricks ou MLflow | MLflow | Já implantado, nenhum vendor novo | Recursos de LLM amadurecem mais devagar |
| Time que quer zero infraestrutura | LangSmith | Hospedado desde o minuto um | Retenção base de 14 dias, seat mais taxas medidas |
Se a sua resposta honesta é "nenhum dos três", as outras sete ferramentas em as dez plataformas que ranqueamos incluem opções hospedadas e só-Enterprise que deixamos fora desta página.
Perguntas Frequentes
Por que usar MLflow para tracing de LLM?
Use MLflow para tracing de LLM quando o seu time já roda modelos clássicos de ML e quer um sistema de registro único: rastreamento de experimentos, model registry e tracing GenAI numa plataforma Apache-2.0 só, sem taxa por trace. Se você só roda recursos de LLM, Langfuse ou LangSmith entregam uma experiência mais jovem e LLM-first.
Dá para usar LangSmith e MLflow juntos?
Sim. Os dois aceitam dados de trace compatíveis com OpenTelemetry, então um collector OTel pode exportar os mesmos spans para o LangSmith e para um servidor de tracking MLflow ao mesmo tempo. O custo é operacional: dois backends, duas contas, storage duplicado. A maioria dos times com quem conversamos escolhe um sistema de registro e pula o segundo.
LangSmith é open source?
Não. LangSmith é software proprietário e fechado da LangChain Inc. O SDK cliente do LangSmith é aberto, mas a plataforma, a UI e o backend não são. Se uma licença open source importa para você, Langfuse (MIT) e MLflow (Apache 2.0) são as duas opções deste comparativo que você pode hospedar livremente.
MLflow é só para machine learning clássico?
Não. O MLflow adicionou suporte GenAI de primeira classe: mlflow.openai.autolog() rastreia chamadas OpenAI automaticamente, @mlflow.trace cobre funções custom, e judges integrados avaliam saídas de LLM. A herança de ML clássico aparece na UX, que é menos LLM-native que a do Langfuse, mas o tracing em si é nível produção.
MLflow é um orquestrador de workflows como Airflow ou Kubeflow?
Não. O MLflow não agenda DAGs nem roda pipelines; ele registra o que as suas execuções fizeram: parâmetros, métricas, artefatos e traces. Airflow e Kubeflow orquestram jobs, MLflow rastreia os resultados. As pessoas confundem os três porque eles coexistem em stacks de MLOps, mas ficam em camadas diferentes e muitas vezes rodam juntos.
Quais são as alternativas open source a LangSmith e MLflow?
Langfuse (MIT) é a alternativa open source mais próxima do LangSmith, com self-hosting e tracing OTel-native, e o próprio MLflow é open source sob Apache 2.0. Além deste comparativo, Lunary, Arize Phoenix e OpenLIT são opções open source de observabilidade de LLM que valem uma olhada antes de você fechar com uma plataforma proprietária.
Qual dos três é o mais barato com 10 milhões de traces por mês?
MLflow, contando só infraestrutura: nossa estimativa é $150-400 por mês para Postgres, object storage e um container. Langfuse Cloud fica em $731 para 10M de units no Core mais o excedente graduado. O LangSmith não dá para precificar a partir da página dele: desde meados de 2026 a LangChain publica taxas de seat e LCU/LSU, não uma taxa de tabela por trace.
Langfuse substitui o MLflow, ou o contrário?
Nenhum substitui o outro de forma limpa. Langfuse substitui as camadas de tracing e eval do MLflow para times só de LLM e dispensa a maquinaria de rastreamento de experimentos e model registry. MLflow substitui o Langfuse quando modelos clássicos de ML compartilham a sua plataforma e um sistema de registro ganha de dois. Eles se sobrepõem no tracing; divergem em tudo ao redor.
Langfuse ainda é open source agora que a ClickHouse adquiriu?
Sim, desde o comunicado de 16/01/2026. A ClickHouse adquiriu o Langfuse junto com uma Série D de $400M, e as duas empresas se comprometeram publicamente a manter a licença MIT, o self-hosting de primeira classe e um roadmap inalterado. Isso é um compromisso público, não uma garantia legal permanente, mas hoje nada mudou na história do self-hosted.
Fontes
Toda fonte abaixo é editorial e dofollow; nenhuma é paga ou permutada.
| Fonte | O que embasa |
|---|---|
| Docs de Tracing do MLflow | Tracing OTel, autolog, @mlflow.trace, SDK enxuto |
| Quickstart de tracing do MLflow | Passos contados na tabela de setup |
| Docs de eval e monitoramento do MLflow | Judges e o fluxo de eval |
| Docs do prompt registry do MLflow | Versionamento de prompts |
| Docs do SDK Python do Langfuse | @observe e variáveis de ambiente obrigatórias |
| Docs de export blob do Langfuse | Export S3, JSONL/Parquet |
| Preços do Langfuse | Units grátis, piso dos planos, preço por 100K |
| Preços da LangChain | Traces base incluídos, preço de seat Plus, medição LCU/LSU |
| Docs do LangSmith | @traceable, variáveis de ambiente, tier self-host |
| OpenTelemetry e convenções semânticas GenAI | O padrão por trás do duplo export |
| Blog de engenharia de escala do Langfuse | Redesign do modelo de dados ClickHouse |
| ClickHouse adquire o Langfuse | Aquisição, 16/01/2026 |
| Langfuse: juntando-se à ClickHouse | Compromissos de MIT e self-hosting |
| Leanware: LangSmith vs MLflow | Único resultado editorial não-vendor na SERP |
| GitHub do MLflow, GitHub do Langfuse | Licenças Apache 2.0 / MIT, estrelas |
| MLflow: Top 5 Ferramentas de Observabilidade | Página de vendor, citada como alegações do MLflow |
Se Você Só Lembrar de Três Coisas
- Duas das três foram feitas para LLMs. O MLflow nasceu em 2018 para ML clássico e aprendeu tracing depois.
- Langfuse se você quer dados de trace self-hosted com licença MIT, seus por completo. LangSmith se o seu app é LangChain ou LangGraph. MLflow se modelos clássicos de ML compartilham a sua plataforma.
- Faça a pergunta de saída primeiro: Langfuse exporta para S3, o banco do MLflow é seu para consultar, o export em massa do LangSmith fica atrás de planos pagos.
- Com 10M de eventos por mês: $731 no preço de tabela do Langfuse Cloud e $150-400 de infraestrutura no MLflow (nossa estimativa). O LangSmith não tem uma cifra comparável desde que parou de publicar uma taxa por trace.
O veredito, repetido: escolha pela linhagem, não pelos recursos. Quer uma segunda opinião sobre qual encaixa na sua stack, ou ajuda para plugar tudo? Fale com a Techsy. Nós escolhemos essas ferramentas para deployments de agentes de clientes e temos prazer em dizer qual e por quê.