
Langfuse vs LangSmith vs MLflow : deux outils d'observabilité, une plateforme ML (2026)
Sur les trois outils de langfuse vs langsmith vs mlflow, deux seulement ont été conçus pour surveiller des LLM. MLflow est sorti en 2018 chez Databricks comme suivi d'expériences pour scikit-learn et XGBoost ; le traçage GenAI est arrivé par-dessus cette base des années plus tard. Langfuse est sous licence MIT et natif LLM, LangSmith est propriétaire et natif de LangChain, MLflow est sous Apache-2.0 et plus ancien que les deux autres. C'est le lignage, pas la liste des fonctionnalités, qui tranche cette comparaison. Verdict : Langfuse pour garder la propriété de vos données, LangSmith pour les équipes LangGraph, MLflow si des modèles classiques partagent votre plateforme.
Points clés
- Langfuse si vous voulez un cœur MIT auto-hébergeable et une propriété totale de vos données de traces. Notez que ses dossiers
ee/relèvent de conditions commerciales séparées, ce qui explique pourquoi GitHub classe le dépôt enNOASSERTIONplutôt qu'en MIT. - LangSmith si votre application repose sur LangChain ou LangGraph et que vous acceptez de payer par siège pour l'intégration la plus aboutie.
- MLflow si vous livrez aussi des modèles de ML classiques et voulez expériences, registre de modèles et traçage au même endroit.
- Les trois parlent désormais OpenTelemetry, donc en faire tourner deux en parallèle est une option réaliste.
Langfuse vs LangSmith vs MLflow en un coup d'œil
Langfuse est le choix open source, LangSmith le choix natif LangChain, et MLflow le choix quand votre équipe livre du ML classique à côté de ses fonctionnalités LLM. Deux de ces outils sont des outils d'observabilité LLM. Le troisième est une plateforme ML qui a appris à tracer les LLM, et cette différence tranche la plupart de ces évaluations.
Vous débutez ? Lisez d'abord notre guide d'introduction à l'observabilité IA.
| Dimension | Langfuse | LangSmith | MLflow |
|---|---|---|---|
| Licence | Cœur MIT, ee/ sous conditions commerciales | Propriétaire | Apache 2.0, open source |
| Auto-hébergement | Oui, gratuit | Plan Enterprise uniquement | Oui, gratuit |
| Traçage LLM | @observe, natif OTel | @traceable, auto LangChain | autolog, @mlflow.trace |
| Évaluation / LLM-as-a-judge | Juges managés + évaluateurs custom | Moteur d'éval intégré | Juges + optimisation de prompts |
| Gestion des prompts | Versioning, labels, playground | Prompt hub | Registre de prompts |
| Cycle de vie ML classique | Non | Non | Expériences + registre de modèles |
| Support OpenTelemetry | Natif | Ingestion compatible OTel | Natif, conventions GenAI |
| Plan gratuit | 50k unités/mois, 30 jours | 5K traces/mois, 1 siège | Illimité, votre infra |
| Premier palier payant | $29/mois (Core) | $39/siège/mois (Plus) | $0, infra seule |
| Rétention des données | 30 j / 90 j / 3 ans selon plan | 14 j de base, 400 j étendue | Illimitée, votre stockage |
| Idéal pour | Posséder ses données de traces | Équipes natives LangGraph | Plateformes mixtes ML + LLM |
Les chiffres de rétention viennent des éditeurs : les paliers 30/90 jours/3 ans de Langfuse selon sa page de tarifs, les 14 jours de base et 400 jours étendus de LangSmith selon les tarifs LangChain (l'étendu est un type de trace au prix doublé, pas un interrupteur de rétention), et MLflow garde les données aussi longtemps que votre stockage le permet.
Trois choix nommés :
- Choisissez Langfuse si vous voulez du code sous licence MIT, un auto-hébergement dès le premier jour, et des données de traces dans vos propres Postgres et ClickHouse.
- Choisissez LangSmith si votre stack est LangChain ou LangGraph et que la tarification par siège l'emporte sur la tarification à la trace.
- Choisissez MLflow si des modèles sklearn et XGBoost tournent à côté de vos fonctionnalités LLM. Pour le détail à deux outils, voyez notre duel Langfuse vs LangSmith complet.
Avez-vous besoin d'un outil natif LLM ou d'une plateforme ML ?
La moitié langfuse vs mlflow de cette requête est en réalité une question de lignage. MLflow a commencé par le suivi d'expériences et un registre de modèles pour le ML classique, puis a ajouté le traçage LLM. Langfuse a commencé par le traçage LLM et n'a rien ajouté d'autre. Si vous ne livrez aucun modèle classique, la machinerie de cycle de vie de MLflow est de la surface à maintenir pour rien, et un outil d'observabilité IA dédié est le chemin le plus court.
MLflow est de loin le plus ancien des trois : licence Apache-2.0, gouvernance Linux Foundation, plus de 27 000 étoiles GitHub au 5 août 2026, construit pour répondre à « quels hyperparamètres ont produit quel artefact ? ». Son traçage GenAI est arrivé par-dessus cette base. Pour une équipe qui livre à la fois un modèle de churn XGBoost et un agent de support GPT-4o, cela offre un système de référence unique : expériences, entrées de registre et traces LLM dans la même base.
Le contrepoids : ne livrez aucun modèle classique et rien de tout cela ne paie son loyer. L'UX native LLM de MLflow est plus jeune que celle de Langfuse : moins de raccourcis, des vues de traces plus rugueuses.
Une précision, car l'autocomplétion montre des gens qui cherchent kubeflow vs mlflow vs airflow : MLflow n'est pas un orchestrateur de workflows. Il ne planifie pas de DAG ; il enregistre ce que vos exécutions ont fait. Airflow et Kubeflow exécutent des jobs, MLflow piste leurs sorties. Sur la question des couches (mlflow vs tensorflow) : TensorFlow est un framework de modélisation, MLflow se place au-dessus de n'importe quel framework d'entraînement. La comparaison de Leanware, le seul résultat éditorial non-éditeur sur cette SERP, fait la même distinction.
| Outil | Origine | Conçu d'abord pour | Ajouté ensuite | À qui cela convient |
|---|---|---|---|---|
| Langfuse | 2023, startup native LLM | Traçage et évals LLM | Gestion des prompts, export OTel | Équipes produit 100% LLM |
| LangSmith | 2023, par LangChain Inc. | Débogage LangChain | Moteur d'éval, prompt hub | Équipes LangChain/LangGraph |
| MLflow | 2018, Databricks, désormais Linux Foundation | Suivi d'expériences, registre de modèles | Traçage GenAI, juges, registre de prompts | Équipes avec ML classique et LLM |
Si votre équipe n'ouvre jamais de notebook Jupyter, le plus gros avantage de MLflow est du poids mort. Ce seul test l'élimine pour la plupart des lecteurs de cette page.
Combien de code demande réellement votre première trace ?
Environ deux lignes de Python pour les trois, mais la friction se niche à des endroits différents. Langfuse et LangSmith demandent des clés de compte avant que votre première trace n'atterrisse ; MLflow demande un serveur de tracking en marche. Le moins de lignes de code et le moins de travail ne sont pas la même chose.
Nous avons pris la même tâche, un appel de chat OpenAI plus un helper, et nous l'avons instrumentée de trois façons à partir des quickstarts de chaque éditeur, relus le 5 août 2026.
Langfuse, via le décorateur @observe :
# pip install langfuse
import os
from langfuse import observe
from langfuse.openai import openai # drop-in wrapper
os.environ["LANGFUSE_PUBLIC_KEY"] = "pk-lf-..."
os.environ["LANGFUSE_SECRET_KEY"] = "sk-lf-..."
os.environ["LANGFUSE_BASE_URL"] = "https://cloud.langfuse.com"
@observe()
def answer(question: str, context: str) -> str:
r = openai.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentLangSmith, via @traceable :
# pip install langsmith
import os
from langsmith import traceable
from openai import OpenAI
os.environ["LANGSMITH_TRACING"] = "true"
os.environ["LANGSMITH_API_KEY"] = "lsv2-..."
client = OpenAI()
@traceable
def answer(question: str, context: str) -> str:
r = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentMLflow, via mlflow.openai.autolog() :
# pip install mlflow
import mlflow
from openai import OpenAI
mlflow.set_tracking_uri("http://localhost:5000") # server must be running
mlflow.openai.autolog()
def answer(question: str, context: str) -> str:
r = OpenAI().chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentLes comptes que nous avons tirés de ces trois quickstarts :
| Outil | Paquets pip | Variables d'env avant la première trace | Lignes de Python ajoutées | Où atterrit la trace |
|---|---|---|---|---|
| Langfuse | 1 (langfuse) | 3 (clé publique, secret, URL de base) | 2 (échange d'import, @observe) | Langfuse Cloud ou votre stack |
| LangSmith | 1 (langsmith) | 2 (clé API, drapeau de tracing) | 2 (import, @traceable) | Projet cloud LangSmith |
| MLflow | 1 (mlflow) | 0 (aucun compte requis) | 2 (URI de tracking, autolog) | La base de votre serveur de tracking |
Compté depuis le quickstart de chaque éditeur, relu le 5 août 2026 : docs SDK Langfuse, quickstart observabilité LangSmith, quickstart traçage MLflow. openai est la dépendance de l'application elle-même, non comptée. Recomptez vous-même.
Notre interprétation, étiquetée comme telle : le code est quasi identique chez les trois, donc ce n'est pas là que se joue la décision. Langfuse et LangSmith concentrent la friction dans cinq minutes de création de compte. MLflow la concentre dans l'infrastructure : cette ligne unique suppose un serveur de tracking, une base derrière, et quelqu'un pour maintenir les deux en vie. Son SDK mlflow-tracing allégé, dont MLflow dit qu'il pèse environ 95 % de moins que le paquet complet, réduit l'installation, pas le serveur.
LLM-as-a-Judge : même méthode, trois foyers différents
Les trois exécutent des évaluateurs LLM-as-a-judge sur des jeux de données, mais le moteur d'éval de LangSmith est le plus abouti, Langfuse associe juges managés, files d'annotation et une GitHub Action pour le gating CI, et MLflow attache ses juges à son outillage d'expériences et d'optimisation de prompts. La méthodologie est identique ; la différence, c'est l'endroit où vivent les résultats.
| Capacité | Langfuse | LangSmith | MLflow |
|---|---|---|---|
| LLM-as-a-judge managé | Oui | Oui, plus grande bibliothèque | Oui, juges intégrés |
| Évaluateurs maison | SDK Python/TS | Code custom + heuristiques | Évaluateurs code |
| Jeux de données et expériences | Oui | Oui, fonctionnalité centrale | Oui, via les expériences |
| File d'annotation humaine | Oui | Oui | Limité |
| Gating CI | GitHub Action | Moteur d'éval + API | Piloté par API |
| Optimisation de prompts | Non | Non | Oui, basée sur GEPA |
Selon les docs d'évaluation de MLflow, ses juges tournent dans le même système de suivi d'expériences que vos métriques de ML classique, le bénéfice de l'argument de lignage ci-dessus : un seul tableau de bord pour un modèle de churn et un agent de support. Selon les docs de Langfuse, les évaluateurs s'attachent aux traces et alimentent des files d'annotation que votre équipe traite dans l'UI.
Pour la méthode, lisez comment évaluer correctement les sorties LLM ; pour le panorama plus large, les outils d'évaluation que nous recommandons. Les pipelines d'agents demandent plus de soin que le seul scoring des sorties, un sujet couvert dans évaluer les agents une fois en production.
Gestion des prompts : un seul versionne les prompts aux côtés des modèles
Court volontairement, car le détail à deux outils appartient à notre article frère. L'offre de chacun : Langfuse propose une gestion des prompts avec versioning, labels et playground ; LangSmith propose un prompt hub avec un versioning de type commit ; MLflow propose un registre de prompts qui les stocke comme des entités de premier ordre à côté de vos modèles.
La seule différence qui pèse dans la décision : MLflow versionne les prompts aux côtés des entrées du registre de modèles, si bien qu'un prompt et le modèle pour lequel il a été ajusté partagent le même système de référence. Langfuse et LangSmith gardent les prompts séparés de ce qui sert vos modèles. Si vous promouvez le modèle et le prompt ensemble et voulez une piste d'audit prouvant quel appariement a été livré, ce couplage bat n'importe quel playground. Pour le détail approfondi à deux outils, voyez notre duel Langfuse vs LangSmith complet.
Auto-hébergement, propriété des données et ce que coûte un départ
Langfuse s'auto-héberge comme un stack multi-services que vous contrôlez entièrement, MLflow comme un serveur de tracking plus une base interrogeable directement en SQL, LangSmith uniquement à des conditions enterprise. La question de la sortie compte plus que celle de l'entrée : quel que soit l'outil choisi, l'historique de traces est la partie que vous ne pouvez pas recréer.
La réalité du déploiement, outil par outil. Langfuse tourne avec un web, un worker, Postgres, ClickHouse et une couche cache/blob depuis sa refonte de l'ère ClickHouse, selon le billet d'ingénierie scale de Langfuse. Le contexte à avoir en tête : ClickHouse a acquis Langfuse le 2026-01-16 en parallèle d'une Série D de $400M, et les deux se sont engagés à maintenir inchangés la licence MIT, l'auto-hébergement de premier ordre et la roadmap (le communiqué de Langfuse). L'auto-hébergement de LangSmith relève du plan enterprise, selon sa doc. MLflow est un serveur de tracking, une base compatible Postgres et du stockage objet.
Les chemins de sortie, la section que personne d'autre n'écrit. Langfuse exporte vers du stockage blob en JSONL ou Parquet via un export S3 documenté, plus une API complète. Le backend de MLflow est une base ouverte que vous pouvez interroger directement. L'export en masse de LangSmith se cache derrière les plans payants. Le verdict : l'enfermement de MLflow est le plus récupérable, Langfuse juste derrière, et sous l'enterprise, LangSmith est l'endroit où un mauvais choix vous coûte votre historique.
Le SSO et le RBAC conditionnent le palier Enterprise de Langfuse ($2,499/mois) et le plan Enterprise de LangSmith ; avec MLflow, vous branchez votre propre auth, liberté et travail à parts égales.
| Outil | Licence auto-hébergée | Services à opérer | Rétention par défaut | Chemin d'export | Récupérable ? |
|---|---|---|---|---|---|
| Langfuse | MIT | Web, worker, Postgres, ClickHouse, cache/blob | 30 j à 3 ans selon plan | Export blob S3, JSONL/Parquet | Oui |
| LangSmith | Propriétaire | Déploiement enterprise uniquement | 14 j de base, 400 j étendue | Export en masse, plans payants | Partiellement |
| MLflow | Apache 2.0 | Serveur de tracking, DB, stockage objet | Illimitée | Requête SQL sur la base backend | Oui, entièrement |
Combien coûte chacun à 100K, 1M et 10M de traces ?
Langfuse facture des unités, MLflow ne facture rien, et LangSmith ne publie plus de prix unitaire comparable du tout. Les unités et les traces ne sont pas le même objet ; une requête utilisateur peut être une seule trace contenant de nombreux événements facturables. Seules deux des trois colonnes ci-dessous peuvent être construites à partir de prix catalogue.
Ce dernier point est un constat, pas un trou dans notre recherche. Au 5 août 2026, la page tarifs de LangChain affiche Plus à $39 par siège avec 10K traces de base incluses, puis facture l'usage à $1.50 par LCU (calcul) et $1.00 par LSU (stockage). Il n'y a plus de tarif au 1K traces sur la page, ni de seconde page qui en porterait un. Une facture LangSmith à un volume de traces donné n'est donc pas dérivable des prix catalogue, et nous n'allons pas inventer une conversion.
| Volume mensuel | Langfuse Cloud | LangSmith | MLflow (auto-hébergé, notre estimation) |
|---|---|---|---|
| 100K | $29 (Core, inclus) | $39 siège + 90K mesurés, pas de tarif catalogue | $30-50 |
| 1M | $101 (Core + 900K de dépassement) | $39 siège + 990K mesurés, pas de tarif catalogue | $60-120 |
| 10M | $731 (Core + 9.9M de dépassement) | $39 siège + 9.99M mesurés, pas de tarif catalogue | $150-400 |
Les chiffres Langfuse sont les prix catalogue de sa page tarifs, lue le 5 août 2026, multipliés par le volume indiqué. Le prix par siège et les paliers de rétention de LangSmith viennent de la même lecture, ce jour-là, des tarifs LangChain : traces de base à rétention 14 jours, traces étendues à 400 jours pour un supplément que la page ne chiffre pas. La colonne MLflow est notre estimation, pas un devis d'éditeur : Postgres managé ($15-25/mois), stockage objet et un conteneur toujours allumé ($10-20/mois), qui grandit avec l'historique stocké.
Vérifiez nos calculs là où il y a des calculs à vérifier. Langfuse publie un barème de dépassement progressif : $8.00 par 100K unités de 100K à 1M, $7.00 de 1M à 10M, $6.50 de 10M à 50M, $6.00 au-delà. À 1M : $29 plus 900K unités à $8 par 100K = $101. À 10M : $29, plus 900K à $8 ($72), plus 9 000K à $7 ($630) = $731.
Notez la différence de forme : LangSmith facture des personnes plus de la consommation mesurée, les deux autres non. Si votre vrai problème est la dépense de tokens, un proxy LiteLLM devant vos modèles coupe la facture avant qu'aucun de ces outils ne la mesure.
Peut-on en faire tourner deux ensemble ?
Oui. Langfuse et MLflow s'appuient tous deux sur OpenTelemetry, si bien qu'un collecteur peut ventiler les mêmes spans GenAI vers deux backends. Le duo réaliste : MLflow comme système de référence du cycle de vie des modèles, Langfuse comme UX de traces native LLM. Techniquement facile ; côté organisation, quelqu'un doit posséder le collecteur.
Le mécanisme : un collecteur OTel avec deux exporters OTLP, qui utilise les conventions sémantiques GenAI pour que les deux côtés parsent les spans de la même façon.
# Illustrative sketch, not a copy-paste-complete collector config
exporters:
otlp/langfuse:
endpoint: https://cloud.langfuse.com/api/public/otel:443
headers:
Authorization: "Basic <base64 public_key:secret_key>"
otlp/mlflow:
endpoint: http://localhost:5000/otel # your MLflow tracking server
service:
pipelines:
traces:
receivers: [otlp]
processors: [batch]
exporters: [otlp/langfuse, otlp/mlflow] # same spans, two backendsÉtiquette claire : le montage ci-dessus est notre interprétation architecturale, pas une configuration supportée par un éditeur. Leanware est la seule autre page de cette SERP à mentionner l'usage de deux outils, en un paragraphe. Le double envoi, c'est deux systèmes, deux factures, du stockage dupliqué, et un collecteur qui réveille quelqu'un à 3h du matin.
Le double envoi de traces est techniquement facile et organisationnellement coûteux. Le second backend est gratuit jusqu'à ce que quelqu'un doive le maintenir en vie.
Langfuse vs LangSmith vs MLflow : qui doit choisir lequel ?
Les avantages et inconvénients de langfuse vs langsmith vs mlflow se ramènent à six profils. Chaque ligne nomme un outil, car « ça dépend » sans choix ne sert à rien.
| Votre situation | Choix | Pourquoi | Ce que vous abandonnez |
|---|---|---|---|
| Dev solo ou petite équipe, une app LLM | Langfuse | 50K unités gratuites, MIT, auto-hébergement possible à tout moment | Le fini de l'auto-tracing LangChain |
| Équipe native LangChain ou LangGraph | LangSmith | Traçage zéro config, meilleure UX LangGraph | Coût par siège, enfermement |
| Équipe plateforme livrant ML classique et fonctionnalités LLM | MLflow | Expériences, registre et traçage réunis | UX native LLM plus jeune |
| Enterprise à forte compliance (résidence, SSO) | Langfuse auto-hébergé | Les données ne quittent jamais votre VPC | Vous opérez cinq services |
| Boutique Databricks ou MLflow existante | MLflow | Déjà en place, aucun nouvel éditeur | Fonctionnalités LLM plus lentes à mûrir |
| Équipe qui veut zéro infrastructure | LangSmith | Hébergé dès la première minute | Rétention de base de 14 jours, siège plus frais mesurés |
Si votre réponse honnête est « aucun des trois », les sept autres outils parmi les dix plateformes que nous avons classées incluent des options hébergées et réservées à l'enterprise que nous avons laissées hors de cette page.
Questions fréquemment posées
Pourquoi utiliser MLflow pour le traçage LLM ?
Utilisez MLflow pour le traçage LLM quand votre équipe livre déjà des modèles de ML classiques et veut un système de référence unique : suivi d'expériences, registre de modèles et traçage GenAI dans une seule plateforme Apache-2.0, sans frais par trace. Si vous ne livrez que des fonctionnalités LLM, Langfuse ou LangSmith vous offrent une expérience plus jeune, LLM d'abord.
Peut-on utiliser LangSmith et MLflow ensemble ?
Oui. Les deux acceptent des données de traces compatibles OpenTelemetry, donc un collecteur OTel peut exporter les mêmes spans vers LangSmith et un serveur de tracking MLflow à la fois. Le coût est opérationnel : deux backends, deux factures, du stockage dupliqué. La plupart des équipes à qui nous parlons choisissent un système de référence et se passent du second.
LangSmith est-il open source ?
Non. LangSmith est un logiciel propriétaire et fermé de LangChain Inc. Le SDK client LangSmith est ouvert, mais la plateforme, l'UI et le backend ne le sont pas. Si une licence open source compte pour vous, Langfuse (MIT) et MLflow (Apache 2.0) sont les deux options de cette comparaison que vous pouvez auto-héberger librement.
MLflow est-il réservé au machine learning classique ?
Non. MLflow a ajouté un support GenAI de premier ordre : mlflow.openai.autolog() trace automatiquement les appels OpenAI, @mlflow.trace couvre les fonctions custom, et des juges intégrés évaluent les sorties LLM. L'héritage ML classique se voit dans l'UX, moins native LLM que celle de Langfuse, mais le traçage lui-même est de niveau production.
MLflow est-il un orchestrateur de workflows comme Airflow ou Kubeflow ?
Non. MLflow ne planifie pas de DAG et n'exécute pas de pipelines ; il enregistre ce que vos exécutions ont fait : paramètres, métriques, artefacts et traces. Airflow et Kubeflow orchestrent des jobs, MLflow piste leurs résultats. Les gens confondent les trois car ils cohabitent dans les stacks MLOps, mais ils siègent à des couches différentes et tournent souvent ensemble.
Quelles sont les alternatives open source à LangSmith et MLflow ?
Langfuse (MIT) est l'alternative open source la plus proche de LangSmith, avec auto-hébergement et traçage natif OTel, et MLflow lui-même est open source sous Apache 2.0. Au-delà de cette comparaison, Lunary, Arize Phoenix et OpenLIT sont des options d'observabilité LLM open source qui méritent un regard avant de vous engager sur une plateforme propriétaire.
Lequel des trois est le moins cher à 10 millions de traces par mois ?
MLflow, en ne comptant que l'infrastructure : notre estimation est de $150-400 par mois pour Postgres, le stockage objet et un conteneur. Langfuse Cloud atterrit à $731 pour 10M d'unités sur Core plus son dépassement progressif. LangSmith ne peut pas être chiffré depuis sa page : depuis mi-2026, LangChain publie des tarifs de siège et de LCU/LSU, pas un prix catalogue par trace.
Langfuse remplace-t-il MLflow, ou l'inverse ?
Aucun ne remplace l'autre proprement. Langfuse remplace les couches de traçage et d'éval de MLflow pour les équipes 100% LLM et abandonne la machinerie de suivi d'expériences et de registre de modèles. MLflow remplace Langfuse quand des modèles de ML classiques partagent votre plateforme et qu'un système de référence bat deux. Ils se chevauchent sur le traçage ; ils divergent sur tout ce qui l'entoure.
Langfuse est-il toujours open source maintenant que ClickHouse l'a acquis ?
Oui, à la date de l'annonce du 2026-01-16. ClickHouse a acquis Langfuse en parallèle d'une Série D de $400M, et les deux entreprises se sont engagées publiquement à conserver la licence MIT, un auto-hébergement de premier ordre et une roadmap inchangée. C'est un engagement public, pas une garantie légale permanente, mais aujourd'hui rien n'a changé dans l'histoire de l'auto-hébergement.
Sources
Chaque source ci-dessous est éditoriale et dofollow ; aucune n'est payée ni échangée.
| Source | Ce qu'elle étaye |
|---|---|
| Docs MLflow Tracing | Traçage OTel, autolog, @mlflow.trace, SDK allégé |
| Quickstart traçage MLflow | Étapes comptées dans le tableau d'installation |
| Docs éval et monitoring MLflow | Juges et workflow d'éval |
| Docs registre de prompts MLflow | Versioning des prompts |
| Docs SDK Python Langfuse | @observe et variables d'env requises |
| Docs export blob Langfuse | Export S3, JSONL/Parquet |
| Tarifs Langfuse | Unités gratuites, planchers de plan, prix par 100K |
| Tarifs LangChain | Traces de base incluses, prix de siège Plus, mesure LCU/LSU |
| Docs LangSmith | @traceable, variables d'env, palier auto-hébergé |
| OpenTelemetry et conventions sémantiques GenAI | Le standard derrière le double export |
| Blog ingénierie scale Langfuse | Refonte du modèle de données ClickHouse |
| ClickHouse acquiert Langfuse | Acquisition, 2026-01-16 |
| Langfuse : rejoindre ClickHouse | Engagements MIT et auto-hébergement |
| Leanware : LangSmith vs MLflow | Seul résultat éditorial non-éditeur de la SERP |
| GitHub MLflow, GitHub Langfuse | Licences Apache 2.0 / MIT, étoiles |
| MLflow : Top 5 des outils d'observabilité | Page éditeur, citée pour les affirmations de MLflow |
Si vous ne devez retenir que trois choses
- Deux des trois ont été conçus pour les LLM. MLflow a été construit en 2018 pour le ML classique et a appris le traçage plus tard.
- Langfuse si vous voulez des données de traces sous licence MIT, auto-hébergées, qui vous appartiennent entièrement. LangSmith si votre app est LangChain ou LangGraph. MLflow si des modèles de ML classiques partagent votre plateforme.
- Posez d'abord la question de la sortie : Langfuse exporte vers S3, la base de MLflow est à vous pour la requêter, l'export en masse de LangSmith se cache derrière des plans payants.
- À 10M d'événements par mois : $731 au prix catalogue Langfuse Cloud et $150-400 d'infrastructure sur MLflow (notre estimation). LangSmith n'a pas de chiffre comparable depuis qu'il a arrêté de publier un tarif par trace.
Le verdict, reformulé : choisissez sur le lignage, pas sur les fonctionnalités. Vous voulez un second avis sur l'outil adapté à votre stack, ou de l'aide pour le mettre en place ? Parlez à Techsy. Nous choisissons ces outils pour des déploiements d'agents clients, et nous vous dirons volontiers lequel et pourquoi.