Techsy
Kontakt
Loslegen
Zurück zum Blog
comparisons

Langfuse vs LangSmith vs MLflow: Zwei sind Observability-Tools, eines ist eine ML-Plattform (2026)

Geschrieben von Mert Batur
Aktualisiert Aug 4, 2026
13 Lesezeit
Inhaltsverzeichnis
Langfuse vs LangSmith vs MLflow: Zwei sind Observability-Tools, eines ist eine ML-Plattform (2026)

Langfuse vs LangSmith vs MLflow: Zwei sind Observability-Tools, eines ist eine ML-Plattform (2026)

Nur zwei der drei Tools im Vergleich langfuse vs langsmith vs mlflow wurden gebaut, um LLMs zu beobachten. MLflow erschien 2018 bei Databricks als Experiment-Tracking für scikit-learn und XGBoost; GenAI-Tracing kam erst Jahre später obendrauf. Langfuse ist MIT-lizenziert und LLM-nativ, LangSmith ist proprietär und LangChain-nativ, MLflow ist Apache-2.0-lizenziert und älter als beide. Die Herkunft entscheidet hier, nicht Feature-Listen. Das Fazit: Langfuse, wenn Sie Ihre Daten selbst besitzen wollen, LangSmith für LangGraph-Teams, MLflow, wenn klassische Modelle Ihre Plattform teilen.

Die wichtigsten Erkenntnisse

  • Langfuse, wenn Sie einen MIT-Core wollen, den Sie selbst hosten können und bei dem Ihnen die Trace-Daten vollständig gehören. Beachten Sie, dass die ee/-Ordner separate kommerzielle Bedingungen tragen, weshalb GitHub das Repo als NOASSERTION und nicht als MIT ausweist.
  • LangSmith, wenn Ihre App auf LangChain oder LangGraph läuft und Sie pro Sitzplatz für die tiefste Integration bezahlen.
  • MLflow, wenn Sie auch klassische ML-Modelle ausliefern und Experimente, Model Registry und Tracing an einem Ort wollen.
  • Alle drei sprechen inzwischen OpenTelemetry, daher ist der Parallelbetrieb von zweien eine reale Option.

Langfuse vs LangSmith vs MLflow auf einen Blick

Langfuse ist die Open-Source-Wahl, LangSmith ist die LangChain-native Wahl, und MLflow ist die Wahl, wenn Ihr Team neben LLM-Features auch klassische ML-Modelle betreibt. Zwei davon sind LLM-Observability-Tools. Das dritte ist eine ML-Plattform, die LLM-Tracing gelernt hat, und genau dieser Unterschied entscheidet die meisten dieser Evaluationen.

Neu hier? Lesen Sie zuerst unsere KI-Observability-Grundlagen.

DimensionLangfuseLangSmithMLflow
LizenzMIT-Core, ee/ unter kommerziellen BedingungenProprietärApache 2.0, Open Source
Self-HostingJa, kostenlosNur Enterprise-PlanJa, kostenlos
LLM-Tracing@observe, OTel-nativ@traceable, automatisches LangChainautolog, @mlflow.trace
Evaluation / LLM-as-a-JudgeManaged + eigene EvaluatorenEingebaute Eval-EngineJudges + Prompt-Optimierung
Prompt-ManagementVersionierung, Labels, PlaygroundPrompt HubPrompt Registry
Klassischer ML-LebenszyklusNeinNeinExperimente + Model Registry
OpenTelemetry-SupportNativOTel-kompatibler IngestNativ, GenAI-Conventions
Kostenloser Tier50k Einheiten/Monat, 30 Tage5k Traces/Monat, 1 SitzplatzUnbegrenzt, eigene Infrastruktur
Einstiegspreis (bezahlt)29 $/Monat (Core)39 $/Sitzplatz/Monat (Plus)0 $, nur Infrastruktur
Aufbewahrungsdauer30 T / 90 T / 3 J je Plan14 T Basis, 400 T erweitertUnbegrenzt, eigener Speicher
Am besten fürBesitz der Trace-DatenLangGraph-native TeamsGemischte ML- + LLM-Plattformen

Die Aufbewahrungsfristen stammen von den Anbietern: Langfuses 30/90-Tage/3-Jahre-Stufen laut Preisseite, LangSmiths 14-Tage-Basis und 400-Tage-Erweiterte-Traces laut LangChain-Preisen (Erweitert ist ein eigener Trace-Typ mit eigener Zusatzgebühr, kein Umschalter für die Aufbewahrung), und MLflow behält Daten so lange wie Ihr Speicher.

Drei benannte Empfehlungen:

  • Wählen Sie Langfuse, wenn Sie MIT-lizenzierten Code, Self-Hosting ab Tag eins und Trace-Daten im eigenen Postgres und ClickHouse wollen.
  • Wählen Sie LangSmith, wenn Ihr Stack LangChain oder LangGraph ist und Pro-Sitzplatz-Preise besser sind als Pro-Trace-Preise.
  • Wählen Sie MLflow, wenn sklearn- und XGBoost-Modelle neben Ihren LLM-Features laufen. Für den Zwei-Tool-Detailvergleich siehe unseren vollständigen Langfuse-vs-LangSmith-Vergleich.

Brauchen Sie ein LLM-natives Tool oder eine ML-Plattform?

Die Langfuse-vs-MLflow-Hälfte dieser Suche ist eigentlich eine Herkunftsfrage. MLflow startete als Experiment-Tracking und Model Registry für klassisches ML und rüstete dann LLM-Tracing nach. Langfuse startete mit LLM-Tracing und fügte nichts Weiteres hinzu. Wenn Sie keine klassischen Modelle betreiben, ist MLflows Lebenszyklus-Mechanik reine Wartungsfläche ohne Gegenwert, und ein dediziertes KI-Observability-Tool ist der kürzere Weg.

MLflow ist mit großem Abstand das älteste der drei: Apache-2.0-lizenziert, von der Linux Foundation verwaltet, mit über 27.000 GitHub-Sternen (Stand 5. August 2026), gebaut für die Frage „Welche Hyperparameter haben welchen Artifact erzeugt?". Das GenAI-Tracing kam auf diese Basis obendrauf. Für ein Team, das sowohl ein XGBoost-Churn-Modell als auch einen GPT-4o-Support-Agenten betreibt, heißt das: ein einziges System of Record für Experimente, Registry-Einträge und LLM-Traces in derselben Datenbank.

Das Gegengewicht: Betreiben Sie keine klassischen Modelle, zahlt sich nichts davon aus. MLflows LLM-native UX ist jünger als die von Langfuse, mit weniger Shortcuts und gröberen Trace-Ansichten.

Eine Klarstellung, denn die Autovervollständigung zeigt Suchen nach kubeflow vs mlflow vs airflow: MLflow ist kein Workflow-Orchestrator. Es plant keine DAGs; es zeichnet auf, was Ihre Runs getan haben. Airflow und Kubeflow führen Jobs aus, MLflow trackt deren Output. Zur Ebenen-Frage (mlflow vs tensorflow): TensorFlow ist ein Modellierungs-Framework, MLflow sitzt über dem Framework, mit dem Sie trainieren. Leanwares Vergleich, das einzige nicht-anbietergebundene redaktionelle Ergebnis auf dieser SERP, zieht dieselbe Trennlinie.

ToolHerkunftZuerst gebaut fürSpäter ergänztFür wen geeignet
Langfuse2023, LLM-natives StartupLLM-Tracing und EvalsPrompt-Management, OTel-ExportReine LLM-Produktteams
LangSmith2023, von LangChain Inc.LangChain-DebuggingEval-Engine, Prompt HubLangChain-/LangGraph-Teams
MLflow2018, Databricks, heute Linux FoundationExperiment-Tracking, Model RegistryGenAI-Tracing, Judges, Prompt RegistryTeams mit klassischem ML und LLMs

Wenn Ihr Team nie ein Jupyter-Notebook öffnet, ist MLflows größter Vorteil totes Gewicht. Dieser eine Test eliminiert es für die meisten Leser dieser Seite.

Wie viel Code braucht Ihr erster Trace wirklich?

Bei allen drei etwa zwei Zeilen Python, aber die Reibung sitzt an verschiedenen Stellen. Langfuse und LangSmith verlangen Konto-Keys, bevor Ihr erster Trace ankommt; MLflow verlangt einen laufenden Tracking-Server. Wenigste Codezeilen und wenigster Aufwand sind nicht dasselbe.

Wir haben dieselbe Aufgabe genommen, einen OpenAI-Chat-Call plus eine Hilfsfunktion, und sie nach dem Quickstart jedes Anbieters auf drei Arten instrumentiert, neu gelesen am 5. August 2026.

Langfuse, über den @observe-Decorator:

python
# pip install langfuse
import os
from langfuse import observe
from langfuse.openai import openai  # drop-in wrapper

os.environ["LANGFUSE_PUBLIC_KEY"] = "pk-lf-..."
os.environ["LANGFUSE_SECRET_KEY"] = "sk-lf-..."
os.environ["LANGFUSE_BASE_URL"] = "https://cloud.langfuse.com"

@observe()
def answer(question: str, context: str) -> str:
    r = openai.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
    )
    return r.choices[0].message.content

LangSmith, über @traceable:

python
# pip install langsmith
import os
from langsmith import traceable
from openai import OpenAI

os.environ["LANGSMITH_TRACING"] = "true"
os.environ["LANGSMITH_API_KEY"] = "lsv2-..."
client = OpenAI()

@traceable
def answer(question: str, context: str) -> str:
    r = client.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
    )
    return r.choices[0].message.content

MLflow, über mlflow.openai.autolog():

python
# pip install mlflow
import mlflow
from openai import OpenAI

mlflow.set_tracking_uri("http://localhost:5000")  # server must be running
mlflow.openai.autolog()

def answer(question: str, context: str) -> str:
    r = OpenAI().chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
    )
    return r.choices[0].message.content

Die Zahlen, die wir aus diesen drei Quickstarts abgeleitet haben:

Toolpip-PaketeEnv-Vars vor dem ersten TraceZusätzliche Zeilen PythonWo der Trace landet
Langfuse1 (langfuse)3 (Public Key, Secret, Base URL)2 (Import-Tausch, @observe)Langfuse Cloud oder eigener Stack
LangSmith1 (langsmith)2 (API-Key, Tracing-Flag)2 (Import, @traceable)LangSmith-Cloud-Projekt
MLflow1 (mlflow)0 (kein Konto nötig)2 (Tracking-URI, autolog)Datenbank Ihres Tracking-Servers

Gezählt aus dem Quickstart jedes Anbieters, neu gelesen am 5. August 2026: Langfuse-SDK-Docs, LangSmith-Observability-Quickstart, MLflow-Tracing-Quickstart. openai ist eine Abhängigkeit der App selbst und nicht mitgezählt. Zählen Sie selbst nach.

Unsere Interpretation, ausdrücklich als solche gekennzeichnet: Der Code ist bei allen drei nahezu identisch, dort liegt die Entscheidung also nicht. Langfuse und LangSmith laden die Reibung auf fünf Minuten Konto-Erstellung vor. MLflow lädt sie in die Infrastruktur vor: Dieser Einzeiler setzt einen Tracking-Server voraus, eine Datenbank dahinter und jemanden, der beides am Laufen hält. Das schlanke mlflow-tracing-SDK, laut MLflow etwa 95 % kleiner als das Gesamtpaket, verkürzt die Installation, nicht den Server.

LLM-as-a-Judge: Gleiche Methode, drei unterschiedliche Orte

Alle drei fahren LLM-as-a-Judge-Evaluatoren über Datensätze, aber LangSmiths Eval-Engine ist am stärksten produktisiert, Langfuse kombiniert Managed Judges mit Annotation Queues und einer GitHub Action für CI-Gating, und MLflow bindet Judges an seine Experiment- und Prompt-Optimierungswerkzeuge. Die Methodik ist identisch; der Unterschied liegt darin, wo die Ergebnisse leben.

FähigkeitLangfuseLangSmithMLflow
Managed LLM-as-a-JudgeJaJa, größte BibliothekJa, eingebaute Judges
Eigene EvaluatorenPython/TS-SDKEigener Code + HeuristikenCode-Evaluatoren
Datensätze und ExperimenteJaJa, KernfunktionJa, über Experimente
Menschliche Annotation QueueJaJaEingeschränkt
CI-GatingGitHub ActionEval-Engine + APIAPI-gesteuert
Prompt-OptimierungNeinNeinJa, GEPA-basiert

Laut MLflows Evaluations-Docs laufen dessen Judges im selben Experiment-Tracking-System wie Ihre klassischen ML-Metriken – der Ertrag des Herkunftsarguments oben: ein Dashboard für Churn-Modell und Support-Agent. Laut Langfuses Docs heften sich Evaluatoren an Traces und speisen Annotation Queues, die Ihr Team in der UI abarbeitet.

Für die Methode lesen Sie LLM-Outputs richtig evaluieren; für den breiteren Markt die von uns bewerteten Evaluation-Tools. Agent-Pipelines brauchen mehr Sorgfalt als Output-Scoring, behandelt in Agenten in Produktion evaluieren.

Prompt-Management: Nur eines versioniert Prompts neben Modellen

Absichtlich kurz gehalten, denn der Zwei-Tool-Vergleich gehört in unseren Schwesterbeitrag. Die Form jedes Tools: Langfuse bietet Prompt-Management mit Versionierung, Labels und Playground; LangSmith bietet einen Prompt Hub mit Commit-artiger Versionierung; MLflow bietet eine Prompt Registry, die Prompts als First-Class-Entitäten neben Ihren Modellen speichert.

Der eine entscheidungsrelevante Unterschied: MLflow versioniert Prompts neben den Model-Registry-Einträgen, sodass ein Prompt und das Modell, auf das er abgestimmt wurde, ein gemeinsames System of Record teilen. Langfuse und LangSmith halten Prompts getrennt von dem, was Ihre Modelle serviert. Wenn Sie Modell und Prompt gemeinsam promoten und einen Audit-Trail wollen, der belegt, welche Paarung ausgeliefert wurde, schlägt diese Kopplung jeden Playground. Für den tiefen Zwei-Tool-Vergleich siehe unseren vollständigen Langfuse-vs-LangSmith-Vergleich.

Self-Hosting, Datenhoheit und was der Ausstieg kostet

Langfuse lässt sich als Multi-Service-Stack self-hosten, den Sie vollständig kontrollieren, MLflow als Tracking-Server plus eine Datenbank, die Sie direkt per SQL abfragen können, LangSmith nur zu Enterprise-Bedingungen. Die Ausstiegsfrage zählt mehr als die Einstiegsfrage: Welches Tool Sie auch wählen, die Trace-Historie ist der Teil, den Sie nicht neu erzeugen können.

Die Deployment-Realität je Tool. Langfuse läuft als Web, Worker, Postgres, ClickHouse und einer Cache-/Blob-Schicht, seit dem Redesign der ClickHouse-Ära, laut Langfuses Scale-Engineering-Beitrag. Kontext, den Sie parat haben sollten: ClickHouse übernahm Langfuse am 16.01.2026 samt einer 400-Mio-$-Series-D, und beide verpflichteten sich öffentlich darauf, dass MIT-Lizenz, erstklassiges Self-Hosting und Roadmap unverändert bleiben (Langfuses Statement). LangSmith-Self-Hosting ist eine Frage des Enterprise-Plans, laut seinen Docs. MLflow ist ein Tracking-Server, eine Postgres-kompatible Datenbank und Objektspeicher.

Die Ausstiegswege, der Abschnitt, den sonst niemand schreibt. Langfuse exportiert in Blob-Speicher als JSONL oder Parquet über einen dokumentierten S3-Export, plus vollständige API. MLflows Backend ist eine offene Datenbank, die Sie direkt abfragen können. LangSmiths Bulk-Export sitzt hinter Bezahltarifen. Das Urteil: MLflows Lock-in ist am leichtesten rückholbar, Langfuse knapp dahinter, und unterhalb der Enterprise-Stufe ist LangSmith der Ort, an dem eine falsche Wahl Sie Ihre Historie kostet.

SSO und RBAC gibt es bei Langfuses Enterprise-Stufe (2.499 $/Monat) und LangSmiths Enterprise-Plan; bei MLflow verdrahten Sie Ihre Auth selbst, Freiheit und Arbeitsaufwand zu gleichen Teilen.

ToolSelf-Host-LizenzDienste, die Sie betreibenAufbewahrung StandardExportwegRückholbar?
LangfuseMITWeb, Worker, Postgres, ClickHouse, Cache/Blob30 T bis 3 J je PlanS3-Blob-Export, JSONL/ParquetJa
LangSmithProprietärNur Enterprise-Deployment14 T Basis, 400 T erweitertBulk-Export, BezahltarifeTeilweise
MLflowApache 2.0Tracking-Server, DB, ObjektspeicherUnbegrenztSQL-Abfrage auf die Backend-DBJa, vollständig

Was kostet jedes Tool bei 100K, 1M und 10M Traces?

Langfuse bemisst Units, MLflow bemisst nichts, und LangSmith veröffentlicht überhaupt keinen vergleichbaren Preis pro Einheit mehr. Units und Traces sind nicht dasselbe Objekt; ein einzelner Nutzer-Request kann ein einziger Trace sein, der viele abrechenbare Events enthält. Nur zwei der drei Spalten unten lassen sich aus Listenpreisen bilden.

Dieser letzte Punkt ist ein Befund, keine Lücke in unserer Recherche. Stand 5. August 2026 setzt LangChains Preisseite Plus bei 39 $ pro Sitzplatz an, inklusive 10K enthaltener Basis-Traces, danach bemisst sie den Verbrauch mit 1,50 $ pro LCU (Compute) und 1,00 $ pro LSU (Storage). Es gibt auf der Seite keinen Preis pro 1K Traces mehr, und auch keine zweite Seite, die einen führt. Eine LangSmith-Rechnung bei einem angegebenen Trace-Volumen lässt sich also nicht aus Listenpreisen ableiten, und wir erfinden keine Umrechnung.

Monatliches VolumenLangfuse CloudLangSmithMLflow (self-gehostet, unsere Schätzung)
100K29 $ (Core, enthalten)39 $ Sitzplatz + 90K bemessen, kein Listenpreis30-50 $
1M101 $ (Core + 900K Mehrverbrauch)39 $ Sitzplatz + 990K bemessen, kein Listenpreis60-120 $
10M731 $ (Core + 9,9M Mehrverbrauch)39 $ Sitzplatz + 9,99M bemessen, kein Listenpreis150-400 $

Die Langfuse-Zahlen sind Listenpreise von der Preisseite, gelesen am 5. August 2026, mal dem gezeigten Volumen. LangSmiths Sitzplatzpreis und Aufbewahrungsstufen stammen aus derselben Lektüre von LangChains Preisen am selben Tag: Basis-Traces bei 14 Tagen Aufbewahrung, erweiterte Traces bei 400 Tagen gegen eine Zusatzgebühr, die die Seite nicht beziffert. Die MLflow-Spalte ist unsere Schätzung, kein Anbieterangebot: Managed Postgres (15-25 $/Monat), Objektspeicher und ein Always-on-Container (10-20 $/Monat), wachsend mit der gespeicherten Historie.

Prüfen Sie unsere Rechnung, wo es etwas nachzurechnen gibt. Langfuse veröffentlicht eine gestaffelte Mehrverbrauchstabelle: 8,00 $ pro 100K Units von 100K bis 1M, 7,00 $ von 1M bis 10M, 6,50 $ von 10M bis 50M, 6,00 $ darüber. Bei 1M: 29 $ plus 900K Units zu 8 $ pro 100K = 101 $. Bei 10M: 29 $, plus 900K zu 8 $ (72 $), plus 9.000K zu 7 $ (630 $) = 731 $.

Beachten Sie den Formunterschied: LangSmith berechnet Personen plus bemessenen Verbrauch, die anderen beiden nicht. Wenn Ihr eigentliches Problem Token-Ausgaben sind, senkt ein LiteLLM-Proxy vor Ihren Modellen die Rechnung, bevor eines dieser Tools sie überhaupt bemisst.

Können Sie zwei davon parallel betreiben?

Ja. Langfuse und MLflow bauen beide auf OpenTelemetry auf, daher kann ein Collector dieselben GenAI-Spans an zwei Backends fächern. Die realistische Paarung: MLflow als System of Record für den Modell-Lebenszyklus, Langfuse als LLM-native Trace-UX. Technisch einfach; organisatorisch muss jemandem der Collector gehören.

Der Mechanismus: ein OTel-Collector mit zwei OTLP-Exportern, unter Nutzung der GenAI Semantic Conventions, damit beide Seiten Spans gleich parsen.

yaml
# Illustrative sketch, not a copy-paste-complete collector config
exporters:
  otlp/langfuse:
    endpoint: https://cloud.langfuse.com/api/public/otel:443
    headers:
      Authorization: "Basic <base64 public_key:secret_key>"
  otlp/mlflow:
    endpoint: http://localhost:5000/otel  # your MLflow tracking server

service:
  pipelines:
    traces:
      receivers: [otlp]
      processors: [batch]
      exporters: [otlp/langfuse, otlp/mlflow]  # same spans, two backends

Klar gekennzeichnet: Die obige Anordnung ist unsere Architektur-Interpretation, keine vom Anbieter unterstützte Konfiguration. Leanware ist die einzige andere Seite auf dieser SERP, die den Parallelbetrieb zweier Tools überhaupt erwähnt, in einem Absatz. Dual-Shipping heißt zwei Systeme, zwei Rechnungen, doppelter Speicher und ein Collector, der jemanden um 3 Uhr nachts anruft.

Dual-Shipping von Traces ist technisch einfach und organisatorisch teuer. Das zweite Backend ist kostenlos, bis es jemand am Leben erhalten muss.

Langfuse vs LangSmith vs MLflow: Wer sollte was wählen?

Die Pro-und-Contra-Liste für langfuse vs langsmith vs mlflow verdichtet sich auf sechs Profile. Jede Zeile benennt ein Tool, denn „kommt darauf an" ohne Empfehlung ist unbrauchbar.

Ihre SituationWahlWarumWas Sie aufgeben
Solo-Entwickler oder kleines Team, eine LLM-AppLangfuseKostenlose 50K Units, MIT, Self-Hosting jederzeitLangChain-Auto-Tracing-Feinschliff
LangChain- oder LangGraph-natives TeamLangSmithTracing ohne Konfiguration, beste LangGraph-UXPro-Sitzplatz-Kosten, Lock-in
Plattform-Team mit klassischem ML und LLM-FeaturesMLflowExperimente, Registry und Tracing in einemJüngere LLM-native UX
Compliance-starkes Enterprise (Residenz, SSO)Langfuse self-gehostetDaten verlassen nie Ihre VPCSie betreiben fünf Dienste
Bestehender Databricks- oder MLflow-ShopMLflowBereits installiert, kein neuer AnbieterLLM-Features reifen langsamer
Team, das null Infrastruktur willLangSmithGehostet ab Minute eins14 Tage Basis-Aufbewahrung, Sitzplatz plus bemessene Gebühren

Wenn Ihre ehrliche Antwort „keines dieser drei" lautet: Die anderen sieben Tools in den zehn Plattformen, die wir gerankt haben umfassen gehostete und Enterprise-Optionen, die wir auf dieser Seite weggelassen haben.

Häufig gestellte Fragen

Warum MLflow für LLM-Tracing nutzen?

Nutzen Sie MLflow für LLM-Tracing, wenn Ihr Team bereits klassische ML-Modelle ausliefert und ein einziges System of Record will: Experiment-Tracking, Model Registry und GenAI-Tracing in einer einzigen Apache-2.0-Plattform, ohne Pro-Trace-Gebühr. Wenn Sie nur LLM-Features ausliefern, bieten Langfuse oder LangSmith Ihnen ein jüngeres, LLM-first Erlebnis.

Kann man LangSmith und MLflow zusammen nutzen?

Ja. Beide akzeptieren OpenTelemetry-kompatible Trace-Daten, daher kann ein OTel-Collector dieselben Spans gleichzeitig an LangSmith und einen MLflow-Tracking-Server exportieren. Die Kosten sind operativ: zwei Backends, zwei Rechnungen, doppelter Speicher. Die meisten Teams, mit denen wir sprechen, wählen ein System of Record und lassen das zweite weg.

Ist LangSmith Open Source?

Nein. LangSmith ist proprietäre, geschlossene Software von LangChain Inc. Das LangSmith-Client-SDK ist offen, aber Plattform, UI und Backend sind es nicht. Wenn Ihnen eine Open-Source-Lizenz wichtig ist, sind Langfuse (MIT) und MLflow (Apache 2.0) die beiden Optionen in diesem Vergleich, die Sie frei selbst hosten können.

Ist MLflow nur für klassisches maschinelles Lernen?

Nein. MLflow hat erstklassige GenAI-Unterstützung ergänzt: mlflow.openai.autolog() traced OpenAI-Calls automatisch, @mlflow.trace deckt eigene Funktionen ab, und eingebaute Judges evaluieren LLM-Outputs. Die klassische ML-Herkunft zeigt sich in der UX, die weniger LLM-nativ ist als die von Langfuse, aber das Tracing selbst ist produktionsreif.

Ist MLflow ein Workflow-Orchestrator wie Airflow oder Kubeflow?

Nein. MLflow plant keine DAGs und führt keine Pipelines aus; es zeichnet auf, was Ihre Runs getan haben: Parameter, Metriken, Artifacts und Traces. Airflow und Kubeflow orchestrieren Jobs, MLflow trackt deren Ergebnisse. Leute verwechseln die drei, weil sie in MLOps-Stacks gemeinsam vorkommen, aber sie sitzen auf verschiedenen Ebenen und laufen oft zusammen.

Was sind die Open-Source-Alternativen zu LangSmith und MLflow?

Langfuse (MIT) ist die nächstliegende Open-Source-Alternative zu LangSmith, mit Self-Hosting und OTel-nativem Tracing, und MLflow selbst ist Open Source unter Apache 2.0. Über diesen Vergleich hinaus sind Lunary, Arize Phoenix und OpenLIT Open-Source-LLM-Observability-Optionen, die einen Blick wert sind, bevor Sie sich an eine proprietäre Plattform binden.

Welches der drei ist bei 10 Millionen Traces pro Monat am günstigsten?

MLflow, nur die Infrastruktur gezählt: Unsere Schätzung liegt bei 150-400 $ pro Monat für Postgres, Objektspeicher und einen Container. Langfuse Cloud landet bei 731 $ für 10M Units auf Core plus dessen gestaffeltem Mehrverbrauch. LangSmith lässt sich nicht mehr von seiner Preisseite ableiten: Seit Mitte 2026 veröffentlicht LangChain Sitzplatz- und LCU/LSU-Sätze, keinen Listenpreis pro Trace.

Ersetzt Langfuse MLflow, oder umgekehrt?

Keines ersetzt das andere sauber. Langfuse ersetzt MLflows Tracing- und Eval-Ebenen für reine LLM-Teams und streicht die Experiment-Tracking- und Model-Registry-Mechanik. MLflow ersetzt Langfuse, wenn klassische ML-Modelle Ihre Plattform teilen und ein System of Record besser ist als zwei. Sie überschneiden sich beim Tracing; sie driften bei allem drumherum auseinander.

Ist Langfuse noch Open Source, jetzt wo ClickHouse es übernommen hat?

Ja, Stand der Ankündigung vom 16.01.2026. ClickHouse übernahm Langfuse samt einer 400-Mio-$-Series-D, und beide Unternehmen verpflichteten sich öffentlich darauf, die MIT-Lizenz, erstklassiges Self-Hosting und eine unveränderte Roadmap beizubehalten. Das ist eine öffentliche Verpflichtung, keine dauerhafte rechtliche Garantie, aber heute hat sich an der Self-Hosting-Geschichte nichts geändert.

Quellen

Jede Quelle unten ist redaktionell und dofollow; keine ist bezahlt oder getauscht.

QuelleWas sie belegt
MLflow-Tracing-DocsOTel-Tracing, autolog, @mlflow.trace, schlankes SDK
MLflow-Tracing-QuickstartGezählte Schritte in der Setup-Tabelle
MLflow-Eval- und Monitoring-DocsJudges und der Eval-Workflow
MLflow-Prompt-Registry-DocsPrompt-Versionierung
Langfuse-Python-SDK-Docs@observe und nötige Env-Vars
Langfuse-Blob-Export-DocsS3-Export, JSONL/Parquet
Langfuse-PreiseKostenlose Units, Plan-Mindestpreise, Preis je 100K
LangChain-PreiseEnthaltene Basis-Traces, Plus-Sitzplatzpreis, LCU/LSU-Bemessung
LangSmith-Docs@traceable, Env-Vars, Self-Host-Stufe
OpenTelemetry und GenAI Semantic ConventionsDer Standard hinter dem Dual-Export
Langfuse-Scale-Engineering-BlogClickHouse-Datenmodell-Redesign
ClickHouse übernimmt LangfuseÜbernahme, 16.01.2026
Langfuse: Joining ClickHouseMIT- und Self-Hosting-Verpflichtungen
Leanware: LangSmith vs MLflowEinziges nicht-anbietergebundenes redaktionelles SERP-Ergebnis
MLflow GitHub, Langfuse GitHubApache-2.0-/MIT-Lizenzen, Sterne
MLflow: Top 5 Observability ToolsAnbieterseite, zitiert als MLflows Behauptungen

Wenn Sie nur drei Dinge behalten

  • Zwei der drei wurden für LLMs gebaut. MLflow entstand 2018 für klassisches ML und lernte Tracing erst später.
  • Langfuse, wenn Sie MIT-lizenzierte, selbst gehostete Trace-Daten wollen, die Ihnen vollständig gehören. LangSmith, wenn Ihre App LangChain oder LangGraph ist. MLflow, wenn klassische ML-Modelle Ihre Plattform teilen.
  • Stellen Sie die Ausstiegsfrage zuerst: Langfuse exportiert nach S3, MLflows Datenbank gehört Ihnen zur Abfrage, LangSmiths Bulk-Export sitzt hinter Bezahltarifen.
  • Bei 10M Events pro Monat: 731 $ zum Langfuse-Cloud-Listenpreis und 150-400 $ Infrastruktur auf MLflow (unsere Schätzung). Für LangSmith gibt es keine vergleichbare Zahl mehr, seit es keinen Preis pro Trace mehr veröffentlicht.

Das Fazit, noch einmal: Entscheiden Sie nach Herkunft, nicht nach Features. Wollen Sie eine zweite Meinung dazu, was zu Ihrem Stack passt, oder Hilfe beim Einrichten? Sprechen Sie mit Techsy. Wir wählen diese Tools für Kunden-Agent-Deployments aus und sagen Ihnen gern, welches und warum.

Tags

langfuse vs langsmith vs mlflowllm observabilityllm tracinglangfuselangsmithmlflowopentelemetry

Diesen Artikel teilen

Verwandte Artikel

Mehr in comparisons

comparisons
Aug 4, 2026

Die besten Open-Source-LLM-Evaluierungs-Frameworks 2026 (eines ist gar nicht Open Source)

Am 2026-08-04 haben wir die Lizenzdatei und den Commit-Log des Default-Branch von acht Open-Source-LLM-Evaluierungs-Frameworks gelesen und sechs davon installiert, um dieselben 10 Testfälle durchlaufen zu lassen. Eines läuft unter einer Lizenz, die die OSI nicht anerkennt, zwei haben seit 2024 kein Release mehr veröffentlicht, und zwei Relevanz-Metriken bewerteten eine überzeugende Falschaussage höher als eine korrekte Antwort.

16 min read Lesezeit
Lesen
comparisons
Jul 30, 2026

Hybride Suche: BM25 vs. Vektor (und warum Sie beides brauchen)

BM25 findet Ihre SKUs und Fehlercodes; Vektorsuche findet die paraphrasierte Frage, die genau diese Wörter nie verwendet. So kombiniert Reciprocal Rank Fusion beide Verfahren, mit echten Benchmark-Zahlen 2025-2026 und herstellerneutralem Python-Code.

13 Min. Lesezeit Lesezeit
Lesen
comparisons
Jul 21, 2026

RPA vs. KI vs. Hybrid: Welche Automatisierung ist 2026 die richtige für Ihre Geschäftsprozesse?

RPA folgt Regeln, KI trifft Entscheidungen, und 2026 kombiniert die klügste Automatisierung für Geschäftsprozesse beides. Dieser neutrale Leitfaden liefert Ihnen eine 3-Wege-Entscheidungsmatrix, echte Kosten für Jahr 1 vs. Jahr 3 und reale Projektdaten, um RPA, KI oder Hybrid zu wählen.

11 Min. Lesezeit Lesezeit
Lesen
Alle Beiträge ansehen
Ihr Projekt starten

Bereit, etwas Außergewöhnliches zu bauen?

Machen wir aus Ihrer Vision ein fertiges Produkt. Unser Team baut mit Ihnen Software, die spürbar etwas bewegt.

30-Minuten-Scoping-Call buchenUnsere Arbeit ansehen

Frisch aus der Bibliothek

Claude Skills

Alle ansehen
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

KI-Automatisierungen

Alle ansehen
  • Security-Auditor

    Wöchentlicher SCA- + IaC-Scan mit priorisierten Fix-PRs.

  • Cold-Email-Texter

    Erzeugt Erstkontakt-Mails, verankert in einem konkreten öffentlichen Detail.

  • Lead-Research-Agent

    Reichert eine E-Mail zum Profil an, bewertet den Fit, meldet in Slack.

Frisch aus der Bibliothek

Claude Skills

Alle ansehen
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

KI-Automatisierungen

Alle ansehen
  • Security-Auditor

    Wöchentlicher SCA- + IaC-Scan mit priorisierten Fix-PRs.

  • Cold-Email-Texter

    Erzeugt Erstkontakt-Mails, verankert in einem konkreten öffentlichen Detail.

  • Lead-Research-Agent

    Reichert eine E-Mail zum Profil an, bewertet den Fit, meldet in Slack.

Leistungen

  • Enterprise-Lösungen
  • Mobile Apps
  • Web-Anwendungen

Lösungen

  • CRM-Systeme
  • KI-Integration
  • ERP-Lösungen
  • Voice Agents
  • Prozessautomatisierung
  • Cybersicherheit

Bibliothek

  • Blog
  • Portfolio

Community

  • KI-Automatisierungen
  • Claude Skills

Tools

  • Mobile-App-Kostenrechner
  • OpenAI / LLM API-Kostenrechner
  • MVP-Kostenrechner
  • Voice-AI-Agent-Kostenrechner

Unternehmen

  • Über uns
  • Partner
  • Kontakt

Rechtliches

  • Datenschutz
  • Nutzungsbedingungen
  • Cookie-Richtlinie

Leistungen

  • Enterprise-Lösungen
  • Mobile Apps
  • Web-Anwendungen

Lösungen

  • CRM-Systeme
  • KI-Integration
  • ERP-Lösungen
  • Voice Agents
  • Prozessautomatisierung
  • Cybersicherheit

Bibliothek

  • Blog
  • Portfolio

Community

  • KI-Automatisierungen
  • Claude Skills

Tools

  • Mobile-App-Kostenrechner
  • OpenAI / LLM API-Kostenrechner
  • MVP-Kostenrechner
  • Voice-AI-Agent-Kostenrechner

Unternehmen

  • Über uns
  • Partner
  • Kontakt
RechtlichesDatenschutzNutzungsbedingungenCookie-Richtlinie
TECHSY
© 2026 Techsy. Alle Rechte vorbehalten.