
Langfuse vs LangSmith vs MLflow: dwa to narzędzia do obserwacji, jedno to platforma ML (2026)
Tylko dwa z trzech narzędzi w porównaniu langfuse vs langsmith vs mlflow powstały po to, by obserwować LLM-y. MLflow wystartował w 2018 roku w Databricks jako śledzenie eksperymentów dla scikit-learn i XGBoost; tracing GenAI doszedł do tej bazy dopiero lata później. Langfuse jest na licencji MIT i natywny dla LLM-ów, LangSmith jest własnościowy i natywny dla LangChain, MLflow działa na Apache-2.0 i jest starszy od obu. O wyborze decyduje rodowód, nie lista funkcji. Werdykt: Langfuse, jeśli chcesz w pełni posiadać własne dane, LangSmith dla zespołów LangGraph, MLflow, jeśli klasyczne modele dzielą Twoją platformę.
Najważniejsze wnioski
- Langfuse, jeśli chcesz open source (MIT), który możesz hostować sam i w pełni posiadać dane trace'ów. Zwróć uwagę, że jego foldery
ee/podlegają osobnym warunkom komercyjnym, dlatego GitHub raportuje repozytorium jakoNOASSERTION, a nie MIT. - LangSmith, jeśli Twoja aplikacja działa w LangChain lub LangGraph i płacisz za miejsce za najciaśniejszą integrację.
- MLflow, jeśli wdrażasz też klasyczne modele ML i chcesz eksperymenty, rejestr modeli oraz tracing w jednym miejscu.
- Wszystkie trzy mówią dziś w OpenTelemetry, więc uruchomienie dwóch naraz jest realną opcją.
Langfuse vs LangSmith vs MLflow w skrócie
Langfuse to wybór open-source, LangSmith to wybór natywny dla LangChain, a MLflow to wybór, gdy zespół wdraża klasyczne ML obok funkcji LLM. Dwa z nich to narzędzia do obserwacji LLM-ów. Trzecie to platforma ML, która nauczyła się trace'ować LLM-y – i ta różnica przesądza o większości tych ocen.
Jesteś tu nowy? Zacznij od naszego wprowadzenia do obserwacji AI.
| Wymiar | Langfuse | LangSmith | MLflow |
|---|---|---|---|
| Licencja | MIT (rdzeń), ee/ na warunkach komercyjnych | Własnościowa | Apache 2.0, open source |
| Self-hosting | Tak, darmowy | Tylko plan Enterprise | Tak, darmowy |
| Tracing LLM | @observe, natywny OTel | @traceable, auto dla LangChain | autolog, @mlflow.trace |
| Ewaluacja / LLM-as-a-judge | Zarządzana + własne ewaluatory | Wbudowany silnik eval | Sędziowie + optymalizacja promptów |
| Zarządzanie promptami | Wersjonowanie, etykiety, playground | Prompt hub | Rejestr promptów |
| Cykl życia klasycznego ML | Nie | Nie | Eksperymenty + rejestr modeli |
| Obsługa OpenTelemetry | Natywna | Ingest zgodny z OTel | Natywna, konwencje GenAI |
| Darmowy próg | 50 tys. jednostek/mies., 30 dni | 5 tys. trace'ów/mies., 1 miejsce | Bez limitu, Twoja infrastruktura |
| Cena wejścia | 29 $/mies. (Core) | 39 $/miejsce/mies. (Plus) | 0 $, tylko infrastruktura |
| Retencja danych | 30 dni / 90 dni / 3 lata wg planu | 14 dni baza, 400 dni rozszerzona | Bez limitu, Twój storage |
| Najlepszy dla | Pełnia praw do trace'ów | Zespoły natywne dla LangGraph | Mieszane platformy ML + LLM |
Liczby retencji pochodzą od dostawców: poziomy 30/90 dni/3 lata Langfuse z jego strony cennika, 14-dniowa baza i 400-dniowe rozszerzone trace'y LangSmith z cennika LangChain (rozszerzone to osobny typ trace'a rozliczany dodatkową opłatą, nie przełącznik retencji), a MLflow trzyma dane tak długo, jak Twój storage.
Trzy konkretne wybory:
- Wybierz Langfuse, jeśli chcesz kodu na licencji MIT, self-hostingu od pierwszego dnia i danych trace'ów we własnym Postgresie i ClickHouse.
- Wybierz LangSmith, jeśli Twój stos to LangChain lub LangGraph, a cena za miejsce wypada lepiej niż cena za trace.
- Wybierz MLflow, jeśli modele sklearn i XGBoost działają obok funkcji LLM. Po szczegóły porównania dwóch narzędzi zajrzyj do naszego pełnego porównania Langfuse vs LangSmith.
Potrzebujesz narzędzia natywnego dla LLM czy platformy ML?
Połowa tego zapytania dotycząca langfuse vs mlflow to w gruncie rzeczy pytanie o rodowód. MLflow zaczynał jako śledzenie eksperymentów i rejestr modeli dla klasycznego ML, a potem dodał tracing LLM-ów. Langfuse zaczynał od trace'owania LLM-ów i nie dodał nic więcej. Jeśli nie wdrażasz klasycznych modeli, cały aparat cyklu życia MLflow to powierzchnia, którą utrzymujesz bez powodu, a dedykowane narzędzie obserwacji AI jest krótszą drogą.
MLflow jest z tej trójki najstarszy i to o kilka długości: licencja Apache-2.0, zarządzanie przez Linux Foundation, ponad 27 000 gwiazdek na GitHubie według stanu na 5 sierpnia 2026, zbudowany, by odpowiadać na pytanie „które hiperparametry dały który artefakt?". Jego tracing GenAI powstał na tej bazie. Dla zespołu wdrażającego jednocześnie model churn XGBoost i agenta wsparcia GPT-4o oznacza to jeden system rejestrów: eksperymenty, wpisy rejestru i trace'y LLM w tej samej bazie danych.
Przeciwwaga: jeśli nie wdrażasz klasycznych modeli, nic z tego nie zarabia na siebie. Interfejs MLflow natywny dla LLM-ów jest młodszy niż ten w Langfuse – mniej skrótów, bardziej surowe widoki trace'ów.
Jedno wyjaśnienie, bo autouzupełnianie pokazuje wyszukiwania kubeflow vs mlflow vs airflow: MLflow nie jest orkiestratorem workflow. Nie planuje DAG-ów; zapisuje, co zrobiły Twoje przebiegi. Airflow i Kubeflow uruchamiają zadania, MLflow śledzi ich wyniki. W kwestii warstw (mlflow vs tensorflow): TensorFlow to framework modelowania, MLflow stoi nad dowolnym frameworkiem, w którym trenujesz. Porównanie Leanware, jedyny niewydawczy wynik redakcyjny w tym SERP, robi ten sam podział.
| Narzędzie | Pochodzenie | Najpierw zbudowane do | Dodane później | Komu to pasuje |
|---|---|---|---|---|
| Langfuse | 2023, startup natywny dla LLM | Tracing i ewaluacja LLM | Zarządzanie promptami, eksport OTel | Zespoły produktowe tylko z LLM |
| LangSmith | 2023, od LangChain Inc. | Debugowanie LangChain | Silnik eval, prompt hub | Zespoły LangChain/LangGraph |
| MLflow | 2018, Databricks, dziś Linux Foundation | Śledzenie eksperymentów, rejestr modeli | Tracing GenAI, sędziowie, rejestr promptów | Zespoły z klasycznym ML i LLM-ami |
Jeśli Twój zespół nigdy nie otwiera notatnika Jupyter, największa zaleta MLflow jest martwym balastem. Ten jeden test eliminuje go dla większości czytelników tej strony.
Ile kodu wymaga w rzeczywistości Twój pierwszy trace?
Około dwóch linijek Pythona dla wszystkich trzech, ale tarcie siedzi w różnych miejscach. Langfuse i LangSmith proszą o klucze konta, zanim wyląduje pierwszy trace; MLflow prosi o działający serwer trackingu. Najmniej linijek kodu i najmniej pracy to nie to samo.
Wzięliśmy to samo zadanie – jedno wywołanie czatu OpenAI plus jeden helper – i oprzyrządowaliśmy je na trzy sposoby z quickstartu każdego dostawcy, czytanego 5 sierpnia 2026.
Langfuse, przez dekorator @observe:
# pip install langfuse
import os
from langfuse import observe
from langfuse.openai import openai # drop-in wrapper
os.environ["LANGFUSE_PUBLIC_KEY"] = "pk-lf-..."
os.environ["LANGFUSE_SECRET_KEY"] = "sk-lf-..."
os.environ["LANGFUSE_BASE_URL"] = "https://cloud.langfuse.com"
@observe()
def answer(question: str, context: str) -> str:
r = openai.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentLangSmith, przez @traceable:
# pip install langsmith
import os
from langsmith import traceable
from openai import OpenAI
os.environ["LANGSMITH_TRACING"] = "true"
os.environ["LANGSMITH_API_KEY"] = "lsv2-..."
client = OpenAI()
@traceable
def answer(question: str, context: str) -> str:
r = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentMLflow, przez mlflow.openai.autolog():
# pip install mlflow
import mlflow
from openai import OpenAI
mlflow.set_tracking_uri("http://localhost:5000") # server must be running
mlflow.openai.autolog()
def answer(question: str, context: str) -> str:
r = OpenAI().chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentLiczby, które wyprowadziliśmy z tych trzech quickstartów:
| Narzędzie | Pakiety pip | Zmienne środowiskowe przed pierwszym trace'em | Dodane linijki Pythona | Gdzie trafia trace |
|---|---|---|---|---|
| Langfuse | 1 (langfuse) | 3 (klucz publiczny, sekret, base URL) | 2 (zamiana importu, @observe) | Langfuse Cloud lub Twój stos |
| LangSmith | 1 (langsmith) | 2 (klucz API, flaga trace'owania) | 2 (import, @traceable) | Projekt w chmurze LangSmith |
| MLflow | 1 (mlflow) | 0 (bez konta) | 2 (URI trackingu, autolog) | Baza Twojego serwera trackingu |
Policzone z quickstartu każdego dostawcy, czytanego 5 sierpnia 2026: dokumentacja SDK Langfuse, quickstart obserwowalności LangSmith, quickstart trace'owania MLflow. openai to zależność samej aplikacji, nie liczymy. Przelicz sam.
Nasza interpretacja, oznaczona jako taka: kod jest niemal identyczny we wszystkich trzech, więc to nie tam zapada decyzja. Langfuse i LangSmith ładują tarcie z przodu w pięć minut zakładania konta. MLflow ładuje je z przodu w infrastrukturę: ten one-liner zakłada serwer trackingu, bazę danych za nim i kogoś, kto utrzyma oba. Jego odchudzony SDK mlflow-tracing, który według MLflow jest o około 95% mniejszy od pełnego pakietu, odchudza instalację, nie serwer.
LLM-as-a-judge: ta sama metoda, trzy różne miejsca
Wszystkie trzy uruchamiają ewaluatory LLM-as-a-judge na zbiorach danych, ale silnik eval LangSmith jest najbardziej produktyzowany, Langfuse łączy zarządzanych sędziów z kolejkami adnotacji i GitHub Action do bramkowania CI, a MLflow wiąże sędziów ze swoim narzędziownictwem eksperymentów i optymalizacji promptów. Metodologia jest identyczna; różnica polega na tym, gdzie mieszkają wyniki.
| Możliwość | Langfuse | LangSmith | MLflow |
|---|---|---|---|
| Zarządzany LLM-as-a-judge | Tak | Tak, największa biblioteka | Tak, wbudowani sędziowie |
| Własne ewaluatory | SDK Python/TS | Własny kod + heurystyki | Ewaluatory kodowe |
| Zbiory danych i eksperymenty | Tak | Tak, funkcja rdzeniowa | Tak, przez eksperymenty |
| Kolejka ludzkich adnotacji | Tak | Tak | Ograniczona |
| Bramkowanie CI | GitHub Action | Silnik eval + API | Przez API |
| Optymalizacja promptów | Nie | Nie | Tak, w oparciu o GEPA |
Według dokumentacji ewaluacji MLflow jego sędziowie działają w tym samym systemie śledzenia eksperymentów co metryki klasycznego ML – to wypłata z argumentu o rodowodzie powyżej: jeden dashboard dla modelu churn i agenta wsparcia. Według dokumentacji Langfuse ewaluatory dołączają do trace'ów i zasilają kolejki adnotacji, przez które zespół przechodzi w interfejsie.
Po metodologię zajrzyj do jak prawidłowo ewaluować wyjścia LLM; po szerszy krajobraz do oceniane przez nas narzędzia ewaluacji. Potoki agentowe wymagają troski wykraczającej poza ocenę wyjścia, co omawiamy w ewaluacja agentów w produkcji.
Zarządzanie promptami: tylko jedno wersjonuje prompty obok modeli
Celowo krótko, bo szczegóły porównania dwóch narzędzi należą do naszego siostrzanego wpisu. Kształt każdego z nich: Langfuse oferuje zarządzanie promptami z wersjonowaniem, etykietami i playgroundem; LangSmith oferuje prompt hub z wersjonowaniem w stylu commitów; MLflow oferuje rejestr promptów przechowujący prompty jako byty pierwszej klasy obok modeli.
Jedyna różnica istotna dla decyzji: MLflow wersjonuje prompty obok wpisów rejestru modeli, więc prompt i model, pod który był strojony, dzielą jeden system rejestrów. Langfuse i LangSmith trzymają prompty osobno od czegokolwiek, co serwuje Twoje modele. Jeśli promujesz model i prompt razem i chcesz śladu audytowego dowodzącego, która para została wydana, to sprzężenie bije każdy playground. Po dogłębne porównanie dwóch narzędzi zajrzyj do naszego pełnego porównania Langfuse vs LangSmith.
Self-hosting, prawa do danych i koszt odejścia
Langfuse hostuje się jako wieloserwisowy stos, który w pełni kontrolujesz, MLflow jako serwer trackingu plus baza, którą możesz odpytywać SQL-em bezpośrednio, LangSmith wyłącznie na warunkach enterprise. Pytanie o wyjście liczy się bardziej niż pytanie o wejście: niezależnie od wybranego narzędzia, historia trace'ów jest tą częścią, której nie odtworzysz.
Rzeczywistość wdrożenia dla każdego narzędzia. Langfuse działa jako web, worker, Postgres, ClickHouse i warstwa cache/blob od czasu przeprojektowania z ery ClickHouse, według wpisu Langfuse o inżynierii skali. Kontekst, który warto mieć poukładany: ClickHouse przejął Langfuse 16 stycznia 2026 wraz z rundą Series D na 400 mln $, a obie strony zobowiązały się, że licencja MIT, pierwszorzędny self-hosting i roadmapa pozostają bez zmian (oświadczenie Langfuse). Self-hosting LangSmith to kwestia planu enterprise, według jego dokumentacji. MLflow to serwer trackingu, baza zgodna z Postgresem i storage obiektowy.
Ścieżki wyjścia, sekcja, której nikt inny nie pisze. Langfuse eksportuje do storage'u blob jako JSONL lub Parquet przez udokumentowany eksport S3, plus pełne API. Backend MLflow to otwarta baza, którą możesz odpytywać bezpośrednio. Eksport masowy LangSmith siedzi za płatnymi planami. Werdykt: lock-in MLflow jest najbardziej odzyskiwalny, Langfuse tuż za nim, LangSmith poniżej enterprise to miejsce, gdzie zły wybór kosztuje Cię historię.
SSO i RBAC bramkują poziom Enterprise Langfuse (2499 $/mies.) i plan Enterprise LangSmith; z MLflow sam wpinasz własne uwierzytelnianie – wolność i praca w równych proporcjach.
| Narzędzie | Licencja self-host | Serwisy, które utrzymujesz | Domyślna retencja | Ścieżka eksportu | Odzyskiwalne? |
|---|---|---|---|---|---|
| Langfuse | MIT | Web, worker, Postgres, ClickHouse, cache/blob | 30 dni do 3 lat wg planu | Eksport blob S3, JSONL/Parquet | Tak |
| LangSmith | Własnościowa | Tylko wdrożenie enterprise | 14 dni baza, 400 dni rozszerzona | Eksport masowy, płatne plany | Częściowo |
| MLflow | Apache 2.0 | Serwer trackingu, baza, storage obiektowy | Bez limitu | Zapytania SQL do bazy backendu | Tak, w pełni |
Ile kosztuje każde z nich przy 100 tys., 1 mln i 10 mln trace'ów?
Langfuse mierzy jednostki, MLflow nie mierzy niczego, a LangSmith nie publikuje już porównywalnej ceny za jednostkę w ogóle. Jednostki i trace'y to nie ten sam obiekt; jedno żądanie użytkownika może być pojedynczym trace'em zawierającym wiele rozliczanych zdarzeń. Tylko dwie z trzech kolumn poniżej da się zbudować z cen katalogowych.
Ten ostatni punkt to wniosek z naszych badań, nie luka w nich. Według stanu na 5 sierpnia 2026 strona cennika LangChain podaje plan Plus jako 39 $ za miejsce, z 10 tys. bazowych trace'ów w cenie, a potem mierzy zużycie po 1,50 $ za LCU (compute) i 1,00 $ za LSU (storage). Na stronie nie ma już żadnej stawki za 1 tys. trace'ów, ani innej podstrony, która by ją niosła. Rachunek LangSmith przy podanym wolumenie trace'ów nie da się więc wyprowadzić z cen katalogowych i nie zamierzamy zmyślać przelicznika.
| Wolumen miesięcznie | Langfuse Cloud | LangSmith | MLflow (self-host, nasza estymacja) |
|---|---|---|---|
| 100 tys. | 29 $ (Core, wliczone) | 39 $ za miejsce + 90 tys. mierzonych, bez stawki katalogowej | 30-50 $ |
| 1 mln | 101 $ (Core + 900 tys. nadwyżki) | 39 $ za miejsce + 990 tys. mierzonych, bez stawki katalogowej | 60-120 $ |
| 10 mln | 731 $ (Core + 9,9 mln nadwyżki) | 39 $ za miejsce + 9,99 mln mierzonych, bez stawki katalogowej | 150-400 $ |
Liczby Langfuse to ceny katalogowe z jego strony cennika, czytanej 5 sierpnia 2026, razy pokazany wolumen. Cena za miejsce LangSmith i poziomy retencji pochodzą z tego samego odczytu cennika LangChain: trace'y bazowe przy 14-dniowej retencji, trace'y rozszerzone przy 400 dniach za dodatkową opłatę, której strona nie kwantyfikuje. Kolumna MLflow to nasza estymacja, nie wycena dostawcy: zarządzany Postgres (15-25 $/mies.), storage obiektowy i jeden zawsze włączony kontener (10-20 $/mies.), rosnące wraz z przechowywaną historią.
Sprawdź naszą matematykę tam, gdzie jest co sprawdzać. Langfuse publikuje stopniowany harmonogram nadwyżek: 8,00 $ za 100 tys. jednostek od 100 tys. do 1 mln, 7,00 $ od 1 mln do 10 mln, 6,50 $ od 10 mln do 50 mln, 6,00 $ powyżej. Przy 1 mln: 29 $ plus 900 tys. jednostek po 8 $ za 100 tys. = 101 $. Przy 10 mln: 29 $, plus 900 tys. po 8 $ (72 $), plus 9 000 tys. po 7 $ (630 $) = 731 $.
Zwróć uwagę na różnicę kształtu: LangSmith rozlicza ludzi plus mierzone zużycie, dwa pozostałe nie. Jeśli Twoim prawdziwym problemem są wydatki na tokeny, proxy LiteLLM przed modelami tnie rachunek, zanim któreś z tych narzędzi go zmierzy.
Czy można uruchomić dwa z nich naraz?
Tak. Langfuse i MLflow oba budują na OpenTelemetry, więc jeden kolektor może rozsyłać te same spany GenAI do dwóch backendów. Realistyczne zestawienie: MLflow jako system rejestrów cyklu życia modelu, Langfuse jako natywny dla LLM-ów interfejs trace'ów. Technicznie łatwe; organizacyjnie ktoś musi być właścicielem kolektora.
Mechanizm: kolektor OTel z dwoma eksporterami OTLP, używający konwencji semantycznych GenAI, by obie strony parsowały spany tak samo.
# Illustrative sketch, not a copy-paste-complete collector config
exporters:
otlp/langfuse:
endpoint: https://cloud.langfuse.com/api/public/otel:443
headers:
Authorization: "Basic <base64 public_key:secret_key>"
otlp/mlflow:
endpoint: http://localhost:5000/otel # your MLflow tracking server
service:
pipelines:
traces:
receivers: [otlp]
processors: [batch]
exporters: [otlp/langfuse, otlp/mlflow] # same spans, two backendsOznaczmy to jasno: powyższy układ to nasza interpretacja architektoniczna, nie konfiguracja wspierana przez dostawcę. Leanware to jedyna inna strona w tym SERP, która w ogóle wspomina o uruchomieniu dwóch narzędzi, w jednym akapicie. Podwójna wysyłka oznacza dwa systemy, dwa rachunki, zdublowany storage i kolektor, który budzi kogoś o 3 w nocy.
Podwójne wysyłanie trace'ów jest technicznie łatwe i organizacyjnie kosztowne. Drugi backend jest darmowy, dopóki ktoś musi go utrzymywać przy życiu.
Langfuse vs LangSmith vs MLflow: kto powinien wybrać co?
Za i przeciw langfuse vs langsmith vs mlflow zamykają się w sześciu profilach. Każdy wiersz wskazuje jedno narzędzie, bo „to zależy" bez wskazania wyboru jest bezużyteczne.
| Twoja sytuacja | Wybór | Dlaczego | Co oddajesz |
|---|---|---|---|
| Samotny programista lub mały zespół, jedna aplikacja LLM | Langfuse | Darmowe 50 tys. jednostek, MIT, self-hosting w każdej chwili | Dopracowany auto-tracing LangChain |
| Zespół natywny dla LangChain lub LangGraph | LangSmith | Tracing bez konfiguracji, najlepszy UX LangGraph | Koszt za miejsce, lock-in |
| Zespół platformowy wdrażający klasyczne ML i funkcje LLM | MLflow | Eksperymenty, rejestr i tracing w jednym | Młodszy interfejs natywny dla LLM |
| Enterprise z naciskiem na compliance (rezydencja, SSO) | Langfuse self-host | Dane nigdy nie opuszczają Twojego VPC | Utrzymujesz pięć serwisów |
| Istniejący sklep Databricks lub MLflow | MLflow | Już wdrożony, bez nowego dostawcy | Funkcje LLM dojrzewają wolniej |
| Zespół chcący zero infrastruktury | LangSmith | Hostowany od pierwszej minuty | 14-dniowa bazowa retencja, opłata za miejsce plus mierzone zużycie |
Jeśli Twoja szczera odpowiedź brzmi „żadne z tych trzech", pozostałe siedem narzędzi z rankingu dziesięciu platform obejmuje opcje hostowane i tylko enterprise, które trzymamy z dala od tej strony.
Często zadawane pytania
Dlaczego używać MLflow do trace'owania LLM?
Używaj MLflow do trace'owania LLM, gdy Twój zespół wdraża już klasyczne modele ML i chce jednego systemu rejestrów: śledzenie eksperymentów, rejestr modeli i tracing GenAI w jednej platformie Apache-2.0, bez opłaty za trace. Jeśli wdrażasz tylko funkcje LLM, Langfuse lub LangSmith dadzą Ci młodsze, LLM-first doświadczenie.
Czy można używać LangSmith i MLflow razem?
Tak. Oba przyjmują dane trace'ów zgodne z OpenTelemetry, więc kolektor OTel może eksportować te same spany do LangSmith i serwera trackingu MLflow jednocześnie. Koszt jest operacyjny: dwa backendy, dwa rachunki, zdublowany storage. Większość zespołów, z którymi rozmawiamy, wybiera jeden system rejestrów i rezygnuje z drugiego.
Czy LangSmith jest open source?
Nie. LangSmith to własnościowe, zamknięte oprogramowanie LangChain Inc. SDK klienta LangSmith jest otwarte, ale platforma, interfejs i backend nie. Jeśli licencja open source ma dla Ciebie znaczenie, Langfuse (MIT) i MLflow (Apache 2.0) to dwie opcje z tego porównania, które możesz swobodnie hostować sam.
Czy MLflow jest tylko do klasycznego uczenia maszynowego?
Nie. MLflow dodał pierwszorzędne wsparcie GenAI: mlflow.openai.autolog() trace'uje wywołania OpenAI automatycznie, @mlflow.trace pokrywa własne funkcje, a wbudowani sędziowie ewaluują wyjścia LLM. Dziedzictwo klasycznego ML widać w interfejsie, który jest mniej natywny dla LLM-ów niż ten w Langfuse, ale sam tracing jest klasy produkcyjnej.
Czy MLflow to orkiestrator workflow jak Airflow lub Kubeflow?
Nie. MLflow nie planuje DAG-ów ani nie uruchamia potoków; zapisuje, co zrobiły Twoje przebiegi: parametry, metryki, artefakty i trace'y. Airflow i Kubeflow orkiestrują zadania, MLflow śledzi ich wyniki. Ludzie mylą tę trójkę, bo współwystępują w stosach MLOps, ale siedzą na różnych warstwach i często działają razem.
Jakie są open-source'owe alternatywy dla LangSmith i MLflow?
Langfuse (MIT) to najbliższa open-source'owa alternatywa dla LangSmith, z self-hostingiem i tracingiem natywnym dla OTel, a sam MLflow jest open source na licencji Apache 2.0. Poza tym porównaniem Lunary, Arize Phoenix i OpenLIT to open-source'owe opcje obserwacji LLM warte uwagi, zanim zobowiążesz się do własnościowej platformy.
Które z trzech jest najtańsze przy 10 mln trace'ów miesięcznie?
MLflow, licząc tylko infrastrukturę: nasza estymacja to 150-400 $ miesięcznie za Postgres, storage obiektowy i kontener. Langfuse Cloud ląduje na 731 $ za 10 mln jednostek na Core plus jego stopniowana nadwyżka. LangSmith nie da się wycenić z jego strony: od połowy 2026 roku LangChain publikuje stawki za miejsce oraz LCU/LSU, a nie cenę katalogową za trace.
Czy Langfuse zastępuje MLflow, czy odwrotnie?
Żadne nie zastępuje drugiego czysto. Langfuse zastępuje warstwy trace'owania i ewaluacji MLflow dla zespołów tylko z LLM-ami i porzuca aparat śledzenia eksperymentów i rejestru modeli. MLflow zastępuje Langfuse, gdy klasyczne modele ML dzielą Twoją platformę, a jeden system rejestrów bije dwa. Pokrywają się w trace'owaniu; rozchodzą we wszystkim wokół niego.
Czy Langfuse jest nadal open source, skoro przejął go ClickHouse?
Tak, według stanu na ogłoszenie z 16 stycznia 2026. ClickHouse przejął Langfuse wraz z rundą Series D na 400 mln $, a obie firmy publicznie zobowiązały się do utrzymania licencji MIT, pierwszorzędnego self-hostingu i niezmienionej roadmapy. To publiczne zobowiązanie, nie wieczysta gwarancja prawna, ale dziś nic w historii self-hostowanej się nie zmieniło.
Źródła
Każde źródło poniżej jest redakcyjne i dofollow; żadne nie jest płatne ani wymienione.
| Źródło | Co potwierdza |
|---|---|
| Dokumentacja MLflow Tracing | Tracing OTel, autolog, @mlflow.trace, odchudzony SDK |
| Quickstart trace'owania MLflow | Kroki policzone w tabeli konfiguracji |
| Dokumentacja ewaluacji i monitoringu MLflow | Sędziowie i workflow ewaluacji |
| Dokumentacja rejestru promptów MLflow | Wersjonowanie promptów |
| Dokumentacja Python SDK Langfuse | @observe i wymagane zmienne środowiskowe |
| Dokumentacja eksportu blob Langfuse | Eksport S3, JSONL/Parquet |
| Cennik Langfuse | Darmowe jednostki, progi planów, cena za 100 tys. |
| Cennik LangChain | Wliczone trace'y bazowe, cena za miejsce Plus, mierzenie LCU/LSU |
| Dokumentacja LangSmith | @traceable, zmienne środowiskowe, poziom self-host |
| OpenTelemetry i konwencje semantyczne GenAI | Standard za podwójnym eksportem |
| Blog inżynierii skali Langfuse | Przeprojektowanie modelu danych ClickHouse |
| ClickHouse przejmuje Langfuse | Przejęcie, 16 stycznia 2026 |
| Langfuse: dołączamy do ClickHouse | Zobowiązania MIT i self-hostingu |
| Leanware: LangSmith vs MLflow | Jedyny niewydawczy wynik redakcyjny SERP |
| MLflow GitHub, Langfuse GitHub | Licencje Apache 2.0 / MIT, gwiazdki |
| MLflow: Top 5 narzędzi obserwacji | Strona dostawcy, cytowana jako twierdzenia MLflow |
Jeśli masz zapamiętać tylko trzy rzeczy
- Dwa z trzech narzędzi powstały z myślą o LLM-ach. MLflow powstał w 2018 roku do klasycznego ML, a tracing doszedł później.
- Langfuse, jeśli chcesz danych trace'ów na licencji MIT, hostowanych u siebie, które w pełni posiadasz. LangSmith, jeśli Twoja aplikacja to LangChain lub LangGraph. MLflow, jeśli klasyczne modele ML dzielą Twoją platformę.
- Najpierw zadaj pytanie o wyjście: Langfuse eksportuje do S3, baza MLflow jest Twoja do odpytywania, eksport masowy LangSmith siedzi za płatnymi planami.
- Przy 10 mln zdarzeń miesięcznie: 731 $ w cenie katalogowej Langfuse Cloud i 150-400 $ infrastruktury na MLflow (nasza estymacja). LangSmith nie ma porównywalnej liczby, odkąd przestał publikować stawkę za trace.
Werdykt, powtórzony: wybieraj po rodowodzie, nie po funkcjach. Chcesz drugą opinię o tym, co pasuje do Twojego stosu, albo pomoc we wpięciu? Porozmawiaj z Techsy. Wybieramy te narzędzia dla klienckich wdrożeń agentów i chętnie powiemy, które i dlaczego.