
Langfuse vs LangSmith vs MLflow: 둘은 관측 가능성 도구, 하나는 ML 플랫폼입니다 (2026)
langfuse vs langsmith vs mlflow 세 도구 중 LLM을 관찰하려고 만들어진 것은 둘뿐입니다. MLflow는 2018년 Databricks에서 scikit-learn과 XGBoost용 실험 추적 도구로 출발했고, GenAI 트레이싱은 그 기반 위에 수년 뒤 얹혔습니다. Langfuse는 MIT 라이선스의 LLM 네이티브, LangSmith는 독점 소프트웨어에 LangChain 네이티브, MLflow는 Apache-2.0이면서 둘보다 오래됐습니다. 기능 체크리스트가 아니라 계보(lineage)가 이 비교를 결정합니다. 결론부터 말하면, 데이터를 소유하려면 Langfuse, LangGraph를 쓰는 팀이라면 LangSmith, 전통적인 ML 모델이 플랫폼을 공유한다면 MLflow입니다.
핵심 요약
- MIT 코어를 셀프 호스팅해서 트레이스 데이터를 완전히 소유하고 싶다면 Langfuse.
ee/폴더는 별도의 상업 조건을 적용받으며, 이 때문에 GitHub는 이 저장소를 MIT가 아니라NOASSERTION으로 표시합니다. - 앱이 LangChain이나 LangGraph이고, 가장 촘촘한 통합을 위해 시트당 비용을 낼 의향이 있다면 LangSmith.
- 전통적인 ML 모델도 함께 배포하면서 실험, 모델 레지스트리, 트레이싱을 한곳에서 관리하고 싶다면 MLflow.
- 세 도구 모두 이제 OpenTelemetry를 지원하므로, 두 가지를 동시에 돌리는 것도 현실적인 선택지입니다.
한눈에 보는 Langfuse vs LangSmith vs MLflow
Langfuse는 오픈소스 선택지, LangSmith는 LangChain 네이티브 선택지, MLflow는 LLM 기능 옆에서 전통적인 ML도 함께 배포하는 팀을 위한 선택지입니다. 이 중 둘은 LLM 관측 가능성 도구이고, 나머지 하나는 LLM 트레이싱을 배운 ML 플랫폼입니다. 바로 이 차이가 대부분의 평가를 좌우합니다.
이 분야가 처음이라면 먼저 AI 관측 가능성 입문 글을 읽으세요.
| 항목 | Langfuse | LangSmith | MLflow |
|---|---|---|---|
| 라이선스 | MIT 코어, ee/는 별도 상업 조건 | 독점(proprietary) | Apache 2.0, 오픈소스 |
| 셀프 호스팅 | 가능, 무료 | 엔터프라이즈 플랜 전용 | 가능, 무료 |
| LLM 트레이싱 | @observe, OTel 네이티브 | @traceable, LangChain 자동 | autolog, @mlflow.trace |
| 평가 / LLM-as-a-judge | 매니지드 + 커스텀 평가기 | 내장 평가 엔진 | Judge + 프롬프트 최적화 |
| 프롬프트 관리 | 버전 관리, 라벨, 플레이그라운드 | 프롬프트 허브 | 프롬프트 레지스트리 |
| 전통적 ML 수명주기 | 없음 | 없음 | 실험 + 모델 레지스트리 |
| OpenTelemetry 지원 | 네이티브 | OTel 호환 수집 | 네이티브, GenAI 규약 |
| 무료 구간 | 월 50K 유닛, 30일 | 월 5K 트레이스, 시트 1개 | 무제한, 자체 인프라 |
| 유료 진입 가격 | $29/월 (Core) | 시트당 $39/월 (Plus) | $0, 인프라 비용만 |
| 데이터 보관 | 플랜별 30일 / 90일 / 3년 | 기본 14일, 확장 400일 | 무제한, 자체 스토리지 |
| 가장 적합한 대상 | 트레이스 데이터 소유 | LangGraph 네이티브 팀 | ML + LLM 혼합 플랫폼 |
보관 기간 수치는 벤더에서 가져왔습니다. Langfuse의 30일/90일/3년 구간은 가격 페이지 기준이고, LangSmith의 기본 14일과 확장 400일 트레이스는 LangChain 가격 페이지 기준입니다(확장 트레이스는 토글이 아니라 가격이 두 배인 별도 트레이스 유형입니다). MLflow는 스토리지가 버티는 만큼 데이터를 보관합니다.
이름을 밝힌 세 가지 선택지:
- MIT 라이선스 코드, 첫날부터 가능한 셀프 호스팅, 직접 운영하는 Postgres와 ClickHouse 안의 트레이스 데이터를 원한다면 Langfuse를 고르세요.
- 스택이 LangChain이나 LangGraph이고 트레이스당 과금보다 시트당 과금이 낫다면 LangSmith를 고르세요.
- sklearn과 XGBoost 모델이 LLM 기능 옆에서 함께 돌아간다면 MLflow를 고르세요. 두 도구만의 상세 비교는 Langfuse vs LangSmith 1:1 비교 글에 있습니다.
LLM 네이티브 도구가 필요한가, ML 플랫폼이 필요한가
이 검색어에서 langfuse vs mlflow 쪽은 사실 계보(lineage) 질문입니다. MLflow는 전통적인 ML을 위한 실험 추적과 모델 레지스트리로 시작해 나중에 LLM 트레이싱을 얹었습니다. Langfuse는 LLM 트레이싱으로 시작해 그 외에는 아무것도 얹지 않았습니다. 전통적인 모델을 하나도 배포하지 않는다면, MLflow의 수명주기 기계장치는 이유 없이 유지보수할 표면적만 늘릴 뿐이고, 전용 AI 관측 가능성 도구가 더 짧은 길입니다.
MLflow는 셋 중 압도적으로 가장 오래되었습니다. Apache-2.0 라이선스, Linux Foundation 거버넌스, 2026년 8월 5일 기준 GitHub 스타 27,000개 이상, "어떤 하이퍼파라미터가 어떤 아티팩트를 만들었는가?"에 답하려고 만들어졌습니다. GenAI 트레이싱은 그 기반 위에 나중에 올라왔습니다. XGBoost 이탈 예측 모델과 GPT-4o 고객지원 에이전트를 둘 다 배포하는 팀이라면, 하나의 기록 시스템, 즉 같은 데이터베이스 안의 실험, 레지스트리 항목, LLM 트레이스를 얻습니다.
반대편 무게추: 전통적인 모델을 하나도 배포하지 않는다면 그중 어떤 것도 제 값을 하지 못합니다. MLflow의 LLM 네이티브 UX는 Langfuse보다 어려서, 숏컷도 적고 트레이스 뷰도 더 거칩니다.
자동완성에 kubeflow vs mlflow vs airflow가 뜰 정도로 사람들이 많이 검색하니 한 가지를 명확히 하자면, MLflow는 워크플로 오케스트레이터가 아닙니다. DAG를 스케줄하지 않고, 실행이 무엇을 했는지 기록합니다. Airflow와 Kubeflow는 잡을 실행하고, MLflow는 그 산출물을 추적합니다. 레이어 질문(mlflow vs tensorflow)에 대해서도 말하자면, TensorFlow는 모델링 프레임워크이고, MLflow는 어떤 프레임워크로 학습하든 그 위에 올라갑니다. 이 SERP에서 유일한 비벤더 편집 글인 Leanware의 비교도 같은 구분을 합니다.
| 도구 | 출발 | 처음부터 만든 것 | 나중에 추가한 것 | 맞는 팀 |
|---|---|---|---|---|
| Langfuse | 2023년, LLM 네이티브 스타트업 | LLM 트레이싱과 평가 | 프롬프트 관리, OTel 내보내기 | LLM 전용 프로덕트 팀 |
| LangSmith | 2023년, LangChain Inc. 출신 | LangChain 디버깅 | 평가 엔진, 프롬프트 허브 | LangChain/LangGraph 팀 |
| MLflow | 2018년, Databricks, 현재 Linux Foundation | 실험 추적, 모델 레지스트리 | GenAI 트레이싱, judge, 프롬프트 레지스트리 | 전통적 ML과 LLM을 함께 쓰는 팀 |
팀이 Jupyter 노트북을 한 번도 열지 않는다면, MLflow의 가장 큰 강점은 죽은 무게입니다. 이 테스트 하나만으로 이 페이지 독자의 대부분에게는 MLflow가 탈락합니다.
첫 트레이스까지 실제로 얼마나 많은 코드가 필요한가
세 도구 모두 Python 두 줄 정도지만, 마찰이 있는 곳은 서로 다릅니다. Langfuse와 LangSmith는 첫 트레이스가 찍히기 전에 계정 키를 요구합니다. MLflow는 실행 중인 트래킹 서버를 요구합니다. 코드 줄 수가 가장 적은 것과 일이 가장 적은 것은 같은 말이 아닙니다.
같은 작업, 즉 OpenAI 채팅 호출 하나와 헬퍼 하나를 가져와 각 벤더의 퀵스타트(2026년 8월 5일 재확인)를 따라 세 가지 방식으로 계측했습니다.
Langfuse, @observe 데코레이터 사용:
# pip install langfuse
import os
from langfuse import observe
from langfuse.openai import openai # drop-in wrapper
os.environ["LANGFUSE_PUBLIC_KEY"] = "pk-lf-..."
os.environ["LANGFUSE_SECRET_KEY"] = "sk-lf-..."
os.environ["LANGFUSE_BASE_URL"] = "https://cloud.langfuse.com"
@observe()
def answer(question: str, context: str) -> str:
r = openai.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentLangSmith, @traceable 사용:
# pip install langsmith
import os
from langsmith import traceable
from openai import OpenAI
os.environ["LANGSMITH_TRACING"] = "true"
os.environ["LANGSMITH_API_KEY"] = "lsv2-..."
client = OpenAI()
@traceable
def answer(question: str, context: str) -> str:
r = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.contentMLflow, mlflow.openai.autolog() 사용:
# pip install mlflow
import mlflow
from openai import OpenAI
mlflow.set_tracking_uri("http://localhost:5000") # server must be running
mlflow.openai.autolog()
def answer(question: str, context: str) -> str:
r = OpenAI().chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}\n\nQ: {question}"}],
)
return r.choices[0].message.content세 퀵스타트에서 우리가 뽑은 수치:
| 도구 | pip 패키지 | 첫 트레이스 전 환경 변수 | 추가된 Python 줄 수 | 트레이스가 도착하는 곳 |
|---|---|---|---|---|
| Langfuse | 1개 (langfuse) | 3개 (public key, secret, base URL) | 2줄 (import 교체, @observe) | Langfuse Cloud 또는 자체 스택 |
| LangSmith | 1개 (langsmith) | 2개 (API key, 트레이싱 플래그) | 2줄 (import, @traceable) | LangSmith 클라우드 프로젝트 |
| MLflow | 1개 (mlflow) | 0개 (계정 불필요) | 2줄 (tracking URI, autolog) | 트래킹 서버의 데이터베이스 |
각 벤더의 퀵스타트에서 직접 셌습니다(2026년 8월 5일 확인): Langfuse SDK 문서, LangSmith observability 퀵스타트, MLflow 트레이싱 퀵스타트. openai는 앱 자체의 의존성이라 세지 않았습니다. 직접 다시 세어 보세요.
우리의 해석임을 분명히 밝힙니다. 세 도구 모두 코드가 거의 똑같으므로, 코드는 결정이 갈리는 지점이 아닙니다. Langfuse와 LangSmith는 계정 생성 5분으로 마찰을 앞당겨 치릅니다. MLflow는 인프라로 앞당겨 치릅니다. 그 한 줄 예제는 트래킹 서버, 그 뒤의 데이터베이스, 그리고 둘 다 살아 있게 유지할 누군가를 가정합니다. MLflow가 전체 패키지보다 약 95% 작다고 말하는 슬림한 mlflow-tracing SDK는 설치를 줄여 줄 뿐, 서버를 줄여 주지는 않습니다.
LLM-as-a-Judge: 같은 방법론, 세 개의 다른 집
세 도구 모두 데이터셋에 대해 LLM-as-a-judge 평가기를 실행하지만, LangSmith의 평가 엔진이 가장 제품화되어 있고, Langfuse는 매니지드 judge에 어노테이션 큐와 CI 게이팅용 GitHub Action을 짝지어 제공하며, MLflow는 judge를 실험 및 프롬프트 최적화 도구와 연결합니다. 방법론은 동일하고, 차이는 결과가 어디에 사느냐입니다.
| 기능 | Langfuse | LangSmith | MLflow |
|---|---|---|---|
| 매니지드 LLM-as-a-judge | 예 | 예, 최대 라이브러리 | 예, 내장 judge |
| 자체 평가기 반입 | Python/TS SDK | 커스텀 코드 + 휴리스틱 | 코드 평가기 |
| 데이터셋과 실험 | 예 | 예, 핵심 기능 | 예, 실험을 통해 |
| 사람 어노테이션 큐 | 예 | 예 | 제한적 |
| CI 게이팅 | GitHub Action | 평가 엔진 + API | API 기반 |
| 프롬프트 최적화 | 아니요 | 아니요 | 예, GEPA 기반 |
MLflow 평가 문서에 따르면, 이 judge는 전통적인 ML 지표와 같은 실험 추적 시스템 안에서 실행됩니다. 위에서 다룬 계보 논의의 보상이 바로 이것입니다. 이탈 예측 모델과 고객지원 에이전트를 하나의 대시보드에서 볼 수 있습니다. Langfuse 문서에 따르면, 평가기는 트레이스에 붙어 팀이 UI에서 처리하는 어노테이션 큐로 흘러갑니다.
방법론 자체는 LLM 출력을 제대로 평가하는 방법을 읽으세요. 더 넓은 지형도는 우리가 순위를 매긴 평가 도구 모음에 있습니다. 에이전트 파이프라인에는 출력 점수 매기기 이상의 주의가 필요하며, 이는 운영 중인 에이전트 평가하기에서 다룹니다.
프롬프트 관리: 모델 옆에서 프롬프트를 버전 관리하는 것은 하나뿐
의도적으로 짧게 씁니다. 두 도구만의 상세 비교는 자매 글의 몫이기 때문입니다. 각자의 모양새: Langfuse는 버전 관리, 라벨, 플레이그라운드가 있는 프롬프트 관리를 제공하고, LangSmith는 커밋 스타일 버전 관리를 갖춘 프롬프트 허브를 제공하며, MLflow는 프롬프트를 모델 옆의 일급(first-class) 엔티티로 저장하는 프롬프트 레지스트리를 제공합니다.
결정과 관련된 차이는 하나입니다. MLflow는 프롬프트를 모델 레지스트리 항목과 나란히 버전 관리하므로, 프롬프트와 그 프롬프트가 튜닝된 대상 모델이 하나의 기록 시스템을 공유합니다. Langfuse와 LangSmith는 프롬프트를 모델 서빙과 분리해 둡니다. 모델과 프롬프트를 함께 승격시키고 어떤 조합이 배포되었는지 증명하는 감사 추적(audit trail)이 필요하다면, 이 결합은 어떤 플레이그라운드보다 값집니다. 두 도구 상세 비교는 Langfuse vs LangSmith 1:1 비교 글을 보세요.
셀프 호스팅, 데이터 소유권, 그리고 떠나는 데 드는 비용
Langfuse는 완전히 통제할 수 있는 멀티 서비스 스택으로 셀프 호스팅하고, MLflow는 직접 SQL로 질의할 수 있는 트래킹 서버와 데이터베이스로, LangSmith는 엔터프라이즈 조건으로만 셀프 호스팅합니다. 진입 질문보다 이탈 질문이 더 중요합니다. 어떤 도구를 고르든, 트레이스 이력은 다시 만들 수 없는 부분이기 때문입니다.
도구별 배포 현실. Langfuse는 ClickHouse 시대의 재설계 이후 웹, 워커, Postgres, ClickHouse, 캐시/blob 레이어로 실행됩니다(Langfuse 스케일 엔지니어링 글 참고). 똑바로 알아야 할 맥락: ClickHouse가 2026년 1월 16일에 Langfuse를 인수했고 4억 달러 규모 시리즈 D도 함께 발표했으며, 양쪽 모두 MIT 라이선스, 일급 셀프 호스팅, 로드맵이 변하지 않는다고 약속했습니다(Langfuse 입장문). LangSmith 셀프 호스팅은 문서에 따르면 엔터프라이즈 플랜의 영역입니다. MLflow는 트래킹 서버, Postgres 호환 데이터베이스, 오브젝트 스토리지입니다.
이탈 경로, 다른 누구도 쓰지 않는 섹션입니다. Langfuse는 문서화된 S3 내보내기로 blob 스토리지에 JSONL 또는 Parquet으로 내보내고, 완전한 API도 있습니다. MLflow의 백엔드는 직접 질의할 수 있는 열린 데이터베이스입니다. LangSmith의 대량 내보내기는 유료 플랜 뒤에 있습니다. 결론: MLflow의 종속(lock-in)이 가장 회복 가능하고, Langfuse가 바로 뒤를 따르며, LangSmith는 엔터프라이즈 미만 구간에서 잘못된 선택이 이력을 잃게 만드는 곳입니다.
SSO와 RBAC은 Langfuse 엔터프라이즈 티어(월 $2,499)와 LangSmith 엔터프라이즈 플랜의 문지기입니다. MLflow에서는 인증을 직접 배선해야 하며, 자유와 수고가 같은 양으로 따라옵니다.
| 도구 | 셀프 호스트 라이선스 | 운영할 서비스 | 기본 보관 기간 | 내보내기 경로 | 회복 가능한가? |
|---|---|---|---|---|---|
| Langfuse | MIT | 웹, 워커, Postgres, ClickHouse, 캐시/blob | 플랜별 30일~3년 | S3 blob 내보내기, JSONL/Parquet | 예 |
| LangSmith | 독점 | 엔터프라이즈 배포 전용 | 기본 14일, 확장 400일 | 대량 내보내기, 유료 플랜 | 부분적으로 |
| MLflow | Apache 2.0 | 트래킹 서버, DB, 오브젝트 스토리지 | 무제한 | 백엔드 DB에 SQL 질의 | 예, 완전히 |
100K, 1M, 10M 트레이스에서는 각각 얼마인가
Langfuse는 유닛(unit) 을 측정하고, MLflow는 아무것도 측정하지 않으며, LangSmith는 더 이상 비교 가능한 유닛 가격을 공개하지 않습니다. 유닛과 트레이스는 같은 객체가 아닙니다. 사용자 요청 하나는 여러 과금 이벤트를 포함하는 하나의 트레이스가 될 수 있습니다. 아래 세 열 중 두 개만 정가로 산출할 수 있습니다.
이 마지막 지점은 우리 조사의 공백이 아니라 하나의 발견입니다. 2026년 8월 5일 기준 LangChain 가격 페이지는 Plus 요금제를 기본 트레이스 10K가 포함된 시트당 $39로 명시하고, 이후 사용량은 LCU(컴퓨트)당 $1.50과 LSU(스토리지)당 $1.00으로 계량합니다. 이 페이지에는 더 이상 1K 트레이스당 요율이 없고, 그런 요율을 담은 두 번째 페이지도 없습니다. 따라서 특정 트레이스 물량에서 LangSmith 청구액을 정가로부터 도출할 수 없으며, 우리는 임의의 환산값을 지어내지 않겠습니다.
| 월 물량 | Langfuse Cloud | LangSmith | MLflow (셀프 호스팅, 자체 추정) |
|---|---|---|---|
| 100K | $29 (Core, 포함) | 시트 $39 + 90K 계량, 정가 없음 | $30-50 |
| 1M | $101 (Core + 900K 초과분) | 시트 $39 + 990K 계량, 정가 없음 | $60-120 |
| 10M | $731 (Core + 9.9M 초과분) | 시트 $39 + 9.99M 계량, 정가 없음 | $150-400 |
Langfuse 수치는 가격 페이지의 정가이며(2026년 8월 5일 확인), 표시된 물량을 곱한 값입니다. LangSmith의 시트 가격과 보관 등급은 같은 날 확인한 LangChain 가격 기준입니다: 기본 트레이스는 14일 보관, 확장 트레이스는 400일 보관에 페이지가 수치화하지 않은 추가 요금이 붙습니다. MLflow 열은 벤더 견적이 아니라 우리의 추정치입니다: 매니지드 Postgres($15-25/월), 오브젝트 스토리지, 항상 켜져 있는 컨테이너 하나($10-20/월), 저장된 이력이 늘수록 커집니다.
계산할 것이 있는 부분은 직접 검증해 보세요. Langfuse는 단계별 초과 요금표를 공개합니다: 100K1M 구간은 유닛당 100K에 $8.00, 1M10M 구간은 $7.00, 10M~50M 구간은 $6.50, 그 이상은 $6.00입니다. 1M에서: $29에 900K 유닛을 100K당 $8로 더하면 = $101. 10M에서: $29에 900K를 $8로($72), 9,000K를 $7로($630) 더하면 = $731.
형태 차이에 주목하세요. LangSmith는 사람 수와 계량된 사용량 모두에 과금하고, 나머지 둘은 그렇지 않습니다. 진짜 문제가 토큰 지출이라면, 모델 앞에 두는 LiteLLM 프록시가 이 도구들이 계량하기도 전에 청구서를 줄여 줍니다.
두 가지를 함께 돌릴 수 있는가
예. Langfuse와 MLflow는 둘 다 OpenTelemetry 위에 만들어져서, 컬렉터 하나가 같은 GenAI 스팬을 백엔드 두 곳으로 팬아웃할 수 있습니다. 현실적인 조합: MLflow를 모델 수명주기의 기록 시스템으로, Langfuse를 LLM 네이티브 트레이스 UX로. 기술적으로는 쉽습니다. 조직적으로는 컬렉터를 책임질 누군가가 있어야 합니다.
메커니즘: OTLP 익스포터 두 개를 단 OTel 컬렉터에 GenAI 시맨틱 규약을 사용해, 양쪽이 스팬을 같은 방식으로 파싱하게 합니다.
# Illustrative sketch, not a copy-paste-complete collector config
exporters:
otlp/langfuse:
endpoint: https://cloud.langfuse.com/api/public/otel:443
headers:
Authorization: "Basic <base64 public_key:secret_key>"
otlp/mlflow:
endpoint: http://localhost:5000/otel # your MLflow tracking server
service:
pipelines:
traces:
receivers: [otlp]
processors: [batch]
exporters: [otlp/langfuse, otlp/mlflow] # same spans, two backends분명히 라벨을 붙이자면, 위 구성은 우리의 아키텍처 해석이지 벤더가 지원하는 구성이 아닙니다. Leanware는 이 SERP에서 도구 두 개를 동시에 돌리는 것을 언급하는 유일한 다른 페이지인데, 한 문단뿐입니다. 이중 전송은 시스템 두 개, 청구서 두 장, 중복 스토리지, 그리고 새벽 3시에 누군가를 깨우는 컬렉터를 뜻합니다.
트레이스 이중 전송은 기술적으로 쉽고, 조직적으로는 비쌉니다. 두 번째 백엔드는 누군가 살아 있게 유지해야 할 때까지 무료입니다.
Langfuse vs LangSmith vs MLflow: 누가 무엇을 골라야 하는가
langfuse vs langsmith vs mlflow의 장단점은 여섯 가지 프로필로 정리됩니다. 모든 행은 도구 하나를 지목합니다. 선택지 없는 "케이스 바이 케이스"는 쓸모가 없기 때문입니다.
| 당신의 상황 | 선택 | 이유 | 포기하는 것 |
|---|---|---|---|
| 1인 개발자 또는 소규모 팀, LLM 앱 하나 | Langfuse | 무료 50K 유닛, MIT, 언제든 셀프 호스팅 | LangChain 자동 트레이싱의 완성도 |
| LangChain 또는 LangGraph 네이티브 팀 | LangSmith | 무설정 트레이싱, 최고의 LangGraph UX | 시트당 비용, 종속 |
| 전통적 ML과 LLM 기능을 함께 배포하는 플랫폼 팀 | MLflow | 실험, 레지스트리, 트레이싱을 하나로 | 더 젊은 LLM 네이티브 UX |
| 컴플라이언스 중심 엔터프라이즈 (거주지, SSO) | Langfuse 셀프 호스트 | 데이터가 VPC를 떠나지 않음 | 서비스 5개를 직접 운영 |
| 기존 Databricks 또는 MLflow 환경 | MLflow | 이미 배포되어 있음, 새 벤더 없음 | LLM 기능의 느린 성숙 |
| 인프라 제로를 원하는 팀 | LangSmith | 첫 순간부터 호스팅 | 기본 14일 보관, 트레이스당 요금 |
솔직한 답이 "셋 다 아니다"라면, 우리가 순위를 매긴 10개 플랫폼에 이 페이지에서 뺀 호스팅 전용, 엔터프라이즈 전용 선택지 일곱 개가 더 있습니다.
자주 묻는 질문
LLM 트레이싱에 왜 MLflow를 쓰는가
팀이 이미 전통적인 ML 모델을 배포하고 있고 기록 시스템을 하나로 가져가고 싶을 때 MLflow를 쓰세요. 실험 추적, 모델 레지스트리, GenAI 트레이싱이 하나의 Apache-2.0 플랫폼에 있고, 트레이스당 비용이 없습니다. LLM 기능만 배포한다면, Langfuse나 LangSmith가 더 젊고 LLM 우선 경험을 제공합니다.
LangSmith와 MLflow를 함께 쓸 수 있는가
예. 둘 다 OpenTelemetry 호환 트레이스 데이터를 받으므로, OTel 컬렉터가 같은 스팬을 LangSmith와 MLflow 트래킹 서버 양쪽에 동시에 내보낼 수 있습니다. 대가는 운영 측면입니다. 백엔드 두 개, 청구서 두 장, 중복 스토리지. 우리가 이야기한 대부분의 팀은 기록 시스템을 하나 고르고 두 번째는 건너뜁니다.
LangSmith는 오픈소스인가
아니요. LangSmith는 LangChain Inc.의 독점 클로즈드 소스 소프트웨어입니다. LangSmith 클라이언트 SDK는 열려 있지만, 플랫폼, UI, 백엔드는 그렇지 않습니다. 오픈소스 라이선스가 중요하다면, Langfuse(MIT)와 MLflow(Apache 2.0)가 이 비교 안에서 자유롭게 셀프 호스팅할 수 있는 두 선택지입니다.
MLflow는 전통적인 머신러닝 전용인가
아니요. MLflow는 일급 GenAI 지원을 추가했습니다. mlflow.openai.autolog()는 OpenAI 호출을 자동으로 트레이스하고, @mlflow.trace는 커스텀 함수를 다루며, 내장 judge가 LLM 출력을 평가합니다. 전통적 ML 유산은 UX에 드러나는데, Langfuse보다 LLM 네이티브 느낌이 덜합니다. 하지만 트레이싱 자체는 프로덕션급입니다.
MLflow는 Airflow나 Kubeflow 같은 워크플로 오케스트레이터인가
아니요. MLflow는 DAG를 스케줄하거나 파이프라인을 실행하지 않습니다. 실행이 무엇을 했는지, 즉 파라미터, 메트릭, 아티팩트, 트레이스를 기록합니다. Airflow와 Kubeflow는 잡을 오케스트레이션하고, MLflow는 그 결과를 추적합니다. 세 가지가 MLOps 스택에서 함께 등장하기 때문에 사람들이 혼동하지만, 서로 다른 레이어에 있고 종종 함께 실행됩니다.
LangSmith와 MLflow의 오픈소스 대안은 무엇인가
Langfuse(MIT)가 가장 가까운 오픈소스 LangSmith 대안입니다. 셀프 호스팅과 OTel 네이티브 트레이싱을 갖추고 있고, MLflow 자체도 Apache 2.0 아래 오픈소스입니다. 이 비교 너머로는 Lunary, Arize Phoenix, OpenLIT이 독점 플랫폼에 정착하기 전에 살펴볼 가치가 있는 오픈소스 LLM 관측 가능성 선택지입니다.
월 1천만 트레이스에서 셋 중 무엇이 가장 싼가
인프라만 따지면 MLflow가 가장 쌉니다. 자체 추정치는 Postgres, 오브젝트 스토리지, 컨테이너에 월 $150-400입니다. Langfuse Cloud는 10M 유닛에서 Core 요금에 단계별 초과분을 더해 $731에 도달합니다. LangSmith는 이 페이지 정보로는 가격을 매길 수 없습니다. 2026년 중반부터 LangChain은 트레이스당 정가 대신 시트 요금과 LCU/LSU 요율을 공개하기 때문입니다.
Langfuse가 MLflow를 대체하는가, 그 반대인가
어느 쪽도 다른 쪽을 깔끔하게 대체하지 못합니다. Langfuse는 LLM 전용 팀에게 MLflow의 트레이싱과 평가 레이어를 대체하고, 실험 추적과 모델 레지스트리 기계장치는 버립니다. MLflow는 전통적인 ML 모델이 플랫폼을 공유하고 있을 때, 그리고 기록 시스템이 하나인 것이 둘인 것보다 나을 때 Langfuse를 대체합니다. 둘은 트레이싱에서 겹치고, 그 주변 모든 것에서는 갈라집니다.
ClickHouse가 인수한 지금도 Langfuse는 여전히 오픈소스인가
예, 2026년 1월 16일 발표 시점 기준으로는 그렇습니다. ClickHouse는 4억 달러 규모 시리즈 D와 함께 Langfuse를 인수했고, 양사는 MIT 라이선스, 일급 셀프 호스팅, 변하지 않는 로드맵을 공개적으로 약속했습니다. 이는 공개적 약속이지 영구적인 법적 보장은 아닙니다. 하지만 오늘 시점에서 셀프 호스팅 이야기에 변한 것은 없습니다.
출처
아래 출처는 모두 편집 링크이며 dofollow입니다. 유료이거나 교환된 링크는 없습니다.
| 출처 | 뒷받침하는 내용 |
|---|---|
| MLflow Tracing 문서 | OTel 트레이싱, autolog, @mlflow.trace, 슬림 SDK |
| MLflow 트레이싱 퀵스타트 | 설정 표에서 센 단계 |
| MLflow 평가 및 모니터링 문서 | Judge와 평가 워크플로 |
| MLflow 프롬프트 레지스트리 문서 | 프롬프트 버전 관리 |
| Langfuse Python SDK 문서 | @observe와 필수 환경 변수 |
| Langfuse blob 내보내기 문서 | S3 내보내기, JSONL/Parquet |
| Langfuse 가격 | 무료 유닛, 플랜 하한, 100K당 가격 |
| LangChain 가격 | 포함된 기본 트레이스, Plus 시트 가격, LCU/LSU 계량 |
| LangSmith 문서 | @traceable, 환경 변수, 셀프 호스트 티어 |
| OpenTelemetry와 GenAI 시맨틱 규약 | 이중 내보내기의 기반 표준 |
| Langfuse 스케일 엔지니어링 블로그 | ClickHouse 데이터 모델 재설계 |
| ClickHouse의 Langfuse 인수 | 인수, 2026-01-16 |
| Langfuse: ClickHouse 합류 | MIT와 셀프 호스팅 약속 |
| Leanware: LangSmith vs MLflow | 유일한 비벤더 편집 SERP 결과 |
| MLflow GitHub, Langfuse GitHub | Apache 2.0 / MIT 라이선스, 스타 |
| MLflow: Top 5 Observability Tools | 벤더 페이지, MLflow의 주장으로 인용 |
세 가지만 기억한다면
- 셋 중 둘은 LLM을 위해 만들어졌습니다. MLflow는 2018년 전통적인 ML을 위해 만들어졌고, 트레이싱은 나중에 배웠습니다.
- MIT 라이선스에 셀프 호스팅, 완전히 소유하는 트레이스 데이터를 원한다면 Langfuse. 앱이 LangChain이나 LangGraph라면 LangSmith. 전통적인 ML 모델이 플랫폼을 공유한다면 MLflow.
- 먼저 이탈 질문을 던지세요. Langfuse는 S3로 내보내고, MLflow의 데이터베이스는 직접 질의할 수 있고, LangSmith의 대량 내보내기는 유료 플랜 뒤에 있습니다.
- 월 1000만 이벤트 기준: Langfuse Cloud 정가는 $731, MLflow 인프라 비용은 $150-400(자체 추정)입니다. LangSmith는 트레이스당 요율 공개를 중단했기 때문에 비교할 수 있는 수치가 없습니다.
결론을 다시 말하면, 기능이 아니라 계보를 보고 고르세요. 어떤 것이 스택에 맞을지 제2의 의견이 필요하거나, 배선을 돕길 원한다면 Techsy와 상담하세요. 우리는 클라이언트 에이전트 배포에 이 도구들을 직접 고르며, 어떤 것을 왜 골랐는지 기꺼이 알려드립니다.