
Langfuse vs LangSmith: En uafhængig dom
Valget mellem Langfuse og LangSmith koger ned til én filosofisk kløft: open-source og framework-agnostisk vs. proprietær og LangChain-native. Den beslutning former alt fra, hvor dine data ligger, til hvor meget du betaler ved skalering.
Her er det, der gør denne sammenligning anderledes: Vi sælger ikke et observability-værktøj. Hvis du kigger på de andre topresultater for denne søgning, er seks ud af ti skrevet af leverandører med en økonomisk interesse, hvor Langfuse sammenligner sig selv med LangSmith, eller konkurrenter som Lunary og Mirascope stille skubber deres egne produkter. Vi er uafhængige. Begge værktøjer har ægte styrker, og vi vil være ærlige omkring, hvor hver enkelt vinder.
En vigtig kontekst: Langfuse v3 blev lanceret i midten af 2025 med en fuld OpenTelemetry-native arkitektur, hvilket ændrer denne sammenligning betydeligt. De fleste artikler på SERP'en blev skrevet før v3. Denne artikel blev ikke. Hvis du forsøger at forstå, hvad LLM-observability faktisk betyder, før du dykker ned i værktøjerne, så start der.
Hurtigt overblik: Langfuse vs LangSmith ved første øjekast
| Dimension | Langfuse | LangSmith | Vinder |
|---|---|---|---|
| Licens | MIT (open-source) | Proprietær | Langfuse |
| Self-Hosting | Docker Compose, 30 min opsætning | Kun Enterprise ($$) | Langfuse |
| Pris (cloud) | Gratis op til 50K enheder/måned | Gratis op til 5K traces/måned | Langfuse |
| LLM Tracing | @observe decorator, OTEL-native | @traceable, LangChain auto-trace | Uafgjort |
| Evalueringsværktøjer | Annotation scoring, eksterne evals | Indbyggede evaluatorer, LLM-as-judge | LangSmith |
| Prompt Management | Versionering, playground, SDK deploy | Hub, versionering, model-switching playground | Uafgjort |
| Framework-integrationer | 10+ (LangChain, OpenAI, Pydantic AI, Vercel osv.) | Primært LangChain/LangGraph | Langfuse |
| OpenTelemetry-support | Native (v3 SDK) | Begrænset | Langfuse |
| Dashboard / UI | Rent, funktionelt | Poleret, funktionsrigt | LangSmith |
| Community | 7K+ GitHub-stjerner, aktiv Discord | Stor (LangChain-økosystem) | LangSmith |
| Data-sovereignitet | Fuld kontrol (self-hosted) | Kun cloud for de fleste brugere | Langfuse |
| Opsætningskompleksitet | Lav (pip install + 2 env vars) | Lav (pip install + 2 env vars) | Uafgjort |
Bundlinje: Langfuse vinder 5 kategorier, LangSmith vinder 3, og 4 er uafgjorte. Men det "rigtige" valg afhænger i høj grad af dit framework, dine datakrav og dit budget. Læs videre for detaljerne.
Tracing og Observability
Begge platforme eksisterer for at besvare det samme spørgsmål: "Hvad skete der inde i mit LLM-kald?" Du vil se hver input, output, latency, token-tælling og omkostning for hver LLM-interaktion i din app. Hvordan de kommer dertil, er forskelligt.
Opsætning af Langfuse Tracing
# pip install langfuse openai
import os
from langfuse.openai import openai # Drop-in replacement
os.environ["LANGFUSE_PUBLIC_KEY"] = "pk-..."
os.environ["LANGFUSE_SECRET_KEY"] = "sk-..."
os.environ["LANGFUSE_HOST"] = "https://cloud.langfuse.com" # or your self-hosted URL
# That's it -- all OpenAI calls are now traced automatically
response = openai.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Explain quantum computing simply"}]
)For mere kontrol kan du bruge @observe-decoratoren:
from langfuse.decorators import observe
@observe()
def analyze_document(doc: str) -> str:
# This entire function becomes a trace span
summary = openai.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": f"Summarize: {doc}"}]
)
return summary.choices[0].message.contentOpsætning af LangSmith Tracing
# pip install langsmith openai
import os
os.environ["LANGSMITH_API_KEY"] = "lsv2-..."
os.environ["LANGSMITH_TRACING"] = "true"
# If using LangChain, tracing is automatic -- zero config
from langchain_openai import ChatOpenAI
llm = ChatOpenAI(model="gpt-4o")
response = llm.invoke("Explain quantum computing simply")
# If NOT using LangChain, use the @traceable decorator
from langsmith import traceable
@traceable
def analyze_document(doc: str) -> str:
response = openai.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": f"Summarize: {doc}"}]
)
return response.choices[0].message.contentHvad du ser i hvert dashboard
Begge dashboards viser trace-hierarkier, input/output-par, latency-opdeling og token-tællinger. LangSmiths dashboard er mere poleret visuelt, trace-træet er lettere at navigere i, og filtreringen er mere intuitiv. Langfuses dashboard er funktionelt og bliver bedre med hver release, men LangSmith har et forspring, når det gælder UI-polering.
Den afgørende tekniske forskel: Langfuse v3-traces er OpenTelemetry-spans under motorhjelmen. Hvis dit team allerede bruger OTEL til backend-observability (Jaeger, Grafana Tempo, Honeycomb), passer Langfuse-traces lige ind i din eksisterende stack. LangSmith bruger sit eget proprietære tracing-format.
Dom: Langfuse vinder til framework-agnostiske projekter. LangSmith vinder, hvis du er helt inde i LangChain. Hvis du bruger LangChain og ønsker zero-config tracing, er LangSmith ægte nemmere. Til alt andet, OpenAI SDK, Pydantic AI, Vercel AI SDK, brugerdefinerede opsætninger, er Langfuse mere fleksibelt.
Evaluering og Evals
LLM-evals besvarer spørgsmålet: "Er min LLM-output faktisk god?" Det er her, de to platforme divergerer mest skarpt.
| Funktion | Langfuse | LangSmith |
|---|---|---|
| Indbyggede evaluatorer | Begrænset (scoring, annotation) | Omfattende (nøjagtighed, relevans, troskab) |
| LLM-as-Judge-skabeloner | Manuel opsætning | Indbyggede skabeloner |
| Datasætstyring | Grundlæggende | Fuld CRUD + versionering |
| Eksperiment-sporing | Via scoring | Native eksperiment-kørsler med sammenligninger |
| Menneskelig annotation | Ja (UI-baseret) | Ja (UI-baseret) |
| Integration af eksterne evals | God (webhook-baseret) | God (API-baseret) |
| CI/CD Eval-automatisering | Mulig, men DIY | Indbygget med evaluate()-funktionen |
LangSmiths evalueringssystem er ægte mere modent. Du kan oprette et datasæt, køre din agent imod det og få nøjagtigheds-/relevansscores på få linjer kode. Funktionen evaluate() integreres med CI/CD-pipelines, så du kan blokere deployment, når eval-scores falder. For dybere dækning af evalueringsmetoder, se hvordan LLM-evaluering fungerer.
Langfuses tilgang er mere DIY; du kan score traces via UI eller API, opsætte annotations-workflows til menneskelig gennemgang og integrere eksterne eval-frameworks. Det virker, men det kræver mere glue code.
Dom: LangSmith har et ægte forspring i indbyggede evalueringsværktøjer. Hvis evals er din højeste prioritet, gør LangSmith det lettere out of the box. Langfuse kan komme derhen, men du skal skrive mere brugerdefineret kode.
Prompt Management
Begge platforme lader dig versionere prompts, teste dem i en playground og deploye ændringer uden kode-deployments.
Langfuse tilbyder prompt-versionering med en playground, der fungerer med enhver udbyder. Du gemmer prompts i Langfuse, henter dem via SDK'et i runtime og ruller tilbage, hvis en ny version performer dårligere. Det er ligetil og framework-agnostisk.
LangSmith har LangChain Hub til deling og versionering af prompts samt en playground med model-switching (prøv den samme prompt mod GPT-4o og Claude side om side). Playgrounden er lidt mere poleret med bedre auto-complete og formatering.
Begge er capable for de fleste teams. Valget her følger normalt den bredere platformbeslutning.
Dom: Begge er capable. LangSmiths playground er lidt mere poleret; Langfuses er mere fleksibel med ikke-LangChain-opsætninger.
Framework-integrationer, udover LangChain
Det er her, Langfuse trækker afgørende fra for teams, der ikke bruger LangChain.
| Framework | Langfuse | LangSmith | Noter |
|---|---|---|---|
| LangChain / LangGraph | Native | Native | Begge er fremragende her |
| OpenAI SDK | Drop-in wrapper | @traceable manuel | Langfuse er nemmere |
| Pydantic AI | Native integration | Ingen integration | Kun Langfuse |
| Vercel AI SDK | Native integration | Ingen integration | Kun Langfuse |
| LlamaIndex | Native callback | Grundlæggende via API | Langfuse er rigere |
| Anthropic SDK | Via decorator | @traceable manuel | Lignende indsats |
| CrewAI | Community-integration | Via LangChain | Indirekte for begge |
| OpenAI Agents SDK | Via decorator | Via LangChain-bro | Langfuse mere direkte |
Hvis du vælger mellem disse frameworks i 2026, bruger mange teams Pydantic AI, Vercel AI SDK eller OpenAI SDK direkte, ikke LangChain. For disse teams er Langfuse den eneste platform med native integrationer. LangSmiths @traceable-decorator fungerer med alt, men det kræver manuel instrumentering. For kontekst om, hvorfor framework-valg betyder noget her, se vores LangGraph vs CrewAI-sammenligning.
Dom: Langfuse vinder afgørende for ikke-LangChain-projekter. Hvis du bruger LangChain, fungerer begge fint. Hvis du ikke gør, er Langfuse det klare valg.
Self-Hosting og Data-sovereignitet
Dette er måske den vigtigste sektion, hvis du arbejder i en virksomhed med compliance-krav.
Langfuse er MIT-licenseret og fuldt self-hostable. Du kan køre det med Docker Compose på cirka 30 minutter. Dine LLM-inputs og -outputs, som ofte indeholder følsomme kundedata, PII eller proprietær forretningslogik, forlader aldrig din infrastruktur. Infrastrukturomkostningen for et lille team er minimal: en enkelt VM med 2 vCPU, 4GB RAM og en managed PostgreSQL-instans.
LangSmith er cloud-first. Self-hosting er kun tilgængelig på Enterprise-planen, hvilket betyder custom pricing (læs: dyrt). For de fleste teams betyder LangSmith, at din trace-data, inklusive hver prompt og respons, ligger på LangChains servere.
Hvad dette betyder i praksis:
- GDPR-compliance: Hvis du behandler EU-brugerdata gennem LLM'er, holder self-hosted Langfuse disse data i din EU-region. LangSmith cloud router gennem US-servere, medmindre du er på Enterprise.
- HIPAA: Sundhedssektoren, der bruger LLM'er, kan ofte ikke sende patientrelaterede data til tredjeparts clouds. Self-hosted Langfuse løser dette.
- IP-beskyttelse: Hvis dine prompts indeholder proprietær forretningslogik, betyder self-hosting, at de aldrig forlader dit netværk.
For en estimeret infrastrukturomkostning: En self-hosted Langfuse-instans til et 10-personers team kører på omkring $50-100/md. i cloud-infrastruktur (lille VM + managed Postgres). Sammenlign det med cloud-priserne nedenfor.
Dom: Langfuse vinder med længder inden for self-hosting. Hvis data-sovereignitet betyder noget, er der intet reelt alternativ.
Dybdegående prisgennemgang: Reelle omkostninger i 3 skalaer
Lad os tale faktiske tal. Begge platforme har gratis tiers, men omkostningerne divergerer hurtigt, efterhånden som du skalerer.
Prismodeller forklaret
Langfuse tager betaling per "observation" (hver trace, span eller score = 1 enhed). Cloud-pris: Gratis tier op til 50K enheder/md. Core-plan til $29/md. Pro til $199/md. Overforbrug: $8 per 100K enheder.
LangSmith tager betaling per trace med tiered retention. Cloud-pris: Gratis Developer-tier op til 5K traces/md. Plus-plan til $39/sæde/md. med 10K basis-traces. Overforbrug: $2,50 per 1K traces (14-dages retention) eller $5,00 per 1K traces (400-dages retention).
Omkostninger i tre skalaer
| Skala | Langfuse Cloud | Langfuse Self-hosted | LangSmith Plus (1 sæde) |
|---|---|---|---|
| Solo dev (10K traces/md.) | $0 (gratis tier) | ~$50/md. (infra) | $39/md. |
| Team på 5 (100K traces/md.) | ~$69/md. (Core + overage) | ~$75/md. (infra) | ~$420/md. ($39x5 + trace overage) |
| Startup (1M traces/md.) | ~$919/md. (Pro + overage) | ~$150/md. (infra) | ~$2.500+/md. (sædeomkostninger + trace overage) |
Priser verificeret april 2026. LangSmith-omkostninger antager 14-dages retention; 400-dages retention fordobler omtrent trace-omkostningerne. Langfuse self-hosted-omkostninger er kun infrastruktur (VM + managed PostgreSQL).
Gablen bliver dramatisk større ved skalering. Ved 1M traces er Langfuse Cloud omtrent en tredjedel af LangSmiths omkostning, og self-hosted Langfuse er en brøkdel af begge.
"Monthly Cost: Langfuse vs LangSmith"
Datatable
| "Usage Tier" | "Langfuse Cloud" | "Langfuse Self-hosted" | "LangSmith Plus" |
|---|---|---|---|
| "Solo (10K)" | 0 | 50 | 39 |
| "Team (100K)" | 69 | 75 | 420 |
| "Startup (1M)" | 919 | 150 | 2500 |
Fordelen ved self-hosted omkostninger
Self-hosting af Langfuse er, hvor økonomien bliver interessant. Når du har infrastrukturen kørende, er selve softwaren gratis (MIT-licens). Din eneste løbende omkostning er VM'en og databasen. For teams med 1M+ traces sparer self-hosting tusindvis af dollars om måneden sammenlignet med enten cloud-mulighed.
Dom: Langfuse er billigere i alle skalaer, og self-hosting gør det stort set gratis udover infrastrukturomkostninger. LangSmiths per-sæde-prissætning løber hurtigt op for teams.
Langfuse v3 og OpenTelemetry: Hvad ændrede sig
De fleste Langfuse vs LangSmith-sammenligninger på nettet blev skrevet før Langfuse v3. Her er hvad der ændrede sig, og hvorfor det betyder noget.
Langfuse v3 genopbyggede SDK'et omkring OpenTelemetry, CNCF-bakket open standard for distributed tracing. I praksis betyder dette:
- Hvis dit team allerede bruger OTEL (Jaeger, Grafana, Datadog) til backend-observability, vises Langfuse-traces i de samme værktøjer. Intet separat dashboard til LLM-traces.
- Bedre ydeevne: OTEL's batched exporter er mere effektiv end v2 SDK'ets custom transport.
- Større integrationsoverflade: Ethvert framework, der producerer OTEL-spans, kan feedes ind i Langfuse, ikke kun frameworks med dedikerede Langfuse-integrationer.
- Migration fra v2:
@observe-decorator-API'en ændrede sig ikke. Under motorhjelmen producerer den nu OTEL-spans. Det meste v2-kode fungerer uændret.
LangSmith har begrænset OTEL-support; du kan eksportere nogle data til OTEL-kompatible backends, men det er ikke native. Tracing-formatet er proprietært.
For teams med modne observability-praksis er dette en betydelig arkitektonisk fordel. At kombinere LLM-traces med backend-request-traces i et enkelt værktøj eliminerer kontekstskift og gør det lettere at debugge end-to-end latency-problemer.
Dom: Langfuse v3's OTEL-arkitektur er en betydelig fordel for teams med eksisterende observability-stacks.
Hvem bør vælge hvad? Beslutningsramme
| Hvis du har brug for... | Vælg | Hvorfor |
|---|---|---|
| LangChain/LangGraph native tracing | LangSmith | Zero-config auto-tracing, dybeste integration |
| Self-hosting / data-sovereignitet | Langfuse | MIT-licens, Docker Compose på 30 minutter |
| Framework-agnostisk observability | Langfuse | Native integrationer til 10+ frameworks |
| Bedste evalueringsværktøjer | LangSmith | Indbyggede evaluatorer, eksperiment-sporing, CI/CD evals |
| Budgetbevidst / startup | Langfuse | Billigere i alle skalaer, gratis self-hosted mulighed |
| Enterprise-compliance (GDPR, HIPAA) | Langfuse (self-hosted) | Dine data, din infrastruktur, MIT-licens |
| Eksisterende OpenTelemetry-stack | Langfuse | Native OTEL siden v3 |
| Poleret dashboard og UI | LangSmith | Mere moden UI, bedre filtrering |
Værd at nævne: Helicone, Braintrust og Arize Phoenix er andre spillere i dette rum. Helicone er et stærkt alternativ til teams, der ønsker en proxy-baseret tilgang til observability. Braintrust fokuserer på evals. Arize bringer ML-observability-ekspertise. Tjek vores fulde rangering af AI-observability-platforme for et bredere overblik.
Endelig dom
| Kategori | Vinder | Nøgleårsag |
|---|---|---|
| Licens & Åbenhed | Langfuse | MIT open-source vs. proprietær |
| Self-Hosting | Langfuse | Eneste reelle mulighed for data-sovereignitet |
| Pris | Langfuse | Billigere i alle skalaer |
| LLM Tracing | Uafgjort | Begge fremragende, forskellige styrker |
| Evalueringsværktøjer | LangSmith | Mere modne indbyggede evals |
| Prompt Management | Uafgjort | Begge capable |
| Framework-integrationer | Langfuse | 10+ native integrationer vs. LangChain-fokuseret |
| OpenTelemetry | Langfuse | Native OTEL i v3 |
| Dashboard UI | LangSmith | Mere poleret, bedre UX |
| Community/Økosystem | LangSmith | Større LangChain-økosystem |
Samlet set: For de fleste teams i 2026 er Langfuse det bedre standardvalg. Det er open-source, billigere, framework-agnostisk og self-hostable. Det eneste scenarie, hvor LangSmith er klart bedre: Du er dybt integreret i LangChain/LangGraph OG har brug for LangSmiths overlegne evalueringsværktøjer OG data-sovereignitet er ikke en bekymring.
Når det er sagt, udvikler begge værktøjer sig hurtigt. Langfuses eval-capabilities bliver bedre, og LangSmiths framework-support udvides. Prøv begge gratis tiers, før du binder dig; Langfuse giver dig 50K gratis observationer om måneden, og LangSmith giver dig 5K gratis traces. Kør din faktiske workload gennem begge og beslut baseret på din oplevelse, ikke kun feature-tabeller.
FAQ
Er Langfuse et godt alternativ til LangSmith?
Ja, for de fleste use cases. Langfuse er open-source, billigere ved skalering, framework-agnostisk og self-hostable. Det hovedområde, hvor LangSmith stadig fører, er indbyggede evalueringsværktøjer. Hvis evals er din primære bekymring, så evaluer begge. Til alt andet er Langfuse et stærkt alternativ.
Hvad er forskellen mellem Langfuse og LangSmith?
Kernforskellen er filosofi: Langfuse er MIT open-source, framework-agnostisk og self-hostable. LangSmith er proprietær, optimeret til LangChain/LangGraph og cloud-first. Begge tilbyder LLM-tracing, omkostningssporing og prompt management, men de tjener forskellige engineering-kulturer.
Kan jeg self-hoste Langfuse i stedet for at bruge LangSmith?
Ja. Langfuse er MIT-licenseret og har en Docker Compose-deployment, der tager cirka 30 minutter. Du har brug for en VM og en PostgreSQL-database. Self-hosting betyder, at din LLM-trace-data (prompts, responses, brugerdata) aldrig forlader din infrastruktur, hvilket er afgørende for GDPR, HIPAA og IP-beskyttelse.
Hvordan sammenlignes Langfuse-priser med LangSmith?
Langfuse er billigere i alle skalaer. Ved 100K traces/md. koster Langfuse Cloud omkring $69/md. vs. LangSmiths $420/md. (team på 5 sæder). Ved 1M traces udvides gablen yderligere. Self-hosted Langfuse koster kun infrastruktur ($150/md.), uanset trace-volumen.
Fungerer Langfuse med andre frameworks end LangChain?
Ja, det er en af dets største fordele. Langfuse har native integrationer til OpenAI SDK, Pydantic AI, Vercel AI SDK, LlamaIndex, Anthropic SDK og mere. LangSmith fungerer bedst med LangChain; andre frameworks kræver manuel @traceable-instrumentering.
Hvilken er bedre til LLM-evaluering, Langfuse eller LangSmith?
LangSmith har fordelen. Det tilbyder indbyggede evaluatorer (nøjagtighed, relevans, troskab), LLM-as-judge-skabeloner, native eksperiment-sporing og CI/CD-integration via evaluate(). Langfuses eval-tilgang er mere manuel, med annotation-scoring og integration af eksterne evals, der kræver mere brugerdefineret kode.
Er LangSmith open source?
Nej. LangSmith er proprietær software, der tilbydes som en cloud-service, med self-hosting kun tilgængelig på Enterprise-planen (custom pricing). Langfuse er MIT-licenseret open-source; du kan inspicere, modificere og self-hoste koden frit.
Kan jeg migrere fra LangSmith til Langfuse?
Ja. Begge platforme bruger lignende koncepter (traces, spans, scoring), så den mentale model overføres. Du skal bytte SDK-integrationer (@traceable til @observe) og rekonfigurere miljøvariabler. Der er intet one-click migrationsværktøj, men indsatsen er normalt et par timer for et typisk projekt.
Hvad er Langfuse v3, og hvad ændrede sig?
Langfuse v3 genopbyggede SDK'et omkring OpenTelemetry (OTEL), CNCF-bakket tracing-standard. Dette betyder bedre ydeevne, native integration med eksisterende OTEL-værktøjer (Grafana, Jaeger, Datadog) og en bredere integrationsoverflade. @observe-decorator-API'en forblev den samme, så migration fra v2 er ligetil.
Er der alternativer til både Langfuse og LangSmith?
Ja. Helicone er et proxy-baseret observability-værktøj med en stærk developer experience. Braintrust fokuserer tungt på evalueringer og datasæt. Arize Phoenix bringer ML-observability-ekspertise til LLM'er. Hver har en anden styrke; tjek hvad der betyder mest for dit team, før du vælger.