Techsy
Kontakt
Kom i gang
Tilbage til blog
comparisons

De Bedste Open Source LLM-evalueringsframeworks i 2026 (Et Er Faktisk Ikke Open Source)

Skrevet af Mert Batur
Aug 4, 2026
16 minutters læsning
Indholdsfortegnelse
De Bedste Open Source LLM-evalueringsframeworks i 2026 (Et Er Faktisk Ikke Open Source)

De Bedste Open Source LLM-evalueringsframeworks i 2026 (Et Er Faktisk Ikke Open Source)

Linje 1 i LICENSE-filen i Arize Phoenix-repoet lyder "Elastic License 2.0 (ELv2)". Ikke Apache. Ikke MIT. Et stærkt anbefalet open source LLM-evalueringsframework er ikke open source ifølge OSI's definition, og næsten hver side, der ranker for denne søgning, gentager alligevel påstanden. Det gjorde en af vores også, indtil i dag. Den 2026-08-04 læste vi licensfilen og default-branch commit-loggen for otte frameworks i hånden, plus tre mere som de øverste sider stadig anbefaler, og installerede derefter seks og kørte de samme 10 cases gennem hver. Vi sælger ikke et eval-framework, så ingen dom herunder beskytter et produkt.

Vigtigste pointer

  • Arize Phoenix kører under Elastic License 2.0, som OSI ikke godkender som open source.
  • UpTrains sidste commit til main var 2024-07-29. Start ikke et nyt projekt på det.
  • pip install promptfoo giver en tredjeparts-wrapper. Det rigtige projekt ligger på npm.
  • Ragas har ingen commits siden 2026-02-24 og skiftede GitHub-organisation til vibrantlabsai.

Hvilket Open Source LLM-evalueringsframework Bør Du Installere i 2026?

Vælg efter begrænsning, ikke efter rangering. For pytest-formede assertions inde i en eksisterende testpakke: installer DeepEval. For en YAML-konfiguration og en CLI, der passer til enhver sprogstak: installer promptfoo. For den reneste adskillelse mellem gode og dårlige svar, vi målte: installer Opik. Alle tre er Apache-2.0 eller MIT.

Her er revisionen. Otte frameworks i omfanget, plus tre mere som de øverste sider for denne søgning stadig anbefaler.

FrameworkLicens (verificeret pr. 2026-08-04)Sidste releaseSidste commit til mainInstallationInterface-formBedst tilSkifteomkostning
DeepEvalApache-2.0v4.1.5 (2026-07-29)2026-08-03pip install deepevalpytest-lignende assertionsat porte en Python-testpakkelav, metrikker er almindelige objekter
PromptfooMIT0.121.20 (2026-07-31)2026-08-04npm install promptfooYAML-konfiguration plus CLIsprogagnostisk prompt-testningmellem, konfigurationsformatet er promptfoo-specifikt
OpikApache-2.02.2.17 (2026-08-04)2026-08-04pip install opikselvstændige .score()-kalden brugbar score på færrest linjerlav, metrikker kører uden platformen
Arize PhoenixElastic License 2.0, ikke OSI-godkendtv19.15.0 (2026-08-03)2026-08-04pip install arize-phoenix-evalsprækonfigurerede evaluatorer over en dataframebinære pass/fail-labelslav for evals, licensbundet hvis du videresælger det
RagasApache-2.0v0.4.3 (2026-01-13)2026-02-24pip install ragasasynkron evaluate() over et datasætRAG-retrieval-metrikkerlav, rækker er almindelige dicts
EvidentlyApache-2.0v0.7.21 (2026-03-10)2026-05-02pip install evidentlydescriptors plus en HTML-rapportbatch-rapportering over mange rækkerhøj, score-skalaen er vendt om
Inspect AIMIT0.3.252 (2026-08-04)2026-08-04pip install inspect-aiPython-taskfiler plus CLIbenchmarking af en modelhøj, tasks er Inspect-specifikke
GiskardApache-2.02.19.2 på PyPI (2026-07-06), v2-linjen2026-08-04pip install giskardscan-APIautomatiserede sårbarhedsscanningermellem, scan-output er Giskard-specifik
lm-evaluation-harnessMITv0.4.12 (2026-05-11)2026-07-13pip install lm-evalCLI over task-definitionerstandard model-benchmarkshøj, task-definitioner er harness-specifikke
UpTrainApache-2.0v0.7.1 (2024-05-14)2024-07-29pip install uptrainPython check-operatorerintet vi ville starte i dagikke relevant
Deepchecksikke registreret af GitHub0.19.1 (2024-12-15)2025-11-24pip install deepcheckssuite- og check-objektertabel- og ML-valideringhøj, suites er Deepchecks-specifikke

Datoerne er sidste commit på hvert projekts default branch pr. 2026-08-04. GitHubs repo-side viser sidste push til enhver branch, hvilket er senere for to projekter her: UpTrain 2024-08-18 og Deepchecks 2025-12-28. Ingen af repoerne er arkiveret.

Skifteomkostnings-kolonnen er den, folk springer over og fortryder bagefter. Scorer er bare tal, så at flytte mellem DeepEval, Ragas, Opik og phoenix-evals betyder for det meste bare at omskrive en løkke. At flytte væk fra promptfoo eller Inspect AI betyder at omskrive et konfigurations- eller task-format uden nogen ækvivalent andre steder, og at flytte væk fra Evidently betyder at revidere hver eneste tærskel, du har skrevet, fordi skalaen løber den anden vej. To af de frameworks, de øverste sider stadig anbefaler, har ikke sendt en release siden 2024.

Vil du have tiers, hostede platforme og en direkte rangering i stedet? Det er en anden opgave, og vi har allerede gjort det i vores rangerede sammenligning af LLM-evalueringsværktøjer inklusive betalte platforme.

De Otte LLM-evalueringsframeworks, Grupperet Efter Hvordan Du Installerer Dem

Installationsformen er det, du skal leve med, så det er grupperingen.

Python-biblioteker, du importerer i dine tests

DeepEval (pip install deepeval, Apache-2.0) pakker LLM-metrikker ind i pytest-formede assertions: byg en LLMTestCase, giv den til assert_test, og testen fejler under din tærskel. Bedst til at placere en kvalitetsport ved siden af de enhedstests, et team allerede kører. Vælg denne, hvis dine evals hører hjemme i samme CI-job som alt andet.

Én oplysning, nævnt én gang: DeepEval er bygget af Confident AI, som er en betalt partner på to andre indlæg på dette site, inklusive den rangerede sammenligning, denne side linker til. Det får ingen særbehandling her, og hvert DeepEval-link på denne side peger på GitHub-repoet.

Ragas (pip install ragas, Apache-2.0) er den RAG-specifikke løsning: evaluate() tager rækker med spørgsmål, kontekst og svar og returnerer scores pr. metrik asynkront. Bedst til retrieval-kvalitetsmåling inde i en Python-pipeline. Dets repo flyttede fra explodinggradients til vibrantlabsai, den sidste release var v0.4.3 den 2026-01-13, og der er ingen commits siden 2026-02-24. Vælg denne, hvis RAG-metrikker er hele opgaven, og et stille repo er acceptabelt, og se den bredere RAG-værktøjsstak.

Opik (pip install opik, Apache-2.0, fra Comet) leverer metrikker, du kan kalde helt alene. Sæt OPIK_TRACK_DISABLE=true, og AnswerRelevance().score() kører uden konto, uden lokal server og uden konfigurationsfil, hvilket produktbeskrivelsen ikke reklamerer med. Bedst til at få en reel score på færrest linjer. Vælg denne, hvis du vil have metrikker nu og måske platformen senere.

Evidently (pip install evidently, Apache-2.0) behandler evals som descriptors over et datasæt og skriver en HTML-rapport som en sideeffekt. Bedst til batch-rapportering på tværs af mange rækker snarere end en binær port. Dets LLM-scores er vendt om: 1.0 betyder useriøst/urigtigt (unfaithful). Vælg denne, hvis det, du skylder nogen, er en delbar rapport, ikke et rødt build.

Giskard (pip install giskard, Apache-2.0) scanner en model for sårbarheder i stedet for at score et datasæt, du selv har skrevet. PyPI-pakken løser v2-linjen, og projektets egen README fastslår, at v2 "ikke længere vedligeholdes aktivt". Bedst til automatiserede red-team-lignende scanninger. Vælg denne, hvis du vil have sårbarheder fundet for dig i stedet for LLM-as-a-judge-metrikker, du selv definerer.

CLI- og konfigurationsværktøjer, du kører mod en YAML-fil

promptfoo (npm install promptfoo, MIT) er en CLI, der læser en YAML-fil: deklarer providers, testcases og assertions, kør npx promptfoo eval, og få pass/fail pr. case plus en lokal resultat-UI. Bedst til at evaluere prompts, når din app ikke er skrevet i Python. Vælg denne, hvis din kvalitetsport skal være en konfigurationsfil, en ikke-Python-kollega kan redigere.

Harness-klasse og platformsbundtet

Inspect AI (pip install inspect-ai, MIT) kommer fra det britiske AI Safety Institute og evaluerer modeller mod tasks, du definerer i Python, med rigtige solver- og scorer-abstraktioner og en run viewer. Bedst til model-niveau benchmarking med reproducerbare task-definitioner. Vælg denne, hvis det, der testes, er en model snarere end din applikation.

Arize Phoenix (pip install arize-phoenix-evals) giver dig prækonfigurerede evaluatorer som FaithfulnessEvaluator og CorrectnessEvaluator, der returnerer en binær label plus en score. Bedst til deterministiske labels, du kan porte på uden at vælge en cutoff selv. Licensen er grunden til, at denne artikel har en parentes i titlen, og det får sit eget afsnit lige nedenfor.

Er Arize Phoenix Open Source?

Nej, ikke ifølge den definition, Open Source Initiative vedligeholder. Arize Phoenix kører under Elastic License 2.0 (ELv2). Linje 1 i repoets LICENSE-fil siger det, og PyPI erklærer uafhængigt license: Elastic-2.0 på v19.15.0. Kildekoden er læsbar, kan forkes og kan self-hostes. Én brug er begrænset.

Den begrænsning, der betyder noget: ELv2 forbyder at levere softwaren til tredjeparter som en hostet eller managed service. Læs det nøje, for det binder langt færre end det lyder til. Hvis du installerer arize-phoenix-evals for at score din egen applikation, rører ELv2 dig aldrig. Hvis du er et konsulenthus eller et platformsteam, der pakker Phoenix ind i en eval-service, du sælger til eksterne kunder, gør den. Det er hele forskellen, og Open Source Definition er det, ELv2 ikke opfylder, specifikt klausulerne om begrænsninger på anvendelsesområde (field-of-use).

LicensOSI-godkendt?Kan du self-hoste?Kan du tilbyde den som en managed service?Frameworks på denne liste
Apache-2.0jajajaDeepEval, Ragas, Opik, Evidently, Giskard, UpTrain
MITjajajapromptfoo, Inspect AI, lm-evaluation-harness
Elastic License 2.0nejjanejArize Phoenix

Hver side, der aktuelt ranker for denne søgning, sætter Phoenix under "open source", og det gjorde vi også. Vores egen rangerede sammenligning af LLM-evalueringsværktøjer beskriver Phoenix som fuldt open source, hvilket er forkert, og det bliver rettet. Phoenix er source-available, ikke open source, og forskellen betyder kun noget, hvis du planlægger at sælge den som en service. Hvis det, du reelt har brug for, er tracing snarere end scoring, hører det til under AI-observabilitetsplatforme, ikke her.

Hvilke af Disse Vedligeholdes Stadig Aktivt?

De fleste af dem. Seks af de elleve repos, vi tjekkede, fik en commit til main den 2026-08-03 eller 2026-08-04: DeepEval, promptfoo, Opik, Arize Phoenix, Inspect AI og Giskard. To har ikke sendt en release siden 2024. Et er gået stille i 2026 efter et skift af GitHub-organisation.

Frameworks vi ikke ville starte et nyt projekt på i 2026

UpTrain er dødt. Dets sidste commit til main landede den 2024-07-29, og dets sidste release, v0.7.1, var 2024-05-14, hvilket gør det to år koldt på begge mål. Repoet er stadig der og stadig Apache-2.0, så intet stopper dig, men at starte nyt arbejde på et forladt evalueringsbibliotek er en beslutning, du senere skal forklare.

Deepchecks fortjener den præcise version. Fakta er: "no release since 0.19.1 on 2024-12-15, though the repo still receives commits, last one on main 2025-11-24". "People are still working on it"; ingen har cuttet en version på over atten måneder. Hverken UpTrain eller Deepchecks er arkiveret på GitHub, og ingen af dem er lukket for bidrag.

Ragas får datoer og intet andet. Sidste release v0.4.3 den 2026-01-13, ingen commits siden 2026-02-24, og repoet flyttede fra explodinggradients til vibrantlabsai. Vi fandt ingen verificerbar forklaring på, hvorfor organisationen skiftede, så vi opfinder ikke en. Et stille repo er ikke det samme som et ødelagt et: Apache-2.0-kode, der beregner en faithfulness-score i dag, beregner den også næste år. Eksponeringen ligger i upatchede afhængigheder, hvilket var præcis det, der bed os i testen nedenfor.

Andre sider på side ét for denne søgning anbefaler stadig både UpTrain og Deepchecks, uden nogen dato knyttet til anbefalingen. Et framework uden release siden december 2024 er en afhængighedsbeslutning, ikke en funktionsbeslutning.

Har Du Brug for et Eval-framework eller en Eval-harness?

Et applikations-eval-framework scorer din apps egne outputs mod dine egne data. DeepEval, Ragas, promptfoo, Opik, phoenix-evals og Evidently gør alle det. En model-eval-harness benchmarker i stedet en model mod standardiserede offentlige tasks. lm-evaluation-harness og Inspect AI gør det. At vælge den forkerte klasse er den dyreste fejl på denne side.

DimensionApplikations-eval-frameworkModel-eval-harness
Hvad du testerdin prompt, retrieval og outputet model-checkpoint eller endpoint
Hvad du levererdine egne spørgsmål, kontekster og svaret task-navn fra en standardpakke
Typisk outputscore pr. metrik pr. række, plus pass/failnøjagtighed på et publiceret benchmark
Hvor det kørerdin CI, ved hvert pull requesten enkeltstående kørsel pr. model eller pr. fine-tune
EksemplerDeepEval, Ragas, promptfoo, Opik, Evidently, phoenix-evalslm-evaluation-harness, Inspect AI

Fejlmønsteret er konkret. Nogen kobler lm-evaluation-harness op til at teste deres RAG-chatbot, får et sæt MMLU-scores tilbage og lærer nøjagtig ingenting om, hvorvidt deres retriever returnerer de rigtige passager. Scorerne er reelle. De måler basismodellen, som ingen var bekymret for.

Inspect AI's form følger af dets oprindelse: det blev bygget hos det britiske AI Safety Institute under MIT til evaluering af frontier-modeller, så solvers, scorers og tasks er førsteklasses, og din applikation er ikke et koncept, det har. Det er en god grund til at bruge det til det, det er til. Hvis dit problem er agenter snarere end enkelte turer, er evaluering af agenter i produktion en helt anden disciplin, og værktøjskaldende servere får deres egen behandling i vores guide til evaluering af MCP-servere og værktøjer.

Hvad Skete Der, Da Vi Installerede Seks af Dem og Kørte de Samme 10 Cases

Den 2026-08-04 installerede vi seks af disse i friske Python 3.11.14-venvs (plus npm til promptfoo) og scorede et identisk 10-punkts RAG-sæt med én dommer, openai/gpt-4o-mini gennem OpenRouter ved temperatur 0. Syv punkter var korrekte. Tre var ødelagte på tre forskellige måder: et modsiger sin kontekst, et opfinder detaljer, et er flydende prosa, der aldrig besvarer spørgsmålet. Hvert framework kørte to gange i træk.

Framework (10 punkter, dommer openai/gpt-4o-mini, kørsel 2026-08-04)InstallationLinjer til første scoreKørselstid, kørsel 1 / kørsel 2Defekter fanget på grounding-metrikkenPunkter, der drev over 2 kørsler
DeepEval 4.1.526.6 s21126.8 s / 134.1 s2 af 3, sprang det irrelevante svar over0 af 10
Ragas 0.4.356.1 s plus en versionspinning2321.2 s / 25.7 s3 af 31 af 10
promptfoo 0.121.20337.9 s14 plus 40 datasæt34.3 s / 44.4 s3 af 32 af 10
Opik 2.2.17142.3 s1554.1 s / 44.8 s3 af 34 af 10
Phoenix evals 3.3.08.7 s1841.2 s / 44.0 s3 af 30 af 10
Evidently 0.7.2142.6 s plus openai259.9 s / 9.7 s3 af 34 af 10

Fem af seks grounding-metrikker fangede alle tre defekter. De tre fund nedenfor er grunden til, at dette afsnit findes.

Relevans-metrikker er ikke kvalitetsmetrikker, og to af dem gav en selvsikker løgn en højere score end et korrekt svar. Ragas ResponseRelevancy scorede punktet, der hævder, at HTTP 404 er en 5xx-serverfejl, til 0.777, over to af de syv korrekte svar, og punktet med opfundne rate limits til 0.813, over fire. promptfoo answer-relevance gjorde det samme: 0.800 for 404-punktet, en klar bestået mod en 0.7-tærskel, mens det korrekte q01 fejlede ved 0.679. Ikke en fejl. Et selvsikkert forkert svar adresserer spørgsmålet perfekt. Men hvis relevans er tallet på dit dashboard, ligner en flydende hallucination dit bedste output.

En faithfulness-only-port overser det irrelevante svar. DeepEval scorede punktet, der aldrig besvarer spørgsmålet, til 1.000 faithfulness, en klar bestået, hvilket er forsvarligt: et svar, der ikke hævder noget om konteksten, modsiger heller ikke noget i den. Kun relevancy fangede det, ved 0.000. Det er den ene grounding-fejl i tabellen ovenfor. Hver enkelt metrik alene har et hul; parret dækker begge.

Binære evaluatorer var stabile ved temperatur 0. Graderede var det ikke. Phoenix og DeepEval flyttede nul af ti punkter over to identiske kørsler. Opik flyttede fire, alle på AnswerRelevance, på et 0.05-net; Evidently flyttede også fire. Ingen drift vendte en dom her, men promptfoos korrekte q01 landede på 0.679, derefter 0.642 mod en 0.700-tærskel, hvilket er formen på en ustabil CI-port.

To mindre bemærkninger: tre af seks (DeepEval, Opik, Phoenix) installerede og kørte rent første gang, mens Ragas ikke ville importere, før vi pinnede langchain-community<0.4. Kun promptfoo rapporterede dommer-token-forbrug, 16.011 assertion-tokens i kørsel 1 og 16.010 i kørsel 2.

Begrænsningerne ved dette, sagt ligeud. n = 10 er en smoke test, ikke et benchmark: det fortæller dig om ergonomi og blinde vinkler, ikke om metrik-nøjagtighed. Én dommer-model scorede alt, og en større dommer ville flytte hvert tal, formentlig inklusive de to falske positiver, DeepEval og Ragas begge producerede på samme korrekte punkt. To kørsler beviser, at drift findes, men kan ikke karakterisere den. Svarene var forudskrevne, så intet her afprøver generering, tracing eller datasæt-håndtering, hvilket får promptfoos installation på 337.9 sekunder til at se værre ud, end den fortjener. "Bedst" betyder altid bedst til en begrænsning: en CI-port, RAG-metrikker eller en UI ændrer hver især svaret, ligesom skellet mellem online og offline evaluering gør.

Det Samme Tjek, Skrevet på Tre Måder

Den hurtigste måde at vælge en interface-form på er at læse den samme assertion tre gange. Her er et grounding-tjek på ét punkt i DeepEval, Ragas og promptfoo, trimmet fra de scripts, vi faktisk kørte. Metriknavnene er forskellige; vi linker til hvordan LLM-as-a-judge-metrikker faktisk virker i stedet for at redefinere dem her.

python
# DeepEval 4.1.5: pytest-formet, fejler testen under tærsklen
from deepeval import assert_test
from deepeval.models import GPTModel
from deepeval.metrics import FaithfulnessMetric
from deepeval.test_case import LLMTestCase

judge = GPTModel(
    model="openai/gpt-4o-mini",
    base_url="https://openrouter.ai/api/v1",
    api_key=OPENROUTER_KEY,
)

def test_faithfulness():
    case = LLMTestCase(
        input=question,
        actual_output=answer,
        retrieval_context=[context],
    )
    assert_test(case, [FaithfulnessMetric(threshold=0.7, model=judge)])
python
# Ragas 0.4.3: bemærk import-stien. `from ragas.metrics import Faithfulness`
# rejser en ImportError i denne version; den konkrete metrik flyttede.
from ragas import evaluate, EvaluationDataset
from ragas.metrics._faithfulness import Faithfulness
from ragas.llms import LangchainLLMWrapper
from langchain_openai import ChatOpenAI

judge = LangchainLLMWrapper(
    ChatOpenAI(model="openai/gpt-4o-mini",
               base_url="https://openrouter.ai/api/v1")
)

result = evaluate(
    dataset=EvaluationDataset.from_list(rows),
    metrics=[Faithfulness(llm=judge)],
)
yaml
# promptfoo 0.121.20: npm install promptfoo, derefter npx promptfoo eval
providers:
  - id: echo          # vi scorede forudskrevne svar i stedet for at generere dem
defaultTest:
  assert:
    - type: context-faithfulness
      threshold: 0.7
tests:
  - vars:
      query: "Is HTTP 404 a client error or a server error?"
      context: "HTTP 404 Not Found is in the 4xx class, which denotes client errors."
      output: "HTTP 404 is a server error in the 5xx class."

Installationslinjerne bærer flere fælder end koden gør, og hver kommentar nedenfor er noget, der kostede os tid den 2026-08-04:

bash
# Det rigtige promptfoo ligger på npm. PyPI-pakken med samme navn er en
# tredjeparts-wrapper: https://pypi.org/project/promptfoo/ vs
# https://www.npmjs.com/package/promptfoo
npm install promptfoo

# pip install giskard løser v2-linjen, som projektets egen README
# markerer som ikke længere aktivt vedligeholdt.
pip install giskard

# lm-evaluation-harness installeres under pakkenavnet lm-eval.
pip install lm-eval

# Evidently trækker ikke openai med, og dommeren crasher ved kaldtidspunktet
# frem for ved importtidspunktet, efter du allerede har bygget datasættet.
pip install evidently openai

# Ragas 0.4.3 vil ikke importere mod langchain-community 0.4.x.
pip install ragas "langchain-community<0.4"

Kan Du Fejle et Build på en Eval-score?

Ja. Hvert framework her returnerer en numerisk eller binær score, og hver vil afslutte med en ikke-nul kode, når en tærskel-assertion fejler, hvilket er alt, GitHub Actions har brug for til at gøre et build rødt. At koble exit-koden op er den nemme del. At vælge en tærskel, din dommer-model ikke krydser ved et uheld, er den del, der tager en uge.

Dette er den workflow-form, vi kører, pinnet til versionerne fra vores 2026-08-04-test:

yaml
name: evals
on: [pull_request]

jobs:
  eval:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v4
      - uses: actions/setup-python@v5
        with:
          python-version: "3.11.14"
      - run: pip install deepeval==4.1.5

      - name: Score the golden set
        env:
          # Pin dommeren. En modelopgradering midt i kvartalet flytter hvert tal.
          JUDGE_MODEL: openai/gpt-4o-mini
          # Tærskler bor ét sted, læst af metrik-konstruktørerne.
          EVAL_THRESHOLD: "0.7"
          OPENROUTER_API_KEY: ${{ secrets.OPENROUTER_API_KEY }}
        run: deepeval test run tests/evals/

To faldgruber bider, før tærsklen gør. For det første er dommer-kald netværkskald: vores 10-punkts DeepEval-kørsel tog 126.8 sekunder, fordi .measure() er sekventiel, og et 200-punkts golden set på den kodesti er en kaffepause ved hvert pull request. Ethvert andet framework i testen paralleliserer som standard, hvilket er den enkelt største håndtag for CI-ventetid.

For det andet, flakiness. Ved temperatur 0 flyttede Opik og Evidently hver fire af ti punkter mellem kørsler i træk, og promptfoos korrekte svar sad på 0.679, derefter 0.642 mod en 0.700-port. Afbødningerne er kedelige, og de virker: kør et fast golden dataset, der kun ændrer sig pr. pull request, pin dommer-modellen, foretræk binære evaluatorer, hvor en label er nok, og port på en delta snarere end en absolut bund. Det sidste betyder mest for multi-turn-evaluering, hvor én samtale producerer mange scores, der hver kan svinge.

For skalaperspektiv: LangChains State of Agent Engineering-undersøgelse (1.340 svar, indsamlet 18. november til 2. december 2025, publiceret 12. juni 2026) fandt, at 89% af organisationerne har implementeret en eller anden form for observability til deres agenter, mens kun 52.4% kører offline-evalueringer på testsæt. At overvåge er almindeligt. At porte er det ikke.

Hvad Vi Ville Installere Denne Uge

Fire ting at tage med. Arize Phoenix er source-available under Elastic License 2.0 og er ikke OSI-godkendt open source, hvilket ændrer intet for de fleste læsere og alt, hvis du videresælger eval-værktøjer. UpTrain er dødt, og sider uden dato anbefaler det stadig. Deepchecks har heller ikke cuttet en release siden december 2024, selvom dets repo stadig tager imod commits. En grounding-metrik og en relevans-metrik har hver et hul, den anden dækker, så port på begge. Og graderede scores driver ved temperatur 0, så pin din dommer og giv tærskler plads.

Hvis jeg skulle starte en ny eval-pakke denne uge, ville jeg installere DeepEval til CI-porten, fordi assertions hører hjemme ved siden af tests (oplysning ovenfor), og tilføje Opiks selvstændige metrikker for den reneste adskillelse, vi målte. Hvis vores stak ikke var Python, promptfoo i stedet, uden tøven. Hvis du hellere vil have, at nogen andre kobler golden set'et og workflowet op, er det en samtale, vi gerne tager.

Ofte Stillede Spørgsmål

Hvad er det bedste open source LLM-evalueringsframework?

Der er ikke én vinder, kun en bedste pasform pr. begrænsning. For en pass/fail-port inde i en Python-testpakke: DeepEval. For en sprogagnostisk YAML- og CLI-opsætning: promptfoo. For RAG-retrieval-metrikker: Ragas, hvis du kan acceptere et repo uden commits siden 2026-02-24. For den reneste adskillelse mellem gode og dårlige svar i vores 2026-08-04-test: Opik.

Er Arize Phoenix open source?

Ikke ifølge Open Source Initiatives definition. Arize Phoenix kører under Elastic License 2.0, som PyPI erklærer som license: Elastic-2.0 på v19.15.0, og som linje 1 i repoets LICENSE-fil siger direkte. Den er source-available: du kan læse, forke, modificere og self-hoste den. Den ene begrænsning er at tilbyde softwaren til tredjeparter som en hostet eller managed service.

Vedligeholdes Ragas stadig?

De verificerbare fakta, pr. 2026-08-04: den sidste release var v0.4.3 den 2026-01-13, der har ikke været commits siden 2026-02-24, og repoet flyttede fra organisationen explodinggradients til vibrantlabsai. Repoet er ikke arkiveret. Vi fandt ingen pålidelig offentlig forklaring på organisationsskiftet og spekulerer ikke i en. Apache-2.0-koden kører stadig; eksponeringen ligger i upatchede afhængigheder.

Har jeg brug for et eval-framework eller en observability-platform?

Begge dele, med tiden, men de besvarer forskellige spørgsmål. Et eval-framework fortæller dig, om en ændring gjorde dine outputs bedre eller dårligere, før du shipper den, på et datasæt, du kontrollerer. En observability-platform fortæller dig, hvad der faktisk skete i produktion, efter du shippede. Start med eval-frameworket, hvis du har en CI-pipeline; se AI-observabilitetsplatforme for produktionssiden.

Kan jeg køre LLM-evals i CI/CD?

Ja. Hvert framework dækket her afslutter med en ikke-nul kode ved en fejlet tærskel-assertion, hvilket er alt, et GitHub Actions-job har brug for. De praktiske begrænsninger er ventetid på uret (dommer-kald er netværkskald, og vores sekventielle DeepEval-kørsel tog 126.8 sekunder for 10 punkter) og dommer-ikke-determinisme. Workflow-formen og afbødningerne er i CI-afsnittet ovenfor.

Hvad er forskellen mellem DeepEval og Ragas?

Interface-form og omfang, ikke kvalitet. DeepEval er pytest-formet og generel: du skriver testcases og asserter på metrik-tærskler, og det dækker applikationsoutputs af mange slags. Ragas er et RAG-specifikt bibliotek, hvis evaluate() kører asynkront over et datasæt med rækker af spørgsmål, kontekst og svar. DeepEval passer mere naturligt til en CI-port; Ragas går dybere på retrieval.

Hvorfor giver pip install promptfoo mig den forkerte pakke?

Fordi promptfoo er et Node-projekt. Det rigtige er publiceret på npm under MIT og installeres med npm install promptfoo. PyPI-pakken med samme navn er en tredjeparts-wrapper, ikke selve upstream-projektet, og at installere den er en almindelig måde at ende med at debugge en CLI, der ikke er den, dokumentationen beskriver.

Er lm-evaluation-harness et LLM-evalueringsframework?

Det er en model-evaluerings-harness, hvilket er en beslægtet, men anderledes opgave. lm-evaluation-harness (installeret som pip install lm-eval) benchmarker en model mod standardiserede offentlige tasks som MMLU. Det fortæller dig ikke, om din retrieval-pipeline returnerede den rigtige passage, fordi din applikation ikke er et koncept, det har. Se afsnittet om framework versus harness ovenfor for skellet.

Er disse frameworks gratis at bruge?

Licensmæssigt, ja. DeepEval, Ragas, Opik, Evidently og Giskard er Apache-2.0; promptfoo, Inspect AI og lm-evaluation-harness er MIT. Begge licenser tillader kommerciel brug, modifikation og videredistribution. Arize Phoenix er undtagelsen: Elastic License 2.0 tillader self-hosting, men ikke at tilbyde softwaren til tredjeparter som en managed service. Dommer-model-API-forbrug faktureres separat af din udbyder.

Tags

open source llm evalueringsframeworkdeepevalragaspromptfooarize phoenixopikllm evaluering

Del denne artikel

Relaterede artikler

Mere fra comparisons

comparisons
Jul 30, 2026

Hybridsøgning: BM25 vs. vektor (og hvorfor du har brug for begge)

BM25 finder dine SKU'er og fejlkoder; vektorsøgning finder det omskrevne spørgsmål, der aldrig bruger de præcise ord. Her er, hvordan Reciprocal Rank Fusion kombinerer begge dele, med rigtige benchmarktal fra 2025-2026 og leverandørneutral Python-kode.

13 minutters læsning minutters læsning
Læs
comparisons
Jul 21, 2026

RPA vs AI vs Hybrid: Hvilken automation vinder forretningsprocesser i 2026?

RPA følger regler, AI træffer beslutninger, og i 2026 blander den smarteste procesautomation begge dele. Denne neutrale guide giver dig et beslutningsframework, omkostninger for år 1 vs. år 3 og reelle data til at vælge RPA, AI eller hybrid.

11 min read minutters læsning
Læs
comparisons
Apr 20, 2026

Vercel blev hacket (april 2026): Den 60-minutters nødplan, som alle udviklere skal køre i dag

Vercel bekræftede et sikkerhedsbrud den 19. april 2026 — miljøvariabler, der ikke var markeret som 'følsomme', blev eksponeret. Her er præcis, hvad du skal gøre i de næste 60 minutter, med en trinvis rotationscheckliste og kommandoer til scanning af hemmeligheder.

9 min read minutters læsning
Læs
Se alle indlæg
Start dit projekt

Klar til at bygge noget ekstraoordinær?

Lad os gøre din vision til virkelighed. Vores team står klar til at hjælpe dig med at skabe software, der gør en forskel.

Book et 30 min. scopemødeSe vores arbejde

Fra biblioteket

Claude Skills

Se alle
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automatiseringer

Se alle
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Fra biblioteket

Claude Skills

Se alle
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automatiseringer

Se alle
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Tjenester

  • Entertainmentløsninger
  • Mobilapps
  • Webapplikationer

Løsninger

  • CRM-systemer
  • AI-integration
  • ERP-løsninger
  • Stemmeargenter
  • Processautomatisering
  • Cybersikkerhed

Bibliotek

  • Blog
  • Portfolio

Fællesskab

  • AI-automatiseringer
  • Claude Skills

Værktøjer

  • Pris på mobil-app
  • OpenAI / LLM API-prisreknemaskine
  • Pris på MVP
  • Pris på stemme-AI-agent

Virksomhed

  • Om
  • Partnere
  • Kontakt

Juridisk

  • Privatlivspolitik
  • Salgsbetingelser
  • Cookiepolitik

Tjenester

  • Entertainmentløsninger
  • Mobilapps
  • Webapplikationer

Løsninger

  • CRM-systemer
  • AI-integration
  • ERP-løsninger
  • Stemmeargenter
  • Processautomatisering
  • Cybersikkerhed

Bibliotek

  • Blog
  • Portfolio

Fællesskab

  • AI-automatiseringer
  • Claude Skills

Værktøjer

  • Pris på mobil-app
  • OpenAI / LLM API-prisreknemaskine
  • Pris på MVP
  • Pris på stemme-AI-agent

Virksomhed

  • Om
  • Partnere
  • Kontakt
JuridiskPrivatlivspolitikSalgsbetingelserCookiepolitik
TECHSY
© 2026 Techsy. Alle rettigheder forbeholdes.