Techsy
Kontakt
Kom igång
Tillbaka till bloggen
comparisons

Bästa öppna LLM-utvärderingsramverk 2026 (ett är faktiskt inte öppen källkod)

Skriven av Mert Batur
Aug 4, 2026
16 läsning
Innehållsförteckning
Bästa öppna LLM-utvärderingsramverk 2026 (ett är faktiskt inte öppen källkod)

Bästa öppna LLM-utvärderingsramverk 2026 (ett är faktiskt inte öppen källkod)

Rad 1 i LICENSE-filen i Arize Phoenix-repot lyder "Elastic License 2.0 (ELv2)". Inte Apache. Inte MIT. Ett flitigt rekommenderat öppen källkod LLM-utvärderingsramverk är inte öppen källkod enligt OSI:s definition, och nästan varje sida som rankar för den här sökningen upprepar påståendet ändå. Det gjorde en av våra sidor också, fram till idag. Den 2026-08-04 läste vi licensfilen och commit-loggen på standardgrenen för åtta ramverk för hand, plus tre till som topplistorna fortfarande rekommenderar, och installerade sedan sex och körde samma 10 fall genom varje. Vi säljer inget utvärderingsramverk, så ingen slutsats nedan skyddar en egen produkt.

Nyckelpunkter

  • Arize Phoenix levereras under Elastic License 2.0, en licens som OSI inte godkänner som öppen källkod.
  • UpTrains senaste commit till main var 2024-07-29. Starta inget nytt projekt med det.
  • pip install promptfoo ger dig en tredjeparts-wrapper. Det riktiga projektet levereras via npm.
  • Ragas har inga commits sedan 2026-02-24 och har bytt GitHub-organisation till vibrantlabsai.

Vilket öppen källkod LLM-utvärderingsramverk bör du installera 2026?

Välj efter begränsning, inte efter rankning. Vill du ha pytest-formade assertions i en befintlig testsvit, installera DeepEval. Vill du ha en YAML-konfig och en CLI som passar valfri språkstack, installera promptfoo. Vill du ha den renaste separationen mellan bra och dåliga svar vi mätte, installera Opik. Alla tre är Apache-2.0 eller MIT.

Här är granskningen. Åtta ramverk ingår, plus tre till som topprankade sidor för den här sökningen fortfarande rekommenderar.

RamverkLicens (verifierad 2026-08-04)Senaste releaseSenaste commit till mainInstallationGränssnittsformBäst påBytkostnad
DeepEvalApache-2.0v4.1.5 (2026-07-29)2026-08-03pip install deepevalpytest-liknande assertionsgrinda en Python-testsvitlåg, mätvärdena är enkla objekt
PromptfooMIT0.121.20 (2026-07-31)2026-08-04npm install promptfooYAML-konfig plus CLIspråkoberoende prompttestningmedel, konfigformatet är promptfoo-specifikt
OpikApache-2.02.2.17 (2026-08-04)2026-08-04pip install opikfristående .score()-anropett användbart poängvärde på minst antal raderlåg, mätvärdena körs utan plattformen
Arize PhoenixElastic License 2.0, inte OSI-godkändv19.15.0 (2026-08-03)2026-08-04pip install arize-phoenix-evalsfärdigbyggda evaluerare över en dataframebinära pass/fail-etiketterlåg för evals, licensbunden om du säljer den vidare
RagasApache-2.0v0.4.3 (2026-01-13)2026-02-24pip install ragasasynkron evaluate() över ett datasetRAG-hämtningsmätvärdenlåg, raderna är enkla dicts
EvidentlyApache-2.0v0.7.21 (2026-03-10)2026-05-02pip install evidentlydeskriptorer plus en HTML-rapportbatchrapportering över många raderhög, poängskalan är omvänd
Inspect AIMIT0.3.252 (2026-08-04)2026-08-04pip install inspect-aiPython-taskfiler plus CLIbenchmarking av en modellhög, tasks är Inspect-specifika
GiskardApache-2.02.19.2 på PyPI (2026-07-06), v2-linjen2026-08-04pip install giskardscan-APIautomatiska sårbarhetsskanningarmedel, skanningsresultat är Giskard-specifikt
lm-evaluation-harnessMITv0.4.12 (2026-05-11)2026-07-13pip install lm-evalCLI över taskdefinitionerstandardiserade modellbenchmarkshög, taskdefinitioner är harness-specifika
UpTrainApache-2.0v0.7.1 (2024-05-14)2024-07-29pip install uptrainPython check-operatoreringet vi skulle starta idagej tillämpligt
Deepchecksinte identifierad av GitHub0.19.1 (2024-12-15)2025-11-24pip install deepcheckssuite- och check-objekttabell- och ML-valideringhög, suiter är Deepchecks-specifika

Datumen är den senaste committen på varje projekts standardgren per 2026-08-04. GitHubs repo-sida visar den senaste pushen till valfri gren, vilket är senare för två projekt här: UpTrain 2024-08-18 och Deepchecks 2025-12-28. Inget av reporna är arkiverat.

Kolumnen om bytkostnad är den folk hoppar över och sedan ångrar. Poäng är bara siffror, så att byta mellan DeepEval, Ragas, Opik och phoenix-evals innebär mest att skriva om en loop. Att byta bort promptfoo eller Inspect AI innebär att skriva om ett konfig- eller task-format utan motsvarighet någon annanstans, och att byta bort Evidently innebär att granska varje tröskelvärde du skrivit, eftersom dess skala går åt andra hållet. Två av ramverken som topprankade sidor fortfarande rekommenderar har inte släppt en release sedan 2024.

Vill du ha nivåer, hostade plattformar och en rak rankning istället? Det är ett annat jobb, och vi har redan gjort det i vår rankade jämförelse av LLM-utvärderingsverktyg, inklusive betalplattformar.

De åtta LLM-utvärderingsramverken, grupperade efter hur du installerar dem

Installationsformen är det du får leva med, så det är grupperingen vi valt.

Python-bibliotek du importerar i tester

DeepEval (pip install deepeval, Apache-2.0) paketerar LLM-mätvärden i pytest-formade assertions: bygg ett LLMTestCase, skicka det till assert_test, och testet fallerar under ditt tröskelvärde. Bäst på att lägga en kvalitetsgrind bredvid de enhetstester ett team redan kör. Välj det här om dina evals hör hemma i samma CI-jobb som allt annat.

En disclosure, sagd en gång: DeepEval byggs av Confident AI, som är en betald partner på två andra inlägg på den här sajten, inklusive den rankade jämförelsen den här sidan länkar till. Det får ingen särbehandling här, och varje DeepEval-länk på den här sidan pekar till GitHub-repot.

Ragas (pip install ragas, Apache-2.0) är det RAG-specifika alternativet: evaluate() tar rader med fråga, kontext och svar och returnerar mätvärden per rad asynkront. Bäst på att mäta hämtningskvalitet inuti en Python-pipeline. Repot flyttade från explodinggradients till vibrantlabsai, senaste release var v0.4.3 den 2026-01-13, och det finns inga commits sedan 2026-02-24. Välj det här om RAG-mätvärden är hela jobbet och ett tyst repo är okej, och se den bredare RAG-verktygsstacken.

Opik (pip install opik, Apache-2.0, från Comet) levererar mätvärden du kan anropa fristående. Sätt OPIK_TRACK_DISABLE=true så körs AnswerRelevance().score() utan konto, utan lokal server och utan konfigfil — något produktens marknadsföring inte lyfter fram. Bäst på att få ett riktigt poängvärde på minst antal rader. Välj det här om du vill ha mätvärden nu och plattformen kanske senare.

Evidently (pip install evidently, Apache-2.0) behandlar evals som deskriptorer över ett dataset och skriver en HTML-rapport som bieffekt. Bäst på batchrapportering över många rader snarare än en binär grind. Dess LLM-poäng är omvända: 1.0 betyder otrogen mot kontexten. Välj det här om det du är skyldig någon är en delbar rapport, inte ett rött bygge.

Giskard (pip install giskard, Apache-2.0) skannar en modell efter sårbarheter istället för att poängsätta ett dataset du skrivit. PyPI-paketet löser upp v2-linjen, och projektets egen README anger att v2 "is no longer actively maintained". Bäst på automatiserade red-team-liknande skanningar. Välj det här om du vill ha sårbarheter hittade åt dig istället för LLM-as-a-judge-mätvärden du själv definierar.

CLI- och konfigverktyg du kör mot en YAML-fil

promptfoo (npm install promptfoo, MIT) är en CLI som läser en YAML-fil: deklarera providers, testfall och assertions, kör npx promptfoo eval, och få pass/fail per fall plus ett lokalt resultat-UI. Bäst på att utvärdera prompts när din app inte är skriven i Python. Välj det här om din kvalitetsgrind ska vara en konfigfil som en icke-Python-kollega kan redigera.

Harness-klass och plattformsbuntat

Inspect AI (pip install inspect-ai, MIT) kommer från UK AI Safety Institute och utvärderar modeller mot tasks du definierar i Python, med riktiga solver- och scorer-abstraktioner och en run viewer. Bäst på modellbenchmarking med reproducerbara taskdefinitioner. Välj det här om det som testas är en modell snarare än din applikation.

Arize Phoenix (pip install arize-phoenix-evals) ger dig färdigbyggda evaluerare som FaithfulnessEvaluator och CorrectnessEvaluator som returnerar en binär etikett plus ett poängvärde. Bäst på deterministiska etiketter du kan grinda på utan att välja ett gränsvärde. Dess licens är anledningen till att den här artikeln har en parentes i titeln, och det får ett eget avsnitt härnäst.

Är Arize Phoenix öppen källkod?

Nej, inte enligt definitionen som Open Source Initiative upprätthåller. Arize Phoenix levereras under Elastic License 2.0 (ELv2). Rad 1 i repots LICENSE-fil säger det, och PyPI deklarerar oberoende license: Elastic-2.0 på v19.15.0. Källkoden är läsbar, forkbar och kan självhostas. En användning är begränsad.

Begränsningen som spelar roll: ELv2 förbjuder att tillhandahålla programvaran till tredje part som en hostad eller hanterad tjänst. Läs det noga, för det binder betydligt färre än det låter som. Om du installerar arize-phoenix-evals för att poängsätta din egen applikation berör ELv2 dig aldrig. Om du är en konsultfirma eller ett plattformsteam som paketerar Phoenix i en evalueringstjänst du säljer till externa kunder, gör den det. Det är hela skillnaden, och det är Open Source Definition som ELv2 misslyckas med, specifikt klausulerna om field-of-use-begränsningar.

LicensOSI-godkänd?Kan du självhosta?Kan du erbjuda den som en hanterad tjänst?Ramverk på den här listan
Apache-2.0jajajaDeepEval, Ragas, Opik, Evidently, Giskard, UpTrain
MITjajajapromptfoo, Inspect AI, lm-evaluation-harness
Elastic License 2.0nejjanejArize Phoenix

Varje sida som just nu rankar för den här sökningen kategoriserar Phoenix som "open source", och det gjorde vi också. Vår egen rankade jämförelse av LLM-utvärderingsverktyg beskriver Phoenix som fullt öppen källkod, vilket är fel, och det korrigeras nu. Phoenix är source-available, inte öppen källkod, och distinktionen biter bara om du planerar att sälja den som en tjänst. Om det du faktiskt behöver är spårning snarare än poängsättning hör det hemma under AI observability-plattformar, inte här.

Vilka av dessa underhålls fortfarande aktivt?

De flesta. Sex av de elva reporna vi kontrollerade fick en commit till main den 2026-08-03 eller 2026-08-04: DeepEval, promptfoo, Opik, Arize Phoenix, Inspect AI och Giskard. Två har inte släppt en release sedan 2024. Ett har blivit tyst under 2026 efter ett byte av GitHub-organisation.

Ramverk vi inte skulle starta ett nytt projekt med 2026

UpTrain är dött. Senaste committen till main landade 2024-07-29 och senaste releasen, v0.7.1, var 2024-05-14, vilket gör det två år kallt på båda måtten. Repot finns kvar och är fortfarande Apache-2.0, så inget hindrar dig, men att starta nytt arbete på ett övergivet utvärderingsbibliotek är ett beslut du får förklara senare.

Deepchecks förtjänar den exakta versionen. Det har inte haft en release sedan 0.19.1 den 2024-12-15, även om repot fortfarande tar emot commits, med den senaste på main daterad 2025-11-24. Folk jobbar fortfarande med det; ingen har klippt en version på över arton månader. Varken UpTrain eller Deepchecks är arkiverat på GitHub, och inget av dem har stängts för bidrag.

Ragas får datum och inget annat. Senaste release v0.4.3 den 2026-01-13, inga commits sedan 2026-02-24, och repot flyttade från explodinggradients till vibrantlabsai. Vi hittade ingen verifierbar förklaring till varför organisationen bytte, så vi hittar inte på en. Ett tyst repo är inte ett trasigt repo: Apache-2.0-kod som räknar ut ett faithfulness-poäng idag gör det fortfarande nästa år. Exponeringen är opatchade beroenden, vilket är precis det som bet oss i testningen nedan.

Andra sidor på sida ett för den här sökningen rekommenderar fortfarande både UpTrain och Deepchecks, utan något datum kopplat till rekommendationen. Ett ramverk utan release sedan december 2024 är ett beroendebeslut, inte ett funktionsbeslut.

Behöver du ett utvärderingsramverk eller en eval-harness?

Ett applikations-evalueringsramverk poängsätter din apps egna utdata mot din egen data. DeepEval, Ragas, promptfoo, Opik, phoenix-evals och Evidently gör alla det. En modell-eval-harness (ett testverktyg för modeller) benchmarkar istället en modell mot standardiserade publika tasks. lm-evaluation-harness och Inspect AI gör det. Att välja fel kategori är det dyraste misstaget på den här sidan.

DimensionApplikations-evalueringsramverkModell-eval-harness
Vad du testardin prompt, hämtning och utdataen modell-checkpoint eller endpoint
Vad du tillhandahållerdina egna frågor, kontexter och svarett tasknamn från en standardsvit
Typisk utdatapoäng per mätvärde och rad, plus pass/failnoggrannhet (accuracy) på en publicerad benchmark
Var det körsdin CI, vid varje pull requesten engångskörning per modell eller per finjustering
ExempelDeepEval, Ragas, promptfoo, Opik, Evidently, phoenix-evalslm-evaluation-harness, Inspect AI

Felläget är konkret. Någon kopplar upp lm-evaluation-harness för att testa sin RAG-chatbot, får tillbaka en uppsättning MMLU-poäng, och lär sig exakt ingenting om huruvida hämtningssteget returnerar rätt passager. Poängen är riktiga. De mäter basmodellen, vilket ingen var orolig för.

Inspect AI:s form följer av dess ursprung: det byggdes hos UK AI Safety Institute under MIT för att utvärdera frontier-modeller, så solvers, scorers och tasks är förstklassiga och din applikation är inget koncept det har. Det är ett bra skäl att använda det för vad det är till för. Om ditt problem är agenter snarare än enstaka turer är att utvärdera agenter i produktion en helt annan disciplin, och verktygsanropande servrar får sin egen behandling i vår guide till att utvärdera MCP-servrar och verktyg.

Vad hände när vi installerade sex av dem och körde samma 10 fall

Den 2026-08-04 installerade vi sex av dessa i nya Python 3.11.14-venvs (plus npm för promptfoo) och poängsatte samma 10-punkters RAG-set med en domare, openai/gpt-4o-mini via OpenRouter vid temperatur 0. Sju punkter var korrekta. Tre var trasiga på tre olika sätt: en motsäger sin kontext, en hittar på specifika detaljer, en är flytande prosa som aldrig svarar på frågan. Varje ramverk kördes två gånger i rad.

Ramverk (10 punkter, domare openai/gpt-4o-mini, körning 2026-08-04)InstallationRader till första poängKörtid, körning 1 / körning 2Defekter fångade på grounding-mätvärdetPunkter som drev mellan 2 körningar
DeepEval 4.1.526.6 s21126.8 s / 134.1 s2 av 3, missade det irrelevanta svaret0 av 10
Ragas 0.4.356.1 s plus en versionslåsning2321.2 s / 25.7 s3 av 31 av 10
promptfoo 0.121.20337.9 s14 plus 40 dataset34.3 s / 44.4 s3 av 32 av 10
Opik 2.2.17142.3 s1554.1 s / 44.8 s3 av 34 av 10
Phoenix evals 3.3.08.7 s1841.2 s / 44.0 s3 av 30 av 10
Evidently 0.7.2142.6 s plus openai259.9 s / 9.7 s3 av 34 av 10

Fem av sex grounding-mätvärden fångade alla tre defekterna. De tre fynden nedan är anledningen till att det här avsnittet finns.

Relevansmätvärden är inte kvalitetsmätvärden, och två av dem rankade en självsäker lögn högre än ett korrekt svar. Ragas ResponseRelevancy poängsatte punkten som påstår att HTTP 404 är ett 5xx-serverfel till 0.777, högre än två av de sju korrekta svaren, och punkten med hittade rate limits till 0.813, högre än fyra. promptfoo answer-relevance gjorde samma sak: 0.800 för 404-punkten, ett rent godkänt mot ett tröskelvärde på 0.7, samtidigt som det underkände det korrekta q01 på 0.679. Inte en bugg. Ett självsäkert fel svar adresserar frågan perfekt. Men om relevans är siffran på din dashboard ser en flytande hallucination ut som din bästa utdata.

En grind som bara mäter faithfulness missar det irrelevanta svaret. DeepEval poängsatte punkten som aldrig svarar på frågan till 1.000 faithfulness, ett rent godkänt, vilket är försvarbart: ett svar som inte påstår något om kontexten motsäger inget i den. Bara relevancy fångade det, med 0.000. Det är det enda grounding-missen i tabellen ovan. Vardera mätvärdet för sig har ett hål; tillsammans täcker de båda.

Binära evaluerare var stabila vid temperatur 0. De graderade var det inte. Phoenix och DeepEval flyttade noll av tio punkter mellan två identiska körningar. Opik flyttade fyra, alla på AnswerRelevance, på ett 0.05-rutnät; Evidently flyttade också fyra. Ingen drift vände en dom här, men promptfoos korrekta q01 hamnade på 0.679 och sedan 0.642 mot ett tröskelvärde på 0.700, vilket är precis formen på en flaky CI-grind.

Två mindre noteringar: tre av sex (DeepEval, Opik, Phoenix) installerades och körde rent på första försöket, medan Ragas inte gick att importera förrän vi låste langchain-community<0.4. Bara promptfoo rapporterade domarens tokenanvändning, 16 011 assertion-tokens i körning 1 och 16 010 i körning 2.

Begränsningarna med det här, sagt rent ut. n = 10 är ett rökprov, inte en benchmark: det säger dig något om ergonomi och blinda fläckar, inte om mätvärdenas exakthet. En domarmodell poängsatte allt, och en större domare skulle flytta varje siffra, förmodligen inklusive de två falska positiva DeepEval och Ragas båda gav på samma korrekta punkt. Två körningar bevisar att drift finns men kan inte karaktärisera den. Svaren var förskrivna, så inget här övar generering, spårning eller datasethantering, vilket gör att promptfoos installation på 337.9 sekunder ser sämre ut än den förtjänar. "Bäst" betyder alltid bäst för en begränsning: en CI-grind, RAG-mätvärden eller ett UI ger olika svar, precis som uppdelningen mellan offline- och online-utvärdering.

Samma kontroll, skriven på tre sätt

Det snabbaste sättet att välja gränssnittsform är att läsa samma assertion tre gånger. Här är en grounding-kontroll på en punkt i DeepEval, Ragas och promptfoo, trimmad från skripten vi faktiskt körde. Mätvärdesnamnen skiljer sig; vi länkar till hur LLM-as-a-judge-mätvärden faktiskt fungerar istället för att omdefiniera dem här.

python
# DeepEval 4.1.5: pytest-formad, testet fallerar under tröskelvärdet
from deepeval import assert_test
from deepeval.models import GPTModel
from deepeval.metrics import FaithfulnessMetric
from deepeval.test_case import LLMTestCase

judge = GPTModel(
    model="openai/gpt-4o-mini",
    base_url="https://openrouter.ai/api/v1",
    api_key=OPENROUTER_KEY,
)

def test_faithfulness():
    case = LLMTestCase(
        input=question,
        actual_output=answer,
        retrieval_context=[context],
    )
    assert_test(case, [FaithfulnessMetric(threshold=0.7, model=judge)])
python
# Ragas 0.4.3: notera importvägen. `from ragas.metrics import Faithfulness`
# ger ImportError i den här versionen; den konkreta metriken har flyttats.
from ragas import evaluate, EvaluationDataset
from ragas.metrics._faithfulness import Faithfulness
from ragas.llms import LangchainLLMWrapper
from langchain_openai import ChatOpenAI

judge = LangchainLLMWrapper(
    ChatOpenAI(model="openai/gpt-4o-mini",
               base_url="https://openrouter.ai/api/v1")
)

result = evaluate(
    dataset=EvaluationDataset.from_list(rows),
    metrics=[Faithfulness(llm=judge)],
)
yaml
# promptfoo 0.121.20: npm install promptfoo, kör sedan npx promptfoo eval
providers:
  - id: echo          # vi poängsatte förskrivna svar istället för att generera dem
defaultTest:
  assert:
    - type: context-faithfulness
      threshold: 0.7
tests:
  - vars:
      query: "Is HTTP 404 a client error or a server error?"
      context: "HTTP 404 Not Found is in the 4xx class, which denotes client errors."
      output: "HTTP 404 is a server error in the 5xx class."

Installationsraderna innehåller fler fallgropar än koden gör, och varje kommentar nedan är något som kostade oss tid den 2026-08-04:

bash
# Det riktiga promptfoo levereras via npm. PyPI-paketet med samma namn är en
# tredjeparts-wrapper: https://pypi.org/project/promptfoo/ jämfört med
# https://www.npmjs.com/package/promptfoo
npm install promptfoo

# pip install giskard löser upp v2-linjen, som projektets egen README
# markerar som no longer actively maintained.
pip install giskard

# lm-evaluation-harness installeras under paketnamnet lm-eval.
pip install lm-eval

# Evidently drar inte in openai, och domaren kraschar vid anropstillfället
# snarare än vid importtillfället, efter att du redan byggt datasetet.
pip install evidently openai

# Ragas 0.4.3 går inte att importera mot langchain-community 0.4.x.
pip install ragas "langchain-community<0.4"

Kan du fälla ett bygge på ett evalueringspoäng?

Ja. Varje ramverk här returnerar ett numeriskt eller binärt poängvärde, och alla avslutar med en exitkod skild från noll när en assertion mot ett tröskelvärde fallerar, vilket är allt GitHub Actions behöver för att göra ett bygge rött. Att koppla upp exitkoden är den enkla delen. Att välja ett tröskelvärde din domarmodell inte korsar av misstag är delen som tar en vecka.

Så här ser workflow-formen ut som vi kör, låst till versionerna från vårt 2026-08-04-test:

yaml
name: evals
on: [pull_request]

jobs:
  eval:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v4
      - uses: actions/setup-python@v5
        with:
          python-version: "3.11.14"
      - run: pip install deepeval==4.1.5

      - name: Score the golden set
        env:
          # Lås domaren. En modelluppgradering mitt i kvartalet flyttar varje poäng.
          JUDGE_MODEL: openai/gpt-4o-mini
          # Tröskelvärden bor på ett ställe, lästa av mätvärdenas konstruktörer.
          EVAL_THRESHOLD: "0.7"
          OPENROUTER_API_KEY: ${{ secrets.OPENROUTER_API_KEY }}
        run: deepeval test run tests/evals/

Två fallgropar biter innan tröskelvärdet gör det. Först, domaranrop är nätverksanrop: vår 10-punkters DeepEval-körning tog 126.8 sekunder eftersom .measure() körs sekventiellt, och ett 200-punkters golden set på den kodvägen blir en kaffepaus vid varje pull request. Varje annat ramverk i testet parallelliserar som standard, vilket är den enskilt största spaken för CI-väggklocktid.

För det andra, flakiness. Vid temperatur 0 flyttade Opik och Evidently vardera fyra av tio punkter mellan körningar i rad, och promptfoos korrekta svar låg på 0.679 och sedan 0.642 mot en 0.700-grind. Motåtgärderna är tråkiga och de fungerar: kör ett fast golden dataset som bara ändras per pull request, lås domarmodellen, föredra binära evaluerare där en etikett räcker, och grinda på en delta snarare än ett absolut golv. Den sista punkten spelar störst roll för flerturns-utvärdering, där en konversation producerar många poäng som var och en kan vackla.

För skalans skull: LangChains State of Agent Engineering-undersökning (1 340 svar, insamlade 18 november till 2 december 2025, publicerad 12 juni 2026) fann att 89 % av organisationerna har infört någon form av observability för sina agenter, medan bara 52.4 % kör offline-utvärderingar på testset. Att övervaka är vanligt. Att grinda är det inte.

Vad vi skulle installera den här veckan

Fyra saker att ta med sig. Arize Phoenix är source-available under Elastic License 2.0 och är inte OSI-godkänd öppen källkod, vilket inte förändrar något för de flesta läsare men förändrar allt om du säljer eval-verktyg vidare. UpTrain är dött, och sidor utan datum rekommenderar det fortfarande. Deepchecks har inte heller klippt en release sedan december 2024, även om repot fortfarande tar emot commits. Ett grounding-mätvärde och ett relevansmätvärde har vardera ett hål som det andra täcker, så grinda på båda. Och graderade poäng driver vid temperatur 0, så lås din domare och ge tröskelvärden marginal.

Om jag skulle starta en ny evalsvit den här veckan skulle jag installera DeepEval för CI-grinden eftersom assertions hör hemma bredvid testerna (disclosure ovan), och lägga till Opiks fristående mätvärden för den renaste separationen vi mätte. Om vår stack inte vore Python, promptfoo istället, utan tvekan. Om du hellre vill att någon annan kopplar upp golden set och workflowet, det är ett samtal vi gärna tar.

Vanliga frågor

Vad är det bästa öppna LLM-utvärderingsramverket?

Det finns ingen enda vinnare, bara bäst passform per begränsning. För en pass/fail-grind i en Python-testsvit, DeepEval. För en språkoberoende YAML- och CLI-uppsättning, promptfoo. För RAG-hämtningsmätvärden, Ragas, om du kan acceptera ett repo utan commits sedan 2026-02-24. För den renaste separationen mellan bra och dåliga svar i vårt 2026-08-04-test, Opik.

Är Arize Phoenix öppen källkod?

Inte enligt Open Source Initiatives definition. Arize Phoenix levereras under Elastic License 2.0, som PyPI deklarerar som license: Elastic-2.0 på v19.15.0 och som rad 1 i repots LICENSE-fil anger direkt. Det är source-available: du kan läsa, forka, modifiera och självhosta det. Den enda begränsningen är att erbjuda programvaran till tredje part som en hostad eller hanterad tjänst.

Underhålls Ragas fortfarande?

De verifierbara fakta, per 2026-08-04: senaste release var v0.4.3 den 2026-01-13, det har inte funnits några commits sedan 2026-02-24, och repot flyttade från organisationen explodinggradients till vibrantlabsai. Repot är inte arkiverat. Vi hittade ingen tillförlitlig publik förklaring till organisationsbytet och spekulerar inte om en. Apache-2.0-koden fungerar fortfarande; exponeringen är opatchade beroenden.

Behöver jag ett utvärderingsramverk eller en observability-plattform?

Båda, så småningom, men de svarar på olika frågor. Ett utvärderingsramverk berättar om en ändring gjorde din utdata bättre eller sämre innan du skeppar den, på ett dataset du kontrollerar. En observability-plattform berättar vad som faktiskt hände i produktion efter att du skeppat. Börja med utvärderingsramverket om du har en CI-pipeline; se AI observability-plattformar för produktionssidan.

Kan jag köra LLM-evals i CI/CD?

Ja. Varje ramverk som täcks här avslutar med en exitkod skild från noll vid en fallerad tröskelvärdes-assertion, vilket är allt ett GitHub Actions-jobb behöver. De praktiska begränsningarna är väggklocktid (domaranrop är nätverksanrop, och vår sekventiella DeepEval-körning tog 126.8 sekunder för 10 punkter) och domarens icke-determinism. Workflow-formen och motåtgärderna finns i CI-avsnittet ovan.

Vad är skillnaden mellan DeepEval och Ragas?

Gränssnittsform och omfattning, inte kvalitet. DeepEval är pytest-format och för generella ändamål: du skriver testfall och gör assertions mot mätvärdenas tröskelvärden, och det täcker applikationsutdata av många slag. Ragas är ett RAG-specifikt bibliotek vars evaluate() körs asynkront över ett dataset med rader av fråga, kontext och svar. DeepEval passar mer naturligt in i en CI-grind; Ragas går djupare på hämtning.

Varför ger pip install promptfoo mig fel paket?

Eftersom promptfoo är ett Node-projekt. Det riktiga publiceras på npm under MIT och installeras med npm install promptfoo. PyPI-paketet med samma namn är en tredjeparts-wrapper, inte uppströmsprojektet, och att installera det är ett vanligt sätt att sluta med att felsöka en CLI som inte är den dokumentationen beskriver.

Är lm-evaluation-harness ett LLM-utvärderingsramverk?

Det är en modellutvärderings-harness, vilket är ett besläktat men annat jobb. lm-evaluation-harness (installeras som pip install lm-eval) benchmarkar en modell mot standardiserade publika tasks som MMLU. Det säger dig inte om din hämtningspipeline returnerade rätt passage, eftersom din applikation inte är ett koncept det har. Se avsnittet om ramverk kontra harness ovan för uppdelningen.

Är de här ramverken gratis att använda?

Licensmässigt, ja. DeepEval, Ragas, Opik, Evidently och Giskard är Apache-2.0; promptfoo, Inspect AI och lm-evaluation-harness är MIT. Båda licenserna tillåter kommersiell användning, modifiering och vidaredistribution. Arize Phoenix är undantaget: Elastic License 2.0 tillåter självhostning men inte att erbjuda programvaran till tredje part som en hanterad tjänst. API-användning för domarmodellen faktureras separat av din leverantör.

Taggar

öppen källkod llm-utvärderingsramverkdeepevalragaspromptfooarize phoenixopikllm-utvärdering

Dela denna artikel

Relaterade artiklar

Mer inom comparisons

comparisons
Jul 30, 2026

Hybrid sökning: BM25 vs vektor (och varför du behöver båda)

BM25 hittar dina SKU:er och felkoder; vektorsökning hittar den parafraserade frågan som aldrig använder exakt de orden. Så här slår Reciprocal Rank Fusion samman båda, med riktiga benchmarktal 2025-2026 och leverantörsoberoende Python-kod.

13 min läsning läsning
Läs
comparisons
Jul 21, 2026

RPA, AI eller hybrid – vad passar bäst för dina affärsprocesser 2026?

RPA följer regler, AI gör bedömningar, och 2026 är den smartaste automatiseringen en kombination av båda. Den här neutrala guiden ger dig en beslutsmodell i tre steg, kostnader för år 1 jämfört med år 3 och verklig byggdata för att välja RPA, AI eller hybrid.

11 min läsning läsning
Läs
comparisons
Jul 8, 2026

OpusClip mot Vizard: Vilken AI-klippgenerator vinner 2026?

OpusClip mot Vizard, testat för 2026. Vi räknade på kostnaden per källminut och gjorde ett praktiskt klippkvalitetstest för att se vem som faktiskt vinner - och för vem. Vizard satsar på värde och volym, OpusClip på virala ögonblick och automatisk omramning.

12 min read läsning
Läs
Visa alla inlägg
Starta ditt projekt

Redo att bygga något utöver det vanliga?

Låt oss göra verklighet av din idé. Vårt team hjälper dig gärna att bygga mjukvara som gör skillnad.

Boka ett scoping-möte på 30 minSe vårt arbete

Senaste från biblioteket

Claude Skills

Visa alla
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automationer

Visa alla
  • Säkerhetsgranskare

    Veckovis SCA- och IaC-skanning med prioriterade åtgärds-PR:er.

  • Cold Email-skribent

    Skapar förstakontaktsmejl förankrade i en specifik offentlig detalj.

  • Agent för lead-research

    Berikar ett mejl till en profil, poängsätter passform och larmar i Slack.

Senaste från biblioteket

Claude Skills

Visa alla
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automationer

Visa alla
  • Säkerhetsgranskare

    Veckovis SCA- och IaC-skanning med prioriterade åtgärds-PR:er.

  • Cold Email-skribent

    Skapar förstakontaktsmejl förankrade i en specifik offentlig detalj.

  • Agent för lead-research

    Berikar ett mejl till en profil, poängsätter passform och larmar i Slack.

Tjänster

  • Enterprise-lösningar
  • Mobilappar
  • Webbapplikationer

Lösningar

  • CRM-system
  • AI-integration
  • ERP-lösningar
  • Röstassistenter
  • Processautomation
  • Cybersäkerhet

Bibliotek

  • Blogg
  • Portfolio

Community

  • AI-automationer
  • Claude Skills

Verktyg

  • Kostnadskalkylator för mobilappar
  • OpenAI / LLM API-kostnadskalkylator
  • Kostnadskalkylator för MVP
  • Kostnadskalkylator för röst-AI-agenter

Företag

  • Om oss
  • Partners
  • Kontakt

Juridiskt

  • Integritetspolicy
  • Användarvillkor
  • Cookiepolicy

Tjänster

  • Enterprise-lösningar
  • Mobilappar
  • Webbapplikationer

Lösningar

  • CRM-system
  • AI-integration
  • ERP-lösningar
  • Röstassistenter
  • Processautomation
  • Cybersäkerhet

Bibliotek

  • Blogg
  • Portfolio

Community

  • AI-automationer
  • Claude Skills

Verktyg

  • Kostnadskalkylator för mobilappar
  • OpenAI / LLM API-kostnadskalkylator
  • Kostnadskalkylator för MVP
  • Kostnadskalkylator för röst-AI-agenter

Företag

  • Om oss
  • Partners
  • Kontakt
JuridisktIntegritetspolicyAnvändarvillkorCookiepolicy
TECHSY
© 2026 Techsy. Med ensamrätt.