Techsy
Kontak
Mulai Sekarang
Kembali ke Blog
comparisons

Framework Evaluasi LLM Open Source Terbaik 2026 (Satu Ternyata Bukan Open Source)

Ditulis oleh Mert Batur
Aug 4, 2026
16 baca
Daftar Isi
Framework Evaluasi LLM Open Source Terbaik 2026 (Satu Ternyata Bukan Open Source)

Baris 1 file LICENSE di repo Arize Phoenix berbunyi "Elastic License 2.0 (ELv2)". Bukan Apache. Bukan MIT. Satu framework evaluasi LLM open source yang paling banyak direkomendasikan ternyata bukan open source menurut definisi OSI, dan hampir semua halaman yang ranking untuk kueri ini tetap mengulangi klaim itu. Salah satu artikel kami sendiri pun begitu, sampai hari ini. Pada 2026-08-04 kami membaca sendiri file lisensi dan log commit default-branch dari delapan framework, ditambah tiga lagi yang masih direkomendasikan halaman-halaman teratas, lalu menginstal enam dan menjalankan 10 kasus yang sama di masing-masing. Kami tidak menjual framework eval, jadi tidak ada verdict di bawah ini yang melindungi sebuah produk.

Ringkasan Utama

  • Arize Phoenix dirilis di bawah Elastic License 2.0, yang tidak disetujui OSI sebagai open source.
  • Commit terakhir UpTrain ke main adalah 2024-07-29. Jangan mulai proyek baru dengannya.
  • pip install promptfoo memberi Anda wrapper pihak ketiga. Proyek aslinya dirilis di npm.
  • Ragas tidak ada commit sejak 2026-02-24 dan pindah organisasi GitHub ke vibrantlabsai.

Framework Evaluasi LLM Open Source Mana yang Sebaiknya Anda Instal di 2026?

Pilih berdasarkan batasan, bukan peringkat. Untuk asersi bergaya pytest di dalam test suite yang sudah ada, instal DeepEval. Untuk konfigurasi YAML dan CLI yang cocok untuk stack bahasa apa pun, instal promptfoo. Untuk pemisahan skor bagus-versus-buruk paling bersih yang kami ukur, instal Opik. Ketiganya berlisensi Apache-2.0 atau MIT.

Berikut audit lengkapnya. Delapan framework dalam cakupan, ditambah tiga lagi yang masih direkomendasikan halaman-halaman peringkat teratas untuk kueri ini.

FrameworkLisensi (diverifikasi per 2026-08-04)Rilis terakhirCommit terakhir ke mainInstalBentuk interfaceTerbaik untukBiaya berpindah
DeepEvalApache-2.0v4.1.5 (2026-07-29)2026-08-03pip install deepevalasersi bergaya pytestmenjaga gate test suite Pythonrendah, metrik berupa objek biasa
PromptfooMIT0.121.20 (2026-07-31)2026-08-04npm install promptfookonfigurasi YAML plus CLIpengujian prompt lintas bahasasedang, format konfigurasi khas promptfoo
OpikApache-2.02.2.17 (2026-08-04)2026-08-04pip install opikpemanggilan .score() mandiriskor pakai dalam baris kode paling sedikitrendah, metrik jalan tanpa platform
Arize PhoenixElastic License 2.0, tidak disetujui OSIv19.15.0 (2026-08-03)2026-08-04pip install arize-phoenix-evalsevaluator siap pakai di atas dataframelabel pass/fail binerrendah untuk eval, terikat lisensi bila dijual kembali
RagasApache-2.0v0.4.3 (2026-01-13)2026-02-24pip install ragasevaluate() async di atas datasetmetrik retrieval RAGrendah, baris data berupa dict biasa
EvidentlyApache-2.0v0.7.21 (2026-03-10)2026-05-02pip install evidentlydescriptor plus laporan HTMLpelaporan batch untuk banyak baristinggi, skala skornya terbalik
Inspect AIMIT0.3.252 (2026-08-04)2026-08-04pip install inspect-aifile task Python plus CLIbenchmarking modeltinggi, task khas Inspect
GiskardApache-2.02.19.2 di PyPI (2026-07-06), lini v22026-08-04pip install giskardscan APIscan kerentanan otomatissedang, output scan khas Giskard
lm-evaluation-harnessMITv0.4.12 (2026-05-11)2026-07-13pip install lm-evalCLI di atas definisi taskbenchmark model standartinggi, definisi task khas harness
UpTrainApache-2.0v0.7.1 (2024-05-14)2024-07-29pip install uptrainoperator check Pythontidak ada yang akan kami mulai hari inin/a
Deepcheckstidak terdeteksi GitHub0.19.1 (2024-12-15)2025-11-24pip install deepchecksobjek suite dan checkvalidasi tabular dan MLtinggi, suite khas Deepchecks

Tanggal adalah commit terakhir di default branch masing-masing proyek per 2026-08-04. Halaman repo GitHub menampilkan push terakhir ke branch mana pun, yang lebih baru untuk dua proyek di sini: UpTrain 2024-08-18 dan Deepchecks 2025-12-28. Tidak ada repo yang diarsipkan.

Kolom biaya berpindah adalah kolom yang sering dilewatkan lalu disesali. Skor cuma angka, jadi pindah antara DeepEval, Ragas, Opik dan phoenix-evals sebagian besar cuma menulis ulang loop. Pindah dari promptfoo atau Inspect AI berarti menulis ulang format konfigurasi atau task tanpa padanan di tempat lain, dan pindah dari Evidently berarti mengaudit setiap threshold yang pernah Anda tulis, karena skalanya berjalan terbalik. Dua dari framework yang masih direkomendasikan halaman-halaman peringkat teratas belum merilis versi baru sejak 2024.

Mau tier, platform hosted, dan urutan yang tegas? Itu pekerjaan berbeda, dan sudah kami kerjakan di perbandingan berperingkat tool evaluasi LLM termasuk platform berbayar.

Delapan Framework Evaluasi LLM, Dikelompokkan Berdasarkan Cara Instalasinya

Bentuk instalasi adalah hal yang harus Anda hidup bersamanya, jadi itulah dasar pengelompokan di sini.

Library Python yang diimpor ke dalam test

DeepEval (pip install deepeval, Apache-2.0) membungkus metrik LLM dalam asersi bergaya pytest: bangun LLMTestCase, serahkan ke assert_test, dan test gagal di bawah threshold Anda. Terbaik untuk menaruh gate kualitas di sebelah unit test yang sudah dijalankan tim. Pilih ini jika eval Anda memang harus ada di CI job yang sama dengan yang lain.

Satu pengungkapan, disebutkan sekali: DeepEval dibangun oleh Confident AI, mitra berbayar di dua post lain di situs ini, termasuk perbandingan berperingkat yang dirujuk halaman ini. Tidak ada perlakuan khusus di sini, dan setiap tautan DeepEval di halaman ini mengarah ke repo GitHub.

Ragas (pip install ragas, Apache-2.0) adalah opsi khusus RAG: evaluate() mengambil baris berisi pertanyaan, konteks, dan jawaban lalu mengembalikan skor per-metrik secara asinkron. Terbaik untuk pengukuran kualitas retrieval di dalam pipeline Python. Repo-nya pindah dari explodinggradients ke vibrantlabsai, rilis terakhirnya v0.4.3 pada 2026-01-13, dan tidak ada commit sejak 2026-02-24. Pilih ini jika metrik RAG adalah seluruh pekerjaan Anda dan repo yang sepi bisa diterima, dan lihat juga stack tooling RAG yang lebih luas.

Opik (pip install opik, Apache-2.0, dari Comet) menyediakan metrik yang bisa dipanggil sendiri-sendiri. Set OPIK_TRACK_DISABLE=true dan AnswerRelevance().score() berjalan tanpa akun, tanpa server lokal, dan tanpa file konfigurasi, sesuatu yang tidak diiklankan dalam framing produknya. Terbaik untuk mendapatkan skor nyata dalam baris kode paling sedikit. Pilih ini jika Anda ingin metrik sekarang dan platformnya mungkin nanti.

Evidently (pip install evidently, Apache-2.0) memperlakukan eval sebagai descriptor di atas dataset dan menulis laporan HTML sebagai efek samping. Terbaik untuk pelaporan batch di banyak baris, bukan gate biner. Skor LLM-nya terbalik: 1.0 berarti tidak faithful. Pilih ini jika yang Anda perlu berikan ke seseorang adalah laporan yang bisa dibagikan, bukan build merah.

Giskard (pip install giskard, Apache-2.0) memindai model untuk kerentanan, bukan menilai dataset yang Anda tulis. Paket PyPI-nya mengarah ke lini v2, dan README proyek itu sendiri menyatakan v2 "is no longer actively maintained" (tidak lagi dipelihara secara aktif). Terbaik untuk scan bergaya red-team otomatis. Pilih ini jika Anda ingin kerentanan ditemukan untuk Anda, bukan metrik LLM-as-a-judge yang Anda definisikan sendiri.

Tool CLI-dan-konfigurasi yang dijalankan terhadap file YAML

promptfoo (npm install promptfoo, MIT) adalah CLI yang membaca file YAML: deklarasikan provider, test case, dan asersi, jalankan npx promptfoo eval, dan dapatkan pass/fail per kasus plus UI hasil lokal. Terbaik untuk mengevaluasi prompt saat aplikasi Anda tidak ditulis dalam Python. Pilih ini jika gate kualitas Anda sebaiknya berupa file konfigurasi yang bisa diedit rekan tim non-Python.

Kelas harness dan yang terikat platform

Inspect AI (pip install inspect-ai, MIT) berasal dari UK AI Safety Institute dan mengevaluasi model terhadap task yang Anda definisikan dalam Python, dengan abstraksi solver dan scorer yang nyata plus run viewer. Terbaik untuk benchmarking level model dengan definisi task yang bisa direproduksi. Pilih ini jika yang diuji adalah sebuah model, bukan aplikasi Anda.

Arize Phoenix (pip install arize-phoenix-evals) memberi Anda evaluator siap pakai seperti FaithfulnessEvaluator dan CorrectnessEvaluator yang mengembalikan label biner plus skor. Terbaik untuk label deterministik yang bisa Anda jadikan gate tanpa memilih cutoff. Lisensinya adalah alasan artikel ini punya keterangan dalam kurung di judulnya, dan itu mendapat bagiannya sendiri berikutnya.

Apakah Arize Phoenix Open Source?

Tidak, tidak menurut definisi yang dipegang Open Source Initiative. Arize Phoenix dirilis di bawah Elastic License 2.0 (ELv2). Baris 1 file LICENSE repo tersebut menyatakan begitu, dan PyPI secara terpisah mendeklarasikan license: Elastic-2.0 pada v19.15.0. Kode sumbernya bisa dibaca, di-fork, dan di-self-host. Satu penggunaan yang dibatasi.

Batasan yang penting: ELv2 melarang menyediakan software ini kepada pihak ketiga sebagai layanan hosted atau managed. Bacalah baik-baik, karena batasan ini mengikat jauh lebih sedikit orang daripada yang terdengar. Jika Anda menginstal arize-phoenix-evals untuk menilai aplikasi Anda sendiri, ELv2 tidak pernah menyentuh Anda. Jika Anda konsultan atau tim platform yang mengemas Phoenix ke dalam layanan eval yang dijual ke pelanggan eksternal, itu berlaku. Itulah seluruh selisihnya, dan Open Source Definition adalah acuan yang gagal dipenuhi ELv2, khususnya klausul soal pembatasan field-of-use.

LisensiDisetujui OSI?Bisa self-host?Bisa ditawarkan sebagai managed service?Framework di daftar ini
Apache-2.0yayayaDeepEval, Ragas, Opik, Evidently, Giskard, UpTrain
MITyayayapromptfoo, Inspect AI, lm-evaluation-harness
Elastic License 2.0tidakyatidakArize Phoenix

Setiap halaman yang saat ini ranking untuk kueri ini memasukkan Phoenix ke kategori "open source", dan artikel kami juga begitu. Perbandingan berperingkat tool evaluasi LLM kami sendiri menyebut Phoenix sepenuhnya open-source, yang keliru, dan sedang diperbaiki. Phoenix bersifat source-available (kode sumber tersedia), bukan open source, dan perbedaan ini baru terasa jika Anda berencana menjualnya sebagai layanan. Jika yang Anda butuhkan sebenarnya tracing, bukan scoring, itu masuk ke platform observability AI, bukan di sini.

Framework Mana yang Masih Aktif Dipelihara?

Sebagian besar masih. Enam dari sebelas repo yang kami cek mendapat commit ke main pada 2026-08-03 atau 2026-08-04: DeepEval, promptfoo, Opik, Arize Phoenix, Inspect AI, dan Giskard. Dua belum merilis versi baru sejak 2024. Satu jadi sepi di 2026 setelah pindah organisasi GitHub.

Framework yang tidak akan kami pakai untuk proyek baru di 2026

UpTrain sudah mati. Commit terakhirnya ke main mendarat pada 2024-07-29 dan rilis terakhirnya, v0.7.1, pada 2024-05-14, yang membuatnya dingin selama dua tahun dari kedua ukuran itu. Repo-nya masih ada dan masih berlisensi Apache-2.0, jadi tidak ada yang menghalangi Anda, tapi memulai pekerjaan baru dengan library evaluasi yang ditinggalkan adalah keputusan yang akan Anda jelaskan nanti.

Deepchecks layak mendapat detail yang presisi. Belum ada rilis sejak 0.19.1 pada 2024-12-15, meski repo-nya masih menerima commit, dengan commit terakhir ke main bertanggal 2025-11-24. People are still working on it (orang-orang masih mengerjakannya); hanya saja tidak ada yang merilis versi baru dalam lebih dari delapan belas bulan. Baik UpTrain maupun Deepchecks tidak diarsipkan di GitHub, dan keduanya tidak tertutup untuk kontribusi.

Ragas hanya mendapat tanggal dan tidak lebih. Rilis terakhir v0.4.3 pada 2026-01-13, tidak ada commit sejak 2026-02-24, dan repo-nya pindah dari explodinggradients ke vibrantlabsai. Kami tidak menemukan penjelasan yang bisa diverifikasi soal kenapa organisasinya berubah, jadi kami tidak akan mengarang satu. Repo yang sepi bukan berarti rusak: kode Apache-2.0 yang menghitung skor faithfulness hari ini akan tetap menghitungnya tahun depan. Risikonya ada di dependency yang tidak dipatch, yang justru menggigit kami di pengujian di bawah.

Halaman-halaman lain di page one untuk kueri ini masih merekomendasikan UpTrain dan Deepchecks, tanpa tanggal apa pun yang menyertai rekomendasi itu. Framework tanpa rilis sejak Desember 2024 adalah keputusan dependency, bukan keputusan fitur.

Anda Butuh Eval Framework atau Eval Harness?

Application eval framework menilai output aplikasi Anda sendiri terhadap data Anda sendiri. DeepEval, Ragas, promptfoo, Opik, phoenix-evals, dan Evidently semuanya melakukan itu. Model eval harness membenchmark sebuah model terhadap task publik yang terstandarisasi. lm-evaluation-harness dan Inspect AI melakukan itu. Memilih kelas yang salah adalah kesalahan paling mahal di halaman ini.

DimensiApplication eval frameworkModel eval harness
Yang Anda ujiprompt, retrieval, dan output Andacheckpoint atau endpoint sebuah model
Yang Anda sediakanpertanyaan, konteks, dan jawaban Anda sendirinama task dari suite standar
Output tipikalskor per metrik per baris, plus pass/failakurasi pada benchmark yang dipublikasikan
Di mana berjalanCI Anda, di setiap pull requestrun satu kali per model atau per fine-tune
ContohDeepEval, Ragas, promptfoo, Opik, Evidently, phoenix-evalslm-evaluation-harness, Inspect AI

Failure mode-nya konkret. Seseorang menyambungkan lm-evaluation-harness untuk menguji chatbot RAG mereka, mendapat sekumpulan skor MMLU, dan tidak belajar apa-apa tentang apakah retriever mereka mengembalikan passage yang tepat. Skornya nyata. Yang diukur adalah base model-nya, yang sebenarnya tidak dikhawatirkan siapa pun.

Bentuk Inspect AI mengikuti asal-usulnya: dibangun di UK AI Safety Institute di bawah lisensi MIT untuk mengevaluasi model frontier, sehingga solver, scorer, dan task adalah konsep kelas satu dan aplikasi Anda bukan konsep yang dimilikinya. Itu alasan bagus untuk memakainya sesuai fungsinya. Jika masalah Anda adalah agen, bukan single turn, mengevaluasi agen di produksi adalah disiplin yang berbeda lagi, dan server tool-calling mendapat pembahasan tersendiri di panduan kami tentang mengevaluasi server dan tool MCP.

Apa yang Terjadi Saat Kami Menginstal Enam di Antaranya dan Menjalankan 10 Kasus yang Sama

Pada 2026-08-04 kami menginstal enam framework ini dalam venv Python 3.11.14 yang baru (plus npm untuk promptfoo) dan menilai satu set RAG 10 item yang identik dengan satu judge, openai/gpt-4o-mini lewat OpenRouter pada temperature 0. Tujuh item benar. Tiga rusak dengan tiga cara berbeda: satu bertentangan dengan konteksnya, satu mengarang detail spesifik, satu berupa prosa fasih yang tidak pernah menjawab pertanyaan. Setiap framework dijalankan dua kali berturut-turut.

Framework (10 item, judge openai/gpt-4o-mini, run 2026-08-04)InstalBaris kode sampai skor pertamaWaktu run, run 1 / run 2Cacat yang tertangkap metrik groundingItem yang bergeser di 2 run
DeepEval 4.1.526.6 dtk21126.8 dtk / 134.1 dtk2 dari 3, melewatkan jawaban yang tidak relevan0 dari 10
Ragas 0.4.356.1 dtk plus satu version pin2321.2 dtk / 25.7 dtk3 dari 31 dari 10
promptfoo 0.121.20337.9 dtk14 plus 40 dataset34.3 dtk / 44.4 dtk3 dari 32 dari 10
Opik 2.2.17142.3 dtk1554.1 dtk / 44.8 dtk3 dari 34 dari 10
Phoenix evals 3.3.08.7 dtk1841.2 dtk / 44.0 dtk3 dari 30 dari 10
Evidently 0.7.2142.6 dtk plus openai259.9 dtk / 9.7 dtk3 dari 34 dari 10

Lima dari enam metrik grounding menangkap ketiga cacat itu. Tiga temuan di bawah ini adalah alasan bagian ini ada.

Metrik relevansi bukan metrik kualitas, dan dua di antaranya memberi skor lebih tinggi pada kebohongan yang meyakinkan dibanding jawaban yang benar. Ragas ResponseRelevancy memberi skor 0.777 pada item yang menyatakan HTTP 404 adalah error server 5xx, lebih tinggi dari dua dari tujuh jawaban benar, dan 0.813 pada item dengan rate limit yang dikarang, lebih tinggi dari empat jawaban benar. promptfoo answer-relevance melakukan hal serupa: 0.800 untuk item 404, lolos bersih terhadap threshold 0.7, sementara jawaban benar q01 gagal di 0.679. Bukan bug. Jawaban salah yang meyakinkan menjawab pertanyaan dengan sempurna. Tapi jika relevansi adalah angka di dashboard Anda, halusinasi yang fasih terlihat seperti output terbaik Anda.

Gate berbasis faithfulness saja melewatkan jawaban yang tidak relevan. DeepEval memberi skor 1.000 faithfulness pada item yang tidak pernah menjawab pertanyaan, lolos bersih, yang bisa dibenarkan: jawaban yang tidak menyatakan apa pun soal konteksnya tidak bertentangan dengan apa pun di dalamnya. Hanya relevancy yang menangkapnya, di angka 0.000. Itulah satu-satunya kegagalan grounding di tabel di atas. Kedua metrik masing-masing punya celah; kombinasi keduanya menutup keduanya.

Evaluator biner stabil pada temperature 0. Yang bergrade tidak. Phoenix dan DeepEval tidak menggeser satu pun dari sepuluh item di dua run identik. Opik menggeser empat, semuanya di AnswerRelevance, pada skala 0.05; Evidently juga menggeser empat. Tidak ada drift yang membalik verdict di sini, tapi jawaban benar q01 milik promptfoo mendarat di 0.679 lalu 0.642 terhadap threshold 0.700, yang merupakan pola khas gate CI yang flaky.

Dua catatan tambahan: tiga dari enam (DeepEval, Opik, Phoenix) terinstal dan berjalan bersih pada percobaan pertama, sementara Ragas tidak mau diimpor sampai kami mengunci langchain-community<0.4. Hanya promptfoo yang melaporkan penggunaan token judge, 16.011 token asersi di run 1 dan 16.010 di run 2.

Keterbatasan pengujian ini, dinyatakan terus terang. n = 10 adalah smoke test, bukan benchmark: ini memberi tahu Anda soal ergonomi dan blind spot, bukan akurasi metrik. Satu model judge menilai semuanya, dan judge yang lebih besar akan menggeser setiap angka, kemungkinan termasuk dua false positive yang sama-sama dihasilkan DeepEval dan Ragas pada item benar yang sama. Dua run membuktikan drift itu ada tapi tidak bisa mengkarakterisasinya. Jawaban sudah ditulis sebelumnya, jadi tidak ada yang di sini menguji generasi, tracing, atau manajemen dataset, yang membuat waktu instal 337.9 detik milik promptfoo terlihat lebih buruk dari yang seharusnya. "Terbaik" selalu berarti terbaik untuk suatu batasan: gate CI, metrik RAG, atau UI masing-masing mengubah jawabannya, begitu juga pembagian antara evaluasi offline dan online.

Pengecekan yang Sama, Ditulis dengan Tiga Cara

Cara tercepat memilih bentuk interface adalah membaca asersi yang sama tiga kali. Berikut pengecekan grounding pada satu item di DeepEval, Ragas, dan promptfoo, dipangkas dari skrip yang benar-benar kami jalankan. Nama metriknya berbeda; kami merujuk ke cara kerja metrik LLM-as-a-judge sebenarnya daripada mendefinisikannya ulang di sini.

python
# DeepEval 4.1.5: bergaya pytest, test gagal di bawah threshold
from deepeval import assert_test
from deepeval.models import GPTModel
from deepeval.metrics import FaithfulnessMetric
from deepeval.test_case import LLMTestCase

judge = GPTModel(
    model="openai/gpt-4o-mini",
    base_url="https://openrouter.ai/api/v1",
    api_key=OPENROUTER_KEY,
)

def test_faithfulness():
    case = LLMTestCase(
        input=question,
        actual_output=answer,
        retrieval_context=[context],
    )
    assert_test(case, [FaithfulnessMetric(threshold=0.7, model=judge)])
python
# Ragas 0.4.3: perhatikan import path-nya. `from ragas.metrics import Faithfulness`
# akan melempar ImportError di versi ini; metrik konkretnya sudah pindah.
from ragas import evaluate, EvaluationDataset
from ragas.metrics._faithfulness import Faithfulness
from ragas.llms import LangchainLLMWrapper
from langchain_openai import ChatOpenAI

judge = LangchainLLMWrapper(
    ChatOpenAI(model="openai/gpt-4o-mini",
               base_url="https://openrouter.ai/api/v1")
)

result = evaluate(
    dataset=EvaluationDataset.from_list(rows),
    metrics=[Faithfulness(llm=judge)],
)
yaml
# promptfoo 0.121.20: npm install promptfoo, lalu npx promptfoo eval
providers:
  - id: echo          # kami menilai jawaban yang sudah ditulis, bukan menggenerasinya
defaultTest:
  assert:
    - type: context-faithfulness
      threshold: 0.7
tests:
  - vars:
      query: "Is HTTP 404 a client error or a server error?"
      context: "HTTP 404 Not Found is in the 4xx class, which denotes client errors."
      output: "HTTP 404 is a server error in the 5xx class."

Baris instalasi menyimpan lebih banyak jebakan daripada kodenya sendiri, dan setiap komentar di bawah ini adalah hal yang benar-benar memakan waktu kami pada 2026-08-04:

bash
# promptfoo yang asli dirilis di npm. Paket PyPI dengan nama sama adalah
# wrapper pihak ketiga: https://pypi.org/project/promptfoo/ vs
# https://www.npmjs.com/package/promptfoo
npm install promptfoo

# pip install giskard mengarah ke lini v2, yang menurut README proyek
# itu sendiri sudah tidak dipelihara secara aktif.
pip install giskard

# lm-evaluation-harness terinstal dengan nama paket lm-eval.
pip install lm-eval

# Evidently tidak menarik openai, dan judge-nya crash saat dipanggil,
# bukan saat diimpor, setelah Anda terlanjur membangun dataset-nya.
pip install evidently openai

# Ragas 0.4.3 tidak mau diimpor bersama langchain-community 0.4.x.
pip install ragas "langchain-community<0.4"

Bisakah Anda Menggagalkan Build Berdasarkan Skor Eval?

Bisa. Setiap framework di sini mengembalikan skor numerik atau biner, dan masing-masing akan exit non-zero saat asersi threshold gagal, yang cukup bagi GitHub Actions untuk membuat build menjadi merah. Menyambungkan exit code adalah bagian mudahnya. Memilih threshold yang tidak akan dilewati model judge Anda secara tidak sengaja adalah bagian yang memakan waktu seminggu.

Inilah bentuk workflow yang kami jalankan, dikunci ke versi dari pengujian kami pada 2026-08-04:

yaml
name: evals
on: [pull_request]

jobs:
  eval:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v4
      - uses: actions/setup-python@v5
        with:
          python-version: "3.11.14"
      - run: pip install deepeval==4.1.5

      - name: Score the golden set
        env:
          # Kunci judge-nya. Upgrade model di tengah kuartal menggeser semua skor.
          JUDGE_MODEL: openai/gpt-4o-mini
          # Threshold ada di satu tempat, dibaca oleh konstruktor metrik.
          EVAL_THRESHOLD: "0.7"
          OPENROUTER_API_KEY: ${{ secrets.OPENROUTER_API_KEY }}
        run: deepeval test run tests/evals/

Dua jebakan menggigit sebelum threshold sempat bertindak. Pertama, panggilan judge adalah panggilan jaringan: run 10-item DeepEval kami memakan 126.8 detik karena .measure() berjalan sekuensial, dan golden set 200 item di jalur kode yang sama adalah waktu ngopi di setiap pull request. Setiap framework lain di pengujian ini melakukan paralelisasi secara default, yang menjadi tuas terbesar untuk waktu wall-clock CI.

Kedua, flakiness. Pada temperature 0, Opik dan Evidently masing-masing menggeser empat dari sepuluh item antar run berturut-turut, dan jawaban benar promptfoo bertengger di 0.679 lalu 0.642 terhadap gate 0.700. Mitigasinya sederhana dan berhasil: jalankan golden dataset tetap yang hanya berubah per pull request, kunci model judge, utamakan evaluator biner ketika sebuah label sudah cukup, dan gate berdasarkan delta bukan floor absolut. Poin terakhir itu paling penting untuk evaluasi multi-turn, tempat satu percakapan menghasilkan banyak skor yang masing-masing bisa goyah.

Untuk skala: survei State of Agent Engineering LangChain (1.340 responden, dikumpulkan 18 November hingga 2 Desember 2025, dipublikasikan 12 Juni 2026) menemukan 89% organisasi sudah menerapkan bentuk observability untuk agen mereka, sementara hanya 52.4% yang menjalankan evaluasi offline pada test set. Mengawasi itu umum. Melakukan gate tidak.

Yang Akan Kami Instal Minggu Ini

Empat hal untuk dibawa pulang. Arize Phoenix bersifat source-available di bawah Elastic License 2.0 dan tidak disetujui OSI sebagai open source, yang tidak mengubah apa pun bagi kebanyakan pembaca dan mengubah segalanya jika Anda menjual kembali tooling eval. UpTrain sudah mati, dan halaman-halaman tanpa tanggal masih merekomendasikannya. Deepchecks juga belum merilis versi baru sejak Desember 2024, meski repo-nya masih menerima commit. Metrik grounding dan metrik relevansi masing-masing punya celah yang ditutup satu sama lain, jadi gate keduanya. Dan skor bergrade goyah pada temperature 0, jadi kunci judge Anda dan beri ruang pada threshold.

Kalau saya memulai eval suite baru minggu ini, saya akan menginstal DeepEval untuk gate CI karena asersi memang tempatnya di sebelah test (pengungkapan di atas), dan menambahkan metrik mandiri Opik untuk pemisahan paling bersih yang kami ukur. Kalau stack kami bukan Python, promptfoo, tanpa ragu. Kalau Anda lebih suka orang lain yang menyambungkan golden set dan workflow-nya, itu obrolan yang senang hati kami lakukan.

Pertanyaan yang Sering Diajukan

Apa framework evaluasi LLM open source terbaik?

Tidak ada satu pemenang, hanya kecocokan terbaik per batasan. Untuk gate pass/fail di dalam test suite Python, DeepEval. Untuk setup YAML dan CLI lintas bahasa, promptfoo. Untuk metrik retrieval RAG, Ragas, jika Anda bisa menerima repo tanpa commit sejak 2026-02-24. Untuk pemisahan paling bersih antara jawaban bagus dan buruk di pengujian kami pada 2026-08-04, Opik.

Apakah Arize Phoenix open source?

Tidak, menurut definisi Open Source Initiative. Arize Phoenix dirilis di bawah Elastic License 2.0, yang dideklarasikan PyPI sebagai license: Elastic-2.0 pada v19.15.0 dan yang dinyatakan langsung di baris 1 file LICENSE repo-nya. Bersifat source-available: Anda bisa membaca, fork, memodifikasi, dan self-host. Satu-satunya batasan adalah menawarkan software ini ke pihak ketiga sebagai layanan hosted atau managed.

Apakah Ragas masih dipelihara?

Fakta yang bisa diverifikasi, per 2026-08-04: rilis terakhir adalah v0.4.3 pada 2026-01-13, tidak ada commit sejak 2026-02-24, dan repo-nya pindah dari organisasi explodinggradients ke vibrantlabsai. Repo-nya tidak diarsipkan. Kami tidak menemukan penjelasan publik yang bisa diandalkan soal perubahan organisasi ini dan tidak akan berspekulasi. Kode Apache-2.0-nya masih berjalan; risikonya ada di dependency yang tidak dipatch.

Saya butuh eval framework atau observability platform?

Keduanya, pada akhirnya, tapi menjawab pertanyaan yang berbeda. Eval framework memberi tahu apakah sebuah perubahan membuat output Anda lebih baik atau lebih buruk sebelum Anda merilisnya, pada dataset yang Anda kendalikan. Observability platform memberi tahu apa yang benar-benar terjadi di produksi setelah Anda merilis. Mulai dengan eval framework jika Anda punya pipeline CI; lihat platform observability AI untuk sisi produksinya.

Bisakah saya menjalankan eval LLM di CI/CD?

Bisa. Setiap framework yang dibahas di sini exit non-zero saat asersi threshold gagal, yang cukup bagi job GitHub Actions. Batasan praktisnya adalah waktu wall-clock (panggilan judge adalah panggilan jaringan, dan run DeepEval sekuensial kami memakan 126.8 detik untuk 10 item) dan non-determinisme judge. Bentuk workflow dan mitigasinya ada di bagian CI di atas.

Apa bedanya DeepEval dan Ragas?

Bentuk interface dan cakupan, bukan kualitas. DeepEval bergaya pytest dan tujuan umum: Anda menulis test case dan menetapkan asersi pada threshold metrik, dan itu mencakup output aplikasi dari berbagai jenis. Ragas adalah library khusus RAG yang evaluate()-nya berjalan asinkron di atas dataset berisi baris pertanyaan, konteks, dan jawaban. DeepEval lebih cocok untuk gate CI; Ragas menggali lebih dalam soal retrieval.

Kenapa pip install promptfoo memberi saya paket yang salah?

Karena promptfoo adalah proyek Node. Yang asli dipublikasikan di npm di bawah lisensi MIT dan diinstal dengan npm install promptfoo. Paket PyPI dengan nama sama adalah wrapper pihak ketiga, bukan proyek aslinya, dan menginstalnya adalah cara umum untuk berakhir men-debug CLI yang bukan yang dijelaskan dokumentasinya.

Apakah lm-evaluation-harness adalah framework evaluasi LLM?

Itu model evaluation harness, pekerjaan yang terkait tapi berbeda. lm-evaluation-harness (diinstal sebagai pip install lm-eval) membenchmark sebuah model terhadap task publik yang terstandarisasi seperti MMLU. Itu tidak akan memberi tahu apakah pipeline retrieval Anda mengembalikan passage yang tepat, karena aplikasi Anda bukan konsep yang dimilikinya. Lihat bagian framework-versus-harness di atas untuk pembagiannya.

Apakah framework-framework ini gratis digunakan?

Dari segi lisensi, ya. DeepEval, Ragas, Opik, Evidently, dan Giskard berlisensi Apache-2.0; promptfoo, Inspect AI, dan lm-evaluation-harness berlisensi MIT. Kedua lisensi ini mengizinkan penggunaan komersial, modifikasi, dan redistribusi. Arize Phoenix adalah pengecualiannya: Elastic License 2.0 mengizinkan self-hosting tapi tidak menawarkan software ini ke pihak ketiga sebagai managed service. Penggunaan API model judge ditagih terpisah oleh provider Anda.

Tag

framework evaluasi llm open sourcedeepevalragaspromptfooarize phoenixopikevaluasi llm

Bagikan artikel ini

Artikel Terkait

Lebih lanjut di comparisons

comparisons
Jul 30, 2026

Pencarian Hybrid: BM25 vs Vektor (dan Kenapa Kamu Butuh Keduanya)

BM25 menemukan SKU dan kode error kamu; pencarian vektor menemukan pertanyaan parafrase yang tidak pernah memakai kata-kata persis itu. Begini cara Reciprocal Rank Fusion menggabungkan keduanya, lengkap dengan angka benchmark 2025-2026 dan kode Python yang netral dari vendor.

13 menit baca baca
Baca
comparisons
Jul 21, 2026

RPA vs AI vs Hybrid: Otomasi Mana yang Menang untuk Proses Bisnis di 2026?

RPA mengikuti aturan, AI membuat penilaian, dan pada tahun 2026 otomasi proses bisnis paling cerdas menggabungkan keduanya. Panduan netral ini memberikan kerangka keputusan tiga arah, biaya Tahun-1 vs Tahun-3, dan data pembangunan nyata untuk memilih RPA, AI, atau hybrid.

11 min read baca
Baca
comparisons
Apr 20, 2026

Vercel Diretas (April 2026): Panduan Darurat 60 Menit yang Wajib Dijalankan Setiap Developer Hari Ini

Vercel mengonfirmasi pelanggaran keamanan pada 19 April 2026 — variabel lingkungan yang tidak ditandai sebagai 'sensitif' terekspos. Berikut langkah tepat yang harus dilakukan dalam 60 menit ke depan, lengkap dengan daftar periksa rotasi bertingkat dan perintah pemindaian rahasia.

9 min read baca
Baca
Lihat Semua Postingan
Mulai Proyek Anda

Siap membangun sesuatu lu biasa?

Mari wujudkan visi Anda menjadi kenyataan. Tim kami siap membantu Anda menciptakan software yang benar-benar berdampak.

Jadwalkan panggilan scoping 30 menitLihat Karya Kami

Terbaru dari library

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Terbaru dari library

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak

Hukum

  • Kebijakan Privasi
  • Syarat Layanan
  • Kebijakan Kuki

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak
HukumKebijakan PrivasiSyarat LayananKebijakan Kuki
TECHSY
© 2026 Techsy. Seluruh hak cipta dilindungi.