
Cara Mengevaluasi Agen AI di Produksi: Sistem 3-Lapisan yang Kami Gunakan pada Jejak Langsung
Mengevaluasi agen AI di produksi berarti menilai seluruh lintasan multi-langkah agen, bukan hanya jawaban akhirnya, pada lalu lintas langsung: memeriksa setiap langkah penalaran, memvalidasi bahwa agen memanggil alat yang tepat dengan argumen yang benar, serta terus memantau keberhasilan tugas, biaya, dan keamanan setelah peluncuran, karena agen sering gagal secara diam-diam dan non-deterministik.
Pada satu eksekusi pipeline konten Techsy milik kami sendiri di Juni 2026, agen tersebut mengirimkan postingan blog yang tampak sempurna dan skor output akhir meloloskannya. Bersih. Kecuali tiga langkah sebelumnya, pembuat brief telah memanggil alat pencarian tautan internal yang salah, sehingga setengah dari tautan kluster mengarah ke halaman kosong. Mengetahui cara mengevaluasi agen AI di produksi berarti menilai seluruh jalur yang ditempuh agen, bukan hanya jawaban yang kebetulan dihasilkan.
Poin utama:
- Nilai seluruh lintasan, bukan hanya jawaban akhir: jawaban benar melalui jalur yang salah tetaplah kegagalan.
- Validasi pemanggilan alat pada tiga aspek: alat yang tepat, argumen yang tepat, langkah yang tepat.
- Jalankan metrik yang sama secara offline dan online, pada jejak produksi langsung, dalam loop berkelanjutan.
- Batasi penerapan (deploy) berdasarkan kerentanan keamanan (jailbreak, PII, penyalahgunaan alat), bukan hanya skor akurasi yang rendah.
Mengapa mengevaluasi agen AI di produksi berbeda dari evaluasi LLM?
Mengevaluasi agen AI di produksi lebih sulit daripada evaluasi model karena agen mengambil banyak langkah, memanggil alat eksternal, dan mengubah status nyata, dan itu semua dilakukan secara non-deterministik. Input yang sama dapat menghasilkan urutan pemanggilan alat yang berbeda setiap kali dijalankan, sehingga satu langkah yang salah di awal dapat merusak setiap langkah sesudahnya.
Panduan ini mengasumsikan Anda sudah memahami evaluasi LLM umum. Jika belum, mulailah dengan panduan evaluasi LLM lengkap kami, kemudian kembali lagi untuk melihat apa yang berubah ketika model menjadi agen. (Masih membangun agen yang akan Anda nilai? Ringkasan framework agen AI terbaik kami membahas lapisan dasarnya.)
Empat hal rusak seketika saat LLM Anda mulai bertindak sendiri:
- Multi-langkah. Agen dukungan mungkin mencari basis pengetahuan, memanggil API pesanan, lalu menyusun balasan. Hanya menilai balasan membuat Anda buta terhadap dua langkah yang menentukannya.
- Non-deterministik. Suhu (temperature), pembaruan bobot model, dan latensi alat berarti permintaan yang sama mengambil jalur berbeda setiap kali dijalankan. Evaluasi Anda harus mampu menghadapi target yang bergerak.
- Berstatus (Stateful). Agen menulis ke database, mengirim email, mengembalikan dana pesanan. Tindakan yang salah bukan sekadar kalimat buruk, melainkan efek samping yang tidak dapat ditarik kembali.
- Kompounding. Langkah yang sedikit salah di langkah ke-2 dari eksekusi 12 langkah meracuni semua langkah berikutnya, dan jawaban akhir mungkin masih terlihat baik-baik saja.
Laporan State of Eval Engineering Galileo edisi Februari 2026, yang mensurvei lebih dari 500 praktisi, menemukan bahwa 84,9% tim mengalami insiden AI dalam enam bulan setelah peluncuran. Tim rekayasa Anthropic menyatakannya dengan jelas dalam esai mereka tentang evaluasi agen: agen gagal di berbagai langkah, alat, dan niat, bukan hanya pada output akhir.
Agen yang mengembalikan jawaban benar melalui lintasan yang salah belum lulus. Ia gagal secara diam-diam, dan akan gagal secara mencolok lain kali ketika pemulihan beruntung tidak terjadi.
Metrik mana yang benar-benar penting untuk agen AI di produksi?
Metrik yang paling penting untuk agen di produksi melampaui akurasi: tingkat keberhasilan tugas, biaya per tugas yang berhasil, persentil latensi, akurasi pemanggilan alat, ketepatan (faithfulness), tingkat intervensi manusia, drift, dan tingkat kelulusan gerbang keamanan. Bersama-sama, metrik evaluasi agen ai ini menangkap kegagalan diam-diam dan non-deterministik yang terlewat oleh skor output tunggal.
Berikut adalah delapan metrik yang benar-benar kami pantau pada eksekusi kami sendiri. Perhatikan betapa sedikitnya metrik yang peduli apakah jawaban akhir terbaca dengan baik:
| Metrik | Apa yang diukur | Cara menilainya | Waspadai |
|---|---|---|---|
| Tingkat keberhasilan/penyelesaian tugas | Apakah agen mencapai tujuan pengguna | LLM-sebagai-juri atas seluruh jejak | Juri berbagi titik buta agen |
| Biaya per tugas yang berhasil | Uang yang dibelanjakan per tujuan yang benar-benar tercapai | Biaya token + alat dibagi jumlah keberhasilan | Kegagalan murah terlihat efisien |
| Latensi p50 / p90 / p99 | Waktu respons end-to-end dan per langkah | Stempel waktu jejak | Ekor (p99) adalah tempat pengguna hengkang |
| Akurasi pemanggilan alat | Alat yang tepat plus argumen yang tepat | Asersi deterministik (lihat di bawah) | Memanggil alat bukan berarti memanggilnya dengan benar |
| Ketepatan / groundedness | Output didukung oleh data yang diambil atau diamati | Juri atau pemeriksaan referensi | Halusinasi yang percaya diri |
| Tingkat intervensi manusia | Seberapa sering seseorang harus turun tangan | Intervensi dibagi jumlah eksekusi | Ketergantungan diam-diam pada fallback |
| Drift | Penurunan metrik seiring waktu atau pembaruan model | Evaluasi online bergulir | Baik saat peluncuran bukan berarti baik sekarang |
| Tingkat kelulusan gerbang keamanan | Bagian eksekusi yang lolos gerbang keamanan | Evaluasi adversarial / red-team | Satu pelanggaran bukan sekadar skor rendah |
Sebagian besar metrik ini mengandalkan LLM-sebagai-juri (satu model menilai output model lain). Ini adalah trik standar dan dapat diskalakan, tetapi berisik: juri sering kali berbagi titik buta agen, jadi anggap skornya sebagai sinyal, bukan kebenaran mutlak. Kami akan kembali membahas kalibrasi juri di bagian tujuh.
Satu metrik layak mendapat sorotan khusus. Biaya per tugas yang berhasil adalah angka yang bertahan dalam tinjauan anggaran. Biaya biasa per tugas memberi imbalan pada kegagalan murah, karena agen yang menyerah dengan cepat dan salah terlihat efisien di spreadsheet.
Bagaimana cara menilai lintasan agen alih-alih jawaban akhirnya?
Untuk menilai lintasan agen, Anda mengevaluasi jejak: catatan terurut dari setiap langkah penalaran, pemanggilan alat, dan output antara yang dihasilkan agen. Evaluasi tingkat span menilai setiap langkah individual (span) sehingga Anda dapat menunjuk tepat langkah mana yang gagal, alih-alih hanya mengetahui bahwa eksekusi keseluruhan berjalan salah.
Anggap jejak seperti stack trace untuk penalaran. Setiap span adalah satu langkah: pengambilan data, pemanggilan alat, atau penyerahan ke sub-agen. Observabilitas menangkap span-span tersebut; evaluasi menilainya. (Belum ada pelacakan? Panduan observabilitas AI kami membahas lapisan pemantauan yang menjadi dasar penilaian, dan perbandingan LangGraph, CrewAI, dan OpenAI Agents SDK kami menunjukkan seperti apa bentuk jejak di masing-masing platform.)
Mengapa menilai setiap span alih-alih titik akhir? Karena kesalahan kompounding. Jika langkah 2 mengambil dokumen yang salah, langkah 3 hingga 12 dibangun di atas sampah, dan frasa akhir yang beruntung masih bisa lolos dari pemeriksaan hanya-output. Penilaian tingkat span memberitahu Anda bahwa eksekusi gagal di langkah 2, bukan hanya bahwa itu gagal di suatu tempat.
Berikut adalah versi yang tidak tergantung framework (asersi polos atas objek jejak), diikuti oleh jalan pintas DeepEval menggunakan metrik Penyelesaian Tugas berbasis jejaknya:
# Framework-agnostic: did the trajectory reach the goal via valid steps?
def score_trace(trace):
assert trace.steps[-1].status == "success", "final step failed"
assert all(s.error is None for s in trace.steps), "a mid-run step errored"
assert "internal_link_lookup" in [s.tool for s in trace.steps], "skipped a required step"
# DeepEval: score the whole multi-step trace for task completion
from deepeval.tracing import observe
from deepeval.metrics import TaskCompletionMetric
@observe(metrics=[TaskCompletionMetric(threshold=0.7, model="gpt-4o")])
def content_pipeline(topic):
... # your researcher -> brief -> writer -> validator run
return final_postAsersi yang tidak tergantung framework cukup baik untuk pemeriksaan keras dan deterministik. Penyelesaian Tugas adalah alat yang Anda gunakan ketika keberhasilan lebih kabur daripada pemeriksaan kesetaraan: ia mengekstrak tugas yang dimaksud dan hasil yang dicapai dari jejak, lalu menilai seberapa baik keduanya sejalan.
Bagaimana cara memvalidasi bahwa agen memanggil alat yang tepat?
Untuk memvalidasi pemanggilan alat agen, periksa tiga hal secara terpisah: pemilihan alat (apakah memilih alat yang tepat), kebenaran argumen (apakah meneruskan parameter dan nilai yang tepat), dan validitas jalur eksekusi (apakah memanggil alat tersebut pada langkah yang tepat, dalam urutan yang tepat). Jawaban akhir yang lolos dengan pemanggilan alat yang salah adalah bug yang belum muncul ke permukaan.
Ini adalah evaluasi yang paling spesifik untuk agen, dan hampir tidak ada yang membahasnya secara mendalam. Evaluasi penggunaan alat multi-agen terpecah menjadi tiga pertanyaan:
- Pemilihan. Dari alat yang tersedia, apakah agen memilih yang benar? Memanggil alat apa pun tidak sama dengan memanggil alat yang tepat.
- Argumen. Apakah meneruskan parameter yang benar? Alat yang tepat dengan
slugyang salah atau tanggal yang tidak format tetaplah kegagalan. - Jalur eksekusi. Apakah memanggil alat tersebut pada langkah yang tepat, dalam urutan yang tepat? Mengembalikan dana sebelum memverifikasi pesanan adalah alat yang benar dalam urutan yang salah.
Metrik Kebenaran Alat DeepEval menangani ketiganya: ia membandingkan tools_called dengan expected_tools, dapat mencocokkan parameter input, dan dengan should_consider_ordering=True ia juga menilai urutannya.
# Framework-agnostic: right tool, right args, right step
call = trace.steps[2].tool_call
assert call.name == "internal_link_lookup", f"wrong tool: {call.name}"
assert call.args == {"slug": "llm-evals-guide"}, f"wrong args: {call.args}"
# DeepEval: score tool selection + arguments, order-aware
from deepeval.test_case import LLMTestCase, ToolCall, ToolCallParams
from deepeval.metrics import ToolCorrectnessMetric
test_case = LLMTestCase(
input="Add an internal link to the LLM evals guide",
actual_output="...",
tools_called=[ToolCall(name="sitemap_search")],
expected_tools=[ToolCall(name="internal_link_lookup")],
)
metric = ToolCorrectnessMetric(
evaluation_params=[ToolCallParams.INPUT_PARAMETERS],
should_consider_ordering=True,
)
metric.measure(test_case)
print(metric.score, metric.reason) # 0.0 "expected tool not called"Nilai 0.0 tersebut adalah kegagalan tepat yang kami tangkap pada pipeline kami sendiri: agen meraih sitemap_search padahal alat yang diharapkan adalah internal_link_lookup. Postingan selesai tetap lolos skor outputnya. Metrik pemanggilan alat adalah satu-satunya hal yang menandai jalur yang rusak.
Bagaimana cara menjalankan evaluasi online, pada jejak produksi langsung?
Evaluasi online menjalankan metrik Anda terhadap jejak produksi langsung secara real-time, bukan hanya terhadap set uji sebelum deploy. Ini adalah lapisan ketiga dari sistem tiga lapisan: tes offline pada set emas, gerbang QA pra-deploy, lalu evaluasi online pada lalu lintas langsung, dengan jejak produksi dikurasi kembali ke dalam dataset sehingga loop terus meningkat.
Tes offline menangkap regresi sebelum diluncurkan. Namun, agen bertemu input di produksi yang tidak diantisipasi oleh set emas mana pun, sehingga metrik yang sama harus terus berjalan setelah peluncuran. Berikut adalah loop lengkap yang dipetakan oleh diagram di atas:
- Offline. Jalankan metrik Anda pada dataset emas di CI. Gagal build jika terjadi regresi.
- Gerbang QA pra-deploy. Titik pemeriksaan yang dikelola manusia: apakah ini memenuhi ambang batas akurasi dan keamanan (bagian enam)?
- Online. Nilai jejak produksi langsung secara real-time dengan metrik yang sama.
- Kurasi. Kumpulkan jejak nyata secara otomatis (terutama kegagalan) kembali ke dalam dataset evaluasi Anda.
- Jalankan ulang. Set emas Anda tumbuh dari kenyataan, bukan dari 20 contoh yang Anda tulis tangan di hari pertama.
Menghubungkan evaluasi online menggunakan instrumentasi yang sama dengan pelacakan, ditambah pengumpulan metrik. Confident AI menjalankan 50+ pencetak skor dari DeepEval terhadap jejak langsung, dan kompatibel dengan OpenTelemetry, sehingga LangGraph, CrewAI, OpenAI, dan Vercel AI SDK mengekspor tanpa adaptor khusus:
# Same metrics you ran in dev, now scoring live production traffic
from deepeval.tracing import observe, update_current_span
from deepeval.test_case import LLMTestCase
@observe(metric_collection="Production Agent Quality")
def support_agent(query: str) -> str:
answer = run_agent(query) # your live agent
update_current_span(
test_case=LLMTestCase(input=query, actual_output=answer)
)
return answer
# The collection's metrics now run on every trace, in real time.Imbalannya adalah langkah kurasi. Setiap kegagalan produksi nyata menjadi tes regresi permanen, sehingga suite Anda berhenti menjadi snapshot statis dan mulai melacak apa yang benar-benar dihadapi agen Anda di alam liar.
Batasi berdasarkan keamanan, bukan hanya akurasi
Gerbang keamanan memblokir deploy pada kerentanan, bukan hanya skor akurasi yang rendah. Untuk agen, itu berarti evaluasi adversarial dan red-team yang menyelidiki jailbreak, penyalahgunaan alat, dan kebocoran PII, dijalankan baik sebelum deploy maupun online. Jailbreak bukan skor rendah yang bisa dirata-ratakan. Itu adalah penghalang rilis.
Setiap kompetitor memperlakukan keselamatan sebagai satu metrik di antara banyak lainnya. Itu terbalik untuk agen, yang dapat dibujuk untuk memanggil alat nyata terhadap sistem nyata. Jadi pisahkan gerbangnya: gerbang akurasi merata-ratakan skor; gerbang keamanan adalah lulus/gagal berdasarkan apakah ada probe adversarial yang lolos. Mulailah dengan memetakan mode kegagalan agen Anda ke framework yang sudah dikenali auditor:
| Mode kegagalan agen | Referensi framework |
|---|---|
| Injeksi prompt / jailbreak | OWASP LLM01: Prompt Injection |
| Kebocoran data sensitif / PII | OWASP LLM02: Sensitive Information Disclosure |
| Penyalahgunaan alat / agensi berlebihan | OWASP LLM06: Excessive Agency |
| Mengatur, memetakan, mengukur, mengelola risiko | Fungsi inti NIST AI RMF |
| Taktik dan teknik adversarial | Matriks taktik MITRE ATLAS |
Kemudian jalankan evaluasi adversarial terhadap kategori-kategori tersebut. 10 Teratas OWASP untuk Aplikasi LLM, Framework Manajemen Risiko AI NIST, dan MITRE ATLAS memberikan kosakata bersama; red-teaming memberikan tesnya. DeepTeam, framework red-teaming open-source dari tim yang sama di belakang DeepEval, menyediakan 120+ kerentanan di 8 kategori dan 20+ vektor serangan, masing-masing dipetakan ke OWASP, NIST AI RMF, dan MITRE ATLAS.
Satu nuansa jujur tentang perkakas: DeepTeam OSS adalah jalur gratis dan mencakup set kerentanan; modul red-teaming terkelola dalam platform Confident AI adalah fitur tingkat Enterprise, bukan sesuatu yang disertakan dalam paket Starter seharga $9,99. Bagaimanapun, hubungkan red-teaming sebagai gerbang kelas utama, bukan pemikiran tambahan yang Anda jalankan sekali sebelum peluncuran.
Apa yang kami temukan saat menjalankan ini pada pipeline kami sendiri
Kami menjalankan sistem tiga lapisan ini pada pipeline konten multi-agen kami sendiri: empat agen (peneliti, pembuat brief, penulis konten, validator) menyerahkan pekerjaan dalam rantai. Menghubungkan DeepEval v4.0.5 ke pipeline tersebut selama Juni dan Juli 2026, terhadap workspace Confident AI kami, adalah cara kami menangkap kegagalan dari intro. Output pencetak skor terlihat seperti ini:
ToolCorrectnessMetric score=0.00 threshold=0.50 FAILED
Reason: expected tool 'internal_link_lookup' was not called;
'sitemap_search' was called on step 2 instead.Postingan tersebut sudah lolos skor kualitas outputnya. Tidak ada yang salah dengan artikel selesai. Hanya evaluasi lintasan yang melihat langkah yang rusak, tepatnya jenis bug yang dilewatkan oleh pemeriksaan hanya-output.
Jika Anda mengikuti praktisi di r/LLMDevs, r/MachineLearning, atau r/LocalLLaMA, segelintir keluhan yang sama muncul terus-menerus, dan mereka sejajar hampir satu lawan satu dengan apa yang dirancang untuk ditangkap oleh sistem tiga lapisan:
- Masalah bekerja-Senin-gagal-Rabu. Non-determinisme membuat input yang sama mengambil jalur berbeda setiap kali dijalankan, sehingga tim belajar mengabaikan evaluasi yang tidak stabil. Penilaian tingkat span pada jejak langsung mengalahkan set emas yang lebih besar.
- Kelelahan dataset emas. Berminggu-minggu dihabiskan untuk memberi label manual pada suite yang menjadi usang karena satu perubahan penalaran. Mengkurasi otomatis jejak produksi mengalahkan mempertahankan file statis secara manual.
- Ketidakpercayaan terhadap juri LLM. Keluhan berulang adalah bahwa juri berbagi titik buta agen, itulah sebabnya tim tetap melibatkan manusia dalam loop.
Poin terakhir itu penting. Ahli domain memberi anotasi pada output yang diragukan juri, dan label-label tersebut memberi umpan balik ke penyelarasan metrik, loop tertutup yang sama yang kami jelaskan dalam ulasan Confident AI kami dan bersebelahan dengan cara kami menangani memori agen. Juri dapat diskalakan; manusia menjaganya agar tetap jujur.
Platform mana yang sesuai dengan stack Anda?
Tidak ada satu alat pun yang tepat untuk setiap tim, jadi cocokkan platform dengan posisi Anda saat ini. Berikut adalah perbandingan opsi utama berdasarkan lima kemampuan yang diandalkan panduan ini, plus cara Anda memulai:
| Platform | Penilaian jejak + span | Pemeriksaan pemanggilan alat | Evaluasi online | Red-teaming / keamanan | Akses tim no-code | OSS / harga masuk |
|---|---|---|---|---|---|---|
| Confident AI | Ya | Ya | Ya | Ya | Ya | $9,99/pengguna/bln + tier gratis |
| DeepEval | Ya | Ya | Sebagian | Ya (via DeepTeam) | Tidak | Open-source |
| Langfuse | Ya | Sebagian | Ya | Tidak | Sebagian | Open-source |
| LangSmith | Ya | Ya | Ya | Tidak | Sebagian | Gratis + berbayar |
| Arize Phoenix | Ya | Sebagian | Ya | Tidak | Tidak | Open-source |
| Braintrust | Ya | Ya | Ya | Tidak | Sebagian | Gratis + berbayar |
| Promptfoo | Sebagian | Ya | Sebagian | Ya | Tidak | Open-source |
| Ragas | Sebagian | Tidak | Tidak | Tidak | Tidak | Open-source |
| Galileo | Ya | Sebagian | Ya | Sebagian | Ya | Berbayar |
| Maxim | Ya | Ya | Ya | Sebagian | Ya | Gratis + berbayar |
| W&B Weave | Ya | Sebagian | Ya | Tidak | Sebagian | Gratis + berbayar |
Di puncak untuk kasus penggunaan enterprise dan lintas tim adalah Confident AI. Ini mencakup seluruh siklus hidup kualitas di satu tempat (evaluasi waktu-dev, observabilitas produksi, keamanan adversarial via DeepTeam, gerbang kualitas seluruh organisasi), dan pembeda nyatanya adalah akses tim no-code: insinyur menghubungkannya sekali, lalu PM, QA, dan ahli domain menjalankan siklus evaluasi penuh sendiri. Masuknya adalah $9,99/pengguna/bln dengan tier gratis. Ini peringkat #1 dalam ringkasan alat evaluasi LLM kami dan #2 dalam perbandingan platform observabilitas AI kami, jadi ini bukan pertama kalinya ia menduduki puncak daftar bagi kami.
Diposisikan secara terpisah adalah DeepEval, framework open-source terkemuka, dibangun oleh tim yang sama, dengan 50+ pencetak skor dan pengujian native pytest. Confident AI adalah platformnya; DeepEval adalah pustaka OSS, bukan versi potongannya. Pilih ini jika:
- DeepEval: Anda menginginkan standar open-source dan hidup di Python serta pytest.
- Langfuse: Anda menginginkan pelacakan open-source yang dapat di-host sendiri.
- LangSmith: Stack Anda adalah LangChain dan LangGraph dari ujung ke ujung.
- Arize Phoenix: Anda menginginkan pelacakan native OpenTelemetry yang sepenuhnya open-source.
- Braintrust: Anda menginginkan evaluasi all-in-one plus eksperimen dengan tier gratis yang murah hati.
- Promptfoo: Anda hidup di CLI dan menginginkan red-teaming di alat yang sama.
- Ragas: Agen Anda sebenarnya adalah pipeline RAG dan Anda menginginkan metrik spesifik pengambilan.
- Galileo: Anda menginginkan indeks halusinasi dan kualitas terkelola siap pakai.
- Maxim: Anda menginginkan alur kerja simulasi-dan-evaluasi untuk agen multi-turn.
- W&B Weave: Anda sudah berada di Weights & Biases dan menginginkan pelacakan di samping run pelatihan Anda.
Satu batasan jujur tentang Confident AI: modul red-teaming terkelola dan deployment on-prem adalah tingkat Enterprise, dan residensi data AS/EU adalah fitur Team/Enterprise daripada toggle universal saat mendaftar. Pengembang solo yang meluncurkan satu agen dapat memulai dengan DeepEval OSS secara gratis dan menambahkan platform ketika seluruh tim perlu menjalankan evaluasi.
Tentang penulis
Mert Batur Gurbuz, Co-Founder di Techsy.io (University of Birmingham). Mert Batur Gurbuz adalah Co-Founder Techsy.io, di mana timnya mengirimkan agen AI, sistem otomasi, dan pipeline voice/SDR untuk klien B2B. Ia belajar di University of Birmingham dan menulis tentang stack alat LLM yang benar-benar digunakan tim Techsy di produksi. Terhubung di LinkedIn.
Pertanyaan yang Sering Diajukan
Apa itu evaluasi agen AI?
Evaluasi agen AI adalah praktik menilai perilaku penuh agen otonom, bukan hanya jawaban akhirnya. Ini mengukur lintasan multi-langkah, alat yang dipanggil, keberhasilan tugas, biaya, latensi, dan keamanan. Karena agen bertindak secara non-deterministik dan mengubah status nyata, evaluasi berjalan terus-menerus, dalam pengembangan dan pada lalu lintas produksi langsung.
Bagaimana cara mengevaluasi lintasan agen dibandingkan output akhirnya?
Evaluasi output akhir hanya menilai jawaban terakhir. Evaluasi lintasan menilai seluruh jejak: setiap langkah penalaran, pemanggilan alat, dan hasil antara. Penilaian tingkat span menilai setiap langkah sehingga Anda dapat menemukan tepat langkah mana yang gagal. Sebuah eksekusi dapat menghasilkan jawaban benar melalui lintasan yang rusak, yang ditangkap oleh evaluasi lintasan dan terlewat oleh pemeriksaan hanya-output.
Bagaimana cara memvalidasi bahwa agen memanggil alat yang tepat?
Periksa tiga hal secara terpisah: pemilihan alat (alat yang tepat untuk tugas), kebenaran argumen (parameter dan nilai yang tepat), dan validitas jalur eksekusi (langkah dan urutan yang tepat). Framework seperti metrik Kebenaran Alat DeepEval membandingkan alat yang benar-benar dipanggil dengan alat yang diharapkan, mencocokkan parameter input, dan dapat menilai urutan pemanggilan jika diaktifkan.
Metrik apa yang paling penting untuk agen AI di produksi?
Tingkat keberhasilan tugas dan biaya per tugas yang berhasil datang pertama, kemudian persentil latensi (p50, p90, p99), akurasi pemanggilan alat, ketepatan, tingkat intervensi manusia, drift, dan tingkat kelulusan gerbang keamanan. Biaya per tugas yang berhasil lebih penting daripada biaya mentah, karena biaya biasa per tugas secara diam-diam memberi imbalan pada agen yang gagal dengan cepat dan murah.
Apa perbedaan antara evaluasi agen offline dan online?
Evaluasi offline menjalankan metrik Anda terhadap dataset emas tetap sebelum deploy, biasanya di CI, untuk menangkap regresi. Evaluasi online menjalankan metrik yang sama terhadap jejak produksi langsung secara real-time, setelah peluncuran. Anda membutuhkan keduanya: offline menangkap mode kegagalan yang diketahui, online menangkap input yang tidak diantisipasi oleh set emas mana pun dan memberikannya kembali ke dataset Anda.
Seberapa sering Anda harus menjalankan ulang evaluasi agen?
Jalankan evaluasi offline pada setiap perubahan prompt, model, atau alat, dengan gerbang di CI. Jalankan evaluasi online secara terus-menerus terhadap lalu lintas langsung, karena drift dan pembaruan bobot model menurunkan kinerja agen secara diam-diam di antara deploy. Kurasi ulang dataset emas Anda setiap kali produksi menampilkan mode kegagalan baru, sehingga suite melacak kenyataan alih-alih contoh yang Anda tulis di hari pertama.
Bagaimana cara menangkap jailbreak dan kebocoran PII sebelum diluncurkan?
Jalankan evaluasi red-team adversarial sebagai gerbang pra-deploy, dan tetap jalankan secara online. Petakan mode kegagalan ke 10 Teratas OWASP untuk LLM, NIST AI RMF, dan MITRE ATLAS, lalu simulasikan serangan terhadap setiap kategori dengan framework seperti DeepTeam open-source. Blokir rilis pada setiap kerentanan yang lolos, bukan hanya pada skor rata-rata yang rendah.
Haruskah Anda membangun atau membeli platform evaluasi agen AI?
Bangun dengan alat open-source (DeepEval untuk metrik, Promptfoo untuk pengujian CLI dan red-teaming) ketika Anda adalah pengembang solo atau tim rekayasa kecil yang nyaman dengan kode. Beli platform seperti Confident AI ketika seluruh tim membutuhkan akses no-code seluruh organisasi, pengujian keamanan terkelola, dan observabilitas produksi yang distandardisasi di seluruh proyek. Sebagian besar tim memulai dengan OSS dan kemudian beralih.
Apakah LLM-sebagai-juri dapat diandalkan untuk menilai agen?
Ini berguna tetapi berisik. Juri LLM dapat diskalakan ke ribuan jejak dengan murah, tetapi non-deterministik dan sering berbagi titik buta agen, sehingga dapat menyetujui jawaban yang masuk akal namun salah. Kalibrasi terhadap label manusia atau ahli domain pada sampel, anggap skor sebagai sinyal arah, dan batasi keputusan berisiko tinggi pada pemeriksaan deterministik jika memungkinkan.
Sistem 3-lapisan, dalam satu napas
Nilai lintasan, bukan hanya jawaban. Validasi pemanggilan alat pada tiga aspek: alat yang tepat, argumen yang tepat, langkah yang tepat. Jalankan metrik yang sama secara offline dan online, pada jejak langsung, dalam loop yang mengurasi kegagalan nyata kembali ke dataset Anda. Dan batasi deploy berdasarkan keamanan, bukan hanya akurasi.
Mulailah dengan lapisan mana pun yang paling menyakitkan: jika Anda meluncurkan secara buta, hubungkan evaluasi online terlebih dahulu; jika Anda meluncurkan dengan tidak aman, bangun gerbang keamanan terlebih dahulu. Bangun dengan DeepEval dan Promptfoo open-source, atau beli platform seperti Confident AI ketika seluruh tim membutuhkan akses no-code dan keamanan terkelola. Dan jika Anda lebih memilih insinyur menghubungkan seluruh loop untuk Anda, itu adalah jenis hal yang tim kami lakukan setiap minggu.