
Online vs Offline Αξιολόγηση LLM: Ποια Χρειάζεστε (και Πότε)
Η online vs offline αξιολόγηση LLM είναι μία απόφαση, όχι δύο, και η σουίτα promptfoo μας το απέδειξε την περασμένη Τρίτη: ένα ξαναγραμμένο system prompt, 47 test cases, η πιστότητα (faithfulness) να πέφτει από 0,91 σε 0,74 σε περίπου 90 δευτερόλεπτα χρόνου CI. Ο offline έλεγχος έπιασε αυτή την οπισθοδρόμηση πριν από τη συγχώνευση· η παρακολούθηση παραγωγής θα τη συναντούσε αργότερα, μεταμφιεσμένη σε νήμα υποστήριξης. Offline και online, ίδια ετυμηγορία: δύο λωρίδες, διαφορετικές δουλειές.
Η offline αξιολόγηση LLM τρέχει το μοντέλο σας απέναντι σε ένα σταθερό σύνολο δεδομένων πριν από το deployment, αποδεικνύοντας ότι μια αλλαγή δεν έσπασε τη μετρημένη ποιότητα. Η online αξιολόγηση βαθμολογεί τη ζωντανή κίνηση παραγωγής μετά την κυκλοφορία, αποκαλύπτοντας όσα το σύνολο δεδομένων δεν περιείχε ποτέ. Οι περισσότερες ομάδες χρειάζονται και τα δύο, με σειρά: το offline βάζει πύλη στο deploy, το online πιάνει την απόκλιση.
Βασικά Συμπεράσματα
- Η offline αξιολόγηση τρέχει σε σταθερό σύνολο δεδομένων πριν από το deploy· η online βαθμολογεί τη ζωντανή κίνηση μετά την κυκλοφορία.
- Οι περισσότερες ομάδες χρειάζονται και τα δύο: το offline βάζει πύλη στα deploys, το online πιάνει όσα ξέφυγαν από το σύνολο δεδομένων.
- Το offline πιάνει οπισθοδρομήσεις prompt και σπασίματα μορφής· το online πιάνει απόκλιση, καθυστέρηση υπό φορτίο και ιδιορρυθμίες ενοποίησης.
- Συνδέστε τα offline evals ως πύλη συγχώνευσης CI· διοχετεύστε online βαθμολογίες από τα traces παραγωγής μέσα στο eval set σας.
Πώς Διαφέρουν Πραγματικά η Online και η Offline Αξιολόγηση; (9 Διαστάσεις)
Οι δύο τρόποι διαφέρουν σε εννέα άξονες, αλλά ο κρίσιμος είναι η πηγή δεδομένων: η offline αξιολόγηση βαθμολογεί ένα σταθερό, versioned σύνολο δεδομένων πριν από το deploy, ενώ η online βαθμολογεί τη ζωντανή κίνηση μετά την κυκλοφορία. Κάθε άλλη διαφορά, από κόστος και καθυστέρηση έως ρίσκο και διακυβέρνηση, πηγάζει από αυτόν τον διαχωρισμό.
Το learning center του Label Studio παρουσιάζει το ζεύγος ως συμπληρωματικούς τρόπους και όχι ως αντιπάλους, και συμφωνούμε. Ο πίνακας επεκτείνει αυτή την προσέγγιση με μετρικές ειδικές για LLM, που η γενική εκδοχή τους για ML δεν καλύπτει.
| Διάσταση | Offline | Online |
|---|---|---|
| Πηγή δεδομένων | Σταθερό golden σύνολο, versioned στο git | Ζωντανά traces παραγωγής, με δειγματοληψία |
| Χρονισμός | Πριν από το deploy, σε κάθε PR | Μετά την κυκλοφορία, συνεχώς |
| Κόστος ανά εκτέλεση | Judge tokens ανά εκτέλεση σουίτας· σχεδόν μηδενικό οριακό κόστος | Judge tokens σε δειγματοληπτημένη κίνηση· κλιμακώνεται με τον όγκο |
| Περιορισμός καθυστέρησης | Κανένας· batch με την ησυχία σας | Budgets κάτω του δευτερολέπτου στα κρίσιμα μονοπάτια |
| Ρίσκο για τους χρήστες | Μηδέν· οι αποτυχίες δεν φτάνουν ποτέ στους χρήστες | Πραγματικό· οι κακές απαντήσεις χτυπούν ζωντανές συνεδρίες |
| Ταχύτητα ανατροφοδότησης | Λεπτά ανά PR | Δευτερόλεπτα έως λεπτά στα streams |
| Τύποι μετρικών | Πιστότητα, συνάφεια απάντησης, συμμόρφωση μορφής, βαθμολογίες benchmark | Εκατοστημόρια καθυστέρησης, ποσοστό σφαλμάτων, ποσοστό ψευδαισθήσεων, ανατροφοδότηση χρηστών |
| Επαναληψιμότητα | Ντετερμινιστική με καρφωμένο μοντέλο και σύνολο | Μη ντετερμινιστική· η μίξη κίνησης αλλάζει καθημερινά |
| Διακυβέρνηση και έλεγχος | Versioned τεκμήρια, συγκρίσιμα μεταξύ εκδόσεων | Dashboards και ειδοποιήσεις· πιο δύσκολη αναπαραγωγή |
Η δική μας ερμηνεία: η στήλη offline απαντά στο «αυτή η αλλαγή έσπασε κάτι;» και η στήλη online απαντά στο «η παραγωγή αποκλίνει από ό,τι δοκιμάσαμε;». Η σειρά των τύπων μετρικών είναι εκεί που οι δύο τρόποι αποκλίνουν περισσότερο· ο οδηγός μας για τις μετρικές αξιολόγησης LLM αναλύει την καθεμία.
Τι Πιάνει Κάθε Τρόπος και Τι Πέφτει Και Από Τους Δύο;
Κάθε τρόπος κατέχει μια ιδιωτική κλάση αποτυχιών που ο άλλος δεν βλέπει. Το offline πιάνει τις αλλαγές που κάνατε εσείς· το online πιάνει τις αλλαγές που έκανε ο κόσμος γύρω σας. Οι ακριβές αποτυχίες, αυτές που επιβιώνουν και από τα δύο δίχτυα, χρειάζονται ανθρώπινο αναθεωρητή. Αυτή η ταξινόμηση είναι η δική μας σύνθεση όσων αναφέρει κάθε τρόπος, όχι κάποιο δημοσιευμένο πρότυπο.
| Τεταρτημόριο | Παραδείγματα | Ενέργεια |
|---|---|---|
| Μόνο offline | Οπισθοδρομήσεις prompt, σπασμένες μορφές εξόδου, πτώσεις βαθμολογίας benchmark, πιστότητα κάτω από το κατώφλι | Αποκλεισμός συγχώνευσης στο CI |
| Μόνο online | Απόκλιση κατανομής, καθυστέρηση υπό φορτίο, ιδιορρυθμίες ενοποίησης, πρότυπα κακόβουλης χρήσης | Ειδοποίηση, δειγματοληψία των traces, διοχέτευσή τους στο eval set |
| Πιάνονται και από τα δύο | Εξάρσεις ποσοστού ψευδαισθήσεων, διάβρωση γεγονωτικής συνέπειας | Κρατήστε και τα δύο· αφαιρέστε τη διπλή δουλειά, όχι την κάλυψη |
| Δεν πιάνονται από κανένα | Νέες ακραίες περιπτώσεις, υποκειμενικές κρίσεις ποιότητας, απόκλιση τόνου φωνής brand | Ουρά ανθρώπινης αναθεώρησης· οι επισημασμένες περιπτώσεις τροφοδοτούν το offline σύνολο |
Το τεταρτημόριο «μόνο offline» είναι εκεί που οι πύλες CI αποδεικνύουν την αξία τους: ένα ξαναγραμμένο prompt που ρίχνει αθόρυβα τη συμμόρφωση μορφής από 99% σε 91% είναι αόρατο στο code review και ολοφάνερο σε μια σουίτα 47 περιπτώσεων. Το τεταρτημόριο «μόνο online» είναι πιο πονηρό. Οι πραγματικοί χρήστες διατυπώνουν πράγματα που το golden set σας δεν είπε ποτέ, τα API τρίτων κάνουν timeout σε χρονοδιαγράμματα που το staging δεν συναντά ποτέ, και κάποιος θα ταΐσει το chatbot σας με ένα prompt 40.000 χαρακτήρων απλώς για να δει τι θα γίνει. Για εκείνη την πλευρά, ο οδηγός μας για την αξιολόγηση agents στην παραγωγή καλύπτει τη βαθμολόγηση πολυβηματικών τροχιών, όχι μόνο μεμονωμένων εξόδων.
Η τελευταία σειρά είναι αυτή που οι ομάδες παραλείπουν, και αυτή που τις καίει. Οι αποτυχίες που σας κοστίζουν χρήστες είναι αυτές που κανένας τρόπος δεν πιάνει μόνος του. Χρειάζονται έναν άνθρωπο μέσα στον βρόχο.
Πώς Συνδέετε τα Offline Evals σε μια Πύλη CI; (Η Διαμόρφωση Που Κανείς Δεν Δείχνει)
Προσθέστε έναν eval runner ως απαιτούμενο status check σε κάθε pull request που αγγίζει prompt, μοντέλο ή διαμόρφωση ανάκτησης. Ορίστε ένα κατώφλι. Αποκλείστε τη συγχώνευση κάτω από αυτό. Το promptfoo τεκμηριώνει ακριβώς αυτό το μοτίβο CI, και είναι αυτό που τρέχουμε.
Το βήμα GitHub Actions
Μια λιτή εκδοχή της πύλης που τρέχουμε σήμερα:
name: llm-eval-gate
on:
pull_request:
paths: ["prompts/**", "evals/**", "src/rag/**"]
jobs:
faithfulness-gate:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v4
- uses: actions/setup-node@v4
with:
node-version: 22
- name: Run offline evals, fail the PR on regression
run: npx promptfoo@latest eval --config evals/support-agent.yaml
env:
OPENAI_API_KEY: ${{ secrets.OPENAI_API_KEY }} # LLM-as-judgeΗ διαμόρφωση YAML δηλώνει τα test cases και τους ισχυρισμούς· το eval επιστρέφει μη μηδενικό κωδικό όταν η σουίτα πέφτει κάτω από το κατώφλι, το GitHub σημαίνει το απαιτούμενο check ως αποτυχημένο και το κουμπί συγχώνευσης γκριζάρει. Το φίλτρο paths έχει σημασία: μια διόρθωση στο README δεν πρέπει να καίει judge tokens.
Τι πιάνει πραγματικά η πύλη
Η ζωντανή εκδοχή βαθμολογεί την αλυσίδα RAG του support agent μας απέναντι σε 47 golden περιπτώσεις σε κάθε PR που επηρεάζει prompt. Μια πλήρης εκτέλεση παίρνει περίπου 90 δευτερόλεπτα χρόνου CI, και η συγχώνευση μπλοκάρεται αυτόματα αν η πιστότητα πέσει κάτω από 0,82. Σε τρεις μήνες, έχει πιάσει δύο οπισθοδρομήσεις που αλλιώς θα κυκλοφορούσαν: μια επανεγγραφή system prompt που έσπρωξε την πιστότητα από 0,91 σε 0,74, και μια αλλαγή στον retriever που διπλασίασε το μήκος context και έσυρε τη συνάφεια απάντησης κάτω από το κατώφλι. Καμία από τις δύο δεν φαινόταν επικίνδυνη στο review.
Μια πύλη πιστότητας στο CI κοστίζει 90 δευτερόλεπτα ανά PR. Μια οπισθοδρόμηση πιστότητας στην παραγωγή σας κοστίζει ένα νήμα υποστήριξης και ένα rollback.
Συγκρίναμε τους runners που μπορείτε να συνδέσετε σε αυτό το μοτίβο, promptfoo, DeepEval και τους υπόλοιπους, στη στρογγυλή ανασκόπηση εργαλείων αξιολόγησης LLM που κάναμε.
Ποια Εργαλεία Τρέχουν Ποιον Τρόπο; (Μήτρα Εργαλείου-προς-Τρόπο)
Κανένα μεμονωμένο εργαλείο δεν κατέχει και τις δύο λωρίδες καθαρά. Το promptfoo και το DeepEval είναι offline-first runners που μπορούν να βαθμολογούν εξαγμένα δεδομένα παραγωγής σε πρόγραμμα· το Langfuse και το LangSmith είναι online-first αποθήκες traces που προσαρτούν LLM-as-judge scorers πάνω σε εισερχόμενα traces. Η μήτρα είναι η δική μας ανάγνωση της τεκμηρίωσης κάθε προμηθευτή: ερμηνεία, όχι ευαγγέλιο.
| Εργαλείο | Offline runner | Online scorer | Και τα δύο εγγενώς; | Τι ΔΕΝ κάνει |
|---|---|---|---|---|
| promptfoo | Ναι: σουίτες YAML, εγγενές CI, πακέτα red-team | Μερικά: ίδιες διαμορφώσεις σε εξαγόμενα logs | Offline-first· το online χρειάζεται βήμα εξαγωγής | Εισαγωγή ζωντανών traces· ρόλος dashboard παρακολούθησης |
| DeepEval | Ναι: δοκιμές τύπου pytest, 14+ μετρικές | Ναι, μέσω της πλατφόρμας Confident AI | Ναι, με τη φιλοξενούμενη επέκταση | Η βιβλιοθήκη ανοιχτού κώδικα μόνη της είναι μόνο offline |
| Langfuse | Μερικά: πειράματα dataset μέσω SDK | Ναι: judge evaluators σε εισαγόμενα traces | Ναι: datasets συν scorers traces | Τρέχει την πύλη συγχώνευσης CI· αυτό το συνδέετε μόνοι σας |
| LangSmith | Ναι: datasets και offline πειράματα | Ναι: αυτοματισμοί βαθμολογούν δειγματοληπτημένα traces | Ναι | Ζει έξω από το stack του LangChain χωρίς τριβές |
| OpenAI Evals | Ναι: evals τύπου registry YAML | Όχι | Όχι | Pipelines traces παραγωγής· μοντέλα εκτός OpenAI |
| Arize Phoenix | Ναι: πειράματα με προτεραιότητα το notebook | Ναι: spans και traces με ενσωματωμένα evaluators | Ναι | Ελαφρύ στήσιμο· η παρατηρησιμότητα προηγείται |
Διαλέξτε promptfoo ή DeepEval αν η πρώτη σας ανάγκη είναι μια πύλη συγχώνευσης που μπλοκάρει τα κακά prompts στο CI. Διαλέξτε Langfuse ή LangSmith αν η πρώτη σας ανάγκη είναι η βαθμολόγηση ζωντανής κίνησης, και η σύγκριση Langfuse vs LangSmith που έχουμε κάνει μπαίνει βαθιά σε αυτή την επιλογή. Το OpenAI Evals παραμένει το παράξενο: ένας offline runner τύπου registry χωρίς πλευρά παραγωγής.
Το promptfoo βάζει πύλη στα PR σας. Το Langfuse βαθμολογεί τα traces παραγωγής σας. Κανένα δεν αντικαθιστά το άλλο.
Πώς ο Βρόχος Ανατροφοδότησης Μετατρέπει τις Online Αποτυχίες σε Offline Δοκιμές;
Δειγματοληπτήστε traces παραγωγής με χαμηλή βαθμολογία, επισημάνετέ τα και δεσμεύστε τα στο offline eval set. Η σουίτα οπισθοδρόμησης τότε μεγαλώνει με κάθε έκπληξη που σας πετάει η παραγωγή, και το επόμενο deploy μπαίνει υπό πύλη στο διευρυμένο σύνολο. Το πλαίσιο του σφονδύλου είναι δικό μας· είναι το κομμάτι που οι περισσότερες ομάδες δεν χτίζουν ποτέ.
Ο κύκλος, όπως τον τρέχουμε:
- Οι online scorers σημαδεύουν traces κάτω από 0,7 βαθμολογία judge.
- Δειγματοληπτούμε 20 έως 30 σημαδεμένα traces την εβδομάδα.
- Ένας άνθρωπος επισημαίνει το καθένα: αναμενόμενη έξοδος συν κλάση αποτυχίας.
- Οι επισημασμένες περιπτώσεις μπαίνουν στο offline eval set ως νέα golden παραδείγματα.
- Το επόμενο PR τρέχει απέναντι στη διευρυμένη σουίτα, και ο βρόχος ξεκινά ξανά.
Η δειγματοληψία ξεκινά από το στρώμα παρατηρησιμότητας LLM, επειδή τα traces είναι η πρώτη ύλη. Για τον ρυθμό: η εβδομαδιαία νικά τη μηνιαία, επειδή η απόκλιση συσσωρεύεται. Επισημαίνουμε 10 έως 15 περιπτώσεις την εβδομάδα, και το σύνολο είναι «αρκετά μεγάλο» όταν οι νέες επισημάνσεις σταματούν να κινούν το ποσοστό επιτυχίας, γύρω στις 150 έως 250 περιπτώσεις για έναν στενό support agent. Η γραμμή μεταξύ των τρόπων συνεχίζει να θολώνει: το Deepchecks αναφέρει ότι οι μηχανικοί της Union.ai προγραμματίζουν τις «offline» αξιολογήσεις τους κάθε λίγα λεπτά, μετατρέποντάς τες ουσιαστικά σε ελέγχους σχεδόν πραγματικού χρόνου.
Το eval set σας δεν είναι σταθερό τεκμήριο. Μεγαλώνει κάθε εβδομάδα που η παραγωγή σας εκπλήσσει.
Πότε Χρειάζεστε Και Τα Δύο; (Online vs Offline Αξιολόγηση LLM Ανά Στάδιο)
Χρειάζεστε και τα δύο από την εβδομάδα κυκλοφορίας και μετά, αλλά η ισορροπία μετατοπίζεται ανά στάδιο: το offline σηκώνει μόνο του τη δουλειά πριν από το deploy, η εβδομάδα κυκλοφορίας προσθέτει βαθμολόγηση shadow ή canary, η μόνιμη κατάσταση στηρίζεται στην online παρακολούθηση με περιοδικές offline επανεκτελέσεις, και μια ειδοποίηση απόκλισης πρέπει να καταλήγει σε ένα αναπαραγόμενο offline test συν ένα μεγαλύτερο eval set.
| Στάδιο | Offline | Online | Ενέργεια |
|---|---|---|---|
| Πριν από το deploy | Πύλη οπισθοδρόμησης σε κάθε PR | Κανένα ακόμα | Αποκλεισμός συγχώνευσης κάτω από το κατώφλι |
| Εβδομάδα κυκλοφορίας | Πλήρης σουίτα στον release candidate | Βαθμολόγηση shadow ή canary στο 5-10% της κίνησης | Σύγκριση online βαθμολογιών με το offline baseline |
| Μόνιμη κατάσταση | Περιοδική επαναξιολόγηση σε ανανεωμένο σύνολο, εβδομαδιαία ή μηνιαία | Συνεχής δειγματοληπτική βαθμολόγηση συν ειδοποιήσεις | Παρακολούθηση απόκλισης· νέο baseline κάθε τρίμηνο |
| Ανιχνεύθηκε απόκλιση | Αναπαραγωγή των αποτυχημένων traces offline | Η ειδοποίηση που πυροδότησε το έναυσμα | Προσθήκη επισημασμένων traces στο eval set· νέα πύλη στο επόμενο deploy |
Το πριν από το deploy είναι το φθηνότερο μέρος για να είστε αυστηροί: μια αποκλεισμένη συγχώνευση κοστίζει λεπτά· μια κακή κυκλοφορία κοστίζει εμπιστοσύνη. Η εβδομάδα κυκλοφορίας είναι εκεί που οι ομάδες υποεπενδύουν, αν και η βαθμολόγηση shadow σε μικρό κομμάτι κίνησης κοστίζει λίγα και αποκαλύπτει αν το golden σύνολο είπε ψέματα. Η μόνιμη κατάσταση είναι εκεί που μπαίνει η εφησυχασμένη ρουτίνα, οπότε βάλτε την επαναξιολόγηση στο ημερολόγιο.
Τι γίνεται με τον EU AI Act;
Οι υποχρεώσεις υψηλού ρίσκου του EU AI Act μπαίνουν σταδιακά μέχρι τον Αύγουστο του 2026, με το πλήρες χρονοδιάγραμμα προθεσμιών δημοσιευμένο στο EUR-Lex, και το μοτίβο συμμόρφωσης αντιστοιχίζεται καθαρά στους δύο τρόπους. Τεκμηριωμένα offline στοιχεία δείχνουν ότι το σύστημα έπιασε τους στόχους ποιότητας πριν από την κυκλοφορία· η συνεχιζόμενη online παρακολούθηση δείχνει ότι συνεχίζει να τους πιάνει μετά. Η δική μας ανάγνωση είναι ότι ένα ίχνος ελέγχου χρειάζεται και τα δύο τεκμήρια, επειδή τα offline logs μόνα τους δεν αποδεικνύουν ότι το σύστημα παρέμεινε συμμορφούμενο, και τα dashboards μόνα τους δεν αποδεικνύουν ότι κυκλοφόρησε συμμορφούμενο. Αυτή είναι ερμηνεία, όχι νομική συμβουλή· ο πυλώνας μας για το pipeline αξιολόγησης LLM χαρτογραφεί το πλήρες σύνολο απαιτήσεων.
Η offline αξιολόγηση είναι τα αποδεικτικά σας. Η online αξιολόγηση είναι το σύστημα έγκαιρης προειδοποίησής σας. Οι ρυθμιστικές αρχές θέλουν και τα δύο.
Σχετικά με τον συγγραφέα: Ο Mert Batur είναι Συνιδρυτής του Techsy.io, όπου η ομάδα παραδίδει AI agents, συστήματα αυτοματισμού και pipelines φωνής/SDR για B2B πελάτες. Γράφει για το σύνολο εργαλείων LLM που η ομάδα της Techsy χρησιμοποιεί πραγματικά στην παραγωγή. Συνδεθείτε στο LinkedIn.
Συχνές Ερωτήσεις
Τι είναι η offline αξιολόγηση LLM;
Η offline αξιολόγηση LLM τρέχει ένα μοντέλο ή prompt απέναντι σε ένα σταθερό, versioned σύνολο δεδομένων πριν από το deployment. Οι τυπικοί έλεγχοι περιλαμβάνουν πιστότητα στο ανακτημένο context, συνάφεια απάντησης, συμμόρφωση μορφής και βαθμολογίες benchmark. Επειδή το σύνολο δεδομένων δεν αλλάζει ποτέ κατά την εκτέλεση, τα αποτελέσματα είναι επαναλήψιμα και συγκρίσιμα, και αυτός ακριβώς είναι ο λόγος που οι offline σουίτες δουλεύουν ως πύλες συγχώνευσης CI.
Τι είναι η online αξιολόγηση LLM;
Η online αξιολόγηση LLM βαθμολογεί τη ζωντανή κίνηση παραγωγής μετά την κυκλοφορία. Ένας scorer LLM-as-judge βαθμολογεί δειγματοληπτημένα traces για ψευδαισθήσεις, τόνο ή ορθότητα κλήσεων εργαλείων, και οι βαθμολογίες ρέουν σε ένα dashboard. Απορροφά επίσης σήματα που τα offline tests δεν βλέπουν: καθυστέρηση υπό φορτίο, ανατροφοδότηση χρηστών και πώς οι πραγματικές ερωτήσεις διαφέρουν από το golden set σας.
Πότε πρέπει να χρησιμοποιώ offline vs online αξιολόγηση LLM;
Χρησιμοποιήστε την offline αξιολόγηση για να βάλετε πύλη στα deploys: κάθε αλλαγή σε prompt, μοντέλο ή ανάκτηση πρέπει να περνά τη σουίτα πριν από τη συγχώνευση. Χρησιμοποιήστε την online αξιολόγηση για να παρακολουθείτε ό,τι κυκλοφορεί. Οι περισσότερες ομάδες βάζουν τα δύο σε σειρά αντί να διαλέξουν ένα: πρώτα offline, online από την εβδομάδα κυκλοφορίας και μετά, με τις αποτυχίες παραγωγής να επιστρέφουν στο offline σύνολο.
Ποιο είναι ένα παράδειγμα online vs offline αξιολόγησης LLM;
Offline παράδειγμα: μια σουίτα promptfoo τρέχει 200 golden ερωτήσεις υποστήριξης σε κάθε pull request και αποκλείει τη συγχώνευση αν η πιστότητα πέσει κάτω από 0,82. Online παράδειγμα: το Langfuse βαθμολογεί το 10% των ζωντανών traces με έναν έλεγχο ψευδαισθήσεων LLM-as-judge και ειδοποιεί όταν ο εβδομαδιαίος μέσος όρος γλιστράει. Ίδιο βαθμολόγιο, διαφορετική πηγή δεδομένων.
Πώς ταιριάζει ο άνθρωπος στον βρόχο (human-in-the-loop) στην αξιολόγηση LLM;
Οι άνθρωποι κλείνουν το κενό που κανένας τρόπος δεν καλύπτει: νέες ακραίες περιπτώσεις, υποκειμενικές κρίσεις ποιότητας και απόκλιση τόνου φωνής brand. Ένας πρακτικός ρυθμός είναι η επισήμανση 10 έως 20 δειγματοληπτημένων traces χαμηλής βαθμολογίας την εβδομάδα και η δέσμευση των επισημασμένων περιπτώσεων στο offline eval set. Η ουρά αναθεώρησης είναι είσοδος του pipeline, όχι παράπλευρο πρότζεκτ.
Πώς δουλεύουν οι αξιολογήσεις Langfuse για online βαθμολόγηση;
Το Langfuse εισάγει traces από την εφαρμογή σας και μετά προσαρτά LLM-as-judge evaluators που βαθμολογούν κάθε trace απέναντι σε ένα βαθμολόγιο: ψευδαισθήσεις, συνάφεια, τοξικότητα ή ένα προσαρμοσμένο prompt. Οι βαθμολογίες καταλήγουν σε ένα dashboard με κλειδιά συνεδρίες και χρήστες. Οι ομάδες εξάγουν τα επίμονα χαμηλόβαθμα traces σε ένα offline dataset για δοκιμές οπισθοδρόμησης. Η ανασκόπησή μας για πλατφόρμες παρατηρησιμότητας συγκρίνει τις αποθήκες traces που τροφοδοτούν αυτό το μοτίβο.
Πώς προσθέτω offline evals σε ένα pipeline CI/CD;
Προσθέστε έναν eval runner ως απαιτούμενο status check σε pull requests που αγγίζουν prompts, μοντέλα ή διαμόρφωση ανάκτησης. Τόσο το promptfoo όσο και το DeepEval τρέχουν headless και επιστρέφουν μη μηδενικό κωδικό σε αποτυχία ισχυρισμού, κάτι που αποκλείει τη συγχώνευση αυτόματα. Η πύλη YAML νωρίτερα σε αυτό το άρθρο είναι ένα λειτουργικό πρότυπο· ξεκινήστε με 30 έως 50 περιπτώσεις.
Ο EU AI Act απαιτεί offline ή online αξιολόγηση;
Ουσιαστικά, και τα δύο. Για συστήματα υψηλού ρίσκου, ο νόμος περιμένει τεκμηριωμένα αποδεικτικά ότι οι στόχοι ποιότητας πιάστηκαν πριν από την κυκλοφορία, που σημαίνει offline τεκμήρια, συν συνεχιζόμενη παρακολούθηση μετά το deployment, που σημαίνει online τηλεμετρία. Οι σταδιακές προθεσμίες του τρέχουν μέχρι τον Αύγουστο του 2026 σύμφωνα με το EUR-Lex. Αυτή είναι η δική μας ανάγνωση του μοτίβου συμμόρφωσης, όχι νομική συμβουλή.
Μπορεί το LLM-as-a-judge να τρέξει και στους δύο τρόπους, offline και online;
Ναι, και πρέπει, επειδή το βαθμολόγιο μεταφέρεται. Offline, ο judge βαθμολογεί κάθε έξοδο του eval set σε batch κατά το CI. Online, το ίδιο judge prompt βαθμολογεί δειγματοληπτημένα traces παραγωγής σχεδόν σε πραγματικό χρόνο. Το να κρατάτε ένα βαθμολόγιο και στους δύο τρόπους είναι αυτό που κάνει το offline baseline σας συγκρίσιμο με το online σήμα απόκλισης.
Ποιες μετρικές διαφέρουν μεταξύ offline και online αξιολόγησης;
Οι offline μετρικές μετρούν την ποιότητα εξόδου απέναντι στην αλήθεια αναφοράς: πιστότητα, συνάφεια απάντησης, συμμόρφωση μορφής, βαθμολογίες benchmark. Οι online μετρικές προσθέτουν λειτουργικά και συμπεριφορικά σήματα: καθυστέρηση p95, ποσοστό σφαλμάτων, ποσοστό ψευδαισθήσεων σε ζωντανή κίνηση, βαθμολογία απόκλισης και ικανοποίηση χρηστών. Η offline λίστα ρωτάει «είναι καλό;» και η online λίστα ρωτάει «είναι ακόμα καλό;»
Η Σύντομη Εκδοχή
- Η offline και η online αξιολόγηση είναι συμπληρωματικές λωρίδες, όχι δίλημμα «ή αυτό ή εκείνο»: η μία βάζει πύλη σε ό,τι κυκλοφορείτε, η άλλη παρακολουθεί ό,τι κυκλοφορήσατε.
- Ξεκινήστε με την πύλη CI αυτή την εβδομάδα, προσθέστε online βαθμολόγηση traces στην κυκλοφορία και συνδέστε τον βρόχο ανατροφοδότησης πριν μπαγιατέψει το eval set σας.
- Ο βρόχος είναι το σύστημα. Ένα στατικό golden σύνολο σαπίζει· ένα αυξανόμενο συσσωρεύει αξία.
Αν θέλετε ένα δεύτερο ζευγάρι μάτια στο eval pipeline σας, πάρτε μια δωρεάν συμβουλή.