ai-machine-learning

Online vs Offline Αξιολόγηση LLM: Ποια Χρειάζεστε (και Πότε)

Ραίτη Mert Batur
Aug 1, 2026
12 εξάγουμε ανάγνωση
Online vs Offline Αξιολόγηση LLM: Ποια Χρειάζεστε (και Πότε)

Online vs Offline Αξιολόγηση LLM: Ποια Χρειάζεστε (και Πότε)

Η online vs offline αξιολόγηση LLM είναι μία απόφαση, όχι δύο, και η σουίτα promptfoo μας το απέδειξε την περασμένη Τρίτη: ένα ξαναγραμμένο system prompt, 47 test cases, η πιστότητα (faithfulness) να πέφτει από 0,91 σε 0,74 σε περίπου 90 δευτερόλεπτα χρόνου CI. Ο offline έλεγχος έπιασε αυτή την οπισθοδρόμηση πριν από τη συγχώνευση· η παρακολούθηση παραγωγής θα τη συναντούσε αργότερα, μεταμφιεσμένη σε νήμα υποστήριξης. Offline και online, ίδια ετυμηγορία: δύο λωρίδες, διαφορετικές δουλειές.

Η offline αξιολόγηση LLM τρέχει το μοντέλο σας απέναντι σε ένα σταθερό σύνολο δεδομένων πριν από το deployment, αποδεικνύοντας ότι μια αλλαγή δεν έσπασε τη μετρημένη ποιότητα. Η online αξιολόγηση βαθμολογεί τη ζωντανή κίνηση παραγωγής μετά την κυκλοφορία, αποκαλύπτοντας όσα το σύνολο δεδομένων δεν περιείχε ποτέ. Οι περισσότερες ομάδες χρειάζονται και τα δύο, με σειρά: το offline βάζει πύλη στο deploy, το online πιάνει την απόκλιση.

Βασικά Συμπεράσματα

  • Η offline αξιολόγηση τρέχει σε σταθερό σύνολο δεδομένων πριν από το deploy· η online βαθμολογεί τη ζωντανή κίνηση μετά την κυκλοφορία.
  • Οι περισσότερες ομάδες χρειάζονται και τα δύο: το offline βάζει πύλη στα deploys, το online πιάνει όσα ξέφυγαν από το σύνολο δεδομένων.
  • Το offline πιάνει οπισθοδρομήσεις prompt και σπασίματα μορφής· το online πιάνει απόκλιση, καθυστέρηση υπό φορτίο και ιδιορρυθμίες ενοποίησης.
  • Συνδέστε τα offline evals ως πύλη συγχώνευσης CI· διοχετεύστε online βαθμολογίες από τα traces παραγωγής μέσα στο eval set σας.

Πώς Διαφέρουν Πραγματικά η Online και η Offline Αξιολόγηση; (9 Διαστάσεις)

Οι δύο τρόποι διαφέρουν σε εννέα άξονες, αλλά ο κρίσιμος είναι η πηγή δεδομένων: η offline αξιολόγηση βαθμολογεί ένα σταθερό, versioned σύνολο δεδομένων πριν από το deploy, ενώ η online βαθμολογεί τη ζωντανή κίνηση μετά την κυκλοφορία. Κάθε άλλη διαφορά, από κόστος και καθυστέρηση έως ρίσκο και διακυβέρνηση, πηγάζει από αυτόν τον διαχωρισμό.

Το learning center του Label Studio παρουσιάζει το ζεύγος ως συμπληρωματικούς τρόπους και όχι ως αντιπάλους, και συμφωνούμε. Ο πίνακας επεκτείνει αυτή την προσέγγιση με μετρικές ειδικές για LLM, που η γενική εκδοχή τους για ML δεν καλύπτει.

ΔιάστασηOfflineOnline
Πηγή δεδομένωνΣταθερό golden σύνολο, versioned στο gitΖωντανά traces παραγωγής, με δειγματοληψία
ΧρονισμόςΠριν από το deploy, σε κάθε PRΜετά την κυκλοφορία, συνεχώς
Κόστος ανά εκτέλεσηJudge tokens ανά εκτέλεση σουίτας· σχεδόν μηδενικό οριακό κόστοςJudge tokens σε δειγματοληπτημένη κίνηση· κλιμακώνεται με τον όγκο
Περιορισμός καθυστέρησηςΚανένας· batch με την ησυχία σαςBudgets κάτω του δευτερολέπτου στα κρίσιμα μονοπάτια
Ρίσκο για τους χρήστεςΜηδέν· οι αποτυχίες δεν φτάνουν ποτέ στους χρήστεςΠραγματικό· οι κακές απαντήσεις χτυπούν ζωντανές συνεδρίες
Ταχύτητα ανατροφοδότησηςΛεπτά ανά PRΔευτερόλεπτα έως λεπτά στα streams
Τύποι μετρικώνΠιστότητα, συνάφεια απάντησης, συμμόρφωση μορφής, βαθμολογίες benchmarkΕκατοστημόρια καθυστέρησης, ποσοστό σφαλμάτων, ποσοστό ψευδαισθήσεων, ανατροφοδότηση χρηστών
ΕπαναληψιμότηταΝτετερμινιστική με καρφωμένο μοντέλο και σύνολοΜη ντετερμινιστική· η μίξη κίνησης αλλάζει καθημερινά
Διακυβέρνηση και έλεγχοςVersioned τεκμήρια, συγκρίσιμα μεταξύ εκδόσεωνDashboards και ειδοποιήσεις· πιο δύσκολη αναπαραγωγή

Η δική μας ερμηνεία: η στήλη offline απαντά στο «αυτή η αλλαγή έσπασε κάτι;» και η στήλη online απαντά στο «η παραγωγή αποκλίνει από ό,τι δοκιμάσαμε;». Η σειρά των τύπων μετρικών είναι εκεί που οι δύο τρόποι αποκλίνουν περισσότερο· ο οδηγός μας για τις μετρικές αξιολόγησης LLM αναλύει την καθεμία.

Τι Πιάνει Κάθε Τρόπος και Τι Πέφτει Και Από Τους Δύο;

Κάθε τρόπος κατέχει μια ιδιωτική κλάση αποτυχιών που ο άλλος δεν βλέπει. Το offline πιάνει τις αλλαγές που κάνατε εσείς· το online πιάνει τις αλλαγές που έκανε ο κόσμος γύρω σας. Οι ακριβές αποτυχίες, αυτές που επιβιώνουν και από τα δύο δίχτυα, χρειάζονται ανθρώπινο αναθεωρητή. Αυτή η ταξινόμηση είναι η δική μας σύνθεση όσων αναφέρει κάθε τρόπος, όχι κάποιο δημοσιευμένο πρότυπο.

ΤεταρτημόριοΠαραδείγματαΕνέργεια
Μόνο offlineΟπισθοδρομήσεις prompt, σπασμένες μορφές εξόδου, πτώσεις βαθμολογίας benchmark, πιστότητα κάτω από το κατώφλιΑποκλεισμός συγχώνευσης στο CI
Μόνο onlineΑπόκλιση κατανομής, καθυστέρηση υπό φορτίο, ιδιορρυθμίες ενοποίησης, πρότυπα κακόβουλης χρήσηςΕιδοποίηση, δειγματοληψία των traces, διοχέτευσή τους στο eval set
Πιάνονται και από τα δύοΕξάρσεις ποσοστού ψευδαισθήσεων, διάβρωση γεγονωτικής συνέπειαςΚρατήστε και τα δύο· αφαιρέστε τη διπλή δουλειά, όχι την κάλυψη
Δεν πιάνονται από κανέναΝέες ακραίες περιπτώσεις, υποκειμενικές κρίσεις ποιότητας, απόκλιση τόνου φωνής brandΟυρά ανθρώπινης αναθεώρησης· οι επισημασμένες περιπτώσεις τροφοδοτούν το offline σύνολο

Το τεταρτημόριο «μόνο offline» είναι εκεί που οι πύλες CI αποδεικνύουν την αξία τους: ένα ξαναγραμμένο prompt που ρίχνει αθόρυβα τη συμμόρφωση μορφής από 99% σε 91% είναι αόρατο στο code review και ολοφάνερο σε μια σουίτα 47 περιπτώσεων. Το τεταρτημόριο «μόνο online» είναι πιο πονηρό. Οι πραγματικοί χρήστες διατυπώνουν πράγματα που το golden set σας δεν είπε ποτέ, τα API τρίτων κάνουν timeout σε χρονοδιαγράμματα που το staging δεν συναντά ποτέ, και κάποιος θα ταΐσει το chatbot σας με ένα prompt 40.000 χαρακτήρων απλώς για να δει τι θα γίνει. Για εκείνη την πλευρά, ο οδηγός μας για την αξιολόγηση agents στην παραγωγή καλύπτει τη βαθμολόγηση πολυβηματικών τροχιών, όχι μόνο μεμονωμένων εξόδων.

Η τελευταία σειρά είναι αυτή που οι ομάδες παραλείπουν, και αυτή που τις καίει. Οι αποτυχίες που σας κοστίζουν χρήστες είναι αυτές που κανένας τρόπος δεν πιάνει μόνος του. Χρειάζονται έναν άνθρωπο μέσα στον βρόχο.

Πώς Συνδέετε τα Offline Evals σε μια Πύλη CI; (Η Διαμόρφωση Που Κανείς Δεν Δείχνει)

Προσθέστε έναν eval runner ως απαιτούμενο status check σε κάθε pull request που αγγίζει prompt, μοντέλο ή διαμόρφωση ανάκτησης. Ορίστε ένα κατώφλι. Αποκλείστε τη συγχώνευση κάτω από αυτό. Το promptfoo τεκμηριώνει ακριβώς αυτό το μοτίβο CI, και είναι αυτό που τρέχουμε.

Το βήμα GitHub Actions

Μια λιτή εκδοχή της πύλης που τρέχουμε σήμερα:

yaml
name: llm-eval-gate

on:
  pull_request:
    paths: ["prompts/**", "evals/**", "src/rag/**"]

jobs:
  faithfulness-gate:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v4
      - uses: actions/setup-node@v4
        with:
          node-version: 22
      - name: Run offline evals, fail the PR on regression
        run: npx promptfoo@latest eval --config evals/support-agent.yaml
        env:
          OPENAI_API_KEY: ${{ secrets.OPENAI_API_KEY }}  # LLM-as-judge

Η διαμόρφωση YAML δηλώνει τα test cases και τους ισχυρισμούς· το eval επιστρέφει μη μηδενικό κωδικό όταν η σουίτα πέφτει κάτω από το κατώφλι, το GitHub σημαίνει το απαιτούμενο check ως αποτυχημένο και το κουμπί συγχώνευσης γκριζάρει. Το φίλτρο paths έχει σημασία: μια διόρθωση στο README δεν πρέπει να καίει judge tokens.

Τι πιάνει πραγματικά η πύλη

Η ζωντανή εκδοχή βαθμολογεί την αλυσίδα RAG του support agent μας απέναντι σε 47 golden περιπτώσεις σε κάθε PR που επηρεάζει prompt. Μια πλήρης εκτέλεση παίρνει περίπου 90 δευτερόλεπτα χρόνου CI, και η συγχώνευση μπλοκάρεται αυτόματα αν η πιστότητα πέσει κάτω από 0,82. Σε τρεις μήνες, έχει πιάσει δύο οπισθοδρομήσεις που αλλιώς θα κυκλοφορούσαν: μια επανεγγραφή system prompt που έσπρωξε την πιστότητα από 0,91 σε 0,74, και μια αλλαγή στον retriever που διπλασίασε το μήκος context και έσυρε τη συνάφεια απάντησης κάτω από το κατώφλι. Καμία από τις δύο δεν φαινόταν επικίνδυνη στο review.

Μια πύλη πιστότητας στο CI κοστίζει 90 δευτερόλεπτα ανά PR. Μια οπισθοδρόμηση πιστότητας στην παραγωγή σας κοστίζει ένα νήμα υποστήριξης και ένα rollback.

Συγκρίναμε τους runners που μπορείτε να συνδέσετε σε αυτό το μοτίβο, promptfoo, DeepEval και τους υπόλοιπους, στη στρογγυλή ανασκόπηση εργαλείων αξιολόγησης LLM που κάναμε.

Ποια Εργαλεία Τρέχουν Ποιον Τρόπο; (Μήτρα Εργαλείου-προς-Τρόπο)

Κανένα μεμονωμένο εργαλείο δεν κατέχει και τις δύο λωρίδες καθαρά. Το promptfoo και το DeepEval είναι offline-first runners που μπορούν να βαθμολογούν εξαγμένα δεδομένα παραγωγής σε πρόγραμμα· το Langfuse και το LangSmith είναι online-first αποθήκες traces που προσαρτούν LLM-as-judge scorers πάνω σε εισερχόμενα traces. Η μήτρα είναι η δική μας ανάγνωση της τεκμηρίωσης κάθε προμηθευτή: ερμηνεία, όχι ευαγγέλιο.

ΕργαλείοOffline runnerOnline scorerΚαι τα δύο εγγενώς;Τι ΔΕΝ κάνει
promptfooΝαι: σουίτες YAML, εγγενές CI, πακέτα red-teamΜερικά: ίδιες διαμορφώσεις σε εξαγόμενα logsOffline-first· το online χρειάζεται βήμα εξαγωγήςΕισαγωγή ζωντανών traces· ρόλος dashboard παρακολούθησης
DeepEvalΝαι: δοκιμές τύπου pytest, 14+ μετρικέςΝαι, μέσω της πλατφόρμας Confident AIΝαι, με τη φιλοξενούμενη επέκτασηΗ βιβλιοθήκη ανοιχτού κώδικα μόνη της είναι μόνο offline
LangfuseΜερικά: πειράματα dataset μέσω SDKΝαι: judge evaluators σε εισαγόμενα tracesΝαι: datasets συν scorers tracesΤρέχει την πύλη συγχώνευσης CI· αυτό το συνδέετε μόνοι σας
LangSmithΝαι: datasets και offline πειράματαΝαι: αυτοματισμοί βαθμολογούν δειγματοληπτημένα tracesΝαιΖει έξω από το stack του LangChain χωρίς τριβές
OpenAI EvalsΝαι: evals τύπου registry YAMLΌχιΌχιPipelines traces παραγωγής· μοντέλα εκτός OpenAI
Arize PhoenixΝαι: πειράματα με προτεραιότητα το notebookΝαι: spans και traces με ενσωματωμένα evaluatorsΝαιΕλαφρύ στήσιμο· η παρατηρησιμότητα προηγείται

Διαλέξτε promptfoo ή DeepEval αν η πρώτη σας ανάγκη είναι μια πύλη συγχώνευσης που μπλοκάρει τα κακά prompts στο CI. Διαλέξτε Langfuse ή LangSmith αν η πρώτη σας ανάγκη είναι η βαθμολόγηση ζωντανής κίνησης, και η σύγκριση Langfuse vs LangSmith που έχουμε κάνει μπαίνει βαθιά σε αυτή την επιλογή. Το OpenAI Evals παραμένει το παράξενο: ένας offline runner τύπου registry χωρίς πλευρά παραγωγής.

Το promptfoo βάζει πύλη στα PR σας. Το Langfuse βαθμολογεί τα traces παραγωγής σας. Κανένα δεν αντικαθιστά το άλλο.

Πώς ο Βρόχος Ανατροφοδότησης Μετατρέπει τις Online Αποτυχίες σε Offline Δοκιμές;

Δειγματοληπτήστε traces παραγωγής με χαμηλή βαθμολογία, επισημάνετέ τα και δεσμεύστε τα στο offline eval set. Η σουίτα οπισθοδρόμησης τότε μεγαλώνει με κάθε έκπληξη που σας πετάει η παραγωγή, και το επόμενο deploy μπαίνει υπό πύλη στο διευρυμένο σύνολο. Το πλαίσιο του σφονδύλου είναι δικό μας· είναι το κομμάτι που οι περισσότερες ομάδες δεν χτίζουν ποτέ.

Ο κύκλος, όπως τον τρέχουμε:

  1. Οι online scorers σημαδεύουν traces κάτω από 0,7 βαθμολογία judge.
  2. Δειγματοληπτούμε 20 έως 30 σημαδεμένα traces την εβδομάδα.
  3. Ένας άνθρωπος επισημαίνει το καθένα: αναμενόμενη έξοδος συν κλάση αποτυχίας.
  4. Οι επισημασμένες περιπτώσεις μπαίνουν στο offline eval set ως νέα golden παραδείγματα.
  5. Το επόμενο PR τρέχει απέναντι στη διευρυμένη σουίτα, και ο βρόχος ξεκινά ξανά.

Η δειγματοληψία ξεκινά από το στρώμα παρατηρησιμότητας LLM, επειδή τα traces είναι η πρώτη ύλη. Για τον ρυθμό: η εβδομαδιαία νικά τη μηνιαία, επειδή η απόκλιση συσσωρεύεται. Επισημαίνουμε 10 έως 15 περιπτώσεις την εβδομάδα, και το σύνολο είναι «αρκετά μεγάλο» όταν οι νέες επισημάνσεις σταματούν να κινούν το ποσοστό επιτυχίας, γύρω στις 150 έως 250 περιπτώσεις για έναν στενό support agent. Η γραμμή μεταξύ των τρόπων συνεχίζει να θολώνει: το Deepchecks αναφέρει ότι οι μηχανικοί της Union.ai προγραμματίζουν τις «offline» αξιολογήσεις τους κάθε λίγα λεπτά, μετατρέποντάς τες ουσιαστικά σε ελέγχους σχεδόν πραγματικού χρόνου.

Το eval set σας δεν είναι σταθερό τεκμήριο. Μεγαλώνει κάθε εβδομάδα που η παραγωγή σας εκπλήσσει.

Πότε Χρειάζεστε Και Τα Δύο; (Online vs Offline Αξιολόγηση LLM Ανά Στάδιο)

Χρειάζεστε και τα δύο από την εβδομάδα κυκλοφορίας και μετά, αλλά η ισορροπία μετατοπίζεται ανά στάδιο: το offline σηκώνει μόνο του τη δουλειά πριν από το deploy, η εβδομάδα κυκλοφορίας προσθέτει βαθμολόγηση shadow ή canary, η μόνιμη κατάσταση στηρίζεται στην online παρακολούθηση με περιοδικές offline επανεκτελέσεις, και μια ειδοποίηση απόκλισης πρέπει να καταλήγει σε ένα αναπαραγόμενο offline test συν ένα μεγαλύτερο eval set.

ΣτάδιοOfflineOnlineΕνέργεια
Πριν από το deployΠύλη οπισθοδρόμησης σε κάθε PRΚανένα ακόμαΑποκλεισμός συγχώνευσης κάτω από το κατώφλι
Εβδομάδα κυκλοφορίαςΠλήρης σουίτα στον release candidateΒαθμολόγηση shadow ή canary στο 5-10% της κίνησηςΣύγκριση online βαθμολογιών με το offline baseline
Μόνιμη κατάστασηΠεριοδική επαναξιολόγηση σε ανανεωμένο σύνολο, εβδομαδιαία ή μηνιαίαΣυνεχής δειγματοληπτική βαθμολόγηση συν ειδοποιήσειςΠαρακολούθηση απόκλισης· νέο baseline κάθε τρίμηνο
Ανιχνεύθηκε απόκλισηΑναπαραγωγή των αποτυχημένων traces offlineΗ ειδοποίηση που πυροδότησε το έναυσμαΠροσθήκη επισημασμένων traces στο eval set· νέα πύλη στο επόμενο deploy

Το πριν από το deploy είναι το φθηνότερο μέρος για να είστε αυστηροί: μια αποκλεισμένη συγχώνευση κοστίζει λεπτά· μια κακή κυκλοφορία κοστίζει εμπιστοσύνη. Η εβδομάδα κυκλοφορίας είναι εκεί που οι ομάδες υποεπενδύουν, αν και η βαθμολόγηση shadow σε μικρό κομμάτι κίνησης κοστίζει λίγα και αποκαλύπτει αν το golden σύνολο είπε ψέματα. Η μόνιμη κατάσταση είναι εκεί που μπαίνει η εφησυχασμένη ρουτίνα, οπότε βάλτε την επαναξιολόγηση στο ημερολόγιο.

Τι γίνεται με τον EU AI Act;

Οι υποχρεώσεις υψηλού ρίσκου του EU AI Act μπαίνουν σταδιακά μέχρι τον Αύγουστο του 2026, με το πλήρες χρονοδιάγραμμα προθεσμιών δημοσιευμένο στο EUR-Lex, και το μοτίβο συμμόρφωσης αντιστοιχίζεται καθαρά στους δύο τρόπους. Τεκμηριωμένα offline στοιχεία δείχνουν ότι το σύστημα έπιασε τους στόχους ποιότητας πριν από την κυκλοφορία· η συνεχιζόμενη online παρακολούθηση δείχνει ότι συνεχίζει να τους πιάνει μετά. Η δική μας ανάγνωση είναι ότι ένα ίχνος ελέγχου χρειάζεται και τα δύο τεκμήρια, επειδή τα offline logs μόνα τους δεν αποδεικνύουν ότι το σύστημα παρέμεινε συμμορφούμενο, και τα dashboards μόνα τους δεν αποδεικνύουν ότι κυκλοφόρησε συμμορφούμενο. Αυτή είναι ερμηνεία, όχι νομική συμβουλή· ο πυλώνας μας για το pipeline αξιολόγησης LLM χαρτογραφεί το πλήρες σύνολο απαιτήσεων.

Η offline αξιολόγηση είναι τα αποδεικτικά σας. Η online αξιολόγηση είναι το σύστημα έγκαιρης προειδοποίησής σας. Οι ρυθμιστικές αρχές θέλουν και τα δύο.

Σχετικά με τον συγγραφέα: Ο Mert Batur είναι Συνιδρυτής του Techsy.io, όπου η ομάδα παραδίδει AI agents, συστήματα αυτοματισμού και pipelines φωνής/SDR για B2B πελάτες. Γράφει για το σύνολο εργαλείων LLM που η ομάδα της Techsy χρησιμοποιεί πραγματικά στην παραγωγή. Συνδεθείτε στο LinkedIn.

Συχνές Ερωτήσεις

Τι είναι η offline αξιολόγηση LLM;

Η offline αξιολόγηση LLM τρέχει ένα μοντέλο ή prompt απέναντι σε ένα σταθερό, versioned σύνολο δεδομένων πριν από το deployment. Οι τυπικοί έλεγχοι περιλαμβάνουν πιστότητα στο ανακτημένο context, συνάφεια απάντησης, συμμόρφωση μορφής και βαθμολογίες benchmark. Επειδή το σύνολο δεδομένων δεν αλλάζει ποτέ κατά την εκτέλεση, τα αποτελέσματα είναι επαναλήψιμα και συγκρίσιμα, και αυτός ακριβώς είναι ο λόγος που οι offline σουίτες δουλεύουν ως πύλες συγχώνευσης CI.

Τι είναι η online αξιολόγηση LLM;

Η online αξιολόγηση LLM βαθμολογεί τη ζωντανή κίνηση παραγωγής μετά την κυκλοφορία. Ένας scorer LLM-as-judge βαθμολογεί δειγματοληπτημένα traces για ψευδαισθήσεις, τόνο ή ορθότητα κλήσεων εργαλείων, και οι βαθμολογίες ρέουν σε ένα dashboard. Απορροφά επίσης σήματα που τα offline tests δεν βλέπουν: καθυστέρηση υπό φορτίο, ανατροφοδότηση χρηστών και πώς οι πραγματικές ερωτήσεις διαφέρουν από το golden set σας.

Πότε πρέπει να χρησιμοποιώ offline vs online αξιολόγηση LLM;

Χρησιμοποιήστε την offline αξιολόγηση για να βάλετε πύλη στα deploys: κάθε αλλαγή σε prompt, μοντέλο ή ανάκτηση πρέπει να περνά τη σουίτα πριν από τη συγχώνευση. Χρησιμοποιήστε την online αξιολόγηση για να παρακολουθείτε ό,τι κυκλοφορεί. Οι περισσότερες ομάδες βάζουν τα δύο σε σειρά αντί να διαλέξουν ένα: πρώτα offline, online από την εβδομάδα κυκλοφορίας και μετά, με τις αποτυχίες παραγωγής να επιστρέφουν στο offline σύνολο.

Ποιο είναι ένα παράδειγμα online vs offline αξιολόγησης LLM;

Offline παράδειγμα: μια σουίτα promptfoo τρέχει 200 golden ερωτήσεις υποστήριξης σε κάθε pull request και αποκλείει τη συγχώνευση αν η πιστότητα πέσει κάτω από 0,82. Online παράδειγμα: το Langfuse βαθμολογεί το 10% των ζωντανών traces με έναν έλεγχο ψευδαισθήσεων LLM-as-judge και ειδοποιεί όταν ο εβδομαδιαίος μέσος όρος γλιστράει. Ίδιο βαθμολόγιο, διαφορετική πηγή δεδομένων.

Πώς ταιριάζει ο άνθρωπος στον βρόχο (human-in-the-loop) στην αξιολόγηση LLM;

Οι άνθρωποι κλείνουν το κενό που κανένας τρόπος δεν καλύπτει: νέες ακραίες περιπτώσεις, υποκειμενικές κρίσεις ποιότητας και απόκλιση τόνου φωνής brand. Ένας πρακτικός ρυθμός είναι η επισήμανση 10 έως 20 δειγματοληπτημένων traces χαμηλής βαθμολογίας την εβδομάδα και η δέσμευση των επισημασμένων περιπτώσεων στο offline eval set. Η ουρά αναθεώρησης είναι είσοδος του pipeline, όχι παράπλευρο πρότζεκτ.

Πώς δουλεύουν οι αξιολογήσεις Langfuse για online βαθμολόγηση;

Το Langfuse εισάγει traces από την εφαρμογή σας και μετά προσαρτά LLM-as-judge evaluators που βαθμολογούν κάθε trace απέναντι σε ένα βαθμολόγιο: ψευδαισθήσεις, συνάφεια, τοξικότητα ή ένα προσαρμοσμένο prompt. Οι βαθμολογίες καταλήγουν σε ένα dashboard με κλειδιά συνεδρίες και χρήστες. Οι ομάδες εξάγουν τα επίμονα χαμηλόβαθμα traces σε ένα offline dataset για δοκιμές οπισθοδρόμησης. Η ανασκόπησή μας για πλατφόρμες παρατηρησιμότητας συγκρίνει τις αποθήκες traces που τροφοδοτούν αυτό το μοτίβο.

Πώς προσθέτω offline evals σε ένα pipeline CI/CD;

Προσθέστε έναν eval runner ως απαιτούμενο status check σε pull requests που αγγίζουν prompts, μοντέλα ή διαμόρφωση ανάκτησης. Τόσο το promptfoo όσο και το DeepEval τρέχουν headless και επιστρέφουν μη μηδενικό κωδικό σε αποτυχία ισχυρισμού, κάτι που αποκλείει τη συγχώνευση αυτόματα. Η πύλη YAML νωρίτερα σε αυτό το άρθρο είναι ένα λειτουργικό πρότυπο· ξεκινήστε με 30 έως 50 περιπτώσεις.

Ο EU AI Act απαιτεί offline ή online αξιολόγηση;

Ουσιαστικά, και τα δύο. Για συστήματα υψηλού ρίσκου, ο νόμος περιμένει τεκμηριωμένα αποδεικτικά ότι οι στόχοι ποιότητας πιάστηκαν πριν από την κυκλοφορία, που σημαίνει offline τεκμήρια, συν συνεχιζόμενη παρακολούθηση μετά το deployment, που σημαίνει online τηλεμετρία. Οι σταδιακές προθεσμίες του τρέχουν μέχρι τον Αύγουστο του 2026 σύμφωνα με το EUR-Lex. Αυτή είναι η δική μας ανάγνωση του μοτίβου συμμόρφωσης, όχι νομική συμβουλή.

Μπορεί το LLM-as-a-judge να τρέξει και στους δύο τρόπους, offline και online;

Ναι, και πρέπει, επειδή το βαθμολόγιο μεταφέρεται. Offline, ο judge βαθμολογεί κάθε έξοδο του eval set σε batch κατά το CI. Online, το ίδιο judge prompt βαθμολογεί δειγματοληπτημένα traces παραγωγής σχεδόν σε πραγματικό χρόνο. Το να κρατάτε ένα βαθμολόγιο και στους δύο τρόπους είναι αυτό που κάνει το offline baseline σας συγκρίσιμο με το online σήμα απόκλισης.

Ποιες μετρικές διαφέρουν μεταξύ offline και online αξιολόγησης;

Οι offline μετρικές μετρούν την ποιότητα εξόδου απέναντι στην αλήθεια αναφοράς: πιστότητα, συνάφεια απάντησης, συμμόρφωση μορφής, βαθμολογίες benchmark. Οι online μετρικές προσθέτουν λειτουργικά και συμπεριφορικά σήματα: καθυστέρηση p95, ποσοστό σφαλμάτων, ποσοστό ψευδαισθήσεων σε ζωντανή κίνηση, βαθμολογία απόκλισης και ικανοποίηση χρηστών. Η offline λίστα ρωτάει «είναι καλό;» και η online λίστα ρωτάει «είναι ακόμα καλό;»

Η Σύντομη Εκδοχή

  • Η offline και η online αξιολόγηση είναι συμπληρωματικές λωρίδες, όχι δίλημμα «ή αυτό ή εκείνο»: η μία βάζει πύλη σε ό,τι κυκλοφορείτε, η άλλη παρακολουθεί ό,τι κυκλοφορήσατε.
  • Ξεκινήστε με την πύλη CI αυτή την εβδομάδα, προσθέστε online βαθμολόγηση traces στην κυκλοφορία και συνδέστε τον βρόχο ανατροφοδότησης πριν μπαγιατέψει το eval set σας.
  • Ο βρόχος είναι το σύστημα. Ένα στατικό golden σύνολο σαπίζει· ένα αυξανόμενο συσσωρεύει αξία.

Αν θέλετε ένα δεύτερο ζευγάρι μάτια στο eval pipeline σας, πάρτε μια δωρεάν συμβουλή.

Ετικέτες

online vs offline αξιολόγηση llmαξιολόγηση llmllm-as-a-judgeπύλη eval ciπαρακολούθηση llm παραγωγής

Κοινοποίηση άρθρου

Σχετικά άρθρα

Περισσότερα στο ai-machine-learning

ai-machine-learning
Aug 1, 2026

Πόσο κοστίζει το LLM Inference; Ανάλυση σε 4 σενάρια με πραγματικούς υπολογισμούς

Το κόστος LLM inference κυμαίνεται από $0,02 έως $75 ανά εκατομμύριο tokens ανάλογα με την κατηγορία μοντέλου. Φτιάξαμε 4 μοντέλα κόστους από τις τιμές Ιουλίου 2026 για να εκτιμήσετε τον μηνιαίο λογαριασμό σας πριν δεσμευτείτε σε πάροχο.

13 λεπτά ανάγνωση εξάγουμε ανάγνωση
Ανάγνωση
ai-machine-learning
Aug 1, 2026

Δημιουργία Εργαλείων για AI Agents, Με Evals Που Αποδεικνύουν Ότι Δουλεύουν

Ένα εργαλείο είναι ένα συμβόλαιο ανάμεσα στον ντετερμινιστικό κώδικά σας και ένα μη ντετερμινιστικό μοντέλο. Επτά αρχές σχεδιασμού, η απόφαση build-vs-buy, MCP serving, ασφάλεια σε επίπεδο εργαλείου και ο κύκλος eval που αποδεικνύει ότι τα εργαλεία του agent σας λειτουργούν.

15 λεπτά ανάγνωση εξάγουμε ανάγνωση
Ανάγνωση
ai-machine-learning
Jul 31, 2026

Παρακολούθηση Κόστους LLM: Πιάστε την Έκρηξη πριν Συμβεί (2026)

Αποδώστε σε κάθε αίτημα LLM ένα πλήθος tokens και μια εκτίμηση κόστους σε δολάρια, αθροίστε ανά μοντέλο και ομάδα και ειδοποιήστε πριν εκτοξευθεί το τιμολόγιο. 5 μετρικές, 3 setups.

13 min read εξάγουμε ανάγνωση
Ανάγνωση
Ξεκινήσετε το Project σας

Έτοιμοι να δημιουργήσουμε κάτι εξαιρετικό;

Ας κάνουμε το όραμά σας πραγματικότητα. Η ομάδα μας είναι έτοιμη να σας βοηθήσει να φτιάξετε λογισμικό που κάνει τη διαφορά.