
RAG vs Fine-Tuning: Πότε να χρησιμοποιήσετε το καθένα (με πραγματικούς αριθμούς)
Οι περισσότερες συμβουλές για rag vs fine tuning παραλείπουν ακριβώς το ένα πείραμα που μέτρησε και τα δύο στην ίδια εργασία. Οι Balaguer και συν., στο arXiv:2401.08406 (162 αναφορές), πέρασαν ένα σύνολο ερωτήσεων-απαντήσεων γεωργίας και από τα δύο: το fine-tuning απέφερε πάνω από 6 μονάδες ακρίβειας και το RAG πρόσθεσε άλλες 5 από πάνω. Ο Πίνακας 18 τους τοποθετεί το GPT-4 στο 75% χωρίς βοήθεια, 81% με fine-tuning και 86% με fine-tuning συν ανάκτηση. Γιατί λοιπόν συνεχίζουμε να λέμε στις περισσότερες ομάδες να ξεκινούν από το RAG; Επειδή η επικαιρότητα, οι παραπομπές και τα μαθηματικά του κόστους που ακολουθούν κρίνουν περισσότερα έργα από ό,τι ένα χάσμα ακρίβειας μιας μονάδας.
Βασικά Συμπεράσματα
- Το RAG είναι η προεπιλογή όταν η γνώση αλλάζει συχνά ή όταν οι απαντήσεις πρέπει να παραπέμπουν σε πηγές· το fine-tuning κερδίζει στη σταθερότητα του φορμά και στην καθυστέρηση.
- Το κόστος του fine-tuning πέφτει μπροστά (εκπαίδευση)· το κόστος του RAG πέφτει ανά ερώτημα (embeddings συν επιπλέον input tokens).
- Δημοσιευμένα στοιχεία στην ίδια εργασία: το fine-tuning πρόσθεσε 6 μονάδες ακρίβειας, το RAG άλλες 5 από πάνω και το υβριδικό ξεπέρασε και τα δύο μόνα τους.
- Τρέξτε τους πέντε ελέγχους (επικαιρότητα δεδομένων, επισημασμένα παραδείγματα, καθυστέρηση, παραπομπές, δεξιότητες ομάδας) πριν γράψετε οποιονδήποτε κώδικα εκπαίδευσης.
Πότε να χρησιμοποιήσετε RAG vs Fine-Tuning; (Γρήγορη ετυμηγορία)
Επιλέξτε RAG αν η γνώση σας αλλάζει συχνά ή αν οι απαντήσεις σας πρέπει να φέρουν παραπομπές. Επιλέξτε fine-tuning αν χρειάζεστε σταθερό φορμά εξόδου και χαμηλή καθυστέρηση και διαθέτετε εκατοντάδες επισημασμένα παραδείγματα. Χρησιμοποιήστε και τα δύο όταν η εγκατάσταση ωριμάσει. Το RAG επεξεργάζεται το context που διαβάζει το μοντέλο· το fine-tuning επεξεργάζεται το ίδιο το μοντέλο. Οι περισσότερες ομάδες χρειάζονται το πρώτο, όχι το δεύτερο.
Μία πρόταση που αξίζει να κρατήσετε: το RAG αλλάζει τι διαβάζει το μοντέλο· το fine-tuning αλλάζει τι είναι το μοντέλο. Επιλέξτε με βάση αυτό που χρειάζεται πραγματικά η εργασία σας.
| Προσέγγιση | Πότε τη χρησιμοποιείτε | Πότε την αποφεύγετε | Αρχικό κόστος | Κόστος ανά ερώτημα | Τριβή ενημέρωσης |
|---|---|---|---|---|---|
| Μηχανική προτροπών (prompt engineering) | Η συμπεριφορά είναι κοντά, η γνώση είναι γενική | Οι απαντήσεις χρειάζονται ιδιωτικά ή φρέσκα δεδομένα | Ώρες επαναλήψεων | Κανένα πέρα από τα tokens | Επεξεργασία του prompt, επαναδημοσίευση |
| RAG | Τα γεγονότα αλλάζουν, οι παραπομπές μετρούν, τα δεδομένα μένουν ιδιωτικά | Απαιτείται καθυστέρηση κάτω από 100ms | Χαμηλό: δόμηση ευρετηρίου | Embeddings συν επιπλέον input tokens | Επαναδημιουργία ευρετηρίου, χωρίς επανεκπαίδευση |
| Fine-tuning | Σταθερό φορμά, τόνος ή προϋπολογισμός καθυστέρησης· υπάρχουν επισημασμένα παραδείγματα | Η γνώση αποκλίνει εβδομαδιαίως | Μεσαίο-υψηλό: προετοιμασία δεδομένων συν εκπαίδευση | Συχνά υψηλότερη τιμή token | Πλήρης επανεκπαίδευση σε κάθε απόκλιση |
| Υβριδικό (και τα δύο) | Ώριμο προϊόν: έλεγχος φορμά συν φρέσκα γεγονότα | Στάδιο πρωτοτύπου, ο προϋπολογισμός δεν έχει ξεκαθαρίσει | Και τα δύο παραπάνω | Και τα δύο παραπάνω | Δύο συστήματα προς συντήρηση |
Το γλωσσάρι RAG της NVIDIA ορίζει καθαρά την πλευρά της ανάκτησης, αν θέλετε τη θεωρητική εκδοχή. Οι ορισμοί, όμως, δεν επιλέγουν την αρχιτεκτονική σας. Τα τεκμήρια την επιλέγουν, γι' αυτό ξεκινήστε από εκεί.
Τι δείχνουν τα τεκμήρια; Μία εργασία, και οι δύο προσεγγίσεις, μετρημένες
Η μόνη μετρημένη σύγκριση στην ίδια εργασία που εμφανίζεται στην πεντάδα του Google για αυτό το ερώτημα είναι οι Balaguer και συν. 2024, μια μελέτη της Microsoft Research με 162 αναφορές. Η ομάδα πέρασε μία εργασία ερωτήσεων-απαντήσεων γεωργίας από ένα RAG pipeline, ένα fine-tuned μοντέλο και ένα υβριδικό των δύο, και ζήτησε από το GPT-4 να βαθμολογήσει τις απαντήσεις. Στη δική τους διάταξη το fine-tuning μόνο του υπερίσχυσε οριακά του RAG μόνο του, ενώ η στοίβαξη των δύο ξεπέρασε το καθένα με μεγαλύτερη διαφορά.
Η μελέτη περίπτωσης γεωργίας (arXiv:2401.08406)
Η μελέτη, που υποβλήθηκε τον Ιανουάριο του 2024 από την Angels Balaguer και 15 συν-συγγραφείς, εξετάζει τι χρειάζεται για να δοθούν στους αγρότες εξατομικευμένες συμβουλές ανά τοποθεσία. Το pipeline τους εξάγει πληροφορίες από PDF, δημιουργεί από αυτές ζεύγη ερωτήσεων-απαντήσεων και αξιολογεί τα Llama2-13B, GPT-3,5 και GPT-4 με και χωρίς ανάκτηση.
Οι Balaguer και συν. αναφέρουν αύξηση ακρίβειας άνω των 6 ποσοστιαίων μονάδων από το fine-tuning, αθροιστική με το RAG, το οποίο πρόσθεσε άλλες 5 μονάδες από πάνω. Το υβριδικό pipeline ξεπέρασε κάθε προσέγγιση μόνη της. Ο Πίνακας 18 δείχνει τη σειρά για το GPT-4: 75% χωρίς βοήθεια, 80% με RAG, 81% με fine-tuning, 86% με fine-tuning συν RAG. Προσέξτε πόσο κοντά κάθονται το 80% και το 81%· η διαφορά μεταξύ RAG μόνο του και fine-tuning μόνο του είναι μία μονάδα, ενώ το υβριδικό απέχει πέντε από τα δύο. Σε ένα πείραμα, το fine-tuned μοντέλο άντλησε γνώση από άλλες γεωγραφίες για να απαντήσει σε τοποειδικές ερωτήσεις, ανεβάζοντας την ομοιότητα απαντήσεων από 47% σε 72%.
Τα οικονομικά τεκμήρια
Η δημοσιευμένη μελέτη της Snorkel AI (Νοέμβριος 2022) καλύπτει την πλευρά του κόστους. Σε ένα benchmark νομικής ταξινόμησης 100 κλάσεων (LEDGAR, 80.000 ρήτρες συμβολαίων), ένα fine-tuned RoBERTa μοντέλο εξίσωσε ένα fine-tuned GPT-3 όντας 1.400× μικρότερο, χρησιμοποιώντας κάτω από 1% των ground-truth ετικετών και τρέχοντας στο 0,1% του κόστους παραγωγής συμπερασμού του fine-tuned GPT-3, περίπου ένα χιλιοστό. Συνολικό χτίσιμο: 1.915 $ με προγραμματική επισήμανση έναντι 7.418 $ για χειροκίνητο σχολιασμό συν fine-tuning του GPT-3. Μια επιφύλαξη: πρόκειται για ταξινόμηση, όχι για παραγωγικές ερωτήσεις-απαντήσεις, οπότε αντιμετωπίστε τις αναλογίες ως ενδεικτικές.
Η δική μας ανάγνωση
Η δική μας ερμηνεία: η διάταξή τους είναι η πιο ευνοϊκή περίπτωση που συναντά ποτέ το fine-tuning, και πάλι κέρδισε με μία μονάδα. Οι Balaguer και συν. εκπαίδευσαν πάνω σε ένα σταθερό σώμα PDF και αξιολόγησαν πάνω στο ίδιο παγωμένο σώμα, άρα τίποτε από όσα έμαθαν τα βάρη δεν πρόλαβε να παλιώσει μέσα στο πείραμα. Οι περισσότερες βάσεις γνώσης παραγωγής δεν μένουν ακίνητες έτσι. Ένα bot υποστήριξης που απαντά σε ερωτήσεις για την κυκλοφορία της περασμένης εβδομάδας ξανακερδίζει τις 6 μονάδες σε κάθε κύκλο επανεκπαίδευσης, ενώ το ευρετήριο που τροφοδοτεί το RAG ενημερώνεται το ίδιο απόγευμα. Γι' αυτό διαβάζουμε το πλεονέκτημα ακρίβειας μιας μονάδας ως την ασθενέστερη εισροή αυτής της απόφασης και την επικαιρότητα ως την ισχυρότερη. Πού τα τεκμήρια δεν γενικεύονται: το αποτέλεσμα της Snorkel είναι benchmark ταξινόμησης και καμία από τις δύο μελέτες δεν δοκιμάζει τον έλεγχο τόνου ή φορμά, που παραμένει η ισχυρότερη περίπτωση του fine-tuning.
| RAG | Fine-tuning | Υβριδικό | |
|---|---|---|---|
| Ακρίβεια εργασίας (Balaguer και συν., με απόδοση) | +5 π.μ., αθροιστικά πάνω από το fine-tuning (όχι αυτόνομα έναντι της βάσης) | +6 π.μ. έναντι της βάσης | Το καλύτερο από τα τρία: GPT-4 στο 86%, έναντι 81% με fine-tuning, 80% RAG, 75% βάση |
| Προφίλ κόστους (Snorkel συν δημόσιες τιμές) | Ανά ερώτημα: embeddings συν context tokens | Μπροστά: 1.915 $-7.418 $ στη δημοσιευμένη περίπτωση· συμπερασμός στο 0,1% του κόστους του fine-tuned GPT-3 με μικρό μοντέλο | Πληρώνει και τα δύο |
| Τριβή ενημέρωσης | Επαναδημιουργία ευρετηρίου εγγράφων | Πλήρης επανεκπαίδευση | Και τα δύο |
| Υποστήριξη παραπομπών | Εγγενής | Καμία | Εγγενής μέσω της πλευράς ανάκτησης |
Το fine-tuning είναι η σωστή απάντηση λιγότερο συχνά από όσο νομίζουν οι ομάδες· τα περισσότερα έργα που λένε «fine-tune» εννοούν ουσιαστικά «ανάκτηση».
Πώς λειτουργεί το RAG και πότε κερδίζει;
Το RAG (παραγωγή επαυξημένη με ανάκτηση) απαντά από έγγραφα που ελέγχετε εσείς, αντί από ό,τι απομνημόνευσε το μοντέλο κατά την εκπαίδευση. Προτάθηκε για πρώτη φορά από τους Lewis και συν. το 2020 και έγινε η προεπιλογή για εργασίες γνώσης επειδή η γνώση ζει έξω από το μοντέλο: ενημερώστε το ευρετήριο και κάθε απάντηση αλλάζει αύριο, χωρίς επανεκπαίδευση.
Το pipeline έχει τέσσερα βήματα:
- Εισαγωγή. Αναλύστε τα έγγραφά σας (PDF, wiki, tickets) σε ένα σώμα.
- Τεμαχισμός και embedding. Χωρίστε σε τμήματα μερικών εκατοντάδων tokens και μετατρέψτε το καθένα σε διάνυσμα με ένα μοντέλο embedding.
- Ανάκτηση. Την ώρα του ερωτήματος, βρείτε τα K πιο όμοια τμήματα, συν αντιστοιχίσεις λέξεων-κλειδιών για ακριβή strings όπως SKU και κωδικοί σφαλμάτων.
- Επαύξηση και παραγωγή. Τοποθετήστε αυτά τα τμήματα στο prompt και αφήστε το LLM να απαντήσει με τις πηγές συνημμένες.
Το RAG κερδίζει σε τρεις άξονες: επικαιρότητα (επαναδημιουργία ευρετηρίου αντί για επανεκπαίδευση), παραπομπές (κάθε απάντηση δείχνει στο τμήμα από το οποίο προήλθε) και έλεγχος δεδομένων (τα δεδομένα πελατών δεν μπαίνουν ποτέ σε εκπαίδευση). Αν θέλετε τον πλήρη οδηγό υλοποίησης, δείτε πώς να χτίσετε μια εφαρμογή RAG βήμα-βήμα.
Μια προειδοποίηση για την ποιότητα ανάκτησης: το pipeline είναι τόσο καλό όσο το μείγμα embedding και ανάκτησής του. Η Contextual Retrieval της Anthropic μέτρησε ποσοστό αποτυχίας ανάκτησης top-20 της τάξης του 5,7% σε απλές διατάξεις, που πέφτει στο 2,9% με contextual embeddings συν BM25 και στο 1,9% όταν προστεθεί reranker. Αν τα ερωτήματα ακριβούς αντιστοίχισης συνεχίζουν να αποτυγχάνουν, η υβριδική αναζήτηση (BM25 vs vector) είναι η λύση.
Πότε κερδίζει το fine-tuning; (Και τι είναι το PEFT;)
Το fine-tuning κερδίζει όταν το πρόβλημα είναι πώς απαντά το μοντέλο, όχι τι ξέρει: σταθερό φορμά εξόδου, τόνος μάρκας ή σκληρός προϋπολογισμός καθυστέρησης χωρίς τον γύρο ανάκτησης. Είναι επίσης ο μοχλός για τα οικονομικά των μικρών μοντέλων. Το παραπάνω αποτέλεσμα της Snorkel, ποιότητα GPT-3 στο 0,1% του κόστους, υπάρχει μόνο επειδή κάποιος έκανε fine-tune ένα μικρό μοντέλο αντί να σερβίρει ένα μεγάλο.
Πλήρες fine-tuning vs PEFT (LoRA / QLoRA)
Το πλήρες fine-tuning ενημερώνει κάθε βάρος του μοντέλου. Είναι ακριβό, αργό και σπάνιο έξω από τα μεγάλα εργαστήρια. Σχεδόν όλοι κυκλοφορούν PEFT (parameter-efficient fine-tuning) αντί γι' αυτό. Το LoRA (Hu και συν. 2021) παγώνει τα βασικά βάρη και εκπαιδεύει έναν μικρό προσαρμογέα χαμηλής τάξης, συνήθως 0,1-1% του αριθμού παραμέτρων. Το QLoRA προσθέτει κβαντοποίηση 4-bit από πάνω, ώστε ένα μοντέλο 13B να χωράει σε μία καταναλωτική GPU. Ένας σχετικός όρος που αξίζει να γνωρίζετε: η συνεχής προεκπαίδευση, όπου ένα μοντέλο συνεχίζει την προεκπαίδευση πάνω σε ένα ακατέργαστο σώμα τομέα (χωρίς επίβλεψη) πριν από το επιβλεπόμενο fine-tuning σε επισημασμένα παραδείγματα.
Μια ελάχιστη διαμόρφωση LoRA, σύμφωνα με την τεκμηρίωση PEFT της Hugging Face:
from peft import LoraConfig, get_peft_model
config = LoraConfig(
r=16, # low-rank dimension; 8-64 typical
lora_alpha=32, # scaling factor, commonly 2x r
target_modules=["q_proj", "v_proj"],
lora_dropout=0.05,
bias="none",
task_type="CAUSAL_LM",
)
model = get_peft_model(base_model, config)
model.print_trainable_parameters()
# trainable params: ~13M || all params: 6.7B || trainable%: 0.19Για προετοιμασία dataset, αριθμό epoch και αξιολόγηση, δείτε τον βήμα-βήμα οδηγό fine-tuning μας.
Οι κίνδυνοι είναι πραγματικοί: υπερπροσαρμογή σε μικρά datasets (μερικές εκατοντάδες παραδείγματα μπορούν να απομνημονεύσουν αντί να μάθουν), παλαιότητα (τα βάρη παγώνουν τη γνώση σας στο όριο της εκπαίδευσης) και καμία απόδοση πηγής (ένα fine-tuned μοντέλο δεν μπορεί να δείξει τις αποδείξεις του). Αν κάποιο από αυτά τα τρία είναι απαγορευτικό, μόλις πείσατε τον εαυτό σας να γυρίσει στο RAG.
RAG vs Fine-Tuning vs Μηχανική Προτροπών: Πού ταιριάζουν τα υπόλοιπα;
Τα τρία είναι σκάλα, όχι αντίπαλοι. Η μηχανική προτροπών αλλάζει τις οδηγίες, το RAG αλλάζει το context που διαβάζει το μοντέλο και το fine-tuning αλλάζει τα βάρη. Ο ίδιος ο οδηγός fine-tuning της OpenAI τοποθετεί το fine-tuning τελευταίο στον βρόχο: πρώτα τα evals, δεύτερα τα prompts, εκπαίδευση μόνο όταν τα prompts δεν αρκούν πια. Δύο νεότερες επιλογές συμπληρώνουν τη φαρέτρα.
| Προσέγγιση | Τι αλλάζει | Πότε τη χρησιμοποιείτε | Πότε την αποφεύγετε | Προφίλ κόστους | Προσπάθεια |
|---|---|---|---|---|---|
| Μηχανική προτροπών | Οι οδηγίες | Η συμπεριφορά είναι κατά 90% έτοιμη | Χρειάζονται ιδιωτικά ή ταχέως μεταβαλλόμενα γεγονότα | Μόνο tokens | Ώρες |
| RAG | Το context που διαβάζεται την ώρα του ερωτήματος | Φρέσκια ή παραπέμψιμη γνώση | Σφιχτή καθυστέρηση· τίποτε προς ανάκτηση | Tokens ανά ερώτημα συν ευρετήριο | Ημέρες |
| Fine-tuning (LoRA) | Τα βάρη | Φορμά, τόνος, καθυστέρηση, σερβίρισμα μικρού μοντέλου | Χωρίς επισημασμένα δεδομένα· γνώση που αποκλίνει | Αρχική εκπαίδευση· ανανεώνεται σε κάθε επανεκπαίδευση | Εβδομάδες |
| CAG (cache-augmented) | Ένα προφορτωμένο, cached context | Μικρή σταθερή βάση γνώσης· διαθέσιμο prompt caching | Το σώμα ξεπερνά το μέγεθος που χωράει σε cache | Εγγραφή cache μία φορά, μετά φθηνές αναγνώσεις | Ημέρες |
| Agents συν χρήση εργαλείων | Τι μπορεί να κάνει το μοντέλο | Οι απαντήσεις χρειάζονται ζωντανές ενέργειες ή υπολογισμό | Αρκεί μια στατική απάντηση | Tokens ανά βήμα· πολλαπλασιάζονται γρήγορα | Εβδομάδες |
Μια σύγχυση που αξίζει να κατονομαστεί: οι MCP servers και τα agent frameworks είναι ενορχήστρωση, όχι προσαρμογή. Αποφασίζουν σε ποια εργαλεία και πηγές φτάνει το μοντέλο· δεν αλλάζουν τον τρόπο που απαντά. Μπορείτε να τρέξετε ένα RAG pipeline μέσα σε έναν agent και να κάνετε fine-tune το μοντέλο από κάτω του, και πολλά συστήματα παραγωγής κάνουν και τα δύο. Οι πόλεμοι του autocomplete («vs mcp», «vs agents») είναι σφάλματα κατηγορίας.
Είναι το RAG φθηνότερο από το fine-tuning; Το πραγματικό μοντέλο κόστους
Σύντομη απάντηση: σε ρεαλιστικούς όγκους ερωτημάτων, ναι. Ο λογαριασμός του fine-tuning έρχεται μπροστά (επισημασμένα δεδομένα συν εκπαίδευση), ενώ ο λογαριασμός του RAG φτάνει ανά ερώτημα (embeddings συν επιπλέον input tokens). Η τεκμηρίωση fine-tuning της OpenAI χρεώνει την εκπαίδευση ανά token, αλλά τα τέλη token είναι ψίχουλα δίπλα στο ανθρώπινο κόστος των επισημασμένων παραδειγμάτων. Ιδού τα μαθηματικά με δημόσιες τιμές καταλόγου.
| Γραμμή κόστους | Πότε πληρώνετε | Δημόσια τιμή καταλόγου |
|---|---|---|
| Εκπαίδευση hosted API (gpt-4o-mini) | Μία φορά ανά έκδοση μοντέλου | 3,00 $ ανά 1 εκατ. training tokens (OpenAI, κατάλογος 2024-25) → 1,5 εκατ. tokens ≈ 4,50 $ |
| Επισημασμένα δεδομένα εκπαίδευσης | Μπροστά, ανανεώνεται στην απόκλιση | 1.915 $ προγραμματικά έναντι 7.418 $ χειροκίνητα (δημοσιευμένη περίπτωση Snorkel) |
| Συμπερασμός fine-tuned μοντέλου | Ανά ερώτημα | Περίπου 2× της βάσης: 0,30 $/1,20 $ έναντι 0,15 $/0,60 $ ανά 1 εκατ. (gpt-4o-mini, OpenAI 2024-25) |
| Embedding του σώματος (RAG) | Μία φορά ανά ενημέρωση σώματος | 0,02 $ ανά 1 εκατ. tokens (text-embedding-3-small) → σώμα 10 εκατ. tokens = 0,20 $ |
| Ανακτημένο context (RAG) | Ανά ερώτημα | ~2.000 επιπλέον input tokens × 0,15 $/1 εκατ. = 0,0003 $ ανά ερώτημα |
Το ερώτημα του σημείου ισοσκέλισης: πόσα ερωτήματα χρειάζονται μέχρι ο αθροιστικός φόρος ανά ερώτημα του RAG να εξισώσει την επένδυση του fine-tuning;
break_even = training_cost / per_query_retrieval_delta
= $1,915 / $0.0003
≈ 6.4 million queriesΜε 50.000 ερωτήματα τον μήνα, αυτό σημαίνει πάνω από δέκα χρόνια. Για τα περισσότερα προϊόντα, η επένδυση του fine-tuning δεν αποσβένεται ποτέ μόνο μέσω εξοικονόμησης tokens· κάνετε fine-tune για το φορμά και την καθυστέρηση, όχι για να νικήσετε το RAG στο κόστος. Τα μαθηματικά ανατρέπονται πέρα από εκατομμύρια ερωτήματα τον μήνα ή με πολύ μεγάλα ανακτημένα context. Και προσέξτε την ασυμμετρία: ο λογαριασμός του fine-tuning ανανεώνεται κάθε φορά που η απόκλιση δεδομένων επιβάλλει επανεκπαίδευση, ενώ το RAG κλιμακώνεται γραμμικά με τον όγκο επί το μέγεθος τμήματος. Αν η δαπάνη ανά ερώτημα είναι η πραγματική έγνοια, ξεκινήστε πρώτα με τη μείωση του κόστους LLM ανά ερώτημα· αν όντως πάρετε τον δρόμο της εκπαίδευσης, συγκρίνετε τα εργαλεία fine-tuning πριν υπογράψετε την επιταγή.
Μια σημείωση επικαιρότητας: από τον Ιούλιο του 2026, η τεκμηρίωση fine-tuning της OpenAI αναφέρει ότι η hosted πλατφόρμα σταματά σταδιακά για νέους χρήστες, ενώ οι υπάρχοντες διατηρούν πρόσβαση στην εκπαίδευση για τους επόμενους μήνες. Είναι ένας λόγος παραπάνω που οι ομάδες γέρνουν προς το PEFT ανοιχτών μοντέλων ή το σκέτο RAG.
5 έλεγχοι πριν αποφασίσετε
Τρέξτε αυτούς τους πέντε ελέγχους ναι-ή-όχι πριν γράψετε οποιονδήποτε κώδικα εκπαίδευσης· το μοτίβο των απαντήσεων δείχνει προς RAG, fine-tuning ή υβριδικό πιο αξιόπιστα από οποιοδήποτε benchmark. Απαντήστε ειλικρινά και μετά μετρήστε.
- Η γνώση αλλάζει πιο γρήγορα από όσο προλαβαίνετε να επανεκπαιδεύσετε; Ναι → RAG. Μια επανεκπαίδευση ανά ενημέρωση εγγράφου δεν είναι πλάνο λειτουργίας.
- Έχετε μερικές εκατοντάδες επισημασμένα παραδείγματα; Όχι → RAG ή μηχανική προτροπών. Το fine-tuning σε 40 παραδείγματα απομνημονεύει· δεν μαθαίνει.
- Υπάρχει σκληρός προϋπολογισμός καθυστέρησης; Σφιχτός → κλίνει προς fine-tuning. Η παράλειψη του γύρου ανάκτησης εξοικονομεί 50-200ms.
- Πρέπει οι απαντήσεις να φέρουν παραπομπές ή ίχνος ελέγχου; Ναι → RAG. Τα fine-tuned μοντέλα δεν μπορούν να δείξουν στο πηγαίο τμήμα.
- Διαθέτει η ομάδα δεξιότητες ML συν προϋπολογισμό GPU ή API για εκπαίδευση; Όχι → RAG. Ένα ευρετήριο που μπορείτε να ξαναχτίσετε νικάει βάρη που δεν μπορείτε να επανεκπαιδεύσετε.
Κυρίως ναι στα 1, 4, 5 → RAG. Κυρίως ναι στα 2 και 3 με σταθερό τομέα → fine-tuning. Μοιρασμένες απαντήσεις, ή ένα ώριμο προϊόν με πραγματική κίνηση → υβριδικό (επόμενη ενότητα). Το νόημα της λίστας είναι να αποφασίζετε με τεκμήρια, όχι με όποια τεχνική είναι τάση στο feed σας αυτόν τον μήνα.
Μπορείτε να χρησιμοποιήσετε RAG και fine-tuning μαζί;
Ναι, και για ώριμες εγκαταστάσεις το υβριδικό μοτίβο είναι ο κανόνας, όχι η εξαίρεση. Κάντε fine-tune για ευχέρεια στον τομέα και φορμά εξόδου (το πώς), ανακτήστε για τα γεγονότα την ώρα του συμπερασμού (το τι). Οι Balaguer και συν. αναφέρουν ακριβώς αυτό στην εργασία γεωργίας τους: το υβριδικό pipeline ξεπέρασε κάθε προσέγγιση μόνη της, με το κέρδος 5 μονάδων του RAG να στοιβάζεται πάνω στις 6 του fine-tuning.
Το μονοπάτι ωρίμανσης που προτείνουμε: ξεκινήστε με μηχανική προτροπών, προσθέστε RAG τη στιγμή που οι απαντήσεις χρειάζονται ιδιωτικά ή φρέσκα δεδομένα και προσθέστε fine-tuning μόνο όταν οι ασυνέπειες φορμά ή η καθυστέρηση αρχίσουν να πονάνε στην παραγωγή. Πηδήξτε κατευθείαν στο fine-tuning και πληρώνετε τον φόρο εκπαίδευσης πριν καν μάθετε αν η ανάκτηση έλυνε ήδη το πρόβλημα.
Το υβριδικό μοτίβο δεν είναι συμβιβασμός· για ώριμες εγκαταστάσεις είναι η προεπιλογή: fine-tune για το φορμά, ανάκτηση για τα γεγονότα.
Πώς αξιολογείτε τον νικητή σας;
Επιλέξτε τον νικητή όπως θα επιλέγατε μια βάση δεδομένων: μετρήστε στο δικό σας φόρτο εργασίας, όχι με βάση την αίσθηση. Η συνταγή χωράει σε μία παράγραφο και καλύπτει τα τέσσερα νούμερα που πραγματικά κρίνουν.
- Κρατημένο σύνολο ερωτήσεων. 100-300 πραγματικές ερωτήσεις χρηστών. Όχι συνθετικές, ποτέ οτιδήποτε είδε το σύστημα κατά την εκπαίδευση ή την ευρετηρίαση.
- Πιστότητα και ορθότητα απάντησης. Η πιστότητα εξετάζει αν η απάντηση εδράζεται στο ανακτημένο context· η ορθότητα εξετάζει αν είναι όντως σωστή. Το ζεύγος, που έγινε δημοφιλές από το RAGAS, πιάνει τόσο τις ψευδαισθήσεις όσο και τις αστοχίες ανάκτησης.
- Καθυστέρηση στο p95, όχι ο μέσος όρος. Η ανάκτηση προσθέτει έναν γύρο· μετρήστε την ουρά.
- Κόστος ανά 1.000 ερωτήματα, tokens συν υποδομή, μετρημένο και όχι μαντεμένο.
- Επανεκτέλεση στην απόκλιση. Νέα έγγραφα, νέο στιγμιότυπο μοντέλου, νέο τρίμηνο: τρέξτε ξανά το σύνολο.
Η πλήρης ανάλυση μετρικών, συμπεριλαμβανομένων των εργαλείων, βρίσκεται στον οδηγό αξιολόγησης LLM μας.
Σχετικά με τον συγγραφέα
Ο Mert Batur είναι συνιδρυτής του Techsy.io, όπου η ομάδα παραδίδει AI agents, συστήματα αυτοματισμού και pipelines φωνής/SDR για B2B πελάτες. Γράφει για το LLM tooling stack που χρησιμοποιεί πραγματικά η ομάδα της Techsy στην παραγωγή. Συνδεθείτε στο LinkedIn.
Συχνές ερωτήσεις
Μπορείτε να χρησιμοποιήσετε RAG και fine-tuning μαζί;
Ναι. Κάντε fine-tune για το φορμά εξόδου και την ευχέρεια στον τομέα και κρατήστε την ανάκτηση για τα γεγονότα την ώρα του συμπερασμού. Οι Balaguer και συν. μέτρησαν αυτό το υβριδικό σε μια εργασία ερωτήσεων-απαντήσεων γεωργίας και διαπίστωσαν ότι ξεπέρασε κάθε προσέγγιση μόνη της, με τα κέρδη ακρίβειας να αθροίζονται. Τα περισσότερα ώριμα συστήματα παραγωγής καταλήγουν εδώ: τα βάρη για το πώς, η ανάκτηση για το τι.
Πότε να μην χρησιμοποιήσετε fine-tuning;
Παραλείψτε το fine-tuning όταν η γνώση σας αλλάζει πιο γρήγορα από όσο μπορείτε να επανεκπαιδεύσετε, όταν έχετε λιγότερα από μερικές εκατοντάδες επισημασμένα παραδείγματα, όταν οι απαντήσεις πρέπει να φέρουν παραπομπές ή ίχνη ελέγχου, ή όταν δεν υπάρχει προϋπολογισμός για επανεκπαίδευση καθώς τα δεδομένα αποκλίνουν. Αυτές οι τέσσερις συνθήκες περιγράφουν τα περισσότερα πρώιμα προϊόντα, γι' αυτό το RAG είναι συνήθως η σωστή πρώτη κίνηση.
Το fine-tuning έχει καταρριφθεί;
Όχι, αλλά η επικράτειά του συρρικνώθηκε. Τα μεγάλα context windows και το φθηνό RAG απορρόφησαν περιπτώσεις χρήσης που απαιτούσαν fine-tuning το 2023. Ό,τι απομένει είναι πραγματικό: αυστηρό φορμά εξόδου, τόνος μάρκας, προϋπολογισμοί καθυστέρησης χωρίς γύρο ανάκτησης και οικονομικά μικρών μοντέλων. Αν το πρόβλημά σας είναι πώς απαντά το μοντέλο αντί για το τι ξέρει, το fine-tuning παραμένει το εργαλείο.
Πότε θα χρησιμοποιούσατε RAG αντί για fine-tuning;
Χρησιμοποιήστε RAG όταν οι απαντήσεις εξαρτώνται από ιδιωτική ή συχνά ενημερωμένη γνώση, ή όταν χρειάζεστε παραπομπές. Χρησιμοποιήστε fine-tuning όταν χρειάζεστε σταθερό φορμά, τόνο ή καθυστέρηση και διαθέτετε αρκετά επισημασμένα παραδείγματα. Χρησιμοποιήστε και τα δύο όταν το προϊόν ωριμάσει. Αν δεν είστε σίγουροι, ξεκινήστε με RAG: είναι φθηνότερο να το αναιρέσετε από ό,τι ένα τρέξιμο εκπαίδευσης.
Είναι το RAG φθηνότερο από το fine-tuning;
Μπροστά, ναι. Το κόστος του RAG είναι ανά ερώτημα (embeddings συν επιπλέον input tokens), ενώ το fine-tuning χρεώνει μία φορά για εκπαίδευση και επισημασμένα δεδομένα και μετά ανανεώνεται σε κάθε επανεκπαίδευση. Με δημόσιες τιμές καταλόγου, το σημείο ισοσκέλισης πέφτει γύρω στα 6,4 εκατομμύρια ερωτήματα στο αριθμητικό παράδειγμά μας, οπότε σε τυπικούς όγκους το RAG παραμένει φθηνότερο για όλη τη ζωή του προϊόντος.
Είναι το RAG καλύτερο από το fine-tuning για τις ψευδαισθήσεις;
Συνήθως, αλλά όχι δωρεάν. Το RAG εδράζει τις απαντήσεις σε ανακτημένα τμήματα, ώστε να μπορείτε να παραπέμπετε σε πηγές και να ελέγχετε τις αποτυχίες. Η κακή ανάκτηση, όμως, δηλητηριάζει την απάντηση: η Anthropic μέτρησε ποσοστό αποτυχίας ανάκτησης top-20 της τάξης του 5,7% σε απλές διατάξεις, που πέφτει στο 1,9% με contextual retrieval συν reranking. Το fine-tuning, εν τω μεταξύ, μπορεί να ενσωματώσει λάθη μέσα στα βάρη χωρίς κανέναν τρόπο να τα ανιχνεύσετε.
RAG vs fine-tuning vs μηχανική προτροπών: ποια είναι η διαφορά;
Η μηχανική προτροπών αλλάζει τις οδηγίες που στέλνετε. Το RAG αλλάζει το context που διαβάζει το μοντέλο την ώρα του ερωτήματος. Το fine-tuning αλλάζει τα βάρη του μοντέλου. Κάθε μία είναι μεγαλύτερη παρέμβαση από την προηγούμενη: δοκιμάστε πρώτα prompts, προσθέστε ανάκτηση όταν η γνώση είναι το σημείο συμφόρησης και εκπαιδεύστε μόνο όταν το φορμά, ο τόνος ή η καθυστέρηση πονάνε ακόμα.
Πώς αξιολογείτε τις επιδόσεις RAG vs fine-tuning;
Φτιάξτε ένα κρατημένο σύνολο 100-300 πραγματικών ερωτήσεων χρηστών και βαθμολογήστε και τις δύο προσεγγίσεις πάνω του: πιστότητα (εδράζεται;), ορθότητα απάντησης (είναι σωστή;), καθυστέρηση p95 και κόστος ανά 1.000 ερωτήματα. Τρέξτε ξανά το σύνολο κάθε φορά που αλλάζουν τα έγγραφα ή το στιγμιότυπο μοντέλου. Οι συνθετικές ερωτήσεις κολακεύουν και τα δύο συστήματα· οι πραγματικές τα ξεχωρίζουν.
Fine-tuning vs RAG για ερωτήσεις πολλαπλών βημάτων πάνω σε νέα γνώση;
RAG, με καλύτερη ανάκτηση. Ο μηχανισμός κρίνει αυτό το ερώτημα: ένα fine-tuned μοντέλο μπορεί να συλλογιστεί μόνο πάνω σε ό,τι απορρόφησαν τα βάρη του, άρα η γνώση που δεν είδε ποτέ είναι απρόσιτη όσο καλά κι αν εκπαιδεύτηκε. Η ανάκτηση τού δίνει τα κομμάτια που λείπουν την ώρα του ερωτήματος. Η παγίδα είναι ότι ένα πέρασμα ανάκτησης σπάνια συλλέγει κάθε βήμα, οπότε σχεδιάστε αποσύνθεση ερωτήματος ή επαναληπτική ανάκτηση συν reranker, όχι μία μόνο αναζήτηση top-K.
Συμπέρασμα
Η σύνοψη, χωρίς τις επιφυλάξεις:
- Το RAG είναι η προεπιλογή για γνώση που αλλάζει και απαντήσεις με παραπομπές. Το fine-tuning είναι ο σπεσιαλίστας για φορμά, τόνο και καθυστέρηση.
- Τα τεκμήρια στην ίδια εργασία (Balaguer και συν.) δίνουν στο fine-tuning +6 π.μ. και στο RAG άλλες +5 π.μ. από πάνω, με το υβριδικό καλύτερο από τα τρία. Η συμβουλή μας να ξεκινήσετε με RAG στηρίζεται στην επικαιρότητα, τις παραπομπές και το κόστος, όχι σε αυτόν τον πίνακα σκορ.
- Τα μαθηματικά του κόστους καταλήγουν υπέρ του RAG σε ρεαλιστικούς όγκους: το σημείο ισοσκέλισης κάθισε γύρω στα 6,4 εκατομμύρια ερωτήματα στο αριθμητικό παράδειγμά μας.
- Αποφασίστε με τους πέντε ελέγχους, όχι με τη συνήθεια.
Επιλέξατε RAG; Δείτε την κατάταξή μας με τα εργαλεία RAG για το stack γύρω από το pipeline.