ai-machine-learning

Παρακολούθηση Κόστους LLM: Πιάστε την Έκρηξη πριν Συμβεί (2026)

Ραίτη Mert Batur
Ενημερώση Jul 31, 2026
15 εξάγουμε ανάγνωση
Παρακολούθηση Κόστους LLM: Πιάστε την Έκρηξη πριν Συμβεί (2026)

Παρακολούθηση Κόστους LLM: Πιάστε την Έκρηξη πριν Συμβεί (2026)

Η παρακολούθηση κόστους LLM είναι η διαφορά ανάμεσα σε ένα απρόσμενο τιμολόγιο $412 και σε ένα ping στο Slack όταν πιάνετε το 80% του προϋπολογισμού. Το Claude Sonnet 5 χρεώνει αυτόν τον μήνα $3,00 ανά εκατομμύριο input tokens και ένας μόνο ανεξέλεγκτος βρόχος agent μπορεί να τα κάψει σε ένα απόγευμα. Οι περισσότερες ομάδες στήνουν την καταγραφή σε μία μέρα· η ειδοποίηση είναι το κομμάτι που παραλείπουν.

Βασικά Συμπεράσματα:

  • Η παρακολούθηση κόστους LLM αποδίδει σε κάθε αίτημα ένα πλήθος tokens και μια εκτίμηση κόστους σε δολάρια και μετά αθροίζει ανά μοντέλο και ομάδα.
  • Παρακολουθήστε πέντε μετρικές: tokens ανά αίτημα, κόστος ανά feature/ομάδα/μοντέλο, αναλογία επιτυχιών cache, κόστος ανά συνομιλία, ρυθμός εξάρσεων.
  • Οι προϋπολογισμοί του LiteLLM, τα traces του Langfuse ή το Datadog LLM Observability στήνουν το καθένα ορατότητα δαπάνης σε λιγότερο από μία μέρα.
  • Τα dashboards δείχνουν εκτιμήσεις· οι τιμές cached input και οι εκπτώσεις batch σημαίνουν ότι το τιμολόγιο συνήθως προσγειώνεται κάτω από αυτές.

Τι Παρακολουθεί στην Πραγματικότητα η Παρακολούθηση Κόστους LLM;

Η παρακολούθηση κόστους LLM είναι η πρακτική του να αποδίδετε σε κάθε αίτημα LLM ένα πλήθος tokens και μια εκτίμηση κόστους σε δολάρια και μετά να αθροίζετε αυτές τις εκτιμήσεις ανά μοντέλο, feature και ομάδα, ώστε η δαπάνη να μπορεί να ειδοποιήσει πριν φτάσει το τιμολόγιο. Η εκτίμηση υπολογίζεται ανά αίτημα από τις δημοσιευμένες τιμές tokens, ανακεφαλαιοποιείται με ό,τι tags αποδίδετε στην κλήση και συγκρίνεται με έναν προϋπολογισμό που έχει οριστεί εκ των προτέρων.

Τα μαθηματικά από κάτω είναι ανεξάρτητα προμηθευτή. Η απόκριση χρήσης κάθε παρόχου αναλύει τα tokens σε πεδία και η τεκμηρίωση κόστους της Datadog τεκμηριώνει ρητά τις σχέσεις. Οι σημασιολογικές συμβάσεις GenAI του OpenTelemetry τυποποιούν τα ίδια πεδία σε όλους τους παρόχους, ώστε ένα dashboard χτισμένο πάνω τους να μην είναι δέσμιο ενός παρόχου.

ΠεδίοΤι μετράειΧρέωση
input_tokensΌ,τι στέλνετε: system prompt, ιστορικό, ανακτημένο context, η ερώτησηΒασική τιμή εισόδου
output_tokensΌ,τι παράγει το μοντέλοΒασική τιμή εξόδου (3–6x της εισόδου)
cache_read_tokensΕίσοδος που επαναχρησιμοποιείται από προηγούμενη cache0,1x–0,25x της βασικής εισόδου
cache_write_tokensΕίσοδος που γράφεται στην cache για πρώτη φορά~1,25x της βασικής εισόδου (TTL 5 λεπτών της Anthropic)
reasoning_tokensΕσωτερική αλυσίδα συλλογισμού, υποσύνολο της εξόδουΤιμή εξόδου

Τρεις σχέσεις κάνουν το μεγαλύτερο μέρος της δουλειάς: συνολικά tokens = είσοδος + έξοδος· είσοδος = μη cached + cache_read + cache_write· και τα reasoning tokens κάθονται μέσα στην έξοδο, με την τιμή εξόδου. Αν τις πετύχετε, η εκτίμηση ανά αίτημα μένει κοντά στην πραγματικότητα· αν τις αγνοήσετε, το dashboard αποκλίνει από τον λογαριασμό κάθε μήνα. Η παρακολούθηση κόστους είναι ένας πυλώνας της παρατηρησιμότητας AI· το tracing και τα evals είναι οι άλλοι δύο και μοιράζονται το ίδιο λεξιλόγιο πεδίων.

Το dashboard σας δείχνει μια εκτίμηση· το τιμολόγιο είναι η μόνη μετρική κόστους που δεν μπαίνει ποτέ σε cache.

Πόσο κοστίζει 1 εκατομμύριο tokens σε LLM;

Εξαρτάται από το μοντέλο και την κατεύθυνση: 1 εκατ. tokens κοστίζουν $0,14 ως είσοδος του DeepSeek-V4 και $15,00 ως έξοδος του GPT-5.6 Terra, διαφορά 100x στην ίδια μονάδα. Ορίστε τέσσερα μοντέλα από την τιμολογιακή έρευνά μας στις 14 Ιουλίου 2026, επαληθευμένα με τις επίσημες σελίδες:

ΜοντέλοΕίσοδος / 1 εκατ. tokensΈξοδος / 1 εκατ. tokensCached είσοδος / 1 εκατ. tokens
Claude Sonnet 5$3,00$15,00$0,30
GPT-5.6 Terra$2,50$15,00$0,25
Gemini 2.5 Pro$1,25$10,00$0,31
DeepSeek-V4$0,14$0,28$0,003

Πηγές: τιμολόγηση OpenAI και τιμολόγηση Anthropic. Μια υποσημείωση: το Claude Sonnet 5 τρέχει με εισαγωγική τιμή $2,00 είσοδος / $10,00 έξοδος μέχρι τις 31 Αυγούστου 2026 και μετά επιστρέφει στα παραπάνω νούμερα.

Οι 5 Μετρικές που Μετρούν Πραγματικά

Πέντε μετρικές καλύπτουν την καταγραφή κόστους LLM και οι περισσότερες ομάδες ειδοποιούν μόνο για δύο από αυτές. Ξεκινήστε από τις δύο πρώτες γραμμές: τα tokens ανά αίτημα πιάνουν το φούσκωμα του prompt την ημέρα που εμφανίζεται και το κόστος ανά ομάδα είναι το νούμερο που τελικά θα ζητήσει το οικονομικό τμήμα. Οι άλλες τρεις λεπτομερούν την εικόνα μόλις στηθούν οι πρώτες.

ΜετρικήΠώς υπολογίζεταιΓιατί μετράειΚατώφλι ειδοποίησης
Tokens ανά αίτημαΆθροισμα εισόδου + εξόδου ανά κλήση, ομαδοποίηση ανά featureΤο φούσκωμα prompt και το γέμισμα context εμφανίζονται εδώ πρώτα+30% πάνω από τον διάμεσο 7 ημερών
Κόστος ανά feature / ομάδα / μοντέλοΆθροισμα εκτιμώμενου κόστους, ομαδοποίηση ανά tag ή virtual keyΗ μονάδα πάνω στην οποία τρέχουν επιμερισμοί και προϋπολογισμοί80% του μηνιαίου προϋπολογισμού
Αναλογία επιτυχιών cachecache_read / συνολικά input tokensΟι χαμηλές αναλογίες σημαίνουν ότι πληρώνετε πλήρη τιμή για επαναλαμβανόμενα promptsΚάτω από 50% σε σταθερή κίνηση
Κόστος ανά συνομιλία / συνεδρίαΆθροισμα κόστους σε κάθε γύρο μιας συνεδρίαςΑποκαλύπτει ανεξέλεγκτους πολυγύρους agents που η προβολή ανά αίτημα χάνει2x η συνεδρία στο 90ό εκατοστημόριο
Ρυθμός εξάρσεων / ανωμαλιώνΗμερήσια μεταβολή της συνολικής δαπάνηςΗ μόνη μετρική που πιάνει έναν σπασμένο βρόχο πριν από τον λογαριασμό+50% από μέρα σε μέρα

Μια σημείωση για το επίπεδο λεπτομέρειας: η Datadog αποθηκεύει το κόστος ανά αίτημα σε nanodollars (δισεκατομμυριοστά του δολαρίου), σύμφωνα με την τεκμηρίωση κόστους της. Με $0,14 ανά εκατομμύριο tokens, ένα μόνο αίτημα DeepSeek-V4 μπορεί να κοστίζει λιγότερο από ένα χιλιοστό του σεντ, οπότε αθροίστε πριν στρογγυλοποιήσετε, αλλιώς η κίνηση μικρών μοντέλων εξαφανίζεται από την αναφορά.

Αν δεν παρακολουθήσετε τίποτε άλλο, παρακολουθήστε τις γραμμές ένα και δύο. Τα tokens ανά αίτημα είναι η πιο πρώιμη προειδοποίηση που θα πάρετε· το κόστος ανά ομάδα είναι αυτό που επιβιώνει της επαφής με ένα λογιστήριο.

Τρεις Τρόποι να Στήσετε Παρακολούθηση Κόστους LLM

Καμία από τις κορυφαίες σελίδες για αυτό το ερώτημα δεν παραδίδει ούτε μία εκτελέσιμη γραμμή κώδικα, οπότε ορίστε τρεις δουλεμένες εγκαταστάσεις. Η καθεμία μπαίνει σε λειτουργία σε λιγότερο από μία μέρα και συνδυάζονται μεταξύ τους: εμείς τρέχουμε τις δύο πρώτες μαζί.

Τι τρέχουμε πραγματικά στην παραγωγή: στο setup μας, κάθε client agent μιλάει με το LiteLLM proxy μέσω του δικού του virtual key, με μηνιαίο προϋπολογισμό σε κάθε key και το Langfuse να ιχνηλατεί κάθε αίτημα πίσω από το proxy. Όταν αναπτύξαμε τα δύο μαζί, ο διαχωρισμός αρμοδιοτήτων ήταν το νόημα: το proxy επιβάλλει τα όρια και τα traces εξηγούν τι τα κατανάλωσε. Κάθε client key μας φέρει επίσης tpm_limit 100.000 tokens ανά λεπτό ως δεύτερη ασφάλεια· σύμφωνα με την τεκμηρίωση του LiteLLM, το proxy απορρίπτει αιτήματα μόλις πιαστεί το όριο, και σε αυτή την τεκμηριωμένη συμπεριφορά βασιζόμαστε, όχι σε κάποιο benchmark που μετρήσαμε οι ίδιοι. Η ρύθμισή μας παρακάμπτει εντελώς το LiteLLM 1.82.7 και 1.82.8, τις δύο εκδόσεις που πιάστηκαν στο περιστατικό supply chain του Μαρτίου 2026, και καρφιτσώνει το tag της εικόνας αντί να επιπλέει στο latest.

LiteLLM proxy: virtual keys + προϋπολογισμοί

Η Techsy τρέχει ένα setup LiteLLM proxy στην παραγωγή με ένα virtual key ανά πελάτη και μηνιαίο προϋπολογισμό σε κάθε key. Το παρακάτω αίτημα είναι η τεκμηριωμένη μορφή από την τεκμηρίωση virtual_keys του LiteLLM: σύμφωνα με αυτή, μόλις η συσσωρευμένη δαπάνη σε αυτό το key ξεπεράσει τα $50 μέσα σε έναν μήνα, το proxy απορρίπτει τα περαιτέρω αιτήματα με σφάλμα υπέρβασης προϋπολογισμού, αντί να καταγράψει μια προειδοποίηση εκ των υστέρων.

bash
curl -X POST http://localhost:4000/key/generate \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "key_alias": "client-acme-search",
    "max_budget": 50.0,
    "budget_duration": "monthly",
    "tpm_limit": 100000,
    "models": ["anthropic/claude-sonnet-4-5"]
  }'

Κάντε την αριθμητική με τις δημοσιευμένες τιμές: με $3,00 / $15,00 ανά εκατομμύριο tokens του Claude Sonnet 5, τα $50 αγοράζουν περίπου 16,7 εκατ. input tokens ή 3,3 εκατ. output tokens, περίπου μία εβδομάδα κίνησης για έναν από τους ελαφρύτερους client agents μας. Αυτή είναι ακριβώς η ακτίνα έκρηξης που θέλουμε. Το tpm_limit είναι η δεύτερη ασφάλεια: ένας ανεξέλεγκτος βρόχος χτυπά τα 100 χιλ. tokens ανά λεπτό πολύ πριν χτυπήσει τον μηνιαίο προϋπολογισμό. Η απόδοση ανά χρήστη δουλεύει με τον ίδιο τρόπο μέσω του endpoint users και ο οδηγός μας για τα καλύτερα εργαλεία gateway LLM καλύπτει πότε ένα proxy αξίζει τη θέση του και πότε είναι απλώς άλλο ένα hop.

Langfuse: cost tracing με @observe

Η αυτόματη συμπλήρωση της Google ζευγαρώνει το "langfuse monitoring" με αυτό το ερώτημα και υπάρχει καλός λόγος: το Langfuse είναι η προεπιλογή ανοιχτού κώδικα στο tracing. Το Python SDK του τυλίγει τον client του παρόχου σας ώστε κάθε κλήση να γίνεται trace που φέρει πλήθος tokens και υπολογισμένο κόστος, σύμφωνα με την τεκμηρίωση tracing του Langfuse:

python
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai  # drop-in wrapper, auto-traces

@observe()
def answer(question: str):
    return openai.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": question}],
    )

answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cards

Το κόστος προσγειώνεται στο trace χωρίς καμία αριθμητική tokens από την πλευρά σας· ομαδοποιήστε τα traces ανά session ή user id για ανακεφαλαιώσεις ανά feature και κάντε self-host αν τα δεδομένα δεν μπορούν να φύγουν από το δίκτυό σας.

Datadog LLM Observability: αν είστε ήδη μέσα

Αν η ομάδα σας ήδη τρέχει Datadog agents, η τεκμηρίωση κόστους LLM της είναι η βαθύτερη ενιαία αναφορά σε αυτή τη σελίδα: κόστος ανά αίτημα σε nanodollars, προσαρμοσμένα cost_tags για αναλύσεις ανά ομάδα και feature και πραγματική ενότητα αντιμετώπισης προβλημάτων για κενά μερικού κόστους. Το ειλικρινές όριο: είναι μόνο Datadog. Οι μετρικές δεν φεύγουν από την πλατφόρμα και δεν υπάρχει εναλλακτική ανοιχτού κώδικα αν η τιμολόγηση σταματήσει να ταιριάζει. Διαλέξτε το για ενοποίηση, όχι για ευελιξία.

Πώς Συνδέετε Προϋπολογισμούς, Ειδοποιήσεις και Επιμερισμό;

Το συνδέετε σε τρία στρώματα: ένα όριο προϋπολογισμού που απορρίπτει αιτήματα στο όριο, μια ειδοποίηση webhook που πυροδοτείται σε ένα ποσοστιαίο κατώφλι πριν από το όριο και virtual keys ανά ομάδα που μετατρέπουν το showback και τον επιμερισμό σε ερώτημα αντί για καβγά. Το LiteLLM τα παραδίδει και τα τρία εκ κατασκευής· τα μοτίβα μεταφέρονται σε οποιοδήποτε gateway με προϋπολογισμούς επιπέδου key.

Ένας προϋπολογισμός που μόνο μετράει είναι αναφορά· ένας προϋπολογισμός που απορρίπτει αιτήματα στο όριο είναι έλεγχος.

Ειδοποιήσεις που πυροδοτούνται πριν από την έξαρση

Ορίστε την ειδοποίηση στο 80% του ορίου, όχι στο 100%. Το LiteLLM παραδίδει ειδοποιήσεις Slack ενσωματωμένες: ορίστε alerting: ["slack"] και alerting_threshold: 80 στο general_settings, δείξτε τη μεταβλητή περιβάλλοντος SLACK_WEBHOOK_URL σε ένα κανάλι και ένα μήνυμα σαν αυτό προσγειώνεται όταν ένα key περάσει το κατώφλι:

json
{
  "text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}

Στο 80%, ένας άνθρωπος έχει ακόμα μέρες για να δράσει: υποβάθμιση μοντέλου, σφίξιμο του prompt ή αύξηση του ορίου με ονοματεπώνυμο στην έγκριση. Μια ειδοποίηση στο 100% είναι αυτοψία.

Από το showback στον επιμερισμό

Showback σημαίνει ότι κάθε ομάδα βλέπει τη δική της δαπάνη· επιμερισμός (chargeback) σημαίνει ότι βγαίνει από τον προϋπολογισμό της. Και τα δύο τρέχουν με ένα υλικό: ένα virtual key ανά ομάδα, με tag κατά τη δημιουργία. Η μηνιαία αναφορά είναι τότε ένα group-by πάνω στον πίνακα δαπάνης:

ΟμάδαΜηνιαίος προϋπολογισμόςΔαπάνη μέχρι σήμεραΚατάσταση
search$50$40,18η ειδοποίηση πυροδοτήθηκε στο 80%
support-chat$200$112,40εντός πορείας
evals-batch$30$29,97πιάστηκε το όριο, απορρίπτει
sandbox$10$1,06εντός πορείας

Παράδειγμα μορφής, όχι δεδομένα πελάτη. Η γραμμή evals-batch είναι το μοτίβο να δουλεύει όπως πρέπει: η δουλειά batch έτρεξε μέχρι το όριό της και σταμάτησε, αντί να αιμορραγεί σιωπηλά μέσα στο τιμολόγιο. Η συμπεριφορά επιβολής τεκμηριώνεται στην τεκμηρίωση virtual_keys του LiteLLM, συμπεριλαμβανομένου του πώς μηδενίζει η διάρκεια προϋπολογισμού.

Γιατί το Dashboard σας Διαφωνεί με τον Λογαριασμό;

Επειδή τα dashboards χρεώνουν με τιμή καταλόγου, ενώ τα τιμολόγια εφαρμόζουν εκπτώσεις που η παρακολούθησή σας δεν βλέπει ποτέ. Η cached είσοδος προσγειώνεται στο 0,1x έως 0,25x της βασικής τιμής, τα batch τρέχουν με τη μισή και τα reasoning tokens χρεώνονται με τιμή εξόδου μέσα από το πλήθος εξόδου. Όταν οι δύο αριθμοί αποκλίνουν, το τιμολόγιο είναι συνήθως το χαμηλότερο και η διαφορά είναι σχεδόν πάντα ένας από τέσσερις τροποποιητές.

Τροποποιητής τιμήςΤυπικός πολλαπλασιαστήςΕπίδραση στην εκτίμησή σας
Cached είσοδος (ανάγνωση cache)0,1x–0,25x της βασικής εισόδουΤο dashboard τρέχει ψηλά αν χρεώνει τα cache hits με πλήρη τιμή
Batch API0,5x σε είσοδο και έξοδοΟι ασύγχρονες εργασίες κοστίζουν τη μισή παρακολουθούμενη τιμή
Reasoning tokens1x τιμή εξόδου, μετρημένα μέσα στην έξοδοΟι μακριές αλυσίδες σκέψης καίνε σιωπηλά προϋπολογισμό εξόδου
Εγγραφή cache~1,25x βασικής εισόδουΤο πρώτο αίτημα σε ένα παράθυρο cache κοστίζει ελαφρώς περισσότερο

Ο ανοιχτός κατάλογος pydantic/genai-prices δείχνει γιατί αυτοί οι πολλαπλασιαστές διαφέρουν ανά μοντέλο: κάθε πάροχος ορίζει τους δικούς του συντελεστές cache και batch, οπότε ένας ενιαίος σκληροκωδικοποιημένος πίνακας τιμών αποκλίνει την ημέρα που ένας πάροχος αναθεωρεί τους καταλόγους του. Η τεκμηρίωση κόστους της Datadog τεκμηριώνει το άλλο μισό του προβλήματος: κενά μερικού κόστους όπου ένα πεδίο token που λείπει επιστρέφει COST UNAVAILABLE για ένα αίτημα. Κοιτάξτε εκεί όταν το dashboard διαβάζει χαμηλότερα από το τιμολόγιο· κοιτάξτε τον πίνακα εκπτώσεων όταν διαβάζει ψηλότερα. Ο μηχανισμός πίσω από τον μεγαλύτερο πολλαπλασιαστή είναι το prompt caching LLM και μια υψηλή αναλογία επιτυχιών cache είναι ο πιο κοινός λόγος που μια παρακολουθούμενη εκτίμηση υπερβαίνει τον πραγματικό λογαριασμό.

Μια εκτίμηση κόστους χωρίς εκπτώσεις cache-hit και batch είναι ταβάνι, όχι πρόβλεψη.

Ποια Εργαλεία Κάνουν Πραγματικά Καταγραφή Κόστους LLM;

Έξι εργαλεία καλύπτουν τα περισσότερα production setups: Langfuse, LiteLLM, Helicone και Portkey από την πλευρά ανοιχτού κώδικα και gateway, Datadog και Braintrust από την εμπορική πλευρά. Ο ειλικρινής διαχωρισμός είναι επιβολή έναντι παρατηρησιμότητας: ένα proxy μπορεί να απορρίψει αιτήματα σε έναν προϋπολογισμό, ενώ ένα εργαλείο tracing μετρά τη δαπάνη εκ των υστέρων. Τα περισσότερα ώριμα stacks καταλήγουν με ένα από το καθένα.

ΕργαλείοΤύποςΠροσέγγιση καταγραφής κόστουςΔωρεάν πλάνοΔιαλέξτε το αν...
LangfuseΑνοιχτού κώδικαΚόστος ανά trace από κάρτες τιμών μοντέλων, self-hostableΔωρεάν self-hosted· δωρεάν hobby πλάνο στο cloudΘέλετε ανοιχτό κώδικα και δική σας ιδιοκτησία δεδομένων
LiteLLMProxy ανοιχτού κώδικαΠροϋπολογισμοί key και ομάδας που επιβάλλονται στο gatewayΔωρεάν (OSS)· επί πληρωμή enterpriseΧρειάζεστε προϋπολογισμούς που απορρίπτουν αιτήματα, όχι απλώς μετρούν
HeliconeGateway ανοιχτού κώδικαΑρχεία κόστους επιπέδου proxy ανά key και μοντέλοΔωρεάν πλάνο με όρια ρυθμούΘέλετε αλλαγή proxy μίας γραμμής χωρίς αλλαγές SDK
PortkeyΕμπορικό gatewayΠροϋπολογισμοί virtual key συν αναλυτικά κόστουςΔωρεάν developer πλάνοΘέλετε gateway, prompts και evals σε ένα πάνελ
Datadog LLM ObservabilityΕμπορικόΜετρικές αιτήματος σε nanodollar συν cost_tagsΔοκιμή 14 ημερώνΤρέχετε ήδη Datadog για όλα τα υπόλοιπα
BraintrustΕμπορικόΔαπάνη συνδεδεμένη με evals ανά projectΔωρεάν πλάνοΗ δουλειά κόστους σας ξεκινά από evals, όχι από τιμολόγια

Μια επιφύλαξη για το περιεχόμενο παρόχων σε αυτόν τον χώρο: η δική του σύγκριση εργαλείων καταγραφής κόστους του Braintrust το 2026 κατατάσσει τον εαυτό του πρώτο και παραλείπει κάθε επιλογή ανοιχτού κώδικα στον παραπάνω πίνακα. Διαβάζετε τα listicle των παρόχων για τα δεδομένα τους, όχι για τις κατατάξεις τους.

Για μια ομάδα που ξεκινά από το μηδέν, θα τρέχαμε LiteLLM μπροστά και Langfuse πίσω του: το proxy επιβάλλει τους προϋπολογισμούς, τα traces τους εξηγούν και το δίδυμο δεν κοστίζει τίποτα μέχρι να περάσετε στα φιλοξενούμενα πλάνα. Αν ζυγίζετε τις δύο προεπιλογές tracing, η ανάλυσή μας Langfuse vs Langsmith μπαίνει σε βάθος σε αυτή την επιλογή και η συλλογή για τις καλύτερες πλατφόρμες παρατηρησιμότητας AI καλύπτει ολόκληρο το πεδίο.

Από την Παρακολούθηση στη Μείωση Κόστους

Η παρακολούθηση δείχνει πού πάνε τα λεφτά· το επόμενο βήμα είναι να αποφασίσετε πόσα πάνε εκεί. Οι τρεις μοχλοί, σε σειρά απόδοσης: cache για επαναλαμβανόμενη είσοδο, δρομολόγηση εύκολων αιτημάτων σε φθηνότερα μοντέλα και σμίκρυνση του μοντέλου όπου η ποιότητα ακόμα αντέχει. Ο οδηγός μας για μείωση κόστους API LLM καλύπτει κάθε μοχλό και η σύγκριση τιμολόγησης API LLM είναι η είσοδος σε όλα τα παραπάνω μαθηματικά.

Η δική μας οπτική: όταν η δαπάνη LLM ενός πελάτη τον ξαφνιάζει, παρακολουθούμε πρώτα και κόβουμε δεύτερα, ποτέ το αντίστροφο. Οι ομάδες που κάνουν cache πριν μετρήσουν συνήθως καταλήγουν να κάνουν cache στα λάθος prompts. Η παρακολούθηση σάς λέει πού πάνε τα λεφτά· το caching και η δρομολόγηση αποφασίζουν πόσα πάνε εκεί. Αν το τιμολόγιό σας ήδη τσιμπάει, πάρτε μια δωρεάν συμβουλευτική και θα κοιτάξουμε τα νούμερα μαζί σας.

Σχετικά με τον Συγγραφέα

Ο Mert Batur είναι Συνιδρυτής του Techsy.io, όπου η ομάδα παραδίδει AI agents, συστήματα αυτοματισμού και pipelines φωνής/SDR για B2B πελάτες. Γράφει για το stack εργαλείων LLM που η ομάδα της Techsy χρησιμοποιεί πραγματικά στην παραγωγή. Συνδεθείτε στο LinkedIn.

Συχνές Ερωτήσεις

Πόσο κοστίζει 1 εκατομμύριο tokens σε LLM;

Με τιμή καταλόγου, οπουδήποτε από $0,14 έως $15 ανά εκατομμύριο ανάλογα με το μοντέλο και την κατεύθυνση: η είσοδος του DeepSeek-V4 κοστίζει $0,14 ανά εκατομμύριο, ενώ η έξοδος του GPT-5.6 Terra κοστίζει $15. Τα output tokens τρέχουν 3 έως 6 φορές την τιμή εισόδου σε κάθε μεγάλο πάροχο. Ο πίνακας στην πρώτη ενότητα έχει τέσσερα μοντέλα και η σύγκριση τιμολόγησης API LLM τιμολογεί και τα δεκαεπτά, επαληθευμένη με τις σελίδες OpenAI και Anthropic τον Ιούλιο του 2026.

Τι είναι η βελτιστοποίηση κόστους LLM;

Η πρακτική του να μειώνετε το κόστος ανά αίτημα χωρίς να ρίχνετε την ποιότητα: prompt caching για επαναλαμβανόμενη είσοδο, δρομολόγηση εύκολων εργασιών σε φθηνότερα μοντέλα, batch API για ασύγχρονη δουλειά και σωστό μέγεθος μοντέλου ανά feature. Η παρακολούθηση κόστους LLM είναι η προϋπόθεση, αφού δεν μπορείτε να βελτιστοποιήσετε ό,τι δεν έχετε αποδώσει. Η αναλογία επιτυχιών cache και το κόστος ανά feature είναι οι δύο μετρικές που δείχνουν πρώτους τους μεγαλύτερους μοχλούς.

Γιατί τα LLM είναι τόσο ακριβά;

Η συμπεραστική λειτουργία (inference) περιορίζεται από τους υπολογισμούς: κάθε token που παράγεται τρέχει ένα πλήρες forward pass του μοντέλου σε GPU και τα reasoning μοντέλα ξοδεύουν επιπλέον tokens σκεπτόμενα πριν απαντήσουν, χρεωμένα με τιμές εξόδου. Τα μακριά system prompts πολλαπλασιάζουν αυτό το κόστος σε κάθε μεμονωμένο αίτημα. Ο λογαριασμός μεγαλώνει με τη φλυαρία και στις δύο πλευρές της κλήσης, γι' αυτό τα tokens ανά αίτημα είναι η πρώτη μετρική που αξίζει να προσέξετε.

Πόσο κοστίζει ένα LLM στις ΗΠΑ;

Η τιμολόγηση API είναι σε δολάρια και παγκόσμια: OpenAI, Anthropic και Google χρεώνουν την ίδια τιμή καταλόγου ανά εκατομμύριο tokens είτε το αίτημα ξεκινά από το Οχάιο είτε από την Οσάκα. Οι περιφερειακές διαφορές εμφανίζονται στο self-hosting, όπου οι ώρες GPU ποικίλλουν ανά cloud region, και στις φιλοξενούμενες πλατφόρμες που προσθέτουν προσαύξηση. Για δουλειά API, η τοποθεσία αλλάζει την καθυστέρηση, όχι την τιμή.

Πώς παρακολουθώ το κόστος LLM ανά ομάδα;

Εκδώστε ένα virtual key ανά ομάδα μέσω ενός proxy όπως το LiteLLM, βάλτε tag σε κάθε key με το όνομα της ομάδας κατά τη δημιουργία και αθροίστε τη δαπάνη ανά αυτό το tag. Κάθε αίτημα τότε φέρει απόδοση από τη στιγμή που γίνεται, χωρίς parsing αρχείων καταγραφής. Ο πίνακας showback στην ενότητα προϋπολογισμών παραπάνω είναι το τελικό προϊόν: ομάδα, μηνιαίος προϋπολογισμός, δαπάνη μέχρι σήμερα, κατάσταση.

Langfuse ή Datadog για καταγραφή κόστους LLM: ποιο να διαλέξω;

Διαλέξτε Langfuse αν θέλετε ανοιχτό κώδικα, self-hosting και δεδομένα που ελέγχετε· τρέχει δωρεάν και ιχνηλατεί κόστος ανά αίτημα έτοιμο από το κουτί. Διαλέξτε Datadog μόνο αν η ομάδα σας το τρέχει ήδη για υποδομές, αφού οι λειτουργίες κόστους LLM του δεν φεύγουν από την πλατφόρμα. Για τις περισσότερες ομάδες που ξεκινούν φρέσκες, το Langfuse μαζί με ένα LiteLLM proxy υπερέχει έναντι οποιασδήποτε επιλογής μεμονωμένα.

Το εκτιμώμενο κόστος LLM ταιριάζει με το πραγματικό τιμολόγιο;

Όχι και συνήθως το τιμολόγιο είναι χαμηλότερο. Τα dashboards χρεώνουν με τιμή καταλόγου, ενώ η cached είσοδος προσγειώνεται στο 0,1x έως 0,25x και οι εργασίες batch στο 0,5x, οπότε ένα workload με πολλή cache βλέπει τον πραγματικό λογαριασμό να έρχεται καλά κάτω από την παρακολουθούμενη εκτίμηση. Τα πεδία token που λείπουν σπρώχνουν το σφάλμα προς την άλλη κατεύθυνση. Ο πίνακας αποκλίσεων παραπάνω παραθέτει κάθε πολλαπλασιαστή και πού να κοιτάξετε.

Πώς ειδοποιούμαι για εξάρσεις δαπάνης LLM;

Ορίστε μια ειδοποίηση κατωφλίου στο 80% του μηνιαίου προϋπολογισμού κάθε ομάδας, παραδιδόμενη στο Slack μέσω webhook, συν μια ειδοποίηση ανωμαλίας από μέρα σε μέρα στο +50% για βρόχους που καίνε γρήγορα. Το LiteLLM παραδίδει το μοτίβο κατωφλίου εκ κατασκευής μέσω της ρύθμισης alerting_threshold. Μια ειδοποίηση στο 80% αφήνει μέρες για αντίδραση· μια ειδοποίηση στο 100% απλώς επιβεβαιώνει ότι το όριο έκανε τη δουλειά του.

Υπάρχει δωρεάν tracker κόστους LLM;

Ναι, τρία αξιόπιστα. Το self-hosted Langfuse είναι δωρεάν και ανοιχτού κώδικα, με δωρεάν hobby πλάνο στο cloud σύμφωνα με τη σελίδα τιμολόγησης του Langfuse. Οι ενσωματωμένοι προϋπολογισμοί key του LiteLLM δεν κοστίζουν τίποτα στο proxy ανοιχτού κώδικα. Το δωρεάν πλάνο του Helicone καλύπτει αρχεία κόστους επιπέδου proxy με όρια ρυθμού. Τα δωρεάν πλάνα καλύπτουν την παρακολούθηση· η επιβολή και οι ειδοποιήσεις σε κλίμακα είναι εκεί που αρχίζουν τα επί πληρωμή πλάνα.

Συμπέρασμα

Διαλέξτε μια διαδρομή setup σήμερα, γιατί η ειδοποίηση που θα θέλετε σε έξι εβδομάδες παίρνει ένα απόγευμα να στηθεί τώρα. Η σύντομη εκδοχή:

  • Παρακολουθήστε πρώτα τα tokens ανά αίτημα και το κόστος ανά ομάδα· προσθέστε τις άλλες τρεις μετρικές μόλις δουλέψουν αυτές.
  • Ένας προϋπολογισμός που απορρίπτει αιτήματα είναι έλεγχος· αυτός που μόνο μετράει είναι αναφορά.
  • Ορίστε την ειδοποίηση στο 80%, στο Slack, πριν προλάβει να ξαφνιάσει κανέναν το τιμολόγιο.
  • Το dashboard σας είναι εκτίμηση· οι τιμές cached input και batch σημαίνουν ότι ο λογαριασμός συνήθως προσγειώνεται κάτω από αυτήν.

Αν προτιμάτε να κοιτάξει κάποιος τα νούμερά σας μαζί σας, πάρτε μια δωρεάν συμβουλευτική.

Ετικέτες

παρακολούθηση κόστους llmκαταγραφή κόστους llmπαρακολούθηση χρήσης tokensπαρατηρησιμότητα llm

Κοινοποίηση άρθρου

Σχετικά άρθρα

Περισσότερα στο ai-machine-learning

ai-machine-learning
Jul 28, 2026

Αξιολόγηση MCP: Το Harness των 7 Ισχυρισμών που Γράψαμε για το Spec της 2026-07-28

Η αναθεώρηση MCP της 2026-07-28 αφαίρεσε το handshake initialize, αρίθμησε εκ νέου τρεις κωδικούς σφάλματος και έκανε κάθε αίτημα αυτόνομο. Ακολουθούν επτά ντετερμινιστικοί ισχυρισμοί συμμόρφωσης που μπορείτε να τρέχετε σε κάθε push, μαζί με τα επίπεδα συμπεριφοράς, αστάθειας, ασφάλειας και CI που χτίζονται από πάνω τους.

15 λεπτά ανάγνωσης εξάγουμε ανάγνωση
Ανάγνωση
ai-machine-learning
Jul 27, 2026

Οι καλύτεροι δημιουργοί AI κοπέλας το 2026: με τι τρέχουν πραγματικά (και είναι παράξενο;)

Ξεμοντάραμε επτά από τους μεγαλύτερους δημιουργούς AI κοπέλας για να δούμε με τι τρέχουν πραγματικά: LLM συντονισμένα σε persona, διανυσματική μνήμη, παραγωγή εικόνας και φωνής. Μια τεχνική ανάλυση, συν η ειλικρινής μας γνώμη για το αν είναι παράξενο.

13 λεπτά ανάγνωση εξάγουμε ανάγνωση
Ανάγνωση
ai-machine-learning
Jul 24, 2026

Το Claude Opus 5 είναι εδώ: Νοημοσύνη κοντά στο Fable 5 στη μισή τιμή

Η Anthropic κυκλοφόρησε το Claude Opus 5 στις 24 Ιουλίου 2026. Περισσότερο από διπλασιάζει το Opus 4.8 στο Frontier-Bench και κρατά την τιμή του Opus, αλλά χάνει σε μερικά τεστ από το Fable 5 και το Mythos 5. Εδώ είναι ο πίνακας benchmarks, η τιμολόγηση και η απόφαση αλλαγής/αναμονής/παραμονής.

10 min read εξάγουμε ανάγνωση
Ανάγνωση
Ξεκινήσετε το Project σας

Έτοιμοι να δημιουργήσουμε κάτι εξαιρετικό;

Ας κάνουμε το όραμά σας πραγματικότητα. Η ομάδα μας είναι έτοιμη να σας βοηθήσει να φτιάξετε λογισμικό που κάνει τη διαφορά.