
Το TurboQuant της Google Συρρίκνωσε ένα Ευρετήριο AI 31GB σε 4GB — Τι Σημαίνει Πραγματικά
31GB σε 4GB. Αυτός είναι ο αριθμός που αφαίρεσε μερικές ποσοστιαίες μονάδες από τη μετοχή της Micron τον Ιούνιο του 2026, και αυτός που έκανε το μισό dev Twitter να πανικοβληθεί για το αν οι λογαριασμοί RAG τους μόλις κατέρρευσαν. Τα μαθηματικά από κάτω είναι αληθινά: Το TurboQuant της Google (arXiv 2504.19874, έγινε αποδεκτό στο ICLR 2026) συμπιέζει τη μνήμη ενός LLM περίπου 6 φορές σε περίπου 3 bits ανά τιμή με σχεδόν μηδενική απώλεια ακρίβειας. Αλλά τα περισσότερα άρθρα έκαναν ένα λάθος, και αυτό αλλάζει τον τρόπο που πρέπει να διαβάσετε ολόκληρη την ιστορία.
Η ιστορία της συμπίεσης μνήμης AI του Google TurboQuant είναι στην πραγματικότητα δύο ιστορίες που φορούν το ίδιο hoodie. Ας τις ξεμπερδέψουμε.
Βασικά Συμπεράσματα
- Το TurboQuant είναι ο αλγόριθμος συμπίεσης της Google χωρίς εκπαίδευση: μείωση ~6x του KV-cache σε ~3 bits, σχεδόν μηδενική απώλεια ακρίβειας (ICLR 2026).
- Το TurboVec είναι μια ξεχωριστή βιβλιοθήκη Rust τρίτων που υλοποιεί το TurboQuant. Η Google δεν το κυκλοφόρησε.
- Το ιογενές demo «31GB → 4GB, ξεπερνά το FAISS» ανήκει στο TurboVec, όχι στο ίδιο το TurboQuant.
- Το πραγματικό κέρδος για τους προγραμματιστές είναι φθηνότερος συμπερασμός μακρού πλαισίου και μικρότερα ευρετήρια RAG, αλλά η επίσημη κυκλοφορία της Google είναι μια δημοσίευση, όχι ένα προϊόν.
Τι Είναι το TurboQuant της Google, σε Απλά Λόγια;
Το TurboQuant είναι ο αλγόριθμος διανυσματικής κβάντωσης της Google Research, χωρίς εκπαίδευση και ανεξάρτητος από τα δεδομένα. Συμπιέζει τον KV cache ενός LLM περίπου 6 φορές, σε περίπου 3 bits ανά τιμή, με σχεδόν μηδενική απώλεια ακρίβειας. Έχει δημοσιευτεί στο arXiv 2504.19874 και έγινε αποδεκτό στο ICLR 2026. Το «χωρίς εκπαίδευση» σημαίνει ότι λειτουργεί σε υπάρχοντα μοντέλα απευθείας, χωρίς να απαιτείται fine-tuning.
Τι συμπιέζεται στην πραγματικότητα; Κυρίως δύο πράγματα.
Πρώτον, ο KV cache. Όταν ένα μοντέλο διαβάζει τη συνομιλία σας, αποθηκεύει μια συνεχώς ενημερούμενη περίληψη όλων όσων έχουν ειπωθεί μέχρι στιγμής, που ονομάζεται key-value cache. Σκεφτείτε το ως τη βραχυπρόθεσμη μνήμη του μοντέλου. Όσο μεγαλύτερο είναι το παράθυρο πλαισίου σας, τόσο περισσότερη από αυτή τη μνήμη κρατά, και τόσο περισσότερη RAM της GPU καταναλώνει. Μια συνομιλία 128k tokens μπορεί να διογκώσει τον KV cache σε πολλά gigabytes. Γι' αυτό η εξυπηρέτηση μακρού πλαισίου γίνεται γρήγορα ακριβή, και γι' αυτό το prompt caching για μείωση του κόστους API έγινε θέμα εξαρχής.
Δεύτερον, τα διανυσματικά ευρετήρια. Τα embeddings που τροφοδοτούν τη σημασιολογική αναζήτηση και το RAG είναι μεγάλοι πίνακες αριθμών κινητής υποδιαστολής. Αποθηκεύστε εκατομμύρια από αυτά σε πλήρη ακρίβεια και μιλάτε για δεκάδες gigabytes RAM.
Το TurboQuant συρρικνώνει και τα δύο. Να και το ωραίο μέρος: δεν χρειάζεται κανένα από τα δεδομένα σας για να το κάνει. Τα περισσότερα σχήματα κβάντωσης μελετούν πρώτα ένα δείγμα των διανυσμάτων σας και μετά φτιάχνουν ένα codebook προσαρμοσμένο σε αυτά. Το TurboQuant το παραλείπει αυτό. Είναι ανεξάρτητο από τα δεδομένα, που σημαίνει ότι πετυχαίνει τον λόγο συμπίεσής του χωρίς ποτέ να κοιτάξει την κατανομή σας.
Το πραγματικό κόλπο του TurboQuant δεν είναι ο λόγος συμπίεσης. Είναι ότι χρειάζεται μηδενικά δεδομένα εκπαίδευσης για να τον πετύχει.
Αυτό είναι το γνήσιο ξεκλείδωμα. Μπορείτε να το στρέψετε σε ένα μοντέλο που ήδη τρέχετε και να πάρετε την εξοικονόμηση αμέσως.
TurboQuant εναντίον TurboVec: Η Σύγχυση που Όλοι Κάνουν Λάθος
Το TurboQuant είναι ο αλγόριθμος συμπίεσης της Google (arXiv 2504.19874, ICLR 2026). Το TurboVec είναι μια ξεχωριστή βιβλιοθήκη Rust και Python τρίτων (RyanCodrai/turbovec) που υλοποιεί το TurboQuant για διανυσματική αναζήτηση. Η Google δεν κυκλοφόρησε το TurboVec. Το ιογενές αποτέλεσμα «31GB → 4GB, ξεπερνά το FAISS» ανήκει στο TurboVec, όχι στο ίδιο το TurboQuant. Αν θυμάστε ένα πράγμα από αυτό το άρθρο, να είναι αυτό.
Εδώ είναι που τα πράγματα μπερδεύτηκαν. Όταν το benchmark 31GB→4GB έγινε ιογενές στις αρχές Ιουνίου 2026, μερικά μέσα (όπως το Tech Startups) έτρεξαν τίτλους που έλεγαν ότι η Google είχε «κυκλοφορήσει το TurboVec». Αυτό δεν συνέβη. Ελέγξτε την πηγή: το TurboVec βρίσκεται στο RyanCodrai/turbovec στο GitHub και το PyPI. Είναι μια βιβλιοθήκη ανοιχτού κώδικα φτιαγμένη από έναν προγραμματιστή ονόματι Ryan Codrai. Το MarkTechPost απέδωσε σωστά το πλαίσιο, περιγράφοντάς το ως «ένα διανυσματικό ευρετήριο Rust με Python bindings, χτισμένο πάνω στον αλγόριθμο TurboQuant της Google».
Άρα η σχέση είναι απλή: η Google δημοσίευσε τα μαθηματικά, και η κοινότητα έφτιαξε εργαλεία με αυτά. Το TurboVec είναι το πιο ορατό από αυτά τα εργαλεία.

| TurboQuant | TurboVec | |
|---|---|---|
| Τι είναι | Αλγόριθμος συμπίεσης | Βιβλιοθήκη διανυσματικού ευρετηρίου (Rust + Python) |
| Ποιος το έφτιαξε | Google Research + DeepMind | Ryan Codrai (τρίτος) |
| Πού | arXiv 2504.19874, ICLR 2026 | GitHub RyanCodrai/turbovec, PyPI |
| Κύριος αριθμός | Μείωση KV-cache ~6x σε ~3 bits | 31GB σε ~4GB για ευρετήριο 10 εκατ. εγγράφων |
| Κατάσταση | Ερευνητική δημοσίευση + αλγόριθμος | Λειτουργική βιβλιοθήκη ανοιχτού κώδικα |
Η Google έφτιαξε τον αλγόριθμο. Ένας προγραμματιστής ονόματι Ryan Codrai έφτιαξε τη βιβλιοθήκη που όλοι βγάζουν screenshot. Δεν είναι το ίδιο πράγμα.
Αν σκέφτεστε πού ταιριάζει ένα ευρετήριο βασισμένο στο TurboQuant δίπλα στην τρέχουσα εγκατάστασή σας, η σύνοψή μας για τις καλύτερες διανυσματικές βάσεις δεδομένων το 2026 βάζει το FAISS, το Qdrant και τα νεότερα συμπιεσμένα ευρετήρια δίπλα-δίπλα.
Πώς το TurboQuant Συμπιέζει τη Μνήμη Χωρίς να Καταστρέφει την Ακρίβεια;
Το TurboQuant χρησιμοποιεί μια τυχαία περιστροφή συν ένα σχήμα κβάντωσης πολικών συντεταγμένων (PolarQuant) και μια προβολή τύπου Johnson-Lindenstrauss (QJL, Quantized Johnson-Lindenstrauss) για να απλώσει ομοιόμορφα τις τιμές πριν την κβάντωση. Αυτή η σχεδόν βέλτιστη παραμόρφωση είναι που του επιτρέπει να πέσει σε περίπου 3 bits ανά τιμή διατηρώντας την ακρίβεια σχεδόν άθικτη, χωρίς να απαιτείται επανεκπαίδευση του μοντέλου.
Ας το ξεδιπλώσουμε, γιατί η ορολογία κρύβει μια αρκετά διαισθητική ιδέα.
Όταν κάνετε κβάντωση, στρογγυλοποιείτε αριθμούς σε λιγότερα bits. Ο κίνδυνος είναι ότι ορισμένες διαστάσεις ενός διανύσματος έχουν πολύ μεγαλύτερο βάρος από άλλες, οπότε η άτσαλη στρογγυλοποίησή τους καταστρέφει το αποτέλεσμα. Η λύση του TurboQuant είναι να περιστρέψει πρώτα τυχαία το διάνυσμα. Φανταστείτε ότι ανακατεύετε ομοιόμορφα μια τράπουλα πριν μοιράσετε, ώστε κανένα χέρι να μην καταλήξει στραβό. Μετά την περιστροφή, οι τιμές είναι απλωμένες ώστε καμία διάσταση να μην κυριαρχεί, και η στρογγυλοποίηση πονάει πολύ λιγότερο.
Αυτό είναι το μέρος του QJL: μια τυχαία προβολή που αναμειγνύει τα πάντα διατηρώντας τις αποστάσεις. Το PolarQuant (παρουσιάστηκε στο AISTATS 2026) στη συνέχεια κβαντίζει τις περιστραμμένες τιμές σε πολικές συντεταγμένες, που ταιριάζει στην κατανομή τους καλύτερα από την απλή στρογγυλοποίηση πλέγματος.
Το αποτέλεσμα είναι αυτό που η δημοσίευση ονομάζει σχεδόν βέλτιστη παραμόρφωση, που σημαίνει ότι πλησιάζει το θεωρητικό όριο Shannon για το πόση ποιότητα μπορείτε να χάσετε σε ένα δεδομένο bit budget. Με απλά λόγια: για 3 bits ανά τιμή, ουσιαστικά δεν μπορείτε να κάνετε πολύ καλύτερα, και το TurboQuant φτάνει εκεί χωρίς να μελετήσει τα δεδομένα σας.
Για τον πλήρη μηχανισμό, το blog του Google Research και η δημοσίευση στο arXiv είναι οι πρωταρχικές πηγές. Το InfoQ έχει επίσης μια καθαρή ανάλυση προσανατολισμένη στους προγραμματιστές για τη γωνία του KV-cache αν θέλετε το πλαίσιο του ασκούντος.
Τι Σημαίνει Πραγματικά το 31GB → 4GB για τον Λογαριασμό RAM Σας;
Ένα ευρετήριο RAG 10 εκατ. διανυσμάτων που χρειάζεται ~31GB RAM σε πλήρη ακρίβεια πέφτει σε περίπου ~4GB με τη συμπίεση του TurboVec που βασίζεται στο TurboQuant, αρκετά μικρό για να χωρέσει σε μια κοινή instance αντί για μια κατηγορία βαριά σε μνήμη. Για τον KV cache, η μείωση ~6x σημαίνει περίπου 6x περισσότερες ταυτόχρονες συνεδρίες μακρού πλαισίου στην ίδια GPU. Αυτό είναι το μέρος που πραγματικά εμφανίζεται σε έναν λογαριασμό.
Τρέξαμε τους αριθμούς που οι ανταγωνιστές δεν θα τρέξουν. Μια γρήγορη σημείωση ειλικρίνειας πρώτα: όλα τα παρακάτω είναι εκτιμήσεις και μοντέλα (Ιούνιος 2026) από δημόσιες τιμές cloud και τους δηλωμένους λόγους της δημοσίευσης. Δεν έχουμε τρέξει το TurboVec σε παραγωγή, οπότε αντιμετωπίστε τα ως τα μαθηματικά, όχι ως benchmark που μετρήσαμε φυσικά. Οι κατηγορίες τιμών ακολουθούν την ίδια βάση που χρησιμοποιούμε στον οδηγό μας για τη μείωση του κόστους API LLM.

Να ένα ευρετήριο embeddings 10 εκατ. εγγράφων, πλήρης ακρίβεια εναντίον συμπιεσμένου με TurboVec, αντιστοιχισμένο στην κατηγορία RAM cloud που πραγματικά θα χρειαζόσασταν:
| Ευρετήριο RAG 10 εκατ. διανυσμάτων | RAM που χρειάζεται | Τυπική κατηγορία instance | Πρόχειρο μηνιαίο εύρος κόστους RAM |
|---|---|---|---|
| Πλήρης ακρίβεια (float32) | ~31 GB | 32GB+ βελτιστοποιημένη για μνήμη | υψηλότερο (κατηγορία βελτιστοποιημένη για μνήμη) |
| Συμπιεσμένο με TurboVec | ~4 GB | 8GB γενικής χρήσης | πολύ χαμηλότερο (κοινή κατηγορία) |
Το άλμα από ένα μηχάνημα βελτιστοποιημένο για μνήμη σε ένα μικρό γενικής χρήσης είναι ολόκληρη η ιστορία. Για ένα αυτο-φιλοξενούμενο ευρετήριο, αυτή είναι συχνά η διαφορά ανάμεσα σε έναν λογαριασμό που σε κάνει να grimace και σε έναν που μόλις προσέχεις. Αν χτίζετε το pipeline που κάθεται πάνω του, ο οδηγός μας για το χτίσιμο μιας εφαρμογής RAG καλύπτει πού ζει αυτό το ευρετήριο.
Τώρα η πλευρά του KV-cache, μοντελοποιημένη σε μια σταθερή GPU 24GB που εξυπηρετεί συνεδρίες πλαισίου 128k:
| KV cache, GPU 24GB @ πλαίσιο 128k | Ταυτόχρονες συνεδρίες (μοντέλο) |
|---|---|
| Πλήρης ακρίβεια | βασική γραμμή (ας την πούμε ~N) |
| TurboQuant ~3-bit (~6x) | περίπου 6x N |
Η μείωση 6x του KV-cache δεν εξοικονομεί απλώς RAM. Μπορεί να μετατρέψει μία GPU σε έξι για εξυπηρέτηση μακρού πλαισίου.
Γι' αυτό αυτό έχει μεγαλύτερη σημασία για τα workloads μακρού πλαισίου από οτιδήποτε άλλο. Αν εξυπηρετείτε πολλές σύντομες συνομιλίες, ο KV cache σας δεν ήταν ποτέ το στενό σημείο. Αν τρέχετε agents 128k tokens ή ανάλυση εγγράφων, μια μείωση 6x αλλάζει τα οικονομικά ανά GPU μέσα σε μια νύχτα. Το ρεπορτάζ του VentureBeat τοποθετεί το κέρδος throughput στο άνω όριο σε έως 8x σε H100 με εξοικονόμηση κόστους 50%+, που συμφωνεί με τα μοντελοποιημένα μαθηματικά συγχρονισμού μας.
Γιατί Έπεσαν οι Μετοχές Τσιπ Μνήμης, και Υπεραντέδρασε η Wall Street;
Μετά την αποκάλυψη του TurboQuant, οι μετοχές των Micron, Western Digital και Seagate έπεσαν από φόβους ότι η ριζικά φθηνότερη μνήμη AI συρρικνώνει τη μελλοντική ζήτηση για DRAM και HBM, το λεγόμενο πλαίσιο «στιγμή DeepSeek». Αναλυτές, συμπεριλαμβανομένης της Wells Fargo, υποστήριξαν το αντίθετο: η φθηνότερη μνήμη οδηγεί σε περισσότερη συνολική χρήση, όχι λιγότερη, μέσω του παραδόξου του Jevons.
Η αφήγηση γράφτηκε μόνη της. Το AI είναι ο μεγαλύτερος αγοραστής μνήμης υψηλού εύρους ζώνης αυτή τη στιγμή, οπότε αν ένας αλγόριθμος της Google κόβει τις ανάγκες μνήμης 6x, λέει η λογική, η ζήτηση για τσιπ πέφτει και μαζί οι κατασκευαστές τσιπ. Το TechCrunch έφτασε μέχρι τη σύγκριση με το «Pied Piper», τη φανταστική startup συμπίεσης από το Silicon Valley του HBO που υποσχόταν να συρρικνώσει τα δεδομένα του κόσμου. Οι μετοχές έπεσαν με αυτόν τον φόβο.
Να η πιο ψύχραιμη ανάγνωση, και είναι αυτή που ο κύκλος των ειδήσεων κυρίως παράλειψε. Η Wells Fargo επεσήμανε το παράδοξο του Jevons: όταν κάτι γίνεται φθηνότερο και πιο αποδοτικό, συνήθως καταναλώνουμε περισσότερο από αυτό συνολικά, όχι λιγότερο. Η φθηνότερη μνήμη AI σημαίνει ότι περισσότερες εφαρμογές κυκλοφορούν λειτουργίες μακρού πλαισίου, περισσότερες ομάδες αυτο-φιλοξενούν μεγαλύτερα ευρετήρια RAG, και γίνεται περισσότερος συμπερασμός, τελεία. Τα κέρδη αποδοτικότητας έχουν μακρά ιστορία στο να αυξάνουν τη συνολική ζήτηση αντί να τη σκοτώνουν.
Η αγορά αποτίμησε το TurboQuant ως δολοφόνο της ζήτησης. Η ιστορία λέει ότι η φθηνότερη υπολογιστική ισχύς συνήθως σημαίνει ότι απλώς χρησιμοποιούμε περισσότερη.
Ήταν λοιπόν η πτώση υπερβολική ανάγνωση; Πιθανώς, τουλάχιστον βραχυπρόθεσμα. Μια ερευνητική δημοσίευση δεν είναι μια ακαριαία αναβάθμιση σε επίπεδο κλάδου. Η αγορά αντέδρασε σε έναν τίτλο· η πραγματική ανάπτυξη θα πάρει τρίμηνα, και το φαινόμενο πρόκλησης ζήτησης μπορεί κάλλιστα να υπερκεράσει την εξοικονόμηση.
Μπορείτε Πραγματικά να Χρησιμοποιήσετε το TurboQuant Σήμερα;
Ναι, εν μέρει. Η επίσημη κυκλοφορία του TurboQuant από τη Google είναι η δημοσίευση και ο αλγόριθμος, όχι ένα προϊόν έτοιμο για χρήση. Αλλά υλοποιήσεις της κοινότητας ήδη υπάρχουν: το TurboVec (RyanCodrai/turbovec, στο PyPI) για διανυσματικά ευρετήρια, και το AmesianX/TurboQuant για το llama.cpp (περίπου 5.2x, με υποστήριξη για DeepSeek-V2/V3 και GLM-4.7-Flash μέσω MLA). Το οικοσύστημα είναι νεαρό αλλά χρησιμοποιήσιμο.
Αν θέλετε να δοκιμάσετε την πλευρά του διανυσματικού ευρετηρίου, το TurboVec είναι ένα pip μακριά:
pip install turbovec
# Rust + Python bindings, implements Google's TurboQuant for vector search
# llama.cpp KV-cache impl (DeepSeek/MLA): github.com/AmesianX/TurboQuant
# Python reference impl: github.com/yashkc2025/turboquantΓια την πλευρά του KV-cache σε τοπικά μοντέλα, η υλοποίηση llama.cpp του AmesianX/TurboQuant είναι αυτή που πρέπει να παρακολουθείτε, ειδικά αν τρέχετε μοντέλα DeepSeek ή GLM με multi-head latent attention. Ταιριάζει ωραία με μια τοπική εγκατάσταση LLM, αφού ένας μικρότερος KV cache σημαίνει ότι μπορείτε να σπρώξετε μεγαλύτερο πλαίσιο στην ίδια κάρτα. Και αν διαλέγετε ποιο ανοιχτό μοντέλο να τρέξετε, τα benchmarks των καλύτερων open-source LLM καλύπτουν τις οικογένειες DeepSeek και GLM απευθείας.
Η ειλικρινής επιφύλαξη: αυτό είναι δημοσίευση-τώρα, οικοσύστημα-που-ωριμάζει. Το επίσημο παραδοτέο της Google είναι έρευνα, όχι ένα υποστηριζόμενο προϊόν με SLA.
Η ειλικρινής απάντηση: το TurboQuant είναι μαθηματικά που μπορούν να σταλούν, όχι ένα κουμπί λήψης. Ακόμα.
Είναι το TurboQuant Hype ή Πραγματικότητα; Μια Ειλικρινής Ετυμηγορία
Το TurboQuant είναι πραγματικό και γνήσια έξυπνο. Ο σχεδιασμός του χωρίς εκπαίδευση είναι το αληθινό ξεκλείδωμα, και το κέρδος του KV-cache έχει τη μεγαλύτερη σημασία για τα workloads μακρού πλαισίου. Αλλά δεν είναι μαγεία: είναι μία πρόοδος κβάντωσης ανάμεσα σε πολλές, ο κύριος αριθμός 31GB→4GB ανήκει στο TurboVec και όχι στη Google, και ο πανικός των μετοχών υπερανέγνωσε ένα ερευνητικό αποτέλεσμα.
Στην εμπειρία μας στη ρύθμιση του κόστους συμπερασμού και RAM για πελάτες, αυτό που αποφασίζει αν μια τεχνική σαν αυτή αξίζει να υιοθετηθεί είναι η τριβή. Το χωρίς εκπαίδευση κερδίζει πολύ εδώ, γιατί δεν υπάρχει κύκλος fine-tuning, κανένα codebook για συντήρηση, καμία εγχείρηση στο μοντέλο. Μπορείτε να το προσαρτήσετε σε κάτι που ήδη τρέχετε.
Τι αλλάζει:
- Φθηνότερος συμπερασμός μακρού πλαισίου, που είναι όπου το κόστος μνήμης πραγματικά πονάει.
- Μικρότερα αυτο-φιλοξενούμενα ευρετήρια RAG που χωράνε σε φθηνότερο hardware.
- Μια επιλογή συμπίεσης που μπορείτε να υιοθετήσετε χωρίς να επανεκπαιδεύσετε τίποτα.
Τι δεν αλλάζει:
- Δεν θα κάνει πολλά για workloads μικρού πλαισίου και μικρών μοντέλων, όπου ο KV cache δεν ήταν ποτέ το στενό σημείο.
- Δεν καθιστά την υπάρχουσα κβάντωσή σας παρωχημένη μέσα σε μια νύχτα· είναι μια προσθήκη, όχι μια αντικατάσταση.
- Η επίσημη κυκλοφορία της Google είναι ακόμα μια δημοσίευση, οπότε εργαλεία επιπέδου παραγωγής είναι θέμα της κοινότητας προς το παρόν.
Αν προσπαθείτε να καταλάβετε τι σημαίνει αυτό για τον δικό σας λογαριασμό συμπερασμού ή RAM, αυτό ακριβώς είναι το είδος της μοντελοποίησης κόστους που κάνουμε για πελάτες στη Techsy. Κλείστε μια δωρεάν συμβουλή αν θέλετε ένα δεύτερο ζευγάρι μάτια σε αυτό.
Σχετικά με τον Συγγραφέα
Ο Mert Batur Gurbuz είναι Συνιδρυτής του Techsy.io, όπου η ομάδα παραδίδει AI agents, συστήματα αυτοματισμού και pipelines φωνής/SDR για B2B πελάτες. Σπουδάζει στο Πανεπιστήμιο του Birmingham και γράφει για το LLM tooling stack που η ομάδα της Techsy χρησιμοποιεί πραγματικά στην παραγωγή. Συνδεθείτε στο LinkedIn.
Συχνές Ερωτήσεις
Τι είναι το Google TurboQuant;
Το TurboQuant είναι ο αλγόριθμος διανυσματικής κβάντωσης της Google Research χωρίς εκπαίδευση, δημοσιευμένος στο arXiv 2504.19874 και αποδεκτός στο ICLR 2026. Συμπιέζει τον KV cache ενός LLM περίπου 6 φορές, σε περίπου 3 bits ανά τιμή, με σχεδόν μηδενική απώλεια ακρίβειας. Επειδή είναι ανεξάρτητος από τα δεδομένα, λειτουργεί σε υπάρχοντα μοντέλα χωρίς κανένα fine-tuning ή επανεκπαίδευση.
Η Google κυκλοφόρησε πραγματικά το TurboVec;
Όχι. Το TurboQuant είναι ο αλγόριθμος της Google. Το TurboVec είναι μια ξεχωριστή βιβλιοθήκη Rust και Python τρίτων (RyanCodrai/turbovec) χτισμένη πάνω στο TurboQuant από έναν ανεξάρτητο προγραμματιστή. Μερικά μέσα απέδωσαν εσφαλμένα στη Google την κυκλοφορία του TurboVec όταν το ιογενές benchmark 31GB→4GB έγινε ιογενές, αλλά το GitHub δείχνει ότι είναι ένα έργο της κοινότητας.
Είναι το TurboQuant το ίδιο με το TurboVec;
Όχι. Το TurboQuant είναι ο αλγόριθμος συμπίεσης που δημοσίευσε η Google. Το TurboVec είναι μία βιβλιοθήκη που υλοποιεί αυτόν τον αλγόριθμο για διανυσματική αναζήτηση. Το ένα είναι τα μαθηματικά· το άλλο είναι ένα εργαλείο χτισμένο με τα μαθηματικά. Το διάσημο αποτέλεσμα «31GB → 4GB, ξεπερνά το FAISS» ανήκει στο TurboVec, όχι σε κάτι που η Google κυκλοφόρησε απευθείας.
Χάνει ακρίβεια το TurboQuant;
Η σχεδόν μηδενική απώλεια ακρίβειας είναι ο κύριος ισχυρισμός της δημοσίευσης, ακόμα και σε περίπου 3 bits ανά τιμή. Ο αλγόριθμος πετυχαίνει σχεδόν βέλτιστη παραμόρφωση (κοντά στο όριο Shannon) περιστρέφοντας τυχαία τα διανύσματα πριν την κβάντωση, ώστε καμία διάσταση να μην κυριαρχεί. Στην πράξη αυτό σημαίνει ότι η πτώση ποιότητας είναι αρκετά μικρή ώστε να είναι αμελητέα για τα περισσότερα workloads.
Πόση RAM εξοικονομεί το TurboQuant;
Περίπου 6x στον KV cache, ρίχνοντάς τον σε περίπου 3 bits ανά τιμή. Στην πλευρά του διανυσματικού ευρετηρίου, το TurboVec επέδειξε ένα ευρετήριο 10 εκατ. εγγράφων να συρρικνώνεται από 31GB σε περίπου 4GB, έως και 92% μείωση μνήμης. Η πραγματική σας εξοικονόμηση εξαρτάται από τη βάση ακρίβειάς σας και από το αν συμπιέζετε KV cache, embeddings, ή και τα δύο.
Είναι αυτό απλώς hype, γιατί έπεσαν οι μετοχές μνήμης;
Είναι μια πραγματική πρόοδος, αλλά ο πανικός υπερανέγνωσε ένα ερευνητικό αποτέλεσμα. Οι Micron, Western Digital και Seagate έπεσαν από φόβους ότι η φθηνότερη μνήμη AI κόβει τη ζήτηση για τσιπ. Η Wells Fargo αντέκρουσε με το παράδοξο του Jevons: η φθηνότερη, πιο αποδοτική μνήμη συνήθως αυξάνει τη συνολική χρήση. Μια δημοσίευση επίσης δεν είναι μια ακαριαία αναβάθμιση του κλάδου, οπότε η βραχυπρόθεσμη αντίδραση φαίνεται υπερβολική.
Μπορώ να χρησιμοποιήσω το TurboQuant σήμερα;
Εν μέρει. Η επίσημη κυκλοφορία της Google είναι η δημοσίευση και ο αλγόριθμος, όχι ένα προϊόν. Υλοποιήσεις της κοινότητας υπάρχουν τώρα: το TurboVec στο PyPI για διανυσματικά ευρετήρια, το AmesianX/TurboQuant για το llama.cpp (DeepSeek-V2/V3 και GLM-4.7-Flash μέσω MLA), και το yashkc2025/turboquant ως αναφορά Python. Το οικοσύστημα είναι νεαρό αλλά ήδη χρησιμοποιήσιμο.
Πώς διαφέρει το TurboQuant από την κβάντωση που ήδη κάνω;
Η περισσότερη κβάντωση μελετά ένα δείγμα των δεδομένων σας για να φτιάξει ένα προσαρμοσμένο codebook. Το TurboQuant είναι χωρίς εκπαίδευση και ανεξάρτητο από τα δεδομένα, οπότε πετυχαίνει τον λόγο του χωρίς ποτέ να κοιτάξει την κατανομή σας. Επίσης στοχεύει ειδικά στον KV cache και τα διανυσματικά ευρετήρια, με σχεδόν βέλτιστη παραμόρφωση, αντί να συμπιέζει απλώς τα βάρη του μοντέλου.
Λειτουργεί το TurboQuant με DeepSeek ή llama.cpp;
Ναι, μέσω της υλοποίησης llama.cpp του AmesianX/TurboQuant, που αναφέρει περίπου 5.2x συμπίεση και υποστηρίζει DeepSeek-V2/V3 και GLM-4.7-Flash μέσω multi-head latent attention (MLA). Αυτό το κάνει μια πρακτική επιλογή αν αυτο-φιλοξενείτε αυτά τα μοντέλα και θέλετε μικρότερο KV cache για μεγαλύτερα πλαίσια στο ίδιο hardware.
Πότε βοηθάει πραγματικά περισσότερο το TurboQuant;
Βοηθάει περισσότερο στον συμπερασμό μακρού πλαισίου και στα μεγάλα αυτο-φιλοξενούμενα ευρετήρια RAG, όπου η μνήμη είναι το πραγματικό στενό σημείο. Μια μείωση 6x του KV-cache σημαίνει περισσότερες ταυτόχρονες συνεδρίες πλαισίου 128k ανά GPU, και ένα συμπιεσμένο ευρετήριο embeddings χωράει σε φθηνότερες instances. Βοηθάει λιγότερο σε συνομιλίες μικρού πλαισίου και μικρά μοντέλα, όπου ο KV cache δεν ήταν ποτέ ο οδηγός του κόστους σας.