ai-machine-learning

I Migliori Database Vettoriali nel 2026: 9 Scelte, Prezzi Reali e Codice per Ognuno

Scritto da Techsy Editorial Team
May 13, 2026
23 lettura
I Migliori Database Vettoriali nel 2026: 9 Scelte, Prezzi Reali e Codice per Ognuno

I Migliori Database Vettoriali nel 2026: 9 Scelte, Prezzi Reali e Codice per Ognuno

Nel 2026 esistono oltre 30 database vettoriali, ma solo una manciata conta davvero per la maggior parte dei team che costruisce sistemi RAG, agenti o ricerca semantica. La scelta giusta dipende più dallo stack esistente che dai numeri di QPS, e il divario tra l'opzione più economica e quella più costosa per lo stesso carico di lavoro è di circa 10 volte. Ecco i nove che useremmo oggi, con prezzi reali e codice funzionante per ciascuno.

Punti chiave:

  • Pinecone Serverless è ancora il percorso più rapido verso la produzione RAG se il budget non è un vincolo.
  • Qdrant offre il miglior rapporto qualità-prezzo open source; ha chiuso un round Series B a marzo 2026.
  • pgvector è "sufficiente" se usi già PostgreSQL e rimani sotto ~10 milioni di vettori.
  • Weaviate, Milvus e Chroma vincono ciascuno in nicchie specifiche; vedi la matrice decisionale più avanti.

Cos'è un database vettoriale (e cosa non è)?

Un database vettoriale è un sistema che memorizza embedding ad alta dimensionalità e serve query ANN (approximate nearest neighbor) con latenza inferiore a 100ms, di solito tramite un indice HNSW o IVF. È alla base di RAG, ricerca semantica e memoria per agenti AI. Le librerie vettoriali come Faiss non sono database: mancano di persistenza, replica e multi-tenancy.

Tre termini si confondono continuamente, quindi chiariamolio subito.

  • Embedding: un vettore numerico (di solito 384–3072 dimensioni) che rappresenta testo, immagine o audio in modo che sia possibile calcolare la similarità.
  • ANN (approximate nearest neighbor): trovare i k vettori più vicini a una query in modo quasi esatto, sacrificando un po' di recall per guadagni enormi in velocità rispetto alla ricerca esatta.
  • HNSW: Hierarchical Navigable Small World, l'indice a grafo che la maggior parte dei database vettoriali moderni usa perché bilancia bene recall e latenza.

La distinzione tra libreria, indice e database conta. Faiss ti dà un indice ANN in memoria: è veloce, ma la persistenza, l'autenticazione e la replica te le gestisci tu. Un database vettoriale avvolge quell'indice con storage, transazioni, filtraggio dei metadati, RBAC e un'API di query. Se stai costruendo un prodotto reale, vuoi il database. Se stai incorporando la ricerca per similarità all'interno di un singolo servizio Python con dati ridotti, una libreria potrebbe bastare.

Un caso a parte da menzionare subito: pgvector è un'estensione di PostgreSQL, non un prodotto standalone. Rientra comunque nella categoria dei database vettoriali perché offre persistenza, transazioni e un'interfaccia SQL — semplicemente montata su Postgres. Ne parliamo più avanti.

Come abbiamo scelto i 9 database vettoriali per il 2026

Dopo aver messo in produzione Pinecone, Qdrant e pgvector negli ultimi 18 mesi — e dopo essere stati svegliati di notte quando la scelta sbagliata si è fatta sentire — tre filtri hanno contato più dei benchmark.

  • Copertura di mercato. Compare in 8 o più dei top 10 confronti SERP per "best vector database." Se nessuno ne scrive, non troverai nessuno da cui imparare quando qualcosa si rompe.
  • Pronto per la produzione nel 2026. Clienti reali che eseguono carichi di lavoro reali su larga scala. Abbiamo escluso startup in stealth e prodotti in beta che non hanno pubblicato un singolo caso studio.
  • Manutenuto. Commit o release stabili negli ultimi sei mesi. Un database vettoriale fermo dal 2024 è una passività, non un asset.

Disclosure onesta: usiamo Qdrant in due dei nostri progetti clienti. Questo non lo rende la risposta giusta per te, e ti diremo esattamente quando non lo è. Non accettiamo sponsorizzazioni da vendor per contenuti sui database vettoriali — ecco perché alcuni nomi che trovi in cima alle "top 10" sponsorizzate altrove non compaiono nella nostra lista.

Qual è il miglior database vettoriale per RAG nel 2026?

Per RAG nel 2026, Pinecone Serverless è il percorso meno faticoso verso la produzione, Qdrant offre il miglior rapporto qualità-prezzo in self-hosting, e pgvector è la risposta giusta se usi già PostgreSQL. Il "miglior database vettoriale per RAG" dipende da scala, preferenza di hosting e stack esistente — non dai numeri dei benchmark.

Ecco come ordineremmo i primi tre per un tipico carico di lavoro RAG (da 1 a 10 milioni di chunk, embedding OpenAI, da 10K a 100K query al giorno):

  1. Pinecone Serverless. Lo metti in produzione nel pomeriggio, l'autoscaling funziona e non hai infrastruttura da sorvegliare. Paga il premium e vai avanti.
  2. Qdrant. Miglior rapporto qualità-prezzo se hai un minimo di capacità operativa. Il filtraggio è eccellente per RAG con molti metadati, e la hybrid search è nativa.
  3. pgvector. Noioso, affidabile e gratuito se paghi già per Postgres. La risposta giusta per circa l'80% dei progetti RAG sotto 10 milioni di vettori.

Tutti i principali vendor di questa lista si integrano con LangChain e LlamaIndex come retriever di prima classe. Nel 2026 è il minimo sindacale, quindi non scegliere in base al supporto ai framework. Scegli in base a costo, scala e larghezza di banda operativa del team.

Se stai ancora definendo il resto della pipeline, dai un'occhiata al broader RAG stack per chunking, reranking e strumenti di valutazione. Sei nuovo al retrieval? Leggi prima come costruire la tua prima app RAG prima di vincolarti a un database. La scelta diventa molto più semplice dopo aver toccato con mano dove stanno i veri colli di bottiglia.

Un'ultima cosa: non scegliere un database vettoriale prima di aver messo a punto la tua strategia di chunking. Chunk mal fatti fanno sembrare pessimo qualsiasi database.

La tabella comparativa — 9 database vettoriali a colpo d'occhio

Otto colonne, nove vendor, numeri reali. Questa è la tabella da mettere tra i preferiti. Ogni colonna è la risposta a una domanda che abbiamo sentito da un cliente reale almeno tre volte nell'ultimo anno. I prezzi sono riferimenti a maggio 2026; tutto cambia ogni trimestre, quindi conferma sulla pagina dei prezzi del vendor prima di firmare un contratto.

VendorTipoIdeale perModello di pricing (2026)Self-host?Hybrid SearchAlgoritmo indiceScala massima (dichiarata)
PineconeManaged (serverless)Percorso più rapido verso RAG in produzione$0 gratuito → $20/mese Builder → basato sull'usoNoSì (sparse-dense)ProprietarioMiliardi
QdrantOpen source + managed cloudMiglior rapporto qualità-prezzo self-hostedOSS gratuito / Tier cloud gratuito / cluster a pagamentoHNSWMiliardi (340M+ verificati)
WeaviateOpen source + managed cloudApp ricche di schema, hybrid search out of the boxOSS gratuito / $25/mese Serverless entrySì (BM25 + dense)HNSWMiliardi
MilvusOpen source + Zilliz CloudDeployment produzione su scala massimaOSS gratuito / Zilliz Cloud basato sull'usoHNSW, IVF, DiskANN, GPUDecine di miliardi
ChromaOpen source (prevalentemente locale)Prototipazione, sviluppo local-firstOSS gratuito / Chroma Cloud betaLimitatoHNSW~10M comfortevoli
pgvectorEstensione PostgresTeam già su PostgresGratuito (la tua fattura Postgres)Tramite pgvectorscale + estensioniHNSW (0.5.0+)~10–50M pratico
MongoDB Atlas Vector SearchManaged (Atlas)Team già su MongoDBPrezzi Atlas (nodi di ricerca)NoHNSWMiliardi
LanceDBOpen source (embedded)Local-first, multimodale, edgeOSS gratuito / LanceDB CloudIVF-PQMiliardi (dichiarato)
Vertex AI Vector Search 2.0Managed (GCP)Team tutto su Google CloudBasato sull'uso GCPNoScaNNMiliardi

I 9 database vettoriali, classificati e spiegati

1. Pinecone — il migliore per arrivare in produzione RAG il più in fretta possibile

Pinecone è il database vettoriale managed predefinito per i team che vogliono zero infrastruttura e hanno il budget per permetterselo. La modalità Serverless è diventata GA nel 2025 ed è ora il prodotto consigliato per la maggior parte dei nuovi progetti.

Perché si distingue:

  • Zero overhead operativo. Nessun cluster da dimensionare, nessuna replica da gestire — solo una chiave API.
  • L'autoscaling serverless gestisce carichi di lavoro variabili senza sharding manuale.
  • La hybrid search sparse-dense è nativa: nessun secondo indice da collegare.

Pricing (maggio 2026): Tier Free (~100K vettori), Builder a $20/mese con letture/scritture/storage basati sull'uso, contratti Enterprise oltre. Secondo la documentazione Pinecone, un tipico carico RAG da 10M vettori si attesta intorno a $700–$900/mese. I dettagli in piccolo contano.

python
from pinecone import Pinecone

pc = Pinecone(api_key="YOUR_KEY")
index = pc.Index("rag-index")
index.upsert([
    {"id": "doc1", "values": [0.1, 0.2, 0.3], "metadata": {"source": "blog"}}
])
results = index.query(vector=[0.1, 0.2, 0.3], top_k=5, include_metadata=True)

Non adatto per: team con requisiti rigidi di data residency, chi ha bisogno di controllo completo sui dati, o budget sotto $20/mese a scala non banale.

2. Qdrant — il migliore per il rapporto qualità-prezzo in self-hosting

Qdrant è il database vettoriale open source che deployiamo più spesso. Il core in Rust è veloce, il filtraggio è davvero eccellente, e il round Series B da $50M a marzo 2026 ha messo risorse serie dietro il prodotto cloud.

Perché si distingue:

  • Performance del filtraggio: i filtri sui payload sono first-class, non aggiunti come ripensamento.
  • Documentazione ottima e client Python che non ti combatte.
  • OSS gratuito, tier cloud gratuito, cluster a pagamento prevedibili quando cresci.

Pricing (maggio 2026): Open source gratuito (Apache 2.0), tier Qdrant Cloud gratuito (cluster da 1GB), cluster a pagamento da ~$25/mese per uno starter da 4GB fino a cluster dedicati con replica. Self-hosted su un Hetzner ax52 costa $60–$120/mese tutto incluso per 10M vettori. Consulta la documentazione Qdrant per l'API client Python aggiornata.

python
from qdrant_client import QdrantClient
from qdrant_client.models import PointStruct, VectorParams, Distance

client = QdrantClient(url="http://localhost:6333")
client.create_collection("rag", vectors_config=VectorParams(size=3, distance=Distance.COSINE))
client.upsert("rag", points=[PointStruct(id=1, vector=[0.1, 0.2, 0.3], payload={"source": "blog"})])
hits = client.query_points("rag", query=[0.1, 0.2, 0.3], limit=5).points

Per un confronto diretto con le alternative open source più ovvie, abbiamo scritto un approfondimento separato head-to-head.

Non adatto per: team con zero capacità operativa che vuole davvero zero infrastruttura (usa Pinecone Serverless in quel caso).

3. Weaviate — il migliore per app ricche di schema con hybrid search nativa

Weaviate è la scelta quando la tua app RAG ha bisogno di più di "blob di testo più metadati." Il modello schema-first e la hybrid search BM25 + dense out of the box lo rendono forte per knowledge base strutturate.

Perché si distingue:

  • Vera hybrid search (BM25 + vettori densi con fusion) senza un secondo sistema.
  • Schema e sistema di moduli permettono di collegare embedding + reranking inline.
  • La multi-tenancy è first-class — comoda se servi embedding per cliente.

Pricing (maggio 2026): Open source gratuito. Cloud ristrutturato a ottobre 2025: Serverless da $25/mese come entry point, tier Enterprise sopra. La documentazione Weaviate descrive il client Python v4.

python
import weaviate

client = weaviate.connect_to_local()
docs = client.collections.get("Docs")
docs.data.insert(properties={"text": "sample"}, vector=[0.1, 0.2, 0.3])
results = docs.query.near_vector(near_vector=[0.1, 0.2, 0.3], limit=5)

Non adatto per: progetti minimali — pagherai (in overhead mentale e denaro) per funzionalità di schema che non ti servono.

4. Milvus — il migliore per i deployment in produzione su scala massima

Milvus è la risposta quando hai superato il miliardo di vettori e stai pensando a decine di miliardi. Le opzioni di indice DiskANN e GPU contano a quella scala, e Zilliz Cloud gestisce il prodotto managed.

Perché si distingue:

  • Più algoritmi di indicizzazione (HNSW, IVF, DiskANN, GPU): scegli per carico di lavoro.
  • Testato in battaglia operativamente. Un caso studio Reddit via MarkTechPost lo vede a 340M+ vettori in produzione.
  • Zilliz Cloud elimina la maggior parte del dolore operativo se non vuoi gestire Milvus da solo.

Pricing (maggio 2026): Open source gratuito. Zilliz Cloud è basato sull'uso, con cluster di sviluppo gratuiti e produzione pay-as-you-go. La documentazione Milvus copre pymilvus e la configurazione DiskANN.

python
from pymilvus import MilvusClient

client = MilvusClient("milvus_demo.db")
client.create_collection(collection_name="rag", dimension=3)
client.insert("rag", [{"id": 1, "vector": [0.1, 0.2, 0.3], "source": "blog"}])
results = client.search("rag", data=[[0.1, 0.2, 0.3]], limit=5)

Non adatto per: progetti piccoli sotto ~10M vettori. Milvus è sovradimensionato, e il costo operativo supererà qualsiasi beneficio in termini di performance.

5. Chroma — il migliore per la prototipazione e lo sviluppo local-first

Chroma è il database vettoriale più facile al mondo da mettere su. pip install chromadb, due righe di Python, e stai già interrogando. È il suo superpotere e il suo limite.

Perché si distingue:

  • Local-first per impostazione predefinita. Nessun server da avviare durante la prototipazione.
  • Apache 2.0 OSS, Chroma Cloud ora in beta per l'hosting managed.
  • Perfetto per tutorial, demo e progetti "voglio provare RAG questo weekend."

Pricing (maggio 2026): Open source gratuito. Il pricing di Chroma Cloud beta non era ancora definito al momento della scrittura. Consulta la documentazione Chroma per l'API client attuale.

python
import chromadb

client = chromadb.PersistentClient(path="./chroma_db")
collection = client.get_or_create_collection("rag")
collection.add(ids=["doc1"], embeddings=[[0.1, 0.2, 0.3]], metadatas=[{"source": "blog"}])
results = collection.query(query_embeddings=[[0.1, 0.2, 0.3]], n_results=5)

Non adatto per: produzione con >10M vettori, isolamento multi-tenant rigoroso, o qualsiasi contesto in cui la latenza p99 è un requisito rigido.

6. pgvector — il migliore per i team già su PostgreSQL

pgvector è la scelta giusta, senza fronzoli, per una grande fetta di progetti RAG. È un'estensione Postgres che aggiunge un tipo di colonna vector e indici ANN, e da pgvector 0.5.0 include HNSW accanto a IVFFlat. Combinalo con pgvectorscale per aggiornamenti dell'indice in streaming e ottieni la maggior parte di ciò che offrono i database vettoriali dedicati.

Perché si distingue:

  • Gira ovunque giri Postgres: Supabase, Neon, AWS RDS, il tuo laptop.
  • Un solo database per i dati applicativi e gli embedding: nessuna sincronizzazione, nessun mal di testa sulla consistenza.
  • SQL significa join, transazioni e controllo degli accessi esistente che funzionano e basta.

Pricing (maggio 2026): Gratuito. Paghi per il compute Postgres sulla piattaforma che usi. Il tier gratuito di Supabase gestisce progetti piccoli, Neon scala a zero tra una query e l'altra, RDS fattura per istanza.

sql
CREATE EXTENSION vector;
CREATE TABLE docs (
  id bigserial PRIMARY KEY,
  embedding vector(1536),
  content text
);
INSERT INTO docs (embedding, content) VALUES ('[0.1,0.2,0.3]', 'sample text');
SELECT content FROM docs ORDER BY embedding <=> '[0.1,0.2,0.3]' LIMIT 5;

Non adatto per: carichi di lavoro oltre ~50M vettori con requisiti rigidi di p99 < 50ms. A quel punto sentirai il disagio, e un motore vettoriale dedicato sarà più economico da operare.

7. MongoDB Atlas Vector Search — il migliore per i team già su MongoDB

MongoDB Atlas Vector Search sta a MongoDB come pgvector sta a Postgres: la risposta ovvia se il tuo database operativo è già MongoDB. I nodi di ricerca dedicati fanno sì che le query vettoriali non competano con il carico transazionale.

Perché si distingue:

  • Una sola piattaforma per documenti, ricerca e vettori. Nessuna sincronizzazione da mantenere.
  • I nodi di ricerca dedicati isolano i carichi vettoriali dall'OLTP primario.
  • Gli strumenti operativi Atlas (backup, monitoraggio, scaling) si estendono agli indici vettoriali.

Pricing (maggio 2026): Pricing Atlas standard più costo orario per i nodi di ricerca. Il tier gratuito (M0) supporta indici vettoriali piccoli per la prototipazione.

python
from pymongo import MongoClient

client = MongoClient("YOUR_ATLAS_URI")
coll = client["rag"]["docs"]
coll.insert_one({"text": "sample", "embedding": [0.1, 0.2, 0.3]})
results = coll.aggregate([
    {"$vectorSearch": {"index": "vec_idx", "path": "embedding", "queryVector": [0.1, 0.2, 0.3], "numCandidates": 100, "limit": 5}}
])

Non adatto per: team che non usano già MongoDB. Non c'è motivo di partire da zero con questa scelta.

8. LanceDB — il migliore per local-first, multimodale e edge

LanceDB è il database vettoriale embedded. Pensa a SQLite-per-vettori: gira in-process, memorizza i dati come file Lance su disco o S3, e gestisce dati multimodali (immagini, testo, audio) in un unico schema.

Perché si distingue:

  • La modalità embedded significa nessun server da deployare. Ottimo per app desktop e edge.
  • Multimodale fin dal primo giorno; il formato file Lance gestisce i tensori in modo pulito.
  • Il backend su object storage funziona con S3, GCS, R2: paghi per byte invece che per istanza.

Pricing (maggio 2026): Open source gratuito. LanceDB Cloud è l'offerta managed, con pricing basato sull'uso.

python
import lancedb

db = lancedb.connect("./lance_db")
table = db.create_table("rag", data=[{"id": 1, "vector": [0.1, 0.2, 0.3], "text": "sample"}])
results = table.search([0.1, 0.2, 0.3]).limit(5).to_pandas()

Non adatto per: team che hanno bisogno di un SLA cloud managed oggi. LanceDB Cloud è più giovane di Pinecone o Qdrant Cloud, e il track record operativo è più breve.

9. Vertex AI Vector Search 2.0 — il migliore per i team tutto su Google Cloud

Vertex AI Vector Search 2.0 è stato lanciato a maggio 2026 come aggiornamento di Google al vecchio Matching Engine, completamente managed e costruito sull'algoritmo ScaNN che Google usa internamente. Se il tuo stack vive su GCP, questa è la via di minor resistenza.

Perché si distingue:

  • ScaNN sotto il cofano: lo stesso algoritmo che Google Search usa per gli embedding.
  • Integrazione stretta con Vertex AI embeddings, Cloud Storage e IAM.
  • Completamente managed, autoscaling, fatturato tramite GCP. Nessun rapporto con un vendor separato.

Pricing (maggio 2026): Basato sull'uso GCP: storage dell'indice + query QPS. Un carico da 10M vettori si attesta tipicamente a $500–$800/mese, comparabile a Pinecone Serverless.

python
from google.cloud import aiplatform

aiplatform.init(project="your-project", location="us-central1")
index = aiplatform.MatchingEngineIndex("projects/.../indexes/...")
endpoint = aiplatform.MatchingEngineIndexEndpoint("projects/.../indexEndpoints/...")
response = endpoint.match(deployed_index_id="rag", queries=[[0.1, 0.2, 0.3]], num_neighbors=5)

Non adatto per: team che non usano Google Cloud. Il vendor lock-in non vale la pena se sei multi-cloud o su AWS.

Menzione d'onore: Faiss

Faiss è una libreria vettoriale, non un database. Ti dà un indice ANN in memoria: nessuna persistenza, nessuna replica, nessuna autenticazione, nessun filtraggio dei metadati al di là di ciò che costruisci tu. Usa Faiss quando stai incorporando un indice di ricerca dentro un servizio Python e i tuoi dati sono piccoli. Per tutto il resto, scegli un vero database vettoriale dalla lista qui sopra.

Scegli il database vettoriale giusto per il tuo stack (matrice decisionale)

La risposta onesta a "quale database vettoriale dovremmo usare?" è "quello che si adatta al tuo stack esistente con meno attrito." Salta le guerre dei benchmark. Inizia da dove vivono già i tuoi dati, poi guarda la scala che ti aspetti tra 18 mesi, poi preoccupati delle funzionalità.

Se sei su / stai costruendo...Prima sceltaSeconda sceltaPerché
PostgreSQL già in usopgvectorQdrantZero nuova infrastruttura; cambia solo quando raggiungi il limite di scala di pgvector
AWS, senza PostgresPinecone ServerlessOpenSearch + k-NNIl managed vince su AWS; OpenSearch se vuoi hybrid
AzureAzure AI SearchPineconeL'integrazione nativa Azure riduce il dolore di auth/fatturazione
Google CloudVertex AI Vector Search 2.0PineconeManaged nativo GCP; ScaNN sotto il cofano
MongoDB già in usoMongoDB Atlas Vector Searchpgvector (se stai migrando)Un solo database da operare
App LangChain / LlamaIndexQdrantPineconeIntegrazioni first-class, hybrid search
n8n / Open WebUI / localeChromaQdrant (self-host)Setup locale più semplice; entrambi con installazione in una riga
Agenti AI (memoria a lungo termine)QdrantPineconeMiglior filtraggio + scala per strumenti di memoria agenti
Local-first / multimodaleLanceDBChromaModalità embedded; immagini + testo in un unico schema

Come leggere la tabella: prendi la riga che corrisponde al tuo stack attuale, segui la raccomandazione della prima colonna, e smetti di ottimizzare. Se sei davvero incerto, prototipa con Chroma in locale (richiede un pomeriggio) e migra su Pinecone o Qdrant quando conosci la forma delle tue query e la scala reale. L'ottimizzazione prematura sulla scelta del database vettoriale ha bruciato più team della scelta sbagliata stessa.

Quanto costa davvero un database vettoriale?

Per 10 milioni di embedding OpenAI a 1536 dimensioni con 100K query al giorno, aspettati circa $700–$900/mese su Pinecone Serverless, $250–$400/mese su Qdrant Cloud, o $60–$120/mese su Qdrant self-hosted su un Hetzner ax52. La tua fattura reale oscilla parecchio con il volume di query, la replica e la dimensione dei metadati.

Ecco lo stesso carico di lavoro su tre configurazioni:

ConfigurazioneVettoriQuery/giornoCosto mensile stimato (maggio 2026)Note
Pinecone Serverless10M (1536-dim)100K$700–$900Letture + scritture + storage basati sull'uso
Qdrant Cloud (managed)10M (1536-dim)100K$250–$400Cluster a 2 repliche, tier scale
Qdrant self-hosted su Hetzner ax5210M (1536-dim)100K$60–$120Hardware + bandwidth; lo gestisci tu

Perché il divario è reale? Stai pagando per tre cose diverse. Su Pinecone paghi l'SLA e il team che lo gestisce; non pensi alla capacità o alle repliche. Su Qdrant Cloud paghi meno perché i costi infrastrutturali di Qdrant sono più bassi e sei più vicino al metallo, ma hai ancora backup, aggiornamenti e status page. Su self-hosted, l'hardware costa quasi niente — e paghi tu quando il disco si riempie alle 2 di notte.

Abbiamo visto una fattura Pinecone passare da $80 a $800 in un mese dopo che un cliente ha aggiunto una seconda region senza cambiare il volume di query. La replica non è gratuita. I costi nascosti di cui nessuno parla: egress (specialmente tra regioni), moltiplicatori di replica, dimensione dei metadati (un payload JSON da 5KB per vettore si accumula su 10M righe), e le stesse chiamate all'API di embedding (la tua fattura OpenAI per text-embedding-3-large spesso supera quella del database vettoriale).

Questi sono stime di maggio 2026 dalle pagine di pricing pubblicate. Conferma su ciascuna pagina vendor prima di impegnarti — i prezzi cambiano ogni trimestre e i nostri numeri si deprezzano.

Hybrid search — quando keyword + vettore batte il solo vettore

La hybrid search combina un indice keyword sparso (BM25 o SPLADE) con un indice vettoriale denso, fondendo i punteggi con Reciprocal Rank Fusion o somme ponderate. Supera il retrieval vettoriale puro in termini di accuratezza RAG di 5–15 punti percentuali nella maggior parte dei benchmark pubblici, specialmente sulle query di corrispondenza esatta come codici prodotto, nomi e stringhe di errore.

La ricerca vettoriale pura è scarsa sulle corrispondenze esatte. Chiedi "qual è il codice errore per E1042?" e un retriever denso restituisce errori semanticamente correlati, non E1042 stesso. BM25 individua esattamente il token. Combina i due e ottieni il meglio di entrambi.

Vendor con hybrid search nativa nel 2026: Qdrant, Weaviate, Milvus e Vespa (vale la menzione anche se non l'abbiamo classificato). Pinecone ha aggiunto la hybrid search sparse-dense nel 2024 e l'API è solida. Gli utenti di pgvector di solito la combinano con la ricerca full-text di Postgres e fondono i punteggi in SQL.

python
from qdrant_client import QdrantClient
from qdrant_client.models import Prefetch, FusionQuery, Fusion

client = QdrantClient(url="http://localhost:6333")
results = client.query_points(
    collection_name="rag",
    prefetch=[
        Prefetch(query=[0.1, 0.2, 0.3], using="dense", limit=20),
        Prefetch(query={"indices": [42, 73], "values": [0.8, 0.6]}, using="sparse", limit=20),
    ],
    query=FusionQuery(fusion=Fusion.RRF),
    limit=5,
)

Se la qualità del tuo retrieval sembra "un po' sbagliata" nonostante buoni embedding, la hybrid search è il fix con il miglior rapporto sforzo-risultato, e si abbina bene a una strategia di chunking intelligente. Non saltare nessuna delle due.

Cosa ci dicono davvero VectorDBBench e ann-benchmarks

VectorDBBench e ann-benchmarks misurano QPS, recall@k e latenza p99 tra database vettoriali su dataset standardizzati come MS-MARCO e LAION. Qdrant e Milvus guidano sul throughput self-hosted; Pinecone Serverless guida sulla semplicità managed. I benchmark sono indicativi. La complessità del filtraggio del tuo carico di lavoro conta più del QPS headline.

Alcuni numeri concreti dai benchmark pubblici. Secondo i benchmark pubblicati da Qdrant, Qdrant ottiene circa 600 QPS a recall@10 = 0.95 sul dataset deep-image-96 da 1M vettori. Milvus con HNSW raggiunge un QPS comparabile sullo stesso dataset; il divario si restringe o si allarga in base alla selettività del filtro. Su ann-benchmarks, le librerie più vecchie come ScaNN e HNSWlib tengono ancora il passo, ricordando a tutti che la qualità dell'algoritmo conta più del marketing del vendor.

I benchmark sono indicativi. La selettività del filtro e la dimensione dei metadati influenzeranno la latenza nel mondo reale più del QPS headline di qualsiasi vendor.

Il punto non è che i benchmark siano inutili. Sono un sanity check. Esegui i tuoi con i tuoi pattern di filtro reali, le tue dimensioni vettoriali reali e il tuo target di recall reale prima di impegnarti. Mentre ci sei, configura come misurare la qualità del retrieval. Recall@k non dice nulla su se le risposte RAG sono corrette.

Migrare via da Pinecone (e altre conversazioni sul lock-in)

Migrare da Pinecone a Qdrant o Weaviate è un progetto da 1–3 giorni per la maggior parte dei team: re-indicizza i tuoi embedding (o copiali tramite l'API esistente), aggiorna la libreria client, e riproduci il traffico. I vendor ricchi di schema come Weaviate aggiungono un po' di lavoro iniziale di mappatura. La parte difficile è raramente il codice.

Tre motivi per cui i team migrano nel 2026: pricing (la fattura ha superato la comodità), data residency (clienti UE, settori regolamentati), e esigenze di hybrid search (la hybrid Pinecone funziona ma è meno ergonomica di quella di Qdrant o Weaviate).

Il playbook ha sempre la stessa forma: esporta i tuoi embedding dalla sorgente, re-indicizza nella destinazione, scrivi i nuovi vettori in doppio per una settimana, passa alle letture, poi decommissiona il vecchio indice. Il dual-write è la parte che i team saltano e di cui si pentono. È il tuo pulsante di rollback se il recall scende.

Punto di contrasto onesto: se la tua app già funziona su Pinecone e il budget non è un problema, la migrazione raramente vale la pena. Il costo opportunità di una migrazione da 3 giorni è di solito più alto dei risparmi, a meno che tu non stia spendendo $5K+/mese.

Quando NON usare un database vettoriale dedicato

Troverai questo consiglio quasi da nessuna parte perché non vende database vettoriali — ma molti team ne cercano uno quando non ne hanno bisogno.

  • Sotto 100K vettori. NumPy in memoria o Faiss vanno benissimo. Caricare un array NumPy ed eseguire la similarità del coseno in Python è sub-millisecondo su un laptop.
  • Già su Postgres, sotto 10M vettori. Aggiungi pgvector e basta. Risparmierai un database, un'integrazione e una fattura mensile.
  • La ricerca keyword è sufficiente. Se gli utenti cercano nomi di prodotti o stringhe esatte, BM25 in Elasticsearch o Typesense batterà qualsiasi ricerca vettoriale. Provalo prima.
  • Stai prototipando in locale. Chroma o SQLite con una colonna di float. Decidi sul database di produzione quando hai dati di produzione reali.

Non hai bisogno di un database vettoriale. Hai bisogno di ricerca. Scegli la cosa più semplice che la eroga. Se vuoi approfondire lo stack circostante, strumenti di context engineering è la lettura correlata.

Come Techsy approccia la scelta del database vettoriale

Quando aiutiamo i clienti a scegliere un database vettoriale, eseguiamo prima un filtro a quattro domande — prima di toccare un singolo benchmark.

  1. Qual è il tuo stack dati attuale? Se sei su Postgres o MongoDB, la risposta è di solito la loro opzione vettoriale nativa. Non aggiungere un database a meno che non si ripaghi da solo.
  2. Quale scala raggiungerai in 18 mesi? Non la scala di oggi. La scala che innesca la riscrittura. Se è sotto 10M vettori, pgvector o Chroma probabilmente bastano.
  3. La flessibilità di hosting è un requisito rigido? Data residency, deployment air-gapped o limiti di costo rigorosi ti spingono verso Qdrant o Milvus self-hosted, non verso Pinecone.
  4. Qual è la larghezza di banda operativa del tuo team? Zero capacità ops + budget = Pinecone. Un po' di capacità ops + pressione sul budget = Qdrant Cloud. Molta capacità ops = Qdrant self-hosted.

In pratica, usiamo Qdrant in due progetti clienti, pgvector in tre, e abbiamo avviato un cliente su Pinecone come prototipo rapido che abbiamo poi migrato su Qdrant quando la scala è arrivata. La prima decisione non è sempre l'ultima.

Se devi scegliere tra due opzioni e sei bloccato, prenota una consulenza gratuita. Ti aiutiamo a evitare una riscrittura da sei mesi.

Domande frequenti

Qual è il miglior database vettoriale per RAG nel 2026?

Per la maggior parte dei team: Pinecone Serverless (più rapido da avviare) o Qdrant (miglior rapporto qualità-prezzo self-hosted). Se già usi Postgres, pgvector gestisce RAG comodamente fino a ~10M vettori. Il "migliore" dipende dalla preferenza di hosting, dalla scala e dallo stack esistente — non dai numeri dei benchmark o dal marketing dei vendor.

Qual è la differenza tra un database vettoriale e un motore di ricerca vettoriale?

Un database vettoriale memorizza embedding più metadati, transazioni e controllo degli accessi. Pinecone, Qdrant e Weaviate sono esempi. Un motore di ricerca vettoriale (o libreria) come Faiss fornisce solo l'indice ANN; persistenza, autenticazione e replica le gestisci tu. I sistemi in produzione hanno bisogno del database; i casi d'uso embedded possono a volte cavarsela con solo il motore di ricerca.

Ho bisogno di un database vettoriale dedicato, o pgvector basta per la produzione?

pgvector basta per la produzione fino a circa 10M vettori con requisiti di latenza p99 rilassati (sub-200ms). Oltre quella soglia, o se hai bisogno di hybrid search, multi-tenancy o p99 sub-50ms, passa a Qdrant, Pinecone o Weaviate. Molti team partono con pgvector e migrano quando arriva la scala reale.

Qual è il database vettoriale più economico nel 2026?

Qdrant self-hosted su un singolo VPS (Hetzner ax52 intorno a $60–$120/mese) gestisce 10M vettori comodamente. Chroma è gratuito per la prototipazione locale. pgvector non aggiunge costi se paghi già per Postgres. Il tier gratuito di Pinecone copre i piccoli progetti, e il $25/mese di Weaviate è l'opzione managed cloud più economica per carichi di lavoro hosted.

Qual è il miglior database vettoriale gratuito?

Qdrant (open source, Apache 2.0, con un tier cloud gratuito) e Chroma (open source, Apache 2.0) sono le due opzioni gratuite più forti per il 2026. pgvector è anch'esso gratuito se usi già Postgres. Milvus è open source gratuito ma operativamente più pesante. Evitalo per progetti piccoli dove Qdrant o Chroma saranno più semplici.

È meglio Pinecone o Qdrant?

Pinecone vince sull'esperienza dello sviluppatore e sull'onboarding zero-ops. Lo metti in produzione in un'ora. Qdrant vince sul prezzo (spesso 3–5 volte più economico su larga scala), sul self-hosting e sulle performance di filtraggio. Scegli Pinecone se la velocità di andare in produzione conta più del costo a lungo termine; scegli Qdrant se il controllo del budget o la data residency sono requisiti rigidi.

Qual è la differenza tra un database vettoriale e un database tradizionale?

Un database tradizionale (PostgreSQL, MongoDB) trova le righe per corrispondenza esatta o per intervallo. Un database vettoriale trova le righe per similarità: dato un embedding, restituisce i k vettori più vicini. L'indice sottostante (HNSW, IVF) è fondamentalmente diverso. Alcuni database tradizionali aggiungono capacità vettoriale tramite estensioni come pgvector; altri includono motori vettoriali dedicati.

Come scelgo un database vettoriale?

Inizia dal tuo stack esistente: su Postgres, prova pgvector. Su AWS senza Postgres, prova Pinecone. Su Google Cloud, prova Vertex AI Vector Search 2.0. Poi filtra per scala (sotto 10M vettori, la maggior parte delle opzioni funziona) e hosting (managed o self-host). Prototipa con Chroma in locale se stai ancora decidendo.

Qual è il miglior database vettoriale open source nel 2026?

Qdrant guida per la maggior parte dei carichi di lavoro in produzione, con HNSW veloce, filtraggio eccellente e un round Series B chiuso a marzo 2026. Weaviate è un forte secondo quando hai bisogno di schema e hybrid search out of the box. Milvus vince sulle scale più grandi. Chroma vince per lo sviluppo locale. pgvector vince se sei già su Postgres.


Il team editoriale di Techsy ha messo in produzione sistemi RAG su Pinecone, Qdrant e pgvector in progetti clienti nel 2024–2026. Non accettiamo sponsorizzazioni da vendor per contenuti sui database vettoriali; ogni scelta in questo articolo è una che metteremmo nel roadmap di un cliente con il nostro nome attaccato.

Tag

database vettorialeRAGinfrastruttura AILLM toolingPineconeQdrantpgvector

Condividi questo articolo

Il Tuo Prossimo Passo

Hai un progetto in mente? Parliamone.

Prenota una call di 30 minuti. Ti ascoltiamo, capiamo il problema e ti diciamo se possiamo aiutarti.