
Nejlepší vektorové databáze v roce 2026: 9 tipů, reálné ceny a kód pro každou
V roce 2026 existuje více než 30 vektorových databází, ale pro většinu týmů, které nasazují RAG, agenty nebo sémantické vyhledávání, jich má význam jen hrstka. Správná volba závisí víc na vašem stávajícím stacku než na hrubých číslech QPS a rozdíl mezi nejlevnější a nejdražší variantou pro stejnou zátěž je zhruba 10násobný. Zde je devět, které bychom dnes skutečně nasadili, s reálnými cenami a spustitelným kódem pro každou.
Klíčové poznatky:
- Pinecone Serverless je stále nejrychlejší cestou k produkčnímu RAG, pokud není omezením rozpočet.
- Qdrant nabízí nejlepší poměr cena/výkon mezi open-source; v březnu 2026 získal financování Series B.
- pgvector „stačí", pokud už provozujete PostgreSQL a držíte se pod ~10 miliony vektorů.
- Weaviate, Milvus a Chroma každý vyhrávají v konkrétních nikách; viz rozhodovací matice níže.
Co je vektorová databáze (a co není)?
Vektorová databáze je systém, který ukládá vysokorozměrné embeddingy a obsluhuje dotazy na přibližného nejbližšího souseda (ANN) s latencí pod 100 ms, obvykle přes index HNSW nebo IVF. Pohání RAG, sémantické vyhledávání a paměť AI agentů. Vektorové knihovny jako Faiss nejsou databáze. Chybí jim perzistence, replikace a multi-tenancy.
Tři pojmy se neustále zaměňují, takže si je ujasněme.
- Embedding: číselný vektor (obvykle 384–3072 dimenzí), který reprezentuje text, obrázek nebo zvuk tak, aby bylo možné spočítat podobnost.
- ANN (approximate nearest neighbor): nalezení nejbližších k vektorů k dotazu téměř přesně, výměnou trochy přesnosti (recall) za obrovské zrychlení oproti přesnému hledání.
- HNSW: Hierarchical Navigable Small World, grafový index, který používá většina moderních vektorových databází, protože dobře vyvažuje přesnost a latenci.
Rozdíl mezi knihovnou, indexem a databází je důležitý. Faiss vám dá in-memory ANN index. Je rychlý, ale perzistenci, autentizaci a replikaci si musíte zajistit sami. Vektorová databáze tento index obalí o úložiště, transakce, filtrování metadat, RBAC a dotazovací API. Pokud nasazujete skutečný produkt, chcete databázi. Pokud vkládáte hledání podle podobnosti do jedné Python služby, může stačit knihovna.
Jeden výjimečný případ, který stojí za zmínku hned na začátku: pgvector je rozšíření PostgreSQL, ne samostatný produkt. Pro naše účely se stále počítá jako vektorová databáze, protože vám dává perzistenci, transakce a SQL rozhraní, jen naroubované na Postgres. Více níže.
Jak jsme vybrali 9 vektorových databází pro rok 2026
Poté, co jsme za posledních 18 měsíců nasadili Pinecone, Qdrant a pgvector v produkci a byli vzbuzeni ve 2 ráno, když byla zvolena špatná, byly tři filtry důležitější než benchmarky.
- Pokrytí trhu. Objevuje se v 8+ z top 10 SERP srovnání pro „nejlepší vektorová databáze". Pokud o tom nikdo nepíše, nebudete mít od koho se učit, až se to rozbije.
- Produkčně připravené v roce 2026. Skuteční zákazníci provozující skutečné zátěže ve velkém měřítku. Přeskočili jsme startupy ve stealth režimu a beta produkty, které nezveřejnily jedinou case study.
- Udržované. Commity nebo stabilní releasy za posledních šest měsíců. Vektorová databáze, která nic nevydala od roku 2024, je závazek, ne aktivum.
Upřímné přiznání zaujatosti: Qdrant používáme ve dvou vlastních klientských projektech. To z něj nedělá správnou odpověď pro vás a přesně vám řekneme, kdy tomu tak není. Nebereme sponzoring od prodejců pro obsah o vektorových databázích, proto některá jména, která jinde uvidíte vysoko na sponzorovaných seznamech „top 10", na našem seznamu nejsou.
Která vektorová databáze je nejlepší pro RAG v roce 2026?
Pro RAG v roce 2026 je Pinecone Serverless cesta s nejmenším úsilím do produkce, Qdrant nabízí nejlepší poměr cena/výkon pro self-hosting a pgvector je správná odpověď, pokud už provozujete PostgreSQL. „Nejlepší vektorová databáze pro RAG" závisí na vašem měřítku, preferenci hostování a stávajícím stacku, ne na číslech z benchmarků.
Zde je, jak bychom seřadili top tři pro typickou zátěž RAG (1–10 milionů chunků, embeddingy OpenAI, 10–100 tisíc dotazů denně):
- Pinecone Serverless. Nasadíte za odpoledne, automatické škálování prostě funguje a není tu žádná infrastruktura, o kterou byste se museli starat. Zaplaťte příplatek a jděte dál.
- Qdrant. Nejlepší poměr cena/výkon, pokud máte jakoukoli kapacitu pro provoz. Filtrování je vynikající pro RAG s množstvím metadat a hybridní vyhledávání je nativní.
- pgvector. Nudný, spolehlivý a zdarma, pokud už za Postgres platíte. Správná odpověď pro ~80 % projektů RAG pod 10 milionů vektorů.
Každý velký prodejce na tomto seznamu se integruje s LangChain a LlamaIndex jako prvotřídní retriever. To je v roce 2026 základ, takže nevybírejte jen podle podpory frameworku. Vybírejte podle nákladů, měřítka a provozní kapacity vašeho týmu.
Pokud stále ladíte zbytek pipeline, podívejte se na širší stack RAG pro nástroje na chunkování, reranking a evaluaci. Jste ve vyhledávání úplní nováčci? Projděte si vytvořte svou první RAG aplikaci, než se upíšete databázi. Volba se výrazně usnadní, jakmile pocítíte, kde skutečně jsou úzká místa.
Ještě jedna věc: nevybírejte vektorovou databázi, dokud nemáte zvládnutou strategii chunkování. Špatné chunky způsobí, že každá databáze vypadá špatně.
Srovnávací tabulka — 9 vektorových databází na jednom místě
Osm sloupců, devět prodejců, reálná čísla. Tohle je ta jediná tabulka, kterou si uložit. Každý sloupec je odpovědí na otázku, kterou jsme za poslední rok slyšeli od reálného klienta alespoň třikrát. Ceny jsou referenční body z května 2026; vše se mění čtvrtletně, takže před podpisem smlouvy ověřte na cenové stránce prodejce.
| Prodejce | Typ | Nejlepší pro | Cenový model (2026) | Self-host? | Hybridní vyhledávání | Algoritmus indexu | Max. měřítko (udávané) |
|---|---|---|---|---|---|---|---|
| Pinecone | Managed (serverless) | Nejrychlejší cesta k produkčnímu RAG | $0 zdarma → $20/měs Builder → podle využití | Ne | Ano (sparse-dense) | Proprietární | Miliardy |
| Qdrant | Open source + managed cloud | Nejlepší self-hosted poměr cena/výkon | Free OSS / Free cloud tier / placené clustery | Ano | Ano | HNSW | Miliardy (340M+ ověřeno) |
| Weaviate | Open source + managed cloud | Aplikace s bohatým schématem, hybridní out of the box | Free OSS / $25/měs Serverless entry | Ano | Ano (BM25 + dense) | HNSW | Miliardy |
| Milvus | Open source + Zilliz Cloud | Produkční nasazení největšího měřítka | Free OSS / Zilliz Cloud podle využití | Ano | Ano | HNSW, IVF, DiskANN, GPU | Desítky miliard |
| Chroma | Open source (převážně lokální) | Prototypování, local-first vývoj | Free OSS / Chroma Cloud beta | Ano | Omezeně | HNSW | ~10M v pohodě |
| pgvector | Rozšíření Postgres | Týmy už na Postgres | Zdarma (váš účet za Postgres) | Ano | Přes pgvectorscale + rozšíření | HNSW (0.5.0+) | ~10–50M prakticky |
| MongoDB Atlas Vector Search | Managed (Atlas) | Týmy už na MongoDB | Ceny Atlas (search nody) | Ne | Ano | HNSW | Miliardy |
| LanceDB | Open source (embedded) | Local-first, multimodální, edge | Free OSS / LanceDB Cloud | Ano | Ano | IVF-PQ | Miliardy (udávané) |
| Vertex AI Vector Search 2.0 | Managed (GCP) | Týmy plně na Google Cloud | GCP podle využití | Ne | Ano | ScaNN | Miliardy |
9 vektorových databází, seřazených a vysvětlených
1. Pinecone, nejlepší pro nejrychlejší cestu k produkčnímu RAG
Pinecone je výchozí managed vektorová databáze pro týmy, které chtějí nulovou infrastrukturu a mají odpovídající rozpočet. Serverless dosáhl GA v roce 2025 a je nyní doporučeným produktem pro většinu nových projektů.
Čím vyniká:
- Nulová provozní zátěž. Žádné clustery k dimenzování, žádné repliky ke správě, jen API klíč.
- Serverless autoškálování zvládá nárazové zátěže bez ručního shardování.
- Sparse-dense hybridní vyhledávání dodáno nativně, žádný druhý index k zapojení.
Ceny (květen 2026): Free Starter tier (~100K vektorů), Builder za $20/měs s nadstavbou podle využití za čtení/zápisy/úložiště, nad tím Enterprise smlouvy. Podle dokumentace Pinecone typická zátěž RAG s 10 miliony vektorů vychází na $700–$900/měs. Detaily v drobném písmu mají význam.
from pinecone import Pinecone
pc = Pinecone(api_key="YOUR_KEY")
index = pc.Index("rag-index")
index.upsert([
{"id": "doc1", "values": [0.1, 0.2, 0.3], "metadata": {"source": "blog"}}
])
results = index.query(vector=[0.1, 0.2, 0.3], top_k=5, include_metadata=True)Není pro: týmy se striktními požadavky na datovou rezidenci, kohokoli, kdo potřebuje plnou kontrolu nad daty, nebo rozpočty pod $20/měs v netriviálním měřítku.
2. Qdrant, nejlepší pro self-hosted poměr cena/výkon
Qdrant je open-source vektorová databáze, kterou nasazujeme nejčastěji. Jádro v Rustu je rychlé, filtrování je opravdu vynikající a Series B $50M v březnu 2026 dala cloudovému produktu vážné peníze za zády.
Čím vyniká:
- Výkon filtrování: payload filtry jsou prvotřídní, ne dodatečně přilepené.
- Vynikající dokumentace a příčetný Python klient, který s vámi nebojuje.
- Free OSS, free cloud tier, předvídatelné placené clustery, když z něj vyrostete.
Ceny (květen 2026): Free open source (Apache 2.0), free Qdrant Cloud tier (1GB cluster), placené clustery od ~$25/měs za 4GB starter až po dedikované clustery s replikací. Self-hosted na Hetzner ax52 vyjde na $60–$120/měs all-in pro 10 milionů vektorů. Aktuální API Python klienta viz dokumentace Qdrant.
from qdrant_client import QdrantClient
from qdrant_client.models import PointStruct, VectorParams, Distance
client = QdrantClient(url="http://localhost:6333")
client.create_collection("rag", vectors_config=VectorParams(size=3, distance=Distance.COSINE))
client.upsert("rag", points=[PointStruct(id=1, vector=[0.1, 0.2, 0.3], payload={"source": "blog"})])
hits = client.query_points("rag", query=[0.1, 0.2, 0.3], limit=5).pointsPro přímé měření sil se zjevnými open-source alternativami jsme napsali samostatný podrobný souboj.
Není pro: týmy s nulovou provozní kapacitou, které chtějí opravdu nulovou infrastrukturu (použijte místo toho Pinecone Serverless).
3. Weaviate, nejlepší pro aplikace s bohatým schématem a nativním hybridním vyhledáváním
Weaviate je to, po čem sáhnete, když vaše RAG aplikace potřebuje víc než „blob textu plus metadata". Model postavený na schématu a BM25 + dense hybridní vyhledávání out of the box z něj dělají silnou volbu pro strukturované znalostní báze.
Čím vyniká:
- Pravé hybridní vyhledávání (BM25 + dense vektory s fúzí) bez druhého systému.
- Systém schématu a modulů vám umožní zapojit embeddingy + reranking inline.
- Multi-tenancy je prvotřídní, hodí se, pokud servírujete embeddingy per zákazník.
Ceny (květen 2026): Free open source. Cloud restrukturalizován v říjnu 2025: Serverless od $25/měs entry, nad tím Enterprise tiery. Dokumentace Weaviate dokumentuje Python klienta v4.
import weaviate
client = weaviate.connect_to_local()
docs = client.collections.get("Docs")
docs.data.insert(properties={"text": "sample"}, vector=[0.1, 0.2, 0.3])
results = docs.query.near_vector(near_vector=[0.1, 0.2, 0.3], limit=5)Není pro: minimalistické projekty, zaplatíte (mentální zátěží i dolary) za funkce schématu, které nepotřebujete.
4. Milvus, nejlepší pro produkční nasazení největšího měřítka
Milvus je odpověď, když jste za hranicí „miliarda vektorů" a začínáte přemýšlet o desítkách miliard. V tom měřítku mají význam volby indexů DiskANN a GPU a managed produkt provozuje Zilliz Cloud.
Čím vyniká:
- Více algoritmů indexu (HNSW, IVF, DiskANN, GPU): vyberte podle zátěže.
- Provozně prověřený v boji. Case study z Redditu přes MarkTechPost uváděla 340M+ vektorů v produkci.
- Zilliz Cloud odstraní většinu provozních bolestí, pokud nechcete provozovat Milvus sami.
Ceny (květen 2026): Free open source. Zilliz Cloud je podle využití s free vývojovými clustery a pay-as-you-go produkcí. Dokumentace Milvus pokrývá pymilvus a konfiguraci DiskANN.
from pymilvus import MilvusClient
client = MilvusClient("milvus_demo.db")
client.create_collection(collection_name="rag", dimension=3)
client.insert("rag", [{"id": 1, "vector": [0.1, 0.2, 0.3], "source": "blog"}])
results = client.search("rag", data=[[0.1, 0.2, 0.3]], limit=5)Není pro: malé projekty pod ~10 milionů vektorů. Milvus je kanón na vrabce a provozní náklady převýší jakýkoli výkonový přínos.
5. Chroma, nejlepší pro prototypování a local-first vývoj
Chroma je nejjednodušší vektorová databáze na světě k rozjetí. pip install chromadb, dva řádky Pythonu a dotazujete. To je její superschopnost i její omezení.
Čím vyniká:
- Local-first ve výchozím stavu. Žádný server k provozování během prototypování.
- Apache 2.0 OSS, Chroma Cloud nyní v betě pro managed hosting.
- Skvělá pro tutoriály, dema a projekty „chci si zkusit RAG o víkendu".
Ceny (květen 2026): Free open source. Ceny Chroma Cloud beta nebyly v době psaní finalizoány. Aktuální API klienta viz dokumentace Chroma.
import chromadb
client = chromadb.PersistentClient(path="./chroma_db")
collection = client.get_or_create_collection("rag")
collection.add(ids=["doc1"], embeddings=[[0.1, 0.2, 0.3]], metadatas=[{"source": "blog"}])
results = collection.query(query_embeddings=[[0.1, 0.2, 0.3]], n_results=5)Není pro: produkce nad >10 milionů vektorů, striktní multi-tenant izolaci nebo cokoli, kde je p99 latence tvrdým požadavkem.
6. pgvector, nejlepší pro týmy už na PostgreSQL
pgvector je nudná, správná volba pro obrovskou část projektů RAG. Je to rozšíření Postgres, které přidává typ sloupce vector a ANN indexy, a od pgvector 0.5.0 dodává HNSW vedle IVFFlat. Spárujte ho s pgvectorscale pro streamované aktualizace indexu a získáte většinu toho, co nabízejí dedikované vektorové databáze.
Čím vyniká:
- Běží všude, kde běží Postgres: Supabase, Neon, AWS RDS, váš laptop.
- Jedna databáze pro data aplikace i embeddingy: žádná synchronizace, žádné starosti s konzistencí.
- SQL znamená, že joiny, transakce a stávající řízení přístupu prostě fungují.
Ceny (květen 2026): Zdarma. Platíte za výpočetní výkon Postgres na platformě, kterou používáte. Free tier Supabase zvládne malé projekty, Neon se škáluje na nulu mezi dotazy, RDS účtuje podle instance.
CREATE EXTENSION vector;
CREATE TABLE docs (
id bigserial PRIMARY KEY,
embedding vector(1536),
content text
);
INSERT INTO docs (embedding, content) VALUES ('[0.1,0.2,0.3]', 'sample text');
SELECT content FROM docs ORDER BY embedding <=> '[0.1,0.2,0.3]' LIMIT 5;Není pro: zátěže nad ~50 milionů vektorů s tvrdými požadavky p99 < 50ms. Pocítíte bolest a dedikovaný vektorový engine bude v tom bodě levnější na provoz.
7. MongoDB Atlas Vector Search, nejlepší pro týmy už na MongoDB
MongoDB Atlas Vector Search je pro MongoDB tím, čím je pgvector pro Postgres: zřejmá odpověď, pokud je vaše provozní databáze už MongoDB. Dedikované search nody znamenají, že vektorové dotazy nekonkurují vaší transakční zátěži.
Čím vyniká:
- Jedna platforma pro dokumenty, vyhledávání a vektory. Žádná synchronizace k údržbě.
- Dedikované search nody izolují vektorové zátěže od primární OLTP.
- Provozní nástroje Atlas (zálohy, monitoring, škálování) se rozšiřují na vektorové indexy.
Ceny (květen 2026): Standardní ceny Atlas plus hodinové náklady za search nody. Free tier (M0) podporuje malé vektorové indexy pro prototypování.
from pymongo import MongoClient
client = MongoClient("YOUR_ATLAS_URI")
coll = client["rag"]["docs"]
coll.insert_one({"text": "sample", "embedding": [0.1, 0.2, 0.3]})
results = coll.aggregate([
{"$vectorSearch": {"index": "vec_idx", "path": "embedding", "queryVector": [0.1, 0.2, 0.3], "numCandidates": 100, "limit": 5}}
])Není pro: týmy, které ještě nejsou na MongoDB. Není důvod začínat.
8. LanceDB, nejlepší pro local-first, multimodální a edge
LanceDB je embedded vektorová databáze. Představte si SQLite pro vektory: běží in-process, ukládá data jako soubory Lance na disku nebo S3 a zvládá multimodální data (obrázky, text, audio) v jednom schématu.
Čím vyniká:
- Embedded režim znamená žádný server k nasazení. Skvělé pro desktopové aplikace a edge.
- Multimodální od prvního dne; formát souborů Lance čistě zvládá tenzory.
- Backend na objektovém úložišti funguje na S3, GCS, R2: platíte za bajt místo za instanci.
Ceny (květen 2026): Free open source. LanceDB Cloud je managed nabídka, ceny podle využití.
import lancedb
db = lancedb.connect("./lance_db")
table = db.create_table("rag", data=[{"id": 1, "vector": [0.1, 0.2, 0.3], "text": "sample"}])
results = table.search([0.1, 0.2, 0.3]).limit(5).to_pandas()Není pro: týmy, které dnes potřebují managed cloud SLA. LanceDB Cloud je mladší než Pinecone nebo Qdrant Cloud a provozní historie je kratší.
9. Vertex AI Vector Search 2.0 — nejlepší pro týmy plně na Google Cloud
Vertex AI Vector Search 2.0 odstartoval v květnu 2026 jako obnova starého Matching Engine od Googlu, plně managed a postavený na algoritmu ScaNN, který Google používá interně. Pokud váš stack žije v GCP, je to cesta nejmenšího odporu.
Čím vyniká:
- ScaNN pod kapotou: stejný algoritmus, který Google Search používá pro embeddingy.
- Těsná integrace s Vertex AI embeddingy, Cloud Storage a IAM.
- Plně managed, autoškálování, účtováno přes GCP. Žádný vztah s dalším prodejcem.
Ceny (květen 2026): GCP podle využití: úložiště indexu + QPS dotazů. Zátěž s 10 miliony vektorů typicky vychází na $500–$800/měs, srovnatelné s Pinecone Serverless.
from google.cloud import aiplatform
aiplatform.init(project="your-project", location="us-central1")
index = aiplatform.MatchingEngineIndex("projects/.../indexes/...")
endpoint = aiplatform.MatchingEngineIndexEndpoint("projects/.../indexEndpoints/...")
response = endpoint.match(deployed_index_id="rag", queries=[[0.1, 0.2, 0.3]], num_neighbors=5)Není pro: týmy mimo Google Cloud. Vendor lock-in nestojí za to, pokud jste multi-cloud nebo AWS-first.
Čestné uznání: Faiss
Faiss je vektorová knihovna, ne databáze. Dá vám in-memory ANN index: žádná perzistence, žádná replikace, žádná autentizace, žádné filtrování metadat nad to, co si sami naroubujete. Použijte Faiss, když vkládáte search index dovnitř Python služby a vaše data jsou malá. Pro vše ostatní vyberte skutečnou vektorovou databázi ze seznamu výše.
Vyberte správnou vektorovou databázi pro svůj stack (rozhodovací matice)
Upřímná odpověď na „kterou vektorovou databázi bychom měli použít?" je „jakoukoli, která se nejlépe vejde do vašeho stávajícího stacku s nejmenším třením." Přeskočte benchmarkové války. Začněte tím, kde už vaše data žijí, pak zkontrolujte měřítko, které očekáváte za 18 měsíců, pak se starejte o funkce.
| Pokud jste na / stavíte... | Vyberte první | Vyberte druhou | Proč |
|---|---|---|---|
| Už PostgreSQL | pgvector | Qdrant | Žádná nová infrastruktura; přepněte, až narazíte na škálovací strop pgvector |
| AWS, bez Postgres | Pinecone Serverless | OpenSearch + k-NN | Managed vyhrává na AWS; OpenSearch, pokud chcete hybrid |
| Azure | Azure AI Search | Pinecone | Nativní integrace Azure snižuje bolest s autentizací/účtováním |
| Google Cloud | Vertex AI Vector Search 2.0 | Pinecone | GCP-nativní managed; ScaNN pod kapotou |
| Už MongoDB | MongoDB Atlas Vector Search | pgvector (při migraci) | Jediná databáze k provozování |
| Aplikace LangChain / LlamaIndex | Qdrant | Pinecone | Prvotřídní integrace, hybridní vyhledávání |
| n8n / Open WebUI / lokální | Chroma | Qdrant (self-host) | Nejjednodušší lokální setup; obě mají instalaci na jeden řádek |
| AI agenti (dlouhodobá paměť) | Qdrant | Pinecone | Nejlepší filtrování + měřítko pro nástroje paměti agentů |
| Local-first / multimodální | LanceDB | Chroma | Embedded režim; obrázek + text v jednom schématu |
Jak to číst: vyberte řádek, který odpovídá vašemu současnému stacku, vezměte doporučení z prvního sloupce a přestaňte optimalizovat. Pokud si opravdu nejste jisti, prototypujte lokálně s Chroma (zabere to odpoledne) a migrujte na Pinecone nebo Qdrant, jakmile znáte tvar svých dotazů a své reálné měřítko. Předčasná optimalizace volby vektorové databáze stála víc týmů než samotná špatná volba.
Kolik vektorová databáze skutečně stojí?
Pro 10 milionů 1536-dimenzionálních embeddingů OpenAI se 100K dotazy denně počítejte zhruba s $700–$900/měsíc na Pinecone Serverless, $250–$400/měsíc na Qdrant Cloud nebo $60–$120/měsíc na self-hosted Qdrant na Hetzner ax52. Váš reálný účet se výrazně houpe podle objemu dotazů, replikace a velikosti metadat.
Zde je stejná zátěž napříč třemi setupy:
| Setup | Vektory | Dotazy/den | Odhadované měsíční náklady (květen 2026) | Poznámky |
|---|---|---|---|---|
| Pinecone Serverless | 10M (1536-dim) | 100K | $700–$900 | Čtení + zápis + úložiště podle využití |
| Qdrant Cloud (managed) | 10M (1536-dim) | 100K | $250–$400 | 2-replikový cluster, scale tier |
| Self-hosted Qdrant na Hetzner ax52 | 10M (1536-dim) | 100K | $60–$120 | Hardware + šířka pásma; provozujete sami |
Proč je ten rozdíl reálný? Platíte za tři různé věci. Na Pinecone platíte za SLA a tým, který to provozuje; nepřemýšlíte o kapacitě ani replikách. Na Qdrant Cloud platíte míň, protože provozní náklady Qdrant jsou nižší a jste blíž železu, ale stále dostáváte zálohy, upgrady a stavovou stránku. Na self-hosted neplatíte za hardware téměř nic a platíte sami sobě, když se ve 2 ráno zaplní disk.
Viděli jsme, jak účet Pinecone vyskočil z $80 na $800 během jednoho měsíce poté, co klient přidal druhý region bez změny objemu dotazů. Replikace není zdarma. Skryté náklady, o kterých nikdo nemluví: egress (zejména napříč regiony), multiplikátory replikace, velikost metadat (5KB JSON payload na vektor se při 10M řádcích nasčítá) a samotná volání embedding API (váš účet OpenAI za text-embedding-3-large často převýší účet za vektorovou databázi).
Toto jsou odhady z května 2026 z veřejných cenových stránek. Před závazkem ověřte na cenové stránce každého prodejce, ceny prodejců se mění čtvrtletně a naše čísla se budou posouvat.
Hybridní vyhledávání, kdy klíčové slovo + vektor porazí samotný vektor
Hybridní vyhledávání kombinuje sparse index klíčových slov (BM25 nebo SPLADE) s dense vektorovým indexem a slučuje skóre pomocí Reciprocal Rank Fusion nebo vážených součtů. Ve většině veřejných benchmarků překonává čistý vektorový retrieval v přesnosti RAG o 5–15 procentních bodů, zejména u dotazů na přesnou shodu, jako jsou kódy produktů, jména a chybové řetězce.
Čistý vektorový search je špatný na přesné shody. Zeptejte se „jaký je chybový kód pro E1042?" a dense retriever vrátí sémanticky příbuzné chyby, ne samotnou E1042. BM25 přesný token připne. Zkombinujte oba a dostanete to nejlepší z obou.
Prodejci s nativním hybridem v roce 2026: Qdrant, Weaviate, Milvus a Vespa (stojí za zmínku, i když jsme ji nehodnotili). Pinecone přidal sparse-dense hybrid v roce 2024 a API je solidní. Uživatelé pgvector ho typicky kombinují s fulltextovým vyhledáváním Postgres a slučují skóre v SQL.
from qdrant_client import QdrantClient
from qdrant_client.models import Prefetch, FusionQuery, Fusion
client = QdrantClient(url="http://localhost:6333")
results = client.query_points(
collection_name="rag",
prefetch=[
Prefetch(query=[0.1, 0.2, 0.3], using="dense", limit=20),
Prefetch(query={"indices": [42, 73], "values": [0.8, 0.6]}, using="sparse", limit=20),
],
query=FusionQuery(fusion=Fusion.RRF),
limit=5,
)Pokud se kvalita vašeho retrievalu zdá „tak nějak mimo" navzdory dobrým embeddingům, hybridní vyhledávání je nejužitečnější oprava a dobře se páruje s chytrou strategií chunkování. Nevynechejte ani jedno.
Co nám VectorDBBench a ann-benchmarks skutečně říkají
VectorDBBench a ann-benchmarks měří QPS, recall@k a p99 latenci napříč vektorovými databázemi na standardizovaných datasetech jako MS-MARCO a LAION. Qdrant a Milvus vedou v self-hosted propustnosti; Pinecone Serverless vede v managed jednoduchosti. Benchmarky jsou orientační. Složitost filtrů vaší zátěže má větší význam než titulní QPS.
Pár konkrétních čísel z veřejných benchmarků. Podle publikovaných benchmarků Qdrant dosahuje Qdrant kolem 600 QPS při recall@10 = 0,95 na datasetu deep-image-96 s 1M vektorů. Milvus s HNSW dosahuje srovnatelného QPS na stejném datasetu; mezera se zužuje nebo rozšiřuje podle selektivity filtrů. Na ann-benchmarks se starší knihovny ScaNN a HNSWlib stále drží a připomínají všem, že kvalita algoritmu má větší význam než marketing prodejců.
Benchmarky jsou orientační. Selektivita vašich filtrů a velikost metadat rozhoupe reálnou latenci víc než titulní QPS kteréhokoli prodejce.
Pointa není, že jsou benchmarky k ničemu. Jsou to kontrola zdravého rozumu. Spusťte si vlastní se svými skutečnými vzory filtrů, svými skutečnými dimenzemi vektorů a svým skutečným cílem přesnosti, než se upíšete. Když už u toho budete, nastavte si jak měřit kvalitu retrievalu. Recall@k vám neřekne nic o tom, zda jsou vaše RAG odpovědi správné.
Migrace z Pinecone (a další hovory o vendor lock-inu)
Migrace z Pinecone na Qdrant nebo Weaviate je pro většinu týmů projekt na 1–3 dny: re-indexujte své embeddingy (nebo je zkopírujte přes stávající API), aktualizujte klientskou knihovnu a přehrajte provoz. Prodejci s bohatým schématem jako Weaviate přidají mírnou práci s mapováním na začátku. Těžká část je zřídka kód.
Tři důvody, proč týmy migrují v roce 2026: ceny (účet přerostl pohodlí), datová rezidence (zákazníci v EU, regulovaná odvětví) a potřeby hybridního vyhledávání (hybrid Pinecone funguje, ale je méně ergonomický než u Qdrant nebo Weaviate).
Postup má pokaždé stejný tvar: exportujte embeddingy ze zdroje, re-indexujte do cíle, týden zapisujte nové vektory duálně, přepněte čtení a pak vyřaďte starý index. Duální zápis je ta část, kterou týmy přeskočí a litují. Je to vaše rollback tlačítko, pokud klesne přesnost.
Upřímný protiargument: pokud vaše aplikace už na Pinecone funguje a rozpočet není blokátorem, migrace se zřídka vyplatí. Náklady příležitosti 3denní migrace jsou obvykle vyšší než úspory, pokud neutratíte $5K+/měsíc.
Kdy NEpoužívat dedikovanou vektorovou databázi
Tuhle radu neuvidíte téměř nikde, protože neprodává vektorové databáze, ale spousta týmů po nich sahá, když je nepotřebuje.
- Pod 100K vektorů. In-memory NumPy nebo Faiss je opravdu v pohodě. Načíst pole NumPy a spustit kosinovou podobnost v Pythonu je na laptopu pod milisekundu.
- Už na Postgres, pod 10M vektorů. Prostě přidejte pgvector. Ušetříte databázi, integraci a měsíční účet.
- Stačí vyhledávání klíčových slov. Pokud uživatelé hledají názvy produktů nebo přesné řetězce, BM25 v Elasticsearch nebo Typesense porazí jakékoli vektorové vyhledávání. Nejdřív to vyzkoušejte.
- Prototypování lokálně. Chroma nebo SQLite + sloupec floatů. O produkční databázi rozhodněte, až budete mít skutečná produkční data.
Nepotřebujete vektorovou databázi. Potřebujete vyhledávání. Vyberte nejjednodušší věc, která ho dodá. Pokud chcete hlubší pohled na okolní stack, související čtení je nástroje kontextového inženýrství.
Jak Techsy přistupuje k výběru vektorové databáze
Když pomáháme klientům vybrat vektorovou databázi, nejprve spustíme čtyřotázkový filtr, než se dotkneme jediného benchmarku.
- Jaký je váš současný datový stack? Pokud jste na Postgres nebo MongoDB, odpovědí je obvykle jejich nativní vektorová volba. Nepřidávejte databázi, pokud se sama nezaplatí.
- Jakého měřítka dosáhnete za 18 měsíců? Ne dnešního měřítka. Měřítka, které spustí přestavbu. Pokud je pod 10M vektorů, pgvector nebo Chroma pravděpodobně stačí.
- Je flexibilita hostování tvrdým požadavkem? Datová rezidence, air-gapped nasazení nebo striktní cenové stropy vás tlačí k self-hosted Qdrant nebo Milvus, ne Pinecone.
- Jaká je provozní kapacita vašeho týmu? Nulová provozní kapacita + rozpočet = Pinecone. Trocha provozní kapacity + tlak na rozpočet = Qdrant Cloud. Hodně provozní kapacity = self-hosted Qdrant.
V praxi používáme Qdrant ve dvou klientských projektech, pgvector ve třech a jednoho klienta jsme nasadili na Pinecone jako rychlý prototyp, který jsme později migrovali na Qdrant, když dorazilo jejich měřítko. První rozhodnutí není vždy to poslední.
Pokud se rozhodujete mezi dvěma a zasekli jste se, získejte bezplatnou konzultaci. Pomůžeme vám přeskočit šestiměsíční přestavbu.
Často kladené otázky
Jaká je nejlepší vektorová databáze pro RAG v roce 2026?
Pro většinu týmů: Pinecone Serverless (nejrychlejší k nasazení) nebo Qdrant (nejlepší self-hosted poměr cena/výkon). Pokud už provozujete Postgres, pgvector zvládne RAG pohodlně do ~10M vektorů. „Nejlepší" závisí na preferenci hostování, měřítku a vašem stávajícím stacku, ne na hrubých číslech z benchmarků nebo marketingových tvrzeních prodejců.
Jaký je rozdíl mezi vektorovou databází a vektorovým vyhledávačem?
Vektorová databáze ukládá embeddingy plus metadata, transakce a řízení přístupu. Pinecone, Qdrant a Weaviate jsou příklady. Vektorový vyhledávač (nebo knihovna) jako Faiss poskytuje pouze ANN index; perzistenci, autentizaci a replikaci si zajišťujete sami. Produkční systémy potřebují databázi; embedded případy si někdy vystačí se samotným vyhledávačem.
Potřebuji dedikovanou vektorovou databázi, nebo pgvector stačí pro produkci?
pgvector stačí pro produkci zhruba do 10M vektorů s uvolněnými požadavky na p99 latenci (pod 200ms). Nad to, nebo pokud potřebujete hybridní vyhledávání, multi-tenancy nebo p99 pod 50ms, přepněte na Qdrant, Pinecone nebo Weaviate. Mnoho týmů nejprve nasadí na pgvector a migruje, až dorazí skutečné měřítko.
Jaká je nejlevnější vektorová databáze v roce 2026?
Self-hosted Qdrant na jednom VPS (Hetzner ax52 kolem $60–$120/měsíc) zvládne pohodlně 10M vektorů. Chroma je zdarma pro lokální prototypování. pgvector nepřidá žádné náklady, pokud už platíte za Postgres. Free tier Pinecone pokrývá malé projekty a $25/měs entry Weaviate je nejlevnější managed cloud volba pro hostované zátěže.
Jaká je nejlepší bezplatná vektorová databáze?
Qdrant (open source, Apache 2.0, s free cloud tier) a Chroma (open source, Apache 2.0) jsou dvě nejsilnější bezplatné volby pro rok 2026. pgvector je také zdarma, pokud už provozujete Postgres. Milvus je free open source, ale provozně těžší. Přeskočte ho pro malé projekty, kde bude jednodušší Qdrant nebo Chroma.
Je lepší Pinecone nebo Qdrant?
Pinecone vyhrává ve vývojářském zážitku a nulovém onboardingu. Nasadíte za hodinu. Qdrant vyhrává v ceně (často 3–5× levnější ve velkém měřítku), self-hostingu a výkonu filtrování. Vyberte Pinecone, pokud je rychlost do produkce důležitější než dlouhodobé náklady; vyberte Qdrant, pokud je kontrola rozpočtu nebo datová rezidence tvrdým požadavkem.
Jaký je rozdíl mezi vektorovou databází a tradiční databází?
Tradiční databáze (PostgreSQL, MongoDB) nachází řádky podle přesné shody nebo rozsahu. Vektorová databáze nachází řádky podle podobnosti: given embedding, vrať nejbližších k vektorů. Podkladový index (HNSW, IVF) je zásadně odlišný. Některé tradiční databáze přidávají vektorovou schopnost přes rozšíření jako pgvector; jiné dodávají dedikované vektorové enginy.
Jak vybrat vektorovou databázi?
Začněte svým stávajícím stackem: na Postgres vyzkoušejte pgvector. Na AWS bez Postgres vyzkoušejte Pinecone. Na Google Cloud vyzkoušejte Vertex AI Vector Search 2.0. Pak filtrujte podle měřítka (pod 10M vektorů funguje většina voleb) a hostování (managed nebo self-host). Pokud se stále rozhodujete, prototypujte lokálně s Chroma.
Jaká je nejlepší open-source vektorová databáze v roce 2026?
Qdrant vede pro většinu produkčních zátěží s rychlým HNSW, vynikajícím filtrováním a Series B financováním v březnu 2026. Weaviate je silná dvojka, když potřebujete schéma a hybridní vyhledávání out of the box. Milvus vyhrává v největších měřítkách. Chroma vyhrává pro lokální vývoj. pgvector vyhrává, pokud už jste na Postgres.
Editorský tým Techsy nasadil RAG systémy na Pinecone, Qdrant a pgvector napříč klientskými projekty v letech 2024–2026. Nebereme sponzoring od prodejců pro obsah o vektorových databázích; každý tip výše je takový, který bychom s vlastním jménem dali na roadmapu klienta.