Techsy
Kontakt
Začít
Zpět na blog
ai-machine-learning

Lokální ChatGPT za 10 minut: Open WebUI + Ollama (2026)

Napsal Techsy Editorial Team
Aktualizováno May 12, 2026
16 minut čtení
Obsah
Lokální ChatGPT za 10 minut: Open WebUI + Ollama (2026)

Lokální ChatGPT za 10 minut: Open WebUI + Ollama (2026)

Pokud jste někdy toužili po tom, aby ChatGPT běžel na vašem laptopu místo na serverech OpenAI, Open WebUI + Ollama je přesně ta sada nástrojů, kterou hledáte. Open WebUI vám poskytne vytříbené chatovací rozhraní; Ollama spouští modely lokálně. Žádné API klíče, žádné účtování za tokeny, žádná data opouštějící váš stroj. Tento průvodce vás dostane od čistého terminálu k prvnímu chatu přibližně za deset minut a následně přidá věci, které většina tutoriálů vynechává: hlasový I/O, Pipelines, MCP, benchmarky pro Apple Silicon a čisté řešení HTTPS pomocí Caddy.

Rychlé shrnutí:

  • Open WebUI je self-hostovaný frontend ve stylu ChatGPT; Ollama je lokální runner modelů, který ho pohání.
  • Cesta s jedním kontejnerem v Dockeru vás dostane k prvnímu chatu za ~10 minut na „zahřátém“ stroji.
  • Nastavte OLLAMA_BASE_URL na http://host.docker.internal:11434, abyste v devíti případech z deseti opravili chybu „nelze se připojit“.
  • Zabijácké funkce Open WebUI jsou Pipelines/Functions, nativní RAG, hlasový I/O a MCP, což nic z toho LM Studio nenabízí.

Co je to vlastně Open WebUI + Ollama?

Open WebUI je open-source, self-hostované webové rozhraní, které poskytuje Ollame (a dalším lokálním runtimeům LLM) chatovací UI ve stylu ChatGPT. Dohromady vám umožňují spouštět soukromé AI modely na vašem vlastním stroji, bez API klíčů, bez nákladů na tokeny a s plnou kontrolou nad daty. Open WebUI je vrstva pro chat; Ollama je vrstva pro modely. Komunikují přes HTTP na portu 11434 a to je celá architektura.

Pojďme si rozebrat jednotlivé části, protože názvy mohou znít zaměnitelně, ale nejsou:

  • Open WebUI, prohlížečová aplikace, kterou skutečně používáte. Podpora více uživatelů, vestavěné RAG, systém pluginů, běží na portu 8080 uvnitř Dockeru (mapujete jej na 3000 na hostiteli).
  • Ollama, server modelů. Stahuje soubory GGUF (představte si je jako .mp3 pro AI modely), načítá je na vaše CPU/GPU a vystavuje přehledné HTTP API na portu 11434.
  • Modely, skutečné soubory s váhami. llama3.2:3b, qwen2.5:14b, deepseek-r1:7b atd. Stahují se příkazem ollama pull a jsou uvedeny v knihovně modelů Ollamy.

Proč tato kombinace vítězí: soukromí (data zůstávají lokální), cena (nulová za token), možnost offline provozu, podpora více uživatelů hned po instalaci a skutečný ekosystém pluginů. Pokud jste nováčkem v širší oblasti, náš průvodce spouštěním LLM lokálně pokrývá hardwarovou stránku věci.

Oficiální dokumentace Open WebUI je kanonickou referencí, záložkujte si ji. Je stručná, ale přesná.

Jak nainstalovat Open WebUI s Ollamou? (Rychlé nastavení)

Nainstalujte Docker, nainstalujte Ollamu a poté spusťte docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main. Navštivte http://localhost:3000, vytvořte admin účet, stáhněte model z Admin → Settings → Connections → Ollama a začněte chatovat. Celkový čas: asi 10 minut na zahřátém stroji.

Zde je kompletní postup krok za krokem:

1. Nainstalujte Docker Desktop, stáhněte jej z docker.com pro Mac/Windows, nebo apt install docker.io na Linuxu.

2. Nainstalujte Ollamu

bash
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# Windows: download installer from ollama.com

3. Stáhněte startovací model. Doporučil bych začít s llama3.2:3b, který je rychlý na téměř všem a dostatečně chytrý, aby byl užitečný. Pokud chcete přehlídku nejsilnějších možností, podívejte se na náš seznam nejlepších open-source LLM.

bash
ollama pull llama3.2:3b

4. Spusťte kontejner Open WebUI (kanonický příkaz):

bash
docker run -d \
  -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  --restart always \
  ghcr.io/open-webui/open-webui:main

5. Otevřete http://localhost:3000, zaregistrujte se (první uživatel se automaticky stane administrátorem) a můžete chatovat.

Pro tip: Na Macích s Apple Silicon spusťte Ollamu nativně (ne v Dockeru). Je to záměr, který umožňuje Ollamě využívat Metal GPU. Open WebUI běží v Dockeru; obě části spolu komunikují přes host.docker.internal:11434.

Co se týče slibu „10 minut“: toto číslo platí pro zahřátý stroj, kdy je Docker již nainstalován a máte slušné internetové připojení pro stažení ~2 GB image a ~2 GB modelu. První instalace Dockeru bez cache? Připočítejte deset minut. Pomalé připojení? Přidejte dalších pět. Upřímný základ, ne marketingové číslo.

Docker Compose: Nastavení připravené pro produkci

Pokud chcete reprodukovatelné nastavení s více kontejnery pro Open WebUI plus samostatnou službu Ollama, Docker Compose je čistší cesta. Jeden YAML soubor definuje obě služby, sdílenou síť, pojmenované svazky pro perzistenci dat a umožňuje redeploy jediným příkazem docker compose up -d. Skvělé pro servery, homelaby nebo týmy.

Triky, na kterých lidé často selžou: když obě služby běží uvnitř Compose, nastavte OLLAMA_BASE_URL=http://ollama:11434 (název služby v Compose), nikoli host.docker.internal. Interní DNS Dockeru automaticky přeloží název služby.

yaml
services:
  ollama:
    image: ollama/ollama:latest
    container_name: ollama
    ports:
      - "11434:11434"
    volumes:
      - ollama:/root/.ollama
    restart: always

  open-webui:
    image: ghcr.io/open-webui/open-webui:main
    container_name: open-webui
    ports:
      - "3000:8080"
    environment:
      - OLLAMA_BASE_URL=http://ollama:11434
    volumes:
      - open-webui:/app/backend/data
    depends_on:
      - ollama
    restart: always

volumes:
  ollama:
  open-webui:

Spusťte to:

bash
docker compose up -d
docker compose logs -f

Dvě poznámky stojí za zdůraznění. Zaprvé, pojmenované svazky (ollama: a open-webui: dole) jsou zde lepší než bind mounty, Docker spravuje oprávnění a vaše historie chatu/konfigurace přežijí rebuildy kontejnerů. Zadruhé, pokud chcete, aby jedno Open WebUI komunikovalo s lokální Ollamou a vzdálenými OpenAI/Anthropic prostřednictvím jedné URL, postavte před něj LiteLLM proxy. A pokud stále vybíráte svou runtime vrstvu, náš přehled nejlepších lokálních nástrojů pro LLM pokrývá Ollamu, vLLM, LM Studio a další.

Akcelerace GPU: NVIDIA, AMD a Apple Silicon

Ollama automaticky detekuje GPU NVIDIA prostřednictvím NVIDIA Container Toolkit, GPU AMD prostřednictvím ROCm na Linuxu a GPU Apple Silicon nativně přes Metal. Nepředáváte --gpus all do Open WebUI, pouze Ollama potřebuje GPU. Nejrychlejší nastavení na každé platformě vypadá jinak a některé momenty typu „proč je to pomalé“ pramení z toho, že máte Ollamu na špatném místě.

NVIDIA (Linux + Windows WSL2)

Nainstalujte NVIDIA Container Toolkit a poté spusťte Ollamu v Dockeru s --gpus all:

bash
docker run -d --gpus=all \
  -v ollama:/root/.ollama \
  -p 11434:11434 \
  --name ollama \
  ollama/ollama

Ověřte pomocí nvidia-smi při načteném modelu, měli byste vidět ollama v seznamu procesů na GPU. Proměnná prostředí OLLAMA_NUM_GPU vám umožňuje omezit vrstvy, když soupeříte o VRAM s jinými workloady.

Apple Silicon (M1/M2/M3/M4)

Spusťte Ollamu nativně, ne v Dockeru. Zatím (k počátku roku 2026) neexistuje průchod Metal GPU do Dockeru, takže Ollama v Dockeru na Macu fallbackne na CPU a budete se divit, proč se váš M3 Max chová jako ThinkPad z roku 2015. Open WebUI stále běží v Dockeru; dosáhne na Ollamu přes host.docker.internal:11434.

Na mém M2 Pro (16 GB) při běhu llama3.2:3b vidím zhruba 45–55 tokenů/sec. llama3.1:8b klesne na ~22–28 tokenů/sec. qwen2.5:14b je na hranici použitelnosti při ~9–12 tokenech/sec, což je fajn pro chat, ale bolestivé pro batch práci. Čísla se liší podle kvantizace a délky kontextu, ale toto je řádově správně.

"Tokens/sec by Model and Hardware"

Tabulka dat
"Tokens/sec by Model and Hardware"
"Model""Apple M2 Pro 16GB""RTX 3060 12GB""RTX 4090 24GB"
"llama3.2:3b"5075180
"llama3.1:8b"2545110
"qwen2.5:14b"112265

AMD (ROCm na Linuxu)

Ollama 0.5+ dodává podporu ROCm pro karty RDNA2/RDNA3 (série RX 6000/7000, čipy pro datová centra MI200/MI300). Použijte dedikovaný image:

bash
docker run -d --device=/dev/kfd --device=/dev/dri \
  -v ollama:/root/.ollama \
  -p 11434:11434 \
  --name ollama \
  ollama/ollama:rocm

Výkon AMD významně dohnal náskok během roku 2025 – ještě není na úrovni NVIDIA, ale už to není jen vědecký experiment.

Jak přidat RAG (vlastní PDF) do Open WebUI?

Open WebUI má vestavěné nativní RAG. Klikněte na svůj profil → Workspace → Knowledge, vytvořte knowledge base, přetáhněte tam PDF, Word dokumenty, Markdown nebo textové soubory. V pozadí Open WebUI rozdělí dokumenty na chunky, embeduje je pomocí nakonfigurovaného embedding modelu (výchozí nomic-embed-text), uloží je do ChromaDB a retrievuje je v době dotazu. Není vyžadována žádná externí služba.

Nastavení vyžaduje jeden extra krok: nejprve stáhněte embedding model.

bash
ollama pull nomic-embed-text

Poté v Admin → Settings → Documents nastavte embedding model na nomic-embed-text. Upravte velikost chunku (výchozí 1500) a overlap (výchozí 100) podle potřeby. Klasická past: příliš velké chunky překročí vaše okno kontextu u malých modelů. Pokud používáte llama3.2:3b s kontextem 4K, chunky o 1500 tokenech nezanechají téměř žádný prostor pro samotnou otázku, snižte na 800 s overlapem 80.

Chcete-li použít knowledge base v chatu, napište # a vyberte kolekci. Nebo ji trvale připojte k Custom Modelu ve Workspace → Models. Webové vyhledávání funguje podobně, zapněte poskytovatele (SearXNG, Brave nebo Tavily) v Admin → Settings → Web Search a model může tahat živé výsledky.

Pro hlubší srovnání RAG se podívejte na náš přehled nástrojů pro RAG. A pokud ChromaDB přestává stačit ve velkém měřítku, náš rozbor možností vektorových databází pokrývá Qdrant, pgvector a kompromisy mezi nimi.

Hlasový I/O: Mluvte se svým lokálním AI

Open WebUI podporuje jak převod řeči na text (STT), tak text na řeč (TTS). Pro STT běží faster-whisper lokálně bez API klíče. Pro TTS můžete napojit API OpenAI TTS nebo spustit lokální engine jako coqui-tts. Po povolení se v chatovacím poli objeví ikona mikrofonu a vaše lokální AI začne odpovídat hlasem.

Jděte do Admin → Settings → Audio. Dva enginy, dvě rozbalovací nabídky.

Cesta STT, vyberte Whisper (Local), zvolte velikost modelu: tiny, base, small, medium nebo large. Model se při prvním použití automaticky stáhne. base je zlatá střední cesta pro většinu laptopů; medium, pokud máte rezervu na GPU.

Cesta TTS, nejjednodušší je OpenAI TTS: vložte API klíč, vyberte tts-1 a hlas (alloy, nova atd.). Zcela lokální cesta: engine coqui-tts se samostatným Docker imagem. Většina lidí skončí u lokálního Whisperu + OpenAI TTS jako pragmatického kompromisu, vaše audio nikdy neopustí počítač pro vstup a API volání je jen krátký textový řetězec pro výstup.

Volbu můžete zakódovat do kontejneru pomocí env vars:

bash
docker run -d \
  -e WHISPER_MODEL=base \
  -e AUDIO_STT_ENGINE=whisper \
  -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

Kompletní audio reference najdete v dokumentaci na GitHubu Open WebUI.

Pipelines & Functions: Zabijácká funkce Open WebUI

Pipelines a Functions jsou způsob, jak rozšířit Open WebUI bez forknutí kódu. Pipelines jsou externí Python služby, které fungují jako filtry, routery modelů nebo plně vlastní handlery. Functions jsou inline Python (Filter, Action nebo Pipe), které žijí přímo uvnitř Open WebUI. Dohromady jsou důvodem, proč Open WebUI poráží LM Studio pro seriózní uživatele.

Tři typy Function, každá jednou větou:

  • Filter, před/zpracovává zprávy (redakce PII, filtr vulgarit, přepis promptů).
  • Action, tlačítko v chatovacím UI, které spustí Python (re-sumarizace, uložení do Notion, spuštění SQL dotazu).
  • Pipe, plný custom handler modelu (routování na vzdálené API, řetězení více modelů, budování agenta).

Zde je minimální Filter, který odstraní e-mailové adresy z uživatelských promptů, než se dostanou k modelu:

python
from pydantic import BaseModel
import re

class Filter:
    class Valves(BaseModel):
        priority: int = 0

    def __init__(self):
        self.valves = self.Valves()

    def inlet(self, body: dict, __user__: dict = None) -> dict:
        for message in body.get("messages", []):
            if message.get("role") == "user":
                message["content"] = re.sub(
                    r"[\w\.-]+@[\w\.-]+",
                    "[REDACTED_EMAIL]",
                    message["content"],
                )
        return body

Vložte to do Admin → Settings → Functions → New, uložte a zapněte pro libovolný model. Hotovo.

Pro externí Pipelines spusťte dedikovaný kontejner vedle Open WebUI:

yaml
  pipelines:
    image: ghcr.io/open-webui/pipelines:main
    container_name: pipelines
    ports:
      - "9099:9099"
    volumes:
      - pipelines:/app/pipelines
    restart: always

Poté v Admin → Settings → Connections přidejte http://pipelines:9099 jako OpenAI-kompatibilní API. Nahrajte soubory .py v Admin → Settings → Pipelines. Oficiální repozitář Pipelines má desítky příkladů, translation routery, logování Langfuse, function calling a další.

MCP: Propojení Open WebUI s externími nástroji

Open WebUI 0.6+ podporuje Model Context Protocol (MCP), což znamená, že váš lokální model může volat externí nástroje, vyhledávání souborů, GitHub, Slack, vaše vlastní custom servery prostřednictvím stejného protokolu, který používá Claude Desktop. Je to nejčistší způsob, jak dát lokálnímu modelu skutečné použití nástrojů bez psaní Pipeline.

Přidejte MCP server v Admin → Settings → Tools: vložte URL serveru, dejte mu jméno a povolte pro konkrétní model. Model se rozhodne, kdy ho během chatu zavolat. Protokol pokrýváme end-to-end v našem průvodci Model Context Protocol (MCP), stejné vzorce, jen ze strany Open WebUI místo Claude Desktopu.

Proč je to důležité: k polovině roku 2026 téměř žádný tutoriál o Open WebUI nezmiňuje MCP. Pokud jste již standardizovali MCP servery pro své nastavení Claude nebo Cursor, můžete namířit Open WebUI na přesně stejné servery. Jeden protokol, každý klient.

Proč Open WebUI nevidí mé modely Ollama? (Řešení problémů)

Pokud se Open WebUI načte, ale dropdown modelů je prázdný, kontejner nemůže dosáhnout na Ollamu. V devíti případech z deseti je řešením --add-host=host.docker.internal:host-gateway plus OLLAMA_BASE_URL=http://host.docker.internal:11434. Na Linuxu bez flagu host-gateway bridge síť Dockeru nevidí port 11434 hostitele. Když jsme to poprvé nasazovali na Linuxovém boxu klienta, narazili jsme přesně na toto a ztratili hodinu.

Tři hlavní příčiny, v pořadí četnosti:

  1. Chybějící flag --add-host (nejčastější na Linuxu). macOS Docker Desktop nastavuje host.docker.internal automaticky; Linux potřebuje explicitní flag.

  2. Ollama navázaná pouze na 127.0.0.1. Z pohledu kontejneru to není dosažitelné. Oprava:

    bash
    OLLAMA_HOST=0.0.0.0:11434 ollama serve

    Nebo nastavte Environment="OLLAMA_HOST=0.0.0.0:11434" v systemd unit na Linuxu.

  3. Firewall / antivir blokuje 11434. Méně časté, ale zkontrolujte ufw, Windows Defender nebo firemní endpoint protection.

Diagnostika, spusťte toto zevnitř kontejneru Open WebUI:

bash
docker exec open-webui curl http://host.docker.internal:11434/api/tags

Pokud to vrátí JSON se seznamem vašich modelů, síťování je v pořádku a problém je v nastavení Open WebUI (zkontrolujte Admin → Connections → Ollama URL). Pokud to visí nebo odmítá připojení, máte problém na straně hostitele, začněte příčinou #2.

Open WebUI vs LM Studio vs Jan vs AnythingLLM

Open WebUI vítězí v podpoře více uživatelů, hloubce RAG a Pipelines/Functions. LM Studio vítězí ve výkonu GPU hned po instalaci a vytříbeném UI pro jednoho uživatele. Jan vítězí v minimální bariéře při prvním spuštění. AnythingLLM vítězí v ergonomii ingestování dokumentů. Pokud chcete self-hostovanou náhradu ChatGPT pro tým, Open WebUI je odpověď.

FunkceOpen WebUILM StudioJanAnythingLLM
Více uživatelůAnoNeNeAno
Nativní RAGAno (hluboké)Pouze pluginZákladníAno (nejlepší UX)
Pluginy / RozšířeníPipelines + FunctionsOmezenéExtensionsPlugins
Podpora GPUPřes backend OllamaVestavěná (nejlepší)VestavěnáPřes backend
Nejlepší proSelf-hostované týmySóloví desktopoví power usersPrvní lokální AIWorkflows těžké na dokumenty

Verdikt: pokud jste sólový vývojář, který chce jen spustit model na své herní GPU a chatovat, LM Studio je rychlejší na nastavení. Pokud budujete soukromý ChatGPT pro tým, děláte seriózní RAG nebo drátujete custom Python logiku, Open WebUI je jediná skutečná volba. Naše širší příspěvek o nejlepších lokálních nástrojích pro LLM porovnává runtime vrstvu (vLLM, llama.cpp, Ollama) pod těmito UI.

Jak bezpečně exponovat Open WebUI přes HTTPS?

Dvě čisté cesty: 5-řádkový Caddyfile před Open WebUI pro skutečný Let's Encrypt certifikát (produkční styl) nebo Cloudflare Tunnel pro sdílení s týmem s nulovým otevřeným portem. Obě udržují Open WebUI na localhost:3000 a zároveň exponují čistou veřejnou URL s HTTPS. Vyberte si podle toho, zda ovládáte DNS pro doménu.

Cesta s Caddy, nasměrujte svou doménu na box, pak:

caddyfile
ai.example.com {
    reverse_proxy localhost:3000
}

To je celá konfigurace. Caddy automaticky získá Let's Encrypt certifikát při prvním požadavku. Spusťte caddy run --config Caddyfile (nebo použijte systemd unit). Kompletní reference: dokumentace Caddy.

Cesta s Cloudflare Tunnel, cloudflared tunnel create open-webui, nasměrujte hostname ve vaší Cloudflare zóně, pak cloudflared tunnel run. Nulový otevřený port, Cloudflare řeší TLS. Skvělé pro „chci, aby na tom byl můj tým, aniž bych dělal díry ve firewallu“.

Jedno tvrdé pravidlo: nikdy neexponujte port 3000 raw do veřejného internetu. Registrace v Open WebUI je ve výchozím nastavení otevřená, kdokoli, kdo trefí vaši URL, si může vytvořit účet. WEBUI_AUTH=False je v pořádku pro LAN, nikdy ne pro veřejnost. Vždy ho postavte za reverse proxy plus whitelisting autentizované registrace (Admin → Settings → General → „Enable Signup“ vypněte poté, co jste vytvořili své účty).

Jak Techsy přistupuje k nasazení lokálních LLM

Nasadili jsme nastavení Open WebUI + Ollama pro klienty v právních firmách, zdravotnictví a týmech interních nástrojů, kteří nemohou (nebo nechtějí) posílat data do OpenAI. Vzorce se opakují dost často na to, abychom je přestali psát od nuly, ale každé nasazení má stejné tři priority.

Co skutečně děláme:

  • Správně dimenzujeme model podle hardwaru a rozpočtu. Rozsah 3B–8B trefuje zlatou střední cestu častěji než ne. Větší není vždy lepší, když záleží na latenci a měsíčních nákladech.
  • Ztvrdíme nasazení. Caddy vpředu, registrace vypnutá, /app/backend/data na zálohovaném pojmenovaném svazku, týdenní snapshoty a skutečný plán disaster recovery.
  • Drátujeme Pipelines pro potřeby specifické pro organizaci. Filtry pro redigování PII, custom RAG pipeline mířené na interní SharePoint nebo Confluence, nástroje pro function-calling pro bezpečný přístup ke shellu, věci, které dělají chatovací UI skutečně užitečným uvnitř firmy.

Pokud raději přeskočíte nastavení a chcete mít soukromý AI stack rovnou běžící, rezervujte si bezplatnou konzultaci. Radi to scopesneme.

Závěr

Tři rychlá shrnutí:

  • Cesta s jedním kontejnerem, nejrychlejší cesta k prvnímu chatu, deset upřímných minut na zahřátém stroji.
  • Docker Compose, to, co skutečně chcete pro cokoli, co musí přežít restart.
  • Pipelines + RAG + MCP, příkop, který činí Open WebUI hodným volby před LM Studio nebo Jan.

Chatujete se svým vlastním AI za deset minut. Od té doby je vše inkrementální, přidejte RAG, když máte dokumenty, přidejte Caddy, když to chcete na telefonu, přidejte Pipelines, když chcete, aby to dělalo skutečnou práci. Pokud chcete jít hlouběji do výběru lokálních modelů, náš průvodce spouštění LLM lokálně pokrývá hardwarovou stránku do hloubky.

FAQ

Jak nainstalovat Open WebUI s Ollamou?

Tři kroky: nainstalujte Docker Desktop, nainstalujte Ollamu (curl -fsSL https://ollama.com/install.sh | sh na macOS/Linux), poté spusťte kanonický kontejner Open WebUI příkazem docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main. Otevřete http://localhost:3000 a vytvořte svůj admin účet.

Je Open WebUI zdarma?

Ano, Open WebUI má licenci MIT a je plně open source. Self-hosting je zdarma; platíte pouze za hardware, na kterém běží (váš laptop, homelab server nebo cloud VM). Volitelné placené položky zahrnují API OpenAI TTS pro hlas nebo komerční modely přístupné přes konektor Open WebUI kompatibilní s OpenAI. Všechno jádrové je bezplatné.

Může Open WebUI běžet bez Ollamy?

Ano, Open WebUI komunikuje s jakýmkoli API kompatibilním s OpenAI. Můžete ho namířit přímo na OpenAI, Anthropic přes LiteLLM proxy, servery vLLM, HTTP server llama.cpp nebo hostované providery jako Groq a Together. Ale „Open WebUI + Ollama“ je kanonická kombinace pro lokální AI, protože Ollama činí správu modelů mrtvě jednoduchou.

Proč se Open WebUI nemůže připojit k Ollamě?

Nejčastější příčina: chybějící flag --add-host=host.docker.internal:host-gateway a nenastavené OLLAMA_BASE_URL v nastavení Open WebUI. Druhá nejčastější: Ollama navázaná pouze na 127.0.0.1, nedosažitelná zevnitř kontejneru, opravte pomocí OLLAMA_HOST=0.0.0.0:11434 ollama serve. Pro rychlou diagnostiku spusťte docker exec open-webui curl http://host.docker.internal:11434/api/tags.

Jak přidat modely do Open WebUI?

Nejjednodušší cesta: z hostitele spusťte ollama pull llama3.2:3b (nebo jakýkoli model z ollama.com/library). Model se automaticky objeví v dropdownu Open WebUI, není nutný restart. Alternativně v Open WebUI jděte do Admin → Settings → Connections → Ollama a použijte tlačítko pull v UI. Každopádně modely žijí na straně Ollamy.

Jaký je rozdíl mezi Open WebUI a LM Studio?

LM Studio je desktopová aplikace pro jednoho uživatele zaměřená na správu modelů plus chat, silné výchozí nastavení GPU, slick UI, žádná podpora více uživatelů. Open WebUI je self-hostovaný server podporující více uživatelů, nativní RAG, hlasový I/O, Pipelines/Functions a MCP. Různé cílové skupiny: LM Studio pro sólové desktopové power usery, Open WebUI pro týmy nebo kohokoli, kdo chce rozšiřitelný soukromý ChatGPT.

Mohu používat Open WebUI na telefonu?

Ano, Open WebUI je plně responzivní, takže funguje v jakémkoli mobilním prohlížeči. Spojte to s HTTPS (Caddy s Let's Encrypt certifikátem nebo Cloudflare Tunnel) a stane se z toho plně funkční mobilní chatovací aplikace. Přidejte si to na domovskou obrazovku na iOS nebo Android pro téměř nativní zážitek z PWA. Nevystavujte to však veřejně bez autentizace.

Jak aktualizovat Open WebUI?

Stáhněte nejnovější image a restartujte: docker pull ghcr.io/open-webui/open-webui:main && docker stop open-webui && docker rm open-webui a poté znovu spusťte svůj původní příkaz docker run. Pojmenované svazky zachovají všechna data, historii chatu, uživatele, RAG kolekce a nastavení. S Docker Compose: docker compose pull && docker compose up -d. Aktualizace vycházejí přibližně týdně.

Podporuje Open WebUI hlasový chat?

Ano, jak převod řeči na text (přes lokální faster-whisper), tak text na řeč (přes API OpenAI TTS nebo lokální coqui-tts). Obojí nastavte v Admin → Settings → Audio. Po povolení se v chatovacím poli objeví ikona mikrofonu. Pragmatické nastavení je lokální Whisper plus OpenAI TTS, plně offline vstup, rychlý čistý výstup. Viz sekce Hlasový I/O výše pro konfiguraci env-var.

Jak přidat své PDF do Open WebUI?

Klikněte na svůj profil → Workspace → Knowledge → New collection, poté nahrajte PDF, Word dokumenty, Markdown nebo textové soubory. Open WebUI rozdělí dokumenty na chunky, embeduje je pomocí nomic-embed-text (nejprve stáhněte přes ollama pull nomic-embed-text) a uloží je do ChromaDB. Referencujte jakoukoli kolekci v chatu pomocí #collection-name nebo ji trvale připojte k Custom Modelu.

Štítky

open-webuiollamalokalni-llmdockerself-hosted-airagnastroje-pro-llm

Sdílet článek

Související články

Více z kategorie ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 je tady: Inteligence blízká Fable 5 za poloviční cenu

Anthropic vydal Claude Opus 5 24. července 2026. Na Frontier-Bench více než zdvojnásobuje Opus 4.8 a drží cenu Opus, ale v několika testech prohrává s Fable 5 a Mythos 5. Zde je tabulka benchmarků, ceník a doporučení: přepnout / počkat / zůstat.

10 min read minut čtení
Číst
ai-machine-learning
Jul 20, 2026

8 nejlepších API pro AI web scraping v roce 2026 (otestováno na našem vlastním agentním stacku)

Otestovali jsme 8 API pro AI web scraping s reálnými cenami pro rok 2026 staženými přes náš vlastní agentní stack. Firecrawl, Bright Data, ScrapingBee a 5 dalších, seřazené podle výstupu připraveného pro LLM, anti-bot a podpory MCP.

9 min read minut čtení
Číst
ai-machine-learning
Jul 20, 2026

Prompt Engineering pro kódování: 7 vzorů, které denně používáme v Claude Code a Cursor (2026)

Většina článků o „promptech pro AI kódování“ vám nabídne 50 šablon ke kopírování. Tento článek učí 7 vzorů, které každý den používáme k provozu pipeline s 16 agenty v Claude Code, včetně skutečných příkladů před a po úpravě pro každý z nich, a ukazuje, kde se každý vzor nachází v nástrojích Claude Code, Cursor a Copilot v roce 2026.

11 min read minut čtení
Číst
Zobrazit všechny články
Začněte svůj projekt

Pojďme něco postavit nevšedního?

Proměňme vaši vizi ve skutečnost. Náš tým je připraven vám pomoct vytvořit software, který dělá rozdíl.

Rezervovat 30minutový úvodní hovorNaše projekty

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt

Právní informace

  • Zásady ochrany osobních údajů
  • Podmínky poskytování služeb
  • Zásady používání cookies

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt
Právní informaceZásady ochrany osobních údajůPodmínky poskytování služebZásady používání cookies
TECHSY
© 2026 Techsy. Všechna práva vyhrazena.