Techsy
Contact
Începe
Înapoi la Blog
ai-machine-learning

ChatGPT local în 10 minute: Open WebUI + Ollama (2026)

Scris de Techsy Editorial Team
Actualizat May 12, 2026
17 min citire
Cuprins
ChatGPT local în 10 minute: Open WebUI + Ollama (2026)

ChatGPT local în 10 minute: Open WebUI + Ollama (2026)

Dacă ți-ai dorit vreodată ca ChatGPT să ruleze pe laptopul tău în loc de pe serverele OpenAI, Open WebUI + Ollama este exact stiva tehnologică de care ai nevoie. Open WebUI îți oferă interfața de chat rafinată; Ollama rulează modelele local. Fără chei API, fără facturare per token, fără date care părăsesc mașina ta. Acest ghid te duce de la un terminal proaspăt la primul tău chat în aproximativ zece minute, apoi adaugă lucrurile pe care majoritatea tutorialelor le omit: I/O vocal, Pipelines, MCP, benchmark-uri pentru Apple Silicon și o cale HTTPS curată cu Caddy.

Concluzii rapide:

  • Open WebUI este un frontend auto-gazduit, stil ChatGPT; Ollama este motorul local de modele care îl alimentează.
  • Calea cu un singur container Docker te duce la primul chat în ~10 minute pe o mașină „încălzită” (cu cache-ul pregătit).
  • Setează OLLAMA_BASE_URL la http://host.docker.internal:11434 pentru a remedia eroarea „nu se poate conecta” în nouă cazuri din zece.
  • Funcțiile killer ale Open WebUI sunt Pipelines/Functions, RAG nativ, I/O vocal și MCP, niciuna dintre ele ne fiind egalată de LM Studio.

Ce este, de fapt, Open WebUI + Ollama?

Open WebUI este o interfață web open-source, auto-gazduită, care oferă Ollama (și altor runtime-uri locale de LLM) o interfață de chat în stil ChatGPT. Împreună, îți permit să rulezi modele AI private pe propria mașină, fără chei API, fără costuri per token, cu control total asupra datelor. Open WebUI este stratul de chat; Ollama este stratul de modele. Ele comunică prin HTTP pe portul 11434, iar aceasta este întreaga arhitectură.

Să descompunem piesele, deoarece numele sună interschimbabile, dar nu sunt:

  • Open WebUI, aplicația de browser pe care o folosești efectiv. Multi-utilizator, RAG integrat, sistem de plugin-uri, rulează pe portul 8080 în interiorul Docker (îl mapezi la 3000 pe gazda ta).
  • Ollama, serverul de modele. Descarcă fișiere GGUF (gândește-te la ele ca .mp3 pentru modelele AI), le încarcă pe CPU/GPU și expune un API HTTP ordonat pe portul 11434.
  • Modelele, fișierele reale de weights. llama3.2:3b, qwen2.5:14b, deepseek-r1:7b etc. Descărcate prin ollama pull, listate în biblioteca de modele a Ollama.

De ce câștigă această combinație: confidențialitate (datele rămân local), cost (zero per token), capabilă offline, multi-utilizator din cutie și un ecosistem real de plugin-uri. Dacă ești nou în acest domeniu mai larg, ghidul nostru despre rularea LLM-urilor local acoperă partea hardware.

Documentația oficială Open WebUI este referința canonică, pune-le la bookmark. Sunt concise, dar precise.

Cum instalez Open WebUI cu Ollama? (Configurare Rapidă)

Instalează Docker, instalează Ollama, apoi rulează docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main. Vizitează http://localhost:3000, creează contul de admin, descarcă un model din Admin → Settings → Connections → Ollama și începe să conversezi. Timp total: aproximativ 10 minute pe o mașină „încălzită”.

Iată calea completă, pas cu pas:

1. Instalează Docker Desktop, descarcă-l de pe docker.com pentru Mac/Windows, sau apt install docker.io pe Linux.

2. Instalează Ollama

bash
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# Windows: download installer from ollama.com

3. Descarcă un model de start. Aș începe cu llama3.2:3b, rapid pe aproape orice, suficient de inteligent pentru a fi util. Dacă dorești o prezentare a celor mai puternice opțiuni, verifică lista noastră cu cele mai bune LLM-uri open-source.

bash
ollama pull llama3.2:3b

4. Rulează containerul Open WebUI (comanda canonică):

bash
docker run -d \
  -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  --restart always \
  ghcr.io/open-webui/open-webui:main

5. Deschide http://localhost:3000, înregistrează-te (primul utilizator devine automat admin) și poți conversa.

Sfat pro: Pe Mac-urile cu Apple Silicon, rulează Ollama nativ (nu în Docker). Este conceput astfel pentru a permite Ollama să utilizeze GPU-ul Metal. Open WebUI rulează în Docker; cele două comunică prin host.docker.internal:11434.

Despre promisiunea de „10 minute”: acesta este un număr pentru o mașină „încălzită”, cu Docker deja instalat și internet decent pentru descărcarea imaginii de ~2 GB și a modelului de ~2 GB. Prima instalare Docker ever, fără cache? Adaugă zece minute pentru asta. Conexiune lentă? Adaugă încă cinci. O linie de bază onestă, nu un număr de marketing.

Docker Compose: Configurarea Pregătită pentru Producție

Dacă dorești o configurare reproductibilă, cu mai multe containere, pentru Open WebUI plus un serviciu Ollama autonom, Docker Compose este calea mai curată. Un singur fișier YAML declară ambele servicii, o rețea partajată, volume denumite pentru persistență și îți permite redeploy-ul cu o singură comandă docker compose up -d. Excelent pentru servere, homelab-uri sau echipe.

Trucul care îi blochează pe oameni: când ambele servicii rulează în interiorul Compose, setează OLLAMA_BASE_URL=http://ollama:11434 (numele serviciului Compose), nu host.docker.internal. DNS-ul intern al Docker rezolvă automat numele serviciului.

yaml
services:
  ollama:
    image: ollama/ollama:latest
    container_name: ollama
    ports:
      - "11434:11434"
    volumes:
      - ollama:/root/.ollama
    restart: always

  open-webui:
    image: ghcr.io/open-webui/open-webui:main
    container_name: open-webui
    ports:
      - "3000:8080"
    environment:
      - OLLAMA_BASE_URL=http://ollama:11434
    volumes:
      - open-webui:/app/backend/data
    depends_on:
      - ollama
    restart: always

volumes:
  ollama:
  open-webui:

Pornește-l:

bash
docker compose up -d
docker compose logs -f

Două note worth highlighting. În primul rând, volumele denumite (ollama: și open-webui: la final) sunt preferabile mount-urilor bind aici, Docker gestionează permisiunile, iar istoricul de chat/configurația supraviețuiesc reconstruirilor containerelor. În al doilea rând, dacă dorești ca un singur Open WebUI să vorbească cu Ollama local și cu OpenAI/Anthropic remote printr-o singură URL, plasează un proxy LiteLLM în față. Și dacă încă îți alegi stratul de runtime, roundup-ul nostru cu cele mai bune unelte locale pentru LLM acoperă Ollama, vLLM, LM Studio și altele.

Accelerare GPU: NVIDIA, AMD și Apple Silicon

Ollama detectează automat GPU-urile NVIDIA prin NVIDIA Container Toolkit, GPU-urile AMD prin ROCm pe Linux și GPU-urile Apple Silicon nativ prin Metal. Nu transmiți --gpus all către Open WebUI, doar Ollama are nevoie de GPU. Configurarea cea mai rapidă pe fiecare platformă arată diferit, iar unele momente de „de ce merge așa greu” se reduc la faptul că ai pus Ollama în locul greșit.

NVIDIA (Linux + Windows WSL2)

Instalează NVIDIA Container Toolkit, apoi rulează Ollama în Docker cu --gpus all:

bash
docker run -d --gpus=all \
  -v ollama:/root/.ollama \
  -p 11434:11434 \
  --name ollama \
  ollama/ollama

Verifică cu nvidia-smi în timp ce un model este încărcat; ar trebui să vezi ollama în lista de procese GPU. Variabila de mediu OLLAMA_NUM_GPU îți permite să limitezi straturile atunci când gestionezi VRAM-ul cu alte sarcini de lucru.

Apple Silicon (M1/M2/M3/M4)

Rulează Ollama natív, nu în Docker. Încă nu există passthrough GPU Metal în Docker (la începutul lui 2026), așa că un Ollama containerizat pe Mac revine la CPU și te vei întreba de ce M3 Max-ul tău se simte ca un ThinkPad din 2015. Open WebUI rulează totuși în Docker; acesta ajunge la Ollama prin host.docker.internal:11434.

Pe M2 Pro-ul meu (16 GB) rulând llama3.2:3b, văd aproximativ 45-55 tokeni/sec. llama3.1:8b scade la ~22-28 tokeni/sec. qwen2.5:14b este la limita utilizabilității la ~9-12 tokeni/sec, bun pentru chat, dureros pentru lucru batch. Numerele variază în funcție de cuantizare și lungimea contextului, dar aceasta este ordinea de mărime.

"Tokens/sec by Model and Hardware"

Tabel de date
"Tokens/sec by Model and Hardware"
"Model""Apple M2 Pro 16GB""RTX 3060 12GB""RTX 4090 24GB"
"llama3.2:3b"5075180
"llama3.1:8b"2545110
"qwen2.5:14b"112265

AMD (ROCm pe Linux)

Ollama 0.5+ include suport ROCm pentru plăcile RDNA2/RDNA3 (seria RX 6000/7000, chip-uri datacenter MI200/MI300). Folosește imaginea dedicată:

bash
docker run -d --device=/dev/kfd --device=/dev/dri \
  -v ollama:/root/.ollama \
  -p 11434:11434 \
  --name ollama \
  ollama/ollama:rocm

Performanța AMD a redus semnificativ decalajul în 2025 — nu este încă la nivelul NVIDIA, dar nu mai este un proiect științific experimental.

Cum adaug RAG (PDF-urile tale) în Open WebUI?

Open WebUI vine cu RAG nativ. Dă click pe profilul tău → Workspace → Knowledge, creează o bază de cunoștințe, adaugă PDF-uri, documente Word, Markdown sau fișiere text. În spate, Open WebUI fragmentează documentele, le încorporează (embed) cu modelul de embedding configurat (implicit nomic-embed-text), le stochează în ChromaDB și le recuperează la momentul interogării. Nu este necesar niciun serviciu extern.

Configurarea necesită un pas extra: descarcă mai întâi modelul de embedding.

bash
ollama pull nomic-embed-text

Apoi, în Admin → Settings → Documents, setează modelul de embedding la nomic-embed-text. Ajustează dimensiunea fragmentului (implicit 1500) și suprapunerea (implicit 100) după preferințe. Capcana clasică: fragmentele prea mari depășesc fereastra de context a modelelor mici. Dacă rulezi llama3.2:3b cu un context de 4K, fragmentele de 1500 de tokeni nu lasă aproape deloc loc pentru întrebarea propriu-zisă; coboară la 800 cu o suprapunere de 80.

Pentru a utiliza o bază de cunoștințe în chat, tastează # și selectează colecția. Sau atașeaz-o permanent unui Model Personalizat în Workspace → Models. Căutarea web funcționează similar; activează un furnizor (SearXNG, Brave sau Tavily) în Admin → Settings → Web Search, iar modelul poate prelua rezultate live.

Pentru o comparație RAG mai aprofundată, vezi roundup-ul nostru de unelte RAG. Și dacă ChromaDB nu face față la scară mare, analiza noastră a opțiunilor de baze de date vectoriale acoperă Qdrant, pgvector și compromisurile implicate.

I/O Vocal: Vorbește cu AI-ul tău Local

Open WebUI suportă atât speech-to-text (STT), cât și text-to-speech (TTS). Pentru STT, faster-whisper rulează local fără cheie API. Pentru TTS, poți conecta API-ul TTS al OpenAI sau rula un motor local precum coqui-tts. Odată activat, apare o pictogramă de microfon în caseta de chat, iar AI-ul tău local începe să îți răspundă vocal.

Mergi la Admin → Settings → Audio. Două motoare, două meniuri dropdown.

Calea STT, alege Whisper (Local), selectează o dimensiune a modelului: tiny, base, small, medium sau large. Modelul se descarcă automat la prima utilizare. base este punctul ideal pentru majoritatea laptopurilor; medium dacă ai rezervă de GPU.

Calea TTS, cea mai simplă este OpenAI TTS: lipește o cheie API, alege tts-1 și o voce (alloy, nova etc.). Calea complet locală: motorul coqui-tts, cu o imagine Docker separată. Majoritatea oamenilor ajung la Whisper local + OpenAI TTS ca un compromis pragmatic; audio-ul tău nu părăsește niciodată cutia pentru input, iar apelul API este doar un șir scurt de text pentru output.

Poți integra alegerea în container prin variabile de mediu:

bash
docker run -d \
  -e WHISPER_MODEL=base \
  -e AUDIO_STT_ENGINE=whisper \
  -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

Referința audio completă se află în documentația GitHub Open WebUI.

Pipelines & Functions: Funcția Killer a Open WebUI

Pipelines și Functions sunt modul în care extinzi Open WebUI fără a-i face fork. Pipelines sunt servicii Python externe care acționează ca filtre, routere de modele sau handler-e personalizate complete. Functions sunt cod Python inline (Filter, Action sau Pipe) care trăiesc în interiorul Open WebUI însuși. Împreună, acestea sunt motivul pentru care Open WebUI bate LM Studio pentru utilizatorii serioși.

Trei tipuri de Function, câte o propoziție fiecare:

  • Filter, pre/post-procesează mesajele (redactare PII, filtru de vulgarități, rescriere prompt).
  • Action, un buton în interfața de chat care declanșează Python (re-sumarizează, salvează în Notion, rulează o interogare SQL).
  • Pipe, un handler complet de model personalizat (routează către un API remote, înlănțuie mai multe modele, construiește un agent).

Iată un Filter minimal care elimină adresele de email din prompt-urile utilizatorilor înainte ca acestea să ajungă la model:

python
from pydantic import BaseModel
import re

class Filter:
    class Valves(BaseModel):
        priority: int = 0

    def __init__(self):
        self.valves = self.Valves()

    def inlet(self, body: dict, __user__: dict = None) -> dict:
        for message in body.get("messages", []):
            if message.get("role") == "user":
                message["content"] = re.sub(
                    r"[\w\.-]+@[\w\.-]+",
                    "[REDACTED_EMAIL]",
                    message["content"],
                )
        return body

Adaugă-l în Admin → Settings → Functions → New, salvează și activează-l pentru orice model. Gata.

Pentru Pipelines externe, lansează containerul dedicat alături de Open WebUI:

yaml
  pipelines:
    image: ghcr.io/open-webui/pipelines:main
    container_name: pipelines
    ports:
      - "9099:9099"
    volumes:
      - pipelines:/app/pipelines
    restart: always

Apoi, în Admin → Settings → Connections, adaugă http://pipelines:9099 ca API compatibil OpenAI. Încarcă fișiere .py în Admin → Settings → Pipelines. Repo-ul oficial Pipelines are zeci de exemple, routere de traducere, logging Langfuse, function calling, toate cele necesare.

MCP: Conectarea Open WebUI la Unelte Externe

Open WebUI 0.6+ suportă Model Context Protocol (MCP), ceea ce înseamnă că modelul tău local poate apela unelte externe, căutare de fișiere, GitHub, Slack, serverele tale personalizate, prin același protocol folosit de Claude Desktop. Este cea mai curată modalitate de a oferi unui model local utilizarea reală a uneltelor fără a scrie un Pipeline.

Adaugă un server MCP în Admin → Settings → Tools: lipește URL-ul serverului, dă-i un nume și activează-l per model. Modelul decide când să îl apeleze în timpul chat-ului. Acoperim protocolul cap-coadă în ghidul nostru Model Context Protocol (MCP), aceleași modele, doar din partea Open WebUI în loc de Claude Desktop.

De ce contează acest lucru: la mijlocul anului 2026, aproape niciun tutorial Open WebUI nu menționează MCP. Dacă ai standardizat deja servere MCP pentru configurarea ta Claude sau Cursor, poți direcționa Open WebUI către exact aceleași servere. Un protocol, fiecare client.

De ce nu vede Open WebUI modelele mele Ollama? (Depanare)

Dacă Open WebUI se încarcă, dar dropdown-ul de modele este gol, containerul nu poate ajunge la Ollama. În nouă cazuri din zece, remedierea este --add-host=host.docker.internal:host-gateway plus OLLAMA_BASE_URL=http://host.docker.internal:11434. Pe Linux, fără flag-ul host-gateway, rețeaua bridge a Docker nu poate vedea portul 11434 al gazdei. Prima dată când am implementat acest lucru pe un server Linux al unui client, am întâlnit exact această problemă și am pierdut o oră.

Trei cauze rădăcină, în ordinea frecvenței:

  1. Lipsește flag-ul --add-host (cel mai comun pe Linux). Docker Desktop pe macOS setează automat host.docker.internal; Linux are nevoie de flag-ul explicit.

  2. Ollama legat doar la 127.0.0.1. Din perspectiva containerului, acesta nu este accesibil. Remediere:

    bash
    OLLAMA_HOST=0.0.0.0:11434 ollama serve

    Sau setează Environment="OLLAMA_HOST=0.0.0.0:11434" în unitatea systemd pe Linux.

  3. Firewall / antivirus blochează 11434. Mai puțin comun, dar verifică ufw, Windows Defender sau protecția endpoint-urilor corporative.

Diagnostic, rulează aceasta din interiorul containerului Open WebUI:

bash
docker exec open-webui curl http://host.docker.internal:11434/api/tags

Dacă returnează JSON cu lista ta de modele, rețeaua este în regulă și problema este în setările Open WebUI (verifică Admin → Connections → Ollama URL). Dacă se blochează sau refuză, ai o problemă pe partea gazdei, începe cu cauza #2.

Open WebUI vs LM Studio vs Jan vs AnythingLLM

Open WebUI câștigă la multi-utilizator, profunzimea RAG și Pipelines/Functions. LM Studio câștigă la performanța GPU out-of-the-box și o interfață polishată pentru un singur utilizator. Jan câștigă la fricțiunea minimă la prima rulare. AnythingLLM câștigă la ergonomia ingestiei de documente. Dacă dorești un înlocuitor ChatGPT auto-gazduit pentru o echipă, Open WebUI este răspunsul.

CaracteristicăOpen WebUILM StudioJanAnythingLLM
Multi-utilizatorDaNuNuDa
RAG NatívDa (profund)Doar pluginBasicDa (cea mai bună UX)
Plugin-uri / ExtensiiPipelines + FunctionsLimitatExtensiiPlugin-uri
Suport GPUPrin backend OllamaIntegrat (cel mai bun)IntegratPrin backend
Cel mai bun pentruEchipe auto-gazduiteUtilizatori desktop solitari power-userAI local pentru începătoriFluxuri de lucru heavy pe documente

Verdict: dacă ești un dezvoltator solo care vrea doar să ruleze un model pe GPU-ul de gaming și să converseze, LM Studio este mai rapid de configurat. Dacă construiești un ChatGPT privat pentru o echipă, faci RAG serios sau integrezi logică Python personalizată, Open WebUI este singura alegere reală. Postarea noastră mai largă despre cele mai bune unelte locale pentru LLM compară stratul de runtime (vLLM, llama.cpp, Ollama) de sub aceste UI-uri.

Cum expun Open WebUI securizat peste HTTPS?

Două căi curate: un Caddyfile de 5 linii în fața Open WebUI pentru un certificat Let's Encrypt real (semi-producție) sau un Cloudflare Tunnel pentru utilizare share-with-my-team cu zero porturi deschise. Ambele mențin Open WebUI pe localhost:3000 în timp ce expun o URL publică curată cu HTTPS. Alege în funcție de dacă controlezi DNS-ul pentru un domeniu.

Calea Caddy, indică domeniul tău către boxă, apoi:

caddyfile
ai.example.com {
    reverse_proxy localhost:3000
}

Aceasta este întreaga configurație. Caddy preia automat un certificat Let's Encrypt la prima cerere. Rulează caddy run --config Caddyfile (sau folosește unitatea systemd). Referință completă: documentația Caddy.

Calea Cloudflare Tunnel, cloudflared tunnel create open-webui, routează un hostname în zona ta Cloudflare, apoi cloudflared tunnel run. Zero porturi deschise, Cloudflare gestionează TLS. Excelent pentru „vreau ca echipa mea să acceseze asta fără a găuri firewall-ul meu”.

O regulă dură: niciodată nu expune portul 3000 brut către internetul public. Înscrierea în Open WebUI este deschisă implicit; oricine lovește URL-ul tău poate crea un cont. WEBUI_AUTH=False este ok pentru LAN, niciodată pentru public. Pune întotdeauna în fața sa un reverse proxy plus whitelist-ing autentificat la înscriere (Admin → Settings → General → „Enable Signup” off după ce ți-ai creat conturile).

Cum abordează Techsy implementările locale de LLM

Am livrat configurări Open WebUI + Ollama pentru clienți din domeniile legal, sănătate și echipe de tooling intern care nu pot (sau nu vor) să trimită date către OpenAI. Modelele se repetă suficient de mult încât am încetat să le scriem de la zero, dar fiecare implementare are aceleași trei priorități.

Ce facem efectiv:

  • Dimensionăm corect modelul la hardware și buget. Intervalul 3B–8B lovește punctul ideal mai des decât nu. Mai mare nu este întotdeauna mai bine când latența și costul lunar contează.
  • Întărim implementarea. Caddy în față, înscrierea dezactivată, /app/backend/data pe un volum denumit cu backup, snapshot-uri săptămânale și un plan real de disaster-recovery.
  • Conectăm Pipelines pentru nevoile specifice organizației. Filtre de redactare PII, pipeline-uri RAG personalizate îndreptate către SharePoint sau Confluence intern, unelte de function-calling pentru acces sigur la shell, lucrurile care fac o interfață de chat realmente utilă într-o companie.

Dacă preferi să sari peste configurare și să primești o stivă AI privată gata de rulare, programează o consultație gratuită. Suntem fericiți să evaluăm proiectul.

Concluzie

Trei recapitulări rapide:

  • Calea cu un singur container, cel mai rapid mod spre primul chat, zece minute oneste pe o mașină „încălzită”.
  • Docker Compose, ceea ce vrei de fapt pentru orice trebuie să supraviețuiască unui reboot.
  • Pipelines + RAG + MCP, șanțul defensiv care face ca Open WebUI să merite ales în detrimentul LM Studio sau Jan.

Conversezi cu propriul tău AI în zece minute. De acolo, totul este incremental: adaugă RAG când ai documente, adaugă Caddy când vrei să îl ai pe telefon, adaugă Pipelines când vrei să facă treabă reală. Dacă vrei să aprofundezi selecția modelelor locale, ghidul nostru rularea LLM-urilor local acoperă partea hardware în detaliu.

Întrebări Frecvente (FAQ)

Cum instalez Open WebUI cu Ollama?

Trei pași: instalează Docker Desktop, instalează Ollama (curl -fsSL https://ollama.com/install.sh | sh pe macOS/Linux), apoi rulează containerul canonic Open WebUI cu docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main. Deschide http://localhost:3000 și creează-ți contul de admin.

Este Open WebUI gratuit?

Da, Open WebUI are licență MIT și este complet open source. Auto-găzduirea este gratuită; plătești doar pentru hardware-ul pe care rulează (laptopul tău, un server homelab sau un VM cloud). Piesele opționale plătite includ API-ul TTS al OpenAI pentru voce sau modelele comerciale accesate prin connector-ul compatibil OpenAI al Open WebUI. Tot ce este esențial este fără cost.

Poate Open WebUI rula fără Ollama?

Da, Open WebUI comunică cu orice API compatibil OpenAI. Îl poți direcționa direct către OpenAI, Anthropic prin intermediul unui proxy LiteLLM, servere vLLM, serverul HTTP al llama.cpp sau provideri găzduiți precum Groq și Together. Dar „Open WebUI + Ollama” este combinația canonică pentru AI local deoarece Ollama face gestionarea modelelor extrem de simplă.

De ce nu se poate conecta Open WebUI la Ollama?

Cea mai comună cauză: lipsește flag-ul --add-host=host.docker.internal:host-gateway și OLLAMA_BASE_URL nu este setat în setările Open WebUI. A doua cea mai comună: Ollama legat doar la 127.0.0.1, inaccesibil din interiorul containerului; remediere cu OLLAMA_HOST=0.0.0.0:11434 ollama serve. Rulează docker exec open-webui curl http://host.docker.internal:11434/api/tags pentru a diagnostica rapid.

Cum adaug modele în Open WebUI?

Calea cea mai ușoară: de pe gazdă, rulează ollama pull llama3.2:3b (sau orice model din ollama.com/library). Modelul apare automat în dropdown-ul Open WebUI, fără restart necesar. Alternativ, în Open WebUI mergi la Admin → Settings → Connections → Ollama și folosești butonul de pull din UI. Oricum, modelele trăiesc pe partea Ollama.

Care este diferența dintre Open WebUI și LM Studio?

LM Studio este o aplicație desktop pentru un singur utilizator, concentrată pe gestionarea modelelor plus chat, cu setări GPU puternice implicite, UI slick, fără multi-utilizator. Open WebUI este un server auto-gazduit care suportă mai mulți utilizatori, RAG nativ, I/O vocal, Pipelines/Functions și MCP. Publicuri diferite: LM Studio pentru utilizatori power-user solitari pe desktop, Open WebUI pentru echipe sau oricine dorește un ChatGPT privat extensibil.

Pot folosi Open WebUI pe telefon?

Da, Open WebUI este complet responsiv, deci orice browser mobil funcționează. Combina-l cu HTTPS (Caddy cu un certificat Let's Encrypt sau un Cloudflare Tunnel) și devine o aplicație de chat mobilă complet funcțională. Adaugă-l pe ecranul principal pe iOS sau Android pentru o experiență PWA aproape nativă. Nu îl expune public fără autentificare, totuși.

Cum actualizez Open WebUI?

Descarcă ultima imagine și repornește: docker pull ghcr.io/open-webui/open-webui:main && docker stop open-webui && docker rm open-webui apoi re-rulează comanda ta originală docker run. Volumele denumite păstrează toate datele, istoricul de chat, utilizatorii, colecțiile RAG și setările. Cu Docker Compose: docker compose pull && docker compose up -d. Actualizările apar aproximativ săptămânal.

Suportă Open WebUI chat-ul vocal?

Da, atât speech-to-text (prin faster-whisper local) cât și text-to-speech (prin API-ul TTS al OpenAI sau coqui-tts local). Configurează ambele în Admin → Settings → Audio. Odată activate, apare o pictogramă de microfon în caseta de chat. Configurarea pragmatică este Whisper local plus OpenAI TTS, input complet offline, output rapid și curat. Vezi secțiunea I/O Vocal de mai sus pentru configurarea variabilelor de mediu.

Cum îmi adaug PDF-urile în Open WebUI?

Dă click pe profilul tău → Workspace → Knowledge → New collection, apoi încarcă PDF-uri, documente Word, Markdown sau fișiere text. Open WebUI fragmentează documentele, le încorporează cu nomic-embed-text (descarcă-l mai întâi prin ollama pull nomic-embed-text) și le stochează în ChromaDB. Referențiază orice colecție în chat cu #nume-colectie sau atașeaz-o permanent unui Model Personalizat.

Etichete

open-webuiollamallm-localdockerai-gazduit-localragunelte-llm

Distribuie acest articol

Articole similare

Mai multe din ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 a sosit: inteligență aproape de Fable 5 la jumătate de preț

Anthropic a lansat Claude Opus 5 pe 24 iulie 2026. Mai mult decât dublează scorul Opus 4.8 pe Frontier-Bench și menține prețul Opus, dar pierde câteva teste în fața Fable 5 și Mythos 5. Iată tabelul de benchmark-uri, prețul și verdictul: schimbi / aștepți / rămâi.

10 min read min citire
Citește
ai-machine-learning
Jul 20, 2026

Cele mai bune 8 API-uri de web scraping AI în 2026 (testate pe stack-ul nostru de agenți)

Am testat 8 API-uri de web scraping AI cu prețuri reale din 2026, obținute prin stack-ul nostru de agenți. Firecrawl, Bright Data, ScrapingBee și alte 5, clasificate pentru output gata pentru LLM, anti-bot și suport MCP.

9 min read min citire
Citește
ai-machine-learning
Jul 20, 2026

Ingineria prompturilor pentru programare: 7 modele pe care le folosim zilnic în Claude Code și Cursor (2026)

Majoritatea articolelor despre „prompturi AI pentru codare” îți oferă 50 de șabloane de copiat. Acest articol te învață cele 7 modele pe care le folosim în fiecare zi pentru a rula o pipeline Claude Code cu 16 agenți, cu exemple reale de „înainte și după” pentru fiecare, plus unde se aplică fiecare model în Claude Code, Cursor și Copilot în 2026.

11 min read min citire
Citește
Vezi toate articolele
Începe Proiectul Tău

Gata să construim ceva extraordinară?

Hai să-ți transformăm viziunea în realitate. Echipa noastră e pregătită să te ajute să creezi software care face diferența.

Programează un apel de 30 minVezi proiectele noastre

Cele mai populare din bibliotecă

Skill-uri Claude

Vezi toate
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatizări AI

Vezi toate
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Cele mai populare din bibliotecă

Skill-uri Claude

Vezi toate
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatizări AI

Vezi toate
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Servicii

  • Soluții Enterprise
  • Aplicații Mobile
  • Aplicații Web

Soluții

  • Sisteme CRM
  • Integrare AI
  • Soluții ERP
  • Agenți Vocali
  • Automatizarea Proceselor
  • Cibersécurité

Bibliotecă

  • Blog
  • Portofoliu

Comunitate

  • Automatizări AI
  • Skill-uri Claude

Tool-uri

  • Calculator cost aplicație mobilă
  • Calculator cost API OpenAI / LLM
  • Calculator cost MVP
  • Calculator cost agent AI vocal

Companie

  • Despre
  • Parteneri
  • Contact

Mențiuni legale

  • Politica de confidențialitate
  • Termeni și condiții
  • Politica cookie

Servicii

  • Soluții Enterprise
  • Aplicații Mobile
  • Aplicații Web

Soluții

  • Sisteme CRM
  • Integrare AI
  • Soluții ERP
  • Agenți Vocali
  • Automatizarea Proceselor
  • Cibersécurité

Bibliotecă

  • Blog
  • Portofoliu

Comunitate

  • Automatizări AI
  • Skill-uri Claude

Tool-uri

  • Calculator cost aplicație mobilă
  • Calculator cost API OpenAI / LLM
  • Calculator cost MVP
  • Calculator cost agent AI vocal

Companie

  • Despre
  • Parteneri
  • Contact
Mențiuni legalePolitica de confidențialitateTermeni și condițiiPolitica cookie
TECHSY
© 2026 Techsy. Toate drepturile rezervate.