
Puoi eseguire un LLM in locale sulla tua macchina adesso stesso -- nessuna chiave API, nessuna bolletta mensile, nessun dato che lascia il tuo hardware. L'ecosistema degli LLM locali è esploso: il 55% dell'inferenza AI aziendale avviene ora on-premise, rispetto al 12% del 2023. Con strumenti come Ollama, passare da zero a un modello funzionante richiede meno di 5 minuti a costo API zero.
Questa guida consolida quello che normalmente dovresti cercare in cinque articoli separati: requisiti hardware, selezione dei modelli, confronto degli strumenti, configurazione passo passo e deployment in produzione -- tutto in un unico posto.
In breve: Riepilogo rapido degli LLM locali
Prima di andare in profondità, ecco il panorama in 60 secondi:
| Aspetto | Risposta rapida |
|---|---|
| Modo più semplice per iniziare | ollama run llama3.3 (un solo comando) |
| Miglior strumento per sviluppatori | Ollama (CLI, API compatibile OpenAI) |
| Miglior strumento per non-sviluppatori | LM Studio (GUI, download con un clic) |
| GPU minima per modelli 7B | 8 GB VRAM (o 8 GB di memoria unificata su Mac) |
| Miglior GPU economica | RTX 4060 Ti 16 GB (~400 €) |
| Miglior GPU in assoluto | RTX 4090 24 GB (re del rapporto qualità-prezzo) |
| Miglior modello generale | Llama 3.3 8B (quantizzazione Q4_K_M) |
| Miglior modello per il codice | Qwen 3 7B |
| Costo vs API cloud | ~0 €/mese locale vs ~20-90 €/mese API |
| Garanzia di privacy | 100% -- i dati non lasciano mai la tua macchina |
Ora analizziamo ognuno di questi punti per aiutarti a fare le scelte giuste per la tua configurazione.
Perché eseguire un LLM in locale?
Ci sono quattro veri motivi per eseguire LLM sul proprio hardware -- e un avvertimento onesto su quando non farlo.
Privacy e sovranità dei dati
Quando esegui in locale, i tuoi prompt, i tuoi dati e i tuoi output non toccano mai un server di terze parti. Punto. Non è un'affermazione di marketing -- è architettura. Non c'è nessuna chiamata di rete da intercettare, nessun termine di servizio che conceda a un fornitore diritti di addestramento sui tuoi dati.
Questo è enormemente importante nei settori regolamentati. Le organizzazioni sanitarie necessitano della conformità HIPAA. Le aziende finanziarie gestiscono dati riservati dei clienti. Le agenzie governative trattano informazioni classificate. Il 55% dell'inferenza AI aziendale avviene ora on-premise proprio perché il peso della conformità dell'AI cloud è enorme.
Eliminazione dei costi
I prezzi delle API cloud si accumulano rapidamente. Ecco cosa costa davvero lo stesso carico di lavoro:
| Fornitore | Costo per 1M di token | Privacy | Latenza (utente singolo) |
|---|---|---|---|
| OpenAI GPT-4o | ~5-14 € | Dati inviati a OpenAI | ~1-2s |
| Anthropic Claude 3.5 | ~3-14 € | Dati inviati ad Anthropic | ~1-2s |
| Llama 3.3 8B locale | 0 € (solo hardware) | 100% privato | ~30-50ms |
| Qwen 3 7B locale | 0 € (solo hardware) | 100% privato | ~30-50ms |
Un investimento GPU una tantum di ~400 € sostituisce 20-90 €/mese in costi API. Se sei un utente moderato, raggiungi il break-even in 4-6 mesi. Dopodiché, ogni token è gratuito.
Velocità per gli utenti singoli
Ecco qualcosa che sorprende le persone: l'inferenza locale è spesso più veloce delle API cloud per un singolo utente. Elimini completamente il round-trip di rete. Una configurazione locale ben configurata offre una latenza del primo token inferiore a 40 ms rispetto ai 1-2 secondi attraverso un'API cloud. Nessun limite di velocità, nessuna interruzione, nessuna attesa in coda durante le ore di punta.
Controllo e personalizzazione
Ottimizza i modelli sui tuoi dati. Crea prompt di sistema personalizzati senza restrizioni della piattaforma. Lavora completamente offline -- in aereo, sul campo, ovunque. Nessun vendor lock-in significa che cambi modelli o strumenti quando arriva qualcosa di meglio.
L'avvertimento onesto
Le API cloud vincono ancora in tre scenari: hai bisogno di ragionamento di classe GPT-4 (i modelli locali si avvicinano ma non ci sono ancora), hai bisogno di un throughput massiccio multi-utente senza gestire GPU, o semplicemente non vuoi occuparti di hardware. Per tutto il resto, vince il locale.
Verdetto: Se elabori dati sensibili, vuoi costi prevedibili o detesti i limiti di velocità delle API, eseguire in locale è una scelta ovvia.
Di quale hardware hai bisogno per eseguire LLM in locale?
La VRAM è il collo di bottiglia. Fine. Un modello che si adatta completamente nella memoria GPU funziona circa 10 volte più velocemente di uno che trabocca nella RAM di sistema. La regola empirica: considera ~0,5-1 GB di VRAM per miliardo di parametri con quantizzazione Q4.
Raccomandazioni GPU per PC
| Budget | GPU | VRAM | Dimensione massima modello | TPS appross | Ideale per |
|---|---|---|---|---|---|
| 0 € (esistente) | Solo CPU | N/A | 7B (molto lento) | 2-5 | Solo test |
| 180-270 € | RTX 3060 12 GB | 12 GB | 7-13B | 15-25 | Hobbista |
| 315-450 € | RTX 4060 Ti 16 GB | 16 GB | 13-34B (quantizzato) | 20-35 | Punto dolce |
| 450-720 € | RX 7900 XTX 24 GB | 24 GB | 34B / 70B Q4 | 25-40 | Scelta AMD conveniente |
| 900-1.350 € | RTX 4090 24 GB | 24 GB | 34B / 70B Q4 | 40-60 | Re del rapporto qualità-prezzo |
| 1.800 €+ | RTX 5090 32 GB | 32 GB | 70B Q4 comodo | 50-80 | Massimo consumer |
Dati sulle prestazioni tratti dai benchmark GPU di Hardware Corner usando llama-bench di llama.cpp standardizzato su Ubuntu 24.04 con CUDA 12.8.
Raccomandazioni per Apple Silicon
La memoria unificata di Apple Silicon è un vero vantaggio qui. GPU e CPU condividono lo stesso pool di RAM, quindi un M4 Max con 128 GB di memoria unificata può eseguire modelli che richiederebbero una GPU discreta da 2.000 €+ su un PC.
| Chip | Memoria unificata max | Dimensione massima modello | TPS appross | Fascia di prezzo |
|---|---|---|---|---|
| M1/M2 | 16-24 GB | 7-13B | 10-20 | 720-1.080 € (usato) |
| M3 Pro | 18-36 GB | 13-34B | 15-30 | 1.440-1.980 € |
| M4 Pro | 24-48 GB | 34B / 70B Q4 | 25-45 | 1.620-2.250 € |
| M4 Max | 64-128 GB | 70B+ / 120B Q4 | 35-55 | 2.700-4.500 € |
| M4 Ultra | 192-256 GB | 120B+ FP16 | 40-65 | 4.500 €+ |
Una nota pratica: i modelli occupano 4-40 GB su disco. Mantieni almeno 100 GB liberi su un SSD (NVMe preferibilmente) se pensi di sperimentare con più modelli.
Verdetto: Inizia con quello che hai -- anche una CPU può eseguire un modello 7B per i test. Per un uso quotidiano serio, la RTX 4060 Ti 16 GB (~400 €) o un Mac M4 Pro sono i punti dolci.
Quali modelli dovresti eseguire in locale?
Non tutti i modelli sono uguali, e "il modello migliore" dipende interamente da cosa ci fai. Ecco una tabella decisionale che taglia il rumore:
| Caso d'uso | Miglior modello | Parametri | VRAM min | Perché questo modello |
|---|---|---|---|---|
| Chat generale | Llama 3.3 8B | 8B | 6 GB | Miglior tuttocampista, modello open source di punta di Meta |
| Assistente di codice | Qwen 3 7B | 7B | 5 GB | Migliori benchmark di codice, forte nel multilingue |
| Multilingue | Qwen 3 7B | 7B | 5 GB | 29 lingue, migliori prestazioni non-inglese |
| Hardware limitato | Phi-4-mini | 3,8B | 3 GB | Il più piccolo di Microsoft, sorprendentemente capace |
| Qualità massima | Llama 3.3 70B (Q4) | 70B | 24 GB | Il più vicino alla classe GPT-4 in locale |
| Contesto lungo | Mistral Small 3 | 24B | 16 GB | Finestra di contesto 128K |
| Ragionamento | DeepSeek-R1 7B | 7B | 5 GB | Ragionamento chain-of-thought |
Tutti questi sono disponibili in formato GGUF -- lo standard universale per i file LLM locali. Li troverai su Hugging Face, il principale hub per scaricare modelli open-weight. Cerca qualsiasi nome di modello più "GGUF" per trovare versioni quantizzate pronte per l'uso locale.
Una domanda comune: "Posso eseguire ChatGPT in locale?" No -- ChatGPT è il prodotto proprietario di OpenAI. Ma Llama 3.3 e Qwen 3 offrono qualità comparabile per la maggior parte dei compiti quotidiani e girano completamente sul tuo hardware.
Verdetto: Inizia con Llama 3.3 8B. Copre bene l'80% dei casi d'uso. Passa a Qwen 3 per il codice o a Llama 3.3 70B quando hai bisogno di più potenza.
Cos'è la quantizzazione (e perché è importante)?
La quantizzazione è il concetto più importante per eseguire LLM in locale. Riduce la precisione dei pesi del modello -- per esempio da virgola mobile a 16 bit a interi a 4 bit -- così i modelli più grandi si adattano in meno VRAM.
Pensala come la qualità audio: un file FLAC senza perdite è enorme ma perfetto. Un MP3 a 320 kbps è una frazione delle dimensioni e praticamente indistinguibile per la maggior parte degli ascoltatori. La quantizzazione Q4_K_M è il tuo MP3 a 320 kbps -- 75% meno VRAM con meno del 3% di perdita di qualità su benchmark standard.
GGUF (General GGML Universal Format) è il formato di file che rende tutto questo possibile. Ha sostituito il vecchio formato GGML ed è ora lo standard universale utilizzato da Ollama, LM Studio e llama.cpp. I file GGUF sono autonomi, indipendenti dall'architettura e mappabili in memoria -- il che significa che gli strumenti possono caricarli in modo efficiente senza overhead di parsing. La specifica completa è aperta e ben documentata.
| Livello di quantizzazione | VRAM (modello 8B) | VRAM (modello 70B) | Qualità vs FP16 | Ideale per |
|---|---|---|---|---|
Q4_K_M | ~5 GB | ~24 GB | 97-98% | Uso quotidiano (consigliato) |
Q5_K_M | ~6 GB | ~30 GB | 98-99% | Attività sensibili alla qualità |
Q8_0 | ~9 GB | ~45 GB | 99%+ | Qualità massima, VRAM sufficiente |
FP16 | ~16 GB | ~140 GB | 100% (riferimento) | Ricerca, fine-tuning |
Quando scarichi un modello da Ollama, ottieni Q4_K_M per impostazione predefinita -- ed è la scelta giusta per la maggior parte delle persone. Gli utenti avanzati possono specificare la quantizzazione esplicitamente: ollama pull llama3.3:70b-q4_K_M.
Verdetto: Usa Q4_K_M per tutto, a meno che tu non abbia VRAM in abbondanza. La differenza di qualità è impercettibile per il 95% dei compiti.
Quale strumento dovresti usare per eseguire LLM in locale?
Il panorama degli strumenti è maturato rapidamente. Ecco i sei strumenti che contano, confrontati fianco a fianco:
| Strumento | Tipo | Piattaforme | Server API | Supporto GPU | Ideale per |
|---|---|---|---|---|---|
| Ollama | CLI + Server | Mac, Linux, Windows | Compatibile OpenAI | CUDA, Metal, ROCm | Sviluppatori (consigliato) |
| LM Studio | App GUI | Mac, Linux, Windows | Compatibile OpenAI | CUDA, Metal | Utenti non-CLI, esplorazione modelli |
| llama.cpp | Motore C++ | Ovunque | HTTP base | CUDA, Metal, ROCm, Vulkan | Massima portabilità, dispositivi edge |
| vLLM | Server Python | Linux (GPU) | Compatibile OpenAI | CUDA | Serving in produzione, multi-utente |
| Docker Model Runner | Plugin Docker | Mac, Linux, Windows | API Docker | CUDA, Metal | Workflow Docker-nativi |
| Jan AI | App GUI | Mac, Linux, Windows | Compatibile OpenAI | CUDA, Metal | Chat desktop orientata alla privacy |
Ollama è il punto di partenza. Avvolge llama.cpp con un server Go, aggiungendo pull dei modelli con un comando, offloading automatico su GPU e un'API compatibile OpenAI. È diventato lo standard de facto per lo sviluppo LLM locale, con oltre 250.000 stelle su GitHub.
LM Studio è lo "Spotify degli LLM" -- sfoglia e scarica modelli tramite un'interfaccia grafica pulita. Ottimo per esplorare e testare prima di impegnarsi in un workflow.
llama.cpp è il motore di inferenza C/C++ grezzo sotto Ollama e LM Studio. Usalo direttamente quando hai bisogno di controllo massimo, build personalizzate o deployment su dispositivi edge.
vLLM è la scelta per la produzione. La sua gestione della memoria PagedAttention offre 19 volte il throughput di Ollama su larga scala -- 793 TPS contro 41 TPS nei benchmark. Se stai servendo più utenti, questo è quello che vuoi.
Docker Model Runner è l'integrazione LLM nativa di Docker, ora in GA. Esegui LLM come artefatti OCI. Se il tuo team vive già in Docker, questo elimina un altro strumento dallo stack.
Jan AI è un'app desktop open source (Apache 2.0) con un design orientato alla privacy e un sistema di estensioni. Un'alternativa solida a LM Studio se vuoi zero telemetria.
Quando usare cosa
| Se hai bisogno di... | Usa questo | Perché |
|---|---|---|
| Avvio più rapido (sviluppatore) | Ollama | Un comando, API OpenAI, fatto |
| Esplorazione con GUI | LM Studio | Sfoglia modelli visivamente, avvio con un clic |
| Serving in produzione (multi-utente) | vLLM | PagedAttention, 19x il throughput |
| Deployment Edge / IoT | llama.cpp | Footprint minimo, funziona ovunque |
| Workflow Docker-nativo | Docker Model Runner | Nessun nuovo strumento, artefatti OCI |
| Chat desktop (privacy) | Jan AI | Interfaccia pulita, nessuna telemetria |
| Prestazioni massime su Mac | MLX (vedi sezione Apple sotto) | 20-30% più veloce di llama.cpp su Apple Silicon |
Verdetto: Inizia con Ollama. Davvero, inizia semplicemente da lì. Copre il 90% dei casi d'uso. Passa a vLLM per la produzione o LM Studio se preferisci un'interfaccia grafica.
Come configuri il tuo primo LLM locale?
Tre passi. Cinque minuti. Andiamo.
Passo 1: Installare Ollama
# macOS / Linux (un solo comando):
curl -fsSL https://ollama.com/install.sh | sh
# Windows: scarica l'installer da https://ollama.com/downloadPasso 2: Scaricare ed eseguire il primo modello
# Scaricare Llama 3.3 (~4,7 GB) e iniziare la chat
ollama pull llama3.3
ollama run llama3.3Ecco tutto. Stai eseguendo un LLM all'avanguardia sul tuo hardware. Scrivi una domanda e riceverai una risposta in millisecondi.
Passo 3: Usare l'API (sostituto drop-in di OpenAI)
Questa è la parte che rende gli LLM locali genuinamente pratici. Ollama espone un'API compatibile OpenAI su localhost:11434. Qualsiasi applicazione che funziona con OpenAI può puntare invece al tuo endpoint locale -- zero modifiche al codice.
# Testare l'API con curl
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "llama3.3",
"messages": [{"role": "user", "content": "Spiega il quantum computing in 3 frasi"}]
}'# Python: Sostituto drop-in per OpenAI SDK
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
response = client.chat.completions.create(
model="llama3.3",
messages=[{"role": "user", "content": "Scrivi una funzione Python per ordinare una lista"}]
)
print(response.choices[0].message.content)Nota che il codice Python usa l'SDK OpenAI standard -- cambi solo base_url. Ogni libreria, framework e strumento che supporta l'API OpenAI funziona con Ollama senza modifiche.
Alternativa: Docker Model Runner
Se il tuo workflow è Docker-nativo, Docker Model Runner ti permette di saltare completamente Ollama:
# Scaricare ed eseguire un modello tramite Docker
docker model pull ai/llama3.3
docker model run ai/llama3.3 "Ciao, come stai?"Docker Model Runner è ora in GA e supporta i backend GPU CUDA, Metal e Vulkan. Esegue i modelli come artefatti OCI e espone un'API compatibile OpenAI -- stessa esperienza sviluppatore, ma nativa nell'ecosistema Docker.
Verdetto: Da zero a un LLM in esecuzione richiede meno di 5 minuti con Ollama. L'API compatibile OpenAI significa che il tuo codice esistente funziona senza modifiche.
Come ottieni le migliori prestazioni su Mac?
Gli utenti Mac hanno un'arma segreta che la maggior parte delle guide ignora completamente: MLX.
Tutti gli strumenti di cui abbiamo discusso -- Ollama, LM Studio, llama.cpp -- funzionano su Mac tramite il backend Metal. Sfruttano tutti i core GPU di Apple Silicon e offrono buone prestazioni. Ma MLX, il framework ML nativo di Apple, va oltre.
MLX è costruito appositamente per Apple Silicon. Sfrutta l'architettura della memoria unificata a un livello più basso rispetto a Metal da solo, offrendo un'inferenza 20-30% più veloce rispetto a llama.cpp sullo stesso hardware. Il pacchetto mlx-lm rende facile eseguire qualsiasi modello compatibile:
# Installare MLX-LM
pip install mlx-lm
# Eseguire un modello con MLX (scaricamento automatico da Hugging Face)
mlx_lm.generate --model mlx-community/Llama-3.3-8B-Instruct-4bit \
--prompt "Spiega la differenza tra Ollama e MLX"Quando dovresti usare MLX rispetto a Ollama su Mac?
- Ollama: Configurazione più semplice, gestione dei modelli integrata, API compatibile OpenAI. Usalo per la maggior parte delle cose -- specialmente se vuoi che altre app si connettano al tuo LLM locale.
- MLX: Inferenza grezza più veloce, ottimizzazione Apple nativa. Usalo quando la velocità conta -- copilot di codice, elaborazione batch o qualsiasi workflow dove una generazione più veloce del 20-30% fa risparmiare tempo reale.
Entrambi gli strumenti possono girare contemporaneamente. Molti sviluppatori usano Ollama come driver quotidiano e passano a MLX per attività critiche per le prestazioni.
Apple ha anche presentato il chip M5 al WWDC25 con miglioramenti di velocità 4x rispetto al M4 per i carichi di lavoro ML. Se stai acquistando nuovo hardware specificamente per LLM locali, Apple Silicon rimane una delle migliori proposte di valore -- specialmente ai livelli M4 Max e Ultra dove 64-256 GB di memoria unificata ti permette di eseguire modelli che costerebbero migliaia in GPU discrete.
Verdetto: Gli utenti Mac hanno un'arma segreta in MLX. Per l'uso quotidiano, Ollama su Mac funziona bene. Per la massima velocità, MLX vale la configurazione extra.
Quando dovresti andare oltre Ollama?
Ollama è perfetto per lo sviluppo, il prototipaggio e i carichi di lavoro a utente singolo. Ma ci sono segnali chiari che lo hai superato:
| Segnale | Restare con Ollama | Passare a vLLM |
|---|---|---|
| Utenti | Utente singolo / piccolo team | Multi-utente / orientato al cliente |
| Throughput | <50 req/min | 50+ req/min |
| Esigenze di latenza | Interattivo (ok) | Elaborazione batch (critico) |
| Numero di GPU | 1 GPU | Multi-GPU |
| Tolleranza alla complessità | Bassa | Moderata-Alta |
vLLM è l'aggiornamento per la produzione. Il suo algoritmo PagedAttention gestisce la memoria GPU come pagine di memoria virtuale in un sistema operativo -- allocando e liberando memoria in blocchi anziché riservare chunk contigui. Il risultato: 793 TPS contro 41 TPS di Ollama nei benchmark multi-utente. Non è un miglioramento marginale; è una classe di strumento diversa.
Vale la pena considerare anche il pattern ibrido: usa un LLM locale per attività sensibili o di routine (sintesi, classificazione, revisione del codice) e instrada le query di ragionamento complesse verso un'API cloud. Ottieni i vantaggi di privacy e costo dell'inferenza locale per l'80% del tuo carico di lavoro mantenendo l'accesso alla qualità dei modelli di frontiera quando ne hai bisogno.
Verdetto: La maggior parte degli sviluppatori non ha mai bisogno di lasciare Ollama. Se stai costruendo un prodotto che serve più utenti, vLLM è il passo successivo ovvio.
Cosa puoi costruire davvero con gli LLM locali?
Eseguire un chatbot è il caso d'uso ovvio, ma non quello interessante. Ecco dove gli LLM locali brillano davvero:
Copilot di codice locale. Connetti Qwen 3 tramite Ollama a Continue.dev o Tabby. Il tuo codice non lascia mai la tua macchina -- fondamentale per codebase proprietarie. La configurazione richiede 10 minuti e l'esperienza rivaleggia con i copilot basati su cloud per la maggior parte delle attività. Se stai costruendo un SaaS potenziato dall'AI, un copilot locale accelera lo sviluppo senza esporre la tua codebase.
Sistema RAG privato. Indicizza i tuoi documenti interni e interrogali poi con un LLM locale. Combina LangChain + Ollama + ChromaDB e avrai una knowledge base privata che gestisce dati riservati senza problemi di conformità. Le aziende sanitarie e legali lo stanno già facendo per HIPAA e il privilegio avvocato-cliente.
Assistente offline. Nessuna connessione internet richiesta. Ricercatori sul campo, operazioni militari, luoghi di lavoro remoti -- ovunque la connettività sia inaffidabile, un LLM locale continua a funzionare.
Pipeline di elaborazione dati. Riepiloga, classifica o estrai informazioni da migliaia di documenti a costo marginale zero. Nessun limite di velocità API che strozzola il throughput. Un modello 8B locale su una buona GPU può elaborare centinaia di pagine al minuto.
Strumenti di sviluppo potenziati dall'AI. Bot di revisione del codice, generatori di messaggi di commit, generazione di test -- tutto in esecuzione sulla tua infrastruttura. I team che usano strumenti AI per startup spesso iniziano con API cloud e migrano le attività ad alto volume e bassa complessità a modelli locali man mano che scalano.
Sovranità dei dati aziendale. Il pattern di architettura ibrida: gli LLM locali gestiscono dati sensibili (HIPAA, GDPR, classificati), le API cloud gestiscono richieste non sensibili che richiedono ragionamento di frontiera. Ottieni il meglio di entrambi i mondi.
Consulta il nostro Migliori strumenti per eseguire LLM in locale [prossimamente] per recensioni approfondite di ogni strumento menzionato sopra.
Verdetto: Il caso d'uso killer non è la chat -- è eseguire AI su dati sensibili che non puoi inviare a un'API cloud. Copilot di codice e RAG privato sono dove gli LLM locali brillano davvero.
Come Techsy affronta l'integrazione dell'AI locale
Abbiamo costruito pipeline di AI locale per team che vanno da startup di 3 persone a organizzazioni di ingegneria enterprise. Ecco cosa abbiamo imparato:
- Inizia con Ollama per il prototipaggio -- valida il caso d'uso prima di investire in infrastruttura
- Progetta l'architettura ibrida presto -- decidi quali attività rimangono locali vs. quali raggiungono un'API cloud
- Usa vLLM quando hai superato Ollama -- specificamente quando servi più di una manciata di utenti concorrenti
- Containerizza tutto -- Docker Model Runner o immagini Docker personalizzate rendono il deployment riproducibile tra gli ambienti
- Pianifica l'hardware GPU in modo ponderato -- una RTX 4090 si ripaga in mesi se sostituisce i costi delle API cloud
Per la maggior parte dei casi d'uso personali e dei piccoli team, la configurazione Ollama in questa guida è genuinamente sufficiente. I nostri servizi hanno senso quando stai scalando l'AI locale in produzione: orchestrazione multi-modello, pipeline di fine-tuning personalizzate o costruzione di prodotti dove l'inferenza LLM è una funzione centrale.
Hai bisogno di aiuto per integrare LLM locali nel tuo prodotto? Ottieni una consulenza gratuita.
Domande frequenti
Come eseguo un LLM in locale?
Installa Ollama, esegui ollama pull llama3.3, poi ollama run llama3.3. Tre comandi e stai eseguendo un LLM all'avanguardia sul tuo hardware. L'intero processo richiede meno di 5 minuti, incluso il download del modello.
Di quale hardware ho bisogno per eseguire un LLM in locale?
Minimo: 8 GB di RAM e qualsiasi CPU moderna -- ma sarà dolorosamente lento. Consigliato: una GPU con 12+ GB di VRAM (RTX 3060 o meglio) o un Mac Apple Silicon con 16+ GB di memoria unificata. La RTX 4060 Ti 16 GB a ~400 € è il punto dolce per la maggior parte delle persone.
Posso eseguire un LLM su un Mac?
Sì, e i Mac sono ottimi per questo. La memoria unificata di Apple Silicon ti dà più VRAM effettiva rispetto alla maggior parte delle GPU discrete allo stesso prezzo. Un M4 Pro con 24 GB gestisce facilmente modelli 7-13B. Per prestazioni ancora migliori, usa MLX -- il framework nativo di Apple che è il 20-30% più veloce di llama.cpp sullo stesso chip.
È gratuito eseguire un LLM in locale?
Il software (Ollama, LM Studio, llama.cpp) e i modelli (Llama, Qwen, Mistral) sono tutti gratuiti e open source. L'unico costo è l'hardware, che probabilmente possiedi già. Anche un laptop base può eseguire modelli più piccoli per i test.
Posso eseguire ChatGPT in locale?
No. ChatGPT è il prodotto proprietario di OpenAI e non è disponibile per il deployment locale. Tuttavia, alternative open-weight come Llama 3.3 e Qwen 3 offrono qualità comparabile per molte attività quotidiane e girano completamente sul tuo hardware.
Cos'è GGUF?
GGUF (General GGML Universal Format) è il formato di file standard per gli LLM locali quantizzati. È autonomo, indipendente dall'architettura e utilizzato da Ollama, LM Studio e llama.cpp. Quando vedi un file modello che termina in .gguf, è pronto per l'inferenza locale.
Cos'è la quantizzazione e perché è importante?
La quantizzazione riduce la precisione del modello (es. da 16 bit a 4 bit) per far sì che modelli più grandi si adattino in meno memoria. La quantizzazione Q4_K_M riduce i requisiti di VRAM di circa il 75% preservando il 97-98% della qualità dell'output. È il motivo per cui puoi eseguire un modello da 70 miliardi di parametri su una singola GPU consumer.
Qual è il miglior modello LLM locale nel 2026?
Llama 3.3 8B è il miglior punto di partenza generico. Qwen 3 7B è in testa per codice e attività multilingue. Phi-4-mini (3,8B) è la scelta per hardware limitato. Llama 3.3 70B offre la cosa più vicina al ragionamento di classe GPT-4 che puoi eseguire in locale.
Quanto è veloce un LLM locale rispetto alle API cloud?
Per un singolo utente, il locale è spesso più veloce -- 30-50 ms di latenza del primo token contro 1-2 secondi tramite un'API cloud. Elimini anche i limiti di velocità e i tempi di attesa in coda. Per scenari multi-utente ad alto throughput, le API cloud o vLLM con un'adeguata infrastruttura GPU supereranno una configurazione Ollama di base.
È sicuro eseguire un LLM in locale per dati sensibili?
Sì -- questa è una delle ragioni principali per eseguire in locale. I dati non lasciano mai la tua macchina, quindi non c'è esposizione a terze parti. Le organizzazioni sanitarie (HIPAA), finanziarie e governative usano LLM locali proprio perché nessun accordo di trattamento dei dati con un fornitore cloud può eguagliare la privacy di non inviare mai i dati.
Qual è la differenza tra Ollama e llama.cpp?
Ollama avvolge llama.cpp con un server Go, aggiungendo gestione dei modelli, offloading automatico su GPU e un'API compatibile OpenAI. llama.cpp è il motore di inferenza C/C++ grezzo sottostante. Usa Ollama per comodità; usa llama.cpp direttamente quando hai bisogno di controllo massimo o deployment edge.
Posso eseguire un modello 70B su hardware consumer?
Sì, con la quantizzazione. Un modello 70B a Q4_K_M ha bisogno di circa 24 GB di VRAM -- raggiungibile con una RTX 4090 o un M4 Max con 48+ GB di memoria unificata. Le prestazioni sono utilizzabili (15-30 token al secondo) ma notevolmente più lente rispetto all'esecuzione di un modello 7B o 13B. Per l'uso quotidiano, la maggior parte delle persone trova che i modelli 7-13B offrano il miglior equilibrio velocità-qualità.
Fonti
- Sito ufficiale di Ollama
- Repository GitHub di Ollama
- Repository GitHub di llama.cpp
- Documentazione di vLLM
- Blog di vLLM -- PagedAttention
- Repository GitHub di Apple MLX
- Repository GitHub di MLX-LM
- Documentazione di Docker Model Runner
- Specifica del formato GGUF
- Documentazione GGUF di Hugging Face
- Benchmark GPU di Hardware Corner per LLM