Vuoi far girare un LLM in locale — senza cloud, senza abbonamento, senza dispersione di dati. La strada nel 2026 è più semplice che mai, ma il numero di decisioni (hardware, modello, quantizzazione, motore) è sconcertante. Questo articolo ti porta in un weekend da «ho un computer» a «il mio endpoint LLM gira» — con ricette concrete dal nostro database per ogni livello di hardware.
Passo 1 (sabato mattina): valutare l'hardware onestamente
Non ti serve hardware nuovo per iniziare — ti serve l'aspettativa giusta su quello che hai già:
- 16 GB di RAM (laptop): Qwen3.8-27B come quant 4-bit (~19 GB sono troppi, prendi il quant Q3 o un 8B–14B). Qualità di chat da desktop, niente miracoli.
- 24 GB di VRAM (RTX 3090/4090): la classe del punto dolce. Qwen3.6 35B-A3B entra come INT4 ed è veloce.
- 32 GB (RTX 5090): Qwen3.6 35B-A3B NVFP4 a ~250 tok/s — l'esperienza mono-GPU più veloce sotto i 5.000 €.
- 64–128 GB (Mac / DGX Spark): qui iniziano i modelli «veri»: Qwen3.8-Flash-Next (MLX 4-bit: 112 GB) o GLM-5.3-Flash come quant 3-bit.
Regola pratica: pesi del modello più il 20% di margine per il contesto devono stare in memoria. Oltre, significa quantizzare più fine o prendere un modello più piccolo.
Passo 2 (sabato pomeriggio): scegliere lo stack software
Lo stack più semplice per iniziare:
- Installa Ollama o LM Studio — entrambi girano su Mac e Linux/Windows, entrambi parlano il formato OpenAI.
- Scarica un modello:
ollama pull qwen3.8:27b(controlla la dimensione!) — oppure sceglierlo dalla ricerca di LM Studio. - Prova: apri la finestra di chat, fai tre volte lo stesso prompt. La velocità di risposta è fluida? Bene. Scatta? Abbassa la quantizzazione di un gradino.
Per tutto ciò che va oltre (tool calling, uso agentico, endpoint personalizzati) prima o poi vorrai vLLM o llama.cpp — ma non il primo giorno.
Passo 3 (domenica mattina): collegare un vero caso d'uso
Un modello locale senza collegamenti resta un giocattolo. I collegamenti utili più semplici:
- Assistente di codice: punta Continue o un endpoint compatibile OpenAI del tuo editor su
http://localhost:11434. - Riassunti di documenti: metti Open WebUI davanti, carica i PDF, fai riassumere in locale.
- Agenti: qualsiasi framework di agenti che parla formato OpenAI può usare il tuo endpoint locale — cambia la base URL, fatto.
Parte del nostro stesso stack di produzione (pipeline del blog, analisi) gira tramite endpoint locali — la strada da «provare in locale» a «produrre in locale» è più corta di quanto si pensi.
Passo 4 (domenica pomeriggio): la misurazione che appartiene a te
Prima di credere a un benchmark qualsiasi della rete, misura da solo:
prompt = il tuo prompt di lavoro reale (non «count to 300»)
3 esecuzioni, prendi la mediana
annota i tok/s di decode E il tempo fino al primo token
Esattamente questi due numeri — decode e TTFT — decidono se il tuo uso è fluido. Tutto il resto è condizionale. E se il tuo numero è ben sotto il valore della ricetta del database: controlla il power limit della GPU (i laptop throttano!), confronta le versioni del motore, guarda le impostazioni della cache KV.
Gli errori da principiante più comuni
- Scegliere il modello più grande che «entra per un pelo» — con un margine del 2%, ogni conversazione lunga scambia contesto con qualità. Meglio un gradino sotto con il 30% d'aria.
- Proiettare i benchmark di altri rig sul proprio — il tuo limite termico, il tuo limite di potenza, la tua versione del motore.
- Aspettarsi tool calling senza supporto del motore — non tutti i motori fanno il parsing delle tool call; le note delle ricette lo dicono.
- Regolare senza misurare — prima misura, poi aggiusta. Altrimenti ottimizzi la sensazione, non il sistema.
Da qui in poi
Quando il tuo endpoint gira, il passo naturale successivo: adotta una ricetta dal nostro database Local AI per il tuo livello di hardware — ci sono ricette da 1× RTX 3090 a 4× DGX Spark con misurazioni, dettagli di quantizzazione e link ai repository originali. Copia i flag di serve, confronta con la tua misurazione, e stai gestendo lo stesso setup degli autori della community.
Domande frequenti
Mi serve obbligatoriamente una GPU? No — un Mac con abbastanza memoria unificata o perfino un laptop potente bastano per iniziare (Qwen3.8-27B Q3, modelli 8B–14B). La GPU diventa importante quando entrano in gioco la velocità o l'uso agentico con tool call.
Ollama o LM Studio? Per il primo giorno è uguale — funzionano entrambi. LM Studio ha la GUI migliore, Ollama il CLI più snello e migliore da scriptare. Chi vorrà poi andare in produzione con vLLM/llama.cpp cambierà comunque; il passaggio costa un pomeriggio.
Quale modello è il miglior punto d'ingresso? Qwen3.8-27B (Apache 2.0, multimodale, 4-bit ~19 GB) è l'ingresso standard del 2026 — leader nella sua classe, supportato ovunque. Per GPU da 24 GB: Qwen3.6 35B-A3B. Per il primissimo contatto: un modello 8B, giusto per vedere il ciclo.
Quanto spazio disco mi serve? Calcola 1,5–2× la dimensione del download per modello (cache di download più pesi decompressi). Un modello 27B 4-bit: ~19 GB di pesi, pianifica 50 GB. Per sperimentare con più modelli: 1 TB di NVMe è l'ordine di grandezza comodo.
Posso più avanti passare a hardware più grande? Sì — è questo il punto dei pesi aperti: lo stesso modello, gli stessi quant girano anche al livello successivo — solo più veloci. I tuoi prompt, il tuo setup e la tua metodologia di misura ti seguono. Per questo conviene misurare pulito fin dall'inizio.
Fonti
- Local AI — Context Studios (database di ricette per ogni livello di hardware)
- LLMCheck — state of open-source local LLMs, settembre 2026 (scelte di modello per livello di RAM)
- weschera — Qwen3.8-27B oMLX su Mac Studio M4 Max (53,3 tok/s)
- club3090 — Qwen3.6 35B-A3B NVFP4 su 1× RTX 5090 (251,8 tok/s)
- MiaAI-Lab — Qwen3.8-Flash-Next su 1× DGX Spark (48,7 tok/s, NVFP4)
- OpenBMB — MiniCPM5-2B (modello d'ingresso, Apache 2.0, GGUF/MLX)