Local AI

Il tuo primo setup LLM locale in un weekend

Il tuo primo setup LLM locale in un weekend

Vuoi far girare un LLM in locale — senza cloud, senza abbonamento, senza dispersione di dati. La strada nel 2026 è più semplice che mai, ma il numero di decisioni (hardware, modello, quantizzazione, motore) è sconcertante. Questo articolo ti porta in un weekend da «ho un computer» a «il mio endpoint LLM gira» — con ricette concrete dal nostro database per ogni livello di hardware.

Passo 1 (sabato mattina): valutare l'hardware onestamente

Non ti serve hardware nuovo per iniziare — ti serve l'aspettativa giusta su quello che hai già:

  • 16 GB di RAM (laptop): Qwen3.8-27B come quant 4-bit (~19 GB sono troppi, prendi il quant Q3 o un 8B–14B). Qualità di chat da desktop, niente miracoli.
  • 24 GB di VRAM (RTX 3090/4090): la classe del punto dolce. Qwen3.6 35B-A3B entra come INT4 ed è veloce.
  • 32 GB (RTX 5090): Qwen3.6 35B-A3B NVFP4 a ~250 tok/s — l'esperienza mono-GPU più veloce sotto i 5.000 €.
  • 64–128 GB (Mac / DGX Spark): qui iniziano i modelli «veri»: Qwen3.8-Flash-Next (MLX 4-bit: 112 GB) o GLM-5.3-Flash come quant 3-bit.

Regola pratica: pesi del modello più il 20% di margine per il contesto devono stare in memoria. Oltre, significa quantizzare più fine o prendere un modello più piccolo.

Passo 2 (sabato pomeriggio): scegliere lo stack software

Lo stack più semplice per iniziare:

  1. Installa Ollama o LM Studio — entrambi girano su Mac e Linux/Windows, entrambi parlano il formato OpenAI.
  2. Scarica un modello: ollama pull qwen3.8:27b (controlla la dimensione!) — oppure sceglierlo dalla ricerca di LM Studio.
  3. Prova: apri la finestra di chat, fai tre volte lo stesso prompt. La velocità di risposta è fluida? Bene. Scatta? Abbassa la quantizzazione di un gradino.

Per tutto ciò che va oltre (tool calling, uso agentico, endpoint personalizzati) prima o poi vorrai vLLM o llama.cpp — ma non il primo giorno.

Passo 3 (domenica mattina): collegare un vero caso d'uso

Un modello locale senza collegamenti resta un giocattolo. I collegamenti utili più semplici:

  • Assistente di codice: punta Continue o un endpoint compatibile OpenAI del tuo editor su http://localhost:11434.
  • Riassunti di documenti: metti Open WebUI davanti, carica i PDF, fai riassumere in locale.
  • Agenti: qualsiasi framework di agenti che parla formato OpenAI può usare il tuo endpoint locale — cambia la base URL, fatto.

Parte del nostro stesso stack di produzione (pipeline del blog, analisi) gira tramite endpoint locali — la strada da «provare in locale» a «produrre in locale» è più corta di quanto si pensi.

Passo 4 (domenica pomeriggio): la misurazione che appartiene a te

Prima di credere a un benchmark qualsiasi della rete, misura da solo:

code
prompt = il tuo prompt di lavoro reale (non «count to 300»)
3 esecuzioni, prendi la mediana
annota i tok/s di decode E il tempo fino al primo token

Esattamente questi due numeri — decode e TTFT — decidono se il tuo uso è fluido. Tutto il resto è condizionale. E se il tuo numero è ben sotto il valore della ricetta del database: controlla il power limit della GPU (i laptop throttano!), confronta le versioni del motore, guarda le impostazioni della cache KV.

Gli errori da principiante più comuni

  1. Scegliere il modello più grande che «entra per un pelo» — con un margine del 2%, ogni conversazione lunga scambia contesto con qualità. Meglio un gradino sotto con il 30% d'aria.
  2. Proiettare i benchmark di altri rig sul proprio — il tuo limite termico, il tuo limite di potenza, la tua versione del motore.
  3. Aspettarsi tool calling senza supporto del motore — non tutti i motori fanno il parsing delle tool call; le note delle ricette lo dicono.
  4. Regolare senza misurare — prima misura, poi aggiusta. Altrimenti ottimizzi la sensazione, non il sistema.

Da qui in poi

Quando il tuo endpoint gira, il passo naturale successivo: adotta una ricetta dal nostro database Local AI per il tuo livello di hardware — ci sono ricette da 1× RTX 3090 a 4× DGX Spark con misurazioni, dettagli di quantizzazione e link ai repository originali. Copia i flag di serve, confronta con la tua misurazione, e stai gestendo lo stesso setup degli autori della community.

Domande frequenti

Mi serve obbligatoriamente una GPU? No — un Mac con abbastanza memoria unificata o perfino un laptop potente bastano per iniziare (Qwen3.8-27B Q3, modelli 8B–14B). La GPU diventa importante quando entrano in gioco la velocità o l'uso agentico con tool call.

Ollama o LM Studio? Per il primo giorno è uguale — funzionano entrambi. LM Studio ha la GUI migliore, Ollama il CLI più snello e migliore da scriptare. Chi vorrà poi andare in produzione con vLLM/llama.cpp cambierà comunque; il passaggio costa un pomeriggio.

Quale modello è il miglior punto d'ingresso? Qwen3.8-27B (Apache 2.0, multimodale, 4-bit ~19 GB) è l'ingresso standard del 2026 — leader nella sua classe, supportato ovunque. Per GPU da 24 GB: Qwen3.6 35B-A3B. Per il primissimo contatto: un modello 8B, giusto per vedere il ciclo.

Quanto spazio disco mi serve? Calcola 1,5–2× la dimensione del download per modello (cache di download più pesi decompressi). Un modello 27B 4-bit: ~19 GB di pesi, pianifica 50 GB. Per sperimentare con più modelli: 1 TB di NVMe è l'ordine di grandezza comodo.

Posso più avanti passare a hardware più grande? Sì — è questo il punto dei pesi aperti: lo stesso modello, gli stessi quant girano anche al livello successivo — solo più veloci. I tuoi prompt, il tuo setup e la tua metodologia di misura ti seguono. Per questo conviene misurare pulito fin dall'inizio.

Fonti

Un tema per il Suo team? Parliamone 30 minuti.

Valutiamo cosa funziona davvero nella Sua azienda — in concreto, senza valanghe di slide.

Senza impegno · 30 minuti · Offerta entro 48 h