---
type: "BlogPosting"
title: "Il tuo primo setup LLM locale in un weekend"
description: "Da «ho un computer» a «il mio endpoint gira»: valutare l'hardware, scegliere lo stack, collegare un caso d'uso, misurare da soli — con ricette per ogni livello."
resource: "https://www.contextstudios.ai/it/blog/il-tuo-primo-setup-llm-locale-in-un-weekend"
language: "it"
tags: ["Local AI", "Self-Hosting", "LLM", "Benchmark", "Hardware"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-05T09:03:39.590Z"
status: "stable"
---

# Il tuo primo setup LLM locale in un weekend

Published: 2026-10-01
Tags: Local AI, Self-Hosting, LLM, Benchmark, Hardware

![Il tuo primo setup LLM locale in un weekend](https://wary-platypus-754.convex.cloud/api/storage/4ff770d9-aee7-4289-8c14-fe4f6f163cc9)

Vuoi far girare un LLM in locale — senza cloud, senza abbonamento, senza dispersione di dati. La strada nel 2026 è più semplice che mai, ma il numero di decisioni (hardware, modello, quantizzazione, motore) è sconcertante. Questo articolo ti porta in un weekend da «ho un computer» a «il mio endpoint LLM gira» — con ricette concrete dal nostro database per ogni livello di hardware.

## Passo 1 (sabato mattina): valutare l'hardware onestamente

Non ti serve hardware nuovo per iniziare — ti serve l'aspettativa giusta su quello che hai già:

- **16 GB di RAM (laptop):** Qwen3.8-27B come quant 4-bit (~19 GB sono troppi, prendi il quant Q3 o un 8B–14B). Qualità di chat da desktop, niente miracoli.
- **24 GB di VRAM (RTX 3090/4090):** la classe del punto dolce. Qwen3.6 35B-A3B entra come INT4 ed è veloce.
- **32 GB (RTX 5090):** Qwen3.6 35B-A3B NVFP4 a ~250 tok/s — l'esperienza mono-GPU più veloce sotto i 5.000 €.
- **64–128 GB (Mac / DGX Spark):** qui iniziano i modelli «veri»: Qwen3.8-Flash-Next (MLX 4-bit: 112 GB) o GLM-5.3-Flash come quant 3-bit.

Regola pratica: pesi del modello più il 20% di margine per il contesto devono stare in memoria. Oltre, significa quantizzare più fine o prendere un modello più piccolo.

## Passo 2 (sabato pomeriggio): scegliere lo stack software

Lo stack più semplice per iniziare:

1. **Installa Ollama o LM Studio** — entrambi girano su Mac e Linux/Windows, entrambi parlano il formato OpenAI.
2. **Scarica un modello:** `ollama pull qwen3.8:27b` (controlla la dimensione!) — oppure sceglierlo dalla ricerca di LM Studio.
3. **Prova:** apri la finestra di chat, fai tre volte lo stesso prompt. La velocità di risposta è fluida? Bene. Scatta? Abbassa la quantizzazione di un gradino.

Per tutto ciò che va oltre (tool calling, uso agentico, endpoint personalizzati) prima o poi vorrai vLLM o llama.cpp — ma non il primo giorno.

## Passo 3 (domenica mattina): collegare un vero caso d'uso

Un modello locale senza collegamenti resta un giocattolo. I collegamenti utili più semplici:

- **Assistente di codice:** punta Continue o un endpoint compatibile OpenAI del tuo editor su `http://localhost:11434`.
- **Riassunti di documenti:** metti Open WebUI davanti, carica i PDF, fai riassumere in locale.
- **Agenti:** qualsiasi framework di agenti che parla formato OpenAI può usare il tuo endpoint locale — cambia la base URL, fatto.

Parte del nostro stesso stack di produzione (pipeline del blog, analisi) gira tramite endpoint locali — la strada da «provare in locale» a «produrre in locale» è più corta di quanto si pensi.

## Passo 4 (domenica pomeriggio): la misurazione che appartiene a te

Prima di credere a un benchmark qualsiasi della rete, misura da solo:

```
prompt = il tuo prompt di lavoro reale (non «count to 300»)
3 esecuzioni, prendi la mediana
annota i tok/s di decode E il tempo fino al primo token
```

Esattamente questi due numeri — decode e TTFT — decidono se il tuo uso è fluido. Tutto il resto è condizionale. E se il tuo numero è ben sotto il valore della ricetta del database: controlla il power limit della GPU (i laptop throttano!), confronta le versioni del motore, guarda le impostazioni della cache KV.

## Gli errori da principiante più comuni

1. **Scegliere il modello più grande che «entra per un pelo»** — con un margine del 2%, ogni conversazione lunga scambia contesto con qualità. Meglio un gradino sotto con il 30% d'aria.
2. **Proiettare i benchmark di altri rig sul proprio** — il tuo limite termico, il tuo limite di potenza, la tua versione del motore.
3. **Aspettarsi tool calling senza supporto del motore** — non tutti i motori fanno il parsing delle tool call; le note delle ricette lo dicono.
4. **Regolare senza misurare** — prima misura, poi aggiusta. Altrimenti ottimizzi la sensazione, non il sistema.

## Da qui in poi

Quando il tuo endpoint gira, il passo naturale successivo: adotta una ricetta dal nostro [database Local AI](/it/local-ai) per il tuo livello di hardware — ci sono ricette da 1× RTX 3090 a 4× DGX Spark con misurazioni, dettagli di quantizzazione e link ai repository originali. Copia i flag di serve, confronta con la tua misurazione, e stai gestendo lo stesso setup degli autori della community.

## Domande frequenti

**Mi serve obbligatoriamente una GPU?**
No — un Mac con abbastanza memoria unificata o perfino un laptop potente bastano per iniziare (Qwen3.8-27B Q3, modelli 8B–14B). La GPU diventa importante quando entrano in gioco la velocità o l'uso agentico con tool call.

**Ollama o LM Studio?**
Per il primo giorno è uguale — funzionano entrambi. LM Studio ha la GUI migliore, Ollama il CLI più snello e migliore da scriptare. Chi vorrà poi andare in produzione con vLLM/llama.cpp cambierà comunque; il passaggio costa un pomeriggio.

**Quale modello è il miglior punto d'ingresso?**
Qwen3.8-27B (Apache 2.0, multimodale, 4-bit ~19 GB) è l'ingresso standard del 2026 — leader nella sua classe, supportato ovunque. Per GPU da 24 GB: Qwen3.6 35B-A3B. Per il primissimo contatto: un modello 8B, giusto per vedere il ciclo.

**Quanto spazio disco mi serve?**
Calcola 1,5–2× la dimensione del download per modello (cache di download più pesi decompressi). Un modello 27B 4-bit: ~19 GB di pesi, pianifica 50 GB. Per sperimentare con più modelli: 1 TB di NVMe è l'ordine di grandezza comodo.

**Posso più avanti passare a hardware più grande?**
Sì — è questo il punto dei pesi aperti: lo stesso modello, gli stessi quant girano anche al livello successivo — solo più veloci. I tuoi prompt, il tuo setup e la tua metodologia di misura ti seguono. Per questo conviene misurare pulito fin dall'inizio.

## Fonti

- [Local AI — Context Studios (database di ricette per ogni livello di hardware)](https://www.contextstudios.ai/it/local-ai)
- [LLMCheck — state of open-source local LLMs, settembre 2026 (scelte di modello per livello di RAM)](https://llmcheck.net/blog/state-of-open-source-local-llms-september-2026)
- [weschera — Qwen3.8-27B oMLX su Mac Studio M4 Max (53,3 tok/s)](https://www.contextstudios.ai/local-ai)
- [club3090 — Qwen3.6 35B-A3B NVFP4 su 1× RTX 5090 (251,8 tok/s)](https://github.com/noonghunna/club-3090/blob/master/BENCHMARKS.md)
- [MiaAI-Lab — Qwen3.8-Flash-Next su 1× DGX Spark (48,7 tok/s, NVFP4)](https://github.com/MiaAI-Lab)
- [OpenBMB — MiniCPM5-2B (modello d'ingresso, Apache 2.0, GGUF/MLX)](https://huggingface.co/openbmb/MiniCPM5-2B)


## Related

- [Sviluppo LLM](https://www.contextstudios.ai/it/sviluppo-llm.md)
- [Sviluppo AI](https://www.contextstudios.ai/it/sviluppo-ia.md)
- [Integrazione LLM](https://www.contextstudios.ai/it/integrazione-llm.md)
- [Consulenza AI](https://www.contextstudios.ai/it/consulenza-ia.md)
