Mettere al lavoro gli agenti IA

Agenti IA locali sul Suo hardware. La Sua IA lavora in azienda – i Suoi dati non escono.

Realizzazione di hardware IA locale con modelli linguistici aperti e agenti IA in azienda

  1. Workshop
  2. Setup
  3. Sprint
  4. Sviluppo & supporto

Prezzo fisso dopo lo scoping · proposta entro 48 h

Aggiornato: settembre 2026

Agenti IA locali sul Suo hardware
Agenti IA locali sul Suo hardware
Agenti IA locali sul Suo hardware

Gli agenti IA locali sono assistenti IA il cui modello linguistico e software di agente girano su hardware all’interno dell’azienda anziché presso un fornitore cloud.

Realizziamo l’infrastruttura IA direttamente da Lei: un Mac Studio, un NVIDIA DGX Spark o una macchina con AMD Ryzen AI Max – a seconda dei modelli e del numero di utenti di cui ha bisogno. Su di essa girano modelli linguistici aperti come Qwen, DeepSeek, GLM o gpt-oss tramite un ambiente di esecuzione locale come llama.cpp, Ollama, MLX o vLLM. Per gli agenti usiamo Hermes Agent, un framework open source di Nous Research: con memoria, skill riutilizzabili, pianificatore e collegamento a Slack, Telegram o e-mail. Tramite MCP gli agenti accedono ai Suoi sistemi – con le autorizzazioni che stabilisce Lei. Richieste e documenti vengono elaborati sul Suo hardware; nessun fornitore cloud li vede.

Per chi

Ideale per aziende che vogliono usare l’IA con dati riservati – dati dei clienti, contratti, disegni tecnici, fascicoli del personale – e che non possono o non vogliono affidarli a un fornitore cloud. Particolarmente adatto a studi legali, studi medici, industria e PMI con elevati requisiti di protezione dei dati e segreti aziendali.

Caratteristiche Principali

  • In sede
  • Sovranità dei dati
  • Sicuro
  • Protetto con Guardrail
  • Principio del Minimo Privilegio
  • Documentato
  • Hermes Agent
  • llama.cpp
  • Ollama
  • MLX
  • vLLM
  • Qwen
  • DeepSeek
  • GLM
  • gpt-oss
  • MCP
  • Docker

Selezioniamo lo stack tecnologico ottimale per le Sue esigenze specifiche

(01)

Hardware

La macchina nella Sua sede. Conta la memoria: decide quanto grandi possono essere i modelli.

ClasseDispositiviMemoriaCosa gira realisticamente
CompattoSingoli teamNVIDIA DGX Spark · macchine con AMD Ryzen AI Max+128 GBModelli fino a circa 120 miliardi di parametri, ad es. gpt-oss-120b
WorkstationRepartiApple Mac Studio con M5 Ultrafino a 512 GBGrandi modelli mixture-of-experts con diverse centinaia di miliardi di parametri
ClusterPiù reparti2–4 Mac Studio o DGX Spark in rete256 GB e oltre, distribuitiModelli molto grandi distribuiti su più dispositivi
EnterpriseTutta l’aziendaNVIDIA DGX Station · workstation con RTX PRO 6000da 96 GB a circa 780 GBMolti utenti contemporanei in produzione

Regola pratica: con quantizzazione a 4 bit un modello richiede circa 0,6 GB di memoria per miliardo di parametri, più lo spazio per il contesto. La scelta concreta la facciamo nel workshop, in base ai Suoi compiti.

(02)

Esecuzione

Il software che esegue il modello e offre un’interfaccia compatibile con OpenAI.

  • llama.cpp
  • Ollama
  • LM Studio
  • MLX
  • vLLM
  • SGLang

MLX sul Mac, vLLM o SGLang su NVIDIA, llama.cpp su AMD – ciò che gira più velocemente sul Suo hardware.

(03)

Modelli

Modelli aperti i cui pesi risiedono sul Suo hardware. Scegliamo in base a compito, lingua e licenza.

FamigliaPunto di forzaLicenza
Qwen (Alibaba)Versatile, forte nella programmazione e con gli strumentiApache 2.0 per le varianti piccole e medie
DeepSeekRagionamento, varianti molto grandiMIT
GLM (Zhipu)Compiti agentici e programmazioneMIT o licenza propria, a seconda della variante
gpt-oss (OpenAI)Compatto, con chiamate a strumentiApache 2.0
MistralFornitore europeo, multilingueApache 2.0
Gemma (Google)Modelli piccoli e medi, anche per immaginiApache 2.0

Nuove versioni escono ogni mese. Prima dell’uso testiamo con i Suoi dati e verifichiamo la licenza di ogni modello.

(04)

Agenti

Hermes Agent pianifica i compiti, usa strumenti e ricorda le conversazioni precedenti.

  • Memoria tra una conversazione e l’altra
  • Skill che l’agente ricava dai compiti svolti
  • Pianificatore per compiti ricorrenti
  • Raggiungibile via Slack, Telegram, Discord o e-mail
  • Accesso ai Suoi sistemi tramite MCP
  • Sub-agenti per il lavoro in parallelo

Hermes Agent è open source (licenza MIT) ed è sviluppato da Nous Research.

Sicurezza e gestione

Locale non significa automaticamente sicuro. Per questo fa parte della realizzazione:

  • Gli agenti girano in container, non direttamente sulla macchina
  • Le azioni delicate richiedono la Sua autorizzazione
  • Le skill vengono verificate prima dell’installazione
  • Limiti per il comportamento del modello, soprattutto a contatto con i clienti
  • Un processo di aggiornamento regolato per modelli, esecuzione e agenti
  • Su richiesta, funzionamento isolato senza connessione a Internet

Come ci lavoriamo

  1. Workshop
  2. Setup
  3. Sprint
  4. Sviluppo & supporto
(01)

Workshop

Un incontro guidato che si chiude con un elenco dei Suoi progetti in ordine di priorità.

½–2 giorni · tre prezzi fissi
(02)

Setup

Configuriamo un sistema ben delimitato e ve lo consegniamo pronto all'uso.

1–2 settimane · prezzo fisso dopo lo scoping
(03)

Sviluppo & supporto

Sviluppiamo il progetto e restiamo al Suo fianco una volta in esercizio.

dopo lo scoping, in continuo · prezzo fisso dopo lo scoping; supporto su base mensile

Incluso

(01)

Workshop su attività, numero di utenti e dati come base per la scelta dell'hardware

(02)

Raccomandazione e installazione dell'hardware: Mac Studio, NVIDIA DGX Spark o computer con AMD Ryzen AI Max

(03)

Ambiente di esecuzione locale (ad es. llama.cpp, Ollama, MLX o vLLM) con interfaccia compatibile con OpenAI

(04)

Scelta di modelli aperti per attività, lingua e licenza, come Qwen, DeepSeek, GLM o gpt-oss

(05)

Agenti con Hermes Agent: memoria, skill riutilizzabili e pianificatore

(06)

Permessi di accesso, registrazione dei log e introduzione per il Suo team

(07)

30 giorni di correzione gratuita degli errori dalla consegna finale

Non incluso

(01)

Costi di acquisto dell'hardware

(02)

Collegamento di ulteriori sistemi oltre il perimetro concordato (separatamente dopo lo scoping)

(03)

Consulenza legale sul regolamento UE sull'IA o sul GDPR

(04)

Assistenza continuativa oltre i 30 giorni di correzione degli errori – prenotabile come Sviluppo & supporto

Svolgimento

(01)

Workshop

In un workshop (da ½ a 2 giorni) chiariamo attività, utenti e dati e definiamo hardware, modelli e licenze.

T1
(02)

Hardware & runtime

Installazione della macchina presso la Sua sede, dell'ambiente di esecuzione e dei modelli aperti scelti.

W1
(03)

Agenti & consegna

Hermes Agent con skill e collegamento ai Suoi sistemi, permessi di accesso, introduzione e documentazione.

W2
(04)

Estensione

Opzionale: ulteriori agenti, integrazioni e gruppi di utenti, passo dopo passo, perimetro dopo lo scoping.

Sviluppo
(01)Di quale hardware abbiamo bisogno?
Dipende dalla dimensione del modello e dal numero di utenti. Per modelli fino a circa 120 miliardi di parametri in quantizzazione a 4 bit bastano dispositivi con 128 GB di memoria unificata, come un NVIDIA DGX Spark o una macchina con AMD Ryzen AI Max+ 395. I modelli più grandi richiedono un Mac Studio con M5 Ultra (fino a 512 GB; queste configurazioni vengono consegnate da fine ottobre 2026) o più dispositivi in rete. Nel workshop stabiliamo quale classe è adatta ai Suoi compiti.
(02)I modelli locali sono buoni come ChatGPT o Claude?
Per molti compiti aziendali – riassumere, cercare nei propri documenti, redigere bozze, classificare, programmare – i modelli aperti attuali sono sufficienti. Per compiti molto complessi i grandi modelli cloud sono spesso ancora in vantaggio. Per questo testiamo i modelli in anticipo con i Suoi dati invece di affidarci ai benchmark.
(03)Davvero nessun dato esce dall’azienda?
L’elaborazione del modello avviene interamente sul Suo hardware. È Lei a decidere se un agente può accedere anche a Internet, per esempio per una ricerca web. Un funzionamento completamente isolato, senza connessione a Internet, è possibile ma richiede un ulteriore irrobustimento per installazione e aggiornamenti – su richiesta lo pianifichiamo.
(04)Perché Hermes Agent?
Hermes Agent è un framework per agenti open source di Nous Research con licenza MIT. Funziona con qualsiasi server di modelli locale, offre memoria, skill, pianificatore e collegamenti a Slack, Telegram o e-mail e integra i Suoi sistemi tramite MCP. Poiché evolve rapidamente, un processo di aggiornamento regolato fa parte della nostra consegna.
(05)Possiamo usare modelli come Qwen, DeepSeek o GLM?
Eseguiti in locale, questi modelli non inviano dati al produttore – i pesi del modello sono file sul Suo hardware. Molte varianti hanno licenza Apache 2.0 o MIT e sono utilizzabili commercialmente; verifichiamo la licenza per ogni modello. Come ogni modello hanno bisogno di limiti per il loro comportamento, e per le applicazioni a contatto con i clienti scegliamo modello e misure di protezione con particolare cura.
(06)Il regolamento UE sull’IA vale anche per l’IA locale?
Sì. Gli obblighi dipendono dalla finalità, non da dove gira il modello. Il funzionamento locale facilita però controllo e documentazione, perché sa quale modello, in quale versione, elabora quali dati.

Pronti per il Suo progetto?

Parli con noi per 30 minuti, senza impegno, oppure ci scriva direttamente.

Prezzo fisso dopo lo scoping · proposta entro 48 h