Déployer des agents IA

Agents IA locaux sur votre propre matériel. Votre IA travaille en interne – vos données ne sortent pas.

Mise en place de matériel IA local avec des modèles de langage ouverts et des agents IA en interne

  1. Atelier
  2. Mise en place
  3. Sprint
  4. Réalisation & suivi

Prix fixe après cadrage · proposition sous 48 h

Mise à jour : septembre 2026

Agents IA locaux sur votre propre matériel
Agents IA locaux sur votre propre matériel
Agents IA locaux sur votre propre matériel

Les agents IA locaux sont des assistants IA dont le modèle de langage et le logiciel d’agent tournent sur du matériel au sein de l’entreprise plutôt que chez un fournisseur cloud.

Nous installons une infrastructure IA directement chez vous : un Mac Studio, un NVIDIA DGX Spark ou une machine équipée d’AMD Ryzen AI Max – selon les modèles et le nombre d’utilisateurs dont vous avez besoin. Elle fait tourner des modèles de langage ouverts comme Qwen, DeepSeek, GLM ou gpt-oss via un environnement d’exécution local tel que llama.cpp, Ollama, MLX ou vLLM. Pour les agents, nous misons sur Hermes Agent, un framework d’agents open source de Nous Research : avec mémoire, compétences réutilisables, planificateur et connexion à Slack, Telegram ou l’e-mail. Via MCP, les agents accèdent à vos systèmes – avec les validations que vous définissez. Les requêtes et les documents sont traités sur votre matériel ; aucun fournisseur cloud ne les voit.

Pour qui

Idéal pour les entreprises qui veulent utiliser l’IA avec des données confidentielles – données clients, contrats, plans techniques, dossiers du personnel – et qui ne peuvent ou ne veulent pas les confier à un fournisseur cloud. Particulièrement adapté aux cabinets d’avocats, cabinets médicaux, à l’industrie et aux PME exigeantes en matière de protection des données et de secret des affaires.

Caractéristiques Clés

  • Sur site
  • Souveraineté des données
  • Sécurisé
  • Protégé par Guardrails
  • Principe du Moindre Privilège
  • Documenté
  • Hermes Agent
  • llama.cpp
  • Ollama
  • MLX
  • vLLM
  • Qwen
  • DeepSeek
  • GLM
  • gpt-oss
  • MCP
  • Docker

Nous sélectionnons la stack technologique optimale pour vos besoins spécifiques

(01)

Matériel

La machine dans vos locaux. C’est la mémoire qui compte : elle détermine la taille des modèles qui tournent.

ClasseAppareilsMémoireCe qui tourne réellement
CompactÉquipesNVIDIA DGX Spark · machines avec AMD Ryzen AI Max+128 GoModèles jusqu’à environ 120 milliards de paramètres, par ex. gpt-oss-120b
Station de travailDépartementsApple Mac Studio avec M5 Ultrajusqu’à 512 GoGrands modèles « mixture of experts » de plusieurs centaines de milliards de paramètres
ClusterPlusieurs départements2 à 4 Mac Studio ou DGX Spark en réseau256 Go et plus, répartisTrès grands modèles répartis sur plusieurs appareils
EntrepriseToute l’entrepriseNVIDIA DGX Station · stations avec RTX PRO 600096 Go à environ 780 GoNombreux utilisateurs simultanés en production

Règle empirique : en quantification 4 bits, un modèle a besoin d’environ 0,6 Go de mémoire par milliard de paramètres, plus la place pour le contexte. Le choix concret se fait lors de l’atelier, en fonction de vos tâches.

(02)

Exécution

Le logiciel qui exécute le modèle et fournit une interface compatible OpenAI.

  • llama.cpp
  • Ollama
  • LM Studio
  • MLX
  • vLLM
  • SGLang

MLX sur Mac, vLLM ou SGLang sur NVIDIA, llama.cpp sur AMD – ce qui tourne le plus vite sur votre matériel.

(03)

Modèles

Des modèles ouverts dont les poids résident sur votre matériel. Nous choisissons selon la tâche, la langue et la licence.

FamillePoint fortLicence
Qwen (Alibaba)Polyvalent, fort en programmation et avec les outilsApache 2.0 pour les variantes petites et moyennes
DeepSeekRaisonnement, très grandes variantesMIT
GLM (Zhipu)Tâches agentiques et programmationMIT ou licence propre, selon la variante
gpt-oss (OpenAI)Compact, avec appels d’outilsApache 2.0
MistralÉditeur européen, multilingueApache 2.0
Gemma (Google)Petits et moyens modèles, images comprisesApache 2.0

De nouvelles versions paraissent chaque mois. Nous testons avec vos propres données avant le déploiement et vérifions la licence de chaque modèle.

(04)

Agents

Hermes Agent planifie les tâches, utilise des outils et se souvient des conversations précédentes.

  • Mémoire d’une conversation à l’autre
  • Des compétences que l’agent tire des tâches accomplies
  • Planificateur pour les tâches récurrentes
  • Joignable via Slack, Telegram, Discord ou e-mail
  • Accès à vos systèmes via MCP
  • Sous-agents pour le travail en parallèle

Hermes Agent est open source (licence MIT) et développé par Nous Research.

Sécurité et exploitation

Local ne veut pas dire sûr d’office. C’est pourquoi cela fait partie de l’installation :

  • Les agents tournent dans des conteneurs, pas directement sur la machine
  • Les actions sensibles nécessitent votre validation
  • Les compétences sont vérifiées avant installation
  • Des garde-fous pour le comportement du modèle, surtout au contact des clients
  • Un processus de mise à jour encadré pour modèles, exécution et agents
  • Sur demande, fonctionnement isolé sans connexion Internet

Comment nous y travaillons

  1. Atelier
  2. Mise en place
  3. Sprint
  4. Réalisation & suivi
(01)

Atelier

Une séance animée qui se termine par une liste hiérarchisée de vos projets.

½–2 jours · trois prix fixes
(02)

Mise en place

Nous mettons en place un système clairement délimité et vous le remettons prêt à l'emploi.

1–2 semaines · prix fixe après cadrage
(03)

Réalisation & suivi

Nous développons le projet et restons à vos côtés une fois qu'il est en production.

après cadrage, en continu · prix fixe après cadrage ; suivi facturé au mois

Inclus

(01)

Atelier sur les tâches, le nombre d'utilisateurs et les données, comme base du choix du matériel

(02)

Recommandation et installation du matériel : Mac Studio, NVIDIA DGX Spark ou machine avec AMD Ryzen AI Max

(03)

Environnement d'exécution local (par ex. llama.cpp, Ollama, MLX ou vLLM) avec une interface compatible OpenAI

(04)

Choix de modèles ouverts selon la tâche, la langue et la licence, comme Qwen, DeepSeek, GLM ou gpt-oss

(05)

Agents avec Hermes Agent : mémoire, skills réutilisables et planificateur

(06)

Droits d'accès, journalisation et prise en main pour votre équipe

(07)

30 jours de correction gratuite des erreurs à compter de la livraison finale

Non inclus

(01)

Coûts d'achat du matériel

(02)

Connexion d'autres systèmes au-delà du périmètre convenu (séparément après cadrage)

(03)

Conseil juridique sur le règlement européen sur l'IA ou le RGPD

(04)

Accompagnement continu au-delà des 30 jours de correction des erreurs – disponible en Réalisation & suivi

Déroulement

(01)

Atelier

Lors d'un atelier (½ à 2 jours), nous clarifions tâches, utilisateurs et données et arrêtons matériel, modèles et licences.

T1
(02)

Matériel & exécution

Installation de la machine dans vos locaux, de l'environnement d'exécution et des modèles ouverts retenus.

W1
(03)

Agents & remise

Hermes Agent avec skills et connexion à vos systèmes, droits d'accès, prise en main et documentation.

W2
(04)

Extension

En option : agents, intégrations et groupes d'utilisateurs supplémentaires, étape par étape, périmètre après cadrage.

Réalisation
(01)De quel matériel avons-nous besoin ?
Cela dépend de la taille du modèle et du nombre d’utilisateurs. Pour des modèles jusqu’à environ 120 milliards de paramètres en quantification 4 bits, des appareils dotés de 128 Go de mémoire unifiée suffisent, comme un NVIDIA DGX Spark ou une machine équipée d’AMD Ryzen AI Max+ 395. Les modèles plus grands nécessitent un Mac Studio M5 Ultra (jusqu’à 512 Go ; ces configurations sont livrées à partir de fin octobre 2026) ou plusieurs appareils en réseau. Lors de l’atelier, nous déterminons la classe adaptée à vos tâches.
(02)Les modèles locaux valent-ils ChatGPT ou Claude ?
Pour de nombreuses tâches en entreprise – résumer, chercher dans vos propres documents, rédiger, classer, programmer – les modèles ouverts actuels suffisent. Pour des tâches très complexes, les grands modèles cloud gardent souvent une avance. C’est pourquoi nous testons les modèles au préalable avec vos propres données plutôt que de nous fier aux benchmarks.
(03)Aucune donnée ne sort-elle vraiment ?
Le traitement par le modèle s’effectue entièrement sur votre matériel. C’est vous qui décidez si un agent peut en plus accéder à Internet, par exemple pour une recherche web. Un fonctionnement totalement isolé, sans connexion Internet, est possible mais demande un durcissement supplémentaire pour l’installation et les mises à jour – nous pouvons le prévoir sur demande.
(04)Pourquoi Hermes Agent ?
Hermes Agent est un framework d’agents open source de Nous Research sous licence MIT. Il fonctionne avec n’importe quel serveur de modèles local, apporte mémoire, compétences, planificateur et connexions à Slack, Telegram ou l’e-mail, et relie vos systèmes via MCP. Comme il évolue rapidement, un processus de mise à jour encadré fait partie de notre transfert.
(05)Pouvons-nous utiliser des modèles comme Qwen, DeepSeek ou GLM ?
Exécutés localement, ces modèles n’envoient aucune donnée à leur éditeur – les poids du modèle sont des fichiers sur votre matériel. De nombreuses variantes sont sous licence Apache 2.0 ou MIT et utilisables commercialement ; nous vérifions la licence de chaque modèle. Comme tout modèle, ils ont besoin de garde-fous pour leur comportement, et pour les applications en contact avec la clientèle nous choisissons modèle et protections avec un soin particulier.
(06)Le règlement européen sur l’IA s’applique-t-il aussi à l’IA locale ?
Oui. Les obligations dépendent de la finalité, pas de l’endroit où tourne le modèle. L’exploitation locale facilite toutefois le contrôle et la documentation, car vous savez quel modèle, dans quelle version, traite quelles données.

Prêt pour votre projet ?

Échangez 30 minutes avec nous, sans engagement, ou écrivez-nous directement.

Prix fixe après cadrage · proposition sous 48 h