La Potion Magique
de l’IA Locale
Hermes Agent + LM Studio + Gemma 4 12B : votre assistant IA orchestré, 100% local, gratuit et confidentiel. Sans abonnement. Sans cloud. Sans compromis.
Deux bangers qui changent tout
Il y a des moments dans le monde de l’IA où deux sorties simultanées créent quelque chose de bien plus grand que la somme des parties. C’est exactement ce qui vient de se passer avec la sortie conjointe de Hermes Agent Desktop et du modèle Gemma 4 12B de Google.
La promesse ? Un système d’agents IA orchestrés, entièrement en local sur votre PC, qui apprend avec vous au fil du temps, qui grandit en capacités chaque jour — et tout ça gratuitement, avec vos données qui ne quittent jamais votre machine.
Ce que vous obtiendrez : un assistant IA personnel qui connaît votre façon de travailler, qui stocke votre historique en local, qui orchestre plusieurs agents en parallèle — et qui tourne sur n’importe quel PC avec 16 Go de mémoire graphique.
Les 3 niveaux d’utilisation de l’IA
Pour comprendre où on va, il faut d’abord comprendre d’où on vient. L’utilisation de l’IA a évolué en trois grandes étapes.
Abonnement classique
ChatGPT, Claude, Gemini… ~20€/mois. Pratique mais vos données transitent chez des tiers, et vous payez même sans utiliser.
API à l’usage
Paiement par tokens consommés. Plus flexible, idéal pour les usages irréguliers. Outils comme Kiro permettent d’en profiter sans interface imposée.
IA locale 100%
Modèle sur votre machine. Zéro abonnement, zéro data externe, zéro coût variable. C’est l’objectif de ce tutoriel.
Pourquoi passer à l’IA locale ?
Confidentialité totale
Chaque token envoyé à OpenAI, Anthropic ou Google est stocké quelque part sur leurs serveurs. Avec une IA locale, vos documents confidentiels, vos stratégies d’entreprise, vos données sensibles — tout reste chez vous.
Économies réelles
Téléchargez le modèle une seule fois. Ensuite, chaque inférence est gratuite. Même pour des milliers de requêtes par mois. Même en laissant tourner la nuit.
Indépendance totale
Pas d’internet requis après le téléchargement. Partez en vacances avec votre laptop, l’IA tourne. Plus de panne de service chez un tiers. Plus de hausse de prix surprise.
Le problème du matériel
Oui, les grands modèles (GPT-4o, Claude Opus) nécessitent des data centers entiers. Voici pourquoi :
La règle d’or : 1 milliard de paramètres ≈ 1 Go de VRAM. Gemma 4 12B tient donc confortablement dans 12-16 Go de mémoire graphique — la config d’un bon laptop gaming récent.
Gemma 4 12B : le modèle surprise de Google
Google vient de sortir Gemma 4 12B, un modèle open source dense de 12 milliards de paramètres. Et c’est une petite révolution.
- Raisonnement avancé : il pense avant de répondre (mode thinking), idéal pour des tâches complexes
- Agentique natif : capable de piloter des outils, de prendre des décisions, d’enchaîner des actions
- Multimodal : il accepte du texte, des images, du son et même de la vidéo en entrée
- Open source et gratuit : téléchargeable légalement, utilisable commercialement sur votre machine
- Ultra-léger : tourne avec 12-16 Go de VRAM, quantisable pour tenir dans encore moins
📊 Comparatif rapide
| Modèle | Taille | Local ? | Raisonnement | Gratuit |
|---|---|---|---|---|
| Gemma 4 12B ⭐ | ~8 Go disque | ✓ | ✓ | ✓ |
| LLaMA 3.1 8B | ~5 Go | ✓ | ~ | ✓ |
| GPT-4o | Cloud | ✗ | ✓ | ✗ |
| Claude Opus 4.8 | Cloud | ✗ | ✓✓ | ✗ |
L’orchestration agentique expliquée
On est passé de simples chatbots (2023) aux assistants personnalisables (2024), puis aux agents IA connectés à des outils via MCP (2025). En 2026, on franchit une nouvelle étape : l’orchestration agentique locale.
⚙️ Architecture d’un système orchestré local
Comment fonctionne l’orchestration ?
Imaginons que vous demandez : « Rédige des brouillons de mails pour demain et ajoute les événements importants à mon agenda. »
L’orchestrateur analyse
Hermes Agent décompose la requête en sous-tâches : récupérer les mails, identifier les priorités, rédiger les réponses, créer les événements agenda.
Les agents travaillent en parallèle
Chaque sous-tâche est confiée à un agent spécialisé. Certains tournent simultanément : l’agent mail et l’agent agenda avancent en même temps.
Consolidation et livraison
L’orchestrateur collecte les résultats, vérifie la cohérence, et vous présente le tout de façon unifiée. Sans jamais envoyer vos mails à un serveur tiers.
📁 Le système de fichiers : la mémoire qui grandit
La vraie magie, c’est le système de fichiers en Markdown que Hermes construit sur votre machine. Il y stocke :
- Votre contexte personnel (nom, métier, préférences)
- L’historique de vos conversations et productions
- Vos skills : les capacités qu’il a apprises avec vous
- Vos données structurées par domaine (réseaux sociaux, messagerie, projets…)
Hermes Agent : le nouveau standard sécurisé
Hermes Agent est la réponse professionnelle et sécurisée aux premiers systèmes d’orchestration comme Open Clow. Développé par une startup new-yorkaise, il corrige les principales failles de sécurité tout en ajoutant une expérience utilisateur bien plus soignée.
Sécurité renforcée
Hermes tourne dans un environnement encapsulé. Les skills sont développés en interne par l’équipe. Impossible pour un pirate de vous faire télécharger un skill malveillant qui exfiltre vos données.
Système de fichiers Markdown natif
Contrairement à Open Clow (format opaque), Hermes utilise du Markdown : lisible, léger, compatible avec Obsidian, explorable directement dans votre explorateur de fichiers.
Desktop App — enfin !
La grande nouveauté : Hermes Agent Desktop est disponible. Plus besoin d’être développeur pour l’installer. Un simple téléchargement, une installation guidée, et c’est prêt.
Les skills intégrés
Hermes est livré avec une bibliothèque de capacités prêtes à l’emploi :
LM Studio : installer et servir Gemma 4 12B
LM Studio est votre serveur de modèles local. Il s’installe en un clic, gère le téléchargement des modèles et les sert via une API locale compatible OpenAI — ce qu’Hermes Agent attend.
Télécharger LM Studio
Rendez-vous sur lmstudio.ai. Cliquez sur « Download for Windows » (ou votre OS). Lancez l’installateur. C’est gratuit.
Trouver et télécharger Gemma 4 12B
Dans l’onglet de recherche de modèles, tapez gemma 4 12b. Sélectionnez le bon modèle (pas trop petit, pas trop grand). Cliquez sur « Download ».
Configurer le contexte (64K tokens minimum)
Au premier lancement, réglez la taille de contexte à 65 000 tokens — c’est ce qu’exige Hermes Agent pour bien fonctionner.
Ajuster la quantisation si besoin
Si votre VRAM est juste (16 Go pile), activez la quantisation du cache KV/V en Q8. Vous perdez très peu en qualité mais économisez 2-4 Go de mémoire.
Activer le serveur local
Onglet « Développeur » → Bouton « Start Server ». Notez l’adresse locale affichée (ex: http://127.0.0.1:1234). C’est elle qu’Hermes Agent utilisera.
⚡ Vérifications importantes dans Server Settings
Serve on local network: doit être cochéEnable CORS: doit être coché (évite les problèmes de connexion)
Connecter Hermes Agent à LM Studio
Installer Hermes Agent Desktop
Rendez-vous sur hermes-agent.nousresearch.com. Cliquez sur « Desktop App » → Téléchargez pour Windows. Lancez l’installateur (il installe Python et l’environnement Linux si nécessaire).
Premier lancement : choisir la source IA
Au premier écran, cherchez « LM Studio » dans la liste des providers. Ne mettez pas de clé API — vous allez renseigner l’adresse locale de votre serveur LM Studio.
Coller l’adresse du serveur
Collez l’adresse notée à l’étape précédente (ex: http://127.0.0.1:1234). Cliquez sur Sauvegarder. La connexion est établie.
Définir votre répertoire de travail
Dans les paramètres → Workspace, précisez un dossier dédié (ex: C:\Users\VotreNom\Hermes\). C’est là que vivra votre système de fichiers personnel.
C’est prêt !
Commencez à discuter avec Hermes Agent. Il va interroger Gemma 4 12B en local, créer des fichiers dans votre répertoire, et apprendre de vous au fil du temps.
La potion complète en action
Voici ce que vous obtenez une fois la recette complète assemblée :
🖥️ Architecture finale sur votre PC
Un assistant qui grandit avec vous
Jour 1 : vide mais déjà utile
Au départ, Hermes ne sait rien de vous. Mais dès vos premières interactions, il commence à constituer sa base : qui vous êtes, comment vous écrivez, quels sont vos projets.
Semaine 1 : il vous connaît
Il sait quel ton adopter sur LinkedIn vs Instagram. Il connaît vos projets en cours. Il retrouve vos anciens fichiers pour contextualiser ses réponses — sans jamais interroger une IA externe pour ça.
Mois 1 : votre clone IA
Des dizaines de skills appris. Des milliers de fichiers contextuels. Il peut travailler la nuit en autonomie : préparer des contenus, enrichir sa base de connaissance, lancer des traitements complexes.
💡 Astuce Pro : le meilleur des deux mondes
Utilisez Gemma 4 12B local pour 90% des tâches (rédaction, résumés, exécution de skills). Reservez Claude Opus via API pour les 10% de tâches complexes (créer de nouveaux skills, raisonnement profond). Résultat : performances maximales, coût minimal.
Regarder la vidéo complète
Renault DesCodes présente en vidéo toute la mise en place pas à pas, avec des démonstrations en direct de Hermes Agent, LM Studio et Gemma 4 12B. Cliquez sur la miniature pour lancer la vidéo :

🚀 Prêt à tester la potion magique ?
Rejoignez la communauté Renault DesCodes pour partager vos expériences, obtenir de l’aide et découvrir les ressources partagées par d’autres utilisateurs.
🌐 Rejoindre renaudecode.fr