Faire tourner DeepSeek V4 gratuitement sans PC surpuissant
Découvrez comment exécuter n’importe quel modèle LLM open weight (DeepSeek, Qwen, Mistral, Kimi K3, Gemma…) depuis votre ordinateur, gratuitement, quelle que soit votre machine !
🎯 Ce que vous allez apprendre
Dans ce guide complet, je vous explique la différence entre installer un modèle en local, louer un serveur et passer par du serverless. Puis je vous montre pas à pas comment déployer l’un des plus gros modèles existants : DeepSeek V4 Pro (plus de 800 Go) via Modal, avec 30 $ de crédit offerts chaque mois.
🤔 Qu’est-ce qu’un modèle open weight ?
Un modèle « open weight » (poids ouverts) est un modèle d’intelligence artificielle dont les paramètres (les « poids » du réseau de neurones) sont publiquement disponibles. Contrairement aux modèles propriétaires comme GPT-4 ou Claude, vous pouvez télécharger et exécuter ces modèles sur votre propre infrastructure.
Accessibles
Téléchargeables gratuitement sur des plateformes comme Hugging Face
Personnalisables
Vous pouvez les adapter à vos besoins spécifiques
Privés
Vos données restent chez vous, pas d’envoi vers des API externes
Les modèles open weight populaires incluent DeepSeek V4, Qwen, Mistral, Kimi K3, et Gemma de Google.
️ Les 3 façons de faire tourner un modèle open weight
1. Installation en local
Pour qui ? Les petits modèles (7B-13B paramètres)
Avantages : Gratuit, privé, rapide
Inconvénients : Nécessite du matériel puissant (GPU avec beaucoup de VRAM)
Outils : Ollama, LM Studio, llama.cpp
2. Louer un serveur GPU
Pour qui ? Modèles moyens à gros (70B+ paramètres)
Avantages : Puissance à la demande, scalable
Inconvénients : Coût horaire, configuration nécessaire
Plateformes : RunPod, Lambda Labs, Vast.ai
3. Serverless (Modal)
Pour qui ? Tous les modèles, même les plus gros (800GB+)
Avantages : Pay-per-use, pas de gestion d’infrastructure, 30$/mois offerts
Inconvénients : Courbe d’apprentissage, latence au cold start
Plateforme : Modal.com
💰 Modal et les 30$ offerts par mois
Modal est une plateforme serverless conçue spécifiquement pour l’IA et le traitement haute performance. Voici ce qui la rend unique :
🎁 L’offre gratuite
- 30$ de crédit offert par mois avec carte bancaire liée
- 5$ de crédit sans carte bancaire
- Pay-as-you-go : vous ne payez que ce que vous utilisez
- Pas d’abonnement minimum, pas de frais cachés
Ces 30$ permettent de faire tourner des modèles massifs comme DeepSeek V4 Pro (qui nécessite normalement plus de 800 Go de mémoire) sans investir dans du matériel coûteux [[1]][[5]].
💵 Comparaison des coûts
📊 Open weight vs propriétaire : benchmark
Les modèles open weight ont fait des progrès extraordinaires en 2026. Voici comment ils se comparent aux modèles propriétaires :
🏆 Performance
DeepSeek V4 et Qwen 3.8 rivalisent désormais avec GPT-4 et Claude sur de nombreux benchmarks, notamment en :
- Raisonnement mathématique
- Génération de code
- Compréhension multilingue
⚡ Rapidité
Les modèles open weight optimisés (comme DeepSeek V4-Flash) offrent :
- Temps de réponse plus rapides
- Moins de latence en local
- Pas de rate limiting
🔐 Confidentialité
Contrairement aux API propriétaires :
- Vos données ne quittent pas votre infrastructure
- Pas d’entraînement sur vos données
- Conformité RGPD facilitée
Créer et configurer son compte Modal
-
Rendez-vous sur modal.com
Cliquez sur « Sign Up » et créez un compte avec votre email GitHub ou Google -
Ajoutez une carte bancaire (optionnel mais recommandé)
Pour débloquer les 30$ de crédit mensuel (au lieu de 5$ sans carte) -
Installez Modal en localpip install modal modal setup
-
Authentifiez-vous
Suivez les instructions pour lier votre compte local à votre compte Modal
🔑 Gérer ses tokens et secrets sur Hugging Face
Pour accéder aux modèles protégés sur Hugging Face, vous devez créer un token d’accès :
-
Créez un compte Hugging Face
Rendez-vous sur huggingface.co et inscrivez-vous -
Générez un token
Allez dans Settings → Access Tokens → « New token »
Choisissez le type « read » (lecture seule suffit pour télécharger des modèles) -
Stockez le token en toute sécurité# Sur votre machine export HUGGINGFACE_TOKEN= »hf_xxxxxxxxxxxxxxxxxx »# Dans Modal, ajoutez-le comme secret modal secret create hf-secret HUGGINGFACE_TOKEN=hf_xxxxx
-
Acceptez les conditions d’utilisation
Pour certains modèles (comme Llama), vous devez accepter la license sur la page du modèle
💻 Installation et setup en local d’un LLM open weight
Méthode 1 : Ollama (le plus simple)
Méthode 2 : LM Studio (interface graphique)
- Téléchargez LM Studio depuis lmstudio.ai
- Recherchez un modèle dans l’interface
- Téléchargez-le en un clic
- Discutez avec le modèle via l’interface chat
Méthode 3 : Transformers (pour développeurs)
Script Python Modal et préchargement du modèle
Voici un exemple complet de script pour déployer DeepSeek V4 sur Modal :
🚢 Comment déployer une app Modal
-
Sauvegardez votre script
Nommez-le par exempledeepseek_app.py -
Déployez l’applicationmodal deploy deepseek_app.py
-
Accédez à l’API
Modal vous donne une URL publique du type :
https://--deepseek-v4-inference-api-generate.modal.run -
Testez votre endpointimport requestsurl = « https://votre-url.modal.run » response = requests.post(url, json={ « prompt »: « Explique-moi l’IA générative », « max_tokens »: 200 }) print(response.json())
📊 Surveillez votre utilisation
Consultez votre tableau de bord Modal pour :
- Voir votre consommation de crédits
- Analyser les temps d’exécution
- Optimiser vos coûts
Peut-on faire tourner n’importe quel modèle sur Modal ?
✅ Oui, mais…
Modèles supportés :
- Tous les modèles Hugging Face
- DeepSeek V4 Pro (800GB+)
- Qwen, Mistral, Llama, Gemma
- Modèles multimodaux (image, audio)
⚠️ Limitations
- VRAM disponible : Jusqu’à 80GB par GPU (H100)
- Modèles très larges : Nécessitent du pipeline parallelism
- Temps de cold start : 30-60s pour charger un gros modèle
- Coût : Les 30$ partent vite avec les très gros modèles
🎯 Recommandations
- Pour tester : Commencez par DeepSeek V4-Flash ou Qwen 72B
- Pour la prod : Utilisez des modèles plus petits (7B-13B) quantifiés
- Pour le prototypage : Profitez des 30$ gratuits pour valider votre idée
🎯 Conclusion
Modal représente une opportunité unique pour les développeurs et chercheurs qui souhaitent expérimenter avec des modèles d’IA massifs sans investir dans du matériel coûteux. Avec 30$ de crédit offert chaque mois, vous pouvez :
Ce que vous obtenez gratuitement
- Accès à des GPU H100/A100 haut de gamme
- Exécution de modèles jusqu’à 800GB+
- Infrastructure serverless scalable
- Pas de gestion d’infrastructure
- API publique prête à l’emploi
N’hésitez pas à partager vos retours d’expérience et à demander des démos contextualisées pour vos cas d’usage spécifiques (texte, son, vidéo, image, etc.) !
🎬 Regarder la vidéo complète
Retrouvez toutes les explications détaillées et la démonstration en direct dans la vidéo YouTube
📑 Sommaire cliquable de la vidéo
- 00:00 – Utiliser n’importe quel LLM open weight gratuitement
- 00:21 – Qu’est ce qu’un modèle open weight ?
- 00:41 – Les 3 façons de faire tourner un modèle open weight
- 02:08 – Modal et les 30$ offerts par mois
- 03:20 – Open weight vs propriétaire : benchmark
- 04:10 – Créer et configurer son compte Modal
- 05:00 – Gérer ses token et secrets sur Hugging Face
- 06:30 – Installation et setup en local d’un LLM open weight
- 08:17 – Script Python Modal et préchargement du modèle
- 11:18 – Comment déployer une app modal
- 13:25 – Peut-on faire tourner n’importe quel modèle sur modal?
- 14:35 – Conclusion
📰 Pour aller plus loin :
Abonnez-vous à la newsletter de Raphael Breme pour recevoir le script Python complet et les mises à jour :
raphaelbreme.substack.com
Prêt à faire tourner vos premiers modèles IA ?
Commencez dès maintenant avec les 30$ offerts par Modal et découvrez la puissance des LLM open weight !
Créer mon compte Modal gratuit