Faire tourner DeepSeek V4 gratuitement sans PC surpuissant | Guide 2026
💰 30$ offerts par mois

Faire tourner DeepSeek V4 gratuitement sans PC surpuissant

Découvrez comment exécuter n’importe quel modèle LLM open weight (DeepSeek, Qwen, Mistral, Kimi K3, Gemma…) depuis votre ordinateur, gratuitement, quelle que soit votre machine !

🎯 Ce que vous allez apprendre

Dans ce guide complet, je vous explique la différence entre installer un modèle en local, louer un serveur et passer par du serverless. Puis je vous montre pas à pas comment déployer l’un des plus gros modèles existants : DeepSeek V4 Pro (plus de 800 Go) via Modal, avec 30 $ de crédit offerts chaque mois.

⚠️ Note importante : Aucun partenariat avec Modal. Testé en août 2026, l’offre peut évoluer.

🤔 Qu’est-ce qu’un modèle open weight ?

Un modèle « open weight » (poids ouverts) est un modèle d’intelligence artificielle dont les paramètres (les « poids » du réseau de neurones) sont publiquement disponibles. Contrairement aux modèles propriétaires comme GPT-4 ou Claude, vous pouvez télécharger et exécuter ces modèles sur votre propre infrastructure.

Accessibles

Téléchargeables gratuitement sur des plateformes comme Hugging Face

🎯

Personnalisables

Vous pouvez les adapter à vos besoins spécifiques

🔒

Privés

Vos données restent chez vous, pas d’envoi vers des API externes

Les modèles open weight populaires incluent DeepSeek V4, Qwen, Mistral, Kimi K3, et Gemma de Google.

Les 3 façons de faire tourner un modèle open weight

💻

1. Installation en local

Pour qui ? Les petits modèles (7B-13B paramètres)

Avantages : Gratuit, privé, rapide

Inconvénients : Nécessite du matériel puissant (GPU avec beaucoup de VRAM)

Outils : Ollama, LM Studio, llama.cpp

🖥️

2. Louer un serveur GPU

Pour qui ? Modèles moyens à gros (70B+ paramètres)

Avantages : Puissance à la demande, scalable

Inconvénients : Coût horaire, configuration nécessaire

Plateformes : RunPod, Lambda Labs, Vast.ai

☁️

3. Serverless (Modal)

Pour qui ? Tous les modèles, même les plus gros (800GB+)

Avantages : Pay-per-use, pas de gestion d’infrastructure, 30$/mois offerts

Inconvénients : Courbe d’apprentissage, latence au cold start

Plateforme : Modal.com

Le saviez-vous ? Modal est une plateforme serverless qui vous permet d’exécuter du code sur des GPU puissants sans gérer l’infrastructure. Vous ne payez que pour le temps d’exécution réel [[1]].

📊 Open weight vs propriétaire : benchmark

Les modèles open weight ont fait des progrès extraordinaires en 2026. Voici comment ils se comparent aux modèles propriétaires :

🏆 Performance

DeepSeek V4 et Qwen 3.8 rivalisent désormais avec GPT-4 et Claude sur de nombreux benchmarks, notamment en :

  • Raisonnement mathématique
  • Génération de code
  • Compréhension multilingue

⚡ Rapidité

Les modèles open weight optimisés (comme DeepSeek V4-Flash) offrent :

  • Temps de réponse plus rapides
  • Moins de latence en local
  • Pas de rate limiting

🔐 Confidentialité

Contrairement aux API propriétaires :

  • Vos données ne quittent pas votre infrastructure
  • Pas d’entraînement sur vos données
  • Conformité RGPD facilitée
📈 Écart réduit : Selon Epoch AI, l’écart entre les meilleurs modèles open-weight et les modèles fermés n’est plus que de 4 mois en moyenne depuis janvier 2026 [[16]].

Créer et configurer son compte Modal

  1. Rendez-vous sur modal.com
    Cliquez sur « Sign Up » et créez un compte avec votre email GitHub ou Google
  2. Ajoutez une carte bancaire (optionnel mais recommandé)
    Pour débloquer les 30$ de crédit mensuel (au lieu de 5$ sans carte)
  3. Installez Modal en local
    pip install modal modal setup
  4. Authentifiez-vous
    Suivez les instructions pour lier votre compte local à votre compte Modal

🔑 Gérer ses tokens et secrets sur Hugging Face

Pour accéder aux modèles protégés sur Hugging Face, vous devez créer un token d’accès :

  1. Créez un compte Hugging Face
    Rendez-vous sur huggingface.co et inscrivez-vous
  2. Générez un token
    Allez dans Settings → Access Tokens → « New token »
    Choisissez le type « read » (lecture seule suffit pour télécharger des modèles)
  3. Stockez le token en toute sécurité
    # Sur votre machine export HUGGINGFACE_TOKEN= »hf_xxxxxxxxxxxxxxxxxx »# Dans Modal, ajoutez-le comme secret modal secret create hf-secret HUGGINGFACE_TOKEN=hf_xxxxx
  4. Acceptez les conditions d’utilisation
    Pour certains modèles (comme Llama), vous devez accepter la license sur la page du modèle
⚠️ Sécurité : Ne partagez jamais votre token Hugging Face publiquement. Utilisez toujours des variables d’environnement ou des secrets gérés [[24]][[27]].

💻 Installation et setup en local d’un LLM open weight

Méthode 1 : Ollama (le plus simple)

# Installation sur macOS/Linux curl -fsSL https://ollama.com/install.sh | sh# Installation sur Windows # Téléchargez depuis ollama.com# Télécharger et lancer un modèle ollama run deepseek-v4 ollama run qwen:72b ollama run mistral:7b

Méthode 2 : LM Studio (interface graphique)

  1. Téléchargez LM Studio depuis lmstudio.ai
  2. Recherchez un modèle dans l’interface
  3. Téléchargez-le en un clic
  4. Discutez avec le modèle via l’interface chat

Méthode 3 : Transformers (pour développeurs)

from transformers import AutoModelForCausalLM, AutoTokenizer import torchmodel_name = « deepseek-ai/deepseek-v4-flash » tokenizer = AutoTokenizer.from_pretrained(model_name) model = AutoModelForCausalLM.from_pretrained( model_name, torch_dtype=torch.float16, device_map= »auto » )
💡 Configuration recommandée : Pour faire tourner un modèle 70B en local, il vous faut environ 140 Go de VRAM (en FP16) ou 70 Go (en quantifié 8-bit).

Script Python Modal et préchargement du modèle

Voici un exemple complet de script pour déployer DeepSeek V4 sur Modal :

import modal from modal import App, Image, Secret# Configuration de l’app app = modal.App(« deepseek-v4-inference »)# Image Docker avec toutes les dépendances image = ( Image.debian_slim() .pip_install( « transformers », « torch », « accelerate », « bitsandbytes » ) )# Fonction de chargement du modèle (exécutée une fois) def load_model(): from transformers import AutoModelForCausalLM, AutoTokenizer import torch model = AutoModelForCausalLM.from_pretrained( « deepseek-ai/deepseek-v4-flash », torch_dtype=torch.float16, device_map= »auto », load_in_8bit=True # Quantification pour réduire la VRAM ) tokenizer = AutoTokenizer.from_pretrained(« deepseek-ai/deepseek-v4-flash ») return model, tokenizer# Fonction d’inférence @app.function( image=image, gpu= »A100″, # ou « H100 » pour plus de puissance secrets=[Secret.from_name(« hf-secret »)], timeout=3600 # 1 heure max ) def generate_text(prompt: str, max_tokens: int = 500): model, tokenizer = load_model() inputs = tokenizer(prompt, return_tensors= »pt »).to(model.device) outputs = model.generate( **inputs, max_new_tokens=max_tokens, temperature=0.7, do_sample=True ) return tokenizer.decode(outputs[0], skip_special_tokens=True)# Point d’entrée API @app.function() @modal.web_endpoint(method= »POST ») def api_generate(data: dict): prompt = data.get(« prompt », «  ») max_tokens = data.get(« max_tokens », 500) response = generate_text.remote(prompt, max_tokens) return {« response »: response}
✨ Astuce : Le préchargement du modèle dans une fonction séparée permet de le garder en mémoire entre les appels, réduisant ainsi la latence et les coûts.

🚢 Comment déployer une app Modal

  1. Sauvegardez votre script
    Nommez-le par exemple deepseek_app.py
  2. Déployez l’application
    modal deploy deepseek_app.py
  3. Accédez à l’API
    Modal vous donne une URL publique du type :
    https://--deepseek-v4-inference-api-generate.modal.run
  4. Testez votre endpoint
    import requestsurl = « https://votre-url.modal.run » response = requests.post(url, json={ « prompt »: « Explique-moi l’IA générative », « max_tokens »: 200 }) print(response.json())

📊 Surveillez votre utilisation

Consultez votre tableau de bord Modal pour :

  • Voir votre consommation de crédits
  • Analyser les temps d’exécution
  • Optimiser vos coûts

Peut-on faire tourner n’importe quel modèle sur Modal ?

✅ Oui, mais…

Modèles supportés :

  • Tous les modèles Hugging Face
  • DeepSeek V4 Pro (800GB+)
  • Qwen, Mistral, Llama, Gemma
  • Modèles multimodaux (image, audio)

⚠️ Limitations

  • VRAM disponible : Jusqu’à 80GB par GPU (H100)
  • Modèles très larges : Nécessitent du pipeline parallelism
  • Temps de cold start : 30-60s pour charger un gros modèle
  • Coût : Les 30$ partent vite avec les très gros modèles
💰 Exemple de coût : DeepSeek V4 Pro nécessite plusieurs GPU H100 en parallèle. Avec 30$, vous aurez environ 10-15 heures d’utilisation. Suffisant pour tester, mais pas pour une utilisation intensive.

🎯 Recommandations

  • Pour tester : Commencez par DeepSeek V4-Flash ou Qwen 72B
  • Pour la prod : Utilisez des modèles plus petits (7B-13B) quantifiés
  • Pour le prototypage : Profitez des 30$ gratuits pour valider votre idée

🎯 Conclusion

Modal représente une opportunité unique pour les développeurs et chercheurs qui souhaitent expérimenter avec des modèles d’IA massifs sans investir dans du matériel coûteux. Avec 30$ de crédit offert chaque mois, vous pouvez :

Ce que vous obtenez gratuitement

  • Accès à des GPU H100/A100 haut de gamme
  • Exécution de modèles jusqu’à 800GB+
  • Infrastructure serverless scalable
  • Pas de gestion d’infrastructure
  • API publique prête à l’emploi
📝 Ressources : Le script Python complet est disponible sur la newsletter de Raphael Breme : raphaelbreme.substack.com

N’hésitez pas à partager vos retours d’expérience et à demander des démos contextualisées pour vos cas d’usage spécifiques (texte, son, vidéo, image, etc.) !

🎬 Regarder la vidéo complète

Retrouvez toutes les explications détaillées et la démonstration en direct dans la vidéo YouTube

2,475 vues
84 likes
15:04
📅 2 Sep 2026

📑 Sommaire cliquable de la vidéo

📰 Pour aller plus loin :

Abonnez-vous à la newsletter de Raphael Breme pour recevoir le script Python complet et les mises à jour :
raphaelbreme.substack.com

Prêt à faire tourner vos premiers modèles IA ?

Commencez dès maintenant avec les 30$ offerts par Modal et découvrez la puissance des LLM open weight !

Créer mon compte Modal gratuit

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Retour en haut