DeepSeek Harness : le « tueur de Claude Code » open source qui mise tout sur les plugins
Architecture « tout est plugin », benchmarks impressionnants, piège de nommage… Décryptage honnête et vérifié du lancement du 13 août 2026 — sans hype ni scepticisme facile.
🕵️ La couche invisible des agents IA
À l’intérieur de chaque agent de code que vous avez utilisé — Claude Code, Cursor, Codex… — se cache une couche dont personne ne parle. Ce n’est ni le modèle, ni la fenêtre de chat : c’est la machinerie entre les deux, celle qui permet au modèle de lire vos fichiers, d’exécuter des commandes, d’appeler des outils et de se souvenir de ce qu’il a fait cinq étapes plus tôt.
Le 13 août 2026, DeepSeek a livré sa propre version de cette couche, en open source et gratuitement, le jour même où son modèle phare passait en disponibilité générale. Son nom : DeepSeek Harness.
Et le pari est plus ambitieux qu’un simple outil de plus : DeepSeek ne cherche pas seulement à concurrencer Claude Code fonction par fonction. L’idée est qu’à long terme, posséder la couche invisible qui relie les modèles au monde réel compte davantage que posséder le modèle lui-même.
« Ni hype essoufflée qui ignore les aspérités, ni scepticisme expéditif qui ignore ce qui est genuinely intéressant : un décryptage honnête, benchmarks et angles morts compris. »
🗓️ Un lancement tout sauf accidentel
31 juillet 2026
DeepSeek re-entraîne (post-training) V4-Flash et publie de nouveaux scores agents. Le changelog crédite déjà… « DeepSeek Harness minimal mode », décrit comme « à paraître bientôt ».
13 août 2026
DeepSeek Harness entre en developer preview open source, le jour même où V4-Pro devient GA sous le nom de checkpoint V4-Pro-0813.
16 août 2026
Entrée en vigueur (16:00 UTC) de la nouvelle tarification peak / off-peak de l’API — soit aujourd’hui même !
Autrement dit, DeepSeek utilisait déjà cet outil en interne pour produire ses benchmarks, des semaines avant que quiconque puisse y toucher. Presque personne n’avait relevé ce détail en juillet… c’est pourtant l’un des fils les plus intéressants à tirer maintenant que l’outil est public. 🧵
🚗 Moteur vs harness : l’image simple
Pensez à n’importe quel assistant de code : le modèle de langage est le moteur. Très doué pour raisonner et générer du texte… mais incapable, seul, de lire un fichier sur votre machine, de lancer une commande terminal ou de se souvenir des trois dernières étapes d’une longue tâche.
Le harness (« harnais »), c’est tout ce qui est emballé autour du moteur pour en faire quelque chose qui agit : il gère les appels d’outils, suit le contexte, décide ce que le modèle voit et quand, et transforme un modèle brut en véritable agent de code.
🧩 Cordis : « tout est plugin »
Contrairement à la plupart des outils agents (un cœur solide + quelques extensions boulonnées dessus), DeepSeek Harness repose sur un framework nommé Cordis, organisé autour d’une idée presque têtue : chaque fonctionnalité est un plugin qui contribue services, événements et effets dans un contexte partagé.
Il n’y a pas de noyau privilégié au centre par lequel tout devrait passer. Rien à patcher, car il n’y a tout simplement pas de centre fixe.
Adaptateur de modèle
La partie qui parle à l’API DeepSeek ? Un plugin.
Registre d’outils
Qui décide des capacités de l’agent ? Un plugin.
Journal de session
Qui enregistre toute la conversation ? Un plugin.
Boucle de l’agent
Le cycle penser-agir-observer lui-même ? Un plugin.
S’y ajoutent deux concepts : les profils et les bundles. Une instance du harness n’est pas un logiciel figé : elle est assemblée au démarrage à partir de configurations empilées, comme une machine remontée à chaque fois avec des pièces interchangeables. Résultat : on peut remplacer le modèle, le jeu d’outils, le stockage de session ou même l’interface par configuration, sans forker ni réécrire le code source.
♟️ Un pari stratégiquement opposé à Anthropic
Claude Code est un produit fermé, très intégré, conçu pour fonctionner extrêmement bien dès l’installation, sans assemblage. DeepSeek, lui, ne joue pas sur cet axe : il veut posséder la couche d’infrastructure composable sous les outils agents — la tuyauterie sur laquelle d’autres développeurs et entreprises construiront leurs propres agents.
Cette flexibilité est puissante si vous voulez un harness sur mesure pour votre workflow. Mais si vous voulez juste un agent qui marche dès l’installation, toute cette composabilité ajoute de la friction.
« DeepSeek Harness ne cherche pas à être le plus facile à prendre en main. Il cherche à être le plus adaptable sur lequel construire. »
📓 Steps, turns & le journal de session append-only
Tout ce que fait l’agent s’organise autour de deux unités simples :
Step (pas)
Une requête au modèle + les appels d’outils qui reviennent attachés à cette requête.
Turn (tour)
Une séquence de steps qui finit par aboutir à une réponse finale.
Cette distinction donne au système une unité cohérente pour construire la mémoire, la récupération et la relecture. Vient alors un choix de design discrètement crucial : le journal de session append-only (ajout uniquement). Tout ce que le modèle voit — messages, résultats d’outils, contexte — doit être reconstructible uniquement depuis ce journal.
Conséquences magiques ✨ : reprendre une session exactement où elle s’était arrêtée, forker une session en une nouvelle branche sans toucher l’originale, et rejouer une session depuis n’importe quel point antérieur — rembobiner l’historique de l’agent et le regarder se dérouler à nouveau. Pour quiconque a déjà perdu une longue session sur un crash ou un terminal fermé, ce choix « ennuyeux » devient un sauvetage.
🎚️ Les 3 modes d’exploitation
Standard
Tout le jeu d’outils disponible, rien n’est retenu. L’expérience complète.
Code
Le modèle écrit lui-même du code qui orchestre ses appels d’outils sur plusieurs rounds : il scripte son propre workflow.
Minimal
Configuration volontairement dépouillée, paramètres d’échantillonnage fixes et immuables.
⚙️ Installation, prérequis & le twist tarifaire
Deux chemins principaux : la voie express via npx (une commande qui lance une interface web locale sans setup manuel), ou la compilation depuis les sources (pour inspecter, modifier, contribuer à l’écosystème de plugins). Prérequis : une version raisonnablement récente de Node.js et une clé API DeepSeek.
Et voici le détail pratique qui tombe pile après le lancement : la tarification actuelle ne tient que jusqu’au 16 août 2026, 16:00 UTC. Ensuite, V4-Pro et V4-Flash passent en tarification peak / off-peak, avec des tarifs off-peak à environ la moitié des tarifs peak. Si vous envisagez un usage sérieux et continu, ce n’est pas une note de bas de page — c’est un facteur de décision. (Pour info : l’article est publié le jour même de ce changement ! 😉)
⚠️ Le piège du nommage : même nom, mêmes commandes, autres outils
Voici le détail que presque personne n’a mentionné : si vous cherchez « DeepSeek Harness » pour l’installer, vous ne regardez pas un projet… mais plusieurs outils complètement différents qui partagent le même nom — et parfois la même commande dsh :
| Projet | Origine | C’est quoi ? |
|---|---|---|
| deepseek-ai/deepseek-harness (GitHub, npx) | ✅ Officiel DeepSeek | Le harness agent décrit dans cet article. |
| Paquet Python « deepseek-harness » (PyPI, depuis mai) | ❌ Développeur indépendant | Adaptateur de protocole, sans lien avec DeepSeek. |
| Projet GitHub tiers (4 formats : lib Python, CLI, serveur TypeScript, skill file Anthropic) | ❌ Non officiel | Même concept, autre problème à résoudre. |
Ces outils non officiels sont des adaptateurs de protocole : ils documentent et contournent les bizarreries de l’API DeepSeek (préserver le « reasoning content » sur les appels multi-tours, gérer une limite de tokens non documentée…). Utiles pour leur usage… mais ce n’est pas du tout le harness officiel.
dsh qui tourne… en faisant quelque chose de totalement différent de ce que vous attendiez, sans aucun avertissement. Règle d’or : vérifiez toujours que vous êtes sur l’organisation GitHub deepseek-ai. (Et prudence doublée sur PyPI, où des paquets malveillants usurpant DeepSeek ont déjà été signalés par le passé.)📊 Benchmarks : les chiffres décortiqués
Le chiffre phare mis en avant : 87,9 sur Terminal-Bench 2.1, un bond spectaculaire par rapport au preview d’avril (72,1). Les écarts les plus larges entre anciennes et nouvelles versions apparaissent sur DeepSWE et NL2Repo. Voici les scores publiés par DeepSeek pour V4-Pro-0813 :
* Sets d’évaluation internes à DeepSeek. Source : changelog officiel DeepSeek API, 13/08/2026.
🔬 Analyse critique : le manque de vérification indépendante
Soyons clairs : chacun de ces chiffres est produit par DeepSeek, mesuré avec le harness de DeepSeek, faisant tourner les modèles de DeepSeek, en mode minimal. Cela ne les rend pas sans valeur — mais ce sont des résultats fournis par le vendeur, pas vérifiés indépendamment.
- Les reproductions indépendantes restent minces : quelques tentatives communautaires sur Terminal-Bench s’approchent des claims… un point de données, pas un corpus de confirmation.
- 🗂️ Les sites de suivi dédiés aux benchmarks tiers montrent encore des sections vides pour ce release.
- 📉 Une version indépendante du benchmark DeepSWE, conçue pour éviter la contamination, aurait scoré V4-Pro bien en dessous du chiffre du harness vendeur.
- 🏠 DSBench-FullStack et DSBench-Hard sont des sets internes : construits par DeepSeek, pour DeepSeek, afin de mesurer DeepSeek.
« Quand vous lisez un graphique de benchmarks d’une entreprise d’IA, la distinction test interne / test externe est souvent la ligne la plus importante de tout le tableau… et c’est généralement le plus petit texte de la page. »
⚖️ Verdict : tueur de Claude Code ou pas ?
Aujourd’hui, DeepSeek Harness est une infrastructure agnostique du modèle, en developer preview, dont la propre documentation annonce ouvertement des breaking changes à venir. Claude Code, en comparaison, est un produit mûr, poli par l’usage réel de milliers de développeurs. L’intention de défier Anthropic est réelle ; mais intention et capacité actuelle sont deux choses différentes : ce ne sont pas (encore) des produits fonctionnellement équivalents.
Ce qui est vraiment impressionnant, c’est la vitesse de l’écosystème : topic GitHub dédié pour les plugins, index communautaires de plugins (mémoire, apps desktop, terminaux, intégrations à d’autres agents), Discord actif, et des dizaines de milliers d’étoiles GitHub en quelques heures — à traiter comme un instantané d’enthousiasme, pas comme une métrique fixe.
Et l’humour cynique des devs n’est pas loin 😄 : « on croule sous tellement de harness qu’il nous faudrait… un harness pour gérer tous nos harness ». Drôle, mais révélateur d’une vraie fatigue face à la fragmentation du secteur.
Le succès du pari dépendra d’une seule chose : l’écosystème de plugins continuera-t-il de grandir comme ces premiers jours, ou s’essoufflera-t-il comme tant de lancements open source ambitieux ? Rendez-vous quand la poussière sera retombée. 🌪️
✅ Fact-check : corrections apportées à la retranscription
| Transcription audio | Correction | Statut |
|---|---|---|
| « DeepSeek Carnis » | DeepSeek Harness | ✏️ Erreur de transcription |
| « Teleflon Verified » | Toolathlon-Verified (benchmark d’usage d’outils) | ✏️ Corrigé (changelog officiel) |
| « repost trained V4 Flash » | Re-post-training de V4-Flash (0731), publié le 31/07/2026 | ✏️ Reformulé |
| « Claude Co-work » | Claude Cowork | ✏️ Orthographe |
| Terminal-Bench 2.1 = 87,9 | Confirmé | ✅ Vérifié |
| Nouveau tarif au 16/08/2026, off-peak = ½ peak | Confirmé (16:00 UTC) | ✅ Vérifié |
Architecture Cordis « tout est plugin », cmd dsh | Confirmé (licence MIT, Node.js) | ✅ Vérifié |
| Confusion PyPI / projets homonymes | Confirmé (projets non officiels existants) | ✅ Vérifié |
🎬 La vidéo originale + sommaire cliquable
▶
20:13
« DeepSeek Just Open Sourced a Claude Code Killer! » — Panda Making Money
Cliquez sur un chapitre pour ouvrir la vidéo au bon moment ⏱️ :
