Ornith 1.5 : L’IA Open-Source Qui S’Auto-Entraîne Vraiment ?
DeepReinforce révolutionne l’IA avec des modèles qui génèrent leurs propres tâches d’entraînement. Analyse complète des performances, benchmarks et guide pratique de déploiement.
Introduction & Premières Impressions
Ornith-1.5 vient tout juste de faire son apparition sur la scène de l’IA open-source, promettant des modèles capables de s’auto-entraîner. Mais cette affirmation d’auto-amélioration tient-elle vraiment la route, ou s’agit-il simplement d’un argument marketing ?
En bref : DeepReinforce propose trois tailles de modèles (397B, 35B et 9B) qui dépassent le concept de « self-scaffolding » de la version 1.0 pour atteindre ce qu’ils appellent une auto-amélioration complète.
Le modèle phare 397B revendique des performances comparables à Claude Opus 4.8 sur le coding agentique. Mais creusons ensemble pour comprendre ce qui est réellement nouveau, ce qui est recyclé de la version 1.0, et où les chiffres méritent un certain scepticisme.
De Ornith 1.0 à 1.5 : L’Évolution
Ornith 1.0
Self-scaffolding : le modèle écrivait son propre harness d’agent (mémoire, logique de retry, orchestration d’outils)
Ornith 1.5
Self-improvement complet : boucle fermée où le modèle propose ses tâches, construit le harness et génère ses rollouts
Trois Tailles
397B (flagship), 35B (MoE), et 9B (dense) assez petit pour tourner sur mobile
La grande différence réside dans l’ampleur de l’autonomie. Là où la version 1.0 se contentait de générer son propre harness pour résoudre des tâches prédéfinies, la version 1.5 crée ses propres tâches d’entraînement en identifiant ses propres lacunes.
Comment Fonctionne la Boucle d’Auto-Amélioration
Le mécanisme d’auto-amélioration repose sur trois étapes entraînées conjointement via l’algorithme GRPO (Group Relative Policy Optimization). Contrairement à ce qu’on pourrait penser, cela se produit pendant l’entraînement, pas pendant l’inférence sur votre machine.
1. Génération de Tâches
Le modèle analyse son historique de résolution et propose une nouvelle tâche progressivement plus difficile, ciblant délibérément ses lacunes plutôt que de piocher dans un ensemble fixe de problèmes.
2. Construction du Scaffold
Pour cette tâche, le modèle construit ou affine un harness spécifique : instructions, outils disponibles, stratégie de décomposition et approche d’orchestration.
3. Solution Rollout
Le modèle tente la tâche sous le scaffold qu’il vient de construire, produisant un rollout qui est ensuite évalué.
L’innovation clé : La récompense du rollout se propage à travers les trois étapes via GRPO. Le modèle apprend simultanément à générer de meilleurs problèmes, de meilleurs scaffolds ET de meilleures solutions.
Le Système de Récompense
Le système de récompense d’Ornith 1.5 évalue chaque solution selon trois critères fondamentaux qui déterminent la qualité de l’apprentissage :
- Validité : La solution fonctionne-t-elle correctement ? Le code produit passe-t-il les tests ?
- Difficulté : La tâche générée représente-t-elle un défi approprié ni trop facile ni impossible ?
- Nouveauté : La tâche apporte-t-elle quelque chose de nouveau par rapport à l’historique d’entraînement ?
Cette approche multi-critères permet d’éviter les écueils classiques du reinforcement learning où le modèle pourrait optimiser pour des solutions triviales. Ici, il doit constamment repousser ses limites tout en maintenant un haut niveau de qualité.
Benchmarks : Les Performances Réelles
Ornith-1.5-397B (Flagship MoE)
| Benchmark | Ornith-1.5-397B | Claude Opus 4.8 | GLM-5.2 | Ornith-1.0-397B |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.1 | 85.0 | 82.7 | 77.5 |
Ornith-1.5-35B (MoE, A3B active)
| Benchmark | Ornith-1.5-35B | Ornith-1.0-35B | Qwen3.6-35B | Gemma-4-31B |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 74.8 | 64.2 | 52.5 | 42.1 |
| SWE-bench Verified | 80.1 | 75.6 | 73.4 | 52.0 |
Ornith-1.5-9B (Dense)
| Benchmark | Ornith-1.5-9B | Ornith-1.0-9B | Qwen3.5-9B | Qwen3.6-35B |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 58.3 | 43.1 | 21.3 | 52.5 |
| SWE-bench Verified | 71.8 | 69.4 | 53.2 | 73.4 |
| GPQA Diamond | 86.4 | – | – | – |
| BrowseComp | 56.4 | 44.8 | – | – |
Point important : Tous ces chiffres proviennent de DeepReinforce lui-même sans vérification indépendante pour l’instant. Un benchmark indépendant sur HackerNews montre des résultats légèrement différents pour le modèle 35B.
Auto-Amélioration : Réalité ou Marketing ?
Après analyse, le mécanisme est réel : génération de tâches, construction de scaffold et rollouts de solutions sont effectivement entraînés conjointement via GRPO. Cependant, il est crucial de comprendre que :
Ce n’est pas magique : Cela se produit pendant l’entraînement, pas au moment de l’inférence. Le modèle que vous téléchargez n’édite pas ses propres weights après téléchargement. C’est un « data flywheel » au moment de l’entraînement, pas une IA qui se réécrit en temps réel.
L’innovation réside dans le fait que le même signal de gradient touche les trois étapes simultanément. Le modèle n’apprend pas seulement à résoudre des problèmes fixes — il apprend simultanément à générer de meilleurs problèmes et de meilleurs scaffolds.
Déploiement Pratique & Configuration Matérielle
Configuration Requise par Modèle
Ornith-1.5-9B
GPU : Single GPU consumer ou Apple Silicon
VRAM : ~19 GB en bfloat16
Mobile : Version quantisée disponible (iPhone/Android)
Formats : GGUF, MLX, NVFP4
Ornith-1.5-35B
GPU : Single GPU 24GB+ recommandé
Type : MoE (A3B active)
Formats : FP8, GGUF, MLX
Optimisé : vLLM, SGLang
Ornith-1.5-397B
GPU : Multi-GPU requis
Type : MoE flagship
Usage : Serving distribué
Format : FP8 principalement
Comment L’Utiliser
- Contexte : 262,144 tokens natifs, extensible à ~1M avec YaRN
- Intégrations : Hermes Agent, OpenClaw, Unsloth Studio
- API : Compatible OpenAI-style tool calls
- Reasoning : Thinking trace automatique dans des tags spéciaux
Verdict Final & Points Clés
Les Points Forts
- Véritable innovation dans l’auto-amélioration pendant l’entraînement
- Performances impressionnantes pour la taille (surtout le 9B)
- Open source avec poids disponibles sur Hugging Face
- Déploiement accessible (9B sur GPU consumer)
- Excellentes performances en coding agentique
Les Points de Vigilance
- Benchmarks auto-déclarés sans vérification indépendante complète
- L’auto-amélioration se fait à l’entraînement, pas à l’inférence
- Le 397B nécessite une infrastructure lourde
- La réception de la version 1.0 avait été mitigée en usage réel
Notre Conclusion
Ornith-1.5 représente un bond en avant réel dans l’approche de l’entraînement des modèles d’IA. Le mécanisme d’auto-amélioration n’est pas du marketing — il est réel et bien implémenté. Cependant, il faut tempérer l’enthousiasme :
Le modèle ne s’améliore pas magiquement après téléchargement. C’est un outil d’entraînement sophistiqué qui produit de meilleurs modèles, pas une IA qui évolue en temps réel sur votre machine.
Pour les développeurs qui cherchent un modèle de coding open-source performant, particulièrement le 9B ou 35B, Ornith-1.5 mérite vraiment d’être testé. Les benchmarks sont solides et l’accessibilité matérielle est un vrai atout.
Regarder la Vidéo Complète
Découvrez l’analyse détaillée de Panda Making Money sur Ornith 1.5
Sommaire de la Vidéo (Liens vers YouTube)
Essayez Ornith-1.5 Dès Maintenant
Les modèles sont disponibles en open source sur Hugging Face. Commencez avec le 9B pour tester sur votre machine locale.
Accéder à Ornith-1.5