SYSTEM / JANV.2025
Les 7 avancées clés de Deepseek dans le domaine des LLMs.
Le cas DeepSeek mérite un vrai arrêt. L’équipe affirme avoir construit un modèle jusqu’à 20 fois moins cher qu’OpenAI, avec des choix techniques assez nets autour du RL, de la distillation et du pipeline d’entraînement. Voici les 7 points à regarder.

DeepSeek affirme avoir construit un modèle jusqu’à 20 fois moins cher qu’OpenAI, tout en gardant des performances proches sur plusieurs benchmarks. Les 7 points à regarder sont le RL direct, le couplage avec les Chain-of-Thought, la distillation, la lisibilité...
DeepSeek mérite qu’on s’y arrête pour une raison précise. L’équipe affirme avoir obtenu un modèle jusqu’à 20 fois moins cher qu’OpenAI, tout en gardant des performances proches sur plusieurs benchmarks. Pour comprendre l’écart, il reste a regarder les choix d’entraînement, la place du RL et le travail fait sur les modèles distillés.
1. Le retour du RL direct
DeepSeek remet le Reinforcement Learning (RL) au centre de l’entraînement, avec une approche moins classique. L’équipe applique directement du RL sur le modèle de base, sans commencer par un entraînement supervisé coûteux ni par un fine-tuning classique en amont.
👉 Résultat, l’entraînement utilise moins de ressources et avance plus vite. Les itérations peuvent améliorer le modèle sans repartir de zéro à chaque fois. C’est une approche plus lisible côté opérationnel, parce qu’elle réduit une partie des étapes lourdes qui pèsent dans l’entraînement d’un LLM.
2. RL et Chain-of-Thought très liés
DeepSeek associe aussi le RL aux chaînes de raisonnement, les Chain-of-Thought (CoT). Le modèle apprend à dérouler un raisonnement étape par étape, ce qui compte pour les tâches complexes comme les mathématiques, le code ou les problèmes scientifiques.
👉 Exemple concret, sur le benchmark MATH-500, DeepSeek-R1 atteint 97,3 %, un score qui dépasse la plupart des autres modèles.
3. Des modèles plus petits grâce à la distillation
DeepSeek a travaillé la distillation des capacités des grands modèles vers des versions plus légères. L’équipe récupère ce qui fonctionne dans le modèle principal, puis le transfère vers des modèles plus petits.
👉 Résultat, des versions distillées comme DeepSeek-R1-Distill-Qwen-7B font mieux que certains modèles plus gros, avec une consommation de ressources plus faible.
👉 Pour les usages limités par le coût ou par la capacité de calcul, l’intérêt est direct. Un modèle plus léger peut tourner dans davantage de contextes, avec une facture plus basse et moins de contraintes d’infrastructure.
4. Des réponses plus lisibles
DeepSeek accorde aussi beaucoup d’importance à la lisibilité des réponses. Avec une phase de Cold Start, l’équipe fine-tune le modèle sur des données propres et structurées. L’objectif est d’obtenir des réponses claires, mieux organisées, sans mélange de langues ni contenu confus.
👉 Cette partie est ensuite renforcée par des récompenses pendant le RL. Le modèle est orienté vers des réponses plus proches de ce que les humains préfèrent lire, au lieu de produire uniquement une sortie correcte sur le plan technique.
5. Raisonnement auto-évolutif et aha moments
Pendant l’entraînement, DeepSeek observe des comportements intéressants. Le modèle apprend à prolonger ses réflexions, à corriger ses propres erreurs, puis à essayer d’autres stratégies pour résoudre un problème.
👉 L’équipe appelle ces comportements des aha moments. Ils montrent que le RL peut pousser un modèle à évoluer de façon autonome, sans intervention humaine directe à chaque étape de correction.
6. Des performances proches des modèles d’OpenAI
DeepSeek-R1, avec un coût bien inférieur, rivalise avec des modèles phares d’OpenAI comme o1-1217 sur plusieurs catégories.
- Mathématiques et raisonnement scientifique avec des scores similaires ou supérieurs.
- Codage avec un très bon niveau sur des compétitions comme Codeforces.
- Écriture et tâches créatives avec de bons résultats sur des benchmarks comme AlpacaEval et ArenaHard.
Ce qui ressort ici, c’est le rapport entre le coût annoncé et la performance mesurée. DeepSeek ne mise pas sur un score isolé. Le modèle tient sur plusieurs familles de tâches, ce qui rend la comparaison avec les modèles d’OpenAI plus intéressante.
7. Un pipeline d’entraînement en plusieurs étapes
Pour obtenir ces résultats, DeepSeek utilise un pipeline d’entraînement structuré.
Cold Start, avec un fine-tuning initial sur des données propres et structurées.
RL ciblé, pour améliorer les capacités de raisonnement logique.
Rejection Sampling, avec une collecte de nouvelles données qui écarte les mauvaises réponses.
RL global, pour aligner le modèle avec les préférences humaines sur une grande variété de scénarios.
👉 Cette méthode améliore les performances étape par étape, tout en gardant une approche plus efficace et moins coûteuse.
DeepSeek montre qu’un modèle peut coûter beaucoup moins cher tout en restant compétitif face aux meilleurs modèles d’OpenAI. Le RL direct, la distillation vers des modèles plus petits et l’optimisation du pipeline expliquent une bonne partie de l’écart. Les détails techniques sont documentés dans le papier publié sur arXiv.