La nouvelle génération de modèles de DeepSeek est devenue le centre d'un débat technologique, avec une proposition très claire : contexte allant jusqu'à un million de jetons et une architecture de plus d'un billion de paramètres Conçue pour être efficace et, surtout, beaucoup moins chère que les alternatives en boucle fermée aux États-Unis, la société chinoise a misé à fond sur la V4, une gamme qui combine des poids ouverts, une fenêtre de contexte immense et une stratégie de prix agressive.
Cette initiative intervient à un moment où l'Europe et l'Espagne examinent de près le coût et la souveraineté technologique de l'IA. DeepSeek V4 se présente comme une option intéressante pour les startups, PME et grandes entreprises européennes. qui ont besoin de capacités de pointe, mais qui ne peuvent pas – ou ne veulent pas – dépendre entièrement d’API propriétaires coûteuses ou de matériel exclusif comme les GPU NVIDIA les plus recherchés.
Une famille V4 centrée sur 1T de paramètres et un contexte de 1M de jetons

DeepSeek a annoncé l'arrivée de DeepSeek-V4 Preview, une famille de modèles ouverts qui s'articule autour de deux idées : une fenêtre de contexte pouvant atteindre 1 million de jetons et des architectures géantes basées sur le modèle Mixture-of-Experts (MoE)Au sein de cette famille, deux variantes principales se distinguent : DeepSeek-V4-Pro et DeepSeek-V4-Flash, toutes deux caractérisées par une capacité de 1M.
Dans sa version la plus ambitieuse, le V4-Pro affiche des performances de jusqu'à 1,6 billion de paramètres au total (1,6 T), bien qu'elle n'active que 32 à 49 milliards de paramètres par étape d'inférence grâce au schéma MoE, essentiel au maintien de son efficacité. Parallèlement, la société a lancé des versions plus légères, telles que V4-Flash et V4-Lite, avec environ 284 à 285 milliards de paramètres au total et environ 13 milliards de paramètres actifs, conçues pour les déploiements où la vitesse et le coût sont prioritaires.
Le nombre total de paramètres place la gamme V4 en tête du marché, mais le détail important est que Seule une fraction de ces experts sont activés par jeton.Cela lui permet de se comporter comme un modèle gigantesque en termes de capacité, tout en consommant de l'énergie de calcul comparable à celle de modèles beaucoup plus petits. Cette approche est en parfaite adéquation avec la stratégie de DeepSeek : concurrencer les grands modèles propriétaires sans faire exploser les coûts d'utilisation.
L'entreprise a également publié des versions préliminaires comme la V4-Lite, qui servent de validation technique, et a ajusté le calendrier de déploiement. La version V4 est encore en phase de test limitée. Dans certains contextes, la famille V4 Preview peut déjà être utilisée dans le chatbot officiel et via l'API mise à jour de l'entreprise, avec le contexte 1M comme valeur par défaut dans ses services.
Une architecture hybride et un mélange d'experts pour rendre le contexte à long terme viable
La capacité de DeepSeek à offrir une fenêtre de contexte d'un million de jetons sans que le coût d'inférence n'explose réside dans son architecture. Le fabricant explique que la version 4 introduit… une combinaison de soins hybrides, de mixité d'experts et de techniques de compression conçu pour fonctionner avec des séquences très longues, réduisant à la fois les FLOP par jeton et la mémoire requise.
Parmi les composants techniques mentionnés par l'entreprise, les suivants se distinguent : L'attention latente multi-têtes (MLA), l'attention parcimonieuse DeepSeek (DSA) et les mécanismes de mémoire conditionnelle tels que les engrammes.Ensemble, ces composants visent à réduire la charge de calcul de l'attention, notamment lorsque le modèle doit traiter des centaines de milliers ou un million de jetons en une seule passe.
Selon les données communiquées par l'entreprise elle-même, dans des scénarios portant sur 1 million de jetons DeepSeek-V4-Pro peut nécessiter environ 27 % des FLOPs par jeton et seulement 10 % du cache KV par rapport aux versions précédentes comme DeepSeek-V3.2.Des variantes plus légères, telles que V4-Flash, réduisent encore ces chiffres, se positionnant comme des solutions d'inférence rapides pour les applications où la latence est critique.
Ces types d'améliorations ne sont pas que théoriques : l'entreprise affirme que la combinaison du MoE, de l'attention dispersée et de la compréhension du contexte permet opérer avec un contexte ultra-long dans matériel moins extrême déjà un coût par million de jetons nettement inférieur à celui de nombreux modèles fermés avec des fenêtres de 128 000 ou 200 000 jetons.
Performance dans les tâches de raisonnement, de programmation et d'agentivité
DeepSeek ne cherche pas seulement à se démarquer par sa taille et son contexte. Dans ses comparaisons internes, l'entreprise insiste sur le fait que V4-Pro et ses variantes ont été spécialement optimisés pour le raisonnement complexe, la programmation et les agentsCes trois domaines représentent actuellement une part importante de la demande des entreprises. Des outils de référence tels que SWE-bench, conçus pour mesurer la capacité de Comprendre et modifier les dépôts de codeOn parle de chiffres supérieurs à 80 % de précision, ce qui correspond aux principaux modèles fermés.
Dans le raisonnement plus général, notamment en mathématiques, dans les disciplines STEM et pour les problèmes de chaîne de pensée, la société place V4-Pro comme l'un des modèles ouverts les plus performantset affirme qu'elle se rapproche du niveau des propositions de fermeture des frontières. En termes de notoriété mondiale, les données internes la placent à l'avant-garde de l'écosystème ouvert et juste derrière quelques modèles propriétaires très spécifiques, tels que certaines variantes avancées de Gemini.
Au-delà des chiffres, l'accent est mis sur tâches d'agent Cela suggère une utilisation qui va bien au-delà du simple chat. DeepSeek affirme que V4 gère déjà sa propre infrastructure d'agents de code et de systèmes qui enchaînent plusieurs étapes.Ils accèdent à des outils et travaillent sur de vastes référentiels ou bases de données documentaires. Cette approche s'inscrit dans la tendance actuelle du secteur, où de nombreuses entreprises ne recherchent plus seulement un chatbot, mais des assistants capables de fonctionner comme de véritables « collègues numériques » au sein de flux de travail complexes.
Ces comparaisons sont à prendre avec des pincettes : comme pour presque toutes les versions récentes d’IA, La plupart des données proviennent de l'entreprise elle-même et de tests réalisés en environnements contrôlés.Malgré cela, la combinaison d'un contexte long, d'une architecture efficace et de performances compétitives suscite l'attention des développeurs européens qui comparent les coûts et les capacités à des options telles que GPT, Claude, Llama ou Mistral.
Modèles ouverts, pondérations publiées et compatibilité avec les API populaires
L'un des facteurs clés qui ont fait la notoriété de DeepSeek est son engagement envers l'écosystème ouvert. Avec la V4, l'entreprise renforce cette approche : a publié le rapport technique et a diffusé les poids libres de la famille sur des plateformes telles que Hugging Facepermettre aux chercheurs, aux entreprises et aux administrations publiques de télécharger les modèles et de les exécuter sur leur propre infrastructure.
Cette approche ouverte des poids, contrairement aux propositions totalement fermées de nombreux laboratoires américains, a des implications claires pour l'Espagne et l'Union européenne. La possibilité de déployer ces modèles dans centres de données au sein de l'UEdans le cadre de réglementations telles que le RGPD et le futur règlement de l'UE sur l'IAElle offre la possibilité de conserver un meilleur contrôle des données sans sacrifier les fonctionnalités de pointe.
En termes d'intégration pratique, DeepSeek a choisi de réduire les frictions : L'API conserve la même URL de base et est compatible avec les schémas ChatCompletions d'OpenAI et avec le Interfaces anthropiquesPour de nombreuses équipes de développement, cela signifie que la migration des tests ou d'une partie du trafic vers la version 4 se limite essentiellement à la modification de l'identifiant du modèle en deepseek-v4-pro ou deepseek-v4-flash et à l'ajustement de quelques paramètres.
Dans le même temps, la société a établi un calendrier pour le retrait des anciens modèles, tels que deepseek-chat et deepseek-reasoner. Elles seront abandonnées et redirigées vers V4-Flash jusqu'à leur retrait définitif, ce qui oblige les utilisateurs à se préparer à la migration. C'est un moyen clair de concentrer l'offre sur la nouvelle génération et d'éviter de fragmenter la base d'utilisateurs en trop de versions anciennes.
Coûts d'inférence maîtrisés et accent mis sur l'efficacité économique
Depuis sa création, DeepSeek s'est toujours concentré sur l'efficacité. Avec la version 4, ce discours est renforcé par une combinaison d'architecture MoE, d'attention distribuée et d'optimisation matérielle visant à… abaisser le coût par million de jetons à des niveaux bien inférieurs à ceux des API premium les plus connues.Certaines analyses externes mentionnent des chiffres d'environ 0,30 $ par million de jetons d'entrée pour certaines configurations, une fraction de ce que facturent les modèles fermés haut de gamme.
Dans le contexte européen, où les coûts des infrastructures et de l'énergie sont importants, cette priorité accordée à l'efficacité correspond bien aux besoins des startups et des PME. Traitement de volumineux documents juridiques, de longs dossiers médicaux ou de référentiels logiciels complets. Ce n'est plus un luxe réservé aux entreprises aux budgets quasi illimités, mais une solution abordable pour les projets émergents.
Certains fournisseurs d'infrastructures d'IA proposent déjà un accès anticipé aux nœuds basés sur DeepSeek V4 dans leurs catalogues, ce qui facilite la tâche des entreprises européennes. Ils peuvent ainsi évaluer les performances et les coûts réels sans avoir à construire leur propre infrastructure à partir de zéro.Pour de nombreuses organisations, cette phase de test constitue l'étape préliminaire avant de décider de poursuivre avec un modèle externalisé ou d'opter pour des déploiements sur site.
Parallèlement, le silence relatif de l'entreprise concernant les coûts exacts de formation et le matériel spécifique utilisé a suscité des interrogations dans certains secteurs. Depuis 2025, des soupçons circulent quant au volume réel des ressources nécessaires à l'entraînement de ses modèles, notamment des estimations évoquant plusieurs dizaines de milliers de GPU haut de gamme. DeepSeek insiste sur le fait qu'elle a atteint une nouvelle étape de « contexte rentable à long terme ».Mais elle n'a pas encore complètement levé les incertitudes concernant l'ampleur matérielle de ses opérations.
Impact sur les startups et les entreprises en Espagne et en Europe
Pour l'écosystème entrepreneurial européen, et en particulier pour les startups technologiques espagnoles, l'émergence de modèles comme DeepSeek V4 ouvre des perspectives qui, jusqu'à récemment, étaient difficiles à envisager. Accédez à un modèle comportant plus d'un billion de paramètres dans le contexte de 1 million de jetons et de pondérations ouvertes. Elle vous permet d'explorer des produits de pointe sans dépendre exclusivement des fournisseurs de la Silicon Valley.
Dans les secteurs réglementés – finance, santé, droit, administration publique – la possibilité de Exécutez le modèle dans des centres de données situés au sein de l'UE ou même dans vos propres installations. Ceci est particulièrement pertinent. La conformité au RGPD et aux réglementations nationales en matière de protection des données est facilitée lorsque les informations n'ont pas à quitter les juridictions européennes pour être traitées par un modèle d'IA.
Les startups espagnoles qui traitent de gros volumes de documents, comme les technologies juridiques, les technologies de la santé ou les outils de développement, peuvent tirer parti du contexte du million de jetons pour l'analyse de dossiers complets, de très longs historiques médicaux ou de référentiels de code monolithiques sans avoir à les diviser en plusieurs morceaux ni à concevoir des systèmes de récupération complexes. Cela réduit la complexité technique et, dans de nombreux cas, la latence également.
Parallèlement, il est important de garder à l'esprit les risques : l'écosystème d'outils entourant DeepSeek est plus récent que celui d'autres modèles ouverts comme Llama, et La documentation et le soutien communautaire sont encore en développement.De plus, le fait qu'il s'agisse d'une entreprise chinoise introduit une dimension géopolitique que certaines organisations européennes perçoivent avec prudence, notamment dans les projets liés aux administrations ou aux infrastructures critiques.
Une mesure qui exerce une pression sur les modèles fermés et coûteux
Au-delà de ses spécifications précises, DeepSeek V4 est interprété dans le secteur comme une nouvelle étape dans la pression concurrentielle exercée sur les modèles fermés les plus chers du marchéEn établissant le contexte de jeton 1M comme norme pour l'ensemble de ses services officiels et en l'accompagnant de pondérations ouvertes, l'entreprise chinoise envoie un message clair : le contexte ultra-long n'a plus besoin d'être une caractéristique exclusive de quelques modèles propriétaires onéreux.
Pour les grands laboratoires occidentaux, cela représente un défi. OpenAI, Anthropic et Google ont historiquement utilisé une combinaison de écosystème exclusif de meilleure qualité, au contexte plus large et protégé comme proposition de valeur. L'émergence d'une alternative ouverte, parfois même supérieure et à très bas coût, oblige à repenser les stratégies de produit et de prix, notamment dans les segments où les marges des entreprises utilisatrices sont faibles.
Dans le monde hispanophone, où de nombreuses start-ups fonctionnent avec des budgets bien plus modestes que leurs homologues américaines, la pression concurrentielle joue en leur faveur. Plus les modèles disponibles seront puissants et ouverts, plus les équipes techniques auront la possibilité de choisir en fonction du prix, de la conformité réglementaire et du cas d'utilisation.et pas seulement de la part de la marque qui gère l'API.
Dans le même temps, DeepSeek sait que son pari n'est pas sans défis : la plupart des benchmarks et des comparaisons proviennent de sa propre documentation ou de tests effectués en phase de prévisualisation, et le marché attend toujours de voir comment les modèles V4 se comportent lorsqu'ils sont déployés massivement dans des environnements de production exigeants, y compris européens.
Globalement, l'arrivée de DeepSeek V4 confirme une tendance qui se dessinait depuis un certain temps : Les modèles d'IA de pointe ne sont plus l'apanage de quelques entreprises aux systèmes fermés et aux budgets astronomiques.Avec une combinaison de plus d'un billion de paramètres, un contexte d'un million de jetons, des pondérations ouvertes et un discours axé sur l'efficacité, l'entreprise chinoise propose une alternative que les entreprises et les développeurs en Espagne et en Europe auront du mal à ignorer dans leurs prochains projets d'adoption et de renouvellement de l'infrastructure d'IA.