ORGANISATION VÉRIFIÉE

DeepSeek

Consultez les modèles documentés, les évaluations publiées et les sources primaires associées à cette organisation.

01 / MODÈLES

Catalogue vérifié

02 / ÉVALUATIONS

Résultats publiés

Les chiffres sont présentés avec le contexte communiqué par leur source. Un résultat du fournisseur n’est pas une comparaison indépendante et ne remplace pas votre propre évaluation.

ModèleBenchmarkRésultatMétrique
DeepSeek V4.1 FlashGPQA Diamond90,9 %Exactitude
DeepSeek V4.1 FlashTerminal-Bench 2.190,6 %Exactitude
DeepSeek V4.1 FlashDeepSWE v1.174,2 %Résolu
DeepSeek V3.2Evaluaciones DeepSeek V3.2Niveau GPT‑5 publiéRaisonnement et agents
DeepSeek R1AIME 202479,8 %Pass@1 publié
03 / MÉTHODE

Comment lire le répertoire

Une organisation, un produit et un modèle ne constituent pas la même unité. Inferama les distingue afin d’éviter d’attribuer des capacités ou des conditions commerciales au mauvais élément.

01

Laboratoire

Entité qui développe ou publie le modèle et maintient sa documentation technique et de sécurité.

02

Modèle

Version identifiable avec des limites, des modalités et un comportement susceptibles de changer entre les lancements.

03

Canal d’accès

API, application, cloud associé ou offre commerciale ; chaque canal peut avoir des tarifs, une rétention et des limites différents.

04

Source et date

Chaque affirmation doit conserver la page officielle consultée et la date de vérification.

ANALYSE

Analyses connexes

DeepSeek V4.1 Flash : comment vérifier si son cache compressé réduit réellement le coût d’un agent
ANALISIS

DeepSeek V4.1 Flash : comment vérifier si son cache compressé réduit réellement le coût d’un agent

DeepSeek attribue à V4.1 Flash un cache KV persistant bien plus petit que celui de son prédécesseur. Ce chiffre décrit une propriété d’infrastructure, pas le coût ni la durée d’une tâche complète. Cette analyse propose un protocole contrôlé pour mesurer les deux.

28 sept. 2026
DeepSeek V3.2 avec outils : auditer l’état de raisonnement avant de maintenir ou migrer un agent
ANALISIS

DeepSeek V3.2 avec outils : auditer l’état de raisonnement avant de maintenir ou migrer un agent

Un guide opérationnel pour vérifier qu’une intégration conserve l’état requis entre DeepSeek, les outils et l’utilisateur. Il propose des tests reproductibles, des critères de journalisation et précise ce qu’on peut — ou non — conclure à partir de `reasoning_content`.

28 sept. 2026
DeepSeek R1 en production : tester le modèle de prompt sans casser l’application
ANALISIS

DeepSeek R1 en production : tester le modèle de prompt sans casser l’application

Les recommandations officielles de prompting pour DeepSeek R1 sont des hypothèses à valider dans chaque application. Ce protocole permet de comparer l’emplacement des instructions et le préfixe « <think> », en mesurant à la fois la qualité des réponses et les problèmes d’intégration.

27 sept. 2026
DeepSeek V4.1 Flash + Eleven v3 face à la voix full-duplex : comment comparer les architectures
COMPARATIVA

DeepSeek V4.1 Flash + Eleven v3 face à la voix full-duplex : comment comparer les architectures

Une chaîne modulaire associant reconnaissance vocale, DeepSeek V4.1 Flash et Eleven v3 n’équivaut pas à un modèle vocal full-duplex. Ce guide propose de comparer les deux systèmes de bout en bout, sans désigner de gagnant sur la seule base de spécifications isolées.

26 sept. 2026
DeepSWE v1.1 : ce que mesure un patch qui passe son vérificateur, et quand son pass@1 ne prouve plus que l’agent a résolu la tâche
ANALISIS

DeepSWE v1.1 : ce que mesure un patch qui passe son vérificateur, et quand son pass@1 ne prouve plus que l’agent a résolu la tâche

DeepSWE v1.1 évalue des modifications de code produites par des agents sur des tâches originales et de longue haleine. Son résultat peut fournir un signal utile, mais une ligne du leaderboard n’est interprétable que si l’on connaît le harnais, la politique de traitement des erreurs, les rollouts, le vérificateur et la version exacte du benchmark. Une revue d’Epoch AI ajoute un avertissement précis : certains patchs qui modifient des tests peuvent recevoir un faux négatif dans certaines conditions.

23 sept. 2026
DeepSeek : comment choisir entre l’API officielle, les poids publiés et des fournisseurs tiers sans confondre ouverture et contrôle opérationnel
ANALISIS

DeepSeek : comment choisir entre l’API officielle, les poids publiés et des fournisseurs tiers sans confondre ouverture et contrôle opérationnel

La disponibilité de poids, d’une API compatible ou du nom d’une famille ne suffit pas, à elle seule, à trancher une décision de production. Cette analyse propose de séparer l’artefact, la licence, l’endpoint, l’opérateur et les éléments de preuve afin d’évaluer DeepSeek via l’API officielle, une infrastructure propre ou un fournisseur tiers.

22 sept. 2026
04 / SOURCES

Traçabilité