Laboratório
Entidade que desenvolve ou publica o modelo e mantém a respetiva documentação técnica e de segurança.
Consulte os modelos documentados, as avaliações publicadas e as fontes primárias associadas a esta organização.
Agentes, código e implantação aberta com baixo custo.
16 SET 2026↗ RACIOCÍNIO ABERTO E AGENTESModelo aberto orientado para raciocínio e agentes, com pensamento integrado na utilização de ferramentas.
18 SET 2026↗ RACIOCÍNIO ABERTO HISTÓRICOModelo de raciocínio aberto e família de modelos destilados, relevante para acompanhar a evolução do raciocínio verificável.
18 SET 2026↗Os números são apresentados com o contexto comunicado pela fonte. Um resultado do fornecedor não equivale a uma comparação independente nem substitui uma avaliação própria.
| Modelo | Benchmark | Resultado | Métrica |
|---|---|---|---|
| DeepSeek V4.1 Flash | GPQA Diamond | 90,9 % | Exatidão |
| DeepSeek V4.1 Flash | Terminal-Bench 2.1 | 90,6 % | Exatidão |
| DeepSeek V4.1 Flash | DeepSWE v1.1 | 74,2 % | Resolvido |
| DeepSeek V3.2 | Evaluaciones DeepSeek V3.2 | Nível GPT‑5 publicado | Raciocínio e agentes |
| DeepSeek R1 | AIME 2024 | 79,8 % | Pass@1 publicado |
Uma organização, um produto e um modelo não são a mesma unidade. A Inferama separa-os para evitar atribuir capacidades ou condições comerciais ao elemento errado.
Entidade que desenvolve ou publica o modelo e mantém a respetiva documentação técnica e de segurança.
Versão identificável com limites, modalidades e comportamento que podem mudar entre lançamentos.
API, aplicação, nuvem associada ou plano comercial; cada canal pode ter preços, retenção e limites distintos.
Cada afirmação deve conservar a página oficial consultada e a data de verificação.
A DeepSeek atribui ao V4.1 Flash uma cache KV persistente muito menor do que a do seu antecessor. Esse número descreve uma propriedade de infraestrutura, não o custo nem o tempo de uma tarefa completa. Esta análise propõe um teste controlado para medir ambos.
28 set 2026 ↗ ANALISISUm guia operacional para verificar se uma integração preserva o estado exigido entre o DeepSeek, as ferramentas e o usuário. Inclui testes reproduzíveis, critérios de registro e limites do que é possível concluir com base em `reasoning_content`.
28 set 2026 ↗ ANALISISAs recomendações oficiais de prompting para o DeepSeek R1 são hipóteses que devem ser validadas em cada aplicação. Este protocolo permite comparar a posição das instruções e o prefixo «<think>», medindo tanto a qualidade das respostas quanto as falhas de integração.
27 set 2026 ↗ COMPARATIVAUma cadeia modular com reconhecimento de voz, DeepSeek V4.1 Flash e Eleven v3 não equivale a um modelo de voz full-duplex. Este guia propõe comparar os dois sistemas de ponta a ponta, sem antecipar um vencedor com base em especificações isoladas.
26 set 2026 ↗ ANALISISO DeepSWE v1.1 avalia alterações de código produzidas por agentes em tarefas originais e de longo horizonte. O seu resultado pode fornecer um sinal útil, mas uma linha do leaderboard só é interpretável se forem conhecidos o arnês, a política de erros, os rollouts, o verificador e a versão exata do benchmark. Uma revisão da Epoch AI acrescenta um alerta concreto: alguns patches que modificam testes podem receber um falso negativo em determinadas condições.
23 set 2026 ↗ ANALISISA disponibilidade de pesos, uma API compatível ou o nome de uma família não resolvem, por si só, uma decisão de produção. Esta análise propõe separar artefacto, licença, endpoint, operador e evidência para avaliar o DeepSeek através da API oficial, de infraestrutura própria ou de um fornecedor externo.
22 set 2026 ↗