Labor
Organisation, die das Modell entwickelt oder veröffentlicht und dessen technische und Sicherheitsdokumentation pflegt.
Entdecke die dokumentierten Modelle, veröffentlichten Bewertungen und Primärquellen dieser Organisation.
Agenten, Code und offene Bereitstellung zu niedrigen Kosten.
16 SEP 2026↗ OFFENES REASONING UND AGENTENAuf Reasoning und Agenten ausgerichtetes offenes Modell mit in die Tool-Nutzung integriertem Denken.
18 SEP 2026↗ HISTORISCHES OFFENES REASONINGOffenes Reasoning-Modell und Familie destillierter Modelle, relevant für die Beobachtung der Entwicklung überprüfbaren Reasonings.
18 SEP 2026↗Die Zahlen werden mit dem von der Quelle angegebenen Kontext dargestellt. Ein Anbieterergebnis ist kein unabhängiger Vergleich und ersetzt keine eigene Bewertung.
| Modell | Benchmark | Ergebnis | Metrik |
|---|---|---|---|
| DeepSeek V4.1 Flash | GPQA Diamond | 90,9 % | Genauigkeit |
| DeepSeek V4.1 Flash | Terminal-Bench 2.1 | 90,6 % | Genauigkeit |
| DeepSeek V4.1 Flash | DeepSWE v1.1 | 74,2 % | Gelöst |
| DeepSeek V3.2 | Evaluaciones DeepSeek V3.2 | Veröffentlichtes GPT‑5-Niveau | Reasoning und Agenten |
| DeepSeek R1 | AIME 2024 | 79,8 % | Veröffentlichtes Pass@1 |
Eine Organisation, ein Produkt und ein Modell sind nicht dieselbe Einheit. Inferama trennt sie, um Fähigkeiten oder kommerzielle Bedingungen nicht dem falschen Element zuzuschreiben.
Organisation, die das Modell entwickelt oder veröffentlicht und dessen technische und Sicherheitsdokumentation pflegt.
Identifizierbare Version mit Limits, Modalitäten und Verhalten, die sich zwischen Veröffentlichungen ändern können.
API, Anwendung, angebundene Cloud oder kommerzieller Tarif; jeder Kanal kann unterschiedliche Preise, Aufbewahrungsfristen und Limits haben.
Zu jeder Aussage müssen die konsultierte offizielle Seite und das Prüfdatum festgehalten werden.
DeepSeek zufolge verfügt V4.1 Flash über einen deutlich kleineren persistenten KV-Cache als sein Vorgänger. Diese Angabe beschreibt eine Infrastruktureigenschaft, nicht die Kosten oder die Dauer einer vollständigen Aufgabe. Diese Analyse schlägt einen kontrollierten Test vor, mit dem sich beides messen lässt.
28 Sep 2026 ↗ ANALISISEin praxisorientierter Leitfaden, um zu prüfen, ob eine Integration den erforderlichen Zustand zwischen DeepSeek, Tools und Nutzenden korrekt erhält. Mit reproduzierbaren Tests, Kriterien für die Protokollierung und klaren Grenzen dessen, was sich aus `reasoning_content` ableiten lässt.
28 Sep 2026 ↗ ANALISISDie offiziellen Prompting-Empfehlungen für DeepSeek R1 sind Hypothesen, die Sie für jede Anwendung überprüfen sollten. Mit diesem Protokoll vergleichen Sie die Position von Anweisungen und das Präfix „<think>“ und messen dabei sowohl die Antwortqualität als auch Integrationsfehler.
27 Sep 2026 ↗ COMPARATIVAEine modulare Kette aus Spracherkennung, DeepSeek V4.1 Flash und Eleven v3 ist nicht dasselbe wie ein Full-Duplex-Sprachmodell. Dieser Leitfaden schlägt vor, beide Systeme durchgängig zu vergleichen, ohne aus einzelnen Spezifikationen vorab einen Sieger abzuleiten.
26 Sep 2026 ↗ ANALISISDeepSWE v1.1 bewertet von Agenten erzeugte Codeänderungen in originären Aufgaben mit langem Bearbeitungshorizont. Das Ergebnis kann ein nützliches Signal liefern, doch eine Leaderboard-Zeile ist nur interpretierbar, wenn Harness, Fehlerpolitik, Rollouts, Verifizierer und die exakte Benchmark-Version bekannt sind. Eine Überprüfung von Epoch AI fügt eine konkrete Warnung hinzu: Manche Patches, die Tests verändern, können unter bestimmten Bedingungen einen falsch negativen Befund erhalten.
23 Sep 2026 ↗ ANALISISDie Verfügbarkeit von Gewichten, einer kompatiblen API oder eines Familiennamens löst für sich genommen keine Produktionsentscheidung. Diese Analyse trennt Artefakt, Lizenz, Endpoint, Betreiber und Nachweise, um DeepSeek über die offizielle API, eigene Infrastruktur oder einen externen Anbieter zu bewerten.
22 Sep 2026 ↗