VERIFIZIERTE ORGANISATION

OpenAI

Entdecke die dokumentierten Modelle, veröffentlichten Bewertungen und Primärquellen dieser Organisation.

01 / MODELLE

Verifizierter Katalog

GENERALISTISCHE GRENZE

GPT‑6 Astra

Generalistisches Grenzmodell, das auf komplexe Aufgaben, den Einsatz von Werkzeugen und hochanspruchsvolle berufliche Arbeit ausgerichtet ist.

16 SEP 2026
GENERALISTISCHE GRENZE

GPT‑5.6 Sol

Komplexe Aufgaben, Code und Agenten mit Werkzeugen.

16 SEP 2026
AUSGEWOGENES KOSTEN-LEISTUNGS-VERHÄLTNIS

GPT‑5.6 Terra

Aufgaben mit ausgewogenem Verhältnis von Qualität, Geschwindigkeit und Kosten.

16 SEP 2026
HOHE EFFIZIENZ

GPT‑5.6 Luna

Hohes Volumen, Unteragenten und strukturierte Extraktion.

16 SEP 2026
FRÜHERE FRONTIER-GENERATION

GPT‑5.5

Frühere OpenAI-Generation für Code und professionelle Arbeit, beibehalten zum Vergleich von Migrationen und Kosten.

18 SEP 2026
NICHT SCHLUSSFOLGERND · LANGER KONTEXT

GPT‑4.1

Nicht schlussfolgerndes Modell mit langem Kontext, nützlich als historische Referenz für Code, Instruktionsbefolgung und vorhersehbare Latenz.

18 SEP 2026
OFFENES REASONING

gpt‑oss‑120b

Reasoning-Modell mit offenen Gewichten für lokale oder private Ausführung; laut OpenAI passt es auf eine H100-GPU.

18 SEP 2026
VISUELLE GENERIERUNG UND BEARBEITUNG

GPT‑Image‑2.5 Sunburst

OpenAIs Hauptmodell zum Generieren und Bearbeiten von Bildern mit komplexen Anweisungen und hochwertiger visueller Produktion.

18 SEP 2026
VIDEO MIT SYNCHRONISIERTEM AUDIO

Sora 2 Pro

Historisches Videomodell mit synchronisiertem Audio, nützlich zum Vergleich der Entwicklung der Sora-Familie.

18 SEP 2026
SPRACHUNTERHALTUNG IN ECHTZEIT

GPT‑Live 1

Echtzeit-Sprachmodell für ausdrucksstarke Gespräche, natürliche Unterbrechungen und Workflows mit Tools.

18 SEP 2026
SPRACHERKENNUNG

GPT‑Transcribe

Spezialisiertes hochpräzises Transkriptionsmodell für Dateien und Echtzeit-Audioeingaben.

18 SEP 2026
TEXTVEKTORREPRÄSENTATION

text‑embedding‑3‑large

Leistungsstärkstes Embedding-Modell von OpenAI für semantische Suche, Klassifizierung, Clustering und RAG.

18 SEP 2026
PROGRAMMIERUNG, COMPUTERNUTZUNG UND PROFESSIONELLE AUFGABEN

GPT‑6.1 Sol

OpenAI-Modell für komplexe Programmierung, Computernutzung und professionelle Aufgaben mit Text- und Bildeingaben. Der Anbieter beschreibt eine Leistung nahe Astra bei geringeren Kosten; prüfen Sie dieses Verhältnis anhand Ihrer eigenen Aufgaben.

30 SEP 2026
02 / BEWERTUNGEN

Veröffentlichte Ergebnisse

Die Zahlen werden mit dem von der Quelle angegebenen Kontext dargestellt. Ein Anbieterergebnis ist kein unabhängiger Vergleich und ersetzt keine eigene Bewertung.

ModellBenchmarkErgebnisMetrik
GPT‑6 AstraTerminal-Bench Science 0.164,6 %Genauigkeit
GPT‑6 AstraGPQA Diamond96,0 %Genauigkeit
GPT‑6 AstraBenchCAD95,9 %Geometrische Überlappung
GPT‑5.6 SolAgents' Last Exam52,7 %Genauigkeit
GPT‑5.6 SolSWE-Bench Pro64,6 %Gelöst
GPT‑5.6 SolTerminal-Bench 2.188,8 %Genauigkeit
GPT‑5.6 TerraAgents' Last Exam50,4 %Genauigkeit
GPT‑5.6 TerraSWE-Bench Pro63,4 %Gelöst
GPT‑5.6 TerraTerminal-Bench 2.187,4 %Genauigkeit
GPT‑5.6 LunaAgents' Last Exam50,3 %Genauigkeit
GPT‑5.6 LunaSWE-Bench Pro62,7 %Gelöst
GPT‑5.6 LunaTerminal-Bench 2.184,7 %Genauigkeit
GPT‑5.5Evaluaciones oficiales GPT‑5.5VeröffentlichtCode und professionelle Arbeit
GPT‑4.1SWE-bench Verified54,6 %Veröffentlichte gelöste Probleme
gpt‑oss‑120bEvaluaciones gpt‑ossVeröffentlichtes o4-mini-NiveauAllgemeines Reasoning
GPT‑Image‑2.5 SunburstEvaluación visual GPT‑Image‑2.5HauptmodellPräferenz und Instruktionsbefolgung
Sora 2 ProEvaluación de Sora 2 ProVeröffentlichtSynchronisiertes Video und Audio
GPT‑Live 1Evaluación de conversación GPT‑LiveHauptmodellNatürlichkeit und Unterbrechungen
GPT‑TranscribeEvaluación ASR GPT‑TranscribeVeröffentlichtTranskriptionsgenauigkeit
text‑embedding‑3‑largeMTEB64,6 %Veröffentlichter Durchschnitt
03 / VERFAHREN

So liest du das Verzeichnis

Eine Organisation, ein Produkt und ein Modell sind nicht dieselbe Einheit. Inferama trennt sie, um Fähigkeiten oder kommerzielle Bedingungen nicht dem falschen Element zuzuschreiben.

01

Labor

Organisation, die das Modell entwickelt oder veröffentlicht und dessen technische und Sicherheitsdokumentation pflegt.

02

Modell

Identifizierbare Version mit Limits, Modalitäten und Verhalten, die sich zwischen Veröffentlichungen ändern können.

03

Zugangskanal

API, Anwendung, angebundene Cloud oder kommerzieller Tarif; jeder Kanal kann unterschiedliche Preise, Aufbewahrungsfristen und Limits haben.

04

Quelle und Datum

Zu jeder Aussage müssen die konsultierte offizielle Seite und das Prüfdatum festgehalten werden.

ANALYSE

Verwandte Analysen

Sora 2 Pro in Video-Benchmarks: Was eine Blindpräferenz misst – und was offenbleibt
ANALISIS

Sora 2 Pro in Video-Benchmarks: Was eine Blindpräferenz misst – und was offenbleibt

Eine Arena-Bewertung beschreibt das Ergebnis eines Vergleichs unter einem bestimmten Protokoll. Sie beweist für sich genommen nicht, dass ein Modell Anweisungen besser befolgt, zeitliche Kontinuität wahrt oder Audio und Video synchronisiert. Dieser Leitfaden trennt, was sich über Sora 2 Pro sagen lässt, von dem, was die verfügbaren Benchmarks nicht belegen.

26 Sep 2026
GPT‑Live‑Konversation bewerten: Wie sich Sprecherwechsel, Unterbrechungen und Aufgabenerledigung messen lassen, ohne ein flüssiges Gespräch mit einem zuverlässigen Agenten zu verwechseln
ANALISIS

GPT‑Live‑Konversation bewerten: Wie sich Sprecherwechsel, Unterbrechungen und Aufgabenerledigung messen lassen, ohne ein flüssiges Gespräch mit einem zuverlässigen Agenten zu verwechseln

Leitfaden zur Bewertung von GPT‑Live‑1 in Full‑Duplex-Sprachgesprächen, der Turn-Dynamik, Verständnis, Aufgabenerfolg und die Sicherheit delegierter Aktionen voneinander trennt. Vorgestellt wird ein reproduzierbares Protokoll mit kontrolliertem Audio, Traces, zeitlicher Annotation und verblindeter menschlicher Prüfung.

23 Sep 2026
ASR-Evaluierung von GPT‑Transcribe: Text, Sprecher und Zeitangaben messen, ohne Fehler zu verdecken, die nachgelagerte Abläufe unterbrechen
ANALISIS

ASR-Evaluierung von GPT‑Transcribe: Text, Sprecher und Zeitangaben messen, ohne Fehler zu verdecken, die nachgelagerte Abläufe unterbrechen

Eine brauchbare Bewertung automatischer Transkription lässt sich nicht auf einen einzigen Genauigkeitswert reduzieren. Dieser Leitfaden beschreibt ein Protokoll, das Texttreue, kritische Entitäten, Sprecherzuordnung, Zeitmarken, Segmentierung und die Gültigkeit der Ausgabe für die konsumierende Anwendung getrennt misst. Ziel ist, Versionen und Konfigurationen reproduzierbar zu vergleichen und auf Grundlage von Evidenz zu entscheiden, wann ein Deployment freigegeben, eingeschränkt oder blockiert werden sollte.

23 Sep 2026
Lokal begrenzte Bildbearbeitung mit KI: So prüfen Sie, dass das Modell nur das Gewünschte ändert und den Rest des Assets erhält
GUIA

Lokal begrenzte Bildbearbeitung mit KI: So prüfen Sie, dass das Modell nur das Gewünschte ändert und den Rest des Assets erhält

Eine generative Bearbeitung ist nicht schon deshalb für den Produktionseinsatz geeignet, weil die verlangte Änderung korrekt aussieht. Dieser Leitfaden behandelt jede Retusche als Vertrag zur Erhaltung: Er legt fest, was sich ändern darf, was erhalten bleiben muss, wie dies gemessen wird und wann eine menschliche Prüfung erforderlich ist.

23 Sep 2026
GPT-Transcribe: Was ein Team erneut prüfen muss, bevor es seinen Transkriptionsdienst ersetzt
NOTICIA

GPT-Transcribe: Was ein Team erneut prüfen muss, bevor es seinen Transkriptionsdienst ersetzt

GPT-Transcribe ist als Transkriptionsmodell verfügbar, das über die OpenAI-API genutzt werden kann. Bevor ein bestehendes ASR-System ersetzt wird, sollte nicht nur der resultierende Text geprüft werden, sondern auch der technische Vertrag, auf dem Suche, Zusammenfassungen, Warnungen, Zitate, Prüfungen und Compliance-Aufzeichnungen beruhen.

22 Sep 2026
BenchCAD: Was die Rekonstruktion eines ausführbaren mechanischen Bauteils zeigt – und was sie über Industriedesign nicht beweist
ANALISIS

BenchCAD: Was die Rekonstruktion eines ausführbaren mechanischen Bauteils zeigt – und was sie über Industriedesign nicht beweist

BenchCAD 1.0 misst, ob ein System CadQuery-Programme erzeugen, ändern oder interpretieren kann, deren Geometrie ausführbar ist und mit einer Referenz verglichen werden kann. Das ist ein nützliches Signal für parametrische Rekonstruktion, ersetzt aber keine Validierung von Toleranzen, Funktion, Fertigung oder Integration in einen Engineering-Workflow.

22 Sep 2026
04 / QUELLEN

Rückverfolgbarkeit