ORGANISATION VÉRIFIÉE

OpenAI

Consultez les modèles documentés, les évaluations publiées et les sources primaires associées à cette organisation.

01 / MODÈLES

Catalogue vérifié

FRONTIÈRE GÉNÉRALISTE

GPT‑6 Astra

Modèle frontière généraliste orienté vers des tâches complexes, l'utilisation d'outils et un travail professionnel très exigeant.

16 SEPT. 2026
FRONTIÈRE GÉNÉRALISTE

GPT‑5.6 Sol

Travail complexe, code et agents utilisant des outils.

16 SEPT. 2026
ÉQUILIBRE COÛT/CAPACITÉ

GPT‑5.6 Terra

Tâches exigeant un équilibre entre qualité, vitesse et coût.

16 SEPT. 2026
HAUTE EFFICACITÉ

GPT‑5.6 Luna

Volume élevé, sous-agents et extraction structurée.

16 SEPT. 2026
FRONTIÈRE ANTÉRIEURE

GPT‑5.5

Génération OpenAI antérieure pour le code et le travail professionnel, conservée pour comparer les migrations et le coût.

18 SEPT. 2026
NON RAISONNEUR · CONTEXTE LONG

GPT‑4.1

Modèle non raisonneur à contexte long, utile comme référence historique pour le code, le suivi des instructions et une latence prévisible.

18 SEPT. 2026
RAISONNEMENT OUVERT

gpt‑oss‑120b

Modèle de raisonnement à poids ouverts pour une exécution locale ou privée ; il tient sur un GPU H100 selon OpenAI.

18 SEPT. 2026
GÉNÉRATION ET ÉDITION VISUELLES

GPT‑Image‑2.5 Sunburst

Modèle principal d’OpenAI pour générer et éditer des images avec des instructions complexes et une production visuelle de haute qualité.

18 SEPT. 2026
VIDÉO AVEC AUDIO SYNCHRONISÉ

Sora 2 Pro

Modèle vidéo historique avec audio synchronisé, utile pour comparer l’évolution de la famille Sora.

18 SEPT. 2026
CONVERSATION VOCALE EN TEMPS RÉEL

GPT‑Live 1

Modèle vocal en temps réel pour des conversations expressives, des interruptions naturelles et des flux avec outils.

18 SEPT. 2026
RECONNAISSANCE VOCALE

GPT‑Transcribe

Modèle spécialisé de transcription de haute précision pour les fichiers et les entrées audio en temps réel.

18 SEPT. 2026
REPRÉSENTATION VECTORIELLE DE TEXTE

text‑embedding‑3‑large

Modèle d’embeddings OpenAI de plus grande capacité pour la recherche sémantique, la classification, le clustering et le RAG.

18 SEPT. 2026
PROGRAMMATION, UTILISATION D’ORDINATEUR ET TRAVAIL PROFESSIONNEL

GPT‑6.1 Sol

Modèle d’OpenAI pour la programmation complexe, l’utilisation d’ordinateur et le travail professionnel, avec des entrées texte et image. Le fournisseur annonce des performances proches d’Astra à moindre coût ; évaluez cet équilibre sur vos propres tâches.

30 SEPT. 2026
02 / ÉVALUATIONS

Résultats publiés

Les chiffres sont présentés avec le contexte communiqué par leur source. Un résultat du fournisseur n’est pas une comparaison indépendante et ne remplace pas votre propre évaluation.

ModèleBenchmarkRésultatMétrique
GPT‑6 AstraTerminal-Bench Science 0.164,6 %Exactitude
GPT‑6 AstraGPQA Diamond96,0 %Exactitude
GPT‑6 AstraBenchCAD95,9 %Chevauchement géométrique
GPT‑5.6 SolAgents' Last Exam52,7 %Exactitude
GPT‑5.6 SolSWE-Bench Pro64,6 %Résolu
GPT‑5.6 SolTerminal-Bench 2.188,8 %Exactitude
GPT‑5.6 TerraAgents' Last Exam50,4 %Exactitude
GPT‑5.6 TerraSWE-Bench Pro63,4 %Résolu
GPT‑5.6 TerraTerminal-Bench 2.187,4 %Exactitude
GPT‑5.6 LunaAgents' Last Exam50,3 %Exactitude
GPT‑5.6 LunaSWE-Bench Pro62,7 %Résolu
GPT‑5.6 LunaTerminal-Bench 2.184,7 %Exactitude
GPT‑5.5Evaluaciones oficiales GPT‑5.5PubliéesCode et travail professionnel
GPT‑4.1SWE-bench Verified54,6 %Problèmes résolus publiés
gpt‑oss‑120bEvaluaciones gpt‑ossNiveau o4-mini publiéRaisonnement général
GPT‑Image‑2.5 SunburstEvaluación visual GPT‑Image‑2.5Modèle principalPréférence et suivi des instructions
Sora 2 ProEvaluación de Sora 2 ProPubliéeVidéo et audio synchronisés
GPT‑Live 1Evaluación de conversación GPT‑LiveModèle principalNaturel et interruptions
GPT‑TranscribeEvaluación ASR GPT‑TranscribePubliéePrécision de transcription
text‑embedding‑3‑largeMTEB64,6 %Moyenne publiée
03 / MÉTHODE

Comment lire le répertoire

Une organisation, un produit et un modèle ne constituent pas la même unité. Inferama les distingue afin d’éviter d’attribuer des capacités ou des conditions commerciales au mauvais élément.

01

Laboratoire

Entité qui développe ou publie le modèle et maintient sa documentation technique et de sécurité.

02

Modèle

Version identifiable avec des limites, des modalités et un comportement susceptibles de changer entre les lancements.

03

Canal d’accès

API, application, cloud associé ou offre commerciale ; chaque canal peut avoir des tarifs, une rétention et des limites différents.

04

Source et date

Chaque affirmation doit conserver la page officielle consultée et la date de vérification.

ANALYSE

Analyses connexes

Sora 2 Pro dans les benchmarks vidéo : ce qu’une préférence à l’aveugle mesure — et ce qu’elle ne dit pas
ANALISIS

Sora 2 Pro dans les benchmarks vidéo : ce qu’une préférence à l’aveugle mesure — et ce qu’elle ne dit pas

Un score d’arène décrit le résultat d’une comparaison menée selon un protocole précis ; à lui seul, il ne prouve pas qu’un modèle suit mieux les instructions, assure la continuité temporelle ou synchronise l’audio et la vidéo. Ce guide distingue ce que l’on peut affirmer au sujet de Sora 2 Pro de ce que les benchmarks disponibles ne permettent pas de conclure.

26 sept. 2026
Évaluation conversationnelle de GPT‑Live : mesurer les tours de parole, les interruptions et la résolution de tâches sans confondre fluidité et fiabilité
ANALISIS

Évaluation conversationnelle de GPT‑Live : mesurer les tours de parole, les interruptions et la résolution de tâches sans confondre fluidité et fiabilité

Guide d’évaluation de GPT‑Live‑1 dans des conversations vocales full‑duplex, en séparant la dynamique des tours de parole, la compréhension, le succès des tâches et la sécurité des actions déléguées. Il propose un protocole reproductible fondé sur un audio contrôlé, des traces, une annotation temporelle et une revue humaine en aveugle.

23 sept. 2026
Évaluation ASR de GPT‑Transcribe : mesurer le texte, les locuteurs et les repères temporels sans masquer les erreurs qui cassent le flux en aval
ANALISIS

Évaluation ASR de GPT‑Transcribe : mesurer le texte, les locuteurs et les repères temporels sans masquer les erreurs qui cassent le flux en aval

Une évaluation utile de la transcription automatique ne se résume pas à un unique pourcentage de précision. Ce guide propose un protocole permettant de mesurer séparément la fidélité du texte, les entités critiques, l’attribution des locuteurs, les repères temporels, la segmentation et la validité de la sortie consommée par une application. L’objectif est de comparer des versions et des configurations de manière reproductible, puis de décider sur des éléments probants quand promouvoir, restreindre ou bloquer un déploiement.

23 sept. 2026
Édition localisée d’images par IA : comment vérifier que le modèle ne modifie que ce qui est demandé et préserve le reste de l’actif
GUIA

Édition localisée d’images par IA : comment vérifier que le modèle ne modifie que ce qui est demandé et préserve le reste de l’actif

Une édition générative utilisable en production ne se valide pas uniquement parce que le changement demandé semble correct. Ce guide propose de traiter chaque retouche comme un contrat de préservation : définir ce qui peut changer, ce qui doit être maintenu, comment le mesurer et à quel moment exiger une revue humaine.

23 sept. 2026
GPT-Transcribe : ce qu’une équipe doit valider à nouveau avant de remplacer son transcripteur
NOTICIA

GPT-Transcribe : ce qu’une équipe doit valider à nouveau avant de remplacer son transcripteur

GPT-Transcribe est présenté comme un modèle de transcription accessible via l’API d’OpenAI. Avant de remplacer un système ASR existant, il convient de valider non seulement le texte produit, mais aussi le contrat technique dont dépendent les moteurs de recherche, résumés, alertes, citations, revues et registres de conformité.

22 sept. 2026
BenchCAD : ce que démontre la reconstruction d’une pièce mécanique exécutable, et ce qu’elle ne prouve pas sur la conception industrielle
ANALISIS

BenchCAD : ce que démontre la reconstruction d’une pièce mécanique exécutable, et ce qu’elle ne prouve pas sur la conception industrielle

BenchCAD 1.0 mesure si un système peut générer, modifier ou interpréter des programmes CadQuery dont la géométrie peut être exécutée et comparée à une référence. C’est un signal utile sur la reconstruction paramétrique, mais il ne remplace pas la validation des tolérances, de la fonction, de la fabrication ou de l’intégration dans un flux d’ingénierie.

22 sept. 2026
04 / SOURCES

Traçabilité