ORGANIZZAZIONE VERIFICATA

OpenAI

Consulta i modelli documentati, le valutazioni pubblicate e le fonti primarie associate a questa organizzazione.

01 / MODELLI

Catalogo verificato

FRONTIERA GENERALISTA

GPT‑6 Astra

Modello generalista di frontiera orientato verso compiti complessi, uso di strumenti e lavoro professionale altamente impegnativo.

16 SET 2026
FRONTIERA GENERALISTA

GPT‑5.6 Sol

Lavoro complesso, codice e agenti con strumenti.

16 SET 2026
EQUILIBRIO COSTO/CAPACITÀ

GPT‑5.6 Terra

Attività che richiedono equilibrio tra qualità, velocità e costo.

16 SET 2026
ALTA EFFICIENZA

GPT‑5.6 Luna

Volumi elevati, sottoagenti ed estrazione strutturata.

16 SET 2026
FRONTIERA PRECEDENTE

GPT‑5.5

Generazione precedente di OpenAI per codice e lavoro professionale, mantenuta per confrontare migrazioni e costo.

18 SET 2026
NON RAGIONANTE · CONTESTO LUNGO

GPT‑4.1

Modello non ragionante a contesto lungo, utile come riferimento storico per codice, aderenza alle istruzioni e latenza prevedibile.

18 SET 2026
RAGIONAMENTO APERTO

gpt‑oss‑120b

Modello di ragionamento con pesi aperti per esecuzione locale o privata; entra in una GPU H100 secondo OpenAI.

18 SET 2026
GENERAZIONE E MODIFICA VISIVA

GPT‑Image‑2.5 Sunburst

Modello principale di OpenAI per generare e modificare immagini con istruzioni complesse e produzione visiva di alta qualità.

18 SET 2026
VIDEO CON AUDIO SINCRONIZZATO

Sora 2 Pro

Modello video storico con audio sincronizzato, utile per confrontare l'evoluzione della famiglia Sora.

18 SET 2026
CONVERSAZIONE VOCALE IN TEMPO REALE

GPT‑Live 1

Modello vocale in tempo reale per conversazioni espressive, interruzioni naturali e flussi con strumenti.

18 SET 2026
RICONOSCIMENTO VOCALE

GPT‑Transcribe

Modello specializzato di trascrizione ad alta precisione per file e input audio in tempo reale.

18 SET 2026
RAPPRESENTAZIONE VETTORIALE DEL TESTO

text‑embedding‑3‑large

Modello di embedding OpenAI a maggiore capacità per ricerca semantica, classificazione, clustering e RAG.

18 SET 2026
PROGRAMMAZIONE, USO DEL COMPUTER E LAVORO PROFESSIONALE

GPT‑6.1 Sol

Modello di OpenAI per programmazione complessa, uso del computer e lavoro professionale con input di testo e immagini. Il fornitore dichiara prestazioni vicine ad Astra a un costo inferiore; verifica questo equilibrio sulle tue attività.

30 SET 2026
02 / VALUTAZIONI

Risultati pubblicati

I dati sono mostrati con il contesto comunicato dalla fonte. Un risultato del fornitore non equivale a un confronto indipendente e non sostituisce una valutazione propria.

ModelloBenchmarkRisultatoMetrica
GPT‑6 AstraTerminal-Bench Science 0.164,6 %Accuratezza
GPT‑6 AstraGPQA Diamond96,0 %Accuratezza
GPT‑6 AstraBenchCAD95,9 %Sovrapposizione geometrica
GPT‑5.6 SolAgents' Last Exam52,7 %Accuratezza
GPT‑5.6 SolSWE-Bench Pro64,6 %Risolto
GPT‑5.6 SolTerminal-Bench 2.188,8 %Accuratezza
GPT‑5.6 TerraAgents' Last Exam50,4 %Accuratezza
GPT‑5.6 TerraSWE-Bench Pro63,4 %Risolto
GPT‑5.6 TerraTerminal-Bench 2.187,4 %Accuratezza
GPT‑5.6 LunaAgents' Last Exam50,3 %Accuratezza
GPT‑5.6 LunaSWE-Bench Pro62,7 %Risolto
GPT‑5.6 LunaTerminal-Bench 2.184,7 %Accuratezza
GPT‑5.5Evaluaciones oficiales GPT‑5.5PubblicateCodice e lavoro professionale
GPT‑4.1SWE-bench Verified54,6 %Problemi risolti pubblicati
gpt‑oss‑120bEvaluaciones gpt‑ossLivello o4-mini pubblicatoRagionamento generale
GPT‑Image‑2.5 SunburstEvaluación visual GPT‑Image‑2.5Modello principalePreferenza e aderenza alle istruzioni
Sora 2 ProEvaluación de Sora 2 ProPubblicataVideo e audio sincronizzati
GPT‑Live 1Evaluación de conversación GPT‑LiveModello principaleNaturalezza e interruzioni
GPT‑TranscribeEvaluación ASR GPT‑TranscribePubblicataPrecisione della trascrizione
text‑embedding‑3‑largeMTEB64,6 %Media pubblicata
03 / METODO

Come leggere la directory

Un'organizzazione, un prodotto e un modello non sono la stessa unità. Inferama li separa per evitare di attribuire capacità o condizioni commerciali all'elemento sbagliato.

01

Laboratorio

Entità che sviluppa o pubblica il modello e ne mantiene la documentazione tecnica e di sicurezza.

02

Modello

Versione identificabile con limiti, modalità e comportamento che possono cambiare tra i rilasci.

03

Canale di accesso

API, applicazione, cloud associato o piano commerciale; ogni canale può avere prezzi, conservazione e limiti diversi.

04

Fonte e data

Ogni affermazione deve conservare la pagina ufficiale consultata e la data di verifica.

ANALISI

Analisi correlate

Sora 2 Pro nei benchmark video: cosa misura una preferenza cieca e cosa lascia senza risposta
ANALISIS

Sora 2 Pro nei benchmark video: cosa misura una preferenza cieca e cosa lascia senza risposta

Un punteggio di arena descrive il risultato di un confronto condotto secondo un protocollo specifico; da solo non dimostra che un modello segua meglio le istruzioni, mantenga la continuità temporale o sincronizzi audio e video. Questa guida distingue ciò che si può affermare su Sora 2 Pro da ciò che i benchmark disponibili non consentono di concludere.

26 set 2026
Valutazione delle conversazioni GPT‑Live: come misurare turni, interruzioni e risoluzione dei compiti senza confondere una conversazione fluida con un agente affidabile
ANALISIS

Valutazione delle conversazioni GPT‑Live: come misurare turni, interruzioni e risoluzione dei compiti senza confondere una conversazione fluida con un agente affidabile

Guida per valutare GPT‑Live‑1 nelle conversazioni vocali full‑duplex separando dinamica dei turni, comprensione, successo del compito e sicurezza delle azioni delegate. Propone un protocollo riproducibile con audio controllato, tracce, annotazione temporale e revisione umana in cieco.

23 set 2026
Valutazione ASR di GPT‑Transcribe: come misurare testo, parlanti e tempi senza nascondere gli errori che compromettono il flusso a valle
ANALISIS

Valutazione ASR di GPT‑Transcribe: come misurare testo, parlanti e tempi senza nascondere gli errori che compromettono il flusso a valle

Una valutazione utile della trascrizione automatica non si riduce a un'unica percentuale di accuratezza. Questa guida propone un protocollo per misurare separatamente fedeltà del testo, entità critiche, attribuzione dei parlanti, timestamp, segmentazione e validità dell'output consumato da un'applicazione. L'obiettivo è confrontare versioni e configurazioni in modo riproducibile e decidere sulla base di evidenze quando promuovere, limitare o bloccare un rilascio.

23 set 2026
Modifica localizzata di immagini con IA: come verificare che il modello cambi solo ciò che è richiesto e preservi il resto dell’asset
GUIA

Modifica localizzata di immagini con IA: come verificare che il modello cambi solo ciò che è richiesto e preservi il resto dell’asset

Una modifica generativa utile in produzione non si convalida solo perché il cambiamento richiesto sembra corretto. Questa guida propone di trattare ogni ritocco come un contratto di preservazione: definire cosa può cambiare, cosa deve rimanere invariato, come misurarlo e quando richiedere una revisione umana.

23 set 2026
GPT-Transcribe: cosa un team deve convalidare di nuovo prima di sostituire il proprio sistema di trascrizione
NOTICIA

GPT-Transcribe: cosa un team deve convalidare di nuovo prima di sostituire il proprio sistema di trascrizione

GPT-Transcribe è indicato come modello di trascrizione disponibile tramite l’API di OpenAI. Prima di sostituire un sistema ASR esistente, è opportuno convalidare non solo il testo prodotto, ma anche il contratto tecnico che sostiene ricerca, riepiloghi, avvisi, citazioni, revisioni e registri di conformità.

22 set 2026
BenchCAD: cosa dimostra la ricostruzione di un componente meccanico eseguibile e cosa non prova sul design industriale
ANALISIS

BenchCAD: cosa dimostra la ricostruzione di un componente meccanico eseguibile e cosa non prova sul design industriale

BenchCAD 1.0 misura se un sistema è in grado di generare, modificare o interpretare programmi CadQuery la cui geometria possa essere eseguita e confrontata con un riferimento. È un segnale utile sulla ricostruzione parametrica, ma non sostituisce la validazione di tolleranze, funzione, produzione o integrazione in un flusso di ingegneria.

22 set 2026
04 / FONTI

Tracciabilità