M
MISTRAL AI / voxtral-mini-tts-2603

Voxtral TTS

Mehrsprachiges Text-to-Speech-Modell mit Streaming und Zero-Shot-Klonen anhand einer Stimmreferenz.

01 / ZUSAMMENFASSUNG

Das Wesentliche

ORIENTIERUNGText-to-Speech und Klonen

Primäre Verwendung angegeben oder vorsichtig aus offizieller Dokumentation abgeleitet.

KONTEXTText und Stimmreferenz

Maximale Eingabekapazität bei Veröffentlichung durch die Quelle.

AUSFAHRTStreaming-Audio

Dokumentierte maximale Erzeugungsgrenze.

ZUGANGMistral API und Gewichte

Verifizierte Verfügbarkeitskanäle.

MODELLTYPSprache und Audio

Primäre Funktionsfamilie und verifizierte Spezialisierungen.

LIZENZCC BY-NC 4.0

Deklarierte Bedingungen für API, Gewichte oder Self-Hosting.

02 / TECHNISCHES DATENBLATT

Limits und Integration

API-IDvoxtral-mini-tts-2603
ModelltypSprache und Audio
ZugangsmodellAPI und offene Gewichte
LizenzCC BY-NC 4.0
EinsatzAPI oder lokal mit Lizenzbeschränkungen
Veröffentlichung23 MAR 2026
WissensstichtagNicht veröffentlicht
EingangText · Referenzaudio
AusfahrtAudio
KontextfensterText und Stimmreferenz
maximale LeistungStreaming-Audio
ArgumentationNicht zutreffend oder nicht veröffentlicht
Veröffentlichte Tools
Strukturierte AusflügeNicht zutreffend oder nicht veröffentlicht
StapelverarbeitungNicht veröffentlicht
Prompt-CacheNicht veröffentlicht
FeinabstimmungHerunterladbare Gewichte
Verifizierte PlattformenMistral API
EIGNET SICH BESSER FÜR

Erzählung, Stimmprototypen und mehrsprachige Synthese.

SOLLTE BEOBACHTET WERDEN

Die Lizenz ist nicht kommerziell; prüfe vor dem Klonen Einwilligung und Stimmrechte.

03 / FÄHIGKEITEN

Was es kann

01

Orientierung

Erzählung, Stimmprototypen und mehrsprachige Synthese.

02

Kontext

Text und Stimmreferenz · Streaming-Audio

03

Tools und Integration

Nicht veröffentlicht

04

Zugang

Mistral API und Gewichte

Eingabemodalitäten
TextReferenzaudio
04 / PREISE

Dokumentierte Kosten

KonzeptWertEinheit/Zustand
StandardeingabeNicht veröffentlichtStandardtarif der API
Eingabe aus dem CacheNicht veröffentlichtLesen wiederverwendeter Präfixe
Schreiben oder Speichern im CacheNicht veröffentlichtDie Bedingung variiert je nach Anbieter
StandardausgabeNicht veröffentlichtKann Reasoning-Tokens enthalten
Batch-EingabeNicht veröffentlichtAsynchrone Verarbeitung
Batch-AusgabeNicht veröffentlichtAsynchrone Verarbeitung

Siehe die Primärquelle: Die Abrechnungseinheit hängt vom Modelltyp und Zugangsweg ab.

i Die Preise ändern sich und können von Level, Region oder Kontextlänge abhängen. Überprüfen Sie die Quelle, bevor Sie eine Entscheidung treffen.

05 / BEWERTUNGEN

So lesen Sie die Ergebnisse

“

Ein öffentlicher Benchmark bietet Orientierung, ersetzt jedoch keine Bewertung mit deinen Daten, Tools, deinem Budget und deiner Fehlertoleranz.

BenchmarkErgebnisMetrikQuelle
Evaluaciones Voxtral TTS~90 msVeröffentlichte Zeit bis zum ersten AudioQuelle öffnen ↗

Inferama hebt nur dann ein „bestes Ergebnis“ hervor, wenn Metrik, Testsatz, Konfiguration und Datum einen gleichwertigen Vergleich ermöglichen. Die Zahlen des Lieferanten werden als Angaben aus eigener Quelle dargestellt.

06 / VERSIONEN

Chronologie

Voxtral TTS

In den verifizierten Katalog von Inferama aufgenommene Version.

ANALYSE

Verwandte Analysen

07 / QUELLEN

Rückverfolgbarkeit