Uso principal declarado o inferido con cautela desde la documentación oficial.
Voxtral TTS
Modelo de texto a voz multilingüe con streaming y clonación zero-shot a partir de una referencia de voz.
Lo esencial
Capacidad máxima de entrada cuando la fuente la publica.
Límite máximo de generación documentado.
Canales de disponibilidad verificados.
Familia funcional principal y especialidades verificadas.
Condiciones declaradas para API, pesos o despliegue propio.
Límites e integración
| ID de API | voxtral-mini-tts-2603 |
|---|---|
| Tipo de modelo | Voz y audio |
| Modelo de acceso | API y pesos abiertos |
| Licencia | CC BY-NC 4.0 |
| Despliegue | API o local con restricciones de licencia |
| Lanzamiento | 23 MAR 2026 |
| Corte de conocimiento | No publicado |
| Entrada | Texto · Audio de referencia |
| Salida | Audio |
| Ventana de contexto | Texto y referencia de voz |
| Salida máxima | Audio en streaming |
| Razonamiento | No aplica o no publicado |
| Herramientas publicadas | |
| Salidas estructuradas | No aplica o no publicado |
| Procesamiento por lotes | No publicado |
| Caché de prompts | No publicado |
| Ajuste fino | Pesos descargables |
| Plataformas verificadas | Mistral API |
Narración, prototipos de voz y síntesis multilingüe.
La licencia es no comercial; revisa consentimiento y derechos de voz antes de clonar.
Qué puede hacer
Orientación
Narración, prototipos de voz y síntesis multilingüe.
Contexto
Texto y referencia de voz · Audio en streaming
Herramientas e integración
No publicado
Acceso
Mistral API y pesos
Coste documentado
| Concepto | Valor | Unidad / condición |
|---|---|---|
| Entrada estándar | No publicado | Tarifa estándar de API |
| Entrada en caché | No publicado | Lectura de prefijos reutilizados |
| Escritura o almacenamiento de caché | No publicado | La condición varía según proveedor |
| Salida estándar | No publicado | Puede incluir tokens de razonamiento |
| Entrada por lotes | No publicado | Procesamiento asíncrono |
| Salida por lotes | No publicado | Procesamiento asíncrono |
Consulta la fuente primaria: la unidad de facturación depende del tipo de modelo y del canal de acceso.
i Los precios cambian y pueden depender del nivel, la región o la longitud del contexto. Revisa la fuente antes de tomar una decisión.
Cómo leer los resultados
Un benchmark público orienta, pero no sustituye una evaluación con tus datos, herramientas, presupuesto y tolerancia al error.
| Benchmark | Resultado | Métrica | Fuente |
|---|---|---|---|
| Evaluaciones Voxtral TTS | ~90 ms | Tiempo hasta primer audio publicado | Ver fuente ↗ |
Inferama solo destaca un «mejor resultado» cuando la métrica, el conjunto de prueba, la configuración y la fecha permiten una comparación equivalente. Las cifras del proveedor se presentan como afirmaciones de su propia fuente.
Cronología
Voxtral TTS
Versión incorporada al catálogo verificado de Inferama.
Análisis relacionados
Voxtral TTS: qué debe validar un equipo antes de sustituir una voz sintética en producción
Mistral AI documenta Voxtral TTS como un servicio de generación de voz con streaming y varios formatos de salida. Antes de reemplazar un proveedor o modelo en llamadas, avisos o contenido publicado, un equipo debe comprobar no solo la calidad audible, sino también la compatibilidad del contrato técnico, operativo y de datos mediante una regresión con sus propios guiones.
22 sep. 2026 ↗ GUIAVoces sintéticas en producción: cómo demostrar consentimiento, controlar el parecido y retirar una voz sin perder trazabilidad
Usar una voz sintética de forma responsable exige más que una casilla de aceptación o una demo convincente. Esta guía propone un sistema operativo para relacionar cada audio con una autorización concreta, controlar el riesgo de parecido con personas identificables, informar cuando proceda y retirar activos al cambiar las condiciones de uso.
22 sep. 2026 ↗