AudioVideoClips logoAudioVideoClips

🎙️Pocket TTS Voice

Generador de voz Kyutai en 5 idiomas, en el dispositivo. Gratis, privado, sin registro — los archivos nunca salen de tu navegador.

Pocket TTS by Kyutai (100M params, built-in preset voices) — models download once, then run on-device. Custom voice cloning is disabled to prevent misuse. Web runtime adapted from KevinAHM's demo (Apache-2.0).

Voces listas. Cinco idiomas. Cero servidores.

Kyutai Pocket TTS con voces predefinidas, en streaming desde tu propio dispositivo. Sin subidas, sin registro, sin marca de agua.

5
idiomas
EN, DE, IT, PT, ES
8
voces cada una
preajustes integrados
0
subidas
ONNX 100% en el navegador
Gratis
siempre
sin registro

Cómo usar Pocket TTS Voice

Convierte texto en habla con voces integradas. Elige una de 8 voces predefinidas por idioma — inglés, alemán, italiano, portugués o español — y genera habla natural con síntesis de baja latencia en streaming. Solo voces predefinidas; la clonación está desactivada para evitar usos indebidos. Los modelos se descargan una vez y quedan en caché; después todo es instantáneo y privado.

  1. 1Escribe o pega hasta 2000 caracteres.
  2. 2Elige un idioma y una voz integrada.
  3. 3Pulsa Generar y descarga la locución en WAV.

Casos de uso

Locuciones multilingües
Narra Reels y explicativos en cinco idiomas con voces consistentes.
Voces de personajes
Da a cada personaje una voz predefinida distinta para historias y juegos.
Accesibilidad
Convierte artículos y notas en audio en un clic.

Qué hace Pocket TTS Voice

Especificaciones

Speed
Sobre 6x tiempo real en CPU, en streaming
Input
Texto de hasta 2000 caracteres
Output
Locución WAV (24 kHz)
Privacy
ONNX en el dispositivo, cero subidas
Cost
Gratis, ilimitado, sin registro

Preguntas frecuentes

¿Mi texto se envía a un servidor?

No. Pocket TTS se ejecuta 100% en tu navegador vía ONNX. Tu texto nunca sale de tu dispositivo.

¿Qué idiomas y voces hay disponibles?

Cinco idiomas (inglés, alemán, italiano, portugués, español), cada uno con 8 voces integradas.

¿Por qué la primera vez tarda más?

Los modelos de voz se descargan una vez y quedan en la caché del navegador. Después cada generación empieza más rápido.

¿En qué formato se descarga?

Un archivo de locución WAV de 24 kHz que puedes usar en cualquier editor de video o pódcast.

Más herramientas gratis

¿Necesitas más control? Abre el editor completo de video y audio →