Texto a voz con IA en español e inglés, en tu navegador

Abre Auditius, elige Voz… en el menú Generar, escribe tu texto, escoge una voz y pulsa Generar. Los modelos de voz de IA funcionan en tu propio dispositivo tras una única descarga, así que tu texto nunca se sube. La voz se abre como un archivo nuevo que puedes editar, o entra directamente en una grabación en la posición del cursor.

  • Gratis
  • Sin instalar nada ni crear cuenta
  • Tus archivos no salen de tu ordenador
  • En español e inglés

Cómo convertir texto en voz paso a paso

No necesitas ningún archivo abierto: por defecto, la voz se crea como un archivo nuevo.

  1. Pulsa Abrir Auditius para generar voz.
  2. Abre el menú Generar y elige Voz…
  3. Escribe o pega tu texto en Texto. Añade [pausa] donde quieras medio segundo de silencio.
  4. Pon el Idioma en Español o Inglés y elige una Voz. La lista agrupa las voces por motor e indica cuáles están ya descargadas.
  5. La primera vez que uses una voz, pulsa Descargar. Se queda en este navegador para la próxima vez.
  6. Ajusta la Velocidad si hace falta, de 0,5× a 2×, y deja la Salida en Nuevo archivo.
  7. Pulsa Generar, escúchalo con la barra espaciadora y guárdalo con Archivo ▸ Guardar como… en WAV, FLAC, MP3 u Ogg Vorbis.

Qué voz elegir

Hay tres motores de voz, y todos tienen voces en español y en inglés.

  • Kokoro: natural y rápido. Una descarga de 96 MB incluye sus siete voces: Dora, Alex y Santa en español, y Heart, Bella, Michael y Fenrir en inglés de Estados Unidos.
  • Piper: muy rápido y ligero, con una descarga de 28 a 64 MB por voz. davefx y carlfm hablan español de España, ald español de México, y LJSpeech y Norman inglés de Estados Unidos.
  • Chatterbox: el más expresivo, con un control de Expresividad en lugar de Velocidad y la opción de clonar una voz. Ocupa 963 MB y necesita WebGPU; sin él, funciona en el procesador y tarda entre 15 y 25 segundos por cada segundo de voz.
  • La primera voz que descargues trae además un motor de 27 MB que comparten todos los modelos.

Pausas, párrafos y dónde va la voz

Las etiquetas de pausa funcionan igual con todos los motores, en español o en inglés.

  • [pausa] o [pause] añade 0,5 segundos de silencio; [pausa 2s], [pausa 1,5] y [pausa 300ms] fijan la duración.
  • Una línea en blanco entre párrafos añade una pausa de 0,8 segundos.
  • Otras palabras entre corchetes no se leen: la ventana las enumera y se las salta.
  • Insertar en el cursor mete la voz en el archivo activo, en la posición del cursor, y empuja el resto del audio hacia la derecha, en un solo paso que puedes deshacer.

Clonar una voz, solo con consentimiento

Con Chatterbox puedes guardar una voz a partir de una grabación corta. Abre Clonar una voz, usa como Referencia una selección del archivo activo o Un archivo (de 5 a 10 segundos de una sola persona hablando con claridad, sin música), escribe un Nombre y marca Es mi voz o tengo permiso de su dueño. Guardar voz sigue desactivado hasta que lo hagas.

Para clonar hace falta un codificador de voz de 592 MB, que se descarga aparte. Las voces guardadas solo se quedan en este navegador, y luego las eliges en Locutor.

La voz generada queda marcada

Cada resultado queda marcado como voz sintética en sus metadatos, con el motor y la voz que lo generaron. La nota se escribe en los archivos WAV, y cuando insertas voz en una grabación, ese archivo también la recibe.

Preguntas frecuentes

¿Qué voces en español tiene el texto a voz?

Kokoro tiene a Dora, Alex y Santa. Piper tiene a davefx y carlfm, de España, y a ald, de México. Chatterbox tiene una voz multilingüe predeterminada y puede usar las voces que clones.

¿Cómo añado una pausa en el texto a voz?

Escribe [pausa] o [pause] para medio segundo, o indica la duración, como [pausa 2s] o [pausa 300ms]. Una línea en blanco entre párrafos añade 0,8 segundos.

¿Puedo cambiar lo rápido que habla la voz generada?

Las voces de Kokoro y Piper tienen un control de Velocidad de 0,5× a 2×. Chatterbox tiene Expresividad en su lugar; para cambiar su ritmo después, usa Efectos ▸ Tiempo/Tono ▸ Estiramiento de tiempo…

¿Por qué Chatterbox tarda tanto en generar la voz?

Es un modelo grande que necesita WebGPU; sin él funciona en el procesador y va muy lento. Kokoro y Piper son rápidos en cualquier equipo.

¿Se envía mi texto a un servidor para generar la voz?

No. Solo se descargan los modelos de voz, una vez. La voz se genera en tu navegador, en tu propio dispositivo, y tu texto se queda ahí.

¿Puedo clonar la voz de otra persona?

Solo con su permiso. Antes de guardar una voz tienes que confirmar que es tuya o que tienes permiso de su dueño, y todo lo que generes con ella queda marcado como voz sintética.

Herramientas de audio