Saltar al contenido
Alejandro ArandaAlejandro Aranda
Volver a proyectos
4 min de lecturaProyectos

LiveTranscriber: entiende y habla en otro idioma, con tu propia voz

Código fuenteDescargar v0.2.0-beta.1

LiveTranscriber hace dos cosas a la vez: te enseña por escrito, en tu idioma, lo que suena en el ordenador; y deja que tú hables en otro idioma con tu propia voz. Todo se ejecuta en local, sin nube y sin factura de API: el audio no sale de la máquina.

LiveTranscriber

Leer lo que dicen los demás

Captura cualquier audio del sistema —una reunión de Teams, una película, un vídeo del navegador— y lo transcribe en directo. También escucha el micrófono a la vez, como dos sesiones independientes, para tener las dos partes de una conversación por separado.

Sobre cada una se puede encender la traducción a más de 40 idiomas, y cada sesión va en su propio sentido: lo que entra por el sistema en inglés lo lees en español, y lo que dices tú en español viaja hacia el inglés. Cada frase se traduce en cuanto la puntuación la cierra, no al final del párrafo, así que el texto traducido va una frase por detrás en lugar de aparecer a bloques cuando alguien termina de hablar. En pantalla se agrupa por párrafos para que se lea como un texto normal.

Hablar con tu propia voz

Aquí está lo distinto. Hablas al micrófono en español, y lo que sale por el otro lado es esa misma frase en el idioma de destino y con tu voz, no con una voz sintética genérica: el modelo clona tu timbre a partir de una muestra tuya de entre 10 y 30 segundos.

Y no se queda dentro de la aplicación. La voz se reproduce por un micrófono virtual, así que cualquier programa que use un micrófono —Teams, Meet, Discord— la escucha como si estuvieras hablando tú. Está verificado de punta a punta: la voz clonada entró por el cable virtual y el propio reconocedor, escuchando al otro lado, la transcribió palabra por palabra, puntuación incluida. Lo que oiría la otra persona es exactamente lo que dijiste.

Hay dos modos. Con clonado de voz, 23 idiomas y tu timbre. Sin clonado, una voz predefinida mucho más rápida en 8 idiomas, útil cuando prima la fluidez.

La reunión en inglés

El escenario que junta las dos mitades: estás en una reunión en inglés. Lees en español lo que dicen los demás, según lo van diciendo. Y cuando te toca hablar, hablas en español y ellos te oyen en inglés con tu voz. No hay que cambiar de idioma mentalmente en ninguna de las dos direcciones.

Solo se pronuncia la traducción de tu micrófono, nunca las frases de los demás —no tendría sentido devolverles su propia voz— y lleva control de eco: si tu voz sale por los altavoces y el micro la recoge, no vuelve a entrar en el bucle.

Se enciende por capas

Las tres funciones son opcionales y se activan en ese orden, así que puedes quedarte donde te interese. Solo transcripción: texto en directo del sistema y del micrófono. Añadiendo traducción: ambos lados traducidos, en los dos sentidos, a cambio de una frase de retraso. Y encendiendo la voz: que la reunión te oiga en su idioma con tu timbre, lo único que pide un cable de audio virtual y una muestra de tu voz. Apagada, no gasta ni un proceso ni memoria de la gráfica.

Lo que te llevas

La sesión se puede exportar a texto o subtítulos .srt, en el idioma original, traducido o bilingüe con las dos versiones juntas. Los ficheros se nombran por fecha y no se sobrescriben: dos exportaciones el mismo día generan dos ficheros, no uno perdido.

Un apunte de cómo está hecho

La captura de audio y toda la lógica están en Rust, la aplicación es Tauri con interfaz en React, y los modelos corren en procesos aparte: reconocimiento con Nemotron-3.5-ASR de NVIDIA, traducción con NLLB-200 y voz con Chatterbox Multilingual. Cada motor está detrás de una interfaz, así que cambiar cualquiera de los tres no toca ni la captura ni la interfaz.

Necesita Windows y una GPU NVIDIA de Turing en adelante, y 15 GB de disco para los modelos —27 GB si añades la voz—; con una RTX 3060 va sobrado. El instalador mide la máquina, elige la precisión según la gráfica, se descarga los modelos y comprueba que todo arranca de verdad antes de darse por bueno.

Y conviene tener presente que es una cadena: si el reconocimiento oye mal una palabra, la traducción arrastra el error. Esto es subtitulado traducido con una frase de retraso, no interpretación simultánea profesional.

Apoyar el proyecto

LiveTranscriber corre entero en tu equipo: sin factura de API, sin cuentas y sin que el audio salga de la máquina. Sostener eso —los modelos, las medidas, cada versión— es tiempo; si te sirve, puedes apoyarlo en GitHub Sponsors.

Código en GitHub.

También te puede interesar