LiveTranscriber: entiende y habla en otro idioma, con tu propia voz
Código fuenteLiveTranscriber hace dos cosas a la vez: te enseña por escrito, en tu idioma, lo que suena en el ordenador; y deja que tú hables en otro idioma con tu propia voz. Todo se ejecuta en local, sin nube y sin factura de API: el audio no sale de la máquina.

Leer lo que dicen los demás
Captura cualquier audio del sistema —una reunión de Teams, una película, un vídeo del navegador— y lo transcribe en directo. También puede escuchar el micrófono al mismo tiempo, en sesiones independientes, para tener las dos partes de una conversación.
Sobre la transcripción se puede encender la traducción a más de 40 idiomas. Cada frase se traduce en cuanto la puntuación la cierra, no al final del párrafo, así que el texto traducido va una frase por detrás en lugar de aparecer a bloques cuando alguien termina de hablar. En pantalla se agrupa por párrafos para que se lea como un texto normal.
Hablar con tu propia voz
Aquí está lo distinto. Hablas al micrófono en español, y lo que sale por el otro lado es esa misma frase en el idioma de destino y con tu voz, no con una voz sintética genérica: el modelo clona tu timbre a partir de una muestra tuya.
Y no se queda dentro de la aplicación. La voz se reproduce por un micrófono virtual, así que cualquier programa que use un micrófono —Teams, Meet, Discord— la escucha como si estuvieras hablando tú. Está verificado de punta a punta: la voz clonada entró por el cable virtual y el propio reconocedor, escuchando al otro lado, la transcribió palabra por palabra, puntuación incluida. Lo que oiría la otra persona es exactamente lo que dijiste.
Hay dos modos. Con clonado de voz, 23 idiomas y tu timbre. Sin clonado, una voz neutra mucho más rápida en 8 idiomas, útil cuando prima la fluidez. La función es completamente opcional: apagada no gasta nada, ni proceso ni memoria de la gráfica.
La reunión en inglés
El escenario que junta las dos mitades: estás en una reunión en inglés. Lees en español lo que dicen los demás, según lo van diciendo. Y cuando te toca hablar, hablas en español y ellos te oyen en inglés con tu voz. No hay que cambiar de idioma mentalmente en ninguna de las dos direcciones.
Solo se pronuncia la traducción de tu micrófono, nunca las frases de los demás —no tendría sentido devolverles su propia voz— y lleva control de eco: si tu voz sale por los altavoces y el micro la recoge, no vuelve a entrar en el bucle.
Lo que te llevas
La sesión se puede exportar a texto o subtítulos .srt, en el idioma original, traducido o bilingüe con las dos versiones juntas. Los ficheros se nombran por fecha y no se sobrescriben: dos exportaciones el mismo día generan dos ficheros, no uno perdido.
Un apunte de cómo está hecho
La captura de audio y toda la lógica están en Rust, la aplicación es Tauri con interfaz en React, y los modelos corren en procesos aparte: reconocimiento con Nemotron-3.5-ASR de NVIDIA, traducción con NLLB-200 y voz con Chatterbox Multilingual. Cada motor está detrás de una interfaz, así que cambiar cualquiera de los tres no toca ni la captura ni la interfaz.
Necesita Windows y una GPU NVIDIA; con una RTX 3060 va sobrado. Y conviene tener presente que es una cadena: si el reconocimiento oye mal una palabra, la traducción arrastra el error. Esto es subtitulado traducido con una frase de retraso, no interpretación simultánea profesional.
Código en GitHub.