Skip to content

v0.69.0 — Karaoke completo, encadenado de descargas y comparación de separadores

Choose a tag to compare

@santiquiroz santiquiroz released this 18 Aug 23:03
· 24 commits to master since this release

Seis funciones nuevas, casi todas alrededor del audio, más una que cambia cómo se
usa toda la app.

🎤 Karaoke completo, en un solo trabajo

Le das una canción y te devuelve el video: sin voz, con la letra sincronizada en
pantalla
. Si el archivo no tiene imagen, el fondo se genera solo.

Las tres piezas ya estaban sueltas —separar la voz, transcribir con tiempos,
quemar subtítulos—. Lo que faltaba era el empalme: pegarle a la imagen la pista
instrumental en vez de la original, que es justo lo que ninguno de los tres
pasos hace por su cuenta.

Está en Transcripción, como un modo de salida más. Ahora ese selector también
aparece para archivos de audio, porque el karaoke es el único modo con video de
salida que no necesita video de entrada.

🔗 Pegás un link y te llegan las pistas

La descarga puede encadenarse con la separación, sin pasar por el módulo de audio
a mano. Una playlist dispara un trabajo por canción.

El archivo que bajaste no se pierde: cada trabajo tiene su propio nombre para
el mismo contenido. Y si la separación falla —falta el modelo, se acabó la
cuota— la descarga sigue estando completa, con su archivo en disco, en vez de
volverse roja por algo que sí salió bien.

⚖️ Probar 2-3 separadores antes de comprometer el tema

Cuál separa mejor depende de tu material, y los rankings publicados promedian
sobre un dataset que no es el tuyo.

Elegís dos o tres modelos y se corren sobre 30 segundos de tu archivo, que cuesta
unas 8 veces menos que la canción entera. Después elegís con el oído.

El fragmento sale del medio y no del arranque: las intros suelen ser
instrumentales, y juzgar un separador de voces en una parte sin voces no dice
nada.

🎯 Máxima calidad: combinar separadores

Corre dos o tres modelos y promedia pista por pista. Sirve porque cada
arquitectura falla distinto: lo que comparten es la señal —todos estiman la misma
voz— y eso se suma; sus artefactos, que no están correlacionados, se cancelan en
parte.

Lo que no hace, y lo dice también la pantalla: inventar separación que ninguno
logró. Si los tres se dejan la voz adentro del instrumental, el promedio también
la tiene.

El costo se dice antes de esperarlo: son N pasadas completas sobre el tema.

🪄 Detalle generativo por tiles

Recorre una foto a su tamaño real, de a pedazos, pidiéndole a un modelo de
difusión que dibuje textura. Está en Generar, junto a imagen a imagen — que hasta
ahora reducía la foto al tamaño del modelo, o sea servía para reinterpretarla, no
para agregarle detalle.

Una aclaración que la app hace en pantalla y que vale repetir acá: inventa lo
que agrega
. Los poros, los pelos y las letras chicas que aparecen no estaban en
el original. Si querés una copia fiel y más grande, eso es el reescalado del
módulo de imagen, que reconstruye en vez de dibujar.

📥 Varios archivos de una, en todos los módulos

Imagen y audio ya aceptaban lotes. Ahora también video, transcripción y
descargas
: elegís un montón de archivos (o pegás varias líneas de URLs) y
quedan encolados con los mismos ajustes, sin repetir el proceso uno por uno.

El primero se sigue en vivo y el resto entra a la cola lateral. De a uno y no
todos juntos, porque en paralelo se pelean el ancho de banda.


Instalación: bajá el .exe de acá abajo y ejecutalo. Si ya tenés Upflow, el
instalador actualiza sobre lo que hay — los modelos que ya bajaste se conservan.

3859 pruebas de backend y 1226 de frontend, todas en verde.