Detrás de cámaras: nuestro laboratorio de aprendizaje automático
En nuestro último artículo, nos adentramos en el apasionante mundo de la tecnología de sincronización labialRask , con la orientación de Dima Vypirailenko, jefe de Aprendizaje Automático de la empresa. Te llevamos detrás de cámaras al Brask ML Lab, un centro de excelencia tecnológica, donde vemos de primera mano cómo esta innovadora herramienta de IA está causando sensación en la creación y distribución de contenido. Nuestro equipo cuenta con ingenieros de aprendizaje automático de clase mundial y artistas de efectos visuales sintéticos que no solo se están adaptando al futuro, sino que lo están creando.
Acompáñanos a descubrir cómo esta tecnología está transformando la industria creativa, reduciendo los costos y ayudando a los creadores a llegar a audiencias de todo el mundo.
¿Qué es la tecnología de sincronización labial?
Uno de los principales retos de la localización de videos es el movimiento poco natural de los labios. La tecnología de sincronización labial está diseñada para ayudar a sincronizar de manera eficaz los movimientos de los labios con las pistas de audio multilingües.
Como hemos aprendido en nuestro último artículo, la técnica de sincronización labial es mucho más compleja que simplemente acertar con el ritmo: también hay que reproducir correctamente los movimientos de la boca. Todas las palabras que se pronuncian tienen un efecto en el rostro de quien habla; por ejemplo, la «O» obviamente creará una forma ovalada en la boca, por lo que no será una «M», lo que añade mucha más complejidad al proceso de doblaje.
¡Te presentamos el nuevo modelo de sincronización labial con mejor calidad!
Nuestro equipo de aprendizaje automático ha decidido mejorar el modelo de sincronización labial existente. ¿Cuál fue el motivo de esta decisión y qué novedades presenta esta versión en comparación con la versión beta?
Se realizaron importantes esfuerzos para mejorar el modelo, entre los que se incluyen:
- Mayor precisión: Hemos perfeccionado los algoritmos de IA para analizar y hacer coincidir mejor los detalles fonéticos del lenguaje hablado, lo que se traduce en movimientos labiales más precisos y estrechamente sincronizados con el audio en varios idiomas.
- Mayor naturalidad: Al integrar datos de captura de movimiento más avanzados y perfeccionar nuestras técnicas de aprendizaje automático, hemos mejorado significativamente la naturalidad de los movimientos labiales, lo que hace que el habla de los personajes se vea más fluida y realista.
- Mayor velocidad y eficiencia: Optimizamos el modelo para procesar videos más rápido sin sacrificar la calidad, lo que permite plazos de entrega más cortos para proyectos que requieren una localización a gran escala.
- Incorporación de los comentarios de los usuarios: Recopilamos activamente los comentarios de los usuarios de la versión beta e incorporamos sus opiniones al proceso de desarrollo para resolver problemas específicos y mejorar la satisfacción general de los usuarios.
¿Cómo sincroniza exactamente nuestro modelo de IA los movimientos de los labios con el audio traducido?
Dima: «Nuestro modelo de IA funciona combinando la información del audio traducido con la información sobre el rostro de la persona que aparece en el cuadro, y luego fusiona ambos datos en el resultado final. Esta integración garantiza que los movimientos de los labios se sincronicen con precisión con el discurso traducido, lo que brinda una experiencia visual fluida».
¿Qué características únicas hacen que Premium Lip-Sync sea ideal para crear contenido de alta calidad?
Dima: «Premium Lip-sync está diseñado específicamente para manejar contenido de alta calidad gracias a sus características únicas, como la capacidad de trabajar con múltiples hablantes y el soporte de alta resolución. Puede procesar videos con una resolución de hasta 2K, lo que garantiza que la calidad visual se mantenga sin comprometerla. Además, la función de múltiples hablantes permite una sincronización labial precisa entre diferentes hablantes dentro del mismo video, lo que lo hace altamente efectivo para producciones complejas que involucran a múltiples personajes o hablantes. Estas características hacen de Premium Lip-sync la mejor opción para los creadores que buscan producir contenido de nivel profesional».
¿Y qué es la función de sincronización labial con varios hablantes?
La función de sincronización labial para múltiples hablantes está diseñada para sincronizar con precisión los movimientos de los labios con el audio hablado en videos en los que aparecen varias personas. Esta tecnología avanzada identifica y distingue entre varios rostros en un mismo fotograma, lo que garantiza que los movimientos de los labios de cada persona se animen correctamente de acuerdo con lo que dicen.
Cómo funciona la sincronización labial con varios altavoces:
- Reconocimiento de rostros en el fotograma: Esta función reconoce inicialmente todos los rostros presentes en el fotograma del video, sin importar cuántos sean. Es capaz de identificar a cada persona, lo cual es fundamental para lograr una sincronización labial precisa.
- Sincronización de audio: Durante la reproducción del video, la tecnología sincroniza la pista de audio específicamente con la persona que está hablando. Este proceso de sincronización preciso garantiza que la voz y los movimientos de los labios estén sincronizados.
- Sincronización del movimiento de los labios: Una vez identificada la persona que habla, la función de sincronización de labios redibuja los movimientos de los labios únicamente de la persona que habla. Los movimientos de los labios de las personas que no hablan en el encuadre no se modificarán, manteniendo su estado natural a lo largo de todo el video. Esta sincronización se aplica exclusivamente a la persona que habla, lo que la hace efectiva incluso en presencia de voces fuera de pantalla o de múltiples rostros en la escena.
- Manejo de imágenes estáticas de labios: Curiosamente , esta tecnología también es lo suficientemente sofisticada como para redibujar los movimientos de los labios en imágenes estáticas de estos, siempre que aparezcan en el fotograma del video, lo que demuestra su versatilidad.
Esta función de sincronización labial para múltiples hablantes mejora el realismo y la participación del espectador en escenas con varios hablantes o configuraciones de video complejas, al garantizar que solo se muevan los labios de las personas que están hablando de acuerdo con el audio. Este enfoque específico ayuda a mantener la atención en el hablante activo y conserva la dinámica natural de las interacciones grupales en los videos.
A partir de un solo video, en cualquier idioma, puedes crear cientos de videos personalizados con diversas ofertas en varios idiomas. Esta versatilidad revoluciona la forma en que los especialistas en marketing pueden interactuar con audiencias diversas y globales, mejorando el impacto y el alcance del contenido promocional.
¿Cómo se logra el equilibrio entre la calidad y la velocidad de procesamiento en la nueva función «Sincronización labial Premium»?
Dima: «Lograr un equilibrio entre la alta calidad y la velocidad de procesamiento en Premium Lipsync es todo un reto, pero hemos logrado avances significativos en la optimización de la inferencia de nuestro modelo. Esta optimización nos permite ofrecer la mejor calidad posible a una velocidad aceptable».
¿Encontraste alguna imperfección interesante o alguna sorpresa mientras entrenabas el modelo?
Además, trabajar con oclusiones en el área de la boca ha resultado ser bastante difícil. Estos elementos requieren una atención minuciosa a los detalles y un modelado sofisticado para lograr una representación realista y precisa en nuestra tecnología de sincronización labial.


¿Cómo garantiza el equipo de aprendizaje automático la privacidad y la protección de los datos de los usuarios al procesar materiales de video?
Dima: Nuestro equipo de aprendizaje automático se toma muy en serio la privacidad y la protección de los datos de los usuarios. Para el modelo Lipsync, no utilizamos datos de clientes para el entrenamiento, lo que elimina cualquier riesgo de robo de identidad. Para entrenar nuestro modelo, nos basamos exclusivamente en datos de código abierto que cuentan con las licencias adecuadas. Además, el modelo opera como una instancia independiente para cada usuario, lo que garantiza que el video final se entregue únicamente al usuario específico y evita cualquier mezcla de datos.
En esencia, estamos comprometidos a empoderar a los creadores y a garantizar el uso responsable de la inteligencia artificial en la creación de contenido, con un enfoque en los derechos legales y la transparencia ética. Te garantizamos que tus videos, fotos, voces e imágenes nunca se utilizarán sin tu permiso explícito, asegurando así la protección de tus datos personales y tus activos creativos.
Nos enorgullece ser miembros de la Coalición para la Procedencia y Autenticidad del Contenido (C2PA) y de la Iniciativa para la Autenticidad del Contenido, lo que refleja nuestro compromiso con la integridad y la autenticidad del contenido en la era digital. Además, nuestra fundadora y directora ejecutiva, María Chmir, figura en el directorio Women in AI Ethics™, lo que destaca nuestro liderazgo en prácticas éticas de IA.
¿Cuáles son las perspectivas futuras para el desarrollo de la tecnología de sincronización labial? ¿Hay algún área específica que te interese especialmente?
Dima: Creemos que nuestra tecnología de sincronización labial puede servir de base para seguir avanzando hacia la creación de avatares digitales. Imaginamos un futuro en el que cualquiera pueda crear y adaptar contenido sin tener que incurrir en costos de producción de video.
A corto plazo, en los próximos dos meses, nos comprometemos a mejorar el rendimiento y la calidad de nuestro modelo. Nuestro objetivo es garantizar un funcionamiento fluido con videos en 4K y mejorar la funcionalidad con videos traducidos a idiomas asiáticos. Estos avances son cruciales, ya que buscamos ampliar la accesibilidad y la facilidad de uso de nuestra tecnología, allanando el camino para aplicaciones innovadoras en la creación de contenido digital. ¡Romper las barreras del idioma nunca ha estado tan al alcance! Prueba nuestra funcionalidad mejorada de sincronización labial y envíanos tus comentarios sobre esta característica.
Preguntas frecuentes
La sincronización labial está disponible en los planes Creator Pro, Archive Pro, Business y Enterprise.
Cada minuto de sincronización labial generado equivale a un minuto deducido de tu saldo total de minutos.
Los minutos de sincronización labial se deducen igual que al doblar tus videos.
La sincronización labial se cobra por separado del doblaje. Por ejemplo, para traducir y sincronizar labialmente un video de 1 minuto a un idioma, necesitas 2 minutos.
Antes de generar la sincronización labial, podrás probar 1 minuto gratis para evaluar la calidad de la tecnología.
La velocidad de generación de la sincronización labial depende del número de personas que hablan en el video, así como de la duración, la calidad y el tamaño del video.
Por ejemplo, estas son las velocidades aproximadas de generación de la sincronización labial para diferentes videos:
Videos con un solo orador
- Video de 4 minutos a 1080p ≈ 29 minutos
- 10 minutos en 1080p ≈ 2 horas y 10 minutos
- Un video de 4K de 10 minutos ≈ 8 horas
Videos con tres ponentes:
- 10 minutos en 1080p ≈ 5 horas y 20 minutos
- Sube tu video a través del enlace de YouTube, Google Drive o sube el archivo directamente desde tu dispositivo. Elige el idioma de destino y haz clic en el botón «Traducir».
- Agrega una voz en off a tu video en Rask mediante el botón «Dub video».
- Para verificar si tu video es compatible con la sincronización labial, haz clic en el botón «Verificación de sincronización labial».
- Si es compatible, sigue adelante tocando el botón «Sincronización labial».
- A continuación, selecciona el número de rostros que quieres que aparezcan en tu video —ya sea «1» o «2+»— y luego toca «Iniciar sincronización labial». Solo un aviso: se trata del número de rostros, no de personas que hablan.









Rask%20Lens%20A%20Recap%204.webp)



