Detrás de cámaras: nuestro laboratorio de aprendizaje automático

En nuestro último artículo, nos adentramos en el apasionante mundo de la tecnología de sincronización labialRask , con la orientación de Dima Vypirailenko, jefe de Aprendizaje Automático de la empresa. Te llevamos detrás de cámaras al Brask ML Lab, un centro de excelencia tecnológica, donde vemos de primera mano cómo esta innovadora herramienta de IA está causando sensación en la creación y distribución de contenido. Nuestro equipo cuenta con ingenieros de aprendizaje automático de clase mundial y artistas de efectos visuales sintéticos que no solo se están adaptando al futuro, sino que lo están creando.

Acompáñanos a descubrir cómo esta tecnología está transformando la industria creativa, reduciendo los costos y ayudando a los creadores a llegar a audiencias de todo el mundo.

¿Qué es la tecnología de sincronización labial?

Uno de los principales retos de la localización de videos es el movimiento poco natural de los labios. La tecnología de sincronización labial está diseñada para ayudar a sincronizar de manera eficaz los movimientos de los labios con las pistas de audio multilingües. 

Como hemos aprendido en nuestro último artículo, la técnica de sincronización labial es mucho más compleja que simplemente acertar con el ritmo: también hay que reproducir correctamente los movimientos de la boca. Todas las palabras que se pronuncian tienen un efecto en el rostro de quien habla; por ejemplo, la «O» obviamente creará una forma ovalada en la boca, por lo que no será una «M», lo que añade mucha más complejidad al proceso de doblaje.

¡Te presentamos el nuevo modelo de sincronización labial con mejor calidad!

Nuestro equipo de aprendizaje automático ha decidido mejorar el modelo de sincronización labial existente. ¿Cuál fue el motivo de esta decisión y qué novedades presenta esta versión en comparación con la versión beta?

Dima Vypirailenko
Jefe de Aprendizaje Automático en Rask
Aunque nuestros resultados de sincronización labial son excepcionales y han atraído una considerable atención de los medios, incluyendo transmisiones de televisión y entrevistas sobre nuestra tecnología, cuando lanzamos nuestra versión beta del modelo de sincronización labial, nos dimos cuenta de que no cumplía con las expectativas de calidad de todos los segmentos de usuarios. Nuestro objetivo principal era cerrar esta brecha, asegurándonos de que nuestros usuarios pudieran localizar de manera efectiva no solo el componente de audio de su contenido, sino también el componente de video.

Se realizaron importantes esfuerzos para mejorar el modelo, entre los que se incluyen:

  1. Mayor precisión: Hemos perfeccionado los algoritmos de IA para analizar y hacer coincidir mejor los detalles fonéticos del lenguaje hablado, lo que se traduce en movimientos labiales más precisos y estrechamente sincronizados con el audio en varios idiomas.
  2. ‍Mayor naturalidad: Al integrar datos de captura de movimiento más avanzados y perfeccionar nuestras técnicas de aprendizaje automático, hemos mejorado significativamente la naturalidad de los movimientos labiales, lo que hace que el habla de los personajes se vea más fluida y realista.
  3. ‍Mayor velocidad y eficiencia: Optimizamos el modelo para procesar videos más rápido sin sacrificar la calidad, lo que permite plazos de entrega más cortos para proyectos que requieren una localización a gran escala.
  4. ‍Incorporación de los comentarios de los usuarios: Recopilamos activamente los comentarios de los usuarios de la versión beta e incorporamos sus opiniones al proceso de desarrollo para resolver problemas específicos y mejorar la satisfacción general de los usuarios.

¿Cómo sincroniza exactamente nuestro modelo de IA los movimientos de los labios con el audio traducido?

Dima: «Nuestro modelo de IA funciona combinando la información del audio traducido con la información sobre el rostro de la persona que aparece en el cuadro, y luego fusiona ambos datos en el resultado final. Esta integración garantiza que los movimientos de los labios se sincronicen con precisión con el discurso traducido, lo que brinda una experiencia visual fluida».

¿Qué características únicas hacen que Premium Lip-Sync sea ideal para crear contenido de alta calidad?

Dima: «Premium Lip-sync está diseñado específicamente para manejar contenido de alta calidad gracias a sus características únicas, como la capacidad de trabajar con múltiples hablantes y el soporte de alta resolución. Puede procesar videos con una resolución de hasta 2K, lo que garantiza que la calidad visual se mantenga sin comprometerla. Además, la función de múltiples hablantes permite una sincronización labial precisa entre diferentes hablantes dentro del mismo video, lo que lo hace altamente efectivo para producciones complejas que involucran a múltiples personajes o hablantes. Estas características hacen de Premium Lip-sync la mejor opción para los creadores que buscan producir contenido de nivel profesional».

¿Y qué es la función de sincronización labial con varios hablantes?

La función de sincronización labial para múltiples hablantes está diseñada para sincronizar con precisión los movimientos de los labios con el audio hablado en videos en los que aparecen varias personas. Esta tecnología avanzada identifica y distingue entre varios rostros en un mismo fotograma, lo que garantiza que los movimientos de los labios de cada persona se animen correctamente de acuerdo con lo que dicen.

Cómo funciona la sincronización labial con varios altavoces:

  • Reconocimiento de rostros en el fotograma: Esta función reconoce inicialmente todos los rostros presentes en el fotograma del video, sin importar cuántos sean. Es capaz de identificar a cada persona, lo cual es fundamental para lograr una sincronización labial precisa.
  • ‍Sincronización de audio: Durante la reproducción del video, la tecnología sincroniza la pista de audio específicamente con la persona que está hablando. Este proceso de sincronización preciso garantiza que la voz y los movimientos de los labios estén sincronizados.
  • ‍Sincronización del movimiento de los labios: Una vez identificada la persona que habla, la función de sincronización de labios redibuja los movimientos de los labios únicamente de la persona que habla. Los movimientos de los labios de las personas que no hablan en el encuadre no se modificarán, manteniendo su estado natural a lo largo de todo el video. Esta sincronización se aplica exclusivamente a la persona que habla, lo que la hace efectiva incluso en presencia de voces fuera de pantalla o de múltiples rostros en la escena.
  • ‍Manejo de imágenes estáticas de labios: Curiosamente , esta tecnología también es lo suficientemente sofisticada como para redibujar los movimientos de los labios en imágenes estáticas de estos, siempre que aparezcan en el fotograma del video, lo que demuestra su versatilidad.

    Esta función de sincronización labial para múltiples hablantes mejora el realismo y la participación del espectador en escenas con varios hablantes o configuraciones de video complejas, al garantizar que solo se muevan los labios de las personas que están hablando de acuerdo con el audio. Este enfoque específico ayuda a mantener la atención en el hablante activo y conserva la dinámica natural de las interacciones grupales en los videos.

A partir de un solo video, en cualquier idioma, puedes crear cientos de videos personalizados con diversas ofertas en varios idiomas. Esta versatilidad revoluciona la forma en que los especialistas en marketing pueden interactuar con audiencias diversas y globales, mejorando el impacto y el alcance del contenido promocional.

¿Cómo se logra el equilibrio entre la calidad y la velocidad de procesamiento en la nueva función «Sincronización labial Premium»?

Dima: «Lograr un equilibrio entre la alta calidad y la velocidad de procesamiento en Premium Lipsync es todo un reto, pero hemos logrado avances significativos en la optimización de la inferencia de nuestro modelo. Esta optimización nos permite ofrecer la mejor calidad posible a una velocidad aceptable».

Dima Vypirailenko
Jefe de Aprendizaje Automático en Rask
Nos enfocamos en procesar únicamente la información necesaria del video del usuario, lo que acelera significativamente el tiempo de procesamiento del modelo. Al optimizar los datos que nuestro modelo necesita analizar, garantizamos tanto la eficiencia como el mantenimiento de resultados de alta calidad, satisfaciendo así las exigencias de los creadores de contenido profesionales.

¿Encontraste alguna imperfección interesante o alguna sorpresa mientras entrenabas el modelo?

Dima Vypirailenko
Jefe de Aprendizaje Automático en Rask
Sí, nos hemos enfrentado a varios retos interesantes, sobre todo en lo que respecta a asegurarnos de que no solo los labios, sino también el vello facial y los dientes se vean bien. ¡Es casi como si todos hubiéramos obtenido un título en odontología en algún momento!


Además, trabajar con oclusiones en el área de la boca ha resultado ser bastante difícil. Estos elementos requieren una atención minuciosa a los detalles y un modelado sofisticado para lograr una representación realista y precisa en nuestra tecnología de sincronización labial.

¿Cómo garantiza el equipo de aprendizaje automático la privacidad y la protección de los datos de los usuarios al procesar materiales de video?

Dima: Nuestro equipo de aprendizaje automático se toma muy en serio la privacidad y la protección de los datos de los usuarios. Para el modelo Lipsync, no utilizamos datos de clientes para el entrenamiento, lo que elimina cualquier riesgo de robo de identidad. Para entrenar nuestro modelo, nos basamos exclusivamente en datos de código abierto que cuentan con las licencias adecuadas. Además, el modelo opera como una instancia independiente para cada usuario, lo que garantiza que el video final se entregue únicamente al usuario específico y evita cualquier mezcla de datos.

En esencia, estamos comprometidos a empoderar a los creadores y a garantizar el uso responsable de la inteligencia artificial en la creación de contenido, con un enfoque en los derechos legales y la transparencia ética. Te garantizamos que tus videos, fotos, voces e imágenes nunca se utilizarán sin tu permiso explícito, asegurando así la protección de tus datos personales y tus activos creativos.

Nos enorgullece ser miembros de la Coalición para la Procedencia y Autenticidad del Contenido (C2PA) y de la Iniciativa para la Autenticidad del Contenido, lo que refleja nuestro compromiso con la integridad y la autenticidad del contenido en la era digital. Además, nuestra fundadora y directora ejecutiva, María Chmir, figura en el directorio Women in AI Ethics™, lo que destaca nuestro liderazgo en prácticas éticas de IA.

¿Cuáles son las perspectivas futuras para el desarrollo de la tecnología de sincronización labial? ¿Hay algún área específica que te interese especialmente?

Dima: Creemos que nuestra tecnología de sincronización labial puede servir de base para seguir avanzando hacia la creación de avatares digitales. Imaginamos un futuro en el que cualquiera pueda crear y adaptar contenido sin tener que incurrir en costos de producción de video.

A corto plazo, en los próximos dos meses, nos comprometemos a mejorar el rendimiento y la calidad de nuestro modelo. Nuestro objetivo es garantizar un funcionamiento fluido con videos en 4K y mejorar la funcionalidad con videos traducidos a idiomas asiáticos. Estos avances son cruciales, ya que buscamos ampliar la accesibilidad y la facilidad de uso de nuestra tecnología, allanando el camino para aplicaciones innovadoras en la creación de contenido digital. ¡Romper las barreras del idioma nunca ha estado tan al alcance! Prueba nuestra funcionalidad mejorada de sincronización labial y envíanos tus comentarios sobre esta característica.

Preguntas frecuentes

¿Cuánto cuesta crear la sincronización labial para un video?
¿Cuánto tiempo se tarda en generar la sincronización labial?
¿Cómo funciona esta función en Rask ?
Empieza a traducir videos ahora mismo
Dobla en más de 135 idiomas con Al
Clona voces en 32 idiomas
Potente editor sin límites
Transcripción y traducción automáticas
Pruébalo gratis
no se requiere tarjeta de crédito

Lecturas imprescindibles

flecha-izquierda
flecha hacia la derecha