Nvidia ha ampliado durante IBC 2026 su conjunto de tecnologías AI for Media, dirigido a la producción audiovisual, el broadcast y el streaming. Las novedades se centran en incorporar inteligencia artificial directamente a los flujos de trabajo para analizar, verificar y mejorar contenidos de vídeo en tiempo real.
La propuesta reúne kits de desarrollo, microservicios y arquitecturas de referencia que pueden integrarse en aplicaciones de producción y distribución. Entre sus posibles usos se encuentran la detección de vídeos generados mediante inteligencia artificial, la mejora de imagen, la creación de repeticiones más fluidas y la adaptación de contenidos a diferentes idiomas.
Detección de vídeos generados con inteligencia artificial
Una de las herramientas incluidas es Nvidia Synthetic Video Detector, diseñada para analizar la probabilidad de que unas imágenes sean auténticas o hayan sido generadas mediante inteligencia artificial.
La tecnología no determina por sí sola si un contenido es verdadero o falso. Su función es ofrecer información adicional, como puntuaciones de confianza y señales detectadas en los fotogramas, para que los equipos editoriales, de verificación y de cumplimiento puedan incorporarla a sus procesos de revisión.
Dalet está integrando esta capacidad en un entorno de verificación alojado en la nube. De esta forma, las organizaciones de noticias podrán enviar vídeos para su análisis y consultar los resultados y metadatos desde una misma interfaz.
Wowza también prevé incorporar la herramienta a su plataforma de inteligencia de vídeo, con el objetivo de analizar emisiones en directo e identificar objetos, escenas o posibles señales de generación artificial.
Mejora de imagen y repeticiones más fluidas
Las novedades presentadas incluyen también tecnologías destinadas a mejorar la calidad del vídeo.
Video Frame Generation utiliza inteligencia artificial generativa para crear fotogramas intermedios entre los originales. Este procedimiento puede aumentar la frecuencia de imagen y producir movimientos más fluidos en contenidos deportivos, retransmisiones en directo y repeticiones a cámara lenta.
Ross Video está incorporando esta tecnología a su plataforma Rio Replay para generar repeticiones deportivas asistidas por inteligencia artificial. El sistema busca conseguir movimientos más suaves sin depender exclusivamente de cámaras capaces de grabar todos los fotogramas a una frecuencia muy elevada.
Por su parte, Video Super Resolution permite aumentar la resolución y reducir elementos como el ruido, el desenfoque y los defectos provocados por la compresión. Puede utilizarse en reproductores de vídeo, servicios de streaming, sistemas de broadcast, aplicaciones de videoconferencia y procesos de transcodificación.
A estas funciones se suma TrueHDR, que transforma vídeo de rango dinámico estándar en contenido de alto rango dinámico en tiempo real. Las tres tecnologías pueden combinarse dentro de una misma cadena de procesamiento.

Análisis del movimiento a partir de una sola cámara
Nvidia también ha desarrollado una tecnología de estimación de postura corporal capaz de identificar la posición y los ángulos de las articulaciones a partir del vídeo grabado con una sola cámara.
La información obtenida puede emplearse en el seguimiento de movimientos, el análisis biomecánico, la mejora de repeticiones, el arbitraje y la creación de experiencias virtuales. También puede aplicarse a animación y producción virtual mediante la transferencia de los movimientos detectados a personajes digitales compatibles.
Vizrt utiliza esta tecnología en entornos de estudio virtual para relacionar el movimiento corporal con efectos tridimensionales de iluminación, sombras y reflejos.
Localización de contenidos en directo
Otro de los ámbitos abordados es la adaptación de programas a distintos idiomas y mercados. Las tecnologías de localización permiten combinar subtítulos, audio traducido, doblaje, movimientos labiales sincronizados y gráficos adaptados.
El sistema LipSync modifica el movimiento de la boca de una persona para ajustarlo a una pista de audio traducida, conservando otros elementos de la imagen, como la posición de la cabeza o el parpadeo.
También se incorpora una función de detección del hablante activo para identificar quién está interviniendo en escenas con varias personas. NDI está utilizando estas capacidades para desarrollar procesos de traducción y doblaje sincronizado en tiempo real dentro de entornos de broadcast.
Integración en infraestructuras basadas en software
La incorporación de Media Exchange Layer a Nvidia Holoscan for Media busca facilitar la conexión entre aplicaciones de vídeo, audio y datos dentro de entornos de producción distribuidos.
Esta arquitectura permite que diferentes funciones compartan una misma infraestructura y puedan evolucionar de forma independiente. Para broadcasters y proveedores tecnológicos, el interés reside en reducir las integraciones específicas necesarias para conectar cada aplicación.
La implantación de estas herramientas también plantea cuestiones relacionadas con la complejidad técnica, los recursos de procesamiento y la dependencia de una infraestructura determinada. Por ello, su adopción dependerá de las necesidades concretas de cada flujo de trabajo y de la utilidad que aporte frente a los sistemas existentes.