VIDEO
HeyGen detalla TAVR, un sistema de vídeo de referencia para avatares más estables
HeyGen y la NTU detallan TAVR, un sistema de avatares que usa un clip de vídeo de referencia (hasta 48 fotogramas) para mantener la identidad al cambiar de escena. Parte de Wan2.1‑T2V (14B) con atención a referencia y audio, genera tramos de ~3 s y ya está en producción. Resultados y código, aún pendientes de verificación externa.
Qué ha ocurrido
HeyGen, junto a la Nanyang Technological University, ha presentado TAVR, un sistema de investigación que usa un vídeo corto como referencia para preservar mejor la identidad de un avatar cuando cambian fondo, pose y cámara. Se apoya en el modelo de difusión de vídeo Wan2.1‑T2V (14B) e incorpora selección de tokens basada en caras, autoatención con referencia y una capa de cross‑attention de audio. El sistema puede componer el avatar sobre un fondo objetivo en un solo pase y genera clips de ~3 segundos, encadenándolos mediante latentes para reducir la “deriva” facial. Según su benchmark interno, con 20 fotogramas TAVR logró una puntuación global de 16,42 frente a 14,13 de HuMo; con 48 fotogramas reporta similitud de identidad de 0,83 respecto a la referencia y 0,69 frente al objetivo. La línea de tiempo: anuncio inicial el 3 de marzo, informe técnico el 30 de abril, artículo divulgativo el 27 de agosto y aceptación en SIGGRAPH Asia 2026. El trabajo afirma estar desplegado en producción.
Qué significa para creadores
Si usas los avatares con vídeo de referencia de HeyGen (p. ej., la dirección de producto marcada por Avatar V), prioriza grabar un clip corto con variedad real de expresiones y poses: cuantos más fotogramas útiles (los autores observaron mejoras de 12 a 48), mejor preservación de rasgos; incluir evidencia clara del interior de la boca ayuda a evitar dientes erróneos. Aporta audio de referencia nítido para favorecer la alineación labial. Como TAVR condiciona directamente en el vídeo y en la escena objetivo, planifica desde el inicio el fondo final para reducir artefactos. Para piezas largas, revisa transiciones cada pocos segundos por el esquema de generación por tramos. Ten en cuenta que costes de inferencia, escala y componentes exactos del producto no se han detallado: prueba antes de comprometerte y documenta siempre el consentimiento de cualquier persona clonada, ya que una mejor preservación de identidad incrementa tanto el valor creativo como el riesgo si faltan permisos.
Fuente y contexto
La información procede de RuntimeWire: detalles técnicos (NTU MMLab, autor principal Zujin Guo, asesoría de Chen Change Loy), artículos de HeyGen y Hugging Face, y el informe en arXiv. El código está anunciado como “próximamente” y el benchmark es interno, aún sin réplica independiente. TAVR se presenta como parte de la base investigadora que habilita productos como Avatar V (vídeos multiángulo y más largos desde una grabación de 15 segundos), pero la empresa no ha listado todos los componentes comerciales. HeyGen indica verificación de consentimiento para gemelos digitales. En negocio, la compañía comunicó en junio haber superado 200 M$ de ARR, más de 30 M de usuarios y presencia en el 85% del Fortune 100, además de una Serie A de 60 M$ en 2024 a valoración aproximada de 500 M$; estas cifras no han sido auditadas externamente.
