MODELOS
Light Origins lanza Light‑O1: del vídeo humano a acciones robóticas, con un previo abierto de 6B
Light Origins, fundada por Roger Jiang, ha lanzado Light‑O1, un modelo que aprende acciones humanas a partir de vídeos de internet y las adapta a distintos robots como LightBot y Unitree G1. Publica un previo abierto de 6.000 millones de parámetros con licencia Apache 2.0 que genera movimientos corporales a 20 fps, aunque requiere controladores adicionales para ejecución en robots.
Qué ha ocurrido
Light Origins presentó Light‑O1, un modelo que aprende acciones humanas estructuradas extraídas de vídeos y las adapta a diferentes morfologías robóticas. En las demostraciones, un mismo punto de partida gobierna a LightBot y Unitree G1 en tareas como arrodillarse, equilibrarse, limpiar una pizarra o recoger un objeto. El informe técnico describe un pipeline que segmenta vídeo, rastrea personas, reconstruye su movimiento en 3D, lo alinea con observaciones visuales y anotaciones en lenguaje, y lo codifica en tokens de acción para un Transformer autoregresivo. En el estudio de escalado se probaron presupuestos de 3,75 a 120 mil millones de tokens multimodales (hasta 100.000 horas de acción humana recuperada), con descensos de error siguiendo leyes de potencia. La compañía liberó Light‑O1‑Preview (6.000 millones de parámetros, licencia Apache 2.0), que acepta texto y genera secuencias de movimiento de cuerpo completo con 138 valores por fotograma a 20 fps; ofrece playground en navegador y ejecución local en Linux con GPU Nvidia. El ejemplo abierto para Unitree G1 usa GEAR‑SONIC en simulación MuJoCo y requiere un checkpoint de política adicional. Light Origins reportó además un 79,3% de éxito macro en 24 tareas de cocina simuladas RoboCasa GR‑1 (50 episodios por tarea). La empresa cerró una ronda Pre‑A de varios cientos de millones de yuanes para entreno a gran escala, datos multimodales y desarrollo soft‑hard.
Qué significa para creadores
Para creadores que cubren IA y robótica, hay material práctico y demostrable: el previo abierto permite generar y visualizar movimientos desde texto en el playground, o montarlos localmente en Linux con GPU Nvidia, útil para vídeos explicativos y comparativas de prompts. La licencia Apache 2.0 habilita usos comerciales en piezas educativas o demos interactivas. Conviene aclarar a la audiencia que el previo es text‑to‑motion y no controla robots por sí solo: para llevarlo al mundo físico hacen falta controladores o modelos de bajo nivel, como ilustra el ejemplo en MuJoCo que requiere una política adicional. Al comentar resultados, matiza que la evaluación de RoboCasa es realizada por la propia Light Origins. El enfoque de preentrenar con vídeo humano y adaptar después a cada robot es una tendencia clave a seguir para contenidos sobre la evolución de humanoides.
Fuente y contexto
Según RuntimeWire y el informe de Light Origins, Light‑O1 separa la representación de la intención motora del control específico del robot, aprovechando el gran volumen de vídeo humano frente a las escasas horas en hardware. Roger Jiang (ex OpenAI; doctor en Física) fundó la empresa en 2024 y defiende que predecir acciones es más útil para robótica que predecir fotogramas. El estudio divulgado llega a 100.000 horas de acción recuperada, mientras que el total de datos del modelo de producción no se ha cuantificado públicamente. La evaluación en RoboCasa y las comparativas con baselines fueron conducidas por Light Origins. El repositorio de inferencia y el checkpoint abierto en Hugging Face permiten a la comunidad explorar la capa de generación de movimiento mostrada en los vídeos del lanzamiento.
