Juanma Aranda

HERRAMIENTAS

Bedrock‑RL hace reproducibles los entrenamientos de agentes visión‑lenguaje en Minecraft

Michael Evans (Old Dominion University) presenta Bedrock‑RL, un framework open source (MIT) que combina Netherite —una reimplementación determinista de Minecraft 1.11.2— y verl para RL distribuido. Define tareas en YAML con semillas separadas y un verificador fijo. Incluye guardarraíles para demos sintéticas y un ejemplo con Qwen3‑VL 2B que muestra mejoras modestas.

Audio con ElevenLabs

Qué ha ocurrido

Bedrock‑RL, descrito por Michael Evans en un artículo de la comunidad de Hugging Face, unifica un simulador determinista de Minecraft (Netherite) con infraestructura de entrenamiento distribuido (verl) para evaluar y entrenar agentes visión‑lenguaje con trazabilidad total. Las tareas se definen en YAML con mundos, instrucciones, presupuesto de acciones y recompensas, generando splits de entrenamiento, desarrollo y prueba con semillas disjuntas. Cada trayectoria guarda semillas, hash de snapshot y procedencia para su reproducción exacta. El verificador de tareas permanece fijo y lee el estado del motor para validar éxitos reales, y se incorporan guardarraíles que impiden que demostraciones sintéticas usen información no observable por el modelo. Un ejemplo incluido entrena Qwen3‑VL 2B con 10 pasos GRPO para elegir un pico de hierro entre 9 ítems: a temperatura 0 pasa del 9,4% (27/288) al 13,5% (39/288; p=0,169); con tres intentos por prompt, el pass@3 sube del 10,8% (31/288) al 22,2% (64/288; p=1.03 x 10^-7).

Qué significa para creadores

Si produces contenidos de IA y videojuegos, Bedrock‑RL permite retos en Minecraft que se pueden repetir y auditar: puedes comparar prompts o modelos sin cambiar verificador ni recompensas, y compartir episodios con semillas y hashes para que tu audiencia replique exactamente tus runs. El motor Netherite afirma soportar miles de mundos en bloqueo en una sola GPU, útil para iterar y capturar material de forma paralela. Los guardarraíles sobre demostraciones evitan “ventajas ocultas”, ayudando a crear datasets más honestos para tutoriales o clonación de comportamiento. Ten en cuenta que el ejemplo mostrado es básico y no prueba habilidades de largo horizonte; el valor inmediato está en usar el stack como banco de pruebas controlado para métodos (GRPO, RLOO, REINFORCE++, ReMax, SFT y destilaciones) y en mantener disciplina de evaluación antes de grabar resultados.

Fuente y contexto

La información procede de RuntimeWire, que resume el anuncio y repositorio de Bedrock‑RL (licencia MIT) y el artículo de Evans en Hugging Face. El proyecto se apoya en Netherite (reimplementación determinista de Minecraft 1.11.2) y en verl para RL distribuido, y se posiciona frente a marcos previos como Project Malmo, MineDojo, Voyager y Craftax. Su aportación clave es la reproducibilidad: simulación determinista, generación controlada por semillas y un verificador inmutable. Aún debe validarse en tareas largas y por más grupos, pero prioriza elementos que suelen decidir si un resultado se sostiene fuera del laboratorio.