MODELOS
Alibaba publica Qwen3.8-27B con pesos abiertos: 48% y 15º en WildClawBench
Alibaba ha publicado Qwen3.8-27B con pesos abiertos (Apache 2.0), un modelo multimodal de 27B con entrada de vídeo, control de razonamiento y ventana de contexto ampliable hasta 1 millón de tokens. En WildClawBench quedó 15º con un 48% en 60 tareas de agentes. Se sirve vía Transformers, vLLM o SGLang; el coste de ejecución no está disponible.
Qué ha ocurrido
Qwen3.8-27B, un modelo multimodal de 27.000 millones de parámetros con entrada nativa de texto, imagen y vídeo (incluido metraje de horas), obtuvo un 48,0% en 60 tareas de agente en WildClawBench y se situó 15º entre 33 modelos, por detrás de sistemas mayores o alojados de OpenAI, Anthropic, xAI, Moonshot AI y del propio Qwen3.8-Max, pero por encima de Qwen3.6-27B. El banco registró 516 minutos de duración y no reportó coste. Alibaba distribuye los pesos bajo Apache 2.0, con ventana nativa de 262.144 tokens ampliable a 1 millón, 64 capas y 5.120 dimensiones ocultas. Se puede cargar con Transformers o servir con vLLM, SGLang y TokenSpeed. El “thinking” viene activado con niveles de esfuerzo (xhigh/medium/low) y opción para conservar el razonamiento entre turnos; desactivarlo es posible, aunque reducir el esfuerzo puede aumentar tiempos y tokens por reintentos en tareas multietapa.
Qué significa para creadores
Para flujos que requieren control, datos propios o personalización (por ejemplo, agentes que combinan navegador, código y análisis multimodal), los pesos abiertos permiten probar en tu infraestructura y decidir el punto óptimo entre latencia y calidad ajustando el esfuerzo de razonamiento y si conservar el contexto de pensamiento. Mide el éxito de tareas extremo a extremo y no solo la latencia de una respuesta: WildClawBench sugiere que la estabilidad en cadenas largas importa. La entrada de vídeo y el gran contexto son útiles para trabajar con material extenso; no obstante, al no haber métricas de coste ni requisitos de hardware publicados, conviene hacer pruebas de precio/rendimiento con tu stack (Transformers, vLLM, SGLang o TokenSpeed) y tu hardware. Si priorizas máximos de desempeño gestionado, los sistemas alojados más grandes siguen delante; si prefieres control y personalización, esta versión descargable es evaluable hoy.
Fuente y contexto
La valoración proviene de RuntimeWire a partir de WildClawBench (vía el arnés OpenClaw). Alibaba publica más métricas propias (SWE-bench Pro 61,7; Terminal Bench 2.1 73,0; LiveCodeBench v6 90,3; OSWorld-Verified 84,3; WebArena-Verified 64,8; AndroidWorld 81,9), obtenidas bajo sus condiciones y con pruebas internas adicionales, por lo que requieren replicación externa. Alibaba planea una edición alojada en Qwen Cloud con contexto de 1 millón por defecto y herramientas integradas, sin fecha ni precios publicados; por ahora, la referencia práctica son los pesos descargables.
