MODELOS
Alibaba sitúa a Qwen3.8-Max como el mejor modelo open-weight en un test de agentes para comercio
El equipo Accio de Alibaba publica Commerce Agent Bench, un test por estados para tareas comerciales. Qwen3.8-Max logró 56/47/53 pases en Accio/OpenClaw/Pi y supera por dos al open-weight DeepSeek V4 Pro; el cerrado Claude Opus 5 queda muy por delante. Los resultados dependen del harness y no son una auditoría independiente.
Qué ha ocurrido
El equipo Accio de Alibaba lanzó Commerce Agent Bench, un benchmark que evalúa agentes por el estado final que dejan en réplicas de software empresarial. En él, Qwen3.8-Max completó 56/47/53 tareas en Accio/OpenClaw/Pi (156 de 321 combinaciones, 48,6%) y, según Alibaba, es el mejor open-weight, dos pases por encima de DeepSeek V4 Pro (154, 48,0%). El modelo cerrado Claude Opus 5 lidera con 65/60/66 (191 de 321, 59,5%) y, aun en su mejor ejecución, falla 41 de 107 tareas (~61,7% de acierto). Los resultados varían por harness y proceden del propio banco de pruebas de Alibaba.
Qué significa para creadores
Para automatizar escaparates, logística o documentación, este test es útil porque verifica resultados guardados (listados publicados, reservas, archivos), no solo conversaciones. Aun así, las tasas de acierto muestran que requieren supervisión y controles a nivel de transacción. Si usas Qwen en OpenClaw, respeta el protocolo de reasoning_content o tus métricas no serán comparables. Como el rendimiento cambia por harness (Qwen rinde mejor en Accio), prueba en el entorno que vayas a desplegar, registra estados y difiere decisiones críticas hasta validar en tus flujos. OpenClaw es rerunnable para auditorías; trata el tablero como referencia, no como garantía.
Fuente y contexto
Commerce Agent Bench incluye 107 tareas (CLI, navegador, ficheros/documentos y API/MCP) y 14 réplicas offline. El repositorio muestra la ligera ventaja de Qwen3.8-Max sobre DeepSeek V4 Pro en el agregado, mientras Claude Opus 5 encabeza todas las ejecuciones. Accio es un harness de referencia no reproducible desde el checkout; OpenClaw sí es reutilizable. Los paquetes de resultados por tarea no se publican con identificadores inmutables, lo que dificulta auditorías completas. Código bajo Apache 2.0 y datos bajo CC BY 4.0; el equipo también mantiene Business Arena y ofrece evaluaciones privadas y contribuciones externas al benchmark.
