Juanma Aranda

HERRAMIENTAS

Demo WebGPU ejecuta Qwen3.5 Small (0,8B–4B) en el navegador con Transformers.js, sin API en la nube

Una demo mantenida por webml-community permite ejecutar en el navegador, vía Transformers.js y WebGPU, los modelos multimodales Qwen3.5 Small de Alibaba en tamaños 0,8B, 2B y 4B, sin recurrir a una API en la nube. El chat se procesa localmente y admite imágenes. Ventajas: privacidad y coste; límites: sin versión 9B ni métricas de hardware.

Audio con ElevenLabs

Qué ha ocurrido

webml-community ha publicado una demostración en navegador que carga los modelos Qwen3.5 Small de Alibaba en variantes de 0,8B, 2B y 4B directamente con Transformers.js y WebGPU. Se puede abrir la página, elegir modelo, adjuntar una imagen si hace falta e iniciar una conversación; la inferencia ocurre en el dispositivo y, según la demo, las charlas permanecen locales. El proyecto es independiente del anuncio original de Qwen3.5 y fue destacado por Joshua Lochner.

Qué significa para creadores

Para probar chat multimodal y tareas de razonamiento sin montar servidor ni pagar por llamada, basta el navegador. La ejecución local mejora privacidad, elimina costes por solicitud y puede seguir funcionando tras descargar los archivos. A cambio, la interfaz se limita a 4B (no incluye 9B), no publica requisitos mínimos ni velocidades y no garantiza resultados homogéneos entre dispositivos WebGPU; el rendimiento depende de la precisión numérica, la memoria y la GPU. Es útil para prototipar flujos y validar si un modelo pequeño encaja en casos concretos.

Fuente y contexto

Según RuntimeWire, la demo convierte los pesos descargables de Qwen3.5 Small en una prueba directa en navegador gracias a Transformers.js y WebGPU. Es una vía de despliegue distinta a la cubierta por informes recientes sobre otros pesos de Qwen; aquí el valor está en cerrar la brecha entre modelo y uso local. Alibaba aporta los modelos, webml-community mantiene la implementación en navegador y Lochner la ha dado a conocer.