Juanma Aranda

HERRAMIENTAS

Mapas de cuantización por tensor para GGUF y nueva nomenclatura S/M/L de Bartowski

El ingeniero Bartowski (Red Hat) ha publicado un método de cuantización GGUF que asigna precisión tensor a tensor usando mapas basados en sensibilidad medida. Tras más de mil pruebas, detecta que los embeddings y varios tensores de atención requieren más bits. Además, introduce sufijos S/M/L con umbrales claros y ya lo aplica en lanzamientos recientes.

Audio con ElevenLabs

Qué ha ocurrido

El 10 de septiembre, Bartowski presentó un enfoque para GGUF que reparte la precisión por tensor mediante mapas derivados de sensibilidad medida, junto a generador, solver y datos públicos. Tras ~96 horas de ensayos y más de 1.000 cuantizaciones con KLD sobre wikitext-2-raw en Qwen3.5 (0.8B y 4B), observó máxima sensibilidad en embeddings; también destacaron proyecciones de atención/valor y salidas SSM, con la típica curva en U por capas. Establece una nomenclatura S/M/L (≥90%, ≥70% o ≤50% de tensores del cuerpo en el tipo base), retirando variantes antiguas. En ejemplos, Q3_K_M se redujo ~15% en Qwen3.5-4B y Q4_K_M ocupó algo más del 5% menos con KLD global ligeramente peor. Ya se usa en MiniCPM5-2B y Gryphe Pantheon Reasoning 26B, con metadatos para inspeccionar los layouts.

Qué significa para creadores

Para quienes ejecutan LLMs locales en equipos de consumo o workstation, esto apunta a descargas más pequeñas y a elecciones de cuantización con mejor “resultado por bit”. Al elegir GGUF de Bartowski, los sufijos S/M/L reflejan de forma realista cuántos tensores quedan en el tipo base, mientras que otros (como embeddings) pueden recibir más precisión; en varios casos, q4_k en embeddings recupera gran parte del rendimiento. Si usas llama.cpp, los archivos –tensor-type-file generados aplican el layout por tensor. Aun así, valida en tus propias tareas: los priors se ajustaron en dos Qwen pequeños y KLD sobre un único corpus, sin reproducción independiente todavía.

Fuente y contexto

El cambio responde a que las reglas históricas por nombre/forma de tensor quedaron rezagadas frente a nuevas arquitecturas, especialmente mixture-of-experts con más de ocho expertos y tensores shexp muy sensibles. Bartowski publicó generador, solver y tablas de sensibilidad en su repositorio y detalló el proceso en un artículo. Otros proyectos atacan el mismo problema (por ejemplo, GGUF Tool Suite de Thireus). Está previsto evaluar Qwen3.8-27B. Falta una comparación amplia e independiente sobre exactitud en tareas, perplejidad, velocidad e interoperabilidad entre backends.