HERRAMIENTAS
Mapas de cuantización por tensor para GGUF y nueva nomenclatura S/M/L de Bartowski
El ingeniero Bartowski (Red Hat) ha publicado un método de cuantización GGUF que asigna precisión tensor a tensor usando mapas basados en sensibilidad medida. Tras más de mil pruebas, detecta que los embeddings y varios tensores de atención requieren más bits. Además, introduce sufijos S/M/L con umbrales claros y ya lo aplica en lanzamientos recientes.
Qué ha ocurrido
El 10 de septiembre, Bartowski presentó un enfoque para GGUF que reparte la precisión por tensor mediante mapas derivados de sensibilidad medida, junto a generador, solver y datos públicos. Tras ~96 horas de ensayos y más de 1.000 cuantizaciones con KLD sobre wikitext-2-raw en Qwen3.5 (0.8B y 4B), observó máxima sensibilidad en embeddings; también destacaron proyecciones de atención/valor y salidas SSM, con la típica curva en U por capas. Establece una nomenclatura S/M/L (≥90%, ≥70% o ≤50% de tensores del cuerpo en el tipo base), retirando variantes antiguas. En ejemplos, Q3_K_M se redujo ~15% en Qwen3.5-4B y Q4_K_M ocupó algo más del 5% menos con KLD global ligeramente peor. Ya se usa en MiniCPM5-2B y Gryphe Pantheon Reasoning 26B, con metadatos para inspeccionar los layouts.
Qué significa para creadores
Para quienes ejecutan LLMs locales en equipos de consumo o workstation, esto apunta a descargas más pequeñas y a elecciones de cuantización con mejor “resultado por bit”. Al elegir GGUF de Bartowski, los sufijos S/M/L reflejan de forma realista cuántos tensores quedan en el tipo base, mientras que otros (como embeddings) pueden recibir más precisión; en varios casos, q4_k en embeddings recupera gran parte del rendimiento. Si usas llama.cpp, los archivos –tensor-type-file generados aplican el layout por tensor. Aun así, valida en tus propias tareas: los priors se ajustaron en dos Qwen pequeños y KLD sobre un único corpus, sin reproducción independiente todavía.
Fuente y contexto
El cambio responde a que las reglas históricas por nombre/forma de tensor quedaron rezagadas frente a nuevas arquitecturas, especialmente mixture-of-experts con más de ocho expertos y tensores shexp muy sensibles. Bartowski publicó generador, solver y tablas de sensibilidad en su repositorio y detalló el proceso en un artículo. Otros proyectos atacan el mismo problema (por ejemplo, GGUF Tool Suite de Thireus). Está previsto evaluar Qwen3.8-27B. Falta una comparación amplia e independiente sobre exactitud en tareas, perplejidad, velocidad e interoperabilidad entre backends.
