Juanma Aranda

MODELOS

LatchBio detecta mejoras y cambios de comportamiento en Grok 4.6 bajo el mismo nombre

LatchBio informa que la versión actualmente servida de Grok 4.6 mejora sus salvaguardas: rechaza el 59,2% de intentos red‑team y completa el 64,8% de tareas rutinarias en BioSecBench‑Refusal. El comportamiento varía por checkpoint y configuración. Grok 4.6 llega a AWS Bedrock (18 ago.) y Microsoft Foundry (26 ago.), lo que obliga a actualizar pruebas y guías.

Audio con ElevenLabs

Qué ha ocurrido

Según un análisis del 1 de septiembre de LatchBio, la versión actualmente servida de Grok 4.6 mejora la distinción entre riesgos biológicos ocultos y tareas legítimas en el benchmark BioSecBench‑Refusal (107 tareas: 61 rutinarias y 46 red‑team). Promedió un 59,2% de rechazos en red‑team y un 64,8% de finalización en tareas rutinarias, con una media armónica ponderada del 62,1% y las tres primeras posiciones del ranking ocupadas por configuraciones de Grok. En vigilancia de patógenos promedió un 53,5%, por detrás de Opus 5 y por delante de GPT‑5.6 Sol, según las compañías. LatchBio subraya que es una mejora frente a evaluaciones previas del mismo nombre de modelo.

Qué significa para creadores

Un mismo nombre de modelo puede cubrir checkpoints con comportamientos distintos; lo operativo es la versión servida en una fecha concreta, junto con el harness y el esfuerzo de evaluación. Para guías, cursos o workflows: documenta siempre fecha/checkpoint y vuelve a medir tras actualizaciones, porque el ajuste continuo puede volver obsoletos tests antiguos sin un “release” formal. Si usas Grok 4.6 (también vía AWS Bedrock o Microsoft Foundry), espera más rechazos ante riesgos biológicos camuflados y mejor tasa en tareas rutinarias, aunque persisten límites (no rechaza el 40,8% de intentos red‑team y no completa el 35,2% de tareas rutinarias).

Fuente y contexto

LatchBio publica BioSecBench‑Refusal y su evaluación independiente; SpaceXAI expone su propia lectura y describe capas de seguridad (entrenamiento de rechazo, filtros en inferencia, controles conductuales y monitorización de sesión). LatchBio, reforzada por la adquisición de TwentyTwo en junio y con financiación divulgada de al menos 33 millones de dólares, usa su infraestructura para probar agentes. Grok 4.6 amplía disponibilidad: AWS Bedrock (18 de agosto) y Microsoft Foundry (26 de agosto).