MODELOS
Grok 4.6 lidera el benchmark Newsroom Reliability v0.2 con 0.79 y bajo coste por tarea
La prueba de 50 tareas de Newsroom Reliability v0.2 sitúa a SpaceXAI: Grok 4.6 en primer lugar con 0.79 y un coste estimado de $0.0056 por tarea. Le siguen OpenAI: GPT‑5.6 Sol (0.77) y varias variantes de GPT‑5.6 y Claude Opus 4.8. Las puntuaciones se evaluaron a ciegas y los costes son orientativos.
Qué ha ocurrido
RuntimeWire informa que, en una batería de 50 tareas del benchmark Newsroom Reliability v0.2, SpaceXAI: Grok 4.6 obtuvo la mejor media (0.79) con un coste estimado de $0.0056 por tarea. Le siguieron OpenAI: GPT‑5.6 Sol (0.77; $0.0217) y variantes como GPT‑5.6 Luna y Luna Pro (0.76; $0.0005). Anthropic: Claude Opus 4.8 quedó cerca (0.74; $0.0223). Las respuestas se calificaron con una rúbrica fija por gpt‑5.4, a ciegas respecto al modelo, sin herramientas ni reintentos; los costes se estiman a partir de precios públicos por token y son orientativos.
Qué significa para creadores
Para flujos tipo redacción (resúmenes, notas, copys), el ranking ayuda a equilibrar fiabilidad y presupuesto: Grok 4.6 combina la mejor puntuación con coste bajo; GPT‑5.6 Luna mantiene 0.76 con un coste muy reducido; GPT‑5.6 Sol y Claude Opus 4.8 rinden alto con mayor coste. Dado que la prueba no usa herramientas ni reintentos y los costes son estimados, valida con tus prompts y volumen real, y revisa tareas y salidas en el leaderboard antes de elegir.
Fuente y contexto
Datos de RuntimeWire, publicado el 14 de agosto de 2026. Newsroom Reliability v0.2 evalúa 50 tareas abiertas puntuadas de 0 a 10 y normalizadas a 0–1; la corrección la realizó gpt‑5.4 con ceguera de modelo. El coste por tarea se estima desde precios públicos por token y puede diferir de la facturación real; es posible explorar prompts, respuestas y calificaciones en el leaderboard interactivo.
