INVESTIGACION
ReViSQL-K2.6 alcanza 91,37% en un benchmark SQL depurado con un único modelo entrenado por refuerzo
Thinking Machines y un equipo de la UIUC presentan ReViSQL-K2.6, un modelo RL de texto a SQL que, tras limpiar a fondo los datos de entrenamiento y evaluación, logra 88,55% (greedy) y 91,37% con autoconsistencia de 16 muestras en Arcwise-Plat-SQL. Reportan costes por tarea de 0,035 y ~0,56 dólares y publican código, datos corregidos y receta.
Qué ha ocurrido
Thinking Machines Lab y cuatro investigadores de UIUC entrenaron ReViSQL-K2.6, un único modelo de texto a SQL que sustituye cadenas de agentes por aprendizaje por refuerzo sobre datos revisados por expertos. En Arcwise-Plat-SQL (variante verificada de BIRD Mini-Dev) alcanzó 88,55% con decodificación greedy y 91,37% seleccionando entre 16 respuestas (autoconsistencia), con costes reportados de 0,035 y ~0,56 dólares por tarea. Usaron Tinker para el entrenamiento, recompensas verificables y técnicas de reward shaping; publicaron código, datos corregidos y la receta. No se informa de despliegues en bases de datos empresariales en producción.
Qué significa para creadores
Si construyes asistentes para consultar métricas o ventas en SQL, este enfoque sugiere que un solo modelo bien entrenado puede evitar gran parte de la orquestación multiagente. Valora el compromiso coste-precisión: greedy es más barato y rápido; la autoconsistencia de 16 muestras mejora acierto a cambio de mayor cómputo. La limpieza de datos es decisiva: auditar y corregir pares pregunta-SQL y usar verificaciones ejecutables puede cambiar tus resultados. Define reglas y constraints de tu dominio como señales de recompensa y prueba siempre en tu propio esquema antes de prometer cobertura en producción.
Fuente y contexto
Según RuntimeWire (28 de agosto de 2026), los autores auditaron unas 2.500 muestras de BIRD Train y hallaron altos errores (61,1% con algún problema), creando BIRD-Platinum; también reportan fallos de anotación en el 52,8% de BIRD Mini-Dev tras dos limpiezas. Un modelo o3 ayudó en la revisión con 90,6% de precisión al señalar errores pero detectó solo el 24,5% de los fallos encontrados por humanos. El trabajo se basa en Kimi-K2.6 entrenado con Tinker y publica materiales de reproducción; las cifras no equivalen a una evaluación en un entorno corporativo vivo y no deben compararse con métricas de conjuntos distintos.
