INVESTIGACION
Google DeepMind prueba evaluaciones doble ciego de IA sin compartir prompts ni pesos
Google DeepMind ha anunciado un piloto de evaluaciones “doble ciego” para modelos de IA: los evaluadores externos no reciben los pesos y la empresa no ve sus prompts. DeepMind lo presenta como un primero del sector, sin verificación independiente. No ha revelado modelos, participantes, dominios, arquitectura de seguridad ni resultados, lo que condiciona su utilidad práctica.
Qué ha ocurrido
El 27 de agosto, Google DeepMind anunció un piloto de evaluaciones doble ciego para modelos de frontera: los evaluadores externos no acceden a los pesos y la compañía no ve sus prompts privados. DeepMind afirma que es una primicia del sector, sin verificación independiente. Los materiales publicados no detallan qué modelos o evaluadores participan, ni la arquitectura técnica, dominios medidos o resultados, por lo que no puede juzgarse aún la independencia ni el control del entorno de prueba.
Qué significa para creadores
Si se consolida, este enfoque podría reducir la filtración de prompts y la contaminación de benchmarks al evaluar modelos sin exponer materiales sensibles. Para creadores y equipos en España, la utilidad dependerá de garantías operativas hoy no reveladas. Si te invitan a evaluar, pide claridad sobre quién controla la infraestructura, qué verificación existe (por ejemplo, atestación), quién accede a registros y salidas, y cómo se publican los resultados. Mantén higiene de benchmarks: evita usar prompts propietarios fuera de entornos con confidencialidad explícita y documenta tus protocolos de prueba.
Fuente y contexto
RuntimeWire informa que el anuncio carece de detalles para auditar el proceso. Como antecedente, OpenMined probó en 2024 una evaluación en enclaves seguros entre organizaciones usando activos simulados (GPT-2 como proxy, contenedores confidenciales en Azure con AMD SEV-SNP y NVIDIA H100, PySyft y servicios de atestación). Ese trabajo no demuestra cómo opera el piloto de DeepMind. La compañía también vive cambios de liderazgo y un ritmo de lanzamientos que presiona las evaluaciones; para valorar este piloto harán falta arquitectura, participantes, verificación y resultados.
