HERRAMIENTAS
Perplexity publica su arquitectura de tres capas para embeddings y ranking: Ivy, Tulip y ROSE
Perplexity ha hecho pública la arquitectura que usa para embeddings y ranking en su buscador: Ivy (pasarela HTTP), Tulip (planificador y batching) y ROSE (motor de modelos). El diseño separa preparación, agrupación y ejecución en GPU, con CUDA graphs y procesamiento asíncrono. Afirman menor latencia y coste, aunque sin cifras de producción.
Qué ha ocurrido
Perplexity ha detallado la pila que alimenta sus cargas de embeddings y ranking: Ivy prepara peticiones y tokeniza en Rust; Tulip (también en Rust) agrupa por tokens y programa lotes para GPU; y ROSE (Python) ejecuta los modelos con CUDA graphs y atención adaptable. El enfoque desacopla CPU y GPU, permite solapamiento de etapas con mecanismos asíncronos (LazyTensors) y prioriza el micro-batching por número de tokens; el hilo indica que en torno a 512 tokens pueden saturar la GPU. La compañía sostiene mejoras en latencia y rendimiento, pero no ha publicado métricas de producción.
Qué significa para creadores
Si construyes RAG o búsqueda semántica, hay lecciones prácticas: separa la preparación de texto del servicio de inferencia, agrupa por tokens para aprovechar la GPU sin aumentar demasiado la espera, y distingue bien cargas online (baja latencia) de batch (alto rendimiento). Perplexity combina recuperación léxica y semántica para no bloquear el flujo en el embedding; puedes replicar ese enfoque híbrido. Si usas su Embeddings API, existen modelos estándar y contextualizados de 0,6B y 4B parámetros, pero la empresa no vincula públicamente Ivy/Tulip/ROSE a ese tráfico ni aporta benchmarks: prueba en tu caso de uso real, mide latencia y coste, y ajusta tamaños de lote y chunking.
Fuente y contexto
La información procede de RuntimeWire y del hilo técnico de Perplexity del 4 de septiembre, junto a su documentación de arquitectura de búsqueda (septiembre de 2025) y guías de Embeddings y RAG. Ese material describe la pila interna y su énfasis en batching y CUDA graphs; no ofrece cifras de latencia, RPS, utilización de GPU ni coste por consulta atribuibles a Ivy/Tulip/ROSE. En paralelo, el sector de infraestructura de búsqueda para IA crece con actores como Exa y Tavily, lo que refuerza el valor de controlar esta capa para productos y APIs.
