A eficiência de busca vira infraestrutura de IA
Aravind Srinivas detalha a infraestrutura de embeddings e reranking do Perplexity: indexação em lote, inferência em GPU, batching e escolhas entre latência e throughput. O caso mostra que recuperar contexto em escala é parte central da qualidade e do custo de produtos com IA. Os ganhos citados são medições da própria empresa, dependentes do modelo e do hardware comparados.
A deep dive into how Perplexity serves search results at scale: embeddings for ranking, GPU-based model inference, request batching, running inference servers, and handling latency/throughput trade-offs.












