NEAREST BY Join: escalando a busca vetorial no Databricks Runtime
Traduzido do original em inglês por IA. Ver em inglês
O Databricks Runtime agora conta com o NEAREST BY, um novo SQL join que executa buscas vetoriais em lote exatas ou aproximadas diretamente em seus dados do Lakehouse. Alimentado por um operador Photon fundido com um kernel GEMM bloqueado personalizado, ele transforma tabelas Delta liquid-clustered padrão em índices vetoriais com poda de partições, sem nenhum repositório de vetores externo para sincronizar ou gerenciar.
* O NEAREST BY é um novo SQL join para busca vetorial em lote: para cada linha de consulta, ele encontra as k linhas mais próximas por similaridade vetorial ou distância, de forma exata ou aproximada. * Um operador Photon fundido com um GEMM kernel bloqueado personalizado empurra a pontuação de distância em direção ao pico de vazão aritmética que o hardware oferece. * Seu Lakehouse também é seu repositório de vetores, sem nenhum sistema separado para sincronizar ou operar: o índice vetorial IVF é uma tabela Delta liquid-clustered comum que descarta a maioria das partições na leitura.
