NEAREST BY Join : mise à l'échelle de la recherche vectorielle dans Databricks Runtime
Traduit de l'original anglais par IA. Voir en anglais
Databricks Runtime intègre désormais NEAREST BY, une nouvelle jointure SQL qui exécute des recherches vectorielles par lot exactes ou approximatives directement sur vos données Lakehouse. Propulsée par un opérateur Photon fusionné doté d'un noyau GEMM bloqué personnalisé, elle transforme les tables Delta standard liquid-clustered en index vectoriels élagués par partition, sans nécessiter de magasin de vecteurs externe à synchroniser ou gérer.
* NEAREST BY est une nouvelle jointure SQL pour la recherche vectorielle par lot : pour chaque ligne de requête, elle trouve les k lignes les plus proches par similarité vectorielle ou distance (exacte ou approximative). * Un opérateur Photon fusionné avec un GEMM kernel bloqué personnalisé pousse le calcul des scores de distance vers le débit arithmétique maximal offert par le matériel. * Votre Lakehouse fait également office de magasin de vecteurs, sans système séparé à synchroniser ou exploiter : l'index vectoriel IVF est une table Delta liquid-clustered ordinaire qui élague la plupart des partitions lors de la lecture.
