NEAREST BY Join: Skalierung der Vektorsuche in Databricks Runtime
Von KI aus dem englischen Original übersetzt. Auf Englisch ansehen
Databricks Runtime bietet nun NEAREST BY, einen neuen SQL-Join, der exakte oder approximative Batch-Vektorsuchen direkt gegen Ihre Lakehouse-Daten ausführt. Angetrieben von einem fusionierten Photon-Operator mit einem benutzerdefinierten geblockten GEMM-Kernel, verwandelt er standardmäßige liquid-clustered Delta-Tabellen in partitionsprunierte Vektorenindizes, ohne dass ein externer Vektorspeicher synchronisiert oder verwaltet werden muss.
* NEAREST BY ist ein neuer SQL-Join für die Batch-Vektorsuche: Für jede Abfragezeile werden die k nächstgelegenen Zeilen nach Vektorähnlichkeit oder Distanz ermittelt – exakt oder approximativ. * Ein fusionierter Photon-Operator mit einem benutzerdefinierten geblockten GEMM-kernel treibt die Distanzbewertung in Richtung des maximalen arithmetischen Durchsatzes der Hardware voran. * Ihr Lakehouse ist gleichzeitig Ihr Vektorspeicher, ohne dass ein separates System synchronisiert oder betrieben werden muss: Der IVF-Vektorindex ist eine gewöhnliche liquid-clustered Delta-Table, die beim Lesen die meisten Partitionen prunt.
