Skalierung der Dokumentenklassifizierung auf über 100.000 Labels
Von KI aus dem englischen Original übersetzt. Auf Englisch ansehen
Databricks-Anwender können die Dokumentenklassifizierung auf über 100.000 Labels skalieren, indem sie die SQL-native Vektorsuche mit der Funktion AI Classify kombinieren, um eine Shortlist von Label-Kandidaten abzurufen und daraus auszuwählen. In drei Benchmarks übertraf dieser hybride Ansatz das beste kosteneffiziente Frontier-Modell um fünf Prozentpunkte bei der Genauigkeit – und das bei etwa einem Hundertstel der Token-Kosten.
* Die Zuordnung von Texten zu großen Taxonomien mit mehr als 100.000 Labels – sei es bei der Verknüpfung biomedizinischer Entitäten, der Lieferanten-Normalisierung oder der Deduplizierung von Unternehmen – ist ein häufiges Problem in der Praxis, bei dem Regex, trainierte Klassifikatoren und direkte LLM-Aufrufe an ihre Grenzen stoßen (Kosten, Wartung, Kontextlimits). * Unsere Lösung kombiniert die Vektorsuche mit der Databricks-Funktion AI Classify: Rufen Sie pro Dokument eine Shortlist von Label-Kandidaten ab und lassen Sie dann die Funktion AI Classify aus dieser Shortlist anstelle der gesamten Taxonomie auswählen. * In drei Benchmarks, die diese Anwendungsfälle abdecken, übertraf die SQL-native Vektorsuche in Kombination mit AI Classify das beste kosteneffiziente Frontier-Modell um fünf Prozentpunkte bei der Genauigkeit – und das bei etwa einem Hundertstel der Token-Kosten.
