Zum Inhalt springen
← Alle News
Databricks Blog20. Juli 2026

Skalierung der Dokumentenklassifizierung auf über 100.000 Labels

Von KI aus dem englischen Original übersetzt. Auf Englisch ansehen

Zusammenfassung

Databricks-Anwender können die Dokumentenklassifizierung auf über 100.000 Labels skalieren, indem sie die SQL-native Vektorsuche mit der Funktion AI Classify kombinieren, um eine Shortlist von Label-Kandidaten abzurufen und daraus auszuwählen. In drei Benchmarks übertraf dieser hybride Ansatz das beste kosteneffiziente Frontier-Modell um fünf Prozentpunkte bei der Genauigkeit – und das bei etwa einem Hundertstel der Token-Kosten.

* Die Zuordnung von Texten zu großen Taxonomien mit mehr als 100.000 Labels – sei es bei der Verknüpfung biomedizinischer Entitäten, der Lieferanten-Normalisierung oder der Deduplizierung von Unternehmen – ist ein häufiges Problem in der Praxis, bei dem Regex, trainierte Klassifikatoren und direkte LLM-Aufrufe an ihre Grenzen stoßen (Kosten, Wartung, Kontextlimits). * Unsere Lösung kombiniert die Vektorsuche mit der Databricks-Funktion AI Classify: Rufen Sie pro Dokument eine Shortlist von Label-Kandidaten ab und lassen Sie dann die Funktion AI Classify aus dieser Shortlist anstelle der gesamten Taxonomie auswählen. * In drei Benchmarks, die diese Anwendungsfälle abdecken, übertraf die SQL-native Vektorsuche in Kombination mit AI Classify das beste kosteneffiziente Frontier-Modell um fünf Prozentpunkte bei der Genauigkeit – und das bei etwa einem Hundertstel der Token-Kosten.

Ähnliche Artikel

News

Wie die FDA eine KI-Plattform aufgebaut hat, die inzwischen 85 % ihrer Mitarbeiter täglich nutzen

databricks-blog3d ago
News

Berechtigung ist nicht gleich Zweck: Intent-basierte Autorisierung in Omnigent

databricks-blog3d ago
News

Provisioning für die Agentic-Ära: Wie Databricks eine Self-Service-Infrastruktur-Ausgabemaschine gebaut hat

databricks-blog3d ago
News

Warum ein Frontier-Daten-Agent allgemeine Coding-Agenten in Qualität und Kosten übertrifft

databricks-blog3d ago