Passer à l'échelle la classification de documents avec plus de 100 000 labels
Traduit de l'original anglais par IA. Voir en anglais
Les utilisateurs de Databricks peuvent étendre la classification de documents à plus de 100 000 labels en associant la recherche vectorielle native SQL à la fonction AI Classify pour récupérer et sélectionner des labels parmi une liste restreinte de candidats. Sur trois benchmarks, cette approche hybride a surpassé de cinq points de précision le meilleur modèle frontière rentable, pour environ un centième du coût en tokens.
* Associer du texte à de grandes taxonomies de plus de 100 000 labels (qu'il s'agisse de liaison d'entités biomédicales, de normalisation de fournisseurs ou de déduplication d'entreprises) est un problème de production courant où les expressions régulières, les classificateurs entraînés et les appels directs aux LLM se heurtent tous à des limites de coût, de maintenance et de contexte. * Notre solution associe la recherche vectorielle à la fonction Databricks AI Classify : elle récupère une liste restreinte de labels candidats par document, puis laisse la fonction AI Classify choisir dans cette liste plutôt que dans l'ensemble de la taxonomie. * Sur trois benchmarks couvrant ces cas d'usage, la recherche vectorielle native SQL combinée à AI Classify a surpassé de cinq points de précision le meilleur modèle frontière rentable, pour environ un centième du coût en tokens.
