Escalando a classificação de documentos para mais de 100 mil rótulos
Traduzido do original em inglês por IA. Ver em inglês
Os profissionais da Databricks podem escalar a classificação de documentos para mais de 100.000 rótulos combinando a busca vetorial nativa em SQL com a função AI Classify para recuperar e selecionar a partir de uma lista restrita de rótulos candidatos. Em três benchmarks, essa abordagem híbrida superou o melhor modelo de fronteira de melhor custo-benefício em cinco pontos de precisão, custando cerca de um centésimo do custo de tokens.
* Mapear texto para grandes taxonomias de mais de 100.000 rótulos, seja para vinculação de entidades biomédicas, normalização de fornecedores ou eliminação de duplicatas de empresas, é um problema comum em produção no qual regex, classificadores treinados e chamadas diretas de LLM enfrentam dificuldades com custos, manutenção e limites de contexto. * Nossa solução combina a busca vetorial com a função AI Classify da Databricks: recupera uma lista restrita de rótulos candidatos por documento e, em seguida, deixa a função AI Classify escolher a partir dessa lista restrita, em vez de usar toda a taxonomia. * Em três benchmarks que abrangem esses casos de uso, a busca vetorial nativa em SQL combinada com o AI Classify superou o melhor modelo de fronteira de melhor custo-benefício em cinco pontos de precisão, custando cerca de um centésimo do custo de tokens.
