← 전체 뉴스
Databricks Blog2026년 7월 20일
10만 개 이상의 라벨로 문서 분류 확장하기
영어 원문을 AI가 번역했습니다. 영어로 보기
요약
Databricks 사용자는 SQL 네이티브 벡터 검색과 AI Classify 함수를 결합하여 후보 라벨의 쇼트리스트를 검색하고 선택함으로써, 10만 개가 넘는 라벨로 문서 분류를 확장할 수 있습니다. 세 가지 벤치마크에 걸쳐 이 하이브리드 접근 방식은 가장 가성비 좋은 프론티어 모델보다 토큰 비용을 약 100분의 1로 줄이면서도 정확도는 5포인트 더 높았습니다.
* 생물의학 엔티티 연결, 공급업체 표준화, 기업 중복 제거 등 10만 개 이상의 방대한 분류 체계에 텍스트를 매핑하는 작업은 흔히 발생하는 프로덕션 문제입니다. 하지만 정규식, 학습된 분류기, 직접적인 LLM 호출은 모두 비용, 유지 관리, 컨텍스트 제한 측면에서 한계가 있습니다. * 당사의 솔루션은 벡터 검색과 Databricks AI Classify 함수를 결합합니다. 문서당 후보 라벨의 쇼트리스트를 검색한 다음, 전체 분류 체계 대신 해당 쇼트리스트에서 AI Classify 함수가 선택하도록 합니다. * 이러한 사용 사례를 다루는 세 가지 벤치마크에서 SQL 네이티브 벡터 검색과 AI Classify의 조합은 가장 가성비 좋은 프론티어 모델보다 토큰 비용을 약 100분의 1로 줄이면서도 정확도는 5포인트 더 높았습니다.
