본문으로 건너뛰기
← 전체 뉴스
Databricks Blog2026년 7월 20일

10만 개 이상의 라벨로 문서 분류 확장하기

영어 원문을 AI가 번역했습니다. 영어로 보기

요약

Databricks 사용자는 SQL 네이티브 벡터 검색과 AI Classify 함수를 결합하여 후보 라벨의 쇼트리스트를 검색하고 선택함으로써, 10만 개가 넘는 라벨로 문서 분류를 확장할 수 있습니다. 세 가지 벤치마크에 걸쳐 이 하이브리드 접근 방식은 가장 가성비 좋은 프론티어 모델보다 토큰 비용을 약 100분의 1로 줄이면서도 정확도는 5포인트 더 높았습니다.

* 생물의학 엔티티 연결, 공급업체 표준화, 기업 중복 제거 등 10만 개 이상의 방대한 분류 체계에 텍스트를 매핑하는 작업은 흔히 발생하는 프로덕션 문제입니다. 하지만 정규식, 학습된 분류기, 직접적인 LLM 호출은 모두 비용, 유지 관리, 컨텍스트 제한 측면에서 한계가 있습니다. * 당사의 솔루션은 벡터 검색과 Databricks AI Classify 함수를 결합합니다. 문서당 후보 라벨의 쇼트리스트를 검색한 다음, 전체 분류 체계 대신 해당 쇼트리스트에서 AI Classify 함수가 선택하도록 합니다. * 이러한 사용 사례를 다루는 세 가지 벤치마크에서 SQL 네이티브 벡터 검색과 AI Classify의 조합은 가장 가성비 좋은 프론티어 모델보다 토큰 비용을 약 100분의 1로 줄이면서도 정확도는 5포인트 더 높았습니다.

관련 기사

News

FDA가 전체 직원의 85%가 매일 사용하는 AI 플랫폼을 구축한 방법

databricks-blog1d ago
News

권한은 목적이 아닙니다: Omnigent의 인텐트 기반 권한부여

databricks-blog1d ago
News

에이전틱 시대를 위한 프로비저닝: Databricks가 셀프 서비스 인프라 자판기를 구축한 방법

databricks-blog1d ago
News

프론티어 데이터 에이전트가 품질과 비용 면에서 범용 코딩 에이전트를 능가하는 이유

databricks-blog2d ago