本文へスキップ
← ニュース一覧
Databricks Blog2026年7月20日

10万以上のラベルに対応するドキュメント分類のスケールアップ

英語原文から AI が翻訳しました。 英語版を見る

要約

Databricksのユーザーは、SQLネイティブのベクトル検索とAI Classify関数を組み合わせることで、候補ラベルのショートリストを取得・選択し、10万以上のラベルに対応するドキュメント分類をスケールアップできます。3つのベンチマークにおいて、このハイブリッドアプローチは、最もコスト効率に優れたフロンティアモデルと比較して、トークンコストを約100分の1に抑えながら、精度で5ポイント上回りました。

* 生体医学的エンティティのリンク、ベンダーの正規化、企業の重複排除など、10万以上のラベルからなる大規模な分類体系にテキストをマッピングすることは、本番環境でよくある課題です。しかし、正規表現、トレーニング済みの分類器、LLMの直接呼び出しでは、コスト、メンテナンス、コンテキスト制限の面でいずれも困難が伴います。 * 私たちのソリューションは、ベクトル検索とDatabricksのAI Classify関数を組み合わせたものです。ドキュメントごとに候補ラベルのショートリストを取得し、分類体系全体からではなく、そのショートリストの中からAI Classify関数に選択させます。 * これらユースケースにわたる3つのベンチマークにおいて、SQLネイティブのベクトル検索とAI Classifyの組み合わせは、最もコスト効率に優れたフロンティアモデルと比較して、トークンコストを約100分の1に抑えながら、精度で5ポイント上回りました。

関連記事

News

FDAがいかにしてスタッフの85%が毎日利用するAIプラットフォームを構築したか

databricks-blog2d ago
News

権限は目的ではない:Omnigentにおけるインテントベースの認可

databricks-blog2d ago
News

エージェント時代に向けたプロビジョニング:Databricksがいかにしてセルフサービス型のインフラ自動供給システムを構築したか

databricks-blog2d ago
News

フロンティアデータエージェントが汎用コーディングエージェントの品質とコストを凌駕する理由

databricks-blog2d ago