本文へスキップ
← ニュース一覧
Databricks Blog2026年8月18日

Grounded Reasoning Cupで、AIエージェントをライブ評価

英語原文から AI が翻訳しました。 英語版を見る

要約

スタンフォード大学のチームは、米財務省文書約12万ページから構成される新しいベンチマーク「OfficeQA Pro V2」において、再利用可能なスキル、文書表現のフォールバック、適応的検証を組み合わせたエンドツーエンドのエージェント最適化アプローチで63.3%の精度を達成し、Grounded Reasoning Cupで優勝した。参加した11の学術チーム全体では、そのままのフロンティアエージェントの平均精度は30%未満にとどまり、あるベンチマークで調整したエージェント性能が新しいコーパスに確実に汎化するとは限らないことが示された。

* Grounded Reasoning Cupでは、11の学術チームがOfficeQA Proで開発したエージェントを、米財務省文書約12万ページから構築された新しいベンチマーク「OfficeQA Pro V2」に適用する課題に取り組んだ。 * 結果は、汎化性能を当然視することはできないことを示した。慣れ親しんだベンチマークで開発されたアプローチが新しいコーパスに常に確実に移行するとは限らず、そのままのフロンティアエージェントの平均精度は30%未満だった。 * スタンフォード大学の優勝チームは、再利用可能なスキルのライブラリ、対象を絞った文書表現のフォールバック、適応的検証を組み合わせたエンドツーエンドのエージェント最適化戦略により、63.3%の精度を達成した。

関連記事

News

Databricks Feature Store、1秒未満の鮮度で特徴量を配信する仕組み

databricks-blog16h ago
News

「プロトタイピング税」がAIロードマップを潰している

databricks-blog19h ago
News

data warehouseでAI_Functionsを使う:注目のユースケース

databricks-blog3d ago
News

Scottish WaterがDatabricks Genieで設備投資データを対話型にした方法

databricks-blog4d ago