← ニュース一覧
Databricks Blog2026年8月18日
Grounded Reasoning Cupで、AIエージェントをライブ評価
英語原文から AI が翻訳しました。 英語版を見る
要約
スタンフォード大学のチームは、米財務省文書約12万ページから構成される新しいベンチマーク「OfficeQA Pro V2」において、再利用可能なスキル、文書表現のフォールバック、適応的検証を組み合わせたエンドツーエンドのエージェント最適化アプローチで63.3%の精度を達成し、Grounded Reasoning Cupで優勝した。参加した11の学術チーム全体では、そのままのフロンティアエージェントの平均精度は30%未満にとどまり、あるベンチマークで調整したエージェント性能が新しいコーパスに確実に汎化するとは限らないことが示された。
* Grounded Reasoning Cupでは、11の学術チームがOfficeQA Proで開発したエージェントを、米財務省文書約12万ページから構築された新しいベンチマーク「OfficeQA Pro V2」に適用する課題に取り組んだ。 * 結果は、汎化性能を当然視することはできないことを示した。慣れ親しんだベンチマークで開発されたアプローチが新しいコーパスに常に確実に移行するとは限らず、そのままのフロンティアエージェントの平均精度は30%未満だった。 * スタンフォード大学の優勝チームは、再利用可能なスキルのライブラリ、対象を絞った文書表現のフォールバック、適応的検証を組み合わせたエンドツーエンドのエージェント最適化戦略により、63.3%の精度を達成した。
