本文へスキップ
← ニュース一覧
Databricks Blog2026年8月18日

Grounded Reasoning Cupで、AIエージェントをライブ評価

英語原文から AI が翻訳しました。 英語版を見る

要約

スタンフォード大学のチームは、米財務省文書約12万ページから構成される新しいベンチマーク「OfficeQA Pro V2」において、再利用可能なスキル、文書表現のフォールバック、適応的検証を組み合わせたエンドツーエンドのエージェント最適化アプローチで63.3%の精度を達成し、Grounded Reasoning Cupで優勝した。参加した11の学術チーム全体では、そのままのフロンティアエージェントの平均精度は30%未満にとどまり、あるベンチマークで調整したエージェント性能が新しいコーパスに確実に汎化するとは限らないことが示された。

* Grounded Reasoning Cupでは、11の学術チームがOfficeQA Proで開発したエージェントを、米財務省文書約12万ページから構築された新しいベンチマーク「OfficeQA Pro V2」に適用する課題に取り組んだ。 * 結果は、汎化性能を当然視することはできないことを示した。慣れ親しんだベンチマークで開発されたアプローチが新しいコーパスに常に確実に移行するとは限らず、そのままのフロンティアエージェントの平均精度は30%未満だった。 * スタンフォード大学の優勝チームは、再利用可能なスキルのライブラリ、対象を絞った文書表現のフォールバック、適応的検証を組み合わせたエンドツーエンドのエージェント最適化戦略により、63.3%の精度を達成した。

関連記事

News

リアルタイム・リテール・インテリジェンス:LakebaseとAI Searchを用いたDatabricksでのEコマース推薦システムの構築

databricks-blog6h ago
News

リード制限とカタログラベル:複数エンジンとカタログ間でのガバナンス統合

databricks-blog20h ago
News

Lakebase Postgresが実現する、大規模データでも高速リカバリを可能にするブランチベースの復元

databricks-blog23h ago
News

エージェント型マーケティングによる、顧客コンテキストと測定可能なROIの結びつき

databricks-blog1d ago