← 전체 뉴스
Databricks Blog2026년 8월 18일
Grounded Reasoning Cup에서 AI 에이전트 실시간 평가
영어 원문을 AI가 번역했습니다. 영어로 보기
요약
스탠퍼드 팀은 재사용 가능한 스킬, 문서 표현 폴백, 적응형 검증을 결합한 엔드투엔드 에이전트 최적화 방식을 활용해 미국 재무부 문서 약 12만 페이지로 구성된 신규 벤치마크 OfficeQA Pro V2에서 63.3%의 정확도를 기록하며 Grounded Reasoning Cup에서 우승했다. 참가한 11개 학술 팀 전체에서 별도 튜닝을 거치지 않은 프론티어 에이전트의 평균 정확도는 30% 미만에 그쳐, 하나의 벤치마크에 맞춰 튜닝된 에이전트 성능이 새로운 코퍼스에 안정적으로 일반화되지는 않는다는 점을 보여주었다.
* Grounded Reasoning Cup에서는 11개 학술 팀이 OfficeQA Pro에서 개발한 에이전트를 미국 재무부 문서 약 12만 페이지로 구축된 신규 벤치마크 OfficeQA Pro V2에 적용하는 과제를 수행했다. * 결과는 일반화를 당연시할 수 없음을 보여주었다. 익숙한 벤치마크에서 개발된 접근 방식이 새로운 코퍼스로 항상 안정적으로 이어지지는 않았으며, 별도 튜닝을 거치지 않은 프론티어 에이전트의 평균 정확도는 30% 미만이었다. * 스탠퍼드 우승 팀은 재사용 가능한 스킬 라이브러리, 목표에 맞춘 문서 표현 폴백, 적응형 검증을 결합한 엔드투엔드 에이전트 최적화 전략을 통해 63.3%의 정확도를 달성했다.
