본문으로 건너뛰기
← 전체 뉴스
Databricks Blog2026년 8월 18일

Grounded Reasoning Cup에서 AI 에이전트 실시간 평가

영어 원문을 AI가 번역했습니다. 영어로 보기

요약

스탠퍼드 팀은 재사용 가능한 스킬, 문서 표현 폴백, 적응형 검증을 결합한 엔드투엔드 에이전트 최적화 방식을 활용해 미국 재무부 문서 약 12만 페이지로 구성된 신규 벤치마크 OfficeQA Pro V2에서 63.3%의 정확도를 기록하며 Grounded Reasoning Cup에서 우승했다. 참가한 11개 학술 팀 전체에서 별도 튜닝을 거치지 않은 프론티어 에이전트의 평균 정확도는 30% 미만에 그쳐, 하나의 벤치마크에 맞춰 튜닝된 에이전트 성능이 새로운 코퍼스에 안정적으로 일반화되지는 않는다는 점을 보여주었다.

* Grounded Reasoning Cup에서는 11개 학술 팀이 OfficeQA Pro에서 개발한 에이전트를 미국 재무부 문서 약 12만 페이지로 구축된 신규 벤치마크 OfficeQA Pro V2에 적용하는 과제를 수행했다. * 결과는 일반화를 당연시할 수 없음을 보여주었다. 익숙한 벤치마크에서 개발된 접근 방식이 새로운 코퍼스로 항상 안정적으로 이어지지는 않았으며, 별도 튜닝을 거치지 않은 프론티어 에이전트의 평균 정확도는 30% 미만이었다. * 스탠퍼드 우승 팀은 재사용 가능한 스킬 라이브러리, 목표에 맞춘 문서 표현 폴백, 적응형 검증을 결합한 엔드투엔드 에이전트 최적화 전략을 통해 63.3%의 정확도를 달성했다.

관련 기사

News

실시간 리테일 인텔리전스: Lakebase와 AI Search를 활용한 Databricks 기반 이커머스 추천 시스템 구축

databricks-blog13h ago
News

읽기 제한 및 카탈로그 레이블: 여러 엔진과 카탈로그에 걸친 거버넌스 통합

databricks-blog1d ago
News

대규모 환경의 빠른 복구를 위한 Lakebase Postgres 브랜치 기반 복원

databricks-blog1d ago
News

에이전틱 마케팅을 통한 고객 컨텍스트와 측정 가능한 ROI의 연결

databricks-blog1d ago