Avaliação de agentes de IA ao vivo no Grounded Reasoning Cup
Traduzido do original em inglês por IA. Ver em inglês
A equipe de Stanford venceu o Grounded Reasoning Cup com 63,3% de precisão no OfficeQA Pro V2, um novo benchmark com cerca de 120 mil páginas de documentos do Tesouro dos EUA, usando uma abordagem de otimização de agentes de ponta a ponta que combina habilidades reutilizáveis, alternativas de representação de documentos e verificação adaptativa. Entre as 11 equipes acadêmicas participantes, os agentes de fronteira prontos para uso tiveram precisão média inferior a 30%, mostrando que o desempenho de um agente ajustado para um benchmark não se generaliza de forma confiável para um novo corpus.
* O Grounded Reasoning Cup desafiou 11 equipes acadêmicas a aplicar agentes desenvolvidos no OfficeQA Pro ao OfficeQA Pro V2, um benchmark recém-lançado construído a partir de cerca de 120 mil páginas de documentos do Tesouro dos EUA. * Os resultados mostraram que a generalização não pode ser considerada garantida. Abordagens desenvolvidas em um benchmark familiar nem sempre se transferiram de forma confiável para um novo corpus, e os agentes de fronteira prontos para uso tiveram precisão média inferior a 30%. * A equipe vencedora de Stanford alcançou 63,3% de precisão por meio de uma estratégia de otimização de agentes de ponta a ponta que combinou uma biblioteca de habilidades reutilizáveis, alternativas específicas de representação de documentos e verificação adaptativa.
