Évaluation en direct des agents IA au Grounded Reasoning Cup
Traduit de l'original anglais par IA. Voir en anglais
L'équipe de Stanford a remporté le Grounded Reasoning Cup avec une précision de 63,3 % sur OfficeQA Pro V2, un nouveau benchmark de 120 000 pages de documents du Trésor américain, grâce à une approche d'optimisation d'agents de bout en bout combinant des compétences réutilisables, des solutions de repli pour la représentation des documents et une vérification adaptative. Sur l'ensemble des 11 équipes universitaires participantes, les agents de pointe utilisés tels quels ont obtenu une précision moyenne inférieure à 30 %, montrant que la performance d'un agent ajustée sur un benchmark ne se généralise pas nécessairement de façon fiable à un nouveau corpus.
* Le Grounded Reasoning Cup a mis au défi 11 équipes universitaires d'appliquer des agents développés sur OfficeQA Pro à OfficeQA Pro V2, un benchmark nouvellement publié construit à partir d'environ 120 000 pages de documents du Trésor américain. * Les résultats montrent que la généralisation ne peut pas être tenue pour acquise. Les approches développées sur un benchmark familier ne se sont pas toujours transférées de façon fiable à un nouveau corpus, et les agents de pointe utilisés tels quels ont obtenu une précision moyenne inférieure à 30 %. * L'équipe gagnante de Stanford a atteint une précision de 63,3 % grâce à une stratégie d'optimisation d'agents de bout en bout combinant une bibliothèque de compétences réutilisables, des solutions de repli ciblées pour la représentation des documents et une vérification adaptative.
