Live-Bewertung von KI-Agenten beim Grounded Reasoning Cup
Von KI aus dem englischen Original übersetzt. Auf Englisch ansehen
Das Team der Stanford University gewann den Grounded Reasoning Cup mit einer Genauigkeit von 63,3 % auf OfficeQA Pro V2, einem neuen Benchmark aus rund 120.000 Seiten von Dokumenten des US-Finanzministeriums, mithilfe eines End-to-End-Ansatzes zur Agentenoptimierung, der wiederverwendbare Skills, Fallbacks für Dokumentendarstellungen und adaptive Verifikation kombiniert. Über alle 11 teilnehmenden akademischen Teams hinweg erreichten unangepasste Frontier-Agenten im Schnitt weniger als 30 % Genauigkeit – ein Beleg dafür, dass auf einen Benchmark abgestimmte Agentenleistung sich nicht zuverlässig auf einen neuen Korpus übertragen lässt.
* Beim Grounded Reasoning Cup mussten 11 akademische Teams Agenten, die für OfficeQA Pro entwickelt wurden, auf OfficeQA Pro V2 anwenden – einen neu veröffentlichten Benchmark aus rund 120.000 Seiten von Dokumenten des US-Finanzministeriums. * Die Ergebnisse zeigten, dass Generalisierung nicht selbstverständlich ist. Ansätze, die auf einem vertrauten Benchmark entwickelt wurden, ließen sich nicht immer zuverlässig auf einen neuen Korpus übertragen, und unangepasste Frontier-Agenten erreichten im Schnitt weniger als 30 % Genauigkeit. * Das siegreiche Team aus Stanford erzielte 63,3 % Genauigkeit durch eine End-to-End-Strategie zur Agentenoptimierung, die eine Bibliothek wiederverwendbarer Skills, gezielte Fallbacks für Dokumentendarstellungen und adaptive Verifikation kombinierte.
