TŁO/ARXIV CS.AI
Problem wiarygodności wyników benchmark'ów AI: czy testy się składają?
Artykuł eksploruje epistemiczny problem w ewaluacji AI: wyniki benchmarków rzadko trafiają bezpośrednio do wniosków, a zmiany kontekstu mogą unieważnić uogólnienia. Badacze proponują ramę "projektywności" do weryfikacji łańcuchów wnioskowania.
#AI-EVALUATION#BENCHMARKS#METHODOLOGY#VALIDATION#EPISTEMOLOGY