TŁO/ARXIV CS.AI
Sztuczne agenty trzeba testować jak żywe organizmy
Artykuł pozycyjny argumentuje, że ewaluacja AI powinna przejść z oceny samych wyników na analizę behawioralnych procesów decyzyjnych. Proponuje metodologię zaczerpniętą z nauk behawioralnych, zamiast tradycyjnych benchmarków wydajnościowych.
#AI-EVALUATION#BEHAVIORAL-TESTING#AGENT-SYSTEMS