PRZEŁOM/ARXIV CS.AI
RubricForge: Automatyczne ocenianie agentów AI bez krzywdzących heurystyk
Nowa metoda RubricForge rozwija rubryką oceniającą dla ewaluacji agentów LLM poprzez ewolucję tekstu na podstawie rzeczywistych wyników, zamiast ręcznych definicji czy fine-tuningu. Rozwiązanie zmniejsza problem przeszacowywania fluencji bez faktycznego sukcesu, gruntując oceny w faktycznych wynikach trajektorii agenta.
#LLM-AGENTS#EVALUATION#REWARD-FREE-JUDGING