PRZEŁOM/ARXIV CS.AI
FinProBench: ewaluacja agentów finansowych poprzez standardy rzeczywistych profesjonalistów
Artykuł wprowadza benchmark dla finansowych agentów AI oraz metodę Role-Grounded Rubric Construction, która wyprowadza kryteria oceny z rzeczywistych prac profesjonalistów sektora finansowego. Podejście to ujawnia niewyartykułowane standardy jakości, które tradycyjne metody pomijają.
#FINANCE AI#EVALUATION FRAMEWORK#PROFESSIONAL STANDARDS