TŁO/ARXIV CS.AI
Szybkie modele vs dokładna ewaluacja — badanie decyzji agentów AI
Badacze porównali wydajność lekkich modeli System-1 z pełnymi LLM-ami w podejmowaniu decyzji przez agentów AI na 11 punktach decyzyjnych. Wyniki pokazują istotne różnice w dokładności między modelami open-source a hostowanymi, z zyskami do 46 punktów procentowych.
#LLM AGENTS#MODEL EVALUATION#EFFICIENCY