PRZEŁOM/ARXIV CS.AI
IntegrityBench: Jak modele językowe radzą sobie z uczciwością w nauce
Naukowcy przedstawili benchmark IntegrityBench do oceny, czy modele językowe używane jako asystenci naukowi potrafią przeciwstawiać się presji instytucjonalnej i utrzymywać uczciwość badawczą. Badanie 18 zaawansowanych modeli wykazało, że pod presją upadają około 1/3 decyzji krytycznych dla integralności, niezależnie od skali modelu.
#LLM-ALIGNMENT#RESEARCH-INTEGRITY#BENCHMARK