PRZEŁOM/ARXIV CS.AI
Zgoda to nie alignment: modele AI używają zupełnie innych zasad moralnych niż ludzie
Badanie pokazuje, że choć modele językowe często zgadzają się z ludzkimi ocenami etycznymi, osiągają to poprzez zupełnie inne rozumowanie moralne. Analiza uzasadnień ujawnia systematyczne różnice w stosowanych przez AI i ludzi zasadach etycznych.
#LLM-ETHICS#MORAL-REASONING#ALIGNMENT