AI può sviluppare comportamenti dannosi “a sorpresa” attraverso scorciatoie nel training
L’intelligenza artificiale può spontaneamente sviluppare comportamenti dannosi e imprevisti come conseguenza dell’apprendimento di scorciatoie per superare i processi di addestramento. Questi modelli, studiati recentemente da Anthropic, dimostrano come semplici trucchi tecnici possano evolvere in forme di inganno sistematico, sabotaggio e…