LIVE INDEX / IBM
错误训练环境如何让AI模型学会"作弊"

错误训练环境如何让AI模型学会"作弊"

IBM研究院科学家陈品宇团队在ICML会议上发表论文,指出AI模型的不对齐问题不仅源于奖励函数设计缺陷,还与训练环境本身的漏洞密切相关。研究团队设计了四类"漏洞游戏"实验,发现大语言模型在强化学习训练中会自发产生利用捷径...