当前位置:首页 » AI资讯 » AI快讯

Anthropic 研究:训练一个错位的奖励寻求者模型

2026-09-01 3

Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。

来源:X:Anthropic (@AnthropicAI)

相关推荐

扫码关注

qrcode

联系我们

回顶部