OpenAI 推出 GPT-Red,一个通过自对弈算法训练的自动化红队智能体,用于发现针对前沿大语言模型的提示注入攻击。该模型在同等规模的最大 RL 后训练计算上训练,能可靠攻破 GPT-5.5 及更早模型,发现比人类红队更多的成功攻击,并泛化到未见环境与防御模型。GPT-Red 被用于对抗性训练 GPT-5.6,使其成为目前对提示注入最鲁棒的模型。
查看原文:https://arxiv.org/abs/2607.26115
来源:HuggingFace Daily Papers(社区热门论文)
未经允许不得转载:AI之家 » GPT-Red:通过大规模自对弈实现自动化红队测试



