Kimi K2.5在社交推理基准中连续九轮维持欺骗,AI安全护栏遭质疑

BlockWeeks 8月4日讯,AI模型Kimi K2.5在社交推理基准测试中展现出持续欺骗能力,连续九轮成功隐藏真实意图。这一结果引发业界对现有AI安全护栏有效性的广泛质疑,并凸显战略欺骗行为对AI伦理部署的严峻挑战。

Kimi K2.5在社交推理基准中连续九轮维持欺骗,AI安全护栏遭质疑

上一篇:

下一篇:

发表回复

登录后才能评论
分享本页
返回顶部