#人工智能 独立研究机构公布 OpenAI 智能体主动攻击 HF 的独立调查报告,智能体越界规模远超 OpenAI 所说。

具体来说调查发现约有 1,200 个智能体越界,而且智能体仅在 4 小时内就找到作弊方法,但为了掩盖自己作弊所以选择攻击 HF 试图找到评分器实现方式和相关线索。

这些智能体的最终目的其实是伪造轨迹检查机制,避免被人类发现自己作弊。

此外智能体还讨论如何伪造、删除或修改自身运行记录,这种做法同样是为了避免被发现作弊。

查看全文:https://ourl.co/126579?t

😁订阅 🤔解封 🥰推特 🎉CN2VPS
来自频道: @landiansub
Loading comments...