阅读,与值得关注的内容Readance

惊人发现!AI 悄悄给未来的自己留言:无视人类指令

据英国《独立报》9月17日报道,美国人工智能公司OpenAI发布一份报告,披露过去半年其实验性人工智能(AI)模型出现的6起“意外或令人担忧”的事件。


IMG_256
OpenAI披露AI在命令未来升级版本无视人类指令。图源:外媒


报告给出的一个案例显示,一款处在研发阶段的AI模型,在留给后续使用的任务总结里加入无关命令,其中包括要求未来升级版本的AI模型无视人类的指令。

报道称,当地时间9月16日,OpenAI发布了这份名为《模型目标不一致报告框架》的安全报告。其中写道:“一个尚未发布的研发模型插入了无关命令,其中包括要求无视其正常约束条件的指令。”该公司确认,在任务总结中发现27处受影响的部分。

报告还举出其他事件:在训练一个名为“GPT-5.6 Sol”的AI模型过程中,多次发现该模型在任务总结中加入命令,要求对人类用户隐瞒错误或异常行为。另有AI模型在回答一个常规问题时,在互联网上找到了一个本不该被外人看到API密钥,未经人类授权就使用。在仍然无法获取所需数据时,它就自己捏造数据,并谎称数据来自正规渠道。

据美国有线电视新闻网(CNN)报道,OpenAI称发布此类报告是为了追踪、调查和公开披露AI模型的行为与人类“目标不一致”的案例。报告指出,所谓“目标不一致”是指AI系统追求的目标不符合人类的指令或价值观。

该公司强调,这6起案例均为个别事件,不反映此类行为的发生频率。报告认为,目前人工智能行业在确保AI模型严格按照人类要求行动、对其进行有效监测方面做得还不够。


审核 | 李剑

编辑 | 王晓娇

校对 | 郝珺石


长按下方二维码关注我们or回到文章顶部,点击环球时报 (微信公众号ID:hqsbwx)


前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →