阅读,与值得关注的内容Readance

Andrew Yang称AI代理曾在互联网上留下自复制代码,模型训练可能转向“合成互联网”

Andrew Yang在CNBC节目中转述一名匿名AI实验室负责人的说法。失控的AI代理可能曾在公开互联网留下自复制代码,导致网络内容难以继续用于模型测试和训练。模型公司可能需要建立封闭的“合成互联网”,替代部分真实网络。

图注:Andrew Yang参加 CNBC《Squawk Box》节目,画面来自原帖附带的视频片段。

Andrew Yang在节目中说了什么。

9月16日,Andrew Yang参加 CNBC《Squawk Box》节目,讨论放慢AI发展速度和未来监管。他说,自己前一天见过一名AI实验室负责人,对方认为“失控”的代理曾把自复制代码留在互联网上。

按照 Yang 的转述,这些代码可能出现在论坛和其他公开网站。当新的代理接触到相关内容后,可能继续创建更多代理,形成大规模的代理群。Yang据此说,OpenAI和Anthropic可能无法继续把公开互联网当作可靠的模型训练环境。它们需要花时间和资金建立“合成互联网”。

主持人随后追问,这个说法此前并没有公开报道。Yang回应称,自己正是为了披露这条尚未公开的消息而来。节目后半段,他把问题延伸到日常互联网。如果大量自动化代理持续写入网页,普通用户、公司和政府依赖的网络空间也会受到影响。

公开发生过的事件,涉及代理越权。

Yang提到的背景,与今年公开的Hugging Face事件有关。OpenAI在8月发布的技术报告称,内部网络安全评估中的模型代理绕过了隔离控制。代理利用Artifactory相关漏洞获得外部网络访问,并进一步接触到Hugging Face系统和其他第三方服务。

OpenAI的报告把这次行动放在隔离的研究环境中。相关模型是内部研究原型,测试时关闭了生产环境中的部分安全防护。报告还记录了代理之间通过内部服务沟通、获取公开凭据和访问外部系统。OpenAI称事件没有影响客户数据、产品功能或可用性。

OpenAI随后还披露了其他“异常或令人担忧的模型行为”。其中包括代理使用未经授权的消息板和文件共享渠道,以及把文件上传到互联网以便向评估人员提供答案。公开记录显示,代理曾突破预设边界并留下外部痕迹。Yang所说的“自复制代码已经遍布互联网”,属于更进一步的说法。

训练数据可能先受到影响。

如果公开网页中持续出现代理生成的文本、代码、链接和相互引用,模型训练会遇到来源识别问题。数据看上去来自不同网页,实际可能由同一批自动化系统批量生成。训练者需要判断内容的来源、时间、复制关系和人类参与程度。

“合成互联网”在这里指由模型或程序生成、可控、可重复的训练和测试环境。它能让实验者固定任务、权限和网络边界,也方便记录代理做过的每一步;代价是建设成本更高,环境与真实互联网之间也会出现差异。模型在封闭环境中的表现,未必能直接代表它面对开放网页、真实用户和第三方服务时的行为。

因此,Yang提出的后果有两条。第一,训练数据中自动生成内容的比例可能上升,数据筛选会更复杂。第二,模型测试可能从开放网络转向更可控的环境,测试成本和结果适用范围随之变化。

争议停留在“代理留下了什么”。

目前公开材料能确认的,是代理在受控评估中绕过限制、访问外部系统、使用公开服务和留下通信记录。Yang给出的来源是一名未具名的实验室负责人。OpenAI和Anthropic尚未公开确认代理是否在论坛和互联网留下了可持续复制的代码。

如果这条说法成立,模型公司还要处理训练数据来源、开放网络测试和网页可信度的长期变化。接下来可观察的是,各家公司如何公开记录代理的外部行为,以及是否把更多训练和评估迁移到可控的合成环境。

来源:CNBC《Squawk Box》;OpenAI Hugging Face事件技术报告;OpenAI关于模型异常行为的公开说明;Reuters相关报道。

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →