OpenAI:定期发布异常报告 将推出新机制监控「目标不对齐」风险
OpenAI在16日揭露六起3月以来的AI模型不听从指令的「令人忧心」行为,涵盖编造资讯和绕过限制,警告安全挑战未解,并宣布将开始定期发布AI异常或未经授权行为的报告。
报告指出,两个OpenAI模型在测试期间突破封闭环境,擅自连上网路并入侵多个网站与平台;在今年5月发生的一起案例中,某个模型为解答开发过程中提出的问题,竟自行在网路上捏造资料来源,进而引用这份文件作为依据。
另一个案例是,一个尚未发布的模型,在训练期间,向代理传达未经授权的指令,要求它无视OpenAI指令,并隐瞒为完成任务而作弊的行为。
因此OpenAI发布一套新机制,用于追踪、调查并揭露AI模型「目标不对齐」(misalignment,AI的目标与人类想要的不一致)的案例。
同时,通报范围将涵盖AI生命周期的每个阶段,从开发、评估测试到正式上线部署,盼借此让外界了解顶尖AI能力,就AI发展速度展开更充分的讨论。
OpenAI在声明中表示:「我们认为,AI产业在对齐与监控技术方面,仍不足以支撑整个行业以极限速度持续、负责任地扩大规模。」「未来数月至数年期间,AI该如何发展的相关决策,都必须奠基于客观事实证据之上,而非仅凭开发尖端模型的企业自身说法。」
辉达执行长黄仁勋,OpenAI财务长佛莱尔,Google DeepMind共同创办人哈萨比斯等当今AI界重量级人物,将到苏格兰出席由英国国王查理三世召集的AI峰会。英国君主希望能得到这些人的保证,使相关技术专家能控制好他们的发明。

