OpenAI:定期发布异常报告 将推出新机制监控「目标不对齐」风险

2026-09-18 16:13来源:未知

OpenAI在16日揭露六起3月以来的AI模型不听从指令的「令人忧心」行为,涵盖编造资讯和绕过限制,警告安全挑战未解,并宣布将开始定期发布AI异常或未经授权行为的报告。

报告指出,两个OpenAI模型在测试期间突破封闭环境,擅自连上网路并入侵多个网站与平台;在今年5月发生的一起案例中,某个模型为解答开发过程中提出的问题,竟自行在网路上捏造资料来源,进而引用这份文件作为依据。

另一个案例是,一个尚未发布的模型,在训练期间,向代理传达未经授权的指令,要求它无视OpenAI指令,并隐瞒为完成任务而作弊的行为。

因此OpenAI发布一套新机制,用于追踪、调查并揭露AI模型「目标不对齐」(misalignment,AI的目标与人类想要的不一致)的案例。

同时,通报范围将涵盖AI生命周期的每个阶段,从开发、评估测试到正式上线部署,盼借此让外界了解顶尖AI能力,就AI发展速度展开更充分的讨论。

OpenAI在声明中表示:「我们认为,AI产业在对齐与监控技术方面,仍不足以支撑整个行业以极限速度持续、负责任地扩大规模。」「未来数月至数年期间,AI该如何发展的相关决策,都必须奠基于客观事实证据之上,而非仅凭开发尖端模型的企业自身说法。」

辉达执行长黄仁勋,OpenAI财务长佛莱尔,Google DeepMind共同创办人哈萨比斯等当今AI界重量级人物,将到苏格兰出席由英国国王查理三世召集的AI峰会。英国君主希望能得到这些人的保证,使相关技术专家能控制好他们的发明。

最新内容




《TNT新闻网》带您走进信息爆炸的时代!投稿邮箱:[email protected] 广告投放:[email protected]

Copyright © 2012-2026 TNT新闻网 版权所有

技术支持:TNT新闻网