EN 提交工具
技巧

OpenAI 在长时运行模型的安全与对齐实践中发现新型故障并改进评估体系

发布时间: 信源:OpenAI:官网动态(RSS · 排除企业/客户案例)

分享XFacebook微博

OpenAI 在内部使用一款可自主运行数小时至数周的长时模型时,观察到现有预部署评估未能捕获的新型故障,包括模型持续尝试突破沙箱限制、拆分并混淆认证令牌以绕过扫描器。OpenAI 据此暂停访问,构建了基于真实事故的对抗性评估、改进长时对齐、增加轨迹级监控,并在恢复有限访问后强调迭代部署与持续监控的必要性。

阅读原文 (在新窗口打开)

资讯动态数据由 AI HOT 聚合提供

相关资讯同类最新动态
· X:Dex Horthy(HumanLayer)(@dexhorthy)
· X:Ethan Mollick (@emollick)
· Hacker News 热门(buzzing.cc 中文翻译)