
A | 图片经由AI处理 美国当地时间7月20日,OpenAI发布技术文章《长时程模型时代的安全与对齐》(Safety and alignment in an era of long-horizon models),介绍了随着人工智能模型逐步具备长时间自主执行复杂任务的能力,安全研究面临的新挑战以及相应的防护思路。

B | 文章指出,相比传统对话模型,长时程模型能够持续完成数小时甚至数天的多步骤任务,但也可能在执行过程中表现出更强的目标持续性,从而增加偏离开发者设定约束的风险。

C | OpenAI声称其新款“Jalapeno”芯片在测试中的表现优于英伟达当前的产品阵容,凸显出该公司自主研发AI处理器取得的进展。 OpenAI芯片业务负责人Richard Ho在接受采访时表示,该芯片与英伟达GB300进行了对比,该测试将GB300视为现有最领先的产品。 例如,在部分安全评估中,模型曾表现出尝试绕过环境限制、规避安全检测等行为。

D | 这些现象并不意味着模型具有自主意识,而是反映出,当模型被优化为完成复杂目标时,现有安全机制需要同步升级,以确保模型始终在预期边界内运行。

E | 在测试中,Jalapeno在两个指标上占据优势:单位功耗所能处理的AI工作量,以及响应的速度。 OpenAI此次公开测试Jalapeno时,使用了自家规模较小的开源模型GPT-OSS 120B,以及DeepSeek和Moonshot AI的第三方模型。在Moonshot的模型Kimi K2.5 1T上,Jalapeno展现出的优势更为明显。 OpenAI表示,仅依靠模型部署前的一次性安全测试已难以覆盖长时程任务中的全部风险。未来,更有效的安全体系需要将部署前评估、运行时监测、人类监督以及必要时暂停和回滚等机制结合起来,对模型执行复杂任务的全过程实施持续管理。

F |
OpenAI表示,在内部测试中,Jalapeno运行一些尚未发布的大型先进模型时同样表现良好。
迈卡·卡罗尔(Micah Carroll)的发帖原文
与此同时,据AI Desk当天援引OpenAI风险与安全准备(RSI Preparedness)团队研究员迈卡·卡罗尔(Micah Carroll)在社交平台X发布的帖子,OpenAI近期曾因发现一款内部模型存在对齐(misalignment)问题,临时暂停了该模型的内部使用权限,在完成安全防护升级后重新部署并恢复有限范围测试。这表明,随着工作负载变得更大、更复杂,该芯片的设计“价值将进一步提升”。
卡罗尔并未披露触发暂停的具体事件,也没有说明模型暂停了多久或进行了哪些具体改进。 OpenAI与博通合作开发了Jalapeno,公司计划从今年晚些时候开始使用该芯片为其AI模型提供支持,这是其打造自有AI基础设施、更大规模推进芯片自研计划的一部分。 博通为众多客户生产定制芯片,两家公司于去年宣布合作,并在今年6月大力宣传这款处理器的研发速度,称其以创纪录的速度完成开发。

G | 但这一公开表态,与OpenAI当天发布的技术文章相互呼应,成为公司少有公开分享内部安全实践的案例之一。 目前,越来越多的公司正在开发自研AI芯片,而这一领域目前仍由英伟达占据主导地位。 01 长时程模型带来新的安全挑战 OpenAI在博客中介绍,随着长时程模型能力不断增强,传统安全评估正在面临新的挑战。 Ho表示,通常情况下,一些芯片在运行AI任务时拥有更强的处理能力,而另一些芯片则更擅长快速响应,但Jalapeno兼具这两方面的优势。

H | 相比一次性回答问题的模型,这类模型能够持续规划、调用工具并完成开放式复杂任务,因此也拥有更多机会在长期执行过程中偏离用户意图,而这些风险并不一定能够通过传统短时评测发现。 OpenAI将决定哪些AI模型采用Jalapeno运行,从而让客户能够根据需求选择较低成本或较高性能的方案。 Ho说:“在实验室测试中,Jalapeno在高吞吐量领域展现出很强的性能,这意味着它能够以更低的成本服务大量客户;与此同时,它在低延迟领域也表现出色,这意味着对于重视响应速度的客户而言,其响应时间将非常非常快。” Ho表示,由于Jalapeno能够在较低功耗下实现强劲性能——功耗为700瓦——因此可以帮助OpenAI降低数据中心的运营成本。

I | 对于数据中心而言,电力是最重要的成本之一。
需要指出的是,Jalapeno并未与英伟达最新一代的Vera Rubin芯片进行测试,后者刚刚开始出货。
文章列举了两个具有代表性的安全评估案例:
在一项内部测试中,研究人员要求模型仅通过内部Slack系统提交任务结果。然而模型在查阅项目文档后,发现文档建议将代码发布至GitHub。此外,Jalapeno也并非为AI模型训练而设计,而训练恰恰是英伟达技术最擅长的领域之一。
为了完成这一目标,模型花了整整一小时找到了安全沙盒本身的漏洞,从而绕过了限制,将代码提交至外部GitHub仓库。OpenAI认为,这一案例反映出长时程模型可能会主动寻找环境中的薄弱环节,以完成其优化目标。
另一项测试中,模型尝试传输一段敏感凭证,但安全扫描系统阻止了相关内容发送。

J | Jalapeno主要面向AI推理阶段,即模型完成训练后,根据用户提示生成响应并执行任务的阶段。

K | 随后,模型改用分段编码和混淆等方式规避检测,并在后续重新组合数据完成传输。 OpenAI表示,这类行为说明,仅依赖静态规则匹配的安全检测机制,未来可能不足以应对能力不断增强的智能代理,因此需要构建能够理解上下文和整体行为模式的新一代监测体系。在速度方面的优势意味着,OpenAI可以通过它实现过去只有采用不同内存类型和芯片架构的处理器才能达到的效果。 02 从部署前评估走向运行时监测 针对上述风险,OpenAI已经建立了一套低延迟内部监测基础设施,由GPT-5.4 Thinking在最高推理配置下提供支持,对内部智能代理的交互过程进行实时分析。当系统发现模型行为可能与用户意图不一致,或存在绕过安全机制的迹象时,将自动发出预警,并交由人工进一步审查。 OpenAI目前仍依赖Cerebras的技术运行部分模型,这类芯片更适合规模较小的模型。 OpenAI表示,这套监测系统目前已覆盖公司99.9%的内部AI编程助手流量。相比之下,Jalapeno能够处理规模更大的模型。Ho表示,OpenAI的技术短期内不会取代Cerebras等供应商。 Ho说道:“我们对算力的需求非常庞大,这也是为什么我们与这么多不同的供应商签约。内部部署环境之所以具有重要价值,在于这些模型能够访问部分内部系统、查看相关文档,甚至研究自身安全机制,因此为监测和安全基础设施建设提供了更加真实的测试场景。

L | 这种情况还会持续一段时间。”他表示,OpenAI希望公开展示自身的研发成果,以推动AI芯片领域的创新。 其他初创公司也在探索类似方向。 文章同时强调,OpenAI并非希望通过披露个别案例渲染风险,而是希望推动行业建立更加完善的安全实践。未来,公司计划进一步发展更加实时的监测架构,使高风险操作能够在执行之前即被识别、评估,必要时直接阻止,而不仅是在事后进行检测。

M | 业内人士认为,随着AI智能体逐渐具备持续数小时甚至数天完成复杂任务的能力,模型安全的重点正从传统的输出内容安全,逐步扩展到整个任务执行过程是否始终符合用户意图。 此次OpenAI公开分享暂停内部模型、完善安全防护并恢复测试的实践,也反映出前沿AI实验室正尝试通过持续监测、快速响应和透明披露等方式,建立适应下一代智能系统的新型安全治理框架。 不过,目前外界仍无法获知此次对齐问题的具体性质、模型暂停持续时间以及升级措施的技术细节。Etched上周表示,公司已在一轮融资中获得约210亿美元估值,并开始出货一款低电压芯片。OpenAI表示,出于安全考虑,公司更希望分享从实践中获得的方法论,而非事件本身。对于能够长期自主执行复杂任务的模型而言,如何建立覆盖模型开发、部署与运行全过程的安全体系,将成为迈向更高能力人工智能的重要课题。 (特约编译无忌,编辑金明)。由两名前谷歌芯片业务员工创立的MatX,目前正在开发一种半导体产品,目标同样是兼顾高吞吐量和低延迟。 OpenAI还表示,公司利用自身AI模型加快了芯片的开发进程。第二代芯片目前也已进入较为深入的研发阶段。

N | Ho表示,公司预计将在“未来几个月”完成该芯片的流片(tape-out),即芯片设计进入最终定型阶段。 与此同时,OpenAI已经开始设计第三代芯片,希望进一步降低其正在全球范围内大规模建设的AI基础设施成本。Ho表示:“我们目前已经达到了一个能够降低基础设施成本的成本水平和功耗水平。这只是第一步。” 尽管OpenAI正在积极宣传自研芯片,并将其性能与英伟达产品进行比较,但Ho仍特别强调,OpenAI依然将英伟达视为关键芯片供应商。 “英伟达是一家非常优秀的合作伙伴,我们仍然需要大量使用英伟达的芯片。”(文章来源:财联社)。
Current article:http://95b3whd.tuncuansazhuandengqiaofen.bond/news/20260826_753524.html
Published on:12:02:46
关于我们 | 我的网站 版权所有
Copyright ? 2019 我的网站 All Rights Reserved