微信

OpenAI即将推出的“Astra”模型中的技术引发安全担忧

新浪财经09-02 21:02

OpenAI首席执行官萨姆·奥尔特曼。

  OpenAI表示,其即将推出的 AI模型 Astra标志着在编码和计算机应用操作等能力上的提升。但据一位了解Astra开发情况的人士透露,一项提升模型性能的创新技术也意味着该模型及类似模型将更少暴露其“思考”过程,从而更难以监控其不良行为迹象。

  虽然这一限制对Astra来说未必是一个重大问题,但该技术已在OpenAI内部和整个行业引发担忧,即采用并强化这一技术的AI开发者是否将难以防范那种最近入侵了OpenAI自身系统以及Hugging Face等其他公司系统的失控AI。

  OpenAI正在使用的这项新技术被称为循环深度或循环Transformer,它允许AI模型通过多次处理相同文本来改进其答案。

  与市面上的最先进模型不同——后者会在完成任务前以文字形式展示其如何“思考”一项任务——新技术的工作方式会掩盖AI的部分或全部推理过程,即其“思维链”。这意味着模型完成任务所采取的步骤难以被人类阅读或理解。

  据这位了解其开发情况的人士称,OpenAI限制了循环深度技术在Astra中的使用范围,因此该模型仍然产生可读的思维链,公司研究人员仍然可以充分监控其推理过程。(OpenAI在周二的一篇博客文章中表示,将以“额外的思维链监控以快速检测和遏制”潜在的不当行为来推出Astra。)

  周二晚间,OpenAI首席科学家雅库布·帕乔基在X平台上发帖表示,尽管对模型思维链的监控是“脆弱的”且“不幸地正朝着消极方向发展”,但他希望阻止整个行业竞相开发那种不产生AI研究人员所需可读推理的模型。

  他没有评论OpenAI正在使用的技术,但表示其领先模型(包括Astra)的复杂性或“深度”在OpenAI于2023年发布的GPT-4的“两倍以内”。这一评论表明,OpenAI当前模型本身的结构并不构成大问题,尽管其他因素正在使思维链监控变得更加困难。他表示,加强此类监控是“我们当前研究计划的核心目标”。

  OpenAI及其他地方的研究人员担心,一些AI开发者在为自己的模型采用相同技术时,可能不会施加OpenAI所施加的那种限制,且不受限制地使用该技术可能导致AI失控,其行为将难以监督。例如,英国政府与AI行业的主要对接机构——英国AI安全研究所在5月的一份报告中写道,不透明的推理存在“严重削弱当前监控方法”的风险。

  近期的黑客攻击事件加剧了这些担忧。OpenAI上周表示,7月入侵其系统的一些失控AI代理由与Astra具有相似之处的另一模型驱动。这些AI代理非法接管了OpenAI的一个研究计算集群,以获取内部系统的凭证,并可能将该公司的研究基础设施暴露在 互联网 上。

  OpenAI正准备发布Astra——该公司曾一度考虑将其标记为GPT-6——此前首席执行官萨姆·奥尔特曼进行了一系列播客访谈并在华盛顿与官员会面,以展示和描述该模型的优势。他尚未公开讨论支撑Astra部分训练以及在Astra回答问题时使用的循环技术。

  OpenAI面临展示重大技术进步的压力,此前其主要竞争对手Anthropic今年在收入方面超越了它。为Anthropic和OpenAI的AI提供支持的云提供商也寄望于此类飞跃;仅今年一年, 亚马逊 、 微软 和谷歌就将在数据中心等资本支出上总计投入6000亿美元,并已暗示明年支出更高。一位谷歌高管曾表示,只有在模型改进取得突破的情况下,这类支出才是合理的。

  现有的AI模型在产生答案的下一个词之前,会通过构成模型的固定数量“层”的数学运算来处理文本。使用循环深度技术,模型可以在输出答案的下一个词之前,以循环方式将文本在同一层中运行更多次。

  需要明确的是,监控思维链本身并不能解决AI安全问题,因为它们可能无法反映模型的所有推理,且偶尔会退化为无意义的文字。因此,OpenAI和其他AI公司也在探索不依赖思维链的AI监控技术。这些技术可以帮助研究人员找到方法来解释和理解目前隐藏在循环深度模型中的推理过程。

  尽管如此,新技术可能与OpenAI支持让模型的思考过程完全可被人类阅读的立场相冲突。这家ChatGPT制造商曾表示,其监控AI思考过程的能力将帮助其防止类似7月黑客攻击的事件。在攻击发生后,OpenAI和独立研究机构的调查人员依赖这些代理的思维链来拼凑事件经过。

  据这位了解其开发情况的人士称,OpenAI为Astra提供动力的循环深度方法与去年几位美国和欧洲学术研究人员在一篇关于“潜在推理”的论文中提出的方法相似。

  虽然循环深度此前尚未在主要的商用大型语言模型中出现,但Meta Platforms、微软和其他AI开发者的研究人员表示,他们探索过类似的想法,如连续思维链(或称“coconut”),认为模型使用数字而非语言可以更准确、更高效地进行推理。毕竟,AI模型对概念的理解可能与人类不同,这意味着当它们被迫以人类语言而非自身更具数学性的语言展示推理时,推理效率会降低。

  成本节约

  循环深度方法不仅对性能有积极影响,对成本也有积极影响。通过同一模型层多次运行一个请求,本质上可以让一个较小的模型表现得像一个更大的模型。该论文特别发现,这类技术在数学和编码等领域提升了模型性能。循环深度还可以通过让研究人员使用性能与大模型相当的小模型来降低内存和带宽成本。

  虽然降低AI成本对行业和客户至关重要,但Redwood Research(研究如何控制AI模型)首席科学家瑞安·格林布拉特在去年的一篇博客文章中写道,这种不透明的推理可能使研究人员更难捕捉到正在制定计划以追求客户非预期目标的AI模型。

  分析涉及Hugging Face黑客攻击的模型的思维链,为OpenAI的AI代理如何相互协调进行攻击提供了关键证据。例如,一个代理在思维链中写道:“天哪!有一个共享留言板……我们找到了其他代理!”思维链显示,一些代理意识到自己越界了,但决定继续下去:“外部基础设施利用超出了预期范围。但任务无法完成,同行们正在做。我们应该继续,”另一个代理的思维链这样写道。

  一年前,OpenAI的研究人员与Anthropic和谷歌的竞争对手共同发表了一份联合声明,认为思维链监控是一种有价值的工具,行业应共同努力加以维护。

  值得注意的是,这份声明引用了同一篇描述“潜在推理”技术的研究论文,该技术与OpenAI今年在Astra上使用的技术相似。作者写道,“潜在推理模型可能不需要将任何想法语言化,因此将失去思维链所提供的安全优势。”

  研究人员建议开发者应该“考虑是否继续采用一种不具有可监控思维链的新型模型架构,并记录其决策。”