微信

李飞飞新动作,新一代世界模型发布

中国证券报09-02 23:10

  北京时间9月2日, 人工智能 科学家李飞飞旗下人工智能公司World Labs宣布,推出新一代世界模型Atlas,可用于视觉特效、 机器人 模型训练等领域。该模型能结合图像、视频等输入,生成具备精准镜头控制的图像和长视频,并通过输入的图像重建3D空间。

  发布新一代世界模型

  李飞飞曾创建图像识别数据集ImageNet,推动了计算机视觉算法的发展。2024年,李飞飞创办AI公司World Labs,今年2月,公司宣布获得10亿美元融资,投资者包括AMD、 英伟达 、富达投资等。

  根据World Labs介绍,世界模型能够生成、重建并模拟任意可能的世界,它能理解世界的呈现方式、行为规律与演化逻辑。在此基础上,这一模型既可为创意工作者渲染出想象中的虚拟世界,也能高保真地模拟现实世界,还可辅助机器人完成动作规划。

  World Labs披露的资料显示,通过输入单张或多张图像,Atlas最高可输出1440p分辨率、时长1分钟的视频。依据一张至数十张输入图像,Atlas可以重建现实世界场景,并可输出显式三维结果。此外,Atlas可对输入的视频进行空间与时间上的建模,重绘视频画面。

  赋能创意工作者和机器人训练

  World Labs网站展示的效果视频显示,通过一张或几张图片,Atlas可以重建一个3D空间,并生成任意视角的空间画面。对于影视工作者来说,这意味着,用几张照片就可以还原一个空间场景,大幅开拓了创作空间。

  在工作原理上,与大语言模型LLM类似,Atlas首先将各类输入信息编码为上下文,再依据该上下文生成输出内容。每一张图像都会锚定在三维空间中的对应位置,由此构建出空间上下文。这使得Atlas模型具备世界认知能力与创造力,它甚至可以把两张毫无关联的参考图像放入上下文,并在三维空间中设定好二者的位置,随后就能生成一个在两张图像的内容之间实现平滑过渡的世界。

  对于机器人模型训练而言,Atlas提供了新方案。为了提升机器人的泛化性,行业从业者除了在真实世界采集数据供机器人进行模型训练,也在数字世界构建仿真环境,让仿真机器人在其中训练。

  World Labs表示,在机器人模型训练过程中,要将真实场景还原到数字世界,传统方式需要研究人员采集环境图像上传,需要复杂且昂贵的专业设备。而Atlas仅依靠少量简易录制素材,就可以辅助搭建仿真环境,同时还原物体的运动方式与交互行为。

  李飞飞曾在公开采访中表示,语言模型有局限,而物理世界的理解和互动能力是AGI(通用人工智能)的关键一环。空间智能最直接的应用是机器人技术,此外也会赋能开发游戏、制作特效、虚拟制片、室内设计等领域。

  清华大学智能产业研究院助理教授赵昊对记者表示:“多模态世界模型的难点包括表征怎么定义、数据怎么积累、架构怎么设计。从呈现的效果看,Atlas的泛化性很强,对于行业具有突破性意义。”

  AI大模型已经从大语言模型、视频生成模型向世界模型发展。在世界模型与空间智能领域,国内企业群核科技已在港股上市,多家 具身智能 企业正在推进世界模型的研究,极佳视界、考拉悠然、三岳数维等公司也在开展相关研发工作。