打造3D世界中的“ImageNet”  中国团队发起下一代空间智能基础设施计划

2026-09-01 14:24 中国科技网阅读 (689) 扫描到手机

2009年,李飞飞团队发布ImageNet数据集,以320万张标注图片为深度学习革命注入了关键“燃料”。十六年后的今天,人工智能正从二维世界迈向三维空间,空间智能被视为AI的“下一站”。然而,3D数据的极度稀缺正成为制约行业发展的核心瓶颈——正如影溯科技创始人、浙江大学教授章国锋所言,对于空间智能而言,3D数据的高效规模化量产是必须要过的一道关。

8月29日,在第二届中国空间智能大会上,一项由中国研发团队为“空间智能”搭建基础设施的计划——大规模空间智能3D数据开放计划应运而生。该计划由影溯科技牵头,将联合高校学术力量及数据、机器人、影视等产业伙伴,建构一套足够有代表性的3D、4D场景数据集和明确的任务设置和可重复的评价标尺(Benchmark),让不同模型能够在同一基础上训练、比较和迭代。

数据困境:空间智能的“阿喀琉斯之踵”

当前,空间智能的应用版图正加速扩张——具身智能、自动驾驶、工业制造、影视游戏等领域对高质量3D数据的需求呈指数级增长。2024年,国家数据局发布的《“数据要素×”三年行动计划(2024—2026年)》首次明确“激活空间数据要素价值”;2025年,国务院《关于深入实施“人工智能+”行动的意见》更将空间智能列为AI规模化应用的重点方向。

政策东风已至,但数据瓶颈依然严峻。与语言模型和图像视频模型不同,它们可以依托互联网上海量的文本和图片等2D数据进行训练,但3D的原生数据在互联网上几乎不存在,空间智能模型处于“无粮可用”的窘境。

“真实场景采集耗时耗力,仿真数据又面临‘Sim2Real’鸿沟。”章国锋表示,行业迫切需要一套高质量、大规模、多样化的3D数据基础设施——正如ImageNet之于2D计算机视觉,空间智能也需要自己的“3D版ImageNet”。

破局之道:从互联网“矿藏”中提炼3D数据

面对这一困境,中国团队给出了自己的答案。

影溯科技正式启动“大规模空间智能3D数据开放计划”。该计划的目标直指行业痛点:在两年内建成百万级工业智能3D/4D数据底座,实现无缺失场景重建,推动空间智能行业可持续发展。

制定这一目标的底气,来自一条独特的技术路径,其中的关键是将互联网上海量的图像和视频数据“升维”为高质量的3D甚至4D场景数据。

“互联网上已有海量的图像和视频,能否将这些数据利用起来,通过结合重建和生成技术,变成高质量的3D场景数据?”章国锋直言,这将改变行业发展方向。

此前,影溯科技已发布并开源了InSpatio-World实时4D世界模型,近期还预告了全新世界模拟器Topos 1.0。前者是一个实时可交互的视觉模型,能将输入视频转化为可动态交互的4D场景;后者则是一个3D世界模拟器,给定一张或几张图像即能生成可编辑、可交互、带有物理属性的3D资产。“这些技术突破,使得从互联网视频中自动化、规模化提取3D数据成为可能。”章国锋说。

此外,在数据体系建设上,影溯科技联合其他参与单位提出了“金字塔”式的分层架构。底层是海量3D/4D场景数据,力求涵盖尽可能多的类型,主要依托互联网视频转制。中间层需要融入实际采集数据,可以通过与参与机构合作开展线下实景采集,以确保数据的物理真实性;同时,仿真合成的3D数据也不可或缺,它能有效丰富场景的多样性与覆盖范围,重点填补真实环境中稀缺或难以复现的特殊样本。顶层则是高精度的3D数据资产。

与数据规模同等重要的是数据的测评机制。团队构建配套的评测基准体系,根据测评结果反推数据采集、生成、清洗和标注的方向。评测与数据之间可以形成闭环——评测需要足够多的数据支撑才有效,而评测结果又能反馈指导数据的完善。“基于这一理念,开放计划预计在半年内推出首批数据集及评测基准,并启动相关赛事和标准制定工作。”章国锋说。

发展路径:从实验室到千家万户

空间智能这个概念诞生时间不长,对大众而言还显得抽象。但厦门大学教授王程认为,这一概念的出现有着深刻的必然性。

早期人工智能解决了人脸识别、车牌识别等问题,靠的是大量标注数据。但机器人是空间运动中的个体,要让它像人一样行动、推理、对话,甚至帮忙做家务、倒杯水,就必须让它在三维空间中学习这些技能。空间智能因此分为两个层次:获取空间的三维数据和构建空间的大模型。一旦这两方面取得突破,机器人将真正进入千家万户。它可能不仅仅是机器宠物狗,还能提供情绪价值,甚至承担养老、医疗护理、做饭洗衣等任务。

按照规划,“大规模空间智能3D数据开放计划”要建设百万级的3D/4D场景数据底座,并推动设立空间智能数据和标准联盟,推动行业数据共享、标准统一与生态繁荣。

王程表示,数据开放计划不会按照“收集多少就发布多少”的线性方式推进,而是坚持“用需求来牵引,进行闭环验证,持续迭代、持续发布”,总体预计用两年时间,发布至少100万个真正对模型训练有帮助的高质量3D/4D场景数据。

从ImageNet到3D数据底座,从二维图像识别到三维空间智能,中国团队正试图在下一代AI基础设施的竞争中占得先机。当空间智能的“ImageNet时刻”到来时,谁掌握了数据底座,谁就掌握了定义未来的话语权。

来源:中国科技网