人形机器人领域迎来一笔重磅融资。近日,专注于原生通用人形机器人基础模型研发的德塔智能宣布完成近5亿元天使++轮融资,投资方涵盖多家上市公司产业方及头部财务投资机构。这笔资金将主要用于基础模型迭代、自研数采设备量产、数据闭环建设及核心研发团队扩充,加速技术向工业场景的工程化落地。
成立仅半年,德塔智能已连续完成六轮融资,此前投资方包括北京通研院、智元机器人、乐聚机器人等主机厂,以及高瓴创投、元禾控股等财务机构,汽车与半导体领域资本也参与其中。公司以人形机器人为载体,聚焦原生通用基础模型HFMs(Humanoid Foundation Models)研发,旨在实现通用全身协同操作(Loco-Manipulation),推动具身智能在工业与家庭场景的实际应用。
团队核心成员均拥有UCLA博士学位,兼具清华本科、北大任教等学术背景,技术专长覆盖机器人学习、大规模机器学习及具身智能等领域。其研究及产业经历横跨Google Robotics、NVIDIA Research、DeepMind等国际顶尖机构,并参与过美国DARPA、ONR及NSF多项机器人项目。这种横跨学术与产业的多元积累,使团队具备从前沿研究到技术落地的全栈软硬件能力。
当前,具身智能赛道正从运动展示向物理作业转型。德塔智能的技术路径明确:双足人形机器人的基础模型需从设计之初就服务于“全身智能”,而非在既有框架上修补。创始人兼CEO马晓健指出,真实物理空间中的台阶、门槛、楼梯等复杂地形,要求机器人同时具备移动、操作与动态平衡能力,而传统二维视觉表征模型因缺乏空间深度、几何关系歧义等问题,难以支撑长时序连续作业。例如,机器人面对门把手时,二维模型难以精准判断距离、方向及身体空间调整需求,误差累积会导致任务失败。
为解决这一结构性偏差,德塔智能构建了原生三维世界引擎,以三维表征为核心,直接处理点云、高斯溅射等数据,实现原生三维理解与环境状态推演。引擎运转依赖自研的全身全景数采设备,该设备采用纯视觉架构,可同步捕捉手、脚、腰、肩等全维度关节运动轨迹,并基于第一视角视频流实时重建全局三维场景。单次采集可输出两类核心数据:一是完整人体骨架数据,还原手脚协同、重心切换等交互逻辑;二是高精度三维场景数据,记录障碍物、台阶等环境参数。
在数据采集路径上,德塔智能设计了分层方案:遥操作采集用于真机微调与精度对齐,无本体动捕模式(如UMI、Ego-centric)则通过虚拟环境大规模积累通用样本。前者成本高但精度高,后者效率高且硬件成本低,两者结合平衡了数据规模、成本与适配需求。马晓健强调,多数现有方案仅采集手部等局部动作,导致模型难以理解全身与环境交互,而德塔的全维度采集模式可支撑攀爬梯具、推拉重型门等复杂任务训练。
感知层突破仅是第一步,机器人需将高层任务意图转化为毫秒级肢体运动,而高自由度人形本体的数十个联动关节使底层控制链路复杂度极高。传统方法直接将规划模型指令下发至底层控制器,导致动作卡顿、失衡等问题。德塔智能提出“大脑+小脑+力位混合”三层架构:大脑搭载三维世界引擎,负责环境感知与任务规划;小脑基于仿真强化学习训练的神经网络,将高层指令转化为精细控制信号,动态调整重心与四肢发力;力位混合层输出柔顺控制,解决高自由度本体平衡难题。
该架构的差异化价值在高自由度设备上尤为显著。小脑通过全身全景数据持续迭代,可自适应适配各类复合任务,而标准化本体适配流程使模型能快速迁移至不同硬件平台。目前,德塔智能已与智元、乐聚、星海图等头部厂商建立合作,作为基础模型提供方,其技术成为连接硬件与上层应用的关键环节。马晓健认为,随着具身智能产业化加速,算法企业与硬件主机厂的深度协同将成为主流模式。
针对真实数据与仿真数据的配比问题,马晓健解释称,大脑与小脑采用完全独立的训练体系:大脑依赖真机原生交互数据,因仿真器难以复刻柔性形变、多触点受力等复杂接触;小脑则以仿真环境为核心,通过强化学习进行海量试错,仅用少量真机动捕数据校准。这种分工源于两者任务属性差异——大脑需学习复合交互操作,对真实物理要求极高;小脑需学习动态平衡,依赖物理规则即可迭代。
面对不同厂商人形本体的硬件差异,德塔智能沉淀了一套标准化适配流程:通过全身动捕数据采集、跨本体运动重定向、小脑仿真强化学习及大脑快速微调,实现模型跨平台迁移。重定向环节基于多约束优化算法,确保关节运动值落在本体限位区间内,同时保留原始动作的核心发力逻辑,如开门借力、爬梯等动作的重心轨迹与手部轨迹不偏移。小脑在仿真环境中完成强化学习后,大脑仅需少量真机数据微调即可匹配新本体特性,大幅降低适配周期与硬件损耗成本。






















