联合开源!因时机器人携手上海交大、复旦发布HandEdit数据集与评测基准
2026/09/06 09:49AI云资讯13669
近日,由因时机器人、上海交通大学和复旦大学等联合完成的HandEdit 数据集与评测基准正式开源。

该项目研究第一视角人类到机器人灵巧手图像编辑:在尽量保留原始场景、物体、视角和交互内容的前提下,将画面中的人手或手臂替换为指定的机器人构型。围绕这一任务,HandEdit 提供了配对数据、统一评测协议和开源工具,供相关方法训练与比较使用。
这并不是普通的“换手”视觉特效。编辑结果既要完整移除原人手,又要保持物体状态、接触关系和背景不变;新生成的机器人还需符合目标 URDF 所规定的结构、材质与关节形态。
数据来源与构成
目前,机器人灵巧操作数据通常通过遥操作、动作捕捉或真实机器人执行采集。这类数据与具体机器人本体紧密相关,采集和扩展成本相对较高。
人类第一视角操作视频则记录了抓取、开合、旋拧、剪切和双手协作等过程,包含较丰富的物体与场景信息。但人手与机器人灵巧手在外观、关节结构、尺度和运动方式上存在差异,因此这些视频不能直接对应到指定机器人构型。
HandEdit 围绕上述差异整理并构建了以下数据资源:
2 亿余个图像编辑样本;
30 万余段视频片段;
汇集EgoDex、ARCTIC、OakInk2、HOI4D、HO-Cap五个第一视角操作数据集;
覆盖26 种 URDF 构型,其中包括 13 种独立灵巧手和 13 种手臂一体构型;
覆盖600 余个场景、1100 余种物体和 400 余类任务。

13 种独立灵巧手覆盖多个品牌及结构类型,其中包括因时机器人自主研发的RH56DFX系列、RH5DG2系列灵巧手;Hand-Arm 构型中还组合了 JAKA、KUKA、Panda、RM65/75、UR5、xArm 等机械臂平台。

△13 种 Hand-only 与 13 种 Hand-Arm 目标构型
项目将不同来源、场景和机器人本体的数据整理到同一套处理与评测框架中,以便在一致条件下训练和比较相关方法。

△HandEdit 中的场景、物体与操作类别示例
数据示例
下面展示的是 HandEdit 数据处理链路中的同步片段。左右画面使用相同 sequence 与相同帧区间:左侧保留原始人类第一视角操作,右侧展示对应的机器人伪 GT。
需要说明的是,以下机器人画面属于仿真渲染与图像合成结果,用于数据构建和模型评测,并非真实机器人执行录像。
Hand-only|独立灵巧手
在Hand-only轨道中,系统需要在保持物体、背景和动作语义不变的前提下,将人手替换为目标灵巧手。

△因时RH56DFX系列灵巧手操作意式咖啡机
Hand-Arm|灵巧手与机械臂
Hand-Arm轨道将可见手臂区域替换为手臂一体构型,需要额外处理腕部位姿、机械臂逆运动学、固定基座、相机关系和前景遮挡。

△因时灵巧手对胶囊咖啡机执行抓取操作
数据是如何生成的
为生成与目标机器人构型相对应的参考图像,HandEdit建立了一条结合视觉处理、几何重定向和仿真渲染的数据处理流程。

△从人类第一视角画面到 Hand-only、Hand-Arm 伪 GT 的主要处理环节
1.分割:默认使用SAM3定位人手或手臂区域,覆盖手指、手掌、手腕及可见前臂;
2.背景修复:移除原前景后,默认使用ProPainter恢复被遮挡区域,兼顾连续帧之间的外观一致性;
3.动作重定向:将MANO或三维手部姿态映射到目标URDF的关节空间,并结合不同本体的运动链、连杆长度和关节限制进行细化;
4.机械臂求解:Hand-Arm 数据先完成手部重定向,再设置相机相对虚拟基座,通过逆运动学求解机械臂关节;
5.同视角渲染与合成:在匹配的第一视角相机下渲染机器人前景,并合成回修复后的场景;
6.质量筛查:剔除前景残留、背景破损、姿态不合理、严重穿模或合成错误的样本。

除合成图像外,数据还保留机器人关节状态等结构化信息,用于检查构型和对应关系。
如何评测编辑结果
评测不仅考察图像的视觉质量,也需要检查人手是否被完整移除、目标机器人结构与身份是否一致,以及物体交互内容是否得到保留。
为此,HandEdit 设置了Hand-only与Hand-Arm两条评测轨道。在论文公开的测试设置中,每条轨道包含1000张图像,并分别对应13种目标构型。评价分为三个层面:
通用相似度:在整图、编辑区域和背景区域计算 PSNR、SSIM、LPIPS 与 FID;
视觉语言模型判断:分别评价语义一致性(SC)和感知质量(PQ);
具身任务指标:检查人手移除、结构一致性、机器人身份一致性和交互保持。
基准统一测试了 11 种具有代表性的开源与商用图像编辑方法,包括 GPT-Image、Nano Banana、FLUX、Seedream、Qwen-Image-Edit、HunyuanImage、FireRed-Image-Edit 和 OmniGen2 等系列。测试使用固定提示模板,并尽量遵循各模型原有的条件输入方式和默认推理设置。

△Hand-only 与 Hand-Arm 轨道的多维评测结果
论文报告的结果也呈现出三个值得关注的现象:
综合表现不能只看一项分数:GPT-Image-2 在通用相似度和具身任务指标上表现较为均衡;
VLM 高分不等于交互正确:GPT-Image-1.5 的 VLM 评价较高,但结构与交互指标并非最优;
画面自然不等于任务完成:FireRed-Image-Edit-1.1 的感知质量较高,但目标本体与交互保持仍可能失败。
这也是 HandEdit 同时保留通用、VLM 和具身任务三类指标的原因:对于机器人图像编辑,手指结构、机器人身份和物体接触关系都需要单独检查。
使用范围与边界
HandEdit 的参考结果由重定向、仿真渲染和图像合成流程生成,属于可控、可复现的伪 GT,并非完美或唯一的标准答案。为避免评测退化为单纯的像素对比,HandEdit 同时引入视觉语言模型判断和具身任务指标,使编辑结果在机器人本体正确性、交互一致性或视觉自然度更好时,可以获得高于伪 GT 的评价。
由因时机器人联合上海交通大学、复旦大学等开发的 HandEdit 数据集与评测基准已正式开源,面向全球研究者与开发者开放。
相关文章
- 华沿机器人与骅升科技达成战略合作,携手布局具身智能与协作机器人市场
- 元点机器人Bridge斩获IFA年度创新奖,全球首款AI原生人形机器人柏林首秀
- 当机器人开始做实验, AI for Science的效率拐点到了 | 对话源络科技连文昭
- 声网RTC支撑NBBOSS AI决策机器人,攻克轻量硬件交互难题
- 黑芝麻智能与遨博智能完成首批产品交付,国产算力赋能机器人规模化落地
- 行业首款60℃热雾巨无霸滚筒扫拖旗舰!iRobot Roomba 875发布,重新定义扫地机器人清洁力
- 跃伴智能如厕机器人首秀福祉展,聚焦失能人群如厕难题
- 智联丝路·绿动化工|量子智能特种场景具身智能机器人亮相,破解石化高危作业难题
- 首日销量突破600台!8888元的元点机器人Bridge正在赢得开发者
- 8888元高性能人形机器人,能用来做什么开发
- 2026世界机器人大会:机器人走向“能听、会说、懂互动”声网对话式 AI 提供实时技术底座
- 具身数采末端市占超80% 知行机器人在WRC提出具身智能新解法
- 机器人会打球、会 “炫技”,谁在记录它们的每个动作?丨青瞳视觉护航人形机器人运动会
- 国内首部《中国AI智能护理机器人行业发展白皮书》发布 俏妃牵头建立行业首个标准体系
- 上海智位机器人助力青少年AI教育实践:40名中学生走进蘑菇云创客空间探索人工智能
- 里斯张云 × 杰克阮积祥做客「赵何娟 Talk」:扎进具身机器人,走难而坚定之路
AI企业
更多>>AI硬件
更多>>- 联合开源!因时机器人携手上海交大、复旦发布HandEdit数据集与评测基准
- 华沿机器人与骅升科技达成战略合作,携手布局具身智能与协作机器人市场
- 元点机器人Bridge斩获IFA年度创新奖,全球首款AI原生人形机器人柏林首秀
- 华硕 ProArt 创梦 27 OLED:以 4K QD-OLED 与专业色彩表现,支持精细化创作
- 芯展速 Gen 6 Retimer 正式上市,副总裁李蓁 ODCC大会演讲官宣 获媒体热议
- 行业首款60℃热雾巨无霸滚筒扫拖旗舰!iRobot Roomba 875发布,重新定义扫地机器人清洁力
- 华硕主板助国产颗粒内存达成四槽满插6000C30与双条8000C36双重突破
- 首日销量突破600台!8888元的元点机器人Bridge正在赢得开发者
AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









