15 Institutions Release TouchScale: 500-Hour Human Visual-Tactile Dataset Boosts Robot Task Success
Researchers from 15 institutions, including Texas A&M, Google DeepMind, CMU, Stanford, and Meta, released TouchScale, a 500-hour human visual-tactile dataset collected with a unified wearable system. Using this data for mid-training, robot success on four real-world contact tasks rose from 22.5% to 57.5%, and scaling benefits were observed as data volume increased.
Coverage timeline
机器之心机器之心
拿起一枚生鸡蛋,手指需要施加恰到好处的力:既要防止滑落,又不能捏碎。拧一条湿毛巾,指尖的力道也要随着水分挤出不断调整。对人类而言,这些操作几乎出于本能。但如果只依赖视觉,摄像头拍得下手部轨迹,却捕捉不到手指接触的位置与按压的力度。 过去几年,在学术界,第一视角人类视频已经快速扩展到数万小时,越来越多工作也开始看到数据规模增长带来的收益。视觉 — 触觉数据却远没有达到这样的规模:此前公开的人类视触觉数据集大多只有几小时到几十小时。若简单将多个小数据集合并,各家的触觉传感器、采集流程和数据格式又不相同。数据量虽然上去了,硬件和流程也跟着变化,“更多数据” 究竟贡献了多少反而难以单独判断。 近日,来自德州农工大学(Texas A&M)、Google DeepMind、卡内基梅隆大学(CMU)、斯坦福大学、加州大学伯克利分校、耶鲁大学、微软、英伟达(NVIDIA)、利物浦大学、Meta、华盛顿大学、西北大学、索尼、佐治亚理工学院(Georgia Tech)以及 Overfit Lab (数据供应商) 等 15 家机构的研究者发布了 TouchScale :一个在统一传感器、统一采集与同步流程下构建的 500 小时人类视觉 - 触觉数据集 。 团队希望借此回答一个关键问题:如果不再拼接不同来源的数据,而是在 同一套传感与采集体系下 ,把 高质量 的第一视角视觉 — 触觉数据真正扩展到数百小时,它是否也会像大规模视频一样,显现出随数据规模增长而来的 Scaling 收益 ?这些 Scaling 收益,又有多少能够进一步转化为机器人的操作能力? TouchScale 带来了什么? 1. 500 小时统一穿戴设备采集 。TouchScale 包含 500 小时人类双手视觉-触觉同步数据,全部由同一套穿戴式系统采集,同步记录头部 RGB-D、双腕 RGB 和双手全手触觉信号。 2. 人类「手感」能迁移到机器人 。无需人类动作标签,也不把人手动作映射到机器人,只用人类视触觉数据做 mid-training,机器人 4 个真机接触任务的平均成功率从 22.5% 升到 57.5%。 3. 数百小时的人类视觉-触觉数据开始显现明显的 Scaling 收益 。TouchScale 用于 mid-training 时,真机操作随着数据规模扩大整体变强;在独立的零样本触觉预测实验中,也观察到了同样
