待补充
hongsukchoi/VideoMimic
机器人
3/5
🧩 软硬件结合
已发布
项目简介
Visual Imitation Enables Contextual Humanoid Control. CoRL 2025, Best Student Paper Award.
VideoMimic 是一个面向人形机器人的视觉模仿学习框架,荣获 CoRL 2025 最佳学生论文奖。其核心目标是让机器人仅通过观看单目摄像头拍摄的人类视频,就能学会在复杂真实环境中执行上下文相关的动作。项目由加州大学伯克利分校团队主导,完整覆盖了从真实世界到仿真、再到真实机器人部署的全流程。
标签
项目特点
**单目视频驱动**:仅需普通摄像头拍摄的人类视频,无需动捕设备或深度传感器。
**端到端模仿学习**:从视频直接映射到机器人动作,跳过手工设计状态表示。
**真实-仿真-真实闭环**:提供从真实数据采集、仿真训练到真机部署的完整工具链。
**上下文感知**:机器人能理解视频中的场景和物体,执行与环境匹配的动作。
**获奖认可**:获得 CoRL 2025 最佳学生论文奖,学术价值得到验证。
**开源可复现**:代码、数据集和训练脚本全部开源,方便研究者复现和改进。
技术规格
| 框架类型 | 视觉模仿学习(Visual Imitation Learning) |
|---|---|
| 输入格式 | 单目 RGB 视频(MP4/AVI) |
| 机器人平台 | 人形机器人(支持 Unitree H1 等) |
| 训练框架 | PyTorch |
| 仿真环境 | Isaac Gym / MuJoCo |
| 推理硬件 | NVIDIA GPU(推荐 RTX 3090 或更高) |
| 视频采样率 | 30 FPS |
| 动作空间 | 关节角度 + 末端执行器位姿 |
| 策略输出频率 | 50 Hz |
| 数据集格式 | HDF5(含 RGB 图像、关节状态、动作标签) |
项目资源
搜索资源
物料清单 (BOM)
| 物料名称 | 数量 | 参考价格 | 备注 |
|---|---|---|---|
| Unitree H1 人形机器人 | 1 | — | 也可适配其他双足人形机器人 |
| NVIDIA GPU 工作站(RTX 4090) | 1 | — | 训练和推理用 |
| 单目 RGB 摄像头(如 Intel RealSense D435) | 1 | — | 用于采集人类演示视频 |
| 关节编码器 | 按机器人配置 | — | 用于状态反馈 |
| 千兆以太网交换机 | 1 | — | 连接机器人和工作站 |
| Isaac Gym | 1 | — | 用于策略训练 |
| PyTorch 2.0+ | 1 | — | 深度学习框架 |
| OpenCV | 1 | — | 视频处理 |
| ROS 2 Humble | 1 | — | 机器人中间件 |
3D 模型
能力画像
**记忆与知识检索**:3/5 — 项目提供预训练模型和数据集,但需要用户自行管理训练日志和实验记录。
**动手与操作**:4/5 — 需要实际搭建机器人硬件、连接传感器和调试部署环境,动手要求较高。
**编程与算法**:5/5 — 核心是深度学习算法,需要掌握 PyTorch、策略网络设计、模仿学习等编程技能。
**设计与建模**:3/5 — 涉及动作空间设计和奖励函数调优,但模型架构已由论文提供。
**实验与调试**:4/5 — 需要反复进行仿真训练、真实环境测试和参数调优,调试工作量大。
**协作与分享**:3/5 — 开源社区活跃,可通过 GitHub Issues 和 PR 协作,但文档以英文为主。
**学习与研究**:5/5 — 前沿研究项目,适合深入理解视觉模仿学习和人形机器人控制。
**系统集成**:4/5 — 需要将视频采集、仿真训练、真机部署等多个模块整合成完整流水线。
项目图库
所需技能
Python 编程(熟练使用 PyTorch)
机器人学基础(运动学、动力学、控制)
计算机视觉基础(图像处理、特征提取)
深度学习(模仿学习、强化学习)
ROS 2 使用经验
Linux 系统操作(Ubuntu 22.04)
硬件调试能力(传感器、电机、通信)
英文文献阅读能力(论文、文档)
适用场景
人形机器人技能学习研究(如抓取、搬运、开门)
家庭服务机器人开发(模仿人类做家务)
工业人形机器人操作任务(装配、分拣)
机器人仿真到真机迁移(Sim-to-Real)研究
机器人学课程教学项目(研究生级别)
开源机器人社区竞赛与演示(如 RoboCup)