Towards Accurate End-Effector Localization for UMI-Style Robotic Manipulation Teaching
Robot demonstration learning requires accurate and temporally complete end-effector localization during close-range manipulation and camera occlusion.
ProofPaper ↗
Key points
- Existing SLAM benchmarks emphasize navigation motions, whereas manipulation datasets prioritize policy learning over localization evaluation.
- We introduce MILD, a Manipulation-Interface Localization Dataset with real-world and simulation sequences.
- The simulation subset, MILD-Sim, extends task coverage in Isaac Sim for controlled manipulation-replay studies.
- To support marker-augmented teaching workspaces without a pre-surveyed fiducial map, we present AprilVINS, which combines fisheye visual-inertial estimation with sequence-local AprilTag geometry and separates prior admission from guarded export of the jointly optimized state.
Sources (1)
- [1]Towards Accurate End-Effector Localization for UMI-Style Robotic Manipulation TeachingarXiv (AI, ML, NLP, CV, robotics, multi-agent) · Oct 7, 11:14 AM
Robot demonstration learning requires accurate and temporally complete end-effector localization during close-range manipulation and camera occlusion.
Existing SLAM benchmarks emphasize navigation motions, whereas manipulation datasets prioritize policy learning over localization evaluation.
Extractive summary: sentences quoted from the sources.