标签: 训练
YouDuck 上标记为「训练」的全部教程、笔记与策略复现。
- 齿隙建模,以及编码器在哪一侧
齿轮传动的空程。Microduck 建模为每个舵机 ±1°,关键在于编码器装在齿隙的输出侧。
- BAM 执行器模型
Rhoban 的舵机物理模型。把舵机当理想力矩源,是 sim2real 失败最常见的根因。
- 域随机化
训练时随机化物理参数,让策略对真实世界的参数分布鲁棒。它和加观测噪声是两回事。
- 61 维观测契约
所有策略共享同一份观测格式,这是运行时能在行走、恢复、特技之间热切换的前提。
- 策略热切换
运行时在行走、恢复、特技策略之间即时切换,不重启不停机。
- 投影重力:机器人怎么知道自己倒了
数据流上唯一的 IMU 量。站立时约为 [0, 0, -1],跌倒判定由它得出。
- sim2real 是什么,为什么它是最难的一步
sim2real 指把仿真里训练的策略迁移到真机。仿真里走得好、上机就摔,是这类项目最常见的失败。
- 训练与部署
从 MuJoCo 仿真训练到把策略跑上真机的完整链路,以及 sim2real 阶段真正会卡住的地方。
- 搭起训练环境,训出第一个策略
microduck_rl 的环境要求、四条核心命令,以及没有 GPU 时的替代方案。
- sim2real 配方
Microduck 从仿真走到真机所依赖的四件事:BAM 执行器物理、域随机化、齿隙建模、共享观测契约。
- 训练任务清单
microduck_rl 里全部可训练任务的 id、地形与用途,含 roller 系列与 Backlash 变体。
- BallKick — 踢球
把 70 mm、15 g 的球向前踢出。策略看不到球。
- GroundPick — 低头捡东西
下蹲并用嘴尖触地,然后回到站立。手柄 A 键触发的动作。
- RollerCrouch — 滑行中下蹲
在轮子上保持滑行的同时压低重心。
- RollerSlope — 斜坡滑降
在斜坡上滑降并保持可控。
- RollerStandUp — 从地面站上轮子
摔倒之后从地面重新站到轮子上。
- Rollers — 轮滑速度跟踪
脚下装被动轮之后的基础滑行策略。roller 模式的主任务。
- Roulade — 前滚翻
向前翻越头部滚一圈,落回双脚。手柄 X 键,按住可连续。
- SitStand — 坐下与站起
指令控制的坐↔站切换,动作柔和,过程中头部仍可控。
- Spin — 原地旋转
在轮子上原地快速旋转。
- StandUp — 从地面站起
从面朝下、面朝上或坐姿站起,然后保持站立并接受体位指令。
- Swizzle — 葫芦步
经典的对称蹬冰动作,两脚同时外八再内收。
- Velocity — 速度指令行走
主任务:按速度指令行走并同时接受头部姿态指令。第一个该训的就是它。
- VelStand — 行走加跌倒恢复
把行走和跌倒恢复训练进同一个策略,省掉运行时的切换。
- 背景:Hugging Face 2025 年收购 Pollen Robotics 意味着什么
Microduck 出自被 Hugging Face 收购的 Pollen Robotics。这条所有权关系解释了它为什么把策略做成可分享的 ONNX 文件。
- BAM — 舵机执行器物理模型
Rhoban 团队的执行器辨识框架,Microduck 用它的 M6 模型建模 Dynamixel XL330。
- microduck_rl — 强化学习训练环境
Microduck 全部动作策略的训练代码:MuJoCo Warp + PPO,含域随机化、BAM 执行器模型与齿隙仿真。
- Microduck Simulator — 浏览器里的在线仿真
Hugging Face Space 上的 Microduck Sandbox,没有硬件也能试。
- mjlab — microduck_rl 的底层训练框架
基于 MuJoCo Warp 的 GPU 并行强化学习框架,Microduck 的训练建立在它之上。