📖 术语表
机器人强化学习运动控制领域的核心术语 · 中文一句话定义 · 教学页自动注解
202 个术语 · 6 个类别 · 字母导航 / 分类筛选 / 即时搜索
自动注解本站教学页已开启术语自动注解:页面中首次出现的每个术语会带 虚线下划线,鼠标悬停即显示一句话定义。
分类
RL 基础与算法41
- Actor-Critic Actor-Critic · 演员-评论家 RL 基础与算法
- 同时学习演员(策略)与评论家(价值)的 RL 框架,兼顾稳定与样本效率。
- Bellman 方程 Bellman 方程 · Bellman equation · 贝尔曼方程 RL 基础与算法
- 描述价值函数自洽性的递归方程:当前价值=即时奖励+下一状态折扣价值。
- DDPG (Deep Deterministic Policy Gradient) DDPG RL 基础与算法
- 把 DQN 思路搬到连续动作的 off-policy 确定性策略算法。
- PPO proximal policy optimization RL 基础与算法
- Proximal Policy Optimization,机器人 RL 最常用策略优化算法(clip 目标函数,大规模并行友好)。
- PPO (Proximal Policy Optimization) PPO · 近端策略优化 RL 基础与算法
- 用 clip 控制策略更新幅度的 on-policy 算法,工程上最常用的 RL 方法。
- Q-learning Q-learning RL 基础与算法
- 经典 off-policy 时序差分算法,直接学习最优动作价值函数。
- RL reinforcement learning · 强化学习 RL 基础与算法
- Reinforcement Learning,强化学习——智能体通过试错(reward 信号)学习最优策略。
- SAC soft actor-critic RL 基础与算法
- Soft Actor-Critic,最大熵 off-policy RL 算法,真机 manipulation 首选(样本效率高)。
- SAC (Soft Actor-Critic) SAC · Soft Actor-Critic · 软演员-评论家 RL 基础与算法
- 带最大熵正则的 off-policy 算法,随机策略、样本效率高、连续控制常用。
- TD3 (Twin Delayed DDPG) TD3 RL 基础与算法
- DDPG 的改进版,双 Q 取最小、策略延迟更新以抑制过估。
- TRPO (Trust Region Policy Optimization) TRPO RL 基础与算法
- 带 KL 信任域约束的策略优化算法,是 PPO 的理论前作。
- off-policy off-policy · 异策略 RL 基础与算法
- 可使用旧策略或异源样本更新当前策略的算法类别(如 SAC/TD3/Q-learning)。
- on-policy on-policy · 同策略 RL 基础与算法
- 采样分布必须与当前策略一致的算法类别(如 PPO/TRPO)。
- reward hacking reward hacking · 奖励黑客 · spec gaming RL 基础与算法
- 策略找到奖励函数漏洞、刷分却不完成真实任务的现象,是 RL 设计的核心风险。
- 价值函数 (value function) 价值函数 · value function · V 函数 RL 基础与算法
- 某状态(或状态-动作对)下未来累积奖励的期望,用来评估好坏。
- 优势函数 (advantage) 优势 · advantage · advantage function · 优势函数 RL 基础与算法
- 衡量某动作相对平均好坏的量 A(s,a)=Q(s,a)−V(s),是策略梯度方差降低的关键。
- 值迭代 (value iteration) 值迭代 · value iteration RL 基础与算法
- 反复用 Bellman 最优方程更新价值函数直到收敛的动态规划算法,是 model-based RL 的祖型。
- 内在奖励 (intrinsic reward) 内在奖励 · intrinsic reward · intrinsic motivation RL 基础与算法
- 由策略自身生成的探索性奖励(如好奇心、信息增益),鼓励访问新状态以治稀疏奖励。
- 动作价值函数 (Q-function) Q 函数 · Q-function · Q 值 RL 基础与算法
- 在状态 s 下采取动作 a 后预期的累积奖励,记作 Q(s,a)。
- 势函数 reward shaping (potential-based) potential-based reward shaping · 势函数 shaping · potential-based shaping RL 基础与算法
- 用状态势函数差定义的 shaping 项,理论上不改变最优策略、只加速收敛。
- 回报 (return) return · 回报 · 累积奖励 RL 基础与算法
- 一条轨迹上奖励(通常带折扣)的累积和,RL 要最大化的目标。
- 奖励 shaping (reward shaping) reward shaping · 奖励 shaping · 奖励塑形 RL 基础与算法
- 在稀疏原始奖励上加辅助项以加速学习、引导探索的技术。
- 奖励函数 (reward function) 奖励函数 · reward function RL 基础与算法
- 对智能体每步行为好坏的标量反馈,RL 优化的源头信号。
- 广义优势估计 (GAE) GAE · Generalized Advantage Estimation · 广义优势估计 RL 基础与算法
- 用 λ 在偏差与方差间折中的 advantage 估计方法,PPO 标配。
- 强化学习 (Reinforcement Learning, RL) 强化学习 · Reinforcement Learning · RL RL 基础与算法
- 通过与环境交互、试错获取奖励信号来学习决策策略的机器学习范式。
- 折扣因子 (discount factor γ) 折扣因子 · discount factor RL 基础与算法
- 衡量未来奖励相对即时奖励权重的系数 γ∈[0,1],越小越短视。
- 探索-利用权衡 (exploration vs. exploitation) exploration-exploitation · 探索-利用 · 探索与利用 RL 基础与算法
- 在尝试新行为与利用已知好行为之间的取舍,RL 的核心难题。
- 时序差分 (Temporal-Difference, TD) 时序差分 · TD learning · Temporal Difference RL 基础与算法
- 用「即时奖励 + 下一状态自举估值」更新价值的自助式学习方法。
- 最大熵 RL (maximum entropy RL) 最大熵 RL · maximum entropy RL · 最大熵强化学习 · MaxEnt RL RL 基础与算法
- 在期望回报上加策略熵奖励的 RL 框架,兼顾探索与鲁棒性,是 SAC 的理论基础。
- 样本效率 (sample efficiency) 样本效率 · sample efficiency · 样本利用率 RL 基础与算法
- 用更少环境交互达到同样性能的能力,真机训练与昂贵仿真的核心指标。
- 滑动时域 (receding horizon) receding horizon · 滑动时域 · 滚动时域 · receding horizon control RL 基础与算法
- 每步重新求解未来有限步最优、只执行第一步的控制思想,MPC 的核心机制。
- 目标网络 (target network) 目标网络 · target network RL 基础与算法
- 周期性慢更新的复制网络,用来稳定 TD 学习的训练目标。
- 稀疏奖励 (sparse reward) sparse reward · 稀疏奖励 RL 基础与算法
- 只在轨迹终点或极少状态给非零奖励的设置,RL 收敛困难、需 shaping 或 curi。
- 策略 (policy) policy · 策略网络 · 策略 RL 基础与算法
- 从状态到动作(或动作分布)的映射,是 RL 中要学习的对象。
- 策略梯度 (policy gradient) 策略梯度 · policy gradient RL 基础与算法
- 直接对策略参数沿期望回报梯度方向更新的方法族。
- 策略熵 (policy entropy) 策略熵 · policy entropy · entropy · 熵 RL 基础与算法
- 策略输出动作分布的不确定度,最大熵 RL 用它作探索奖励,避免策略过早坍缩。
- 策略迭代 (policy iteration) 策略迭代 · policy iteration RL 基础与算法
- 交替评估当前策略与贪心改进策略直到收敛的动态规划算法。
- 经验回放 (experience replay) 经验回放 · experience replay · replay buffer · 回放缓冲 RL 基础与算法
- 把交互数据存进缓冲区反复采样训练,提高 off-policy 数据利用率。
- 部分可观测 MDP (POMDP) POMDP · 部分可观测 MDP RL 基础与算法
- 状态不能直接观测、只能通过观测函数推断的 MDP,更贴近真实感知。
- 重参数化 (reparameterization) 重参数化 · reparameterization · reparameterization trick · 重参数化技巧 RL 基础与算法
- 把随机性从分布参数外移成独立噪声变量的技巧,让随机策略可微、SAC 由此端到端训练。
- 马尔可夫决策过程 (MDP) MDP · 马尔可夫决策过程 RL 基础与算法
- 由状态、动作、转移概率、奖励定义的序贯决策数学框架,是 RL 的形式化基础。
模仿学习与动作生成21
- ACT (Action Chunking Transformer) ACT · Action Chunking Transformer · 动作分块 Transformer 模仿学习与动作生成
- 把动作分段并行预测的 Transformer 策略,ALOHA 用的方法。
- AMP adversarial motion priors 模仿学习与动作生成
- Adversarial Motion Priors,用判别器把动捕数据凝练成风格奖励,连接动捕与 RL 的桥梁。
- BC (行为克隆) behavioral cloning · 行为克隆 模仿学习与动作生成
- Behavioral Cloning,最简单的模仿学习——直接回归专家动作(监督学习)。
- Chunking 模仿学习与动作生成
- 策略一次预测一段连续动作(而非每步一个动作),减少协变量偏移、提高一致性。
- DAgger dataset aggregation 模仿学习与动作生成
- Dataset Aggregation,在线修正 BC 的协变量偏移——策略出错时向专家求助。
- DAgger (Dataset Aggregation) DAgger · Dataset Aggregation · 数据集聚合 模仿学习与动作生成
- 滚动收集「策略访问到的状态」上的专家标签、治 covariate shift 的 IL 算法。
- GAIL generative adversarial imitation learning 模仿学习与动作生成
- Generative Adversarial Imitation Learning,用对抗训练从专家演示学策略+reward。
- GAIL (Generative Adversarial Imitation Learning) GAIL · 生成对抗模仿学习 模仿学习与动作生成
- 用判别器对抗地从专家演示学 reward 的 IL 方法,是 AMP 等对抗式先验的母体。
- IL (模仿学习) imitation learning · 模仿学习 模仿学习与动作生成
- Imitation Learning,从专家演示中学习策略(而非试错)。BC/DAgger/GAIL 是三大流派。
- consistency model consistency model · 一致性模型 模仿学习与动作生成
- 一步去噪的扩散蒸馏模型,用于把慢的 diffusion policy 加速到实时。
- covariate shift covariate shift · 协变量漂移 模仿学习与动作生成
- 训练分布偏离部署分布导致 BC 在长轨迹上失效的统计现象。
- diffusion policy diffusion policy · 扩散策略 模仿学习与动作生成
- 把动作生成看作去噪扩散过程的策略,能自然表达多模态动作分布。
- flow matching flow matching · 流匹配 模仿学习与动作生成
- 用连续归一化流匹配动作分布的策略训练目标,π0 等采用,比扩散更省算。
- 信念状态 (belief state) 信念状态 · belief state · belief · 信念 模仿学习与动作生成
- 在部分可观测环境下,基于历史观测对真实状态的概率推断,POMDP 决策的依据。
- 动作分块 (action chunking) action chunking · 动作分块 模仿学习与动作生成
- 一次预测未来若干步动作而非单步,降低误差累计、加速推理。
- 复合误差 (compounding error) compounding error · 复合误差 模仿学习与动作生成
- 小的步级误差在长轨迹上指数放大,是 BC 失败的主要来源。
- 多模态动作分布 多模态动作分布 · multimodal action distribution 模仿学习与动作生成
- 同一状态可有多种合理动作的分布,单一高斯策略表达不了,需扩散/流/分块等。
- 模仿学习 (Imitation Learning, IL) 模仿学习 · Imitation Learning · IL 模仿学习与动作生成
- 从专家演示学策略、不依赖手工奖励的学习范式。
- 蒸馏 (distillation) 蒸馏 · distillation · 知识蒸馏 · policy distillation 模仿学习与动作生成
- 用大模型或慢模型(teacher)的输出训练小模型或快模型(student)的技术。
- 行为克隆 (Behavioral Cloning, BC) 行为克隆 · Behavioral Cloning · BC 模仿学习与动作生成
- 监督学习式地把状态映射到专家动作的模仿学习方法,最简单的 IL。
- 逆强化学习 (Inverse RL, IRL) 逆强化学习 · Inverse Reinforcement Learning · IRL 模仿学习与动作生成
- 从专家演示反推奖励函数、再用该奖励做 RL 的两阶段方法。
Sim2Real 与训练31
- ADR (Automatic Domain Randomization) ADR · Automatic Domain Randomization · 自动域随机化 Sim2Real 与训练
- 自动逐步扩大域随机化分布范围的方法,OpenAI Hand 等用。
- ALOHA ALOHA 系统 Sim2Real 与训练
- 一种低成本双臂遥操作硬件系统(Active Learning of Robotic Manipulation),由 Stanford 提出,是 teleop 数据采集的民主化基础设施。
- GPU 并行仿真 (GPU parallel sim) GPU 并行仿真 · GPU parallel simulation · GPU parallel sim · GPU 并行 Sim2Real 与训练
- 在单 GPU 上同时跑成千上万个仿真环境的并行能力,Isaac Gym/Lab 借此大幅加速 RL 数据采集。
- Isaac Sim / Isaac Lab Isaac Sim · Isaac Lab · IsaacGym Sim2Real 与训练
- NVIDIA 基于 Omniverse 的 GPU 并行机器人仿真器,支持数万环境并行训练。
- MuJoCo MuJoCo Sim2Real 与训练
- 快速、接触精确的物理仿真器,DeepMind 维护,是 locomotion RL 的事实标准。
- RMA (Rapid Motor Adaptation) RMA · Rapid Motor Adaptation Sim2Real 与训练
- 在线两阶段适应环境隐藏参数的 sim2real 方法,把适应模块放进策略。
- RSI (Random Network Initialization) RSI · Random Network Initialization Sim2Real 与训练
- 用随机初始化的隐藏网络作为系统参数编码器,提升 sim2real 鲁棒性。
- Sim-to-Real sim2real · 仿真到现实 Sim2Real 与训练
- 把仿真中训练的策略迁移到真机器人,机器人 RL 的核心工程挑战。
- Teacher-Student teacher-student · Teacher-Student · 师生蒸馏 Sim2Real 与训练
- 仿真里用特权信息训 teacher,再蒸馏给不依赖特权的 student 部署用。
- actuator shaping / 执行器建模 actuator shaping · 执行器建模 · actuator model Sim2Real 与训练
- 把电机/液压的非线性响应曲线建进仿真,让仿真动作贴合真机。
- sim-to-real gap sim-to-real gap · 仿真-真实差距 · reality gap Sim2Real 与训练
- 仿真与真机在动力学、传感、视觉上的偏差总和,是迁移失败的根源。
- sim2real sim2real · sim-to-real · 仿真到真机 Sim2Real 与训练
- 把仿真训出来的策略迁移到真机的整套技术,是机器人 RL 的关键瓶颈。
- 仿真器 (simulator) 仿真器 · simulator · 物理仿真 Sim2Real 与训练
- 模拟刚体动力学与传感的物理引擎,机器人 RL 常用 MuJoCo / Isaac Sim / Genesis。
- 分布漂移 (distribution shift) 分布漂移 · distribution shift · 分布偏移 Sim2Real 与训练
- 训练数据分布与部署或测试数据分布不一致的统计现象,是泛化失败与 covariate shift 的共同根源。
- 可变形体 (deformable object) 可变形体 · deformable · deformable object · 柔体 Sim2Real 与训练
- 形状会随受力改变的物体(布料、绳、软体),其仿真与操作比刚体难得多。
- 可微仿真 (differentiable simulation) 可微仿真 · differentiable simulation Sim2Real 与训练
- 可对参数反传梯度的仿真器,用于系统辨识与策略优化。
- 地形 (terrain) 地形 · terrain Sim2Real 与训练
- 机器人行走的地面几何与材质(楼梯、碎石、泥地等),locomotion 泛化的关键变量。
- 域适应 (domain adaptation) domain adaptation · 域适应 Sim2Real 与训练
- 把源域(仿真)学到的东西迁到目标域(真机)的方法族。
- 域间差距 (domain gap) 域间差距 · domain gap · domain discrepancy Sim2Real 与训练
- 源域(仿真)与目标域(真机)在物理、传感、视觉上的差异总和,是 sim2real 失败的根源。
- 域随机化 (Domain Randomization, DR) domain randomization · 域随机化 · DR Sim2Real 与训练
- 在仿真里随机化物理/视觉参数以让策略对真机偏差鲁棒的方法。
- 域随机化范围 (DR range) DR range · randomization range Sim2Real 与训练
- 域随机化中每个物理/视觉参数采样的区间,过宽学不会、过窄不鲁棒。
- 异步训练 (asynchronous training) asynchronous training · 异步训练 Sim2Real 与训练
- 多个 worker 异步采集数据并更新共享参数的训练方式,A3C/A2C 等。
- 恢复系数 (restitution) 恢复系数 · restitution · coefficient of restitution Sim2Real 与训练
- 碰撞后两物体分离速度与接近速度之比,0 完全非弹性、1 完全弹性,仿真器调接触用。
- 接触 (contact) 接触 · contact · contact dynamics Sim2Real 与训练
- 两个物体表面发生力学交互的状态,locomotion 落地、操作抓取都靠接触传力。
- 摩擦 (friction) 摩擦 · friction · 摩擦力 Sim2Real 与训练
- 两接触面切向相对运动或趋势的阻力,其建模精度直接决定足式与抓取仿真可信度。
- 物理引擎 (physics engine) 物理引擎 · physics engine Sim2Real 与训练
- 数值求解刚体/柔体动力学、产生接触与碰撞的仿真器内核,MuJoCo/Isaac/Genesis 都属此类。
- 碰撞 (collision) 碰撞 · collision · collision detection Sim2Real 与训练
- 两物体几何重叠或冲击的事件,仿真器需做碰撞检测并按接触模型响应。
- 系统辨识 (System Identification, SysID) 系统辨识 · system identification · SysID Sim2Real 与训练
- 从真机数据估仿真物理参数(摩擦、惯量等)以缩小 sim-to-real gap。
- 观测归一化 (observation normalization) observation normalization · 归一化 · RunningMeanStd · input normalization Sim2Real 与训练
- 用 RunningMeanStd 把观测/动作缩放到稳定区间,是 RL 训练的标配。
- 课程 (curriculum) curriculum Sim2Real 与训练
- 把训练任务按难度从易到难逐步推进的安排。
- 课程学习 (curriculum learning) curriculum learning · 课程学习 Sim2Real 与训练
- 把训练任务由易到难逐步推进,让策略在更难的设置下也能学会。
VLA 与基础模型19
- AMP (Adversarial Motion Prior) AMP · Adversarial Motion Prior · Adversarial Motion Primitive VLA 与基础模型
- 用判别器从参考动作学 reward 的对抗式风格化方法,locomotion 自然度主流方案。
- BERT VLA 与基础模型
- Bidirectional Encoder Representations from Transformers,Google 的双向语言预训练模型,NLP 预训练范式奠基。
- BFM (Behavior Foundation Model) BFM · Behavior Foundation Model · 行为基础模型 VLA 与基础模型
- 大规模预训练、可下游适配的机器人行为基座模型(如 SONIC)。
- CLIP Contrastive Language-Image Pre-training VLA 与基础模型
- Contrastive Language-Image Pre-training,OpenAI 的视觉-语言对比学习模型,VLA 的视觉编码器基础。
- FM (基础模型) foundation model · 基础模型 VLA 与基础模型
- Foundation Model,在大规模数据上预训练、可适配多种下游任务的通用模型。
- GPT generative pre-trained transformer VLA 与基础模型
- Generative Pre-trained Transformer,OpenAI 的生成式语言模型系列,VLA 骨干网络的重要参考。
- LLM (大语言模型) LLM · 大语言模型 · large language model VLA 与基础模型
- Large Language Model,大规模预训练语言模型(GPT/Llama 等),是 VLA 的语义推理骨干。
- LQR (Linear Quadratic Regulator) LQR · Linear Quadratic Regulator · 线性二次型调节器 VLA 与基础模型
- 在线性系统+二次代价下的最优控制方法,有闭式解、WBC 求解器常用。
- MPC (Model Predictive Control) MPC · Model Predictive Control · 模型预测控制 VLA 与基础模型
- 在线滚动求解有限时域最优控制的方法,能处理约束但实时性挑战大。
- MoCo VLA 与基础模型
- Momentum Contrast,一种对比学习框架,视觉表征预训练的早期代表。
- RLHF (Reinforcement Learning from Human Feedback) RLHF VLA 与基础模型
- 用人类偏好数据训奖励模型、再用 RL 对齐 LLM/VLA 的训练范式。
- VLA vision-language-action VLA 与基础模型
- Vision-Language-Action Model,视觉-语言-动作模型——用大模型直接当控制策略(RT-1→π0.7)。
- VLA (Vision-Language-Action) VLA · Vision-Language-Action · 视觉-语言-动作模型 VLA 与基础模型
- 把图像+语言指令映射到机器人动作的多模态基础模型,是机器人基础模型主流路线。
- WBC (Whole-Body Control) WBC · Whole-Body Control · 全身控制 VLA 与基础模型
- 把全身关节任务(站立、平衡、上肢)化成 QP 在线求解的控制方法。
- World Model / 世界模型 world model · World Model · 世界模型 VLA 与基础模型
- 学习环境动态、可在内部预测下一帧/下一状态的模型,可当内部仿真器用。
- 动作先验 (motion prior) motion prior · 动作先验 · Motion Prior VLA 与基础模型
- 把先验动作分布作为策略正则或采样源,让学出来的动作更像人或更自然。
- 基础模型 (foundation model) foundation model · 基础模型 VLA 与基础模型
- 大规模预训练、可在多任务上零样本或少样本适配的通用模型。
- 通用策略 (generalist policy) generalist policy · 通用策略 VLA 与基础模型
- 一个策略跨任务/跨场景/跨形态地泛化,是 VLA 时代的核心目标。
- 遥操作 (teleoperation) teleop · teleoperation · 遥操作 VLA 与基础模型
- 人远程实时操控机器人采集示教数据或执行任务的方式,是 VLA 数据来源。
控制与机器人学42
- DoF (自由度) degrees of freedom · 自由度 控制与机器人学
- Degrees of Freedom,机器人的运动自由度数。人形 ~30-40 DoF,灵巧手 ~16-24 DoF。
- IMU (惯性测量单元) IMU · 惯性测量单元 · Inertial Measurement Unit 控制与机器人学
- 集成加速度计与陀螺仪、测量本体线加速度与角速度的传感器,locomotion 平衡与状态估计核心。
- LQR linear quadratic regulator 控制与机器人学
- Linear Quadratic Regulator,线性系统+二次代价的最优控制解析解。
- LiDAR (激光雷达) LiDAR · 激光雷达 · lidar 控制与机器人学
- 用激光测距生成周围三维点云的传感器,室外机器人导航与建图的核心感知器件。
- MPC model predictive control 控制与机器人学
- Model Predictive Control,基于模型的有限时域优化控制——在每个时刻求解一个最优化问题。
- PD 控制 (PD control) PD control · PD 控制 · PD controller · 比例-微分控制 控制与机器人学
- 用误差比例+误差变化率算力矩的经典反馈控制,机器人关节最常用的底层控制。
- PID 控制 PID · PID control · PID 控制 控制与机器人学
- 在 PD 上加积分项消除稳态误差的反馈控制,工业界最常用的控制器。
- RGB 控制与机器人学
- Red-Green-Blue 色彩空间,机器人最常用的视觉输入格式(彩色图像)。
- RGB-D 相机 RGB-D · RGB-D 相机 · 深度相机 · depth camera 控制与机器人学
- 同时输出彩色图像与每像素深度信息的相机,结构光或 ToF 原理,操作与避障常用。
- SLAM (同步定位与建图) SLAM · 同步定位与建图 · Simultaneous Localization and Mapping 控制与机器人学
- 机器人在未知环境中边构建地图边估计自身位姿的技术,自主导航的基础。
- SMPL SMPL-X · skinned multi-person linear 控制与机器人学
- Skinned Multi-Person Linear model,参数化人体模型(形状+姿态参数→网格),人形动作生成/追踪的标准表示。
- VR (虚拟现实) VR · 虚拟现实 控制与机器人学
- Virtual Reality,人形 teleop 的常见输入设备(如 Apple Vision Pro),提供头部/手部位姿。
- WBC (全身控制) whole-body control · 全身控制 控制与机器人学
- Whole-Body Control,协调人形机器人所有关节实现平衡+操作+步态的控制框架。
- locomotion / 运动 locomotion · 运动控制 · 移动控制 控制与机器人学
- 机器人本体在环境中移动的能力,含行走、奔跑、跳跃、爬行等。
- 关节空间 (joint space) joint space · 关节空间 控制与机器人学
- 以各关节角度/速度描述的运动空间,与机器人本体直接对应。
- 力/力矩传感器 (F/T sensor) 力/力矩传感器 · F/T sensor · force-torque sensor · 力矩传感器 · 六维力传感器 控制与机器人学
- 测量末端六维接触力与力矩的传感器,装配与接触操作中实现力闭环。
- 力矩 (torque) 力矩 · torque · 关节力矩 · joint torque 控制与机器人学
- 使物体绕轴转动的转动效应,单位 N·m,机器人关节电机输出的核心物理量。
- 动作捕捉 (MoCap) MoCap · 动作捕捉 · motion capture 控制与机器人学
- 用光学/惯性标记实时追踪人或物体位姿的系统,是机器人示教数据与运动评测的金标准。
- 动力学 (dynamics) 动力学 · dynamics 控制与机器人学
- 研究力与运动关系的学科,机器人动力学方程是 computed-torque 与模型预测控制的基础。
- 外感知 (exteroception) 外感知 · exteroception · 外部感知 控制与机器人学
- 机器人对外部环境的感知(视觉、激光、触觉等),与本体感知互补,构成完整观测。
- 夹爪 (gripper) 夹爪 · gripper · 机械爪 控制与机器人学
- 安装在机械臂末端、用于夹持物体的装置,含平行夹爪、真空吸盘、柔顺爪等类型。
- 完整约束 (holonomic constraint) holonomic · 完整约束 · holonomic constraint · 非完整约束 · nonholonomic 控制与机器人学
- 只含位形、不含速度的约束,完整系统位形空间维数等于自由度,汽车等非完整系统则相反。
- 工作空间 (workspace) 工作空间 · workspace · 工作空间范围 控制与机器人学
- 机器人末端执行器所能到达的所有位姿构成的集合,由几何结构与关节极限决定。
- 惯量 (moment of inertia) 惯量 · moment of inertia · 转动惯量 · inertia 控制与机器人学
- 描述物体绕轴转动惯性的物理量,与质量一起决定关节加速所需力矩。
- 执行器 (actuator) actuator · 执行器 · 驱动器 控制与机器人学
- 把控制信号变成机械运动的硬件,电机/液压/气压都算。
- 抓取 (grasping) grasping · 抓取 控制与机器人学
- 让机器人末端稳定地握住物体的动作与规划问题,是操作的基础。
- 操作 (manipulation) manipulation · 操作 · manipulate 控制与机器人学
- 机器人改变物体位姿、形状或状态的交互任务总称,含抓、放、装配等。
- 本体感觉 (proprioception) proprioception · 本体感觉 · 本体感知 控制与机器人学
- 机器人对自身关节角度、速度、力矩的内部感知,是闭环控制的基础。
- 柔顺性 (compliance) 柔顺性 · compliance · 柔顺控制 · compliant 控制与机器人学
- 机器人对外力的让步程度,高柔顺利于接触操作、低柔顺利于精定位。
- 正运动学 (forward kinematics, FK) FK · 正运动学 · forward kinematics 控制与机器人学
- 由各关节角度正解末端位姿的过程,是逆运动学、运动规划的下游基础。
- 灵巧手 (dexterous hand) dexterous hand · 灵巧手 控制与机器人学
- 多指、高自由度、能做精细操作的机械手,是机器人操作的前沿硬件。
- 笛卡尔空间 (Cartesian space) Cartesian space · 笛卡尔空间 · task space · 任务空间 控制与机器人学
- 以末端执行器位姿(位置+姿态)描述的任务空间,更贴近任务需求。
- 编码器 (encoder) 编码器 · encoder 控制与机器人学
- 硬件上指测关节角度/速度的传感器;神经网络上指把高维输入压成低维特征的模块(如 VAE encoder)。
- 自由度 (DoF) DoF · Degree of Freedom · 自由度 控制与机器人学
- 描述机器人可独立运动的维数,人形机器人通常 20–40+ DoF。
- 视觉伺服 (visual servoing) visual servoing · 视觉伺服 控制与机器人学
- 用图像反馈闭环控制机器人运动的控制方法。
- 触觉传感 (tactile sensing) 触觉传感 · tactile sensing · 触觉 · tactile · 触觉传感器 控制与机器人学
- 通过皮肤状传感器获取接触力、压力分布、滑动等信号的感知方式,灵巧操作的关键模态。
- 运动学 (kinematics) 运动学 · kinematics 控制与机器人学
- 研究物体位置、速度、加速度等运动几何而不考虑力的学科,IK/FK 都属此范畴。
- 运动学奇异 (kinematic singularity) 奇异点 · singularity · 运动学奇异 · kinematic singularity · 奇异位形 控制与机器人学
- 雅可比矩阵降秩、末端失去某些方向自由度的关节位形,控制中需绕开或动用冗余自由度。
- 逆动力学 (inverse dynamics) inverse dynamics · 逆动力学 控制与机器人学
- 由期望运动反解所需关节力矩,是 computed-torque 控制的基础。
- 逆运动学 (IK) IK · Inverse Kinematics · 逆运动学 控制与机器人学
- 由末端位姿反解各关节角度的过程,机械臂操作的核心算法。
- 阻抗控制 (impedance control) 阻抗控制 · impedance control 控制与机器人学
- 让机器人端表现出期望质量-阻尼-刚度的柔顺控制策略,接触操作与人机交互常用。
- 零矩点 (ZMP) ZMP · Zero Moment Point · 零矩点 控制与机器人学
- 使机器人重心压力点保持在其支撑多边形内的判据,双足步态稳定性常用。
数学、数据与通用缩写48
- AMASS Archive of Motion Capture 数学、数据与通用缩写
- Archive of Motion Capture as Surface Shapes,大规模人体动捕数据集(统一参数化),是 motion prior 研究的数据基础。
- API (应用程序接口) API · 应用程序接口 · Application Programming Interface 数学、数据与通用缩写
- 软件对外暴露的调用约定,机器人 SDK、仿真器接口、大模型服务都以 API 形式提供。
- Adam 优化器 Adam · Adam 优化器 · Adam optimizer · AdamW 数学、数据与通用缩写
- 结合一阶矩与二阶矩自适应估计的梯度下降优化器,深度学习最常用的默认优化算法。
- CPU/GPU 数学、数据与通用缩写
- Central/Graphics Processing Unit,RL 训练的算力来源。Isaac Gym 的 GPU 并行让 RL 训练从天级降到分钟级。
- Dropout Dropout · dropout · 丢弃 数学、数据与通用缩写
- 训练时随机置零部分神经元输出的正则技术,缓解过拟合。
- ELBO 数学、数据与通用缩写
- Evidence Lower Bound,变分推断中证据的下界,CVAE/VAE 优化的目标函数。
- ELBO (证据下界) ELBO · 证据下界 · Evidence Lower Bound 数学、数据与通用缩写
- 对数似然的下界,最大化 ELBO 等价于最小化后验与变分分布的 KL 散度,是 VAE 的训练目标。
- GPU (Graphics Processing Unit) GPU · Graphics Processing Unit 数学、数据与通用缩写
- 大规模并行计算单元,是深度学习训练与推理的主力硬件。
- GRU (门控循环单元) GRU · 门控循环单元 · Gated Recurrent Unit 数学、数据与通用缩写
- 用更新门与重置门控制信息流的轻量 RNN,参数比 LSTM 少、常用于历史编码。
- ImageNet 数学、数据与通用缩写
- 大规模图像分类数据集(1000 类/百万图),深度学习视觉预训练的里程碑数据集。
- InfoNCE 数学、数据与通用缩写
- Info Noise-Contrastive Estimation,对比学习的标准 loss——正样本拉近、负样本推开。
- KL 散度 KL divergence · Kullback-Leibler 数学、数据与通用缩写
- Kullback-Leibler divergence,衡量两个概率分布差异的非对称度量。RL 中用于策略更新约束。
- KL 散度 (KL divergence) KL divergence · KL 散度 · KL 柯尔曼散度 · Kullback-Leibler divergence 数学、数据与通用缩写
- 衡量两概率分布差异的非对称度量,VAE、Trust Region、策略熵正则都用它。
- L2 正则 / 权重衰减 weight decay · L2 regularization · L2 正则 · 权重衰减 数学、数据与通用缩写
- 把权重平方和加进损失以抑制过拟合的正则项。
- LSTM (长短期记忆) LSTM · Long Short-Term Memory 数学、数据与通用缩写
- 带门控、缓解梯度消失的 RNN 单元,长序列建模的经典选择。
- LoRA (Low-Rank Adaptation) LoRA · Low-Rank Adaptation 数学、数据与通用缩写
- 冻结原模型、只训练注入的低秩矩阵的参数高效微调方法,大模型下游适配常用。
- MLP (多层感知机) MLP · 多层感知机 · Multi-Layer Perceptron · 前馈网络 数学、数据与通用缩写
- 由全连接层堆叠的前馈神经网络,是策略与价值网络最简单常用的 backbone。
- OOD (Out-of-Distribution) OOD · out-of-distribution · Out-of-Distribution · 分布外 数学、数据与通用缩写
- 输入落在训练数据分布之外的状态,是策略与模型泛化失败、性能骤降的主要场景。
- OOD (分布外) out of distribution · 分布外 数学、数据与通用缩写
- Out-of-Distribution,测试数据与训练数据分布不同。机器人 sim-to-real 的本质是 OOD 问题。
- ResNet (残差网络) ResNet · 残差网络 · Residual Network 数学、数据与通用缩写
- 引入跨层残差连接的深度 CNN,缓解梯度消失、让上百层网络可训,视觉特征提取常用。
- SDK (软件开发工具包) SDK · 软件开发工具包 · Software Development Kit 数学、数据与通用缩写
- 封装好 API、示例与工具链的开发包,机器人厂商常以 SDK 形式提供控制与感知接口。
- SGD (Stochastic Gradient Descent) SGD · Stochastic Gradient Descent · 随机梯度下降 数学、数据与通用缩写
- 用小批量样本估计梯度的优化方法,是深度学习训练的底层过程。
- SOTA state of the art · 当前最优 数学、数据与通用缩写
- State of the Art,当前最优方法/最佳性能。机器人 RL 各方向有各自 SOTA。
- Transformer Transformer · transformer 数学、数据与通用缩写
- 基于自注意力的通用神经网络骨干,是大模型与 VLA 的主流架构。
- 交叉熵 (cross-entropy) cross-entropy · 交叉熵 · cross entropy 数学、数据与通用缩写
- 衡量两分布差异的常用损失,分类与策略监督训练标配。
- 人工智能 (AI) AI · Artificial Intelligence · 人工智能 数学、数据与通用缩写
- 让机器完成通常需要人类智能的任务的科学与工程。
- 分数匹配 (score matching) score matching · 分数匹配 · score-based model 数学、数据与通用缩写
- 直接学习数据分布对数密度的梯度(分数)来训练生成模型的方法,是扩散/流匹配的理论统一视角。
- 卷积神经网络 (CNN) CNN · Convolutional Neural Network · 卷积神经网络 数学、数据与通用缩写
- 用卷积核局部连接、参数共享的网络,是图像特征提取的经典骨干。
- 去噪 (denoising) 去噪 · denoising · denoise 数学、数据与通用缩写
- 从带噪样本恢复干净样本的过程,扩散模型通过学习逐步去噪来生成动作或图像。
- 反向传播 (backpropagation) backpropagation · 反向传播 · backprop 数学、数据与通用缩写
- 用链式法则逐层计算神经网络梯度的算法,是深度学习训练的核心。
- 变分自编码器 (VAE) VAE · 变分自编码器 · Variational Autoencoder · 变分自编码 数学、数据与通用缩写
- 用变分推断学潜在分布、能生成样本的自编码器,是潜空间建模与生成式控制的经典工具。
- 均方误差 (MSE) MSE · 均方误差 · Mean Squared Error · 均方误差损失 数学、数据与通用缩写
- 预测与真值差平方再取均值的损失函数,回归与 BC 默认目标,但对多模态目标会失效。
- 对比学习 (contrastive learning) contrastive learning · 对比学习 数学、数据与通用缩写
- 用正/负样本对拉近/推远表征的自监督方法,CPC/SimCLR/MOCo 等。
- 嵌入 (embedding) 嵌入 · embedding · 嵌入向量 · 向量嵌入 数学、数据与通用缩写
- 把离散或高维对象映射到稠密低维向量空间的结果,让相似语义在空间上靠近。
- 循环神经网络 (RNN) RNN · Recurrent Neural Network · 循环神经网络 数学、数据与通用缩写
- 处理序列、带循环连接的网络,曾用于时序建模,多被 Transformer 取代。
- 微调 (fine-tuning) fine-tuning · 微调 · fine tuning · finetuning 数学、数据与通用缩写
- 在已预训练模型参数基础上、用下游任务数据继续训练以适配特定任务的常用范式。
- 梯度下降 (gradient descent) gradient descent · 梯度下降 数学、数据与通用缩写
- 沿负梯度方向更新参数以最小化损失的一阶优化方法。
- 泛化 (generalization) generalization · 泛化 数学、数据与通用缩写
- 模型在没见过的输入上仍表现良好的能力,是机器学习的核心目标。
- 注意力机制 (attention) attention · 注意力机制 · 自注意力 · self-attention 数学、数据与通用缩写
- 让模型对不同输入位置分配不同权重的机制,是 Transformer 的核心。
- 潜在空间 (latent space) 潜在空间 · latent space · 潜空间 · 潜变量空间 · latent 数学、数据与通用缩写
- 模型把高维输入压缩成的低维连续特征空间,是 VAE、world model、表征学习的核心表示。
- 监督学习 (supervised learning) supervised learning · 监督学习 数学、数据与通用缩写
- 从带标签样本学输入到输出的映射,BC 就是监督学习在策略上的特例。
- 示教数据 (demonstration data) demonstration data · 示教数据 · 专家演示 · expert demonstration 数学、数据与通用缩写
- 人类或专家提供的(状态、动作)样本,模仿学习的训练原料。
- 神经网络 (neural network, NN) neural network · 神经网络 · NN 数学、数据与通用缩写
- 层叠非线性变换的参数化函数逼近器,是深度学习的基本模型。
- 自监督学习 (self-supervised learning) self-supervised learning · 自监督学习 · SSL 数学、数据与通用缩写
- 不需人工标签、从数据自身构造监督信号的预训练方法。
- 表征学习 (representation learning) representation learning · 表征学习 数学、数据与通用缩写
- 学一个对下游任务友好的特征空间,是视觉/控制策略的基础环节。
- 软更新 (soft update) soft update · 软更新 · Polyak averaging 数学、数据与通用缩写
- 以 τ 缓慢插值更新目标网络参数:θ_target ← τ·θ + (1-τ)·θ_target。
- 过拟合 (overfitting) overfitting · 过拟合 数学、数据与通用缩写
- 模型把训练集噪声也学到手、在测试集上反而变差的现象。
- 预训练 (pretraining) 预训练 · pretraining · pre-train · pretrain 数学、数据与通用缩写
- 在大规模无标注或通用任务数据上先训练模型以学通用表征,再下游适配的两阶段训练第一步。