面向希望系统了解具身智能、并考虑转入相关行业的软件研发工程师。
硬件价格基线:2026-07-12。价格仅用于制定预算,实际采购前应复核国内渠道、套装内容、税费和售后条件。
具身智能不是简单地给人形机器人接入一个大模型,而是让智能体在物理世界中形成完整闭环:
感知环境 -> 理解状态 -> 规划任务 -> 控制身体 -> 接收反馈 -> 持续修正
具身形态不限于人形机器人,也包括机械臂、移动机器人、四足机器人、无人机等。系统学习时应同时沿两条主线推进:
- 技术主线:理解从硬件、感知、规划、控制到学习模型和系统工程的完整技术栈。
- 产业主线:判断机器人解决什么任务、客户为什么付费、可靠性是否足以支持部署。
仿真和线上课程是必要基础,但不能完全替代真实硬件。真实设备才会暴露关节回差、标定误差、相机曝光、USB 丢帧、通信延迟、物体摩擦、供电和安全等工程问题。
优先从已经存在明确需求和付费方的场景开始:
- 工业制造:上下料、装配、质检、搬运。
- 仓储物流:AMR、分拣、拣选。
- 商业服务:清洁、配送、巡检。
- 医疗康养:手术、康复、辅助照护。
- 特种场景:能源、矿山、应急和危险环境。
- 家庭与通用机器人:潜力较大,但可靠性、成本和长任务能力仍是主要约束。
分析每个场景时回答以下问题:
- 是否解决缺工、高风险或高重复劳动问题?
- 单次任务成本是否低于人工或传统自动化?
- 任务成功率、维护成本和回本周期是多少?
- 商业模式是硬件销售、项目交付,还是 RaaS 订阅?
- 当前处于规模商业化、小批量验证,还是实验室演示阶段?
先看场景的原因是:机器人最终要在物理世界创造可量化价值。任务成功率从 90% 提升到 99.9%,通常比单项模型指标提高几个百分点更重要。
- 上游:电机、减速器、编码器、力矩传感器、芯片、电池和材料。
- 中游:机器人本体、控制器、操作系统、仿真平台和具身基础模型。
- 下游:系统集成、场景解决方案、部署、运维和数据服务。
研究公司时,不只看整机演示,还要判断它处于产业链哪一层、核心壁垒是什么、收入依赖产品还是定制项目。
需要理解电机、减速器、编码器、力矩传感器、相机、深度相机、激光雷达和 IMU 的基本作用,以及机械臂、轮式和腿式本体的差异。
硬件决定动作空间、负载、精度、延迟和安全边界。不了解硬件约束,就容易设计出无法稳定执行的算法。
重点包括:
- 坐标系与刚体变换。
- 正逆运动学和动力学。
- 状态估计、定位与 SLAM。
- 路径规划、碰撞检测和轨迹优化。
- PID、MPC、阻抗控制和力控制。
学习模型可以承担语义理解、任务分解或动作生成,但稳定、精确和安全的执行仍依赖经典机器人方法。
- 目标检测、分割和姿态估计。
- RGB-D、点云和三维重建。
- 多传感器融合。
- 抓取点、可供性和接触关系理解。
- 场景变化、遮挡和失败状态识别。
- 行为克隆和模仿学习。
- 强化学习与离线强化学习。
- ACT、Diffusion Policy 等动作策略。
- VLM、VLA、世界模型和具身推理。
- 跨任务、跨场景和跨本体泛化。
短期更实用的系统形态通常是高层具身推理或 VLA 与经典规划、低层控制和安全约束组合,而不是一个端到端模型完全替代机器人栈。
- 遥操作和示范数据采集。
- 视频、关节状态与动作的时间同步。
- 数据清洗、版本管理和失败样本回放。
- 仿真、域随机化和 Sim-to-Real。
- 成功率、任务耗时、恢复率和安全违规率。
机器人数据昂贵、实验复现困难,数据和评测基础设施经常比更换模型更能提升研发效率。
- Linux、C++、Python。
- ROS 2、DDS、节点、Topic、Service、Action 和 TF。
- 实时通信、并发、驱动和硬件抽象。
- 模型部署、日志、回放、OTA 和设备管理。
- 超时、故障恢复、安全状态机和急停。
这一层最适合软件工程师切入,因为分布式系统、可观测性、测试、发布和可靠性经验可以直接复用。
机器人会与人、设备和环境发生物理接触,因此必须了解:
- 速度、力矩、行程和工作空间限制。
- 碰撞检测、急停和断电机制。
- 人机协作和风险评估。
- 工业机器人及应用集成安全标准。
- 长时间运行、维护和异常恢复。
按一般转型成本排序:
-
机器人平台与基础设施
- ROS 2 中间件、设备接入、仿真、数据采集、回放、评测、机器人云平台和边缘部署。
- 最能复用现有软件工程能力,也是优先推荐方向。
-
感知、规划与控制算法
- 适合熟悉 C++、计算机视觉、图形学、数学优化或控制理论的人。
- 需要系统补齐线性代数、概率、优化、运动学和控制。
-
机器人学习与 VLA
- 适合已有 PyTorch、深度学习或大模型经验的人。
- 除模型训练外,还必须掌握数据采集、动作表示、闭环评测和部署。
-
嵌入式与实时控制
- 适合 C/C++、RTOS、驱动、CAN、UART 和硬件经验较强的人。
除非已经具备较强数学和论文背景,不必一开始就把目标限定为具身基础模型研究员。平台、数据、仿真和算法工程更容易完成职业迁移,之后仍可继续向模型研究深入。
- 学习坐标变换、正逆运动学和基本控制。
- 完成 ROS 2 Topic、Service、Action、TF 和 URDF 练习。
- 在仿真中控制一个机械臂或移动机器人。
- 使用 MoveIt 2 完成仿真 pick-and-place。
- 加入碰撞检测、超时、失败重试和任务状态机。
- 建立任务成功率、耗时和失败类型记录。
- 组装并标定主从机械臂。
- 使用两路 RGB 相机采集至少 50 条一致的示范轨迹。
- 训练 ACT 或 Diffusion Policy。
- 比较不同数据量、相机视角和光照条件下的成功率。
- 实现数据集版本管理、回放、失败分类和自动评测。
- 尝试仿真数据、域随机化或合成数据。
- 将推理进程与机器人控制进程解耦,记录端到端延迟。
项目至少应具备:
- 可重复安装和运行的代码仓库。
- 系统架构图和数据流说明。
- 真实任务成功率,而不只是演示视频。
- 失败案例、原因分析和改进记录。
- 测试、日志、回放、超时、急停和安全边界。
建议每周时间分配:50% 编码与实验、20% 经典机器人学、20% 论文和开源项目、10% 公司与商业案例。
第一套硬件应优先形成完整闭环:
主从示教 -> 多视角采集 -> 数据集 -> 策略训练 -> 实机推理 -> 失败回放
不要一次购买人形机器人、移动底盘、深度相机、激光雷达和边缘计算板。设备越多,供电、驱动、标定和通信问题越多,却不一定提高前几个月的学习产出。
| 设备 | 推荐配置 | 预算 | 优先级 | 选择理由 |
|---|---|---|---|---|
| 主从机械臂 | SO-ARM101 Pro 完整套装 | ¥2,500-3,500 | 必买 | LeRobot 原生支持,能完成示教、采集、训练和部署闭环 |
| RGB 相机 | 2 个 UVC 1080p 30fps 摄像头 | ¥300-800 | 必买 | 正面与侧面视角能覆盖目标、夹爪和遮挡,第一阶段无需深度数据 |
| 相机支架 | 桌面悬臂或小三脚架 2 个 | ¥150-300 | 必买 | 固定视角比升级到 4K 更有利于数据一致性 |
| 灯光 | 可固定亮度和色温的桌面灯 | ¥100-300 | 建议 | 减少曝光和阴影变化造成的数据分布漂移 |
| USB 扩展 | 有源 USB 3.0 Hub | ¥150-300 | 建议 | 降低多相机和控制板同时接入时的供电问题 |
| 安全与固定 | 急停断电开关、桌夹、防滑垫 | ¥200-500 | 必买 | 限制机械臂移动并允许快速断电 |
| 实验物料 | 积木、杯子、收纳盒、不同材质物体 | ¥100-300 | 必买 | 构造抓取、分类和泛化任务 |
不包括电脑,第一阶段总预算约 ¥3,500-5,500。
- 一套主臂和从臂可以直接遥操作,较容易采集稳定示范轨迹。
- 6 自由度带夹爪,能够覆盖抓取、搬运、分类和放置任务。
- LeRobot 原生支持标定、遥操作、数据记录、ACT、Diffusion Policy 和 VLA 模型。
- Python 接口开放,可研究串口通信、控制循环、数据格式和硬件抽象。
- 电机、打印件和控制板可单独更换,维护成本低。
- 后续可以扩展为 LeKiwi 移动操作机器人。
它的限制也要明确:舵机回差、刚度、重复定位精度和负载能力不能与工业机械臂相比。它适合学习系统闭环和机器人学习,不适合验证高精度装配或高动态控制。
不同渠道的“套装”内容并不一致。下单前逐项确认:
- Leader 和 Follower 两条机械臂。
- 12 个匹配型号和齿比的总线舵机。
- 两套完整结构件和夹爪。
- 两块控制板及必要控制器。
- 两个与电机版本匹配的电源。
- USB 线、舵机线和桌面固定件。
部分官方商品只包含电机、适配板和线缆,不包含 3D 打印结构件、相机或 AC 电源。不能仅凭商品名判断内容,错误电压的电源也不能混用。
- 1080p、30fps。
- 支持 MJPEG 和标准 UVC 免驱协议。
- 最好支持手动曝光、增益和白平衡。
- 带标准 1/4 英寸支架孔。
建议一路放在正面或斜上方,观察机械臂、目标和容器;另一路放在侧面或夹爪附近,观察遮挡和接触状态。相机位置和照明应固定。
- 已有 NVIDIA 显卡且显存不少于 12GB:先使用现有设备。
- 只有 Mac:用于机械臂控制、数据采集和小模型实验,大型训练使用云 GPU。
- 只有 CPU:可以完成控制和采集,但不适合本地训练机器人策略。
- 8 核以上 CPU。
- 64GB 内存。
- 2TB NVMe SSD。
- RTX 5060 Ti 16GB 或显存更大的 NVIDIA GPU。
- Ubuntu 24.04 + ROS 2 Jazzy。
- 整机预算约 ¥8,000-11,000。
机器人数据通常包含多路视频,训练更容易先受到显存限制。16GB 新卡比更快但只有 8GB 或 12GB 的型号更适合作为入门训练机。如果能够承担二手硬件风险、较高功耗和散热要求,经过完整显存与压力测试的 RTX 3090 24GB 通常有更强的机器人学习性价比。
16GB 仍不适合训练大型 VLA。ACT 和较小的 Diffusion Policy 可以本地训练,大型 VLA 应优先租用 24GB 至 80GB 的云 GPU。
只有在第一阶段已经完成稳定抓取闭环后,才按研究方向选择以下设备。
- 预算:约 ¥1,900-2,800。
- 用途:RGB-D、点云、手眼标定、三维定位、避障和 SLAM。
- 选择理由:支持室内外、IMU、UVC,并提供官方 ROS 2 驱动。
如果当前任务只使用 RGB 模仿学习,深度相机不会直接提高学习收益,因此不列入第一批采购。
- 预算:约 ¥2,000-3,000,包含 NVMe SSD 和必要附件。
- 用途:TensorRT、相机接入、功耗测试和机器人端推理。
- 选择理由:体积小、CUDA 生态完整,适合学习从训练机到边缘设备的部署链路。
Jetson 是部署机,不是训练机。8GB 内存限制明显,不能替代桌面 NVIDIA GPU。
当桌面操作稳定后,可复用 SO-ARM101,将其扩展为 LeKiwi 移动操作机器人,继续学习:
- 底盘控制和远程遥操作。
- 网络通信和视频传输。
- 移动操作与长任务。
- 移动平台上的供电、延迟和安全问题。
只有明确转向移动机器人、建图和 Nav2 时才购买。它支持 ROS 和 ROS 2,适合室内定位、建图和避障。没有移动底盘时,单独购买激光雷达的学习收益有限。
- 数万元以上的人形机器人:成本高、底层常被封装,单位投入得到的学习内容有限。
- 没有关节位置反馈的 PWM 舵机机械臂:难以获得可靠的状态和动作数据。
- 只有一条从臂的套装:可以遥操作,但主从示教更容易采集稳定轨迹。
- 老款 Jetson Nano:内存和算力不适合现代机器人学习。
- 8GB 显存的新显卡:视觉推理尚可,策略训练很快受限。
- 第一批同时购买深度相机、激光雷达和移动底盘:调试面过大,不利于尽快形成完整成果。
- SO-ARM101 Pro 主从完整套装。
- 两个 RGB 相机、固定支架、灯光和安全断电设备。
- 使用现有电脑或云 GPU,完成第一个实机抓取策略。
- 根据方向选择深度相机、Jetson 或移动底盘,而不是全部购买。
- IFR World Robotics 2025 - Service Robots
- 2025 年政府工作报告
- 工信部《人形机器人创新发展指导意见》解读
- ISO 10218-1:2025 工业机器人安全要求