A4a. 人物与物体运动
本环节研究如何把动作意图变成对象路径、部件运动和时序,并让已有结构执行。外部骨架模型、物理仿真与影视粗代理有不同的输出边界;本页记录可借鉴部分,不安排新的骨架或物理执行层。
时间和方法描述沿用 2026-09-23 笔记,本轮未重新读论文或运行模型;效果数字的旧版本由 Git 保存。
文本到运动的方法
| 工作 | 时间 / 来源性质 / URL | 原记机制 | 对整体闭环的启发与限制 |
|---|---|---|---|
| MoTiGA | CVPR 2026,论文入口 | 多层次时间建模、人类偏好优化、HumanML3D-R | 整体路径、部件动作和节拍可分层;生成 motion tokens 不等同于 agent 编写程序 |
| The Quest for Generalizable Motion Generation | ICLR 2026,二手论文页 | 长尾语义、数据扩展和评测 | 回归不能只选走跑跳;需补原论文和测试条件 |
| Human-Object Interaction 引导 | 原记 2026-03-26 / ICLR 2026,会议 PDF | 原记把 IK/物理约束放入生成循环 | 接触关系应进入动作规划;具体是否属于 classifier-free guidance 待核对,不能照搬原笔记术语 |
| 接触密集多角色运动跟踪 | Eurographics 2026,视频 | 专家模型处理密集接触 | 近距离多主体动作值得单独评估;仅有视频入口,题名/论文/实现待补 |
| InterAct | 原记 2026-08,ResearchGate | 表面关键点表示多物体和关节物体 | 可参考交互目标的表示;发布日期和版本需核对,不能凭聚合页认定 2026 新作 |
原笔记记录了 FID、偏好对数量和生成秒数;本轮不把这些异任务数字用于路线排序。需要比较时先核实硬件、样本、动作时长、表示和评测协议。
可调用的动作来源
QuickMagic Text to Motion
- 时间与来源:原记 2026-06-05 beta;产品页,商业来源。
- 原记输入/输出:动作描述、时长和候选数量 → 骨骼动画;Refine/Polish 调整提示,重定向和接触清理是后续步骤。
- 可借:候选生成、比较、选择、后处理的顺序,以及把“动作生成成功”和“适配具体角色成功”分开。
- 待查:导出格式、骨架、帧率、可编辑范围和当前计费。历史免费额度不视为当前服务承诺。
HY-Motion 1.0
- 时间与来源:2025-12-30 发布,原记 2026-01-29 SSAE 评测更新;GitHub、Hugging Face。因有具体 2026 更新线索保留。
- 原记形态:文本到 SMPL-H 运动,主模型与 Lite,附语义对齐评测和 ComfyUI 集成。
- 可借:作为动作意图→轨迹的外部对照。输出骨架不是 voxel 部件轨迹;导入需处理轴、单位、rest pose、时序、关节映射和简化。
- 获取状态:有仓库/权重入口,未在本轮下载、重定向或验证许可。
视频/单图 → 运动:平台、开源与人体表示
2026-09-25 检索补充。 本节为并行联网检索转述;标「原页」者表示检索者称已抓取官方页/README。价格与许可随厂商变化,引用前需回到官方页核对。
分水岭:给不给可复用的运动数据
| 类别 | 条目 | 输出 | 能否进 AnimationTrack |
|---|---|---|---|
| 直接给结构化运动数据 | Move API、Meshcapade/SMPL、DeepMotion、Rokoko、Flow Studio、Cascadeur、Viggle PINOC | FBX/BVH/GLB/USD/JSON/SMPL 参数 | 可,但需轴/单位/rest pose/关节映射与简化 |
| 只给视频,运动不可复用 | Runway Act-Two、Kling Motion Control、Wan-Animate、UniAnimate、Moore-AnimateAnyone、Viggle V4 主产品 | 生成视频 | 不能——运动烘焙进像素。这些是下游视频模型,不是运动源 |
这个区分直接对应本页开头的问题:下游模型修饰动作 ≠ 我们得到可重定向的运动。
云服务与桌面工具
| 条目 | 时间 | 来源 | 输入 | 输出 | 开源/许可 | 可借之处 |
|---|---|---|---|---|---|---|
| Autodesk Flow Studio(原 Wonder Dynamics/Wonder Studio) | 2024-05 收购,2025-03 更名,2025-08 免费层,2026 在售;官方 | 商业 SaaS | 实拍视频(body/face/hand)+ 可选文本/图像角色 | FBX(烘焙在 validated rig)、USD(完整场景:rig 层级、相机跟踪、clean plate、alpha mask、character passes) | 闭源;Free(带水印)/Lite $10/月/Pro ~$100/月 | 最值得看的 USD 场景导出:相机轨迹与角色 pass 作为独立可编辑产物导出,与本项目「scene time / render schedule 分离」「每帧相机 provenance」同构。局限:只支持其 validated rig |
| Cascadeur 2026.1 | 2025.1 AI Inbetweening → 2025.3 AI interpolation → 2026.1 Root Motion Tool(扩散做运动风格迁移)、Filament、UE Live Link;官方博客 | 商业桌面 | 关键帧/姿势、视频 mocap、GLB/FBX/DAE | FBX、DAE、USD(Indie+);Free 仅 .CASC | Free/Indie $99 年/Pro $399 年 | 运动生成范式最值得借鉴:物理约束(AutoPhysics/fulcrum)+ AI 中间帧 = 少量关键姿势间生成物理合理过渡,对应「确定性工具烘焙 + agent 给关键姿势 + 风格参数」 |
| Move AI(MoveOne / Genesis / Move API) | MoveOne(iPhone 单摄)、Move Live(2024-06)、Genesis(企业多摄,2026-04)、Move API(2025);运动数据格式文档(原页) | 商业 API | 单/多摄视频 | FBX、GLB、USD、BVH、C3D、Blend、MP4,以及 motion_data.json:逐帧 joint_data 含 position(米)、euler_xyz、local_transformation(4×3)、关节 torques、脚部 ground reaction forces;右手 Z-up | 闭源 API;MoveOne Free 30 credits、Starter ~$18/月 | 全场最接近 AnimationTrack 的接口:逐帧关节局部变换矩阵可直接映射到 track 采样;torque/GRF 是可选额外元数据 |
| Rokoko Vision 3.0 | 2026-07-16 重写单目求解器;双摄工作流 2026-08-16 退役;不含手指追踪;官方博客 | 商业 SaaS | 上传视频(monocular);另有 Text-to-Motion | FBX、BVH(HIK/Mixamo 骨架)、CSV(Pro) | 闭源;Free 30s/月、Basic $10、Plus $28、Pro $70 | Text-to-Motion 与 Video-to-Motion 同平台,正好覆盖两阶段运动来源;CSV 便于程序化读取;单价低,适合批量学生数据 |
| DeepMotion Animate 3D | 2020 上线,2026 活跃;官方文档、REST API 客户端 | 商业服务(API 客户端公开) | 视频(单人/多人,支持 face/hand);SayMotion 为文本 | FBX、BVH、GLB、MP4;自定义角色 FBX/GLB/VRM | 闭源;Free 60s/月(非商用)、Basic $14.90/月 | 官方 REST API 定义了错误码与烘焙流程,可作批处理采集器 |
| Meshcapade / MoCapade 3.0 | MoCapade 3.0(2025):多人≤4 + 精细手 + 3D 相机轨迹导出 + .SMPL 格式;2026-02-19 Epic 收购,独立服务 2026-04 前后关停,并入 MetaHuman;UE 5.8 于 2026-06 内置 markerless mocap 插件(实验性、仅 Windows);官方 Medium、smplcodec | 商业(已并入 Epic) | 任意视频(单/多摄、单/多人) | FBX、GLB、MP4、.SMPL(含 avatar+motion);GLB 含估计 3D 相机+场景 | 平台闭源;SMPL 参数化表示 + smplcodec 开源;SMPL 商用需向 MPI/Meshcapade 授权 | .SMPL + smplcodec 是最程序化的路径;其「相机轨迹导出」与本项目相机时间线契合。依赖单一商业 SaaS 有断供风险(本行就是例证) |
| Plask | 最近一次产品功能更新 2024-10-31(观察 2026-07),产品仍在运行但停滞 | 商业 SaaS | 上传视频/摄像头 | FBX / GLB / BVH(24 源骨骼重定向) | 闭源;Free 15s/天(个人非商业)、Standard ~$18/月 | 廉价 BVH 通道,可做早期验证;更新停滞 |
| Viggle AI V4 + PINOC | V4 于 2026-02(自研 JST 3D world model);官方博客 | 商业 SaaS | 角色图 + 参考视频(或文本生成角色);PINOC 支持 Mixamo FBX/GLB 导入 | 主产品:视频;PINOC:FBX、GLB(Mixamo/MetaHuman 骨架)、USDZ | 闭源;Free/Pro $7.99/Live $15.99/Max $63.99 | PINOC 的骨架运动是唯一可复用部分;V4 的「3D world model 做结构化运动理解」与「几何不可变、节点驱动」理念接近,但实现是像素生成 |
| Runway Act-Two | 2025-07-15 发布,2025-07-21 API | 商业 | driving performance 视频 + 参考角色图,无需 rig | 仅生成视频 | 闭源;5 credits/秒,API ~$0.05/秒 | 作运动迁移画质基线;运动不可复用,与「运动须可迭代」的要求冲突 |
| Kling 动作迁移 | 2.6 Motion Control;3.0 于 2026-05-23 迁移上线 | 商业 | 1 张角色图 + 1 段参考视频 + character_orientation | 仅生成视频(720p/1080p) | 闭源;3.0 标准 ~35 credits/秒 | 参考画质;输出视频不可进 AnimationTrack |
开源生成式(视频→视频)
| 条目 | 时间 | 许可 | 输入 | 对本项目 |
|---|---|---|---|---|
| Wan2.2-Animate / Wan-Animate-2 | Wan2.2-Animate-14B 2025-09-19 开源;Wan-Animate-2 2026-08-07:端到端 DiT 直接吃驱动视频、去掉中间 pose extractor、新增文本驱动视角控制、含 Lite 实时变体;仓库、权重 | Apache-2.0(含商用输出) | 参考角色图 + 驱动视频(+ 文本描述/视角 prompt) | 可自托管、商用友好;「文本驱动视角控制」是运动与相机解耦的开源实现参照;输出仍是视频,需额外 HMR 才能转成运动数据 |
| UniAnimate / UniAnimate-DiT | 2025 SCIS / 2024 代码,基于 Wan2.1-14B-I2V;仓库 | 开源(许可待核对) | 参考图 + DWPose 姿态序列 | 统一视频扩散 + first-frame conditioning 的长视频思路;已非 SOTA |
| Moore-AnimateAnyone | 持续维护至 2026 | Apache-2.0 | 参考图 + DWPose/YOLOX 姿态序列 | 姿态条件生成的自托管参考实现 |
人体动作/网格重建:可程序化读取的核心
| 条目 | 时间 | 许可 | 输出 | 对本项目 |
|---|---|---|---|---|
| MHR(Momentum Human Rig, Meta) | 2025-11-19 发布,仓库维护至 2026-08;仓库、论文(原页) | Apache-2.0(商用友好) | 参数 45 shape + 72 expression + 204 pose;网格 + 骨骼;FBX rig(含 blendshapes);7 级 LOD(595–73,639 顶点);mhr.io 加载 FBX/NPZ | 全场最适合程序化对接的人体表示:显式解耦骨架与表面、127 关节、PyTorch 可微,set_pose/get_joint_transforms 可映射为节点/骨骼 track。局限:较新、生态小、127 关节需映射到 lattice |
| SAM 3D Body(Meta) | 2025-11-19,CVPR 2026 oral;研究页 | SAM License(可商用但非纯 Apache;MHR 本身 Apache-2.0) | 单张 RGB 图 → MHR 参数 + 网格:pred_vertices、pred_keypoints_3d/2d、pred_cam_t、focal_length、pose/shape 参数 | 单图→完整人体(含脚手)→ MHR 参数,是「单图驱动」最直接的 3D 入口,输出结构清晰可解析。局限:单图无时间信息 |
| SMPL-X | 长期标准 | 学术免费,商用须授权;禁军事/监控/色情/再分发 | 参数向量 + 网格 | 生态最广的运动中间表示,多数 HMR 输出它;非商业许可是主要限制 |
| GVHMR | SIGGRAPH Asia 2024,TPAMI 2026 扩展;仓库 | 代码/权重非商业研究许可;SMPL 另受 MPI 门控 | 单目视频 → SMPL/SMPL-X 参数(世界坐标 + 相机坐标),joints_world (L,24,3) | 世界重力对齐坐标、脚滑更少、轨迹更物理,最适合把视频运动转成世界坐标 track 的候选之一。局限:24 关节无手指 |
| WHAM | CVPR 2024,维护中;仓库 | 代码 MIT(依赖 SMPL,门控仍适用) | 单目视频 → SMPL 24 关节 + 全局轨迹 | 在线、高效、时序平滑,可作世界坐标运动初值;长序列误差累积 |
| TRAM | 2024,ZJU-3DV,维护至 2025–2026;仓库 | 研究许可(依赖 SMPL-X) | in-the-wild 单目视频 → SMPL-X body pose + 世界空间轨迹 | 场景尺度恢复 + 全局轨迹,适合有背景参照的镜头;计算较重 |
运动数据格式对照
| 格式 | 性质 | 内容 | 对本项目 |
|---|---|---|---|
| BVH | 文本开放 | 仅关节层级 + 每帧旋转/平移,无网格/材质 | 最易程序化解析,适合直接采样进 AnimationTrack |
JSON(Move motion_data.json) | 开放 | 逐帧关节 position/rotation/local matrix/torque/GRF,Z-up | 最贴近 AnimationTrack 的逐帧采样接口,但是厂商私有 schema |
| USD | Pixar 开放 | 富场景层级、相机、材质、动画、流式访问 | 场景级对接最佳(Flow Studio/Meshcapade 导出相机轨迹与多角色场景) |
| FBX | Autodesk 专有 | 完整场景:骨骼层级+网格+材质+blendshape+动画曲线 | DCC/引擎交换首选;骨骼命名不一,需显式 retarget 步骤 |
| GLB/glTF | Khronos 开放 | PBR + 标准骨骼动画 | Web/Three.js 预览、轻量交付 |
| C3D | 生物力学标准 | 标记点/力板原始数据 | 研究级通道,非动画格式 |
对本环节的结论
- 「能给出可复用运动数据」与「只给视频」必须分开:后者不能作为 AnimationTrack 输入,只能作为下游。
- 许可最干净、最程序化的三条路径:MHR(Apache-2.0)+ SAM 3D Body/视频 HMR;Move API
motion_data.json;Meshcapade.SMPL+smplcodec(注意 SMPL 商用门控)。 - 可借鉴的生成范式:Cascadeur 的「物理约束 + AI 中间帧」与 2026.1 Root Motion Tool;Flow Studio/Meshcapade 的相机轨迹独立导出;Wan-Animate-2 的文本驱动视角控制。
- 2026 最大变化是并购整合(Wonder→Autodesk、Meshcapade→Epic、Move Pro→Genesis、RADiCAL 核心 IP 2026-04 被 Autodesk 收购):管线对外部服务应做适配层,不把单一 SaaS 当作长期依赖。
- 待核对:各条价格/层级多来自第三方聚合页;UniAnimate/WHAM/TRAM 的 LICENSE 文件应在仓库内二次核对;GVHMR/WHAM/TRAM 的商用能力受 SMPL/SMPL-X 门控限制。
刚性部件与交互
SceneCode(2026-05)是铰链、滑轨与部件分解的线索;Code2Worlds(2026-02)是代码表达时间的线索。主体介绍统一放在场景构建。
闭环中应能区分:没有可驱动的手臂是结构问题;手臂已存在但角度不对是驱动问题;动作执行了但镜头看不到是观察/镜头问题。拿持、坐靠可先用锚点、层级、相对轨迹近似。几何采样精度的增加不会自动补出控制自由度。
最值得做的比较
- 同一动作要求下,agent 编写路径/旋转与外部动作模型导入分别需要多少修订?
- 只取少量刚性部件后,哪些动作语义仍清楚,哪些接触或朝向丢失?
- 全局位移、局部关节和相机运动是否被正确分开?
- 下游会修饰僵硬动作,还是把它保留下来?这是实际视频问题,不能由动作文件合法性回答。
持续跟踪
人类交互运动列表 仅作新作发现入口;多数旧工作不继续展开。Motion-Agent(ICLR 2025)与 MotionGPT 属背景,不作为本轮优先项。
维护记录
- 2026-09-24:重写为方法、可调用资产、交互表示和比较问题;删除动作 token 等同作者程序的类比,以及跨任务指标外推。
- 2026-09-25:新增「视频/单图 → 运动」平台与开源对照(Flow Studio、Cascadeur 2026.1、Move AI、Rokoko Vision 3.0、DeepMotion、Meshcapade、Viggle、Act-Two、Kling、Wan-Animate-2)、人体表示(MHR/SAM 3D Body/SMPL-X/GVHMR/WHAM/TRAM)与格式对照;确立「给运动数据 vs 只给视频」的分水岭。检索转述,未逐页复核官方文档与许可。