下列规模均指具身/人形机器人产业,但三家机构对「产业边界」定义不同,口径不可直接相加。
人形本体 → 整体 TAM
高盛 $38B/2035(仅本体)
摩根士丹利 $5T/2050(含供应链)
花旗 $7T/2050(含非人形AI机器人)
用户支出 / 本体销售
IDC $77B/2030(用户支出)
CAGR 94%
中金 581亿元/2030
人形市场分项
摩根士丹利美国分项
$240B / 2040
$1T / 2050
三者均为具身/人形机器人产业规模,但定义不同:本体硬件 < 含供应链服务的 TAM < 含非人形的 AI 机器人整体,不可横向相加。数据来源:高盛(2024-01)、摩根士丹利(2025-04)、花旗(2024-12)、IDC(2025)、中金(2024)。
| 模态 | 可用训练数据量级 | 相对比例 |
|---|---|---|
| 📝 文本 LLM | 15T tokens | 基准线 |
| 🖼️ 图像多模态 | 60亿对 | ~1/2,500 |
| 🎬 视频世界模型 | 26亿条 | ~1/5,800 |
| 🤖 机器人具身 | 240万 episodes | ~1/20,000 |
具身数据与文本数据的可用量级差距约 20,000×
📌 公开语料趋于枯竭,价值向高质量、真实交互、合规数据迁移
📌 具身数据无法从互联网直接获取,须采集、仿真、蒸馏
📌 2026 = 具身数据规模化元年,数据成为产业卡点
来源:Coatue《The Path to General-Purpose Robots》、中国信通院《具身智能发展报告 2025》、艺恩研究整理
具身 vs 文本差距约 20,000×,真实数据成卡点。互联网可爬取的文本/图像数据无法替代物理世界交互数据。
真机遥操 / 便携采集 / 仿真合成 / 视频蒸馏 四范式并行。没有单一范式能覆盖所有场景需求。
美国大额股权融资领先(Figure $39B估值),中国整机量产与场景落地领先(宇树5500+台出货)。
数据层位居上游,资产化环节毛利60-70%,显著高于硬件本体。掌握全链路闭环者主导利润分配。
NVIDIA(仿真+算力)、特斯拉(真实车队数据)、京东(物流场景)等以数据飞轮构筑竞争护城河。
资本/估值:大额股权融资领先 · Figure $39B
技术路线:VLA 基础模型原创 · PI π0
量产落地:相对谨慎,技术打磨优先
数据策略:通用数据巨头 + 仿真驱动
资本/估值:整机融资密集 · 银河 210亿元
技术路线:快速跟随 + 工程化 · 智元 GO-1
量产落地:整机出货领先 · 宇树 5500+ 台
数据策略:遥操工厂 + 仿真 + 视频蒸馏
资本规模:美 > 中 | 技术原创:美 > 中 | 整机量产:中 > 美 | 场景落地:中 > 美 | 政策支持:中 > 美 | 数据合规:各有优势
来源:TechCrunch / Bloomberg / Sacra、上交所招股书、艺恩研究整理(截至 2026-05)
| 价值链环节 | 相对毛利率 | 利润分布 |
|---|---|---|
| 采集 | 35% | |
| 标注 | 40% | |
| 治理 | 45% | |
| 仿真增广 | 55% | |
| 训练评测 | 58% | |
| 资产化 | 68% |
毛利率沿「采集→资产化」链条 逐级递增。掌握全链路闭环的数据公司主导利润分配,价值向上游数据层迁移,本体硬件趋于薄利。
注:毛利率为艺恩研究测算区间参考,用于示意价值链相对高低,非企业实际财务数据。
人类操作员远程控制机器人执行任务,记录操作轨迹作为训练数据。高质量但采集成本极高,难以规模化。
低成本动作捕捉+场景记录设备,灵活部署到各种真实环境。介于遥操和仿真之间的平衡方案。
NVIDIA Omniverse/Isaac Sim等平台大规模合成训练数据。成本低、可扩展,但sim-to-real gap仍是瓶颈。
从互联网视频中提取人类操作知识,蒸馏为机器人可执行策略。数据量大但质量噪声控制是关键挑战。
| 层级 | 数据来源 | 质量 | 规模 | 成本 |
|---|---|---|---|---|
| 🥇 真机操作 | 遥操/自主执行 | 最高 | 最小 | 最高 |
| 🥈 人类示范 | 穿戴设备/动捕 | 高 | 小 | 中高 |
| 🥉 仿真数据 | 物理引擎合成 | 中 | 极大 | 低 |
| 🏅 视频蒸馏 | 互联网视频 | 噪声大 | 最大 | 最低 |
白皮书归类为四大范式,覆盖真机采集、仿真合成、标注治理、资产化平台全链路。
美国大额股权融资领先,中国整机+场景闭环企业估值快速追赶。数据层公司毛利率显著高于整机硬件公司。
📄 完整18家公司详情、融资额、技术路线对比 → 见原始白皮书 17-28页
工业制造 → 仓储物流 → 商业服务 → 医疗康养,场景从结构化向半结构化/非结构化扩展。
数据主权+出口管制下,中美具身数据生态将形成两套平行体系,各有优势和短板。
量产→数据积累→模型迭代→性能提升→更多量产,形成正向飞轮。先发优势显著。
具身数据正在成为AI产业的下一个「石油」——谁掌握高质量、大规模的具身数据采集和资产化能力,谁就掌握下一代AI基础设施的定价权。2026年是关键窗口期。