具身智能数据采集中心争议:商业化成色与收入结构深度拆解
2026/9/13 8:01:21 网站建设 项目流程

最近具身智能圈子里这场争论挺有嚼头,梅卡曼德创始人邵天兰在公开场合直接开火,批评部分同行靠数据采集中心制造收入,还点名了银河通用。这话一出,圈子里立刻分成两派,一边觉得他捅破了行业里那层窗户纸,另一边则认为他这是典型的吃不到葡萄说葡萄酸。

先声明一下,我不站队。但作为一个在机器人行业摸爬滚打多年的从业者,我更关心的是这场争吵背后暴露出来的真实问题:数据采集中心到底是一门什么生意?它能不能撑起一家具身智能公司的估值和未来?以及摆在所有创业者、投资人和求职者面前的一个灵魂拷问——你的收入,到底是卖产品赚来的,还是靠堆人头、堆场地堆出来的?

这篇文章我打算把它拆开揉碎讲清楚,包括争议双方的底层逻辑、数据采集中心的真实成本和收益结构、以及怎么从财务报表和业务动作里识别一家公司的收入成色。不管你是创业者、投资人,还是正在考虑入行具身智能的技术人员,这篇内容应该都能给你一些参考。

1. 事件始末:一场关于“收入成色”的行业之争

1.1 邵天兰到底在批评什么

邵天兰的质疑,核心点并不是“数据采集中心存在”这件事本身,而是围绕数据采集中心形成的收入模式。他直言不讳地指出,部分具身智能公司把数据采集中心做成了一项对外服务业务,通过承接数据采集、数据标注、数据加工这类订单来形成账面收入,再用这些收入向资本市场讲一个“商业化进展顺利”的故事。

这在行业里其实早有耳闻。具身智能公司建数据采集基地,本质上是为了获取训练机器人模型所需的操作数据,这是研发投入的一部分。但问题在于,当这个研发动作同时变成了一个对外收费的服务项目,而且这个服务项目的收入还占到公司整体营收的大头时,它的性质就变了。邵天兰的意思很直接:这不是在卖产品和做技术,这是在卖数据采集的“劳务”,用低毛利的服务收入去粉饰一家科技公司的商业化成色。

他点名银河通用,则是把争论从抽象概念拉到了具体对象上。不管点名是否准确,这一下让所有做具身智能的创业公司都开始自我审视:我们账上的收入,到底有多少来自核心产品和技术交付,又有多少来自数据相关的服务合同?

1.2 为什么这个话题会踩中行业神经

这个话题能引发这么大反响,是因为它精准踩中了当下具身智能赛道的集体焦虑:融资环境收缩,一级市场对纯讲故事的容忍度越来越低,投资人们开始追问商业化落地和真实收入。

在这种压力下,数据采集中心这种“重资产、重人工”的模式,反而成了一种看起来非常合理的创收手段。一方面,数据采集中心确实需要大量人力和设备投入,天然有成本;另一方面,如果把这些采集能力对外输出,帮传统企业或者科研机构做数据采集和标注,确实能签合同、能开票、能回款。这在账面上形成了一种“公司有造血能力”的错觉。

但问题是,这种收入和一家科技公司的核心竞争力和技术壁垒没有直接关系。一个做数据采集外包的公司,和一个做具身智能核心算法的公司,在财务报表上可能都叫“营业收入”,但在估值逻辑上完全不是一个物种。邵天兰的批评之所以刺耳,就是因为他把这种“收入结构错配”赤裸裸地摆在了台面上。

1.3 争论背后的两条技术路线

这场争论如果只停留在收入层面,那还只是财务问题。但深挖下去,你会发现它背后是两条技术路线的碰撞。

一条路线我称之为“数据飞轮派”。这个流派的逻辑是:通用具身智能的核心在于模型泛化能力,而模型的泛化能力需要海量、多样、高质量的真实操作数据来喂养。所以在真正解决技术问题之前,要先解决数据供给问题,数据采集中心就是这一路线的必然产物,哪怕它前期成本极高、看起来不像传统的高科技,但它是通往通用智能的必经之路。

另一条路线则是“场景落地派”。以梅卡曼德这类工业机器人公司为代表,他们认为机器人技术最终要解决的是真实生产线上的问题。与其大规模采集通用数据,不如深入细分场景,把抓取、装配、检测这些具体环节做深做透,靠真正的硬件交付和软件系统在产线上创造价值。这一派强调现金流、强调交付、强调复购,对“先烧钱建数据中心、再等待模型质变”的路线天然持怀疑态度。

这两条路线各有各的道理,但邵天兰这一波操作,等于把“数据飞轮派”的商业化软肋公开示众了。

2. 拆解数据采集中心这门生意的真实商业逻辑

2.1 数据采集中心到底在做什么

为了把这个问题说透,我先还原一下数据采集中心的运作方式。

一个典型的数据采集中心,场地至少几百平米起步,里面排列着多台机器人本体,可能是机械臂,也可能是人形机器人或者移动底盘。每一台设备旁边都配有操作员,操作员穿戴遥操作设备,包括主手控制臂、VR头显、数据手套、动捕服等等,通过这类设备“手把手”地教机器人完成一个动作,比如抓取一个水杯、打开一扇门、叠一件衣服。

在执行过程中,系统会同步记录大量的多模态数据:机器人各关节的角度、速度、力矩,相机采集的RGB图像和深度图像,还可以包括触觉传感器数据、力传感器数据、语音指令等等。这些数据经过清洗、分割、标注之后,会形成训练数据集,用来微调机器人的操作模型。

从本质上来说,数据采集中心干的事情,就是把“人类操作员教机器人做事”这个过程工业化、流水线化。听起来没什么高深的,但它确实是当前具身智能领域获取真实数据最可靠、最主流的方式。

2.2 数据服务收入的成色分析

现在关键问题来了:一个数据采集中心,如何形成收入?

一般有几种途径。第一种是内供,也就是只为自己公司的算法团队采集数据,这属于纯研发投入,不产生对外收入,这部分不涉及争议。第二种是对外服务,也就是把数据采集能力打包成产品,卖给其他需要机器人数据的公司、科研机构或者高校实验室,帮他们完成特定场景的数据采集和标注任务,按项目收费。第三种是更隐蔽的关联交易,即通过母公司、兄弟公司或者相关利益方采购数据服务,把左口袋的钱装到右口袋,制造出“有真实收入”的表象。

这三种途径里,第二种和第三种就是争议的焦点。尤其是第三种,本质上是把研发预算包装成了营业收入的来源,数据从公司A的研发中心搬到公司B的账户上,再以“采购数据服务”的名义回流。整个流程合法合规,但商业实质并没有改变:公司还是没有来自市场的、真正的产品收入。

更关键的是,数据采集服务的毛利率通常不高。因为它的成本结构里,大头是场地租金、设备折旧和一线操作员的人力成本,这些成本是刚性的,不会因为规模扩大而显著下降。我见过一些数据采集项目的报价,表面客单价看着还行,但刨掉人员和设备成本,净利润率可能只有十个点上下,甚至更低。

2.3 数据飞轮的真相:数据是否真正进入闭环

支持数据采集中心模式的从业者,最常讲的一个词叫“数据飞轮”。意思是采集数据、训练模型、模型能力提升、部署到机器人、机器人在真实场景收集更多数据、再回来迭代模型,形成一个正向循环。

逻辑本身没问题,但现实执行中有一个魔鬼细节:采集回来的数据,真的进入模型训练闭环了吗?

很多公司其实是把数据采集中心和模型训练团队剥离开的。数据部门按合同要求采集数据、交付数据集,任务就算完成了,至于这批数据是否被模型团队采用、是否真正提升了模型性能,完全没人跟进。结果就是,公司花了大量人力物力采集了上百T的数据,真正用于训练和迭代的可能只有一小部分,剩下的数据躺在硬盘里吃灰。

如果数据没有进入飞轮闭环,那这个数据采集中心存在的意义就只剩两个:一个是给公司内部算法团队提供原材料,另一个就是对外接单赚钱。前者是正常研发投入,后者就是一门单纯的数据服务生意。把后者包装成“具身智能核心能力”来融资,这才是整个行业争论的根源所在。

3. 具身智能商业模式的分水岭:卖产品、卖方案还是卖数据

3.1 三种典型收入结构的本质区别

要判断一家具身智能公司的商业化成色,最直接的办法就是看它的收入结构。

第一种是产品型收入。典型特征是公司有标准化的硬件或者软件产品,比如一台机器人、一套3D视觉引导系统、一个控制器,重复销售给不同的客户。这类收入毛利高,通常能干到40%以上,而且客户分散、可复制性强。梅卡曼德这类工业视觉公司,走的主要是这条路子。

第二种是解决方案型收入。典型的项目制集成模式,客户给你一个具体的场景需求,你组建团队去定制开发、部署、调试,最后交付一条可运行的生产线或者一套定制化系统。这类收入规模通常很大,单个合同可能几百万甚至上千万,但毛利不稳定,项目周期长、回款慢、高度依赖项目负责人的个人能力。做得好是高科技集成商,做不好就是披着科技外衣的工程队。

第三种是数据服务型收入。就是前面讲的,通过提供数据采集、标注、加工服务来收费。这类收入毛利低、劳动密集、技术门槛不高,竞争激烈,本质上更接近外包服务。

这三种收入形态完全可以并列存在,但如果一家公司的数据服务收入占比越来越高,而产品型、解决方案型收入迟迟不见起色,那它的“科技公司”成色就要打一个问号了。

收入类型核心特征毛利率水平可复制性技术壁垒
产品型收入标准化硬件/软件重复售卖高(40%以上)
解决方案型收入项目制交付、定制化集成中(20%-40%)
数据服务型收入数据采集、标注、加工外包低(10%-20%)

3.2 工业场景落地与通用场景探索的路径差异

对于走应用落地路线的公司来说,核心逻辑是找到一到两个足够大的垂直场景,投入大量工程资源去打磨产品,然后靠口碑和案例复制增长。比如做3D视觉引导抓取的,先搞定一个汽车零部件装配场景,再复制到家电、物流、食品等其他行业,每进入一个行业都要做大量的场景适配和工艺积累,但每拿下一个行业,后面的复制成本就会显著下降。

这种路径的缺点是前期慢、苦、脏,没有性感的宏大叙事,融资故事不好讲。但优点是你每收一笔钱,都是真实的客户在为你解决实际问题付费,而且你的产品和场景是深度耦合的,客户想换掉你的成本也很高。

走通用具身智能路线的公司,逻辑完全相反。它们的核心假设是:只要模型足够大、数据足够多,机器人的泛化能力就能突破临界点,最终迎来指数级的爆发。在这个假设下,前期大量的数据投入是必要的,数据采集中心是核心资产生,甚至愿意为了数据牺牲一段时间的商业变现。

这两种路径没有绝对的对错,问题在于,走第二条路线的公司如果自身造血能力不足,又需要持续输血,很容易在“融资讲故事”和“数据服务创收”之间发生变形,最后变成一种两头不靠的状态:数据采集中心既没有形成真正驱动技术闭环的数据飞轮,也没有建立起高壁垒的产品能力,只是在为别人做嫁衣。

3.3 投资人视角:收入质量应该怎么判断

聊到这里,肯定有人会问:那我们看一家公司到底能不能投,该怎么从公开信息里判断收入质量?我给几条实操判断标准。

第一条,剥离数据服务收入看核心产品收入。把公司的收入按产品型、解决方案型、数据服务型拆开,重点看产品型收入和解决方案收入的总和在整体营收中的占比和增速。如果核心产品收入占比逐年下降、全靠数据服务撑门面,这种公司要慎重。

第二条,核对客户集中度和关联交易。如果一家公司的前五大客户占比超过50%,而且这些客户里有关联方或者投资方背景,那就要留意了。正常的科技产品公司,客户应该是分散的、可以通过公开渠道查到的真实企业。

第三条,观察应收账款的规模和账期。我见过不少靠数据服务撑收入的公司,应收账款比营业收入增长还快,账期越拉越长。这说明所谓的收入并没有变成真金白银回流,而只是在账面上堆砌了一个数字。

第四条,也是最关键的,问一句:他家的数据有没有进入自家模型迭代闭环?如果数据只出了,没进模型,那这个数据中心的商业价值就要大打折扣。

4. 从业者避坑指南:从这场争论里能学到什么

4.1 创业者避坑:别为了账面收入毁掉技术方向

对创业者来说,这场争论最具警示意义的一点是:收入结构的健康度,决定了公司的长期估值逻辑。

我知道创业者的压力,融资环境不好的时候,投资人只要看到收入增长就开心,至于收入到底是卖产品赚的还是做服务赚的,很多人睁一只眼闭一只眼。但我想说的是,短期用数据服务冲量,本质上是在透支公司的技术品牌和研发资源。

原因很简单:你把最优秀的技术骨干派去做数据采集项目,他们精力和时间消耗在项目管理、客户沟通、数据清洗上,还有多少精力能留给核心算法的迭代?等到资本寒冬过去,你回头发现自己既没有产品壁垒,也没有数据资产的深度积累,账上的“收入”并不能转化为下一轮融资的筹码。

一家真正值得被资本青睐的具身智能公司,应该把收入建立在技术和产品的不可替代性上,而不是建立在劳动密集的外包服务上。数据服务可以作为公司早期的现金流补充,但要严格限制其占营收的比例,最好控制在20%以内,把80%的资源砸向核心产品和场景落地。

4.2 投资人避坑:数据资产不等于数据收入

这场争论也给投资人提了个醒:数据是资产,但不代表数据服务收入是高质量的资产收入。

数据资产的价值,在于它能否持续喂养出一个越来越强的模型,从而支撑起后续的产品竞争力。如果数据只是像流水线产品一样被采集出来、交付出去,数据资产的价值就会大打折扣,甚至变成负债——因为它消耗了大量现金流,却没有产生复利效应。

我建议投资人在尽调环节多问几个具体问题:你们的数据从采集到最终用于模型训练,全流程的周期是多久?数据进入模型后,模型指标提升了多少?有多少比例的数据是真正进入训练集,而不是躺在冷存储里面的?数据采集中心的人力和设备成本,未来有没有边际递减的可能?这些问题能问到点子上,比看PPT上的宏大叙事有用得多。

4.3 求职者避坑:选公司要看收入结构,更要看技术栈投入

最后聊聊和普通从业者相关的事。如果你正在考虑加入一家具身智能公司,我的建议是,先别急着看公司名气,也别光看薪资,多看两眼技术投入结构。

具体来说,入职前可以在面试环节里多问一句:公司的核心数据采集中心产出的数据,目前有多少比例被自研模型使用?算法团队的规模有多少?是算法团队定义数据采集的需求,还是数据采集团队自己决定做什么数据?这几个问题能帮你判断,这家公司是真的在积累技术壁垒,还是在堆数据给人看。

一家把数据采集中心当作核心壁垒的公司,对人才的吸引力,远不如一家把数据当作训练原材料、而非收入来源的公司。前者需要的是标准化的操作员和管理者,后者需要的是真正有技术判断力的算法工程师和系统工程师。两者未来的职业天花板,完全不是一个级别。

5. 行业走向:争论过后,具身智能的真实分化才刚刚开始

这场由邵天兰引发的争论,短期看是个人恩怨和公关口水战,但长期看,更像是一个信号:具身智能行业已经走到了分化的路口。

过去两年,整个赛道享受了太多泡沫红利,PPT上画个机器人、官网挂几段演示视频,就能拿到大额融资。但现在不行了。投资人的耐心在消退,对商业化的要求却越来越硬。当潮水退去,谁能靠产品和服务真正赚到钱,谁只是在靠数据采集中心做劳务外包和数字游戏,会一目了然。

我个人的判断是,接下来两三年会看到一个明显的趋势:靠数据服务撑收入的公司,会逐渐被资本市场淘汰或者强制转型;而真正扎扎实实做产品、做场景落地的公司,会像梅卡曼德这类企业一样,依靠深入的行业know-how和工程交付能力,逐渐形成一个又一个可复制的高毛利收入来源。

当然,数据飞轮派的探索也不会白费。droid硬件、遥操作基础设施、多模态数据管理工具这些技术积累,未来会成为整个具身智能产业的基础设施,被沉淀下来。就算个别公司倒下,它们探索出来的数据采集方法论和数据标准,也可能会成为行业的公共财富。

这里面唯一要被严格审视的,就是“打着研发旗号建数据中心,实际上靠数据外包赚钱”这种变形模式。因为它既不产生真正的技术飞轮,也不产生可持续的商业价值,只是在一个热门赛道里做着一门本质上是劳务输出的生意,却享受着科技公司的高估值。这种情况不改变,行业的泡沫就还会继续吹大。

对我个人来说,这场争论最大的价值就是提醒我,无论行业热度多高、资本市场多喧嚣,判断一家公司价值的标准始终没变:你到底有没有解决一个真实的问题?有没有客户愿意为你解决的问题持续付费?这个问题的答案,才是所有商业模式争议的终极裁判。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询