在美国加州圣莱安德罗的一间仓库里,操作员 Andrew Ceja 戴着一副头显,小心地从摇摇欲坠的叠叠乐木塔中抽出积木。头显上的摄像头记录着他眼前的画面,这种第一人称视频如今已是机器人训练数据的重要来源。但在摄像头之外,头显还装有脑电传感器,持续测量操作员完成任务时的神经活动。

摄像头看到的是:手伸向哪一块积木、如何调整角度、木塔何时开始晃动。脑电信号试图回答的则是另一组问题:操作员什么时候意识到自己选错了积木?什么时候感到意外?什么时候已经形成行动意图,却还没有真正伸出手?

开展这项试验的是人工智能数据基础设施公司 Encord。提供脑电头显的则是德国神经技术初创公司 Zander Labs。按照双方的设想,视觉、动作与脑电活动经过时间同步后,可以形成一种比普通操作视频更优质的训练数据:它不仅告诉机器人一个动作是如何完成的,也可能记录人类在做出动作之前和发现错误之时的内部状态。

Encord 的目标,是测试这些脑电信号能否成为一种新的数据标签,帮助机器人模型更准确地学习人类的意图、识别高风险时刻,并判断什么情况下需要调用更强、计算成本更高的推理模型。

如果这条路径能够成立,下一代具身智能的训练数据,不仅来自人类的身体,也可能来自人的大脑。

机器人数据,需要被重新生产

Encord 由 Ulrik Stig Hansen 和 Eric Landau 于 2020 年在伦敦创办,两人此前都曾在金融行业工作。

Landau 本科就读于斯坦福大学物理学专业,后取得电气工程硕士学位,并在哈佛大学完成应用物理学硕士学习。创办 Encord 前,他曾在自营交易公司 DRW 担任高级量化研究员。

Hansen 来自丹麦,青少年时期便开始编程,后来进入金融行业。2018 年离开原有工作后,他重新转向计算机科学和深度学习研究。两人在一次创业者配对活动中相识,并开始尝试把量化交易系统中的自动化方法用于 AI 数据处理。


图 | Ulrik Stig Hansen 和 Eric Landau(来源:Encode)

创业早期,Encord 获得的客户 SurgEase 是一家胃肠内镜远程医疗公司,其系统会产生结肠镜检查的高清视频,需要进行数据管理和标注;此后,Encord 又进入放射影像等领域,帮助医疗和科研团队标注计算机视觉训练数据。

这段经历确立了 Encord 的基本方向:与其为某个行业开发单一 AI 模型,不如提供一套管理、筛选、标注和评估非结构化数据的通用平台。随着客户扩展到制造、自动驾驶、无人机和机器人,Encord 也逐渐从标注工具商转向多模态数据基础设施公司。

随着机器人客户增加,Encord 遇到的问题也发生了变化。过去,客户通常已经拥有图像和视频,只需要工具帮助整理和标注;机器人公司需要的许多数据却没有现成来源。

大语言模型可以从网上获取文本、代码和图像,机器人却没有现成的“物理世界语料库”。一个模型可以从公开视频中看到人类如何倒咖啡,但普通视频未必能提供深度、机器人关节、控制指令、触觉和力矩等信息。摄像头还可能遮挡手部动作,也不会解释操作者为何突然停顿或者改变方向。

正因如此,具身智能公司正在大规模收集两类数据。

第一类是以人为中心的第一视角数据。工作人员佩戴头部或腕部摄像头,在家庭、仓库、工厂等环境中完成真实任务,模型据此学习人类如何与物体互动;第二类是机器人遥操作数据。人类通过控制器、遥操作设备完成任务,系统同步记录图像、关节状态、控制指令和力反馈。

Encord 两条路线都在推进。该公司在圣莱安德罗的办公场地雇佣了十余名操作员,让他们反复执行倒咖啡、堆叠筹码、插拔服务器网线等任务。仓库里还摆放着假花、塑料蔬菜、书籍、猫砂盆和成捆的电线——这些看似杂乱的日常物品,构成了机器人进入家庭、数据中心和工业环境之前的“练习册”。

公司称,其平台管理的数据量在过去一年由 1PB 增至超过 5PB,物理 AI 相关收入增长 10 倍,目前服务全球 300 多支 AI 团队。

但随着机器人公司采用端到端学习方法,Encord 发现仅仅管理客户已有的数据已经不够,因为部分训练数据“根本不存在”,Encord 机器人学习负责人 Vineeth Velmurugan 表示。

因此,在第一视角视频和遥操作之外,Encord 开始尝试通过其他方式获取数据。与 Zander Labs 合作采集脑电,就是其中一项试验。

脑电如何成为新的数据标签

Zander Labs 主要开发被动式脑机接口(passive BCI)。它不同于通常所说的“意念控制”:主动式脑机接口需要使用者有意识地生成信号,例如想象左手或右手运动;被动式脑机接口则在人正常执行任务时持续监测脑电,识别可能与错误、惊讶、注意力和认知负荷有关的特征。

这套技术主要包括三个步骤:通过电极采集头皮电位变化;对信号降噪并提取特征,由分类器识别特定脑电模式;最后将识别结果与操作视频、身体动作和机器状态进行时间对齐。据 Velmurugan 估计,这种经过深度标注的多模态数据,其训练价值可能是普通第一人称录像的 100 倍。

在硬件方面,Zander Labs 正在开发名为 Zypher 的便携式脑电方案。根据公司资料,该方案采用可放置在耳周和前额的电极,并配备小型 24 通道脑电放大器,目标是在实验室以外进行连续采集。


(来源:Zander Labs)

脑电被记录下来之后,系统还需要过滤噪声、提取特征,再用分类器识别特定事件。对 Encord 的机器人训练试验而言,其中一类重要信号是错误相关电位。

当人发现自己或机器的行为偏离预期时,大脑可能在数百毫秒内产生与错误处理有关的电位变化。以拆积木为例,如果操作员看到木塔朝意料之外的方向倾斜,即使他尚未说话、停手或按下按钮,脑电信号中也可能已经出现相应反应。

分类器的作用,是判断某段信号出现错误相关电位的可能性,而不是还原操作员脑中的完整想法。它或许可以标记操作员在这个时间点发现异常,但不能直接解释异常来自哪块积木,也不能告诉系统正确动作是什么。Zander Labs 还在开发通用分类器,希望减少每一名使用者重新校准系统的需要。

对 Encord 而言,关键步骤是把分类器输出的时间点与操作视频和动作数据对齐。例如,视频显示操作员在某一秒抽动积木,脑电分类器随后检测到错误反应,系统便可以给对应片段添加可能察觉错误的标签。数据审核人员可以优先检查这些位置,机器人模型也可以获得一层区别于动作标签的辅助信息。

Zander Labs 神经科学家 Lucas Gehrke 还表示,脑电反映出的认知投入程度,可能为模型的计算资源分配提供参考。例如,系统可以比较人在例行操作和复杂决策阶段的脑活动差异,用于研究哪些任务节点可能需要计算量更高的模型。

不过,真实环境中的脑电采集面临较多干扰。眨眼、面部肌肉、头部和身体运动、电极接触变化以及环境电磁噪声,都可能产生比目标信号更明显的波动。不同使用者的脑电模式并不完全一致;同一个人在疲劳、压力变化或重新佩戴设备后,采集结果也可能改变。

因此,这类脑电信号现阶段更适合作为概率性的辅助标签:它可以提示某个时间点可能发生了错误识别、意外或认知负荷变化,但不能作为对操作员思想内容的直接读取,也不能脱离视频、动作和任务背景单独解释。

目前,Encord 与 Zander Labs 的合作仍处于试验阶段。双方准备先建立一套带有脑电标签的数据集,将其用于客户的机器人模型,测试额外的信号是否能提升性能,然后再决定是否扩大规模。

除了脑电,Encord 还在测试佩戴于前臂的肌电传感器。由于普通视频有时无法完整拍摄手部姿态,公司希望利用手臂肌肉产生的电信号,辅助还原手部的三维位置。

1.https://techcrunch.com/2026/07/26/are-brain-waves-the-next-unlock-for-physical-ai/

2.https://encord.com/

3.https://techfundingnews.com/yc-backed-encord-snaps-30m-for-faster-ai-development/

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成