真实世界数据:AI训练的新矿藏与数据公司的进化路径
摘要
真实世界数据正在重塑AI训练范式 当前,前沿AI实验室的训练需求正经历一次关键迁移:从互联网公开数据、专家构造数据,转向企业真实工作流中自然产生的数据——即 real-world data。这类数据不是被刻意设计出来的,而...
真实世界数据正在重塑AI训练范式
当前,前沿AI实验室的训练需求正经历一次关键迁移:从互联网公开数据、专家构造数据,转向企业真实工作流中自然产生的数据——即 real-world data。这类数据不是被刻意设计出来的,而是在日常协作、系统操作、问题解决过程中留下的完整行为痕迹。它自带上下文、意图、反馈与结果闭环,是模型迈向长程任务处理能力(Long Horizon Reasoning)不可或缺的燃料。
数据供需错配催生新分工
市场呈现出典型的两端割裂:模型公司拥有强大的机器学习工程能力(MLE-rich),却缺乏高质量、高保真、可规模化获取的真实业务数据(data-poor);而企业恰恰相反——坐拥海量流程日志、协作记录、审批链路与客户交互数据(data-rich),却普遍缺乏将这些资产转化为训练资源的技术能力(MLE-poor)。
这一结构性缺口,正在催生两类互补型公司:
• Human Data Company:聚焦数据供给侧,深入企业现场捕获、清洗、建模真实工作轨迹,为模型实验室提供可训练的数据产品;
• RLaaS(Reinforcement Learning-as-a-Service)公司:聚焦能力供给侧,将企业的业务系统、工具链与组织规则封装为可复用、可重置、可评测的强化学习环境,本质是交付“可训练的业务操作系统”。
数据不是原料,而是信号载体
真正有价值的数据,必须同时满足三个条件:可还原意图、可验证结果、可反复练习。我们将其分为两类形态:
• Type 1(原生工作流数据):如 GitHub 的 commit-message-issue-timeline 链路、客服工单的完整处理记录、销售系统中从线索分配到成单的全路径日志。这类数据天然携带 reward signal 和失败归因,但获取门槛高、合规要求严、结构化难度大。
• Type 2(专家构造数据):由领域专家在模拟环境中完成任务后生成。适合早期能力爬坡,但易失真、难泛化。当任务链路变长、经济价值升高时,其局限性愈发明显。
更务实的路径是走向 Type 1.5:在专家参与中嵌入真实工作逻辑——长期绑定高质专家、重构激励机制防止 reward hacking、建立多层 QA 工程体系(含异常检测、行为分析、效果反验),让构造过程无限逼近真实。
好数据的关键指标是“可爬坡性”
衡量一条训练数据是否有效,不在于模型能否“一次性做对”,而在于它是否卡在模型当前能力的边界上,具备稳定的“爬坡潜力”。典型判据是:
• pass@1 = 0%,pass@32 = 30%:说明模型已偶然触达成功路径,只需稳定训练即可提升成功率;
• pass@1 = 0%,pass@256 = 0%:任务远超当前能力或过于偏门,不具备训练价值。
这要求数据设计者既懂模型瓶颈,也懂业务逻辑——所谓 data taste 与 research taste 的双重能力。
RL环境的本质,是可重置的业务操作系统
一个成熟的 RL 环境,不是沙盒游戏,而是对企业真实业务系统的轻量级镜像:它集成 CRM、邮件、文档库、审批流等工具接口,预设业务规则作为 reward 函数,并支持环境快速复制与状态重置。
随着模型能力增强,RL 环境正朝四个方向演进:
• 空间扩展:跨多个系统协同,而非单点沙盒;
• 工具活化:调用不确定性输出的子模型(如搜索模型),需具备参数控制与结果校验能力;
• 组织复杂化:多 agent 分工协作,reward 不仅看结果,更看成本与时效;
• 任务升维:从单动作训练,升级为子流程编排,最终指向端到端工作流规划。
进入真实世界的最大障碍,是样本效率
编码类任务适合 RL,因其环境易复制、反馈即时、失败可重来;但销售、法务、管理等真实场景无法“存档重来”。每一次客户谈判、每一份合同审核、每一笔投资决策,都是不可复制的单次事件,反馈延迟且因果模糊。
突破路径正在浮现:
• OPSD(On-Policy Self-Distillation):让“老员工模型”蒸馏经验策略,教会新模型如何判断关键信息、何时追问、何时行动,把稀疏结果反馈转化为密集过程指导;
• Dreaming(梦境推演):模型基于真实经历构建内部 world model,在其中模拟不同决策分支、不同沟通策略、不同定价方案,实现“一次实践,百次反思”的高效学习。
这两条路径,正在为 AI 进入真实世界开辟第三条 scaling 轨道:test-time training。
企业自训模型,不是选择题,而是算术题
当工作流本身成为数据来源,企业是否该 post-train 自己的模型?答案取决于四个乘数的乘积:
数据独特性 × Eval 清晰度 × 任务频率 × 单次改善价值
任一趋近于零,投入就难以回收。例如 DoorDash 的菜单识别任务:数据高度定制(商户规则)、评估明确(字段匹配率)、高频发生(年均十万+商户)、单次准确率提升直接降低人工审核成本——因此自建小模型成为必然。
而企业最大的优势,恰恰是入口——它是唯一能持续捕获高质量 agentic trajectory 的主体。一条完整用户操作轨迹,在外部市场报价可达上千美元;而在企业内部,它每天自然产生,且附带隐性偏好信号:用户接受/拒绝、小幅修改/大幅重写、下载/弃用、低延迟响应/高 token 消耗……这些都可转化为 DPO、RLHF 等训练所需的 preference pair。
未来属于“建工厂”的人
数据赛道已告别粗放淘金。靠人力堆砌、项目制交付的 Type 2 公司窗口期正在收窄;真正可持续的玩家,正在构建三类核心能力:
• 可审计的数据谱系(data lineage):清晰追溯来源、清洗逻辑、专家资质与 QA 流程;
• 可工程化的质量保障:将 QA 从运营动作升级为自动化系统,嵌入生产全流程;
• 可复用的环境基建:不止交付单次 RL 场景,而是沉淀出模块化、可配置、可组合的企业级环境模板。
招聘结构即是信号:频繁招 SPL(Special Project Lead)的公司仍在“卖人力”;只招 Member of Technical Staff,专注数据工程、环境工程与 QA 自动化的团队,才真正走在“建工厂”的路上。
评论 (7)
样本效率是进入真实世界的障碍,OPSD和Dreaming这俩方法有点意思。
RL环境在不断演进,朝四个方向发展难度不小,得一步步来。
AI训练用真实世界数据是趋势,不过企业和模型公司配合还得解决不少技术问题。
好数据得有可爬坡性,这就要求设计数据的人既懂模型又懂业务,不好找啊。
企业自训模型得算那四个乘数,算对了才能有收益,不能盲目搞。
数据分类型还挺重要,Type 1.5感觉是个务实的方向,得好好研究。
未来数据赛道得建工厂,有那三类核心能力才能长久,靠人力不行。