上企业AI前,这两个"要不要"先想清楚:数据中台和自训大模型
2026年9月9日

企业打算上 AI 的时候,有两个问题几乎一定会被提出来:

一是"我们数据中台还没建完,是不是得先建好再说";二是"要不要训练一个我们自己的行业大模型"。

这两个问题的答案,可能和很多人想的不一样。

结论先行:两个都不必等

问题结论真正的前提
要不要先把数据中台建好?不必等全企业级的数据中台建完但"这一个场景"的数据必须可用、口径必须对
要不要训练自己的大模型?绝大多数企业不需要先评估"现有模型 + 企业知识 + 工具调用"的组合

最常见的错误,是把"建设工作"当成了"前提条件"。 数据中台和自训模型都是重投入的长周期工程,一旦把它们设成门槛,AI 落地基本就无限期推迟了。

第一个"要不要":数据中台

先把三件事分开

很多人说"数据没治理好,所以不能上 AI",其实混淆了三件不同粒度的事:

  1. 企业级数据治理——全集团主数据、数据标准、资产盘点。这是长期工程,不必作为 AI 起步的前置条件。
  2. 场景级数据准备——某一个 AI 任务需要用到的那几张表、那几个字段。这个必须做,不能跳过。
  3. 指标口径管理——同一个指标在不同系统里定义是否一致。这个也必须做。

为什么口径比治理更致命

问数类 AI 出问题的典型原因,往往不是数据没治理,而是同一个指标在不同系统里定义不一样

AI 会照着它拿到的口径,给出非常自信的错误答案。

一个立刻能做的检查: 挑几个管理层常用的指标,要求 AI 的回答显示数据来源、时间范围、筛选条件和计算口径,然后和原报表逐条核对。这一条做下来,能挡掉大部分问数类事故。

判断清单:这个场景能不能起步

不必问"数据中台建没建完",问这四个:

四个都过,就可以起步。

第二个"要不要":自训大模型

答案是:绝大多数企业不需要

第一,成本高、难度大。 2024 年流行过企业微调自己的垂类模型,实践下来投入和复杂度都远超预期。

第二,不划算。 通用大模型的迭代速度和泛化能力,已经明显超过企业自己微调的垂类模型。你花大力气训出来的效果,可能几个月后就被新一代通用模型追平了。

第三,有更便宜的解法。 企业真正缺的往往不是"更懂行业的模型",而是让模型能够访问企业私域知识和业务系统

四步性价比顺序

手段解决什么投入
提示优化让模型更好理解任务最低
检索增强(RAG)让模型用上企业私域知识
工具调用让模型查真实数据、调业务系统
模型训练/微调改变模型本身行为最高

注意:这四步不是必须依次完成的阶梯。 别默认"先提示词、再 RAG、最后微调",应该针对具体问题直接比较效果和成本。

什么情况下才值得自训

三个条件同时具备:

  1. 任务收益足够高,值得专项投入;
  2. 专有数据确实构成壁垒,且量大质优;
  3. 持续维护能力跟得上——模型训完还要持续更新和评测。

顺带回答另一个高频问题:先选模型还是先选场景?

通常先明确场景,再选模型。

因为问答、预测、文档处理和系统执行这四类任务,对准确性、时延、费用和隐私的要求完全不同。场景没定,模型无从比较。

最后:两个问题的共同答案

企业AI 的起点不是一个宏大的建设计划,而是一个具体的业务问题。

不要等数据中台,先把这一个场景的数据和口径解决掉;不要急着训模型,先让现有模型接上你的知识和系统。省下的时间,投到"选一个高频、规则清晰、可量化的场景先跑起来"上,比什么都值。

三点客观提醒

  1. 关于数据中台的判断需谨慎:用友官方资料中没有针对"是否必须先建数据中台"的直接表述,本文结论由"数据质量与指标口径决定问数可靠性""有数据基础则落地成本更低"等证据推导,仅供参考。
  2. "多数企业不需要自训模型"有阶段性:模型能力迭代很快,这个判断应随技术与成本变化重新评估。
  3. 模型不能保证 100% 正确:仍需按错误后果设定验收阈值,高风险任务保留人工确认。