上企业AI,要不要先把数据中台建好?要不要训练自己的大模型?
2026年9月9日

企业规划 AI 时,有两个问题几乎必被问到:是不是得先把数据中台建好?需不需要训练我们自己的大模型?

这两个问题背后的焦虑是一样的:"是不是得先把地基打完,才能开始用 AI?"

核心结论

两个都不必等,但有一个东西必须先想清楚——场景。

问题结论真正的前提
要不要先把数据中台建好?不必等全企业级的数据中台建完但"这一个场景"的数据必须可用、口径必须对
要不要训练自己的大模型?绝大多数企业不需要先评估"现有模型 + 企业知识 + 工具调用"的组合

最容易犯的错,是把"建设工作"当成了"前提条件"。 数据中台和自训模型都是重投入的长周期工程,把它们设成前置门槛,等于把 AI 落地无限期推迟。

一、要不要先把数据中台建好?

先区分三件事

很多企业把"数据没治理好"当成不能上 AI 的理由,其实是把三件不同粒度的事混在了一起:

层次范围对 AI 的影响
企业级数据治理全集团主数据、数据标准、资产盘点长期工程,不必作为 AI 起步的前置条件
场景级数据准备某一个 AI 任务需要用到的那几张表、那几个字段必须做,且不可跳过
指标口径管理同一个指标在不同系统里定义是否一致必须做,否则 AI 会给出看似正确、实则口径错误的答案

为什么"口径"比"治理"更致命

问数类场景出问题的典型原因,往往不是数据没治理,而是同一个指标在不同系统里定义不一样——"收入"含不含税,"在岗人数"算不算外包,"逾期"从哪天开始算。

AI 会照着它拿到的口径,给出非常自信的错误答案。所以做问数类 AI,先做一件事就够了:

挑几个管理层常用的指标,要求 AI 的回答显示数据来源、时间范围、筛选条件和计算口径,再和原报表逐条核对。

真正的判断标准

不是"数据中台建没建完",而是这四个问题:

四个问题都过,这个场景就可以起步,不必等全企业的数据治理完成。

二、要不要训练自己的大模型?

结论:绝大多数企业不需要

三条理由:

  1. 成本高、难度大。 2024 年曾流行过企业微调自己的垂类模型,实践下来投入和复杂度都远超预期。
  2. 不划算。 通用大模型的迭代速度和泛化能力,已经明显超过企业自己微调的垂类模型——花大力气训出来的效果,可能几个月后就被新一代通用模型追平。
  3. 多数场景有更便宜的解法。 企业真正缺的往往不是"更懂行业的模型",而是让模型能够访问企业私域知识和业务系统

更划算的四步顺序

手段解决什么投入
提示优化让模型更好地理解任务要求最低
检索增强(RAG)让模型用上企业私域知识
工具调用让模型查真实数据、调业务系统
模型训练/微调改变模型本身的行为最高

提醒:这四步不是必须依次完成的阶梯。 不要默认"先提示词、再 RAG、最后微调",应该针对具体问题直接比较效果和成本,哪个解决问题用哪个。

什么时候才值得考虑自训

只有三个条件同时具备时:

一个前置判断:先选场景,还是先选模型?

通常是先明确场景,再选模型。

因为问答、预测、文档处理和系统执行这四类任务,对准确性、时延、费用和隐私的要求完全不同。场景没定,模型无从比较。建议顺序:先定义输入、输出、数据、可调用工具和验收标准,再做模型效果与成本比较。

三、这两个问题的共同答案

企业AI 的起点不是一个宏大的建设计划,而是一个具体的业务问题。

不要等数据中台,先把这一个场景的数据和口径解决掉;不要急着训模型,先让现有模型接上你的知识和系统。省下来的时间,都应该投到"选一个高频、规则清晰、可量化的场景先跑起来"上。

用友 BIP 6 的对应能力

需要说清楚的边界

关于"是否必须先建数据中台",用友官方资料中没有直接表述,本文结论由"数据质量与指标口径决定问数可靠性""有数据基础则落地成本更低"等证据推导得出,仅供参考,不作为官方方法论引用。"多数企业不需要自训模型"是基于当前阶段的判断,模型能力迭代很快,应随技术与成本变化重新评估。模型不能保证 100% 正确,仍需按错误后果设定验收阈值并保留人工确认。


说明:AI 生成内容存在不确定性,具体产品能力、版本适配范围与实施条件,请以用友官方最新产品资料与售前确认结果为准。