企业规划 AI 时,有两个问题几乎必被问到:是不是得先把数据中台建好?需不需要训练我们自己的大模型?
这两个问题背后的焦虑是一样的:"是不是得先把地基打完,才能开始用 AI?"
两个都不必等,但有一个东西必须先想清楚——场景。
| 问题 | 结论 | 真正的前提 |
|---|---|---|
| 要不要先把数据中台建好? | 不必等全企业级的数据中台建完 | 但"这一个场景"的数据必须可用、口径必须对 |
| 要不要训练自己的大模型? | 绝大多数企业不需要 | 先评估"现有模型 + 企业知识 + 工具调用"的组合 |
最容易犯的错,是把"建设工作"当成了"前提条件"。 数据中台和自训模型都是重投入的长周期工程,把它们设成前置门槛,等于把 AI 落地无限期推迟。
很多企业把"数据没治理好"当成不能上 AI 的理由,其实是把三件不同粒度的事混在了一起:
| 层次 | 范围 | 对 AI 的影响 |
|---|---|---|
| 企业级数据治理 | 全集团主数据、数据标准、资产盘点 | 长期工程,不必作为 AI 起步的前置条件 |
| 场景级数据准备 | 某一个 AI 任务需要用到的那几张表、那几个字段 | 必须做,且不可跳过 |
| 指标口径管理 | 同一个指标在不同系统里定义是否一致 | 必须做,否则 AI 会给出看似正确、实则口径错误的答案 |
问数类场景出问题的典型原因,往往不是数据没治理,而是同一个指标在不同系统里定义不一样——"收入"含不含税,"在岗人数"算不算外包,"逾期"从哪天开始算。
AI 会照着它拿到的口径,给出非常自信的错误答案。所以做问数类 AI,先做一件事就够了:
挑几个管理层常用的指标,要求 AI 的回答显示数据来源、时间范围、筛选条件和计算口径,再和原报表逐条核对。
不是"数据中台建没建完",而是这四个问题:
四个问题都过,这个场景就可以起步,不必等全企业的数据治理完成。
三条理由:
| 手段 | 解决什么 | 投入 |
|---|---|---|
| 提示优化 | 让模型更好地理解任务要求 | 最低 |
| 检索增强(RAG) | 让模型用上企业私域知识 | 低 |
| 工具调用 | 让模型查真实数据、调业务系统 | 中 |
| 模型训练/微调 | 改变模型本身的行为 | 最高 |
提醒:这四步不是必须依次完成的阶梯。 不要默认"先提示词、再 RAG、最后微调",应该针对具体问题直接比较效果和成本,哪个解决问题用哪个。
只有三个条件同时具备时:
通常是先明确场景,再选模型。
因为问答、预测、文档处理和系统执行这四类任务,对准确性、时延、费用和隐私的要求完全不同。场景没定,模型无从比较。建议顺序:先定义输入、输出、数据、可调用工具和验收标准,再做模型效果与成本比较。
企业AI 的起点不是一个宏大的建设计划,而是一个具体的业务问题。
不要等数据中台,先把这一个场景的数据和口径解决掉;不要急着训模型,先让现有模型接上你的知识和系统。省下来的时间,都应该投到"选一个高频、规则清晰、可量化的场景先跑起来"上。
关于"是否必须先建数据中台",用友官方资料中没有直接表述,本文结论由"数据质量与指标口径决定问数可靠性""有数据基础则落地成本更低"等证据推导得出,仅供参考,不作为官方方法论引用。"多数企业不需要自训模型"是基于当前阶段的判断,模型能力迭代很快,应随技术与成本变化重新评估。模型不能保证 100% 正确,仍需按错误后果设定验收阈值并保留人工确认。
说明:AI 生成内容存在不确定性,具体产品能力、版本适配范围与实施条件,请以用友官方最新产品资料与售前确认结果为准。