企业打算上 AI 的时候,有两个问题几乎一定会被提出来:
一是"我们数据中台还没建完,是不是得先建好再说";二是"要不要训练一个我们自己的行业大模型"。
这两个问题的答案,可能和很多人想的不一样。
| 问题 | 结论 | 真正的前提 |
|---|---|---|
| 要不要先把数据中台建好? | 不必等全企业级的数据中台建完 | 但"这一个场景"的数据必须可用、口径必须对 |
| 要不要训练自己的大模型? | 绝大多数企业不需要 | 先评估"现有模型 + 企业知识 + 工具调用"的组合 |
最常见的错误,是把"建设工作"当成了"前提条件"。 数据中台和自训模型都是重投入的长周期工程,一旦把它们设成门槛,AI 落地基本就无限期推迟了。
很多人说"数据没治理好,所以不能上 AI",其实混淆了三件不同粒度的事:
问数类 AI 出问题的典型原因,往往不是数据没治理,而是同一个指标在不同系统里定义不一样:
AI 会照着它拿到的口径,给出非常自信的错误答案。
一个立刻能做的检查: 挑几个管理层常用的指标,要求 AI 的回答显示数据来源、时间范围、筛选条件和计算口径,然后和原报表逐条核对。这一条做下来,能挡掉大部分问数类事故。
不必问"数据中台建没建完",问这四个:
四个都过,就可以起步。
第一,成本高、难度大。 2024 年流行过企业微调自己的垂类模型,实践下来投入和复杂度都远超预期。
第二,不划算。 通用大模型的迭代速度和泛化能力,已经明显超过企业自己微调的垂类模型。你花大力气训出来的效果,可能几个月后就被新一代通用模型追平了。
第三,有更便宜的解法。 企业真正缺的往往不是"更懂行业的模型",而是让模型能够访问企业私域知识和业务系统。
| 手段 | 解决什么 | 投入 |
|---|---|---|
| 提示优化 | 让模型更好理解任务 | 最低 |
| 检索增强(RAG) | 让模型用上企业私域知识 | 低 |
| 工具调用 | 让模型查真实数据、调业务系统 | 中 |
| 模型训练/微调 | 改变模型本身行为 | 最高 |
注意:这四步不是必须依次完成的阶梯。 别默认"先提示词、再 RAG、最后微调",应该针对具体问题直接比较效果和成本。
三个条件同时具备:
通常先明确场景,再选模型。
因为问答、预测、文档处理和系统执行这四类任务,对准确性、时延、费用和隐私的要求完全不同。场景没定,模型无从比较。
企业AI 的起点不是一个宏大的建设计划,而是一个具体的业务问题。
不要等数据中台,先把这一个场景的数据和口径解决掉;不要急着训模型,先让现有模型接上你的知识和系统。省下的时间,投到"选一个高频、规则清晰、可量化的场景先跑起来"上,比什么都值。