用自己的数据训练AI:什么可行,什么不可行
几乎每位想让AI用上自家公司数据的老板,要的都是自己并不需要的东西。更便宜的做法效果更好,也更容易核查。
Terence用自己的数据训练AI。打电话来的老板们大多这么说。他们想要一个懂自家价目表、合同、说明书,以及当年和某位客户谈定条款的助手。不是懂互联网的AI,而是懂他们公司的AI。完全合理。只不过十次里有九次,要做的并不是训练,而这能省下不少钱。
这篇文章讲三件事:这一句话背后藏着的三种含义、你多半指的是哪一种,以及实际操作中会在哪里出问题。有数字,没有技术黑话。
用自己的数据训练AI可能指的三件事
三位老板说同一句话,往往指的是三件不同的事。把它们分开很值得,因为它们之间的价格能差上一千倍。
- 把文档带进一次对话。你把一个pdf拖进聊天窗口然后就它提问。免费、即时,对话结束就没了。
- 让AI在你自己的档案里查。你的文档经过处理,使得每个问题先调出正确的段落,答案基于这些段落,并注明出自哪份文件。
- 改造模型本身。你让一个现成的AI模型在你的材料上继续学习,从而改变它的行为方式。
第一种几乎人人都在用了。第三种是大多数人说训练时心里想的。而第二种才是他们真正想要的。
第三种我们很少做。不是做不了,而是在几乎所有情况下它对你毫无帮助,钱却照付。如果有人向你兜售一个用你的数据训练过的模型,先问问他:不这么做会出什么问题。
为什么再训练一个模型几乎从来不是答案
再训练改变的是模型的行为方式:它的语气、它保持的格式、它使用的行业词汇。它做不好的,恰恰是记住事实。而当你想知道2023年那份合同里写的保修期是多久时,你要的正是事实。
- 事实会变模糊。再训练过的模型给出的回答听起来像你的文档,但未必是文档里写的内容。
- 你无法核查答案从哪里来。没有文件、没有页码、没有把关。
- 每次变动都要再来一轮。一月份换了新价目表?那就重来。
- 删除很麻烦。客户问他的数据是不是真的删干净了,他不会接受大部分这种答复。
- 它比其他做法贵得多,无论是花钱还是花时间。
有一个例外,说实话在中小企业里很少见。如果你每天要大量产出完全相同类型、格式固定的文本,比如成千上万条标准化的简短评估,那么再训练可能有意义。那时你买的是形式,不是知识。如果你不属于这种情况,那它就不适合你。
真正管用的做法:先查,再答
你几乎总是需要的那件事,反而更好理解。你的文档,也就是说明书、报价单、合同、会议纪要和价格约定,经过处理后可以按含义检索,而不只是按字面词句。有人用日常语言提出一个问题。系统调出真正相关的那几段。之后才根据这几段写出答案。
和你现在的搜索功能的区别是:那个找到的是文件,这个找到的是答案。今天你搜太阳能板保修,会得到十二个文件名,然后自己去读。换成另一种,你得到的是:安装五年,面板本身二十五年,下面还标着这出自哪份文件。
标注来源不是装饰。它是别人在照着答案行动之前唯一能核实对错的依据。说不出来源的系统,对企业使用来说就是没做完。
一千页的一次性处理,按公开价格计算
我会先与你进行一次免费交流,了解哪些工作耗时、你使用哪些系统,以及自动化能在哪些方面帮忙。随后,你会收到包含自动化机会、系统连接、时间安排和费用的方案。
问题出在哪:不在技术,而在你的文档
几乎每一个卡在这里的项目,原因都不是AI。五种常见情况。
- 版本互相打架。文件夹里放着三份价目表而没有一份为准,那你有时拿到这份、有时拿到那份。这不是AI的错,是你的档案的问题。
- 扫描件没有文字。拍照拍下来的附件,对电脑来说只是一张图。能解决,但要花工夫。
- 权限。一旦什么都能检索,人事档案也就能检索了。谁能看什么要事先定好,而不是等有人翻出来之后。
- 只存在脑子里的经验。哪里都没写下来的东西,也就找不出来。有时第一步是:把那十件老被问到的事先写下来。
- 问得太少。如果一周只查五次,你回不了本。那答案是把文件夹整理好。
在杂乱文档里检索的助手,只会把杂乱显现出来,而不是把它解决掉。如果第一次交谈我们就看出真正的问题在档案本身,我们会直说。那第一步是整理,而不是开工。
我们想要本国语言的模型,为什么这是个误解
想法很合理:你的文档是某种语言写的,所以你想要专为这门语言做的模型。2025年9月出现了第一份认真检验这一点的研究。安特卫普大学的语言技术研究者做了MTEB-NL,一套包含四十个荷兰语测试集的标尺,其中还有法律文本和招标文件。
结果与直觉相反。专门基于荷兰语文本构建的模型,BERTje和RobBERT,在找出正确段落这项上得了17.6和18.3分。国际通用的多语言模型达到59.1。而在识别和归类文本上,同样这些模型表现还算可以,50.9对60.2。它们对语言的理解没问题。只是什么都找不到。
特定语言模型与多语言模型的检索得分(MTEB-NL,安特卫普大学,2025年9月)
解释就在同一份研究里:检索是一项单独的能力,模型必须单独为它调校。把同一个模型拿来针对检索调校一遍,分数就从18.3跳到51.6。所以关键不在模型是哪种语言的,而在它有没有在你的语言上就检索能力做过检验。要问的是这个。它是本国语言的模型并不能回答这个问题。
你的文档留在国内吗?
这是被问得最多、却最少被认真回答的问题。检索这一块有好消息:那份研究里表现最好的模型都是公开可得的,可以跑在你自己的服务器上。其中一个成绩不错的还小到不需要什么重型机器。也就是说,你的档案不必离开你的办公楼。
写答案这一块就不同了。那里通常用的是大厂的大模型,问题就变成它在哪里运行。有的厂商提供在欧洲境内处理,有的不提供,而且同一家不同产品之间也有差别。要问清楚,写进合同,别接受一句没问题就算了。
档案要多大,这件事才划算?
有个经验法则。只有几份文档时,你每次直接带上就行。这样很好用,也更便宜。超过大约四十页,天平就倒过来了:不管你用得多频繁,把全部内容都带上都会比有针对性地查更贵。而在那之后档案越大,差别反而越小。用有针对性的检索,问一千页的问题和问四十页的问题,花费几乎一样。
实际来说:一份产品目录、一个合同文件夹或一套安装规程,总是远远超过这条线。五份流程加一本员工手册则不然。
中小企业现在走到哪一步
这不是一场注定要输的仗,但也不是你已经落败的赛跑。据荷兰统计局的数据,2025年有33%的十人及以上企业使用了AI,2024年是23%,2023年是14%。在十到五十人这一档,这个比例是28%。
2025年10人及以上企业的AI使用率;10至50人为28%(荷兰统计局)
而且这种使用很浅。荷兰政府2025年9月发布的中小企业AI使用调查显示,用途主要集中在写文字、沟通和总结文档。更专门化的应用很少见。也就是说,恰恰是在与你自己的文档绑在一起的那部分工作上,位置还空着。
比百分比更有意思的是企业不动手的原因。在同一批数据中,未使用者提到缺乏知识和经验的次数,大约是提到成本太高的四倍。所以这不是钱的问题。这是我不知道从哪儿开始的问题。
该怎么着手
- 用两周时间记下真正被问到的问题,以及答案在哪儿。不要凭记忆,要写下来,连同找答案花掉的时间。
- 数一数实际涉及多少页。通常只是文件夹里那一堆的一小部分。
- 每个主题指定一份为准的文件,其余的从来源里拿掉。项目成败就在这一步。
- 从一个团队的一类问题开始。不是什么都能检索,而是我们的技术员可以调出安装规程。
- 要求每个答案都标出来源,并安排两个人抽查一周。
- 一个月后,测和第一步同样的指标。如果查找时间没下降,那就停。
这么做出来的东西,看上去很少有多惊艳。不会出现什么聪明的机器人。出现的是一个不用再打电话问三位同事、就知道适用哪种保修期的人。顺带一提,交付之后我们听到最多的一句话不是关于AI的,而是关于文档的:没想到乱成这样。
如果你的文档还得先写出来而不是找出来,如果一周只有几个问题,或者真正的问题是没人知道哪份文件为准,那就别做。最后这一条要靠一个约定来解决,而不是靠软件。