AI trainen op eigen data: wat kan wel en wat niet
Bijna elke ondernemer die AI op zijn eigen bedrijfsgegevens wil, vraagt om iets dat hij niet nodig heeft. De goedkopere oplossing werkt beter en is beter te controleren.
TerenceAI trainen op eigen data. Zo formuleren de meeste ondernemers het als ze bellen. Ze willen een assistent die hun prijslijsten kent, hun contracten, hun handleidingen en de afspraken die ooit met een klant zijn gemaakt. Geen AI die het internet kent, maar een die hun bedrijf kent. Volkomen logisch. Alleen is trainen negen van de tien keer niet wat er moet gebeuren, en dat scheelt een hoop geld.
Dit artikel gaat over drie dingen: welke drie betekenissen achter die ene zin schuilgaan, welke je waarschijnlijk bedoelt, en waar het in de praktijk misgaat. Met de cijfers erbij, en zonder techniekpraat.
Drie dingen die AI trainen op eigen data kan betekenen
Als drie ondernemers dezelfde zin uitspreken, bedoelen ze vaak drie verschillende dingen. Het loont om die uit elkaar te trekken, want ze schelen in prijs een factor duizend.
- Documenten meesturen in een gesprek. Je sleept een pdf in een chatvenster en stelt er vragen over. Gratis, direct, en na dat gesprek is het weg.
- AI laten opzoeken in je eigen archief. Je documenten worden zo verwerkt dat er bij elke vraag eerst de juiste passages uit worden gehaald, en het antwoord daarop wordt gebaseerd, met vermelding van het document erbij.
- Het model zelf bijschaven. Je laat een bestaand AI-model bijleren op jouw materiaal, zodat zijn gedrag verandert.
Nummer een gebruikt bijna iedereen al. Nummer drie is wat de meeste mensen bedoelen als ze trainen zeggen. En nummer twee is wat ze eigenlijk willen.
Wij bouwen nummer drie zelden. Niet omdat het niet kan, maar omdat je er in bijna alle gevallen niets aan hebt en er wel voor betaalt. Verkoopt iemand je een model dat op jouw gegevens is getraind, vraag dan eerst wat er misgaat als hij dat niet doet.
Waarom een AI-model bijtrainen bijna nooit het antwoord is
Bijtrainen verandert hoe een model zich gedraagt: welke toon het aanslaat, welk formaat het aanhoudt, welke vakwoorden het gebruikt. Wat het niet betrouwbaar doet, is feiten onthouden. En feiten zijn precies wat je zoekt als je wilt weten welke garantietermijn er in dat contract van 2023 staat.
- Feiten vervagen. Een bijgetraind model geeft een antwoord dat klinkt zoals jouw documenten klinken, niet per se wat er staat.
- Je kunt niet nakijken waar het antwoord vandaan komt. Geen document, geen paginanummer, geen controle.
- Elke wijziging kost een nieuwe ronde. Nieuwe prijslijst in januari? Dan opnieuw.
- Weghalen is lastig. Een klant die vraagt of zijn gegevens echt verwijderd zijn, neemt geen grotendeels als antwoord.
- Het is fors duurder dan de alternatieven, in geld en in doorlooptijd.
Er is een uitzondering, en die is eerlijk gezegd zeldzaam in het mkb. Moet je heel vaak per dag exact hetzelfde soort tekst produceren in een eigen vaste vorm, denk aan duizenden korte gestandaardiseerde beoordelingen, dan kan bijtrainen zin hebben. Dan koop je vorm, geen kennis. Herken je jezelf daar niet in, dan is het niet voor jou.
Wat wel werkt: eerst opzoeken, dan pas antwoorden
Wat je bijna altijd nodig hebt, is simpeler te begrijpen. Je documenten, dus handleidingen, offertes, contracten, notulen en prijsafspraken, worden zo verwerkt dat er op betekenis in gezocht kan worden en niet alleen op exacte woorden. Iemand stelt een vraag in gewone taal. Het systeem haalt de paar passages op die er echt toe doen. Pas daarna wordt het antwoord geformuleerd, op basis van die passages.
Het verschil met de zoekfunctie die je nu hebt: die vindt bestanden, dit vindt antwoorden. Zoek je nu op garantie zonnepaneel, dan krijg je twaalf bestandsnamen terug en mag je zelf gaan lezen. In het andere geval krijg je: vijf jaar op de montage, vijfentwintig jaar op het paneel zelf, en daaronder staat uit welk document dat komt.
Die bronvermelding is geen versiering. Het is het enige waarmee iemand kan controleren of het antwoord klopt voordat hij ernaar handelt. Een systeem dat geen bron kan noemen, is voor bedrijfsgebruik niet af.
eenmalige verwerking van duizend pagina's, bij gepubliceerde tarieven
Ik begin met een gratis kennismakingsgesprek. We bespreken waar tijd in gaat zitten, welke systemen je gebruikt en waar automatisering kan helpen. Daarna krijg je een voorstel met automatiseringskansen, koppelingen, planning en kosten.
Waar het misgaat: niet in de techniek, maar in je documenten
In vrijwel elk project dat hierop stukloopt, ligt de oorzaak niet bij de AI. Vijf klassiekers.
- Tegenstrijdige versies. Staan er drie prijslijsten in de map en is er geen leidende, dan krijg je soms de ene en soms de andere. Dat is geen fout van de AI, dat is je archief.
- Ingescande documenten zonder tekst. Een gefotografeerde bijlage is voor een computer een plaatje. Op te lossen, maar het is werk.
- Rechten. Wordt alles doorzoekbaar, dan wordt het personeelsdossier dat ook. Wie wat mag zien regel je vooraf, niet nadat iemand het gevonden heeft.
- Kennis die alleen in hoofden zit. Wat nergens staat, kan ook niet worden teruggevonden. Soms is de eerste stap: schrijf die tien veelgestelde dingen eens op.
- Te weinig vragen. Wordt er per week vijf keer iets opgezocht, dan verdien je geen systeem terug. Dan is een opgeruimde map het antwoord.
Een assistent die in rommelige documenten zoekt, maakt de rommel zichtbaar in plaats van dat hij hem oplost. Zien wij in een eerste gesprek dat het echte probleem het archief is, dan zeggen we dat. Dan is de eerste stap opruimen en niet bouwen.
Wij willen een Nederlands AI-model, en waarom dat een misverstand is
Logische gedachte: je documenten zijn Nederlands, dus je wilt een Nederlands model. In september 2025 verscheen het eerste serieuze onderzoek dat dit toetst. Taaltechnologen van de Universiteit Antwerpen bouwden MTEB-NL, een meetlat met veertig Nederlandse testsets, waaronder juridische teksten en aanbestedingen.
De uitkomst is contra-intuitief. Modellen die speciaal op Nederlandse tekst zijn gebouwd, BERTje en RobBERT, scoorden op het terugvinden van de juiste passage 17,6 en 18,3 punten. Meertalige, internationale modellen kwamen op 59,1. Op het herkennen en indelen van teksten deden diezelfde Nederlandse modellen het wel redelijk, 50,9 tegen 60,2. Ze snappen de taal prima. Ze vinden alleen niets.
zoekscore Nederlands model tegenover meertalig model (MTEB-NL, Universiteit Antwerpen, september 2025)
De verklaring staat in hetzelfde onderzoek: zoeken is een aparte vaardigheid waar een model apart op afgestemd moet zijn. Neem hetzelfde Nederlandse model en stem het wel af op zoeken, en de score springt van 18,3 naar 51,6. Het gaat dus niet om de taal van het model, maar of het op zoeken in het Nederlands is getoetst. Vraag daarnaar. Het is een Nederlands model is geen antwoord op die vraag.
Blijven je documenten in Nederland?
Dit is de vraag die het vaakst wordt gesteld en het minst vaak fatsoenlijk wordt beantwoord. Voor het zoekgedeelte is er goed nieuws: de best presterende modellen uit dat onderzoek zijn vrij beschikbaar en kunnen op je eigen server draaien. Een van de goed scorende modellen is bovendien zo klein dat er geen zware machine voor nodig is. Je archief hoeft het pand dus niet te verlaten.
Voor het formuleren van het antwoord ligt het anders. Daar wordt meestal een groot model van een grote aanbieder gebruikt, en dan is de vraag waar dat draait. Sommige aanbieders bieden verwerking binnen Europa aan, andere niet, en het verschilt per onderdeel van hun aanbod. Vraag ernaar, laat het opschrijven in het contract en neem geen genoegen met dat zit wel goed.
Hoe groot moet je archief zijn voordat dit loont?
Er is een vuistregel. Bij een handvol documenten kun je ze simpelweg elke keer meesturen. Dat werkt prima en is goedkoper. Boven ongeveer veertig pagina's kantelt dat: alles meesturen wordt dan duurder dan gericht opzoeken, hoe vaak je het ook gebruikt. En hoe groter je archief daarna wordt, hoe minder het uitmaakt. Bij gericht opzoeken kost een vraag over duizend pagina's vrijwel hetzelfde als een vraag over veertig.
Praktisch gezien: een productcatalogus, een map met contracten of een verzameling montagevoorschriften zit daar altijd ruim boven. Vijf procedures en een personeelshandboek niet.
Waar het mkb nu staat
Het is geen achterhoedegevecht, maar ook geen wedloop die je al verloren hebt. Volgens het CBS gebruikte in 2025 33 procent van de bedrijven met tien of meer medewerkers AI, tegen 23 procent in 2024 en 14 procent in 2023. In de band van tien tot vijftig medewerkers ligt dat op 28 procent.
AI-gebruik bij bedrijven met 10 of meer medewerkers in 2025; bij 10 tot 50 medewerkers 28 procent (CBS)
En dat gebruik is ondiep. Uit het onderzoek naar AI-gebruik in het mkb dat de rijksoverheid in september 2025 publiceerde, blijkt dat de inzet zich vooral richt op tekst schrijven, communicatie en het samenvatten van documenten. Meer gespecialiseerde toepassingen komen weinig voor. Precies daar, bij het werk dat aan je eigen documenten vastzit, ligt het dus nog open.
Interessanter dan het percentage is de reden dat bedrijven niet beginnen. In diezelfde CBS-cijfers noemen niet-gebruikers gebrek aan kennis en ervaring ongeveer vier keer zo vaak als reden als te hoge kosten. Het is dus geen geldprobleem. Het is een ik-weet-niet-waar-ik-moet-beginnen-probleem.
Zo pak je het aan
- Houd twee weken bij welke vragen er echt gesteld worden en waar het antwoord in stond. Niet uit je hoofd, maar opschrijven, met de tijd die het zoeken kostte.
- Tel hoeveel pagina's het werkelijk betreft. Meestal is dat een fractie van wat er in de map staat.
- Wijs per onderwerp een leidend document aan en haal de rest uit de bron. Dit is de stap waar het project op staat of valt.
- Begin met een soort vraag van een team. Niet alles doorzoekbaar, maar onze monteurs kunnen de montagevoorschriften opvragen.
- Eis bronvermelding bij elk antwoord en laat twee mensen een week lang steekproeven doen op de antwoorden.
- Meet na een maand hetzelfde als in stap een. Is de zoektijd niet gedaald, dan stop je ermee.
Wat dit oplevert is zelden spectaculair om te zien. Er komt geen slimme robot. Er komt iemand die niet meer drie collega's hoeft te bellen om te weten welke garantietermijn geldt. De vaakst gehoorde opmerking na oplevering gaat trouwens niet over de AI, maar over de documenten: dat we niet wisten dat het zo'n zooitje was.
Doe het niet als je documenten nog gemaakt moeten worden in plaats van opgezocht, als er per week een handvol vragen is, of als het echte probleem is dat niemand weet welk document geldt. Dat laatste los je op met een afspraak, niet met software.
Klaar om te starten?
Vraag een gratis gesprek aan. We kijken samen waar jij tijd verliest.
Plan gratis gesprek