KI mit eigenen Daten trainieren: was geht und was nicht

Fast jeder Unternehmer, der KI auf seinen eigenen Firmendaten will, fragt nach etwas, das er nicht braucht. Die günstigere Lösung funktioniert besser und ist leichter zu prüfen.

Terence
9 Min. Lesen

KI mit eigenen Daten trainieren. So formulieren es die meisten Unternehmer, wenn sie anrufen. Sie wollen einen Assistenten, der ihre Preislisten kennt, ihre Verträge, ihre Handbücher und die Absprachen, die einmal mit einem Kunden getroffen wurden. Keine KI, die das Internet kennt, sondern eine, die ihren Betrieb kennt. Völlig logisch. Nur ist Trainieren in neun von zehn Fällen nicht das, was passieren muss, und das spart eine Menge Geld.

In diesem Artikel geht es um drei Dinge: welche drei Bedeutungen hinter diesem einen Satz stecken, welche Sie vermutlich meinen, und wo es in der Praxis schiefgeht. Mit Zahlen, aber ohne Technikgerede.

Drei Dinge, die KI mit eigenen Daten trainieren bedeuten kann

Wenn drei Unternehmer denselben Satz sagen, meinen sie oft drei verschiedene Dinge. Es lohnt sich, das auseinanderzuziehen, denn im Preis liegt dazwischen der Faktor tausend.

  • Dokumente in ein Gespräch mitgeben. Sie ziehen ein PDF in ein Chatfenster und stellen Fragen dazu. Kostenlos, sofort, und nach dem Gespräch wieder weg.
  • KI in Ihrem eigenen Archiv nachschlagen lassen. Ihre Dokumente werden so aufbereitet, dass zu jeder Frage zuerst die passenden Stellen herausgeholt werden und die Antwort darauf beruht, mit Angabe des Dokuments.
  • Das Modell selbst nachschärfen. Sie lassen ein bestehendes KI-Modell an Ihrem Material weiterlernen, sodass sich sein Verhalten ändert.

Nummer eins nutzt fast jeder schon. Nummer drei ist das, was die meisten meinen, wenn sie trainieren sagen. Und Nummer zwei ist das, was sie eigentlich wollen.

Nummer drei bauen wir selten. Nicht weil es nicht ginge, sondern weil es Ihnen in fast allen Fällen nichts bringt und trotzdem Geld kostet. Verkauft Ihnen jemand ein Modell, das auf Ihren Daten trainiert wurde, fragen Sie zuerst, was schiefgeht, wenn er es nicht tut.

Warum das Nachtrainieren eines KI-Modells fast nie die Antwort ist

Nachtrainieren verändert, wie sich ein Modell verhält: welchen Ton es anschlägt, welches Format es einhält, welche Fachbegriffe es verwendet. Was es nicht zuverlässig tut, ist sich Fakten merken. Und Fakten sind genau das, wonach Sie suchen, wenn Sie wissen wollen, welche Gewährleistungsfrist in dem Vertrag von 2023 steht.

  • Fakten verschwimmen. Ein nachtrainiertes Modell gibt eine Antwort, die klingt wie Ihre Dokumente klingen, nicht unbedingt das, was darin steht.
  • Sie können nicht nachprüfen, woher die Antwort kommt. Kein Dokument, keine Seitenzahl, keine Kontrolle.
  • Jede Änderung kostet eine neue Runde. Neue Preisliste im Januar? Dann von vorn.
  • Entfernen ist schwierig. Ein Kunde, der fragt, ob seine Daten wirklich weg sind, nimmt größtenteils nicht als Antwort.
  • Es ist deutlich teurer als die Alternativen, in Geld und in Zeit.

Es gibt eine Ausnahme, und die ist im Mittelstand ehrlich gesagt selten. Müssen Sie sehr oft am Tag genau dieselbe Art Text in einer eigenen festen Form produzieren, denken Sie an tausende kurze standardisierte Beurteilungen, dann kann Nachtrainieren sinnvoll sein. Dann kaufen Sie Form, nicht Wissen. Erkennen Sie sich darin nicht wieder, ist es nichts für Sie.

Was funktioniert: erst nachschlagen, dann antworten

Was Sie fast immer brauchen, ist einfacher zu verstehen. Ihre Dokumente, also Handbücher, Angebote, Verträge, Protokolle und Preisabsprachen, werden so aufbereitet, dass darin nach Bedeutung gesucht werden kann und nicht nur nach exakten Wörtern. Jemand stellt eine Frage in normaler Sprache. Das System holt die wenigen Stellen heraus, auf die es wirklich ankommt. Erst danach wird die Antwort formuliert, auf Basis dieser Stellen.

Der Unterschied zur Suchfunktion, die Sie heute haben: die findet Dateien, das hier findet Antworten. Suchen Sie heute nach Garantie Solarmodul, bekommen Sie zwölf Dateinamen zurück und dürfen selbst lesen. Im anderen Fall bekommen Sie: fünf Jahre auf die Montage, fünfundzwanzig Jahre auf das Modul selbst, und darunter steht, aus welchem Dokument das stammt.

Diese Quellenangabe ist keine Dekoration. Sie ist das Einzige, womit jemand prüfen kann, ob die Antwort stimmt, bevor er danach handelt. Ein System, das keine Quelle nennen kann, ist für den betrieblichen Einsatz nicht fertig.

~1 Cent

einmalige Aufbereitung von tausend Seiten, zu veröffentlichten Tarifen

Ich beginne mit einem kostenlosen Kennenlerngespräch. Wir besprechen, was Zeit kostet, welche Systeme du nutzt und wo Automatisierung helfen kann. Danach erhältst du ein Angebot mit Automatisierungsmöglichkeiten, Anbindungen, Zeitplan und Kosten.

Wo es schiefgeht: nicht in der Technik, sondern in Ihren Dokumenten

In praktisch jedem Projekt, das hieran scheitert, liegt die Ursache nicht bei der KI. Fünf Klassiker.

  • Widersprüchliche Versionen. Liegen drei Preislisten im Ordner und keine ist die maßgebliche, bekommen Sie mal die eine und mal die andere. Das ist kein Fehler der KI, das ist Ihr Archiv.
  • Eingescannte Dokumente ohne Text. Ein abfotografierter Anhang ist für einen Computer ein Bild. Lösbar, aber es ist Arbeit.
  • Rechte. Wird alles durchsuchbar, wird auch die Personalakte durchsuchbar. Wer was sehen darf, regeln Sie vorher, nicht nachdem es jemand gefunden hat.
  • Wissen, das nur in Köpfen steckt. Was nirgends steht, kann auch nicht gefunden werden. Manchmal ist der erste Schritt: schreiben Sie die zehn häufigsten Dinge einmal auf.
  • Zu wenige Fragen. Wird pro Woche fünfmal etwas nachgeschlagen, holen Sie kein System wieder rein. Dann ist ein aufgeräumter Ordner die Antwort.

Ein Assistent, der in unordentlichen Dokumenten sucht, macht die Unordnung sichtbar, statt sie zu beseitigen. Sehen wir im ersten Gespräch, dass das eigentliche Problem das Archiv ist, sagen wir das. Dann ist der erste Schritt aufräumen und nicht bauen.

Wir wollen ein Modell in unserer Sprache, und warum das ein Missverständnis ist

Naheliegender Gedanke: Ihre Dokumente sind in einer Sprache, also wollen Sie ein Modell für genau diese Sprache. Im September 2025 erschien die erste ernsthafte Untersuchung, die das prüft. Sprachtechnologen der Universität Antwerpen bauten MTEB-NL, einen Maßstab mit vierzig niederländischen Testsätzen, darunter juristische Texte und Ausschreibungen.

Das Ergebnis ist kontraintuitiv. Modelle, die eigens auf niederländischem Text gebaut wurden, BERTje und RobBERT, erreichten beim Auffinden der richtigen Textstelle 17,6 und 18,3 Punkte. Mehrsprachige, internationale Modelle kamen auf 59,1. Beim Erkennen und Einordnen von Texten schnitten dieselben Modelle durchaus ordentlich ab, 50,9 gegen 60,2. Sie verstehen die Sprache gut. Sie finden nur nichts.

17,6 vs 59,1

Suchwert eines sprachspezifischen Modells gegenüber einem mehrsprachigen Modell (MTEB-NL, Universität Antwerpen, September 2025)

Die Erklärung steht in derselben Untersuchung: Suchen ist eine eigene Fähigkeit, auf die ein Modell eigens abgestimmt sein muss. Nehmen Sie dasselbe Modell und stimmen Sie es auf Suchen ab, springt der Wert von 18,3 auf 51,6. Es geht also nicht um die Sprache des Modells, sondern darum, ob es auf das Suchen in Ihrer Sprache geprüft wurde. Fragen Sie danach. Es ist ein Modell für Ihre Sprache ist keine Antwort darauf.

Bleiben Ihre Dokumente im Land?

Das ist die Frage, die am häufigsten gestellt und am seltensten ordentlich beantwortet wird. Für den Suchteil gibt es gute Nachrichten: die bestplatzierten Modelle aus dieser Untersuchung sind frei verfügbar und können auf Ihrem eigenen Server laufen. Eines der gut abschneidenden Modelle ist zudem so klein, dass keine schwere Maschine nötig ist. Ihr Archiv muss das Haus also nicht verlassen.

Beim Formulieren der Antwort sieht es anders aus. Dort kommt meist ein großes Modell eines großen Anbieters zum Einsatz, und dann ist die Frage, wo das läuft. Manche Anbieter bieten Verarbeitung innerhalb Europas an, andere nicht, und es unterscheidet sich je nach Teil ihres Angebots. Fragen Sie danach, lassen Sie es in den Vertrag schreiben und geben Sie sich nicht mit das passt schon zufrieden.

Wie groß muss Ihr Archiv sein, damit sich das lohnt?

Es gibt eine Faustregel. Bei einer Handvoll Dokumente können Sie sie schlicht jedes Mal mitgeben. Das funktioniert gut und ist günstiger. Oberhalb von etwa vierzig Seiten kippt das: alles mitzugeben wird dann teurer als gezielt nachzuschlagen, egal wie oft Sie es nutzen. Und je größer Ihr Archiv danach wird, desto weniger macht es aus. Beim gezielten Nachschlagen kostet eine Frage zu tausend Seiten praktisch dasselbe wie eine Frage zu vierzig.

Praktisch gesehen: ein Produktkatalog, ein Ordner mit Verträgen oder eine Sammlung von Montagevorschriften liegt immer deutlich darüber. Fünf Verfahrensanweisungen und ein Mitarbeiterhandbuch nicht.

Wo der Mittelstand heute steht

Das ist kein Rückzugsgefecht, aber auch kein Rennen, das Sie schon verloren haben. Nach Angaben des niederländischen Statistikamts nutzten 2025 33 Prozent der Betriebe mit zehn oder mehr Beschäftigten KI, gegenüber 23 Prozent 2024 und 14 Prozent 2023. In der Spanne von zehn bis fünfzig Beschäftigten liegt das bei 28 Prozent.

33%

KI-Nutzung bei Betrieben mit 10 oder mehr Beschäftigten 2025; bei 10 bis 50 Beschäftigten 28 Prozent (Statistikamt der Niederlande)

Und diese Nutzung ist flach. Eine im September 2025 von der niederländischen Regierung veröffentlichte Untersuchung zur KI-Nutzung im Mittelstand zeigt, dass sie sich vor allem auf Texte schreiben, Kommunikation und das Zusammenfassen von Dokumenten richtet. Spezialisiertere Anwendungen kommen kaum vor. Genau dort also, bei der Arbeit, die an Ihren eigenen Dokumenten hängt, ist es noch offen.

Interessanter als der Prozentsatz ist der Grund, warum Betriebe nicht anfangen. In denselben Zahlen nennen Nichtnutzer fehlendes Wissen und fehlende Erfahrung etwa viermal so oft als Grund wie zu hohe Kosten. Es ist also kein Geldproblem. Es ist ein Ich-weiß-nicht-wo-ich-anfangen-soll-Problem.

So gehen Sie vor

  • Halten Sie zwei Wochen lang fest, welche Fragen tatsächlich gestellt werden und wo die Antwort stand. Nicht aus dem Kopf, sondern aufgeschrieben, mit der Zeit, die das Suchen gekostet hat.
  • Zählen Sie, um wie viele Seiten es wirklich geht. Meist ist das ein Bruchteil dessen, was im Ordner liegt.
  • Bestimmen Sie je Thema ein maßgebliches Dokument und nehmen Sie den Rest aus der Quelle. An diesem Schritt steht und fällt das Projekt.
  • Beginnen Sie mit einer Art Frage aus einem Team. Nicht alles durchsuchbar, sondern unsere Monteure können die Montagevorschriften abrufen.
  • Verlangen Sie zu jeder Antwort eine Quellenangabe und lassen Sie zwei Personen eine Woche lang Stichproben machen.
  • Messen Sie nach einem Monat dasselbe wie in Schritt eins. Ist die Suchzeit nicht gesunken, hören Sie auf.

Was dabei herauskommt, ist selten spektakulär anzusehen. Es kommt kein schlauer Roboter. Es kommt jemand, der nicht mehr drei Kollegen anrufen muss, um zu wissen, welche Gewährleistungsfrist gilt. Die Bemerkung, die wir nach der Übergabe am häufigsten hören, betrifft übrigens nicht die KI, sondern die Dokumente: dass wir nicht wussten, was für ein Durcheinander das ist.

Lassen Sie es, wenn Ihre Dokumente erst noch geschrieben statt gefunden werden müssen, wenn es pro Woche eine Handvoll Fragen gibt, oder wenn das eigentliche Problem ist, dass niemand weiß, welches Dokument gilt. Letzteres lösen Sie mit einer Absprache, nicht mit Software.

Bereit loszulegen?

Kostenloses Gespräch anfragen. Wir schauen gemeinsam, wo Sie Zeit verlieren.

Kostenloses Gespräch planen

Erkennen Sie das in Ihrem Unternehmen?

Planen Sie ein kostenloses Gespräch. Wir schauen gemeinsam, wo Sie Zeit verlieren, und ob KI die Lösung ist.

Kostenloses Gespräch planen