Entraîner une IA sur ses propres données : ce qui marche
Presque tout dirigeant qui veut une IA sur les données de son entreprise demande une chose dont il n'a pas besoin. La solution moins chère fonctionne mieux et se vérifie plus facilement.
TerenceEntraîner une IA sur ses propres données. C'est ainsi que la plupart des dirigeants le formulent quand ils appellent. Ils veulent un assistant qui connaisse leurs tarifs, leurs contrats, leurs manuels et les accords passés un jour avec un client. Pas une IA qui connaît internet, mais une qui connaît leur entreprise. Parfaitement logique. Sauf que neuf fois sur dix, entraîner n'est pas ce qu'il faut faire, et cela change beaucoup de choses au budget.
Cet article traite de trois choses : les trois sens qui se cachent derrière cette seule phrase, celui que vous visez probablement, et là où cela dérape en pratique. Avec les chiffres, et sans jargon technique.
Trois sens possibles pour entraîner une IA sur ses propres données
Quand trois dirigeants prononcent la même phrase, ils veulent souvent dire trois choses différentes. Cela vaut la peine de les distinguer, car un facteur mille sépare leurs prix.
- Joindre des documents à une conversation. Vous glissez un pdf dans une fenêtre de discussion et vous posez des questions dessus. Gratuit, immédiat, et effacé à la fin de la conversation.
- Laisser l'IA chercher dans vos propres archives. Vos documents sont préparés de sorte que chaque question fasse d'abord remonter les bons passages, et la réponse s'appuie dessus, avec le document cité.
- Ajuster le modèle lui-même. Vous faites apprendre un modèle d'IA existant sur votre matière, pour que son comportement change.
Le premier, presque tout le monde l'utilise déjà. Le troisième, c'est ce que la plupart des gens veulent dire quand ils parlent d'entraînement. Et le deuxième, c'est ce qu'ils veulent vraiment.
Le troisième, nous le construisons rarement. Non pas parce que c'est impossible, mais parce que dans presque tous les cas cela ne vous apporte rien et vous le payez quand même. Si quelqu'un vous vend un modèle entraîné sur vos données, demandez d'abord ce qui se passe de mal s'il ne le fait pas.
Pourquoi réentraîner un modèle n'est presque jamais la réponse
Le réentraînement change la manière dont un modèle se comporte : le ton qu'il adopte, le format qu'il tient, le vocabulaire métier qu'il emploie. Ce qu'il ne fait pas de façon fiable, c'est retenir des faits. Et les faits sont exactement ce que vous cherchez quand vous voulez savoir quelle durée de garantie figure dans ce contrat de 2023.
- Les faits se brouillent. Un modèle réentraîné donne une réponse qui sonne comme vos documents, pas nécessairement ce qu'ils disent.
- Vous ne pouvez pas vérifier d'où vient la réponse. Aucun document, aucun numéro de page, aucun contrôle.
- Chaque modification coûte un nouveau tour. Nouveau tarif en janvier ? On recommence.
- Retirer quelque chose est compliqué. Un client qui demande si ses données ont vraiment disparu n'acceptera pas en grande partie comme réponse.
- C'est nettement plus cher que les alternatives, en argent et en délai.
Il existe une exception, franchement rare dans une PME. Si vous devez produire de très nombreuses fois par jour exactement le même type de texte dans une forme fixe qui vous est propre, pensez à des milliers de courtes évaluations standardisées, le réentraînement peut avoir du sens. Vous achetez alors une forme, pas un savoir. Si vous ne vous reconnaissez pas là-dedans, ce n'est pas pour vous.
Ce qui marche : d'abord chercher, ensuite répondre
Ce dont vous avez presque toujours besoin est plus simple à comprendre. Vos documents, donc manuels, devis, contrats, comptes rendus et accords tarifaires, sont préparés pour qu'on puisse y chercher par le sens et pas seulement par les mots exacts. Quelqu'un pose une question en langage courant. Le système remonte les quelques passages qui comptent vraiment. C'est seulement ensuite que la réponse est rédigée, sur la base de ces passages.
La différence avec la fonction de recherche que vous avez aujourd'hui : celle-ci trouve des fichiers, l'autre trouve des réponses. Cherchez garantie panneau solaire aujourd'hui et vous récupérez douze noms de fichiers, à vous de lire. Dans l'autre cas vous obtenez : cinq ans sur la pose, vingt-cinq ans sur le panneau, avec en dessous le document d'où cela vient.
Cette référence à la source n'est pas décorative. C'est la seule chose qui permet à quelqu'un de vérifier que la réponse est juste avant d'agir. Un système incapable de citer sa source n'est pas fini pour un usage professionnel.
traitement unique de mille pages, aux tarifs publiés
Je commence par un premier échange gratuit. Nous parlons des tâches qui prennent du temps, de tes outils et de ce que l’automatisation pourrait apporter. Tu reçois ensuite une proposition avec les possibilités d’automatisation, les connexions, le calendrier et les coûts.
Là où ça dérape : pas dans la technique, mais dans vos documents
Dans presque tous les projets qui butent là-dessus, la cause n'est pas l'IA. Cinq classiques.
- Des versions contradictoires. S'il y a trois tarifs dans le dossier et qu'aucun ne fait foi, vous obtiendrez tantôt l'un, tantôt l'autre. Ce n'est pas une erreur de l'IA, ce sont vos archives.
- Des documents scannés sans texte. Une pièce jointe photographiée n'est qu'une image pour un ordinateur. Solvable, mais c'est du travail.
- Les droits d'accès. Si tout devient interrogeable, le dossier du personnel le devient aussi. Qui peut voir quoi se règle avant, pas après que quelqu'un l'a trouvé.
- Le savoir qui n'existe que dans les têtes. Ce qui n'est écrit nulle part ne peut pas être retrouvé. Parfois la première étape est d'écrire enfin les dix questions les plus fréquentes.
- Trop peu de questions. Si l'on cherche quelque chose cinq fois par semaine, vous ne rentabiliserez pas un système. Alors un dossier bien rangé est la réponse.
Un assistant qui cherche dans des documents en désordre rend le désordre visible au lieu de le résoudre. Si nous voyons dès le premier entretien que le vrai problème est l'archivage, nous le disons. La première étape est alors de ranger, pas de construire.
Nous voulons un modèle dans notre langue, et pourquoi c'est un malentendu
Raisonnement logique : vos documents sont dans une langue, donc vous voulez un modèle fait pour cette langue. En septembre 2025 est parue la première étude sérieuse qui teste cela. Des spécialistes du traitement des langues de l'Université d'Anvers ont bâti MTEB-NL, une mesure avec quarante jeux de tests néerlandais, dont des textes juridiques et des appels d'offres.
Le résultat est contre-intuitif. Les modèles construits spécialement sur du texte néerlandais, BERTje et RobBERT, ont obtenu 17,6 et 18,3 points pour retrouver le bon passage. Les modèles multilingues internationaux atteignaient 59,1. Pour reconnaître et classer des textes, ces mêmes modèles s'en sortaient correctement, 50,9 contre 60,2. Ils comprennent bien la langue. Ils ne trouvent simplement rien.
score de recherche d'un modèle propre à une langue face à un modèle multilingue (MTEB-NL, Université d'Anvers, septembre 2025)
L'explication figure dans la même étude : chercher est une compétence à part, sur laquelle un modèle doit être réglé séparément. Prenez le même modèle et réglez-le pour la recherche, et le score passe de 18,3 à 51,6. Ce n'est donc pas la langue du modèle qui compte, mais le fait qu'il ait été évalué sur la recherche dans votre langue. Posez cette question. Il est fait pour votre langue n'y répond pas.
Vos documents restent-ils dans le pays ?
C'est la question la plus posée et la moins souvent correctement traitée. Pour la partie recherche, bonne nouvelle : les modèles les plus performants de cette étude sont librement disponibles et peuvent tourner sur votre propre serveur. L'un des bons élèves est de plus assez petit pour ne pas exiger de machine lourde. Vos archives n'ont donc pas à quitter les murs.
Pour la rédaction de la réponse, c'est autre chose. On y emploie généralement un grand modèle d'un grand fournisseur, et la question devient : où tourne-t-il ? Certains fournisseurs proposent un traitement en Europe, d'autres non, et cela varie selon les parties de leur offre. Posez la question, faites-la inscrire au contrat, et ne vous contentez pas d'un ça va aller.
Quelle taille d'archives faut-il pour que cela vaille le coup ?
Il existe une règle empirique. Avec une poignée de documents, vous pouvez simplement les joindre à chaque fois. Cela fonctionne bien et coûte moins cher. Au-delà d'une quarantaine de pages, la bascule se produit : tout joindre devient plus cher que chercher de façon ciblée, quelle que soit la fréquence d'usage. Et plus vos archives grandissent ensuite, moins cela compte. En recherche ciblée, une question sur mille pages coûte pratiquement autant qu'une question sur quarante.
Concrètement : un catalogue produits, un dossier de contrats ou un ensemble de notices de pose se situent toujours bien au-dessus. Cinq procédures et un livret d'accueil, non.
Où en sont les PME aujourd'hui
Ce n'est pas un combat d'arrière-garde, mais pas non plus une course déjà perdue. Selon l'institut néerlandais de la statistique, 33 pour cent des entreprises de dix salariés ou plus utilisaient l'IA en 2025, contre 23 pour cent en 2024 et 14 pour cent en 2023. Dans la tranche de dix à cinquante salariés, on est à 28 pour cent.
usage de l'IA dans les entreprises de 10 salariés ou plus en 2025 ; de 10 à 50 salariés, 28 pour cent (statistique néerlandaise)
Et cet usage est superficiel. Une étude sur l'usage de l'IA dans les PME publiée par le gouvernement néerlandais en septembre 2025 montre qu'il porte surtout sur la rédaction de textes, la communication et le résumé de documents. Les applications plus spécialisées restent rares. C'est donc exactement là, dans le travail attaché à vos propres documents, que la place est encore libre.
Plus intéressante que le pourcentage est la raison pour laquelle les entreprises ne se lancent pas. Dans ces mêmes chiffres, les non-utilisateurs citent le manque de connaissances et d'expérience environ quatre fois plus souvent que le coût trop élevé. Ce n'est donc pas un problème d'argent. C'est un problème de je ne sais pas par où commencer.
Comment vous y prendre
- Pendant deux semaines, notez quelles questions sont réellement posées et où se trouvait la réponse. Pas de mémoire, mais par écrit, avec le temps qu'a pris la recherche.
- Comptez le nombre de pages réellement concernées. C'est souvent une fraction de ce qui dort dans le dossier.
- Désignez un document de référence par sujet et sortez le reste de la source. C'est l'étape dont dépend tout le projet.
- Commencez par un seul type de question d'une seule équipe. Pas tout interrogeable, mais nos techniciens peuvent consulter les notices de pose.
- Exigez une source pour chaque réponse et faites contrôler les réponses par sondage pendant une semaine par deux personnes.
- Au bout d'un mois, mesurez la même chose qu'à l'étape un. Si le temps de recherche n'a pas baissé, vous arrêtez.
Le résultat est rarement spectaculaire à regarder. Il n'apparaît pas de robot malin. Il apparaît quelqu'un qui n'a plus besoin d'appeler trois collègues pour savoir quelle garantie s'applique. La remarque que nous entendons le plus souvent après la livraison ne porte d'ailleurs pas sur l'IA, mais sur les documents : on ne savait pas que c'était un tel fouillis.
Ne le faites pas si vos documents doivent encore être écrits plutôt que retrouvés, s'il y a une poignée de questions par semaine, ou si le vrai problème est que personne ne sait quel document fait foi. Ce dernier point se règle par un accord, pas par un logiciel.
Prêt à commencer?
Demandez une consultation gratuite. Nous regardons ensemble où vous perdez du temps.
Planifier un appel gratuit