Entrenar la IA con tus propios datos: qué funciona

Casi todo empresario que quiere IA sobre los datos de su empresa pide algo que no necesita. La opción más barata funciona mejor y es más fácil de comprobar.

Terence
9 min de lectura

Entrenar la IA con tus propios datos. Así lo plantean la mayoría de los empresarios cuando llaman. Quieren un asistente que conozca sus listas de precios, sus contratos, sus manuales y los acuerdos que un día se cerraron con un cliente. No una IA que conozca internet, sino una que conozca su empresa. Del todo lógico. Solo que nueve de cada diez veces entrenar no es lo que hay que hacer, y eso ahorra mucho dinero.

Este artículo trata tres cosas: los tres significados que se esconden tras esa única frase, cuál es el que probablemente quieres, y dónde falla en la práctica. Con las cifras delante y sin jerga técnica.

Tres cosas que puede significar entrenar la IA con tus propios datos

Cuando tres empresarios dicen la misma frase, a menudo quieren decir tres cosas distintas. Vale la pena separarlas, porque entre ellas hay un factor mil de diferencia en precio.

  • Adjuntar documentos a una conversación. Arrastras un pdf a una ventana de chat y preguntas sobre él. Gratis, inmediato, y desaparece al terminar esa conversación.
  • Dejar que la IA consulte tu propio archivo. Tus documentos se preparan de modo que ante cada pregunta se extraigan primero los pasajes correctos, y la respuesta se base en ellos, citando el documento.
  • Ajustar el modelo en sí. Haces que un modelo de IA existente aprenda de tu material para que cambie su comportamiento.

El primero ya lo usa casi todo el mundo. El tercero es lo que la mayoría quiere decir cuando dice entrenar. Y el segundo es lo que en realidad quiere.

El tercero lo construimos pocas veces. No porque no se pueda, sino porque en casi todos los casos no te aporta nada y aun así lo pagas. Si alguien te vende un modelo entrenado con tus datos, pregunta primero qué sale mal si no lo hace.

Por qué reentrenar un modelo casi nunca es la respuesta

El reentrenamiento cambia cómo se comporta un modelo: el tono que adopta, el formato que mantiene, los términos del oficio que usa. Lo que no hace de forma fiable es recordar hechos. Y los hechos son justo lo que buscas cuando quieres saber qué plazo de garantía figura en aquel contrato de 2023.

  • Los hechos se difuminan. Un modelo reentrenado da una respuesta que suena como suenan tus documentos, no necesariamente lo que dicen.
  • No puedes comprobar de dónde viene la respuesta. Ni documento, ni número de página, ni control.
  • Cada cambio cuesta otra ronda. ¿Nueva lista de precios en enero? Vuelta a empezar.
  • Retirar algo es complicado. Un cliente que pregunta si sus datos han desaparecido de verdad no acepta un en su mayor parte por respuesta.
  • Es bastante más caro que las alternativas, en dinero y en plazos.

Hay una excepción, y en una pyme es francamente rara. Si tienes que producir muchas veces al día exactamente el mismo tipo de texto en un formato fijo propio, piensa en miles de valoraciones breves estandarizadas, reentrenar puede tener sentido. Entonces compras forma, no conocimiento. Si no te reconoces ahí, no es para ti.

Lo que sí funciona: primero buscar, después responder

Lo que casi siempre necesitas es más fácil de entender. Tus documentos, es decir manuales, presupuestos, contratos, actas y acuerdos de precios, se preparan para que se pueda buscar en ellos por significado y no solo por palabras exactas. Alguien hace una pregunta en lenguaje corriente. El sistema extrae los pocos pasajes que de verdad importan. Solo después se redacta la respuesta, a partir de esos pasajes.

La diferencia con el buscador que tienes ahora: ese encuentra archivos, este encuentra respuestas. Busca hoy garantía panel solar y recibes doce nombres de archivo y te toca leer. En el otro caso recibes: cinco años en el montaje, veinticinco en el propio panel, y debajo de qué documento sale.

Esa cita de la fuente no es adorno. Es lo único que permite a alguien comprobar si la respuesta es correcta antes de actuar. Un sistema que no puede citar una fuente no está terminado para uso profesional.

~1 céntimo

procesamiento único de mil páginas, a tarifas publicadas

Empiezo con una conversación inicial gratuita. Hablamos de qué tareas llevan tiempo, qué sistemas usas y dónde podría ayudar la automatización. Después recibes una propuesta con oportunidades de automatización, conexiones, plazos y costes.

Dónde falla: no en la técnica, sino en tus documentos

En prácticamente todo proyecto que encalla aquí, la causa no es la IA. Cinco clásicos.

  • Versiones contradictorias. Si hay tres listas de precios en la carpeta y ninguna manda, unas veces te dará una y otras veces otra. Eso no es fallo de la IA, es tu archivo.
  • Documentos escaneados sin texto. Un adjunto fotografiado es una imagen para un ordenador. Tiene solución, pero es trabajo.
  • Permisos. Si todo se vuelve consultable, el expediente de personal también. Quién puede ver qué se decide antes, no después de que alguien lo haya encontrado.
  • Conocimiento que solo está en las cabezas. Lo que no está escrito en ninguna parte tampoco se puede encontrar. A veces el primer paso es escribir de una vez esas diez cosas que siempre se preguntan.
  • Pocas preguntas. Si se consulta algo cinco veces por semana, no vas a amortizar un sistema. Entonces la respuesta es una carpeta ordenada.

Un asistente que busca en documentos desordenados hace visible el desorden en lugar de resolverlo. Si en la primera conversación vemos que el problema real es el archivo, lo decimos. Entonces el primer paso es ordenar y no construir.

Queremos un modelo en nuestro idioma, y por qué es un malentendido

Pensamiento lógico: tus documentos están en un idioma, así que quieres un modelo hecho para ese idioma. En septiembre de 2025 apareció el primer estudio serio que lo comprueba. Especialistas en tecnología del lenguaje de la Universidad de Amberes construyeron MTEB-NL, una medida con cuarenta conjuntos de prueba en neerlandés, entre ellos textos jurídicos y licitaciones.

El resultado es contraintuitivo. Los modelos construidos especialmente sobre texto neerlandés, BERTje y RobBERT, sacaron 17,6 y 18,3 puntos al recuperar el pasaje correcto. Los modelos multilingües internacionales llegaron a 59,1. Al reconocer y clasificar textos, esos mismos modelos se defendían razonablemente, 50,9 frente a 60,2. Entienden bien el idioma. Simplemente no encuentran nada.

17,6 vs 59,1

puntuación de búsqueda de un modelo específico de idioma frente a uno multilingüe (MTEB-NL, Universidad de Amberes, septiembre de 2025)

La explicación está en el mismo estudio: buscar es una habilidad aparte para la que un modelo tiene que estar ajustado por separado. Coge el mismo modelo y ajústalo para búsqueda, y la puntuación salta de 18,3 a 51,6. Así que no se trata del idioma del modelo, sino de si se ha comprobado su capacidad de búsqueda en tu idioma. Pregunta por eso. Es un modelo en tu idioma no responde a esa pregunta.

¿Tus documentos se quedan en el país?

Es la pregunta que más se hace y la que menos veces se contesta como es debido. Para la parte de búsqueda hay buenas noticias: los modelos con mejor resultado de ese estudio están disponibles libremente y pueden funcionar en tu propio servidor. Uno de los que puntúan bien es además tan pequeño que no hace falta una máquina pesada. Tu archivo no tiene por qué salir del edificio.

Para redactar la respuesta la cosa cambia. Ahí se usa normalmente un modelo grande de un proveedor grande, y entonces la pregunta es dónde funciona. Algunos proveedores ofrecen procesamiento dentro de Europa, otros no, y varía según la parte de su oferta. Pregúntalo, haz que se recoja en el contrato y no te conformes con un no te preocupes.

¿Cómo de grande tiene que ser tu archivo para que compense?

Hay una regla práctica. Con un puñado de documentos puedes simplemente adjuntarlos cada vez. Funciona bien y sale más barato. Por encima de unas cuarenta páginas la cosa se invierte: enviarlo todo se vuelve más caro que buscar de forma dirigida, por mucho que lo uses. Y cuanto mayor sea tu archivo a partir de ahí, menos importa. Con búsqueda dirigida, una pregunta sobre mil páginas cuesta prácticamente lo mismo que una sobre cuarenta.

En la práctica: un catálogo de productos, una carpeta de contratos o un conjunto de instrucciones de montaje están siempre muy por encima. Cinco procedimientos y un manual del empleado, no.

Dónde están hoy las pymes

No es una batalla perdida de antemano, pero tampoco una carrera que ya hayas perdido. Según la oficina de estadística neerlandesa, en 2025 el 33 por ciento de las empresas con diez o más empleados usaba IA, frente al 23 por ciento en 2024 y el 14 por ciento en 2023. En la banda de diez a cincuenta empleados está en el 28 por ciento.

33%

uso de IA en empresas de 10 o más empleados en 2025; entre 10 y 50 empleados, 28 por ciento (estadística neerlandesa)

Y ese uso es superficial. Un estudio sobre el uso de IA en la pyme publicado por el gobierno neerlandés en septiembre de 2025 muestra que se dirige sobre todo a escribir textos, comunicación y resumir documentos. Las aplicaciones más especializadas son escasas. Justo ahí, en el trabajo pegado a tus propios documentos, sigue habiendo hueco.

Más interesante que el porcentaje es la razón por la que las empresas no empiezan. En esas mismas cifras, quienes no lo usan mencionan la falta de conocimiento y experiencia unas cuatro veces más a menudo que el coste excesivo. No es un problema de dinero. Es un problema de no sé por dónde empezar.

Cómo abordarlo

  • Durante dos semanas anota qué preguntas se hacen realmente y dónde estaba la respuesta. No de memoria, sino por escrito, con el tiempo que costó buscarla.
  • Cuenta cuántas páginas están realmente implicadas. Suele ser una fracción de lo que hay en la carpeta.
  • Designa un documento que mande por cada tema y saca el resto de la fuente. De este paso depende todo el proyecto.
  • Empieza con un tipo de pregunta de un equipo. No todo consultable, sino nuestros técnicos pueden consultar las instrucciones de montaje.
  • Exige la fuente en cada respuesta y que dos personas hagan comprobaciones al azar durante una semana.
  • Al cabo de un mes mide lo mismo que en el paso uno. Si el tiempo de búsqueda no ha bajado, lo dejas.

Lo que sale de esto rara vez es espectacular de ver. No aparece ningún robot listo. Aparece alguien que ya no tiene que llamar a tres compañeros para saber qué garantía se aplica. Por cierto, el comentario que más oímos tras la entrega no es sobre la IA, sino sobre los documentos: no sabíamos que aquello estuviera tan revuelto.

No lo hagas si tus documentos todavía hay que escribirlos en vez de encontrarlos, si hay un puñado de preguntas por semana, o si el problema real es que nadie sabe qué documento manda. Eso último se resuelve con un acuerdo, no con software.

¿Listo para empezar?

Solicita una consulta gratuita. Analizamos juntos dónde pierdes tiempo.

Programar llamada gratuita

¿Te suena esto?

Programa una llamada gratuita. Analizamos juntos dónde pierdes tiempo, y si la IA es la solución.

Programar llamada gratuita