Treinar IA com dados próprios: o que funciona e o que não

Quase todo empresário que quer IA sobre os dados da sua empresa pede algo de que não precisa. A solução mais barata funciona melhor e é mais fácil de verificar.

Terence
9 min de leitura

Treinar IA com dados próprios. É assim que a maioria dos empresários formula quando liga. Querem um assistente que conheça as suas tabelas de preços, os seus contratos, os seus manuais e os acordos que um dia foram feitos com um cliente. Não uma IA que conhece a internet, mas uma que conhece a empresa deles. Perfeitamente lógico. Só que nove em cada dez vezes treinar não é o que tem de acontecer, e isso poupa muito dinheiro.

Este artigo trata de três coisas: os três significados escondidos nessa única frase, qual deles provavelmente quer dizer, e onde corre mal na prática. Com os números à frente e sem conversa técnica.

Três coisas que treinar IA com dados próprios pode significar

Quando três empresários dizem a mesma frase, muitas vezes querem dizer três coisas diferentes. Vale a pena separá-las, porque entre elas há um fator mil de diferença no preço.

  • Anexar documentos a uma conversa. Arrasta um pdf para uma janela de conversa e faz perguntas sobre ele. Gratuito, imediato, e desaparece quando a conversa acaba.
  • Deixar a IA consultar o seu próprio arquivo. Os seus documentos são preparados de forma a que cada pergunta traga primeiro as passagens certas, e a resposta assente nelas, com o documento indicado.
  • Ajustar o próprio modelo. Faz com que um modelo de IA existente aprenda com o seu material, para que o comportamento dele mude.

O primeiro quase toda a gente já usa. O terceiro é o que a maioria quer dizer quando fala em treinar. E o segundo é o que realmente quer.

O terceiro raramente construímos. Não porque não seja possível, mas porque em quase todos os casos não lhe traz nada e mesmo assim paga por ele. Se alguém lhe vende um modelo treinado com os seus dados, pergunte primeiro o que corre mal se ele não o fizer.

Porque retreinar um modelo quase nunca é a resposta

Retreinar muda a forma como um modelo se comporta: o tom que adota, o formato que mantém, os termos do ofício que usa. O que não faz de forma fiável é reter factos. E factos são exatamente o que procura quando quer saber que prazo de garantia consta daquele contrato de 2023.

  • Os factos esbatem-se. Um modelo retreinado dá uma resposta que soa como soam os seus documentos, não necessariamente o que neles está escrito.
  • Não consegue verificar de onde vem a resposta. Sem documento, sem número de página, sem controlo.
  • Cada alteração custa uma nova ronda. Nova tabela de preços em janeiro? Recomeça-se.
  • Retirar algo é complicado. Um cliente que pergunta se os dados dele desapareceram mesmo não aceita um em grande parte como resposta.
  • É bastante mais caro do que as alternativas, em dinheiro e em prazo.

Há uma exceção, e numa pequena empresa é francamente rara. Se tem de produzir muitas vezes por dia exatamente o mesmo tipo de texto num formato fixo próprio, pense em milhares de avaliações curtas padronizadas, retreinar pode fazer sentido. Aí está a comprar forma, não conhecimento. Se não se reconhece nisso, não é para si.

O que funciona: primeiro procurar, depois responder

O que quase sempre precisa é mais simples de perceber. Os seus documentos, ou seja manuais, orçamentos, contratos, atas e acordos de preços, são preparados para que se possa procurar neles por significado e não apenas por palavras exatas. Alguém faz uma pergunta em linguagem corrente. O sistema traz as poucas passagens que realmente importam. Só depois é escrita a resposta, com base nessas passagens.

A diferença para a pesquisa que tem hoje: essa encontra ficheiros, esta encontra respostas. Procure hoje por garantia painel solar e recebe doze nomes de ficheiro e tem de ler tudo. No outro caso recebe: cinco anos na montagem, vinte e cinco anos no próprio painel, e por baixo de que documento isso vem.

Essa indicação da fonte não é enfeite. É a única coisa que permite a alguém verificar se a resposta está certa antes de agir. Um sistema que não consegue indicar a fonte não está pronto para uso profissional.

~1 cêntimo

processamento único de mil páginas, a preços publicados

Começo com uma conversa inicial gratuita. Falamos sobre as tarefas que levam tempo, os sistemas que usas e onde a automatização pode ajudar. Depois recebes uma proposta com oportunidades de automatização, integrações, prazos e custos.

Onde corre mal: não na tecnologia, mas nos seus documentos

Em praticamente todos os projetos que encalham nisto, a causa não é a IA. Cinco clássicos.

  • Versões contraditórias. Se estão três tabelas de preços na pasta e nenhuma manda, umas vezes recebe uma e outras vezes outra. Não é falha da IA, é o seu arquivo.
  • Documentos digitalizados sem texto. Um anexo fotografado é uma imagem para um computador. Tem solução, mas dá trabalho.
  • Permissões. Se tudo passa a ser pesquisável, o processo individual dos trabalhadores também passa. Quem pode ver o quê trata-se antes, não depois de alguém ter encontrado.
  • Conhecimento que só existe nas cabeças. O que não está escrito em lado nenhum também não pode ser encontrado. Às vezes o primeiro passo é escrever de uma vez aquelas dez coisas que sempre perguntam.
  • Poucas perguntas. Se se procura algo cinco vezes por semana, não vai amortizar um sistema. Aí a resposta é uma pasta arrumada.

Um assistente que procura em documentos desarrumados torna a desarrumação visível em vez de a resolver. Se numa primeira conversa vemos que o problema real é o arquivo, dizemo-lo. Então o primeiro passo é arrumar e não construir.

Queremos um modelo na nossa língua, e porque isso é um mal-entendido

Pensamento lógico: os seus documentos estão numa língua, portanto quer um modelo feito para essa língua. Em setembro de 2025 saiu o primeiro estudo sério que testa isso. Especialistas em tecnologia da linguagem da Universidade de Antuérpia construíram o MTEB-NL, uma medida com quarenta conjuntos de teste em neerlandês, incluindo textos jurídicos e concursos públicos.

O resultado é contraintuitivo. Os modelos construídos especificamente sobre texto neerlandês, BERTje e RobBERT, obtiveram 17,6 e 18,3 pontos a encontrar a passagem certa. Os modelos multilingues internacionais chegaram a 59,1. A reconhecer e classificar textos, esses mesmos modelos saíram-se razoavelmente, 50,9 contra 60,2. Percebem bem a língua. Só não encontram nada.

17,6 vs 59,1

pontuação de pesquisa de um modelo específico da língua face a um multilingue (MTEB-NL, Universidade de Antuérpia, setembro de 2025)

A explicação está no mesmo estudo: procurar é uma competência à parte, para a qual um modelo tem de ser afinado separadamente. Pegue no mesmo modelo e afine-o para pesquisa, e a pontuação salta de 18,3 para 51,6. Não é portanto a língua do modelo que conta, mas se foi testado a procurar na sua língua. Pergunte por isso. É um modelo na sua língua não responde a essa pergunta.

Os seus documentos ficam no país?

É a pergunta mais feita e a menos vezes respondida como deve ser. Para a parte da pesquisa há boas notícias: os modelos com melhor desempenho nesse estudo estão livremente disponíveis e podem correr no seu próprio servidor. Um dos que pontuam bem é além disso tão pequeno que não exige uma máquina pesada. O seu arquivo não tem portanto de sair do edifício.

Para escrever a resposta é diferente. Aí usa-se normalmente um modelo grande de um fornecedor grande, e então a pergunta é onde é que ele corre. Alguns fornecedores oferecem processamento dentro da Europa, outros não, e varia consoante a parte da oferta. Pergunte, faça constar do contrato e não se contente com um isso está tratado.

Que dimensão tem de ter o seu arquivo para compensar?

Há uma regra prática. Com um punhado de documentos pode simplesmente anexá-los de cada vez. Funciona bem e sai mais barato. Acima de cerca de quarenta páginas isso inverte-se: enviar tudo passa a ser mais caro do que procurar de forma dirigida, por muito que use. E quanto maior o seu arquivo ficar depois, menos importa. Na procura dirigida, uma pergunta sobre mil páginas custa praticamente o mesmo que uma sobre quarenta.

Na prática: um catálogo de produtos, uma pasta de contratos ou um conjunto de instruções de montagem estão sempre bem acima disso. Cinco procedimentos e um manual do colaborador não.

Onde estão hoje as pequenas empresas

Não é uma batalha de retaguarda, mas também não é uma corrida já perdida. Segundo o instituto de estatística neerlandês, em 2025 33 por cento das empresas com dez ou mais trabalhadores usavam IA, contra 23 por cento em 2024 e 14 por cento em 2023. Na faixa de dez a cinquenta trabalhadores fica nos 28 por cento.

33%

uso de IA em empresas com 10 ou mais trabalhadores em 2025; entre 10 e 50 trabalhadores, 28 por cento (estatística neerlandesa)

E esse uso é pouco profundo. Um estudo sobre uso de IA nas pequenas empresas publicado pelo governo neerlandês em setembro de 2025 mostra que se dirige sobretudo a escrever textos, comunicação e resumir documentos. Aplicações mais especializadas são raras. É exatamente aí, no trabalho colado aos seus próprios documentos, que ainda há espaço.

Mais interessante do que a percentagem é a razão pela qual as empresas não começam. Nesses mesmos números, quem não usa aponta falta de conhecimento e experiência cerca de quatro vezes mais do que custos elevados. Não é portanto um problema de dinheiro. É um problema de não sei por onde começar.

Como avançar

  • Durante duas semanas registe que perguntas são realmente feitas e onde estava a resposta. Não de cabeça, mas por escrito, com o tempo que a procura levou.
  • Conte quantas páginas estão realmente em causa. Normalmente é uma fração do que está na pasta.
  • Indique um documento que manda por assunto e retire o resto da fonte. É neste passo que o projeto se decide.
  • Comece com um tipo de pergunta de uma equipa. Não tudo pesquisável, mas os nossos técnicos conseguem consultar as instruções de montagem.
  • Exija a indicação da fonte em cada resposta e mande duas pessoas fazer verificações por amostragem durante uma semana.
  • Ao fim de um mês meça o mesmo que no passo um. Se o tempo de procura não baixou, para.

O resultado raramente é espetacular de ver. Não aparece nenhum robô esperto. Aparece alguém que já não precisa de telefonar a três colegas para saber que garantia se aplica. Já agora, o comentário que mais ouvimos depois da entrega não é sobre a IA, é sobre os documentos: não sabíamos que aquilo estava uma trapalhada.

Não avance se os seus documentos ainda têm de ser escritos em vez de encontrados, se há um punhado de perguntas por semana, ou se o problema real é que ninguém sabe que documento manda. Esse último resolve-se com um acordo, não com software.

Pronto para começar?

Solicite uma consulta gratuita. Analisamos juntos onde você perde tempo.

Agendar chamada gratuita

Reconhece-se nesta situação?

Agende uma chamada gratuita. Analisamos juntos onde perde tempo, e se a IA é a solução.

Agendar chamada gratuita