SLMs em finanças: modelos de IA menores que cortam custo e protegem dados

Por que modelos de linguagem pequenos podem custar até 100x menos por consulta, rodar na sua infraestrutura e resolver tarefas financeiras repetitivas.

Existe uma ideia fixa no mercado: para usar IA de verdade, você precisa do maior e mais caro modelo disponível. Os números contam outra história. Um endpoint privado com um modelo pequeno atendendo 10 mil consultas por dia costuma custar entre US$ 500 e US$ 2.000 por mês — contra US$ 5.000 a US$ 50.000 para o mesmo volume rodando em LLMs de fronteira. Por consulta, a diferença pode chegar a 100 vezes. E, para boa parte do trabalho financeiro, o modelo menor entrega o mesmo resultado.

Esse é o argumento por trás dos SLMs (small language models, ou modelos de linguagem pequenos) — a contracorrente mais interessante da IA generativa em 2025-2026. Depois de anos correndo atrás do maior modelo possível, muitas equipes financeiras estão descobrindo que menor, mais barato e rodando dentro de casa costuma ser a escolha mais inteligente.

O que é um modelo "pequeno" — e por que isso importa

Não existe uma linha oficial, mas a convenção do mercado é chamar de SLM os modelos com menos de 10 bilhões de parâmetros. Para comparação, os LLMs generalistas que rodam por trás do ChatGPT e do Gemini têm dezenas a centenas de bilhões. O BloombergGPT, treinado especificamente para finanças, tem 50 bilhões.

Parâmetros são, grosso modo, o "tamanho do cérebro" do modelo. Mais parâmetros significam mais capacidade de raciocínio aberto e conversa genérica — mas também mais GPUs, mais energia, mais latência e mais custo por resposta. A pergunta que raramente se faz é: você precisa desse cérebro inteiro para extrair o valor de uma nota fiscal ou classificar um lançamento contábil?

Na maioria das tarefas financeiras, não. Elas são repetitivas, estruturadas e de baixo risco de ambiguidade: extrair campos de um documento, categorizar uma despesa, montar um resumo padronizado, responder uma dúvida a partir de uma base interna. É exatamente aí que os modelos pequenos brilham — e onde o modelo gigante é um canhão para matar mosquito.

Por que finanças é o caso de uso ideal para SLMs

Três características do trabalho financeiro se encaixam quase perfeitamente na proposta dos modelos pequenos.

Privacidade e soberania dos dados. Área financeira lida com extratos, folha, contratos e dados de clientes — informação que muita empresa simplesmente não pode enviar para uma API externa. Modelos pequenos e de peso aberto (open-weight) rodam inteiramente na sua própria infraestrutura, sem que nenhum dado saia do ambiente controlado. No Brasil, isso conversa diretamente com a LGPD e reduz o risco de "shadow AI" — o hábito de colar dados sensíveis em ferramentas públicas por conta própria.

Custo previsível. Um LLM de fronteira cobra por token e escala de forma agressiva com o volume. Um SLM rodando em servidor próprio tem custo fixo de infraestrutura e custo marginal próximo de zero por consulta. Para operações que processam milhares de documentos por dia, essa matemática muda completamente o business case.

Especialização vence generalização. Um modelo menor, ajustado (fine-tuned) com os seus próprios dados e processos, tende a entregar mais precisão e consistência na tarefa específica do que um modelo gigante genérico respondendo por prompt. Menos "criatividade" indesejada, menos alucinação, respostas mais padronizadas — que é justamente o que se quer num relatório ou numa conciliação.

Os números que sustentam a decisão

A pesquisa mais citada sobre o tema é o paper da NVIDIA, "Small Language Models are the Future of Agentic AI" (junho de 2025). A tese: em sistemas de agentes de IA — onde o modelo executa poucas tarefas especializadas, repetidas muitas vezes — os SLMs são "suficientemente capazes, mais adequados e necessariamente mais econômicos". Segundo o estudo, modelos abaixo de 10 bilhões de parâmetros podem ser de 10 a 30 vezes mais baratos de operar e ajustados em horas, não semanas.

Outros números que circulam em análises de 2025-2026 para o setor financeiro:

  • Até 100x menos custo por consulta via API em comparação com LLMs de fronteira — e zero por consulta quando o modelo roda no próprio dispositivo.
  • Latência abaixo de um segundo, essencial para fluxos que exigem resposta em tempo real, como validação de pagamentos.
  • Estratégias de escalonamento seletivo (roteirizar o simples para o SLM e só mandar o complexo para o LLM) que geram mais de 70% de economia sem perda de qualidade percebida.

O caso mais conhecido veio do JPMorgan: o sistema COiN, um modelo especializado em revisão de contratos, reduziu uma tarefa que levava semanas para poucas horas — sem depender de um modelo generalista gigante.

Os modelos e ferramentas que você pode usar hoje

O ecossistema de modelos pequenos, muitos deles de peso aberto e gratuitos para uso comercial, amadureceu rápido. Abaixo, os nomes que mais aparecem em projetos financeiros.

Modelo Tamanho aprox. Diferencial para finanças
Phi-3 (Microsoft) 3–15 bi Forte em raciocínio estruturado; roda até em máquinas modestas
Mistral 7B 7 bi Peso aberto, ótimo custo-benefício, roda 100% na sua infra
Llama 3.2 (Meta) 1–11 bi Versões pequenas para uso local e em borda (edge)
Gemma 2 (Google) 9 bi Peso aberto, bom desempenho em extração e classificação
FinBERT < 1 bi Treinado em textos financeiros; análise de sentimento e classificação

O papel de cada um depende da tarefa. Para extrair dados de documentos, classificar transações ou responder perguntas sobre uma base interna, modelos como Mistral 7B, Gemma 2 ou Phi-3 combinados com RAG (a técnica que conecta o modelo aos seus dados confiáveis) resolvem com custo baixo. Para análise de sentimento em notícias e relatórios, o FinBERT continua sendo uma referência barata e específica.

Vale um alerta prático, que aparece em quase toda análise séria do tema: a maioria das falhas não é do modelo, é da recuperação de informação. Antes de trocar por um modelo maior, melhore a organização e a busca nos seus dados (o "R" do RAG). Muita gente paga por um cérebro maior para resolver um problema que era de biblioteca mal catalogada.

Onde o modelo pequeno basta — e onde ainda precisamos do grande

SLM não é bala de prata, e o discurso maduro não é "abandone os LLMs". É usar o modelo certo para cada etapa. O padrão que vem se firmando em produção é o híbrido: rotear as tarefas rotineiras e de escopo estreito para o modelo pequeno e escalar para o LLM só quando o problema é aberto, complexo ou exige contexto muito longo.

Onde o SLM costuma bastar:

  • Extração e normalização de dados (notas, faturas, extratos)
  • Classificação de despesas e lançamentos contábeis
  • Rotinas de KYC/AML e triagem de documentos
  • Busca em base de conhecimento interna com RAG
  • Assistência de código para a equipe de dados/finanças

Onde o LLM ainda leva vantagem:

  • Síntese entre muitos documentos longos
  • Raciocínio aberto e narrativas explicativas complexas
  • Decisões que exigem contexto de 100 mil tokens ou mais

Repare que, mesmo nos casos de decisão de crédito, o desenho recomendado separa os papéis: o modelo pequeno faz a parte estruturada (decisão, extração) e o modelo grande escreve a narrativa explicativa — sempre com revisão humana obrigatória quando a decisão afeta um cliente.

Próximos Passos

  1. Mapeie suas tarefas de IA por tipo. Separe o que é repetitivo e estruturado (candidato a SLM) do que exige raciocínio aberto (candidato a LLM). Só essa lista já mostra onde há dinheiro sendo gasto à toa.
  2. Rode um piloto pequeno em um único fluxo. Escolha uma tarefa de alto volume — extração de faturas, classificação de despesas — e teste um modelo aberto como Mistral 7B ou Phi-3 antes de qualquer contrato grande.
  3. Arrume os dados antes de trocar o modelo. Se a resposta veio ruim, investigue primeiro a busca (RAG) e a qualidade da base. Quase sempre o problema está aí, não no tamanho do modelo.
  4. Calcule o custo por consulta, não a licença. Compare o custo total de um endpoint próprio com um SLM contra o custo por token do LLM no seu volume real. Para operações de alto volume, a conta costuma virar rápido.
  5. Desenhe o roteamento híbrido. Defina uma regra clara: o simples fica no modelo pequeno, o complexo escala para o grande. É o desenho que entrega custo previsível e desempenho na medida da demanda.

A pergunta que importa não é "qual o modelo mais poderoso do mercado", e sim "qual o menor modelo que resolve bem o meu problema". Na maioria das tarefas financeiras, a resposta é surpreendentemente pequena — e barata.


Fontes: