Rodar IA dentro da empresa: o guia pra usar inteligência artificial sem o dado do cliente sair da sua rede
A Meta liberou um modelo que roda offline, numa máquina normal, com licença comercial. Isso muda a conversa sobre LGPD e IA na pequena empresa. O guia com o hardware necessário, o passo a passo de instalação e as 3 regras antes de ligar.
Em uma frase
Dá pra rodar uma IA de 30B dentro do seu computador, sem internet e sem mensalidade: precisa de 24 GB de memória de vídeo (ou um MacBook M4/M5 Max), instala pelo LM Studio e pronto. O dado nunca sai da sua rede. Rodar local resolve o vazamento, não resolve a IA fazer besteira: continua precisando de dono, humano no botão e registro.
Toda vez que alguém da sua equipe cola um dado de cliente no ChatGPT, aquele dado saiu da sua empresa. Você não sabe pra onde foi, e a LGPD cobra de você, não da ferramenta.
A resposta óbvia é proibir. Não funciona: a equipe continua usando, só que escondido, e agora sem regra nenhuma.
Existe uma terceira saída, e desde 10 de agosto de 2026 ela ficou realmente viável pra empresa pequena: rodar a inteligência artificial dentro da sua própria máquina, sem internet, sem mandar nada pra lugar nenhum. Este guia mostra como, o que custa, o que dá e o que não dá pra fazer.
1 · O que mudou
A Meta liberou o Muse Glimmer, um modelo de 30 bilhões de parâmetros com licença Apache 2.0 (uso comercial liberado), desenhado especificamente pra rodar em hardware de consumidor, offline.
Os números que importam, direto do model card oficial:
| Tamanho | ~29,6 bilhões de parâmetros |
| Licença | Apache 2.0 (pode usar comercialmente) |
| Memória necessária | Abaixo de 20 GB com compressão de 4 bits |
| Placa de vídeo | Cabe em 24 GB ou 32 GB de VRAM |
| Contexto | 131 mil tokens (cerca de 300 páginas de uma vez) |
| Idiomas | Mais de 100, português incluído |
| Entrada | Texto e imagem (lê print, gráfico, documento) |
| Conexão | Nenhuma. Roda sem internet. |
Velocidade medida pela própria Meta, na versão comprimida de 17 GB:
| Máquina | Sem otimização | Com otimização |
|---|---|---|
| Nvidia RTX 5090 | 74,9 tokens/s | 233,4 tokens/s |
| MacBook M4 Max | 23,7 tokens/s | 37,8 tokens/s |
| MacBook M5 Max | 26,6 tokens/s | 50,2 tokens/s |
Pra referência: 30 tokens por segundo já é mais rápido do que você lê. Um MacBook M4 Max dá conta.
Liberar Rodar IA dentro da empresa: o guia pra usar inteligência artificial sem o dado do cliente sair da sua rede
Materiais relacionados
Auditoria de IA em 5 camadas: o checklist pra blindar qualquer automação que você já tem rodando
Sua automação no GPT, no Make ou no n8n está funcionando, mas acumulando risco invisível: dado sem permissão, viés, erro caro e decisão que ninguém explica. Este checklist adapta a governança da ISO 42001 em 5 camadas que qualquer PME roda numa tarde.
Como saber se o seu agente de IA está funcionando: o teste de 20 casos
A maioria das empresas responde "o agente está bom?" com sensação. Aí alguém mexe no prompt, quebra três coisas e ninguém percebe. Este guia monta o conjunto de teste que transforma achismo em número, numa tarde e sem ferramenta nenhuma.
Por que a fatura da IA estoura: as 3 causas e os 3 tetos que resolvem
Quando chega print de fatura de IA estourada, é sempre uma de três coisas: volume que ninguém previu, a conversa inteira sendo reenviada a cada mensagem, ou o agente em loop tentando sem limite. Nenhuma delas é preço de modelo. Este guia mostra os três tetos que travam cada uma.
Gostou desse? Recebe o próximo direto.
Material novo toda semana, sem spam.