← INEMA.CLUB · Início Kit Local · INEMA
Rodando modelos locais · A Estratégia Local

O Laboratório Local.
Grátis. Privado. Seu.

Qual modo rodar, o que sua máquina realmente aguenta, os modelos que valem o disco — e as duas armadilhas que fazem as pessoas acharem que local é ruim.

O Laboratório Local — a estação do futuro
01 · A estratégia

Escolha seu modo primeiro.

Local não é tudo ou nada. Decida o quanto sai da sua máquina — a escolha do modelo vem depois.

Escolha seu modo — cofre, conectado, nuvem
🔒
Cofre
nada nunca sai

100% local, funciona offline. Dados de cliente, contratos, saúde, trabalho ainda não lançado.

trabalho sensível
🔌
Conectado
local primeiro, nuvem sob demanda

O local cuida dos rascunhos e do trabalho pesado; você troca pra nuvem nas decisões mais difíceis.

★ a estratégia do dia a dia
☁️
Nuvem-primeiro
local só para os 5% privados

Nuvem por padrão; cai pro local só quando algo não pode sair da máquina.

pouca vram
02 · Sua máquina

O que sua máquina realmente aguenta?

Arraste até a memória da sua máquina — em Mac com Apple Silicon, memória unificada conta como VRAM. Em PC, use a VRAM da sua GPU.

sua memória · vram ou apple unificada 24 GB
8162432486496128

⏳ máquina do tempo
Tão potente quanto a fronteira de

🎯 parente moderno mais próximo

Regra de bolso: o arquivo do modelo mais o cache de contexto moram na memória — deixe folga. Tamanhos assumem quantização Q4.
03 · Os melhores da categoria

Três trabalhos. Três campeões.

Não colecione modelos — designe-os. Clique num comando pra copiar.

01 Qwen
o programadorQwen3-Coder 30B

Qualidade de classe 32B na velocidade de um modelo pequeno. O rei do código local.

24GB · ~40 tok/sollama pull qwen3-coder:30b-a3b
02 DeepSeek
o raciocinadorDeepSeek-R1 14B

Cadeia de raciocínio de fronteira, destilada. Veja ele pensar antes de responder.

16GB · 32B / 70B acimaollama pull deepseek-r1:14b
03 OpenAI
o generalistaGPT-OSS 20B

Os pesos abertos da OpenAI. Bate-papo, ferramentas e agentes, no estilo da casa.

feito para 16GBollama pull gpt-oss:20b
04 · O cenário local

Seis casas. Todo tamanho.

Toda casa lança uma escada de tamanhos — o mesmo cérebro, escalado pra cima ou pra baixo. O Ollama é a porta de entrada pra todas elas. Os pontos que cabem na sua máquina ficam acesos (sincronizado com o slider acima) — clique em qualquer ponto pra copiar o comando de pull.

O cenário de modelos locaisseus GB24 GB
QwenQwen3pragmático · adora ferramentas
DeepSeekDeepSeek-R1pensa em voz alta
OpenAIGPT-OSSgenes de fronteira · rígido
GemmaGemma 3polido · o mais seguro
MetaLlamao padrão · meio-termo
MistralMistralenxuto · relaxado
1B8B30B70B120B
papo rápidotrabalho de verdadenível agentequase-fronteira
tamanho do ponto = parâmetros · faixa verde = alcance da sua máquina (arraste o slider) · ★ = o coder
🎭
Mesmos cérebros, modos diferentes

Alinhamento também é especificação técnica. Gemma e GPT-OSS vêm travados de fábrica — recusam qualquer coisa mais picante, o que é exatamente o que você quer pra uso seguro em família ou de frente pro cliente. Llama fica no meio-termo; Mistral é mais solto. E existem também modelos totalmente neutros, que você mesmo direciona — essa é a especialidade da Nous Research, com modelos abertos e steeráveis feitos sob medida pra esse tipo de controle. Escolha o temperamento certo pro trabalho certo.

05 · O contexto honesto

Local é bom, de verdade?

Resposta honesta: um bom 30B local hoje faz o que a fronteira fazia não faz muito tempo — e pra rascunho, trabalho braçal e documento privado, isso já é a maior parte dos seus tokens.

O espectro de poder — de 8B até a fronteira
local · pequeno
O cérebro de bolso

Bate-papo, rascunhos, resumos — rápido, leve, roda em quase qualquer coisa.

LlamaGemmaMistral
local · 30B ★
A fronteira de ontem

Código de verdade, agentes de verdade, contexto de verdade — na sua própria mesa, de graça.

QwenGPT-OSS
gigantes alugados
Abertos, mas enormes

GLM, DeepSeek, Kimi — fronteira de peso aberto. Grandes demais pra hospedar em casa; centavos pra alugar.

GLMDeepSeekKimi
nuvem de fronteira
Os 5% mais difíceis

Raciocínio profundo, arquitetura, bom gosto de design. Manda pra cá — e depois volta pra casa.

GPT-5.6Claude
⚖️
Onde a linha realmente passa

Em raciocínio puro, a fronteira ainda ganha — é por isso que o modo Conectado existe. Mas a vantagem do local não é QI: é custo zero por token, zero saída de dados e nenhum limite de taxa. Direcione por tarefa, não por lealdade.

06 · As duas armadilhas

Por que acham que local é ruim.

Geralmente não é o modelo. É uma dessas duas configurações.

🧠
O padrão de 4.096 tokens

O contexto real do Qwen3-Coder é de 256K. O Ollama entrega ele travado em 4K — você está usando ~1,6% do cérebro e depois culpando o modelo.

nativo · 256Kpadrão · 4K
Fix: OLLAMA_CONTEXT_LENGTH=65536 ollama serve
🌊
A parede do KV-cache

Contexto consome memória: um 70B precisa de ~42GB só de cache a 128K. Máquinas de consumidor batem o teto por volta de 32–64K utilizáveis — é o cache que não cabe, não o modelo.

Fix: quantização do KV-cache — q8_0 reduz o cache de memória praticamente pela metade, com perda mínima de qualidade.
07 · Ligando os fios

Três comandos para uma sala lacrada.

O Ollama expõe um endpoint compatível com OpenAI em localhost:11434 — seu agente pluga como qualquer outro cérebro. Nada sai da máquina.

terminal · local e grátis
# 1 · puxe o coder
$ ollama pull qwen3-coder:30b-a3b

# 2 · suba o contexto ANTES de julgar
$ OLLAMA_CONTEXT_LENGTH=65536 ollama serve

# 3 · aponte seu cliente pra localhost
$ <seu-cliente-openai-compatible> --model qwen3-coder:30b-a3b --base-url http://localhost:11434/v1
Sua máquina. Sua mente.
E daí →

Hoje à noite: arraste o slider até sua máquina, puxe os modelos recomendados, e suba o contexto antes de julgar qualquer coisa. Seu laboratório é grátis, privado e está sempre aberto.

INEMA.CLUB · Kit bônus do Capítulo 3 · inema.club