Pular para o conteúdo

Context Forge — modelos locais

O Context Forge é o motor de modelos locais integrado ao Context Code: baixa e executa modelos no formato GGUF diretamente na sua máquina, sem instalar nem configurar nenhum servidor externo. Ideal para trabalhar sem conexão, com privacidade total e sem gastar tokens pagos.

Abre pela barra lateral: Context Forge (“Motores locais e catálogo de modelos”).

A primeira coisa que o Forge faz é se preparar para a sua máquina: baixa os binários do motor (builds do llama.cpp) que correspondem ao seu hardware — CPU e aceleração por GPU quando disponível (CUDA para NVIDIA, Vulkan e outras variantes conforme a plataforma). Só são baixados os motores que você escolher, na aba Motores.

A aba de modelos é o Forge Hub — Modelos GGUF, com dois caminhos:

  • Catálogo com curadoria: uma seleção pronta para usar; escolha o modelo e clique em Baixar.
  • Pesquisar HuggingFace: escreva um termo (“gemma 4”, “qwen coder”) ou cole um repositório exato autor/modelo para ver os GGUF disponíveis.

Para cada modelo você escolhe a quantização — versões do mesmo modelo com equilíbrio diferente entre tamanho/velocidade e qualidade. Regra prática: quantizações menores cabem em menos RAM/VRAM e respondem mais rápido, em troca de um pouco de precisão; cada modelo vem com uma quantização padrão razoável.

Os downloads podem ser cancelados e continuados depois (retomam de onde pararam).

Forge Hub: catálogo curado, busca no Hugging Face e quantizações por modelo.

Em Catálogo → Instalado, clique em Executar em um modelo para carregá-lo na memória/GPU (e Parar para descarregá-lo e liberar RAM/VRAM). Com o modelo em execução, o “Context Forge” aparece como um provedor a mais no seletor do chat.

Na barra superior do app há atalhos para liberar memória (descarregar o modelo local) ou parar o motor local por completo.

O Forge expõe o modelo em execução por uma API compatível com OpenAI, para conectar qualquer ferramenta que fale esse protocolo:

  • URL base: a que a aba API mostra (servida em 127.0.0.1, acessível apenas do seu próprio equipamento).
  • Chave de API: uma nova é gerada a cada inicialização do servidor; copie na mesma aba. Todas as requisições levam o cabeçalho Authorization: Bearer <API key>.
  • O campo model das suas requisições deve ser o id de um modelo em execução (a aba lista os “Modelos carregados”).
Ventana de terminal
curl <Base URL>/v1/chat/completions \
-H "Authorization: Bearer <API key>" \
-H "Content-Type: application/json" \
-d '{"model": "<id del modelo cargado>", "messages": [{"role": "user", "content": "Hola"}]}'
A aba API: Base URL compatível com OpenAI, chave e modelos carregados.
O Context Forge baixa o motor certo para o seu equipamento (CUDA, ROCm, Vulkan ou CPU) e o mantém atualizado.
O catálogo multimídia acrescenta imagem, vídeo e voz aos modelos de texto.
A visão Design usa esses modelos multimídia: imagem, vídeo e voz gerados no próprio equipamento.