Context Forge — modelos locais
O Context Forge é o motor de modelos locais integrado ao Context Code: baixa e executa modelos no formato GGUF diretamente na sua máquina, sem instalar nem configurar nenhum servidor externo. Ideal para trabalhar sem conexão, com privacidade total e sem gastar tokens pagos.
Abre pela barra lateral: Context Forge (“Motores locais e catálogo de modelos”).
Motores por hardware
Seção intitulada “Motores por hardware”A primeira coisa que o Forge faz é se preparar para a sua máquina: baixa os binários do motor (builds do llama.cpp) que correspondem ao seu hardware — CPU e aceleração por GPU quando disponível (CUDA para NVIDIA, Vulkan e outras variantes conforme a plataforma). Só são baixados os motores que você escolher, na aba Motores.
Forge Hub: buscar e baixar modelos
Seção intitulada “Forge Hub: buscar e baixar modelos”A aba de modelos é o Forge Hub — Modelos GGUF, com dois caminhos:
- Catálogo com curadoria: uma seleção pronta para usar; escolha o modelo e clique em Baixar.
- Pesquisar HuggingFace: escreva um termo (“gemma 4”, “qwen coder”) ou cole um repositório exato
autor/modelopara ver os GGUF disponíveis.
Para cada modelo você escolhe a quantização — versões do mesmo modelo com equilíbrio diferente entre tamanho/velocidade e qualidade. Regra prática: quantizações menores cabem em menos RAM/VRAM e respondem mais rápido, em troca de um pouco de precisão; cada modelo vem com uma quantização padrão razoável.
Os downloads podem ser cancelados e continuados depois (retomam de onde pararam).
Executar um modelo
Seção intitulada “Executar um modelo”Em Catálogo → Instalado, clique em Executar em um modelo para carregá-lo na memória/GPU (e Parar para descarregá-lo e liberar RAM/VRAM). Com o modelo em execução, o “Context Forge” aparece como um provedor a mais no seletor do chat.
Na barra superior do app há atalhos para liberar memória (descarregar o modelo local) ou parar o motor local por completo.
A aba API: use de outros aplicativos
Seção intitulada “A aba API: use de outros aplicativos”O Forge expõe o modelo em execução por uma API compatível com OpenAI, para conectar qualquer ferramenta que fale esse protocolo:
- URL base: a que a aba API mostra (servida em
127.0.0.1, acessível apenas do seu próprio equipamento). - Chave de API: uma nova é gerada a cada inicialização do servidor; copie na mesma aba. Todas as requisições levam o cabeçalho
Authorization: Bearer <API key>. - O campo
modeldas suas requisições deve ser o id de um modelo em execução (a aba lista os “Modelos carregados”).
curl <Base URL>/v1/chat/completions \ -H "Authorization: Bearer <API key>" \ -H "Content-Type: application/json" \ -d '{"model": "<id del modelo cargado>", "messages": [{"role": "user", "content": "Hola"}]}'