Context Forge — modelos locales
Context Forge es el motor de modelos locales integrado en Context Code: descarga y ejecuta modelos en formato GGUF directamente en tu máquina, sin instalar ni configurar ningún servidor externo. Ideal para trabajar sin conexión, con total privacidad y sin gastar tokens de pago.
Se abre desde la barra lateral: Context Forge («Motores locales y catálogo de modelos»).
Motores por hardware
Sección titulada «Motores por hardware»Lo primero que hace Forge es prepararse para tu máquina: descarga los binarios del motor (builds de llama.cpp) que corresponden a tu hardware — CPU, y aceleración por GPU cuando está disponible (CUDA para NVIDIA, Vulkan, y otras variantes según plataforma). Solo se descargan los motores que elijas, desde la pestaña Motores.
Forge Hub: buscar y descargar modelos
Sección titulada «Forge Hub: buscar y descargar modelos»La pestaña de modelos es el Forge Hub — Modelos GGUF, con dos caminos:
- Catálogo curado: una selección lista para usar; elige el modelo y pulsa Descargar.
- Buscar en HuggingFace: escribe un término («gemma 4», «qwen coder») o pega un repositorio exacto
autor/modelopara ver los GGUF disponibles.
Para cada modelo eliges la cuantización — versiones del mismo modelo con distinto equilibrio entre tamaño/velocidad y calidad. Regla práctica: cuantizaciones más pequeñas caben en menos RAM/VRAM y responden más rápido, a cambio de algo de precisión; cada modelo trae una cuantización por defecto razonable.
Las descargas se pueden cancelar y continuar después (se reanudan donde iban).
Ejecutar un modelo
Sección titulada «Ejecutar un modelo»En Catálogo → Instalados, pulsa Ejecutar en un modelo para cargarlo en memoria/GPU (y Detener para descargarlo y liberar RAM/VRAM). Con el modelo en ejecución, «Context Forge» aparece como un proveedor más en el selector del chat.
En la barra superior de la app tienes accesos directos para liberar memoria (desmontar el modelo local) o detener el motor local por completo.
La pestaña API: úsalo desde otras aplicaciones
Sección titulada «La pestaña API: úsalo desde otras aplicaciones»Forge expone el modelo en ejecución por una API compatible con OpenAI, para conectarle cualquier herramienta que hable ese protocolo:
- Base URL: la que muestra la pestaña API (servida en
127.0.0.1, solo accesible desde tu propio equipo). - API key: se genera nueva en cada arranque del servidor; cópiala desde la misma pestaña. Todas las peticiones llevan la cabecera
Authorization: Bearer <API key>. - El campo
modelde tus peticiones debe ser el id de un modelo en ejecución (la pestaña lista los «Modelos cargados»).
curl <Base URL>/v1/chat/completions \ -H "Authorization: Bearer <API key>" \ -H "Content-Type: application/json" \ -d '{"model": "<id del modelo cargado>", "messages": [{"role": "user", "content": "Hola"}]}'