Ir al contenido

Context Forge — modelos locales

Context Forge es el motor de modelos locales integrado en Context Code: descarga y ejecuta modelos en formato GGUF directamente en tu máquina, sin instalar ni configurar ningún servidor externo. Ideal para trabajar sin conexión, con total privacidad y sin gastar tokens de pago.

Se abre desde la barra lateral: Context Forge («Motores locales y catálogo de modelos»).

Lo primero que hace Forge es prepararse para tu máquina: descarga los binarios del motor (builds de llama.cpp) que corresponden a tu hardware — CPU, y aceleración por GPU cuando está disponible (CUDA para NVIDIA, Vulkan, y otras variantes según plataforma). Solo se descargan los motores que elijas, desde la pestaña Motores.

La pestaña de modelos es el Forge Hub — Modelos GGUF, con dos caminos:

  • Catálogo curado: una selección lista para usar; elige el modelo y pulsa Descargar.
  • Buscar en HuggingFace: escribe un término («gemma 4», «qwen coder») o pega un repositorio exacto autor/modelo para ver los GGUF disponibles.

Para cada modelo eliges la cuantización — versiones del mismo modelo con distinto equilibrio entre tamaño/velocidad y calidad. Regla práctica: cuantizaciones más pequeñas caben en menos RAM/VRAM y responden más rápido, a cambio de algo de precisión; cada modelo trae una cuantización por defecto razonable.

Las descargas se pueden cancelar y continuar después (se reanudan donde iban).

Forge Hub: catálogo curado, búsqueda en HuggingFace y cuantizaciones por modelo.

En Catálogo → Instalados, pulsa Ejecutar en un modelo para cargarlo en memoria/GPU (y Detener para descargarlo y liberar RAM/VRAM). Con el modelo en ejecución, «Context Forge» aparece como un proveedor más en el selector del chat.

En la barra superior de la app tienes accesos directos para liberar memoria (desmontar el modelo local) o detener el motor local por completo.

La pestaña API: úsalo desde otras aplicaciones

Sección titulada «La pestaña API: úsalo desde otras aplicaciones»

Forge expone el modelo en ejecución por una API compatible con OpenAI, para conectarle cualquier herramienta que hable ese protocolo:

  • Base URL: la que muestra la pestaña API (servida en 127.0.0.1, solo accesible desde tu propio equipo).
  • API key: se genera nueva en cada arranque del servidor; cópiala desde la misma pestaña. Todas las peticiones llevan la cabecera Authorization: Bearer <API key>.
  • El campo model de tus peticiones debe ser el id de un modelo en ejecución (la pestaña lista los «Modelos cargados»).
Ventana de terminal
curl <Base URL>/v1/chat/completions \
-H "Authorization: Bearer <API key>" \
-H "Content-Type: application/json" \
-d '{"model": "<id del modelo cargado>", "messages": [{"role": "user", "content": "Hola"}]}'
La pestaña API: Base URL compatible con OpenAI, clave y modelos cargados.
Context Forge descarga el motor que le toca a tu equipo (CUDA, ROCm, Vulkan o CPU) y lo mantiene al día.
El catálogo multimedia añade imagen, vídeo y voz a los modelos de texto.
La vista Diseño usa esos modelos multimedia: imagen, vídeo y voz generados en el propio equipo.