Prompteo

Unidad 12 · 2 min

Camino avanzado: ventana de contexto y diagnóstico

La ventana de contexto no es gratis: se paga en memoria, y cuando no entra, todo va lento.

Contexto y memoria

La ventana de contexto es cuánto texto puede tener el modelo a la vista de una vez. En local no es un número que elegís libremente: lo paga tu memoria.

Ollama fija un valor por defecto según la VRAM disponible, textualmente:

> "< 24 GiB VRAM: 4k context; 24-48 GiB VRAM: 32k context; >= 48 GiB VRAM: 256k context"

Es decir: por debajo de 24 GiB de VRAM el contexto por defecto es de 4k. No porque el modelo no sepa más, sino porque no entra.

Cambiarlo

Con una variable de entorno al arrancar el servidor:

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

También se ajusta con un control deslizante en los ajustes de la aplicación.

Y la advertencia, textual de la documentación:

> "Setting a larger context length will increase the amount of memory required to run a model. Ensure you have enough VRAM available to increase the context length."

El síntoma que hay que saber leer

Si subís el contexto más allá de lo que tu VRAM aguanta, el modelo no falla con un error claro: se descarga parcialmente a la CPU y todo se vuelve lento. La documentación recomienda comprobarlo con:

ollama ps

Ahí ves si el modelo está realmente en la GPU o si se está ejecutando desplazado a la CPU. Un modelo "lento sin motivo" casi siempre es esto.