Contexto y memoria
La ventana de contexto es cuánto texto puede tener el modelo a la vista de una vez. En local no es un número que elegís libremente: lo paga tu memoria.
Ollama fija un valor por defecto según la VRAM disponible, textualmente:
> "< 24 GiB VRAM: 4k context; 24-48 GiB VRAM: 32k context; >= 48 GiB VRAM: 256k context"
Es decir: por debajo de 24 GiB de VRAM el contexto por defecto es de 4k. No porque el modelo no sepa más, sino porque no entra.
Cambiarlo
Con una variable de entorno al arrancar el servidor:
OLLAMA_CONTEXT_LENGTH=64000 ollama serve
También se ajusta con un control deslizante en los ajustes de la aplicación.
Y la advertencia, textual de la documentación:
> "Setting a larger context length will increase the amount of memory required to run a model. Ensure you have enough VRAM available to increase the context length."
El síntoma que hay que saber leer
Si subís el contexto más allá de lo que tu VRAM aguanta, el modelo no falla con un error claro: se descarga parcialmente a la CPU y todo se vuelve lento. La documentación recomienda comprobarlo con:
ollama ps
Ahí ves si el modelo está realmente en la GPU o si se está ejecutando desplazado a la CPU. Un modelo "lento sin motivo" casi siempre es esto.