Modelos propios y cuantización
No estás limitado al catálogo. Un Modelfile apunta a pesos que ya tenés.
FROM /path/to/model
Eso, para un directorio con pesos en formato Safetensors. Para un archivo GGUF:
FROM /path/to/file.gguf
Y para un adaptador GGUF sobre un modelo base:
FROM <model name>
ADAPTER /path/to/file.gguf
Con una advertencia textual: "When importing a GGUF adapter, it's important to use the same base model as the base model that the adapter was created with." El adaptador aprendió sobre un base concreto; ponerlo sobre otro no da un error limpio, da resultados malos.
El modelo se construye con:
ollama create -f Modelfile
Cuantizar
Cuantizar es guardar los pesos con menos precisión. Se hace al crear:
ollama create --quantize q4_K_M mymodel
El flag es -q / --quantize. Niveles documentados: q8_0, q4_K_S y q4_K_M.
Y el intercambio, textual: "Quantizing a model allows you to run models faster and with less memory consumption but at reduced accuracy."
Ahí está todo. Más rápido y con menos memoria, a cambio de precisión. No es una optimización gratis: es una decisión con costo, y elegirla bien depende de para qué usás el modelo.