Prompteo

Unidad 13 · 1 min

Camino avanzado: modelos propios y cuantización

Importar pesos con un Modelfile y cambiar su tamaño a cambio de precisión.

Modelos propios y cuantización

No estás limitado al catálogo. Un Modelfile apunta a pesos que ya tenés.

FROM /path/to/model

Eso, para un directorio con pesos en formato Safetensors. Para un archivo GGUF:

FROM /path/to/file.gguf

Y para un adaptador GGUF sobre un modelo base:

FROM <model name>
ADAPTER /path/to/file.gguf

Con una advertencia textual: "When importing a GGUF adapter, it's important to use the same base model as the base model that the adapter was created with." El adaptador aprendió sobre un base concreto; ponerlo sobre otro no da un error limpio, da resultados malos.

El modelo se construye con:

ollama create -f Modelfile

Cuantizar

Cuantizar es guardar los pesos con menos precisión. Se hace al crear:

ollama create --quantize q4_K_M mymodel

El flag es -q / --quantize. Niveles documentados: q8_0, q4_K_S y q4_K_M.

Y el intercambio, textual: "Quantizing a model allows you to run models faster and with less memory consumption but at reduced accuracy."

Ahí está todo. Más rápido y con menos memoria, a cambio de precisión. No es una optimización gratis: es una decisión con costo, y elegirla bien depende de para qué usás el modelo.