El servidor y su API
Detrás del chat de la terminal hay un servidor HTTP. Se arranca con:
ollama serve
ollama serve --help lista las variables de entorno que acepta.
Escucha en http://localhost:11434. Ese puerto, 11434, es el que vas a ver en todos los ejemplos.
Los endpoints nativos
curl http://localhost:11434/api/generate -d '{
"model": "gemma4",
"prompt": "Why is the sky blue?"
}'
POST /api/generate— generación a partir de un prompt.POST /api/chat— conversación con una lista de mensajes con roles./api/embed— embeddings, la representación numérica de un texto.
La diferencia entre generate y chat es la forma de la entrada: generate recibe un prompt suelto, chat recibe messages con sus roles. Elegís según lo que estés construyendo.
Qué modelos hay corriendo
ollama ps
Muestra los modelos activos. Es el comando que más vas a usar cuando algo va lento y quieras entender qué está pasando de verdad.
Para bajar uno sin cerrar el servidor:
ollama stop gemma4
Esa separación entre servidor y modelo cargado es la idea importante de esta unidad: el servidor vive, los modelos entran y salen de memoria.