Prompteo

Unidad 10 · 1 min

Camino avanzado: el servidor y su API

Ollama expone una API HTTP local contra la que podés programar.

El servidor y su API

Detrás del chat de la terminal hay un servidor HTTP. Se arranca con:

ollama serve

ollama serve --help lista las variables de entorno que acepta.

Escucha en http://localhost:11434. Ese puerto, 11434, es el que vas a ver en todos los ejemplos.

Los endpoints nativos

curl http://localhost:11434/api/generate -d '{
  "model": "gemma4",
  "prompt": "Why is the sky blue?"
}'
  • POST /api/generate — generación a partir de un prompt.
  • POST /api/chat — conversación con una lista de mensajes con roles.
  • /api/embed — embeddings, la representación numérica de un texto.

La diferencia entre generate y chat es la forma de la entrada: generate recibe un prompt suelto, chat recibe messages con sus roles. Elegís según lo que estés construyendo.

Qué modelos hay corriendo

ollama ps

Muestra los modelos activos. Es el comando que más vas a usar cuando algo va lento y quieras entender qué está pasando de verdad.

Para bajar uno sin cerrar el servidor:

ollama stop gemma4

Esa separación entre servidor y modelo cargado es la idea importante de esta unidad: el servidor vive, los modelos entran y salen de memoria.