Prompteo

Unidad 3 · 2 min

Modelos sin dependencia de proveedor

Por qué el agente no está atado a un proveedor, cómo apuntarlo a un modelo local y qué hacer cuando el contexto no alcanza.

Modelos sin dependencia de proveedor

Una diferencia estructural entre un agente auto-hospedado y uno gestionado es quién elige el modelo. Aquí lo elegís vos, y lo cambiás con hermes model: sin tocar código y sin reinstalar.

El mecanismo que lo hace posible es sencillo y merece entenderse. Hermes Agent habla con cualquier extremo HTTP compatible con la API de OpenAI: si un servidor implementa /v1/chat/completions, podés apuntar el agente hacia él. Eso cubre servicios en la nube, enrutadores multi-proveedor, servidores en tu propia GPU y modelos locales.

La configuración vive en config.yaml, que es la única fuente de verdad para el modelo y su dirección. La variable LLM_MODEL del archivo de entorno ya no se lee: quien la edite esperando cambiar el modelo no verá ningún efecto. La clave que fija la dirección del servidor es model.base_url.

Para un modelo local, la vía documentada es el flujo de "endpoint personalizado". Un Ollama local se alcanza en http://localhost:11434/v1 sin clave de API; vLLM y otros servidores propios usan el mismo camino.

Existe además el concepto de modelo auxiliar: tareas laterales como visión, compresión o búsqueda entre sesiones pueden enviarse a un modelo más barato. Por defecto está en auto, es decir, usa tu modelo principal.

Con modelos locales pequeños, el conjunto de herramientas por defecto más el prompt de sistema puede desbordar una ventana de contexto reducida y provocar un error de flujo vacío. La solución documentada es restringir las herramientas o cargar el modelo con más contexto.