Qué es un LLM
Un modelo de lenguaje grande (LLM) genera texto prediciendo el siguiente token más probable a partir de todo lo que vino antes. Un token es una unidad de texto (a veces una palabra, a veces un fragmento de palabra); el modelo no ve letras ni palabras completas, y eso explica errores curiosos como contar mal las letras de una palabra.
El modelo solo puede considerar una cantidad limitada de texto a la vez: la context window (ventana de contexto). Lo que queda fuera de esa ventana no influye en la respuesta. Además, su conocimiento llega hasta una fecha de corte (knowledge cutoff): sobre eventos posteriores puede no saber nada o, peor, generar una respuesta que suena correcta sin serlo.
La generación es probabilística: parámetros como la temperature (temperatura) regulan cuánta variabilidad hay al elegir cada token. Por eso el mismo prompt (el texto que le escribís) puede producir respuestas distintas en dos intentos.
Igual de importante es lo que un LLM solo no hace: no busca en internet, no recuerda conversaciones anteriores y no ejecuta acciones por su cuenta. Muchos asistentes agregan esas capacidades por fuera del modelo (búsqueda web, memoria entre chats, herramientas), a veces activadas por vos y a veces por el producto: revisá en los ajustes qué tiene el tuyo. Entender estos límites es la base para usarlo bien.