Árbol de conocimiento
Seguridad ofensiva
Shells
Transferencia de archivos
Aplicaciones web
Inferencia
La inferencia es la ejecución de un modelo ya entrenado para producir un resultado a partir de nuevo input. En un LLM generativo, el recorrido práctico tiene dos partes: procesar el input y generar el output.
Prefill
Durante prefill, el modelo procesa los tokens de entrada antes de empezar a responder. Si enviamos 20K tokens entre instrucciones, historial y documentos, esos 20K deben procesarse antes de que aparezca el primer token de salida.
Un input mayor suele aumentar ese trabajo inicial. Desde el cliente, la espera hasta el primer token también puede incluir red, colas o preparación de la request, así que no todo el tiempo observado pertenece al modelo.
En runtimes que utilizan una KV cache, prefill también prepara el estado que se reutilizará durante la generación. La consecuencia práctica aparece sobre todo en inferencia local: más contexto requiere más tiempo de procesamiento inicial y más memoria para mantener ese estado.
Decode y generación autoregresiva
Después empieza decode. El modelo genera un token, lo añade a la secuencia y utiliza lo que ya existe para generar el siguiente. Por eso se habla de generación autoregresiva.
La respuesta no se calcula como un bloque de texto terminado. Se construye paso a paso:
- El modelo obtiene candidatos para el siguiente token.
- La configuración de generación selecciona uno.
- Ese token pasa a formar parte del contexto de la respuesta.
- El proceso se repite hasta terminar.
La generación puede parar porque el modelo produce un token de fin, alcanza el máximo de output o encuentra una secuencia de parada configurada. El máximo es un límite, no una longitud que el modelo tenga que completar.
Sampling
En cada paso existen varios tokens posibles. Sampling controla cómo se elige entre ellos.
Con una selección greedy se toma el candidato con mayor puntuación. Con sampling se elige a partir de una distribución, lo que permite variación entre ejecuciones.
Temperature
Temperature cambia cuánto pesan las alternativas menos probables. Un valor bajo concentra la selección en los candidatos principales. Un valor más alto permite más variación.
No es un control de inteligencia ni de profundidad de reasoning. Actúa sobre la selección de tokens durante decode.
Top-p
Top-p limita los candidatos al conjunto que acumula una parte determinada de la probabilidad y realiza sampling dentro de ese grupo.
Temperature y top-p pueden combinarse, aunque no conviene copiar valores entre modelos como si fueran equivalentes. Los defaults y recomendaciones dependen del modelo y del runtime. Tampoco hay que asumir reproducibilidad exacta solo por utilizar temperature = 0; versión, backend y hardware pueden seguir introduciendo diferencias.
Streaming
Sin streaming, la aplicación espera a que termine la generación y recibe la respuesta completa. Con streaming, recibe fragmentos a medida que se producen.
Esto permite mostrar texto o empezar a procesar una tool call antes de tener toda la respuesta. Mejora la espera percibida, pero no hace que decode genere tokens más rápido por sí mismo.
Velocidad y latencia
Las dos medidas que más utilizo para interpretar inferencia local son:
- Time to First Token (TTFT): tiempo hasta recibir el primer token. Incluye el efecto de prefill y, según cómo se mida, otras esperas de la request.
- Tokens/s de generación: velocidad a la que llegan los tokens durante decode.
Un número de tokens/s solo es comparable si la herramienta mide el mismo intervalo. Algunas separan prefill y decode; otras calculan una media más amplia.
El experimento de Qwen3.8-27B con OpenCode muestra la diferencia de forma práctica. Una request corta con el modelo completamente en GPU podía generar alrededor de 40–45 tokens/s, mientras una prueba con unas 50K tokens de input tardaba mucho más en procesar el prompt y generaba alrededor de 21 tokens/s. No era solo una propiedad del modelo: también cambiaban el tamaño del input y la presión sobre el runtime.
Inferencia local desarrolla la relación con memoria, offload y hardware.