LLM Tune
Explorador de Parámetros de Decodificación

LLM Tune

LLM Tune es un playground interactivo diseñado para experimentar con Temperatura, Top-k, Nucleus Sampling (Top-p) y penalización de repetición, visualizando en tiempo real cómo estos hiperparámetros transforman la distribución de tokens y la creatividad en modelos de lenguaje.

Experimenta con variaciones de muestreo estocástico para calibrar el balance óptimo entre coherencia fáctica y diversidad lingüística según la tarea requerida.

1

¿Qué hace esta app?

Esta aplicación es un recurso académico que demuestra, paso a paso, cómo los parámetros de decodificación (Temperatura, Top-k, Top-p y Penalización por repetición) influyen en la generación de texto por un LLM. Primero explicamos cada parámetro conceptualmente, luego mostramos ejemplos numéricos y, finalmente, permitimos experimentar con ejemplos prácticos (playground).

🌡️

Temperatura

Controla la aleatoriedad en el muestreo: valores bajos concentran probabilidad en el modo más probable; valores intermedios equilibran coherencia y variedad; valores altos amplifican la diversidad.

🔢

Top-k

Limita el número absoluto de candidatos considerados en cada paso. Un k pequeño fuerza salidas predecibles, un k grande permite mucha diversidad pero puede introducir ruido.

🎯

Top-p

Selecciona el núcleo probabilístico acumulado hasta alcanzar la masa p. A diferencia de top-k, top-p adapta el tamaño del conjunto según la distribución.

🔄

Penalización

Reduce la probabilidad de volver a escoger tokens ya generados, evitando bucles y muletillas; un valor moderado mejora diversidad sin sacrificar coherencia.

Fundamentos de Decodificación y Estrategias de Muestreo en LLMs

Los modelos de lenguaje basados en arquitecturas Transformer generan texto token por token de manera autoregresiva. En cada paso de inferencia, la red neuronal produce un vector de logits sobre la totalidad del vocabulario. La decodificación es el algoritmo matemático que convierte estos logits no normalizados en una distribución de probabilidad de tokens candidatos mediante una función softmax escalada.

1. Temperatura (T) y Escalado de Logits

El hiperparámetro de temperatura modula la entropía de la función softmax dividiendo cada logit z_i por T antes de la exponencial: P(w_i) = exp(z_i / T) / Σ exp(z_j / T). A temperaturas cercanas a 0 (T < 0.2), la distribución se vuelve casi determinista (Greedy Search), seleccionando siempre el token más probable. Conforme T supera 1.0, la distribución se aplana, otorgando mayor probabilidad a tokens de baja frecuencia y posibilitando mayor creatividad léxica a expensas de la precisión fáctica.

2. Top-k y Nucleus Sampling (Top-p)

El truncamiento por Top-k restringe la selección a los k tokens con mayor probabilidad absoluta, descartando por completo la cola larga del vocabulario. Por su parte, el muestreo por núcleo (Top-p), introducido por Holtzman et al. (2019), selecciona el subconjunto dinámico de menor tamaño cuya masa de probabilidad acumulada alcance el umbral p. Esto ajusta el espacio de búsqueda según la certeza del modelo en cada contexto.

3. Penalización por Frecuencia y Repetición

En modelos autorregresivos, los bucles de repetición son un artefacto común debido a la acumulación de probabilidad local. Los factores de penalización reducen el logit de aquellos tokens que ya han sido generados en la ventana de contexto previa, obligando al modelo a introducir variantes sintácticas y léxicas sin perder el hilo temático.

4. Aplicaciones Prácticas y Calibración

Para tareas de extracción de datos, generación de código y respuestas técnicas, se recomienda calibrar T entre 0.0 y 0.2 con Top-p de 0.9. Para redacción creativa, lluvia de ideas y generación literaria, se sugiere calibrar T entre 0.7 y 0.95 con Top-p de 0.95 para permitir metáforas y giros lingüísticos inesperados.

ExploraModelo

Material educativo sobre parámetros de decodificación en LLMs

Diseñado con foco en accesibilidad y experiencia de aprendizaje