Los asistentes conversacionales con inteligencia artificial ya forman parte de la vida diaria, y mucha gente se pregunta cómo “saben” qué escribir. No hay magia: detrás de cada respuesta hay muchísimas cuentas, y las ideas centrales son las mismas de la preparatoria y los primeros semestres de universidad. Probabilidad condicional, función exponencial, logaritmo y notación científica. Aquí usamos el tema como pretexto para repasar esas cuatro herramientas, con números pequeños inventados para el ejemplo.
La idea central: predecir la siguiente palabra
Un modelo de lenguaje recibe un fragmento de texto y responde una pregunta concreta: ¿qué tan probable es que cada palabra del vocabulario sea la siguiente? Después de “el cielo está”, palabras como “despejado” o “nublado” deben tener probabilidad alta, y “tornillo” casi ninguna.
En lenguaje matemático es una probabilidad condicional, , que se lee “probabilidad de dado el contexto”. Para ser una distribución válida, cada valor debe estar entre 0 y 1 y la suma sobre todas las palabras debe dar exactamente 1.
Softmax: de puntajes cualesquiera a probabilidades
Internamente el modelo produce un puntaje por palabra, un número real cualquiera que puede ser negativo o mayor que 1. Para convertirlo en probabilidad se aplica softmax:
La función exponencial es clave. Como siempre es positivo, ninguna probabilidad sale negativa. Como es creciente, un puntaje mayor sigue dando mayor probabilidad. Además amplifica diferencias: un puntaje apenas 1 mayor se vuelve unas 2,718 veces más grande, porque .
Ejemplo resuelto: tres palabras candidatas
Supón un vocabulario de juguete con tres candidatas después de “el cielo está”: “despejado” con puntaje 2, “nublado” con puntaje 1 y “tornillo” con puntaje 0.
- Calcula la exponencial de cada puntaje, con e ≈ 2,718.
- Suma los tres valores para obtener el denominador.
- Divide cada exponencial entre la suma. Para "despejado":
- Repite con las otras dos palabras.
- Comprobación: las tres probabilidades deben sumar 1 (la mínima diferencia es redondeo).
Resultado: cerca de 66,5% para “despejado”, 24,5% para “nublado” y 9% para “tornillo”. El puntaje 0 no se volvió probabilidad 0, porque .
La probabilidad de una oración completa
Generar una oración repite el proceso palabra por palabra. Por la regla de la cadena, la probabilidad de la secuencia es el producto de las probabilidades de cada paso, condicionadas a lo anterior:
Supón una oración de cuatro palabras con probabilidades 0,5, 0,4, 0,2 y 0,1 en cada paso. La oración tiene probabilidad , es decir, 0,4%. Con 50 palabras a 0,1 cada una, el producto es , tan pequeño que una computadora puede redondearlo a cero (underflow).
Por qué entra el logaritmo
La solución es trabajar con log-probabilidades, usando . Al aplicar logaritmo a la regla de la cadena, el producto se vuelve suma:
- Calcula el logaritmo de cada factor.
- Suma los valores.
- Regresa de la escala logarítmica y compara con el producto directo.
Coincide: 0,004 por ambos caminos. En el caso de 50 palabras guardamos solo en lugar de . Como el logaritmo es creciente, la oración con mayor log-probabilidad también es la más probable.
Orden de magnitud y notación científica
El tamaño de estos modelos se describe con frases como “miles de millones de parámetros”. Aquí ayuda la notación científica: mil millones es y un billón (en español) es . Si un modelo hipotético A tiene parámetros y otro B tiene , B es dos órdenes de magnitud mayor, es decir, 100 veces mayor, no “el doble”.
Errores comunes
- Creer que softmax es solo dividir entre la suma. Sin la exponencial, los puntajes negativos darían “probabilidades” negativas.
- Sumar probabilidades de pasos consecutivos. Los eventos en secuencia se multiplican.
- Olvidar que las log-probabilidades son negativas. Más cerca de 0 significa más probable.
- Confundir órdenes de magnitud. De a es 1,000 veces más, no 3 veces.
- Tomar probabilidad alta como certeza. Un 66,5% todavía deja 33,5% para otras palabras.
Preguntas frecuentes
¿Softmax siempre da valores entre 0 y 1?
Sí. Cada término es positivo y se divide entre una suma que lo incluye; con más de una palabra queda estrictamente entre 0 y 1, y todos suman 1.
¿Por qué usar la base e?
Cualquier base mayor que 1 serviría. Se prefiere e porque su derivada es ella misma, lo que simplifica el entrenamiento.
¿El logaritmo cambia cuál oración es la más probable?
No. Es una función creciente y conserva el orden.
¿Necesito cálculo para entender esto?
No para lo que se muestra aquí. Bastan probabilidad condicional y las propiedades de potencias y logaritmos.