// blog
Notas sobre IA, infraestructura y lo que voy aprendiendo.
Por qué escalar los scores de atención por √d_k evita que softmax se sature y mata los gradientes.
// blog
Por qué escalar los scores de atención por √d_k evita que softmax se sature y mata los gradientes.