Dos características y una etiqueta binaria: capa oculta con tanh y salida logística. Gradiente completo de la entropía cruzada binaria media; mapa de calor de la probabilidad y frontera de nivel 0,5 (XOR o espirales).
Sobre el modelo
Un perceptrón multicapa mínimo: una capa oculta con tanh y salida logística σ(z₂) para una etiqueta binaria a partir de las características (x, y). Paso hacia adelante: z₁ = W₁x + b₁, a₁ = tanh(z₁), z₂ = w₂ᵀ a₁ + b₂, ŷ = σ(z₂). El entrenamiento es el gradiente completo sobre toda la muestra, con paso η, de la entropía cruzada binaria media. La retropropagación es la regla de la cadena: el error ŷ − y tira de los pesos de salida y, a través de tanh′(z₁) = 1 − tanh²(z₁), de los de la capa oculta. El mapa de calor de σ(z₂(x, y)) muestra la estimación de la probabilidad de la clase 1 y cómo se mueve la frontera de nivel ~0,5 después de bloques de épocas; el anillo blanco es un error en el entrenamiento. Las plantillas son el problema XOR y dos espirales.
Para quién: Curso introductorio de redes neuronales: perceptrón, entropía cruzada, retropropagación.
Conceptos clave
perceptrón multicapa
tangente hiperbólica
sigmoide
entropía cruzada binaria
gradiente completo sobre la muestra
retropropagación
frontera de decisión
problema XOR
Cómo funciona
Red 2 → H → 1: z₁ = W₁x + b₁, capa oculta tanh, salida ŷ = σ(w₂ᵀ a₁ + b₂). La pérdida es la entropía cruzada binaria media; el gradiente se promedia sobre todos los puntos. Retropropagación: ŷ − y en la salida y luego tanh′ hacia los pesos de la capa oculta. El mapa de calor estima P(clase 1); la frontera de nivel 0,5 se mueve con las épocas.
Preguntas frecuentes
¿Por qué aquí se usa tanh y no ReLU?
ReLU es más habitual en redes profundas por la velocidad y las activaciones dispersas, pero tanh es suave y acotada: en un modelo didáctico tan pequeño resulta más cómoda y más cercana a las cuentas clásicas. Si hay saturación, igual se ve el efecto de las derivadas que se desvanecen.
¿En qué se diferencia el gradiente completo del estocástico?
El paso estocástico toma un punto o un conjunto aleatorio pequeño; el gradiente completo promedia sobre todos los puntos. Así se lee mejor un solo paso, pero en una muestra grande cuesta más.
¿Por qué a veces las espirales no terminan de aprenderse?
Las espirales son difíciles y la red es chica: hacen falta ancho de la capa oculta, un paso estable y muchas épocas. A la frontera pueden hacerle falta pliegues que, con una capa estrecha, aparecen despacio o se quedan en un mínimo pobre.