Una red neuronal artificial es un programa informático que aprende patrones a partir de ejemplos. Es la base del etiquetado de fotos, los asistentes de voz y los chatbots. Sin embargo, el principio en el que se basa es sencillo. Pequeñas unidades matemáticas se transmiten números entre sí, y el aprendizaje permite ajustar esos números. Esta guía explica en términos sencillos cómo funciona una red neuronal artificial. También muestra cómo ese mismo principio ha dado lugar a los modelos lingüísticos actuales.
¿Qué es una red neuronal artificial?
Una red neuronal artificial es un conjunto de procesadores sencillos llamados neuronas. Cada neurona recibe números, los evalúa y devuelve un único número. En general, su diseño se inspira en el cerebro. En la práctica, sin embargo, se trata simplemente de aritmética a gran escala.
La red aprende a partir de datos en lugar de reglas fijas. Si le muestras miles de fotos de gatos etiquetadas, identifica las características que importan. Nadie define ninguna regla sobre los bigotes o las orejas. Por lo tanto, el mismo método puede procesar voz, texto o datos de sensores. Nuestra guía de técnicas de aprendizaje automático muestra dónde se sitúan las redes neuronales en comparación con otros métodos.
Es esta flexibilidad la que explica su auge. Los programas antiguos requerían la intervención de un experto para describir cada caso. Una red, en cambio, solo necesita ejemplos y potencia de cálculo. Por lo tanto, los avances dependen ahora en gran medida de la calidad de los datos.
Arquitectura de las redes neuronales: capas, pesos y activaciones

La arquitectura de una red neuronal describe la forma en que se conectan las neuronas. Cada red consta de una capa de entrada, una o varias capas ocultas y una capa de salida. La capa de entrada recibe los datos brutos, como los valores de los píxeles. La capa de salida proporciona la respuesta, por ejemplo, una etiqueta o una puntuación.
Hay dos elementos que realizan la mayor parte del trabajo. Los pesos determinan la intensidad con la que una neurona influye en la siguiente. Las funciones de activación introducen una curvatura en los cálculos, lo que permite a la red modelar patrones curvos y complejos. Sin esta curvatura, muchas capas se reducirían a una simple línea. Por lo tanto, la profundidad solo aporta una ventaja cuando hay activaciones entre las capas.
Los diseñadores también eligen la anchura y la profundidad de la red. Una red pequeña funciona rápidamente, pero solo aprende patrones sencillos. Una red grande capta detalles sutiles, pero su aprendizaje resulta más costoso. En otras palabras, la arquitectura es siempre un compromiso entre potencia y coste.
Cómo el entrenamiento ajusta los pesos
El entrenamiento comienza con pesos aleatorios, lo que explica que las primeras estimaciones sean mediocres. La red realiza una predicción y la compara con la respuesta correcta. A continuación, una función de pérdida mide la desviación. A continuación, un algoritmo denominado «retropropagación» remonta el error a través de las capas e identifica los pesos que lo provocan.
El descenso del gradiente ajusta entonces cada peso en la dirección que reduce el error. Este ciclo se repite millones de veces. Poco a poco, la pérdida disminuye y las predicciones mejoran. Sin embargo, la red también puede memorizar sus datos de entrenamiento. Para evitarlo, los ingenieros reservan un conjunto de prueba y detienen el entrenamiento cuando los resultados de las pruebas se estancan.
La velocidad de aprendizaje depende de un parámetro denominado «tasa de aprendizaje». Si es demasiado alta, los pesos superan los valores óptimos. Si es demasiado baja, el entrenamiento avanza a paso de tortuga. Por eso los ingenieros dedican muchos esfuerzos a ajustarla y suelen supervisar la curva de pérdida a medida que avanza el entrenamiento.
Cómo analiza las imágenes una red neuronal convolucional
Una red neuronal convolucional está diseñada para procesar matrices de datos, en particular imágenes. En lugar de conectar cada píxel con cada neurona, desliza pequeños filtros sobre la imagen. Los primeros filtros detectan los contornos. Las capas siguientes combinan estos contornos para formar figuras, mientras que las capas más profundas reconocen rostros u objetos.
Esta arquitectura permite ahorrar memoria y mejorar la precisión. Además, un filtro entrenado en una esquina de la imagen funciona en cualquier otro lugar. Esta reutilización explica por qué los modelos convolucionales han revolucionado la búsqueda de imágenes, los exámenes médicos y las aplicaciones fotográficas.
Las etapas de agrupación (pooling) aportan un recurso adicional. Reducen el tamaño de la imagen entre capas y conservan solo las señales más fuertes. De este modo, la red sigue siendo rápida y tolera ligeras desviaciones en la imagen.
De las redes neuronales a los modelos lingüísticos
Los modelos lingüísticos modernos también son redes neuronales. Utilizan una arquitectura denominada «transformador», que evalúa la relación entre cada palabra y todas las demás. Antes de esta etapa, el texto se convierte en números. Nuestro artículo explicativo sobre las representaciones vectoriales muestra cómo funciona esta conversión.
A continuación, la escala se encarga del resto. Miles de millones de pesos, entrenados con enormes colecciones de textos, generan las habilidades generales que observamos en los chatbots. Nuestro artículo sobre los modelos base aborda esta evolución. Para un contexto técnico más amplio, consulta la presentación de las redes neuronales artificiales en Wikipedia.
Límites y conclusiones
Una red neuronal artificial es potente, pero no es magia. Necesita amplios conjuntos de datos y hereda sus sesgos. Además, funciona como una «caja negra», lo que dificulta explicar una respuesta concreta. Por ello, los equipos comprueban minuciosamente los resultados antes de confiar en ellos.
El coste constituye otra preocupación. Las grandes redes requieren chips costosos y una gran cantidad de electricidad. Además, pueden presentar fallos inesperados, como una respuesta dada con seguridad pero que, sencillamente, es errónea. Por eso, los buenos equipos supervisan los resultados tras la puesta en marcha, y no solo antes.
Sin embargo, el principio básico sigue siendo fácil de entender. Capas de cálculos matemáticos sencillos, perfeccionados mediante numerosos ejemplos, aprenden patrones que nadie ha codificado manualmente. Una vez que se comprende esto, la mayor parte de las noticias sobre la IA moderna se vuelven mucho más claras.

