Saltar al contenido

¿Qué es el aprendizaje profundo por refuerzo?

30/12/2023
¿Qué Es El Aprendizaje Profundo Por Refuerzo?

¿Qué implica el Deep Reinforcement Learning o Aprendizaje Reforzado Profundo?

El aprendizaje reforzado profundo se encuentra entre las metodologías más empleadas en el diseño y desarrollo de tecnologías de Inteligencia Artificial (IA), junto a las técnicas de aprendizaje no supervisado y aprendizaje supervisado. El Aprendizaje Reforzado Profundo normalmente arroja resultados notoriamente sorprendentes y superlativos, derivado de su ingeniosa mezcla de aprendizaje profundo con aprendizaje reforzado. Pero, ¿cómo funciona exactamente este procedimiento? Para entenderlo mejor, será beneficioso definir previamente qué es el aprendizaje reforzado común.

Los algoritmos de aprendizaje reforzado están centrados en la consecución de objetivos, y se diseñan a través de un proceso de ensayo y error, con el propósito de optimizar la elección que produce mejores resultados o una «recompensa» más grande. Al momento de entrenar estos algoritmos, se conceden «recompensas» o «castigos» que influirán en las decisiones próximas. Los algoritmos se esfuerzan por encontrar conjuntos de acciones que concedan al sistema la recompensa más grande, equilibrando las recompensas inmediatas con las futuras. Los algoritmos de aprendizaje reforzado se destacan por su potencia y flexibilidad, ya que se pueden adaptar para cualquier tarea o entorno y son capaces de aprender acciones posibles de manera dinámica.[automatic_youtube_gallery type="search" search="¿Qué es el aprendizaje profundo por refuerzo?" cache="2419200" per_page="1" thumb_excerpt="0" player_description="0"]

Enfoque general del aprendizaje reforzado profundo

&Iquest;QuÉ Es El Aprendizaje Reforzado Profundo?

Foto: Megajuice vía Wikimedia Commons, CC 1.0 (https://commons.wikimedia.org/wiki/File:Reinforcement_learning_diagram.svg)

Al trabajar con aprendizaje reforzado profundo, los entornos suelen presentarse en forma de imágenes, es decir, capturas que representan el estado del entorno en un momento específico. El agente necesita analizar dichas imágenes y extraer de ellas la información relevante, que utilizará para determinar la acción más apropiada. Existen dos técnicas principales para llevar a cabo el proceso de aprendizaje reforzado profundo: el aprendizaje basado en valores y el aprendizaje basado en políticas.

El aprendizaje basado en valores recurre a algoritmos y arquitecturas como las redes neuronales convolucionales y las Redes Q profundas. Los mencionados algoritmos obrajan convirtiendo la imagen a escala de grises, suprimiendo las secciones innecesarias de la imagen, y luego agrupando una serie de convoluciones y operaciones, para obtener las partes más relevantes de la imagen. Posterior a ello, se utilizan estas partes para calcular el valor Q que corresponderá a las diversas acciones que puede realizar el agente. Los valores Q se emplean para decidir la ruta más óptima que el agente debe seguir. Una vez que los valores Q iniciales han sido calculados, se procede con una retroalimentación para afinar estos cálculos y obtener estimados más precisos.

Cuando el número de acciones potenciales que puede realizar el agente es sumamente alto, como es el caso en los escenarios del mundo real, los métodos basados en políticas se presentan como la opción más práctica, dado que calcular los valores Q para cada acción individual puede resultar ineficaz. Los enfoques basados en políticas operan sin tener que calcular valores de funciones para acciones individuales, sino aprendiendo las políticas directamente, a menudo usando una técnica llamada gradiente de políticas.

El gradiente de políticas trabaja recolectando un estado y calculando las probabilidades de acciones basadas en las experiencias previas del agente, para después seleccionar la acción más probable. Se repite este proceso hasta el final del periodo de evaluación, y una vez concluido éste, se entregan al agente las recompensas correspondientes. Finalmente, los parámetros de la red se actualizan de acuerdo a los procesos de retroalimentación.

Explorando el concepto de Q-Learning

Debido a que el Q-Learning desempeña un rol fundamental en el proceso de aprendizaje reforzado profundo, resulta útil dedicar un momento para analizar en profundidad su funcionamiento.

El Proceso de Decisión de Markov

&Iquest;QuÉ Es El Aprendizaje Por Refuerzo Profundo?

Un proceso de decisión de Markov. Foto: waldoalvarez vía Pixabay, licencia Pixbay (https://commons.wikimedia.org/wiki/File:Markov_Decision_Process.svg)

Para un agente de IA sea capaz de ejecutar una serie de tareas y alcanzar un objetivo dado, se necesita enfrentarse a una secuencia de estados y eventos. Este empieza en un estado y necesita ejecutar un conjunto de acciones para llegar a un estado final. En este proceso puede haber una gran cantidad de estados entre los estados inicial y final y resulta impráctico, e incluso imposible en algunos casos, almacenar información sobre todos ellos. Por ello, el sistema debe encontrar una manera de conservar sólo la información más relevante de los estados. Esto se logra mediante un Proceso de Decisión de Markov, que mantiene sólo la información acerca del estado actual y el estado anterior. Cada uno de los estados respecta una propiedad de Markov que permite rastrear como el agente cambia del estado anterior al actual.

Aprendizaje Profundo Q

Una vez que el modelo tiene acceso a los datos de los estados del ambiente de aprendizaje, se pueden calcular los valores Q. Estos son las recompensas finales concedidas al agente al final de una secuencia de acciones.

Los valores Q se calculan con base a una serie de recompensas. Hay una recompensa inmediata, calculada en el estado actual y dependiendo de la acción actual. También se calcula el valor Q para el estado subsecuente, así como para el estado posterior a éste, y así continuamente hasta que se han calculado todos los valores Q para los diferentes estados. También existe un parámetro gamma que es utilizado para determinar cuánta importancia tendrán las recompensas futuras en las acciones del agente. Las políticas normalmente se calculan inicializando de manera aleatoria los valores Q y permitiendo que el modelo vaya convergiendo hacia los valores Q óptimos a lo largo del curso del entrenamiento.

Redes Q Profundas (Deep Q Networks)

Uno de los principales retos al aplicar el Q-learning radica en que la cantidad de memoria necesaria para almacenar datos puede crecer en manera considerable con medida que el número de estados aumenta. Las Redes Q Profundas son una solución a este problema, combinando modelos de redes neuronales con valores Q, permitiendo a un agente aprender a partir de la experiencia y hacer estimados razonables sobre las mejores acciones a tomar. En el aprendizaje Q profundo, se estiman las funciones de valor Q utilizando redes neuronales. La red neuronal toma el estado como datos de entrada y genera un valor Q para todas las diferentes acciones posibles que puede llevar a cabo el agente.

El aprendizaje Q profundo se lleva a cabo mediante el almacenamiento de todas las experiencias pasadas en la memoria, calculando las salidas máximas para la red Q y luego usando una función de pérdida para calcular la diferencia entre los valores actuales y los valores teóricos más altos posibles.

Aprendizaje Reforzado Profundo vs Aprendizaje Profundo

Una de las principales diferencias entre el aprendizaje reforzado profundo y el aprendizaje profundo regular radica en que en el primero, las entradas cambian constantemente, a diferencia del aprendizaje profundo tradicional. ¿Cómo puede el modelo de aprendizaje tomar en cuenta estos cambios constantes en las entradas y resultados?

Básicamente, para manejar la divergencia entre los valores predichos y los objetivo, se pueden utilizar dos redes neuronales en lugar de una. Una red estima los valores objetivo, mientras que la otra red se encarga de las predicciones. Los parámetros de la red objetivo se actualizan en tanto el modelo aprende, tras haber pasado un número de iteraciones de entrenamiento previamente determinado. Finalmente, se juntan las salidas de las respectivas redes para determinar la diferencia.

Aprendizaje basado en políticas

Los métodos basados en políticas tienen un funcionamiento distinto de las técnicas basadas en valores Q. Mientras que aquellos métodos de valor Q generan una función de valor que predice recompensas para estados y acciones, los métodos basados en políticas determinan una política que asignará estados a acciones. En otras palabras, la función política que selecciona acciones es optimizada directamente sin considerar la función de valor.

Gradientes de Políticas

Una política de aprendizaje reforzado profundo puede caer en una de dos categorías: estocástica o determinista. Una política determinista es aquella en la que los estados se asignan a acciones, lo que significa que cuando la política recibe información sobre un estado, devuelve una acción. Mientras tanto, las políticas estocásticas dan comresultado una distribución de probabilidad para las acciones en lugar de una única y discreta acción.

Las políticas deterministas se utilizan cuando no hay incertidumbre sobre los resultados de las acciones que se pueden tomar. En otras palabras, cuando el ambiente mismo es determinista. Por el contrario, los resultados estocásticos de las políticas son apropiadas para entornos donde el resultado de las acciones es incierto. Normalmente, los escenarios de aprendizaje por refuerzo implican cierto grado de incertidumbre, por lo que se utilizan políticas estocásticas.

Los enfoques del gradiente de políticas tienen ciertas ventajas sobre las técnicas de Q-learning, así como algunas desventajas. En términos de ventajas, los métodos basados en políticas convergen hacia parámetros óptimos de manera más rápida y confiable. El gradiente de políticas puede sencillamente seguirse hasta que se hayan determinado los mejores parámetros, mientras que con los métodos basados en valores pequeños cambios en los valores de acción estimados pueden resultar en grandes cambios en las acciones y sus parámetros asociados.

Los gradientes de políticas también se desempeñan mejor para los espacios de acción de alta dimensión. Cuando hay un número extremadamente alto de acciones posibles para llevar a cabo, el Q-learning profundo se vuelve poco práctico