No alcanzaron los caracteres para subir el codigo completo, pero les comprato el link de Google Colab para que lo revisen y vean que efectivamente funciono. Ademas les comparto una pequeña conclusion de lo aprendido y realiado.
https://colab.research.google.com/drive/1vskKUmujxyYsL96B4R_f8SpNoZxhZH4A?usp=sharing
Ahora se Pueden Probar otras configuraciones:
Conclusion
En esta actividad utilicé el algoritmo Q-Learning para entrenar un agente en el entorno FrozenLake. Primero se creó una tabla Q con valores iniciales iguales a cero y se definieron los hiperparámetros de aprendizaje, como alpha, gamma y epsilon.
Durante el entrenamiento, el agente utilizó una estrategia epsilon-greedy, alternando entre la exploración de acciones nuevas y la selección de aquellas que habían entregado mejores resultados. Después de cada acción, los valores de la tabla Q fueron actualizados según la recompensa recibida y las posibles recompensas futuras.
Al terminar el entrenamiento, evalué al agente sin exploración, haciendo que eligiera únicamente las mejores acciones aprendidas. De esta forma fue posible medir cuántas veces consiguió cruzar el lago y llegar a la meta sin caer en los agujeros.
También probé diferentes valores para los hiperparámetros y observé que estos influyen en la velocidad y estabilidad del aprendizaje. La actividad permitió comprender cómo un agente puede aprender mediante prueba y error, utilizando recompensas para mejorar progresivamente sus decisiones.