Resumen
OpenAI Five es un programa informático de OpenAI que juega el videojuego five-on-five Dota 2. Su primera aparición pública ocurrió en 2017, donde se demostró en un juego uno contra uno en vivo contra el jugador profesional Dendi, quien perdió contra él. Al año siguiente, el sistema había avanzado hasta el punto de desempeñarse como un equipo completo de cinco y comenzó a jugar contra equipos profesionales y a mostrar la capacidad de derrotarlos.
Al elegir un juego tan complejo como Dota 2 para estudiar el aprendizaje automático, OpenAI pensó que podría capturar con mayor precisión la impredecibilidad y la continuidad observadas en el mundo real, construyendo así sistemas de resolución de problemas más generales. Los algoritmos y el código utilizados por OpenAI Five fueron finalmente tomados prestados por otra red neuronal en desarrollo por la empresa, una que controlaba una mano robótica física. OpenAI Five ha sido comparado con otros casos similares de inteligencia artificial (IA) que juega contra humanos y los derrota, como AlphaStar en el videojuego StarCraft II, AlphaGo en el juego de mesa Go, Deep Blue en el ajedrez y Watson en el programa de televisión Jeopardy!.
Historia
El desarrollo de los algoritmos utilizados para los bots comenzó en noviembre de 2016. OpenAI decidió usar Dota 2, un videojuego competitivo de cinco contra cinco, como base debido a que era popular en la plataforma de transmisión en vivo Twitch, tenía soporte nativo para Linux y contaba con una interfaz de programación de aplicaciones (API) disponible. Antes de convertirse en un equipo de cinco, la primera demostración pública ocurrió en The International 2017 en agosto, el torneo anual de campeonato principal del juego, donde Dendi, un jugador profesional ucraniano del juego, perdió contra un bot de OpenAI en un enfrentamiento uno contra uno en vivo. Después del partido, el CTO Greg Brockman explicó que el bot había aprendido jugando contra sí mismo durante dos semanas de tiempo real y que el software de aprendizaje era un paso hacia la creación de software que puede manejar tareas complejas "como ser un cirujano". OpenAI utilizó una metodología llamada aprendizaje por refuerzo, ya que los bots aprenden con el tiempo jugando contra sí mismos cientos de veces al día durante meses, en la que se les recompensa por acciones como matar a un enemigo y destruir torres.
Para junio de 2018, la capacidad de los bots se expandió para jugar juntos como un equipo completo de cinco y pudieron derrotar a equipos de jugadores aficionados y semiprofesionales.
De Wikipedia (CC BY-SA 4.0).