Cuando DeepMind presentó AlphaStar en 2019, derrotando al campeón mundial de StarCraft II Serral 10-1, la comunidad de desarrollo de juegos quedó en shock. No era un truco de marketing ni un bot programado manualmente con miles de reglas. Era un agente de inteligencia artificial entrenado mediante reinforcement learning (aprendizaje por refuerzo), capaz de tomar decisiones estratégicas en un espacio de acciones prácticamente infinito.
He experimentado con sistemas de IA para minijuegos como proyecto personal, y puedo decirte que lo que DeepMind y OpenAI lograron no es solo un hito técnico: es una demostración práctica de cómo el refuerzo profundo puede resolver problemas que parecían imposibles hace una década. En este artículo voy a desglosar qué hace que estos sistemas funcionen, por qué StarCraft y Dota 2 son los bancos de prueba perfectos, y qué se puede extraer de todo esto para el desarrollo de IA en juegos.
¿Por Qué StarCraft y Dota 2 Son el Everest de la IA en Juegos?
Antes de hablar de técnicas conviene entender por qué estos juegos resultan tan especiales a la hora de entrenar bots. A diferencia del ajedrez o Go, que DeepMind ya había conquistado, StarCraft y Dota 2 presentan desafíos de otra naturaleza:
Estos factores hacen que el reinforcement learning encaje casi a la perfección. A diferencia del supervised learning, donde harían falta millones de ejemplos etiquetados, el RL permite que el agente aprenda explorando el entorno y recibiendo recompensas según gane o pierda.
AlphaStar: La Arquitectura que Conquistó StarCraft II
El Núcleo Técnico
AlphaStar utiliza una arquitectura basada en redes neuronales profundas combinadas con policy gradient methods (métodos de gradiente de política). La red recibe como entrada información visual del mapa —procesada mediante CNNs y con resolución variable—, datos estructurados sobre unidades, construcciones y recursos, y el historial de acciones previas.
Con todo eso produce como salida una distribución de probabilidad sobre las acciones que el agente puede ejecutar.
Lo interesante es que AlphaStar no intenta predecir todas las acciones a la vez. En su lugar recurre a un sistema jerárquico:
Esto reduce drásticamente la complejidad del problema: en vez de elegir entre millones de acciones posibles, el agente elige entre unas pocas decenas de funciones de alto nivel.
El Entrenamiento
DeepMind entrenó AlphaStar con una técnica llamada league training (entrenamiento en liga). La idea, bastante ingeniosa, consiste en no limitarse a entrenar un único agente contra sí mismo, sino mantener múltiples versiones —con diferentes arquitecturas y parámetros— compitiendo entre ellas. Así se evita que el agente converja hacia estrategias fácilmente explotables.
El proceso funciona, a grandes rasgos, así:
El resultado es que AlphaStar terminó aprendiendo estrategias emergentes que ningún humano había diseñado explícitamente: tácticas de harass, timing attacks y macro management conceptualmente parecidas a las que emplean los mejores jugadores profesionales.
OpenAI Five: Dominando el Caos de Dota 2
Un Problema Aún Más Duro
Si StarCraft ya es difícil, Dota 2 roza la pesadilla. El espacio de acciones es todavía más amplio, hay diez jugadores simultáneos (5v5) y cada héroe tiene habilidades completamente distintas. OpenAI Five se enfrenta además a un problema que AlphaStar no tiene: la coordinación multiagente.
OpenAI resolvió esto entrenando a cinco agentes de forma simultánea, cada uno controlando un héroe. Los agentes se comunican entre sí mediante canales de atención (attention mechanisms), que les permiten "leer" el estado de sus aliados en tiempo real.
PPO: El Algoritmo Ganador
Mientras AlphaStar recurre a métodos de policy gradient más clásicos, OpenAI Five se apoya en Proximal Policy Optimization (PPO), un algoritmo más estable y sample-efficient que buena parte de las alternativas disponibles.
PPO se organiza en torno a tres piezas que trabajan juntas. Por un lado está el actor o policy network, que decide qué acción tomar en cada estado del juego. Por otro, el crítico o value network, encargado de estimar el valor de cada estado, es decir, la recompensa futura que cabe esperar desde ahí. Y por último, la llamada trust region, un mecanismo que evita que las actualizaciones del modelo sean demasiado bruscas y acaben desestabilizando todo el entrenamiento.
Lo importante aquí es que PPO es on-policy, es decir, el agente aprende de sus propias experiencias recientes. Esto resulta clave en juegos competitivos, donde el entorno —al incluir a otros agentes que también aprenden— cambia constantemente.
Escalado Masivo
OpenAI Five se entrenó sobre una infraestructura descomunal: miles de GPUs y TPUs ejecutando millones de episodios de juego en paralelo. Esto no es un detalle accidental, sino algo fundamental, porque el RL necesita experiencia, y mucha. Según las estimaciones que se han difundido sobre el proyecto, hablamos del equivalente a miles de años de partidas comprimidos en apenas semanas de entrenamiento paralelo.
Lecciones Prácticas para Desarrolladores
Si trabajas en minijuegos o proyectos indie —como es mi caso— es poco probable que tengas acceso a miles de GPUs, así que vale la pena preguntarse qué se puede rescatar de todo esto para una escala mucho más modesta.
Lo primero es intentar simplificar el espacio de acciones. Tanto AlphaStar como OpenAI Five reducen la complejidad mediante abstracciones, y esa misma lógica aplica a proyectos pequeños: si estás entrenando un bot para un juego de estrategia sencillo, no tiene sentido que el agente elija entre millones de acciones posibles. Definir macroacciones de alto nivel simplifica enormemente el problema.
Otro punto que marca la diferencia es el reward shaping. La recompensa final —ganar o perder— es demasiado escasa para que el aprendizaje sea eficiente. Ambos sistemas añaden recompensas intermedias, como destruir unidades enemigas, acumular oro o capturar objetivos, y eso acelera bastante el proceso de aprendizaje.
El self-play también merece mención aparte, porque no hace falta contar con millones de GPUs para aprovecharlo. Incluso en un proyecto indie, entrenar agentes contra versiones anteriores de sí mismos suele ser mucho más eficiente que enfrentarlos siempre a un oponente fijo.
Y por último, conviene no perder de vista la divergencia del entrenamiento. Los agentes de RL tienden a explotar cualquier grieta en la función de recompensa, así que hay que revisar con frecuencia si el agente está desarrollando estrategias genuinamente inteligentes o simplemente aprovechando bugs del sistema.
El Futuro: Más Allá de los Esports
Lo fascinante es que estas técnicas ya están migrando a otros terrenos. DeepMind ha publicado trabajos sobre RL aplicado a robótica, optimización de redes y biología computacional. Para quienes desarrollamos juegos, esto sugiere que los sistemas de IA cada vez más sofisticados dejarán de ser un lujo para convertirse en una expectativa más o menos estándar.
La pregunta no es tanto si el RL llegará a los juegos indie, sino cuándo lo hará. Y cuando llegue, espero que este artículo haya servido para entender un poco mejor qué está sucediendo bajo el capó.
¿Quieres profundizar más? Revisa los papers originales de DeepMind y OpenAI. Son técnicamente densos, pero valen cada ecuación.

