El ajedrez, el Go y el póker han servido como importantes campos de prueba para la inteligencia artificial. Pero el póker se diferencia de los otros dos en una forma fundamental: es un juego de información imperfecta.
En el ajedrez y el Go, el estado completo del juego es visible. En el póker, un jugador — y de igual manera una IA de póker — conoce sus propias cartas, las cartas comunitarias, el tamaño del bote, los tamaños de los stacks y las acciones anteriores, pero no puede ver las cartas privadas de los oponentes.
Incluso las acciones de un oponente no revelan esa información oculta con certeza. Una gran apuesta puede representar una mano fuerte o un farol. Un check puede indicar debilidad, pero también puede ocultar un monstruo. Diferentes manos pueden tomar la misma acción, mientras que la misma mano no necesariamente tiene que jugarse de la misma manera cada vez.
Por lo tanto, una IA de póker no puede simplemente intentar "adivinar" qué cartas tiene un oponente. Debe razonar sobre las distribuciones de manos y estrategias posibles, y tomar decisiones basadas en esas probabilidades y posibles resultados futuros.
Eso es precisamente lo que hizo que el póker fuera un desafío tan valioso para la investigación en IA.
¿Por qué el póker es un problema de IA diferente al ajedrez?
En el ajedrez, la posición completa se conoce en cualquier momento dado. Una de las principales dificultades proviene del enorme número de secuencias futuras posibles que pueden desarrollarse a partir de esa posición.
El póker añade otro problema: parte del estado actual del juego está oculta.
En el river, por ejemplo, una IA puede conocer la mesa exacta, el tamaño del bote, los stacks efectivos y el historial de apuestas completo mientras aún no tiene conocimiento directo de las dos cartas ocultas de su oponente. En cambio, debe razonar sobre un rango de manos posibles y la probabilidad asociada con cada una de ellas.
Luego está la estrategia mixta.
Una estrategia óptima de póker no necesariamente dice que la misma mano siempre debe tomar la misma acción. Apostar puede ser correcto a una frecuencia y hacer check a otra.
El faroleo es parte del mismo sistema estratégico. Si un jugador solo apuesta manos fuertes, sus acciones revelan demasiada información y la estrategia se vuelve explotable.
Por lo tanto, el póker enfrenta a la IA con varios problemas simultáneamente: información oculta, un enorme espacio de decisiones y oponentes estratégicos que intentan activamente explotar sus decisiones.
El póker atrajo a los investigadores de IA mucho antes del boom del póker en línea
La relación entre el póker y la inteligencia artificial precede a la explosión del póker en línea.
Los investigadores estaban interesados en el juego porque combinaba probabilidad, teoría de juegos, información oculta e interacción estratégica dentro de un sistema formal con reglas claramente definidas.
El aumento del poder computacional y la capacidad de simular el póker digitalmente expandieron drásticamente lo que los investigadores podían intentar.
En 2006, se lanzó la Competencia Anual de Póker por Computadora, permitiendo que programas de póker desarrollados por universidades y grupos de investigación compitieran entre sí. La Universidad de Alberta y la Universidad Carnegie Mellon se convirtieron en centros particularmente importantes de investigación en IA de póker.
La verdadera pregunta iba mucho más allá de si los investigadores podían construir un bot de póker fuerte.
Era: ¿Cómo puede una inteligencia artificial desarrollar una estrategia efectiva en un entorno donde no tiene información completa?
2015: Una forma de Hold'em fue esencialmente resuelta
Uno de los mayores avances llegó en 2015.
Michael Bowling y los investigadores de la Universidad de Alberta anunciaron que su sistema Cepheus había resuelto esencialmente de manera débil el heads-up limit Hold'em.
Una parte clave de la investigación involucró la Minimización de Arrepentimiento Contrafactual y su variante mejorada CFR+.
En términos simplificados, el sistema evalúa repetidamente cuánto mejor podría haber actuado eligiendo acciones alternativas. Al minimizar este "arrepentimiento" acumulado a través de enormes números de iteraciones, el algoritmo se mueve hacia una estrategia de equilibrio.
El resultado no es necesariamente una regla como "siempre sube en esta situación."
En cambio, una estrategia podría especificar subir con una mano particular a una frecuencia y hacer call a otra.
Ese enfoque sonará familiar para cualquiera que haya estudiado el póker GTO moderno. Desde la perspectiva de la IA, sin embargo, el avance demostró algo mucho más amplio: juegos de información imperfecta extremadamente grandes podrían abordarse con estrategias que eran extraordinariamente difíciles de explotar para un oponente.
2017: Libratus derrota a jugadores profesionales de póker
El siguiente hito espectacular vino de la Universidad Carnegie Mellon con Libratus.
Creado por Tuomas Sandholm y Noam Brown, Libratus abordó el heads-up no-limit Hold'em — un juego mucho más complejo que el póker limit heads-up.
En enero de 2017, jugó 120,000 manos contra cuatro fuertes profesionales heads-up: Jason Les, Dong Kim, Daniel McAulay y Jimmy Chou.
Libratus ganó de manera decisiva.
Pero su importancia no fue simplemente que una computadora había vencido a jugadores profesionales de póker.
Libratus no intentaba principalmente imitar cómo los jugadores humanos de élite abordaban el juego aprendiendo de los historiales de manos humanas. Partiendo de las reglas del póker, calculó su propia estrategia.
No estaba aprendiendo cómo los humanos jugaban al póker.
Estaba tratando de determinar cómo debería jugarse el juego.
DeepStack: ¿Qué pasa cuando no puedes calcular todo?
Otro gran avance llegó alrededor de la misma época con DeepStack, que también demostró un rendimiento sobrehumano en heads-up no-limit Hold'em.
DeepStack combinó aprendizaje profundo, razonamiento teórico de juegos y búsqueda en tiempo real.
El árbol de juego completo del no-limit Hold'em es demasiado grande para calcularlo exhaustivamente. En cambio, DeepStack utilizó redes neuronales para estimar el valor de los estados futuros del juego sin tener que calcular cada posible continuación hasta el final de la mano.
Eso aborda un problema mucho más amplio en inteligencia artificial:
Si no puedes calcular cada posible futuro, ¿puede un sistema estimar con precisión el valor de estados que no ha explorado completamente?
La pregunta se extiende mucho más allá del póker.
2019: Pluribus se enfrenta al póker de seis jugadores
El póker heads-up es un concurso estratégico entre dos participantes. El póker de seis jugadores introduce un nivel de complejidad completamente diferente.
En 2019, Noam Brown y Tuomas Sandholm presentaron Pluribus, que demostró un rendimiento sobrehumano en el no-limit Hold'em de seis jugadores contra jugadores humanos de élite.
La importancia nuevamente se extendió más allá del póker.
Muchos problemas estratégicos del mundo real involucran múltiples tomadores de decisiones. Las subastas, negociaciones, mercados y competencia económica pueden involucrar resultados que dependen de las acciones de varios participantes independientes.
Por lo tanto, el póker se convirtió en un importante entorno experimental para la toma de decisiones multi-agente.
¿Qué tiene que ver todo esto con ChatGPT?
Aquí es donde es necesaria una distinción importante.
Los modelos de lenguaje grandes como ChatGPT no son descendientes tecnológicos directos de las IA de póker como Cepheus, Libratus o Pluribus.
Los transformadores, el preentrenamiento de lenguaje a gran escala y la predicción del siguiente token surgieron de una línea de investigación diferente.
La conexión se vuelve más interesante en áreas como el aprendizaje por refuerzo, el auto-juego, la búsqueda y el razonamiento.
También hay un vínculo muy concreto entre las dos eras de la investigación en IA.
Noam Brown, uno de los investigadores detrás de Libratus y Pluribus, se unió más tarde a OpenAI, donde su trabajo se centró en mejorar las capacidades de razonamiento de los modelos de lenguaje grandes. También desempeñó un papel importante en la investigación detrás del modelo de razonamiento o1 de OpenAI.
Eso no significa que los algoritmos de póker de Libratus se transfirieran simplemente a un modelo de lenguaje.
Pero hay continuidad en algunas de las preguntas de investigación subyacentes.
De la mesa de póker a los modelos de razonamiento
Una de las áreas principales de la investigación moderna en IA es el cálculo en tiempo de inferencia, o en tiempo de prueba.
La idea básica es que el poder computacional no solo debe gastarse durante el entrenamiento de un modelo. Un sistema también puede utilizar computación adicional mientras trabaja en un problema particular difícil.
La IA de juegos ya había demostrado el valor de una idea relacionada.
En lugar de calcular y almacenar una solución completa para cada situación concebible por adelantado, una IA puede realizar búsqueda y cálculo adicionales cuando se encuentra con una decisión particular.
Los modelos de razonamiento modernos operan utilizando tecnología muy diferente, pero el paralelo conceptual es claro:
¿Cómo puede una IA utilizar más computación en un problema específico difícil para producir una mejor solución?
Esta pregunta conecta algunas de las lecciones de investigación de la IA de juegos con una de las áreas más importantes del desarrollo moderno de IA.
¿Por qué fue tan útil el póker como laboratorio de IA?
El póker ofrece algo cercano a condiciones de laboratorio para estudiar la toma de decisiones difíciles.
Sus reglas, acciones y pagos están precisamente definidos, sin embargo, el juego contiene simultáneamente información privada, aleatoriedad, faroles, estrategias mixtas, un enorme espacio de decisiones y oponentes inteligentes.
El póker digital proporciona otra gran ventaja: el estado del juego puede representarse como datos estructurados — cartas ocultas, cartas de la mesa, posición, tamaño del bote, tamaños de los stacks, tamaños de las apuestas e historial de acciones.
Las computadoras también pueden simular enormes números de manos entre sí. Con el auto-juego, ni siquiera necesitan oponentes humanos para generar experiencia.
La inteligencia artificial moderna no "creció" a partir del póker en línea comercial.
Más bien, el póker simulado por computadora se convirtió en uno de los laboratorios más útiles de la investigación en IA para estudiar la toma de decisiones estratégicas bajo incertidumbre.
El verdadero legado del póker en la inteligencia artificial
En el ajedrez, una máquina debe encontrar la jugada correcta desde una posición completamente observable dentro de un enorme espacio de búsqueda.
El póker le dio a los investigadores un desafío diferente:
¿Cómo debería una máquina tomar decisiones cuando parte del estado del juego está oculta, la misma acción del oponente puede representar muchas manos diferentes, y la estrategia óptima en sí misma puede requerir faroles y acciones aleatorias?
Esta es una pregunta mucho más amplia que cómo jugar un lugar particular en el river.
El póker se convirtió en uno de los principales entornos experimentales para estudiar cómo las máquinas pueden tomar decisiones racionales en entornos parcialmente observables, adversariales y estratégicos.
En el ajedrez, la máquina podía ver todo.
En la mesa de póker, tenía que aprender a razonar sobre lo que no podía ver.
Y décadas después, algunos de los investigadores y preguntas de investigación que surgieron de ese desafío han encontrado nueva relevancia en el desarrollo de los sistemas de IA centrados en el razonamiento de hoy.

















0 comentarios