Le jeu de trading de crypto n’a pas encore de vainqueur, que les IA se sont déjà mises au poker Texas Hold’em.
Cette fois, au lieu de s'affronter avec le marché, l'IA se retrouve face à une autre IA.
Comparé à l'affrontement avec le marché, cette fois-ci, l'adversaire de l'AI est devenu une autre AI.
Auteur : Eric, Foresight News
Il reste 4 jours avant la clôture du concours de trading NOF1 AI. Actuellement, DeepSeek et Tongyi Qianwen sont toujours largement en tête, tandis que les 4 autres AI n'ont pas réussi à surpasser la simple détention de bitcoin. Sauf surprise, DeepSeek devrait remporter le championnat. Il ne reste plus qu'à voir quand les autres dépasseront le rendement du simple holding de bitcoin, et qui finira dernier.
Bien que le trading de cryptomonnaies par AI se fasse sur un marché en constante évolution, cela reste un jeu PvE. Pour vraiment comparer « quelle AI est la plus intelligente » plutôt que « quelle AI sait le mieux trader » dans un jeu PvP, le jeune russe Max Pavlov a réuni 9 AI autour d'une table de poker Texas Hold'em.
D'après les informations publiques sur LinkedIn, Max Pavlov a longtemps travaillé comme chef de produit. Dans la présentation de son site de poker AI, il indique également être passionné par le deep learning, l'AI et le poker. Quant à la raison de ce test, Max Pavlov explique que la communauté du poker n'a pas encore atteint de consensus sur la fiabilité du raisonnement des grands modèles de langage, et que ce tournoi vise à démontrer les capacités de raisonnement de ces modèles dans des parties réelles.

Peut-être parce que Grok n'a pas brillé dans le trading de cryptomonnaies, Elon Musk a partagé hier une capture d'écran montrant Grok en tête du tournoi de poker, comme pour « reprendre la main ».
Comment les AI se sont-elles comportées ?
Ce tournoi de poker a invité 9 participants, dont les bien connus Gemini, ChatGPT, Claude Sonnet (lancé par Anthropic, soutenu par FTX), Grok, DeepSeek, Kimi (AI du groupe Moonshot), Llama, ainsi que Mistral Magistral, développé par la société française Mistral AI et axé sur le marché et les langues européennes, et enfin GLM, issu de Beijing Zhipu, pionnier chinois dans la recherche sur les grands modèles de langage.

Au moment de la rédaction, Gemini, ChatGPT, Claude Sonnet, Grok et DeepSeek sont dans le vert, tandis que les 4 autres sont en perte, le participant Llama de Meta étant le plus mal en point, ayant déjà perdu plus de la moitié de sa mise.

Le tournoi a débuté le 27 et se termine le 31, il reste donc moins d'un jour et demi. D'après la courbe des rendements, Grok de xAI a longtemps mené durant la première journée, restant en deuxième position après avoir été dépassé par Gemini. Sur les 2540 mains jouées, Grok a été dépassé par Claude Sonnet vers la 2270e main, puis par ChatGPT vers la 2500e main.
DeepSeek, Kimi et le participant européen Mistral Magistral sont restés stables autour de l'équilibre. Llama a commencé à chuter brutalement après la 740e main, se maintenant en dernière position, tandis que GLM a décroché vers la 1440e main.
Au-delà du rendement, les statistiques techniques révèlent les différentes « personnalités » des AI participantes.

En ce qui concerne le VPIP (Voluntarily Put $ In Pot, mise volontaire dans le pot), notre participant Llama atteint 61 %, misant dans plus de la moitié des tours. Les trois joueurs les plus prudents ont logiquement le moins d'actions, tandis que les meilleurs ont un VPIP compris entre 25 % et 30 %.
Pour le PFR (Pre-Flop Raise, relance avant le flop), Llama est également en tête, suivi de près par Gemini, le plus rentable. On voit donc que Llama de Meta est un joueur excessivement agressif et proactif, tandis que Gemini, bien que relativement agressif, reste modéré, misant fort avec de bonnes mains et profitant de l'audace de Llama, ce qui a mené à des résultats opposés pour les deux.
En combinant les données de 3-Bet et C-Bet, on constate que Grok est en réalité un joueur plutôt stable, pas trop passif, mais très oppressant avant le flop. Ce style lui a permis de garder la tête au début, mais la stratégie agressive de Gemini et ChatGPT, combinée à la fougue de Llama, a permis aux plus audacieux de prendre la tête.
Comment les AI analysent-elles ?
Max Pavlov a défini quelques règles de base pour ce tournoi : blinds à 10/20 dollars, pas d'ante ni de straddle, 9 joueurs répartis sur 4 tables, et un réapprovisionnement automatique à 100 big blinds si le tapis descend en dessous de ce seuil.
De plus, toutes les AI utilisent le même prompt, avec une limite de tokens pour restreindre la longueur du raisonnement, et en cas de réponse anormale, elles foldent par défaut. Max Pavlov a prévu de demander aux AI d'expliquer leur décision pendant ou après chaque main.
Voyons, à travers une main jouée lors de la rédaction de cet article, comment les AI analysent la situation.

Après que Claude et Gemini aient payé les blinds, Llama estime que le 8 de pique et la Q de trèfle sont des mains « relativement fortes », permettant de viser une quinte ou une couleur, et suit donc pour 20.

DeepSeek considère que Q de cœur et 2 sont trop faibles pour suivre à cette position, tandis que GLM pense qu'avec une main assortie en position intermédiaire, il peut relancer pour construire le pot contre un Llama loose, et que 80 dollars permettent de garder le pot sous contrôle tout en mettant la pression. Kimi, avec une main de même valeur mais de couleurs inversées par rapport à Llama, estime que sa main est trop faible et qu'il risque un 3-Bet, donc il ne suit pas.
Jusqu'ici, on voit que Llama ne fait pas d'analyse de données ou de position, misant presque « à l'aveugle », alors que les trois suivants prennent leur décision en fonction de la position et des données précédentes.

Après que GPT o3 ait osé relancer à 260 avec un As, Grok et Magistral choisissent de folder, Grok ayant même deviné que GPT avait probablement AK ou une paire supérieure, et, compte tenu du rythme effréné de Llama, préfère abandonner.

Ensuite, Gemini, Llama et GLM foldent également. GLM pense que GPT a probablement une grosse paire ou un As, tandis que Llama, sans analyse de données, estime simplement que sa main est assez forte, mais pas au point de suivre une mise de 260.
L'audace de Llama, la prudence de DeepSeek et Kimi, et l'audace de GPT se sont toutes manifestées dans cette main, qui s'est terminée sans flop, GPT remportant le pot. Au moment de la rédaction, les profits des quatre premiers continuent de croître, et il est probable que le champion sera l'un d'eux. Les AI qui n'ont pas brillé dans le trading de cryptomonnaies ont su prouver leur valeur au poker.
Bien que de nombreux laboratoires testent les capacités des AI selon des protocoles scientifiques, les utilisateurs s'intéressent surtout à l'utilité de l'AI pour eux-mêmes. DeepSeek, peu performant au poker, est un excellent trader, tandis que Gemini, piètre trader, brille à la table de poker. Lorsque l'AI intervient dans différents contextes, nous pouvons, à travers des comportements et résultats compréhensibles, observer les domaines de prédilection de chaque AI.
Bien sûr, quelques jours de trading ou de poker ne suffisent pas à conclure sur les capacités d'une AI dans un domaine ou sur son évolution future. Les décisions de l'AI sont dénuées d'émotion, et leur processus dépend de la logique sous-jacente de l'algorithme, parfois même inconnue de ses développeurs.
Grâce à ces tests ludiques hors laboratoire, nous pouvons observer plus intuitivement la logique de l'AI face à des situations et jeux familiers, et ainsi repousser les frontières de la réflexion entre humains et AI.
Avertissement : le contenu de cet article reflète uniquement le point de vue de l'auteur et ne représente en aucun cas la plateforme. Cet article n'est pas destiné à servir de référence pour prendre des décisions d'investissement.
Vous pourriez également aimer
Selon les informations, la Banque d’Angleterre envisage de suspendre la vente d’obligations à long terme, le “plus agressif” des acteurs du resserrement monétaire mondial freine dans la tempête obligataire.
Vendre une fois, perdre la moitié ; la Banque d’Angleterre a freiné sur la réduction quantitative.

La hausse des taux d'intérêt de la Fed jeudi fait presque l'unanimité, pourquoi Standard Chartered refuse-t-elle de "capituler" ?
Standard Chartered estime que les pressions inflationnistes de base pourraient être surestimées et que relever les taux reste un « mauvais choix de politique » : les droits de douane augmentent l’indice PCE d’environ 0,7 point de pourcentage, mais leur impact devrait s’atténuer ; l’indice CPI ultra sous-jacent est déjà revenu dans une fourchette normale et la pression côté consommation est limitée. En juillet, seuls trois membres votants soutiennent une hausse des taux et les données actuelles sont insuffisantes pour que davantage de membres changent d’avis. Une approche plus raisonnable serait d’attendre que l’effet des droits de douane et la révision des données s’estompent avant d’évaluer la tendance de l’inflation.
Au moment où le rendement des obligations américaines à 10 ans dépasse 5 %, le rendement des obligations japonaises est également passé sous la barre des 3 %, la pression sur les marchés obligataires mondiaux s'accroît brusquement !
Les marchés obligataires mondiaux tirent la sonnette d'alarme : le rendement des obligations américaines dépasse 5 %, atteignant un niveau record depuis 2007, tandis que les obligations japonaises atteignent leur plus haut niveau depuis 30 ans. La flambée des prix du pétrole, une inflation persistante et d'énormes dettes exercent une triple pression qui provoque une vague de ventes massives. Les institutions avertissent : 5 % n'est pas la limite, 6 % est déjà en ligne de mire ! Avec la décision des banques centrales américaine et japonaise prévue cette semaine, une tempête d'actifs encore plus intense pourrait tout juste commencer.
Le trading par IA ralentit ! Goldman Sachs avertit que le trading momentum connaît la plus grande divergence depuis 5 ans, les capitaux passant des puces électroniques aux logiciels
Goldman Sachs avertit que la négociation liée à l’IA fait face à une épreuve structurelle : il existe une divergence record sur cinq ans entre la performance sur trois mois et celle sur douze mois du facteur momentum, tandis que l’indice IA recule de près de 45% par rapport à son sommet. Par ailleurs, les capitaux se déplacent des semi-conducteurs vers les logiciels, accélérant la différenciation du facteur momentum. Selon Goldman Sachs, si cette vague de rotation se poursuit, la corrélation à long terme entre l’IA et le momentum pourrait progressivement se relâcher.
