Agents IA de Pokemon Showdown construits avec des API LLM gratuites et appel d'outils

Un développeur a construit un système où des LLM comme Llama 3, Qwen et Gemma jouent de manière autonome à des combats Pokémon Showdown. Les agents analysent l'état complet du combat à chaque tour — affinités de type, PV, météo, conditions de terrain, informations adverses révélées — et décident d'attaquer ou de changer de Pokémon en utilisant des appels d'outils structurés.
Points clés
- Achemine tout via LiteLLM et utilise exclusivement des modèles avec des niveaux d'API gratuits (Groq, Cerebras, OpenRouter, Google AI Studio).
- Coût d'inférence zéro pour une exécution locale.
- Deux modes : Humain vs. IA (jouer contre le bot) et IA vs. IA (opposer deux modèles l'un à l'autre).
- Prend en charge plus de 15 modèles gratuits prêts à l'emploi.
- Observabilité complète via Langfuse pour voir les appels d'outils exacts et le raisonnement à chaque tour.
Points forts de l'architecture
L'agent utilise l'appel d'outils pour structurer les décisions — plutôt qu'une simple réponse par prompt — les données brutes du champ de bataille sont fournies au LLM, qui sélectionne ensuite les actions d'attaque ou de changement via des schémas d'outils prédéfinis. Cela permet de raisonner sur des états de plateau complexes comme les avantages de type et les effets de terrain dynamiques.
Dépôt GitHub
Code et instructions de configuration : github.com/MohamedMostafa259/pokemon-ai-agent
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Engram : couche mémoire open-source pour Claude Code et les clients MCP
Engram est une couche de mémoire open-source qui fonctionne comme un serveur MCP avec n'importe quel client comme Claude Code, Cursor ou Windsurf. Il stocke des souvenirs illimités avec une recherche sémantique vectorielle, atteint 80 % de précision sur le benchmark LOCOMO et utilise environ 800 tokens par requête contre 5 000+ pour les approches basées sur des fichiers.

Le moteur d'inférence Atlas devient open source : Rust pur + CUDA, plus de 100 tok/s sur DGX Spark
Atlas est maintenant open source — un moteur d'inférence Rust + CUDA qui atteint un pic de 130 tok/s sur Qwen3.5-35B (NVFP4) sur un seul DGX Spark, sans runtime Python et avec un démarrage à froid inférieur à 2 minutes.

Leanstral : Agent de Code Open-Source pour Lean 4 et l'Ingénierie de Preuves Formelles
Mistral AI a publié Leanstral, le premier agent de code open-source conçu pour Lean 4, avec 6 milliards de paramètres actifs et une licence Apache 2.0. Les benchmarks montrent qu'il surpasse les modèles open-source plus grands et offre des performances compétitives par rapport à Claude à un coût significativement inférieur.

Sens : SDK Go pour les assertions de test basées sur les LLM et l'extraction de texte structuré
Sense est un SDK Go qui utilise Claude pour deux fonctions principales : évaluer les sorties non déterministes dans les tests avec des assertions en langage naturel, et extraire des structures typées de textes non structurés via la réflexion et l'utilisation forcée d'outils.