Agents IA de Pokemon Showdown construits avec des API LLM gratuites et appel d'outils

Un développeur a construit un système où des LLM comme Llama 3, Qwen et Gemma jouent de manière autonome à des combats Pokémon Showdown. Les agents analysent l'état complet du combat à chaque tour — affinités de type, PV, météo, conditions de terrain, informations adverses révélées — et décident d'attaquer ou de changer de Pokémon en utilisant des appels d'outils structurés.
Points clés
- Achemine tout via LiteLLM et utilise exclusivement des modèles avec des niveaux d'API gratuits (Groq, Cerebras, OpenRouter, Google AI Studio).
- Coût d'inférence zéro pour une exécution locale.
- Deux modes : Humain vs. IA (jouer contre le bot) et IA vs. IA (opposer deux modèles l'un à l'autre).
- Prend en charge plus de 15 modèles gratuits prêts à l'emploi.
- Observabilité complète via Langfuse pour voir les appels d'outils exacts et le raisonnement à chaque tour.
Points forts de l'architecture
L'agent utilise l'appel d'outils pour structurer les décisions — plutôt qu'une simple réponse par prompt — les données brutes du champ de bataille sont fournies au LLM, qui sélectionne ensuite les actions d'attaque ou de changement via des schémas d'outils prédéfinis. Cela permet de raisonner sur des états de plateau complexes comme les avantages de type et les effets de terrain dynamiques.
Dépôt GitHub
Code et instructions de configuration : github.com/MohamedMostafa259/pokemon-ai-agent
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Anthropic lance Claude pour les petites entreprises avec des workflows pré-construits pour QuickBooks, HubSpot, Canva
Claude pour Petites Entreprises est un module complémentaire activable dans Claude Cowork qui se connecte à QuickBooks, PayPal, HubSpot, Canva, Docusign, Google Workspace et Microsoft 365, avec 15 workflows agentiques prêts à l'emploi pour la paie, la clôture mensuelle, la facturation, la gestion de campagnes, etc.

L'approche de débat multi-agents améliore la qualité du raisonnement des LLM.
Un développeur a expérimenté une approche de débat multi-agents avec CyrcloAI, où différents agents IA endossent des rôles comme analyste, critique et synthétiseur pour critiquer les réponses des autres avant de produire une réponse finale, ce qui a donné des résultats plus structurés et réfléchis.

Benchmark de Quantification Qwen 3.6 27B : Q4_K_M Surpasse Q8_0 en Compromis Pratiques
Évalué Qwen 3.6 27B en BF16, Q4_K_M et Q8_0 quantifications GGUF sur HumanEval, HellaSwag et BFCL. Q4_K_M offre des scores proches de BF16 avec 48% de RAM en moins, 1,45x de vitesse et une taille de fichier réduite de 68,8%.

Dual DGX Sparks contre Mac Studio M3 Ultra : Comparaison pratique pour exécuter Qwen3.5 397B en local
Un développeur a comparé l'exécution locale de Qwen3.5 397B sur un Mac Studio M3 Ultra 512GB à 10 000 $ et une configuration dual DGX Spark à 10 000 $. Le Mac Studio a atteint 30-40 tok/s avec une bande passante de 800 Go/s mais un préremplissage lent, tandis que les Sparks ont fourni 27-28 tok/s avec un calcul plus rapide mais une configuration complexe.