DoomVLM : Outil Open Source pour Tester les Modèles de Vision et Langage dans les Matchs à Mort de Doom

✍️ OpenClawRadar📅 Publié: March 14, 2026🔗 Source
DoomVLM : Outil Open Source pour Tester les Modèles de Vision et Langage dans les Matchs à Mort de Doom
Ad

Ce que fait DoomVLM

DoomVLM est un notebook Jupyter qui teste des modèles de langage visuel (VLM) en les faisant jouer à Doom. Il capture des captures d'écran depuis ViZDoom, dessine une grille de colonnes numérotées par-dessus, et envoie l'image à n'importe quel VLM via une API compatible OpenAI. Le modèle dispose de deux outils : shoot(column) et move(direction), avec tool_choice: "required". Il s'agit d'une inférence purement visuelle — pas d'apprentissage par renforcement ni de fine-tuning.

Fonctionnalités clés et mises à jour

  • Modes Deathmatch : Deux modes ajoutés. Benchmark — les modèles jouent à tour de rôle contre des bots dans des conditions identiques pour une comparaison équitable. Arena — tout le monde joue simultanément via du multiprocessing ; celui qui infère plus vite obtient plus de tours.
  • Support multi-agents : Jusqu'à 4 agents, chacun entièrement configurable dans l'interface : prompt système, descriptions d'outils, paramètres d'échantillonnage, longueur de l'historique des messages, colonnes de la grille, etc. Vous pouvez opposer différentes tailles de modèles (0,8B contre 4B contre 9B) ou différents modèles (Qwen contre GPT-4o).
  • Compatibilité API : Fonctionne avec n'importe quelle API compatible OpenAI — LM Studio, Ollama, vLLM, OpenRouter, OpenAI, Claude. Il suffit de changer l'URL et le modèle dans les paramètres.
  • Enregistrement et journalisation : Enregistrement des épisodes en GIF/MP4 avec des superpositions affichant les PV, les munitions, les décisions du modèle et la latence. Tableau des scores en direct dans Jupyter. Tous les résultats sont sauvegardés dans le dossier workspace/ (journaux, vidéos, captures d'écran). Possibilité de tout télécharger en un seul ZIP.
Ad

Performance et configuration

Performance : Sur un MacBook M1 Pro 16 Go, le modèle 0,8B prend ~10 secondes par étape. Sur un RunPod L40S, il prend 0,5 seconde. Vous avez besoin d'un GPU pour un gameplay arena correct.

Démarrage rapide :

LM Studio → lms get qwen-3.5-0.8b → lms server start → pip install -r requirements.txt → jupyter lab doom_vlm.ipynb → Run All

L'ensemble du projet est un unique notebook Jupyter sous licence MIT.

État actuel et observations

Le développeur n'a pas trouvé de prompts universels permettant à Qwen 3.5 de battre systématiquement chaque scénario. Observation générale : des prompts plus simples et plus courts donnent de meilleurs résultats ; les modèles s'étouffent avec des instructions trop détaillées.

Les modèles phares comme GPT-4o ou Claude n'ont pas encore été testés, bien que l'interface les prenne en charge — vous pouvez les exécuter depuis votre machine locale sans GPU, il suffit d'insérer la clé API.

L'outil est désormais abouti, et l'exploration des combinaisons modèle/prompt/paramètre qui fonctionnent le mieux ne fait que commencer. Le développeur encourage le partage des découvertes : prompts intéressants, résultats surprenants avec différents modèles, paramètres qui ont aidé. Publiez des vidéos de gameplay depuis le dossier workspace/.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Graft : les hooks de Claude Code réduisent les jetons grep de 42 %
Tools

Graft : les hooks de Claude Code réduisent les jetons grep de 42 %

Graft construit un graphe de connaissances persistant pour les agents de codage, réduisant les appels d'outils de 46 %, les tokens de 42 %, et augmentant l'exactitude SWE-bench de 54 % à 66 %.

OpenClawRadar
7 commandes slash, 0,45 $/article : Ce pipeline Claude Code exécute une opération complète de contenu SEO
Tools

7 commandes slash, 0,45 $/article : Ce pipeline Claude Code exécute une opération complète de contenu SEO

Un développeur a open-sourcé un pipeline Claude Code en 7 commandes qui gère la recherche SEO, la rédaction, l'optimisation et la publication. Coût : 0,45 $/article (API Perplexity), exécution en 15 min/jour. Résultats : 18× d'impressions mensuelles en 12 mois.

OpenClawRadar
Hippo v0.21.0 : Mémoire bio-inspirée pour agents IA avec support multi-outils
Tools

Hippo v0.21.0 : Mémoire bio-inspirée pour agents IA avec support multi-outils

Hippo v0.21.0 introduit une configuration en une seule commande pour plusieurs outils de codage IA, dont Claude Code, OpenCode, OpenClaw, Codex, Cursor et Pi. Le système de mémoire intègre la dégradation, le renforcement de la récupération et la consolidation, sans dépendances d'exécution.

OpenClawRadar
Hubcap Bridge : Messagerie Bidirectionnelle Persistante entre CLI et JavaScript Navigateur via CDP
Tools

Hubcap Bridge : Messagerie Bidirectionnelle Persistante entre CLI et JavaScript Navigateur via CDP

Hubcap Bridge est une nouvelle fonctionnalité de l'outil CLI Hubcap qui crée un canal de communication bidirectionnel persistant entre les processus locaux et le JavaScript exécuté dans les pages du navigateur via le Chrome DevTools Protocol. Il permet aux compétences Claude Code d'interagir avec les applications web via leurs API JavaScript internes sans nécessiter d'accès à une API publique.

OpenClawRadar