DoomVLM: Ferramenta de Código Aberto para Testar Modelos de Linguagem Visual em Partidas de Morte do Doom

O que o DoomVLM faz
O DoomVLM é um notebook Jupyter que testa modelos de linguagem visual (VLMs) fazendo-os jogar Doom. Ele tira capturas de tela do ViZDoom, desenha uma grade de colunas numeradas por cima e envia a imagem para qualquer VLM via uma API compatível com OpenAI. O modelo tem duas ferramentas: shoot(column) e move(direction), com tool_choice: "required". Isso é pura inferência visual—sem aprendizado por reforço ou ajuste fino.
Recursos e Atualizações Principais
- Modos Deathmatch: Dois modos adicionados. Benchmark—os modelos jogam alternadamente contra bots sob condições idênticas para comparação justa. Arena—todos jogam simultaneamente via multiprocessamento; quem fizer inferência mais rápido ganha mais turnos.
- Suporte Multiagente: Até 4 agentes, cada um totalmente configurável na interface: prompt do sistema, descrições de ferramentas, parâmetros de amostragem, tamanho do histórico de mensagens, colunas da grade, etc. Você pode colocar diferentes tamanhos de modelo uns contra os outros (0.8B vs 4B vs 9B) ou diferentes modelos (Qwen vs GPT-4o).
- Compatibilidade com API: Funciona com qualquer API compatível com OpenAI—LM Studio, Ollama, vLLM, OpenRouter, OpenAI, Claude. Basta trocar a URL e o modelo nas configurações.
- Gravação e Registro: Gravação de episódios em GIF/MP4 com sobreposições mostrando HP, munição, decisões do modelo e latência. Placar ao vivo no Jupyter. Todos os resultados salvos na pasta
workspace/(logs, vídeos, capturas de tela). Pode baixar tudo como um único ZIP.
Desempenho e Configuração
Desempenho: Em um MacBook M1 Pro 16GB, o modelo 0.8B leva ~10 segundos por passo. Em um RunPod L40S, leva 0,5 segundos. Você precisa de uma GPU para jogabilidade adequada na arena.
Início rápido:
LM Studio → lms get qwen-3.5-0.8b → lms server start → pip install -r requirements.txt → jupyter lab doom_vlm.ipynb → Executar Tudo
Todo o projeto é um único notebook Jupyter sob licença MIT.
Estado Atual e Observações
O desenvolvedor não encontrou prompts universais que permitam ao Qwen 3.5 vencer consistentemente todos os cenários. Observação geral: prompts mais simples e curtos produzem melhores resultados; os modelos travam com instruções excessivamente detalhadas.
Modelos principais como GPT-4o ou Claude ainda não foram testados, embora a interface os suporte—você pode executá-los da sua máquina local sem GPU, basta inserir a chave da API.
A ferramenta agora está polida, e a exploração de quais combinações de modelo/prompt/configuração funcionam melhor está apenas começando. O desenvolvedor incentiva o compartilhamento de descobertas: prompts interessantes, resultados surpreendentes com diferentes modelos, configurações que ajudaram. Poste vídeos de jogabilidade da pasta workspace/.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Executando o Claude Code Offline em um M3 Pro com Qwen3.6: 4 Correções Que Fizeram Funcionar
Quatro correções de variáveis de ambiente fazem o Claude Code funcionar totalmente offline em um M3 Pro com Qwen3.6 (MoE, ~3B ativos), completando um ciclo de incidente de SRE desde a investigação até o PR sem que nenhum dado saia da máquina.

Claude-IDE-Bridge Agora Funciona em Servidores Remotos para Desenvolvimento Assistido por IA
A ferramenta Claude-IDE-Bridge agora conecta a IA Claude a ambientes de desenvolvimento remotos em VPS ou máquinas na nuvem, permitindo acesso a diagnósticos em tempo real, arquivos abertos e falhas de testes de qualquer dispositivo.

Resultados de Benchmark: Claude Agent Swarm com Sistema de Memória Apresenta Economia de 30-43% em Custos de Tokens
Um desenvolvedor testou um enxame de 6 agentes Claude em uma tarefa de programação de 40 pontos com e sem um sistema de memória personalizado chamado Stompy. Os resultados mostram que o Sonnet 4.6 com memória obteve pontuação perfeita a US$ 3,98 contra US$ 7,04 sem memória, enquanto o Haiku 4.5 falhou completamente sem memória, mas marcou 39/40 com ela.

Octopoda MCP Server Adiciona Memória Persistente, Detecção de Loops e Trilhas de Auditoria ao Claude Code
Um desenvolvedor criou o Octopoda, um servidor MCP que se integra ao Claude Code para fornecer memória persistente, detecção de loops, trilhas de auditoria e espaços de conhecimento compartilhados para agentes de IA. O sistema utiliza PostgreSQL com pgvector para busca semântica, FastAPI e um painel React.