DoomVLM: 둠 데스매치에서 비전 언어 모델 테스트를 위한 오픈 소스 도구

✍️ OpenClawRadar📅 게시일: March 14, 2026🔗 Source
DoomVLM: 둠 데스매치에서 비전 언어 모델 테스트를 위한 오픈 소스 도구
Ad

DoomVLM의 기능

DoomVLM은 비전 언어 모델(VLM)이 Doom을 플레이하도록 하여 테스트하는 Jupyter 노트북입니다. ViZDoom에서 스크린샷을 캡처하고, 위에 번호가 매겨진 열 그리드를 그린 다음, OpenAI 호환 API를 통해 모든 VLM에 이미지를 전송합니다. 모델에는 shoot(column)과 move(direction) 두 가지 도구가 있으며, tool_choice: "required"로 설정되어 있습니다. 이는 순수한 비전 추론으로, 강화 학습이나 미세 조정이 필요하지 않습니다.

주요 기능 및 업데이트

  • 데스매치 모드: 두 가지 모드가 추가되었습니다. 벤치마크—모델이 동일한 조건에서 봇과 교대로 플레이하여 공정한 비교가 가능합니다. 아레나—멀티프로세싱을 통해 모든 모델이 동시에 플레이하며, 추론 속도가 빠른 모델이 더 많은 턴을 얻습니다.
  • 다중 에이전트 지원: 최대 4개의 에이전트를 지원하며, 각각 UI에서 완전히 구성 가능합니다: 시스템 프롬프트, 도구 설명, 샘플링 매개변수, 메시지 기록 길이, 그리드 열 등. 서로 다른 모델 크기(0.8B vs 4B vs 9B)나 다른 모델(Qwen vs GPT-4o)을 대결시킬 수 있습니다.
  • API 호환성: 모든 OpenAI 호환 API와 작동합니다—LM Studio, Ollama, vLLM, OpenRouter, OpenAI, Claude. 설정에서 URL과 모델만 변경하면 됩니다.
  • 녹화 및 로깅: HP, 탄약, 모델 결정 및 지연 시간을 보여주는 오버레이와 함께 GIF/MP4 형식으로 에피소드를 녹화합니다. Jupyter에서 실시간 스코어보드를 제공합니다. 모든 결과는 workspace/ 폴더에 저장됩니다(로그, 비디오, 스크린샷). 모든 것을 단일 ZIP 파일로 다운로드할 수 있습니다.
Ad

성능 및 설정

성능: MacBook M1 Pro 16GB에서는 0.8B 모델이 단계당 약 10초가 소요됩니다. RunPod L40S에서는 0.5초가 소요됩니다. 적절한 아레나 게임플레이를 위해서는 GPU가 필요합니다.

빠른 시작:

LM Studio → lms get qwen-3.5-0.8b → lms server start → pip install -r requirements.txt → jupyter lab doom_vlm.ipynb → Run All

전체 프로젝트는 MIT 라이선스 하에 단일 Jupyter 노트북입니다.

현재 상태 및 관찰 결과

개발자는 Qwen 3.5가 모든 시나리오를 일관되게 이길 수 있는 보편적인 프롬프트를 아직 찾지 못했습니다. 일반적인 관찰 결과: 더 간단하고 짧은 프롬프트가 더 나은 결과를 제공하며, 모델은 지나치게 상세한 지시 사항에 혼란스러워합니다.

GPT-4o나 Claude와 같은 플래그십 모델은 아직 테스트되지 않았지만, 인터페이스는 이를 지원합니다—GPU 없이 로컬 머신에서 실행할 수 있으며, API 키만 연결하면 됩니다.

이 도구는 이제 완성되었으며, 어떤 모델/프롬프트/설정 조합이 가장 효과적인지에 대한 탐구는 이제 막 시작되었습니다. 개발자는 흥미로운 프롬프트, 다른 모델로 얻은 놀라운 결과, 도움이 된 설정 등 발견한 내용을 공유할 것을 권장합니다. workspace/ 폴더에서 게임플레이 비디오를 게시하세요.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

토큰 낭비 없이 클로드 채팅 간 맥락 유지하는 2-프롬프트 시스템
Tools

토큰 낭비 없이 클로드 채팅 간 맥락 유지하는 2-프롬프트 시스템

한 개발자가 전체 클로드 대화를 구조화된 컨텍스트 블록으로 압축하고 새 채팅에 로드하여 결정, 작업 및 다음 단계를 보존하는 두 개의 프롬프트를 공유합니다.

OpenClawRadar
조라: 기본 거부 보안과 로컬 메모리를 갖춘 오프라인 우선 AI 에이전트
Tools

조라: 기본 거부 보안과 로컬 메모리를 갖춘 오프라인 우선 AI 에이전트

Zora는 기본적으로 Ollama를 통해 완전히 오프라인으로 실행되며, 제로 접근 권한으로 시작하고 세션 간 지속적인 메모리를 유지하는 AI 에이전트입니다. 다른 에이전트에서 나타난 보안 및 비용 문제를 해결합니다.

OpenClawRadar
Cloudflare의 vinext: Vite 위에 AI로 구축된 Next.js 호환 프레임워크
Tools

Cloudflare의 vinext: Vite 위에 AI로 구축된 Next.js 호환 프레임워크

Cloudflare 엔지니어들이 AI를 활용해 일주일 만에 Vite 기반으로 Next.js API 표면을 재구축하여 vinext를 만들었습니다. 이는 4배 더 빠르게 빌드하고 57% 더 작은 번들을 생성하는 드롭인 대체제입니다. 단일 명령어로 Cloudflare Workers에 배포됩니다.

OpenClawRadar
Claude Code 동적 워크플로우: 병렬 서브에이전트 및 울트라코드 모드
Tools

Claude Code 동적 워크플로우: 병렬 서브에이전트 및 울트라코드 모드

Claude Code는 코드베이스 전반의 버그 사냥, 대규모 마이그레이션, 다각도 검증 같은 복잡한 작업을 위해 수십에서 수백 개의 병렬 하위 에이전트를 조율하는 동적 워크플로를 도입했습니다. UltraCode 모드는 어려운 문제에 자동으로 워크플로를 트리거합니다.

OpenClawRadar